基本信息

来源摘要/节选

公开展示已截断至最多 800 个字符;请访问原始来源查看完整上下文。

引言:Token 还是不够用? 作为一名重度依赖 Claude和 Gemini辅助编程的开发者,我经常遇到一个尴尬的场景: 我想让 AI 重构一个模块,但这个模块依赖错综复杂。当我试图把整个 monorepo 的相关文件丢进对话框时,Token 瞬间爆炸,或者因为上下文过长(Lost in the Middle),模型开始胡言乱语。 传统的 RAG(检索增强生成)通过切片(Chunking)解决了容量问题,但破坏了代码的 整体结构感 。 直到最近,我读到了 DeepSeek 团队的论文 DeepSeek-OCR 和另一篇 Text or Pixels? ,它们提出了一个反直觉的观点: 对于结构化数据(如代码、表格),视觉编码(Vision Encoder)比文本编码(Text Tokenizer)效率更高。 于是我造了个轮子 —— Pixrep 。 什么是 Pixrep? 简单来说,它是一个 Python CLI 工具,能把你的整个代码仓库“拍”成一组结构化的、带语法高亮和语义分析的 PDF。 GitHub: github.com/TingjiaInFu… 核心原理:为什么“看图”比“读字”更省 Token? 我们在写代码时,为了可读性会使用大量的缩进、换行和空格。在 Text Tokenizer 眼里,这些都是昂贵的 Token。 而在 Vision Model 眼里,代码的缩进、层级关系就是一张图上的几何结构。现代多模态模型的 Vision Encoder(如 ViT)通过 Patch 处理图像,对于稀疏的文本结构,压缩率极高。…

来源说明

当前只保存了公开页面节选,不代表原文全文。请以原始来源为准。

本页只呈现已做哈希绑定的来源证据,不包含基于旧正文或缺失原文的扩展推断。