2026年5月至8月,GitHub上涌现了大量以"省Token"为核心卖点的开源项目,形成了本轮技术浪潮的最高峰。
与此前学术研究和CaaS服务的本质区别在于:这些项目不再只是提供算法实现,而是围绕AI Agent的实际工作流进行了深度产品化设计------它们提供了代理模式、钩子注入、知识图谱等工程能力,让压缩技术能够以近乎零成本的方式融入现有开发流程。
这些项目的技术路线并非凭空产生,而是对前述历史方法的继承、组合与工程化突破。根据技术思路的不同,可归纳为六个流派逐一阐述。
流派一:智能中间件压缩 ------ Headroom
仓库:headroom-ai/headroom | Star:> 50k(截至2026年6月) | 发布时间:2026年5月
核心定位:在 AI Agent 和 LLM 之间插入一个透明的"无损压缩层"。Headroom 是这波浪潮中 Star 数最高、影响力最大的项目,截至 2026 年 6 月已获 50,000+ Star。它的核心思想很简单:不动语义,只压缩表示层。模型拿到的信息是等价的,只是用更少的 Token 表达了同样的含义。
技术架构:Headroom 内部是一个六层处理管道,其中最核心的是四台专用压缩引擎:实测数据显示,一个 SRE 调试场景从 65,694 Token 压缩到 5,118,省了 92%。
关键设计:CCR 可逆压缩。Headroom 不是简单地丢弃信息。它采用 CCR(Context Compression with Retrieval)机制:压缩后的内容发给 LLM,原始内容缓存在本地。如果模型发现信息不足,可以通过检索工具 headroom_retrieve 取回原文。这意味着压缩是可逆的------信息"无损失"。
接入方式:支持三种模式:
Library 模式:在 Python/TypeScript 代码中直接调用 compress()
Proxy 模式:启动本地代理,修改 BASE_URL 即可接入
Wrap 模式:一行命令包装 claude、cursor 等 CLI 工具
与历史方法的关系:继承了LLMLingua的"内容筛选"思想,但用类型感知引擎替代单一小模型,精准度更高
借鉴了KV Cache优化中的"对齐"思想(CacheAligner),但实现在模型外部,无需修改模型
首次将"可逆"概念工程化,解决了有损压缩的核心痛点

Ponytail:顾问,让Agent少做无用功
Ponytail不直接处理数据,而是通过改变Agent的行为模式来间接省Token。它是一个Agent插件或技能,其核心是YAGNI原则(You Aren't Gonna Need It)。
它通过一个"决策梯"强制Agent在动手前思考:这真的有必要做吗?能不能用更简单的方式实现?从而在源头上减少Agent生成不必要的代码和决策,最终达到减少Token消耗的目的。
RTK (Rust Token Killer):过滤器,净化命令行输出
RTK专注于解决一个具体痛点:AI编程工具执行命令时,返回的冗长输出(如git diff)会消耗大量Token。
它是一个命令行代理(CLI Proxy),位于Shell和Agent之间。它会拦截命令执行结果,针对不同命令(如git status, pytest)采用不同的压缩策略。例如,它可能会精简git diff的输出,只保留变更信息。
简单、专注、高效:RTK只做一件事,但做得很好。
context-guru:核心库,提供灵活的可逆压缩
context-guru是一个用Go编写的核心库或代理。它更像一个工具箱,提供高度灵活的压缩能力。
它的核心特点是"无损或可逆压缩"。与Headroom类似,它也支持在压缩时留下标记以便恢复。但它更强调作为可嵌入的组件,其核心可以作为一个HTTP代理运行,也可以作为插件集成到其他系统中。
在基准测试中,它在SWE-bench上实现了13.2%的总账单成本降低,并且解决了最多的任务(88%)。
流派二:输出风格精简 ------ caveman
仓库:caveman-ai/caveman | Star:~87k(截至2026年7月) | 发布时间:2026年5月
- 核心定位:改变 AI 的"说话方式",让回复极度简洁。
如果说 Headroom 压缩的是"输入",那 caveman 压缩的就是"输出"。它是一个 Claude Code 的 Skill/插件,强制 AI Agent 像"穴居人"(caveman)一样说话。- 实现方式:通过一个 Skill 文件或插件,砍掉所有礼貌用语、填充词和不必要的解释,只保留最核心的技术信息。对比一下:
正常 Claude(69 tokens) :"The reason your React component is re-rendering is likely because you're creating a new object reference on each render cycle..."
Caveman Claude(19 tokens) :"New object ref each render. Inline object prop = new ref = re-render. Wrap in useMemo."
同样是 69 Tokens 的回复被压缩到了 19 Tokens,省了约 75% 。- 多档位控制:caveman 提供了 Lite、Full、Ultra 等多个压缩级别,甚至还有好玩的文言文模式。此外,它还能压缩常驻上下文的记忆文件,平均省 46% 的输入 Token。
- 争议与局限:不过,caveman 的效果存在争议。JetBrains 使用开源评估框架测试后发现,其实际输出 Token 减少量约为 8.5%,远低于宣称的 65%。此外,它只节省输出 Token,不影响思考/推理 Token。
- 与历史方法的关系:属于规则控制的"硬提示"压缩,无学术论文支撑,但创意新颖、实现简单

superpowers:优化Agent的"技能包"
superpowers是一个Agent技能框架,它通过优化技能本身的描述来省Token。
- 工作机制:该框架包含了上百个由社区打磨的Agent技能。这些技能描述被特意写成极度精炼的Markdown格式,去除了所有冗余说明,只保留最核心的指令和参数。
- 效果:当Agent调用这些精炼的技能时,每次调用所消耗的提示词Token会平均减少约40%。
- 对比caveman:caveman是事后压缩AI的回复,而superpowers是在事前优化你让AI做事的"指令"本身。
📚 everything-claude:汇集人类的"优化智慧"
everything-claude严格来说,不是一个自动化工具,而是一个知识库(Knowledge Base)。
工作机制:它是一个由社区共同维护的、庞大的、结构化的知识集合,里面汇集了无数让Claude"少说废话"、高效工作的技巧、提示词(Prompts)和工作流。
效果:它的"间接节省"体现在,你需要主动去学习这些技巧,然后将其应用到自己的工作流程中,从而实现省Token的目的。它不提供一键式解决方案,而是提供知识。
💎 总结caveman:是强制执行者。它不讲道理,直接在你和AI之间插一脚,强制AI换个"短平快"的风格说话,简单粗暴。
superpowers:是流程优化者。它从源头入手,把你给AI的"工作手册"(技能描述)改得更加精炼,让AI用更少的Token读明白指令。
everything-claude:是智慧搬运工。它把你带到一座"宝藏山"前,里面都是别人挖到的省Token技巧,能挖到多少、怎么用,完全看你自己的行动力。
流派三:视觉通道"偷渡"------ pxpipe
仓库:pxpipe/pxpipe | Star:~6.7k(截至2026年7月) | 发布时间:2026年6月
- 核心定位:把文字"画"进图片,利用多模态模型的计费漏洞。
pxpipe 的思路堪称"反常识":不删减内容,而是把大量文本先渲染成 PNG 图片,再交给具备视觉读取能力的多模态模型。- 核心原理:主流多模态模型(如 Claude)对图像 Token 的计费,取决于图片的像素尺寸,而非其中包含的信息量。一张清晰的 1080p 图片,无论上面写满代码还是只画了一只猫,在模型眼中都只值几千个图像 Token。
- 实测效果:一个约 25,000 个文本 Token 的典型上下文,经 pxpipe 渲染后仅消耗约 2,700 个图像 Token,端到端成本下降 59%-70%。在 SWE-bench Lite 测试中,平均单次请求成本从 5.4 美元压至 2.7 美元。
- 诚实面对的局限:项目文档坦率承认------这是有损压缩。精确的 ID、哈希值、密钥等字节级精确的信息必须保持为文本。在 Fable 5 模型上,密集图片中精确 12 字符十六进制字符串的识别率仅 13/15。因此,它最适合那些"容错率高"的场景------理解代码结构和逻辑,而非逐字抄写。
- 与历史方法的关系:与学术方法无关,属于计费策略层面的"漏洞利用",但创意独特。
流派四:上游预处理与智能路由 ------ OmniRoute & 9Router
核心定位:在请求到达模型之前,通过预处理和智能路由来省钱。
OmniRoute(omniroute/omniroute,Star ~15k):聚合了290+家AI供应商、500+种模型,在请求发出前运行一个模块化的提示词压缩管道,集成了RTK(47个过滤器)、Caveman、LLMLingua-2等10种压缩引擎,对符合条件的上下文可节省15%-95%的Token。更值得注意的是它的Combo路由系统------一条预配置的模型链(如Claude → GPT-4o → Gemini → DeepSeek),当某个模型配额用尽或服务宕机时自动切换,应用层完全无感知。
9Router(9router/9router):更聚焦于AI编程工具场景,自带RTK Token节省器,自动压缩终端输出、代码差异等冗余内容,每次请求节省20%-40%的Token。配合三级降级机制(订阅层→低价层→免费层),确保开发流程永不中断。
与历史方法的关系:两者都是"工程集成"的集大成者------将LLMLingua等学术算法打包为易用的路由服务,并叠加了供应商调度能力,形成了"省钱全家桶"。

流派五:源头减负 ------ CodeGraph
仓库:codegraph/codegraph | 发布时间:2026年5月
- 核心定位:与其压缩 AI 的输出,不如减少 AI 的无效输入。
- CodeGraph 的思路是:提前给 AI 画好一张代码地图,让它不用自己在文件海里慢慢爬。
- 问题场景:AI 编程 Agent 理解代码库的典型方式是:grep 找关键词 → 发现候选文件 → 逐个 Read → 再 grep → 再 Read......这个过程消耗大量 Token 在"发现结构"上。
- 解决方案:CodeGraph 提前把代码库解析成知识图谱,包含每个符号、调用边、依赖关系。Agent 直接查询这张图,一次返回相关源码和调用链。解析引擎用 Rust 编写,支持 20+ 种编程语言。
- 实测数据:在 7 个真实开源仓库上的测试中,有 CodeGraph 比没有时:工具调用少 89% ,Token 消耗少 69% ,成本低 60% 。在 VS Code 仓库(~10k 文件)上,有图时 41 秒 / 2 次调用 / 265k Token,无图时 3 分 24 秒 / 40 次调用 / 1.5M Token。
- 与历史方法的关系:本质上是"RAG"思想在代码场景的深度优化,但对程序分析(AST)的结合超越了传统RAG,实现了结构化的精准查询。
流派六:综合优化工具包 ------ squeez & tok
核心定位:提供可集成的 Token 优化能力。
- squeez 是一个端到端的 Token 优化工具,专为 AI CLI 界面设计。它通过 PreToolUse 钩子拦截每条命令,应用智能过滤、去重、分组和截断,最高可将 Bash 输出压缩 95%。当同一个文件在一次会话中被读取 5 次时,后续每次读取仅消耗 13 个 Token。它同样支持可逆压缩------原始内容存储在内容寻址的 blob 中。
- tok 则是一个 Go 语言库,提供了提示词压缩、输出过滤、Token 估算、密钥扫描等全套能力。它的输出过滤管道有 31 层(熵剪枝、困惑度过滤、AST 感知压缩等),提示词压缩可削减 20%-70%。整体可降低 LLM Token 成本 60%-90%。
- 与历史方法的关系:综合了摘要、截断、LLMLingua等公开方法,属于"底层工具箱"式集成,适合开发者嵌入自己的Agent框架。

总结

1. 工作流环节(Where)
在AI Agent的完整请求链路中插在哪一环节:

2. 技术核心(How)
我区分了不同项目的底层技术手段:
- 智能中间件:透明代理,拦截请求,内容感知压缩,强调"无损/可逆"。
- 输出风格精简:通过提示词工程或规则约束AI的表达方式。
- 知识图谱:用结构化查询替代文本搜索,从源头减少Token。
- 路由+预处理:整合多个压缩引擎,叠加供应商调度,形成"省钱全家桶"。
- 综合工具包:提供可编程的、多场景覆盖的压缩能力。
- 视觉通道偷渡:利用多模态模型对图像Token的计费规则差异。
- 可视化监控:不做压缩,而是让Token消耗"可见"。
3. 目标对象(What)
我区分了它们主要压缩的是哪种Token:

