CodeGraph 到底能省多少 Token?官方数据很漂亮,但独立公开实测没有得出同样结果
CodeGraph 是一个面向 Claude Code、Codex、Cursor 等编程智能体的本地代码知识图谱工具。它会提前解析代码中的符号、调用关系、依赖和文件结构,再通过 MCP 提供给智能体。
它要解决的问题很直接:Coding Agent 为了理解代码,经常反复执行 Grep、Read、Glob 等探索操作。CodeGraph 希望把这些重复搜索替换成结构化的图查询。
项目目前公开宣传的核心数字包括:工具调用减少 88%、耗时减少 53%、处理 Token 减少 62%、成本降低 44%。
不过,这些数字来自 CodeGraph 自己设计和执行的官方 Benchmark。
这篇文章会保留官方测试作为背景,但后面的效果判断不采用官方数据,只看第三方公开实测。
官方测试:从“成本基本持平”到“成本降低 44%”
测试来源:CodeGraph 官方 Benchmark
网页地址:CodeGraph GitHub
CodeGraph 官方先后公开过多轮 A/B 测试,结果变化比较明显。
| 时间 | 官方公开结果 |
|---|---|
| 2026 年 5 月 | 文件读取减少 76%,37 组任务总成本约 15.4 美元 vs 13.8 美元,官方描述为“成本基本持平” |
| 2026 年 7 月 | 工具调用减少 89%,处理 Token 减少 69%,成本降低 60% |
| 2026 年 8 月 | 工具调用减少 88%,耗时减少 53%,处理 Token 减少 62%,成本降低 44% |
2026 年 8 月的最新官方测试使用 Claude Opus 4.8,在 VS Code、Excalidraw、Django、Tokio、OkHttp、Gin、Alamofire 七个开源项目上测试,每个条件运行 4 次并取中位数。
官方还修复了旧测试中对照组可能通过 Bash 意外调用 CodeGraph CLI 的污染问题。
因此,当前 README 使用的是 Token 减少 62%、成本降低 44% 这组数字,而不是此前的 69% 和 60%。
但由于这些测试由项目方自己设计、运行和发布,下面不使用这些数字判断 CodeGraph 的真实效果,只作为官方宣传口径的背景说明。
第三方独立公开实测
HarrisonSec 40 次 A/B 测试:Token 少 22.6%,速度快 20.3%,费用反而增加 6.8%
测试来源:Harrison Guo / HarrisonSec
网页地址:I Tested CodeGraph on Hono
这是目前公开资料中比较完整的一组独立 A/B 测试。
测试对象是 Hono,约 280 个 TypeScript 源文件。测试使用 Claude Opus 4.8,设计 5 类代码理解任务,每个任务分别进行 4 次原生工具测试和 4 次 CodeGraph 测试,总计 40 次运行。
作者还公开了原始 CSV,并验证每一次 CodeGraph 测试确实连接并调用了 MCP 工具。
汇总结果:
| 指标 | 不使用 CodeGraph | 使用 CodeGraph | 变化 |
|---|---|---|---|
| 平均工具调用 | 14.0 次 | 6.3 次 | 减少 55.0% |
| 平均耗时 | 70.8 秒 | 56.4 秒 | 减少 20.3% |
| 平均 Token | 9,385 | 7,261 | 减少 22.6% |
| 平均费用 | 0.338 美元 | 0.361 美元 | 增加 6.8% |
这组测试里,CodeGraph 确实减少了工具调用、Token 和平均耗时,但没有降低总费用。
而且不同任务之间差异很大。
| 任务 | Token 变化 | 耗时变化 | 费用变化 |
|---|---|---|---|
| 路由查找 | -40.2% | +2.8% | +22.5% |
| 中间件调用链 | -21.9% | +4.5% | +43.4% |
| 跨运行时架构分析 | -39.1% | -52.8% | -28.9% |
| 重构定位 | -6.1% | -2.2% | +26.5% |
| 文本对照任务 | +1.4% | -15.0% | -5.3% |
最明显的收益出现在跨多个文件和目录的架构分析任务中:工具调用减少 80.1%,耗时减少 52.8%,费用降低 28.9%。
但简单路由查找和中间件追踪虽然 Token 更少,费用反而分别增加 22.5% 和 43.4%。
这份测试能支持的结论是:CodeGraph 在 Hono 上明显减少了探索步骤和 Token,平均速度也更快;但不能证明它一定省钱。
OpenCodeReview 约 200 个真实 PR:工具调用和耗时略降,但 Token 增加约 13%
测试来源:OpenCodeReview 作者公开 A/B 测试
网页地址:GitHub Issue #1056
2026 年 6 月 29 日,OpenCodeReview 作者公开了将 CodeGraph 接入 AI 代码审查流程后的测试。
测试使用 Claude Opus 4.6,对同一批 200 个真实生产仓库 PR 分别开启和关闭 CodeGraph,其中 6 个只有测试代码变化的 PR 被自动跳过。
与 HarrisonSec 的代码理解测试不同,这组测试直接观察实际代码审查结果。
工具调用与耗时
| 指标 | 不使用 CodeGraph | 使用 CodeGraph | 变化 |
|---|---|---|---|
| 总工具调用 | 7,363 | 7,107 | -3.5% |
| 文件读取 | 3,101 | 2,779 | -10.4% |
| 代码搜索 | 2,253 | 1,973 | -12.4% |
| 总耗时 | 4 小时 46 分 21 秒 | 4 小时 41 分 32 秒 | -1.7% |
在这组更接近真实开发工作流的测试中,CodeGraph 仍然减少了文件读取和代码搜索,但幅度远小于官方 Benchmark,也小于 HarrisonSec 的测试。
Token
| 指标 | 不使用 CodeGraph | 使用 CodeGraph |
|---|---|---|
| 总 Token | 7,950 万 | 8,960 万 |
| 输出 Token | 约 200 万 | 约 200 万 |
| 平均每个 PR | 41 万 | 46.2 万 |
测试作者明确指出,输入 Token 增加约 13%,输出 Token 基本不变。
也就是说,在真实 PR 代码审查任务中,CodeGraph 并没有减少整体 Token,反而因为增加了结构化上下文而消耗更多输入 Token。
审查质量
| 指标 | 不使用 CodeGraph | 使用 CodeGraph | 变化 |
|---|---|---|---|
| 精确率 | 30.6% | 31.9% | +1.3 个百分点 |
| 召回率 | 18.9% | 20.4% | +1.5 个百分点 |
| 找到的真实问题 | 285 | 307 | +7.7% |
这意味着增加的 Token 并非完全没有收益:CodeGraph 组多发现了 22 个真实问题。
因此,这组测试更准确的描述不是“CodeGraph 更省 Token”,而是:
它用更多输入上下文换来了略少的搜索操作、略快的总耗时,以及更高的代码审查问题检出数量。
需要说明的是,OpenCodeReview 作者已经集成 CodeGraph,并在 Issue 中提出进一步合作,因此这虽然属于非 CodeGraph 官方测试,但测试方并非完全没有产品合作利益。数据可以参考,但应保留这一背景。
Qiita 真实项目测试:4 个相关位置只找到 2 个
测试来源:Qiita 开发者 TheGateBreaker
网页地址:Qiita 测试原文
2026 年 7 月 30 日,一名开发者把 CodeGraph 接入自己公司的真实 Python 项目。
项目包含 400 多个 Python 文件,建立索引约耗时 3 秒。
测试选择的不是人为设计的问题,而是过去真实发生过、曾导致代码审查往返 9 轮的历史问题。
实际存在 4 个相关业务判断位置。
CodeGraph 最终找到:
| 项目 | 数量 |
|---|---|
| 实际相关位置 | 4 |
| CodeGraph 找到 | 2 |
| 未找到 | 2 |
找到的两个位置都直接调用了目标函数。
另外两个位置虽然实现了同样的业务判断,但属于独立重复实现,并没有调用目标函数,因此调用图中不存在连接关系。
作者又尝试自然语言探索,仍然没有找到剩余两个位置。
这组测试没有统计 Token、费用和整体耗时,因此不能用它判断 CodeGraph 是否更省资源。
它能说明的是 CodeGraph 的能力边界:
对于存在明确符号关系、调用关系的代码,图查询有优势;如果问题来自“没有调用关系的重复实现”,调用图本身并不能保证发现它。
哪些公开数据没有用于最终结论
为了避免把不同可信度的数据混在一起,下面几类公开数据不用于文章最后的效果判断:
- CodeGraph 官方 Benchmark:保留作宣传口径背景,但不作为独立证据。
- LemonCrow、Repowise 等直接竞品 Benchmark:虽然有公开数据,但测试方存在直接竞争关系,不作为中立独立测试。
- Reddit 个人反馈:部分用户声称节省 20%~30% Token,但没有公开完整任务集、日志和原始数据,因此只属于个人体验。
- 转述官方 Benchmark 的博客、项目介绍和聚合网站:没有重新运行实验,不算独立测试。
总结
综合目前这些非官方公开实测,更准确的定位是:
CodeGraph 的实际价值目前最有证据支持的是“减少部分代码探索和搜索动作”,尤其适合跨文件、调用链和架构关系查询。
至于宣传中最吸引人的两个指标:
Token 是否稳定减少:没有得到一致验证。
费用是否稳定下降:目前独立测试没有验证,唯一完整公开费用 A/B 测试甚至平均贵了 6.8%。
因此,如果使用 CodeGraph 的目标是让 Coding Agent 更少反复 Grep、Read,并更快理解复杂调用关系,它有公开数据支持。
如果唯一目标是省 Token 或降低 API 账单,现有第三方独立公开测试还不足以证明它能稳定做到。