CodeGraph 到底能省多少 Token?我整理了官方 A/B、200 个真实 PR 和公开实测,结果和宣传并不完全一致

3 阅读8分钟

CodeGraph 到底能省多少 Token?官方数据很漂亮,但独立公开实测没有得出同样结果

CodeGraph 是一个面向 Claude Code、Codex、Cursor 等编程智能体的本地代码知识图谱工具。它会提前解析代码中的符号、调用关系、依赖和文件结构,再通过 MCP 提供给智能体。

它要解决的问题很直接:Coding Agent 为了理解代码,经常反复执行 Grep、Read、Glob 等探索操作。CodeGraph 希望把这些重复搜索替换成结构化的图查询。

项目目前公开宣传的核心数字包括:工具调用减少 88%、耗时减少 53%、处理 Token 减少 62%、成本降低 44%

不过,这些数字来自 CodeGraph 自己设计和执行的官方 Benchmark。

这篇文章会保留官方测试作为背景,但后面的效果判断不采用官方数据,只看第三方公开实测


官方测试:从“成本基本持平”到“成本降低 44%”

测试来源:CodeGraph 官方 Benchmark

网页地址:CodeGraph GitHub

CodeGraph 官方先后公开过多轮 A/B 测试,结果变化比较明显。

时间官方公开结果
2026 年 5 月文件读取减少 76%,37 组任务总成本约 15.4 美元 vs 13.8 美元,官方描述为“成本基本持平”
2026 年 7 月工具调用减少 89%,处理 Token 减少 69%,成本降低 60%
2026 年 8 月工具调用减少 88%,耗时减少 53%,处理 Token 减少 62%,成本降低 44%

2026 年 8 月的最新官方测试使用 Claude Opus 4.8,在 VS Code、Excalidraw、Django、Tokio、OkHttp、Gin、Alamofire 七个开源项目上测试,每个条件运行 4 次并取中位数。

官方还修复了旧测试中对照组可能通过 Bash 意外调用 CodeGraph CLI 的污染问题。

因此,当前 README 使用的是 Token 减少 62%、成本降低 44% 这组数字,而不是此前的 69% 和 60%。

但由于这些测试由项目方自己设计、运行和发布,下面不使用这些数字判断 CodeGraph 的真实效果,只作为官方宣传口径的背景说明。


第三方独立公开实测

HarrisonSec 40 次 A/B 测试:Token 少 22.6%,速度快 20.3%,费用反而增加 6.8%

测试来源:Harrison Guo / HarrisonSec

网页地址:I Tested CodeGraph on Hono

这是目前公开资料中比较完整的一组独立 A/B 测试。

测试对象是 Hono,约 280 个 TypeScript 源文件。测试使用 Claude Opus 4.8,设计 5 类代码理解任务,每个任务分别进行 4 次原生工具测试和 4 次 CodeGraph 测试,总计 40 次运行

作者还公开了原始 CSV,并验证每一次 CodeGraph 测试确实连接并调用了 MCP 工具。

汇总结果:

指标不使用 CodeGraph使用 CodeGraph变化
平均工具调用14.0 次6.3 次减少 55.0%
平均耗时70.8 秒56.4 秒减少 20.3%
平均 Token9,3857,261减少 22.6%
平均费用0.338 美元0.361 美元增加 6.8%

这组测试里,CodeGraph 确实减少了工具调用、Token 和平均耗时,但没有降低总费用

而且不同任务之间差异很大。

任务Token 变化耗时变化费用变化
路由查找-40.2%+2.8%+22.5%
中间件调用链-21.9%+4.5%+43.4%
跨运行时架构分析-39.1%-52.8%-28.9%
重构定位-6.1%-2.2%+26.5%
文本对照任务+1.4%-15.0%-5.3%

最明显的收益出现在跨多个文件和目录的架构分析任务中:工具调用减少 80.1%,耗时减少 52.8%,费用降低 28.9%。

但简单路由查找和中间件追踪虽然 Token 更少,费用反而分别增加 22.5% 和 43.4%。

这份测试能支持的结论是:CodeGraph 在 Hono 上明显减少了探索步骤和 Token,平均速度也更快;但不能证明它一定省钱。


OpenCodeReview 约 200 个真实 PR:工具调用和耗时略降,但 Token 增加约 13%

测试来源:OpenCodeReview 作者公开 A/B 测试

网页地址:GitHub Issue #1056

2026 年 6 月 29 日,OpenCodeReview 作者公开了将 CodeGraph 接入 AI 代码审查流程后的测试。

测试使用 Claude Opus 4.6,对同一批 200 个真实生产仓库 PR 分别开启和关闭 CodeGraph,其中 6 个只有测试代码变化的 PR 被自动跳过。

与 HarrisonSec 的代码理解测试不同,这组测试直接观察实际代码审查结果。

工具调用与耗时

指标不使用 CodeGraph使用 CodeGraph变化
总工具调用7,3637,107-3.5%
文件读取3,1012,779-10.4%
代码搜索2,2531,973-12.4%
总耗时4 小时 46 分 21 秒4 小时 41 分 32 秒-1.7%

在这组更接近真实开发工作流的测试中,CodeGraph 仍然减少了文件读取和代码搜索,但幅度远小于官方 Benchmark,也小于 HarrisonSec 的测试。

Token

指标不使用 CodeGraph使用 CodeGraph
总 Token7,950 万8,960 万
输出 Token约 200 万约 200 万
平均每个 PR41 万46.2 万

测试作者明确指出,输入 Token 增加约 13%,输出 Token 基本不变。

也就是说,在真实 PR 代码审查任务中,CodeGraph 并没有减少整体 Token,反而因为增加了结构化上下文而消耗更多输入 Token。

审查质量

指标不使用 CodeGraph使用 CodeGraph变化
精确率30.6%31.9%+1.3 个百分点
召回率18.9%20.4%+1.5 个百分点
找到的真实问题285307+7.7%

这意味着增加的 Token 并非完全没有收益:CodeGraph 组多发现了 22 个真实问题。

因此,这组测试更准确的描述不是“CodeGraph 更省 Token”,而是:

它用更多输入上下文换来了略少的搜索操作、略快的总耗时,以及更高的代码审查问题检出数量。

需要说明的是,OpenCodeReview 作者已经集成 CodeGraph,并在 Issue 中提出进一步合作,因此这虽然属于非 CodeGraph 官方测试,但测试方并非完全没有产品合作利益。数据可以参考,但应保留这一背景。


Qiita 真实项目测试:4 个相关位置只找到 2 个

测试来源:Qiita 开发者 TheGateBreaker

网页地址:Qiita 测试原文

2026 年 7 月 30 日,一名开发者把 CodeGraph 接入自己公司的真实 Python 项目。

项目包含 400 多个 Python 文件,建立索引约耗时 3 秒。

测试选择的不是人为设计的问题,而是过去真实发生过、曾导致代码审查往返 9 轮的历史问题。

实际存在 4 个相关业务判断位置。

CodeGraph 最终找到:

项目数量
实际相关位置4
CodeGraph 找到2
未找到2

找到的两个位置都直接调用了目标函数。

另外两个位置虽然实现了同样的业务判断,但属于独立重复实现,并没有调用目标函数,因此调用图中不存在连接关系。

作者又尝试自然语言探索,仍然没有找到剩余两个位置。

这组测试没有统计 Token、费用和整体耗时,因此不能用它判断 CodeGraph 是否更省资源。

它能说明的是 CodeGraph 的能力边界:

对于存在明确符号关系、调用关系的代码,图查询有优势;如果问题来自“没有调用关系的重复实现”,调用图本身并不能保证发现它。


哪些公开数据没有用于最终结论

为了避免把不同可信度的数据混在一起,下面几类公开数据不用于文章最后的效果判断:

  • CodeGraph 官方 Benchmark:保留作宣传口径背景,但不作为独立证据。
  • LemonCrow、Repowise 等直接竞品 Benchmark:虽然有公开数据,但测试方存在直接竞争关系,不作为中立独立测试。
  • Reddit 个人反馈:部分用户声称节省 20%~30% Token,但没有公开完整任务集、日志和原始数据,因此只属于个人体验。
  • 转述官方 Benchmark 的博客、项目介绍和聚合网站:没有重新运行实验,不算独立测试。

总结

综合目前这些非官方公开实测,更准确的定位是:

CodeGraph 的实际价值目前最有证据支持的是“减少部分代码探索和搜索动作”,尤其适合跨文件、调用链和架构关系查询。

至于宣传中最吸引人的两个指标:

Token 是否稳定减少:没有得到一致验证。

费用是否稳定下降:目前独立测试没有验证,唯一完整公开费用 A/B 测试甚至平均贵了 6.8%。

因此,如果使用 CodeGraph 的目标是让 Coding Agent 更少反复 Grep、Read,并更快理解复杂调用关系,它有公开数据支持。

如果唯一目标是省 Token 或降低 API 账单,现有第三方独立公开测试还不足以证明它能稳定做到。