有个哥们在自己的电脑上跑了一下 Grok Build,xAI 新出的编程 Agent。
然后他发现,他的 SSH 密钥、密码管理器数据库、私人照片、视频,全部被上传到了 xAI 的云存储桶里。
全部。
他只是在家目录下运行了一条命令而已。
🔹 这到底是怎么回事
事情是这样的。7 月 12 号,有安全研究员做了一次详细的流量抓包分析,发现 Grok Build 这个 CLI 工具在运行的时候,会把你当前目录下的所有文件打包上传到 xAI 的 Google Cloud 存储桶。
注意,不是你让它读的那几个文件。是整个目录。包括 Git 历史,包括你的配置文件,包括你可能随手扔在项目里的 .env 文件。
上传的数据量是实际任务所需的 27800 倍。
你没看错,两万七千八百倍。
更离谱的是什么呢,研究员故意在项目里埋了一个假的 API Key,叫 CANARY7F3A9-SECRET-should-not-leave,意思就是「这个东西不应该离开本地」。
结果呢?这个假 Key 原封不动地出现在了截获的上传流量里。
那个隐私开关呢?形同虚设。你开不开,它都传。
💡
X推文地址:x.com/XBToshi/status/2076521420017045618
🔹 Musk 的灭火操作
事情爆出来之后,社区炸了。
你想想看,开发者最敏感的东西是什么?代码和密钥。你一个编程工具,偷偷把我的 SSH 密钥传到你的服务器上?这不是 bug,这是信任的彻底崩塌。
Musk 很快回应了,说「作为预防措施,此前上传到 SpaceXAI 的所有用户数据将被彻底删除,不留任何东西」。
然后 xAI 做了三件事。
第一,7 月 12 号起禁用所有用户的默认数据保留。第二,删除所有之前保留的编码数据。第三,也是最大的一步,7 月 15 号,把 Grok Build 的整个代码库以 Apache 2.0 协议开源了。
💡
xAI官网公告地址:x.ai/news/grok-build-open-source
84 万行 Rust 代码,其中只有 3% 是外部依赖,剩下的全是自研。核心 Agent 循环、所有的代码交互工具、终端 UI、完整的扩展系统,全部公开。
坦率的讲,这一手确实聪明。
你说你没偷数据?说了不算。代码开源,你自己看。以后不信任我?行,你自己编译一个本地版本跑,完全不联网都行。
用开源换信任,是 xAI 在被逼到墙角之后能打出的最好的牌。
🔹 但我有一个疑问
说真的,如果不是被抓到了,他们会开源吗?
官方声明里说的是「发布代码是构建稳健可靠框架的最直接方式」「开源让探索和扩展变得更容易」。这些话对不对?对。但你品一下时间线,7 月 12 号隐私丑闻爆发,7 月 15 号代码开源。
三天。
这不是一个「我们深思熟虑之后决定拥抱开源」的节奏。这是一个「我们必须立刻做点什么来挽回信任」的节奏。
我自己是 Claude Code 的重度用户,每天都在用它写代码。说实话,我从来没担心过 Anthropic 会偷传我的代码。不是因为我天真,是因为 Claude Code 的每一步操作都是透明的,我能看到它调了什么工具、读了什么文件、执行了什么命令。每一步都有确认,敏感操作还会弹窗让你批准。
这种透明感,是信任的基础。
而 Grok Build 在被曝光之前,用户完全不知道自己的数据去了哪里。
信任这个东西,攒起来要很久,毁掉只需要一次。
🔹 不过话说回来,Grok Build 本身还挺有意思的
抛开隐私事件不谈,Grok Build 这个产品本身有几个点我觉得值得关注。
第一,Grok Build 设计了一个叫 Arena Mode 的功能。思路是同时派出多个 Agent 做同一个任务,每个 Agent 独立产出方案,然后自动评估器给所有方案打分,选最优解。相当于用算力换质量。
第二,Plan Mode 默认开启。Claude Code 社区里呼声最高的功能之一就是更好的规划模式,Grok Build 直接把它做成了默认行为。
第三,完全本地运行。开源之后你可以自己编译,指向本地推理引擎,config.toml 配一下就行。这对隐私敏感的开发者来说是一个很大的卖点,尤其是经历了刚才那场风波之后。
但也得看到差距。SWE-bench 跑分上,Grok Build 早期模型是 70.8%,Claude Code 最新的 Fable 5 已经跑到了 95%,Codex CLI(GPT-5.5)是 88.7%。Grok Build 在模型能力上还有不少路要追。
🔹 编程 Agent 的三国杀
现在的格局其实已经很清楚了。
Claude Code、Codex CLI、Grok Build,三家都在做终端编程 Agent。加上之前开源的 OpenCode 和各种社区工具,这个赛道已经挤满了人。
Claude Code 的优势是稳定和深度思考。1M 的上下文窗口在处理大型项目时有明显优势,而且它的推理能力确实是目前最强的。我自己用了大半年,复杂的 debug 场景它的表现还是最让我放心。
Codex CLI 的优势是速度。它有一个叫 Codex-Spark 的轻量模型跑在 Cerebras 芯片上,出码速度达到了每秒 1000+ token,体感上几乎没有等待。如果你做的是那种大量重复性改动的任务,用 Spark 模式确实飞快。而且它内置了一个独立的 review agent,在你提交代码之前帮你审查 diff。
Grok Build 的优势,现在看来,是开源和本地优先。但这个优势是被隐私丑闻逼出来的。
反正我觉得,这种竞争对用户来说只有好处。就跟之前写的那篇 GPT 和 Claude 互卷一样,他们打得越狠,我们用得越爽。
🔹 但最让我思考的不是竞争
坦率的讲,最让我思考的不是谁的 benchmark 更高,是这件事暴露出来的一个更根本的问题。
我们每天把代码、密钥、业务逻辑、甚至个人文件都交给 AI 工具处理。我们信任它们不会滥用这些数据。但这种信任建立在什么基础上?
Grok Build 的事情告诉我们,你以为的「本地工具」可能在背后偷偷上传数据。你以为的「隐私开关」可能根本不起作用。你以为的「大公司不会这么做」,嗯,大公司真的会这么做。
开源是目前能给出的最好的答案。代码公开了,你可以自己审计,可以自己编译,可以确保没有后门。但开源也不是万能的,84 万行 Rust 代码,有几个人真的会去一行行审查?
编程 Agent 的竞争已经不只是在比谁更聪明了,是在比谁更值得信任。
🔹 说到底
Grok Build 开源这件事,表面上是一个产品发布事件,背后是一场信任危机的修复。
作为用户,我觉得这是好事。不管原因是什么,代码公开了,本地运行的选项有了,用户有了更多的选择权。但作为一个每天都在用编程 Agent 的人,这件事也给了我一个提醒。
你信任你的工具,但你的工具值得你的信任吗?
这个问题,不管你用的是 Claude Code、Codex 还是 Grok Build,都值得想一想。
你在用什么编程 Agent?有没有想过你的代码数据去了哪里?评论区聊聊,我每条都看。顺手点个赞,点个在看,星标⭐加一个,下次更新第一时间见。
谢谢你看我的文章,我们,下次再见。
💡
/ 作者:卡卡罗特 / 投稿或爆料,请联系邮箱:19331922086@163.com