九月一天一个大模型发布?大模型不比谁更能聊了

0 阅读5分钟

9 月 1 日到 9 月 3 日,四天。

Anthropic、Google、Meta、OpenAI,四家,四场发布。

如果你把这四场发布并排放在一起看,会发现一件细思极恐的事:它们几乎在讲同一个故事。

不是"我的模型更聪明了",不是"我的上下文更长"。

是——我的模型更能干活了。

我们两个月前在 DeepSeek-V4-Flash 那篇文章里写过一句话:竞争重点,正从"陪你聊天"转向"Agent、工具调用、自动化执行"。当时这只是从一家公司的公告里读出来的信号。

这一周,海外四家同时把它变成了全行业的共识。

先看这四场发布

日期厂商产品核心指向
9-01AnthropicFable 5.1 / Mythos 5.1长周期 Agent、编程,成本降 25-45%
9-02GoogleGemini 3.8 Flash / Flash Cyber软件工程、智能体、网络安全
9-02MetaMuse Spark 1.3补 Agent 与代码能力
9-03OpenAIGPT-6 Astra计算机操作、漏洞挖掘、科学推理

Anthropic 的新一代强化长周期 Agent——注意"长周期"这三个字,它意味着模型不再只是完成一个单轮任务,而是能扛住一个持续数小时甚至更久的完整项目。

Google 这次有意思,除了高速推理的 Flash,还单独拉出一个 Flash Cyber,把网络安全能力做成独立版本。

Meta 的 Muse Spark 1.3 最直白——新一代旗舰,重点就是"补 Agent 与代码"。补,说明之前有短板,现在在追。

OpenAI 的 GPT-6 Astra 是代际升级,能力拉到计算机操作、漏洞挖掘、科学推理三个新维度。但同时,它安全管控严格,不全部开放

四家,四个方向看起来不同,但底层是同一件事:把模型从"问答机器"推向"能自主执行任务的数字员工"。

三个值得琢磨的信号

一、主战场,彻底换了

还记得去年大家比什么吗?比谁的对话更自然,比谁的文笔更好,比谁能写一首像样的诗。

这一周四场发布,没有一家在强调"聊天体验"。

它们的关键词高度重合:Agent、编程、软件工程、工具调用、计算机操作。

这说明行业已经默认了一件事:"会聊天"不再是卖点,它已经变成了基础设施。 真正的战场,是谁能让模型真的把活干完——自己读代码库、自己改文件、自己跑测试、自己操作电脑。

这个拐点,DeepSeek 在 7 月就喊出来了。这一周,海外四家用四场发布会,集体点了头。

二、一个刺眼的反差:海外在降,我们在涨

Anthropic 这次明确:成本下降 25% 到 45%。

而在大约四周前,8 月 6 日,DeepSeek 公告:整体上调 API 定价,预计涨幅较大。

一边是海外厂商在 Agent 能力暴涨的同时把价格往下砍,一边是国内厂商在能力证明之后把价格往上提。

这不是谁对谁错,这是处在不同阶段

  • 海外四家,尤其是 Anthropic,已经在用降价换 Agent 的调用量——Agent 是高频、长链路、大 token 消耗的场景,价格每降一点,开发者的使用量就上一个台阶。它们在抢生态位。
  • DeepSeek 刚完成融资、扩招、能力证明,走到了"回收定价权"这一步——从挑战者变成要算账的一方。

对开发者来说,这个反差的直接含义是:别只盯着一个 API 的价格曲线,要看整个市场的价格剪刀差。 海外在打价格战的时候,正是你重新谈成本、重新做多供应商备份的窗口期。

三、能力越强,越要上锁

这是我觉得最值得说的一点。

Google 单独做了 Flash Cyber(网络安全),OpenAI 的 GPT-6 Astra 把漏洞挖掘写进核心能力,但紧接着一句"安全管控严格,不全部开放"。

这句话的分量很重。

它意味着:模型的能力已经强到厂商自己都觉得不能全给你。当 AI 能自己找漏洞、能操作你的电脑、能执行长周期任务,它就不再只是一个工具——它是一个有行动能力的主体。

所以新的产品形态出现了:能力分层开放。 能挖漏洞的能力给你一部分,但最锋利的那一层,锁起来。

这会是接下来一年所有厂商的共同课题:一边把模型能力往上堆,一边给它套上缰绳。能力和管控,从此是一体两面。

给你的三点观察

第一,别再用"聊天体验"评估模型了。 买车不看音响了,看能不能跑长途。评估模型,看它能不能独立扛完一个项目——这才是这周四场发布共同定下的新标准。

第二,成本窗口正在打开,但不会太久。 海外这波降价(Anthropic 降 25-45%)是为了抢 Agent 生态位。一旦格局稳定,价格一样会回收。趁现在,把你的核心链路做多供应商,把可替换的调用接到更便宜的模型上。

第三,"计算机操作"这条线,值得你盯紧。 GPT-6 Astra 把计算机操作放到核心能力,这不是小升级——从"给你代码"到"替你操作电脑",是 Agent 从辅助走向执行的关键一步。它真正落地那天,很多"人工点一下"的岗位会重新被定义。


四天,四家,同一个方向。

两个月前我们从一家公司的公告里读出的信号,现在成了整个行业的方向。

大模型不再比谁更能聊了。它们开始比谁能真的把活干完。

而"能力越强、管控越严"这个新变量提醒我们:当 AI 开始自己动手,我们要操心的,就不再是它够不够聪明,而是——它该被允许做到哪一步。

我是词元。下一期,我们聊聊这轮海外四连发里,哪些能力会最快落进普通人的工作流。