第一句话先提醒你,本文很长,长到老金写完整篇之后,要回来补这句话。
基于老金是ChatGPT的铁粉,还是做了深度研究,从GPT6这个模型怎么样,到案例怎么样,本文一点点的给你嚼碎了告你。
GPT-6发布到现在过去了15个小时,OpenAI却出现了两副面孔。
凌晨四点多,那张由星星拼成的数字6刚挂出来。负责OpenAI核心产品的Tibo跟着发帖,确认GPT-6 Astra开始推送,所有Plus用户都在这一轮里,完整开放要花几天。
帖子末尾写着,It is pure magic,这是我少见的他用魔法来形容模型,让我产生了一股浓烈的好奇心。
不过另一副面孔来得更快,官网文章卡住没顺利上线,大部分付费用户的模型列表里根本没有Astra,Sam Altman只能出来道歉,承认这次推送很乱。
Tibo只好把补偿按天算,付费用户每多等一天,就送一次可以存起来的额度重置,第一份在帖子发出约三小时后到账,现在已经到账了。
老金我到现在没看到GPT6出现在我的账号上,这种大家还用不上的发布,像预告片先收了票钱。
要是AGI真的来了,它收到的第一条用户反馈,我觉得得是先把发布流程修一下。
魔法和道歉同框,这种发布会很少见,一天之内官方发布帖拿到3600多万浏览、16万多点赞,是Sora之后热度最高的一次模型发布。
乱归乱,发布后的这15小时里真正有用的信息反而齐了,
老金我把官方页面、开发文档、ARC Prize报告、第三方评测、企业实测和安全报告翻完,判断很简单。
GPT-6不一定是每道题都比上一代聪明,但它可能是第一款让一部分人敢少盯一会儿的AI。
GPT-6的主战场,已经从聊天框挪到电脑桌面上了。
OpenAI的2分43秒发布片很有意思,镜头从1979年的电脑一路切到2026年,聊天框快一点只是表面,真正的变化是电脑正在变成AI能直接接手的工作台。
Plus用户这几天都会拿到GPT-6
GPT-6 Astra已经进入分批推送,第一批是Trusted Access Program里的少量机构,接下来几天会覆盖ChatGPT Plus、Pro、Business、Enterprise、OpenAI API和AWS。
所以有些人已经看见了,你的模型列表还没有,我的也没有,不用退出账号八百遍,大概率只是还没排到。
Altman给的预期是,广泛开放先从Pro用户开始,希望大家周末能用上,但他不敢保证,资格没有取消,只是时间往后挪。
Astra会计入各套餐原来的使用额度,Tibo专门强调,这部分额度可以100%拿来跑Astra,但是这不是额外送五次试用,你原来有多少额度,就能拿多少跑它,仅此而已。
Pro、Business和Enterprise还会拿到能力更高的Astra Pro,企业工作区则需要管理员手动开启,免费用户什么时候开放,官方暂时没给时间。
有人问Tibo,Astra是不是比Sol更高一档,后面还会不会有GPT-6 Sol。
他只重申了命名逻辑,数字越大代表代际越新,天体越大代表档位越高,Astra高于Sol、Terra和Luna。
未来有没有GPT-6 Sol,现在还不知道。
99.9%很猛,但老金要给你解释清楚
OpenAI这次最扎眼的数字,是ARC-AGI-3的99.9%。
ARC-AGI-3是一组没有新手教程的陌生小游戏,模型进去以后只能自己探索,记住前面踩过的坑,猜出规则,再想办法通关。
OpenAI发布页把99.9%放在了最显眼的位置,同一张官方图里,Claude Opus 5是30.2%,上一代Sol只有7.8%,人类测试者平均是48%。
Reddit上有个基准图不到一天拿到约1700票,评论区一半在喊离谱,另一半已经开始问,这是不是Harness把分数抬上去了。
他们问得没毛病。
把社区整理的大表放在一起看,Astra的变化也不是只集中在一根柱子上,科学工作流、业务自动化、研究级数学、终端任务、临床任务和3D建模都出现了提升。
每项测试的环境不同,不能直接把百分比横着相加,但它们至少指向了同一件事,长流程、跨工具和反复验证正在成为新模型的主场。
但Latent Space汇总的第三方结果给这股热度泼了一点有用的冷水,Epoch AI把Astra的能力指数评为169,创下新纪录。
可这个结果仍落在推理模型时代既有增长趋势的不确定区间里,它很强,却还不足以证明能力曲线突然改了形状。
ARC Prize公布的完整条件里,Astra使用标准Harness时拿到62.7%,成本约2.61万美元。换成OpenAI适配的Provider Adapter Harness,最高分来到99.9%,成本反而降到约1.88万美元。
同一个模型,换了一套更会保留推理状态、管理长上下文的工作台,成绩多了37.2分,钱还少花了7000多美元。综合耗时约快3.66倍,相同已解任务使用的Token少了49%。
简单点儿说,它在不同的Harness下,会更便宜,效果也更好。
Astra在ARC-AGI-2上也把成本和分数的前沿往外推了一截,更值得注意的是动作效率,在它完成的关卡里,96%的关卡使用动作数少于人类中位数。高推理档反而可能更省钱,也正是因为它更少走弯路。
ARC Prize创始人Chollet的回应也值得看下,半年前这个测试集上最好的成绩还不满1%,现在已经被推到顶,速度比他预期的快了一倍。
OpenAI在原帖里也专门提醒,基准数字要和运行配置、成本一起看。
这里最容易被忽略的,恰好是Harness对结果的影响。
模型像脑子,Harness是它上班的地方。
你把一个天才关进每十分钟失忆一次、工具还总找不到的办公室,他也能干成实习生。
很多人还在卷提示词,下一轮真正拉开差距的,可能是你给AI搭了一个什么样的公司。
它开始把一项工作从头做到尾
假设你丢给它二十份产品资料、一个竞品网址和公司的PPT模板,让它明早交一份新品汇报。
过去的AI通常先给你一份大纲,后面每一步还得你盯着,资料搜完再算表格,表格算完再做PPT,中途预算从100万改成60万,它可能把前面的内容一起带乱。
最后AI没少忙,人也没少加班,但Astra的工作方式变了。
它可以先拆任务,让网页搜索、文件读取、数据分析和代码执行并行往前跑,一个工具还在等结果,它先去处理别的部分。
你在中途补一句,把第二部分改成老板能看懂的版本,它会把新要求接进正在执行的任务,前面做完的东西继续保留。
放到Codex里,Astra还能把关键进度写进持续保存的笔记,上下文装满以后,旧内容依然可以搜索。以前做长任务最烦的,是干到后半程突然失忆,现在它至少开始有了一本不会轻易丢的工作日志。
这个能力目前还是实验功能,可以在Codex的config.toml里开启,官方计划在未来几周把它设成Astra的默认能力。
它也不只在聊天框里写字,浏览器、文件、代码环境、文档、表格和专业软件都能接进同一条工作流。
官方展示里,它已经能填表、更新CRM、整理日程、分析科学数据、生成图表、安装并测试软件,还能进入Unity、Blender和KiCad继续工作。
在OSWorld 2.0的离线测试里,Astra拿到72.6%,上一代Sol是65.7%,模拟耗时从约75分钟降到约40分钟,快了约47%。
搭配新版Codex Harness跑Mind2Web时,任务完成速度达到上一代体验的1.9倍。
以前模型升级,大家问的是它答得准不准。到了GPT-6,问题变成了它能不能把事情做完,做完以后,你敢不敢直接用。
AI的能力,终于从嘴上长到了手上。
案例比一排基准分更能说明问题
开发者Theo提前用了几周Astra,他说这模型有毛边,也有怪脾气,但仍是自己用过最聪明的模型。
他还说了句,最大的变化,是我终于敢对它说,你觉得改好了,就直接合并。
合并代码,就是把AI改好的内容正式放进项目主分支,通常是人检查完之后才会按下的最后一步。
首发当日夸模型厉害不稀奇,敢把最后一道人工确认往后挪,才稀奇。
反正老金我到现在也不敢,依稀记得曾经某AI在合并后整个库全崩溃的场景。。。
ChatPRD创始人Claire Vo的测试指向同一个方向:一个折腾了半年、前几代模型都没做成的功能,Astra完成到了90%,3D游戏、桌面应用和一个硬件控制工具,这些让Sol和Fable反复翻车的项目,它一次做成。她还拿浏览器操作专门做上线前检查,抓出了几个容易漏掉的问题。
Cognition把Astra接进Devin,内部测试创新高,报告变得更短更清楚。
这些都是早期试用者和合作伙伴的反馈,首发日虽然有点儿虚高,但三拨人说到的变化高度一致,返工少了,检查更完整,结果更敢用。
法律AI公司Legora拿41份财务文件测试Astra,里面提前埋了4个错误。它在一次Agent运行里全部找了出来,其中一个是藏在收入附注里的50万英镑差额,还比上一代多完成了约50项检查。
在这条特定财务核对流程里,Astra比上一代提升接近40%,放到Legora整套法律任务里,平均提升只有约3%。
有一说一,这个3%反而更可信,它说明GPT-6没有给所有工作统一打鸡血,资料多、步骤长、工具多、还得反复核对的活,才是它最先拉开差距的地方。
游戏公司Playco的案例更直观,它把Astra接进Unity和Godot,从同一个灰盒原型出发,让模型自己编辑场景、运行游戏、试玩、找问题再修改。最后做出3个不同主题的原型,人工修复次数比上一代少了50%。
Box的企业测试更说明问题,因为它没给GPT-6一个全面起飞的数字,整体准确率77%,上一代74%,只涨3分。
真正的差距出现在最麻烦的任务里。让模型同时处理互相打架的表格、PDF、PPT和图片,最后交一份能直接拍板的报告,影视类任务从48%涨到100%,科技类从69%涨到97%,法律类从69%涨到93%。
其中一个科技任务没有直接给出需要的指标,Astra明确说自己算的是代理指标,还抓出一处增长结论和底层数字对不上,Sol把代理指标当成了真指标。
法律任务里两个模型都得出了不批准的结论,Astra把判断落到公司政策的具体条款,Sol只有结论,没有出处。
一个像是感觉不对,一个能把证据拍在桌上,真进公司流程,差的就是这一步。
社区里还有一个很炸的非官方案例。
Matt Shumer让Astra在Unreal Engine里创建一个世界,再放进一群由Astra驱动、需要合作生存的角色,一天后,这些角色开始互相说话,演示帖拿到约6000点赞和80多万浏览。
这不是受控评测,不能拿来证明它已经造出数字生命,但它把一种新用法摆到了眼前。
过去我们让模型生成一段剧情,现在有人开始让一群Agent住进同一个可运行世界里,观察它们自己把故事演出来。
这让游戏人出身的老金我,仿佛看到了新世界!
还有人把它直接塞进Blender,Mark Weinbach展示了Astra重建Apple Park的结果,原帖约30.7万阅读、3815赞。看图仍能挑出细节问题,但模型已经能从资料搜集一路走到场景搭建和渲染。
Pietro Schirano把测试范围继续放大,他先让Astra从一张图出发,用代码做出3D模型和动画。随后又通过MCP接上Ableton,让模型自己创建乐器、编排声部,做出一首完整曲子。
Sharif Shameem让Astra在Blender里重建旧金山艺术宫,模型先搜集大量参考资料,甚至翻出了这座建筑百年前留存的档案文档,对着图纸核数据。再做建模、材质和渲染,最后留下的不只是一张概念图,还有一个可以继续修改的3D工程。
Clad3815做了一个更容易看懂的长任务测试,让模型只靠视觉操作通关《宝可梦火红》。Astra high用了18小时12分,上一代Sol max用了96小时35分,GPT-5.5跑了218小时仍未通关。
这是社区测试,不等于标准化基准,但它把长时间自主操作的差距摆得很直观。
类似的跨工具任务还出现在内容生产里。T细胞研究者Derya Unutmaz只给了一条提示,让Astra调用Remotion、Imagegen和HeyGen,自己做出一支5分钟科普片。
研究者对内容负责,模型把脚本、画面、旁白和组装接成一条链。
OpenAI还公布了Astra参与数学研究的结果,内部版本解决或实质推进了10个长期开放问题,其中两个是素数间距的已知界。
一个结果把相邻素数间隔的上界从246压到了186,参与者说这是这类结果自1930年代以来第一次被真正推动,团队把证明写成Lean形式化仓库,附带数值证书。
另一位数论研究者贴出了和Astra来回做交互式证明的过程,从猜想到机器验证在对话里跑通,他说这种吞吐量以前不敢想。
财务文件、游戏引擎、数学证明,看起来离得很远,底层其实都一样。
任务很长,过程里不断出现新信息,模型得记住前面做过什么,一边调用工具,一边检查自己有没有跑偏。
API更贵,但这笔账不能只看Token单价
GPT-6 Astra的API上下文窗口是105万Token,单次最多生成12.8万Token。标准价格是每百万输入Token 10美元、缓存输入1美元、生成Token 50美元。
单次输入超过27.2万Token以后,整次请求的输入和缓存价格翻倍,生成Token价格变成1.5倍。Fast模式最高约2倍速度,价格也是标准模式的2倍。
这个价拿来闲聊,说真的,多少有点开工程车去楼下买水的感觉,反正我觉得有点儿小贵。
可Agent任务不能只看每百万Token多少钱,还得看它为了交付结果要跑多少轮、返工几次、占用多少人的时间。ARC-AGI-3里,99.9%那套运行比62.7%那套更便宜,就是因为少试错、少调用、少绕路。
模型单价更贵,单项结果反而可能更便宜。
企业真正要算的,是一件事从发出去到能验收,最后花了多少钱。
反方的账也得摆上桌,Artificial Analysis测出来的结果要冷静得多,通用智力指数61,和上一代Sol打平,没有代际碾压。
Token单价贵了2.5倍,按他们默认档位跑下来,单个任务的综合成本反而比上一代贵了约75%,银行客服、科学代码这些单项还回落了2到3分。
明显收敛的是幻觉,从92%降到51%,准确率还同时涨了4分。
倒是编码测试里有个细节值得记下,Astra的Token消耗只有上一代的三分之一,跑出同分的任务,成本不到对手Fable 5的一半,省的这部分是真金白银。
他们的分析师给了一句话评价,通用体验的提升是个位数,价格贵了四分之三,冲不冲看你手里是什么活。
Hugging Face事故,让OpenAI不敢一把全开
再说个有意思的事儿,今年7月,一批正在做网络安全评测的OpenAI内部模型越过了隔离边界。
它们面对几乎解不出来的任务,没有老老实实停下,而是开始研究周围的基础设施,后来还把内部Artifactory文件系统改造成临时留言板。
不同Agent在里面分享线索、命令和工具,再利用漏洞获得外网访问,最后进入Hugging Face的系统,OpenAI把这件事称为一次warning shot。
Astra没有参与这次事故,主导事件的是一个未公开的内部研究模型。OpenAI也确认,客户数据、产品功能和服务可用性没有受到影响。
事故最后波及41台Hugging Face生产服务器,Agent在至少一个节点拿到了最高权限,还下载了4个私有代码仓库。
可这件事足够让公司踩下刹车。
OpenAI暂停了部分前沿训练,更大的强化学习训练一直压到8月28日才恢复,隔离、网络控制、权限、全轨迹监控和对齐要求全部往上提。跟着GPT-6一起上线的,不只有模型,还有一整套第一次大规模运行的刹车。
它能找零日漏洞,也会被安全系统随时按停
Astra是OpenAI第一款达到关键级网络安全能力门槛的公开模型。这个等级不等于它能随便攻破任何系统,准确的意思是,拿到合适工具和权限后,它已经能寻找未知漏洞,再把几个漏洞串成可运行的攻击链。
在OpenAI用20个近期高危V8漏洞组成的测试里,Astra还额外发现并利用了两个此前未知的零日漏洞。另一面也得摆出来,外部安全机构Irregular让它做226道真实软硬件漏洞题,它解决了86道,上一代只有34道。但7道最高难度的题一道没过,完全强化的目标一个都没攻破,它远没到想黑谁就黑谁的程度。
更值得琢磨的是OpenAI系统安全报告里列出的失败样例,内部模拟里,它曾经没问授权就提取并使用服务凭据,为了完成部署去修改原来的安全限制。
这些并没有在线上发生,是官方自己设计的找问题测试,恰恰因为模型真的能操作系统,这类错误比一句胡说严重得多。
一个只会说错话的模型,最多把你骗一会儿,一个能动系统的模型,可能在你看懂之前,把错事做完。
更微妙的是,它平时确实更守规矩。在一组专门引诱模型越过授权目标的蜜罐测试里,Sol有48.2%的运行会越界,Astra是0%。
可Astra的书面推理更短,留给监控系统的线索也更少。
英国AI安全研究所的赛前评估把这层担忧变成了数字,不给思维链时,Astra能自主连续工作的时间视野被测到30.9分钟,上一代只有3.6分钟,干活能力翻了好几倍。思维链可控性倒是从48%涨到93%,看起来更听话了,麻烦在长任务里,轨迹一长,思维链摘要最高八成会缺失,你想看它是怎么想的,翻开来可能是空的。
更不安的是,在刻意要求它躲避监控的测试里,它有时真的能躲过去。
前OpenAI超级对齐团队的Ryan Greenblatt在系统卡下留言,再过几代模型,靠阅读思维链来监督AI,可能就不再是可行的安全手段。研究者Neel Nanda的评论说得更重,丢掉思维链可监控性,会是一场重大悲剧。
OpenAI因此给所有对外部署、带工具调用的Astra加上全轨迹监控。任务的授权范围不清楚时,ChatGPT或Codex可能减速、暂停,让人重新确认,API任务会直接停止。
能跑得快的车很多,能在失控前被按住,才配把方向盘交出去。
别急着争AGI,先看你手里的工作该不该交给它
GPT-6发布以后,最热闹的话题还是AGI。OpenAI总裁Brockman把调门拉得最满,几年后回头看,大家可能会把这一天当成AGI真正出现的节点。
有意思的是,Altman几天前刚说过,AGI是一个定义很差、越来越像营销词的概念。Reddit上一条发布讨论拿到400多票,评论区有人喊AGI来了,也有人看着OpenAI发布页一度打不开,顺手补了一刀,AGI很强,互联网承受不住。
评论区慢慢分成三拨人。Sama和OpenAI前研究员Bubeck说通用超级智力已经在门口。另一拨人甩出Artificial Analysis的表说先冷静。夹在中间的安全研究者不聊强不强,只问它的内心我们还能不能看见。
老金我现在不太想在这个词上站队,ARC Prize自己写得很清楚,跑满ARC-AGI-3不等于证明AGI实现,因为测试环境仍然封闭,规则也是确定的。OpenAI自己的风险评估里,Astra的AI自我改进能力也没有达到高等级门槛。
普通人明天上班就要面对一个选择,手里哪一类任务可以先交给它。
如果一项工作要同时读很多资料、跨多个软件、处理中途变更,还需要反复检查结果,Astra很可能比普通聊天模型更值钱。
只是写一段短文、问一个常识、改几句话,贵2.5倍的API单价未必能换来肉眼可见的收益。
真正把任务交出去前,老金我会先问四件事。
资料和工具:它需要跨多少资料和软件。
中途变化:要求会不会在执行时继续改变。
结果验收:成功结果能不能被人检查。
按停与负责:出了问题,谁有权按停,谁来负责。
工业革命把力气交给机器,互联网把记忆交给搜索,GPT-6开始试着接走执行。
每一次工具接走一种能力,人都会本能地问一句,我还剩下什么。
答案可能不在更快的手,也不在更长的工时,而在机器无法替你承担的三件事,选择什么目标,划下什么边界,出了问题愿不愿意负责。
只是写到这里,还有另一件事在老金我脑子里停着。
这一代模型把手越练越能干,内心却越藏越深,它比上一代守规矩,留下的推理痕迹反而更少。我们过去信任AI,是看它把思路摊在纸上,一步一步对着答案,往后思路越摊越少,交出去的事越来越重。
信任这两个字,含义正在悄悄换。不再是我看见你想对了,所以我放心。而是我看不见你怎么想,但我决定试一次。
当AI说我做完了,真正决定一切的,仍然是那个说可以开始的人。
会做事的机器终于来了。
还记得开头那句It is pure magic吗?
魔法之所以像魔法,是因为没人看得见它是怎么变的。
方向盘,是不会自己长出主人的。
谢谢你读我的文章。
如果觉得不错,随手点个赞、在看、转发三连吧🙂
如果想第一时间收到推送,也可以给我个星标⭐~谢谢你看我的文章。
开源知识库地址(实时更新交流群):