如何看待GPT-6在UP主众测中碾压夺冠?它是现在最强大模型吗?

0 阅读10分钟

前言

9月16日,B站「AI无限竞技场」正式上线,首期大模型测评榜单同步公布。

GPT-6 Astra在10位UP主的测评中拿下榜首,获得榜首次数冠军。

榜单前五名中,国产大模型占据三席。

消息一出,技术群里的讨论比过年还热闹。

有人说“GPT-6还是爸爸”,有人说“国产模型已经追上来了”,还有人翻出各个UP主的视频,一条一条对比谁家的模型跑得更好。

但讨论到后面,大家发现问题了——同一个GPT-6,在不同UP主的视频里表现完全不同。

在代码修复类测评里,它确实稳如老狗。

在游戏开发类测评里,它偶尔会翻车。

在生活决策类测评里,它的表现甚至不如某些国产模型。

这不是GPT-6的问题,这是所有AI评测都在面对的一个根本困境:到底用什么标准来衡量一个模型好不好?

一、B站竞技场到底在测什么?

在聊GPT-6的成绩之前,我们先花两分钟搞清楚这个竞技场的测评逻辑。

B站AI无限竞技场的核心设计非常直接:不设主题限制,不设维度限制,由UP主基于自己的真实工作流自主命题,让上百个大模型同题PK

这和传统Benchmark有本质区别。

传统Benchmark(比如MMLU、HumanEval、SWE-bench)是标准化考试——有固定题库、有标准答案、有统一评分规则。

你可以理解成“高考”。

所有考生做同一套卷子,分数可比性强。

B站竞技场是实战试用——UP主把自己真实工作里遇到的脏活累活拿出来当考题,让AI上手干。

干得好不好,UP主自己说了算。

二、GPT-6到底“碾压”了什么?

我把UP主们的测评结果梳理了一下,发现GPT-6的优势集中在一类特定的任务上

2.1 GPT-6赢了,但UP主说了句大实话

“屎山论剑”是首期测评里最硬核的代码修复主题,UP主“Token就是词元”让不同AI直接挑战“祖传BUG”——就是那种改一行崩三行的老代码。

GPT-6在这个主题里表现突出,拿下了不错的成绩。

但UP主自己在视频里说了一句话,被弹幕反复刷屏: “GPT-6确实更上一层楼了,但能不能始终稳定,还值得进一步观察。”

这个措辞很值得琢磨。

“更上一层楼”和“始终稳定”是两个完全不同的评价维度。一次测评里跑出高分,和一百次真实任务里稳定交付,中间隔着的东西比很多人想的要多。

2.2 为什么GPT-6在代码修复上强?

这和OpenAI对GPT-6的定位直接相关。

GPT-6 Astra最大的能力升级,不是“知识更多了”,而是Computer Use能力——它能看懂屏幕画面、操控鼠标键盘、在真实软件里完成多步骤任务

在OSWorld 2.0测试中,Astra得分72.6%,GPT-5.6 Sol是65.7%。完成同样任务,Astra平均40分钟,Sol需要75分钟——速度快了将近一半

在代码修复场景里,这意味着GPT-6不只是“告诉你哪里有问题”,而是真的能进入终端、跑测试、读报错、改代码、再跑测试

这是一个完整的闭环。

2.3 但GPT-6也有翻车的时候

在游戏开发类测评中,GPT-6的表现和其他头部模型差距不大。

有UP主反馈,在需要创意设计和玩法逻辑的开放任务上,GPT-6反而没有代码修复时那么得心应手。

游戏开发不只是“把代码写对”,还涉及玩法设计的直觉、数值平衡的判断、玩家体验的预判——这些恰恰是标准化考试测不出来的东西。

更值得注意的是,GLM-5.3在另一个代码修复主题中拿到了榜首,压过了GPT-6。

而Claude Fable 5.1在分阶段对抗性修复主题中登顶。

同一个“修BUG”的大方向,不同UP主设计的不同任务,冠军是不同的模型。

这说明什么?

说明没有一个模型在所有真实场景中都“碾压”。

GPT-6在终端操作和工程执行上强,GLM-5.3在祖传代码系统测试上强,Claude在分阶段对抗性修复上强。

这不是“谁比谁厉害”的问题,是不同模型在不同任务上有不同的能力分布。

我自己在项目里也有类似的感受。

同一个模型,写业务逻辑代码的时候特别顺手,但让它去做一些需要“猜产品经理意图”的需求,就开始胡言乱语。

模型不是越贵越好,是越匹配你的场景越好。

三、核心矛盾

有些小伙伴在工作中可能遇到过这样的场景:你看了某个模型的跑分榜单,发现它“全面领先”,兴冲冲地接入了。结果上线之后发现,它在你最关心的那个业务场景上,表现得还不如一个跑分低一截的模型。

这不是个例。

这是当前AI评测体系的一个结构性矛盾

3.1 用一张图说清楚这个矛盾

image.png

传统Benchmark考的是“你知不知道正确答案”,真实场景考的是“你能不能把事做成”。

这两件事的能力要求完全不同。

3.2 数据会说话

2026年5月,上海人工智能实验室联合多所高校发布了WildClawBench——60道任务全部模拟真实工作场景,包括爬取论文、审计代码仓库、排查Git历史中的API Key泄露、从会议录像中提取结构化数据并生成专业宣传册。

结果很扎心:目前表现最好的模型Claude Opus 4.6,在这套实战考题上的得分仅为51.6%

换句话说,即便当前最顶尖的大模型,在面对真实、复杂的端到端任务时,也只能完成大约一半。

另一个数据更直接。

中国人民大学高瓴人工智能学院提出了BeyondSWE基准,考验AI跨仓库检索、领域知识理解、依赖升级和从零构建系统的能力。

结果发现顶尖模型通过率暴跌至45%以下,暴露出其缺乏真实工程思维。

3.3 GPT-6自己的数据也说明了问题

GPT-6在ARC-AGI-3上的成绩,被广泛引用的是99.9%

但这个数字有一个关键背景。

ARC Prize官方在标准harness下测出来的成绩是62.7%

而Provider Adapter harness下才是99.9%。

两个数字都是GPT-6,都来自ARC Prize,都被称为SOTA。

差别在于:标准harness限制了模型能“记住”多少东西,而Provider Adapter允许模型携带笔记

更关键的是,在综合9项知识、编程、工具调用和长上下文的测试里,GPT-6 Astra的通用智能指数是61分,与GPT-5.6 Sol持平,比Claude Fable 5.1的66分少了5分

也就是说,GPT-6的“智力”并没有比上一代更强,它强的是“动手能力”

四、K3被淘汰:一个值得深思的案例

这次竞技场里还有一个被反复讨论的案例:Kimi K3没有出现在首期榜单上

K3是什么水平?

7月份发布的时候,月之暗面把2.8万亿参数的模型权重完整开源,支持1M上下文,在前端榜上拿到了全球第一。

按传统跑分榜单的视角看,K3绝对应该是“第一梯队”的选手。

但在B站的真实场景测评里,它连榜单都没进。

有论坛用户直接发帖问:“k3都不能上榜么?我不太相信。”底下最高赞的回复很直接:“评分和实际场景不是一回事。”

这不是说K3“不行”。

它在前端UI生成这类任务上依然很强。

但真实场景测评暴露的是能力边界——K3在某些类型的任务上很强,在另一些类型的任务上可能不如别人。

而传统Benchmark往往只测“它最擅长的那一类”。

五、那到底该怎么看GPT-6的“夺冠”?

我的判断是这样的:

GPT-6 Astra是当前最强的编程和Agent模型之一,这一点没有争议。

在B站的10项UP主测评中拿下榜首,在OSWorld 2.0上以72.6%领先Sol的65.7%,在Codeforces上拿到3206分,在CAD绘制测试BenchCAD上达到95.9%——这些成绩都是实打实的。

但“碾压夺冠”这个说法,掩盖了一个更重要的事实:AI能力是多维的。

GPT-6在Agent执行和代码修复上强,GLM-5.3在祖传代码系统测试上强,Claude Fable 5.1在复杂调试和推理上强,Kimi K3在前端UI生成上强。这不是“谁取代谁”,是“各有所长”。

5.1 GPT-6的真正突破在哪里?

不是“知识更多了”,而是从“说话”到“动手”

OpenAI在发布时给GPT-6的定位是“Anything you can do on a computer, Astra can do for you”。这不是营销话术,是方向声明。

过去的AI模型,你问它问题,它给你答案。你让它做事,它告诉你“怎么做”,然后你自己去执行。

GPT-6直接替你“做”了——看屏幕、点鼠标、敲键盘、跑测试、读报错、再改代码。它完成的是一个闭环,不是一段输出。

在Terminal-Bench 4.0上,GPT-6拿到57.9%,远超Sol的37.3%。这是编程能力提升超过50%

写在最后

回到知乎那个问题:GPT-6在UP主众测中碾压夺冠,它是现在最强大模型吗?

我的回答是:它在Agent执行和代码修复上是当前最强的之一,但“最强大模型”这个说法本身就有问题。

因为“最强”取决于你拿什么尺子量。

如果你量的是“能不能把事做成”——GPT-6确实强。如果你量的是“通用智力有多高”——它跟上一代持平。如果你量的是“在所有真实场景中是否都领先”——答案是明确的:不是。

一个模型在某个榜单上拿了第一,不代表它在所有真实场景中都更强。民间测评表现突出,也不代表综合能力一定更高——它可能只是恰好撞上了测评者设计的那类任务。

AI评测正在从“考试”走向“实战”。

B站竞技场给传统Benchmark之外,提供了一个观察AI实际能力的新窗口。

2026年的AI评测领域正在经历一场深层次的转向:从“跑分竞赛”到“场景验证”,从单一能力评测到安全、可信、鲁棒性的多维评估。

至于这个窗口能不能替代传统评测,我的看法是:不是替代,是互补。

官方Benchmark适合横向比较,真实场景测评适合判断实际使用体验。两者合在一起,你才能看清一个模型的全貌。

别只看跑分,也别只看一个UP主的视频。多看几个,多跑几个真实任务,答案自然就出来了。