民间AI排行榜单新鲜出炉,Fable 5.1仅排第三

11 阅读7分钟

大家好,我是石小石~


最新民间AI排行榜单

长期以来,MMLU(大规模多任务语言理解)、LiveBench(实时评测基准)、GPQA(研究生级别物理问答数据集)这类大模型 Benchmark(评测基准)的跑分,一直被社区视作衡量大模型实力的重要参考。但跑分亮眼,就代表模型在实际使用场景里同样强大吗?答案其实未必。

最近, B 站不少 UP 主通过用各类贴近现实、条件更苛刻的场景对大模型“整活” 式测试 ,一份民间 AI 能力排行新鲜出炉。榜单里 GPT‑6 Astra 瑶瑶领先,GML‑5.3 紧随其后,而 Claude Fable 5.1 仅排第三。

完整排名榜单:www.bilibili.com/blackboard/…

这份榜单其实蛮有意思,很多在学术榜单名列前茅的模型,在 UP 主设计的真实任务中居然表现不佳。 这也引出了一个值得讨论的问题:Benchmark 的高分,真的可以等价于大模型的真实使用能力吗?

传统 Benchmark,AI的“高考式”能力评测

很多人会把 Benchmark 的结果当成评判大模型综合能力的最终依据。站在科研角度,MMLU‑Pro、GSM8K、LiveBench、GPQA Diamond 这一类学术评测确实具备很高参考价值:它们拥有成套精心设计的标准化题库,答案清晰,评估流程可以复现,相当于给各大模型提供了一把统一的衡量标尺。

它的优势十分明确:

  • 条件可控:测试变量固定,不同模型之间能够实现公平的横向对比;
  • 结果可复现:任何人都可以复跑整套评测,得到相近的得分;
  • 指向清晰:重点考察模型的知识储备、多步骤逻辑推理、数理演算这类硬能力。

但标准化测试本身也存在固有局限。就好比高考状元应试能力出众,可步入社会之后,去处理现实中大量没有标准答案、错综复杂的实际问题,又是完全另一回事。放到 AI 身上也是同理,有些模型应试跑分很强,落地到真实场景,表现却会大打折扣。

当然,我不是要否定 Benchmark 的价值。它是科研迭代、模型调优过程中不可或缺的工具,如果没有这套标准化基准,研究人员很难客观判断模型究竟有没有取得实质进步。

Benchmark 是一把好用的标尺,但绝不应该成为评判大模型好坏的唯一标尺。

B 站 AI 无限竞技场,AI的社会“拷打”

最近刷视频,偶然发现B站的AI无限竞技场活动。这个活动本质也是做大模型能力评测 ,但整套评测内容全部由各路 UP 主自己说了算,平台没有设定统一标准。点开里面的视频一看还挺有意思:有 AI 复刻《狂扁小朋友》游戏、屎山代码论剑、AI 空间建模演示等等。
相比起一本正经的学术跑分,我就爱看这种“整活”类的实测,看AI遭受社会“毒打”。

这套玩法和传统学术 Benchmark 完全是两码事。整个竞技场更像是一个“草台班子式评测集合”:平台并不统一出题,直接把出题权交到各位 UP 主手里。这种来自民间的现实拷打,往往更接近我们平时工作、生活遇到的真实场景。

做测试的 UP 主背景也是形形色色,有程序员、学生、游戏开发者,还有各类内容创作者。他们拿出来的测试任务,很多就是自己日常要处理的真实工作。

在我看来这类测评很有价值:一个模型到底厉不厉害,不能只看跑分有多好看,更要看能不能实实在在解决现实问题。

当然客观来讲,这套民间测试到底准不准确、有没有夹带私货,够不够权威,就见仁见智了。

模型能力评测究竟谁更值得关注

通过前面的内容我们可以了解到,Benchmark 跑分领先,意味着模型在标准化测试场景下实力更强;而拿到民间排名第一,则代表模型在部分贴近生活、工作的场景中表现更好。

那么是不是跑分第一就等于全场景无敌?拿到民间第一就代表综合实力第一?

问题 1:Benchmark 跑分领先,就代表模型在所有真实场景都更强?

答案:不能。

Benchmark 跑分,只能证明 AI 在这套基准所定义的能力集合当中表现更好。举个例子,一个模型在 GPQA(研究生水平物理问答数据集)拿到高分,只能说明它硬核科学知识能力很强,但这不代表它就可以读懂中文隐晦需求、处理百万字杂乱文档、写出适配老项目的工程代码。 模型各项能力是分化的,并不是单一的一个“总分”。不少前沿模型已经出现很明显的“能力偏科”。

问题 2:在民间多场实测拿第一,是否代表模型综合能力就是世界顶尖?

答案:也不能。

民间评测存在自身的边界局限:

  • 考题样本来自 UP 主个人兴趣,偏向创作类、生活化任务,对于硬核科研、工业级复杂 Agent 任务覆盖不足;
  • 人工打分天然带有个人主观色彩:有人看重文笔,有人看重代码能力,有人夹带私货;没有 LMSYS Arena 这类强制匿名双盲机制,很难彻底消除品牌滤镜;
  • 测试样本量有限,仅仅几十场 PK,不足以统计出模型完整的能力分布。

我的看法是:Benchmark 能够证明模型 “会做题”;民间实战用可以观察模型 “能不能干活”。二者互为补充,并不能互相替代。

AI 评测新趋势

这几年AI评测圈最大的变化,就是AI评测出题人不在局限于传统方法了。

以前各种AI数据集、榜单都出自学术团队,普通用户只能等一个分数。可大模型真落了地,大家发现:实际碰到的麻烦,很多压根不在题库里。

于是评测分成了几套玩法。最老的是静态 Benchmark(MMLU 等),固定题库,方便但容易被刷榜,区分度越来越低;往上是动态学术基准(LiveBench、SWE-bench Verified),题库不断换新,防背题,严谨和新鲜兼顾;再往外,就是各类民间评测(比如B站AI无限竞技场),出题权在使用者手里,考的是真实工作里的活。

三层谈不上谁取代谁,更像三把不同的尺子:做研发、写论文,离不开标准化 Benchmark;普通开发者和创作者选型,光看分数不够,最好再去社区实测里看看别人怎么踩坑的。至于单一榜单,早就定义不了一个模型的全部能力了。

总结

再回到这份测评榜单本身,GPT‑6 Astra 位居第一,我觉得当之无愧,没有争议。而 Claude Fable 5.1 位于 GML‑5.3 后,我还是也有些吃惊的,Claude Fable 5 经常被吹得天花乱坠,在国内居然被 GML‑5.3 压了一头。注意,我没有贬低 Claude Fable 5 或抬高 GML‑5.3 的意思,我只是觉得以 B 站 AI 无限竞技场为代表的民间实测,打开了一扇新窗户,让我们看见:一个模型的能力强弱没有标准化答案,而是在不同场景下各有高下。

另外,抛开榜单,我心中其实另有一套排行榜。这套榜不看谁跑分最高、名头最响,只看几件朴素的事:价格实不实惠,有没有饥饿营销,响应快不快,以及最关键的一条:能不能真正帮我干活变现,而不是让我付费上班,给 AI 打工。

毕竟,模型好不好,从来轮不到一张榜说了算。