微软与剑桥证实:不是逼近而是碾压!4541个样本揭示AI团队创造力远超人类

58 阅读11分钟

长久以来,无论人工智能在围棋棋盘上多么无解,或者在医学考试中拿到了多么夸张的高分,人类总有一道自认牢不可破的心理防线:创造力。

我们在潜意识里认定,机器只能做穷举和缝合,而那种灵光一闪、兼具新奇与实用的真正创意,是碳基生物独有的特权。

但当多个 AI 大模型组成一个团队,开始相互讨论、反驳并迭代想法时,这道防线不仅被击穿,而且被碾压了。

ArXiv URL:arxiv.org/abs/2605.17…

微软亚洲研究院、剑桥大学和浙江大学等机构的最新研究证实:多智能体(Multi-agent)AI 团队在创造力上,不仅轻松超越了单个大模型,更是以压倒性优势击败了真实的人类团队。

基于对 4541 个 AI 创意和 341 个真实人类团队创意的盲评比对,AI 团队在整体创造力得分上将人类团队远远甩在身后,统计学效应量(Cohen's dd)高达 1.50。

更关键的是,研究人员破解了这种优势的来源:AI 团队通过在不同语义概念间进行高效率的"大跨度跳跃"来产生创意;而人类团队则更依赖维持对话的顺畅和人际连贯。

这不再是一个停留于直觉层面的哲学探讨。本文通过把虚无缥缈的对话变成可计算的几何轨迹,首次将多智能体的创造过程彻底白盒化。

01 撕开创意壁垒:从单兵作战到群体智能的跃升

在测试大模型的创造力时,过去的研究往往局限于"发散性思维"测试。比如给出一个回形针,让 AI 尽可能多地说出它的非传统用途。但在真实的商业和社会环境中,单纯的脑洞大开毫无价值。

真正的创意,是在复杂的约束条件下找到破局点。为了逼近真实场景,研究人员设计了六个涵盖气候变化、教育不平等、供应链管理等领域的复杂现实问题。

他们将人类分为三人或六人的小组进行讨论,同时用 GPT-4.1 和 o3 等顶级大模型构建了同等规模的虚拟 AI 团队。所有的输出结果被隐去来源,交由独立的评委进行双盲打分。

数据揭示了一个极其冷酷的现实。

从整体分布来看,代表 AI 团队的得分箱型图在创造力维度上发生了显著的向右偏移。这种优势不是局部的微小胜利,而是一种断层式的领先。

AI与人类团队在创造力、新颖度和有用性上的得分分布对比

即使我们将目光聚焦在"最顶尖的创意"上,人类依然无法守住阵地。统计显示,在排名前 5% 的绝对头部想法中,AI 团队的平均得分为 0.53,而人类团队最聪明的 5% 创意平均分只有 0.37。

这意味着在需要密集脑力劳动的应用问题解决场景下,由顶级大模型组成的协作网络,不仅兜住了下限,连过去我们认为人类最具优势的"上限",也被彻底改写了。

02 拆解创造力公式:用极致的新颖度打破平庸

要理解 AI 为什么能赢,首先需要明确学术界究竟是如何定义"创造力"的。

创造力从来不是单纯的荒诞或猎奇。研究人员采用了该领域最经典的共识评估技术(Consensual Assessment Technique),将创造力严格拆解为两个维度的乘积:

Creativity=Novelty×UsefulnessCreativity = Novelty \times Usefulness

在这个评估体系中,NoveltyNovelty(新颖度)代表想法的独特程度和跳脱常规的幅度,而 UsefulnessUsefulness(有用性)则衡量这个想法在现实物理和商业逻辑中是否具备可行性。

一个极度新颖但无法落地的想法只能得低分,反之亦然。

数据拆解后,AI 团队的制胜机制浮出水面:它们并没有在"有用性"上与人类拉开太大差距,而是依靠爆表的新颖度取得了决定性胜利。

新颖度与有用性的二维分布散点图

上图的散点分布清晰地展示了这种不对称竞争。红色的 AI 节点大量聚集在象限的右上方,它们能够在保证方案不脱离现实约束(有用性保持相当水平)的前提下,组合出人类评委意想不到的新奇视角(新颖度激增)。

人类在群体讨论时,为了照顾彼此的颜面或受限于有限的知识储备,往往会不自觉地向安全、可落地的保守方案靠拢。

而无视社交压力的多智能体系统,则能在保持逻辑自洽的同时,毫无负担地探索思维空间的边缘。

03 探寻思维黑盒:将对话转化为高维空间的几何漫游

知道 AI 更具有创造力只解决了一半的问题,系统设计师更关心的是:在得出那个惊艳结论之前的讨论过程中,AI 们到底经历了怎样的互动?

传统的文本分析往往只能抓取关键词或者统计对话轮数,这种颗粒度完全无法还原"灵感"的产生轨迹。本文作者采用了一种极具工程美感的方法:语义轨迹分析(Semantic Trajectory Analysis)。

他们将团队讨论的每一句话,通过神经网络嵌入技术转化为高维空间中的一个向量坐标。随着对话一轮轮推进,这些坐标连成了一条思维的"飞行轨迹"。

在这个几何空间里,玄学的对话变成了可精确测量的数字。研究人员重点关注了轨迹的几个特征:

  • 它跨越的范围有多广(全局连贯性是高还是低)?

  • 它每一步跳跃的步子有多大(语义扩展范围)?

  • 它有没有绕远路(路径长度)?

这种将连续对话降维投射为可观测路线的方法,就像是给隐秘的群体思考过程装上了高精度的轨迹雷达。

只有通过这种空间透视,我们才能真正看清人类和机器在思考习惯上的根本分歧。

04 探索与连贯的对立:人类与机器的路线分歧

当所有团队的思考轨迹被绘制出来后,一个反直觉的发现出现了:产生绝妙创意的共同前提,是让对话"跑题"。

无论是人类还是 AI 团队,数据都指向了一个共识:全局连贯性(Global Coherence)越低,创造力得分反而越高。

这意味着,死死咬住一个初始概念反复打磨,往往只能产出平庸的废话;只有大开大合、让讨论的话题在广阔领域中游走,才能撞出火花。

但在"如何跑题"这件事上,两者的策略截然不同。

AI与人类团队在语义轨迹特征上的系数对比

如上图的回归系数所示,AI 团队的创意爆发严重依赖于"高效探索"。它们喜欢巨大的语义扩展(Semantic Spread)和极短的路径长度。

比如在讨论塑料垃圾时,AI 团队能前一秒讨论经济补贴,下一秒直接跃迁到区块链追踪,紧接着切入生物科技改造细菌。它们不需要铺垫,直接在概念的孤岛间进行精准的瞬移。

相反,人类团队则高度依赖局部连贯性(Local Coherence)和平滑的对话流。人类即使要跳跃思维,也需要通过"我顺着你的意思补充一点"这样的润滑剂来过渡。

为什么这一步的发现至关重要?因为它揭示了我们过去在设计 AI 团队时常常犯的错误:试图让多智能体去模仿人类流畅、客气的圆桌会议。

实际上,AI 根本不需要人类那套用来维持社交氛围的平滑过渡。让它们进行高频、突兀、甚至不留情面的跨界碰撞,才是激发大模型创造力的正解。

05 结构重塑表现:给AI团队定规矩的代价

既然对话的过程能被量化,那我们能否通过改变讨论的"规则",来强行调整这些思维轨迹?

本文作者发现,讨论结构(Discussion Structure)是控制大模型表现的一个极其强大的设计杠杆。他们测试了让智能体各自独立发言再汇总的结构,也测试了让智能体互相反驳、迭代修改的交互结构。

结果表明,不同的交互结构直接决定了创造力的走向,并且在很大程度上导致了新颖度与有用性的此消彼长。

不同大模型在不同讨论结构下的表现差异(支架悖论)

更有趣的是,研究人员发现了不同代际模型之间的"支架悖论"(Scaffolding Paradox)。

对于 GPT-4.1 这样的标准大语言模型,强迫它们进行多轮迭代讨论(相当于给它们搭建思维脚手架),能让创造力得分暴涨 37.4%。

但当我们换用 OpenAI 最新的推理模型 o3-high 时,这种外部的讨论框架几乎失效了——创造力只提升了微不足道的 4.0%。

这背后的逻辑非常清晰:具备深度隐式推理能力的新一代模型,在输出第一个词之前,已经在内部完成了海量的自我辩论和轨迹漫游。

外部的"多智能体发言协议",反而变成了一种冗余的限制。

06 人物设定与团队规模的反直觉真相

在目前流行的 AI 智能体开发教程中,有两个几乎被奉为圭臬的经验法则:第一,要给每个 Agent 赋予不同的人物设定(比如一个是黑客,一个是投资人);第二,三个臭皮匠顶个诸葛亮,智能体越多越好。

但这项涵盖近 5000 个样本的研究,用冷冰冰的数据给这两个经验泼了冷水。

首先,设定不同的人物角色(Persona)并不能提高整体创造力得分。虽然赋予不同的专业身份确实让它们产出了更有逻辑、落地性更强的方案(有用性上升),但这却以牺牲思维发散性为代价(新颖度显著下降)。

最终一抵消,整体创造力并没有实现跃升。

其次,人多并不意味着力量大。当团队规模从 3 个智能体增加到 6 个时,创造力非但没有进步,反而出现了轻微的下降。

这和组织心理学中经典的"过程损耗"(Process Loss)效应如出一辙。当加入过多的节点时,大模型们不得不花费大量的 Token 去综合别人的冗长发言,导致对话迅速陷入对局部细节的繁琐纠缠,反而丧失了在大跨度语义空间中轻盈跳跃的能力。

07 告别盲目试错:开启可计算的创意工程

这项来自顶尖机构的大规模实验,彻底刷新了我们对大模型边界的认知。它证明了创造力并非不可解析的玄学,而是可以通过语义空间中的几何轨迹被精确诊断、甚至主动优化的工程问题。

但这篇论文的价值边界同样清晰。它极其适合从事多智能体框架开发(如 AutoGen、MetaGPT)的系统架构师和产品经理关注。

通过这套轨迹评估体系,我们终于可以告别"换个提示词试试"的盲目试错阶段,用量化指标来判断你的 AI 团队是不是陷入了思维死胡同。

然而,我们必须认识到,这项研究比较的是"纯粹的 AI 团队"和"纯粹的人类团队"。在真实的商业与科学前沿,下一个更有价值的问题将不再是谁碾压了谁,而是当掌握默会知识、具备物理直觉的人类,与能够进行高频跨界跳跃的多智能体系统深度融合时,这种人机协同的网络,又会将创造力的天花板推向怎样的高度。