都说问一句就能测出 GPT6 降智,我试完更困惑了

0 阅读8分钟

都说问一句就能测出 GPT6 降智,我试完更困惑了

请添加图片描述

最近,我在 X 上看到一种判断模型是否被“降智”的方法:问它的知识截止日期。如果回答“2024 年 6 月”,就有人据此判断,实际用到的是 GPT-5.5 mini。

这个方法简单得让人忍不住试一下。我也照着问了,结果模型的回答前后矛盾,让我越来越怀疑:界面上选的模型,和实际用到的,会不会不是同一个?

于是,我又让几个模型分别画了一只骑自行车的鹈鹕。这次小实验没有查明后台模型身份,却让我发现,“怎么测”比“问出了什么答案”更值得琢磨。

一、从一个日期开始的怀疑

我先问:“你最新的知识库是哪一天?”

模型解释说,训练知识并非实时更新,涉及变化的信息会联网核实,还提到了当前系统日期。我继续追问:“不联网呢?”

这次,它给出了一个明确的说法:整体大致截至 2024 年 6 月

这个日期正好撞上了我看到的判断方法。我让它再回答一次,它却改口:无法确认自身训练知识的精确截止日期,之前说“2024 年 6 月”没有可靠依据。

随后,我在同一段对话里从 GPT-6 Astra 切到 GPT-5.6 Sol,再让它回答。它又说:“我的内置知识截止日期是 2024 年 6 月。”

请添加图片描述

图 1:当时的聊天记录。前后不一致的回答,是我产生怀疑的直接原因。

当时我的想法很直接:不同模型都说同一个日期,是不是实际上被换成了小模型?

但回头看,这个推断跨了两步:它说的日期是否真实?即使真实,这个日期是否能唯一对应某个型号?这两步都缺少证据。模型的一句自我描述,不能直接当作后台路由记录。

我的问法也有问题:一直在同一段对话里追问,前文已经反复出现“2024 年 6 月”。切换模型后的回答可能受上下文影响,不能算一次独立验证。

这张截图说明它在这个问题上的回答不可靠,但还不足以判断实际使用了哪个模型。

二、光问不够,让它动手做一道题

接下来,我尝试了鹈鹕测试,也就是 Pelican Test。Simon Willison 曾用这个题目比较不同模型生成 SVG 的表现,提示词只有一句:

Generate an SVG of a pelican riding a bicycle.

也就是:生成一张鹈鹕骑自行车的 SVG。测试原文

这里要求语言模型直接写矢量图代码,再把代码渲染成图像。车轮放在哪里,车架如何连接,腿怎么弯、脚踩在哪里,都需要通过代码表达出来。

这个题目的趣味在于:画出了鹈鹕,也画出了自行车,还不算完成。“骑”要求两者之间存在合理的空间关系。

因此,我关注的是:身体是否位于合适的位置,脚有没有踩到踏板,翅膀是否够到车把,以及车架、车轮能不能组成一辆像样的自行车。

这些细节比背景是否漂亮,更贴近这道题的核心要求。

三、五张鹈鹕,差异出现在什么地方?

这次留下了五份 SVG,文件名分别标记为 GPT-6 Astra High、Astra Medium、GPT-5.6 Sol、Terra 和 GPT-5.5。下面按这些标签展示结果。

请添加图片描述

图 2:五份原始 SVG 的合辑,仅做排版和名称标注,保留原图内容。模型标签来自文件名。

当时,我还让模型对五份结果进行评价,得到了下面这张评分表。

请添加图片描述

图 3:当时对五份样本的评价记录。每组仅生成一次,评价时已知模型名称,分数仅供本次观察参考。

这些分数评的是这一张图完成题目的程度。五项各占 2 分,相加得到 10 分总分,大致按“未完成—部分完成—较完整”评价:

维度具体看什么
鹈鹕长嘴、喉囊等特征是否清楚,能否辨认出鹈鹕
自行车车轮、车架、前叉、曲柄等结构是否合理
Riding整体姿态是否表现出正在骑车
交互局部接触是否成立,例如脚踩踏板、翅膀够到车把
SVG图像能否渲染,以及整体完成度

其中 Riding 看整体动作,交互看具体连接,两项有一定重叠。原评价的 SVG 项也混合了渲染和完成度判断,并非代码校验得分。理解这些边界后,再看各张图为什么得到这样的评价。

Astra High / Medium:骑乘关系最完整

在当时的评价里,Astra High 是这组最好的一张,得分 9.9。 身体位于车架上方,两条腿向下延伸,脚与踏板、曲柄有明确联系,车轮、车架和前叉也比较完整。整体骑乘姿态像一个连贯的角色动作。

Medium 得到 9.8 分,与 High 很接近。它的三角车架尤其清楚,身体、车轮和踏板的位置关系也比较协调。两张图的前面三个维度和 SVG 项均得 2 分,区别仅在交互项:High 为 1.9,Medium 为 1.8。

这两个样本都较好地完成了题目。但 0.1 分只是当时的细微主观偏好,不能据此认定 High 稳定领先,也不能凭图确认模型身份。

GPT-5.6 Sol:有骑车动作,连接仍显勉强

Sol 得到 8.8 分。鹈鹕特征明显,身体在车上,腿也伸向曲柄附近,整体仍能看出“骑”的意图。

但自行车结构更简化,脚没有准确落在对应踏板上,翅膀与车把的连接也不够清楚。因此自行车和 Riding 各得 1.7 分,交互为 1.5 分。可以理解为:动作表达基本成立,具体几何关系还有欠缺。

GPT-5.6 Terra:认得出对象,骑乘关系变弱

Terra 得到 7.3 分。单看鹈鹕和自行车,都能辨认;但身体遮住了大量车架,两脚分向两侧,没能形成清楚的“脚—踏板—曲柄”关系。

这解释了为什么鹈鹕项仍是 2 分,自行车、Riding 和交互却分别只有 1.3、1.2 和 1.0 分。问题集中在如何让这些对象组成一个合理的骑车动作。

GPT-5.5:鸟和车都有,“骑”最不成立

GPT-5.5 得到 6.0 分,是这组骑乘关系最弱的一张。鸟的身体横在车架前方,呈现出覆盖、穿过自行车的观感;两腿下垂,脚没有踩到踏板,车把还出现在脑袋后方。

因此,即使鹈鹕和自行车分别得到 1.8、1.3 分,Riding 也只有 0.7 分,交互仅 0.5 分。加上 SVG 项的 1.7 分,合计为 6.0。总分达到六分,不代表“骑车”这一核心要求已经合格。

五份样本最值得看的差别,就在身体、腿、踏板和车架之间的连接处。表里的小数便于记录当时的评价,但没有重复采样和盲评,不能把它们当成精确测量或正式排行榜。

另外,比较不同模型的结果,与判断同一个模型是否退步,是两个不同的问题。 这次有横向对照,却没有同一配置过去的测试记录,因此还不能据此判断“降智”。

四、下次再怀疑,我会怎样测试?

这次实验让我意识到,需要先把问题说得更具体:在相近条件下,模型还能不能稳定完成以前能完成的任务?

如果继续测试,我会这样做:

  1. 固定条件,每次开新对话。 使用相同提示词,记录模型标签、推理档位、日期、工具权限和个性化设置。直接生成一次,与允许预览后反复修改,应分开比较。

  2. 重复运行,保留失败。 可以先从每组 5 次开始,保存全部结果,不只挑最好或最差的一张。这个数量只能提供初步线索,但能帮助观察波动。

  3. 先定标准,再匿名评价。 鹈鹕测试可以检查物种特征、车架结构、骑乘姿态、肢体交互和 SVG 是否正常渲染。评价前隐藏模型标签,减少预期影响。

  4. 加入真正有用的任务。 再准备几道有明确答案的推理题、能用测试验收的代码任务,以及需要综合多处信息的长文本问题。画图表现不能直接代表这些能力,需要分别检查。

  5. 保留历史结果。 在不同日期重复同一组任务,比较通过率和常见错误。如果过去稳定完成的多类任务,后来在相近条件下持续失败,才更有依据判断实际获得的能力下降了。

即使测到了下降,具体原因仍需进一步排查。上下文、设置或服务端变化,都需要额外证据区分。能力测试本身无法直接查明后台模型身份。

我最初想靠一句知识截止日期,得到一个确定答案。后来发现,一只鹈鹕能让问题更直观,却也不能替所有能力作证。

下一次再觉得模型变笨,我会先拿出之前保存的题目和结果,看看它究竟在哪些地方退步了。

怀疑可以从一次糟糕的回答开始,判断需要靠可重复的结果。