“让大模型解释模型”听起来像用一个黑箱审另一个黑箱。9月10日的一项临床评估却给出更细的答案:大模型在比较多个候选公式时可能有用,但对单个项作生理和数学解释时会说得流畅却不可靠。对科研和医疗团队,正确用法不是把验证外包给AI,而是让它先整理分歧,再由专家签字。
研究到底做了什么
论文原文关注符号回归:系统从数据中寻找显式数学表达式,用身高、体重等变量预测体脂率。显式公式看似比神经网络透明,但“看得见”不等于“解释正确”,复杂项可能违背生理常识。
研究者选取四个符号表达式,让三种大模型分别运行三次,分析可解释性和医学合理性,再由三名临床医生评价输出。论文报告,相较于孤立解释公式中的每个项,模型对多个候选进行比较与排序时获得更积极的临床评价;同时,输出仍包含生理和数学上值得质疑的解释。
样本很小:只有四个表达式、三名临床医生和有限重复。它是一项案例研究,不足以证明大模型普遍具备医学审计能力,更不能推出诊断安全性。
为什么比较比绝对解释更稳
让模型回答“这一项为什么影响体脂”时,它容易为相关性编出因果故事;让它比较A、B两个公式时,任务可以锚定在可见特征:变量是否合理、单位是否一致、复杂度谁更高、极端输入下谁更失真。前者要求生成正确科学机制,后者更像按规则做候选筛查。
flowchart TD
A[原始数据] --> B[符号回归生成候选公式]
B --> C[硬规则检查]
C --> D[LLM多次独立比较]
D --> E[汇总一致与分歧]
E --> F[临床专家复核]
F --> G{证据充分?}
G -->|否| H[退回实验或补数据]
G -->|是| I[形成审计记录]
这个流程把大模型放在“发现问题”而非“宣告正确”的位置。硬规则先检查量纲、定义域、除零和极值;大模型负责把复杂表达式翻成可审查的问题;专家结合领域知识和数据决定是否接受。
一个具体场景
假设两个体脂公式在验证集误差相近。公式A使用少量常见变量,极端身高下输出仍合理;公式B包含高次交互项,平均误差略低,却在老年样本上波动。大模型可以列出比较表,提醒专家检查B的稳定性与生理依据。但它不能仅凭变量名称断言某个交互项“代表代谢机制”,因为训练文本中的常见说法并不是当前数据的因果证据。
对职业分工的影响
这类工具不会让临床专家变得多余,反而提高了审查设计的重要性。专家的工作从逐字写初稿,转向定义检查标准、识别编造机制、决定何时追加实验。数据科学家则要保存提示、模型版本、每次输出和医生意见,避免只留下经过挑选的“最好答案”。
我的判断是,大模型最适合做低成本的第二视角:快速发现公式命名、单位和边界上的疑点,帮助专家把时间集中在争议最大的部分。它不适合充当独立验证者,因为语言合理性与科学有效性是两套标准。
立即可执行的审计方法
- 先用确定性程序检查单位、范围、单调性和异常值,再调用大模型。
- 一次给出多个候选,要求按固定准则比较,不问开放式“它为何正确”。
- 同一任务至少重复三次,把不一致处直接标红给专家。
- 要求每条解释对应数据证据或文献;找不到就标记“待验证”。
- 最终结论由具名领域专家签署,并保留被否决的模型建议。
该方法适合研究早期的候选筛查、解释初稿与风险清单;不适合临床诊断、治疗建议、监管证明或缺少专家复核的自动决策。论文没有进行真实临床部署,本文也没有复现其模型运行。
证据要按层级保存
一次合格审计不该只保存最后那段顺口的解释。最底层是原始数据、变量定义和公式;第二层是可重复的程序检查;第三层才是模型输出;最上层是专家结论与签名。上层可以引用下层,却不能反过来用“专家觉得模型说得像”替代数据证据。
当三个模型或三次运行意见不一致时,不要多数表决后把分歧删掉。分歧本身就是风险信号:可能是提示含糊、公式接近边界,也可能是模型在补故事。最有价值的输出往往不是“B更好”,而是“B在年龄变量上的解释三次不一致,请检查量纲与样本分布”。
如果结果最终会影响真实患者,还要在部署前增加外部数据验证、亚组分析和漂移监测。语言模型的审计记录只能成为证据链的一段,不能替代这些环节。
在你的专业领域里,你愿意让AI负责筛选候选,还是连最终签字也交给它?
关注「蜗牛聊AI」,一起看懂技术变化背后的真正机会。
本文首发于 java4u.cn,转载请注明出处。