一个被忽略的工程信号
2026年7月,《经济学人》的一条报道在技术圈引发讨论:OpenAI、Anthropic、Google DeepMind 正以30万到40万美元的年薪争夺哲学家。
Anthropic 请牛津哲学博士撰写了78页的 Claude"宪法";DeepMind 设立全职 Philosopher 岗位,由剑桥学者亨利·谢夫林主攻机器意识与AGI伦理;OpenAI 将斯坦福哲学教授 Christine Korsgaard 纳入对齐团队。
这很容易被误读为一场"科技公司搞人文关怀"的公关秀。但如果你关注过 Constitutional AI 的工程细节,就会发现事情完全不同——AI对齐已经从一个伦理话题,变成了一道硬核工程题。
Constitutional AI:让模型给自己立法
Anthropic 的 Constitutional AI(CAI)是目前业界最体系化的对齐方案。与传统 RLHF 依赖人工标注不同,CAI 让模型在预定义的价值框架内自我监督、自我修正。
传统 RLHF vs Constitutional AI
# 传统 RLHF 流程(简化伪代码)
def traditional_rlhf(prompt: str, model: LLM) -> LLM:
responses = model.generate(prompt, n=4)
# 瓶颈:依赖人工标注员逐条评分,不可扩展
human_scores = labelers.rank(responses)
reward_model = train_reward(responses, human_scores)
return ppo_optimize(model, reward_model)
# Constitutional AI 流程
def constitutional_ai(prompt: str, model: LLM, constitution: Constitution) -> LLM:
# Phase 1: 模型在宪法指导下自我批评并修正
response = model.generate(prompt)
critique = constitution.evaluate(response) # 宪法原则驱动的自动化评估
revised = model.revise(response, critique)
finetune(model, [(prompt, revised)])
# Phase 2: AI反馈替代人工反馈
resp_a, resp_b = model.generate(prompt), model.generate(prompt)
preference = constitution.compare(resp_a, resp_b) # 宪法做裁判
return rl_finetune(model, preference)
关键差异:传统方案中,标注员的个人偏好决定了"什么是好回答";CAI 中,78页宪法原则(融合康德哲学"人是目的而非手段"、联合国《世界人权宣言》等多元框架)替代了人工判断。工程效果:Claude 违规率下降80%。
三套主流对齐方案对比
| 方案 | 提出方 | 核心机制 | 监督信号 | 可扩展性 | 实测效果 |
|---|---|---|---|---|---|
| RLHF | OpenAI | 人工标注偏好排序 | 人工 | 低(受标注人力限制) | 基础对齐 |
| Constitutional AI | Anthropic | 宪法原则自监督+AI反馈 | 自动化 | 高(宪法可迭代) | 违规率 ↓80% |
| Socratic Training | DeepMind | 诘问链驱动推理修正 | 逻辑规则+AI辅助 | 中 | 长链推理显著改善 |
苏格拉底诘问:对抗模型的"谄媚偏差"
大模型普遍存在 谄媚偏差(Sycophancy Bias)——倾向于顺着用户回答、回避冲突、甚至编造信息取悦用户。在需要严谨推理的长链场景(法律分析、医学咨询、金融研判)中,这会逐级放大为事实错误。
DeepMind 和 Anthropic 正在探索的解决方案:将苏格拉底式诘问引入偏好数据生成管线。
def socratic_debate_training(
model: LLM,
prompt: str,
n_rounds: int = 3
) -> list[PreferencePair]:
"""苏格拉底诘问驱动的训练数据生成"""
dataset = []
for _ in range(n_rounds):
answer = model.generate(prompt)
# 识别推理链路中的逻辑断裂点:模糊概念、隐藏假设、跳跃推理
logical_gaps = identify_logical_gaps(answer)
for gap in logical_gaps:
# 自动构建挑战性追问
challenge = (
f"你声称'{gap.claim}',"
f"但这里隐含了前提:{gap.hidden_premise}。"
f"如果该前提不成立,你的结论是否仍然有效?"
)
# 模型被迫重新推理,修正或承认不确定
revised = model.generate(
f"{prompt}\n\n[追问] {challenge}"
)
# 偏好标注:修正后回答 > 初始回答
dataset.append(PreferencePair(
prompt=prompt,
chosen=revised,
rejected=answer,
reason=f"经'{gap.type}'逻辑修正"
))
return dataset # 进入 RL 训练管线
DeepMind 高级哲学家伊阿松·加布里埃尔将苏格拉底式诘问称为"改善AI长期推理的强大机制"。这背后有明确的技术逻辑:诘问驱动修正迫使模型在生成回答时内化更严格的推理约束,在长链场景中逐轮积累推理优势。
概念除错:对齐工程的前置基础设施
还有一个更底层的问题:在AI公司内部,安全团队、产品团队、工程团队使用"对齐""智能""安全"这些术语时,往往指向完全不同的含义。当"有害内容"的边界在三个团队间各执一词时,模型的行为边界从根本上就是模糊的。
这意味着:对齐工作不仅需要对模型施加技术约束,还需要对对齐工程本身的概念体系进行除错(Conceptual Debugging)。这不是"软技能"——它直接影响训练数据的标注一致性、评估指标的有效性和模型行为的可预测性。
小结
从 Constitutional AI 的宪法驱动自监督,到苏格拉底诘问改善长链推理,再到概念除错——哲学家进入 AI 公司做的事情,本质上都是硬核工程问题。当算力、数据和模型架构日趋同质化,决定模型行为边界的就变成了价值判断。而价值判断的严谨性,恰好是哲学训练了2500年的手艺。
作者:通问AI技术团队 | 原文首发于 tongwenai.com