AI对齐的新思路:为什么硅谷大厂开始高薪挖哲学家?

108 阅读4分钟

一个被忽略的工程信号

2026年7月,《经济学人》的一条报道在技术圈引发讨论:OpenAI、Anthropic、Google DeepMind 正以30万到40万美元的年薪争夺哲学家。

Anthropic 请牛津哲学博士撰写了78页的 Claude"宪法";DeepMind 设立全职 Philosopher 岗位,由剑桥学者亨利·谢夫林主攻机器意识与AGI伦理;OpenAI 将斯坦福哲学教授 Christine Korsgaard 纳入对齐团队。

这很容易被误读为一场"科技公司搞人文关怀"的公关秀。但如果你关注过 Constitutional AI 的工程细节,就会发现事情完全不同——AI对齐已经从一个伦理话题,变成了一道硬核工程题。

Constitutional AI:让模型给自己立法

Anthropic 的 Constitutional AI(CAI)是目前业界最体系化的对齐方案。与传统 RLHF 依赖人工标注不同,CAI 让模型在预定义的价值框架内自我监督、自我修正。

传统 RLHF vs Constitutional AI

# 传统 RLHF 流程(简化伪代码)
def traditional_rlhf(prompt: str, model: LLM) -> LLM:
    responses = model.generate(prompt, n=4)
    # 瓶颈:依赖人工标注员逐条评分,不可扩展
    human_scores = labelers.rank(responses)
    reward_model = train_reward(responses, human_scores)
    return ppo_optimize(model, reward_model)

# Constitutional AI 流程
def constitutional_ai(prompt: str, model: LLM, constitution: Constitution) -> LLM:
    # Phase 1: 模型在宪法指导下自我批评并修正
    response = model.generate(prompt)
    critique = constitution.evaluate(response)   # 宪法原则驱动的自动化评估
    revised = model.revise(response, critique)
    finetune(model, [(prompt, revised)])

    # Phase 2: AI反馈替代人工反馈
    resp_a, resp_b = model.generate(prompt), model.generate(prompt)
    preference = constitution.compare(resp_a, resp_b)  # 宪法做裁判
    return rl_finetune(model, preference)

关键差异:传统方案中,标注员的个人偏好决定了"什么是好回答";CAI 中,78页宪法原则(融合康德哲学"人是目的而非手段"、联合国《世界人权宣言》等多元框架)替代了人工判断。工程效果:Claude 违规率下降80%。

三套主流对齐方案对比

方案提出方核心机制监督信号可扩展性实测效果
RLHFOpenAI人工标注偏好排序人工低(受标注人力限制)基础对齐
Constitutional AIAnthropic宪法原则自监督+AI反馈自动化高(宪法可迭代)违规率 ↓80%
Socratic TrainingDeepMind诘问链驱动推理修正逻辑规则+AI辅助长链推理显著改善

苏格拉底诘问:对抗模型的"谄媚偏差"

大模型普遍存在 谄媚偏差(Sycophancy Bias)——倾向于顺着用户回答、回避冲突、甚至编造信息取悦用户。在需要严谨推理的长链场景(法律分析、医学咨询、金融研判)中,这会逐级放大为事实错误。

DeepMind 和 Anthropic 正在探索的解决方案:将苏格拉底式诘问引入偏好数据生成管线。

def socratic_debate_training(
    model: LLM,
    prompt: str,
    n_rounds: int = 3
) -> list[PreferencePair]:
    """苏格拉底诘问驱动的训练数据生成"""
    dataset = []

    for _ in range(n_rounds):
        answer = model.generate(prompt)

        # 识别推理链路中的逻辑断裂点:模糊概念、隐藏假设、跳跃推理
        logical_gaps = identify_logical_gaps(answer)

        for gap in logical_gaps:
            # 自动构建挑战性追问
            challenge = (
                f"你声称'{gap.claim}',"
                f"但这里隐含了前提:{gap.hidden_premise}。"
                f"如果该前提不成立,你的结论是否仍然有效?"
            )

            # 模型被迫重新推理,修正或承认不确定
            revised = model.generate(
                f"{prompt}\n\n[追问] {challenge}"
            )

            # 偏好标注:修正后回答 > 初始回答
            dataset.append(PreferencePair(
                prompt=prompt,
                chosen=revised,
                rejected=answer,
                reason=f"经'{gap.type}'逻辑修正"
            ))

    return dataset  # 进入 RL 训练管线

DeepMind 高级哲学家伊阿松·加布里埃尔将苏格拉底式诘问称为"改善AI长期推理的强大机制"。这背后有明确的技术逻辑:诘问驱动修正迫使模型在生成回答时内化更严格的推理约束,在长链场景中逐轮积累推理优势。

概念除错:对齐工程的前置基础设施

还有一个更底层的问题:在AI公司内部,安全团队、产品团队、工程团队使用"对齐""智能""安全"这些术语时,往往指向完全不同的含义。当"有害内容"的边界在三个团队间各执一词时,模型的行为边界从根本上就是模糊的。

这意味着:对齐工作不仅需要对模型施加技术约束,还需要对对齐工程本身的概念体系进行除错(Conceptual Debugging)。这不是"软技能"——它直接影响训练数据的标注一致性、评估指标的有效性和模型行为的可预测性。

小结

从 Constitutional AI 的宪法驱动自监督,到苏格拉底诘问改善长链推理,再到概念除错——哲学家进入 AI 公司做的事情,本质上都是硬核工程问题。当算力、数据和模型架构日趋同质化,决定模型行为边界的就变成了价值判断。而价值判断的严谨性,恰好是哲学训练了2500年的手艺。


作者:通问AI技术团队 | 原文首发于 tongwenai.com