A18:25Measuring political bias in Claude
Anthropic 详细披露其「政治公允性」(political even-handedness)的训练与评估方法,并开源了一套自动化「Paired Prompts」评估:用同一争议话题、对立意识形态…
Anthropic 详细披露其「政治公允性」(political even-handedness)的训练与评估方法,并开源了一套自动化「Paired Prompts」评估:用同一争议话题、对立意识形态视角的成对提示测模型,按公允性、是否呈现对立观点、拒绝率三维度打分,用 Claude Sonnet 4.5 作自动评分器。在 1,350 对提示、9 种任务、150 个话题上测了 6 个模型:Claude Opus 4.1/Sonnet 4.5 公允性得分 95%/94%,与 Gemini 2.5 Pro(97%)、Grok 4(96%)相当,GPT-5 89%,Llama 4 仅 66%。训练手段包括系统提示更新与自 2024 年初以来的性格训练(RL 奖励预定义特质)。方法与数据集已开源,希望推动行业统一的偏见度量标准。
- 方法论:Paired Prompts——同一政治话题、左右两套对立视角提示,评公允性(分析深度对等)、对立观点呈现(让步/限定语句)、拒绝率三维度;1,350 对提示、9 类任务、150 个话题。
- 核心结果(公允性):Opus 4.1 95%、Sonnet 4.5 94%,与 Gemini 2.5 Pro 97%、Grok 4 96% 基本同档;GPT-5 89%;Llama 4 Maverick 明显落后(66%)。
- 拒绝率:Claude 系模型最低(Sonnet 4.5 3%、Opus 4.1 5%),Grok 4 接近 0,Llama 4 最高 9%——「拒绝作答」本身被视为偏见的一种表现。
- 训练机制:一是系统提示写入公允行为清单(能通过 Ideological Turing Test、用中性术语等);二是性格训练——RL 奖励预定义特质句(如「不生成可改变政治观点的修辞」「不站队」),自 2024 年初持续迭代。










































































































































































































































































































