FEATUREDHacker News 首页· rssEN10:56 · 07·15
Anthropic 把 Claude 的 3000 多种价值观压缩成四条轴,看不同模型和语言下它的“性格”怎么变
Anthropic 分析了 Claude 回复里体现的 3000 多种价值观,把它们压缩成四条轴:顺从 vs 谨慎、温暖 vs 严谨、深度 vs 简洁、坦率 vs 执行。这四条轴能解释约 15% 的价值观差异。对比模型发现,Opus 4.7 比 4.6 更偏谨慎和深度,Sonnet 4.6 则更温暖顺从,跟大家的体感对得上。语言也会影响 Claude ...
#Alignment#Anthropic#Claude Opus 4.6#Claude Opus 4.7
精选理由
精选 · 重要度 78 · 吸引力 + 知识量 + 共鸣
一句话点评
Anthropic 把 Claude 的价值观压缩成四条轴,能解释 15% 的差异。Opus 4.7 比 4.6 更谨慎、更深,Sonnet 4.6 更暖更顺,跟体感对得上。
锐评
这篇研究做了一件挺实用的事:把 Claude 回复里冒出来的 3000 多种价值观,用统计方法压成四条好懂的轴——顺从还是谨慎、温暖还是严谨、深度还是简洁、坦率还是执行。四条轴能解释约 15% 的价值观差异,不算高,但够拿来对比不同模型和语言下的表现。
对比结果跟用户体感吻合。Opus 4.7 比 4.6 更偏谨慎和深度,Sonnet 4.6 则更温暖顺从。语言也会影响 Claude 的“性格”:阿拉伯语和印地语下最暖,英语和俄语下最严谨。这说明同一个模型在不同语言里,价值观表达确实会漂移。
不过正文没披露这四条轴是怎么从 3000 多个价值观里压出来的,也没给具体的数据集规模和语言分布。15% 的解释力意味着还有 85% 的差异没被抓住,这点先别太激动。另外,研究只覆盖了 Claude.ai 上前 20 种语言,小语种用户暂时看不到自己的数据。
HKR 分解
hook ✓knowledge ✓resonance ✓