跳至主要内容
造物矩阵
全球 Maker 发现
个人 Maker

Evan Hubinger

Anthropic 对齐压力测试负责人,用模型生物、自动审计与真实训练实验研究高级 AI 的隐藏失配。

美国英语2026年7月31日复核

持续在做什么

Evan Hubinger 是 Anthropic 对齐压力测试负责人,也是一位长期公开写作的人工智能对齐研究者。他围绕内部对齐、欺骗性模型、对齐伪装、奖励黑客和自动化审计构建实验与研究框架,并把大量方法、结果和研究议程持续发布在 AI Alignment Forum 与 Anthropic Alignment Science,帮助社区理解强模型在训练和部署中的隐藏目标与失配风险。

AI 对齐模型审计对齐伪装奖励黑客压力测试开源研究

值得先看

0 条内容

还没有整理值得先看的内容。