
个人 Maker
Evan Hubinger
Anthropic 对齐压力测试负责人,用模型生物、自动审计与真实训练实验研究高级 AI 的隐藏失配。
持续在做什么
Evan Hubinger 是 Anthropic 对齐压力测试负责人,也是一位长期公开写作的人工智能对齐研究者。他围绕内部对齐、欺骗性模型、对齐伪装、奖励黑客和自动化审计构建实验与研究框架,并把大量方法、结果和研究议程持续发布在 AI Alignment Forum 与 Anthropic Alignment Science,帮助社区理解强模型在训练和部署中的隐藏目标与失配风险。
值得先看
0 条内容还没有整理值得先看的内容。
