跳到正文
MIT Technology Review · AI· Arthur Holland Michel·· 23 小时前AI 评分36

我们是否过度信任 AI 说“不”的能力

We’re putting too much faith in AI’s ability to say no

AI 导读

MIT Technology Review 刊文讨论 AI 拒答机制:模型通过微调和分类器学会拒绝有害请求,但拒答本质是概率性的,仍可被越狱绕过。文章引用前 OpenAI 安全员工 Steven Adler、红队成员 Paul Röttger 等人的说法,指出拒答能力与模型本身能力不可分割,Anthropic 曾称某类分类器使聊天机器人算力成本增加 24%。

来源:MIT Technology Review · AI · technologyreview.com