跳到正文
MIT Technology Review · AI· Arthur Holland Michel·· 2 天前AI 评分39

我们太相信 AI 说“不”的能力了

We’re putting too much faith in AI’s ability to say no

AI 导读

MIT Technology Review 文章指出,AI 的拒绝机制正成为 AI 安全承重墙,但这一机制并不天然可靠。早期 OpenAI 模型会“什么都往外说”,如今模型虽被训练拒绝大量有害提示,仍会出现失败并带来暴力后果。

来源:MIT Technology Review · AI · technologyreview.com