我们太相信 AI 说“不”的能力了
MIT Technology Review 文章指出,AI 的拒绝机制正成为 AI 安全承重墙,但这一机制并不天然可靠。早期 OpenAI 模型会“什么都往外说”,如今模型虽被训练拒绝大量有害提示,仍会出现失败并带来暴力后果。
MIT Technology Review 文章指出,AI 的拒绝机制正成为 AI 安全承重墙,但这一机制并不天然可靠。早期 OpenAI 模型会“什么都往外说”,如今模型虽被训练拒绝大量有害提示,仍会出现失败并带来暴力后果。
Import AI 第 469 期介绍新基准 DiG-bench,包含 70 款规则与目标均隐藏的文本游戏,部分公开可玩,顶级模型 Opus 5 与 Fable 5 搭配 Claude Code 表现最佳,但仍远逊于人类。