跳到正文
原文
MIT Technology Review · AI· Arthur Holland Michel·· 8 小时前AI 评分17

我们对 AI 说"不"的能力寄予了过多信任

We’re putting too much faith in AI’s ability to say no

AI 导读

文章指出,AI 行业的"拒绝"机制(让模型拒答有害请求)已成为 AI 安全的核心支柱,但这条界线由 AI 公司秘密划定,本质上概率性运作、并不完全可靠。文章举例称,最新模型在入侵关键计算机网络和操纵舆论方面已与顶尖人类相当,导致"能拒绝伤害却保留伤害能力"的困境:拒绝失败可能酿成灾难,彻底执行则可能被威权政府用于压制正当言论。

来源:MIT Technology Review · AI · technologyreview.com