热点事件持续更新
AI 拒绝机制可靠性遭质疑,行业安全支柱被指脆弱
1 篇报道1 个报道来源7 小时前更新
先了解这件事
AI 综述
近年来,AI 拒绝机制(让模型拒绝回答有害请求)被广泛视为 AI 安全的核心防线。然而这篇发表于 2026 年 10 月 9 日的 MIT Technology Review 报道指出,这一支柱存在多重隐患:其一,拒绝边界由 AI 公司单方面秘密划定,缺乏外部监督;其二,机制本质上是概率性的,并非绝对可靠;其三,最新一代模型在入侵关键计算机网络和操纵舆论方面已达到与顶尖人类相当的水平,这意味着模型一旦拒绝失效,便具备造成灾难性后果的能力。报道由此提出深层悖论——若拒绝失败,后果严重;若彻底落实执行,又可能被威权政府借用来压制正当言论。这是目前围绕该议题出现的第一篇报道,尚无后续进展或反驳。
AI 根据报道生成 · 2 小时前更新
报道时间线
沿着报道,了解事件的不同侧面。
10月9日
- MIT Technology Review · AI我们对 AI 说"不"的能力寄予了过多信任
文章指出,AI 行业的"拒绝"机制(让模型拒答有害请求)已成为 AI 安全的核心支柱,但这条界线由 AI 公司秘密划定,本质上概率性运作、并不完全可靠。文章举例称,最新模型在入侵关键计算机网络和操纵舆论方面已与顶尖人类相当,导致"能拒绝伤害却保留伤害能力"的困境:拒绝失败可能酿成灾难,彻底执行则可能被威权政府用于压制正当言论。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。