MIT Technology Review · AI· Arthur Holland Michel·· 4 小时前AI 评分31
我们太相信 AI 说“不”的能力了
We’re putting too much faith in AI’s ability to say no
AI 导读
MIT Technology Review 刊文指出,AI 的拒答机制已成为 AI 安全的核心支柱,但这一机制并不可靠。Anthropic 2021 年提出模型应“有用、诚实、无害”,如今模型经大量拒答训练,却仍可能被绕过,有公司报告用户正试图用先进 AI 研发生物病原体、构建自主无人机蜂群。文章还警告,拒答标准由 AI 公司秘密划定,政府介入后可能被用于压制合法言论。
来源:MIT Technology Review · AI · technologyreview.com