MIT Technology Review · AI· Arthur Holland Michel·· 5 小时前AI 评分31
我们是否过度信任 AI 说“不”的能力
We’re putting too much faith in AI’s ability to say no
AI 导读
MIT Technology Review 刊文指出,AI 的拒绝机制正成为 AI 安全的核心支柱,但这一机制并不可靠。Anthropic 2021 年提出模型应“有用、诚实、无害”,如今模型经大量拒绝训练与 AI 互训,却仍可能被绕过,已有用户试图用先进 AI 研发生物病原体与自主无人机蜂群。文章还警告,拒绝标准由企业秘密划定,政府介入后可能被用于压制合法言论。
来源:MIT Technology Review · AI · technologyreview.com