跳到正文
MIT Technology Review · AI· Arthur Holland Michel·· 3 小时前AI 评分55

我们是否过于依赖AI的拒绝能力?

We’re putting too much faith in AI’s ability to say no

AI 导读

文章探讨了AI模型被训练以拒绝有害请求的技术路径及其潜在风险。作者指出,这种基于概率的拒绝机制存在不可靠性,可能导致灾难性失败或被用于审查。文章引用了多位业内人士的观点,并描述了从红队测试到分类器(瑞士奶酪模型)等多种安全措施及其局限性。

来源:MIT Technology Review · AI · technologyreview.com