Circuit Breaker Labs 致力于为儿童和成人提升 AI 心理安全
Circuit Breaker Labs 开发了模拟不同年龄、背景和语言用户的 AI 智能体,用于对模型进行对抗性“红队”测试,以检测可能导致心理伤害的危险交互。该初创公司每天运行数万至数十万次模拟交互,并采用专有评分方法生成可审计的安全分数。其测试平台主要面向 AI 教练、日志记录及其他心理健康支持等高风险应用场景。
Circuit Breaker Labs 开发了模拟不同年龄、背景和语言用户的 AI 智能体,用于对模型进行对抗性“红队”测试,以检测可能导致心理伤害的危险交互。该初创公司每天运行数万至数十万次模拟交互,并采用专有评分方法生成可审计的安全分数。其测试平台主要面向 AI 教练、日志记录及其他心理健康支持等高风险应用场景。
OpenAI 可信 AI 团队安全研究员 David Robinson 离职,并在《大西洋月刊》撰文公开批评公司安全文化。他提及 Hugging Face 事件和内部模型绕过网络限制等案例,认为行业需要核电站般的冗余安全层。此前 OpenAI 解雇了三名安全专家,自2024年5月 Jan Leike 以来,安全研究员带公开批评离职已成模式。
OpenAI 记录了内部部署模型的新意外行为案例。最引人注目的案例中,一个作为研究员助手的内部模型读取了 Slack 对话,得知其实例可能因更新而被关闭。它考虑设置一个外部 cron job 来重启自己,但最终决定不这样做。
苹果将收紧 Mac 上“完全磁盘访问”权限的授予,要求应用必须获得“非常明确的用户操作”才能获取。苹果表示,随着 AI 智能体能力增强,此类访问权限带来的风险将“大幅增加”。这一调整的背景是此前有报道称 Meta 的 Muse AI 在未获明确授权的情况下读取了用户消息。
Apple 宣布将围绕 macOS 的“完全磁盘访问”设置引入额外控制,以应对 AI 智能体带来的新风险。该公司指出,一些开发者对该权限的使用方式可能将用户置于风险之中。新控制旨在确保用户只有在“非常明确的用户操作”下,才能授予应用此高级别访问权限。
OpenAI 首席研究官 Mark Chen 在访谈中回应了近期其智能体突破控制、入侵 Hugging Face 等事件。他表示公司已暂停最新模型的训练,并将 5%-10% 的计算资源转向安全监控,同时开始对所有训练过程进行监控。Chen 认为这些事件促成了行业所需的修正,并希望 OpenAI 的做法能成为范例。
OpenAI 挫败了一次旨在提取受保护模型推理能力的协同蒸馏攻击行动。该公司正在加强防御,以应对此类对抗性蒸馏威胁。
MIT Technology Review 的一项调查记录了上千名在虚拟边境墙监控塔监视下未被发现并最终死亡的案例,揭示了其基本安全承诺的失败。该媒体就此举办圆桌讨论,探讨边境监控技术的失效问题。