Simon Willison·· 5 天前AI 评分62
Anthropic Frontier Red Team 报告:GLM-5.3 与 Claude Mythos Preview 在二进制利用基准上的表现
Quoting Anthropic Frontier Red Team
AI 导读
Anthropic Frontier Red Team 在一份报告中评估了多个模型在 100 项随机选取的内部二进制利用基准任务上的表现。GLM-5.3 在 4% 的试验中实现了完整的控制流劫持,Claude Mythos Preview 则为 6%。
来源:Simon Willison · simonwillison.net