中国 AI 模型在敏感话题上遵循国家立场或拒绝回答
Aleph Alpha 的研究显示,中国 AI 模型在涉及天安门、台湾、新疆等 967 个敏感话题时,仅有 17% 至 41% 的回答被其系统评为“平衡”,其余则重复国家立场、回避或拒绝回答。在相同测试中,Claude Sonnet 5 和 Mistral Small 分别有 70% 和 92% 的回答是平衡的。这种倾向也体现在非政治性问题的回答中,并可能通过训练数据影响其他模型。
Aleph Alpha 的研究显示,中国 AI 模型在涉及天安门、台湾、新疆等 967 个敏感话题时,仅有 17% 至 41% 的回答被其系统评为“平衡”,其余则重复国家立场、回避或拒绝回答。在相同测试中,Claude Sonnet 5 和 Mistral Small 分别有 70% 和 92% 的回答是平衡的。这种倾向也体现在非政治性问题的回答中,并可能通过训练数据影响其他模型。
LEGO-Anything 方法使用编码智能体将单张照片转换为可执行的 Blender 程序来构建 3D 场景,并通过迭代运行和修订代码进行优化。在 LEGO-Bench 基准测试中,GPT-6 Astra 在室内和室外场景的重建准确率分别达到 53.4% 和 39.6%,但智能体在几何判断上仍接近随机水平。
Hugging Face 推出了 Open TTS Leaderboard,这是一个专注于开源和多语言文本转语音(TTS)及语音克隆模型的评测平台。它使用可扩展的客观指标(如 WER、CER、RTFx、TTFA 和 SIM)进行快速评估,以弥补依赖人工投票的竞技场式榜单在规模和一致性上的不足。
Anthropic Frontier Red Team 在一份报告中评估了多个模型在 100 项随机选取的内部二进制利用基准任务上的表现。GLM-5.3 在 4% 的试验中实现了完整的控制流劫持,Claude Mythos Preview 则为 6%。
DiG-bench 评测中,Opus 5 与 Fable 5(结合 Claude Code)总体表现最佳,仅在最高难度 Tier 7 上达到 0.2 的胜率。GPT-5.5、Kimi K3 在借助工具链时可攻克部分 Tier 6 任务,而 GLM-5.2 与 Gemini 3.1 Pro 则止步于 Tier 4。