Hugging Face Blog 介绍 ServiceNow CoreAI 的 AutoSynthData:为企业智能体生成训练数据
ServiceNow CoreAI 团队开发了 AutoSynthData 系统,用于自动生成企业智能体所需的训练数据。该系统通过分析目标模型的失败案例和更强“教师”模型的成功经验,识别能力差距并生成新的、可执行的任务。生成的每个任务都包含系统规范、用户提示词和验证器,旨在提供针对当前模型弱点的有效训练信号。
ServiceNow CoreAI 团队开发了 AutoSynthData 系统,用于自动生成企业智能体所需的训练数据。该系统通过分析目标模型的失败案例和更强“教师”模型的成功经验,识别能力差距并生成新的、可执行的任务。生成的每个任务都包含系统规范、用户提示词和验证器,旨在提供针对当前模型弱点的有效训练信号。
Google Research 提出了 Diffusion Controller 框架,将图像去噪过程重构为一个连续控制问题,以统一和简化对生成模型的引导。该框架包含一个轻量的‘转向阻尼器’网络,能在不修改核心模型的情况下控制图像生成。
Hugging Face 发布论文 ProvenanceGuard,这是一个针对基于 MCP 的 LLM 智能体的溯源感知事实性验证层,旨在解决跨源混淆问题。该方法在医疗智能体测试中,在 139 个应被阻止的声明中成功捕获了 138 个,并能在约 86% 的情况下识别出正确的来源。
NVIDIA 联合 Google DeepMind、EMBL-EBI 等全球研究机构,在 AlphaFold Database 中发布了超过 2800 种病毒的蛋白质复合物预测 3D 结构数据集。
微软在其开源框架 Physical AI Toolchain 中增加了面向机器人的推理卸载功能。研究表明,将物理 AI 推理从机器人板载 GPU 卸载到边缘或云端,能显著提升任务成功率、支持运行更大模型,并大幅延长电池续航时间。该工具集基于 Kubernetes,支持容器化部署和智能策略分发,并已提供针对 SO-101 和 UR10e 机器人的示例项目。
Microsoft Research 开源了逆合成预测模型 RetroChimera,其通过集成 R-SMILES 2 和 NeuralLoc 两个互补模型来提升预测质量。在盲测中,博士级化学家更青睐 RetroChimera 提出的单个反应预测。该模型已开源实现和权重,旨在加速新药和先进材料的研发。
Google Research 提出 Retrieve-for-Train 框架,通过离线强化学习将优化后的查询分解行为蒸馏至一个 53.9M 参数的扩散模型,从而在推理时绕过文本链式推理 token 的生成瓶颈。该方法使用 Gemma3-4B 和 Qwen3-4B 等开源模型进行微调,旨在实现满足集合层面属性(如多样性、互补性)的高效单次查询扩展。
Google Research 提出的 ToolGrad 框架采用“答案优先”范式,通过文本梯度迭代构建 API 工作流来高效生成高质量工具使用数据集。
Google DeepMind 发布了 AlphaGenome Atlas 平台,它包含对人类基因组中 90 亿个单核苷酸变异(所有可能的单字母变化)影响的预测。
推荐理由:原文介绍了 AlphaGenome Atlas 的功能、数据规模、可用入口和初步应用案例,读者可以据此判断它对基因组研究的潜在影响。
Google Research 评估了将基于数十万欧洲人群(UK Biobank)的多基因风险评分模型迁移至近 20 万日本人群(Biobank Japan)时的性能变化。
GigaPath-Flash 和 GigaTIME-Flash 以大幅提升的效率扩展了 GigaPath 和 GigaTIME 模型系列,使大规模病理学研究更易实现。GigaPath-Flash 采用 22M 参数的蒸馏 ViT-S 编码器,在保持性能的同时将推理计算成本降低约 50 倍。这些开源模型支持群体规模发现,帮助研究人员分析更大患者队列并进行重复实验。
伯克利 AI 研究团队扩展了 K-Search 框架,为其添加了 MLX 后端和一个结构化的 CUDA-to-MLX 翻译层,可将 NVIDIA GPU 上的内核优化知识迁移到 Apple Silicon。
伯克利 AI 研究团队提出 ABBEL 框架,通过将摘要视为信念状态并引入信念分级监督,来提升长程交互任务中的学习效率和性能。在 CollabBench 协作编码环境中,使用基于重构的信念分级函数将性能与全上下文模型的差距缩小了约 50%,训练步数减少了 50%。该框架还展示了在 Combination Lock 和多目标问答环境中减少内存使用或提升学习效率的潜力。
自适应并行推理让推理模型能自行决定何时分解并行化独立子任务、生成多少并发线程以及如何协调它们。现有方法如 Self-Consistency、Tree of Thoughts 和 GroupThink 的并行化决策均由外部框架强加,而非模型自适应选择。该方法旨在解决序列推理因探索路径积累导致的上下文窗口超限、性能下降和延迟增长问题。
GRASP 是一种基于梯度的规划器,通过虚拟状态展开、状态迭代随机化和梯度重塑三项技术,显著提升了在大型学习世界模型中进行长时程规划的鲁棒性。该方法解决了长时程优化中梯度爆炸/消失、非贪婪结构导致的局部极小值以及高维视觉模型带来的脆弱梯度信号等问题。GRASP 使基于世界模型的规划能够更有效地用于控制、学习和决策任务。
Berkeley AI Research 提出了 SPEX 和 ProxySPEX 算法框架,用于大规模识别驱动大语言模型决策的关键特征、数据和模型组件间的交互作用。SPEX 利用稀疏性和低度性,将交互发现重构为可解的稀疏恢复问题;ProxySPEX 则利用交互的层次性结构,能以约 10 倍更少的消融操作达到与 SPEX 相当的性能。这些方法在特征归因、数据归因和模型组件归因中实现了高效交互发现。