NASA 与 IBM 开源月球基础模型,将 17 年轨道器数据转化为月球科学基础
NASA 与 IBM 联合发布开源月球基础模型,基于 17 年月球勘测轨道飞行器数据训练,包含近 200 万个图块数据。该模型在预测月球极区冰沉积物时,将误差降低了最高 22%,并在粗尺度陨石坑检测任务中表现优于 SwinV2-B 基线模型近 19%。模型采用多模态架构,能适应不同图像块尺寸,并支持使用 LoRA 等轻量级方法进行微调。
NASA 与 IBM 联合发布开源月球基础模型,基于 17 年月球勘测轨道飞行器数据训练,包含近 200 万个图块数据。该模型在预测月球极区冰沉积物时,将误差降低了最高 22%,并在粗尺度陨石坑检测任务中表现优于 SwinV2-B 基线模型近 19%。模型采用多模态架构,能适应不同图像块尺寸,并支持使用 LoRA 等轻量级方法进行微调。
ServiceNow CoreAI 团队开发了 AutoSynthData 系统,用于自动生成企业智能体所需的训练数据。该系统通过分析目标模型的失败案例和更强“教师”模型的成功经验,识别能力差距并生成新的、可执行的任务。生成的每个任务都包含系统规范、用户提示词和验证器,旨在提供针对当前模型弱点的有效训练信号。
NVIDIA 联合 Google DeepMind、EMBL-EBI 等全球研究机构,在 AlphaFold Database 中发布了超过 2800 种病毒的蛋白质复合物预测 3D 结构数据集。
Microsoft Research 开源了逆合成预测模型 RetroChimera,其通过集成 R-SMILES 2 和 NeuralLoc 两个互补模型来提升预测质量。在盲测中,博士级化学家更青睐 RetroChimera 提出的单个反应预测。该模型已开源实现和权重,旨在加速新药和先进材料的研发。
Google Research 提出的 ToolGrad 框架采用“答案优先”范式,通过文本梯度迭代构建 API 工作流来高效生成高质量工具使用数据集。
Google DeepMind 发布了 AlphaGenome Atlas 平台,它包含对人类基因组中 90 亿个单核苷酸变异(所有可能的单字母变化)影响的预测。
推荐理由:原文介绍了 AlphaGenome Atlas 的功能、数据规模、可用入口和初步应用案例,读者可以据此判断它对基因组研究的潜在影响。
Google Research 评估了将基于数十万欧洲人群(UK Biobank)的多基因风险评分模型迁移至近 20 万日本人群(Biobank Japan)时的性能变化。
伯克利 AI 研究团队提出 ABBEL 框架,通过将摘要视为信念状态并引入信念分级监督,来提升长程交互任务中的学习效率和性能。在 CollabBench 协作编码环境中,使用基于重构的信念分级函数将性能与全上下文模型的差距缩小了约 50%,训练步数减少了 50%。该框架还展示了在 Combination Lock 和多目标问答环境中减少内存使用或提升学习效率的潜力。
Berkeley AI Research 提出了 SPEX 和 ProxySPEX 算法框架,用于大规模识别驱动大语言模型决策的关键特征、数据和模型组件间的交互作用。SPEX 利用稀疏性和低度性,将交互发现重构为可解的稀疏恢复问题;ProxySPEX 则利用交互的层次性结构,能以约 10 倍更少的消融操作达到与 SPEX 相当的性能。这些方法在特征归因、数据归因和模型组件归因中实现了高效交互发现。