跳到正文

技术方向

数据与训练 最新动态

训练侧的门道:数据集构建、合成数据、预训练与后训练方法、算力与训练成本。

3 条精选近 30 天 3 条共收录 14 条

更新

数据与训练的精选

9月30日周三第 1–3 条
  1. Google DeepMind61

    Google DeepMind 推出用于合成生物学的 SynthID Bio 水印技术

    Google DeepMind 推出 SynthID Bio,将水印技术应用于合成生物学,可在保持蛋白质生物功能的同时,为 AI 生成的蛋白质序列和 3D 结构嵌入可验证的签名。该技术已通过湿实验验证,水印版蛋白结合剂在命中率、结合亲和力等方面与非水印版本相当。SynthID Bio 旨在为 DNA 合成筛选和公共数据库完整性提供自动化验证层,以应对 AI 生成生物设计带来的生物安全挑战。

    推荐理由:原文介绍了将数字水印技术首次应用于合成生物学领域的具体方法、验证结果和潜在应用场景,为理解 AI 在生物安全中的作用提供了实例。

9月29日周二
  1. Hugging Face Blog60

    NVIDIA Kumo Tabular 开源表格预测基础模型

    NVIDIA 开源了用于表格分类和回归的基础模型 Kumo Tabular,无需训练、微调或特征工程即可对新行进行预测。该模型在 TabArena、BeyondArena、TALENT 和 ScoringBench 四个基准测试中均排名第一,并提供三种参数量版本(28M 至 215M)。

    推荐理由:原文给出了模型在多个基准测试中的领先表现和无需训练即可预测的能力,读者可以据此判断它在表格预测任务上的潜力。

9月8日周二
  1. Google DeepMind60

    Google DeepMind 发布 AlphaGenome Atlas:预测人类基因组所有单字母变异的平台

    Google DeepMind 发布了 AlphaGenome Atlas 平台,它包含对人类基因组中 90 亿个单核苷酸变异(所有可能的单字母变化)影响的预测。

    推荐理由:原文介绍了 AlphaGenome Atlas 的功能、数据规模、可用入口和初步应用案例,读者可以据此判断它对基因组研究的潜在影响。