跳到正文

技术方向

安全对齐 最新动态

AI 安全与对齐:越狱与防御、模型行为研究、安全评测与治理框架的进展。

2 条精选近 30 天 2 条共收录 23 条

更新

安全对齐的精选

10月1日周四第 1–2 条
  1. Google DeepMind79

    Google DeepMind 发布前沿模型 Gemini 4 Argon

    Google DeepMind 宣布推出前沿模型 Gemini 4 Argon,在复杂软件工程、企业知识工作和网络安全防御等长流程任务中提供前沿性能。其输出 token 限制提升至 100 万,定价为每百万输入 token 2 美元、输出 token 10 美元。

    推荐理由:官方宣布了 Gemini 4 Argon 的核心能力、定价和分阶段发布计划,读者可以了解其性能基准和潜在应用领域。

9月30日周三
  1. Google DeepMind61

    Google DeepMind 推出用于合成生物学的 SynthID Bio 水印技术

    Google DeepMind 推出 SynthID Bio,将水印技术应用于合成生物学,可在保持蛋白质生物功能的同时,为 AI 生成的蛋白质序列和 3D 结构嵌入可验证的签名。该技术已通过湿实验验证,水印版蛋白结合剂在命中率、结合亲和力等方面与非水印版本相当。SynthID Bio 旨在为 DNA 合成筛选和公共数据库完整性提供自动化验证层,以应对 AI 生成生物设计带来的生物安全挑战。

    推荐理由:原文介绍了将数字水印技术首次应用于合成生物学领域的具体方法、验证结果和潜在应用场景,为理解 AI 在生物安全中的作用提供了实例。