GPT-6 系列模型使用指南
OpenAI 为开发者提供了 GPT-6 系列模型的选择、提示词优化、技能调用及生产工作流准备指南。该指南涵盖了如何根据任务需求选择不同模型、调整推理强度,并协调工具使用。
OpenAI 为开发者提供了 GPT-6 系列模型的选择、提示词优化、技能调用及生产工作流准备指南。该指南涵盖了如何根据任务需求选择不同模型、调整推理强度,并协调工具使用。
ServiceNow CoreAI 团队开发了 AutoSynthData 系统,用于自动生成企业智能体所需的训练数据。该系统通过分析目标模型的失败案例和更强“教师”模型的成功经验,识别能力差距并生成新的、可执行的任务。生成的每个任务都包含系统规范、用户提示词和验证器,旨在提供针对当前模型弱点的有效训练信号。
Chatham Financial 使用 Codex 和 GPT-5.6 构建技术并重新设计工作流,将交易验证时间从 30 分钟缩短至 4 分钟以内。
Amazon Quick 发布 Live Data in Apps 功能,使 AI 构建的 Quick Apps 能实时查询受管控的 Quick Sight 数据集,而非依赖构建时的静态快照。应用每次被打开时都会重新运行 SQL 查询,确保数据最新,并自动应用行级和列级安全规则,每个用户只能看到自己权限内的数据。
NVIDIA NeMo Agent Toolkit 支持将 Amazon S3 Vectors 实现为自定义持久化记忆后端。该方案为多智能体系统提供向量相似性搜索、可过滤元数据、强写入一致性和弹性扩展能力。开发者可通过实现 `MemoryEditor` 接口创建自定义记忆提供者,并在 Amazon EKS 上部署该栈。
OpenAI 认为,先进 AI 的价值可能更多体现在为突破性想法提供常规执行支持。执行能力将塑造下一阶段的经济形态与发展速度。
Amazon Payments 在 Amazon SageMaker AI 上应用了多目标上下文多臂老虎机(MAB)进行产品获取漏斗的个性化推荐。一项为期七周的在线 A/B 测试显示,针对某一客户群体,最终漏斗转化率获得了较高的个位数百分比相对提升。该方案使用 LinUCB 算法,通过为漏斗的每个阶段(申请开始、提交、批准)运行独立模型并线性组合其得分,来同时优化整个转化路径。
这篇 AWS 官方博客介绍了如何使用 Amazon Bedrock AgentCore 构建环境智能体,实现从事件驱动信号到人工审核工作流的自动化。
Albertsons Cos. 正在使用 ChatGPT Enterprise 和 OpenAI API 来帮助团队提高工作效率,并为数百万顾客简化杂货购物流程。
ChatGPT Work 帮助社交俱乐部 The Den 将准备拨款申请的时间从 3 天缩短至 2 小时,准备酒类许可证材料的时间从 4 天缩短至 3 小时。该工具每周为俱乐部节省 10-15 小时,使其能将更多时间用于业务增长。
Google DeepMind 宣布推出前沿模型 Gemini 4 Argon,在复杂软件工程、企业知识工作和网络安全防御等长流程任务中提供前沿性能。其输出 token 限制提升至 100 万,定价为每百万输入 token 2 美元、输出 token 10 美元。
推荐理由:官方宣布了 Gemini 4 Argon 的核心能力、定价和分阶段发布计划,读者可以了解其性能基准和潜在应用领域。
Google DeepMind 推出 SynthID Bio,将水印技术应用于合成生物学,可在保持蛋白质生物功能的同时,为 AI 生成的蛋白质序列和 3D 结构嵌入可验证的签名。该技术已通过湿实验验证,水印版蛋白结合剂在命中率、结合亲和力等方面与非水印版本相当。SynthID Bio 旨在为 DNA 合成筛选和公共数据库完整性提供自动化验证层,以应对 AI 生成生物设计带来的生物安全挑战。
推荐理由:原文介绍了将数字水印技术首次应用于合成生物学领域的具体方法、验证结果和潜在应用场景,为理解 AI 在生物安全中的作用提供了实例。
CoreWeave 宣布其云平台已提供 NVIDIA Vera Rubin NVL72 系统和 Spectrum-X 以太网网络,AI 软件工程师 Devin 的研发公司 Cognition 成为首个生产负载客户。
OpenAI 挫败了一次旨在提取受保护模型推理能力的协同蒸馏攻击行动。该公司正在加强防御,以应对此类对抗性蒸馏威胁。
OpenAI 与美国小企业管理局合作,为小企业提供实践性 AI 培训和本地支持。同时,OpenAI 发布了一份关于小团队如何使用 AI 的新报告。
Hugging Face 推出了 Open TTS Leaderboard,这是一个专注于开源和多语言文本转语音(TTS)及语音克隆模型的评测平台。它使用可扩展的客观指标(如 WER、CER、RTFx、TTFA 和 SIM)进行快速评估,以弥补依赖人工投票的竞技场式榜单在规模和一致性上的不足。
Google Research 提出了 Diffusion Controller 框架,将图像去噪过程重构为一个连续控制问题,以统一和简化对生成模型的引导。该框架包含一个轻量的‘转向阻尼器’网络,能在不修改核心模型的情况下控制图像生成。
NVIDIA 开源了用于表格分类和回归的基础模型 Kumo Tabular,无需训练、微调或特征工程即可对新行进行预测。该模型在 TabArena、BeyondArena、TALENT 和 ScoringBench 四个基准测试中均排名第一,并提供三种参数量版本(28M 至 215M)。
推荐理由:原文给出了模型在多个基准测试中的领先表现和无需训练即可预测的能力,读者可以据此判断它在表格预测任务上的潜力。
Hugging Face 发布论文 ProvenanceGuard,这是一个针对基于 MCP 的 LLM 智能体的溯源感知事实性验证层,旨在解决跨源混淆问题。该方法在医疗智能体测试中,在 139 个应被阻止的声明中成功捕获了 138 个,并能在约 86% 的情况下识别出正确的来源。
OpenAI 在 DevDay 2026 上发布了超过 20 项公告,涵盖 GPT-6 Astra、ChatGPT、Codex、API、安全以及面向开发者的新工具。
Mistral AI 在德国慕尼黑开设新中心,专注于工业 AI 和 Physics AI 研究与应用。该中心将与宝马合作进行碰撞模拟和工程 AI,与西门子能源合作开发工业 AI 应用,并计划到 2030 年在欧洲建设 1 吉瓦的计算能力。Mistral 强调其开放权重架构,模型可在客户自有基础设施上运行,确保数据主权和完全可审计性。
H 公司发布了 Holo4 系列通用计算机使用智能体模型,包含 27B 密集型和 35B-A3B MoE 两个版本,并同步更新了 Holotron4 Nano。
推荐理由:原文给出了模型能力、性能对比和开放获取方式,读者可以据此判断它在通用计算机使用智能体领域的定位。
GitHub Copilot 应用中的 canvas 功能允许用户创建可双向通信的全栈应用界面,以替代纯聊天交互。例如,用户可构建用于管理本地 Winget 包或自动化开发工作流的自定义界面,从而将 AI 智能体从执行工具转变为工具构建者。该功能旨在解决纯聊天界面在处理特定任务时效率低下的问题。
GitHub Security Lab 发布了 Fuzzing Taskflow Agent,这是一个用于 C/C++ 项目的自动化模糊测试管道。用户只需提供一个 GitHub 仓库地址,该 Agent 便能自动执行识别入口点、分析构建系统、编写测试工具、运行 AFL++、分析覆盖率、改进工具、分类崩溃并生成漏洞报告等全流程。
Google DeepMind 为 Gemini 3.8 Live 推出 Live Avatar 功能,将低延迟流式视频与实时对话模型原生结合,为企业用户提供带有动态视觉形象的对话体验。
Liquid AI 发布了用于视觉语言模型 LFM2.5-VL-3B 的实验性 DSpark 草稿模型,可在不改变输出质量的前提下加速推理。该草稿模型增加了 280M 参数,在 M5 Max 设备上解码速度最高提升 3.13 倍,在 H100 GPU 上最高提升 2.66 倍。模型以开源权重形式提供,并支持 llama.cpp、MLX-VLM 和 SGLang。
NVIDIA 联合 Google DeepMind、EMBL-EBI 等全球研究机构,在 AlphaFold Database 中发布了超过 2800 种病毒的蛋白质复合物预测 3D 结构数据集。
Remedy Entertainment 的游戏《CONTROL Resonant》本周在 GeForce NOW 云游戏平台上线。购买 12 个月 GeForce NOW Ultimate 会员至 9 月 27 日,可免费获得该游戏。此外,GeForce NOW 即将支持 Googlebooks 笔记本电脑,本周另有《DragonSword: Awakening》等九款新游戏加入云游戏库。
GitHub Copilot 应用重构了 Pull Request 视图,以支持包含 2200 个文件、超过一百万行变更和 400 多条行内评论的超大规模代码审查。其核心挑战在于处理高度不确定的评论内容,为此采用了将确定性代码高度与动态区块高度分离的双几何架构。该设计确保了即使在极端负载下,滚动和渲染性能依然流畅。
微软在其开源框架 Physical AI Toolchain 中增加了面向机器人的推理卸载功能。研究表明,将物理 AI 推理从机器人板载 GPU 卸载到边缘或云端,能显著提升任务成功率、支持运行更大模型,并大幅延长电池续航时间。该工具集基于 Kubernetes,支持容器化部署和智能策略分发,并已提供针对 SO-101 和 UR10e 机器人的示例项目。
Google DeepMind 宣布为其 Private AI Compute 平台引入安全、持久的服务器端内存技术。该技术通过硬件强化的安全飞地、加密通道和设备派生的加密密钥,在云端实现类似本地设备的隐私保护标准,使 AI 助手能在跨设备间保持长期连续性。平台还发布了更新的技术白皮书、独立审计结果以及服务器软件防篡改公开记录以供验证。
Google DeepMind 为 Gemini 家族新增两款文本转语音模型 Gemini 3.8 Flash TTS 和 Flash-Lite TTS。
推荐理由:原文详细说明了两个新语音模型的核心能力、适用场景和开放入口,读者可以据此评估它们对音频创作和产品集成的影响。
Microsoft Research 开源了逆合成预测模型 RetroChimera,其通过集成 R-SMILES 2 和 NeuralLoc 两个互补模型来提升预测质量。在盲测中,博士级化学家更青睐 RetroChimera 提出的单个反应预测。该模型已开源实现和权重,旨在加速新药和先进材料的研发。
GitHub 播客最新一期探讨了关于 AI 辅助开发的几个常见热门观点。节目认为,开发者仍需审查 AI 生成的代码,但应根据风险调整审查深度;RAG 并未过时,它能为模型提供训练数据之外的相关信息;Skills 和 MCP 解决不同问题,前者提供打包的专业知识,后者则为智能体提供连接工具和数据的标准。
GitHub 使用 Copilot 应用和 CLI,将 Copilot 智能体运行时从 TypeScript 完全重写为超过 80 万行生产级 Rust 代码。
推荐理由:原文详细描述了用 AI 智能体辅助将核心运行时从 TypeScript 重写为 Rust 的过程、策略和结果,为大型代码库现代化提供了具体案例。
Mistral AI 与 Mozilla 达成合作,为 Firefox Smart Window(Beta)AI 浏览助手提供模型支持。该功能初期面向法国和北美用户,今年晚些时候将扩展至英国和德国,旨在提供注重隐私、理解本地语言文化细微差别的 AI 浏览体验。双方基于对开源、用户控制和数据零保留的承诺,共同推动开放 AI 技术在浏览器中的应用。
Google Research 提出 Retrieve-for-Train 框架,通过离线强化学习将优化后的查询分解行为蒸馏至一个 53.9M 参数的扩散模型,从而在推理时绕过文本链式推理 token 的生成瓶颈。该方法使用 Gemma3-4B 和 Qwen3-4B 等开源模型进行微调,旨在实现满足集合层面属性(如多样性、互补性)的高效单次查询扩展。
Google DeepMind 发布两款专为实时对话优化的新模型 Gemini 3.8 Live 和 3.8 Live Extended Thinking。Gemini 3.8 Live 注重规模化与成本效益,支持 97 种语言实时切换和后台工具调用。
推荐理由:原文给出了两个新模型的核心定位、关键能力差异和开放入口,读者可以据此判断它们会怎样改变语音交互和复杂任务处理。
GitHub 营销人员利用 GitHub Copilot 和 GitHub Actions 将活动管理流程自动化,通过 GitHub Issue 表单触发工作流,连接事件平台 API 和 CRM CLI。该方案基于团队 Markdown 格式的运行手册,在对话中生成符合规范的营销活动名称和邀请邮件草稿,实现了从活动策划到事后清理的端到端自动化。
Google Research 提出的 ToolGrad 框架采用“答案优先”范式,通过文本梯度迭代构建 API 工作流来高效生成高质量工具使用数据集。