使用 NVIDIA NeMo Agent Toolkit 和 Amazon S3 Vectors 构建智能体记忆
NVIDIA NeMo Agent Toolkit 支持将 Amazon S3 Vectors 实现为自定义持久化记忆后端。该方案为多智能体系统提供向量相似性搜索、可过滤元数据、强写入一致性和弹性扩展能力。开发者可通过实现 `MemoryEditor` 接口创建自定义记忆提供者,并在 Amazon EKS 上部署该栈。
NVIDIA NeMo Agent Toolkit 支持将 Amazon S3 Vectors 实现为自定义持久化记忆后端。该方案为多智能体系统提供向量相似性搜索、可过滤元数据、强写入一致性和弹性扩展能力。开发者可通过实现 `MemoryEditor` 接口创建自定义记忆提供者,并在 Amazon EKS 上部署该栈。
Amazon Payments 在 Amazon SageMaker AI 上应用了多目标上下文多臂老虎机(MAB)进行产品获取漏斗的个性化推荐。一项为期七周的在线 A/B 测试显示,针对某一客户群体,最终漏斗转化率获得了较高的个位数百分比相对提升。该方案使用 LinUCB 算法,通过为漏斗的每个阶段(申请开始、提交、批准)运行独立模型并线性组合其得分,来同时优化整个转化路径。
这篇 AWS 官方博客介绍了如何使用 Amazon Bedrock AgentCore 构建环境智能体,实现从事件驱动信号到人工审核工作流的自动化。
CoreWeave 宣布其云平台已提供 NVIDIA Vera Rubin NVL72 系统和 Spectrum-X 以太网网络,AI 软件工程师 Devin 的研发公司 Cognition 成为首个生产负载客户。
Liquid AI 发布了用于视觉语言模型 LFM2.5-VL-3B 的实验性 DSpark 草稿模型,可在不改变输出质量的前提下加速推理。该草稿模型增加了 280M 参数,在 M5 Max 设备上解码速度最高提升 3.13 倍,在 H100 GPU 上最高提升 2.66 倍。模型以开源权重形式提供,并支持 llama.cpp、MLX-VLM 和 SGLang。
GitHub Copilot 应用重构了 Pull Request 视图,以支持包含 2200 个文件、超过一百万行变更和 400 多条行内评论的超大规模代码审查。其核心挑战在于处理高度不确定的评论内容,为此采用了将确定性代码高度与动态区块高度分离的双几何架构。该设计确保了即使在极端负载下,滚动和渲染性能依然流畅。
微软在其开源框架 Physical AI Toolchain 中增加了面向机器人的推理卸载功能。研究表明,将物理 AI 推理从机器人板载 GPU 卸载到边缘或云端,能显著提升任务成功率、支持运行更大模型,并大幅延长电池续航时间。该工具集基于 Kubernetes,支持容器化部署和智能策略分发,并已提供针对 SO-101 和 UR10e 机器人的示例项目。
Google DeepMind 宣布为其 Private AI Compute 平台引入安全、持久的服务器端内存技术。该技术通过硬件强化的安全飞地、加密通道和设备派生的加密密钥,在云端实现类似本地设备的隐私保护标准,使 AI 助手能在跨设备间保持长期连续性。平台还发布了更新的技术白皮书、独立审计结果以及服务器软件防篡改公开记录以供验证。
GitHub 使用 Copilot 应用和 CLI,将 Copilot 智能体运行时从 TypeScript 完全重写为超过 80 万行生产级 Rust 代码。
推荐理由:原文详细描述了用 AI 智能体辅助将核心运行时从 TypeScript 重写为 Rust 的过程、策略和结果,为大型代码库现代化提供了具体案例。
Mistral 与 Cloudera 宣布合作,将 Mistral 模型集成到 Cloudera 的混合数据平台中,使企业能在私有云、公有云、本地及完全隔离的环境中部署 AI 模型并保持完全控制。该合作旨在满足对主权 AI 日益增长的需求,让企业能够利用自身专有数据训练定制化模型,并拥有数据和生成智能的所有权。
Mistral AI 协助一家欧洲能源运营商将 4 万行 Fortran 77 代码迁移至 C++。项目构建了数值对等性测试框架以验证迁移正确性,并部署了包含规划、编码、测试和代码质量审查的 AI 智能体工作流来理解和重构代码。AI 智能体通过文档库和 Mistral OCR 整合分散的文档,并自动生成代码文档。
Mistral 宣布三项举措以构建客户 AI 主权基础:Mistral Regional Endpoints 正式可用,允许客户选择推理运行在欧盟或美国;平台将支持第三方开放模型,首个为 Z.ai 的 GLM-5.2;并联合企业成立联盟,通过多年承诺的 European Compute Units 保障欧洲长期 AI 算力容量。公司计划到 2030 年建设高达 1 GW 的算力容量。
推荐理由:原文给出了 Mistral 为保障 AI 主权推出的三项具体措施,包括区域端点、第三方模型支持和长期算力承诺,读者可以据此判断其对企业合规和部署策略的影响。
伯克利 AI 研究团队扩展了 K-Search 框架,为其添加了 MLX 后端和一个结构化的 CUDA-to-MLX 翻译层,可将 NVIDIA GPU 上的内核优化知识迁移到 Apple Silicon。
自适应并行推理让推理模型能自行决定何时分解并行化独立子任务、生成多少并发线程以及如何协调它们。现有方法如 Self-Consistency、Tree of Thoughts 和 GroupThink 的并行化决策均由外部框架强加,而非模型自适应选择。该方法旨在解决序列推理因探索路径积累导致的上下文窗口超限、性能下降和延迟增长问题。