Amazon Bedrock、AgentCore 与 Strands 2026 年 9 月更新盘点
Amazon Bedrock 在 9 月新增由 OpenAI 驱动的托管智能体公开预览,并上架 GPT-6 Astra、GPT-6 Astra Ultrafast。
Amazon Bedrock 在 9 月新增由 OpenAI 驱动的托管智能体公开预览,并上架 GPT-6 Astra、GPT-6 Astra Ultrafast。
Postman 的 Agent Mode 基于 Amazon Bedrock 运行,为 4000 万开发者提供 API 测试、文档、发现与实现的 AI 原生工作方式。
Ai2 用 GPU 时间预算、分层公平分配和时间切片契约替换了原有的优先级调度器,把"哪个项目该拿多少 GPU 时间"从事后逐个协调变成透明的预算流程。Ai2 管理数千块 NVIDIA H100、B200 和 B300,集群规模 88 到 1024 块 GPU,服务约 150 名内部研究者,待处理需求常达可用 GPU 的 2-3 倍。
Sophos 借助 OpenAI 的 Daybreak 将网络威胁调查时间缩短 96%,并实现 52% 的 MDR 案例自动化,同时保留人工监督。
Asana 借助 Codex 中的 GPT-6 Astra,在测试中让其浏览器智能体成本降低 76 倍、速度提升 5 倍,从而为客户提供更强的模型。原始标题称此次优化使用 GPT-6.1 Sol。
NVIDIA 发文展示开发者如何用 GPT-6 Astra、Claude Fable 5 等前沿 AI 模型配合 Omniverse 库(ovphysx、ovstage、ovrtx、ovui)把仿真构想变成可运行应用。
Incarna 借助 Amazon Bedrock AgentCore payments,让 AI 智能体按次向 BlockRun 支付模型推理费用,将 x402 支付支持的开发工作从数月缩短到数天并投入生产。
AWS 发布基于 Amazon SageMaker HyperPod 与 EKS 的多租户参考架构,让多个团队共享同一 GPU 集群,同时保持隔离与资源公平。
Oracle 在招聘、工程和运营环节借助 ChatGPT Work 与 Codex,将专家知识转化为快速、可重复的工作流,把原本需要数天的工作缩短到几分钟完成。
Pollo AI 使用 GPT-5.6、GPT-6 Astra 和 GPT-Image-2.5,帮助创作者把创意转化为精细图像与电影级视频广告。
LegalOn 把每日 Codex 预估成本削减 65%,同时维持原有开发速度。该团队按任务匹配 Astra、Sol 与 Luna 模型,并对预算进行策略性管理。
作者在 HuggingChat 里开启 ML-intern,用几句提示词就在几天内训出六个模型并发布到 Hub,总计算成本约 103 美元。
推荐理由:作者公开了六个模型项目从 450 词到 2000 词的提示词写法,含基线、冒烟测试与预算控制等可迁移步骤。
OpenAI 打击了两起借助 AI 运作的影响行动,手段包括伪装成记者和一家智库来散播地缘政治叙事。
AWS 宣布 Claude Haiku 5.5 在 Amazon Bedrock 和 Claude Platform on AWS 上可用。据 Anthropic 介绍,它是 Claude 5.5 家族中速度最快、最经济的模型,面向子智能体和高并发成本敏感型任务,大多数任务成本比 Claude Haiku 4.5 低约 75%。
NVIDIA 与 Microsoft 在旧金山活动上宣布为 Windows PC 上的 AI 智能体共同设计硬件与软件,并发布 RTX Spark 笔记本与紧凑台式机。
推荐理由:RTX Spark 与 Windows PC 端本地 AI 栈的组合,给出了消费级硬件跑大模型的统一内存与算力规格。
Amazon Quick 和 Amazon Bedrock Knowledge Bases 在预检索 ACL 过滤之上新增实时 ACL 校验,在查询时直接向权威来源核验权限,避免同步间隙的陈旧权限漏洞。
GitHub 发布基于 ModernBERT 的通用密钥检测分类器,用代码上下文在推送前拦截非结构化密钥,候选批量评估耗时不到 2 毫秒,并称可将可拦截的密钥数量提升一倍以上。
Liquid AI 开源 d1 决策模型家族两款模型:d1-3B 与实验性的 d1-omni-600M,均为开放权重并在 Hugging Face 上线。
推荐理由:Liquid AI 开源两款决策模型,给出端侧毫秒级延迟与七项基准对比,可据此判断小模型在边缘设备上做结构化决策的可行性。
微软亚洲研究院开源 Agent Lightning v1.0,这是一个约 3500 行代码的轻量级智能体 RL 框架,采用 Harnessed Agentic RL 范式,实现部署用 harness 直接参与强化学习训练而无需在训练框架内重写 agent。
推荐理由:Agent Lightning v1.0 不到 3500 行实现完整智能体 RL 系统,读者可了解如何在真实 harness 上训练 agent。
AWS 提出 Agentic Value Model,认为以“节省工时×人力成本”衡量自动化的传统 ROI 模型是为 RPA 设计的,会漏掉 AI 智能体的大部分价值。该框架从时间节省、异常处理、决策质量和变更韧性四个维度衡量价值,并以价值实现机制作为前提;文中称修正一个错误可能花费原交易成本的 1.5–4 倍,人为错误可占运营成本的 2–15%。
Qlik 基于 Amazon Bedrock 打造 Qlik Answers,让员工用自然语言提问并获得有来源支撑的答案。该产品 2026 年 2 月正式可用,其 Discovery Agent 上线以来已为客户发现超过 10 万条异常与离群点。
阿布扎比技术创新研究院(TII)发布 Falcon-ASR,一个 1.6B 参数的语音识别模型,重点面向阿拉伯语尤其是阿联酋方言,同时支持英语、法语、西班牙语和葡萄牙语。
NVIDIA 团队从 Nemotron 3 出发,用监督微调、强化学习与反馈式推理打造专精模型,在 IOI 2026 拿到 535.4/600,在 IMO 2026 拿到 30/42,两者都超过官方金牌线。
OpenAI 将 College Planner 引入 ChatGPT for Teens,帮助学生管理大学申请,同时上线闪卡和测验功能,并组建青少年 AI 顾问委员会。
Radisson Hotel Group 与 Accenture 合作,基于 OpenAI 技术打造了一款 ChatGPT 插件,让旅客在规划行程时就能查找、比较和预订酒店。
Google DeepMind 发布 EmbeddingGemma 2,这是基于 Gemma 4 架构、采用 Apache 2.0 许可的开源多模态嵌入模型,可将文本、图像、音频、视频映射到统一嵌入空间。
推荐理由:Google DeepMind 开源 740M 参数多模态嵌入模型,给出端侧内存占用与向量截断方法,可供本地检索与 RAG 选型参考。
Microsoft 的 Jennifer Neville 在 Microsoft Research Podcast 中讨论评估如何推动 AI 系统性能边界,以及在传统基准之外测试模型时出现的「意外失败」。她结合自己从数学、物理、认知科学到计算机科学的经历,分享使用当前 AI 系统的实用建议,并强调结果超出预期时应仔细审视数据。
Google Research 用 Google Earth AI 的 Population Dynamics Foundation Model(PDFM)位置嵌入,在无需任务微调的情况下接入现有流行病学模型。
NVIDIA《State of AI in Telecommunications》报告显示,89% 受访者认为开源模型和软件对公司 AI 战略重要。
Mistral AI 发布 Mistral Large 4 公开预览,可通过 Mistral Studio 试用预览 API,权重计划于本月底开放。ML4 是 1 万亿参数、52B 激活参数的原生多模态模型,在欧洲自有数据中心的 3,800 块 NVIDIA Grace Blackwell GPU 上从零训练,官方称其在编码、智能体工作流和多模态理解上可与最强开源模型竞争。
推荐理由:官方给出 1 万亿参数、52B 激活的开放权重模型细节与多类基准对比,可据此判断开源前沿模型的能力位置。
Google 发布了一份关于智能体隐私与安全的新 workshop 报告,由 50 多位学界与业界人士在 2025 年底于纽约举行的 Google CAPS Workshop 上协作完成。
GitHub 发布 ReviewBench,一个面向 AI 代码评审的开源离线基准,基于 1.039 亿个 GitHub PR 的语言与仓库规模分布,包含 19 种语言的 219 个公开 PR,金标由人工评审、前沿 LLM 和静态分析等多来源构建。
NVIDIA Inception 计划中的 iSono Health、Whiterabbit.ai 和 Ataraxis AI 正用 AI 覆盖乳腺癌筛查、风险评估与治疗规划环节。
微软与 Hugging Face 联合发布 ThinkingBox,通过隔离 MCP 会话检查智能体留下的后端状态与副作用,而不是看它生成的文字,Bench 覆盖 507 个有状态业务流程、每个任务重复运行 20 次。
推荐理由:微软与 Hugging Face 联合发布的智能体基准,用后端数据库终态而非模型自述来判定成败,并公开了 507 个任务、20 次重复运行的完整环境。
GitHub 提出 AI 时代开发者应强化的三项技能:学会指挥 AI 智能体而非仅使用 AI、不轻信 AI 的第一次回答、用 AI 节省的时间解决更大问题。文中举例称 GitHub Copilot 内置的 Rubber Duck agent 会用第二个模型审查计划、代码与测试;在认证流程示例中,开发者可同时协调三个 AI 智能体分别产出认证、文档和测试。
Google Research 发布新一代联邦学习系统,利用可信执行环境(TEE)为数据匿名化提供可验证、可审计的保证,并已应用于 Gboard。系统中,客户端设备本地加密训练数据并上传,只有符合访问策略的 TEE 工作负载才能解密处理,访问策略发布到公开透明日志 Rekor,相关二进制可从开源仓库 Confidential Federated Compute 复现构建。
推荐理由:Google 公布基于 TEE 的新一代联邦学习系统设计,读者可了解其如何让服务端处理过程可外部验证。
NVIDIA 将于本月通过 Acer、ASUS、Dell、Gigabyte、HP 和 MSI 推出 64GB 统一内存版 DGX Spark,预装 DGX OS 和 NVIDIA AI 软件栈,10 月 23 日开售,起售价 4,999 美元。
推荐理由:64GB 版本的定价、可跑 100B 参数模型和双机集群 1.7x 实测,为本地部署选型提供了具体参照。
ServiceNow CoreAI 构建了 AutoSynthData,利用目标模型的失败案例和更强教师的成功案例,定位当前模型的能力缺口,并据此生成、验证新的可执行训练任务。管线以 EnterpriseOps Gym 数据集为例演示,任务由系统规范、用户提示词和验证器三部分组成,需满足可行性、真实性与难度要求。随着模型改进,课程会自动转向其仍未掌握的能力。
OpenAI 的 GPT-6 Astra Ultrafast 已上线 OpenAI API,并向符合条件的 ChatGPT Work 和 Codex 用户开放,运行在 NVIDIA Blackwell GPU 上。
推荐理由:原文给出 GPT-6 Astra Ultrafast 在 Blackwell 上的提速数据与开放入口,读者可据此判断它对编码智能体循环的影响。
Google DeepMind 发布新前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络安全防御者开放,随后逐步向开发者、企业和消费者推出。
推荐理由:原文给出 Argon 在编码与网络安全防御上的基准成绩和 Google 内部落地案例,读者可据此判断前沿模型的能力边界。