Asana 用 GPT-6.1 Sol 在浏览器测试中将模型成本降低 76 倍
Asana 借助 Codex 中的 GPT-6 Astra,在测试中让其浏览器智能体成本降低 76 倍、速度提升 5 倍,从而为客户提供更强的模型。原始标题称此次优化使用 GPT-6.1 Sol。
Asana 借助 Codex 中的 GPT-6 Astra,在测试中让其浏览器智能体成本降低 76 倍、速度提升 5 倍,从而为客户提供更强的模型。原始标题称此次优化使用 GPT-6.1 Sol。
NVIDIA 发文展示开发者如何用 GPT-6 Astra、Claude Fable 5 等前沿 AI 模型配合 Omniverse 库(ovphysx、ovstage、ovrtx、ovui)把仿真构想变成可运行应用。
Incarna 借助 Amazon Bedrock AgentCore payments,让 AI 智能体按次向 BlockRun 支付模型推理费用,将 x402 支付支持的开发工作从数月缩短到数天并投入生产。
Oracle 在招聘、工程和运营环节借助 ChatGPT Work 与 Codex,将专家知识转化为快速、可重复的工作流,把原本需要数天的工作缩短到几分钟完成。
AWS 宣布 Claude Haiku 5.5 在 Amazon Bedrock 和 Claude Platform on AWS 上可用。据 Anthropic 介绍,它是 Claude 5.5 家族中速度最快、最经济的模型,面向子智能体和高并发成本敏感型任务,大多数任务成本比 Claude Haiku 4.5 低约 75%。
GitHub 发布基于 ModernBERT 的通用密钥检测分类器,用代码上下文在推送前拦截非结构化密钥,候选批量评估耗时不到 2 毫秒,并称可将可拦截的密钥数量提升一倍以上。
微软亚洲研究院开源 Agent Lightning v1.0,这是一个约 3500 行代码的轻量级智能体 RL 框架,采用 Harnessed Agentic RL 范式,实现部署用 harness 直接参与强化学习训练而无需在训练框架内重写 agent。
推荐理由:Agent Lightning v1.0 不到 3500 行实现完整智能体 RL 系统,读者可了解如何在真实 harness 上训练 agent。
OpenAI 将 College Planner 引入 ChatGPT for Teens,帮助学生管理大学申请,同时上线闪卡和测验功能,并组建青少年 AI 顾问委员会。
NVIDIA 将于本月通过 Acer、ASUS、Dell、Gigabyte、HP 和 MSI 推出 64GB 统一内存版 DGX Spark,预装 DGX OS 和 NVIDIA AI 软件栈,10 月 23 日开售,起售价 4,999 美元。
推荐理由:64GB 版本的定价、可跑 100B 参数模型和双机集群 1.7x 实测,为本地部署选型提供了具体参照。
Google DeepMind 推出 SynthID Bio,将水印技术用于合成生物学,把不可感知的签名嵌入生物代码,使其不仅在数字模型上可验证,在合成出的实体蛋白质上也能被检测,同时实验室测试显示不影响生物功能。
推荐理由:SynthID 水印能力从数字媒体延伸到合成生物,读者可了解蛋白质与结构水印的验证方式和生物安全筛查意义。
微软研究院发布 Quine,一个面向生物学复杂性的 AI 研究系统,由生物学多模态世界模型和连接科学工具、文献、湿实验与研究者的交互 harness 组成。它与 Broad Institute 合作,用该系统筛选可能驱动肿瘤状态转变的化合物,最高排名化合物在多个湿实验检测中产生了最大的目标转变,整个过程从缩小化合物搜索空间到选出候选仅用一个周末。
推荐理由:微软研究院公开生物学多模态世界模型 Quine 的构建思路,并给出胰腺癌化合物筛选的湿实验验证细节。
Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,把近实时视频生成与语音结合,为 Gemini 的实时对话模型带来视觉形象。
推荐理由:官方给出 Live Avatar 在对话中实时生成视频与语音的能力,读者可据此评估企业虚拟客服的交互形态变化。
Google DeepMind 发布 AlphaGenome Atlas,收录人类基因组中全部 90 亿个单核苷酸变异的分子效应预测,规模达 1PB,为 AlphaFold Database 的 30 多倍。
推荐理由:官方给出 90 亿单核苷酸变异预测数据集的构成与开放方式,可了解基因组预测资源的规模与使用入口。
Mistral 发布 Agentic Search,用 search、open、navigate、read、grep 五工具组成多步检索循环,让模型可在复杂文档中搜索、读取并核验信息。
推荐理由:原文用 FinanceBench 和 OfficeQA Pro 对比一次性 RAG,说明多步检索在准确率、延迟和 token 上的收益,可帮助判断是否引入 Agentic Search。