Google Gemini 4 内部测试:Carbon 编程性能据称接近 Anthropic Opus 5.5
据 Business Insider 看到的内部文档、截图和聊天记录,Google 正在测试 Argon、Barium、Carbon 三个 Gemini 4 变体,其中 Carbon 已部署在内部编程平台 Jetski 上,据称在编程任务上强于 Argon,有员工将其与 Anthropic 最强编程模型 Opus 5.5 相比。
据 Business Insider 看到的内部文档、截图和聊天记录,Google 正在测试 Argon、Barium、Carbon 三个 Gemini 4 变体,其中 Carbon 已部署在内部编程平台 Jetski 上,据称在编程任务上强于 Argon,有员工将其与 Anthropic 最强编程模型 Opus 5.5 相比。
哈佛大学研究人员 Fiona Chen 与 James Stratton 基于 Jellyfish 聚合数据,分析了 2021 年至 2026 年 3 月间 700 多家软件开发企业、逾 70 万名员工的 3 亿条工作事件,发现 AI 编码工具虽能生成大量可用代码,却几乎没有证据显示企业因此提高了软件产出或减少了用工。
Simon Willison 用 ChatGPT 桌面版 Codex 标签页的语音对话模式,在厨房做晚饭的半小时里让 GPT-6 Astra High 为博客开发出 Newsletters 索引页,含新 Django 模型与迁移、四个导入脚本、/newsletters/ 归档页、日期归档页展示和站内搜索集成。
Oracle 在招聘、工程和运营环节借助 ChatGPT Work 与 Codex,将专家知识转化为快速、可重复的工作流,把原本需要数天的工作缩短到几分钟完成。
LegalOn 把每日 Codex 预估成本削减 65%,同时维持原有开发速度。该团队按任务匹配 Astra、Sol 与 Luna 模型,并对预算进行策略性管理。
Anthropic 发布时隔约一年的 Haiku 层级更新 Claude Haiku 5.5,定价与 OpenAI 的 GPT-6 Luna 一致,同日下调 Sonnet 5.5 缓存读取价格和订阅套餐价格。
推荐理由:除发布本身外,还汇总了第三方评测的 token 消耗与分层定价,便于判断真实成本。
GitHub 发布基于 ModernBERT 的通用密钥检测分类器,用代码上下文在推送前拦截非结构化密钥,候选批量评估耗时不到 2 毫秒,并称可将可拦截的密钥数量提升一倍以上。
Mistral 发布新模型 Mistral Large 4,拥有 1 万亿参数,昵称 Le Chonk,任何人都可使用和定制,目前处于预览阶段,正式版将在月底前推出。
Mistral AI 发布 Mistral Large 4 公开预览,可通过 Mistral Studio 试用预览 API,权重计划于本月底开放。ML4 是 1 万亿参数、52B 激活参数的原生多模态模型,在欧洲自有数据中心的 3,800 块 NVIDIA Grace Blackwell GPU 上从零训练,官方称其在编码、智能体工作流和多模态理解上可与最强开源模型竞争。
推荐理由:官方给出 1 万亿参数、52B 激活的开放权重模型细节与多类基准对比,可据此判断开源前沿模型的能力位置。
GitHub 发布 ReviewBench,一个面向 AI 代码评审的开源离线基准,基于 1.039 亿个 GitHub PR 的语言与仓库规模分布,包含 19 种语言的 219 个公开 PR,金标由人工评审、前沿 LLM 和静态分析等多来源构建。
GitHub 提出 AI 时代开发者应强化的三项技能:学会指挥 AI 智能体而非仅使用 AI、不轻信 AI 的第一次回答、用 AI 节省的时间解决更大问题。文中举例称 GitHub Copilot 内置的 Rubber Duck agent 会用第二个模型审查计划、代码与测试;在认证流程示例中,开发者可同时协调三个 AI 智能体分别产出认证、文档和测试。
Google DeepMind 发布新前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络安全防御者开放,随后逐步向开发者、企业和消费者推出。
推荐理由:原文给出 Argon 在编码与网络安全防御上的基准成绩和 Google 内部落地案例,读者可据此判断前沿模型的能力边界。
GitHub Copilot 提出 canvas——运行在 GitHub Copilot 应用内的全栈小应用,可无浏览器外壳运行、与 agent 双向通信,并能在本地执行代码。
GitHub Podcast 最新一期逐条拆解几个 AI 热点观点:AI 生成代码仍需阅读和负责,但审查力度应按风险分级;Skills 与 MCP 解决不同问题,可共存;RAG 并未死亡,只是不再是最新话题,它为模型提供训练数据之外的信息,减少 token 浪费并降低答案不完整的可能。