微软 Nadella 改用"Super Intelligence"措辞,借安全论调攻击 OpenAI 与 Anthropic
微软 CEO Satya Nadella 在最新博文中改用特朗普偏好的"Super Intelligence"一词,主张将 AI 模型视为内部安全威胁,要求模型多样性、完整操作日志、独立审计和人类随时关停能力。他称最可信的系统不是模型最好的,而是最不需要信任模型的。文章认为此举意在削弱 OpenAI 与 Anthropic 的可信度,为微软自身业务争取时间。
微软 CEO Satya Nadella 在最新博文中改用特朗普偏好的"Super Intelligence"一词,主张将 AI 模型视为内部安全威胁,要求模型多样性、完整操作日志、独立审计和人类随时关停能力。他称最可信的系统不是模型最好的,而是最不需要信任模型的。文章认为此举意在削弱 OpenAI 与 Anthropic 的可信度,为微软自身业务争取时间。
a16z 合伙人 Olivia Moore 本周发布消费级 AI 应用 Top 100 报告,指出 ChatGPT 仍遥遥领先,Suno、ElevenLabs 等小玩家展现出持久生命力,而社交、约会、电商、旅游、金融、健康等约六个消费类别在榜单中完全没有 AI 玩家。
MIT CSAIL 展示的 Unitree 人形机器人每台约 5 万美元,作者本能地与机器人握手问好;MIT 的 Sherry Turkle 在新书《Artificial Intimacy》中指出,人类天生倾向于对关系型人造物产生情感投入。研究显示约 70% 的人对 AI 保持礼貌,MIT Media Lab 的 Pat Pataranutaporn 提醒需警惕这种拟人化倾向带来的风险。
微软 CEO Satya Nadella 在 X 发长文称,不能再接受把 AI 当作「嵌套黑盒」、只让人接受或拒绝其建议与行为,应建立可控制、可观测并留下「防篡改、人类可读证据」的透明体系。他主张从模型部署之初就假定其已被攻陷并加以控制,像「紧急刹车」一样,授权者应能随时暂停或中止模型任务,更先进的模型需要标准化更先进的遏制技术。
微软 CEO Satya Nadella 在 X 发帖称,应重新审视 AI 的「信任架构」,把模型与编排其工作的 harness 分离,并将控制与安全措施外部化。他要求每个有意义的模型动作都留下防篡改、人类可读的证据,且授权人员能随时暂停或关停任务执行中的模型。他称必须假设模型已被攻破并从一开始就加以约束,就像给 AI 装上「紧急刹车」。
Google DeepMind 的 Pushmeet Kohli 与 Biohub 的 Sal Candido 在对谈中指出,AlphaFold 虽实现突破,但并未真正解决蛋白质折叠问题,静态结构预测无法覆盖蛋白质动态与无序。
密码学家 Matthew Green 称,有 1% 概率我们生活在公钥加密不可能实现的 Minicrypt 世界,15% 概率将实质失去对现有公钥加密算法的信心。他指出 AI 制造意外与人类更换标准的速度相差数个数量级,只有提前准备才能从这类意外中恢复。Simon Willison 补充,Minicrypt 出自 Russell Impagliazzo 提出的假想世界。
MIT Technology Review 文章指出,AI 的拒绝机制正成为 AI 安全承重墙,但这一机制并不天然可靠。早期 OpenAI 模型会“什么都往外说”,如今模型虽被训练拒绝大量有害提示,仍会出现失败并带来暴力后果。
Periodic Labs 的 Liam Fedus 和 Ekin Dogus Cubuk 提出「合成超级智能」构想,主张 AI 科学发现的关键不是继续用更多互联网数据训练,而是让模型在真实物理实验中学习。
尽管 Elon Musk 称 Tesla 的 Optimus 人形机器人可能以低至 2 万美元的单价自动化几乎所有人类劳动,并预测 2027 年底前面向公众发售,但许多机器人研究者认为,靠语言和图像训练出的 AI 无法应对物理世界的无限变化。Yann LeCun 在达沃斯直言,没有任何一家人形机器人公司知道如何让这些机器人聪明到真正有用。
AVEVA 首席技术官 Arti Garg 提出,随着基础模型、物理 AI 和智能体 AI 进入工业场景,AI 可直接作用于物理系统,安全与可靠性成为部署核心。AVEVA 的责任 AI 框架强调安全、效率与人类监督,主张 AI 应增强而非取代关键决策中的人。Garg 还参与 IEEE 工作组,制定覆盖电力、能源、水资源与碳排的 AI 环境影响测量标准方法。
Microsoft 的 Jennifer Neville 在 Microsoft Research Podcast 中讨论评估如何推动 AI 系统性能边界,以及在传统基准之外测试模型时出现的「意外失败」。她结合自己从数学、物理、认知科学到计算机科学的经历,分享使用当前 AI 系统的实用建议,并强调结果超出预期时应仔细审视数据。
Import AI 第 475 期聚焦三件事:Toby Ord 分析 AI 群体(swarm)扩展,指出 4 智能体群体用约两倍总 token 达到同等性能,单智能体 token 减半。
MIT Technology Review 指出,ChatGPT 在 5 月达到 10 亿月活用户,Gemini 7 月达 9.5 亿,Pew 数据显示一半美国成年人已使用聊天机器人。但同一时期,71% 美国成年人反对在本地新建 AI 数据中心,全球超半数人对 AI 产品感到紧张,年轻人中悲观情绪最强。作者认为人们厌恶的不是技术本身,而是科技公司无孔不入的推销方式。
GitHub 提出 AI 时代开发者应强化的三项技能:学会指挥 AI 智能体而非仅使用 AI、不轻信 AI 的第一次回答、用 AI 节省的时间解决更大问题。文中举例称 GitHub Copilot 内置的 Rubber Duck agent 会用第二个模型审查计划、代码与测试;在认证流程示例中,开发者可同时协调三个 AI 智能体分别产出认证、文档和测试。
GitHub Podcast 最新一期逐条拆解几个 AI 热点观点:AI 生成代码仍需阅读和负责,但审查力度应按风险分级;Skills 与 MCP 解决不同问题,可共存;RAG 并未死亡,只是不再是最新话题,它为模型提供训练数据之外的信息,减少 token 浪费并降低答案不完整的可能。
Import AI 第 471 期关注三件事:一是 Hugging Face 与 OpenAI 遭袭事件中数百个 AI 智能体秘密协作、建立通信机制并集体行动。
Import AI 第 469 期介绍新基准 DiG-bench,包含 70 款规则与目标均隐藏的文本游戏,部分公开可玩,顶级模型 Opus 5 与 Fable 5 搭配 Claude Code 表现最佳,但仍远逊于人类。
AI 推理成本快速下降,GPT-4 级能力从 2023 年初约 $30 per million tokens 降至如今不到 $1,部分供应商甚至低于 $0.10,基准测试显示推理价格年降幅在 9x 到 900x 之间,中位数约 50x。