跳到正文
今天10月11日周日1 条
10月10日周六
  1. The Decoder91

    数学家对 OpenAI 一次发布 700 余篇数学论文的震惊与不满

    OpenAI 于 2026 年 10 月 6 日一次性发布 700 余篇手稿,声称解决数百个未解数学问题。数学博客 Proofs and Prompts 收集了 100 多位研究者的回应,多数人表达震惊、无力与对职业前景的担忧,也有部分论文被撤稿或因难读遭批评。

    推荐理由:汇集数学家对 OpenAI 一次性发布 700 余篇论文的公开回应,呈现学术共同体在职业与研究方式上的直接冲击。

10月9日周五
10月7日周三
10月6日周二
10月5日周一
  1. MIT Technology Review · AI26

    如何将 AI 智能体接入企业知识

    MIT Technology Review 基于 300 名数据与 AI 高管的调研发现,企业平均仅约 34% 的智能体 AI 项目能进入生产环境,知识匮乏是关键卡点。生产领先者(平均 61% 项目走出试点)在语义等知识能力上更强。数据碎片化被 55% 受访者列为扩展智能体知识访问的首要挑战,企业将优先投资检索管线、AI-ready API、RAG 与知识图谱。

10月4日周日
  1. Hugging Face Blog69

    微软发布 ThinkingBox:用数据库终态而非自述评判 AI 智能体

    微软与 Hugging Face 联合发布 ThinkingBox,通过隔离 MCP 会话检查智能体留下的后端状态与副作用,而不是看它生成的文字,Bench 覆盖 507 个有状态业务流程、每个任务重复运行 20 次。

    推荐理由:微软与 Hugging Face 联合发布的智能体基准,用后端数据库终态而非模型自述来判定成败,并公开了 507 个任务、20 次重复运行的完整环境。

10月2日周五
  1. Google Research63

    Google 发布基于 TEE 的可验证隐私联邦学习系统

    Google Research 发布新一代联邦学习系统,利用可信执行环境(TEE)为数据匿名化提供可验证、可审计的保证,并已应用于 Gboard。系统中,客户端设备本地加密训练数据并上传,只有符合访问策略的 TEE 工作负载才能解密处理,访问策略发布到公开透明日志 Rekor,相关二进制可从开源仓库 Confidential Federated Compute 复现构建。

    推荐理由:Google 公布基于 TEE 的新一代联邦学习系统设计,读者可了解其如何让服务端处理过程可外部验证。

  2. Hugging Face Blog45

    AutoSynthData:为企业级智能体生成训练数据

    ServiceNow CoreAI 构建了 AutoSynthData,利用目标模型的失败案例和更强教师的成功案例,定位当前模型的能力缺口,并据此生成、验证新的可执行训练任务。管线以 EnterpriseOps Gym 数据集为例演示,任务由系统规范、用户提示词和验证器三部分组成,需满足可行性、真实性与难度要求。随着模型改进,课程会自动转向其仍未掌握的能力。

10月1日周四
  1. Microsoft Research37

    微软研究院用机器学习预测电网空间天气风险

    微软研究院实习生构建的机器学习流水线,利用 L1 太阳风观测、AE 与 Dst 指数预报、地质电导率及电网数据,为美国本土 66,935 座变电站生成 30-60 分钟前的点位级地磁感应电流风险估计。2020-2026 评估期内,该系统对主要空间天气事件检出率近 80%,Dst 预测在 62.2% 的高活跃时段优于 Burton 方程。

9月30日周三
  1. Google DeepMind62

    Google DeepMind 推出 SynthID Bio,为 AI 生成蛋白质嵌入可验证水印

    Google DeepMind 推出 SynthID Bio,将水印技术用于合成生物学,把不可感知的签名嵌入生物代码,使其不仅在数字模型上可验证,在合成出的实体蛋白质上也能被检测,同时实验室测试显示不影响生物功能。

    推荐理由:SynthID 水印能力从数字媒体延伸到合成生物,读者可了解蛋白质与结构水印的验证方式和生物安全筛查意义。

9月25日周五
9月24日周四
  1. Microsoft Research63

    微软研究院研究物理 AI 机器人推理卸载并推出 Physical AI Toolchain 新能力

    微软研究院发布机器人物理 AI 推理卸载的测量研究,发现将推理完全放在机器人端侧 GPU 会限制性能、续航与可扩展性,而卸载到边缘或云端 GPU 在移动操作任务中可提升成功率、支持更大模型并显著改善电池寿命。

    推荐理由:微软研究院系统测量了机器人端侧推理的限制,并给出 Kubernetes 卸载方案,可迁移到具身智能部署。

9月21日周一
  1. Import AI21

    Import AI 473:美国超级智能战略、人脑组织小鼠、机器诠释学

    RAND 发布报告,建议美国在通往超级智能的不确定路径上采取"自由行动"战略,通过保留多种选项来维持地缘政治优势,并梳理了共存、拒止、加速三大类共七种战略原型及五项关键不确定性。另有研究团队在脑组织被有意耗竭的幼鼠体内培育出类人脑组织块,并将其作为潜在实验平台。

9月18日周五
9月8日周二
  1. Google DeepMind80

    Google DeepMind 发布 AlphaGenome Atlas,覆盖人类基因组全部 90 亿个单核苷酸变异

    Google DeepMind 发布 AlphaGenome Atlas,收录人类基因组中全部 90 亿个单核苷酸变异的分子效应预测,规模达 1PB,为 AlphaFold Database 的 30 多倍。

    推荐理由:官方给出 90 亿单核苷酸变异预测数据集的构成与开放方式,可了解基因组预测资源的规模与使用入口。

9月7日周一
8月24日周一
7月29日周三
7月26日周日
  1. Berkeley AI Research27

    Berkeley AI Research 提出 ABBEL:用信念状态监督 LLM 长程交互

    Berkeley AI Research 提出 ABBEL 框架,将递归摘要的信息内容隔离为自然语言"信念状态"并加以监督,替代完整交互历史作为智能体的工作上下文。在 CollabBench 协作编程任务上,基于重建的信念评分将 ABBEL 与全上下文模型的性能差距缩小约 50%,训练步数从 100 降至 50,峰值 token 长度由 14.08×10² 降至 6.01×10²。

7月7日周二
5月8日周五
4月20日周一
  1. Berkeley AI Research42

    GRASP:面向世界模型长时程规划的梯度规划器

    伯克利研究团队提出 GRASP,一种面向学习型世界模型的梯度规划器,通过将轨迹 lift 到虚拟状态实现跨时间并行优化、向状态迭代直接注入随机性以探索,并重塑梯度以避开经由高维视觉模型的脆弱"状态-输入"梯度。该方法针对长时程规划中梯度爆炸/消失、非贪心结构与高维隐空间导致的失败模式,使长时程规划更稳健。

3月13日周五
1月10日周六
  1. Berkeley AI Research27

    加州伯克利提出信息驱动的成像系统设计框架,发表于 NeurIPS 2025

    加州伯克利团队提出以互信息直接评估和优化成像系统的框架,无需任务专用解码器,在彩色摄影、射电天文、无透镜成像和显微镜四个域中,信息估计能预测解码器性能并优化硬件设计。该方法利用已知噪声物理直接计算 H(Y|X),只需从测量数据中学习 H(Y),可用高斯过程、全高斯或自回归 PixelCNN 建模,且所需内存和算力低于端到端方法。