arXiv 因 AI 论文洪流限制每人每月投稿两篇
arXiv 宣布自 2026 年 10 月 1 日起每人每个日历月最多投稿两篇,2024 年起实施的同时最多三篇活跃投稿的限制继续保留。该限制适用于所有分类且只针对投稿人,共同作者不受影响,被拒稿件仍计入额度,但作者在发表前删除可退回名额。
arXiv 宣布自 2026 年 10 月 1 日起每人每个日历月最多投稿两篇,2024 年起实施的同时最多三篇活跃投稿的限制继续保留。该限制适用于所有分类且只针对投稿人,共同作者不受影响,被拒稿件仍计入额度,但作者在发表前删除可退回名额。
OpenAI 于 2026 年 10 月 6 日一次性发布 700 余篇手稿,声称解决数百个未解数学问题。数学博客 Proofs and Prompts 收集了 100 多位研究者的回应,多数人表达震惊、无力与对职业前景的担忧,也有部分论文被撤稿或因难读遭批评。
推荐理由:汇集数学家对 OpenAI 一次性发布 700 余篇论文的公开回应,呈现学术共同体在职业与研究方式上的直接冲击。
Google DeepMind 的 Pushmeet Kohli 与 Biohub 的 Sal Candido 在对谈中指出,AlphaFold 虽实现突破,但并未真正解决蛋白质折叠问题,静态结构预测无法覆盖蛋白质动态与无序。
哈佛大学研究人员 Fiona Chen 与 James Stratton 基于 Jellyfish 聚合数据,分析了 2021 年至 2026 年 3 月间 700 多家软件开发企业、逾 70 万名员工的 3 亿条工作事件,发现 AI 编码工具虽能生成大量可用代码,却几乎没有证据显示企业因此提高了软件产出或减少了用工。
Periodic Labs 的 Liam Fedus 和 Ekin Dogus Cubuk 提出「合成超级智能」构想,主张 AI 科学发现的关键不是继续用更多互联网数据训练,而是让模型在真实物理实验中学习。
NVIDIA 团队从 Nemotron 3 出发,用监督微调、强化学习与反馈式推理打造专精模型,在 IOI 2026 拿到 535.4/600,在 IMO 2026 拿到 30/42,两者都超过官方金牌线。
Google Research 用 Google Earth AI 的 Population Dynamics Foundation Model(PDFM)位置嵌入,在无需任务微调的情况下接入现有流行病学模型。
Google 发布了一份关于智能体隐私与安全的新 workshop 报告,由 50 多位学界与业界人士在 2025 年底于纽约举行的 Google CAPS Workshop 上协作完成。
GitHub 发布 ReviewBench,一个面向 AI 代码评审的开源离线基准,基于 1.039 亿个 GitHub PR 的语言与仓库规模分布,包含 19 种语言的 219 个公开 PR,金标由人工评审、前沿 LLM 和静态分析等多来源构建。
MIT Technology Review 基于 300 名数据与 AI 高管的调研发现,企业平均仅约 34% 的智能体 AI 项目能进入生产环境,知识匮乏是关键卡点。生产领先者(平均 61% 项目走出试点)在语义等知识能力上更强。数据碎片化被 55% 受访者列为扩展智能体知识访问的首要挑战,企业将优先投资检索管线、AI-ready API、RAG 与知识图谱。
微软与 Hugging Face 联合发布 ThinkingBox,通过隔离 MCP 会话检查智能体留下的后端状态与副作用,而不是看它生成的文字,Bench 覆盖 507 个有状态业务流程、每个任务重复运行 20 次。
推荐理由:微软与 Hugging Face 联合发布的智能体基准,用后端数据库终态而非模型自述来判定成败,并公开了 507 个任务、20 次重复运行的完整环境。
Google Research 发布新一代联邦学习系统,利用可信执行环境(TEE)为数据匿名化提供可验证、可审计的保证,并已应用于 Gboard。系统中,客户端设备本地加密训练数据并上传,只有符合访问策略的 TEE 工作负载才能解密处理,访问策略发布到公开透明日志 Rekor,相关二进制可从开源仓库 Confidential Federated Compute 复现构建。
推荐理由:Google 公布基于 TEE 的新一代联邦学习系统设计,读者可了解其如何让服务端处理过程可外部验证。
ServiceNow CoreAI 构建了 AutoSynthData,利用目标模型的失败案例和更强教师的成功案例,定位当前模型的能力缺口,并据此生成、验证新的可执行训练任务。管线以 EnterpriseOps Gym 数据集为例演示,任务由系统规范、用户提示词和验证器三部分组成,需满足可行性、真实性与难度要求。随着模型改进,课程会自动转向其仍未掌握的能力。
微软研究院实习生构建的机器学习流水线,利用 L1 太阳风观测、AE 与 Dst 指数预报、地质电导率及电网数据,为美国本土 66,935 座变电站生成 30-60 分钟前的点位级地磁感应电流风险估计。2020-2026 评估期内,该系统对主要空间天气事件检出率近 80%,Dst 预测在 62.2% 的高活跃时段优于 Burton 方程。
Google DeepMind 推出 SynthID Bio,将水印技术用于合成生物学,把不可感知的签名嵌入生物代码,使其不仅在数字模型上可验证,在合成出的实体蛋白质上也能被检测,同时实验室测试显示不影响生物功能。
推荐理由:SynthID 水印能力从数字媒体延伸到合成生物,读者可了解蛋白质与结构水印的验证方式和生物安全筛查意义。
Hugging Face 发布 Open TTS Leaderboard,用 WER/CER、RTFx、TTFA 和 WavLM 说话人相似度等客观指标评测开源与多语言 TTS 模型,单模型评测从数周投票缩短到数小时。
Google Research 提出 Diffusion Controller 框架,把扩散模型的去噪过程重构为连续控制问题,主模型完全冻结,仅附加一个轻量"转向阻尼"网络对生成轨迹做微调。
Google Research 发布 AI video co-director 等四个框架,构建在 Gemini 和 Veo 之上,用于自动化生成连贯的多镜头长视频。
微软研究院发布机器人物理 AI 推理卸载的测量研究,发现将推理完全放在机器人端侧 GPU 会限制性能、续航与可扩展性,而卸载到边缘或云端 GPU 在移动操作任务中可提升成功率、支持更大模型并显著改善电池寿命。
推荐理由:微软研究院系统测量了机器人端侧推理的限制,并给出 Kubernetes 卸载方案,可迁移到具身智能部署。
Microsoft Research 在 Nature 发表逆合成预测框架 RetroChimera,该框架结合 Transformer 模型 R-SMILES 2 与 GNN 模型 NeuralLoc,用学习式集成重排序整合两者的预测结果。
RAND 发布报告,建议美国在通往超级智能的不确定路径上采取"自由行动"战略,通过保留多种选项来维持地缘政治优势,并梳理了共存、拒止、加速三大类共七种战略原型及五项关键不确定性。另有研究团队在脑组织被有意耗竭的幼鼠体内培育出类人脑组织块,并将其作为潜在实验平台。
Google Research 公布一项新研究实验,让教师借助生成式 UI(GenUI)为课程动态生成定制互动教育模拟,并已向可信测试教师群体获得初步正面反馈。
Google DeepMind 发布 AlphaGenome Atlas,收录人类基因组中全部 90 亿个单核苷酸变异的分子效应预测,规模达 1PB,为 AlphaFold Database 的 30 多倍。
推荐理由:官方给出 90 亿单核苷酸变异预测数据集的构成与开放方式,可了解基因组预测资源的规模与使用入口。
Google DeepMind 发表论文,让 100 个运行 Gemini 3.1 Pro 的自主智能体尝试解决 Formal Conjectures 数据集中的 71 道数学题。
METR 分析显示 AI 对科学的加速并不均衡:2026 年 cURL、OpenSSL、Firefox 等项目的漏洞报告速度较 2025 年大幅加快,数学领域只是小幅加速,而 AI 研究本身的算法进展尚无可测加速。
伯克利 Sky Lab 团队为进化式 kernel 搜索框架 K-Search 新增 MLX 后端,通过结构化 CUDA-to-MLX 翻译层,把已有 CUDA kernel 当作知识库改编为 Apple Silicon 上的原生 kernel,而非从头重写。
Berkeley AI Research 提出 ABBEL 框架,将递归摘要的信息内容隔离为自然语言"信念状态"并加以监督,替代完整交互历史作为智能体的工作上下文。在 CollabBench 协作编程任务上,基于重建的信念评分将 ABBEL 与全上下文模型的性能差距缩小约 50%,训练步数从 100 降至 50,峰值 token 长度由 14.08×10² 降至 6.01×10²。
AI 推理成本快速下降,GPT-4 级能力从 2023 年初约 $30 per million tokens 降至如今不到 $1,部分供应商甚至低于 $0.10,基准测试显示推理价格年降幅在 9x 到 900x 之间,中位数约 50x。
Berkeley AI Research 梳理了并行推理领域进展,重点分析自适应并行推理——让模型自行决定何时分解并行、生成多少并发线程并协调它们,而非由外部框架固定并行结构。
伯克利研究团队提出 GRASP,一种面向学习型世界模型的梯度规划器,通过将轨迹 lift 到虚拟状态实现跨时间并行优化、向状态迭代直接注入随机性以探索,并重塑梯度以避开经由高维视觉模型的脆弱"状态-输入"梯度。该方法针对长时程规划中梯度爆炸/消失、非贪心结构与高维隐空间导致的失败模式,使长时程规划更稳健。
伯克利 AI 研究团队提出 SPEX 与 ProxySPEX 算法,可在特征、数据和模型组件归因中大规模识别驱动 LLM 行为的关键交互。SPEX 利用稀疏性与低阶性把交互搜索转化为稀疏恢复问题,ProxySPEX 进一步借助层级结构,以约 10 倍更少的消融实验达到 SPEX 的性能。
加州伯克利团队提出以互信息直接评估和优化成像系统的框架,无需任务专用解码器,在彩色摄影、射电天文、无透镜成像和显微镜四个域中,信息估计能预测解码器性能并优化硬件设计。该方法利用已知噪声物理直接计算 H(Y|X),只需从测量数据中学习 H(Y),可用高斯过程、全高斯或自回归 PixelCNN 建模,且所需内存和算力低于端到端方法。