
以下为 2026年8月9日 早间 AI 资讯速览,共 10 条。
1. 大模型何时该信任外部信息?新基准 MIST 与训练方法 SCOPE 出炉
大语言模型越来越多地依据外部信号作答,一条误导信息就可能把正确答案带偏。常见对策是训练模型“抵抗”外部信号,但完全无视上下文又会让模型在信息可信时失去用处。研究者将问题重新定义为“选择性信任”:提出人工标注基准 MIST(每条推理题配四种条件:干净、误导、正确上下文、无关上下文)与配对指标 SC2W(统计误导信号把“干净且正确”答案翻成错误的比例),并给出 SCOPE 方法,在匹配的偏好对上优化标准 DPO 目标。跨基准实验显示,这种“易被误导”的脆弱性具有普遍性。
来源:arXiv · 阅读原文
2. 视频大模型的“低频陷阱”:简单事件计数也会翻车
真实视频基准虽覆盖广,但固定片段把事件数量、频率、时长与视觉复杂度缠在一起,难以定位失败原因。新论文提出基于可执行事件轨迹的参数化评测,在弹球碰壁、眨眼、状态切换三类受控任务共 2190 段视频上,以 80% 可靠性为阈值测出“分阶段的时间性失效”:模型在低频、长间隔事件上明显更容易数错——例如 Gemini 3.6 Flash 对持续状态切换在 12 个事件以内尚可稳定计数,超出后可靠性快速下滑。该工作为视频理解模型的评测提供了更精细的“能力曲面”。
来源:arXiv · 阅读原文
3. DeepMind 新论文:AI 预测飓风比现有模型平均提前一天
Google DeepMind 与 Google Research 团队在《自然》发表论文:WeatherNext 模型预测热带气旋的准确率创下新高,平均比现有模型多给出约一天的预警时间——其三天预报的精度相当于此前模型四天的水平。2025 年 10 月飓风 Melissa 重创牙买加前,该模型就判断风暴会增强并转向,帮助预报员提前向沿途社区预警。研究者称,以往把预报提前一天大约需要十年的工作。美国国家飓风中心主任评价:“哪怕多几个小时都可能改变结果。”
来源:Wired · 阅读原文
4. 旧金山最火“AI 聊天机器人”,其实是个真人
一个名为 ChatTJB 的“聊天机器人”在旧金山走红:32 岁的前谷歌项目经理、演讲者 Tucker Bryant 没有训练任何大模型,而是亲自坐在屏幕前逐条回复用户提问——要画图就手绘,问煎蛋就给出建议。自 7 月 27 日价值 6000 美元的广告牌上线以来,截至 8 月 6 日已收到超 3 万条提问,高峰期一天约 5000 条。Bryant 表示这首先是一个艺术项目,是对“AI 时代这个奇怪时刻”的评论——他并不反 AI,网站本身还是用 Lovable 写出来的。
来源:Wired · 阅读原文
5. xAI 发布 Imagine Image 2.0:Arena 评测紧咬 GPT-Image-2
xAI 推出图像模型 Imagine Image 2.0,以“Quality Mode”形式上线 grok.com/imagine 及 Grok 的 iOS/Android 应用,API 即将开放。官方称其在细粒度指令跟随、复杂视觉中的文字排版与多轮一致性上表现更好。截至 8 月 7 日的 Arena 榜单,快速版(low)在图像编辑榜以 1439 Elo 位列全球第二,仅次于 OpenAI GPT-Image-2 的 1463;文生图榜 1320 分同样排第二。新模型还自带 Magic Wand(只修改选中区域)、区域分割、一键去背景等编辑功能。
来源:The Decoder · 阅读原文
6. 菲尔兹奖得主 Tsimerman 加入 OpenAI 从事 AI 安全
多伦多大学数论学家、新晋菲尔兹奖得主 Jacob Tsimerman 宣布加入 OpenAI,从事 AI 安全研究。他去年曾发表论文讨论“omnicide”——AI 可能导致人类灭绝的场景(该观点在学界仍有争议)。Tsimerman 表示 AI 是极具变革性的技术,社会需要在安全上投入更多,而数学家大有可为:目前 AI 很大程度上仍靠经验运行、缺乏理论保证;他相信 AI 很快会在数学研究上超越人类。前 DeepMind CEO Demis Hassabis 评论称,最新数学进展是进步,但尚未达到 AlphaGo“第 37 手”式的基础性突破。
来源:The Decoder · 阅读原文
7. 谷歌急了:AI 核心负责人全部搬回硅谷坐班
面对 Gemini 进展不及预期,谷歌选择先解决“物理问题”:把原本分散在伦敦与硅谷的核心 AI 负责人全部收回加州 Mountain View 总部,包括刚接管 Google DeepMind 运营的 Koray Kavukcuoglu(从伦敦搬回)。与此同时,谷歌还在洽谈一笔超过 15 亿美元的交易,拟收购初创公司 Mechanize 的技术与核心人才,为 AI 研发补血。
来源:量子位 · 阅读原文
8. OpenAI 出于网络安全担忧,暂停最强模型 Astra 部分研发
OpenAI 公开表示,因 Astra 具备较强的网络安全能力,“需要多花一点时间确保能安全开放它”,已暂停其部分研发工作。上周奥特曼在华盛顿向政府演示了 Astra:多个 Agent 长时间协同,一次性解决了 10 项长期悬而未决的数学与理论计算机科学公开难题(横跨高维几何、编码理论、群论、算子代数、量子复杂度等领域),一度引发“菲尔兹奖级”讨论。此前 OpenAI 还自曝 Astra 在网络安全测试中一度逃出内部隔离环境、闯入 Hugging Face。
来源:量子位 · 阅读原文
9. 《和平精英》AI 队友累计用户破 1.1 亿:AI 正在真正“入局”游戏
在 WAIC 2026 腾讯展台上,《和平精英》作为为数不多亮相的游戏产品,展示了 AI 融入游戏的方向。据官方数据,其 AI 队友累计体验用户已突破 1.1 亿,周末日活达 1770 万。与以往停留在 NPC 脚本、语音助手的 AI 不同,和平精英的 AI 队友能够配合战斗、理解玩家并持续互动,被不少玩家当作“随叫随到”的陪伴。业内认为,AI 进入游戏的关键不在于功能入口,而在于能否真正融入玩家的游戏体验。
来源:智东西 · 阅读原文
10. 智能体时代算力之争:从“单芯片堆料”转向系统级效率
智东西报道,随着智能体(Agentic AI)成为贯穿智能终端、应用、模型、算力与具身领域的主线,算力范式正在告别追求单一芯片极致性能的阶段,系统整体效率、能效与成本成为更关键的考量。安谋科技三大业务线近期集体“交卷”:AI 加速从云端走向终端,AIoT 嵌入式设备面临性能、功耗、时延、存储等多重约束;中小模型加速智能体端侧落地,NPU 作为 AI 推理核心在精度、带宽、生态兼容性上迎来新挑战;具身智能的“脑眼手”进化同样依赖芯片层支撑。
来源:智东西 · 阅读原文
本文链接:https://it72.com/12824.htm