AI 日报 | 10-05:上下文交给模型自己管,比手写压缩更准也更省算力

AI 日报 | 10-05:上下文交给模型自己管,比手写压缩更准也更省算力

:fire: 让模型自己管上下文,比手写压缩策略更准,也更省算力。这是今天最值得看的一条。

同一批消息的另一半在政策与产品侧:特朗普把「超级智能」落成一个协调机构,Anthropic 的宗教咨询被曝光,Gemini 免费档要从 10 月 9 日起降一档。

头条 | 别写压缩策略,让模型自己改上下文

Context Language Models 的做法很直接:把上下文当成一个文件,允许模型对它做不受限的更新;多智能体场景下,多个上下文就以文件形式并存。

论文是 arXiv 2609.37725,代码已开源在 facebookresearch/context-language-models,作者里能看到 Nathan Lambert、Pang Wei Koh、Luke Zettlemoyer 等人。

零样本条件下(Mini-SWE-Agent 骨干,对比 MEM1、Self-Compact、ACM、RLM 以及 Codex 式摘要),它给出的是「更准且更省」:BrowseComp-Plus 上准确率更高 11.4%、FLOPs 少 21.5%,12 小时 EdgeBench 分数高 5%、FLOPs 少 59%。

场景 CLM 结果 计算
BrowseComp-Plus(零样本) 准确率高 11.4% FLOPs 少 21.5%
12 小时 EdgeBench(零样本) 分数高 5% FLOPs 少 59%
24 小时多仓库 agent-swarm 同算力改进多 65% 同算力
上下文管理任务(在上下文中学习) 留出准确率最高 +35.9 点 计算减少
Qwen3.5-9B(在线 RL) 28.8 → 42.5 FLOPs 少 12%
Suffix Cache Reuse(服务端) 同等表现 比标准 SGLang 再降 35%

它还试了两种「学习」路径。在上下文中学习,靠自然语言指令、经标准 skill-optimization 循环演化,上下文管理任务留出准确率最高加 35.9 点;在权重中学习,用在线 RL 把 Qwen3.5-9B 在 BrowseComp-Plus 上从 28.8 → 42.5,FLOPs 还少 12%。

Context Language Models 论文总览图

图 1:论文四栏总览,含定性例子、零样本应用、在上下文中学习与在权重中学习。来源:arXiv 2609.37725《Context Language Models》。

另外配了一个服务端方案 Suffix Cache Reuse:同等表现下,服务端计算比标准 SGLang 再降 35%。论文里那张对照图讲的就是这一段。

Suffix Cache Reuse 的服务端计算对比

图 2:标准服务与 Suffix Cache Reuse 在编辑上下文后的重算差别。来源:arXiv 2609.37725《Context Language Models》。

它改变的是工程选择:你还要不要自己实现压缩与检索策略,还是把这件事交给模型。需要留意,全部结果是论文作者自测、没有第三方复现;论文 v1 提交于 9 月 29 日,不是这几天才发布。

政策与伦理:一条落地,一条被曝光

特朗普在 Truth Social 宣布成立「超级智能部队」,称其负责协调联邦政府、确保美国继续在超级智能领域保持领先。要写清它的性质:协调机构,不是监管机构。

人事来自《华尔街日报》的转述——国家情报总监 Jay Clayton 任主席,另三名官员任副主席,任务是在 120 天内就风险与机遇提交报告。TechCrunch 与 The Decoder 都指出,这个名称与实际超级智能技术并无关系。

据《纽约时报》,Anthropic 联合创始人 Chris Olah 过去一年主导与天主教、犹太教、锡克教、福音派等宗教领袖私下会面,讨论模型是否已有意识、以及如何为其灌输道德准则。与会者称他像对待有意识存在那样谈论 Claude,而他本人承认无法确定。

报道还提到 Anthropic 在保密协议下接触神学家与宗教学者,希望他们认可 Claude 具有道德地位;奥尔特曼对此发声批评,其批评原文尚未公开。这条的见报日是 10 月 2 日,不是今天。

政策与伦理两条的要点

图 3:SIF 与 Anthropic 宗教咨询两条的要点与口径。自制信息卡。来源:TechCrunch 转引特朗普 Truth Social 帖、《华尔街日报》转述(10-04);《纽约时报》报道(10-02)。

工具与产品:都在压低门槛,也都在等核实

一个 MIT 许可的开源项目 Strata,让 125B 的 Qwen3.8-Flash-Next 跑到消费级显卡上——项目自述 12GB 以上显存即可,RTX 4090 上约 100 token/s。这些数字目前只有项目自述,没有第三方实测,想用就自己先测一遍。

据第三方报道,自 10 月 9 日起,Gemini Web 与 App 的免费个人用户不再默认提供完整的 Flash 以及 Pro 访问,统一调整为更轻量的 Flash-Lite。目前没有 Google 官方的公告,消息来自第三方转述,「AI Plus 也失去 Pro」这个细节未经确认。

还有一条只有转述来源:GitHarness 把每条需求与对应工作像 Git 提交一样存,用户改需求时从最近有效版本分支、只重做变更部分。作者称在全部 30 个测试设置中优于「简单续跑」,其中一个编码设置的 token 用量少 73.6%。这条目前无论文原文可核,数字请按转述口径看。

三条的共同点是把「能不能跑、怎么跑、花多少」的门槛往下压,但数字分别来自项目自述、第三方转述和 X 转述——都还等第三方实测。

工具与产品三条的口径

图 4:Strata、Gemini 免费档与 GitHarness 三条的口径。自制信息卡。来源:GitHub Niko1221/Strata、Hacker News(10-04);新浪财经、The Decoder、IT之家转述(10-03~10-04);Rohan Paul 转述(10-05)。

速览:另外八条

  • 马斯克称 Grok 4.7 在 Artificial Analysis Cyber Index 登顶,该榜的评测方尚未确认这一说法。来源:马斯克 X(10-05)
  • 马斯克确认 SpaceXAI 将更名为 SpaceXSI,延续「SI」这条改名线。来源:IT之家(10-04)
  • 微软为 20 多个数据中心项目引入「仿生」计划,恢复原湿地生态、种植本土植物。来源:IT之家(10-04)
  • 人形机器人笼斗赛被加州监管叫停,州立体育委员会已发出停止令。来源:IT之家(10-04)
  • 新泽西副州长称把调查报告喂给多个 AI 平台、共 59 次询问,无一家认定存在性骚扰。来源:The Verge(10-05)
  • 乐山大佛管委会辟谣「掏耳朵」视频,称系 AI 生成的不实信息。来源:IT之家(10-04)
  • 一项研究结论:个人智能体的记忆笔记超过一定限度反而让智能体违反规则,计数追踪类需求应改用代码。来源:经 Rohan Paul 转述(10-05)
  • 星际争霸赛事后续:GPT-6 Astra 与 Claude Opus 5.5 表现相当,但都打不过人类做的机器人。来源:The Verge(10-04)

积木观察

把今天这几条放在一起看,智能体的状态管理正在从「靠模型隐式记忆」变成显式机制:CLM 把上下文当文件,GitHarness 把需求当提交,连速览里那条研究都在说记忆不是越多越好。

如果你在做长时程 agent,建议先读 CLM 的对照条件,再决定要不要把手写的压缩逻辑换成「让模型自己管」;也可以先拿它那两个指标——准确率与 FLOPs——量一遍自己现在的方案。

结尾互动

你的智能体现在是自己写压缩策略,还是已经交给模型管了?评论区聊聊。

来源链接

官方来源

独立来源

  • SIF 人事:《华尔街日报》转述(10-04)
  • Anthropic 宗教咨询:《纽约时报》(10-02),经 IT之家、The Decoder 等转述
  • Gemini 免费档调整:新浪财经、The Decoder、IT之家转述(10-03~10-04),尚无官方公告
  • GitHarness:经 Rohan Paul 转述(10-05;论文原文尚未公开)