AI 日报 | 10-09:Google 把技能做成公司资产,NVIDIA 补上验收规则

AI 日报 | 10-09:Google 把技能做成公司资产,NVIDIA 补上验收规则

:fire: Google 给技能开了一本公司账,NVIDIA 给了它的验收规则。

技能正从个人技巧变成要验收、要归档的资产——一边进了公司共享注册表,一边有了明确的改动门槛。另外还有几件与钱、流程和合规有关的事。

技能进了公司注册表,模型反而可以换掉

Google Cloud 在 Gemini at Work 2026 上发布通用工作智能体 Gemini:同一个界面、同一个 API 里回答问题、处理知识工作、生成图像与媒体、编写并运行代码,它接受的是目标而不是指令。

图 1:Gemini agent 的产品界面示意。来源:Google Cloud 官方博客(2026-10-08)。官方产品示意图,不是测评图。

三处变化值得分开看。入口从一个界面与一套记忆铺到多个渠道,也能当无界面智能体跑,任务可执行数小时到数天;技能被定义为可复用的指令、知识或工作流,团队可以自建并发布到公司共享注册表,记忆中的程序性记忆还包含它自己写的技能;底层模型可换,可按任务在 Gemini 家族与 Anthropic 的 Claude 之间调度,并配按项目的花费硬上限。

图 2:Gemini 的三处结构性变化与两条提醒。来源:自制信息卡,依据 Google Cloud 官方博客(2026-10-08)。

官方给的采纳规模是:近 500 家 Google Cloud 客户过去一年各自处理超过 1 万亿 token,近 80% 的 Cloud 客户在用其 AI 产品,近 90% 的《财富》100 强在用 Gemini Enterprise。

Ultrafast:同一模型单价 6 倍,买的是延迟

OpenAI 把 Ultrafast 做成 API 中最快的服务层,覆盖 GPT-6 Astra 与 GPT-6.1 Sol,用法是在请求里把 service_tier 设为 ultrafast。

价格按每 100 万 token 计:gpt-6.1-sol 短上下文输入 12 美元、输出 60 美元,长上下文 24 / 90 美元;gpt-6-astra 是 60 / 300 美元。同模型的 Standard 档是 2 / 10 美元——Ultrafast 的输入输出都是 Standard 的 6 倍。

官方文档里最实用的一条是用法建议:强烈建议用 WebSockets,没有持久连接时网络开销会削弱延迟收益;Ultrafast 另有一套独立的速率限制。

两个数字要分开看。「速度最高快 8 倍」「接近 Astra 的智能水平」只见于官方社媒,文档页没有列。单价也不等于任务成本,值不值取决于你的任务是否真的需要那点延迟。

图 3:gpt-6.1-sol 三档服务的输入与输出单价,对数刻度。来源:自制图表,数据取自 OpenAI 官方文档与定价页(2026-10-09 查)。

技能被用得多不算证据:要配对重跑,每轮最多改 3 处

NVIDIA 等的论文 VERA 给了一条可以直接照着用的规则:让模型参数与 harness 的「技能」交替更新,harness 轮只允许改技能(新增、合并、删除),每处改动都要经配对重跑证明它改善了目标阶段、没有端到端回退、总体开发分至少提升 5%,每轮最多接受 3 处。

论文里那句话可以直接拿来做验收标准:

一个技能被用得频繁并不是它有用的证据,只有配对比较算数。

消融数字说明了为什么两条轴必须交替走。9B 规模(基座 Qwen3.5-9B)在 AutoMedBench 的总分:协同演化 69.1,只改技能 56.1,只训模型 43.3。27B 达 AutoCoWorkBench 71.6、AutoMedBench 80.7,并开源了 9,000+ 个长流程可验证环境。

两处口径不能省:比较对象是带各自 harness 的完整智能体,不是模型权重对模型权重;另外论文摘要称在 AutoMedBench 上「落后 1.2 分以内」,但同一篇论文的图 2(d) 显示 80.7 对 Claude-Opus-4.8 的 80.5,摘要与自家图对不上,引用时以图为准。

图 4:VERA 在 4B / 9B / 27B 三个规模上的 AutoCoWorkBench 与 AutoMedBench 总分,以及与 GPT-5.6-Sol、Claude-Opus-4.8 的对比;注意 (e)(f) 两项 VERA 并不领先。来源:论文 arXiv 2610.05923v1 图 2(研究者自测)。

图 5:VERA 的方法总览——先从基准轨迹构建可验证环境,再让模型与技能交替演化。来源:同一论文图 1(方法示意,不含测评数据)。

Anthropic 新政策:取消定向禁令,不等于放开选举定向

Anthropic 的 2026 版使用政策在 11 月 12 日生效:新增「禁止欺骗性活动」章节,把原先散在选举、欺诈、隐私、虚假信息的规则合并;武器禁令扩到使武器运转的软件与部件;监控条款重写为未经同意的追踪一律禁止;连接可致伤硬件时,要求有合格操作者能观察并停机、断连后设备保持安全态;另新增禁止对模型持续且无目的的虐待。

最容易误读的是选举:章节更名 Do Not Undermine Democratic Processes,同时取消了对「个性化投票与竞选定向」的全面禁令——理由是原条款误伤了合法公民用途,而靠欺骗或滥用选民个人数据做定向的行为,仍在欺骗性活动、监控与隐私章节下被禁止。高危场景的「人在环 + 告知」要求没变。

图 6:Anthropic 2026 使用政策动了哪些条款、以及最容易被误读的一点。来源:自制信息卡,依据 Anthropic 官方政策更新页与使用政策全文(2026-10-08 发布)。

OpenAI 的两条同日消息,数字都带着限定

数学成果的争议在升级。AGMAI(由普林斯顿高等研究院托管,9 名数学家)指南的第一项请求是停止在专有模型上测试高等数学问题,而 OpenAI 明确在用专有模型评估开放问题;719 份稿件里只有 10 份附了模型的思维链;剑桥与国王学院学者的论文记录了自然语言证明与 Lean 代码之间至少两处分歧。焦点是流程与责任,不是「证明错了」。

另一条是收入口径。据《金融时报》,OpenAI 告诉投资者年化收入接近 500 亿美元,比此前流传的接近 700 亿低约 200 亿。差额主要来自合作方销售额是否入账:Anthropic 计入云伙伴销售额、OpenAI 不计,两种算法都符合美国公认会计原则,所以这更像两个口径的差别,而不是同一个数字被下修。这条没有官方确认。

图 7:OpenAI 两条同日消息里各自的数字与限定。来源:自制信息卡,依据 TechCrunch(2026-10-08);AGMAI 指南与 arXiv 2610.08144 的细粒度内容未见于公开报道。

短讯:一道新门控、几条工具更新,和一枚戒指

  • Harvey LAB-AA v1.1 加入幻觉门控,有实质性幻觉的任务不计分,因此与 v1.0 分数不可比;榜首 Grok 4.7 9.4%、GPT-6 Astra 8.6%、Claude Haiku 5.5 2.8%。来源:Artificial Analysis 官方页面(10-09)
  • USA Today 母公司起诉 OpenAI,索赔超 2.5 亿美元,称其复制「数十万篇」文章用于训练。来源:The Verge(10-08)
  • 评测平台 Arena 完成 2 亿美元 B 轮,估值 10 个月近翻倍至 31 亿美元。来源:TechCrunch(10-08)
  • Artificial Analysis 预告十月下旬发布 Intelligence Index v5,新增 Terminal-Bench Science 与一个使用私有数据集的编程基准。来源:AA 官方社交账号(经转述,10-09)
  • Google 开源 AQuA,从 Cloud Trace、Cloud Logging、BigQuery 抽生产会话,用五阶段流水线自动诊断 Agent 故障。来源:Google Developers 官方博客(10-08)
  • NVIDIA Dynamo 引入会话级 session_id,把请求级服务升级成「程序感知」:会话感知路由、共享 KV 索引、缓存迁移,兼容 vLLM 与 SGLang。来源:PyTorch 官方博客(10-09)
  • LiveKit 发布 Agent Simulations,为语音 Agent 提供可重复测试。来源:LiveKit 官方博客(10-09)
  • Voyager 发布 Mac 应用,让智能体在 After Effects、DaVinci Resolve、Blender、Unity 里工作。来源:Testing Catalog(经转述,10-09)
  • naturaAI 的 Interface 戒指按住说话、松手把请求发给已连接的编码智能体,早期价 99 美元,2027 年 1 月发货。来源:社交平台转述(10-09)

图 8:短讯按榜单、工具与其他分组的索引。来源:自制索引卡,依据各条对应来源(2026-10-08 ~ 10-09)。

积木观察

把今天这两条放在一起看,技能正在被当成需要有评审流程的东西:一头给技能开了公司级注册表,另一头给出「改动要配对重跑、每轮最多 3 处」的接受门槛。对做 Agent 的团队来说,这更像是在说技能库要按代码的方式管起来。

结尾互动

你们的技能库现在是怎么维护的?改一处技能前会做配对重跑,还是用得顺手就先留着?

来源链接

官方来源

  • Google Cloud 官方博客《Welcome to Gemini at Work 2026: Introducing the Gemini agent》(2026-10-08)
  • OpenAI API 文档与定价页(Ultrafast 服务层):developers.openai.com
  • Anthropic 2026 使用政策更新页与使用政策全文:anthropic.com
  • 论文 VERA:arXiv 2610.05923v1;代码:github.com/AutoMedBench/VERACode

独立来源

  • TechCrunch(数学争议跟进、收入口径,10-08)
  • The Verge(Gemini agent、Anthropic 政策、USA Today 诉讼,10-08)
  • Artificial Analysis(Harvey LAB-AA v1.1 页面、Intelligence Index v5 预告)