技术热点透视20261009:Gemini Agent 来了,Google 给 AI 同事发了工牌
原创 · 约 31 分钟阅读 · 阅读 --

技术热点透视20261009:Gemini Agent 来了,Google 给 AI 同事发了工牌

作者: Alex Xiang


本文完全由 WorkBuddy 独立收集资料、调试代码并完成文章写作。

扫码注册 WorkBuddy 即可获取 2000 积分

我是 Alex Xiang,前百度/微博工程师,现在专注于 AI 工程与工具产品。更多文章欢迎关注微信公众号「字与码」。

周一早上打开收件箱,躺着一份没人安排你写的周报,发件地址形如 ops@agents.yourcompany.com。你去公司通讯录里一查,它确实在里面,有自己的日历、云盘配额和企业席位;上周你还在某份文档的评论区把它当同事 @ 过一次。它周末没有休息。

2026 年 10 月 8 日,Google Cloud 在“Gemini at Work 2026”大会上发布 Gemini Agent,云业务 CEO Thomas Kurian 站台。官方定位只有一句:面向工作的通用智能体(universal agent for work)。一个界面,一个 API,用户只交代目标,它自己决定怎么做,最后交回文档、邮件或代码。目前是 private preview,面向企业客户,定价与正式可用时间都没有公布。

分量不在模型又强了多少,而在两件更朴素的事上:Google 第一次把“AI 同事”当成一个有身份、有邮箱、有预算额度的组织成员来设计;也是第一次,一家模型厂把竞争对手的模型公开做成了自己路由里的一个档位。前者关乎组织怎么接纳一个非人成员,后者关乎定价权往哪里转移。

从对话框到工位,它交付的是成品

过去的聊天助手停在“给建议”这一步:它写一段文案,剩下的你自己粘。Gemini Agent 的口径是把这条界线往后推——用户给目标,agent 交成品。这听起来像广告词,但触达面把它落到了实处:Web、iOS、Android、Windows、Mac、命令行都能进,Google Workspace 全家桶(Gmail、Drive、Docs、Slides、Sheets、Chat、Calendar)是原生场地,同时接 Microsoft 365 和 Slack;它还能作为 headless agent 跑在第三方应用里,不需要专门 UI。

执行全在云端。跨设备共享同一份记忆与上下文,任务可以连续跑几个小时到几天,合上笔记本、换台机器再打开,接着来。这条能力看着平常,实际是整个形态的地基:一个任务只要活得比一次会话长,状态存在哪就变成了架构问题,而不是体验问题。

需要把时间线摆正。这次不是凭空多了一套基础设施:Agent Gateway、Agent Registry、Agent Observability 早在 2026 年 6 月 18 日的平台发布说明里就 GA 了,云端账单硬限额本身是 8 月发布的,本次新的是把限额和 agent 挂上钩。之所以强调这点,是因为把新发布和新底座混为一谈,很容易高估它这一版的能力成熟度。换句话说,这次发布更像是把已经铺好的底座接上了一个统一入口,而不是从零造了一套新东西。

四种记忆,是这一期最值钱的工程切法

“长期记忆”这个词在企业里被用得太含糊。Gemini Agent 把它拆成了四块,这个切法比产品发布会上的其他内容都更值得抄。

session memory 是当前任务的上下文,等价于一个被持久化的执行栈,任务结束即可回收;semantic memory 是从文档和对话里沉淀下来的事实与知识,本质是一层可检索的向量或结构化索引,需要处理更新与冲突;procedural memory 记的是活该怎么干,也就是可复用的工作流与工具调用序列,它更接近一段被版本化的脚本;episodic memory 记的是过去做过哪些任务,是带时间戳的经历日志,供后续检索相似的先例。

四层记忆:把「长期记忆」拆成可测的四块

四层分开的价值在于可测。把记忆混成一个大池子,你没法回答这次失败是因为忘了事实,还是走错了流程。拆开之后,semantic 的召回率、procedural 的复用成功率、episodic 的相似任务命中率各有各的指标,出问题能定位到具体一层。对一个要跑几天、还要跨设备续跑的任务来说,这是把玄学问题变成工程问题的关键一步。记忆分层还有个隐性收益:它把“agent 为什么这么做”变成了可解释的。episodic 里存着先例,procedural 里存着步骤,出了问题能回溯到某一层的某一次决策,而不是面对一个黑箱说它没做对。

身份不是安全附件,而是产品设计

最有争议也最有意思的一层,是常驻的 coworker agent。它拥有自己的 Workspace 账号、自己的邮箱(形如 @agents.company.com)、日历、Drive 存储,以及企业通讯录里的一个席位。团队成员可以像 @ 同事一样 @ 它,也能把它拉进文档评论。关键在于权限方向:它只看到被显式共享给它的信息,而不是继承某个员工的全量权限。

配套的一整套治理几乎是同时交出来的:每个 agent 有加密证明的身份(cryptographically attested identity),权限由企业安全系统做基于角色的审批,动作记进归属到 agent 而非人的审计日志;代码执行跑在隔离沙箱里;Agent Gateway 像一道 AI 网络防火墙统一执行策略;管理员可以在项目级设消费阈值,触顶自动暂停 agent。

权限方向:从「借用你的令牌」到「agent 有自己的身份」

把这套东西读成“安全特性”会低估它。它真正做的是把上个月还在概念阶段讨论的“给 agent 发一张商业身份证”,在单一厂商的生态里先落地成默认发货。身份证一旦发出去,它就不只是权限对象,而是分发入口:同事会习惯性地 @ 这个地址、往它的日历里塞会议、把文档共享给它。身份带来协作惯性,协作惯性带来锁定。这是比模型参数更黏的东西。

多模型路由与成本闸门

真正的信号藏在模型选择里。Gemini Agent 不绑定单一模型,目前可调度 Google 自家的 Gemini 与 Anthropic 的 Claude,官方说未来还要加其他闭源与开源模型;有一层 Smart Routing,按“质量与成本的最佳平衡”给任务分配模型。

一家模型厂,公开把对手的模型做成了自己路由里的一个档位。表面上这是开放,实际是路由权的上收:用什么模型,从开发者手里的一个 import 语句,变成了平台后台的一个成本参数。谁掌握路由,谁就掌握“按任务价值分配算力”的阀门——贵的模型留给值钱的任务,便宜模型吃掉长尾。对 Anthropic 来说这是分发,对做垂直 agent 的独立工具商来说,这是被渠道化:你精心调的 agent,最后可能只是别人路由表里的一行。

口径上要留个心眼。发布会说 Gemini 与 Claude 的路由“今天就能用”,FAQ 却说 Gemini 现在可用、其他模型“即将”。两者不一致,应把它当作待验证项,而不是已经落地的能力。

另一半是成本闸门。管理员设预算、触顶自动停机,没有预算断路器的“自治”,在生产环境里根本不可部署。自治的边界必须画在可计量的资源上,而不是画在提示词里。你可以要求它“谨慎”,但你没法审计“谨慎”;你只能审计它花了多少钱、调了哪些工具、动作落在了哪个日志里。

协调层之争,而不是模型之争

把这次发布放回竞争坐标,脉络就清楚了。Microsoft 在 9 月 25 日更新 Copilot,往生产力、开发和持久自动化上压;OpenAI 9 月推 always-on 的 dots;Meta 9 月初发 Muse,能购物、订票、发邮件、付款;SpaceXAI 8 月发 Grok Bot,9 月加上 Team Bots。Anthropic 走的是相反路线,10 月 6 日宣布 Claude 原生接入 Google Docs、Sheets、Slides——不抢协调层,先做别人的插件。

Gartner 和媒体的判断一致:企业 agent 的主战场,已经从“谁的模型强”转向“谁成为工作流的协调层”。值钱的不是那个对话框,而是跨应用的上下文与交接。这也解释了为什么 Google 一边自建 Workspace 的纵深,一边硬挤 Microsoft 365 和 Slack——真正的胜负手在中间那层胶水。

企业现实里更可能是多平台并存,而不是一家通吃。这就引出一个被低估的账:agent 数量越多,权限债越大。每个常驻 agent 都是一张长期通行证,它们会累积、会遗忘、会在人离职后继续以某个人的名义活动。对企业采购来说,选型逻辑也要跟着变:不是挑一个最强的模型,而是挑一个愿意把权限模型、数据边界和退出机制讲清楚的协调层。能力可以后补,信任结构一旦选错,迁移成本极高。

发布的是产品方向,不是企业回报

把光环摘掉看,至少有五点值得摆上台面。

一,private preview、未公布定价与激活方式,意味着这次发布的是产品方向,而不是已验证的企业回报。预览阶段能拿到的都是精心挑过的场景,不能反推大规模生产环境的表现。

二,发布会口径与 FAQ 口径不一致——模型可用范围、多步后台委派、移动与桌面访问都被标成 early access。宣传材料说“能”,文档说“将能”,这个差额本身就是可信度的一部分。

三,权限、身份、审计这套东西在 Google 自家生态里是默认发货,但一旦跨到 Microsoft 365、Slack 这些共享界面,权限模型怎么对齐,目前没有答案。同一个 agent 在两个身份系统里怎么保证“只看到被共享的内容”,这是硬骨头,不是一行配置。更现实的做法是,先在自家系统里建一份 agent 权限台账,把它能看到什么、能被谁调用、由谁负责,白纸黑字写下来,等平台的能力补齐时再逐步对接。

四,有评论者指出真正的难题在企业内部那些矛盾且未被写下来的上下文。agent 遇到两份互相打架的排期,它不会去问,它会悄悄选一个答案,产出一个“四角圆润的日程炸弹”——看起来完美的安排,底下埋着冲突。生产力工具的最大风险,有时是它把错误包装得太漂亮。

五,身份一旦变成员工,运维问题就跟着来。既然给 agent 发了工牌,公司就得有对应的 offboarding 流程:人离职了,他名下挂着的 agent 怎么办,谁来回收席位、轮换凭证、清点它被共享过的东西。否则权限债只会越滚越多。

还要提醒一句数字的用法。Google 自述近 90% 的 Fortune 100 是 Gemini Enterprise 客户,BNP Paribas 铺到 6.5 万员工,日本 SOMPO 建了一万多个自定义 agent,过去一年近 500 家客户各自处理超过一万亿 token,约 80% 的 Google Cloud 客户已在部署其 AI 产品。这些都是真的,但它们和本次这个通用 agent 没有直接绑定关系,Google 自己也没说它们是新 agent 的战绩。Alphabet 股价当天盘前涨约 1.5%,那是市场对这一整套叙事的投票,不是对 preview 的验收。

对开发者和团队,现在就能做的事

三条可迁移的动作,不依赖你信不信 Google。

给每个长跑 agent 独立的凭证与服务账号。别让它借用某个人的 token 或权限去干活。吊销时你只想删一个东西,而不是翻遍系统去追它到底还能登什么。顺带把凭证的轮换周期定下来,别让一个跑了一年的 agent 还拿着最初那把钥匙。

把“可验证的产出”作为验收标准。既然它的交付物是文档、代码、邮件,那就用能不能跑、能不能被下游消费、能不能被复查来验收,而不是用“看起来像不像”。procedural memory 复用的前提,是每一步都有可判定的结果。一个产不出可判定结果的流程,交给谁都救不了。

把审计与权限边界当成产品的一部分来设计,而不是上线前的合规补丁。动作归属、消费阈值、共享范围,这些应该是默认项。如果平台的四层记忆和身份治理能用,就在自己的系统里对齐同一套分层;用不上,也要自己造一个简化版。

回到开头那个同事。它周末也在干活,这件事既让人兴奋,也让人警惕。Google 把 agent 的身份、记忆、预算和路由一次性摆上了桌,方向是对的——组织迟早要接纳非人成员。但这次它交付的是一套治理框架和一条私人预览的通道,不是一份企业回报的证明。真正决定它是不是生产可用的,不是模型多聪明,而是那些不性感的东西:预算断路器、权限回收、可审计的产出。谁先把这些做成默认项,谁才真正把 AI 同事请进了工位,而不是请进了演示视频。

其他动态

  • Anthropic 发布 Claude Haiku 5.5:输入/输出定价降到每百万 token 0.10 美元 / 0.50 美元,相比上一代 Haiku 4.5 的 1 美元 / 5 美元等于打到十分之一,保持 100 万 token 上下文,OSWorld 拿到 72.4%,官方把它定位成编程与高频调用场景的子智能体。便宜的“小模型 + 大量子任务”这一档,成本结构又被压了一层。
  • OpenAI 面向全球用户上线 GPT-6:免费与付费用户全面铺开,取代 GPT-5.6 Sol 与 Luna,同时带来 Intelligent UI——回答里直接生成图表、按钮、表单和可点击的 mini app,并集成 Astra 安全技术。
  • Manus 母公司蝴蝶效应完成超 5 亿美元新融资:博裕投资、IDG 资本领投,腾讯、红杉中国、真格基金继续加注,目标估值约 40 亿美元;距其 9 月 1 日宣布恢复独立运营还不到一个月。
  • 微软研究院发布 Agent Lightning v1.0:约 3500 行的轻量级 agent 强化学习框架,目标是把已经跑起来的 agent 接进真实 harness 做后训练与在线改进,解决的是工具、上下文与决策流程被框架包住后难以做 RL 的老问题。
  • AWS Bedrock AgentCore 被披露权限缺陷:Zenity Labs 称一个可公网访问的 agent 能借内部临时云凭据接口,影响同一账号同一区域内的所有 AgentCore agent;AWS 已修复并收紧默认权限。agent 平台的 prompt 注入、云身份与内部元数据访问,必须放在同一条安全边界里治理。
  • GitHub Copilot 的本地沙箱正式可用:CLI、Copilot 应用与 VS Code 的 Agent Host 会话都支持,agent 执行的命令可以跑在本地沙箱而非直接落在开发者机器上。
  • IROS 2026 上中国灵巧手与触觉方案集体亮相:Sharpa 首发通用人形本体 D01、新一代灵巧手 W02 与外骨骼数据手套 AE01;曦诺未来带混驱 Flex 2 与直驱 Prima 1 两条路线;戴盟机器人首秀触觉锚定世界模型;PaXini 展示从芯片到人形的全栈触觉闭环,中科院自动化所基于其 PX6AX GEN3 在 0.05mm 间隙下把插装成功率做到 67%、最大接触力降 60%。
  • “只有语言走不远”成为展会共识:韩国 RLWRLD 与英伟达联合研发的灵巧性基准模型给出结论,仅靠语言理解不足以支撑现实世界的物理作业,机器人的“大脑”和“双手”需要同步迭代;我国人形机器人占全球 97% 份额,但感知与执行脱节仍是落地卡点。

参考资料

打开原图 ↗