昨天看到Google更新了Gemini API里的Managed Agents。
先说下Managed Agents是什么。
它是Google给开发者提供的一套托管式Agent能力。
开发者通过一个API调用,就能让Agent在云端沙盒里做推理、执行代码、管理文件、检索网页。
7月初,Google已经给它加过后台执行长任务、连接远程MCP服务器、调用自定义函数和刷新凭证。
也就是说,此前的重点是让Agent能对接工具、能在后台跑,也能连到公司自己的系统。
昨天这次更新比较重要的是下面这三个:
新增environment hooks;给多轮任务设总token预算;支持定时触发。
之前Google解决的是Agent能不能跑、能不能接上外部工具。
这次解决的是它跑起来后最多能花多少钱、调用工具前能不能被拦住,以及能不能按计划重复执行、保留前一次的文件。
我会想分享这件事,是因为最近大家都在比Agent一次能完成多少步骤、多复杂的任务。
但真想让它替你跑一周,问题马上就变了:
它会不会一直做错?
费用会不会失控?
动了不该动的数据怎么办?
人要接手时,又该从哪里接?
这次更新让我意识到,Agent要从一次演示变成你愿意长期放着跑的工作流,补的往往不是更大的模型,而是三件更基础的事:别让它失控花钱,别让它越权动手,也别让它每次都从零开始。
**1️⃣ 先管住钱:别让Agent一错到底**
现在很多Agent演示,都是把查网页、读文件、写代码、调用几个系统,拼成一轮任务。
做完就结束,出错了,人就在旁边重来一次就行。
可如果它每周一汇总销售线索、每天检查异常订单、夜里跑资料核验,或者等客户回复后继续跟进,问题就不一样了。
你不一定在旁边,却还得为它持续出错的成本买单。
Google这次新增的`max_total_tokens`,限制的不是单条回复,而是整个多轮任务的总token消耗。
预算用完,任务会暂停,当前的工作环境也会保留。你可以先看一眼它跑到了哪一步,再决定要不要加预算继续。
长期任务一旦走错路,还在不停调用模型和工具,成本和错误就会一起累积。能先停下来,才更让人放心。
但钱管住了,还不够。因为Agent真正麻烦的地方,不是它多说了几句废话,而是它已经能动手操作。
**2️⃣ 再管住手:别让Agent越权操作**
Google把这套能力叫environment hooks:Agent每次准备调用工具前后,系统都能先跑一段你自己定的规则。
比如它准备写文件、执行代码、调用外部系统时,先过一道安全检查;任务做完后,再自动跑一次格式或结果校验。
如果规则拒绝,这一步就不会执行。
Agent还能看到为什么被拦住,再换个办法。
对能调用工具的Agent,只盯着它会不会答错已经不够了。
更要紧的是,它实际执行了什么。
一封邮件发错人、一条数据写进错误字段、一个文件覆盖掉旧版本,后果都不是“重新生成一次”能解决的。
给Agent接更多工具前,最好先把话说清楚:哪些动作可以直接做,哪些要检查,哪些碰都不能碰。
可一个被管住预算和权限的Agent,如果每次启动都要重新交代任务、重新找文件,也还谈不上真正好用。
**3️⃣ 最后才是持续工作:别让Agent每次从零开始**
Google还加入了定时触发。你可以把Agent、工作环境、提示词和执行时间设好,到点让它自动运行;每次运行沿用同一个沙盒,同一份工作材料也能一直留在原来的地方。
不过,文件留得住还不够。想把Agent放进日常工作,至少得把4件事说清楚:
- 它在替谁做什么,什么时候会自己启动;- 它这次最多能花多少预算;- 它要动哪些工具和数据,哪些地方会被拦住;- 它没做完或做错时,人能从哪里接手。
这三层补齐后,Agent才开始像一个能被放进日常工作的系统,而不只是一次性的任务演示。
**4️⃣ 做Agent产品,不能只炫耀它能干多少活**
不少Agent产品最爱展示的,是它连续调用了多少工具、自己规划了多少步,最后完成了多复杂的任务。
但用户真准备把它用在工作里,最先问的往往是:它会不会失控?钱花到哪里了?出了问题我怎么叫停?做了一半能不能换人接?
Google这次更新只适用于Gemini API里的Managed Agents,不代表所有Agent产品都已经解决这些问题。但它至少说明,大厂现在补的,已经不只是模型能力。
模型够不够强,决定了Agent的工作做得好不好。
预算、权限、审核和交接到不到位,才决定了用户会不会真把它长期放在工作里。