昊梵体育网

Uber软件工厂:AI 请求涨9倍,账单没翻车? 在全员普及 AI 后,Ube

Uber软件工厂:AI 请求涨9倍,账单没翻车?

在全员普及 AI 后,Uber 超过 70% 的 PR 已被归因于本地或云端 Agent,工程师还构建了 3,600+ 个 Agent Skill,每天执行超过 3 万次。

2026 年 2 月到 8 月,Agent 周请求量增长 9.4 倍,但 AI 总支出从 4 月后相对趋稳;在固定模型的比较口径下,每会话成本较 6 月峰值下降 52%。

来看看 Uber 是怎么做到的?Uber 将 AI 使用分成四层,从原始 Agent 会话、带 Skill 的会话,到通用 Agent 和专业 Agent。越往上,平台对成本、质量和模型选择拥有更多控制。

同时,总成本被拆成六个乘数:用户数、人均会话数、每会话轮数、每轮请求数、每次请求 Token 数和每 Token 价格。用户和使用规模继续增长,重点则是减少 Agent 执行过程中的额外开销。

模型选择:Uber 用真实任务构建评测基准,在质量、可靠性和成本之间寻找帕累托最优方案;主 Agent 负责拆解和评估,任务明确的子 Agent 默认优先使用更经济的模型。

上下文:即使模型支持 1M 上下文,也会在 400K Token 触发压缩;Prompt 缓存根据会话长度设置不同有效期。100+ 工具预加载可能额外占用约 50K~70K Token,因此 Uber 通过 CLI 和工具搜索按需调用 MCP 工具。

执行路径:Code-mode 把轮询和批处理交给脚本,小结果集的 Token 使用降低 50% 以上,批量流程节省超过 90%;AI Context Graph 则帮助 Agent 更快找到正确工程上下文,减少搜索与试错。

规模化之后,重点转向托管 Agent。Uber 最后的方向是把更多软件开发工作负载交给托管 Agent。进入托管环境后,模型路由、执行 Harness、评测和运行成本都更容易统一控制。

Uber 值得学习的是把 Agent 成本从一张不断上涨的模型账单,拆成了一组可以测量、定位和持续优化的工程变量。软件开发开始走向“Software Factory”之后,优化对象也从单个开发者的一次 Agent 会话,变成了整座软件工厂的运行效率。

Uber SoftwareFactory Agent AI工程化 成本优化 Token 你认为MCP还有未来吗 CodingAgent 研发效能