昊梵体育网

给 Agent 接记忆的人,大概率都经历过这样的循环:向量库跑通、历史灌进去、t

给 Agent 接记忆的人,大概率都经历过这样的循环:向量库跑通、历史灌进去、top-k 检索也能用,前几周很美好,然后某天发现检索结果越来越像一锅粥,六个月前的旧配置还在被引用,账单悄悄爬升。这篇文章就是来回答"为什么会这样"的。
核心结论一句话:Agent 的记忆问题从来不是记不住,而是从不有目的地忘记。绝大多数记忆系统只做追加、不做修剪,构建(写入)阶段烧掉的能量比之后 300 次查询还多,而准确率指标完全看不出来。斯坦福、微软、Anthropic 以及背后的硬件实验,其实是在用四种语言讲同一件事——记忆不是存储桶,而是有代谢的系统,需要被工程化治理。
读完你能带走四样东西。第一,一个代价模型:构建、查询、维护三阶段里,大头在看不见的构建路径,衡量记忆系统要看"每个正确答案的能耗",而不是只看准确率。第二,一个内容标准:存事实和技能,别存原始日志;决策相关信息集中在抽象知识里,密度胜过体积。第三,一个控制要求:记忆必须可作用域、可审计、可删除,一条错误记忆会持续污染每个未来会话。第四,一个硬件视角:所有记忆最终压在 KV 缓存上,完整上下文是平方级成本,块级释放和构建后台化才是正确姿势。
落地顺序也给了:先手工跑一次提炼、证明它能改变决策再自动化;矛盾检测先手工后定时;遗忘策略要在存储变大前加入;硬件调优放最后。斯坦福实测默认系统都不遗忘,百万 token 时足迹跨度约 9 倍,压垮长期 Agent 的是增长斜率。