Skip to content

Context、检索与信息压缩

第一部 · 模型能力与边界 · 第2章

撰写日期:2026-08-31(整理自 2026-07-13 的实践)

结论

个人 AI 和知识型 Agent 的竞争力,不在于把更多材料永久塞给模型,而在于每次任务都能找到足够相关、可核查的原文。

Context 不是仓库容量,而是一次推理的注意力预算。检索的目标不是“尽量多给”,而是“只给完成当前任务所必需的证据”。

1. 先区分三种信息

信息例子处理方式
稳定规则身份、边界、输出契约少量常驻
当前现场当前消息、回复链、任务状态每轮自动注入
长尾材料文档、历史对话、代码、事件按需检索

把三者全塞进系统提示会让成本和噪声一起增长;全部交给模型临时搜索,又会产生不可控的工具回合。正确的分层是:便宜且高频有用的自动注入,昂贵或低频的信息按需获取。

2. 小语料先用简单检索

做检索不等于起手就建向量库。先根据语料规模、更新频率和查询类型选择最简单、可观测的方案:

条件更合适的起点
文件少、目录清楚、查询偏精确目录索引、关键词与按需精读
语义表达差异大、材料开始增长混合检索与重排
高频问答、延迟敏感启动时建内存索引,请求时只注入命中片段
权限复杂或数据跨域先解决访问控制,再谈召回率

判断标准不是某个固定 token 数,而是:漏召回是否已经影响结果、全量注入是否拖慢任务、检索失败是否可观测。

3. 原文和观点档案分层

个人化系统可以保留两级表示:

  • 原始语料保存长尾细节与出处,不替作者改写历史;
  • 观点档案定期从原始语料中提炼高频判断、经历时间线和表达偏好,作为稳定锚点。

观点档案不是新的事实源。回答涉及具体经历或判断时,仍应回到原文核对;新材料出现后,档案也需要重新蒸馏和修正。

4. 出处必须能回到事实源

检索型问答至少要区分:

  1. 原文明确说过什么;
  2. 根据多条材料可以推断什么;
  3. 当前材料不足以回答什么。

引用应链接到可访问的原文,而不是只给裸文件名或“根据记忆”。这样用户验证的是证据,不是模型的自信。

5. 压缩会累积损失

如果上游已经把会议转写压成摘要,下游再把摘要压成记忆,遗漏会被永久放大。每一层压缩都要保留返回原始材料的路径,并在重要决策缺失时先检查上游是否已经丢失信息。

相关

MIT License