Appearance
Context、检索与信息压缩
第一部 · 模型能力与边界 · 第2章
撰写日期:2026-08-31(整理自 2026-07-13 的实践)
结论
个人 AI 和知识型 Agent 的竞争力,不在于把更多材料永久塞给模型,而在于每次任务都能找到足够相关、可核查的原文。
Context 不是仓库容量,而是一次推理的注意力预算。检索的目标不是“尽量多给”,而是“只给完成当前任务所必需的证据”。
1. 先区分三种信息
| 信息 | 例子 | 处理方式 |
|---|---|---|
| 稳定规则 | 身份、边界、输出契约 | 少量常驻 |
| 当前现场 | 当前消息、回复链、任务状态 | 每轮自动注入 |
| 长尾材料 | 文档、历史对话、代码、事件 | 按需检索 |
把三者全塞进系统提示会让成本和噪声一起增长;全部交给模型临时搜索,又会产生不可控的工具回合。正确的分层是:便宜且高频有用的自动注入,昂贵或低频的信息按需获取。
2. 小语料先用简单检索
做检索不等于起手就建向量库。先根据语料规模、更新频率和查询类型选择最简单、可观测的方案:
| 条件 | 更合适的起点 |
|---|---|
| 文件少、目录清楚、查询偏精确 | 目录索引、关键词与按需精读 |
| 语义表达差异大、材料开始增长 | 混合检索与重排 |
| 高频问答、延迟敏感 | 启动时建内存索引,请求时只注入命中片段 |
| 权限复杂或数据跨域 | 先解决访问控制,再谈召回率 |
判断标准不是某个固定 token 数,而是:漏召回是否已经影响结果、全量注入是否拖慢任务、检索失败是否可观测。
3. 原文和观点档案分层
个人化系统可以保留两级表示:
- 原始语料保存长尾细节与出处,不替作者改写历史;
- 观点档案定期从原始语料中提炼高频判断、经历时间线和表达偏好,作为稳定锚点。
观点档案不是新的事实源。回答涉及具体经历或判断时,仍应回到原文核对;新材料出现后,档案也需要重新蒸馏和修正。
4. 出处必须能回到事实源
检索型问答至少要区分:
- 原文明确说过什么;
- 根据多条材料可以推断什么;
- 当前材料不足以回答什么。
引用应链接到可访问的原文,而不是只给裸文件名或“根据记忆”。这样用户验证的是证据,不是模型的自信。
5. 压缩会累积损失
如果上游已经把会议转写压成摘要,下游再把摘要压成记忆,遗漏会被永久放大。每一层压缩都要保留返回原始材料的路径,并在重要决策缺失时先检查上游是否已经丢失信息。