Skip to content

延迟、成本与可观测性

第二部 · Agent 系统与平台 · 第8章

撰写日期:2026-08-31(整理自常驻问答服务实践)

结论

AI 服务的端到端速度由多个串行阶段共同决定。优化前先拆预算;很多慢并非模型推理本身,而是冷启动、重复 Context、模型自主搜索和无关工具加载。

1. 拆开延迟预算

text
事件接收
→ 排队
→ Context 组装与检索
→ 模型首字
→ 完整生成
→ 外部发送与落盘

每段分别记录耗时,至少同时关注首字延迟、总完成时间和长尾分位。只看平均值会掩盖偶发的上百秒等待。

2. 先消灭固定浪费

  • 常驻服务避免每条消息冷启完整 Agent;
  • 启动时加载索引,请求时只注入少量命中材料;
  • 材料已经准备好时禁用无关工具回合;
  • 关闭与当前问答无关的插件、项目上下文和钩子;
  • 按内容哈希缓存重复识别结果。

3. 按意图和置信度分流

高置信、证据明确的任务可以走较快路径;复杂、低置信或需要视觉理解的任务走更强路径。分流规则必须经过真实样本验证,并且低置信任务能够回退,而不是为了速度硬给答案。

本地能力与远端模型也可以组合:文字截图先用本地 OCR,布局和视觉判断再交给多模态模型。关键不是“本地一定更好”,而是让常见路径不支付不必要的远端成本。

4. 感知延迟也是产品设计

先创建“正在处理”的消息,再增量更新同一结果,可以显著降低等待的不确定感。但流式回执不能掩盖卡死:超过阈值仍需显示错误、允许重试或转人工。

5. 成本要与价值一起看

记录每类任务的调用次数、输入输出量、失败率和人工节省时间。具体数字会随模型和部署变化,Playbook 应保留测量方法,不把某台机器或某个套餐的成本当成长期结论。

相关

MIT License