← 返回列表

AI 推理成本优化:模型路由/缓存/压缩的实战数字

2026/9/14

B 方向·OPC 最佳实践(COGS 执行层)。on-device-ai-app-opportunities 提了「模型路由+缓存」原则、indie-pricing-models 定了「混合计价防穿仓」——本篇把实战数字补齐。

背景与问题

生产环境的 LLM 成本优化各手段能省多少?组合拳怎么排?

发现(生产实证数字,访问 2026-09-14)

  • 组合拳总量:caching+batching+routing 全开时生产团队报告 60-80% 账单削减GMI Cloud);多数团队组合后省 50-70%PremAI)。
  • 单手段数字:模型路由(简单查询走小模型)省 40-75%;语义缓存命中时省 50-90%(命中率 25-35% 常态);prompt 压缩/上下文压缩省 50-70% token;输出 token 上限(Morph 五杠杆KalviumMavik Labs)。
  • 推荐堆叠顺序:①模型路由(40-60%)→②prompt caching(重复 token 省 50-90%)→③输出上限→④批处理(非实时任务)(Tokonomics)。

推测(映射到本产品线)

  • 防诈判断:可疑话术库比对是高重复查询——语义缓存命中潜力大(话术库有限集合);「新话术」才走大模型。
  • 见守对话:每日确认是固定流程 → IVR 模板(零 token);AI 对话周 2-3 次(japan-ai-welfare-call 混合架构)已是最强压缩。
  • 回忆录整理:批次化(夜间批处理非实时)+ 小模型初稿/大模型终稿双段路由。

结论

可行动启发:

  1. 堆叠顺序执行:路由(默认便宜模型+贵模型白名单触发)→ 话术库语义缓存 → 输出上限 → 夜间批处理——按此顺序每步测质量衰减,不一次全开。
  2. COGS 表加「缓存命中率」指标opc-finance-dashboard):命中率 <20% 说明查询太散(产品/话术库该收敛),>40% 说明 COGS 优化到位。
  3. 「贵模型白名单」写进产品规则:哪些触发走大模型(新话术模式/成书章节生成),白名单外的升级请求拒绝——防止单用户烧穿(indie-pricing-models 的 credits 上限的技术执行件)。
  4. 模型换代复测节奏:季季用固定测试集重跑「便宜模型能否接住」——模型降价/能力提升是持续的外部红利(on-device-ai-app-opportunities 的端侧演进同理),COGS 只会越测越低。

待办 / 下次继续

关联

AI 推理成本优化:模型路由/缓存/压缩的实战数字 · 我的站点