AI 调用产生费用之后,缓存命中率很容易成为优化目标。但产品需要回答的问题更具体:完成一次验收通过的业务任务,究竟花了多少钱,又让使用者等了多久?
把一次任务的账算完整
以批量整理供应商资料为例,一次任务可能包含信息抽取、格式修复、失败重试和人工复核。输入缓存只影响其中一部分费用。若为了提高命中率保留了大量无用上下文,或模型输出变长,最终支出未必下降。
先记录任务编号、模型与版本、输入长度、输出长度、缓存命中量、耗时、重试次数和验收结果。能从服务响应获得的数据,尽量使用实际记录;拿不到的项目单独注明估算方法。不同服务的缓存规则、价格和有效期各有差异,应以当前官方说明与账单为准。
DeepSeek 的官方缓存文档提供命中与未命中输入量的响应字段,并说明缓存命中采用尽力而为的方式。文档还说明输出仍需生成。因此,不能把命中率解释成答案复用率,也不能承诺每次重复请求都会享受相同收益。
设计一个能够复查的对照实验
准备同一批经授权的测试材料,固定任务要求、模型参数和质量判定办法。先运行当前版本,再调整提示结构。对于规则稳定、材料变化的工作,可以把固定说明放在前部,把变化内容放在后部;具体能否命中仍要按服务规则实测。
测试应同时覆盖首次请求、连续请求、间隔后请求和内容变化。记录每次调用的实际费用与结果,并重复运行以观察波动。只挑一次命中最好的截图,无法说明日常工作负载会节省多少。
优化结果至少一起报告三项:每个验收通过任务的平均成本、完成时间分布、验收通过率。若节省了费用却增加人工修改,应该把复核时间列出来。人工成本尚无可靠估算时,保留原始分钟数即可,不必强行换算成一个看似精确的金额。
给缓存留出清晰的失效边界
业务规则、权限或资料版本变化时,应重新检查请求中使用的内容。输入缓存帮助复用计算,业务层仍需负责选择正确材料。长期保存的项目知识、检索索引与本次调用缓存也应分别管理,避免把“曾经处理过”当成“现在仍然适用”。
同样,不宜仅为了维持缓存而不停发送请求。先测量这种做法的额外开销,确认服务支持方式,再决定是否值得实施。低频任务往往可以直接接受下一次未命中的成本。
一份实用的优化报告应附测试条件、样本范围、失败案例和复测触发条件。对于独立开发者,这比一句“节省了很多 Token”更有说服力,也让客户能够知道收益来自哪里、在什么情况下会消失。