资讯中心

AI 功能别只看效果:把 token、重试和工具调用写进成本台账

📅 2026/7/25 4:56:14
AI 功能别只看效果:把 token、重试和工具调用写进成本台账
先分清单位成本与系统成本单位成本是单次请求的 token 与单价系统成本还包括自动重试、多模型兜底、工具调用链、日志与评测批量跑数、以及缓存未命中。只盯单价会漏掉真正的放大器。建议在请求维度至少记录模型、输入/输出 token、延迟、是否缓存命中、重试次数、工具调用次数、业务场景标签、用户或租户 id脱敏。归因没有场景标签就无法治理同一套网关若服务「客服摘要 / 代码补全 / 内部实验」却不打标签月末只能看到总账。场景标签应在调用入口写入而不是事后靠 URL 猜测。对 B 端还可按租户聚合防止个别客户的异常循环拖垮共享额度。预算闸门先软告警后硬熔断可执行规则示例单请求输出 token 上限超限截断并记事件。单用户/单租户日预算超限降级到小模型或排队。工具调用最大步数防止 agent 空转。评测与生产配额隔离避免回归任务打爆在线额度。闸门要可配置并留下「因何熔断」的可读原因方便排障。优化顺序先砍浪费再谈换模型常见浪费来源1. 把整库文档塞进上下文。2. 失败后无差别重试多次。3. 对稳定问答不做缓存。4. 用大模型做分类/抽取等可小模型完成的任务。优化顺序建议减上下文 → 加缓存 → 限重试与步数 → 路由到小模型 → 最后才谈议价或换供应商。顺序反了容易在错误架构上省小钱。和质量指标一起看避免「省出事故」成本下降若伴随核心路径通过率下滑或人工接管率上升说明省错了地方。台账应同时看成本、延迟、任务成功率、人工升级率。只优化其中一项会扭曲系统。局限与替代路线可观测性解决「看得见」不自动等于「控得住」。组织上仍需有人认领预算与场景 owner。对开源本地模型成本转到机器与电费同样要记 GPU 时与队列等待。替代路线是能力分级默认小模型 检索仅高价值或失败升级走大模型。分级策略往往比全局上大模型更可持续。对工程团队的启发把模型调用当成一种付费 API 资源来做 SRE有指标、有归因、有预算、有熔断。效果评估和成本台账并列才谈得上「可上线的 AI 功能」。合规自检无具体未核验价格承诺。无导流。含边界与替代路线。CSDN 公开首发专稿。