Token 成本与用量审计:钱到底花在哪了

2 min read|把每一分成本摊到模型与任务上,才知道哪些调用值得。

用 AI 的人迟早会撞上一个问题:账单在涨,但不知道涨在哪。 这时候需要的不是「省着点用」,而是一次审计。

一、数据从哪来

大多数调用都会留下两类信息:用量(输入/输出/缓存命中的 token 数)和归属(用的哪个模型、哪次会话、哪个任务)。审计的第一步,是把这两类信息接到一起。

二、三个分摊维度

同一笔成本,至少可以从三个角度看:

  1. 按模型:贵的模型是不是被用在了不重要的地方;
  2. 按任务:哪类任务在吃预算,是探索,还是重复劳动;
  3. 按执行方:成本集中在少数几个高频角色上,还是均匀摊开。

摊开之后,通常会发现成本高度集中——少数几类调用吃掉大部分预算。

三、一个反直觉的发现

在不做任何优化的前提下,缓存命中的占比往往远高于直觉。也就是说,很多成本并不是「新信息」带来的,而是重复把同样的上下文送进去。

这直接指向最有效的降本动作:减少重复上下文,而不是换更便宜的模型。

四、降本动作清单

按性价比排序,大致是:

  1. 砍掉重复的上下文注入(收益最大);
  2. 把「贵模型 + 闲聊」换成「便宜模型 + 同样的事」;
  3. 长日志、长源码交给独立会话处理,别拖进主上下文;
  4. 给探索性任务设预算上限,撞到就停。

五、最小实现

不需要一上来就做仪表盘。先写一个能算出「本期 / 上期成本差」和「按模型分解」的小脚本,跑通一次真实的账,再考虑可视化。

审计的价值不在把数字做得漂亮,而在让每一次「要不要继续跑」变成一个有依据的判断。

相关文章