In、Out 与 Cache:Token 用量怎么算
Token 数字只有在知道它包含什么的时候才有意义。Agent HUD 保留三个互不重叠的维度,所以数字可以直接相加,不会有任何一部分被重复计入。
三个互不重叠的维度
每次请求都按三个维度记录。它们可加且从不重叠,所以 In + Out + Cache 就是这次请求的全部消耗,没有任何一项被算两次。
| 维度 | 包含 | 不包含 |
|---|---|---|
| In | 新输入:提示词 Token 加上缓存写入 | 缓存读取 |
| Out | 输出 Token;推理已经计在其中 | — |
| Cache | 只有缓存读取 | — |
推理 Token 只算一次
模型在回答之前思考时,那部分 Token 已经包含在厂商返回的输出计数里。Agent HUD 不会再加一遍,所以推理很重的一轮,不会相对普通一轮被虚高。
默认口径是 In + Out
图表、使用时段热图、模型分布和会话行,都跟随当前选中的维度。默认选的是新增用量——In + Out——切到全部则再叠加缓存读取。
面板里单个会话的 Token 数字,是这个会话的 In + Out。在缓存维度出现之前写下的记录,解码时缓存读取为零,而不是去猜一个值。
不管日志什么样,都只计一次
- 一次 API 响应只计一次,不管日志是什么排布。
- 同一个事件在两个文件里、或者在两台 Mac 上的副本,合并成一条记录。
- 两个确实独立、只是数字恰好相同的请求,则都保留。
柱子怎么分桶
柱状图按 15 分钟、30 分钟、1 小时或 1 天分桶,对齐到本地的一刻钟、整点或自然日边界,落在所显示的精确区间内。空桶保留自己的位置而不是塌缩,计数保持整数。
Token 不是额度
两者是不同的读数,谁都不由对方推算。厂商上报额度窗口就直接显示;Token 数量来自请求日志。Agent HUD 不会把 Token 换算成额度百分比,也不会用你花了多少 Token 去补一个拿不到的额度。
常见问题
- 推理(thinking)Token 会被算两遍吗?
- 不会。推理已经包含在厂商返回的输出 Token 计数里,Agent HUD 不会再加一次。
- 缓存读取算进我的用量吗?
- 算,但单列为一个维度。默认视图显示新增用量——输入加输出——切到全部维度时才出现缓存读取。缓存写入属于输入,不属于缓存。
- 同一个 agent 在两台 Mac 上跑,用量会被算两遍吗?
- 不会。同一个事件从两个文件或两台机器过来的副本会合并成一条记录;两个独立的请求即使 Token 数完全相同,也分别保留。
- 为什么 Token 总量和额度百分比对不上?
- 它们量的不是一回事。额度来自厂商自己的窗口读数,Token 来自请求日志,谁都不是由另一个算出来的。
指南
最近更新: 2026-09-20 · 这里描述的行为,在 Agent HUD Open 的文档里有完整说明,并附有对应代码。 github.com/jazzenchen/agent-hud-open