跳过正文

Claude 撞限这天,我烧了 $137——好在 ¥11 的学费上次交过了

·2771 字·6 分钟
田国虎
作者
田国虎
写字的地方。

封面

上一篇《Claude Code 账单:7 天 $333》的结尾,我留了个话头:下一篇写「怎么每天把 token 用得更多、更值」。

没想到,文章发出去的第二天,这个题自己找上门了——Claude 撞限了。

这不是我第一次撞墙。之前 Kimi 撞限那次,被停机之后我走了最常见的那条路:充了个加油包止血,¥11,接着原来的会话继续聊——结果一两轮对话,¥11 就没了。那次学费让我彻底记住了一件事:受限之后接着聊长会话,是最贵的姿势。

所以这次 Claude 撞限,配额冻结、排查了四轮之后,我没急着充值续命,而是走了第三条路:把撞限本身立项,花一下午做了三场深研,把机制彻底摸清。

晚上看成本看板,一个有点黑色幽默的数字:当天烧了 $137.97,2.4 亿 token,全周期单日最高——比上周发文章那天的峰值 $78.29 还高。

撞限当天的成本卡:单日 $137.97,全周期最高

越想省的那天,烧得越多。但和上次不同的是,这次烧的每一分都换成了东西。交过的学费、新买的认知,都写出来。

一、撞限之后,你烧的是另一种钱
#

先说清楚两次撞限教会我的第一件事:订阅池里烧的是配额,超额后烧的是真钱——而超额状态偏偏是长会话最贵的形态。

订阅制下,成本表现为「额度消耗速度」,缓存命中省的是配额,数字大了只是心疼。但撞限之后开加油包,每一轮对话都按官方 API 单价计费,是真金白银。

上次 Kimi 撞限,我那 ¥11 是怎么没的?被停之后我开了加油包,接着原来那个 300-400K 上下文的会话继续聊。一两轮对话,¥11 就没了。算一下就知道不冤:每轮重发 300-400K 上下文,两轮就是 70-80 万输入 token,按输入价直接乘出来,就是十几块。而且刚开加油包时缓存是冷的,一分钱折扣都没有。

更坑的是:Claude 超额状态下,缓存寿命会从 1 小时掉到 5 分钟。也就是说,越没钱的时候,折扣越少。

所以撞限后的正确动作,按优先级排是这三条:

  1. 先瘦身再决定/compact 或开新会话把上下文瘦下来,再决定要不要花加油包的钱
  2. 换家不换任务:看一眼其他几家 CLI 的额度水位,把任务派给还有余量的——订阅池消化,比真金白银的加油包便宜
  3. 加油包只配小上下文:必须用,也确保会话是新的或刚压缩的,别拿几百 K 的旧上下文去按量计费

上次 Kimi 撞限,我三条全做反了,¥11 就是学费。这次 Claude 撞限,总算做对了:没续旧会话,没冲动充值,把任务挪给还有余量的 CLI,省下的钱换成了三场深研。

二、会话为什么越聊越贵:缓存寿命和滚雪球
#

往深一层,撞限只是个触发器,真正的问题是日常的 token 都漏在哪。两个机制必须搞清楚。

第一个机制:LLM 没有记忆,每轮请求都把整个上下文重发一遍计费。

你以为你在「接着聊」,模型看到的是一封越来越长的信,每说一句话,都把整封信重寄一次。缓存能打折——但只对「字节级一致的前缀」有效,而且有过期时间。四家的缓存寿命,我调研加实测的结果:

  • Claude Code:1 小时(抓包实证;缓存读打 1 折,但写入有溢价;超额状态掉回 5 分钟)
  • Kimi Code:未公开,但官方已经开始对长空闲会话弹「缓存可能已过期」提醒;切模型、切 effort 会直接杀掉缓存
  • Codex:5-10 分钟无活动即清,但好在没有写入溢价,重建损失小
  • DeepSeek:没有显式过期,命中约 1/30 价,命门是前缀必须字节对齐——很多 Agent 框架命中率只有 20-60%

第二个机制:会话成本随轮次滚雪球。

因为每轮都重发全部历史,第 N 条消息的边际成本是指数增长的。调研里有个实测口径:第 260 条消息比第 1 条贵 1338 倍。还有个个案:隔夜唤醒一个大会话,第一条消息就吞了当月 22% 的配额——因为缓存早过期了,全量上下文按全价重发,Claude 还加收 2 倍写入溢价。

把这两个机制翻译成操作纪律,就是一张时间表:

  • 间隔 < 10 分钟:放心续,缓存全热
  • 10 分钟到 1 小时:Claude/Kimi 可续;Codex 缓存大概率已死,但损失小
  • 1 小时到当天:小会话随意;几万 token 的大会话,值得开新会话
  • 隔夜一律开新会话——旧会话的第一句,是全量上下文按全价重发

任务没做完怎么办?标准动作是:离开前让 AI「把当前进展、关键决策、下一步写到 progress.md」,回来后同目录开新会话,第一句 @progress.md 继续

一句话总结:**会话是耗材,文件才是资产。**超过缓存寿命的会话不值得赎回。

三、一个意外发现:我的派单制天生就在省 token
#

调研到这儿,我意识到一件事。

token 效率的两条顶级建议——「新任务 = 新会话」和「状态写文件、别唤醒隔夜会话」——恰好就是我那套派单工作流的固有形态。

我之前写过,我的所有任务都以工单形式存在滴答清单里,派给不同终端的 Agent 去执行。每个任务新开工单、新窗口,干完回填结果就走,几乎不存在多轮长会话。也就是说,个人用户最大的两个浪费源——上下文滚雪球、隔夜会话冷启动——在这套结构下天然不发生。

「会话是耗材、文件才是资产」在这套系统里甚至是三层的:任务定义在滴答工单里,会话死了任务不死,新窗口拿工单号就能完整复活上下文;过程记录在工作区的 memory 里,打回返工能读回现场;产出沉淀在交付目录里,脱离会话独立存在。

这给我一个判断工作流的新标准:**评估一个系统的 token 效率,先看它把状态存在哪。**存在会话里,每次都要花全价赎回;存在文件里,一次写入、处处便宜。

好的工作流设计,能把「需要自觉的纪律」变成「不需要自觉的默认」。上面第二节那张时间表,我现在依然要背——但只在派单制之外的探索性对话里用。那是仅剩的浪费高发区,那里的纪律只能靠自觉。

四、省不是目的,省下来的要烧给好奇心
#

最后说清一个容易搞反的事,也是这篇真正想说的。

撞限这天,我一边在研究怎么省 token,一边派下去一整组任务:给整个 Agent 系统做游戏化改造——好奇心探索日志、XP 徽章、注意力采集。一手拧紧水龙头,一手给好奇心接管子。乍看矛盾,其实是同一笔预算:省下来的是空转和重绘,要烧的地方是探索和创造。

教人省 token 的文章满大街都是。但只讲省,会把人带进一个误区:把账单压低成了目的本身。上一篇我就说过——luna 模型 7 天才烧 $0.68,难道把活全堆给它?不是。算账是让你知道哪个岗位该用贵的模型,哪个岗位降配也不心疼,什么时候额度该重置了、可以放开手用。

**所以「用得更多」和「用得更值」从来不矛盾:省,是为了敢用。**今天这 $137,换来的是几家订阅的计费机制彻底摸清、三张卡片入库、外加这篇文章——这笔账我自己认。

看清了,才敢用。省出来的额度不会变成钱,用在刀刃上的才会。

下一步
#

token 怎么省、怎么值,到这里讲完了。下一个问题自然来了:省下来的 token,具体烧给了什么?——那组游戏化改造已经在跑了:Agent 会自己记好奇心日志、攒 XP、给我提探索建议。这套东西跑出了什么效果,是下一篇的题。

今天把两张单子都放这:¥11 是上次 Kimi 撞限交的学费,$137 是这次 Claude 撞限换的认知。

都值。


相关文章
#