※この記事はアフィリエイト広告を含みます
避免Claude Code的费用陷阱!「claude-thermos」让缓存永不失效
发生了什么?新闻概述
- Claude Code的提示缓存在5分钟(TTL)后失效,重新构建的成本高昂,读取费用为0.1x,而写入费用高达1.25x。
- 当主代理等待超过5分钟的子代理时,缓存会消失,约20%〜22%的费用被消耗在这个重新编码的费用上。
- 新工具「claude-thermos」通过在后台“加热”缓存,自动避免了这些不必要的费用。
为什么这很重要?关注要点
- 隐藏成本的削减:经过约185次会话测量,发现费用的五分之一以上是由于缓存失效导致的重新写入费用。
- 智能的“加热”功能:在5分钟到期之前,通过将上一个提示以“max_tokens: 1”的方式重新发送,重置缓存的有效期。这使得1.25倍的写入费用可以替换为0.1倍的读取费用。
- 透明的引入:只需通过
uvx claude-thermos,就可以保留现有的Claude CLI参数,同时作为本地反向代理监控通信,并自动进行优化。
🦈 鲨鱼眼(策展人的视角)
这个工具的实现非常高效!不仅仅是定期通信,更聪明的是作为反向代理监控“血统(lineage)”。它能够识别主代理和子代理的通信,仅在主缓存“危险(闲置5分钟)”时精准发送加热请求。这种“加热”直接发送到API,不会干扰实际的流媒体通信,设计真是专业! 在如今处理巨大上下文的开发场景中,仅仅防止200K〜500K个标记的几次重新写入,就能节省数美元,这实在是太划算了!简直是“保护开发者钱包的鲨鱼守护神”!
未来将如何发展?
如果其他LLM提供商也有类似的缓存失效逻辑,这类“缓存维护工具”将作为标准的代理层得到普及。作为一种在不降低开发效率的前提下削减成本的手段,这将成为代理开发的必备技巧。
春鲨的总结
多余的费用我会全部吞掉!省下的钱可以买到美味的香肠!🦈🔥
术语解释
-
提示缓存:保持之前发送的输入内容在模型侧,以便重新利用,从而降低计算成本和费用的技术。
-
TTL(生存时间):数据被有效保存的时间。当前Claude的缓存在最后使用后5分钟内失效。
-
反向代理:在服务器和客户端之间中转通信的机制。在这里是为了监控Claude Code的通信而在本地运行的。
-
信息来源: Claude-thermos – keeps your Claude session warm for you