LLM 的 KV Cache:一个时间戳,能让你的账单比不开缓存还贵

Posted on 一 31 8月 2026 in AI • Tagged with tech, AI, LLM, kv-cache, prompt-caching, context-engineering, token, agent

KV Cache 不是一个"顺手能省点钱"的技巧,而是一条硬约束:它规定了你的提示词必须怎么排版。前缀不稳,缓存全废;更糟的是,如果你开了缓存又让前缀每轮都变,按价目表算,账单会比压根不开缓存还高 25%。本文讲清 KV Cache 的原理、命中规则、省钱之外的收益、可落地的最佳实践和常见陷阱。


Continue reading

上下文管理之渐进式披露:别把整座图书馆搬进模型的脑子

Posted on 二 25 8月 2026 in AI • Tagged with journal, AI, context-engineering, token, agent, skill, progressive-disclosure

上下文窗口再大,也不该一次性塞满。渐进式披露的核心是:先给模型一张薄薄的"目录",让它按需去取详情。这既是省 token 的关键手段,也是让 Agent 少犯错的结构性做法。本文用我自己写的两个 skill 讲清它的做法、最佳实践和常见陷阱。


Continue reading

Headroom 和 Ponytail:给 AI 编程的 Token 账单拧上两个阀门

Posted on 五 03 7月 2026 in Tech • Tagged with ai, token, cost, headroom, ponytail, agents, context, productivity

用 AI 写代码,token 烧钱的地方无非三处:模型读进去多少、写出多少代码、回话多啰嗦。Headroom 管"读进去",靠压缩上下文;Ponytail 管"写出来",靠逼着 agent 少写代码。这篇讲清楚这两个开源工具各自怎么做、在你的项目里怎么装怎么用,也把厂商不爱说的坑一并摊开:真实场景省的往往没广告那么多。


Continue reading

用 Codex 怎么省 Token:账单别让上下文偷偷烧掉

Posted on 二 23 6月 2026 in Tech • Tagged with codex, ai, token, cost, context, productivity, agents-md

用 Codex 写代码,token 烧得最快的往往不是模型多能干,而是上下文管理不当。这篇文章从 Codex 的 agent loop、项目指令和 prompt 缓存机制讲起,给出一份能直接照做、也能度量效果的省 token 清单:什么时候开新会话、AGENTS.md 怎么瘦身、怎么选模型和推理档位、怎么监控自己的消耗。


Continue reading

LLM API 越来越贵,别让 token 像自来水一样哗哗流

Posted on 五 08 5月 2026 in Journal • Tagged with LLM, AI, token, cost-control, prompt-engineering, productivity

LLM API 的成本控制不是少用 AI,而是把 token 当工程资源来管。先度量,再分级选模型,压缩上下文,复用缓存,限制输出,离线任务走批处理,最后拿检查清单管住那些看不见的浪费。


Continue reading