Pi Agent 的 Token 成本控制:为什么核心是 Prompt Cache 前缀稳定性系列第 05 篇(系列索引)。Coding Agent 的成本结构与普通 LLM 应用有本质差异:每一轮对话都要重新发送整个对话历史(系统提示词 + 工具定义 + 全部消息),一个跑了 30 轮的会话,累计发送的 prompt token 是单轮的几十倍。因此"降低成本"的核心不是"少说话",而是让重复发送的部分尽可能命中 Prompt Cache。本文从成本模型出发,逐层拆解 Pi 在这个问题上的具体设计。