技术栈
推理成本
AI你一生一世
7 天前
人工智能
·
大语言模型
·
注意力机制
·
rag
·
长上下文
·
上下文窗口
·
推理成本
Attention is all you have:当上下文成为唯一的护城河
我是AI时代的无业游民,我游荡在现实与意念之间过去两年,主流大模型的上下文窗口从 8K 一路推到 1M 甚至 10M token。表面上看,这是"能塞更多文档"的工程红利;但在真实系统里,它带来的第一个问题不是性能,而是决策逻辑的崩塌。
小七-七牛开发者
3 个月前
缓存
·
agent
·
token
·
context
·
上下文
·
推理成本
TokenPilot:让 LLM Agent 长会话成本降 60%+ 的上下文管理
今天解读的这篇论文叫 TokenPilot: Cache-Efficient Context Management for LLM Agents,作者来自浙江大学、电子科技大学、西安电子科技大学和 HomologyAI。
我是有底线的