技术栈

qkv

liulilittle
12 天前
c++·人工智能·ai·llm·注意力·qkv
长上下文的成本结构与「甜点区间」——从推理引擎的物理约束看 200K/256K/400K摘要:1M 上下文是当前大模型最具营销力、也最容易被误读的指标。本文不讨论「能不能支持 1M」,而是讨论一个更实质的问题:在真实推理成本与能力衰减的双重约束下,什么长度是高效工作的甜点区间。 文中全部数值来自笔者从零实现的纯 CPU 推理引擎 llmx(目标模型 Qwen3.6-35B-A3B,40 层、词表 248320、GGUF Q4_K_XL 量化),以及公开的注意力复杂度结论。核心论点是:解码器的成本由「每 token 必须搬运的字节数」决定,而这个字节数在权重项上是常数、在上下文项上是线性的;当
net3m33
3 个月前
人工智能·ai·qkv
AI人工智能思路部分总结1---20260524提示词1:类似qkv的万能组合网络里,即我的多层ai内存以及子ai内存理论,见:【比如 【地点+有+名词短语】即学校里有3个苹果 ,这个会触发 苹果.数量=3 这个ai内存和 水果.数量=+3 这个ai内存,
我是有底线的