qjlDim 含义 TurboQuant QJL Quantized Johnson-Lindenstrauss,量化JL随机投影

qjlDim=384 含义(TurboQuant QJL + mse2 算子)

mse2:就是 MSE最优标量量化(Lloyd‑Max)阶段 ,TurboQuant 的 Stage1;然后 Stage2 对残差做 QJL(Quantized Johnson-Lindenstrauss,量化JL随机投影) 1bit残差校正。

qjlDim = QJL sketch维度(投影后的草图向量长度 m),这里等于384。

术语拆解

  1. QJL :Quantized Johnson-Lindenstrauss,量化JL随机投影。
    用一个高斯随机矩阵把原始残差向量投影到 m 维,再取符号变成1bit的±1向量,用来无偏估计原始向量内积,专门补MSE量化带来的内积偏差,KV Cache低比特量化(2/3bit)里用的核心技术。
  2. qjlDim(m) :QJL投影之后的草图维度(sketch dimension)
    • 原始KV向量维度是 d(比如768)
    • 随机矩阵 S ∈ R qjlDim × d
    • 输出草图:sign(S @ residual),输出向量长度 = qjlDim
    • 这里 qjlDim=384:残差向量被投影到 384维,每个维度只存1bit符号(+1/-1)

mse2 + qjlDim 整体流程(TurboQuant)

  1. mse2:对KV向量做随机旋转 + Lloyd‑Max MSE最优标量量化(这一步就是mse2算子),得到粗量化向量;
  2. 计算残差 r = 原始向量 − mse2复原向量;
  3. QJL模块:残差r乘以随机JL矩阵,投影到 qjlDim=384,取sign,保存384个1bit符号,用来推理时修正attention内积的bias。

取值意义

  • qjlDim越大:草图携带信息越多,内积估计方差越小、精度越高;但存储和计算开销线性上涨(这里384是工程常用折中值);
  • qjlDim越小:内存开销低,但量化误差变大,PPL上升。

补充:不要和原始embedding dim混淆。原始向量维度(例如hidden_dim=768)≠ qjlDim(投影草图维度384)。

如果你需要,我可以把这个算子的输入输出shape、昇腾CANN上tile切分策略一起整理出来。

相关推荐
HwJack201 小时前
【HarmonyOS开发小实践】HarmonyOS GC 引用计数 vs 对象追踪,三种回收算法
jvm·算法·harmonyos
blxr_1 小时前
力扣hot100前k个高频元素https://leetcode.cn/problems/top-k-frequent-elements/
算法·leetcode·职场和发展
光依旧1 小时前
MCP实战手记(九):生产化MCP Server的6层安全防护
java·人工智能·spring boot·安全·网络安全·ai agent·mcp
红海云1 小时前
Jev放开之后,Agent开始分工
人工智能
Flynt2 小时前
Claude Code 103 秒删掉 4.8 万个文件之后,我把自己的仓库"删"了一遍:git 能救的比你想的少
git·ai编程·claude
灰山君2 小时前
面向高校实训室的数字孪生可视化平台:支持校内部署与200个教学席位
大数据·人工智能·信息可视化·数据可视化·实时大数据
马剑威(威哥爱编程)2 小时前
【AI全栈后端12-04】Spring Boot 用结构化输出自动解析简历:让模型按你的 POJO 输出
java·人工智能·spring boot·后端
海盗12342 小时前
AI 新闻日报 2026-09-30:智能体边界下沉到芯片、微软统一多智能体 SDK、具身工具链走向智能体可用
人工智能·microsoft·机器人·人工智能aigc
时晴⁧⁧2 小时前
Skill和MCP推荐清单
ai编程