取算存——模型容量、能耗指标和架构梳理

AI模型的计算过程可系统性地拆解为"取"、"算"、"存"三大阶段,每个阶段又可细化为多个子步骤,并对应着关键的容量、架构、能耗指标。

1. "取"阶段:数据与指令获取

此阶段负责将模型权重、输入数据及计算指令从存储系统加载至计算单元。

子步骤 关键容量指标 架构 能耗指标
1.1 指令取指 (Instruction Fetch) 指令缓存容量 (I-Cache Size) :决定能预取和缓存的指令数量。分支目标缓冲区大小 (BTB Size):影响分支预测的准确性和覆盖范围。 多级指令缓存架构、分支预测器设计(如TAGE、Perceptron)、指令预取单元(Stream Buffer、Stride Prefetcher) 指令缓存访问能耗、分支预测器功耗、预取单元动态功耗
1.2 数据加载 (Data Load) 缓存层级容量 (Cache Hierarchy Capacity) :L1/L2/L3 Cache、共享LLC的大小。KV Cache容量 :在自回归生成中,决定能缓存的上下文长度。内存带宽 (Memory Bandwidth):决定数据从主存加载到缓存的峰值速率。 非统一内存访问(NUMA)架构、缓存一致性协议(MESI、MOESI)、HBM/GDDR内存子系统、KV Cache专用硬件加速 缓存访问能耗(按层级)、内存控制器功耗、DRAM/PIM(存内处理)能耗、数据传输能耗
1.3 权重预取与广播 (Weight Prefetching & Broadcasting) 网络带宽 (Network Bandwidth) :节点间数据传输的峰值速率。参数服务器存储容量 :能容纳的模型参数总量。预取缓冲区大小 (Prefetch Buffer Size):决定能提前加载多少未来需要的数据块。 参数服务器架构、All-Reduce通信拓扑(Ring、Tree)、RDMA网络、权重预取流水线、广播总线设计 网络接口卡(NIC)功耗、交换机能耗、参数服务器存储能耗、预取逻辑动态功耗

2. "算"阶段:核心计算执行

此阶段在算术逻辑单元(ALU)、张量核心(Tensor Core)等计算单元上执行矩阵乘、卷积等核心运算。

子步骤 关键容量指标 架构 能耗指标
2.1 指令译码与发射 (Instruction Decode & Issue) 重排序缓冲区大小 (ROB Size) :决定能同时跟踪的未完成指令数量。保留站容量 (Reservation Station Entries) :影响指令发射的并行度。发射宽度 (Issue Width):每个周期能发射的指令数。 超标量/超长指令字(VLIW)架构、乱序执行引擎、多发射流水线、SIMD/SIMT指令集扩展 译码器功耗、重排序缓冲区访问能耗、指令发射队列动态功耗、寄存器重命名功耗
2.2 计算执行 (Execution) 峰值算力 (Peak FLOPS/TFLOPS) :硬件理论最大计算吞吐量。寄存器文件容量 (Register File Size) :决定能同时驻留在计算单元附近的数据量。张量核心数量/规模:决定并行矩阵乘法的能力。 多核/众核架构、张量处理单元(TPU)设计、脉动阵列、存算一体(PIM/CIM)架构、近似计算单元 计算单元动态功耗(与频率/电压相关)、寄存器文件访问能耗、张量核心能效比(FLOPS/Watt)、热设计功耗(TDP)
2.3 同步与归约 (Synchronization & Reduction) 聚合带宽 (Aggregate Bandwidth) :集群内所有节点间同时通信的总带宽。归约缓冲区大小 (Reduction Buffer Size) :决定单次能归约的数据量。同步原语支持的最大进程/线程数 硬件屏障同步单元、原子操作加速器、归约树网络拓扑、全局同步控制器 同步逻辑功耗、归约网络能耗、原子操作加速器动态功耗、全局时钟网络功耗

3. "存"阶段:结果写回与更新

此阶段将计算结果写回内存或缓存,并可能更新模型状态。

子步骤 关键容量指标 架构 能耗指标
3.1 结果写回 (Write-Back) 写缓冲区深度 (Write Buffer Depth) :决定能缓冲的待写回结果数量。存储队列容量 (Store Queue Size) :影响乱序执行中存储指令的缓冲能力。回写带宽 (Write-back Bandwidth):数据从计算单元写回缓存的速率。 写合并缓冲区架构、非阻塞写回流水线、缓存替换策略硬件(LRU、Random)、写分配/非写分配策略 写缓冲区访问能耗、缓存行写回功耗、存储队列维护功耗、写分配逻辑动态功耗
3.2缓存一致性维护 (Cache Coherence Maintenance) 目录/监听过滤器容量 (Directory/Snoop Filter Capacity) :跟踪缓存行状态的数据结构大小。一致性域最大节点数 :协议能支持的最大处理器/GPU核心数。无效化队列深度 (Invalidation Queue Depth) 目录一致性协议、监听式一致性协议、基于Token的一致性、硬件一致性控制器、分布式目录结构 一致性协议消息处理功耗、目录访问能耗、无效化广播能耗、一致性控制器静态功耗
3.3模型状态更新 (Model State Update) 模型参数总量 (Parameter Count) :决定需要存储和更新的数据规模。优化器状态内存占用 (如Adam的动量和方差)。持久化存储带宽/容量:用于Checkpointing的磁盘/NVMe性能。 参数服务器架构、梯度聚合拓扑、异步/同步更新策略、检查点压缩硬件、非易失内存(NVM)存储层次 参数更新通信能耗、优化器状态访问功耗、检查点写入能耗、NVM编程功耗
3.4 输出返回 (Output Return) 输出缓冲区大小 (Output Buffer Size) :决定能缓存的生成结果长度。PCIe/NVLink带宽 :设备到主机数据传输速率。服务端并发请求处理容量:QPS(每秒查询数)。 DMA引擎设计、主机-设备通信协议、输出流水线架构、请求调度器、负载均衡硬件 DMA传输功耗、PCIe/NVLink链路能耗、输出缓冲区访问功耗、请求调度器动态功耗


参考来源

相关推荐
xiwc1 小时前
Token 预算管理:长对话不崩溃的秘密
人工智能
何时梦醒1 小时前
第一篇:项目概览 — 在浏览器里跑大模型,端侧 AI 的革命来了
前端·人工智能
何时梦醒1 小时前
第二篇:工程化搭建 — Vite + React + TypeScript + TailwindCSS 全解析
前端·人工智能
橘子星1 小时前
浏览器也能跑大模型:WebGPU + Transformers.js 本地运行 DeepSeek-R1
前端·人工智能
物联网软硬件开发-轨物科技2 小时前
【轨物方案】从五维感知到一键顺控:箱变智能化不是一个传感器能解决的事
人工智能·科技·其他·机器人·开源
Swift社区2 小时前
Python 开发环境怎么选?PyCharm、VS Code、Trae 谁更适合 AI 开发?
人工智能·python·pycharm
SLD_Allen2 小时前
Kubernetes + Ray + Volcano:云原生AI训练调度体系
人工智能·云原生·kubernetes
七牛开发者2 小时前
Codex 实践系列 Vol.04:用 Goal 和 Plan 管住一个长任务
java·数据库·人工智能·github·copilot
qq_267612892 小时前
从工具整合到AI协作:Gitee DevOps平台如何重塑企业研发全流程效能
人工智能·gitee·devops