AI模型的计算过程可系统性地拆解为"取"、"算"、"存"三大阶段,每个阶段又可细化为多个子步骤,并对应着关键的容量、架构、能耗指标。
1. "取"阶段:数据与指令获取
此阶段负责将模型权重、输入数据及计算指令从存储系统加载至计算单元。
| 子步骤 | 关键容量指标 | 架构 | 能耗指标 |
|---|---|---|---|
| 1.1 指令取指 (Instruction Fetch) | 指令缓存容量 (I-Cache Size) :决定能预取和缓存的指令数量。分支目标缓冲区大小 (BTB Size):影响分支预测的准确性和覆盖范围。 | 多级指令缓存架构、分支预测器设计(如TAGE、Perceptron)、指令预取单元(Stream Buffer、Stride Prefetcher) | 指令缓存访问能耗、分支预测器功耗、预取单元动态功耗 |
| 1.2 数据加载 (Data Load) | 缓存层级容量 (Cache Hierarchy Capacity) :L1/L2/L3 Cache、共享LLC的大小。KV Cache容量 :在自回归生成中,决定能缓存的上下文长度。内存带宽 (Memory Bandwidth):决定数据从主存加载到缓存的峰值速率。 | 非统一内存访问(NUMA)架构、缓存一致性协议(MESI、MOESI)、HBM/GDDR内存子系统、KV Cache专用硬件加速 | 缓存访问能耗(按层级)、内存控制器功耗、DRAM/PIM(存内处理)能耗、数据传输能耗 |
| 1.3 权重预取与广播 (Weight Prefetching & Broadcasting) | 网络带宽 (Network Bandwidth) :节点间数据传输的峰值速率。参数服务器存储容量 :能容纳的模型参数总量。预取缓冲区大小 (Prefetch Buffer Size):决定能提前加载多少未来需要的数据块。 | 参数服务器架构、All-Reduce通信拓扑(Ring、Tree)、RDMA网络、权重预取流水线、广播总线设计 | 网络接口卡(NIC)功耗、交换机能耗、参数服务器存储能耗、预取逻辑动态功耗 |
2. "算"阶段:核心计算执行
此阶段在算术逻辑单元(ALU)、张量核心(Tensor Core)等计算单元上执行矩阵乘、卷积等核心运算。
| 子步骤 | 关键容量指标 | 架构 | 能耗指标 |
|---|---|---|---|
| 2.1 指令译码与发射 (Instruction Decode & Issue) | 重排序缓冲区大小 (ROB Size) :决定能同时跟踪的未完成指令数量。保留站容量 (Reservation Station Entries) :影响指令发射的并行度。发射宽度 (Issue Width):每个周期能发射的指令数。 | 超标量/超长指令字(VLIW)架构、乱序执行引擎、多发射流水线、SIMD/SIMT指令集扩展 | 译码器功耗、重排序缓冲区访问能耗、指令发射队列动态功耗、寄存器重命名功耗 |
| 2.2 计算执行 (Execution) | 峰值算力 (Peak FLOPS/TFLOPS) :硬件理论最大计算吞吐量。寄存器文件容量 (Register File Size) :决定能同时驻留在计算单元附近的数据量。张量核心数量/规模:决定并行矩阵乘法的能力。 | 多核/众核架构、张量处理单元(TPU)设计、脉动阵列、存算一体(PIM/CIM)架构、近似计算单元 | 计算单元动态功耗(与频率/电压相关)、寄存器文件访问能耗、张量核心能效比(FLOPS/Watt)、热设计功耗(TDP) |
| 2.3 同步与归约 (Synchronization & Reduction) | 聚合带宽 (Aggregate Bandwidth) :集群内所有节点间同时通信的总带宽。归约缓冲区大小 (Reduction Buffer Size) :决定单次能归约的数据量。同步原语支持的最大进程/线程数。 | 硬件屏障同步单元、原子操作加速器、归约树网络拓扑、全局同步控制器 | 同步逻辑功耗、归约网络能耗、原子操作加速器动态功耗、全局时钟网络功耗 |
3. "存"阶段:结果写回与更新
此阶段将计算结果写回内存或缓存,并可能更新模型状态。
| 子步骤 | 关键容量指标 | 架构 | 能耗指标 |
|---|---|---|---|
| 3.1 结果写回 (Write-Back) | 写缓冲区深度 (Write Buffer Depth) :决定能缓冲的待写回结果数量。存储队列容量 (Store Queue Size) :影响乱序执行中存储指令的缓冲能力。回写带宽 (Write-back Bandwidth):数据从计算单元写回缓存的速率。 | 写合并缓冲区架构、非阻塞写回流水线、缓存替换策略硬件(LRU、Random)、写分配/非写分配策略 | 写缓冲区访问能耗、缓存行写回功耗、存储队列维护功耗、写分配逻辑动态功耗 |
| 3.2缓存一致性维护 (Cache Coherence Maintenance) | 目录/监听过滤器容量 (Directory/Snoop Filter Capacity) :跟踪缓存行状态的数据结构大小。一致性域最大节点数 :协议能支持的最大处理器/GPU核心数。无效化队列深度 (Invalidation Queue Depth)。 | 目录一致性协议、监听式一致性协议、基于Token的一致性、硬件一致性控制器、分布式目录结构 | 一致性协议消息处理功耗、目录访问能耗、无效化广播能耗、一致性控制器静态功耗 |
| 3.3模型状态更新 (Model State Update) | 模型参数总量 (Parameter Count) :决定需要存储和更新的数据规模。优化器状态内存占用 (如Adam的动量和方差)。持久化存储带宽/容量:用于Checkpointing的磁盘/NVMe性能。 | 参数服务器架构、梯度聚合拓扑、异步/同步更新策略、检查点压缩硬件、非易失内存(NVM)存储层次 | 参数更新通信能耗、优化器状态访问功耗、检查点写入能耗、NVM编程功耗 |
| 3.4 输出返回 (Output Return) | 输出缓冲区大小 (Output Buffer Size) :决定能缓存的生成结果长度。PCIe/NVLink带宽 :设备到主机数据传输速率。服务端并发请求处理容量:QPS(每秒查询数)。 | DMA引擎设计、主机-设备通信协议、输出流水线架构、请求调度器、负载均衡硬件 | DMA传输功耗、PCIe/NVLink链路能耗、输出缓冲区访问功耗、请求调度器动态功耗 |