【论文阅读】龙芯2号处理器设计和性能分析

作者:胡伟武老师

胡伟武老师是计算机体系结构方向的大牛,推动了龙芯处理器的发展


学习体会:

学习追踪龙芯系列"工程流"论文,看看如何做工程,完成→完美

龙芯2号处理器几乎是工程向的论文,主要看一下实现了什么,还有补一下姚永斌老师出版的 《超标量处理器设计》,基础的知识还得再看看"一生一芯"了


摘录文章:

龙芯2号是一款64位通用RISC处理器,旨在提升中国在高性能CPU领域的自主创新能力。

取指和转移预测
  • 龙芯2号采用4路超标量流水线,每次取4条指令。P1

  • 指令Cache和指令TLB同时访问,降低延迟。P2

  • 转移预测使用BHT、BTB和RAS等机制,提高预测准确性。P3

寄存器重命名
  • 龙芯2号使用基于CAM的寄存器重命名方法,通过PRMT表保存物理寄存器和结构寄存器之间的关系。P3

  • 每条指令通过查找PRMT表确定源寄存器对应的物理寄存器号,并分配目标寄存器。P3

动态调度
  • 龙芯2号具有定点和浮点两个独立的保留站,每个保留站16项。P3

  • 保留站每拍最多可以发射5个操作数准备好的指令到5个功能部件。P3

  • Reorder队列负责指令的有序结束,最多可以容纳32条指令。P3

  • 转移队列记录转移指令信息,用于转移取消和预测修正。P4

功能部件
  • 龙芯2号包括两个定点部件(ALU1和ALU2)和两个浮点部件(FALU1和FALU2)。P4

  • 定点部件执行加减、逻辑、移位、比较、乘除等操作。P4

  • 浮点部件执行加减、取绝对值、取反、格式转换、比较、乘除、开方等操作。P4

  • 浮点功能部件支持并行单精度浮点指令和SIMD定点指令。P4

存储访问与存储管理
  • 龙芯2号一级指令和数据Cache大小均为64KB,采用4路组相联结构。P4

  • TLB共64项,为全相联结构。P4

  • 访存队列记录最多16个未执行完的load或store操作,实现访存指令乱序执行、非阻塞Cache、load speculation和store forwarding等。P5

物理实现及初步性能分析
  • 龙芯2号采用0.18 μm CMOS工艺实现,芯片面积6700μm x 6200μm,最高工作频率500MHz,功耗3-5W。P2

  • Spec CPU2000测试结果表明,龙芯2号定点性能是龙芯1号的8-10倍,浮点性能是龙芯1号的6-8倍,总体性能达到Pentium III水平。P6

  • 访存带宽测试结果表明,龙芯2号的性能瓶颈在于访存带宽,未来将通过改进套片设计来提升带宽。P6P7
总结和未来的工作
  • 龙芯2号是一款性能先进的64位RISC处理器,采用乱序执行和激进Cache设计,实现了较高的性能。

  • 未来工作包括改进处理器核和存储系统,提升性能和带宽,并开发多核版本。


参考文献:

1胡伟武,张福新,李祖松.龙芯2号处理器设计和性能分析J.计算机研究与发展,2006,(06):959-966.

相关推荐
不悔哥28 分钟前
开源 QEMU:不用板子也能跑嵌入式系统
开源
行者全栈架构师2 小时前
【鸿蒙心迹】从 TypeScript 迁移到 ArkTS——10 个编译报错逐个拆解(HarmonyOS 7.x)
前端·人工智能·开源
网络毒刘2 小时前
AtomGit 秋季活动向:AI 工具链相关开源仓库如何写好 README 与示例路径
开源·readme·ai工具链·atomgit
CEZ2 小时前
仓库数字化成熟度分级:JeeWMS 开源 Java 仓库管理系统如何支撑从可见到自治的四级跃迁
java·开源
xiwc3 小时前
AI Helper 实战:从零搭建开源项目的双语 Wiki
开源·ai编程
文慧的科技江湖3 小时前
2026年10月7日虚拟电厂行业早报:标准按容量划线,市场按动作付钱——调频细则把K值写进价格公式,虚拟电厂开始卖「动作」 | 慧知开源虚拟电厂平台
开源·电力市场·储能·虚拟电厂·辅助服务·能源互联网
头发还在的女程序员3 小时前
能源管理平台能碳管理平台,全链路数据采集与分析
开源·能源管理·能源监测·能碳管理
Rocky Ding*4 小时前
Emu3大模型深度解析:下一Token预测如何统一图像、视频与理解,以及它尚未解决的问题
论文阅读·人工智能·深度学习·机器学习·aigc·ai-native·emu3
来自于狂人4 小时前
GitHub 开源趋势日报 | 2026年10月7日用 AI Agent 逆向工程一切
人工智能·开源·github
SL_staff5 小时前
制造业数字化协同:为什么甘特图只是起点,不是终点
java·开源·全栈