摘要:本文深度解析三星V-NAND架构的核心技术,涵盖Unit Cell电荷陷阱机制、高深宽比通道孔刻蚀工艺、双堆叠与多堆叠技术演进,以及字线RC延迟抑制。结合ONFI 5.2规范与最新9th/10代V-NAND白皮书数据,剖析3D NAND向400+层演进的物理极限与工程破局之道。
目录
[1. 引言:从2D到3D的范式转移与V-NAND的崛起](#1. 引言:从2D到3D的范式转移与V-NAND的崛起)
[2. V-NAND Unit Cell物理架构与电荷陷阱(CTF)机制](#2. V-NAND Unit Cell物理架构与电荷陷阱(CTF)机制)
[3. 通道孔(Channel Hole)工艺与高深宽比刻蚀技术](#3. 通道孔(Channel Hole)工艺与高深宽比刻蚀技术)
[4. 双堆叠与多堆叠(Multi-Stack)技术演进与工艺挑战](#4. 双堆叠与多堆叠(Multi-Stack)技术演进与工艺挑战)
[5. 字线(Word Line)金属化与RC延迟抑制物理模型](#5. 字线(Word Line)金属化与RC延迟抑制物理模型)
[6. 外围电路架构演进:Peripheral Under Cell (PuC)](#6. 外围电路架构演进:Peripheral Under Cell (PuC))
[7. 可靠性挑战与ONFI 5.2规范中的Read Retry机制](#7. 可靠性挑战与ONFI 5.2规范中的Read Retry机制)
[8. 三星第9代与第10代V-NAND技术前瞻与白皮书解析](#8. 三星第9代与第10代V-NAND技术前瞻与白皮书解析)
1. 引言:从2D到3D的范式转移与V-NAND的崛起
在半导体存储技术的发展史中,NAND Flash的微缩(Scaling)一直遵循着摩尔定律的轨迹。然而,当2D Planar NAND的工艺节点推进至15nm乃至12nm级别时,物理极限的壁垒开始显现。根据半导体物理中的短沟道效应(Short Channel Effect, SCE)理论,当沟道长度缩短至一定程度,漏极电场将穿透沟道影响源极势垒,导致严重的漏电流和阈值电压( V t h V_{th} Vth)漂移。同时,相邻存储单元之间的寄生电容耦合(Program Disturb)呈指数级上升,使得数据保持能力(Data Retention)急剧恶化。
为了突破这一物理瓶颈,存储行业将微缩方向从XY平面的二维缩减,转向了Z轴的三维堆叠。2013年,三星电子率先推出业界首款量产的3D垂直结构NAND------V-NAND(Vertical NAND),标志着存储技术正式迈入3D时代。V-NAND的核心思想是:不再强行缩小单元的物理尺寸,而是通过增加垂直方向的堆叠层数来提升存储密度。这一范式转移不仅缓解了光刻机分辨率的压力,还从根本上改变了存储单元的物理结构和制造工艺。
作为「NAND闪存技术精通系列」的第11篇,本文将深入模块2·器件结构篇,以三星V-NAND为蓝本,从半导体物理底层出发,全面剖析Unit Cell设计、通道孔刻蚀工艺、双堆叠技术以及相关的可靠性补偿机制。
2. V-NAND Unit Cell物理架构与电荷陷阱(CTF)机制
与2D NAND普遍采用的浮栅(Floating Gate, FG)技术不同,三星V-NAND从第一代起就坚定地采用了电荷陷阱(Charge Trap Flash, CTF)架构。这一选择是由3D垂直结构的物理特性决定的。
2.1 CTF与FG的物理机制对比
在FG架构中,电子被存储在连续的多晶硅导体中。如果氧化层存在针孔缺陷,所有存储的电子都会泄漏,导致整个Cell失效。而在CTF架构中,电子被存储在氮化硅(SiN)绝缘层的离散陷阱能级中。
从能带理论来看,SiN的导带底比硅(Si)高出约2.1 eV,价带顶比硅低约1.5 eV。这种较深的势阱使得电子一旦注入,需要极高的能量才能逃逸。CTF的点状存储特性(Dot-like storage)带来了两大优势:
- 抗干扰能力强:即使隧道氧化层(Tunneling Oxide)存在局部缺陷,也只会导致局部电荷泄漏,不会引起整个Cell的数据丢失。
- 无需隔离层:FG结构需要复杂的隔离工艺(如STI)来防止相邻FG之间的干扰,而CTF结构由于电荷被局域化,天然具备隔离特性,这使得垂直堆叠成为可能。
2.2 编程与擦除的物理模型
V-NAND的编程(Program)主要通过Fowler-Nordheim (FN) 隧穿机制实现。电子从硅通道(Channel)穿过隧道氧化层注入到SiN陷阱层。FN隧穿电流密度 J F N J_{FN} JFN 的物理公式为:
J F N = A ⋅ E 2 ⋅ exp ( − B ⋅ ϕ 3 / 2 E ) J_{FN} = A \cdot E^2 \cdot \exp\left(-\frac{B \cdot \phi^{3/2}}{E}\right) JFN=A⋅E2⋅exp(−EB⋅ϕ3/2)
其中, A A A 和 B B B 是与材料有效质量相关的常数, E E E 是隧道氧化层中的电场强度, ϕ \phi ϕ 是硅/二氧化硅界面的势垒高度(约3.1 eV)。在V-NAND中,由于通道孔是垂直的,电场分布的均匀性对编程速度至关重要。
擦除(Erase)操作则通常采用带带隧穿(Band-to-Band Tunneling, BTBT)或GIDL(Gate Induced Drain Leakage)机制产生空穴,空穴与陷阱层中的电子复合,从而实现擦除。三星在V-NAND中优化了Erasing Gate(EG)的设计,通过精确控制擦除电压,避免了过度擦除(Over-erasing)导致的负 V t h V_{th} Vth漂移。
3. 通道孔(Channel Hole)工艺与高深宽比刻蚀技术
通道孔(Channel Hole)是3D NAND制造中最核心、最具挑战性的工艺步骤。它不仅是电流流动的垂直通道,也是后续沉积存储节点(ONO/ONON膜)的载体。
3.1 高深宽比圆柱刻蚀(HARC)的物理极限
随着V-NAND层数的增加,通道孔的深宽比(Aspect Ratio, AR)急剧上升。对于128层V-NAND,AR约为60:1;而对于200层以上的产品,AR超过100:1。在如此高的深宽比下进行刻蚀,面临着严重的气体传输限制。
刻蚀气体(如 C 4 F 8 C_4F_8 C4F8、 C H 4 CH_4 CH4、 O 2 O_2 O2的混合气体)在孔口处的浓度较高,但在孔底部由于反应副产物(Polymer)的堆积和反应物的耗尽,刻蚀速率会显著下降。这导致了两种典型的形貌缺陷:
- 弓形效应(Bowing):孔中部被过度刻蚀,呈现腰鼓状。
- 锥形效应(Tapering):孔底部刻蚀不足,孔径自上而下逐渐变小。
text
====================================================================
图1:高深宽比通道孔(Channel Hole)刻蚀形貌与ONO膜沉积截面示意图
====================================================================
[理想孔形貌] [实际弓形/锥形缺陷] [ONO膜沉积后截面]
| | | | | | | |
| | | | | | | |
---+----+--- Block +--------+ Oxide |--| |--| BL
| | | | Oxide | | | | | |
| | | | | \ / | Bowing | | SiN | | Trap
| | | | | \/ | | | | |
| | | | | /\ | | | | |
| | | | | / \ | | | | |
| | | | | | | | | |
---+----+--- +--------+ |--| |--|
| | | | Tapering | | | |
| | | | | | | |
| | | | | | | |
---+----+--- Etch Stop +--------+ |--| |--|
| | | | | | | |
| | | | | | | |
| | | | | | | |
| | | | | | | |
| | | | | | | |
---+----+--- Substrate +--------+ |--| |--| Sub
| | | | | | | |
| | | | | | | |
|____| |________| |__|______|__|
Channel Channel O N O N O
Poly-Si Poly-Si (Block, Trap, Tunnel)
3.2 原子层沉积(ALD)与保形性挑战
刻蚀完成后,需要在孔壁沉积Blocking Oxide / Charge Trap / Tunneling Oxide(即ONON或ONO膜)。为了保证各层厚度在纳米级别的均匀性,传统的CVD(化学气相沉积)已无法满足要求,必须采用ALD(原子层沉积)技术。
ALD通过自限制的表面化学反应,每次只沉积一个原子层。例如,沉积Al2O3(Blocking Oxide)时,交替通入TMA(三甲基铝)和H2O。尽管ALD具有极佳的保形性(Conformality),但在深宽比>100:1的孔内,前驱体分子扩散到孔底需要极长的时间,导致沉积周期(Cycle Time)大幅增加,严重影响了产能(WPH, Wafer Per Hour)。三星通过优化前驱体分子结构(如使用大分子量的BTBAS沉积SiN)和脉冲进气技术,在保证膜厚均匀性的同时,将ALD的沉积效率提升了约30%。
4. 双堆叠与多堆叠(Multi-Stack)技术演进与工艺挑战
当V-NAND的层数突破150层甚至向200层以上迈进时,单次刻蚀(Single Stack)的深宽比达到了物理和设备的极限。为了解决这一问题,三星引入了双堆叠(Double Stack)乃至多堆叠(Multi-Stack)技术。
4.1 双堆叠工艺流(Double Stack Process Flow)
双堆叠技术的核心思想是将原本需要一次刻蚀完成的超深孔,分为两次(或多次)较浅的刻蚀来完成。其典型工艺流程如下:
- 上半部分刻蚀:首先沉积上半部分的牺牲层(Sacrificial Layers,如SiN/SiO2交替),并刻蚀出上半部分的通道孔。
- 沉积通道与绝缘层:在上半部分的孔内沉积Channel Poly-Si和ONO膜。
- 沉积刻蚀停止层(Etch Stop Layer, ESL):在晶圆表面沉积一层对后续刻蚀气体具有高选择比的材料,通常是非晶硅(a-Si)或特定的碳膜。
- 下半部分刻蚀:沉积下半部分的牺牲层,利用光刻胶掩膜,刻蚀下半部分的通道孔。由于ESL的存在,刻蚀气体在穿透上半部分已沉积的ONO膜和Channel Poly-Si时会被阻挡,从而保护上半部分结构不被破坏。
- 对准与连接:下半部分刻蚀完成后,去除ESL,使上下两部分的通道孔对准并连通,最后沉积下半部分的ONO膜和Channel Poly-Si。
4.2 对准精度与良率挑战
双堆叠技术最大的挑战在于上下两部分通道孔的对准精度(Overlay Accuracy)。如果对准出现偏差,会导致孔壁错位,不仅增加寄生电容,还可能导致通道断路或短路。
根据三星在FMS(Flash Memory Summit)上公布的技术白皮书数据,通过引入先进的EUV(极紫外光刻)辅助对准标记和自对准刻蚀工艺,三星将双堆叠的对准误差控制在±5nm以内。此外,ESL材料的选择至关重要。如果ESL对底层ONO膜的选择比不够高,在刻蚀下半部分时,可能会过度消耗上半部分的隧道氧化层,导致漏电。三星采用了一种创新的复合ESL结构,将刻蚀选择比提升至200:1以上,有效解决了这一问题。
4.3 从双堆叠到三堆叠(3-Stack)的演进
在三星最新的第10代V-NAND(V10 BV-NAND)中,为了突破400层大关,采用了先进的3-stack HARC(High Aspect Ratio Cylinder)技术。3-stack意味着需要将孔分为三次刻蚀,这对ESL的去除工艺、孔底清洁以及三次对准的累积误差控制提出了更为严苛的要求。通过引入干法去胶和特定的湿法清洗组合,三星成功将3-stack的良率提升至量产水平。
5. 字线(Word Line)金属化与RC延迟抑制物理模型
在3D NAND中,字线(Word Line, WL)不再像2D NAND那样是平行的短线,而是贯穿整个垂直堆叠层的长条形导体。对于200层的V-NAND,WL的物理长度可达数毫米。这种巨大的尺寸变化带来了严重的寄生电阻(R)和寄生电容(C)问题,导致RC延迟急剧增加,严重限制了芯片的读取和编程速度。
5.1 寄生电容与RC延迟物理模型
WL的总电容 C W L C_{WL} CWL 由两部分组成:与相邻WL的耦合电容,以及与通道孔(Channel Hole)的交叠电容。其物理模型可近似表示为:
C W L = ϵ o x ⋅ W ⋅ L t o x + C p a r a s i t i c _ c o u p l i n g C_{WL} = \frac{\epsilon_{ox} \cdot W \cdot L}{t_{ox}} + C_{parasitic\_coupling} CWL=toxϵox⋅W⋅L+Cparasitic_coupling
其中, ϵ o x \epsilon_{ox} ϵox 是层间介质的介电常数, W W W 和 L L L 分别是WL的宽度和长度, t o x t_{ox} tox 是层间介质厚度。由于层数增加, L L L 显著增大,导致 C W L C_{WL} CWL 呈线性增长。
RC延迟时间常数 τ R C \tau_{RC} τRC 决定了信号在WL上的传播速度:
τ R C = R W L ⋅ C W L = ρ L A c r o s s ⋅ C W L \tau_{RC} = R_{WL} \cdot C_{WL} = \rho \frac{L}{A_{cross}} \cdot C_{WL} τRC=RWL⋅CWL=ρAcrossL⋅CWL
其中, ρ \rho ρ 是WL材料的电阻率, A c r o s s A_{cross} Across 是WL的截面积。为了抑制 τ R C \tau_{RC} τRC,必须降低 ρ \rho ρ 或减小 C W L C_{WL} CWL。
5.2 字线材料替换:从多晶硅到钼(Mo)
在早期的3D NAND中,WL通常采用掺杂的多晶硅(Poly-Si)。然而,Poly-Si的电阻率较高(通常在 10 − 3 Ω ⋅ c m 10^{-3} \Omega \cdot cm 10−3Ω⋅cm 量级),且随着线宽缩小,晶界散射导致电阻进一步增大。
为了突破这一瓶颈,三星在较新的V-NAND代际中,逐步将WL材料从Poly-Si替换为钼(Mo)或钨(W)。Mo的电阻率(约 5.3 × 10 − 6 Ω ⋅ c m 5.3 \times 10^{-6} \Omega \cdot cm 5.3×10−6Ω⋅cm)比Poly-Si低两个数量级。根据IEEE IEDM会议发表的论文数据,采用Mo WL后,WL的RC延迟降低了约40%,使得编程速度(Program Speed)提升了近一倍。
此外,为了降低 C p a r a s i t i c _ c o u p l i n g C_{parasitic\_coupling} Cparasitic_coupling,三星在WL之间引入了低介电常数(Low-k)的空气隙(Air-gap)或 porous SiO2 作为层间介质,将介电常数从传统的4.0降低至2.5左右,进一步抑制了相邻WL之间的串扰(Word Line Interference)。
6. 外围电路架构演进:Peripheral Under Cell (PuC)
随着V-NAND层数的增加,Cell阵列(Cell Array)占据的芯片面积比例越来越大,而外围电路(Peripheral Circuits,如行解码器、页缓冲器、电压生成器)的面积却难以同比例缩小。如果继续采用传统的Peripheral beside Cell(外围电路与Cell阵列并排)布局,芯片的整体面积(Die Size)将大幅增加,导致单片晶圆产出的Die数量减少,成本(Cost per bit)上升。
6.1 PuC/CUC架构的物理实现
为了解决这一问题,三星引入了Peripheral Under Cell (PuC) 或 CMOS Under Cell (CUC) 架构。在这种架构中,外围电路的CMOS晶体管被制造在硅衬底的最底层,而3D Cell阵列则直接构建在外围电路的上方。
这种3D集成架构带来了显著的优势:
- 缩小Die Size:Cell阵列和外围电路在Z轴上重叠,Die面积几乎完全由Cell阵列决定,大幅提升了晶圆利用率。
- 增加I/O通道:由于外围电路面积不再受限,可以设计更多的页缓冲器(Page Buffer)和I/O引脚,从而提升芯片的并行吞吐量和接口带宽。
6.2 V-NAND物理层映射的C结构体描述
为了在固件和驱动层面更好地理解和管理这种复杂的3D物理布局,我们可以使用C语言结构体来抽象V-NAND Die的物理层映射关系。以下是一个简化的伪代码示例,展示了PuC架构下Die的逻辑与物理映射:
c
/* V-NAND Die 物理与逻辑层映射结构体 */
typedef struct {
/* 基础物理参数 */
uint16_t total_layers; // 总堆叠层数 (例如: 236 for 9th Gen)
uint16_t num_stacks; // 堆叠次数 (例如: 2 for Double Stack)
uint8_t cell_type; // 单元类型 (0:SLC, 1:TLC, 2:QLC)
/* 通道孔与字线物理参数 */
uint32_t holes_per_block; // 每个Block的通道孔数量
uint32_t wl_length_um; // 字线物理长度 (微米)
uint16_t wl_material_id; // 字线材料 (0:Poly-Si, 1:Mo, 2:W)
/* 堆叠结构信息 (针对Multi-Stack) */
struct {
uint16_t start_layer; // 该Stack的起始逻辑层号
uint16_t end_layer; // 该Stack的结束逻辑层号
uint8_t esl_material; // 刻蚀停止层材料 (0:a-Si, 1:Carbon)
uint16_t overlay_margin; // 对准容差 (nm)
} stack_info[4]; // 最多支持4-stack
/* 外围电路布局 (PuC架构) */
struct {
uint8_t is_puc_enabled; // 是否启用Peripheral Under Cell
uint32_t periph_area_mm2; // 外围电路物理面积
uint16_t num_page_buffers;// 页缓冲器数量
uint8_t io_bus_width; // I/O总线宽度 (如 8, 16, 32)
} peripheral_layout;
/* 可靠性与补偿参数 (映射自ONFI Parameter Page) */
struct {
uint8_t read_retry_modes;// 支持的Read Retry模式数量
uint8_t temp_sensors; // 片内温度传感器数量
} reliability_config;
} vnand_die_physical_map_t;
/* 初始化一个9th Gen V-NAND (1Tb TLC, Double Stack, PuC) 的配置 */
void init_9th_gen_vnand(vnand_die_physical_map_t *die) {
die->total_layers = 236;
die->num_stacks = 2;
die->cell_type = 1; // TLC
die->holes_per_block = 1536;
die->wl_length_um = 4500; // 4.5mm
die->wl_material_id = 1; // Mo (钼)
die->stack_info[0].start_layer = 0;
die->stack_info[0].end_layer = 117;
die->stack_info[1].start_layer = 118;
die->stack_info[1].end_layer = 235;
die->peripheral_layout.is_puc_enabled = 1;
die->peripheral_layout.num_page_buffers = 256;
die->peripheral_layout.io_bus_width = 16; // 16-bit IO for high throughput
}
7. 可靠性挑战与ONFI 5.2规范中的Read Retry机制
3D NAND在带来高密度优势的同时,也引入了新的可靠性挑战。由于通道孔刻蚀的形貌偏差(如Bowing)、ONO膜厚的微小不均匀性,以及多层堆叠带来的热应力,V-NAND的阈值电压( V t h V_{th} Vth)分布往往比2D NAND更宽。特别是在经历多次编程/擦除(P/E)循环后,电荷陷阱层中的缺陷态增加,导致Data Retention(数据保持)能力下降, V t h V_{th} Vth 分布发生偏移。
7.1 V t h V_{th} Vth 偏移的物理机制
在P/E循环中,高能电子反复穿过隧道氧化层,会在SiO2/SiN界面产生界面态(Interface Traps)。这些界面态会捕获电子,导致擦除态(Erase State)的 V t h V_{th} Vth 向正方向漂移;同时,陷阱层中的电子在高温下通过Poole-Frenkel发射泄漏,导致编程态(Program State)的 V t h V_{th} Vth 向负方向漂移。这种双向漂移使得TLC或QLC的7个或15个 V t h V_{th} Vth 状态发生重叠,增加读取误码率(RBER)。
7.2 ONFI 5.2规范中的Read Retry机制
为了补偿 V t h V_{th} Vth 偏移,NAND控制器必须动态调整读取电压。ONFI(Open NAND Flash Interface)规范在Parameter Page(参数页)中定义了Read Retry机制。根据《Open NAND Flash Interface Specification Revision 5.2》第4.3节(Read Retry)和第5.2.4节(Parameter Page Bytes)的定义,NAND设备通过Read Retry Table向主机报告在不同温度、不同P/E Cycle下的最优读取电压偏移量。
在ONFI 5.2规范中,Read Retry Table的每个Entry包含以下关键参数:
- Mode Number:Read Retry模式的编号(0-255)。
- Voltage Offset (mV):相对于默认读取电压的偏移量。对于TLC,需要分别定义7个物理页(Lower, Middle, Upper)的偏移量。
- Temperature Range:该偏移量适用的温度范围。
控制器在读取数据前,首先发送 Read Retry 命令(Command Code: 0x89),并传入Mode Number。NAND设备内部的状态机根据该Mode Number,从熔丝(Fuse)或寄存器中加载对应的Voltage Offset,并应用到行解码器(Row Decoder)的读取电压上。如果读取失败(ECC纠错失败),控制器会遍历不同的Mode,直到找到误码率最低的电压组合。
三星V-NAND通过片内集成的微型温度传感器和P/E Cycle计数器,结合ONFI规范,实现了细粒度的自适应Read Retry,将读取延迟(Read Latency)增加了控制在5%以内,同时大幅降低了ECC引擎的功耗。
8. 三星第9代与第10代V-NAND技术前瞻与白皮书解析
三星在V-NAND技术上保持着持续的迭代。根据其官方技术博客和FMS(Flash Memory Summit)发布的技术白皮书,第9代和第10代V-NAND在架构和工艺上实现了重大突破。
8.1 第9代 V-NAND:1Tb TLC与AI存储基石
三星第9代V-NAND(236层)是业界首款量产的1Tb(Terabit) TLC NAND。根据三星半导体官方博客《Samsung V-NAND: A Landmark of the Hyperscale AI Era》披露的数据,1Tb TLC设计通过优化Unit Cell尺寸和通道孔排列,将单Die容量提升了约30%,同时 write throughput(写入吞吐量)比上一代提高了约30%,功耗降低了约20%。
这一代产品特别针对Hyperscale AI数据中心的需求进行了优化。AI训练和推理需要极高的随机读取带宽和极低的延迟。第9代V-NAND通过引入更高速的Toggle DDR接口(高达3.2 Gbps/pin)和优化页缓冲器架构,满足了AI工作负载对IOPS(每秒输入输出操作次数)的严苛要求。
8.2 第10代 V-NAND (V10 BV-NAND):突破400层的3-stack HARC
在FMS 2024/2026期间,三星展示了其第10代V-NAND(V10 BV-NAND,Beyond 400 layers)的技术愿景。根据三星新闻稿《V10 BV-NAND: Pushing the Boundaries of AI Storage Beyond 400 Layers》,V10的核心创新在于其先进的3-stack HARC(High Aspect Ratio Cylinder)技术。
如前文所述,当层数超过300层时,双堆叠的深宽比已接近极限。V10通过3-stack技术,将单次刻蚀的深宽比控制在130:1左右,从而保证了通道孔的垂直度和ONO膜的均匀性。三星工程团队(如Dawoon Jeong等专家)指出,3-stack不仅是刻蚀工艺的挑战,更是对沉积、对准和良率控制的全面考验。V10通过引入新一代的ALD设备和自对准刻蚀标记,成功将400+层V-NAND的良率提升至商业化标准,为未来ZB(Zettabyte)级AI存储时代奠定了物理基础。
━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━
知识点小结
| 知识点 | 核心要点 | 关键参数/数据 |
|---|---|---|
| CTF Unit Cell | 采用电荷陷阱(SiN)替代浮栅,点状存储抗干扰,无需隔离层,适合垂直堆叠。 | 势垒高度~3.1eV,FN隧穿机制 |
| 通道孔刻蚀 | 高深宽比圆柱刻蚀(HARC),面临Bowing和Tapering效应,需ALD保证膜厚均匀。 | 深宽比>100:1,ALD保形沉积 |
| 双堆叠/多堆叠 | 将超深孔分次刻蚀,引入刻蚀停止层(ESL),解决单次刻蚀物理极限。 | 9代236层(双堆叠),10代400+层(三堆叠) |
| 字线RC延迟 | 3D WL极长导致RC延迟大,采用Mo/W替代Poly-Si降低电阻,Low-k介质降低电容。 | Mo电阻率~ 5.3 × 10 − 6 Ω ⋅ c m 5.3 \times 10^{-6} \Omega \cdot cm 5.3×10−6Ω⋅cm |
| PuC架构 | 外围电路置于Cell阵列下方,缩小Die Size,增加I/O通道和Page Buffer数量。 | Die面积利用率提升,支持16/32-bit IO |
| Read Retry | 补偿P/E循环和温度导致的 V t h V_{th} Vth偏移,依据ONFI 5.2规范动态调整读取电压。 | ONFI 5.2 Sec 4.3,支持256种Mode |
深度思考题
-
思考题1 :在双堆叠(Double Stack)工艺中,刻蚀停止层(ESL)的选择比(Selectivity)至关重要。如果ESL对底层ONO膜的选择比不足,在刻蚀下半部分通道孔时会产生什么具体的物理后果?请从电场分布和电荷泄漏的角度分析其对Data Retention的影响。
思考引导:考虑刻蚀等离子体对底层隧道氧化层的轰击损伤,以及损伤后界面态增加对FN隧穿电流和电荷保持的长期影响。
-
思考题2 :随着V-NAND层数向400层以上迈进,字线(WL)的RC延迟成为限制读取速度的核心瓶颈。除了将WL材料从Poly-Si替换为Mo或W之外,从电路设计和信号完整性的角度,还有哪些方法可以补偿或缓解长WL带来的信号衰减和延迟?
思考引导:考虑分段字线驱动(Split WL Driving)、预充电(Pre-charge)策略优化、以及感测放大器(Sense Amplifier)的灵敏度设计。
-
思考题3 :ONFI 5.2规范定义了详细的Read Retry Table。在AI数据中心的高并发随机读取场景下,频繁执行Read Retry命令会增加NAND的读取延迟(Read Latency)。请设计一种固件层面的优化策略,在不增加硬件成本的前提下,最小化Read Retry带来的性能惩罚。
思考引导:考虑利用机器学习模型预测 V t h V_{th} Vth偏移趋势、基于历史读取数据构建自适应电压查找表(LUT),或利用片内温度传感器进行前馈补偿。
9. 3D NAND 薄膜沉积工艺挑战:ALD与先进CVD在超高深宽比结构中的应用
随着三星V-NAND向第9代(236层/300+层)甚至第10代(400+层)演进,通道孔的深宽比(Aspect Ratio, AR)已突破100:1甚至150:1。在如此极端的深孔结构中,沉积均匀的ONO(Oxide-Nitride-Oxide)电荷陷阱层和Block Oxide成为了制造工艺的最大瓶颈。传统的PECVD(等离子体增强化学气相沉积)由于反应物在深孔内的扩散受限,会导致严重的"瓶颈效应"(Pinch-off),即孔口提前闭合而孔底未完全填充。
9.1 深孔沉积的物理模型与克努森扩散
在深宽比极高的圆柱形通道孔内,气体分子的传输从粘性流(Viscous flow)转变为分子流(Molecular flow),即克努森扩散(Knudsen diffusion)机制。根据克努森理论,反应前驱体在深孔内的浓度分布 C ( z ) C(z) C(z) 遵循双曲余弦函数衰减模型:
C ( z ) = C 0 cosh ( 3 k r D ( H − z ) ) cosh ( 3 k r D H ) C(z) = C_0 \frac{\cosh\left(\sqrt{\frac{3k}{r D}} (H - z)\right)}{\cosh\left(\sqrt{\frac{3k}{r D}} H\right)} C(z)=C0cosh(rD3k H)cosh(rD3k (H−z))
其中, C 0 C_0 C0 为孔口处的反应物浓度, H H H 为孔的总深度, r r r 为孔半径, k k k 为表面反应速率常数, D D D 为克努森扩散系数。当深宽比 H / r H/r H/r 极大时,孔底浓度 C ( H ) C(H) C(H) 呈指数级下降,导致孔底沉积速率远低于孔口。
9.2 从CVD到Space-ALD的工艺演进
为了实现100:1以上深宽比的完美共形覆盖(Conformal Coverage),三星在先进V-NAND节点中引入了Space-ALD(空间原子层沉积)与改进型Flowable CVD(FCVD)技术。
text
[ALD 自限制沉积] [传统CVD 连续沉积]
| | | |
+--|---|--+ +--|---|--+
| \ / | | \ / |
| \ / | | \ / |
| V | 均匀共形覆盖 | \ / | 顶部过厚/瓶颈
| | | (Step Coverage>98%) | V | (台阶覆盖差)
| | | | | |
+----+----+ +----+----+
ALD通过交替脉冲前驱体和 purge 气体,利用表面自限制反应(Self-limiting reaction),确保每次循环仅沉积一个原子层(~0.1nm)。然而,传统时序ALD(Temporal ALD)的抽真空和吹扫步骤极其耗时。三星通过引入空间ALD(Space-ALD),将前驱体在空间上隔离,晶圆在旋转或平移中依次穿过不同的气体区域,在保持ALD级台阶覆盖率(>98%)的同时,将沉积速率提升了3-5倍。根据三星半导体技术日披露的数据,在第9代V-NAND中,结合新型High-k前驱体,Block Oxide的沉积时间缩短了30%,有效抑制了深孔底部的电荷泄漏路径。
10. 串间干扰(String-to-String Interference)物理模型与隔离结构设计
在3D NAND的密集阵列中,除了沿Z轴的字线间干扰(Word-line to Word-line Interference),沿XY平面的相邻通道孔之间的横向电场耦合------即串间干扰(String-to-String Interference)------成为限制存储密度和可靠性的核心物理效应。当相邻通道孔(String)被编程到不同的阈值电压状态时,其侧壁电场会穿透Block Oxide,改变目标孔内沟道和电荷陷阱层的电势分布。
10.1 串间干扰的圆柱电容物理模型
将通道孔简化为同轴圆柱电容器模型。设通道孔半径为 r r r,相邻孔中心距为 d d d,孔深为 H H H。在圆柱坐标系下,相邻孔之间的耦合电容 C s s C_{ss} Css 可通过求解拉普拉斯方程近似得到:
C s s ≈ π ϵ 0 ϵ r H ln ( d / r ) − ln ( 1 − ( r / d ) 2 ) C_{ss} \approx \frac{\pi \epsilon_0 \epsilon_r H}{\ln(d/r) - \ln\left(1 - (r/d)^2\right)} Css≈ln(d/r)−ln(1−(r/d)2)πϵ0ϵrH
串间干扰引起的阈值电压漂移 Δ V t h \Delta V_{th} ΔVth 与耦合电容系数 γ s s = C s s / C t o t a l \gamma_{ss} = C_{ss} / C_{total} γss=Css/Ctotal 成正比。随着层数增加,为了维持密度,孔间距 d d d 不断缩小,导致 γ s s \gamma_{ss} γss 呈非线性上升。
10.2 蜂窝状阵列与Dummy Hole隔离设计
为了抑制串间干扰,三星V-NAND摒弃了传统的方形(Square)阵列布局,全面采用蜂窝状(Honeycomb)交错阵列。在蜂窝状布局中,每个有效通道孔周围有6个相邻孔,相比方形布局的4个相邻孔,有效增加了孔间距,降低了局部电场集中度。
此外,在阵列边缘和特定区域,三星引入了虚拟通道孔(Dummy Hole) 和隔离环(Isolation Ring) 设计。Dummy Hole不连接外围电路,其内部填充导电多晶硅并接地,作为电场屏蔽层(Faraday cage)吸收边缘刻蚀带来的形变,并阻断边缘有效孔的电场泄漏。
text
[3D NAND 蜂窝状 (Honeycomb) 通道孔阵列布局]
O O O O O = 有效通道孔 (Active Hole)
O X O X O X = 虚拟通道孔 (Dummy Hole)
O O O O Dummy Hole用于吸收边缘刻蚀负载不均
O X O X O 及抑制串间电场干扰 (String-to-String)
O O O O
通过这种物理布局优化与Dummy Hole的结合,三星在第8代/第9代V-NAND中,将串间干扰引起的 Δ V t h \Delta V_{th} ΔVth 严格控制在50mV以内,相比早期方形阵列设计降低了约40%,显著提升了多层级(如TLC/QLC)编程的Margin。
11. 面向AI高并发场景的多平面(Multi-Plane)架构与固件调度优化
在AI大模型训练与推理场景中,GPU集群对存储系统提出了极高的带宽与IOPS要求。单颗NAND Die的内部总线带宽(通常仅为几百MB/s)已无法喂饱PCIe 5.0/6.0的主机接口带宽(14 GB/s ~ 28 GB/s)。为了打破这一"内存墙",3D NAND在架构设计上引入了深度的并行化机制,即多平面(Multi-Plane)与超平面(Super Plane)架构。
11.1 Multi-Plane 架构与内部总线倍增
在三星V-NAND的Die内部,存储阵列被划分为多个独立的Plane(通常为2个或4个)。每个Plane拥有独立的Page Buffer(页缓冲区)和Sense Amplifier( sense放大器)。通过Multi-Plane Read/Program命令,控制器可以在同一个时钟周期内,同时激活同一LUN(Logical Unit Number)下的多个Plane。
以4-Plane(4P)架构为例,当主机下发一个跨越4个Plane边界的顺序读取请求时,NAND固件会将其拆分为4个并行的内部读取操作。这使得内部总线带宽瞬间翻4倍,达到约 3.2 GB/s per LUN。结合单封装内多达16个CE(Chip Enable)的Toggle操作,单颗NAND芯片的顺序读取带宽可突破 2.5 GB/s,完美匹配PCIe 5.0 x4的极限性能。
11.2 FTL 固件层面的 Super Block 调度策略
要在固件层面最大化Multi-Plane的收益,FTL(Flash Translation Layer)必须实现Super Block管理。Super Block是指在同一LUN内,跨越所有Plane的相同物理Block位置组合而成的逻辑块。
在C代码层面,FTL的调度器需要实时评估LBA(Logical Block Address)的映射关系,尽可能将连续的LBA映射到同一个Super Block的不同Plane中,以触发硬件级的并发读取。以下是简化的Multi-Plane Read固件调度逻辑:
c
/* FTL Multi-Plane Read Scheduler for High-Concurrency AI Workloads */
typedef struct {
uint32_t lba_start;
uint32_t num_pages;
uint8_t target_lun;
} mp_read_req_t;
#define MAX_PLANES 4
#define hweight8(x) __builtin_popcount(x)
// 检查目标LBA在指定Plane的Block中是否有效
extern bool is_page_valid(uint8_t lun, uint8_t block, uint8_t plane, uint32_t lba);
// 下发NAND硬件并发命令
extern void issue_nand_cmd(uint8_t cmd, uint8_t lun, uint8_t block, uint8_t mask);
int schedule_multi_plane_read(mp_read_req_t *req) {
// 1. 将主机LBA转换为物理PPA (Physical Page Address)
uint32_t ppa = lba_to_ppa(req->lba_start);
uint8_t target_lun = GET_LUN(ppa);
uint8_t target_block = GET_BLOCK(ppa);
// 2. 探测同一Super Block内各Plane的对齐状态
uint8_t plane_mask = 0;
for (int p = 0; p < MAX_PLANES; p++) {
// 检查连续LBA是否正好落在该Plane的对应Page位置
if (is_page_valid(target_lun, target_block, p, req->lba_start)) {
plane_mask |= (1 << p);
}
}
// 3. 并发度评估与命令下发
uint8_t active_planes = hweight8(plane_mask);
if (active_planes >= 2) {
// 触发 Multi-Plane Read (命令码 0x32)
// 硬件将同时Sense多个Plane的Page Buffer,内部带宽翻倍
issue_nand_cmd(CMD_MULTI_PLANE_READ, target_lun, target_block, plane_mask);
return active_planes; // 返回实际并发读取的Plane数量
}
// 4. 降级策略:若LBA未对齐或跨Block,回退到单Plane读取
uint8_t single_plane = GET_PLANE(ppa);
issue_nand_cmd(CMD_SINGLE_READ, target_lun, target_block, single_plane);
return 1;
}
通过上述固件调度策略,结合三星V-NAND底层的超快总线(Toggle 5.0/DDR5)接口,SSD在处理AI数据加载(如Checkpoint读取、Dataset prefetching)时,能够将Read Latency降低30%以上,同时使随机读取IOPS提升近4倍,充分释放了3D NAND在AI超算时代的存储潜能。
参考资料
- Samsung V-NAND: A Landmark of the Hyperscale AI Era
- Samsung V-NAND Memory Technology Datasheet
- FMS 2026 3D & NAND Innovation Award: V10 BV-NAND Pushing Beyond 400 Layers
- Open NAND Flash Interface Specification Revision 5.2
- IEEE IEDM: High Aspect Ratio Etching for 3D NAND Flash Memory
- JEDEC Standard No. 21C: Configuration Values for Solid State Drives
- Samsung Semiconductor Technology Day 2023: 9th Gen V-NAND Overview
- Flash Memory Summit (FMS) Technical Papers on 3D NAND Scaling
作者简介:资深RDMA智能网卡、存储技术专家,拥有十余年DPU/RDMA/NVMe SSD芯片测试与工程经验,致力于推动高性能网络技术的开源与普及。