三星V-NAND架构技术解析(Unit Cell、双堆叠技术、通道孔工艺)

摘要:本文深度解析三星V-NAND架构的核心技术,涵盖Unit Cell电荷陷阱机制、高深宽比通道孔刻蚀工艺、双堆叠与多堆叠技术演进,以及字线RC延迟抑制。结合ONFI 5.2规范与最新9th/10代V-NAND白皮书数据,剖析3D NAND向400+层演进的物理极限与工程破局之道。

目录

[1. 引言:从2D到3D的范式转移与V-NAND的崛起](#1. 引言:从2D到3D的范式转移与V-NAND的崛起)

[2. V-NAND Unit Cell物理架构与电荷陷阱(CTF)机制](#2. V-NAND Unit Cell物理架构与电荷陷阱(CTF)机制)

[3. 通道孔(Channel Hole)工艺与高深宽比刻蚀技术](#3. 通道孔(Channel Hole)工艺与高深宽比刻蚀技术)

[4. 双堆叠与多堆叠(Multi-Stack)技术演进与工艺挑战](#4. 双堆叠与多堆叠(Multi-Stack)技术演进与工艺挑战)

[5. 字线(Word Line)金属化与RC延迟抑制物理模型](#5. 字线(Word Line)金属化与RC延迟抑制物理模型)

[6. 外围电路架构演进:Peripheral Under Cell (PuC)](#6. 外围电路架构演进:Peripheral Under Cell (PuC))

[7. 可靠性挑战与ONFI 5.2规范中的Read Retry机制](#7. 可靠性挑战与ONFI 5.2规范中的Read Retry机制)

[8. 三星第9代与第10代V-NAND技术前瞻与白皮书解析](#8. 三星第9代与第10代V-NAND技术前瞻与白皮书解析)

1. 引言:从2D到3D的范式转移与V-NAND的崛起

在半导体存储技术的发展史中,NAND Flash的微缩(Scaling)一直遵循着摩尔定律的轨迹。然而,当2D Planar NAND的工艺节点推进至15nm乃至12nm级别时,物理极限的壁垒开始显现。根据半导体物理中的短沟道效应(Short Channel Effect, SCE)理论,当沟道长度缩短至一定程度,漏极电场将穿透沟道影响源极势垒,导致严重的漏电流和阈值电压( V t h V_{th} Vth)漂移。同时,相邻存储单元之间的寄生电容耦合(Program Disturb)呈指数级上升,使得数据保持能力(Data Retention)急剧恶化。

为了突破这一物理瓶颈,存储行业将微缩方向从XY平面的二维缩减,转向了Z轴的三维堆叠。2013年,三星电子率先推出业界首款量产的3D垂直结构NAND------V-NAND(Vertical NAND),标志着存储技术正式迈入3D时代。V-NAND的核心思想是:不再强行缩小单元的物理尺寸,而是通过增加垂直方向的堆叠层数来提升存储密度。这一范式转移不仅缓解了光刻机分辨率的压力,还从根本上改变了存储单元的物理结构和制造工艺。

作为「NAND闪存技术精通系列」的第11篇,本文将深入模块2·器件结构篇,以三星V-NAND为蓝本,从半导体物理底层出发,全面剖析Unit Cell设计、通道孔刻蚀工艺、双堆叠技术以及相关的可靠性补偿机制。

2. V-NAND Unit Cell物理架构与电荷陷阱(CTF)机制

与2D NAND普遍采用的浮栅(Floating Gate, FG)技术不同,三星V-NAND从第一代起就坚定地采用了电荷陷阱(Charge Trap Flash, CTF)架构。这一选择是由3D垂直结构的物理特性决定的。

2.1 CTF与FG的物理机制对比

在FG架构中,电子被存储在连续的多晶硅导体中。如果氧化层存在针孔缺陷,所有存储的电子都会泄漏,导致整个Cell失效。而在CTF架构中,电子被存储在氮化硅(SiN)绝缘层的离散陷阱能级中。

从能带理论来看,SiN的导带底比硅(Si)高出约2.1 eV,价带顶比硅低约1.5 eV。这种较深的势阱使得电子一旦注入,需要极高的能量才能逃逸。CTF的点状存储特性(Dot-like storage)带来了两大优势:

  1. 抗干扰能力强:即使隧道氧化层(Tunneling Oxide)存在局部缺陷,也只会导致局部电荷泄漏,不会引起整个Cell的数据丢失。
  2. 无需隔离层:FG结构需要复杂的隔离工艺(如STI)来防止相邻FG之间的干扰,而CTF结构由于电荷被局域化,天然具备隔离特性,这使得垂直堆叠成为可能。

2.2 编程与擦除的物理模型

V-NAND的编程(Program)主要通过Fowler-Nordheim (FN) 隧穿机制实现。电子从硅通道(Channel)穿过隧道氧化层注入到SiN陷阱层。FN隧穿电流密度 J F N J_{FN} JFN 的物理公式为:

J F N = A ⋅ E 2 ⋅ exp ⁡ ( − B ⋅ ϕ 3 / 2 E ) J_{FN} = A \cdot E^2 \cdot \exp\left(-\frac{B \cdot \phi^{3/2}}{E}\right) JFN=A⋅E2⋅exp(−EB⋅ϕ3/2)

其中, A A A 和 B B B 是与材料有效质量相关的常数, E E E 是隧道氧化层中的电场强度, ϕ \phi ϕ 是硅/二氧化硅界面的势垒高度(约3.1 eV)。在V-NAND中,由于通道孔是垂直的,电场分布的均匀性对编程速度至关重要。

擦除(Erase)操作则通常采用带带隧穿(Band-to-Band Tunneling, BTBT)或GIDL(Gate Induced Drain Leakage)机制产生空穴,空穴与陷阱层中的电子复合,从而实现擦除。三星在V-NAND中优化了Erasing Gate(EG)的设计,通过精确控制擦除电压,避免了过度擦除(Over-erasing)导致的负 V t h V_{th} Vth漂移。

3. 通道孔(Channel Hole)工艺与高深宽比刻蚀技术

通道孔(Channel Hole)是3D NAND制造中最核心、最具挑战性的工艺步骤。它不仅是电流流动的垂直通道,也是后续沉积存储节点(ONO/ONON膜)的载体。

3.1 高深宽比圆柱刻蚀(HARC)的物理极限

随着V-NAND层数的增加,通道孔的深宽比(Aspect Ratio, AR)急剧上升。对于128层V-NAND,AR约为60:1;而对于200层以上的产品,AR超过100:1。在如此高的深宽比下进行刻蚀,面临着严重的气体传输限制。

刻蚀气体(如 C 4 F 8 C_4F_8 C4F8、 C H 4 CH_4 CH4、 O 2 O_2 O2的混合气体)在孔口处的浓度较高,但在孔底部由于反应副产物(Polymer)的堆积和反应物的耗尽,刻蚀速率会显著下降。这导致了两种典型的形貌缺陷:

  1. 弓形效应(Bowing):孔中部被过度刻蚀,呈现腰鼓状。
  2. 锥形效应(Tapering):孔底部刻蚀不足,孔径自上而下逐渐变小。
text 复制代码
====================================================================
图1:高深宽比通道孔(Channel Hole)刻蚀形貌与ONO膜沉积截面示意图
====================================================================

   [理想孔形貌]         [实际弓形/锥形缺陷]       [ONO膜沉积后截面]
      |    |               |        |              |  |      |  |
      |    |               |        |              |  |      |  |
   ---+----+--- Block      +--------+ Oxide        |--|      |--| BL
   |  |    |  | Oxide      |        |              |  |      |  |
   |  |    |  |            |  \  /  | Bowing       |  | SiN  |  | Trap
   |  |    |  |            |   \/   |              |  |      |  |
   |  |    |  |            |   /\   |              |  |      |  |
   |  |    |  |            |  /  \  |              |  |      |  |
   |  |    |  |            |        |              |  |      |  |
   ---+----+---            +--------+              |--|      |--|
      |    |               |        | Tapering     |  |      |  |
      |    |               |        |              |  |      |  |
      |    |               |        |              |  |      |  |
   ---+----+--- Etch Stop  +--------+              |--|      |--|
      |    |               |        |              |  |      |  |
      |    |               |        |              |  |      |  |
      |    |               |        |              |  |      |  |
      |    |               |        |              |  |      |  |
      |    |               |        |              |  |      |  |
   ---+----+--- Substrate  +--------+              |--|      |--| Sub
      |    |               |        |              |  |      |  |
      |    |               |        |              |  |      |  |
      |____|               |________|              |__|______|__|
      Channel              Channel                 O  N  O  N  O
      Poly-Si              Poly-Si                 (Block, Trap, Tunnel)

3.2 原子层沉积(ALD)与保形性挑战

刻蚀完成后,需要在孔壁沉积Blocking Oxide / Charge Trap / Tunneling Oxide(即ONON或ONO膜)。为了保证各层厚度在纳米级别的均匀性,传统的CVD(化学气相沉积)已无法满足要求,必须采用ALD(原子层沉积)技术。

ALD通过自限制的表面化学反应,每次只沉积一个原子层。例如,沉积Al2O3(Blocking Oxide)时,交替通入TMA(三甲基铝)和H2O。尽管ALD具有极佳的保形性(Conformality),但在深宽比>100:1的孔内,前驱体分子扩散到孔底需要极长的时间,导致沉积周期(Cycle Time)大幅增加,严重影响了产能(WPH, Wafer Per Hour)。三星通过优化前驱体分子结构(如使用大分子量的BTBAS沉积SiN)和脉冲进气技术,在保证膜厚均匀性的同时,将ALD的沉积效率提升了约30%。

4. 双堆叠与多堆叠(Multi-Stack)技术演进与工艺挑战

当V-NAND的层数突破150层甚至向200层以上迈进时,单次刻蚀(Single Stack)的深宽比达到了物理和设备的极限。为了解决这一问题,三星引入了双堆叠(Double Stack)乃至多堆叠(Multi-Stack)技术。

4.1 双堆叠工艺流(Double Stack Process Flow)

双堆叠技术的核心思想是将原本需要一次刻蚀完成的超深孔,分为两次(或多次)较浅的刻蚀来完成。其典型工艺流程如下:

  1. 上半部分刻蚀:首先沉积上半部分的牺牲层(Sacrificial Layers,如SiN/SiO2交替),并刻蚀出上半部分的通道孔。
  2. 沉积通道与绝缘层:在上半部分的孔内沉积Channel Poly-Si和ONO膜。
  3. 沉积刻蚀停止层(Etch Stop Layer, ESL):在晶圆表面沉积一层对后续刻蚀气体具有高选择比的材料,通常是非晶硅(a-Si)或特定的碳膜。
  4. 下半部分刻蚀:沉积下半部分的牺牲层,利用光刻胶掩膜,刻蚀下半部分的通道孔。由于ESL的存在,刻蚀气体在穿透上半部分已沉积的ONO膜和Channel Poly-Si时会被阻挡,从而保护上半部分结构不被破坏。
  5. 对准与连接:下半部分刻蚀完成后,去除ESL,使上下两部分的通道孔对准并连通,最后沉积下半部分的ONO膜和Channel Poly-Si。

4.2 对准精度与良率挑战

双堆叠技术最大的挑战在于上下两部分通道孔的对准精度(Overlay Accuracy)。如果对准出现偏差,会导致孔壁错位,不仅增加寄生电容,还可能导致通道断路或短路。

根据三星在FMS(Flash Memory Summit)上公布的技术白皮书数据,通过引入先进的EUV(极紫外光刻)辅助对准标记和自对准刻蚀工艺,三星将双堆叠的对准误差控制在±5nm以内。此外,ESL材料的选择至关重要。如果ESL对底层ONO膜的选择比不够高,在刻蚀下半部分时,可能会过度消耗上半部分的隧道氧化层,导致漏电。三星采用了一种创新的复合ESL结构,将刻蚀选择比提升至200:1以上,有效解决了这一问题。

4.3 从双堆叠到三堆叠(3-Stack)的演进

在三星最新的第10代V-NAND(V10 BV-NAND)中,为了突破400层大关,采用了先进的3-stack HARC(High Aspect Ratio Cylinder)技术。3-stack意味着需要将孔分为三次刻蚀,这对ESL的去除工艺、孔底清洁以及三次对准的累积误差控制提出了更为严苛的要求。通过引入干法去胶和特定的湿法清洗组合,三星成功将3-stack的良率提升至量产水平。

5. 字线(Word Line)金属化与RC延迟抑制物理模型

在3D NAND中,字线(Word Line, WL)不再像2D NAND那样是平行的短线,而是贯穿整个垂直堆叠层的长条形导体。对于200层的V-NAND,WL的物理长度可达数毫米。这种巨大的尺寸变化带来了严重的寄生电阻(R)和寄生电容(C)问题,导致RC延迟急剧增加,严重限制了芯片的读取和编程速度。

5.1 寄生电容与RC延迟物理模型

WL的总电容 C W L C_{WL} CWL 由两部分组成:与相邻WL的耦合电容,以及与通道孔(Channel Hole)的交叠电容。其物理模型可近似表示为:

C W L = ϵ o x ⋅ W ⋅ L t o x + C p a r a s i t i c _ c o u p l i n g C_{WL} = \frac{\epsilon_{ox} \cdot W \cdot L}{t_{ox}} + C_{parasitic\_coupling} CWL=toxϵox⋅W⋅L+Cparasitic_coupling

其中, ϵ o x \epsilon_{ox} ϵox 是层间介质的介电常数, W W W 和 L L L 分别是WL的宽度和长度, t o x t_{ox} tox 是层间介质厚度。由于层数增加, L L L 显著增大,导致 C W L C_{WL} CWL 呈线性增长。

RC延迟时间常数 τ R C \tau_{RC} τRC 决定了信号在WL上的传播速度:

τ R C = R W L ⋅ C W L = ρ L A c r o s s ⋅ C W L \tau_{RC} = R_{WL} \cdot C_{WL} = \rho \frac{L}{A_{cross}} \cdot C_{WL} τRC=RWL⋅CWL=ρAcrossL⋅CWL

其中, ρ \rho ρ 是WL材料的电阻率, A c r o s s A_{cross} Across 是WL的截面积。为了抑制 τ R C \tau_{RC} τRC,必须降低 ρ \rho ρ 或减小 C W L C_{WL} CWL。

5.2 字线材料替换:从多晶硅到钼(Mo)

在早期的3D NAND中,WL通常采用掺杂的多晶硅(Poly-Si)。然而,Poly-Si的电阻率较高(通常在 10 − 3 Ω ⋅ c m 10^{-3} \Omega \cdot cm 10−3Ω⋅cm 量级),且随着线宽缩小,晶界散射导致电阻进一步增大。

为了突破这一瓶颈,三星在较新的V-NAND代际中,逐步将WL材料从Poly-Si替换为钼(Mo)或钨(W)。Mo的电阻率(约 5.3 × 10 − 6 Ω ⋅ c m 5.3 \times 10^{-6} \Omega \cdot cm 5.3×10−6Ω⋅cm)比Poly-Si低两个数量级。根据IEEE IEDM会议发表的论文数据,采用Mo WL后,WL的RC延迟降低了约40%,使得编程速度(Program Speed)提升了近一倍。

此外,为了降低 C p a r a s i t i c _ c o u p l i n g C_{parasitic\_coupling} Cparasitic_coupling,三星在WL之间引入了低介电常数(Low-k)的空气隙(Air-gap)或 porous SiO2 作为层间介质,将介电常数从传统的4.0降低至2.5左右,进一步抑制了相邻WL之间的串扰(Word Line Interference)。

6. 外围电路架构演进:Peripheral Under Cell (PuC)

随着V-NAND层数的增加,Cell阵列(Cell Array)占据的芯片面积比例越来越大,而外围电路(Peripheral Circuits,如行解码器、页缓冲器、电压生成器)的面积却难以同比例缩小。如果继续采用传统的Peripheral beside Cell(外围电路与Cell阵列并排)布局,芯片的整体面积(Die Size)将大幅增加,导致单片晶圆产出的Die数量减少,成本(Cost per bit)上升。

6.1 PuC/CUC架构的物理实现

为了解决这一问题,三星引入了Peripheral Under Cell (PuC) 或 CMOS Under Cell (CUC) 架构。在这种架构中,外围电路的CMOS晶体管被制造在硅衬底的最底层,而3D Cell阵列则直接构建在外围电路的上方。

这种3D集成架构带来了显著的优势:

  1. 缩小Die Size:Cell阵列和外围电路在Z轴上重叠,Die面积几乎完全由Cell阵列决定,大幅提升了晶圆利用率。
  2. 增加I/O通道:由于外围电路面积不再受限,可以设计更多的页缓冲器(Page Buffer)和I/O引脚,从而提升芯片的并行吞吐量和接口带宽。

6.2 V-NAND物理层映射的C结构体描述

为了在固件和驱动层面更好地理解和管理这种复杂的3D物理布局,我们可以使用C语言结构体来抽象V-NAND Die的物理层映射关系。以下是一个简化的伪代码示例,展示了PuC架构下Die的逻辑与物理映射:

c 复制代码
/* V-NAND Die 物理与逻辑层映射结构体 */
typedef struct {
    /* 基础物理参数 */
    uint16_t total_layers;        // 总堆叠层数 (例如: 236 for 9th Gen)
    uint16_t num_stacks;          // 堆叠次数 (例如: 2 for Double Stack)
    uint8_t  cell_type;           // 单元类型 (0:SLC, 1:TLC, 2:QLC)
    
    /* 通道孔与字线物理参数 */
    uint32_t holes_per_block;     // 每个Block的通道孔数量
    uint32_t wl_length_um;        // 字线物理长度 (微米)
    uint16_t wl_material_id;      // 字线材料 (0:Poly-Si, 1:Mo, 2:W)
    
    /* 堆叠结构信息 (针对Multi-Stack) */
    struct {
        uint16_t start_layer;     // 该Stack的起始逻辑层号
        uint16_t end_layer;       // 该Stack的结束逻辑层号
        uint8_t  esl_material;    // 刻蚀停止层材料 (0:a-Si, 1:Carbon)
        uint16_t overlay_margin;  // 对准容差 (nm)
    } stack_info[4];              // 最多支持4-stack
    
    /* 外围电路布局 (PuC架构) */
    struct {
        uint8_t  is_puc_enabled;  // 是否启用Peripheral Under Cell
        uint32_t periph_area_mm2; // 外围电路物理面积
        uint16_t num_page_buffers;// 页缓冲器数量
        uint8_t  io_bus_width;    // I/O总线宽度 (如 8, 16, 32)
    } peripheral_layout;
    
    /* 可靠性与补偿参数 (映射自ONFI Parameter Page) */
    struct {
        uint8_t  read_retry_modes;// 支持的Read Retry模式数量
        uint8_t  temp_sensors;    // 片内温度传感器数量
    } reliability_config;

} vnand_die_physical_map_t;

/* 初始化一个9th Gen V-NAND (1Tb TLC, Double Stack, PuC) 的配置 */
void init_9th_gen_vnand(vnand_die_physical_map_t *die) {
    die->total_layers = 236;
    die->num_stacks = 2;
    die->cell_type = 1; // TLC
    die->holes_per_block = 1536;
    die->wl_length_um = 4500; // 4.5mm
    die->wl_material_id = 1;  // Mo (钼)
    
    die->stack_info[0].start_layer = 0;
    die->stack_info[0].end_layer = 117;
    die->stack_info[1].start_layer = 118;
    die->stack_info[1].end_layer = 235;
    
    die->peripheral_layout.is_puc_enabled = 1;
    die->peripheral_layout.num_page_buffers = 256;
    die->peripheral_layout.io_bus_width = 16; // 16-bit IO for high throughput
}

7. 可靠性挑战与ONFI 5.2规范中的Read Retry机制

3D NAND在带来高密度优势的同时,也引入了新的可靠性挑战。由于通道孔刻蚀的形貌偏差(如Bowing)、ONO膜厚的微小不均匀性,以及多层堆叠带来的热应力,V-NAND的阈值电压( V t h V_{th} Vth)分布往往比2D NAND更宽。特别是在经历多次编程/擦除(P/E)循环后,电荷陷阱层中的缺陷态增加,导致Data Retention(数据保持)能力下降, V t h V_{th} Vth 分布发生偏移。

7.1 V t h V_{th} Vth 偏移的物理机制

在P/E循环中,高能电子反复穿过隧道氧化层,会在SiO2/SiN界面产生界面态(Interface Traps)。这些界面态会捕获电子,导致擦除态(Erase State)的 V t h V_{th} Vth 向正方向漂移;同时,陷阱层中的电子在高温下通过Poole-Frenkel发射泄漏,导致编程态(Program State)的 V t h V_{th} Vth 向负方向漂移。这种双向漂移使得TLC或QLC的7个或15个 V t h V_{th} Vth 状态发生重叠,增加读取误码率(RBER)。

7.2 ONFI 5.2规范中的Read Retry机制

为了补偿 V t h V_{th} Vth 偏移,NAND控制器必须动态调整读取电压。ONFI(Open NAND Flash Interface)规范在Parameter Page(参数页)中定义了Read Retry机制。根据《Open NAND Flash Interface Specification Revision 5.2》第4.3节(Read Retry)和第5.2.4节(Parameter Page Bytes)的定义,NAND设备通过Read Retry Table向主机报告在不同温度、不同P/E Cycle下的最优读取电压偏移量。

在ONFI 5.2规范中,Read Retry Table的每个Entry包含以下关键参数:

  • Mode Number:Read Retry模式的编号(0-255)。
  • Voltage Offset (mV):相对于默认读取电压的偏移量。对于TLC,需要分别定义7个物理页(Lower, Middle, Upper)的偏移量。
  • Temperature Range:该偏移量适用的温度范围。

控制器在读取数据前,首先发送 Read Retry 命令(Command Code: 0x89),并传入Mode Number。NAND设备内部的状态机根据该Mode Number,从熔丝(Fuse)或寄存器中加载对应的Voltage Offset,并应用到行解码器(Row Decoder)的读取电压上。如果读取失败(ECC纠错失败),控制器会遍历不同的Mode,直到找到误码率最低的电压组合。

三星V-NAND通过片内集成的微型温度传感器和P/E Cycle计数器,结合ONFI规范,实现了细粒度的自适应Read Retry,将读取延迟(Read Latency)增加了控制在5%以内,同时大幅降低了ECC引擎的功耗。

8. 三星第9代与第10代V-NAND技术前瞻与白皮书解析

三星在V-NAND技术上保持着持续的迭代。根据其官方技术博客和FMS(Flash Memory Summit)发布的技术白皮书,第9代和第10代V-NAND在架构和工艺上实现了重大突破。

8.1 第9代 V-NAND:1Tb TLC与AI存储基石

三星第9代V-NAND(236层)是业界首款量产的1Tb(Terabit) TLC NAND。根据三星半导体官方博客《Samsung V-NAND: A Landmark of the Hyperscale AI Era》披露的数据,1Tb TLC设计通过优化Unit Cell尺寸和通道孔排列,将单Die容量提升了约30%,同时 write throughput(写入吞吐量)比上一代提高了约30%,功耗降低了约20%。

这一代产品特别针对Hyperscale AI数据中心的需求进行了优化。AI训练和推理需要极高的随机读取带宽和极低的延迟。第9代V-NAND通过引入更高速的Toggle DDR接口(高达3.2 Gbps/pin)和优化页缓冲器架构,满足了AI工作负载对IOPS(每秒输入输出操作次数)的严苛要求。

8.2 第10代 V-NAND (V10 BV-NAND):突破400层的3-stack HARC

在FMS 2024/2026期间,三星展示了其第10代V-NAND(V10 BV-NAND,Beyond 400 layers)的技术愿景。根据三星新闻稿《V10 BV-NAND: Pushing the Boundaries of AI Storage Beyond 400 Layers》,V10的核心创新在于其先进的3-stack HARC(High Aspect Ratio Cylinder)技术。

如前文所述,当层数超过300层时,双堆叠的深宽比已接近极限。V10通过3-stack技术,将单次刻蚀的深宽比控制在130:1左右,从而保证了通道孔的垂直度和ONO膜的均匀性。三星工程团队(如Dawoon Jeong等专家)指出,3-stack不仅是刻蚀工艺的挑战,更是对沉积、对准和良率控制的全面考验。V10通过引入新一代的ALD设备和自对准刻蚀标记,成功将400+层V-NAND的良率提升至商业化标准,为未来ZB(Zettabyte)级AI存储时代奠定了物理基础。

━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━

知识点小结

知识点 核心要点 关键参数/数据
CTF Unit Cell 采用电荷陷阱(SiN)替代浮栅,点状存储抗干扰,无需隔离层,适合垂直堆叠。 势垒高度~3.1eV,FN隧穿机制
通道孔刻蚀 高深宽比圆柱刻蚀(HARC),面临Bowing和Tapering效应,需ALD保证膜厚均匀。 深宽比>100:1,ALD保形沉积
双堆叠/多堆叠 将超深孔分次刻蚀,引入刻蚀停止层(ESL),解决单次刻蚀物理极限。 9代236层(双堆叠),10代400+层(三堆叠)
字线RC延迟 3D WL极长导致RC延迟大,采用Mo/W替代Poly-Si降低电阻,Low-k介质降低电容。 Mo电阻率~ 5.3 × 10 − 6 Ω ⋅ c m 5.3 \times 10^{-6} \Omega \cdot cm 5.3×10−6Ω⋅cm
PuC架构 外围电路置于Cell阵列下方,缩小Die Size,增加I/O通道和Page Buffer数量。 Die面积利用率提升,支持16/32-bit IO
Read Retry 补偿P/E循环和温度导致的 V t h V_{th} Vth偏移,依据ONFI 5.2规范动态调整读取电压。 ONFI 5.2 Sec 4.3,支持256种Mode

深度思考题

  1. 思考题1 :在双堆叠(Double Stack)工艺中,刻蚀停止层(ESL)的选择比(Selectivity)至关重要。如果ESL对底层ONO膜的选择比不足,在刻蚀下半部分通道孔时会产生什么具体的物理后果?请从电场分布和电荷泄漏的角度分析其对Data Retention的影响。

    思考引导:考虑刻蚀等离子体对底层隧道氧化层的轰击损伤,以及损伤后界面态增加对FN隧穿电流和电荷保持的长期影响。

  2. 思考题2 :随着V-NAND层数向400层以上迈进,字线(WL)的RC延迟成为限制读取速度的核心瓶颈。除了将WL材料从Poly-Si替换为Mo或W之外,从电路设计和信号完整性的角度,还有哪些方法可以补偿或缓解长WL带来的信号衰减和延迟?

    思考引导:考虑分段字线驱动(Split WL Driving)、预充电(Pre-charge)策略优化、以及感测放大器(Sense Amplifier)的灵敏度设计。

  3. 思考题3 :ONFI 5.2规范定义了详细的Read Retry Table。在AI数据中心的高并发随机读取场景下,频繁执行Read Retry命令会增加NAND的读取延迟(Read Latency)。请设计一种固件层面的优化策略,在不增加硬件成本的前提下,最小化Read Retry带来的性能惩罚。

    思考引导:考虑利用机器学习模型预测 V t h V_{th} Vth偏移趋势、基于历史读取数据构建自适应电压查找表(LUT),或利用片内温度传感器进行前馈补偿。

9. 3D NAND 薄膜沉积工艺挑战:ALD与先进CVD在超高深宽比结构中的应用

随着三星V-NAND向第9代(236层/300+层)甚至第10代(400+层)演进,通道孔的深宽比(Aspect Ratio, AR)已突破100:1甚至150:1。在如此极端的深孔结构中,沉积均匀的ONO(Oxide-Nitride-Oxide)电荷陷阱层和Block Oxide成为了制造工艺的最大瓶颈。传统的PECVD(等离子体增强化学气相沉积)由于反应物在深孔内的扩散受限,会导致严重的"瓶颈效应"(Pinch-off),即孔口提前闭合而孔底未完全填充。

9.1 深孔沉积的物理模型与克努森扩散

在深宽比极高的圆柱形通道孔内,气体分子的传输从粘性流(Viscous flow)转变为分子流(Molecular flow),即克努森扩散(Knudsen diffusion)机制。根据克努森理论,反应前驱体在深孔内的浓度分布 C ( z ) C(z) C(z) 遵循双曲余弦函数衰减模型:

C ( z ) = C 0 cosh ⁡ ( 3 k r D ( H − z ) ) cosh ⁡ ( 3 k r D H ) C(z) = C_0 \frac{\cosh\left(\sqrt{\frac{3k}{r D}} (H - z)\right)}{\cosh\left(\sqrt{\frac{3k}{r D}} H\right)} C(z)=C0cosh(rD3k H)cosh(rD3k (H−z))

其中, C 0 C_0 C0 为孔口处的反应物浓度, H H H 为孔的总深度, r r r 为孔半径, k k k 为表面反应速率常数, D D D 为克努森扩散系数。当深宽比 H / r H/r H/r 极大时,孔底浓度 C ( H ) C(H) C(H) 呈指数级下降,导致孔底沉积速率远低于孔口。

9.2 从CVD到Space-ALD的工艺演进

为了实现100:1以上深宽比的完美共形覆盖(Conformal Coverage),三星在先进V-NAND节点中引入了Space-ALD(空间原子层沉积)与改进型Flowable CVD(FCVD)技术。

text 复制代码
       [ALD 自限制沉积]                 [传统CVD 连续沉积]
          |   |                           |   |
       +--|---|--+                     +--|---|--+
       |  \   /  |                     | \     / |
       |   \ /   |                     |  \   /  |
       |    V    | 均匀共形覆盖        |   \ /   | 顶部过厚/瓶颈
       |    |    | (Step Coverage>98%) |    V    | (台阶覆盖差)
       |    |    |                     |    |    |
       +----+----+                     +----+----+

ALD通过交替脉冲前驱体和 purge 气体,利用表面自限制反应(Self-limiting reaction),确保每次循环仅沉积一个原子层(~0.1nm)。然而,传统时序ALD(Temporal ALD)的抽真空和吹扫步骤极其耗时。三星通过引入空间ALD(Space-ALD),将前驱体在空间上隔离,晶圆在旋转或平移中依次穿过不同的气体区域,在保持ALD级台阶覆盖率(>98%)的同时,将沉积速率提升了3-5倍。根据三星半导体技术日披露的数据,在第9代V-NAND中,结合新型High-k前驱体,Block Oxide的沉积时间缩短了30%,有效抑制了深孔底部的电荷泄漏路径。

10. 串间干扰(String-to-String Interference)物理模型与隔离结构设计

在3D NAND的密集阵列中,除了沿Z轴的字线间干扰(Word-line to Word-line Interference),沿XY平面的相邻通道孔之间的横向电场耦合------即串间干扰(String-to-String Interference)------成为限制存储密度和可靠性的核心物理效应。当相邻通道孔(String)被编程到不同的阈值电压状态时,其侧壁电场会穿透Block Oxide,改变目标孔内沟道和电荷陷阱层的电势分布。

10.1 串间干扰的圆柱电容物理模型

将通道孔简化为同轴圆柱电容器模型。设通道孔半径为 r r r,相邻孔中心距为 d d d,孔深为 H H H。在圆柱坐标系下,相邻孔之间的耦合电容 C s s C_{ss} Css 可通过求解拉普拉斯方程近似得到:

C s s ≈ π ϵ 0 ϵ r H ln ⁡ ( d / r ) − ln ⁡ ( 1 − ( r / d ) 2 ) C_{ss} \approx \frac{\pi \epsilon_0 \epsilon_r H}{\ln(d/r) - \ln\left(1 - (r/d)^2\right)} Css≈ln(d/r)−ln(1−(r/d)2)πϵ0ϵrH

串间干扰引起的阈值电压漂移 Δ V t h \Delta V_{th} ΔVth 与耦合电容系数 γ s s = C s s / C t o t a l \gamma_{ss} = C_{ss} / C_{total} γss=Css/Ctotal 成正比。随着层数增加,为了维持密度,孔间距 d d d 不断缩小,导致 γ s s \gamma_{ss} γss 呈非线性上升。

10.2 蜂窝状阵列与Dummy Hole隔离设计

为了抑制串间干扰,三星V-NAND摒弃了传统的方形(Square)阵列布局,全面采用蜂窝状(Honeycomb)交错阵列。在蜂窝状布局中,每个有效通道孔周围有6个相邻孔,相比方形布局的4个相邻孔,有效增加了孔间距,降低了局部电场集中度。

此外,在阵列边缘和特定区域,三星引入了虚拟通道孔(Dummy Hole) 和隔离环(Isolation Ring) 设计。Dummy Hole不连接外围电路,其内部填充导电多晶硅并接地,作为电场屏蔽层(Faraday cage)吸收边缘刻蚀带来的形变,并阻断边缘有效孔的电场泄漏。

text 复制代码
       [3D NAND 蜂窝状 (Honeycomb) 通道孔阵列布局]
           
             O   O   O   O          O = 有效通道孔 (Active Hole)
           O   X   O   X   O        X = 虚拟通道孔 (Dummy Hole)
             O   O   O   O          Dummy Hole用于吸收边缘刻蚀负载不均
           O   X   O   X   O        及抑制串间电场干扰 (String-to-String)
             O   O   O   O

通过这种物理布局优化与Dummy Hole的结合,三星在第8代/第9代V-NAND中,将串间干扰引起的 Δ V t h \Delta V_{th} ΔVth 严格控制在50mV以内,相比早期方形阵列设计降低了约40%,显著提升了多层级(如TLC/QLC)编程的Margin。

11. 面向AI高并发场景的多平面(Multi-Plane)架构与固件调度优化

在AI大模型训练与推理场景中,GPU集群对存储系统提出了极高的带宽与IOPS要求。单颗NAND Die的内部总线带宽(通常仅为几百MB/s)已无法喂饱PCIe 5.0/6.0的主机接口带宽(14 GB/s ~ 28 GB/s)。为了打破这一"内存墙",3D NAND在架构设计上引入了深度的并行化机制,即多平面(Multi-Plane)与超平面(Super Plane)架构。

11.1 Multi-Plane 架构与内部总线倍增

在三星V-NAND的Die内部,存储阵列被划分为多个独立的Plane(通常为2个或4个)。每个Plane拥有独立的Page Buffer(页缓冲区)和Sense Amplifier( sense放大器)。通过Multi-Plane Read/Program命令,控制器可以在同一个时钟周期内,同时激活同一LUN(Logical Unit Number)下的多个Plane。

以4-Plane(4P)架构为例,当主机下发一个跨越4个Plane边界的顺序读取请求时,NAND固件会将其拆分为4个并行的内部读取操作。这使得内部总线带宽瞬间翻4倍,达到约 3.2 GB/s per LUN。结合单封装内多达16个CE(Chip Enable)的Toggle操作,单颗NAND芯片的顺序读取带宽可突破 2.5 GB/s,完美匹配PCIe 5.0 x4的极限性能。

11.2 FTL 固件层面的 Super Block 调度策略

要在固件层面最大化Multi-Plane的收益,FTL(Flash Translation Layer)必须实现Super Block管理。Super Block是指在同一LUN内,跨越所有Plane的相同物理Block位置组合而成的逻辑块。

在C代码层面,FTL的调度器需要实时评估LBA(Logical Block Address)的映射关系,尽可能将连续的LBA映射到同一个Super Block的不同Plane中,以触发硬件级的并发读取。以下是简化的Multi-Plane Read固件调度逻辑:

c 复制代码
/* FTL Multi-Plane Read Scheduler for High-Concurrency AI Workloads */
typedef struct {
    uint32_t lba_start;
    uint32_t num_pages;
    uint8_t  target_lun;
} mp_read_req_t;

#define MAX_PLANES 4
#define hweight8(x) __builtin_popcount(x)

// 检查目标LBA在指定Plane的Block中是否有效
extern bool is_page_valid(uint8_t lun, uint8_t block, uint8_t plane, uint32_t lba);
// 下发NAND硬件并发命令
extern void issue_nand_cmd(uint8_t cmd, uint8_t lun, uint8_t block, uint8_t mask);

int schedule_multi_plane_read(mp_read_req_t *req) {
    // 1. 将主机LBA转换为物理PPA (Physical Page Address)
    uint32_t ppa = lba_to_ppa(req->lba_start);
    uint8_t target_lun = GET_LUN(ppa);
    uint8_t target_block = GET_BLOCK(ppa);
    
    // 2. 探测同一Super Block内各Plane的对齐状态
    uint8_t plane_mask = 0;
    for (int p = 0; p < MAX_PLANES; p++) {
        // 检查连续LBA是否正好落在该Plane的对应Page位置
        if (is_page_valid(target_lun, target_block, p, req->lba_start)) {
            plane_mask |= (1 << p);
        }
    }
    
    // 3. 并发度评估与命令下发
    uint8_t active_planes = hweight8(plane_mask);
    
    if (active_planes >= 2) {
        // 触发 Multi-Plane Read (命令码 0x32)
        // 硬件将同时Sense多个Plane的Page Buffer,内部带宽翻倍
        issue_nand_cmd(CMD_MULTI_PLANE_READ, target_lun, target_block, plane_mask);
        return active_planes; // 返回实际并发读取的Plane数量
    }
    
    // 4. 降级策略:若LBA未对齐或跨Block,回退到单Plane读取
    uint8_t single_plane = GET_PLANE(ppa);
    issue_nand_cmd(CMD_SINGLE_READ, target_lun, target_block, single_plane);
    return 1;
}

通过上述固件调度策略,结合三星V-NAND底层的超快总线(Toggle 5.0/DDR5)接口,SSD在处理AI数据加载(如Checkpoint读取、Dataset prefetching)时,能够将Read Latency降低30%以上,同时使随机读取IOPS提升近4倍,充分释放了3D NAND在AI超算时代的存储潜能。

参考资料

作者简介:资深RDMA智能网卡、存储技术专家,拥有十余年DPU/RDMA/NVMe SSD芯片测试与工程经验,致力于推动高性能网络技术的开源与普及。

相关推荐
gwf2164 天前
3D NAND电荷陷阱层物理(CTF材料、电荷纵向分布、保留力机制)
半导体物理·3d nand·nand·电荷陷阱·jedec规范·高深宽比刻蚀·能带工程