论文精读:量子辅助玻尔兹曼机用于风力发电概率学习

1.背景介绍

可再生能源发电概率的精确建模对于现代电力系统中的功率预测和不确定性感知运行至关重要。然而由于可再生能源固有的时空相关性,高精度地学习和建模其数据结构仍然具有挑战性。

为应对该挑战,本论文提出了一种新型的量子辅助高斯-伯努利受限玻尔兹曼机(GBRBM),该模型本质上适用于连续风电建模;进而将其负相位定制为可直接由量子计算机求解的形式,从而加速学习过程;最后在真实量子硬件上进行了实验验证,验证方法的有效性。

本论文的创新点在于:

(1)作为一种基于非参数神经网络的方法,受限玻尔兹曼机(RBM)通过隐式捕获统计依赖关系来学习不确定输入的联合分布,然而其负相位的计算需要密集的采样过程,在高维条件下也可能损失精度,本文通过量子优化机制加速采样过程并克服局部最优;

(2)现有的量子玻尔兹曼机仅适用于离散变量,这不适用于可再生能源(如风能)的不确定连续结构。本文提出的用于概率风电学习的量子辅助GBRBM机制,通过调整GBRBM的负相位,将传统仅适用于离散变量的量子玻尔兹曼机的应用范围扩展到连续不确定性,同时保留了可通过量子计算求解的结构以加速整体训练过程。

2.传统GBRBM的局限性

本文考虑学习多个风电出力(输出功率)之间依赖结构的问题。设 v ∈ R N \mathbf{v} \in \mathbb{R}^{N} v∈RN表示GBRBM的可见随机向量,其实现对应于从 N N N台风力涡轮机收集的归一化有功功率测量值。图1概念性地说明了GBRBM的概率学习和生成机制。

GBRBM的相关能量函数定义为:

E θ ( v , h ) = 1 2 σ 2 ∥ v − b ∥ 2 2 − 1 σ 2 v ⊤ W h − c ⊤ h , ( 1 ) E_{\theta}(\mathbf{v},\mathbf{h}) = \frac{1}{2\sigma^2}\| \mathbf{v} - \mathbf{b}\| _2^2 -\frac{1}{\sigma^2}\mathbf{v}^\top \mathbf{W}\mathbf{h} - \mathbf{c}^\top \mathbf{h}, \quad (1) Eθ(v,h)=2σ21∥v−b∥22−σ21v⊤Wh−c⊤h,(1)

其中 h ∈ { 0 , 1 } M \mathbf{h} \in \{0,1\}^{M} h∈{0,1}M表示二元隐变量, W ∈ R N × M \mathbf{W} \in \mathbb{R}^{N \times M} W∈RN×M是权重矩阵, b \mathbf{b} b和 c \mathbf{c} c分别是可见层和隐藏层的偏置, θ = { W , b , c } \theta = \{\mathbf{W}, \mathbf{b}, \mathbf{c}\} θ={W,b,c}表示参数集, σ 2 \sigma^2 σ2是高斯可见变量 v \mathbf{v} v的方差。

相关的联合概率密度函数 p θ p_{\theta} pθ为:

p θ ( v , h ) = 1 Z θ exp ⁡ ( − E θ ( v , h ) ) , ( 2 ) p_{\theta}(\mathbf{v},\mathbf{h}) = \frac{1}{Z_{\theta}}\exp \left(-E_{\theta}(\mathbf{v},\mathbf{h})\right), \quad (2) pθ(v,h)=Zθ1exp(−Eθ(v,h)),(2)

其中确保联合概率密度函数归一化的配分函数为:

Z θ = ∫ R N ∑ h exp ⁡ ( − E θ ( v , h ) ) d v Z_{\theta} = \int_{\mathbb{R}^{N}}\sum_{\mathbf{h}}\exp \left(- E_{\theta}(\mathbf{v},\mathbf{h})\right) \mathrm{d}\mathbf{v} Zθ=∫RNh∑exp(−Eθ(v,h))dv

通过对隐变量求和得到边际似然函数:

p θ ( v ) = ∑ h p θ ( v , h ) p_{\theta}(\mathbf{v}) = \sum_{\mathbf{h}} p_{\theta}(\mathbf{v}, \mathbf{h}) pθ(v)=h∑pθ(v,h)

给定观测值 v \mathbf{v} v,我们最大化对数似然函数来训练GBRBM:

max ⁡ θ log ⁡ p θ ( v ) = max ⁡ θ log ⁡ ∑ h 1 Z θ exp ⁡ ( − E θ ( v , h ) ) . ( 3 ) \max_{\theta}\log p_{\theta}(\mathbf{v}) = \max_{\theta}\log \sum_{\mathbf{h}}\frac{1}{Z_{\theta}}\exp \left(-E_{\theta}(\mathbf{v},\mathbf{h})\right). \quad (3) θmaxlogpθ(v)=θmaxlogh∑Zθ1exp(−Eθ(v,h)).(3)

计算对数似然函数关于 θ \theta θ的梯度,得到正相-负相分解:

∇ θ log ⁡ p θ ( v ) = E p θ ( h ∣ v ) − ∇ θ E θ ( v , h ) − E p θ ( v , h ) − ∇ θ E θ ( v , h ) , ( 4 ) \begin{array}{r}\nabla_{\theta}\log p_{\theta}(\mathbf{v}) = \mathbb{E}{p{\theta}(\mathbf{h}|\mathbf{v})}\left-\\nabla_{\\theta}E_{\\theta}(\\mathbf{v},\\mathbf{h})\\right\\ -\mathbb{E}{p{\theta}(\mathbf{v},\mathbf{h})}\left-\\nabla_{\\theta}E_{\\theta}(\\mathbf{v},\\mathbf{h})\\right, \end{array} \quad (4) ∇θlogpθ(v)=Epθ(h∣v)−∇θEθ(v,h)−Epθ(v,h)−∇θEθ(v,h),(4)

其中 ∇ θ = ∂ ∂ θ \nabla_{\theta} = \frac{\partial}{\partial\theta} ∇θ=∂θ∂表示关于 θ \theta θ的梯度算子,在公式(4)中,第一项是正相位,第二项是负相位。在正相位中,期望是针对条件概率密度 p θ ( h ∣ v ) p_{\theta}(\mathbf{h} \mid \mathbf{v}) pθ(h∣v)计算的,其中 v \mathbf{v} v是给定的观测功率测量值。此时,隐变量 h \mathbf{h} h是条件独立,可直接采样。

注1 :与易于采样的正相相比,负相需要计算关于联合概率密度 p θ ( v , h ) p_{\theta}(\mathbf{v}, \mathbf{h}) pθ(v,h)的期望,其中可见变量和隐变量均会变化,这需要依赖计算量更大的采样方法,如吉布斯采样或马尔可夫链蒙特卡洛方法。此外,对于高维依赖数据结构(如高度相关的风电数据),这些采样器收敛缓慢,并可能导致有偏估计。因此,负相采样既计算昂贵又可能不准确,这对GBRBM的实际应用构成了挑战,这一困难促使我们在下一节对负相进行重新表述。

3.论文方法

现在,本论文引出用于风电概率学习的量子辅助GBRBM训练方法。

3.1 设计纯隐层结构的动机

如表I所示,当前的RBM在量子采样需求和风电建模之间存在根本性的不匹配。标准RBM和QRBM使用二值能量函数,使其与量子计算兼容,但不适用于连续的风电数据。相比之下,GBRBM适用于连续的风电出力,但其负相涉及连续变量,这与量子采样不兼容。

表I 基于RBM的方法在风电建模下的比较

方法 模型 (可见-隐藏) 量子采样 风电建模
RBM 二值-二值 × ×
QRBM 二值-二值 ×
GBRBM 连续-二值 ×
本文方法 连续-二值

一个直接的补救措施是将连续变量离散化,但这会导致二值单元数量迅速增加,并很快在当前量子硬件上变得不切实际。因此,要为GBRBM实现量子辅助训练,就需要重新表述负相,保留潜在的统计依赖性的同时从采样中移除连续可见变量,这促使我们解析地消除负相中的可见变量,得到一个仅在二值变量上定义的等价纯隐层能量函数

3.2 纯隐层能量重构

为了消除公式(1)中的连续可见变量,我们首先对联合概率密度 ( p θ ( v , h ) (p_{\theta}(\mathbf{v},\mathbf{h}) (pθ(v,h)关于 v \mathbf{v} v进行积分,得到边际概率密度 p θ ( h ) p_{\theta}(\mathbf{h}) pθ(h):

p θ ( h ) ∝ ∫ R N exp ⁡ ( − E θ ( v , h ) ) d v . ( 5 ) p_{\theta}(\mathbf{h})\propto \int_{\mathbb{R}^{N}}\exp (-E_{\theta}(\mathbf{v},\mathbf{h}))\mathrm{d}\mathbf{v}. \quad (5) pθ(h)∝∫RNexp(−Eθ(v,h))dv.(5)

将(1)中的 E θ ( v , h ) E_{\theta}(\mathbf{v},\mathbf{h}) Eθ(v,h)代入(5),得到:

p θ ( h ) ∝ exp ⁡ ( c ⊤ h ) ∫ R N exp ⁡ ( − ∥ v − b ∥ 2 2 2 σ 2 + v ⊤ W h σ 2 ) d v . ( 6 ) p_{\theta}(\mathbf{h})\propto \exp \left(\mathbf{c}^{\top}\mathbf{h}\right)\int_{\mathbb{R}^{N}}\exp \left(-\frac{\|\mathbf{v} - \mathbf{b}\|_{2}^{2}}{2\sigma^{2}} +\frac{\mathbf{v}^{\top}\mathbf{W}\mathbf{h}}{\sigma^{2}}\right)\mathrm{d}\mathbf{v}. \quad (6) pθ(h)∝exp(c⊤h)∫RNexp(−2σ2∥v−b∥22+σ2v⊤Wh)dv.(6)

为了便于对 v \mathbf{v} v进行解析积分,将指数部分改写为 v \mathbf{v} v的二次函数,并收集(6)中所有依赖于 v \mathbf{v} v的项。定义:

f ( v , h ) = − 1 2 σ 2 ∥ v − b ∥ 2 2 + 1 σ 2 v ⊤ W h , ( 7 ) f(\mathbf{v},\mathbf{h}) = -\frac{1}{2\sigma^{2}}\| \mathbf{v} - \mathbf{b}\|_{2}^{2} + \frac{1}{\sigma^{2}}\mathbf{v}^{\top}\mathbf{W}\mathbf{h}, \quad (7) f(v,h)=−2σ21∥v−b∥22+σ21v⊤Wh,(7)

展开(7)中的 ∥ v − b ∥ 2 2 \| \mathbf{v} - \mathbf{b}\|_{2}^{2} ∥v−b∥22,得到

f ( v , h ) = − 1 2 σ 2 v ⊤ v + 1 σ 2 v ⊤ ( b + W h ) − 1 2 σ 2 b ⊤ b . ( 8 ) f(\mathbf{v},\mathbf{h}) = -\frac{1}{2\sigma^{2}}\mathbf{v}^{\top}\mathbf{v} + \frac{1}{\sigma^{2}}\mathbf{v}^{\top}(\mathbf{b} + \mathbf{W}\mathbf{h}) - \frac{1}{2\sigma^{2}}\mathbf{b}^{\top}\mathbf{b}. \quad (8) f(v,h)=−2σ21v⊤v+σ21v⊤(b+Wh)−2σ21b⊤b.(8)

注意,最后一项 − 1 2 σ 2 b ⊤ b - \frac{1}{2\sigma^{2}}\mathbf{b}^{\top}\mathbf{b} −2σ21b⊤b与 v \mathbf{v} v无关,可以包含在配分函数 Z θ Z_{\theta} Zθ中。因此,通过分离依赖于 v \mathbf{v} v的项并配平方,(8)可整理为:

f ( v , h ) = − ∥ v − ( b + W h ) ∥ 2 2 2 σ 2 + ∥ b + W h ∥ 2 2 2 σ 2 − b ⊤ b 2 σ 2 . ( 9 ) f(\mathbf{v},\mathbf{h}) = -\frac{\|\mathbf{v} - (\mathbf{b} + \mathbf{W}\mathbf{h})\|{2}^{2}}{2\sigma^{2}} +\frac{\|\mathbf{b} + \mathbf{W}\mathbf{h}\|{2}^{2}}{2\sigma^{2}} -\frac{\mathbf{b}^{\top}\mathbf{b}}{2\sigma^{2}}. \quad (9) f(v,h)=−2σ2∥v−(b+Wh)∥22+2σ2∥b+Wh∥22−2σ2b⊤b.(9)

(9)中的第一项是 v \mathbf{v} v的标准高斯核。具体来说,对于任何 b + W h ∈ R N \mathbf{b} + \mathbf{W}\mathbf{h} \in \mathbb{R}^{N} b+Wh∈RN,有

∫ R N exp ⁡ ( − ∥ v − ( b + W h ) ∥ 2 2 2 σ 2 ) d v = ( 2 π σ 2 ) N 2 \int_{\mathbb{R}^{N}}\exp \left(-\frac{\|\mathbf{v} - (\mathbf{b} + \mathbf{W}\mathbf{h})\|_{2}^{2}}{2\sigma^{2}}\right)\mathrm{d}\mathbf{v} = (2\pi \sigma^{2})^{\frac{N}{2}} ∫RNexp(−2σ2∥v−(b+Wh)∥22)dv=(2πσ2)2N

这是一个与 h \mathbf{h} h无关的常数。将此应用于(9),所有依赖于 v \mathbf{v} v的项都可以解析积分,得到一个与 h \mathbf{h} h无关的常数因子。于是式(6)可以写成:

p θ ( h ) ∝ exp ⁡ ( c ⊤ h + 1 2 σ 2 ∥ b + W h ∥ 2 2 ) . ( 10 ) p_{\theta}(\mathbf{h})\propto \exp \left(\mathbf{c}^{\top}\mathbf{h} + \frac{1}{2\sigma^{2}}\| \mathbf{b} + \mathbf{W}\mathbf{h}\|_{2}^{2}\right). \quad (10) pθ(h)∝exp(c⊤h+2σ21∥b+Wh∥22).(10)

展开式(10)中的二次项 ∥ b + W h ∥ 2 2 \| \mathbf{b} + \mathbf{W}\mathbf{h}\|_{2}^{2} ∥b+Wh∥22,得到:

p θ ( h ) ∝ exp ⁡ ( ( c + 1 2 σ 2 W ⊤ b ) ⊤ h + 1 2 σ 2 h ⊤ W ⊤ W h ) . ( 11 ) p_{\theta}(\mathbf{h})\propto \exp \left(\left(\mathbf{c} + \frac{1}{2\sigma^{2}}\mathbf{W}^{\top}\mathbf{b}\right)^{\top}\mathbf{h} + \frac{1}{2\sigma^{2}}\mathbf{h}^{\top}\mathbf{W}^{\top}\mathbf{W}\mathbf{h}\right). \quad (11) pθ(h)∝exp((c+2σ21W⊤b)⊤h+2σ21h⊤W⊤Wh).(11)

现在,(11)是一个概率密度函数,其对应的能量函数 E θ e f f ( h ) E_{\theta}^{\mathrm{eff}}(\mathbf{h}) Eθeff(h)仅由二值隐变量组成。

3.3 量子辅助负相采样

有趣的是,(11)中的纯隐层分布自然地对应于伊辛模型,其能量定义在二值自旋变量 s ∈ { − 1 , + 1 } M \mathbf{s} \in \{- 1, + 1\}^{M} s∈{−1,+1}M上,具有线性和成对相互作用项:

E ( s ) = − α ⊤ s − 1 2 s ⊤ J s , ( 12 ) E(\mathbf{s}) = -\alpha^{\top}\mathbf{s} - \frac{1}{2}\mathbf{s}^{\top}\mathbf{J}\mathbf{s}, \quad (12) E(s)=−α⊤s−21s⊤Js,(12)

其中#\alpha 表示外场, 表示外场, 表示外场,\mathbf{J}$表示自旋之间的两两耦合。

应用标准仿射变换 h = ( s + 1 ) / 2 \mathbf{h} = (\mathbf{s} + \mathbf{1}) / 2 h=(s+1)/2,其中 1 \mathbf{1} 1是全1向量,能量函数 E θ e f f ( h ) E_{\theta}^{\mathrm{eff}}(\mathbf{h}) Eθeff(h)可以等价地改写为Ising形式:

E θ e f f ( s ) = − ( 1 2 ( c + 1 σ 2 W ⊤ b ) ⏟ a + W ⊤ W 1 4 σ 2 ⏟ a ) ⊤ s − s ⊤ 1 8 σ 2 W ⊤ W s ⏟ a + C , ( 13 ) \begin{array}{r}E_{\theta}^{\mathrm{eff}}(\mathbf{s}) = -\left(\underbrace{\frac{1}{2}\left(\mathbf{c} + \frac{1}{\sigma^2}\mathbf{W}^{\top}\mathbf{b}\right)}{\mathbf{a}} + \underbrace{\frac{\mathbf{W}^{\top}\mathbf{W}\mathbf{1}}{4\sigma^2}}{\mathbf{a}}\right)^{\top}\mathbf{s}\\ -\underbrace{\mathbf{s}^{\top}\frac{1}{8\sigma^2}\mathbf{W}^{\top}\mathbf{W}\mathbf{s}}_{\mathbf{a}} + C, \end{array} \quad (13) Eθeff(s)=− a 21(c+σ21W⊤b)+a 4σ2W⊤W1 ⊤s−a s⊤8σ21W⊤Ws+C,(13)

其中,

C = − 1 2 ( c + 1 σ 2 W ⊤ b ) ⊤ 1 − 1 8 σ 2 1 ⊤ W ⊤ W 1 C = -\frac{1}{2}\left(\mathbf{c} + \frac{1}{\sigma^2}\mathbf{W}^{\top}\mathbf{b}\right)^{\top}\mathbf{1} - \frac{1}{8\sigma^2}\mathbf{1}^{\top}\mathbf{W}^{\top}\mathbf{W}\mathbf{1} C=−21(c+σ21W⊤b)⊤1−8σ211⊤W⊤W1

汇集了所有与 s \mathbf{s} s无关的项,因此不影响自旋构型间的相对能量差,也不影响最终的采样行为。

至此,我们已经将GBRBM的负相分布重新表述为一个明确的伊辛能量函数,该函数天然可由基于伊辛模型的量子硬件(如专用量子计算机)求解。更具体地说,在专用量子计算机中,伊辛自旋由耦合光学参量振荡器的相位状态表示,其动力学实现实现了一个模拟物理过程,用于采样伊辛哈密顿量的低能构型。在本工作中,量子真机仅用于生成负相位的样本,而所有参数更新和梯度计算均在经典计算机上执行。这种混合学习策略有效地加速了GBRBM训练中最耗时的部分,同时可能受益于量子硬件提供的非局域采样。

注2 :所提的重构方法使得GBRBM能够实现量子辅助的负相位采样,而无需离散化连续可见变量,从而避免了组合爆炸和信息损失。此外,它允许将量子硬件集成到采样过程中,为经典采样方案提供了一种替代方案。

4.结果说明

本论文使用玻色量子的专用量子计算机(SPQC)进行评估,风电数据来自SDWPF数据集,对比方法包括使用吉布斯采样训练的传统GBRBM和基于RealNVP的归一化流。

为了测试所提方法的可扩展性,考虑了四个系统规模递增的测试案例,分别涉及5、10、15和20台风力涡轮机;为确保模型容量相当,对于传统GBRBM和所提GBRBM,隐单元数量根据系统规模设定:5机和10机案例为128,15机和20机案例为256,学习率根据问题规模进行调整,5机、10机和15/20机案例的值分别为0.003、0.002和0.001;对于5机和10机案例,批量大小设为128,训练轮数为200;而对于15机和20机案例,批量大小设为256,训练轮数增至300。

论文采用能量距离(ED)和沃瑟斯坦距离(WD)来评估学习分布与真实分布之间的相似性,它们能有效捕获风电数据的统计特性。

4.1 计算效率

图2展示了传统GBRBM和所提方法在不同涡轮机数量下的计算运行时间。经典GBRBM的运行时间随系统规模迅速增长,反映了在高维条件下重复进行负相采样的成本不断增加。相比之下,量子辅助方法随系统规模增加的运行时间增长速度明显更慢,这表明将负相位采样承载到量子硬件上有效地缓解了主要的计算瓶颈。总体而言,这些结果证明了所提方法在大型风电概率学习中的可扩展性。

4.2 精度测试

表II总结了传统GBRBM、所提方法和基于RealNVP的归一化流在5、10、15和20机设置下的性能。传统GBRBM和所提方法产生了相当的精度,表现为相似的ED和WD值,表明所提出的量子辅助训练保留了原始GBRBM的建模能力。同时,所提方法在不同系统规模下始终获得略低的ED和WD值,且在较大案例中改进更为明显。作为现代生成模型的代表,RealNVP模型在5机案例中表现具有竞争力,且通常获得更低的ED值,但其优势并未随着系统规模增大而持续保持,尤其是在WD方面。

这些结果表明,所提方法在提高计算效率的同时,在不同规模下实现了稳定且具有竞争力的性能。

表II 性能比较 (ED: × 10 − 4 \times 10^{-4} ×10−4, WD: × 10 − 3 \times 10^{-3} ×10−3)

方法 5 涡轮机 10 涡轮机 15 涡轮机 20 涡轮机
ED WD ED WD ED WD ED WD
RealNVP 5.84 5.65 6.86 4.24 10.32 7.81 11.96 9.82
GBRBM 5.95 5.70 6.86 4.13 10.43 7.67 12.14 9.59
本文方法 5.94 5.68 6.80 4.02 10.21 7.60 12.02 9.37

4.3 扩展性讨论

(1)关于计算可扩展性 :采样维度从 O ( N + M ) \mathcal{O}(N + M) O(N+M)降低到 O ( M ) \mathcal{O}(M) O(M),计算负担从迭代采样转移到多项式矩阵运算。具体来说,经典负相需要在连续-离散联合高维空间中进行重复采样,而所提方法基于纯隐层分布操作,从采样循环中移除了连续分量。这种结构性重构缓解了高维联合采样的困难,并带来了更有利的扩展行为,这与图2中观察到的较慢运行时间增长一致。

(2)关于采样机制:采样过程可以通过能量景观来理解,其中每个构型对应一个能量值。在包含多台涡轮机的风电建模中,由于强空间相关性,此类能量景观通常非常复杂。经典采样方法(如吉布斯采样)基于条件分布逐变量更新,导致探索是增量式的,并且在有限迭代次数内覆盖范围受限。相比之下,所提方法采用基于量子动态采样,其中耦合振荡器共同演化并同时更新多个变量,从而能够在能量景观中实现更高效的转移。这种差异提高了探索效率,并与表II中的结果一致。

(3)关于硬件局限性:当前的量子真机受限于硬件噪声和有限的量子比特数,可能影响实际性能。特别是演化过程中的硬件噪声可能会在重复运行中引入变异性,影响采样结果的稳定性。同时,可执行的问题规模受限于可用量子比特的数量,尽管存在这些限制,真实量子设备的测试已经证明了我们提出的方法具有优异的性能。随着量子硬件的发展,这些结果有望得到进一步改善。

论文下载链接https://ieeexplore.ieee.org/document/11532962

相关推荐
CS创新实验室10 天前
量子计算机的操作系统:原理、实践与经典架构之对比
架构·操作系统·量子计算
沈浩(种子思维作者)13 天前
心理的研究,我从何来?
数据库·人工智能·量子计算
月光船幽幽14 天前
Φ-MEU全息演算新范式
人工智能·科技·量子计算·拓扑学
ECT-OS-JiuHuaShan15 天前
严格证明:还原论是ASCII,整体论是UTF-8的历史意义和价值
开发语言·人工智能·算法·量子计算
逻辑君20 天前
认知神经科学研究报告【20260112】
人工智能·深度学习·数学建模·量子计算
逻辑君21 天前
认知神经科学研究报告【20260111】
人工智能·深度学习·机器学习·量子计算
YFJ_mily21 天前
**Python 实战:写一个论文 PDF 投稿自检工具|附 IPAT 2026 智能光子学会议征稿信息
人工智能·python·pdf·量子计算·论文投稿·智能光子学
葫三生21 天前
《论三生原理》论证:大衍筮法是一种离散生成算法?
人工智能·算法·机器学习·计算机视觉·区块链·量子计算
想你依然心痛23 天前
量子计算对嵌入式密码学的挑战与后量子算法准备
算法·密码学·量子计算