论文解读:用于数据分析的极值点对称模态分解方法 (Extreme-point Symmetric Mode Decomposition,ESMD)
Wang J L, Li Z J. Extreme-point symmetric mode decomposition method for data analysisJ. Advances in Adaptive Data Analysis, 2013, 5(03): 1350015.
文章的核心贡献可以概括为一句话:作者试图把 HHT 的两个关键环节都从"外部构造"拉回到"数据内部几何"。在分解阶段,它不用传统 EMD 那种由局部极大点、局部极小点分别生成上、下外包络再取均值的方式,而是连接相邻极大点和极小点,取连线中点,再由中点生成一条、两条、三条或更多条内插曲线;在频率分析阶段,也不再把 IMF 送入 Hilbert 变换求解析信号,而是直接利用极值点之间的时间间隔内插出瞬时频率和瞬时幅值。
其中全文最重要的分解式仍然是
Y ( t ) = ∑ j = 1 n M j ( t ) + R ( t ) , Y(t)=\sum_{j=1}^{n}M_j(t)+R(t), Y(t)=j=1∑nMj(t)+R(t),
但这里的 R ( t ) R(t) R(t) 已经不是传统 EMD 中的"最后剩下的、最多只有一个极值点的趋势项"。ESMD 允许 R ( t ) R(t) R(t) 保留一定数量的极值点,并通过方差比准则选择筛分次数,使它成为 adaptive global mean,记作 AGM。换句话说,ESMD 不把趋势看成被动残余,而把趋势看成可优化的全局均值曲线;不把 IMF 的对称性理解为外包络对称,而理解为极大---极小点之间的内在平衡;不把瞬时频率理解为必须经 Hilbert 变换得到的相位导数,而把它理解为由极值间距直接读出的局部振荡速率。
1. 从 HHT 到 ESMD
Fourier 变换的基本模型是把数据投影到固定幅值、固定频率的正弦基上,所以它天然适合线性平稳问题。Wavelet 变换虽然引入尺度和窗口,可以观察时间---频率局部结构,但它仍需要预设母小波和尺度族。HHT 的 EMD 则有一个关键突破:它不预设基函数,而是根据数据自身的极值点筛出若干 IMF;随后 HSA 用 Hilbert 变换给 IMF 加上瞬时幅值和瞬时频率。Wang 与 Li 对 HHT 的不满集中在两个地方:EMD 的外包络均值可能把低频趋势拆散,HSA 的 Hilbert 解析信号则对正交性、窄带性和相位单调性有额外要求。
对一个 IMF x ( t ) x(t) x(t),原文回顾的 Hilbert 变换是
y ( t ) = H x ( t ) = 1 π P ∫ − ∞ ∞ x ( τ ) t − τ d τ , y(t)=Hx(t)=\frac{1}{\pi}P\int_{-\infty}^{\infty}\frac{x(\tau)}{t-\tau}\,d\tau, y(t)=Hx(t)=π1P∫−∞∞t−τx(τ)dτ,
其中 P P P 表示 Cauchy 主值。解析信号写成
z ( t ) = x ( t ) + i y ( t ) = A ( t ) e i θ ( t ) , z(t)=x(t)+iy(t)=A(t)e^{i\theta(t)}, z(t)=x(t)+iy(t)=A(t)eiθ(t),
于是瞬时幅值、相位和角频率为
A ( t ) = x 2 ( t ) + y 2 ( t ) , θ ( t ) = arctan y ( t ) x ( t ) , ω ( t ) = d θ ( t ) d t . A(t)=\sqrt{x^2(t)+y^2(t)}, \qquad \theta(t)=\arctan\frac{y(t)}{x(t)}, \qquad \omega(t)=\frac{d\theta(t)}{dt}. A(t)=x2(t)+y2(t) ,θ(t)=arctanx(t)y(t),ω(t)=dtdθ(t).
这套公式把一个实信号嵌入复平面,把局部振荡解释成复平面中的旋转。但作者指出, y ( t ) y(t) y(t) 必须能合理地作为 x ( t ) x(t) x(t) 的正交分量, θ ( t ) \theta(t) θ(t) 的导数也应非负,才能赋予 ω ( t ) \omega(t) ω(t) 清晰的物理含义。若 IMF 不是严格窄带,或者有平台、尖峰、间歇停振,Hilbert 相位就可能产生难解释的局部异常。
ESMD 的回答是:既然 IMF 的产生依赖数据极值点,那么瞬时频率也应尽量从极值点直接构造。这样,HHT 的两段式流程
data → EMD IMFs → Hilbert transform instantaneous frequency \text{data}\xrightarrow{\text{EMD}}\text{IMFs}\xrightarrow{\text{Hilbert transform}}\text{instantaneous frequency} dataEMD IMFsHilbert transform instantaneous frequency
被替换成
data → ESMD IMFs + AGM → DI instantaneous frequency and amplitude . \text{data}\xrightarrow{\text{ESMD}}\text{IMFs + AGM}\xrightarrow{\text{DI}}\text{instantaneous frequency and amplitude}. dataESMD IMFs + AGMDI instantaneous frequency and amplitude.
其中 HHT 的外包络和 Hilbert 变换都带有某种"外部补全"的意味;ESMD 则把极大点、极小点、相邻极值中点、极值间隔全部作为数据内生结构来使用。

图 1 用一条在若干时间段内突然停在极值或零值附近的振荡曲线说明:真实振荡未必处处光滑、未必每一段都严格通过零点。中间的平顶段和后面的零平台段使传统"极值点数与过零点数相差至多一"的 IMF 条件显得过窄。ESMD/DI 的立场是,把平台段理解为瞬时频率为零或暂时停振的区间,而不是把整个曲线排除在 IMF 之外。
经典 EMD 要求极值点数与过零点数相等或最多差 1,但图中的振荡有平台段:在平台内部,信号不再往返通过零点,却仍然可以被物理地理解为一次振荡过程中的"暂停"。若坚持传统 IMF 条件,它会被排除;若使用 DI 方法,则平台处可以自然赋值为 f ( t ) = 0 f(t)=0 f(t)=0,而平台外仍可由相邻极值间隔得到频率。
2. 极点对称
EMD 的局部均值是上、下包络的平均。设上包络为 U ( t ) U(t) U(t),下包络为 L ( t ) L(t) L(t),传统筛分扣除的是
m E M D ( t ) = U ( t ) + L ( t ) 2 . m_{\mathrm{EMD}}(t)=\frac{U(t)+L(t)}{2}. mEMD(t)=2U(t)+L(t).
ESMD 不直接构造 U ( t ) U(t) U(t) 和 L ( t ) L(t) L(t)。它先把相邻极大点、极小点连接起来,取线段中点,再由这些中点构造内插曲线。若极值点为
E i = ( t i , y i ) , i = 1 , 2 , ... , n , E_i=(t_i,y_i),\qquad i=1,2,\ldots,n, Ei=(ti,yi),i=1,2,...,n,
那么相邻极值的中点为
F i = E i + E i + 1 2 = ( t i + t i + 1 2 , y i + y i + 1 2 ) , i = 1 , 2 , ... , n − 1. F_i=\frac{E_i+E_{i+1}}{2} =\left(\frac{t_i+t_{i+1}}{2},\frac{y_i+y_{i+1}}{2}\right), \qquad i=1,2,\ldots,n-1. Fi=2Ei+Ei+1=(2ti+ti+1,2yi+yi+1),i=1,2,...,n−1.
若一个峰值 y i y_i yi 与紧接着的谷值 y i + 1 y_{i+1} yi+1 关于零线对称,那么这个中点就在零线上;若中点偏离零线,偏离量就可以解释为局部平衡位置的漂移。ESMD 的"极点对称"正是围绕这条局部平衡轨迹展开。
作者先从加权周期函数谈起。普通周期振荡可写成
A cos ω t , A\cos \omega t, Acosωt,
其中 A A A 与 ω \omega ω 都是常数。加权周期函数写成
A ( t ) cos ω t , A(t)\cos\omega t, A(t)cosωt,
它保留固定频率,但幅值随时间变动。进一步讲,这个 A ( t ) A(t) A(t) 不一定只代表振幅大小,也可以被分解为真实振荡幅度和平衡位置漂移两部分:
A ( t ) cos ω t = A r ( t ) + A e ( t ) cos ω t . A(t)\cos\omega t=A_r(t)+A_e(t)\cos\omega t. A(t)cosωt=Ar(t)+Ae(t)cosωt.
更一般的广义周期函数可写成
A ( t ) cos θ ( t ) = A r ( t ) cos θ r ( t ) + A e ( t ) cos θ e ( t ) . A(t)\cos\theta(t) =A_r(t)\cos\theta_r(t)+A_e(t)\cos\theta_e(t). A(t)cosθ(t)=Ar(t)cosθr(t)+Ae(t)cosθe(t).
也就是说,观测到的振荡可能同时包含"围绕平衡位置的真实往返运动"和"平衡位置本身的移动"。如果 A e ( t ) ≈ 0 A_e(t)\approx0 Ae(t)≈0,极值中点就接近零线,模态近似严格极点对称;如果 A e ( t ) A_e(t) Ae(t) 不为零,中点轨迹就是平衡位置移动的观测。
3. 严格极点对称与等幅模态的推导
考虑理想模态
x ( t ) = A sin θ ( t ) , A > 0 , θ ′ ( t ) > 0. x(t)=A\sin\theta(t),\qquad A>0,\qquad \theta'(t)>0. x(t)=Asinθ(t),A>0,θ′(t)>0.
它的极值点满足
x ′ ( t ) = A θ ′ ( t ) cos θ ( t ) = 0 , x'(t)=A\theta'(t)\cos\theta(t)=0, x′(t)=Aθ′(t)cosθ(t)=0,
由于 θ ′ ( t ) > 0 \theta'(t)>0 θ′(t)>0,所以
cos θ ( t ) = 0 , θ ( t ) = π 2 + k π . \cos\theta(t)=0, \qquad \theta(t)=\frac{\pi}{2}+k\pi. cosθ(t)=0,θ(t)=2π+kπ.
相邻极值的函数值交替为 A A A 与 − A -A −A。设相邻极值点为
E i = ( t i , A ) , E i + 1 = ( t i + 1 , − A ) , E_i=(t_i,A), \qquad E_{i+1}=(t_{i+1},-A), Ei=(ti,A),Ei+1=(ti+1,−A),
则它们的中点纵坐标为
A + ( − A ) 2 = 0. \frac{A+(-A)}{2}=0. 2A+(−A)=0.
因此,任意形如 A sin θ ( t ) A\sin\theta(t) Asinθ(t) 且相位单调的等幅模态,其相邻极值中点必然落在零线上。反过来,若一个离散模态的相邻极值点满足
y i + y i + 1 2 = 0 , i = 1 , 2 , ... , n − 1 , \frac{y_i+y_{i+1}}{2}=0, \qquad i=1,2,\ldots,n-1, 2yi+yi+1=0,i=1,2,...,n−1,
那么
y i + 1 = − y i . y_{i+1}=-y_i. yi+1=−yi.
递推可得
y i + 2 = − y i + 1 = y i , y_{i+2}=-y_{i+1}=y_i, yi+2=−yi+1=yi,
于是所有极大值具有相同幅值,所有极小值具有相反的相同幅值。若极大值为正、极小值为负,则存在 A > 0 A>0 A>0,使得
y i = ( − 1 ) i − 1 A y_i=(-1)^{i-1}A yi=(−1)i−1A
或相差一个符号。也就是说,它把"所有中点贴近零线"当成目标,实际上会把模态推向等幅极值结构。若原信号本来是调幅的,ESMD I 的高次数筛分就会倾向于把一个调幅模态拆成多个近似等幅模态。

图2:ESMD I 的单内插曲线。细线是加权周期信号,圆圈是相邻极大点与极小点连线的中点,粗线是这些中点的插值曲线。它不是外包络,而是位于信号内部的"平衡位置轨迹"。当粗线不在零线附近时,ESMD I 会把它作为局部均值扣除,于是原本的调幅信号会被迫朝等幅极点对称靠拢。

图3:加权周期函数经 ESMD I、20 次筛分后的分解。原始信号只有一个固定频率、衰减幅值的振荡,但 20 次筛分后出现 Mode1 到 Mode4 以及残差 R。多个 Mode 的振幅趋于近似恒定,说明严格极点对称会把幅值调制拆散,导致"过筛分"。这正是作者不主张盲目增加筛分次数的直接证据。

图4:加权周期函数的方差比随筛分次数变化。纵轴为方差比 u=\\sigma/\\sigma_0,横轴为筛分次数。曲线在小筛分次数附近出现低谷,原文指出 3 次附近优于 20 次。这里的重点不是数值本身,而是"筛分次数"被转化成可优化变量,AGM 的好坏通过方差比来评价。

图5:加权周期函数经 ESMD I、3 次筛分后的分解。与图3相比,Mode1 更完整地保留了原始衰减振荡,后续 Mode 和残差主要表现为较小分解误差。这个例子说明,较弱的对称要求有时比强行达到极点对称更符合物理意义。
4. ESMD 的分解算法:从极值中点到模态与 AGM
设离散数据为
Y = { y i } i = 1 N . Y=\{y_i\}_{i=1}^{N}. Y={yi}i=1N.
首先找出局部极值点,包括极大点和极小点,并记为
E i = ( t i , y i E ) , 1 ≤ i ≤ n . E_i=(t_i,y_i^{E}),\qquad 1\le i\le n. Ei=(ti,yiE),1≤i≤n.
若存在连续相等的极值平台,原文为了编程方便只取第一个点作为代表,随后连接相邻极值点 E i E_i Ei 与 E i + 1 E_{i+1} Ei+1,定义中点
F i = ( s i , m i ) = ( t i + t i + 1 2 , y i E + y i + 1 E 2 ) , 1 ≤ i ≤ n − 1. F_i=\left(s_i,m_i\right) =\left(\frac{t_i+t_{i+1}}{2},\frac{y_i^{E}+y_{i+1}^{E}}{2}\right), \qquad 1\le i\le n-1. Fi=(si,mi)=(2ti+ti+1,2yiE+yi+1E),1≤i≤n−1.
边界处还要补出 F 0 F_0 F0 和 F n F_n Fn,使内插曲线覆盖完整数据区间。随后按照给定的内插曲线数 p p p,将这些中点分成 p p p 组并分别内插,得到
L 1 ( t ) , L 2 ( t ) , ... , L p ( t ) . L_1(t),L_2(t),\ldots,L_p(t). L1(t),L2(t),...,Lp(t).
它们的平均曲线为
L ∗ ( t ) = 1 p ∑ q = 1 p L q ( t ) . L^*(t)=\frac{1}{p}\sum_{q=1}^{p}L_q(t). L∗(t)=p1q=1∑pLq(t).
ESMD 的一次筛分可写成
Y ( s + 1 ) ( t ) = Y ( s ) ( t ) − L ∗ ( s ) ( t ) . Y^{(s+1)}(t)=Y^{(s)}(t)-L^{*(s)}(t). Y(s+1)(t)=Y(s)(t)−L∗(s)(t).
如果 L ∗ ( t ) L^*(t) L∗(t) 足够小,当前曲线就近似围绕局部平衡位置对称;如果 L ∗ ( t ) L^*(t) L∗(t) 仍较大,就继续筛分。原文采用双重停止思想:一方面设定允许误差 ε \varepsilon ε,当
∥ L ∗ ∥ ≤ ε \|L^*\|\le \varepsilon ∥L∗∥≤ε
时停止;另一方面设定最大筛分次数 K K K,避免无穷循环。实际应用中常取
ε = 0.001 σ 0 , \varepsilon=0.001\sigma_0, ε=0.001σ0,
其中 σ 0 \sigma_0 σ0 是原始数据相对于总均值的标准差。
当第一个模态 M 1 M_1 M1 被筛出后,对残差
Y 1 ( t ) = Y ( t ) − M 1 ( t ) Y_1(t)=Y(t)-M_1(t) Y1(t)=Y(t)−M1(t)
重复同样过程,得到 M 2 , M 3 , ... M_2,M_3,\ldots M2,M3,...。当最后残差的极值点数不超过预设下限 m R m_R mR 时停止,得到
Y ( t ) = M 1 ( t ) + M 2 ( t ) + ⋯ + M n ( t ) + R ( t ) . Y(t)=M_1(t)+M_2(t)+\cdots+M_n(t)+R(t). Y(t)=M1(t)+M2(t)+⋯+Mn(t)+R(t).
这里的 m R m_R mR 是 ESMD 区别于传统 EMD 的一个关键参数。传统 EMD 往往把最后残差限制为单调函数或至多一个极值点的趋势;ESMD 允许 R ( t ) R(t) R(t) 保留若干极值点。这样, R ( t ) R(t) R(t) 可以表达弯曲的低频演化,而不必把所有低频起伏都拆进 IMF。
5. AGM 优化
为了决定最大筛分次数 K K K,作者引入方差比。原始数据总均值为
Y ˉ = 1 N ∑ i = 1 N y i , \bar{Y}=\frac{1}{N}\sum_{i=1}^{N}y_i, Yˉ=N1i=1∑Nyi,
原始数据相对于总均值的方差为
σ 0 2 = 1 N ∑ i = 1 N ( y i − Y ˉ ) 2 . \sigma_0^2=\frac{1}{N}\sum_{i=1}^{N}\left(y_i-\bar{Y}\right)^2. σ02=N1i=1∑N(yi−Yˉ)2.
若某次分解得到残差
R = { r i } i = 1 N , R=\{r_i\}_{i=1}^{N}, R={ri}i=1N,
则原数据相对于 AGM 候选曲线 R R R 的方差定义为
σ 2 = 1 N ∑ i = 1 N ( y i − r i ) 2 . \sigma^2=\frac{1}{N}\sum_{i=1}^{N}(y_i-r_i)^2. σ2=N1i=1∑N(yi−ri)2.
方差比为
ν = σ σ 0 . \nu=\frac{\sigma}{\sigma_0}. ν=σ0σ.
在有限整数区间 K min , K max K_{\\min},K_{\\max} Kmin,Kmax 上改变最大筛分次数,每个 K K K 产生一个残差 R K R_K RK,也产生一个方差比
ν ( K ) = 1 σ 0 1 N ∑ i = 1 N ( y i − r i ( K ) ) 2 1 / 2 . \nu(K)=\frac{1}{\sigma_0}\left\\frac{1}{N}\\sum_{i=1}\^{N}\\left(y_i-r_i(K)\\right)\^2\\right^{1/2}. ν(K)=σ01N1i=1∑N(yi−ri(K))21/2.
作者选择
K 0 = arg min K ∈ K min , K max ν ( K ) , K_0=\arg\min_{K\inK_{\\min},K_{\\max}}\nu(K), K0=argK∈Kmin,Kmaxminν(K),
然后用 K 0 K_0 K0 重新分解,输出所有 Mode 与最终 AGM。这个优化的含义可以写得更抽象。设 ESMD 在不同 K K K 下生成的残差族为
R = { R K : K ∈ K min , K max ∩ Z } , \mathcal{R}=\{R_K:K\inK_{\\min},K_{\\max}\cap\mathbb{Z}\}, R={RK:K∈Kmin,Kmax∩Z},
那么选择 AGM 等价于在有限候选集中求解
R K 0 = arg min R ∈ R ∥ Y − R ∥ 2 . R_{K_0}=\arg\min_{R\in\mathcal{R}}\|Y-R\|_2. RK0=argR∈Rmin∥Y−R∥2.
因此,ESMD 的 AGM 是"受模态分解机制约束的最小二乘趋势"。它不同于普通最小二乘拟合,因为普通最小二乘需要事先给出函数族,例如多项式、指数函数或样条函数;而其函数族则是由极值点内插、筛分次数、残差极值点数共同生成,也不同于滑动平均,因为滑动平均必须预先选窗口和权重,而 ESMD 的低频曲线来自数据极值结构。
不过,这里的"最优"应当谨慎理解。因为它不是所有可能趋势曲线中的绝对最优,而是在给定 p p p、 m R m_R mR、边界处理、内插方式和 K K K 搜索区间之后的算法内部最优。若 m R m_R mR 太小,AGM 可能过于僵硬;若 m R m_R mR 太大,AGM 可能吞掉本应属于低频 IMF 的振荡。作者在气温数据例子中明确提醒,增大 m R m_R mR 虽可降低方差比,却可能把 Mode5 与 R 合并成过度灵活的 AGM。

图6:风速数据在 ESMD I 下的方差比曲线。风速数据更复杂,方差比曲线呈多峰、多谷形态。原文在 1 , 30 1,30 1,30 内选出 18 次筛分作为最优。曲线的起伏表明, K K K 与分解质量之间并非单调关系,筛分次数不能用"越大越好"来判断。

图7:风速数据经 ESMD I、18 次筛分后的分解。图中出现 12 个 IMF 与残差 R,许多低频 IMF 仍带有明显调幅。ESMD I 的问题在这里再次显现:由于所有中点共用一条插值曲线,算法对极点对称的要求过严,分解效率较低,模态数偏多。
图6和图7展示 ESMD I 在真实风速数据上的表现。图6说明方差比曲线有明显不规则性,18 次筛分是所选区间内的低谷;图7显示 ESMD I 产生了 12 个 Mode。这种细碎分解并非一定错误,但它反映了 ESMD I 的低效率:所有中点都参与同一条内插曲线,使均值曲线保留了较多高频结构,筛分时更容易把调幅或局部不对称拆成多个模态。
6. ESMD I、II、III:内插曲线数如何改变对称强度
ESMD I、ESMD II、ESMD III 的根本差别是中点如何分组。ESMD I 使用一条曲线:
p = 1 , L ∗ ( t ) = L 1 ( t ) . p=1,\qquad L^*(t)=L_1(t). p=1,L∗(t)=L1(t).
它要求所有中点共同生成的曲线接近零线,因此对应最强的极点对称。ESMD II 使用两条曲线:奇数编号中点生成 L 1 ( t ) L_1(t) L1(t),偶数编号中点生成 L 2 ( t ) L_2(t) L2(t),筛分均值为
L ∗ ( t ) = L 1 ( t ) + L 2 ( t ) 2 . L^*(t)=\frac{L_1(t)+L_2(t)}{2}. L∗(t)=2L1(t)+L2(t).
这相当于允许中点轨迹自身上下摆动,只要求奇、偶两条中点轨迹近似互为对称。ESMD III 使用三条曲线:
L ∗ ( t ) = L 1 ( t ) + L 2 ( t ) + L 3 ( t ) 3 , L^*(t)=\frac{L_1(t)+L_2(t)+L_3(t)}{3}, L∗(t)=3L1(t)+L2(t)+L3(t),
其中 L 1 , L 2 , L 3 L_1,L_2,L_3 L1,L2,L3 分别由编号 3 k + 1 3k+1 3k+1、 3 k + 2 3k+2 3k+2、 3 ( k + 1 ) 3(k+1) 3(k+1) 的中点内插得到。它的对称要求更宽松,可以理解为 L 1 + L 2 L_1+L_2 L1+L2 与 L 3 L_3 L3 的广义平衡。
随着 p p p 增大,单条内插曲线使用的中点变少,均值曲线对原始高频结构的跟随程度降低,分解效率通常提高,Mode 数减少。但与此同时,对称条件也变弱,幅值调制更快,DI 频率和能量分析可能更不稳定。作者最终偏向 ESMD II,因为它既不像 ESMD I 那样过分追求等幅极点对称,也不像 ESMD III 那样过分放松约束。

图8:ESMD II 的奇偶中点内插。大圆圈是相邻极值连线中点。ESMD II 不把所有中点放进同一条曲线,而是把奇数中点与偶数中点分别内插,再取两条曲线的平均。图中粗线即为均值曲线。它允许中点轨迹自身有振荡,只要求奇偶两组中点近似对称,因此比 ESMD I 更宽松。
图8也是理解 ESMD II 的关键图,其中两条内插曲线是由中点分组形成的内部轨迹。它们可以跨越零线,符号也可以交替变化,因此不能简单看作"内部上包络"和"内部下包络"。ESMD II 的筛分扣除的是二者平均,而不是其中任何一条。这使算法比 EMD 更接近局部几何中心,也比 ESMD I 更能容忍调幅。
7. ESMD II 的理想算例:三部分复合信号
论文的第三个例子是
Y ( t ) = − sin ( 8 π t ) + 1.5 e − 0.2 t sin ( 1.9 π t + π 20 ) + ( t − 2 ) 2 , 0 ≤ t ≤ 4. Y(t)=-\sin(8\pi t)+1.5e^{-0.2t}\sin\left(1.9\pi t+\frac{\pi}{20}\right)+(t-2)^2, \qquad 0\le t\le4. Y(t)=−sin(8πt)+1.5e−0.2tsin(1.9πt+20π)+(t−2)2,0≤t≤4.
这个信号由三类结构构成:高频等幅正弦,低频衰减加权正弦,以及抛物线趋势。若算法有效,理想分解应当接近
M 1 ( t ) ≈ − sin ( 8 π t ) , M_1(t)\approx-\sin(8\pi t), M1(t)≈−sin(8πt),
M 2 ( t ) ≈ 1.5 e − 0.2 t sin ( 1.9 π t + π 20 ) , M_2(t)\approx1.5e^{-0.2t}\sin\left(1.9\pi t+\frac{\pi}{20}\right), M2(t)≈1.5e−0.2tsin(1.9πt+20π),
R ( t ) ≈ ( t − 2 ) 2 . R(t)\approx(t-2)^2. R(t)≈(t−2)2.
图9和图10显示,ESMD II 基本实现了这个目标。方差比曲线在 29 次附近进入稳定低谷,实际分解中 Mode1、Mode2 和 R 与三部分构造项高度对应。这个例子说明,ESMD II 的奇偶极点对称既能提取高频,也能保留低频调幅,还能把平滑趋势留在 AGM 中。

图9:复合数据的方差比曲线。复合数据由高频正弦、低频衰减正弦和抛物线趋势构成。方差比在 29 次附近进入低谷且相对稳定,说明该 K K K 产生的 AGM 是一个合理低频趋势,而不是把趋势错误地分进 IMF。

图10:复合数据经 ESMD II、29 次筛分后的分解。Data 是三部分叠加;Mode1 几乎对应 − sin ( 8 π t ) -\sin(8\pi t) −sin(8πt),Mode2 对应低频加权周期项,R 对应抛物线趋势 ( t − 2 ) 2 (t-2)^2 (t−2)2。
8. 风速数据:AGM 为什么比 EMD 的最后趋势更有解释力
风速数据采样率为 20 Hz,包含湍动高频、低频变化和可能的趋势漂移。ESMD II 在图11中选择 30 次筛分,图12给出 4 个 Mode 与一个 R。作者认为这些 Mode 可理解为平均周期约为 3.8 s 3.8\,\mathrm{s} 3.8s、 1.5 s 1.5\,\mathrm{s} 1.5s、 0.6 s 0.6\,\mathrm{s} 0.6s 等不同尺度的风速振荡。
图13把 ESMD II 的 AGM 与 EMD 趋势函数并列。可以把 EMD 的最后趋势记为 T E M D ( t ) T_{\mathrm{EMD}}(t) TEMD(t),把若干低频 Mode 记为 C 5 ( t ) , C 6 ( t ) , C 7 ( t ) C_5(t),C_6(t),C_7(t) C5(t),C6(t),C7(t)。原文的观察可写成近似关系
R E S M D ( t ) ≈ T E M D ( t ) + C 5 ( t ) + C 6 ( t ) + C 7 ( t ) . R_{\mathrm{ESMD}}(t)\approx T_{\mathrm{EMD}}(t)+C_5(t)+C_6(t)+C_7(t). RESMD(t)≈TEMD(t)+C5(t)+C6(t)+C7(t).
也就是说,传统 EMD 会把低频均值结构拆散到多个低频 IMF 中,而 ESMD 通过允许 R R R 保留若干极值点,可以把这些低频演化直接合并进 AGM。对趋势提取来说,这非常重要,因为真实系统的均值轨迹未必单调,低频弯曲不一定应被当作振荡分量。

图11:风速数据在 ESMD II 下的方差比曲线。曲线在 30 次附近取低值,且随后出现若干平台式稳定区间。相比图6,ESMD II 的方差比曲线虽然仍有不规则跳变,但可选的稳定低谷更清楚,支持作者把 30 次作为风速数据的最优筛分次数。

图12:风速数据经 ESMD II、30 次筛分后的分解。ESMD II 只产生 4 个 Mode 和一个 R。Mode1、Mode2 代表较高频率的湍动,Mode3、Mode4 是低频振荡,R 是随时间缓慢弯曲的 AGM。与图7相比,模态数减少而层次更清晰。

图13:ESMD II 的 AGM 与 EMD 趋势比较。虚线是风速数据,带小圆的曲线是 ESMD II 的 AGM,粗实线是 EMD 的最后趋势,细实线是 EMD 的低频 Mode 与趋势相加。ESMD AGM 更贴近低频起伏。

图14:同一风速数据经 EMD、30 次筛分后的分解。EMD 产生 7 个 Mode 和残差 R。高频 Mode 与 ESMD 有相似之处,但低频部分分得更碎,最后 R 更接近单调趋势。图13说明,要把 EMD 的若干低频 Mode 与 R 相加,才能接近 ESMD 的 AGM。
9. 气温数据:稳定筛分区间与季节性 AGM
气温数据是从 2008 年 5 月 10 日到 2011 年 11 月 3 日的日平均气温。与短时风速不同,气温数据有明显季节性,因此最后的 AGM 不应是一条简单直线或单调曲线。图15显示方差比随筛分次数变化时出现多个稳定区间。作者倾向于在稳定区间中选择方差比较小的筛分次数,因为稳定区间意味着分解对 K K K 的微小变化不敏感。
图16中,残差 R R R 呈现季节性缓慢起伏,前几个 Mode 对应较快温度波动。作者解释说,分解出的 IMF 可与约双月、月、半月等尺度联系起来。若第 j j j 个 Mode 的局部平均频率为 f ˉ j \bar{f}_j fˉj,则其平均周期可粗略写为
T ˉ j = 1 f ˉ j . \bar{T}_j=\frac{1}{\bar{f}_j}. Tˉj=fˉj1.
当 T ˉ j ≈ 66 \bar{T}_j\approx66 Tˉj≈66 天、35 天、17 天时,就可分别联系到双月、月、半月尺度。更重要的是幅值变化。若某个 Mode 的幅值曲线 A j ( t ) A_j(t) Aj(t) 在某段时间显著增大,就表示该时间段内该尺度的异常振荡增强。原文据此指出,Mode4 的幅值变化大,而 Mode5 较小,温度异常主要发生在约 35 天尺度,时间集中在 2009 年 1 月至 3 月附近。

图15:气温数据在 ESMD II 下的方差比曲线。日平均气温数据的方差比曲线出现多个分离的稳定区间,例如原文提到的 20 , 29 20,29 20,29、 36 , 40 36,40 36,40、 43 , 48 43,48 43,48、 72 , 76 72,76 72,76。作者最终选用 29 次,强调稳定区间比单个偶然低点更可靠。

图16:气温数据经 ESMD II、29 次筛分后的分解。R 呈现清楚的季节性演化,Mode5 大致对应较慢的周期振荡,Mode4 的幅值变化更剧烈。作者据此指出,温度异常主要体现在约 35 天尺度上,尤其集中在 2009 年 1 月至 3 月附近。

图17:Mode1 的奇偶型极点对称与外包络对照。图中内插中点以不同符号显示,外侧两条曲线是上、下包络。奇偶中点内插曲线的均值接近零线,这与外包络均值接近零的效果相似。作者用此图说明,ESMD II 的内对称在密集极值情况下近似等价于 EMD 的外包络对称。
图17给出了 ESMD II 与 EMD 之间最直观的桥梁。外包络对称要求
U ( t ) + L ( t ) 2 ≈ 0 , \frac{U(t)+L(t)}{2}\approx0, 2U(t)+L(t)≈0,
奇偶极点对称要求
L 1 ( t ) + L 2 ( t ) 2 ≈ 0. \frac{L_1(t)+L_2(t)}{2}\approx0. 2L1(t)+L2(t)≈0.
在极值点密集、包络缓慢变化时,这两种条件接近;但在极值点稀疏或边界附近,外包络外推的不确定性通常更大,而内插中点曲线幅度较小、位置更靠近数据本身。作者因此认为 ESMD II 在许多情况下比外包络 EMD 更稳健。
10. ESMD III
ESMD III 用三条内插曲线,均值为
L ∗ ( t ) = L 1 ( t ) + L 2 ( t ) + L 3 ( t ) 3 . L^*(t)=\frac{L_1(t)+L_2(t)+L_3(t)}{3}. L∗(t)=3L1(t)+L2(t)+L3(t).
对称条件变成
∣ L ∗ ( t ) ∣ ≤ ε . |L^*(t)|\le\varepsilon. ∣L∗(t)∣≤ε.
若把 L 1 ( t ) + L 2 ( t ) L_1(t)+L_2(t) L1(t)+L2(t) 看作一侧, L 3 ( t ) L_3(t) L3(t) 看作另一侧,那么 ESMD III 只要求三组中点的总体均衡,而不要求奇偶两组之间直接对称。它的好处是筛分更快。复合数据例子中,ESMD III 只需 5 次筛分就能得到与 ESMD II 类似的结果;气温数据中,它用 11 次筛分得到的方差比略低于 ESMD II 的 29 次筛分结果。
但效率提高的代价是 Mode 的幅值调制更快。若一个 Mode 写作
M j ( t ) = A j ( t ) cos θ j ( t ) , M_j(t)=A_j(t)\cos\theta_j(t), Mj(t)=Aj(t)cosθj(t),
则 ESMD II 通常让 A j ( t ) A_j(t) Aj(t) 更平滑,ESMD III 则可能让 A j ( t ) A_j(t) Aj(t) 带有较快变化。对于后续 DI 频率与能量分析来说,过快的幅值调制会使频率---幅值解释变得不够稳定。因此,作者最终把 ESMD II 作为默认推荐。

图18:气温数据经 ESMD III、11 次筛分后的分解。ESMD III 只需 11 次筛分,并输出更少 Mode。AGM 仍然合理,方差比略低于 ESMD II 的结果,但 Mode 的幅值调制更快、对称性更弱。这幅图支持作者对 ESMD III 的评价:效率高,但不一定最适合频率和能量分析。
11. DI 瞬时频率:从极值间距推出局部频率
DI 方法的目标是避免 Hilbert 变换,直接从 IMF 的极值点构造瞬时频率。设第 j j j 个 IMF 的离散数据为
( t ( k ) , y ( k ) ) , 1 ≤ k ≤ N . (t(k),y(k)),\qquad 1\le k\le N. (t(k),y(k)),1≤k≤N.
极值点可用不等式识别。一个采样点可作为极大点的条件之一是
y ( k ) > y ( k − 1 ) , y ( k ) ≥ y ( k + 1 ) , y(k)>y(k-1),\qquad y(k)\ge y(k+1), y(k)>y(k−1),y(k)≥y(k+1),
或者
y ( k ) ≥ y ( k − 1 ) , y ( k ) > y ( k + 1 ) . y(k) \ge y(k-1), \qquad y(k) > y(k+1). y(k)≥y(k−1),y(k)>y(k+1).
极小点对应
y ( k ) < y ( k − 1 ) , y ( k ) ≤ y ( k + 1 ) , y(k) < y(k-1),\qquad y(k)\le y(k+1), y(k)<y(k−1),y(k)≤y(k+1),
或者
y ( k ) ≤ y ( k − 1 ) , y ( k ) < y ( k + 1 ) . y(k) \le y(k-1),\qquad y(k) < y(k+1). y(k)≤y(k−1),y(k)<y(k+1).
把这些极值点记为
E i = ( t i , y i ) , 1 ≤ i ≤ m . E_i=(t_i,y_i),\qquad 1\le i\le m. Ei=(ti,yi),1≤i≤m.
若不存在相邻相等极值,那么一个自然的局部频率节点是
a i = t i + 1 + t i − 1 2 , f i = 1 t i + 1 − t i − 1 . a_i=\frac{t_{i+1}+t_{i-1}}{2}, \qquad f_i=\frac{1}{t_{i+1}-t_{i-1}}. ai=2ti+1+ti−1,fi=ti+1−ti−11.
为什么是这个公式?对纯正弦
x ( t ) = A cos ( 2 π f t ) , x(t)=A\cos(2\pi f t), x(t)=Acos(2πft),
相邻极大---极小之间相隔半个周期,相隔两个极值点的同类型极值之间相隔一个完整周期 T = 1 / f T=1/f T=1/f。因此
t i + 1 − t i − 1 = T , f = 1 t i + 1 − t i − 1 . t_{i+1}-t_{i-1}=T, \qquad f=\frac{1}{t_{i+1}-t_{i-1}}. ti+1−ti−1=T,f=ti+1−ti−11.
对缓慢调频信号
x ( t ) = A ( t ) cos ϕ ( t ) , ϕ ′ ( t ) > 0 , x(t)=A(t)\cos\phi(t), \qquad \phi'(t)>0, x(t)=A(t)cosϕ(t),ϕ′(t)>0,
相邻两个同类型极值大致满足相位差 2 π 2\pi 2π。令 a i a_i ai 为 t i − 1 t_{i-1} ti−1 与 t i + 1 t_{i+1} ti+1 的中点,则 Taylor 展开给出
ϕ ( t i + 1 ) − ϕ ( t i − 1 ) = ϕ ′ ( a i ) ( t i + 1 − t i − 1 ) + ϕ ( 3 ) ( a i ) 24 ( t i + 1 − t i − 1 ) 3 + ⋯ . \phi(t_{i+1})-\phi(t_{i-1}) =\phi'(a_i)(t_{i+1}-t_{i-1}) +\frac{\phi^{(3)}(a_i)}{24}(t_{i+1}-t_{i-1})^3+\cdots. ϕ(ti+1)−ϕ(ti−1)=ϕ′(ai)(ti+1−ti−1)+24ϕ(3)(ai)(ti+1−ti−1)3+⋯.
由于左侧约为 2 π 2\pi 2π,在相位变化足够平缓时有
1 t i + 1 − t i − 1 ≈ ϕ ′ ( a i ) 2 π . \frac{1}{t_{i+1}-t_{i-1}} \approx \frac{\phi'(a_i)}{2\pi}. ti+1−ti−11≈2πϕ′(ai).
这正是普通频率而非角频率。若需要角频率,则可写成
ω i ≈ 2 π f i . \omega_i\approx 2\pi f_i. ωi≈2πfi.
若出现相邻相等极值,DI 方法把该处视为间歇或平台,直接定义
a i = t i , f i = 0. a_i=t_i, \qquad f_i=0. ai=ti,fi=0.
在平台附近,为了不让频率曲线断裂,原文还给出相邻点修正。若 E i E_i Ei 与 E i + 1 E_{i+1} Ei+1 是相邻相等极值,则左侧邻近频率可取
a i − 1 = t i + t i − 2 2 , f i − 1 = 1 t i − t i − 2 , a_{i-1}=\frac{t_i+t_{i-2}}{2}, \qquad f_{i-1}=\frac{1}{t_i-t_{i-2}}, ai−1=2ti+ti−2,fi−1=ti−ti−21,
右侧邻近频率可取
a i + 2 = t i + 3 + t i + 1 2 , f i + 2 = 1 t i + 3 − t i + 1 . a_{i+2}=\frac{t_{i+3}+t_{i+1}}{2}, \qquad f_{i+2}=\frac{1}{t_{i+3}-t_{i+1}}. ai+2=2ti+3+ti+1,fi+2=ti+3−ti+11.
若平台段使得 E i , E i + 1 E_i,E_{i+1} Ei,Ei+1 或 E i − 1 , E i E_{i-1},E_i Ei−1,Ei 并非普通相邻极值,原文采用扣除平台长度的估计,例如
a i − 1 = t i − 1 , f i − 1 = 1 ( t i + 2 − t i − 2 ) − ( t i + 1 − t i ) , a_{i-1}=t_{i-1}, \qquad f_{i-1}=\frac{1}{(t_{i+2}-t_{i-2})-(t_{i+1}-t_i)}, ai−1=ti−1,fi−1=(ti+2−ti−2)−(ti+1−ti)1,
以及
a i + 2 = t i + 2 , f i + 2 = 1 ( t i + 3 − t i − 1 ) − ( t i + 1 − t i ) . a_{i+2}=t_{i+2}, \qquad f_{i+2}=\frac{1}{(t_{i+3}-t_{i-1})-(t_{i+1}-t_i)}. ai+2=ti+2,fi+2=(ti+3−ti−1)−(ti+1−ti)1.
边界处使用线性外推。左端若不是相邻相等情形,则
f 1 = ( f 3 − f 2 ) ( a 1 − a 2 ) a 3 − a 2 + f 2 , a 1 = t ( 1 ) . f_1=\frac{(f_3-f_2)(a_1-a_2)}{a_3-a_2}+f_2, \qquad a_1=t(1). f1=a3−a2(f3−f2)(a1−a2)+f2,a1=t(1).
若外推得到 f 1 ≤ 0 f_1\le0 f1≤0,则改用正值估计
f 1 = 1 2 ( t 2 − t 1 ) . f_1=\frac{1}{2(t_2-t_1)}. f1=2(t2−t1)1.
右端类似:
f m = ( f m − 1 − f m − 2 ) ( a m − a m − 1 ) a m − 1 − a m − 2 + f m − 1 , a m = t ( N ) . f_m=\frac{(f_{m-1}-f_{m-2})(a_m-a_{m-1})}{a_{m-1}-a_{m-2}}+f_{m-1}, \qquad a_m=t(N). fm=am−1−am−2(fm−1−fm−2)(am−am−1)+fm−1,am=t(N).
若 f m ≤ 0 f_m\le0 fm≤0,则取
f m = 1 2 ( t m − t m − 1 ) . f_m=\frac{1}{2(t_m-t_{m-1})}. fm=2(tm−tm−1)1.
最后用所有节点 ( a i , f i ) (a_i,f_i) (ai,fi) 内插出一条曲线 f ( t ) f(t) f(t),并取非负部分作为瞬时频率:
f i n s t ( t ) = max { 0 , f ( t ) } . f_{\mathrm{inst}}(t)=\max\{0,f(t)\}. finst(t)=max{0,f(t)}.
瞬时幅值比瞬时频率更容易。对 IMF 取绝对值,找出其极值点,再对这些极值点做上包络内插。若第 j j j 个 IMF 的瞬时幅值为 A j ( t ) A_j(t) Aj(t),作者定义总能量为
E ( t ) = 1 2 ∑ j = 1 n A j 2 ( t ) . E(t)=\frac{1}{2}\sum_{j=1}^{n}A_j^2(t). E(t)=21j=1∑nAj2(t).
这个式子像局部均方振幅。若
M j ( t ) = A j ( t ) cos θ j ( t ) , M_j(t)=A_j(t)\cos\theta_j(t), Mj(t)=Aj(t)cosθj(t),
并在一个局部周期内把 A j ( t ) A_j(t) Aj(t) 视为近似常数,则
⟨ M j 2 ( t ) ⟩ ≈ A j 2 ( t ) ⟨ cos 2 θ j ( t ) ⟩ = A j 2 ( t ) 2 . \left\langle M_j^2(t)\right\rangle \approx A_j^2(t)\left\langle \cos^2\theta_j(t)\right\rangle =\frac{A_j^2(t)}{2}. ⟨Mj2(t)⟩≈Aj2(t)⟨cos2θj(t)⟩=2Aj2(t).
若不同 IMF 的局部频率相差较大,交叉项平均近似消失,于是总振荡强度自然写成 1 2 ∑ j A j 2 ( t ) \frac12\sum_jA_j^2(t) 21∑jAj2(t)。这并不是严格力学能量,而是一个描述非平稳振荡强度的时间函数。

图19:风速 IMF 的 DI 瞬时频率与瞬时幅值。每个 IMF 对应一对曲线,F 表示瞬时频率,A 表示瞬时幅值。F1 在若干时间段达到 Nyquist 频率,说明高频 Mode 已逼近采样可分辨上限;F3 在 t ≈ 10 t\approx10 t≈10 附近出现尖峰,而 A3 同时很小,表示短促高频振荡但能量不大。

图20:风速 IMF 的频率分布。不同线型代表不同 IMF 的瞬时频率。相邻 Mode 在整体频率范围上可能重叠,但在同一时刻重叠并不明显。作者据此认为,"频率重叠"若只从全局频谱看会被放大,而用时间变化频率看,许多 Mode 仍可视为独立振荡。

图21:风速 IMF 总能量随时间变化。总能量由 E ( t ) = 1 2 ∑ j A j 2 ( t ) E(t)=\frac12\sum_j A_j^2(t) E(t)=21∑jAj2(t) 给出。曲线在 15 秒内出现三个较大峰值,表示振荡强度在这些时刻增强。

图22:风速数据的最优 AGM 随时间变化。细线是原始风速,粗线是 AGM。与图21对照,能量峰值大体对应 AGM 的下凹区间。作者没有给出确定物理解释,而是把它作为可能涉及能量转移或低频---高频耦合的开放问题。
图19到图22体现了 DI 方法与 Hilbert 谱的差别:Hilbert 谱常把能量投影到时间---频率平面,而作者认为,对非平稳数据来说,总能量本身也在时间方向上变化,强行投影到固定频率轴可能掩盖局部过程。图20显示频率作为时间函数时,相邻模态的"重叠"并不严重;图21和图22则提示,低频 AGM 的下凹与高频振荡能量峰值可能存在耦合。
12. 整体判断
这篇文章最有启发性的地方,是把 EMD/HHT 中长期分散讨论的问题统一起来:筛分停止准则、趋势项定义、局部对称类型、IMF 条件、瞬时频率计算。 AGM 的思想特别重要:因为很多真实数据的"趋势"不是单调线,也不是最多一个极值点的光滑曲线;它可能是一条保留少数极值、代表低频均衡轨迹的曲线。ESMD 允许这种曲线存在,并用方差比选择它。
ESMD II 是全文最稳妥的版本。ESMD I 的严格极点对称会把调幅结构推向等幅 Mode,容易过筛分;ESMD III 的效率很高,但对称要求较弱,幅值调制可能太快;ESMD II 以奇偶中点内插替代外包络,在分解效率、对称性和幅值平滑之间取得折中。论文中的复合信号、风速数据和气温数据都支持这一点。
但文章的局限也很明显,比如 ε \varepsilon ε、 m R m_R mR、边界处理、内插方法、筛分区间 K min , K max K_{\\min},K_{\\max} Kmin,Kmax 都会影响分解。方差比优化只在 ESMD 生成的候选 AGM 集合内有效,不能保证恢复某种唯一真实趋势。DI 频率方法直观,但依赖极值点质量;在强噪声条件下,极值点过密会使频率曲线跳动。作者在附录 D 中也承认,IMF 对称度随筛分次数不是单调改善,而是间歇式变化,这意味着 ESMD 的收敛理论仍需进一步建立。
因此,最合适的评价是:ESMD 给出了一套非常清楚的数据几何替代方案,即从"外包络平均"转向"相邻峰谷中点",从"最后剩下的趋势"转向"可优化的 AGM",从"Hilbert 解析相位"转向"极值间距内插频率"。这些思想即使不完全采用原算法,也值得在非线性、非平稳数据分析中保留。
附录一:边界处理的细节
边界处理在 EMD/ESMD 中非常敏感,因为样条或线性内插在端点处容易外推失真。原文附录 A 以左边界为例说明了作者对 Wu--Huang 线性边界方法的修改。设由前两个极大点插值得到的直线为
y = k 1 t + b 1 , y=k_1t+b_1, y=k1t+b1,
由前两个极小点插值得到的直线为
y = k 2 t + b 2 . y=k_2t+b_2. y=k2t+b2.
在左端 t = 0 t=0 t=0 处,这两条线给出上、下边界候选值 b 1 , b 2 b_1,b_2 b1,b2。设原始数据首点为
Y 1 = Y ( 0 ) . Y_1=Y(0). Y1=Y(0).
若
b 2 ≤ Y 1 ≤ b 1 , b_2\le Y_1\le b_1, b2≤Y1≤b1,
则首点落在合理外推带内,直接把 b 1 b_1 b1 和 b 2 b_2 b2 作为边界最大值和边界最小值即可。若 Y 1 Y_1 Y1 略高于 b 1 b_1 b1,原 Wu--Huang 处理会直接把 Y 1 Y_1 Y1 与 b 2 b_2 b2 作为边界极值;若 Y 1 Y_1 Y1 略低于 b 2 b_2 b2,则把 b 1 b_1 b1 与 Y 1 Y_1 Y1 作为边界极值。Wang 与 Li 认为,若边界过陡,这样做会让内插曲线在端点发生剧烈弯折,因此引入阈值。
上侧过陡阈值为
b 1 + b 2 2 + ( b 1 − b 2 ) = 3 b 1 − b 2 2 , \frac{b_1+b_2}{2}+(b_1-b_2)=\frac{3b_1-b_2}{2}, 2b1+b2+(b1−b2)=23b1−b2,
下侧过陡阈值为
b 1 + b 2 2 − ( b 1 − b 2 ) = 3 b 2 − b 1 2 . \frac{b_1+b_2}{2}-(b_1-b_2)=\frac{3b_2-b_1}{2}. 2b1+b2−(b1−b2)=23b2−b1.
于是上侧分为两种情形。若
b 1 < Y 1 ≤ 3 b 1 − b 2 2 b_1 < Y_1 \le \frac{3b_1 - b_2}{2} b1<Y1≤23b1−b2
则首点只是略高于上边界,可仍把 Y 1 Y_1 Y1 和 b 2 b_2 b2 作为边界最大、最小点。若
Y 1 > 3 b 1 − b 2 2 , Y_1>\frac{3b_1-b_2}{2}, Y1>23b1−b2,
则首点过高,直接用 b 2 b_2 b2 可能造成端点不稳定。作者此时把 Y 1 Y_1 Y1 作为边界最大点,而边界最小点不再用原来的下边界直线,而是从第一个实际极小点出发、结合首点与第一个实际极大或极小点重新构造一条直线
y = k ∗ t + b ∗ . y=k^*t+b^*. y=k∗t+b∗.
下侧情形完全对称。若
3 b 2 − b 1 2 ≤ Y 1 < b 2 , \frac{3b_2 - b_1}{2} \le Y_1 < b_2, 23b2−b1≤Y1<b2,
则可把 b 1 b_1 b1 与 Y 1 Y_1 Y1 作为边界最大、最小点;若
Y 1 < 3 b 2 − b 1 2 , Y_1<\frac{3b_2-b_1}{2}, Y1<23b2−b1,
则首点过低,需重新构造边界最大点。这个修正的核心不是追求解析优雅,而是数值稳定:边界点不应因首点过陡而把插值曲线拉出不合理形状。

附图A.1:左边界处理的三种情形。Case A 表示首点位于两条外推直线之间;Case B 表示首点略高于上边界但未过陡;Case C 表示首点过陡,此时用经过首点和第一个相反极值的斜线重新确定边界点。这个修改是为了避免边界处的插值曲线在高筛分次数下发生不稳定摆动。
附录二:包络对称方案也可套用 AGM 优化
原文附录 B 提到,本文的方差比优化和 AGM 思想并不只能配合极点对称,也可以配合传统 EMD 的包络对称。若仍然构造上包络 U ( t ) U(t) U(t) 与下包络 L ( t ) L(t) L(t),筛分均值就是
L ∗ ( t ) = U ( t ) + L ( t ) 2 . L^*(t)=\frac{U(t)+L(t)}{2}. L∗(t)=2U(t)+L(t).
于是一次筛分仍可写作
Y ( s + 1 ) ( t ) = Y ( s ) ( t ) − L ∗ ( s ) ( t ) , Y^{(s+1)}(t)=Y^{(s)}(t)-L^{*(s)}(t), Y(s+1)(t)=Y(s)(t)−L∗(s)(t),
最终也可以通过
ν ( K ) = 1 σ 0 1 N ∑ i = 1 N ( y i − r i ( K ) ) 2 1 / 2 \nu(K)=\frac{1}{\sigma_0}\left\\frac{1}{N}\\sum_{i=1}\^{N}\\left(y_i-r_i(K)\\right)\^2\\right^{1/2} ν(K)=σ01N1i=1∑N(yi−ri(K))21/2
选择最优残差。风速数据实验中,包络对称方案在 39 次筛分时也能得到相当好的 AGM,方差比约为 33.8 % 33.8\% 33.8%,且高频 Mode 与 ESMD II 的结果相似。区别主要在低频 Mode,因为外包络位于数据外部,稀疏极值下更依赖外推;奇偶中点曲线位于数据内部,局部不确定性相对小。

附图A.2:包络对称方案下风速数据的方差比。这里作者把 ESMD 的 AGM 优化思想移植到传统外包络对称方案上。方差比同样随筛分次数出现不规则变化,说明"优化残差"并不依赖极点对称,也可以用于 EMD 型框架。

附图A.3:包络对称方案、39 次筛分下的风速分解。该图与图12相似,说明在极值点密集时,外包络对称与 ESMD II 的奇偶内对称会产生接近结果。但低频 Mode 仍存在差别,作者认为稀疏极值情形下内插曲线更可信。
附录三:OST 方法为什么不一定优化整体 AGM
原文附录 C 讨论另一种停止准则,称为 OST,optimal sifting times。它不是先固定全局 K K K 并优化最终 AGM,而是在提取某个准 IMF 时,选择使该准 IMF 的均值曲线最大幅值最小的筛分次数。若第 s s s 次筛分后的均值曲线为 L ∗ ( s ) ( t ) L^{*(s)}(t) L∗(s)(t),定义
A max ( s ) = max t ∣ L ∗ ( s ) ( t ) ∣ . A_{\max}(s)=\max_t|L^{*(s)}(t)|. Amax(s)=tmax∣L∗(s)(t)∣.
则单个 IMF 的 OST 可写成
s 0 = arg min 1 ≤ s ≤ K max A max ( s ) . s_0=\arg\min_{1\le s\le K_{\max}}A_{\max}(s). s0=arg1≤s≤KmaxminAmax(s).
这确实更直接地优化了"当前 IMF 是否对称",因为 L ∗ ( t ) L^*(t) L∗(t) 越小,模态越接近对称。但问题在于,整体分解的目标并不只是让每个 IMF 局部最对称,还要让最终残差 R R R 成为合适 AGM。逐个 IMF 的局部最优会改变后续残差的极值结构,可能导致最后 R R R 的低频拟合变差。
这个差异可以用两个目标函数表示。单 IMF 的 OST 目标是
min s A max ( s ) , \min_s A_{\max}(s), sminAmax(s),
而 AGM 优化目标是
min K ∥ Y − R K ∥ 2 . \min_K \|Y-R_K\|_2. Kmin∥Y−RK∥2.
前者关心局部对称误差,后者关心最终全局均值曲线与数据的低频拟合。两个目标没有必然一致性。图A.4与图A.5正说明,即使 K max K_{\max} Kmax 从 100 增加到 200,使单个 IMF 有更多筛分选择,最后的 R 也可能更差。

附图A.4:OST 方法在 K max = 100 K_{\max}=100 Kmax=100 时的风速分解。这里是对单个准 IMF 的均值曲线幅度做最优筛分。结果看似能让每个 IMF 更对称,但最后 R 的整体拟合未必最好。

附图A.5:OST 方法在 K max = 200 K_{\max}=200 Kmax=200 时的风速分解。扩大 K max K_{\max} Kmax 给了单个 IMF 更多筛分选择,模态对称性可能更强,但残差 R 反而更差。这个对照说明,逐个 IMF 的局部最优不能保证整体 AGM 最优。
附录四:过筛分与 Nyquist 极限的推导
原文附录 D 提到,随着筛分次数增加,第一模态的极值点数总体上可能增加。极端情况下,所有极值点都相邻,中间没有普通采样点。设采样间隔为
Δ t = 1 f s , \Delta t=\frac{1}{f_s}, Δt=fs1,
其中 f s f_s fs 是采样率。若相邻采样点交替成为极大、极小,则相隔两个极值点的时间为
t i + 1 − t i − 1 = 2 Δ t . t_{i+1}-t_{i-1}=2\Delta t. ti+1−ti−1=2Δt.
DI 频率公式给出
f i = 1 t i + 1 − t i − 1 = 1 2 Δ t = f s 2 . f_i=\frac{1}{t_{i+1}-t_{i-1}}=\frac{1}{2\Delta t}=\frac{f_s}{2}. fi=ti+1−ti−11=2Δt1=2fs.
这正是 Nyquist 频率。也就是说,若过筛分把模态推到采样点级别的交替振荡,瞬时频率会逼近采样所能表示的最高频率。这通常不代表真实物理振荡,而是算法过度追求对称后产生的数值极限。
另一个重要现象是对称度不单调改善。若用均值曲线最大幅值衡量不对称度,即
A max ( K ) = max t ∣ L K ∗ ( t ) ∣ , A_{\max}(K)=\max_t|L_K^*(t)|, Amax(K)=tmax∣LK∗(t)∣,
直觉可能以为 A max ( K ) A_{\max}(K) Amax(K) 随 K K K 增大而下降。但图A.6显示它会突然升高、进入平台、再下降。这是因为筛分会改变极值点位置和数量,而内插曲线又由极值点决定;一旦某次筛分引起极值结构突变,均值曲线可能突然变差。由此可见,固定一个很大的筛分次数并不可靠。

附图A.6:IMF1 均值曲线最大幅值随筛分次数变化。纵轴是 IMF1 均值曲线的最大幅值,横轴是筛分次数。曲线并没有单调下降,而是多次突然跳升、平台、再下降,显示 IMF 对称度随筛分次数呈间歇式变化。这也是作者反对无限筛分、固定"大次数筛分"的重要依据。
一些补充推导
A. 奇偶极点对称为什么近似等价于包络对称
设一个局部振荡的上包络、下包络分别为 U ( t ) U(t) U(t) 与 L ( t ) L(t) L(t)。某一对相邻极大点和极小点出现在
p i = c i + h i 2 , q i = c i − h i 2 , p_i=c_i+\frac{h_i}{2}, \qquad q_i=c_i-\frac{h_i}{2}, pi=ci+2hi,qi=ci−2hi,
其中 c i c_i ci 是二者时间中点, h i h_i hi 是时间间隔。极大值近似为 U ( p i ) U(p_i) U(pi),极小值近似为 L ( q i ) L(q_i) L(qi)。ESMD 的中点纵坐标为
m i = U ( p i ) + L ( q i ) 2 . m_i=\frac{U(p_i)+L(q_i)}{2}. mi=2U(pi)+L(qi).
对 U U U 和 L L L 在 c i c_i ci 处 Taylor 展开:
U ( c i + h i 2 ) = U ( c i ) + h i 2 U ′ ( c i ) + h i 2 8 U ′ ′ ( c i ) + O ( h i 3 ) , U\left(c_i+\frac{h_i}{2}\right) =U(c_i)+\frac{h_i}{2}U'(c_i)+\frac{h_i^2}{8}U''(c_i)+O(h_i^3), U(ci+2hi)=U(ci)+2hiU′(ci)+8hi2U′′(ci)+O(hi3),
L ( c i − h i 2 ) = L ( c i ) − h i 2 L ′ ( c i ) + h i 2 8 L ′ ′ ( c i ) + O ( h i 3 ) . L\left(c_i-\frac{h_i}{2}\right) =L(c_i)-\frac{h_i}{2}L'(c_i)+\frac{h_i^2}{8}L''(c_i)+O(h_i^3). L(ci−2hi)=L(ci)−2hiL′(ci)+8hi2L′′(ci)+O(hi3).
相加再除以 2 得
m i = U ( c i ) + L ( c i ) 2 + h i 4 ( U ′ ( c i ) − L ′ ( c i ) ) + h i 2 16 ( U ′ ′ ( c i ) + L ′ ′ ( c i ) ) + O ( h i 3 ) . m_i=\frac{U(c_i)+L(c_i)}{2} +\frac{h_i}{4}\left(U'(c_i)-L'(c_i)\right) +\frac{h_i^2}{16}\left(U''(c_i)+L''(c_i)\right)+O(h_i^3). mi=2U(ci)+L(ci)+4hi(U′(ci)−L′(ci))+16hi2(U′′(ci)+L′′(ci))+O(hi3).
如果包络对称成立,即
U ( c i ) + L ( c i ) 2 ≈ 0 , \frac{U(c_i)+L(c_i)}{2}\approx0, 2U(ci)+L(ci)≈0,
并且包络相对于半周期变化缓慢,即 h i ∣ U ′ ∣ h_i|U'| hi∣U′∣、 h i ∣ L ′ ∣ h_i|L'| hi∣L′∣、 h i 2 ∣ U ′ ′ ∣ h_i^2|U''| hi2∣U′′∣、 h i 2 ∣ L ′ ′ ∣ h_i^2|L''| hi2∣L′′∣ 都小,那么
m i ≈ 0. m_i\approx0. mi≈0.
这说明在极值密集、包络慢变时,外包络均值为零会推出中点接近零线。反过来,若奇偶中点曲线的平均接近零,并且中点足够密集,则这些中点内插曲线的平均可近似外包络均值。因此,ESMD II 的奇偶极点对称与 EMD 的包络对称在密集极值情况下近似等价。图17正是这个近似关系的视觉展示。
B. ESMD 筛分算子的线性化视角
严格来说,ESMD 是非线性的,因为极值点位置会随筛分结果改变。但若在某一小范围内假设极值点分组不变、内插算子线性,则可以把中点内插均值看成一个投影样的算子 P p P_p Pp,使得
L ∗ = P p Y . L^*=P_pY. L∗=PpY.
一次筛分为
S Y = Y − P p Y = ( I − P p ) Y . SY=Y-P_pY=(I-P_p)Y. SY=Y−PpY=(I−Pp)Y.
重复 K K K 次筛分,在这个线性化近似下得到
S K Y = ( I − P p ) K Y . S^K Y=(I-P_p)^K Y. SKY=(I−Pp)KY.
若 P p P_p Pp 主要提取局部均值或低频平衡轨迹,那么 I − P p I-P_p I−Pp 类似高通算子。频率较低、能被中点内插曲线捕捉的部分会被反复削弱;频率较高、围绕零线对称的部分会被保留。这个线性化解释说明了筛分为什么能从高频到低频逐层提取 Mode,同时也说明了过筛分风险。若 I − P p I-P_p I−Pp 反复作用于数据,低频调制会不断被削弱,剩下的部分越来越像局部交替的高频振荡。当极值点结构变化时, P p P_p Pp 也随之变化,于是 S K S^K SK 不再是固定线性算子的幂, A max ( K ) A_{\max}(K) Amax(K) 就可能出现图A.6那样的间歇式突变。
C. AGM 最优化与普通最小二乘的关系
普通最小二乘拟合先给定一个函数族
F = { f ( t ; θ ) : θ ∈ Θ } , \mathcal{F}=\{f(t;\theta):\theta\in\Theta\}, F={f(t;θ):θ∈Θ},
再解
θ ∗ = arg min θ ∈ Θ ∑ i = 1 N ( y i − f ( t i ; θ ) ) 2 . \theta^*=\arg\min_{\theta\in\Theta}\sum_{i=1}^{N}\left(y_i-f(t_i;\theta)\right)^2. θ∗=argθ∈Θmini=1∑N(yi−f(ti;θ))2.
ESMD 的 AGM 则不预设显式参数族,而是由分解机制生成候选曲线
R p , m R , ε = { R K : K ∈ K min , K max ∩ Z } . \mathcal{R}_{p,m_R,\varepsilon}=\{R_K:K\inK_{\\min},K_{\\max}\cap\mathbb{Z}\}. Rp,mR,ε={RK:K∈Kmin,Kmax∩Z}.
于是
R ∗ = arg min R ∈ R p , m R , ε ∑ i = 1 N ( y i − R ( t i ) ) 2 . R^*=\arg\min_{R\in\mathcal{R}{p,m_R,\varepsilon}}\sum{i=1}^{N}(y_i-R(t_i))^2. R∗=argR∈Rp,mR,εmini=1∑N(yi−R(ti))2.
两者形式相似,都是在某个函数集合内做最小二乘;差别在于函数集合的来源。普通最小二乘的集合由人为模型给定,ESMD 的集合由极值点、内插规则、筛分停止准则共同生成。这就是作者说 ESMD 的 AGM 优于普通最小二乘和滑动平均的根源:它不是任意平滑,而是受振荡分解结构约束的平滑。
不过,这也带来一个重要偏差---方差权衡。若 m R m_R mR 太小,集合 R \mathcal{R} R 太窄,AGM 偏差大;若 m R m_R mR 太大,集合 R \mathcal{R} R 太宽,AGM 方差小但可能过拟合,把低频 IMF 吞并。设真实低频均值为 g ( t ) g(t) g(t),可以形式化写出
∥ Y − R ∥ 2 2 = ∥ g − R ∥ 2 2 + ∥ η ∥ 2 2 + 2 ⟨ g − R , η ⟩ , \|Y-R\|_2^2=\|g-R\|_2^2+\|\eta\|_2^2+2\langle g-R,\eta\rangle, ∥Y−R∥22=∥g−R∥22+∥η∥22+2⟨g−R,η⟩,
其中 η \eta η 是振荡与噪声部分。若 R R R 过于灵活,它可能拟合 η \eta η 的低频片段,导致 ∥ Y − R ∥ 2 \|Y-R\|_2 ∥Y−R∥2 降低但物理解释变差。因此,原文强调不能只盯着更低的方差比,还要结合 m R m_R mR 和分解结果的可解释性。
D. DI 频率公式的误差项
对调频信号
x ( t ) = A ( t ) cos ϕ ( t ) , ϕ ′ ( t ) > 0 , x(t)=A(t)\cos\phi(t),\qquad \phi'(t)>0, x(t)=A(t)cosϕ(t),ϕ′(t)>0,
假设 A ( t ) A(t) A(t) 变化慢到不显著移动极值位置,则相邻同类型极值近似满足
ϕ ( t i + 1 ) − ϕ ( t i − 1 ) = 2 π . \phi(t_{i+1})-\phi(t_{i-1})=2\pi. ϕ(ti+1)−ϕ(ti−1)=2π.
令
Δ i = t i + 1 − t i − 1 , c i = t i + 1 + t i − 1 2 . \Delta_i=t_{i+1}-t_{i-1}, \qquad c_i=\frac{t_{i+1}+t_{i-1}}{2}. Δi=ti+1−ti−1,ci=2ti+1+ti−1.
Taylor 展开为
2 π = ϕ ′ ( c i ) Δ i + ϕ ( 3 ) ( c i ) 24 Δ i 3 + O ( Δ i 5 ) . 2\pi =\phi'(c_i)\Delta_i+\frac{\phi^{(3)}(c_i)}{24}\Delta_i^3+O(\Delta_i^5). 2π=ϕ′(ci)Δi+24ϕ(3)(ci)Δi3+O(Δi5).
两边除以 Δ i \Delta_i Δi,得到
2 π Δ i = ϕ ′ ( c i ) + ϕ ( 3 ) ( c i ) 24 Δ i 2 + O ( Δ i 4 ) . \frac{2\pi}{\Delta_i} =\phi'(c_i)+\frac{\phi^{(3)}(c_i)}{24}\Delta_i^2+O(\Delta_i^4). Δi2π=ϕ′(ci)+24ϕ(3)(ci)Δi2+O(Δi4).
所以 DI 频率
f i = 1 Δ i f_i=\frac{1}{\Delta_i} fi=Δi1
满足
2 π f i = ϕ ′ ( c i ) + O ( Δ i 2 ) . 2\pi f_i =\phi'(c_i)+O(\Delta_i^2). 2πfi=ϕ′(ci)+O(Δi2).
若相位三阶导较小、局部周期较短,DI 频率是角频率 ϕ ′ ( t ) \phi'(t) ϕ′(t) 的二阶精度近似。这给 DI 方法提供了一个数学理由:它可以看作对局部相位导数的有限差分估计。
若 A ( t ) A(t) A(t) 变化并不慢,极值点位置由
x ′ ( t ) = A ′ ( t ) cos ϕ ( t ) − A ( t ) ϕ ′ ( t ) sin ϕ ( t ) = 0 x'(t)=A'(t)\cos\phi(t)-A(t)\phi'(t)\sin\phi(t)=0 x′(t)=A′(t)cosϕ(t)−A(t)ϕ′(t)sinϕ(t)=0
决定,即
tan ϕ ( t ) = A ′ ( t ) A ( t ) ϕ ′ ( t ) . \tan\phi(t)=\frac{A'(t)}{A(t)\phi'(t)}. tanϕ(t)=A(t)ϕ′(t)A′(t).
当
∣ A ′ ( t ) A ( t ) ϕ ′ ( t ) ∣ ≪ 1 \left|\frac{A'(t)}{A(t)\phi'(t)}\right|\ll1 A(t)ϕ′(t)A′(t) ≪1
时,极值位置只相对理想相位点轻微偏移,DI 仍然有效;若该比值不小,幅值调制本身会显著改变极值位置,瞬时频率估计就会受到影响。这也是作者偏好 ESMD II 而非 ESMD III 的数学原因之一:幅值调制越慢,DI 频率越稳定。
E. 相邻相等极值为什么应赋频率零
设信号在区间 α , β \\alpha,\\beta α,β 上保持常值
x ( t ) = C , t ∈ α , β . x(t)=C,\qquad t\in\\alpha,\\beta. x(t)=C,t∈α,β.
在这个区间内,任意点的局部变化率为
x ′ ( t ) = 0. x'(t)=0. x′(t)=0.
若把频率理解为往返振荡速率,那么平台内部没有往返振荡,应有
f ( t ) = 0 , t ∈ ( α , β ) . f(t)=0, \qquad t\in(\alpha,\beta). f(t)=0,t∈(α,β).
传统零交叉法会在平台段遇到定义困难,因为过零点可能不存在或不唯一;Hilbert 相位也可能在平台附近出现不稳定旋转。DI 方法直接把相邻相等极值对应的频率节点设为零:
( a i , f i ) = ( t i , 0 ) . (a_i,f_i)=(t_i,0). (ai,fi)=(ti,0).
这使图1那样的间歇振荡可以自然纳入 IMF 框架。
F. 总能量公式与局部正交近似
设数据分解为
Y ( t ) − R ( t ) = ∑ j = 1 n M j ( t ) , M j ( t ) = A j ( t ) cos θ j ( t ) . Y(t)-R(t)=\sum_{j=1}^{n}M_j(t), \qquad M_j(t)=A_j(t)\cos\theta_j(t). Y(t)−R(t)=j=1∑nMj(t),Mj(t)=Aj(t)cosθj(t).
局部平方振荡强度为
\\left(Y(t)-R(t)\\right)\^2 = \\sum_{j=1}\^{n} A_j^2(t)\\cos^2\\theta_j(t) * 2\\sum_{j \\lt k} A_j(t)A_k(t)\\cos\\theta_j(t)\\cos\\theta_k(t).
若在一个短时间窗内 A j ( t ) A_j(t) Aj(t) 近似常数,且不同模态相位变化足够分离,则
⟨ cos 2 θ j ( t ) ⟩ ≈ 1 2 , \left\langle \cos^2\theta_j(t)\right\rangle\approx\frac12, ⟨cos2θj(t)⟩≈21,
并且交叉项近似平均为零:
⟨ cos θ j ( t ) cos θ k ( t ) ⟩ ≈ 0 , j ≠ k . \left\langle \cos\theta_j(t)\cos\theta_k(t)\right\rangle\approx0, \qquad j\ne k. ⟨cosθj(t)cosθk(t)⟩≈0,j=k.
于是局部平均平方振荡强度约为
⟨ ( Y ( t ) − R ( t ) ) 2 ⟩ ≈ 1 2 ∑ j = 1 n A j 2 ( t ) . \left\langle \left(Y(t)-R(t)\right)^2\right\rangle \approx\frac12\sum_{j=1}^{n}A_j^2(t). ⟨(Y(t)−R(t))2⟩≈21j=1∑nAj2(t).
这就是原文总能量公式
E ( t ) = 1 2 ∑ j = 1 n A j 2 ( t ) E(t)=\frac12\sum_{j=1}^{n}A_j^2(t) E(t)=21j=1∑nAj2(t)
的数学来源。它是一种基于局部正交、慢变幅值和 IMF 分离假设得到的振荡强度指标。
G. 为什么筛分次数越多不一定越好
若把每次筛分看成从当前信号中扣除局部均值,直觉上筛分越多,均值越小,模态越对称。但这个直觉忽略了极值点集合会变化。记第 K K K 次筛分后的极值集合为
E K = { E i ( K ) } , \mathcal{E}_K=\{E_i^{(K)}\}, EK={Ei(K)},
对应的均值曲线为
L K ∗ = I ( E K ) , L_K^*=\mathcal{I}(\mathcal{E}_K), LK∗=I(EK),
其中 I \mathcal{I} I 表示由极值中点分组内插出的均值曲线。即使 Y ( K + 1 ) = Y ( K ) − L K ∗ Y^{(K+1)}=Y^{(K)}-L_K^* Y(K+1)=Y(K)−LK∗,下一次的极值集合 E K + 1 \mathcal{E}_{K+1} EK+1 也可能与 E K \mathcal{E}_K EK 拓扑不同,例如新增极值、极值合并、边界极值改变。于是
∥ L K + 1 ∗ ∥ ≤ ∥ L K ∗ ∥ \|L_{K+1}^*\|\le\|L_K^*\| ∥LK+1∗∥≤∥LK∗∥
并无一般保证。图A.6中的突跳正来自这种极值结构变化。ESMD 通过方差比和稳定区间来选择 K K K,本质上是认为筛分不是单调优化过程,而是一个非线性、分段不稳定的迭代过程。