一句话结论:不复权看的是"账面价格跳空",前复权看的是"当前真实价下的图形连续性",后复权看的是"从某基准日持有并红利再投的总收益"。三者的差别不在算法高低,而在你问的问题是什么。
一、为什么需要复权
股票不是静态的标价牌。公司每次派现金红利、送股、转增、配股、拆细,交易所会在"除权除息日"把股价机械地往下砍一刀------这不是市场跌了,是公司把一部分价值以现金或股票的形式交还给了你。
举个最直白的例子:
- 某股昨天收盘 110 元,今晚公告"每股派 10 元现金红利";
- 今天除息日开盘,股价直接变成 100 元(110 − 10)。
如果你用"原始价"算收益:110 → 100,账面 −9% 。但真实情况是:你手里股票值 100,口袋里多了 10 元现金,净变动为 0。那 9% 是个 phantom loss(幻觉亏损)。
量化回测里,如果你把这种跳空当成真实的价格波动:
- 动量/反转类信号会被除权日附近的"暴跌"污染;
- 收益曲线系统性低估(A 股长期分红 + 送转频繁,低估幅度可达 20%~40%);
- 量价类指标在除权日出现断崖,因子失真。
复权的本质任务:把"公司行为造成的机械 discontinuity"抹平,让价格/收益序列反映真实的经济价值变化。
二、三种价格口径
1. 不复权(原始价 / Raw)
就是交易所每天真实成交的收盘价。除权除息日的跳空完整保留。
- ✅ 这是"真实可成交"的价格;
- ❌ 单独用它算长期收益,会系统性低估(它完全忽略了分红和送股)。
2. 前复权(Forward-adjusted)
锚定在"最新一天":最新价 = 真实成交价,历史价格被等比缩放,使整条曲线连续。
- ✅ 最新价是真的 → 画图、技术图形、和当前盘面完全一致;
- ✅ 曲线连续,没有假跳空;
- ⚠️ 历史价格不是真实成交价(被缩放过),且随着新分红发生,历史前复权价会缓慢漂移(因为锚点始终是"现在")。
3. 后复权(Backward-adjusted)
锚定在"基准日"(通常是上市首日或数据起点):基准日价格 = 真实价,之后所有价格按累计红利再投向上放大。
- ✅ 直接反映"从基准日持有至今、红利全部再投入"的总收益;
- ✅ 收益归因、绩效对比的"标准答案";
- ⚠️ 最新价不是真实成交价(被放大了),不能直接拿去下单。
一个算给你看的数字例子
假设一只股票:期初 100 元买入,中途两次每股派 10 元。
| 时点 | 不复权收盘 | 后复权收盘 | 前复权收盘 |
|---|---|---|---|
| 基准日(买) | 100 | 100 | 83.33 |
| 除息前一日 | 110 | 110 | 91.67 |
| 除息当日 | 100 | 110 | 91.67 |
| 二次除息前 | 120 | 132 | 110 |
| 二次除息当日 | 110 | 132 | 110 |
核对收益(红利再投口径):
- 持有 1 股,100 元起步;第一次除息得 10 元,按 100 元再买入 → 1.1 股;第二次除息得 11 元,按 110 元再买入 → 1.2 股;期末 1.2 股 × 110 = 132 元。
- 总收益 = 32%。
看到关键点了吗:
- 不复权 算出来是 110/100 − 1 = 10%(严重低估,漏了两次分红);
- 后复权 :132/100 − 1 = 32%(基准真实,命中);
- 前复权 :110/83.33 − 1 = 32%(最新价真实,长期收益也命中)。
核心认知:前复权和后复权在"累计总收益"上是一致的(都内含红利再投),区别只是锚点不同------前复权把"真实"放在尾巴,后复权把"真实"放在开头。不复权则两者都不沾,单独用必错。
三、复权是怎么算的(复权因子法)
一切归到一个量:复权比例 q,表示"穿越一次公司行为时,价格被压缩的比例"。
- 现金分红:
q = 除权日价 / 除权前收盘价 = (P前 − D) / P前 - 1 拆 n(每股变 n 股):
q = 1 / n - 送股同理按送转比例并入。
有了逐日 q,复权价就是"原始价 × 累计复权因子":
python
import pandas as pd
import numpy as np
def add_adjusted_prices(df, price_col='close',
prev_close_col='prev_close', ex_close_col='ex_close'):
"""
df 需按日期升序,含:
- close 不复权收盘价
- prev_close 除权前一日收盘(仅事件日有值)
- ex_close 除权日价格(仅事件日有值)
返回带 hf_close(后复权) / qf_close(前复权) 的 DataFrame。
"""
df = df.sort_values('date').reset_index(drop=True)
n = len(df)
# 1) 逐日复权比例 q:事件日 = ex/prev,其余 = 1
q = np.ones(n)
mask = df[prev_close_col].notna() & df[ex_close_col].notna()
q[mask.values] = (df.loc[mask, ex_close_col]
/ df.loc[mask, prev_close_col]).values
# 2) 后复权因子:首日为 1,向后按 1/q 累积放大
hf = np.ones(n)
for i in range(1, n):
hf[i] = hf[i - 1] * (1.0 / q[i])
# 3) 前复权因子:以后复权因子归一化到末日=1(末日即真实价)
qf = hf / hf[-1]
df['hf_factor'] = hf
df['qf_factor'] = qf
df['hf_close'] = df[price_col] * hf # 后复权价
df['qf_close'] = df[price_col] * qf # 前复权价
return df
实战提醒:上面是教学版 。真实市场还有配股(有认购价)、增发、可转债转股、吸收合并等复杂事件,手工因子极易算错。生产环境一律优先使用数据商(交易所/券商/Wind/通联/聚源等)提供的官方复权因子,只把它们当校验参考。
另外别忘了一件常被忽略的事:成交量也要复权。拆细后每股成交量会断崖,跨期比较时要按拆细比例反向缩放成交量,否则所有量价指标在除权日当场失效。
四、场景化选择:到底该用哪种数据
记住总原则:回测和画图用复权价,下单和算分红用不复权,绩效归因用后复权。
| 场景 | 推荐数据 | 原因 |
|---|---|---|
| 策略回测(信号 + 收益) | 前复权 或 后复权(二选一、全程一致) | 需要连续序列,避免虚假跳空 |
| 技术指标 / K 线画图 | 前复权 | 末日是真实价,图形与盘面一致 |
| 收益 / 绩效归因 | 后复权 | 反映红利再投总收益,基准清晰 |
| 实盘下单 / 成交仿真 | 不复权 | 真实可成交价,手续费与滑点算得准 |
| 除权除息事件研究 | 不复权 + 后复权 对照 | 一边看真实跳空,一边算真实总收益 |
| 横截面因子 / 选股 | 前复权收盘价(统一口径) | 跨标的可比,且贴近当前价 |
| 股息率 / 分红收益率 | 不复权 | 分红金额与股价都是真实值 |
| 指数 / 基准对比 | 后复权(或官方全收益指数) | 与全收益指数对标才公平 |
最容易踩的反模式:回测用前复权、下单用不复权 → 价格口径不一致,回测里的"成交价"根本成交不了,滑点和真实成交价全错位。
五、六个常见坑
- 混用口径:同一回测里前复权和不复权掺着用,收益失真、信号错位。
- 用不复权算长期收益:A 股分红 + 高送转环境下,低估 20%~40% 是常态。
- 回测用前复权、实盘用不复权:价格基准对不上,成交价与滑点全错。
- 量没复权:拆细后成交量断崖,量价指标直接失效。
- 复权因子来源不一:不同数据源的因子定义不同,跨源拼接的回测不可比。
- 生存偏差(survivorship bias):只留上市至今的票、丢了退市股,前视偏差会美化一切策略。
六、落地清单(直接照做)
- 回测统一用一种复权价,写进代码常量,禁止混用;
- 成交仿真和实盘信号分离:信号用复权价生成,成交价用不复权;
- 绩效报告用后复权(或全收益指数)对外披露;
- 成交量单独做复权处理;
- 优先调用数据商官方复权因子,自己只做校验;
- 数据入库时同时存"不复权 + 复权因子",用的时候再现场换算,避免锚点漂移污染历史。
结语
复权不是一个"高深模型",而是一个口径纪律问题。它考验的不是你算得准不准,而是你清不清楚"自己到底在问什么问题"------是问图形连不连续、当前能不能成交、还是问长期总收益。把这三种问题对应的数据分清楚,你的回测报告就先赢了一半。
⚠️ 免责声明:本文为技术科普,所有示例均为示意数据,不构成任何投资建议。复权因子与历史事件处理请以你所使用数据商的官方口径为准。