量化交易中的数据复权:概念、原理与场景化选择

一句话结论:不复权看的是"账面价格跳空",前复权看的是"当前真实价下的图形连续性",后复权看的是"从某基准日持有并红利再投的总收益"。三者的差别不在算法高低,而在你问的问题是什么。


一、为什么需要复权

股票不是静态的标价牌。公司每次派现金红利、送股、转增、配股、拆细,交易所会在"除权除息日"把股价机械地往下砍一刀------这不是市场跌了,是公司把一部分价值以现金或股票的形式交还给了你。

举个最直白的例子:

  • 某股昨天收盘 110 元,今晚公告"每股派 10 元现金红利";
  • 今天除息日开盘,股价直接变成 100 元(110 − 10)。

如果你用"原始价"算收益:110 → 100,账面 −9% 。但真实情况是:你手里股票值 100,口袋里多了 10 元现金,净变动为 0。那 9% 是个 phantom loss(幻觉亏损)。

量化回测里,如果你把这种跳空当成真实的价格波动:

  • 动量/反转类信号会被除权日附近的"暴跌"污染;
  • 收益曲线系统性低估(A 股长期分红 + 送转频繁,低估幅度可达 20%~40%);
  • 量价类指标在除权日出现断崖,因子失真。

复权的本质任务:把"公司行为造成的机械 discontinuity"抹平,让价格/收益序列反映真实的经济价值变化。


二、三种价格口径

1. 不复权(原始价 / Raw)

就是交易所每天真实成交的收盘价。除权除息日的跳空完整保留

  • ✅ 这是"真实可成交"的价格;
  • ❌ 单独用它算长期收益,会系统性低估(它完全忽略了分红和送股)。

2. 前复权(Forward-adjusted)

锚定在"最新一天":最新价 = 真实成交价,历史价格被等比缩放,使整条曲线连续。

  • ✅ 最新价是真的 → 画图、技术图形、和当前盘面完全一致;
  • ✅ 曲线连续,没有假跳空;
  • ⚠️ 历史价格不是真实成交价(被缩放过),且随着新分红发生,历史前复权价会缓慢漂移(因为锚点始终是"现在")。

3. 后复权(Backward-adjusted)

锚定在"基准日"(通常是上市首日或数据起点):基准日价格 = 真实价,之后所有价格按累计红利再投向上放大。

  • ✅ 直接反映"从基准日持有至今、红利全部再投入"的总收益
  • ✅ 收益归因、绩效对比的"标准答案";
  • ⚠️ 最新价不是真实成交价(被放大了),不能直接拿去下单。

一个算给你看的数字例子

假设一只股票:期初 100 元买入,中途两次每股派 10 元。

时点 不复权收盘 后复权收盘 前复权收盘
基准日(买) 100 100 83.33
除息前一日 110 110 91.67
除息当日 100 110 91.67
二次除息前 120 132 110
二次除息当日 110 132 110

核对收益(红利再投口径):

  • 持有 1 股,100 元起步;第一次除息得 10 元,按 100 元再买入 → 1.1 股;第二次除息得 11 元,按 110 元再买入 → 1.2 股;期末 1.2 股 × 110 = 132 元
  • 总收益 = 32%

看到关键点了吗:

  • 不复权 算出来是 110/100 − 1 = 10%(严重低估,漏了两次分红);
  • 后复权 :132/100 − 1 = 32%(基准真实,命中);
  • 前复权 :110/83.33 − 1 = 32%(最新价真实,长期收益也命中)。

核心认知:前复权和后复权在"累计总收益"上是一致的(都内含红利再投),区别只是锚点不同------前复权把"真实"放在尾巴,后复权把"真实"放在开头。不复权则两者都不沾,单独用必错。


三、复权是怎么算的(复权因子法)

一切归到一个量:复权比例 q,表示"穿越一次公司行为时,价格被压缩的比例"。

  • 现金分红:q = 除权日价 / 除权前收盘价 = (P前 − D) / P前
  • 1 拆 n(每股变 n 股):q = 1 / n
  • 送股同理按送转比例并入。

有了逐日 q,复权价就是"原始价 × 累计复权因子":

python 复制代码
import pandas as pd
import numpy as np

def add_adjusted_prices(df, price_col='close',
                        prev_close_col='prev_close', ex_close_col='ex_close'):
    """
    df 需按日期升序,含:
      - close          不复权收盘价
      - prev_close     除权前一日收盘(仅事件日有值)
      - ex_close       除权日价格(仅事件日有值)
    返回带 hf_close(后复权) / qf_close(前复权) 的 DataFrame。
    """
    df = df.sort_values('date').reset_index(drop=True)
    n = len(df)

    # 1) 逐日复权比例 q:事件日 = ex/prev,其余 = 1
    q = np.ones(n)
    mask = df[prev_close_col].notna() & df[ex_close_col].notna()
    q[mask.values] = (df.loc[mask, ex_close_col]
                       / df.loc[mask, prev_close_col]).values

    # 2) 后复权因子:首日为 1,向后按 1/q 累积放大
    hf = np.ones(n)
    for i in range(1, n):
        hf[i] = hf[i - 1] * (1.0 / q[i])

    # 3) 前复权因子:以后复权因子归一化到末日=1(末日即真实价)
    qf = hf / hf[-1]

    df['hf_factor'] = hf
    df['qf_factor'] = qf
    df['hf_close'] = df[price_col] * hf        # 后复权价
    df['qf_close'] = df[price_col] * qf        # 前复权价
    return df

实战提醒:上面是教学版 。真实市场还有配股(有认购价)、增发、可转债转股、吸收合并等复杂事件,手工因子极易算错。生产环境一律优先使用数据商(交易所/券商/Wind/通联/聚源等)提供的官方复权因子,只把它们当校验参考。

另外别忘了一件常被忽略的事:成交量也要复权。拆细后每股成交量会断崖,跨期比较时要按拆细比例反向缩放成交量,否则所有量价指标在除权日当场失效。


四、场景化选择:到底该用哪种数据

记住总原则:回测和画图用复权价,下单和算分红用不复权,绩效归因用后复权。

场景 推荐数据 原因
策略回测(信号 + 收益) 前复权 后复权(二选一、全程一致) 需要连续序列,避免虚假跳空
技术指标 / K 线画图 前复权 末日是真实价,图形与盘面一致
收益 / 绩效归因 后复权 反映红利再投总收益,基准清晰
实盘下单 / 成交仿真 不复权 真实可成交价,手续费与滑点算得准
除权除息事件研究 不复权 + 后复权 对照 一边看真实跳空,一边算真实总收益
横截面因子 / 选股 前复权收盘价(统一口径) 跨标的可比,且贴近当前价
股息率 / 分红收益率 不复权 分红金额与股价都是真实值
指数 / 基准对比 后复权(或官方全收益指数) 与全收益指数对标才公平

最容易踩的反模式:回测用前复权、下单用不复权 → 价格口径不一致,回测里的"成交价"根本成交不了,滑点和真实成交价全错位。


五、六个常见坑

  1. 混用口径:同一回测里前复权和不复权掺着用,收益失真、信号错位。
  2. 用不复权算长期收益:A 股分红 + 高送转环境下,低估 20%~40% 是常态。
  3. 回测用前复权、实盘用不复权:价格基准对不上,成交价与滑点全错。
  4. 量没复权:拆细后成交量断崖,量价指标直接失效。
  5. 复权因子来源不一:不同数据源的因子定义不同,跨源拼接的回测不可比。
  6. 生存偏差(survivorship bias):只留上市至今的票、丢了退市股,前视偏差会美化一切策略。

六、落地清单(直接照做)

  • 回测统一用一种复权价,写进代码常量,禁止混用;
  • 成交仿真和实盘信号分离:信号用复权价生成,成交价用不复权;
  • 绩效报告用后复权(或全收益指数)对外披露;
  • 成交量单独做复权处理;
  • 优先调用数据商官方复权因子,自己只做校验;
  • 数据入库时同时存"不复权 + 复权因子",用的时候再现场换算,避免锚点漂移污染历史。

结语

复权不是一个"高深模型",而是一个口径纪律问题。它考验的不是你算得准不准,而是你清不清楚"自己到底在问什么问题"------是问图形连不连续、当前能不能成交、还是问长期总收益。把这三种问题对应的数据分清楚,你的回测报告就先赢了一半。

⚠️ 免责声明:本文为技术科普,所有示例均为示意数据,不构成任何投资建议。复权因子与历史事件处理请以你所使用数据商的官方口径为准。

相关推荐
Thom5803 天前
【PTrade】PTrade如何进行盘后固定价委托?after_trading_order()完整教程
ai·量化交易·ptrade·量化编程
benchmark_cc15 天前
Python 量化核心基础:前复权、后复权与不复权有什么区别?基于 QuantDash 的数据处理与回测避坑指南
开发语言·python·pandas·量化策略·量化交易·quantdash
benchmark_cc16 天前
用 Streamlit + QuantDash 10分钟拼装一个跨市场持仓风险与相关性诊断面板
开发语言·python·pandas·量化策略·量化交易·quantdash
benchmark_cc17 天前
如何用 Python + QuantDash 快速构建高胜率“配对交易(Pairs Trading)”策略?
开发语言·人工智能·python·pandas·量化交易·quantdash
郭泽斌之心20 天前
让别人临时接管你的 AI 助手:分级授权的远程控制怎么设计
人工智能·深度学习·量化交易·ea·mt5·fay数字人·easydeal
code 旭1 个月前
不会编程也能做AI 量化交易工具:基于 MCP 协议的自然语言交易思路不会编程也能做AI 量化交易工具:基于 MCP 协议的自然语言交易思路
人工智能·ai·量化交易·mcp
x861 个月前
程序员量化交易实战 35:生成运维检查清单
量化交易
wayz112 个月前
Overlap:HWMA(Holt-Winter移动平均线)技术指标详解
算法·金融·数据分析·量化交易·特征工程