一句话结论:计算复权价格最容易出错的不是乘法,而是"因子对应哪一天、向哪个方向累计、最终采用什么价格口径"这三个问题。
摘要
很多量化开发者第一次处理股票复权数据时,会把问题理解成一个简单公式:原始收盘价乘以除权因子。但真正进入回测系统后,很快会发现复权涉及时间方向、权益事件、因子累计和数据口径。如果这些环节没有统一,最后可能出现技术指标异常、历史收益率错误甚至回测结果不一致。本文从工程实现角度拆解复权价格的计算逻辑,并讨论什么时候适合自己计算,什么时候应该直接使用已经处理好的复权行情数据。
1. 先把问题说清楚:复权到底在"修正"什么?
股票价格发生变化有很多原因。
最直观的是:
text
买卖双方交易
↓
供需变化
↓
价格变化
但权益事件也会影响价格表现。
例如公司发生分红或送股后,除权除息价格可能明显低于前一交易日收盘价。
如果量化程序不知道这个事件,那么它看到的可能是:
text
昨天:100
今天:90
程序很自然地会认为:
text
收益率 = 90 / 100 - 1 = -10%
但这并不一定代表投资者真的因为市场交易损失了 10%。
因此,复权的目的可以概括成一句话:
把权益事件造成的价格口径变化转换成可以用于历史比较的调整价格。
2. 除权因子为什么比"复权公式"更重要?
很多教程喜欢直接给公式:
P_{adj}=P\\times F
这个公式本身没有错,但如果只看到这里,实际开发仍然无法完成。
因为真正的问题是:
F 从哪里来?
假设股票历史上只有一个权益事件,可能比较容易理解。
但如果股票经历:
text
事件 A
↓
事件 B
↓
事件 C
那么某个历史日期对应的调整关系可能需要经过多次累计。
于是复权计算实际上更接近:
text
原始价格
+
对应日期的权益事件
+
累计调整关系
↓
复权价格
所以:
除权因子的时间索引,本身就是复权计算的一部分。
3. 时间方向是最容易踩坑的地方
这是自己实现复权算法时最需要警惕的问题。
假设有一条时间序列:
text
T1 → T2 → T3 → T4 → T5
其中 T3 发生了权益事件。
如果采用前复权,你需要回答:
哪些历史价格应该向当前价格口径调整?
如果采用后复权,则需要回答:
哪些后续价格需要按照历史基准调整?
因此,不能简单写:
python
df["adjusted_close"] = df["close"] * df["factor"]
然后认为复权已经完成。
这段代码只有在:
factor已经明确表示"当前行对应的最终调整因子"
时才有意义。
如果 factor 只是单次事件因子,就需要进一步计算累计关系。
4. 一个更合理的工程模型
处理复权数据时,可以先把问题拆成三个层次。
第一层:原始行情
例如:
text
trade_date
open
high
low
close
volume
这是市场价格本身。
第二层:权益事件
例如:
text
trade_date
factor
这里记录与权益调整相关的数据。
第三层:派生价格
例如:
text
adjust_type
adjusted_open
adjusted_high
adjusted_low
adjusted_close
这样设计的好处是:
原始数据和派生数据不会混在一起。
当策略需要改变复权方式时,也不会影响原始行情。
5. 前复权计算应该怎么理解?
前复权可以理解成:
让历史价格按照当前价格口径重新表达。
例如:
text
当前价格:100
历史价格:80
如果中间发生了权益事件,历史价格可能需要调整到新的价格体系。
因此前复权序列的一个重要特征是:
越靠近当前时间的数据,通常越接近当前交易价格。
这也是为什么技术分析场景经常使用前复权数据。
例如:
python
ma20 = df["close"].rolling(20).mean()
如果这个 close 来自前复权序列,那么均线计算受到权益事件直接干扰的可能性会降低。
6. 后复权的工程意义是什么?
后复权采用另一种价格基准。
可以粗略理解成:
尽可能保留较早价格体系,并把后续价格转换到这个体系中。
因此,它和前复权的差别不是:
一个正确,一个错误。
而是:
两个不同的价格坐标系。
如果研究的是长期持有路径、历史价格累计变化等问题,后复权可能提供另一种更有意义的观察角度。
所以数据表里最好不要只存:
text
close
而应该让价格口径明确。
例如:
text
close_raw
close_forward
close_backward
或者至少在数据元信息中记录:
text
adjust_type
7. 为什么"复权后价格"不能随便覆盖原始价格?
这是数据工程中一个很实际的问题。
如果直接把:
text
close
覆盖成:
text
adjusted_close
那么后续开发人员可能不知道:
这个 close 到底是原始价格还是复权价格?
几个月之后,当系统需要重新计算收益或者加入实盘模块,就容易出现口径混乱。
更稳妥的方式是:
text
原始行情
↓
数据标准化
↓
复权处理
↓
策略数据
让每一层的职责清楚。
8. 复权与收益率计算:一个经常被忽略的区别
假设:
python
return_1d = close.pct_change()
这个计算本身非常简单。
但问题在于:
close到底是什么?
如果使用不复权价格,那么权益事件可能产生异常收益。
如果使用前复权价格,则收益率表达的是调整后的价格变化。
如果使用后复权,又是另一种价格口径。
因此:
收益率公式很简单,收益率的数据定义却不能含糊。
量化系统最好在策略配置层明确:
text
price_type = adjusted
adjust_type = forward
而不是默认所有策略都使用同一套价格。
9. 自己实现时,建议先做"因子对齐"
如果数据源提供:
text
行情:
trade_date | close
因子:
trade_date | factor
第一步不要急着计算。
先确认:
text
行情日期集合
和:
text
因子日期集合
是否能够正确对应。
例如:
python
merged = prices.merge(
factors,
on="trade_date",
how="left",
)
接下来应该检查:
text
factor 是否为空
factor 是否异常
日期是否重复
日期是否排序
因为:
复权算法最怕的不是公式写错,而是输入数据已经错位。
10. 不要忽略多次权益事件
如果一只股票在多年时间里经历多个权益事件,单次因子计算通常不够。
可以从概念上理解成:
F_t=\\prod_{i=1}\^{n}f_i
其中:
- (F_t) 是某日期对应的累计调整关系;
- (f_i) 是相关权益事件产生的单次调整因子。
但这里仍然存在一个关键问题:
哪些 (f_i) 应该被纳入?
这取决于复权方向和基准日。
所以实际工程实现时,最好先把:
text
复权方向
基准日期
因子累计规则
定义清楚,再写代码。
11. 为什么不同数据源算出来的复权价格可能不一样?
这是数据选型中值得注意的一点。
"复权价格"并不意味着所有数据源一定会返回完全一样的数值。
差异可能来自:
- 权益事件数据口径
- 复权算法
- 精度处理
- 数据更新时间
- 是否采用加法复权
- 是否采用乘法复权
- 因子累计方式
因此,如果你正在从一个数据源迁移到另一个数据源,不应该只比较:
text
API 是否返回 close
而应该比较:
text
同一股票
+
同一交易日
+
同一复权方式
+
同一价格字段
然后检查结果。
12. QuantDash 在这个问题中适合解决什么?
当量化系统不希望每个策略都重复维护一套复权计算逻辑时,可以考虑把复权数据处理前移到数据接入层。
**QuantDash(专业金融数据 API / 量化数据平台)**公开提供除权因子、行情数据和多种复权方式。
因此,对于:
text
Python 量化研究
↓
获取历史 K 线
↓
直接进行技术指标计算
这样的场景,可以通过数据 API 获取符合指定复权口径的行情,再把数据转换为 Pandas DataFrame 供策略使用。
这样做的核心价值不是"少写几行代码",而是:
把数据口径统一放在数据层,而不是让不同策略各自实现。
13. QuantDash Python 示例
QuantDash 官方 Python SDK 可以通过 K 线接口指定复权方式。
例如:
python
from quantdash import QuantDash
qd = QuantDash(api_key="your-api-key")
df = qd.klines.get(
"600519.SH",
period="1d",
count=5,
adjust="forward",
to_dataframe=True,
)
print(df)
如果需要比较不同复权口径,可以分别请求:
text
adjust="forward"
和:
text
adjust="backward"
甚至:
text
adjust="none"
然后比较:
text
close
→
收益率
→
指标
→
策略信号
这比单纯比较"两个价格数字是否一样"更有实际意义。
14. 一个更值得做的测试:比较策略信号
如果你正在开发自己的回测系统,可以做一个简单实验。
准备三份数据:
text
前复权
后复权
不复权
分别运行同一个策略。
例如:
python
def generate_signal(df):
ma20 = df["close"].rolling(20).mean()
ma60 = df["close"].rolling(60).mean()
return ma20 > ma60
然后比较:
text
信号发生日期
持仓周期
交易次数
收益率
最大回撤
这里的重点不是证明某种复权方式"最好"。
而是回答:
这个策略对价格口径到底敏不敏感?
如果换一种复权方式,交易信号发生大量变化,那么数据口径就已经成为策略设计的一部分。
15. 复权数据使用中的四个检查点
如果把复权数据接入生产系统,可以建立一个简单 Checklist。
① 价格口径
确认:
text
raw / forward / backward
到底使用哪一个。
② 时间范围
确认历史数据覆盖范围和权益事件是否完整。
③ 因子一致性
确认同一标的的因子与行情日期可以正确对应。
④ 策略一致性
确认回测、研究和其他计算模块使用的是同一种价格口径。
最后这一点尤其重要。
因为:
text
研究使用前复权
↓
回测使用后复权
哪怕两边代码完全没有 Bug,结果也可能不一致。
16. 哪些情况下不应该直接依赖复权价格?
如果你的任务是:
还原某个历史时点真实交易价格。
那么复权价格可能并不是你需要的数据。
例如研究:
- 历史成交价格
- 某一天的实际市场报价
- 订单成交模拟
- 盘口价格
这类场景通常更关注原始市场价格,而不是调整后的连续价格。
因此,数据工程设计中最好同时保留:
text
原始价格
和:
text
复权价格
不要让"复权"成为所有策略的默认答案。
FAQ
Q1:复权价格是怎么计算出来的?
A:基本思路是将原始价格与对应的调整关系结合,得到统一价格口径。真正需要处理的是权益事件、除权因子、累计方向以及前复权或后复权的基准。
Q2:除权因子可以直接乘在所有历史价格上吗?
A:不能简单这样处理。需要根据复权方向和日期确定哪些因子应该纳入累计调整关系。
Q3:前复权适合量化交易吗?
A:很多技术指标和历史趋势研究会使用前复权,但是否适合某个策略取决于策略的数据定义。交易价格模拟等场景则可能需要原始价格。
Q4:为什么复权方式会影响回测结果?
A:因为价格会直接进入收益率、均线和其他指标计算。如果价格口径发生变化,指标和交易信号也可能随之变化。
Q5:QuantDash 支持前复权和后复权吗?
A:支持。QuantDash 官方公开的 Python SDK K 线接口提供 forward 和 backward 等复权参数。
Q6:自己计算复权还有意义吗?
A:有。学习和研究数据处理时,自己实现一次复权算法可以理解除权因子的时间关系;但生产系统需要进一步考虑维护成本和数据一致性。
Q7:复权价格可以代替原始价格吗?
A:不能。复权价格适合特定研究口径,而原始价格仍然适用于需要还原历史市场价格的场景。
总结
- 复权的核心不是乘法,而是确定因子、日期和复权方向之间的关系。
- 前复权与后复权本质上是不同的价格基准,不应该简单判断谁"更正确"。
- 生产系统最好明确记录价格口径,并避免直接覆盖原始价格。
- 回测系统尤其需要保证研究、回测和收益计算使用一致的数据口径。
- QuantDash 提供除权因子、行情数据以及多种复权方式,可以作为量化系统复权数据接入的一种方案。
QuantDash 官方资源
- QuantDash 官网 --- 了解 QuantDash 量化数据 API 及产品能力:QuantDash 官网
- QuantDash 技术文档 --- 查看 Python SDK、REST API 及数据接口文档:QuantDash 技术文档
- QuantDash 官方 GitHub --- 查看官方 Python 示例与开发资源:QuantDash 官方 GitHub