仅凭“用历史数据验证新策略”这一提法,无法推出某个策略是否靠谱,也无法推出是否应当据此采取任何交易动作。历史回测能回答的是“在设定的数据和规则下,这套逻辑过去会得到什么结果”,它既不能证明未来会重复,也不能替代对策略逻辑本身、数据质量和执行条件的核查。要判断可信度,缺少的关键信息至少包括:回测所用的数据来源与复权处理、样本区间覆盖了哪些市场状态、策略规则是否在看过数据之后被反复调整、以及回测是否计入了交易成本和可成交性。
回测到底在验证什么
回测是把一套明确的买卖规则,放到历史行情或历史财务数据上重演,得到一个模拟的收益与风险序列。它验证的对象是“规则在历史样本上的表现”,而不是“规则背后的经济逻辑是否成立”。
这两者容易混淆。一个策略在历史上赚钱,可能来自真实的定价规律,也可能来自数据本身的缺陷、样本期的特殊性,或者规则被反复拟合到这段历史上。因此,回测结果只能作为一条证据,需要和策略逻辑、数据质量、执行假设一起看。
判断时需要区分几类信息:
- 策略逻辑:赚的是什么钱,为什么这个来源可能持续存在,是否有可解释的经济或行为基础。
- 数据质量:是否使用复权价格、是否包含已退市或已更名的标的、财务数据是否存在未来函数(即用了当时还拿不到的信息)。
- 执行假设:成交价用的是收盘价、开盘价还是均价,是否假设了无法实现的成交,是否计入手续费、印花税、冲击成本。
- 样本外表现:规则确定之后,在未参与规则设计的数据上表现如何。
可能并存的原因与需要核对的公开事实
同一个“回测很漂亮”的结果,背后可能有多重原因,它们并不互斥。
原因一:策略逻辑确实捕捉到了某种可重复的规律。 需要核对的公开信息包括:策略依赖的指标或财务科目是否有明确定义,数据来源是否为交易所行情、上市公司定期报告等可追溯渠道,以及该规律在逻辑上是否有合理来源。
原因二:样本区间恰好有利于该策略。 不同市场阶段(单边上涨、震荡、快速下跌)对策略的影响差异很大。需要核对的是回测区间覆盖了哪些阶段,以及策略在各类阶段中的表现是否被单独拆开看,而不是只看一个合并后的总收益。
原因三:过拟合。 参数越多、调整越细,越容易贴合历史噪声。需要核对的是:参数是在多少组候选里挑出来的,规则在确定之后是否还根据回测结果反复修改,以及是否存在样本外测试。
原因四:数据或执行假设偏乐观。 例如使用了事后才公布的数据、忽略了停牌与涨跌停导致的无法成交、未计入交易成本。需要核对的是数据字段的公布时点、成交假设的具体规则,以及成本参数的设定依据。
原因五:幸存者偏差。 如果标的池只包含当前仍在交易的品种,历史上退市或消失的样本被剔除,结果会被系统性抬高。需要核对的是标的池的构建方式是否包含已退市样本。
这些原因可以通过公开信息部分区分:数据来源与字段定义可查证;样本区间与市场阶段可对照指数走势划分;参数选择过程属于策略设计记录,需要策略提供方说明;成本与成交假设需要看回测说明文档。
评估指标与结论的适用边界
只看累计收益或年化收益,无法区分“赚得多”和“承担了多大风险才赚到”。风险调整后的指标(例如把收益与波动或回撤联系起来看的比率类指标)能提供另一维度,但同样依赖样本期和计算口径,不同口径之间不可直接比较。
需要留意的边界包括:
- 回测与实盘的差距:即使规则相同,实盘还会受到流动性、成交时点、资金规模、心理执行偏差的影响。回测未计入的部分,正是差距的常见来源。
- 指标的口径:最大回撤、波动率、胜率等指标对区间起点和终点敏感,换一段区间可能得到不同结论。
- 样本长度与阶段覆盖:样本过短或只覆盖单一市场状态时,结论的适用范围相应收窄。
- 规则稳定性:如果规则在样本外需要不断调整才能维持表现,说明其稳健性存疑。
因此,历史回测的合理定位是“排除明显不成立的策略”和“暴露策略对哪些条件敏感”,而不是“确认策略未来有效”。任何据此做出的交易决策,都涉及回测无法覆盖的风险,决策权仍在读者自身。
常见问题
回测收益高就说明策略靠谱吗?
不能。高收益可能来自样本期有利、过拟合、数据缺陷或未计入成本,需要结合策略逻辑、样本外表现和执行假设一起判断。单看收益数字无法区分这些来源。
为什么要看风险调整后的指标?
因为同样的收益可能对应完全不同的波动和回撤路径。风险调整类指标把收益与承担的风险联系起来,但它对样本区间和计算口径同样敏感,需要和其他证据交叉核对。
回测和实盘表现不一致,通常要核对什么?
可以核对成交假设是否可实现、是否计入交易成本与冲击成本、标的池是否含幸存者偏差,以及实盘执行时点与回测设定是否一致。这些是差距的常见来源,但具体原因需要逐项对照原始记录。