Pesaran–Timmermann 检验:方向预测是否增加了信息?
了解 Pesaran–Timmermann 检验如何将方向命中率与根据实际上涨比例和预测上涨比例计算的基准进行比较,以及序列依赖为何会改变统计推断。
本指南内容64%的命中率是否有用,取决于基准
简短摘要
Pesaran–Timmermann(PT)检验关注的是:预测是否包含结果变动方向的信息。对于二元的上涨/下跌预测,它会将观测到的方向命中率与由实际上涨比例和预测上涨比例分别推导出的符合率进行比较。这个基准不一定是 50%。常见的检验还依赖于预测时点之间的相关性假设;统计显著性本身并不能证明某项交易规则有盈利能力。
64%的命中率是否有用,取决于基准
假设市场在评估样本的 60% 日期上涨。预测者在其中 70% 的日期判断“上涨”。即使预测和结果毫无关联,两组方向也会经常一致:有些日期两者都指向上涨,另一些日期则都指向下跌。机械地把命中率与 50% 比较,会忽略这种不平衡。
PT 框架明确了这种比较。它检验预测方向与实际方向的吻合频率,是否高于两者各自边际频率在独立假设下所能解释的水平。这是对方向预测信息的检验,不是对收益幅度、交易时点或整体策略价值的评分。Pesaran 和 Timmermann 提出了基于列联表的预测表现检验;在二元 2×2 情形下,他们的检验与独立性检验渐近等价 {source:pesaranTimmermannDirectionalTests1992}。
将每组匹配的预测和结果放进 2×2 表格
如果实际结果被归类为上涨,则令 \(Y_t=1\);如果归类为下跌,则令 \(Y_t=0\)。如果预测指向上涨,则令 \(Z_t=1\);如果预测指向下跌,则令 \(Z_t=0\)。评估中的每一行都应把 \(t\) 时点生成的预测,与该预测所针对期限内的实际结果配对。
四个单元格分别统计上涨/上涨、上涨/下跌、下跌/上涨和下跌/下跌。若 \(n_{11}\) 和 \(n_{00}\) 是两个一致单元格,而 \(n\) 是可用的匹配对数,则观测到的方向命中率为
\[ \widehat{P}=\frac{n_{11}+n_{00}}{n}. \]
这个设定只有两个类别。应预先决定如何处理零收益、零预测或中性区间。例如,研究可以把收益率小于或等于零归为“非上涨”,也可以把预测小于或等于其阈值归为“非上涨”。排除平局也是一种可行规则,但它会改变样本,且必须一致执行。使用二分类基准公式时,不要把零对零计作第三种一致情形。
预测起点和目标期限也必须匹配。如果 \(Z_t\) 预测接下来五个交易日收益率的符号,那么 \(Y_t\) 应标记同一起点后的这五日收益,而不是次日的一日收益,否则表格会把不同事件配在一起。每天生成的预测即使对应相互重叠的五日目标,也可以纳入描述性表格,但会产生下文讨论的依赖问题。
根据两种上涨比例推导独立基准
令 \(\hat p_y\) 表示实际结果被归类为上涨的样本比例,\(\hat p_z\) 表示预测为上涨的样本比例。如果实际标签与预测标签相互独立,预期的一致比例为
\[ \widehat{P}^{*}=\hat p_y\hat p_z+(1-\hat p_y)(1-\hat p_z). \]
第一个乘积是在独立情况下上涨/上涨的一致概率;第二个乘积是下跌/下跌的一致概率。因此,基准随两个边际比例变化,可能高于或低于 50%。始终预测更常见方向的模型,即使没有增加信息,也可能显得命中率不低。
一个极端情况可以说明这一点。如果分类器在每个日期都预测“上涨”,那么 \(\hat p_z=1\),观测命中率就是实际上涨比例 \(\hat p_y\),独立基准也同样等于 \(\hat p_y\)。超额一致率按定义为零。这种常量预测在上涨较常见时看起来可能很准确,却无法区分哪些日期会真正上涨;其估计方差也可能退化,以至于常规 PT p 值不存在。
考虑 100 个假设的匹配日期。实际结果有 60 天上涨,预测有 70 天看涨。列联表如下:
| 实际方向 | 预测上涨 | 预测下跌 | 合计 |
|---|---|---|---|
| 上涨 | 47 | 13 | 60 |
| 下跌 | 23 | 17 | 40 |
| 合计 | 70 | 30 | 100 |
共有 64 组一致,因此 \(\widehat P=0.64\)。独立基准为 \(0.60\times0.70+0.40\times0.30=0.54\)。观测命中率比基准高 10 个百分点。这些虚构数据仅用于演示计算;差值本身不是有效的不确定性估计,也不能证明交易有效。
用估计的不确定性对命中率差值进行标准化
对标准二元 PT 统计量,定义
\[ \widehat v=\frac{\widehat P^{*}(1-\widehat P^{*})}{n} \]
以及
\[ \widehat w=\frac{(2\hat p_y-1)^2\hat p_z(1-\hat p_z)+(2\hat p_z-1)^2\hat p_y(1-\hat p_y)}{n}. \]
则
\[ PT=\frac{\widehat P-\widehat P^{*}}{\sqrt{\widehat v-\widehat w}}. \]
在零假设和常见的大样本假设下,该统计量渐近服从标准正态参考分布。分子表示超出独立基准的额外一致率;分母则考虑了基准是用同一组样本估计的,而不是固定为 50%。statsmodels 的实现文档列出了该公式和记号 {source:statsmodelsPesaranTimmermannAPI}。
上式是 statsmodels 文档记载的主要渐近方差形式。原始研究中更完整的有限样本 delta 方差会在 \(\widehat w\) 上加上 \(4\hat p_y\hat p_z(1-\hat p_y)(1-\hat p_z)/n^2\)。这个低阶项不会改变一阶渐近结果,但可能使有限样本统计量有所变化。如果结果取决于具体实现,应说明所用公式和软件版本,不要假设各软件包的有限样本计算完全相同后再直接比较 p 值。
公式无法弥补薄弱的研究设计。样本很小、预测几乎恒定、单元格为空,或估计方差为零/无效时,常见近似可能不可靠或无法定义。在这种情况下,不要强行从公式中得出 p 值;应报告边际比例和列联表,并选择适合数据结构与样本量的推断方法。
对上面的假设表格,主要公式的分量为 \(\widehat v=0.54(0.46)/100=0.002484\),以及 \(\widehat w=[0.2^2(0.7)(0.3)+0.4^2(0.6)(0.4)]/100=0.000468\)。标准误为 \(\sqrt{0.002484-0.000468}\approx0.0449\),因此 \(PT\approx0.10/0.0449=2.23\)。按双侧标准正态分布计算,p 值约为 0.026。这是将主要渐近公式应用于虚构数据的计算;更完整的有限样本项会让数值略有变化,而序列依赖也可能使正态参考分布失效。不要把它作为实证结果呈现。

将拒绝零假设视为方向证据,而不是交易结论
分子为正,表示方向一致的频率高于独立基准;分子为负,则表示低于基准。预先指定的单侧检验可以检验一致率是否高于基准;双侧检验则检验方向关联是否在任一方向上有所不同。备择假设和显著性水平都应在查看结果前确定。
在检验假设成立的条件下,较小的 p 值说明数据与指定零假设较不相符。它不是零假设为真的概率,也不是预测下期有效的概率。它不能说明收益是否足以覆盖买卖价差、费用、市场冲击、资金费率或借贷成本;也不会校正尝试多个资产、期限、阈值、模型变体或预测符号后只报告赢家所造成的问题。如果曾搜索候选策略,[White Reality Check 指南](/zh-CN/learn/white-reality-check-data-snooping-strategy-backtest-explained)解释了为什么推断要反映这种选择过程。
反过来,未能拒绝零假设并不能证明方向彼此独立。短样本或类别不平衡的样本,可能没有足够检验力来发现关联。PT 统计量为负也不意味着预测完全没有结构;它可能表示系统性的方向不一致。看到这一结果后再反转预测符号,就是一次新的模型选择,需要在新数据上评估,或纳入最初的搜索程序。
应一起报告实际上涨比例、预测上涨比例、观测命中率、独立基准、百分点差值、备择假设和不确定性估计方法。若只给 p 值而没有列联表的边际合计和效应大小,就很难判断这是幅度小但估计精确的提升,还是幅度较大但噪声也更高的提升。
序列依赖会误导教科书式参考分布
常规 PT 统计量通常是在方向观测序列独立的假设下介绍的。但金融标签可能连续成段出现。每日观测可能共享相互重叠的多日目标;波动率状态可能持续;滚动预测也可能重复使用大部分相同的估计数据。这时,\(n\) 组匹配对并不等于 \(n\) 份独立信息。常规标准误可能过小,从而导致过于频繁地拒绝零假设。
Pesaran 和 Timmermann 后来使用动态扩展回归和有限阶 Markov 框架,提出了针对序列相关多类别变量依赖性的检验 {source:pesaranTimmermannSerialCategories2009}。专门研究方向预测的工作也发现,存在序列相关时,传统的独立性 PT 程序可能过度拒绝,并研究了包括 bootstrap 在内的依赖稳健替代方法 {source:blaskowitzHerwartzDirectionalSerialCorrelation2014}。适用方法取决于预测生成方式、预测期限和依赖结构;通用的重抽样方案不会自动有效。
请说明预测起点是否重叠、间隔多长,以及用哪种依赖处理方法估计不确定性。如果把教科书统计量作为描述性基准,请标明独立性假设。当设计违反这一假设时,不要把名义上 5% 的结果解释为实际错误拒绝率也是 5%。
基于当时确实可以生成的预测构建评估
对于每个预测起点,都应保留当时实际可获得的预测、预测期限、信息截止时点、实际结果,以及将两者转换为上涨/下跌标签的规则。在制表前对齐时间戳、交易品种、价格或收益定义和缺失值处理方式。使用修订后的宏观数据或根据评估期调过的信号所生成的预测,不能算作未经调整的样本外预测。
在查看留出结果前选定分类阈值。如果模型输出概率,阈值会把概率转换为二元方向;在同一份样本中搜索阈值会改变问题并产生选择偏差。明确区分训练集、验证集和最终评估集;如果重抽样意在考虑模型搜索,则每次都要重新运行完整的选择流程。
PT 关注的问题不同于比较预测误差幅度。[Diebold–Mariano 指南](/zh-CN/learn/diebold-mariano-forecast-accuracy-test-explained)比较成对的损失差异;[Giacomini–White 指南](/zh-CN/learn/giacomini-white-conditional-predictive-ability-test-explained)则检验相对预测能力是否随预先指定的信息而变化。对于嵌套预测模型,请参阅 [Clark–West 调整指南](/zh-CN/learn/clark-west-test-nested-forecast-accuracy-adjustment-explained)。这些检验回答不同问题,不应仅仅因为它们返回熟悉的统计量就互相替代。
方向显著性不能证明策略有盈利能力
PT 检验把每个结果压缩为一个方向标签。上涨一个 tick 和大幅上涨都算上涨;小幅预测失误和严重亏损也都只算一次方向错误。因此,如果错误交易的亏损大于正确交易的盈利、信号晚于价格变动,或交易成本吞噬优势,即使命中率提高,策略仍可能亏损。
例如,假设有 100 笔规模相同的虚构交易,其中 64 笔方向预测正确、平均每笔盈利 0.10%,另有 36 笔预测错误、平均每笔亏损 0.25%。忽略复利和成本后,简单的毛收益合计为 \(64(0.10\%)-36(0.25\%)=-2.6\) 个百分点,尽管命中率达到 64%。这个刻意简化的计算忽略复利,也不是市场证据;它说明单靠命中率无法决定期望收益。
评估交易时,应在计算收益前明确入场和退出时点、头寸规模、风险限额及未成交订单的处理方式。适用时计入买卖价差、佣金、滑点、市场冲击、融资和交易平台特有成本。在样本外将净收益与适当基准比较,并考虑产生该规则的多重尝试搜索过程。PT 结果可以作为方向关联的部分证据,但不能替代可执行且考虑成本的评估。
常见问题
Q1Pesaran–Timmermann 检验会把准确率与 50% 比较吗?
不会。它将观测一致率与根据实际上涨比例和预测上涨比例分别计算的独立基准比较。这个基准可能高于或低于 50%。
Q2预测期限重叠时,可以使用常规 PT p 值吗?
如果不处理依赖性,就不应直接使用。目标重叠和持续性标签可能使基于独立假设的常规不确定性估计偏小。应选用假设适合预测期限和依赖结构的方法。
Q3PT 结果显著是否意味着交易策略有盈利?
不意味着。该检验只使用方向标签,不衡量变动幅度、入场和退出价格、头寸规模、费用、滑点或资金费率。样本外净收益需要单独评估。
资料来源与延伸阅读
报告问题
我们会准备一封包含本文链接的邮件。发送后,Mark 才会收到你的反馈
快速检查
读完指南后,用 3 道题检查一下
问题 01
如果实际结果有 60% 的时间上涨,而预测有 70% 的时间看涨,独立假设下的一致率基准是多少?
选择答案即可查看解释
期权术语表
清楚解释从看涨、看跌和期权链到 IV、希腊字母、未平仓量与最大痛点等核心期权术语
浏览期权术语表