检验时间序列自相关的 Ljung–Box 检验
了解 Ljung–Box Q 统计量如何组合残差自相关、如何选择滞后阶数和自由度,以及该检验不能对金融收益率证明什么
本指南内容Ljung–Box 检验评估什么
简短摘要
Ljung–Box 检验询问:截至所选滞后阶数的自相关是否联合为零。将它用于模型残差,可以检查该范围内是否仍有线性依赖;但它不能证明独立性、正态性、模型正确或收益率预测可供交易。
Ljung–Box 检验评估什么
样本自相关图可能显示多个滞后阶数上的依赖,但逐根读取许多柱状条会带来多重检验问题。Ljung–Box 检验把前 \(h\) 个样本自相关合成一个组合统计量。其原假设是滞后1到 \(h\) 的总体自相关都为零;备择假设是其中至少一个不为零。
Box 和 Pierce 开发了一个总体拟合优度检验,用于检查拟合后的时间序列模型。Ljung 和 Box 修改了统计量,以改善有限样本下的近似。“Portmanteau”表示一个统计量概括多个滞后相关性,并不意味着检验涵盖了时间序列依赖的所有类型。
如果检验收益率序列,问题可能是过去的带符号收益率是否留下线性序列依赖。如果检验拟合后的 ARMA 模型,通常是问模型使用了指定滞后结构后,残差中是否仍有自相关。这是相关但不同的用途,因此解释结果前要说明检验对象。
计算 Box–Pierce 与 Ljung–Box 统计量
令 \(\hat\rho_k\) 为滞后 \(k\) 的样本自相关,\(n\) 为用于计算它的观测数,\(h\) 为检验的最大滞后。Box–Pierce 统计量为
\[ Q_{BP}=n\sum_{k=1}^{h}\hat\rho_k^2. \]
Ljung–Box 调整会按每个滞后可用的样本量加权:
\[ Q_{LB}=n(n+2)\sum_{k=1}^{h}\frac{\hat\rho_k^2}{n-k}. \]
由于相关系数被平方,正负自相关都会抬高统计量。该调整会对可用配对数较少的滞后给予更大权重,即使两个滞后的估计相关相同。在大样本中,两种统计量通常会趋近;有限样本下常用 Ljung–Box,因为原始研究发现其小样本近似表现较好。
在白噪声原假设和检验的正则条件下,将 \(Q_{LB}\) 与卡方分布比较。对未拟合动态参数的原始序列,常用 \(h\) 作为参考自由度。对估计得到的 ARMA(\(p,q\)) 模型残差,常见调整是 \(h-p-q\),且结果必须为正。此修正反映用于拟合残差动态的参数,并不是对任何回归都要减去所有系数的通用规则。积分、季节、受约束或其他特殊模型可能采用不同约定。参考自由度应与具体残差检验及软件定义相匹配。例如,若只检验到 \(h=4\),ARMA(2,2) 残差按常见调整后的自由度为零,此时不能进行普通卡方比较。应预先选择更长的滞后范围,或使用适合该模型的诊断方法,不要强行套用零自由度的参考分布。还要说明选择该滞后范围的理由。
演算一个假设的残差例子
假设某个拟合模型留下 \(n=250\) 个残差,预先设定的五阶检验得到自相关 \(0.10, 0.05, -0.08, 0.02, -0.04\)。Box–Pierce 先将它们平方后求和:
\[ 0.10^2+0.05^2+(-0.08)^2+0.02^2+(-0.04)^2=0.0209. \]
于是 \(Q_{BP}=250(0.0209)=5.225\)。应用 Ljung–Box 权重后:
\[ Q_{LB}=250(252)\left(\frac{0.0100}{249}+\frac{0.0025}{248}+\frac{0.0064}{247}+\frac{0.0004}{246}+\frac{0.0016}{245}\right)\approx 5.31. \]
这一步还没有得到 p 值。如果这些是 ARMA(1,1) 拟合后的残差,常见参考自由度为 \(h-p-q=5-1-1=3\);对按自身原假设检验的原始序列,自由度可能是5。自由度的选择会改变上尾概率。这里所有数值都是为演示计算而虚构的,并非市场观测或模型结果。
统计量较小,表示在选定参考分布下,观测到的平方自相关并不异常大,但这不能证明相关系数恰好为零。统计量较大,表示在所选水平下,这组数据较难与原假设相容;应检查涉及哪些滞后和模型特征,而不要把单个数字当成原因诊断。
先选好滞后范围,再看哪个结果最有利
滞后上限 \(h\) 决定检验的问题。只检验少数短滞后,可能漏掉较慢的依赖或日频观测中的每周模式。把检验扩展到很多滞后,会加入弱而嘈杂的估计,降低对某种短滞后模式的检验功效,并让结果容易受少数长滞后相关影响。较大的 \(h\) 在 ARMA 自由度调整后也会留下更少自由度。
根据采样频率、已知的日历结构、模型目的,以及残差不应再包含哪种依赖来选择滞后。对日度市场数据,交易时段滞后未必等于日历日滞后。日内数据可能有时段效应和隔夜影响。季节模型可能需要季节滞后或专门的季节诊断;一个通用截断值可能掩盖结构。
如果尝试了许多 \(h\)、变换、资产或模型阶数,却只报告最小的 p 值,展示出来的显著性就忽略了这些搜索。应在解释诊断前写明滞后范围和判断规则,或在推断计划中纳入更广泛搜索的影响。
将自相关图与联合统计量一起解读
自相关图常包含 \(\pm1.96/\sqrt{n}\) 这类近似单滞后界限。在简单白噪声模型下,它们可用于标记单个样本相关,但不是所有滞后同时适用的95%置信带。分别查看许多柱状条会提高至少一个偶然越界的概率。Ljung–Box 检验则对预先设定的滞后集合提出一个联合问题,并为组合统计量使用参考分布。
一个较大的自相关或多个中等自相关都可能推高联合统计量。检验后应查看逐滞后项 \(n(n+2)\hat\rho_k^2/(n-k)\) 和 ACF 图。单根柱状条超出经验界限并不自动等于组合检验显著;所有单独柱状条都在各自界限内,也不保证联合统计量不显著。

*概念图对比没有明显滞后模式的残差与在多个偏移下反复对齐的残差,不代表实际市场观测。*

区分原始收益率、模型残差和平方残差
对带符号收益率进行检验,询问截至滞后 \(h\) 的线性自相关是否联合为零。对拟合残差进行检验,则询问所选模型是否还留下类似的线性依赖。拒绝原假设可以促使你检查均值设定、时间对齐、市场日历和残差图,但它不会指出缺少了哪个模型项。
检查重叠收益窗口是否造成依赖
即便底层单期收益彼此不相关,观测的定义也可能制造自相关。例如,一个五交易日滚动收益和下一个五交易日滚动收益会共享四个日收益。窗口重叠会机械地关联相邻观测。Ljung–Box 可以正确拒绝这种构造序列的零自相关,但这并不说明非重叠的日收益可被预测。
应说明观测是日收益、多日滚动收益,还是重叠结果模型的残差。根据经济问题对齐交易日历、收盘时间戳和隔夜区间。如果确实需要重叠期限,就使用适合该构造的推断方法和参考分布,而不要将结果解读为独立的交易优势证据。
即使带符号收益率几乎没有自相关,也可能存在波动聚集。对残差平方化会改变问题:平方残差或绝对值标准化残差的自相关可以表示收益尺度上的依赖。McLeod 和 Li 研究了 ARMA 拟合后用平方残差自相关诊断非线性依赖的方法。这仍是诊断,不是某个唯一波动模型的证明。[ARCH-LM 指南](/zh-CN/learn/arch-lm-test-volatility-clustering-finance-explained)介绍了针对 ARCH 型依赖的检验,[GARCH 指南](/zh-CN/learn/volatility-clustering-garch-explained)解释条件方差建模。
零自相关比独立性弱。序列在检验的滞后上相关为零,仍可能依赖非线性变换、条件方差、尾部或市场状态。Ljung–Box 统计量本身也不能说明正态性、平稳性、因果结构,或计入执行成本后能否获得收益。
参数估计后要核对参考分布
简单的卡方近似依赖模型、残差构造、样本量和参数估计方式。如果先拟合 ARMA 模型,残差自相关是估计量,而不是直接观测创新之间的相关。常见的自由度修正是实用的渐近约定,并不保证每种设定下的有限样本精确性。
小样本、很长的滞后范围、接近相互抵消的 AR 与 MA 根、离群值、条件异方差,或拟合模型族以外的序列依赖,都会降低该近似的可靠性。拒绝可能反映均值设定错误、数据质量问题或不合适的参考分布。未拒绝则可能源于检验功效低,或滞后选择漏掉了关注的依赖。
对复杂或非标准模型,应采用参考分布与拟合过程相匹配的诊断;也可使用有依据的 bootstrap 并重复估计步骤来评估校准。当依赖或方差变化是关注点时,独立同分布地重采样残差并不自动有效。说明重采样设计,并将模型选择与最终评估分开。
将拒绝视为进一步诊断的提示,而不是交易
拒绝后可查看自相关函数、适用时的偏自相关、残差时点以及各滞后对 \(Q_{LB}\) 的贡献。考虑模式是否短暂、具有季节性、源于遗漏的均值项,或集中在平方残差中。模型调整应基于合理的设定问题,并用未参与选择的数据评估。
对交易规则而言,样本内可预测性不等于可执行优势。下一步预测必须在下单前可用、通过按时间顺序划分的留出期验证,并计入买卖价差、市场冲击、佣金、融资、借券和换手。Ljung–Box 检验不评估策略净盈利,也不能证明拒绝结果会延续到样本外。
报告观测定义和数量、检验序列、变换、滞后上限、各滞后自相关或图、检验版本、参考自由度、统计量、p 值和显著性水平。如果数据是金融收益率,还应说明交易时段、缺失值、重叠期限及拟合的条件方差如何处理。这样读者才能了解检验做了什么、还有什么没有解决。
Box 和 Pierce 的1970 年论文提出总体残差自相关统计量。Ljung 和 Box 的1978 年论文提出有限样本修正。McLeod 和 Li 的1983 年论文研究平方残差自相关。NIST 的 Box–Ljung 资料总结了统计量和残差自由度调整。相关诊断可参阅[方差比检验](/zh-CN/learn/variance-ratio-test-random-walk-horizon-scaling-explained)、[ARCH-LM](/zh-CN/learn/arch-lm-test-volatility-clustering-finance-explained)及[GARCH 波动聚集](/zh-CN/learn/volatility-clustering-garch-explained)指南。
常见问题
Q1Ljung–Box 检验不显著能证明残差是白噪声吗?
不能。这表示选定滞后的自相关没有大到足以在所选水平拒绝联合原假设。其他滞后、非线性依赖、波动聚集或检验功效不足仍可能存在。
Q2拟合后的 ARMA 残差应使用多少自由度?
当结果为正时,ARMA(\(p,q\)) 残差检查常用 \(h-p-q\),但特殊模型和季节模型可能采用不同规则。参考分布要匹配具体模型与实现。
Q3Ljung–Box 能识别可盈利的收益模式吗?
不能。它诊断所选滞后范围的联合自相关。预测或交易主张需要预先设定的实时规则、按时间顺序的样本外证据和现实的执行成本。 ---
资料来源与延伸阅读
报告问题
我们会准备一封包含本文链接的邮件。发送后,Mark 才会收到你的反馈
快速检查
读完指南后,用 3 道题检查一下
问题 01
检验至滞后 h 的 Ljung–Box 原假设是什么?
选择答案即可查看解释