Skip to content
全部期权指南
市场微观结构10 分钟

知情交易概率(PIN):公式、计算示例与局限

了解 PIN 模型如何利用买方和卖方发起的交易到达次数估计信息驱动交易,并学习经典公式、参数估计方法与模型局限。

本指南内容PIN 估计模型隐含的信息驱动订单到达份额

简短摘要

知情交易概率(PIN)是一种市场微观结构估计量,它根据买方发起和卖方发起的交易到达次数之间的不平衡建立模型。混合模型尝试区分信息驱动交易与一般流动性需求,但结果依赖较强的假设和审慎的最大似然估计。PIN 无法识别某位具体的知情交易者,也不预测下一次价格变动或证明某种策略可以获利。

PIN 估计模型隐含的信息驱动订单到达份额

每笔已成交交易都有买方和卖方,但通常观察不到双方各自为何交易。买方可能因私人信息而行动,也可能是在调整投资组合、满足现金需求或执行基准策略。PIN 使用多个时期内买方发起和卖方发起的交易次数,估计模型会把多少订单流归因于根据私人信息交易的参与者。

Easley、Kiefer、O’Hara 和 Paperman 提出这一结构方法,用于研究信息驱动交易与流动性。他们的模型把每日买卖订单计数视为某个不可观察信息状态的结果。没有私人信息事件时,不知情买家和卖家产生订单;好消息或坏消息到来时,知情交易者会按信号方向增加订单。许多日期中买卖计数的不对称,有助于估计潜在状态的概率和订单到达率(Easley 等,1996)。

因此,PIN 是针对特定样本和指定模型估计出的属性。它不是贴在某笔成交上的标签,不是知情者人数的直接计数,也不是下一笔交易由知情者发起的概率。在定义和假设相同的情况下,较高的估计值表示拟合模型将更大比例的预期订单到达归于知情交易者成分。

模型把信息事件视为潜在状态

经典 PIN 模型把每个交易时期划分为三种潜在状态之一。以 \(1-\alpha\) 的概率,不发生信息事件;以 \(\alpha\delta\) 的概率,事件带来好消息;以 \(\alpha(1-\delta)\) 的概率,事件带来坏消息。参数 \(\alpha\) 表示信息事件发生的概率,\(\delta\) 表示在信息事件发生的条件下消息为好的概率。

每个时期内,不知情买家和卖家的订单预期到达率均为 \(\varepsilon\)。发生信息事件时,知情交易者以预期到达率 \(\mu\) 进入市场,并按信号方向交易:好消息时买入,坏消息时卖出。在最简单的版本中,给定状态后,买卖计数是条件独立的泊松随机变量。模型并不观察状态或交易者类型,而是从最终的计数模式中推断参数。

这些是建模假设,并非已知适用于所有市场的事实。它们使混合模型可以估计和解释。如果模型没有考虑交易聚集、相互关联的流动性需求、不同公告产生的到达模式、交易方向误分类或交易场所碎片化,这些因素就可能被误认为信息驱动的订单流。

PIN 公式比较知情与非知情订单的预期到达量

在对称版本中,每期知情订单的预期到达量为 \(\alpha\mu\)。非知情订单的预期到达量是买方的 \(\varepsilon\) 加卖方的 \(\varepsilon\),总计 \(2\varepsilon\)。PIN 是知情成分占全部预期到达量的比例:

PIN = αμ / (αμ + 2ε)

好消息参数 \(\delta\) 会影响知情交易者使用买方还是卖方一侧,但在计算总占比时会约掉。另一个需要注意的区别是,\(\alpha\) 与 \(\mu\) 虽以乘积进入分子,经济含义却不同:\(\alpha\) 较高表示每期发生信息事件的概率更高,\(\mu\) 较高表示事件发生后知情订单到达更频繁。在其他参数不变时,两者上升都会提高 \(\alpha\mu\),但只报告 PIN 无法区分这两种原因。不同样本即使得到相同 PIN,也可能对应不同的信息事件频率和事件日交易强度。因此,除 PIN 外还应报告 \(\alpha\)、\(\delta\)、\(\mu\) 和 \(\varepsilon\),并检查参数如何变化。

解读时要区分 \(\mu\) 与 \(\alpha\mu\):\(\mu\) 是信息事件已发生时的条件到达率,\(\alpha\mu\) 则是合并有事件期和无事件期后,每期平均的知情订单到达量。两者虽然都以“每期”为单位,含义却不同;把两者都简称为知情交易率,会混淆事件发生频率和事件日交易强度。比较日频与小时频结果前,也要统一时期定义,因为 \(\alpha\) 表示每个时期内发生信息事件的概率。部分扩展模型允许买卖两侧的到达率更灵活,或采用不同的交易生成过程。若使用扩展模型,应说明公式与解释的差异,不能不加说明地套用经典表达式。

假设某个完全虚构时期的参数为 \(\alpha=0.20\),信息事件日知情订单的预期到达量 \(\mu=12\),每期每一侧非知情订单的预期到达率 \(\varepsilon=40\)。知情订单预期到达量为 \(0.20\times12=2.4\),非知情订单预期到达量为 \(40+40=80\)。模型隐含的份额为 \(2.4/(2.4+80)=0.0291\),约为 2.9%。

这个例子只展示算法。它不表示实际观察到的交易中恰好有 2.9% 是知情交易,不表示每笔交易客观上有 2.9% 的概率属于知情交易,也不表示任何参与者掌握了内幕信息。示例中的事件概率和到达率都是假设值;实际应用必须用数据估计,并报告样本时期和模型设定。

PIN 还受分母影响。保持 \(\alpha\) 和 \(\mu\) 不变,把每一侧非知情订单到达率从 40 提高到 60,PIN 就变为 \(2.4/(2.4+120)\),约为 2.0%。知情订单预期到达量没有变化,只是更多的非知情订单降低了它在总量中的占比。因此,PIN 下降不自动意味着信息到达风险降低。尤其当不同时期的基础交易量变化时,应逐项检查估计参数。

不可见的信息信号分成均衡与不对称的买卖到达流,最后汇入概念性估计过程
潜在信息状态与买卖订单到达的概念示意;并非市场数据或 PIN 估计结果

最大似然法根据买卖计数估计潜在参数

对每个时期 \(t\),令 \(B_t\) 表示买方发起的交易到达次数,\(S_t\) 表示卖方发起的交易到达次数。经典模型中,这些计数的似然是三种状态的混合。无事件状态的权重为 \(1-\alpha\),买卖双方的泊松到达率都为 \(\varepsilon\)。好消息状态的权重为 \(\alpha\delta\),买方到达率为 \(\varepsilon+\mu\),卖方为 \(\varepsilon\)。坏消息状态的权重为 \(\alpha(1-\delta)\),买方到达率为 \(\varepsilon\),卖方为 \(\varepsilon+\mu\)。在每种状态内将对应的泊松概率相乘,再对三种状态求和,就得到该时期的似然。

估计过程会选择 \(\alpha\)、\(\delta\)、\(\mu\) 和 \(\varepsilon\),使样本各期的对数似然之和最大化,再用拟合参数计算 PIN。研究者通常使用一个季度之类的窗口估计,因为单日的两侧计数对混合结构提供的信息很少。最终 PIN 是窗口级估计;延长窗口可能让计数更稳定,但也会把不同市场状态平均在一起。

PIN 不是简单地计算买卖数量净差,再对净差求平均。净数量本身无法区分好消息日与流动性需求同时抬高买卖活动的情形。最大似然法会利用完整样本,联合评估每个日期的买卖计数与三种潜在状态的吻合程度。窗口过短可能让混合状态难以识别;窗口过长则可能迫使模型用固定到达率描述截然不同的交易环境。

优化也不是可以略过的常规细节。似然可能存在多个局部最大值,参数可能落在边界,大量交易计数还可能导致浮点下溢或上溢。Yan 和 Zhang 记录了边界解可能造成的显著偏差,并提出改进估计的方法(Yan 和 Zhang,2012)。可信的估计应使用数值稳定的似然、多个合理的初始值、符合模型的参数约束,并报告所选最优解是否可复现。

成交方向和抽样选择会影响估计结果

经典模型需要买方发起和卖方发起的计数。如果数据源没有主动方字段,计数可能来自报价规则、tick 检验或 Lee–Ready 程序等分类器。方向误分类会把观察值从 \(B_t\) 移到 \(S_t\),或反过来,从而改变似然。因此,估计记录应说明分类方法、如何处理中间价成交和方向未知的成交、交易场所覆盖范围以及时间戳对齐方式。[成交方向分类指南](/zh-CN/learn/trade-direction-classification-lee-ready-algorithm-explained)解释了为什么推断出的方向会随报价和数据源而变化。

研究者还需要定义时期、金融工具、符合条件的成交,以及如何处理集合竞价、成交更正、场外报告和无成交区间。合并多个交易场所会形成不同于单一场所的计数过程。从日频时期改成日内短周期会改变到达率的解释,也可能让稳定估计所需的观测量不足。只有数据构造、估计器、窗口和模型版本足够一致时,PIN 序列才适合跨资产或跨时间比较。

不要悄悄删掉难处理的观测值,也不要只报告看起来合理的估计。保留原始计数,记录排除项,检查参数估计和边界命中情况,并在合理的分类规则与窗口下比较结果。如果估计值显著变化,这种敏感性就是结果的一部分,不应作为噪声隐藏起来。

PIN 与其他流动性指标相关,但衡量对象不同

报价或有效买卖价差衡量交易者需要让出的价格或执行成本。PIN 则估计结构模型中归因于知情成分的预期订单到达份额。价差较宽可能反映逆向选择风险、库存成本、费用或竞争情况,但价差本身不是 PIN 值。[Roll 价差估计器](/zh-CN/learn/roll-bid-ask-spread-autocovariance-estimator-explained)在自身假设下利用收益率自协方差推断价差。

订单流不平衡概括买卖活动的差异,有时还包括限价单新增和撤销。它可以直接在选定区间内观察;PIN 则使用似然从重复计数中推断潜在的信息过程。不平衡并不是知情交易的证据:流动性需求或分批执行也可能产生相似模式。[订单流不平衡](/zh-CN/learn/order-flow-imbalance-limit-order-book-explained)介绍了另一种指标。

VPIN 也不只是高频版 PIN。它是基于成交量时钟的统计量,使用成交量桶中的不平衡,并有不同的交易分类和抽样方式。Andersen 和 Bondarenko 的评估质疑了 VPIN 能否在其检验的环境中可靠衡量交易毒性或预示市场动荡(Andersen 和 Bondarenko,2014)。应根据每种指标自身的构造和证据评估,不要因名称相似就把它们混为一谈。

估计结果需要通过模型拟合和稳定性检查

拟合出的 PIN 值可能看起来很精确,但计数模型未必能很好拟合数据。Gan、Wei 和 Johnstone 检验了 PIN 模型的经验拟合,并报告了他们分析的分布和依赖模式中存在的结构性局限(Gan 等,2017)。这说明应检查具体样本的拟合情况,而不是说所有应用都无效。

有用的诊断包括买卖计数的分布及其依赖性、零成交时期的频率、模型隐含的计数概率、优化器的收敛和边界状态,以及对不同初始值的敏感性。将模型模拟或拟合的计数分布与观察数据比较,并检查相邻窗口的参数是否仍然合理。标准误或置信区间应符合所用估计方法;单独一个点估计会掩盖抽样误差和模型选择带来的不确定性。

相邻窗口中的估计值稳定,不代表模型设定正确。反过来,估计值变化可能反映信息到达、非知情需求、数据覆盖发生变化,或者模型设定不匹配。给出市场解释前,应先说明证据和局限。

有用的 PIN 报告应说明时期和拟合方法以便复现

如果缺少测量记录,PIN 数值就很难解读。应注明金融工具或资产范围、交易场所覆盖范围、样本日期、观测时期与时区、符合条件的成交条件,以及将交易分类为买方或卖方发起的程序。说明估计采用经典三状态模型还是扩展模型,并与 PIN 一并披露拟合出的 \(\alpha\)、\(\delta\)、\(\mu\) 和 \(\varepsilon\)。

还应说明估计窗口、似然实现方式、优化算法和初始值策略。报告收敛情况、边界解、不确定性估计和拟合诊断。如果集合竞价、成交更正、无成交区间或方向未知的成交被排除或特殊处理,也应说明方法。这些细节有助于读者区分稳健模式和由某项数据或优化选择驱动的结果。

观测时期很重要,因为 \(\alpha\) 表示每个时期内发生信息事件的概率,而 \(\mu\) 与 \(\varepsilon\) 表示每个时期的到达率。从日频计数改为小时计数会改变单位和底层事件过程。即使 PIN 公式形式相同,不同时长时期估计的参数也不能直接比较。比较资产或日期前,应先统一时期定义和成交构造,再把拟合到达率的变化视为需要检查的证据,而不是自动认定为知情交易发生了变化。

PIN 估计值不是独立的交易信号

PIN 是作为市场微观结构指标提出的,不是开仓或平仓规则。它不会告诉交易者价格将朝哪个方向变动、可能变动多少、表面上的信号是否已反映在报价中,也不会说明能否按显示价格成交。早期资产定价研究考察了历史 NYSE 横截面中的 PIN 估计值及其与该样本预期收益的关系;这项结果不是当前预测,也不是普遍适用的溢价(Easley、Hvidkjaer 和 O’Hara,2002)。

如果把 PIN 用作解释变量,应报告成交方向分类方法、估计时期和窗口、拟合参数、不确定性、模型拟合检查以及敏感性分析。如果用于交易策略,应在未参与规则选择的数据上检验完整策略,计入价差、费用、滑点、市场冲击和容量,并与基准比较。[实施差额](/zh-CN/learn/implementation-shortfall-explained)提供了一种比较决策价格与实际执行成本的方法。统计上有趣的估计仍可能没有可用的预测价值,或在扣除成本后不再有价值。

常见问题

Q1PIN 是下一笔交易属于知情交易的概率吗?

不是。经典 PIN 公式是模型隐含的知情订单预期到达量占全部预期到达量的样本级比例。它不会给已观察到的或未来的每笔成交赋予客观概率。

Q2PIN 较高是否意味着某只股票会跑赢?

不是。PIN 根据特定模型估计与信息相关的订单流。历史样本中报告的收益关系不能让 PIN 成为独立预测,也不能证明某个交易策略扣除成本后能够盈利。

Q3PIN 和 VPIN 有什么区别?

经典 PIN 对各时期的买卖到达计数拟合参数混合模型。VPIN 使用成交量桶和成交量时钟构建不平衡。二者的假设、输入和解释各不相同;关于 VPIN 预测表现的说法也曾受到质疑。

Q4为什么同一证券的两个 PIN 估计值可能不同?

它们可能采用了不同的成交方向规则、交易场所、时期长度、样本窗口、模型变体、初始值或优化算法。边界解和数据错误也会影响拟合。只有先对齐并记录这些选择,估计值才适合比较。

资料来源与延伸阅读

报告问题

我们会准备一封包含本文链接的邮件。发送后,Mark 才会收到你的反馈

快速检查

读完指南后,用 3 道题检查一下

问题 1 / 3

问题 01

在对称的经典 PIN 模型中,ε 表示什么?

选择答案即可查看解释

期权术语表

清楚解释从看涨、看跌和期权链到 IV、希腊字母、未平仓量与最大痛点等核心期权术语

浏览期权术语表