知情交易機率(PIN):公式、計算示例與局限
了解 PIN 模型如何利用買方和賣方發起的交易到達次數估計資訊驅動交易,並認識經典公式、參數估計方法與模型局限。
本指南內容PIN 估計模型隱含的資訊驅動訂單到達佔比
簡短摘要
知情交易機率(PIN)是一種市場微觀結構估計量,根據買方發起和賣方發起的交易到達次數之間的不平衡建立模型。混合模型嘗試區分資訊驅動交易與一般流動性需求,但結果取決於較強的假設和審慎的最大概似估計。PIN 無法識別某位具體的知情交易者,也不會預測下一次價格變動或證明某種策略可以獲利。
PIN 估計模型隱含的資訊驅動訂單到達佔比
每宗已成交交易都有買方和賣方,但通常無法觀察雙方各自為何交易。買方可能因私人資訊而行動,也可能是在調整投資組合、滿足現金需要或執行基準策略。PIN 使用多個時期內買方發起和賣方發起的交易次數,估計模型會把多少訂單流歸因於根據私人資訊交易的參與者。
Easley、Kiefer、O’Hara 和 Paperman 提出這種結構方法,用於研究資訊驅動交易和流動性。他們的模型把每日買賣訂單計數視為某個未能觀察的資訊狀態所產生的結果。沒有私人資訊事件時,不知情的買家和賣家會發出訂單;好消息或壞消息到達時,知情交易者會按照訊號方向增加訂單。多個交易日中買賣計數的不對稱,有助估計潛在狀態的機率和訂單到達率(Easley 等,1996)。
因此,PIN 是針對特定樣本和指定模型估計的屬性。它不是貼在某宗成交上的標籤,不是知情者人數的直接統計,也不是下一宗交易由知情者發起的機率。在定義和假設相同的情況下,較高的估計值代表配適模型把較大比例的預期訂單到達歸入知情交易者成分。
模型把資訊事件視為潛在狀態
經典 PIN 模型把每個交易時段分為三種潛在狀態之一。以 \(1-\alpha\) 的機率,不會有資訊事件;以 \(\alpha\delta\) 的機率,事件帶來好消息;以 \(\alpha(1-\delta)\) 的機率,事件帶來壞消息。參數 \(\alpha\) 代表資訊事件發生的機率,\(\delta\) 則是在資訊事件發生的條件下,消息屬於好消息的機率。
每個時段內,不知情買方和賣方訂單的預期到達率均為 \(\varepsilon\)。資訊事件發生時,知情交易者以預期到達率 \(\mu\) 進場,並按照訊號方向交易:好消息時買入,壞消息時賣出。在最簡單的版本中,給定狀態後,買賣計數是條件獨立的泊松隨機變數。模型看不到狀態或交易者類型,只能從最終觀察到的計數模式推斷參數。
這些是建模假設,並非已知適用於所有市場的事實。它們令混合模型可以估計和解釋。如果模型沒有考慮交易聚集、相互關聯的流動性需求、不同公告帶來的到達模式、交易方向誤分類或交易場所分散等情況,這些因素便可能被誤認為資訊驅動的訂單流。
PIN 公式比較知情與非知情訂單的預期到達量
在對稱版本中,每期知情訂單的預期到達量為 \(\alpha\mu\)。非知情訂單的預期到達量是買方的 \(\varepsilon\) 加賣方的 \(\varepsilon\),合計 \(2\varepsilon\)。PIN 是知情成分佔所有預期到達量的比例:
PIN = αμ / (αμ + 2ε)
好消息參數 \(\delta\) 會影響知情交易者使用買方還是賣方一側,但計算總佔比時會約掉。還要留意,\(\alpha\) 和 \(\mu\) 雖以乘積出現在分子,經濟含義卻不同:\(\alpha\) 較高代表每期發生資訊事件的機率較高,\(\mu\) 較高則代表事件發生後知情訂單到達得更頻繁。在其他參數不變時,兩者上升都會提高 \(\alpha\mu\);但只報告 PIN,無法分辨這兩種原因。不同樣本即使得到相同 PIN,也可能對應不同的資訊事件頻率和事件日交易強度。因此,報告 PIN 時亦應列出 \(\alpha\)、\(\delta\)、\(\mu\) 和 \(\varepsilon\),並檢查這些參數的變化。
解讀時要分清 \(\mu\) 和 \(\alpha\mu\):\(\mu\) 是資訊事件已發生時的條件到達率;\(\alpha\mu\) 則是合併有事件期和無事件期後,每期平均的知情訂單到達量。兩者雖然都以「每期」為單位,含義卻不同;若把兩者都稱為知情交易率,便會混淆事件發生頻率和事件日交易強度。比較日頻與小時頻結果前,也要統一時期定義,因為 \(\alpha\) 代表每個時期內發生資訊事件的機率。部分擴展模型容許買賣兩側採用更靈活的到達率,或使用不同的交易生成過程。若使用這些擴展模型,應說明公式和解釋有何不同,不能不加說明地代入經典公式。
假設某個純屬虛構的時期有以下參數:\(\alpha=0.20\),資訊事件日知情訂單的預期到達量 \(\mu=12\),每期每一側非知情訂單的預期到達率 \(\varepsilon=40\)。知情訂單的預期到達量為 \(0.20\times12=2.4\);非知情訂單的預期到達量為 \(40+40=80\)。模型隱含的佔比為 \(2.4/(2.4+80)=0.0291\),即約 2.9%。
這個例子只演示計算過程。它不代表實際觀察到的交易中剛好有 2.9% 屬於知情交易,也不代表每宗交易客觀上有 2.9% 的機率屬於知情交易,更不表示任何參與者掌握內幕消息。例子中的事件機率和到達率都是假設值;實際應用必須用數據估計,並交代樣本時期和模型設定。
PIN 也受分母影響。保持 \(\alpha\) 和 \(\mu\) 不變,將每一側非知情訂單到達率由 40 提高至 60,PIN 便會變成 \(2.4/(2.4+120)\),約為 2.0%。知情訂單的預期到達量沒有改變,只是增加的非知情訂單降低了它在總量中的佔比。因此,PIN 下降不一定代表資訊到達風險降低。尤其在不同時期的基礎交易量有變化時,應逐項檢查估計參數。

最大概似法根據買賣計數估計潛在參數
對每個時期 \(t\),令 \(B_t\) 表示買方發起的交易到達次數,\(S_t\) 表示賣方發起的交易到達次數。經典模型中,這些計數的概似由三種狀態混合而成。無事件狀態的權重為 \(1-\alpha\),買賣兩側的泊松到達率均為 \(\varepsilon\)。好消息狀態的權重為 \(\alpha\delta\),買方到達率為 \(\varepsilon+\mu\),賣方為 \(\varepsilon\)。壞消息狀態的權重為 \(\alpha(1-\delta)\),買方到達率為 \(\varepsilon\),賣方為 \(\varepsilon+\mu\)。在每種狀態內,把相應的泊松機率相乘,再將三種狀態的結果相加,就會得到該時期的概似。
估計器會選取 \(\alpha\)、\(\delta\)、\(\mu\) 和 \(\varepsilon\),令樣本各期的對數概似總和最大化,然後用配適出的參數計算 PIN。研究者通常會使用一個季度等窗口估計,因為單日的兩側計數對混合結構提供的資訊不多。最後得到的 PIN 是窗口級估計;延長窗口或會令計數更穩定,但亦會把不同市場狀態平均在一起。
PIN 並非把買賣數量相減得出淨差,再對淨差取平均。單看淨數量,無法分辨好消息日和流動性需求同時推高買賣活動的時期。最大概似法會利用整個樣本,聯合評估各日期的買賣計數與三種潛在狀態的吻合程度。窗口過短可能令混合狀態難以識別;窗口過長則可能迫使模型用固定到達率描述截然不同的交易環境。
優化並非可以忽略的例行細節。概似可能有多個局部最大值,參數可能落在邊界,大量交易計數亦可能令計算出現浮點下溢或上溢。Yan 和 Zhang 記錄了邊界解可能造成的重大偏差,並提出改善估計的方法(Yan 和 Zhang,2012)。可信的估計應採用數值穩定的概似、多個合理的起始值、符合模型的參數限制,並交代所選最優解能否重現。
成交方向和抽樣選擇會影響估計結果
經典模型需要買方發起和賣方發起的計數。如果數據源沒有主動方欄位,這些計數可能要透過報價規則、tick test 或 Lee–Ready 程序等分類器得出。成交方向分錯會把觀察值由 \(B_t\) 移到 \(S_t\),或反過來,從而改變概似。因此,估計記錄應交代分類方法、如何處理中間價成交和方向未知的成交、交易場所覆蓋範圍,以及時間戳的對齊方式。[成交方向分類指南](/zh-HK/learn/trade-direction-classification-lee-ready-algorithm-explained)解釋推斷方向為何會因報價和數據源而異。
研究者亦要定義時期、金融工具、納入的成交條件,以及如何處理開市競價、成交更正、場外成交申報和無成交時段。合併多個交易場所,可能會形成有別於單一場所的計數過程。由日頻時期改為日內短時段,會改變到達率的解釋,也可能令觀察值不足以穩定估計。只有在數據構造、估計器、窗口和模型版本大致一致時,PIN 序列才適合跨資產或跨時間比較。
不要悄悄刪除難處理的觀察值,也不要只報告看來合理的估計。保留原始計數,記錄所有排除項,檢查參數估計和邊界命中情況,並在合理的分類方法和窗口下比較結果。如果估計值有明顯變化,這種敏感性本身就是結果的一部分,不應當成噪音隱藏起來。
PIN 與其他流動性指標相關,但衡量對象不同
報價或有效買賣差價衡量交易者需要讓出的價格或執行成本。PIN 則估計結構模型中歸因於知情成分的預期訂單到達佔比。差價較闊可能反映逆向選擇風險、庫存成本、費用或競爭情況,但差價本身不是 PIN 值。[Roll 差價估計器](/zh-HK/learn/roll-bid-ask-spread-autocovariance-estimator-explained)在自身假設下利用回報自協方差推斷差價。
訂單流不平衡概括買賣活動的差異,有時亦涵蓋限價盤新增和取消。它可在選定時段內直接觀察;PIN 則透過概似從多個時期的成交計數推斷潛在資訊過程。不平衡並非知情交易的證據:流動性需求或分批執行也可能產生相似模式。[訂單流不平衡](/zh-HK/learn/order-flow-imbalance-limit-order-book-explained)介紹了另一種指標。
VPIN 也不只是高頻版的 PIN。它是基於成交量時鐘的統計量,利用成交量桶內的不平衡建構,並有不同的成交分類和抽樣選擇。Andersen 和 Bondarenko 的評估質疑 VPIN 能否在其測試環境中可靠衡量交易毒性或預示市場動盪(Andersen 和 Bondarenko,2014)。應按每種指標本身的構造和證據評估,不要因為名稱相似便把它們混為一談。
估計結果需要通過模型配適和穩定性檢查
PIN 配適值看來精確,不代表計數模型與數據吻合良好。Gan、Wei 和 Johnstone 檢驗 PIN 模型的經驗配適,並報告他們分析的分布和依賴模式存在結構性局限(Gan 等,2017)。這個證據說明應檢查具體樣本的配適情況,並非表示所有應用都無效。
有用的診斷包括買賣計數的分布及其依賴關係、零成交時段的頻率、模型隱含的計數機率、優化器的收斂和邊界狀況,以及對不同起始值的敏感性。把模擬或配適所得的計數分布與觀察數據比較,並檢查相鄰窗口的參數是否仍合理。標準誤或信賴區間應符合所用的估計方法;單一點估計會掩蓋抽樣誤差和模型選擇帶來的不確定性。
相鄰窗口的估計值穩定,並不能證明模型設定正確。相反,估計值有變化,也可能反映資訊到達、非知情需求、數據覆蓋範圍有變,或模型設定不吻合。在作出市場解釋前,應先交代證據和局限。
有用的 PIN 報告應說明時期和配適方法以便重現
沒有測量記錄,PIN 數值便很難解讀。應註明金融工具或資產範圍、交易場所覆蓋、樣本日期、觀察時期和時區、納入的成交條件,以及把成交分類為買方或賣方發起的程序。說明估計採用經典三狀態模型還是擴展模型,並一併披露配適出的 \(\alpha\)、\(\delta\)、\(\mu\) 和 \(\varepsilon\)。
亦要描述估計窗口、概似函數的實作方式、優化程序和起始值策略。報告收斂情況、邊界解、不確定性估計和配適診斷。如果開市競價、成交更正、無成交時段或方向未知的成交被排除或特別處理,應說明做法。這些細節有助讀者分辨穩健的模式和由某項數據或優化選擇驅動的結果。
觀察時期很重要,因為 \(\alpha\) 表示每個時期內發生資訊事件的機率,而 \(\mu\) 和 \(\varepsilon\) 是每個時期的到達率。把日頻計數改為小時計數,會改變單位和底層事件過程。即使 PIN 公式形式相同,不同時長的時期所估出的參數也不能直接比較。比較資產或日期前,先統一時期定義和成交構造,再把配適到達率的變化視為需要檢查的證據,而非自動認定為知情交易出現變化。
PIN 估計不是獨立的交易訊號
PIN 作為市場微觀結構指標而開發,並非開倉或平倉規則。它不會告訴交易者價格將向哪個方向變動、可能變動多少、表面上的訊號是否已反映在報價中,也不會說明能否按顯示價格成交。早期資產定價研究考察歷史 NYSE 橫截面中的 PIN 估計值,以及它與該樣本預期回報的關係;這項結果不是當前預測,也不是普遍適用的溢價(Easley、Hvidkjaer 和 O’Hara,2002)。
如果把 PIN 用作解釋變量,應報告成交方向分類方法、估計時期和窗口、配適參數、不確定性、模型配適檢查及敏感性分析。如果用於交易策略,應以未參與策略選擇的數據測試完整規則,計入差價、費用、滑點、市場衝擊和容量,再與基準比較。[實施差額](/zh-HK/learn/implementation-shortfall-explained)提供一種比較決策價格與實際執行成本的方法。統計上有趣的估計仍可能沒有實用的預測價值,或在扣除成本後不再有價值。
常見問題
Q1PIN 是下一宗交易屬於知情交易的機率嗎?
不是。經典 PIN 公式是模型隱含的知情訂單預期到達量佔預期到達總量的樣本級比例。它不會為已觀察或未來的每宗成交賦予一個客觀機率。
Q2PIN 較高是否代表某隻股票會跑贏?
不是。PIN 在指定模型下估計與資訊相關的訂單流。歷史樣本中報告的回報關係,不會令 PIN 成為獨立預測,也不能證明某種交易策略扣除成本後會獲利。
Q3PIN 和 VPIN 有甚麼分別?
經典 PIN 對各時期的買賣到達計數配適參數混合模型。VPIN 使用成交量桶和成交量時鐘構造不平衡。兩者的假設、輸入和解讀均不同;VPIN 預測表現的相關說法亦曾受到質疑。
Q4為甚麼同一證券會有不同的 PIN 估計值?
估計可能採用不同的成交方向規則、交易場所、時期長度、樣本窗口、模型版本、起始值或優化程序。邊界解和數據錯誤亦會影響配適。先對齊並記錄這些選擇,再比較估計值。
資料來源與延伸閱讀
回報問題
我們會準備一封包含本文連結的電郵。寄出後,Mark 才會收到你的回報
快速檢查
讀完指南後,用 3 道題檢查一下
問題 01
在對稱的經典 PIN 模型中,ε 代表甚麼?
選擇答案即可查看解釋
期權術語表
清楚解釋從認購、認沽和期權鏈到 IV、希臘值、未平倉合約與最大痛點等核心期權術語
瀏覽期權術語表