Probabilité de négociation informée (PIN) : formule, exemple et limites
Découvrez comment le modèle PIN estime les échanges fondés sur l'information à partir des arrivées d'ordres d'achat et de vente, comment calculer sa formule et quelles sont ses hypothèses et limites d'estimation.
Dans ce guidePIN estime la part des arrivées d'ordres attribuée à l'information par le modèle
Bref résumé
La probabilité de négociation informée (PIN) est une estimation de microstructure fondée sur le déséquilibre entre les arrivées de transactions initiées par les acheteurs et celles initiées par les vendeurs. Son modèle de mélange distingue les échanges fondés sur l'information de la demande habituelle de liquidité, mais repose sur des hypothèses fortes et une estimation par maximum de vraisemblance menée avec soin. Il n'identifie pas un opérateur informé en particulier, ne prédit pas le prochain mouvement de prix et ne prouve pas qu'il existe un signal rentable.
PIN estime la part des arrivées d'ordres attribuée à l'information par le modèle
Toute transaction exécutée implique un acheteur et un vendeur, mais la raison de chaque échange n'est généralement pas observable. Un acheteur peut réagir à une information privée, rééquilibrer un portefeuille, répondre à un besoin de liquidités ou suivre un indice de référence. PIN utilise le nombre de transactions initiées par les acheteurs et les vendeurs sur plusieurs périodes pour estimer la part du flux d'ordres que le modèle attribue à des opérateurs agissant sur la base d'informations privées.
Easley, Kiefer, O’Hara et Paperman ont introduit une approche structurelle pour étudier les échanges informés et la liquidité. Leur modèle traite les nombres quotidiens d'achats et de ventes comme les résultats d'un état informationnel non observé. En l'absence d'information privée, des acheteurs et vendeurs non informés génèrent des ordres. Quand une bonne ou une mauvaise information arrive, un opérateur informé ajoute des ordres dans le sens qu'indique cette information. L'asymétrie des nombres d'achats et de ventes sur de nombreux jours aide à estimer les probabilités des états cachés et les taux d'arrivée (Easley et al., 1996).
PIN est donc une estimation pour un échantillon et un modèle donné. Ce n'est ni une étiquette attribuée à une transaction particulière, ni un décompte direct des personnes détenant une information privée, ni la probabilité que la prochaine transaction soit informée. Une estimation plus élevée signifie que, selon les mêmes définitions et hypothèses, le modèle ajusté attribue une part plus importante des arrivées d'ordres attendues à sa composante d'opérateurs informés qu'une estimation plus faible.
Le modèle traite les événements informationnels comme des états latents
Le modèle PIN classique divise chaque période de négociation en l'un de trois états cachés. Avec une probabilité \(1-\alpha\), aucun événement informationnel ne survient. Avec une probabilité \(\alpha\delta\), l'événement apporte une bonne nouvelle ; avec une probabilité \(\alpha(1-\delta)\), une mauvaise nouvelle. \(\alpha\) est la probabilité d'un événement informationnel et \(\delta\) la probabilité conditionnelle d'une bonne nouvelle sachant qu'un événement se produit.
Les arrivées attendues d'ordres non informés sont au taux \(\varepsilon\) par côté et par période, pour les achats comme pour les ventes. Lorsqu'un événement informationnel survient, un opérateur informé arrive au taux attendu \(\mu\) et négocie dans le sens indiqué par le signal : il achète en cas de bonne nouvelle et vend en cas de mauvaise nouvelle. Dans la version la plus simple, les nombres d'achats et de ventes sont conditionnellement indépendants et suivent des lois de Poisson dans chaque état. L'état et le type d'opérateur ne sont pas observés ; le modèle en déduit les paramètres à partir des nombres observés.
Ce sont des hypothèses de modélisation, pas des descriptions établies pour tous les marchés. Elles rendent le modèle de mélange estimable et interprétable. Elles impliquent aussi que le regroupement des transactions, une demande de liquidité corrélée, des annonces aux rythmes d'arrivée différents, les erreurs de signe des transactions ou la fragmentation des marchés peuvent être confondus avec un flux informé si le modèle n'en tient pas compte.
La formule PIN compare les arrivées attendues informées et non informées
Dans la version symétrique, le nombre attendu d'arrivées informées par période est \(\alpha\mu\). Les arrivées non informées attendues comprennent \(\varepsilon\) du côté acheteur et \(\varepsilon\) du côté vendeur, soit \(2\varepsilon\). PIN est la part des arrivées informées dans le total des arrivées attendues :
PIN = αμ / (αμ + 2ε)
Le paramètre \(\delta\) détermine le côté choisi par l'opérateur informé, mais s'annule dans cette part agrégée. Certaines extensions autorisent des taux d'arrivée d'achat et de vente plus flexibles ou d'autres processus de génération des transactions ; ne remplacez pas l'expression classique par leurs formules sans en expliquer la différence et l'interprétation.
Supposons une période hypothétique avec \(\alpha=0.20\), \(\mu=12\) arrivées informées attendues le jour d'un événement informationnel et \(\varepsilon=40\) arrivées non informées attendues par côté et par période. Le nombre attendu d'arrivées informées est \(0.20\times12=2.4\). Celui des arrivées non informées est \(40+40=80\). La part implicite du modèle vaut \(2.4/(2.4+80)=0.0291\), soit environ 2.9 %.
Cet exemple illustre uniquement le calcul. Il ne signifie pas que précisément 2.9 % des transactions observées étaient informées, qu'une transaction a objectivement 2.9 % de chances d'être informée, ni qu'un participant détenait une information privilégiée. Les taux et la probabilité de l'événement sont hypothétiques ; dans une application réelle, il faut les estimer sur les données et indiquer la période d'échantillonnage et la spécification du modèle.
PIN dépend aussi du dénominateur. Si \(\alpha\) et \(\mu\) restent constants tandis que le taux d'arrivée non informée par côté passe de 40 à 60, le calcul devient \(2.4/(2.4+120)\), soit environ 2.0 %. Le nombre attendu d'arrivées informées ne change pas, mais sa part du total diminue. Une baisse de PIN ne prouve donc pas à elle seule une diminution du risque d'arrivée d'informations. Si la fenêtre d'estimation et le volume habituel des échanges changent, examinez quels paramètres ont évolué.

Le maximum de vraisemblance estime les paramètres cachés à partir des nombres d'achats et de ventes
Pour chaque période \(t\), notons \(B_t\) le nombre d'arrivées initiées par les acheteurs et \(S_t\) celui initié par les vendeurs. Dans le modèle classique, la vraisemblance de ces nombres est un mélange de trois composantes. L'état sans événement a un poids \(1-\alpha\) et des taux de Poisson \(\varepsilon\) des deux côtés. L'état de bonne nouvelle a un poids \(\alpha\delta\), un taux d'achat \(\varepsilon+\mu\) et un taux de vente \(\varepsilon\). L'état de mauvaise nouvelle a un poids \(\alpha(1-\delta)\), un taux d'achat \(\varepsilon\) et un taux de vente \(\varepsilon+\mu\). On multiplie les probabilités de Poisson correspondantes dans chaque état, puis on les additionne entre les états pour obtenir la vraisemblance de la période.
L'estimateur choisit \(\alpha,\delta,\mu,\varepsilon\) pour maximiser la somme des log-vraisemblances sur l'échantillon. PIN est ensuite calculée à partir des paramètres estimés. Les chercheurs estiment souvent les paramètres sur une fenêtre telle qu'un trimestre, car les deux nombres d'une seule journée renseignent peu sur le mélange. PIN est alors une estimation au niveau de la fenêtre. Une fenêtre plus longue peut stabiliser les nombres tout en faisant la moyenne de conditions de marché changeantes.
PIN ne se calcule pas en soustrayant chaque jour le nombre de ventes du nombre d'achats puis en faisant la moyenne des différences. Le nombre net d'achats ne distingue pas un état de bonnes nouvelles d'une hausse simultanée des achats et des ventes due à la demande de liquidité. Le maximum de vraisemblance évalue conjointement, sur tout l'échantillon, la plausibilité des nombres observés d'achats et de ventes dans chacun des trois états cachés. Une fenêtre trop courte rend le mélange difficile à identifier ; une fenêtre trop longue oblige à résumer des environnements de négociation différents par les mêmes taux d'arrivée fixes.
L'optimisation n'est pas un détail anodin. La vraisemblance peut avoir plusieurs maxima locaux, les paramètres peuvent atteindre les bornes, et de grands nombres de transactions peuvent provoquer un sous-dépassement ou un dépassement en virgule flottante. Yan et Zhang documentent un biais substantiel dû aux solutions de frontière et proposent une méthode d'estimation améliorée (Yan et Zhang, 2012). Une estimation crédible exige une vraisemblance numériquement stable, plusieurs valeurs initiales défendables, des contraintes de paramètres cohérentes avec le modèle et des diagnostics vérifiant que l'optimum retenu peut être reproduit.
Le signe des transactions et les choix d'échantillonnage influent sur l'estimation
Le modèle classique nécessite des nombres d'achats et de ventes initiés. Si un flux de données n'indique pas le côté agressif, ces nombres peuvent être construits par une règle fondée sur les cotations, un test des ticks ou la méthode Lee–Ready. Les transactions mal classées passent de \(B_t\) à \(S_t\) ou inversement et modifient la vraisemblance. Il faut donc documenter la méthode de classification, le traitement des transactions au milieu de la fourchette ou de sens inconnu, la couverture des marchés et l'alignement des horodatages. Le guide sur la classification du sens des transactions explique pourquoi le signe inféré peut varier selon la cotation et le flux de données.
Il faut aussi définir la période, l'instrument, les conditions de transaction incluses et le traitement des enchères, corrections, déclarations hors marché et intervalles sans transaction. Combiner plusieurs marchés peut produire un processus de comptage différent de l'analyse d'un seul marché. Passer de périodes quotidiennes à des périodes intrajournalières change l'interprétation des taux d'arrivée et peut laisser trop peu d'observations pour une estimation stable. PIN n'est comparable entre actifs ou dates que si la construction des données, la fenêtre, l'estimateur et la version du modèle sont suffisamment alignés.
Ne supprimez pas silencieusement les observations difficiles et ne publiez pas seulement l'estimation qui semble plausible. Conservez les nombres d'origine, documentez les exclusions, examinez les paramètres et les solutions de frontière, et comparez les résultats selon des choix raisonnables de classification et de fenêtre. Si l'estimation varie fortement, cette sensibilité fait partie du résultat.
PIN est liée à d'autres mesures de liquidité, mais mesure autre chose
Le spread coté ou effectif mesure une concession de prix ou un coût d'exécution. PIN estime plutôt la part des arrivées d'ordres attendues attribuée à la composante informée d'un modèle structurel. Un spread large peut refléter le risque de sélection adverse, les coûts de stock, les frais ou la concurrence ; il n'est pas en soi une valeur PIN. L'estimateur de spread de Roll infère un spread à partir de l'autocovariance des rendements selon ses propres hypothèses.
Le déséquilibre du flux d'ordres résume l'écart entre l'activité d'achat et de vente, souvent avec les ajouts et annulations d'ordres à cours limité. Il est directement observable sur un intervalle choisi, tandis que PIN utilise une vraisemblance pour inférer un processus latent de nouvelles à partir de nombres répétés. Un déséquilibre ne prouve pas une négociation informée : les besoins de liquidité ou l'exécution groupée peuvent produire un motif similaire. Le guide sur le déséquilibre du flux d'ordres présente cette mesure distincte.
VPIN n'est pas non plus simplement une PIN calculée à haute fréquence. C'est une statistique fondée sur une horloge de volume et les déséquilibres de compartiments de volume, avec ses propres choix de classification et d'échantillonnage. Andersen et Bondarenko ont contesté l'affirmation selon laquelle VPIN mesurerait de manière fiable la toxicité ou signalerait des turbulences dans le contexte qu'ils ont étudié (Andersen et Bondarenko, 2014). Chaque mesure doit être évaluée selon sa construction et ses éléments probants, plutôt que traitée comme un nom interchangeable.
L'estimation nécessite de vérifier l'ajustement et la stabilité du modèle
Une valeur PIN ajustée peut sembler précise alors que le modèle de comptage s'ajuste mal. Gan, Wei et Johnstone évaluent l'ajustement empirique des modèles PIN et signalent des limites structurelles dans les distributions et schémas de dépendance qu'ils examinent (Gan et al., 2017). Cela justifie de vérifier l'ajustement pour l'échantillon étudié, sans affirmer que toute application est invalide.
Les diagnostics utiles comprennent la distribution des nombres d'achats et de ventes, leur dépendance, la fréquence des périodes sans transaction, les probabilités de comptage impliquées par le modèle, la convergence et le statut de frontière de l'optimiseur, ainsi que la sensibilité à d'autres valeurs initiales. Comparez les distributions simulées ou ajustées aux données observées et vérifiez que les paramètres restent plausibles dans des fenêtres voisines. Les erreurs-types ou intervalles de confiance doivent refléter la méthode d'estimation ; un point estimé seul masque l'incertitude d'échantillonnage et de choix du modèle.
Une estimation stable entre fenêtres adjacentes ne prouve pas que le modèle soit correctement spécifié. À l'inverse, une estimation changeante peut refléter une évolution de l'arrivée d'informations, de la demande non informée, de la couverture des données ou une mauvaise spécification. Présentez les éléments observés et les limites avant toute interprétation de marché.
Un rapport PIN rend la période et l'ajustement reproductibles
Sans fiche de mesure, il est difficile d'interpréter une valeur PIN. Précisez l'instrument ou l'univers, la couverture des marchés, les dates d'échantillonnage, la période d'observation et le fuseau horaire, les conditions de transaction retenues et la procédure d'attribution du signe acheteur ou vendeur. Indiquez si l'estimation repose sur le modèle classique à trois états ou sur une extension, et publiez les valeurs estimées de \(\alpha,\delta,\mu,\varepsilon\) avec PIN.
Décrivez également la fenêtre d'estimation, l'implémentation de la vraisemblance, l'algorithme d'optimisation et la stratégie de valeurs initiales. Indiquez la convergence, les solutions de frontière, les estimations d'incertitude et les diagnostics d'ajustement. Si les enchères, corrections, intervalles sans transaction ou signes inconnus ont été exclus ou traités à part, expliquez comment. Ces détails permettent de distinguer un motif robuste d'un résultat dépendant d'un choix de données ou d'optimiseur.
La période d'observation compte parce que \(\alpha\) est une probabilité d'événement par période, tandis que \(\mu\) et \(\varepsilon\) sont des taux d'arrivée par période. Passer de nombres quotidiens à des nombres horaires change les unités et le processus d'événement sous-jacent. Des paramètres issus de périodes de longueur différente ne sont pas directement comparables au seul motif que la formule PIN garde la même forme. Alignez les définitions de période et la construction des transactions avant de comparer actifs ou dates ; examinez ensuite les variations des taux estimés au lieu de les interpréter automatiquement comme des variations de la négociation informée.
Une estimation PIN n'est pas un signal de trading autonome
PIN a été développée comme mesure de microstructure, pas comme règle d'entrée ou de sortie. Elle ne dit ni dans quel sens le prix bougera, ni de combien, ni si un signal apparent est déjà intégré dans la cotation, ni si une exécution est possible au prix affiché. L'étude initiale de valorisation des actifs a examiné des PIN estimées dans une coupe historique de titres du NYSE et leur relation avec les rendements attendus de cet échantillon ; ce résultat n'est ni une prévision actuelle ni une prime universelle (Easley, Hvidkjaer et O’Hara, 2002).
Si PIN sert de variable explicative, indiquez la méthode de signature des transactions, la période et la fenêtre d'estimation, les paramètres ajustés, l'incertitude, les vérifications d'ajustement et les analyses de sensibilité. Si vous envisagez une stratégie, testez la règle complète sur des données qui n'ont pas servi à la sélectionner, tenez compte du spread, des frais, du glissement, de l'impact de marché et de la capacité, puis comparez-la à une référence. L'implementation shortfall permet de comparer un prix de décision aux coûts d'exécution réels. Une estimation statistiquement intéressante peut néanmoins n'avoir aucune valeur prédictive ou utilité après coûts.
Questions fréquentes
Q1PIN est-elle la probabilité que la prochaine transaction soit informée ?
Non. La formule PIN classique est un ratio, au niveau de l'échantillon, entre les arrivées informées attendues impliquées par le modèle et le total attendu. Elle n'attribue aucune probabilité objective à chaque transaction observée ou future.
Q2Une PIN plus élevée signifie-t-elle qu'une action fera mieux que le marché ?
Non. PIN estime le flux d'ordres lié à l'information selon un modèle particulier. Les relations avec les rendements observées dans un échantillon historique n'en font pas une prévision autonome et ne prouvent pas qu'une stratégie soit rentable après coûts.
Q3Quelle est la différence entre PIN et VPIN ?
PIN classique ajuste un mélange paramétrique aux nombres d'arrivées d'achats et de ventes sur des périodes temporelles. VPIN utilise des compartiments de volume et un déséquilibre calculé sur une horloge de volume. Leurs hypothèses, données et interprétations diffèrent ; les performances prédictives de VPIN ont été contestées.
Q4Pourquoi deux estimations PIN du même titre peuvent-elles différer ?
Elles peuvent utiliser des règles de classification des transactions, des marchés, durées de période, fenêtres, variantes du modèle, valeurs initiales ou routines d'optimisation différentes. Les solutions de frontière et les erreurs de données peuvent aussi influer sur l'ajustement. Il faut aligner et documenter ces choix avant de comparer les estimations.
Sources et lectures complémentaires
Signaler un problème
Nous préparons un e-mail avec le lien de cet article. Mark ne reçoit le signalement qu’après son envoi
Vérification rapide
Guide terminé ? Vérifiez vos acquis avec 3 questions
Question 01
Dans le modèle PIN classique symétrique, que représente ε ?
Choisissez une réponse pour voir l'explication
Glossaire des options
Des définitions claires des termes essentiels, des calls, puts et chaînes d’options à la volatilité implicite, aux sensibilités et à l’écart acheteur-vendeur
Parcourir le glossaire des options