Tutte le guide sulle opzioni
Progetta un confronto più equo prima di stimare gli effetti18 min di lettura

Punteggi di propensione, matching e sovrapposizione

Scopri cosa bilanciano i propensity score, perché sovrapposizione e assenza di confondimento sono importanti, come matching e weighting cambiano l'estimand e quali diagnostiche rendono credibile uno studio finanziario.

A cura di Mark · Fonti primarie qui sotto

Risposta diretta

Un propensity score è la probabilità di ricevere il trattamento date le covariate osservate prima del trattamento. Fare matching o weighting su questo punteggio può rendere tali covariate misurate più comparabili tra gruppi trattati e non trattati. Non può bilanciare confondenti nascosti, correggere una sovrapposizione mancante o creare randomizzazione. Un'analisi credibile definisce quindi l'estimand, progetta il confronto senza consultare gli esiti, controlla equilibrio delle covariate e concentrazione dei pesi e riporta come trimming o matching cambiano la popolazione studiata.

Il trattamento osservazionale inizia dalla selezione

Imprese, investitori e mercati raramente adottano una politica in modo casuale. Dimensione, rischio, governance, liquidità e crescita attesa possono influenzare sia l'adozione sia gli esiti successivi.

Una differenza grezza negli esiti mescola quindi l'effetto del trattamento con differenze preesistenti. La correzione tramite regressione affronta lo stesso problema di identificazione, a meno che le sue ipotesi non siano difendibili.

La domanda di progettazione viene prima: tra quali unità il trattamento avrebbe potuto variare plausibilmente e quali fatti precedenti al trattamento spiegano quella scelta?

Un propensity score comprime le covariate osservate

Per le covariate X, il propensity score e(X) è la probabilità del trattamento condizionata a X. Le unità con lo stesso punteggio dovrebbero avere distribuzioni simili delle X misurate.

Questa proprietà di bilanciamento riduce un confronto multidimensionale a un solo punteggio, ma solo per le variabili fornite prima del trattamento. L'accuratezza predittiva non è l'obiettivo.

Il modello dovrebbe riflettere l'assegnazione del trattamento e la conoscenza sostantiva. Variabili post-trattamento e collider possono introdurre bias invece di rimuoverlo.

L'assenza di confondimento è il ponte causale

I metodi basati sulla propensione richiedono scambiabilità condizionale: dopo il condizionamento sulle covariate osservate, l'assegnazione del trattamento non è correlata agli esiti potenziali confrontati.

Questa affermazione non può essere verificata dai soli dati sottoposti a matching. Un'aspettativa omessa, un segnale privato o un'abilità manageriale possono ancora guidare trattamento e performance.

Il matching è quindi uno strumento di progettazione, non un certificato causale. Controlli negativi, ragionamento istituzionale e analisi di sensibilità dovrebbero affrontare il confondimento non misurato.

La sovrapposizione determina chi può essere confrontato

La positività significa che ogni profilo di covariate rilevante ha una possibilità significativa di comparire in entrambi i gruppi. Punteggi vicini a zero o uno rivelano un supporto comune sottile.

Nessun modello può fabbricare un analogo non trattato per un'unità trattata fuori dalla popolazione donatrice. Estrarre lì risultati per estrapolazione fa dipendere i risultati dalla forma funzionale invece che dall'evidenza.

Caliper, trimming e overlap weights possono migliorare la stabilità, ma cambiano la popolazione obiettivo. L'estimand rivisto va nominato, non nascosto.

Matching e weighting rispondono a domande diverse

Il matching nearest-neighbor o con caliper costruisce un campione di confronto. La subclassification confronta fasce di punteggio, mentre l'inverse-probability weighting crea una pseudo-popolazione ponderata.

I pesi per l'effetto medio del trattamento differiscono dai pesi per l'effetto sulle unità trattate. Gli overlap weights enfatizzano le unità il cui stato di trattamento era più incerto.

Le scelte influenzano bias, varianza e interpretazione. Riutilizzare controlli, scartare unità trattate e stimare i punteggi influiscono tutti sull'incertezza e dovrebbero entrare nell'inferenza.

L'equilibrio è la diagnostica principale della progettazione

Dopo l'aggiustamento, confronta ogni covariata con differenze medie standardizzate e grafici delle distribuzioni. Un AUC elevato del modello di trattamento non dimostra un buon equilibrio.

Esamina distribuzioni dei propensity score, conteggi non abbinati, dimensione campionaria effettiva e pesi massimi. Alcune osservazioni estreme possono dominare silenziosamente una stima.

L'esito dovrebbe restare nascosto mentre si mette a punto la progettazione. Altrimenti le scelte ripetute di matching possono diventare una ricerca della specifica guidata dall'esito.

Le applicazioni finanziarie hanno bisogno di una storia del trattamento

Supponi che le imprese che adottano una regola di disclosure in seguito negozino a costi inferiori. Il matching può confrontare gli adottanti con imprese simili per dimensione, volatilità, proprietà e liquidità precedente.

Fallisce comunque se l'adozione è seguita a un piano di finanziamento non misurato che ha migliorato anch'esso la liquidità. Tempistica e registri delle decisioni contano più di un lungo elenco di covariate.

Riporta data del trattamento, finestra precedente al trattamento, covariate, grafico della sovrapposizione, tabella dell'equilibrio, estimand, pesi, esclusioni, incertezza dell'effetto e sensibilità al bias nascosto.

Leggi la stima come un confronto progettato

Il risultato più solido non è quello che usa ogni osservazione. È quello sostenuto da una popolazione nella quale esistono davvero controparti credibili.

Separa il risultato osservabile della progettazione — migliore equilibrio delle covariate — dall'affermazione causale non verificabile — non resta alcun confondimento nascosto importante.

Se la stima cambia bruscamente con caliper, regole di trimming o scenari plausibili di bias nascosto, l'incertezza sulla progettazione deve far parte della conclusione.

Domande frequenti

Il matching rende randomizzato uno studio osservazionale?

No. Può migliorare la comparabilità sulle covariate osservate precedenti al trattamento, ma può restare un confondimento nascosto.

Il modello di propensione dovrebbe prevedere il trattamento con la massima accuratezza possibile?

No. Il suo scopo è l'equilibrio delle covariate per l'estimand obiettivo, non la performance di classificazione.

Cosa significa una sovrapposizione scarsa?

Significa che alcune unità trattate non hanno controparti non trattate credibili, quindi per i loro effetti servono estrapolazione o una popolazione obiettivo più ristretta.

Il trimming dei punteggi estremi è innocuo?

No. Può migliorare precisione e robustezza, ma cambia la popolazione descritta dalla stima.

Fonti e approfondimenti

Guide correlate