Model Confidence Set (MCS): compare modelos de previsão sem forçar um vencedor
Entenda como o Model Confidence Set usa testes sequenciais e bootstrap para dados dependentes para manter modelos de previsão que as evidências não conseguem distinguir.
Neste guiaQue pergunta o Model Confidence Set responde?
Resumo breve
O Model Confidence Set (MCS) compara uma família definida de procedimentos de previsão e retorna os candidatos que não puderam ser considerados inferiores sob a função de perda escolhida. Vários modelos podem permanecer quando a amostra não os distingue; o resultado depende da família de candidatos, do desenho da previsão, da perda e do procedimento de inferência.
Que pergunta o Model Confidence Set responde?
Suponha que você tenha vários procedimentos para prever a volatilidade do próximo dia. Os erros diferem, mas a amostra pode ser curta ou ruidosa demais para indicar qual procedimento tem a menor perda esperada. Escolher o menor loss médio imporia um vencedor mesmo quando a diferença pode ser variação amostral. O MCS oferece uma resposta em forma de conjunto: quais candidatos continuam estatisticamente compatíveis com a melhor previsão segundo um critério definido?
O MCS começa com um conjunto de candidatos \(\mathcal M_0\), uma função de perda ou outro critério e um nível de confiança. Ele testa repetidamente se os candidatos ainda em consideração têm capacidade preditiva igual. Se o teste rejeitar a hipótese, uma regra de eliminação remove um candidato considerado relativamente fraco, e o teste continua no conjunto menor. Os sobreviventes formam o MCS. Hansen, Lunde e Nason apresentam o procedimento como um conjunto de confiança para o melhor modelo ou modelos da coleção especificada, assim como um intervalo de confiança para parâmetros pode conter mais de um valor quando os dados são imprecisos (artigo de 2011).
“Melhor” é relativo à comparação: aos candidatos incluídos, ao alvo, ao horizonte, às informações disponíveis em cada origem e ao critério de avaliação. O MCS não exige que um candidato seja o verdadeiro processo gerador dos dados e pode manter vários candidatos com o mesmo melhor desempenho esperado. Ele não é uma probabilidade posterior de que um modelo retido esteja correto.
Defina a família de candidatos e a pergunta da previsão
Antes de calcular as perdas, defina \(\mathcal M_0\). Um candidato pode ser um modelo estimado junto com as regras de estimação e atualização da previsão, ou um procedimento de previsão que não seja descrito como modelo estatístico. Por exemplo, “GARCH” não está totalmente especificado se a distribuição da volatilidade, a janela móvel, as atualizações dos parâmetros e o horizonte podem variar. Cada escolha pode gerar um candidato diferente.
Cada candidato precisa prever o mesmo alvo nas mesmas origens e horizonte, usando apenas informações que estariam disponíveis naquele momento. As perdas brutas não são comparáveis de forma justa se um modelo prevê variância de um dia e outro prevê volatilidade de cinco dias. Use uma amostra de avaliação comum, alinhe observações ausentes explicitamente e registre a versão dos dados, a janela inicial de estimação, o calendário recursivo ou móvel e o tratamento de entradas revisadas. Previsões sobrepostas no tempo podem fazer com que perdas de origens próximas compartilhem observações.
Escolha o critério antes de observar os resultados. Erro quadrático, erro absoluto ou uma perda específica da decisão podem ordenar previsões pontuais de maneiras diferentes. Uma previsão de variância pode exigir uma perda de volatilidade adequada a uma proxy ruidosa; uma previsão de quantil precisa de um quantile score, não de erro quadrático médio. Um MCS bom sob uma perda não implica um bom resultado sob outra. Se a lista foi reduzida após a inspeção dos mesmos resultados de avaliação, o conjunto formal fica condicionado a essa seleção não relatada e deixa de refletir a busca completa.
Transforme previsões comuns em diferenças de perda pareadas
Seja \(y_{t+h}\) o alvo realizado para uma previsão feita na origem \(t\), e \(\hat y_{i,t+h|t}\) a previsão do candidato \(i\). Para uma função de perda \(L\) predefinida, calcule uma perda por candidato e origem comum:
\[ L_{i,t}=L(y_{t+h},\hat y_{i,t+h|t}) \]
Suponha que uma perda menor seja melhor. Para os candidatos \(i\) e \(j\), defina a diferença pareada:
\[ d_{ij,t}=L_{i,t}-L_{j,t}, \qquad \bar d_{ij}=\frac{1}{P}\sum_{t=1}^{P}d_{ij,t} \]
Aqui, \(P\) é o número de origens comuns. Com essa convenção de sinal, \(\bar d_{ij}\) positivo significa que o candidato \(i\) teve perda média maior que \(j\) na amostra; um valor negativo favorece \(i\). O pareamento importa porque ambos enfrentam os mesmos resultados realizados. Choques comuns de mercado podem aumentar as duas perdas, enquanto a diferença isola o desempenho relativo.
A hipótese nula de capacidade preditiva igual para o conjunto atual \(\mathcal M\) pode ser escrita assim:
\[ H_{0,\mathcal M}:\quad \mu_{ij}=E[d_{ij,t}]=0 \quad \text{para todo } i,j\in\mathcal M \]
Essa é uma afirmação conjunta sobre o conjunto atual, não uma coleção de testes pareados sem relação entre si, examinados um a um. O framework original do MCS usa um teste conjunto de equivalência e uma regra de eliminação para administrar a busca entre modelos. Ele não pergunta se as previsões foram exatamente iguais em cada data.
Teste o conjunto atual e defina como um candidato pode sair
O procedimento MCS alterna entre um teste no nível do conjunto e uma etapa de eliminação. Comece com \(\mathcal M=\mathcal M_0\) e teste a capacidade preditiva igual no nível \(\alpha\) escolhido. Se o teste não rejeitar, pare e informe o conjunto atual. Se rejeitar, use uma regra de eliminação predefinida para remover um candidato e repita o teste no conjunto menor. Sob as premissas do procedimento, o conjunto sobrevivente é o MCS \((1-\alpha)\).
O artigo desenvolve duas estatísticas conhecidas. A estatística range procura a maior diferença pareada de perda padronizada:
\[ T_{R,\mathcal M}=\max_{i,j\in\mathcal M}|t_{ij}|, \qquad t_{ij}=\frac{\bar d_{ij}}{\widehat{\mathrm{se}}(\bar d_{ij})} \]
A regra de eliminação correspondente remove o candidato com a maior desvantagem padronizada frente a outro. Uma segunda estatística compara cada candidato ao desempenho médio do conjunto atual:
\[ T_{\max,\mathcal M}=\max_{i\in\mathcal M}t_{i\cdot}, \qquad d_{i\cdot,t}=\frac{1}{|\mathcal M|}\sum_{j\in\mathcal M}d_{ij,t} \]
Aqui, \(t_{i\cdot}\) padroniza a média de \(d_{i\cdot,t}\); sua regra associada remove o candidato com o maior excesso padronizado de perda em relação à média do conjunto. Estatística e regra de eliminação formam um par. Escolha e informe as duas como um procedimento, sem misturá-las depois de observar qual produz um conjunto menor. O artigo do MCS explica por que o teste de rejeição precisa ser coerente com a regra que identifica o candidato a remover (Hansen, Lunde e Nason).
Preserve a dependência temporal no bootstrap
A distribuição de uma estatística máxima depende da variabilidade conjunta das diferenças de perda dos candidatos. Tratar cada modelo ou data como uma observação independente pode romper os dois tipos de dependência: perdas sucessivas podem ter correlação serial, e as perdas de dois candidatos na mesma data são pareadas. O bootstrap do MCS precisa preservar a estrutura conjunta relevante da série temporal ao aproximar a distribuição nula da estatística do conjunto.
Uma opção é reamostrar blocos temporais alinhados do vetor de perdas ou diferenças dos candidatos. No stationary bootstrap, os comprimentos dos blocos são aleatórios e a série reamostrada pode recomeçar em uma data escolhida aleatoriamente. Politis e Romano introduziram o método para observações estacionárias com dependência fraca (artigo de 1994). Os autores do MCS descrevem implementações block bootstrap e citam o stationary bootstrap como alternativa. Reamostrar separadamente a série de perdas de cada modelo destrói o pareamento na mesma data e pode alterar a comparação.
Comprimento médio do bloco, variante de bootstrap, centralização sob a hipótese de capacidade igual, número de repetições e horizonte afetam a estimativa de incerteza. Horizontes mais longos e sobrepostos costumam aumentar a dependência das diferenças de perda, mas não há comprimento de bloco universal para todos os alvos e amostras. Explique o desenho e verifique se a conclusão muda em configurações razoáveis de dependência. O resultado do bootstrap é uma aproximação sob suas premissas, não corrige look-ahead, holdout reutilizado, comportamento não estacionário das pontuações ou família incompleta de candidatos.
Calcule uma comparação hipotética entre quatro modelos
Suponha que quatro procedimentos A, B, C e D prevejam o mesmo alvo de volatilidade em 120 origens diárias comuns. As perdas médias quadráticas são 1,20, 1,23, 1,45 e 1,90, em unidades ilustrativas de pontos percentuais ao quadrado. As médias colocam A em primeiro e D em último, mas a classificação não informa a incerteza da amostra.
Para A contra B, a diferença média pareada é \(1.20-1.23=-0.03\). Se o erro padrão que considera a dependência for \(0.04\), a estatística pareada será \(-0.03/0.04=-0.75\). Esse único contraste não mostra uma diferença estatística clara entre A e B. O MCS não para aí: sua estatística conjunta considera os contrastes entre os quatro candidatos.
Para ilustrar, suponha que uma execução de MCS com block bootstrap sobre a série completa de 120 origens use \(T_R\), \(\alpha=0.05\) e uma regra coerente que elimina o pior candidato. Suponha que o p-value do conjunto completo seja 0.018, D seja removido e depois o p-value para \(\{A,B,C\}\) seja 0.11. Como 0.11 supera 0.05, o procedimento para com \(\{A,B,C\}\) como MCS hipotético de 95%. C permanece apesar da perda média maior que a de A: essa execução hipotética não estabeleceu que C seja inferior no teste conjunto.
Os p-values foram inventados para demonstrar as etapas; não podem ser reconstruídos a partir das quatro perdas médias nem do contraste A–B. Um resultado real exige a série completa de perdas por origem, previsões dos candidatos, desenho do bootstrap e sequência de eliminação. Guarde esses dados e informe a sequência completa para que o leitor veja qual candidato saiu em cada rejeição. <!-- learn:illustration -->

Interprete o conjunto sobrevivente sem exagerar
No nível de confiança de 95%, sob condições de regularidade e premissas dos testes, o MCS é projetado para conter o melhor candidato do conjunto especificado com pelo menos a cobertura assintótica indicada. Isso não significa que cada modelo retido tenha 95% de probabilidade de ser o melhor. A afirmação de confiança trata da cobertura em amostras repetidas, não de uma distribuição posterior sobre rótulos de modelos.
Não rejeitar a capacidade preditiva igual não prova que as perdas esperadas dos candidatos sejam idênticas. O teste pode ter pouco poder se o período de avaliação for curto, as diferenças de perda forem muito voláteis ou vários candidatos estiverem próximos. Um conjunto grande pode indicar honestamente que os dados não separam as alternativas. Ele também pode conter modelos todos ruins em termos absolutos, pois o MCS compara candidatos entre si, não contra um padrão externo obrigatório.
O conjunto também se limita ao que entrou em \(\mathcal M_0\). Se uma procedure realmente melhor foi omitida, o MCS não pode descobri-la. Se um modelo foi removido antes da análise após uma consulta aos mesmos dados de avaliação, a cobertura nominal não considera essa busca não registrada. Informe como os candidatos foram gerados e filtrados. Quando vários compartilham a menor perda esperada, manter mais de um é compatível com o método, não uma falha em escolher.
Diferencie o MCS dos testes pareados e dos testes contra benchmark
O teste Diebold–Mariano se concentra na diferença pareada de perda entre dois procedimentos de previsão. O MCS testa repetidamente um conjunto e informa quais candidatos sobrevivem à eliminação conjunta. Executar muitos testes DM e manter os pares não significativos não equivale automaticamente ao MCS; o bootstrap conjunto e a regra coerente de eliminação importam.
O teste Clark–West trata de uma comparação mais restrita de erro quadrático quando um modelo inclui um benchmark restrito e o ruído de estimação afeta a diferença bruta. O MCS não exige candidatos aninhados e aceita uma perda definida pelo usuário, mas ainda precisa de um desenho de previsão comum.
O Reality Check de White e o teste Superior Predictive Ability de Hansen perguntam se pelo menos um membro de uma família pesquisada supera um benchmark designado. O MCS não depende de benchmark e descreve um conjunto de candidatos relativamente superiores. Todos exigem um relato fiel da busca e da dependência, mas respondem a hipóteses nulas diferentes. Consulte o guia Reality Check e SPA e os artigos originais de White (2000) e Hansen (2005).
Relate o desenho e separe a classificação de previsões do valor de negociação
Um relatório reproduzível do MCS identifica cada procedimento candidato, alvo e horizonte comuns, regras de origem e informação, cronograma de estimação, datas de avaliação, tratamento de dados ausentes, fórmula de perda e direção considerada melhor. Informe nível de significância, estatística e regra de eliminação, tipo de bootstrap, comprimento do bloco, centralização, número de repetições, p-values em cada etapa e conjunto final. Perdas médias dão contexto, mas não substituem a inferência conjunta por uma tabela de classificação.
Na avaliação de volatilidade, explique como a proxy observada foi formada e se é ruidosa ou revisada. Em previsões de vários passos, informe a sobreposição das janelas do alvo e o método para dependência. Mostre sensibilidade a mudanças plausíveis na perda, período amostral e configurações de bootstrap quando elas alterarem o conjunto. Um p-value pequeno sem os candidatos eliminados e os detalhes do procedimento não basta para reproduzir o conjunto.
O MCS classifica procedimentos preditivos segundo um critério. Ele não estabelece causalidade, não identifica o processo gerador dos dados nem prova que as previsões restantes criem uma operação lucrativa. Transformar previsão em posição exige limites, tamanho, giro, horário de execução, spread, taxas, slippage, financiamento, empréstimo e restrições de risco. Avalie a regra congelada em dados posteriores adequados e informe separadamente os resultados líquidos. Para perdas de volatilidade com proxies imperfeitas, consulte o guia QLIKE versus erro quadrático.
Perguntas frequentes
Q1O MCS escolhe um único melhor modelo?
Não necessariamente. Um candidato pode permanecer quando os dados o distinguem, ou vários podem continuar quando a amostra não permite apontar qual é inferior. Escolher um para implantação exige uma regra de decisão separada.
Q2Um modelo no MCS tem 95% de chance de estar correto?
Não. O nível de confiança descreve a cobertura, em amostras repetidas, do melhor candidato da família definida sob as premissas do método. Não é uma probabilidade posterior de que o modelo seja verdadeiro.
Q3Posso usar o MCS para algo além de previsões de volatilidade?
Sim. Ele pode comparar previsões, modelos econométricos ou outros candidatos quando se definem um critério comum relevante e um desenho amostral apropriado. O resultado sempre depende da família e da perda escolhidas.
Q4O MCS considera automaticamente todos os modelos que experimentei?
Somente se a busca real estiver representada na família de candidatos e no procedimento de avaliação. Uma seleção não documentada ou a reutilização dos dados de avaliação não é corrigida apenas por executar o MCS depois.
Fontes e leituras adicionais
Relatar um problema
Vamos preparar um e-mail com o link deste artigo. Mark só receberá o relato depois que você enviar
Verificação rápida
Terminou o guia? Confira o que aprendeu com 3 perguntas
Pergunta 01
O que o Model Confidence Set informa?
Escolha uma resposta para ver a explicação
Glossário de opções
Definições claras dos termos essenciais, de calls, puts e cadeia de opções a IV, gregas e spread bid-ask
Ver o glossário de opções