Skip to content
Todos os guias de opções e contratos futuros
Econometria de frequências mistas13 min read

Regressão MIDAS: dados de frequências mistas e previsão de volatilidade

Entenda como a regressão MIDAS combina dados financeiros diários e semanais com pesos parcimoniosos para defasagens, como construir uma previsão de volatilidade e onde modelos de frequências mistas podem induzir a erro.

Neste guiaA MIDAS trata da diferença entre frequências de observação

Resumo breve

A regressão MIDAS (mixed data sampling, ou amostragem de dados mistos) conecta observações registradas em frequências diferentes sem forçar primeiro todas as séries a um mesmo calendário. Um pequeno número de parâmetros estimados define pesos para o histórico de observações de frequência mais alta, o que pode ajudar a prever uma variável financeira de frequência mais baixa. Os pesos descrevem um padrão preditivo sob o modelo escolhido; não demonstram causalidade nem uma vantagem de negociação.

A MIDAS trata da diferença entre frequências de observação

Dados financeiros e econômicos não chegam no mesmo relógio. Uma variável-alvo de volatilidade pode ser medida semanalmente, enquanto seus possíveis preditores são retornos diários ou medidas realizadas intradiárias. Uma série macroeconômica pode ser trimestral, enquanto o preço de um ativo é observado a cada pregão. Uma regressão comum espera uma linha por observação para a variável-alvo e os preditores; por isso, antes de estimar um modelo conhecido, o analista precisa decidir o que fazer com esses calendários diferentes.

Uma opção é agregar os dados diários em uma média ou soma semanal. É simples, mas impõe um peso específico a cada dia e pode apagar em que momento da semana ocorreu um movimento. Outra opção é repetir um valor trimestral em linhas diárias ou interpolá-lo. A repetição pode fazer um dado que muda lentamente parecer muitas observações novas; a interpolação pode introduzir uma trajetória suave que nunca foi observada. Nenhuma dessas operações cria informação nova.

A MIDAS oferece uma forma direta de conectar as frequências. Ela mantém a variável-alvo em sua frequência natural mais baixa e inclui uma defasagem estruturada da série de frequência mais alta. O nome se refere à amostragem de dados mistos, não a um único modelo de volatilidade. Pesquisadores usam regressões MIDAS para previsão de volatilidade e em outras situações nas quais os preditores têm intervalos de amostragem menores do que o resultado. A questão central é quanto do histórico recente de alta frequência usar e como restringir seus pesos.

Uma defasagem ponderada transforma muitas observações em um preditor compacto

Seja \(y_{t+1}\) uma variável-alvo de frequência mais baixa, como a variância realizada da próxima semana, observada após o fim da semana \(t+1\). Seja \(x_{t-j}\) um preditor diário observado \(j\) pregões antes da origem da previsão, no fechamento da semana \(t\). Uma regressão MIDAS simples é \(y_{t+1}=a+b\sum_{j=1}^{K}w_j(\theta)x_{t-j}+u_{t+1}\), em que \(K\) é o número de defasagens diárias, \(w_j(\theta)\) é um peso controlado por um pequeno vetor de parâmetros e \(u_{t+1}\) é o erro de previsão.

Os pesos costumam ser normalizados para que \(\sum_{j=1}^{K}w_j(\theta)=1\). Isso facilita a leitura da soma ponderada como um histórico com pesos, enquanto \(b\) controla a força da relação com a variável-alvo. A normalização não significa que as observações diárias sejam independentes ou igualmente informativas. É uma parametrização conveniente do perfil de defasagens.

O analista pode escolher \(x\) como retornos diários ao quadrado, retornos absolutos, uma medida de variância realizada construída com retornos intradiários ou outra variável disponível na origem da previsão. \(y\) pode ser a variância semanal futura, uma divulgação macroeconômica mensal ou outra variável-alvo de frequência mais baixa. A definição da variável-alvo determina o significado dos coeficientes. Um modelo para uma aproximação de variância realizada não é automaticamente um modelo de variância instantânea latente, variância implícita em opções ou retorno de preço.

A MIDAS é um arcabouço de regressão, não um estimador universal. A resposta pode ser modelada em níveis, logaritmos ou por meio de uma função de ligação; a estimação depende da família de pesos e das hipóteses sobre os erros escolhidas. Uma regressão linear de uma aproximação não negativa de variância pode gerar previsões ajustadas negativas, a menos que a especificação restrinja a previsão ou transforme a variável-alvo. A conveniência do modelo não elimina a necessidade de verificar o suporte e as unidades da variável-alvo.

A função de pesos troca flexibilidade por estabilidade

Uma regressão de defasagens distribuídas sem restrições estima um coeficiente separado para cada uma das \(K\) entradas diárias. Se \(K\) for grande em relação ao número de observações semanais da variável-alvo, as estimativas podem ser ruidosas e muito correlacionadas. Em vez disso, a MIDAS define os coeficientes das defasagens por uma função de baixa dimensão. Um perfil ilustrativo de Almon exponencial é \(w_j(\theta)=\frac{\exp(\theta_1j+\theta_2j^2)}{\sum_{\ell=1}^{K}\exp(\theta_1\ell+\theta_2\ell^2)}\). Um perfil polinomial Beta normalizado também é comum.

Esses perfis podem dar mais peso aos pregões recentes, reduzi-lo gradualmente ou atribuir relativamente mais peso a uma parte intermediária da janela. Os parâmetros descrevem a curva suave escolhida, não a importância de cada dia sem ressalvas. Se os dados sustentam uma resposta breve, mas a função selecionada impõe uma cauda longa e suave, os coeficientes estimados herdam essa restrição. Por outro lado, estimar muitos coeficientes diários livres pode ajustar ruído em vez de uma dinâmica estável.

Restrições aos pesos são hipóteses do modelo. Pesos normalizados não negativos podem tornar uma previsão de variância interpretável como média ponderada, mas excluem efeitos positivos e negativos de defasagem que se compensariam. Um perfil flexível pode permitir uma elevação ou uma mudança de inclinação, mas parâmetros de forma em excesso podem ficar fracamente identificados. Compare algumas formas defensáveis, informe quais defasagens estavam disponíveis e avalie se a previsão muda materialmente quando a família de pesos muda.

Não existe um \(K\) universal. Uma janela mais longa pode capturar informação persistente, mas acrescenta parâmetros ou impõe um perfil mais prolongado; uma janela curta pode deixar passar dinâmicas lentas. O número de defasagens deve ser escolhido usando informação disponível no período de estimação e validado sem usar a variável-alvo futura de avaliação. Um bom ajuste dentro da amostra, por si só, não mostra que a janela captura um sinal repetível.

Observações de alta frequência passam por uma curva de pesos de defasagem, que dá mais peso às mais recentes antes de gerar um resultado de frequência menor
Esquema conceitual de entradas em frequências mistas, pesos de defasagem e uma previsão de frequência menor; não são dados observados

Alinhe a origem da previsão ao momento em que cada dado era conhecido

Os rótulos de frequência não bastam para estabelecer um desenho válido de previsão. Suponha que a variável-alvo seja a variância da próxima semana de cinco pregões e que a previsão seja emitida após o fechamento de sexta-feira. Os preditores podem incluir observações diárias encerradas até aquele fechamento, mas não uma estatística de variância realizada calculada com retornos da semana seguinte. Se a variável-alvo for uma estatística semanal ou mensal publicada, a divulgação pode ocorrer depois do período que ela descreve. Um backtest deve usar o valor que realmente estava disponível, não um dado revisado ou publicado posteriormente.

Antes de ajustar o modelo, registre uma tabela da origem da previsão: quando ela é emitida, o horário mais recente permitido para cada preditor, o período da variável-alvo e quando ela se torna observável. Para retornos financeiros, especifique se o retorno entre fechamentos inclui o intervalo noturno, qual pregão define um dia e como feriados ou barras ausentes alteram a contagem de defasagens diárias. Cinco pregões e sete dias corridos são intervalos diferentes.

Calendários de divulgação criam bordas irregulares. Em uma data, um preditor pode ter um valor diário recente enquanto uma série mensal ainda não foi divulgada. Carregar o último valor mensal disponível pode ser válido se o modelo o tratar como informação desatualizada, mas conhecida na origem. É inválido preencher a observação ainda não publicada usando uma divulgação posterior. Revisões históricas podem criar um problema mais sutil de antecipação: uma base atual pode conter uma série macroeconômica revisada que um previsor em tempo real não teria visto.

Mercados assíncronos acrescentam outro problema de alinhamento. Um fechamento diário de ações e um fechamento diário de criptoativos podem se referir a intervalos UTC diferentes; uma estimativa de volatilidade intradiária pode usar barras que terminam depois do horário da previsão. Conversão de fuso horário, mudanças de horário de verão, fechamento de plataformas e construção das barras fazem parte do conjunto de informação. Declare como esses pontos são tratados, em vez de supor que linhas com a mesma data compartilham o mesmo corte de informação.

Um exemplo hipotético converte entradas diárias em uma previsão semanal

Suponha que a variável-alvo seja a variância realizada da próxima semana e que a previsão seja emitida no fechamento de sexta-feira. O modelo usa cinco medidas diárias de variância realizada da semana concluída. Os pesos estimados, do pregão mais recente para o mais antigo, são \(0{,}40, 0{,}25, 0{,}16, 0{,}11, 0{,}08\), que somam um. As entradas diárias correspondentes, em unidades de retorno ao quadrado, são \(0{,}0004, 0{,}0001, 0{,}0009, 0{,}0004, 0{,}0001\).

O histórico ponderado é \(0{,}40(0{,}0004)+0{,}25(0{,}0001)+0{,}16(0{,}0009)+0{,}11(0{,}0004)+0{,}08(0{,}0001)=0{,}000381\). Para esse modelo hipotético ajustado, suponha que o intercepto seja \(a=0{,}00012\) e a inclinação \(b=0{,}80\). A previsão da variância para a próxima semana é \(0{,}00012+0{,}80(0{,}000381)=0{,}0004248\). Se for útil apresentar um resumo em desvio-padrão, a raiz quadrada é aproximadamente \(0{,}02061\), ou \(2{,}06\%\) durante a semana-alvo, segundo a definição escolhida.

A conta ilustra o mapeamento de preditores diários para uma variável-alvo semanal futura; os valores e coeficientes ajustados são inventados. Ela não afirma que algum dos dias listados causou a variância da semana seguinte, nem que o ativo provavelmente subirá ou cairá. O peso do pregão recente mostra como o modelo preditivo especificado combina as entradas observadas, condicionado à amostra e às restrições. Não é uma estimativa de resposta causal.

O exemplo também evidencia uma questão de unidades. Variância realizada diária e variância realizada semanal são ambas variâncias de retornos, mas se referem a intervalos de acumulação diferentes. A inclinação \(b\), o intercepto e a construção da variável-alvo são estimados para essa convenção exata; não se pode simplesmente rebatizar as entradas diárias como variância semanal. Se a variável-alvo fosse o logaritmo da variância semanal, a previsão estaria em unidades logarítmicas e, em geral, exponenciar a média condicional do logaritmo não seria igual à média condicional da variância. Qualquer transformação de volta aos níveis exige uma variável-alvo de previsão explícita e, quando apropriado, uma correção de viés da transformação inversa.

A estimação depende da variável-alvo e da restrição às defasagens

Dado um vetor de pesos fixo, a regressão é linear no intercepto e na inclinação. Quando os pesos dependem de parâmetros não lineares desconhecidos \(\theta\), a estimação costuma usar mínimos quadrados não lineares ou um método relacionado baseado em verossimilhança. O estimador busca em conjunto os parâmetros da forma dos pesos e os coeficientes de regressão, ou elimina por perfil os coeficientes lineares para cada forma candidata. Valores iniciais, limites dos parâmetros, critérios de convergência e a existência de vários ótimos locais podem importar; uma estimativa não deve ocultar soluções que não convergiram ou ficaram no limite.

Se \(y\) for uma medida de volatilidade não negativa, uma especificação linear comum pode gerar uma previsão ajustada negativa, especialmente fora da amostra. As opções incluem restrições que mantenham a previsão de nível não negativa, uma função de ligação positiva ou um modelo para o logaritmo da variável-alvo. Essas escolhas mudam o estimando e a interpretação da previsão. Em um modelo com variável-alvo em log, prever a média condicional do logaritmo da variância não fornece automaticamente a média condicional da variância; a distribuição do erro e a transformação de volta aos níveis importam.

A incerteza amostral também reflete como a variável-alvo foi construída. A variância realizada semanal calculada com retornos intradiários contém erro de medição e pode ser sensível a ruído de microestrutura, intervalo de amostragem, saltos e observações ausentes. Se as janelas semanais da variável-alvo se sobrepõem, erros de previsão de origens vizinhas compartilham retornos subjacentes. Nesse caso, erros-padrão e comparações que presumem erros de previsão independentes podem ser inadequados. Use inferência compatível com o horizonte e a estrutura de dependência e informe como a variável-alvo foi medida.

A estabilidade dos parâmetros também é uma preocupação. Um perfil de pesos estimado faz a média do período de estimação; se a estrutura do mercado mudar, a curva talvez não descreva bem nenhum regime atual. Estimações com janela expansiva e janela móvel respondem a perguntas diferentes: a primeira usa mais histórico, mas conserva dinâmicas antigas; a segunda se adapta mais rápido, porém tem menos observações e maior ruído de estimação. Especifique a regra de atualização com antecedência e compare-a a um benchmark fixo em uma avaliação cronológica.

MIDAS é relacionada a GARCH-MIDAS, mas não é a mesma coisa

MIDAS nomeia uma forma de combinar observações amostradas em frequências diferentes por meio de defasagens ponderadas. Uma regressão MIDAS pode prever diretamente uma variável-alvo futura de volatilidade realizada com medidas diárias ou intradiárias passadas. Ela não precisa especificar a recursão de variância condicional de um passo associada a um modelo GARCH.

GARCH-MIDAS é uma família distinta que combina um componente de volatilidade de longo prazo, que costuma mudar lentamente e ser impulsionado por variáveis de frequência mais baixa, com um componente de variância condicional de curto prazo que evolui recursivamente. Os dois componentes têm parametrizações e hipóteses próprias. Ao encontrar o rótulo GARCH-MIDAS em um artigo ou pacote de software, examine as equações exatas: os pesos MIDAS podem reger o componente de longo prazo, enquanto uma recursão GARCH trata os choques de curto prazo. O rótulo, por si só, não revela a variável-alvo, se a previsão é de volatilidade latente ou realizada, nem como a positividade é imposta.

Os primeiros trabalhos financeiros sobre MIDAS e volatilidade comparam preditores, frequências e extensões de defasagens diferentes em um arcabouço parcimonioso de previsão. Trabalhos metodológicos posteriores desenvolvem propriedades de estimação e teste para regressões de frequências mistas, incluindo comparações com agregação temporal tradicional. Essas contribuições sustentam a mecânica, não a afirmação de que MIDAS sempre supera GARCH ou de que preditores de alta frequência sempre melhoram uma previsão. Os resultados dependem do ativo, da amostra, da variável-alvo, do preditor, do horizonte e do desenho de avaliação.

Escolha o modelo de acordo com a pergunta. Se o objetivo for prever uma medida futura de volatilidade realizada usando o histórico diário, uma regressão MIDAS direta pode ser uma candidata natural. Se o objetivo for modelar a variância condicional recursivamente, compare uma especificação GARCH adequada. Se a tarefa combinar divulgações macroeconômicas trimestrais com uma variável-alvo financeira diária, uma regressão de frequências mistas talvez precise controlar as versões dos dados disponíveis em cada divulgação. Modelos com nomes parecidos podem responder a perguntas diferentes; compare as origens das previsões, as definições das variáveis-alvo e os conjuntos de informação antes de comparar o desempenho.

Erros de medição e seleção podem superar o efeito da curva de pesos

Dados de alta frequência oferecem mais detalhe temporal, mas podem aumentar o ruído de medição. Barras muito curtas contêm oscilação entre bid e ask, discretização de preços, cotações desatualizadas, negociação assíncrona e erros de feed. Somar retornos ao quadrado em intervalos cada vez menores não garante uma estimativa melhor da variância realizada. Escolha a grade de amostragem e as regras de limpeza antes de examinar o desempenho da previsão e faça uma análise de sensibilidade com alternativas plausíveis.

O número de resultados de frequência mais baixa, e não a aparente quantidade de linhas diárias dos preditores, limita o que pode ser aprendido. Dez anos de entradas diárias pareadas com variáveis-alvo semanais ainda fornecem apenas cerca de quinhentos períodos semanais de resultado, antes de dados ausentes e do período reservado à avaliação. Uma função de pesos suave usa menos coeficientes do que defasagens diárias livres, mas sua forma ainda pode ficar fracamente identificada quando a amostra é curta, os preditores são muito persistentes ou as defasagens candidatas são redundantes.

Muitas escolhas analíticas criam viés de seleção: testar várias medidas de alta frequência, extensões de defasagem, perfis de pesos, transformações, mercados, horizontes de previsão e funções de perda, e depois apresentar apenas o melhor resultado. O ajuste dentro da amostra é especialmente vulnerável porque as mesmas variáveis-alvo orientam a estimação dos parâmetros e as escolhas de modelo. Registre a família de modelos testada, escolha uma métrica principal e use uma amostra cronológica posterior reservada ou uma comparação que considere a seleção. Se muitos prognósticos forem comparados nas mesmas datas, leve em conta dependência e multiplicidade, em vez de tratar cada resultado como confirmação independente.

Uma curva de pesos estimada não é uma explicação causal. As entradas de alta frequência podem funcionar como indicadores de notícias, liquidez ou atividade de mercado; fatores não observados podem afetar tanto os preditores quanto a volatilidade futura. Utilidade preditiva exige alinhamento temporal estável e evidência fora da amostra. Uma interpretação causal exigiria um desenho de identificação e hipóteses adicionais, além da equação de defasagens MIDAS.

Uma previsão não define uma decisão de negociação lucrativa

Uma previsão de volatilidade pode informar um orçamento de risco, o tamanho de uma proteção ou uma faixa de cenários, mas não especifica o sinal do retorno nem a direção de uma posição. Um desvio-padrão semanal previsto de \(2{,}06\%\) não é um movimento prometido, uma perda máxima nem uma cotação de volatilidade implícita de opções. A previsão se refere a uma medida de dispersão escolhida sob um modelo e uma amostra ajustados; os retornos realizados ainda podem ser muito maiores ou menores.

Para estudar uma estratégia, defina o horário do sinal, o horário da ordem, o instrumento, a regra de exposição e a saída antes de testar. Reestime os parâmetros MIDAS em cada origem histórica usando apenas informações que estariam disponíveis naquele momento. Avalie as previsões em relação a um benchmark predefinido e a uma função de perda coerente com a variável-alvo; depois, simule separadamente os retornos após spread, tarifas, funding, aluguel, impacto de mercado e giro da carteira. Uma previsão de variância pode ser estatisticamente melhor sem elevar o retorno líquido após custos.

Informe a variável-alvo e seu procedimento de amostragem; definições e unidades dos preditores; frequências mais baixa e mais alta; origem da previsão; número de defasagens; função de pesos e restrições; janela de estimação e calendário de atualização; tratamento de dados ausentes e versões de dados; função de perda; benchmark e datas do teste cronológico. Apresente a incerteza ou a sensibilidade ao perfil de defasagens quando essas escolhas alterarem materialmente o resultado. Para contexto relacionado, veja os guias sobre volatilidade realizada, agrupamento de volatilidade e GARCH e comparação da precisão de previsões.

As fontes primárias incluem o estudo de previsão de volatilidade MIDAS de Ghysels, Santa-Clara e Valkanov; a revisão metodológica e suas extensões de Ghysels, Sinko e Valkanov; e a análise de modelos de regressão de frequências mistas de Andreou, Ghysels e Kourtellos. Os resultados empíricos se referem às amostras e aos desenhos estudados; não garantem desempenho em um mercado atual ou em outra classe de ativos.

Perguntas frequentes

Q1MIDAS significa que todos os dados são promediados para uma única frequência?

Não. Uma regressão MIDAS mantém a variável-alvo na frequência escolhida e usa uma defasagem ponderada estruturada de preditores de frequência mais alta. Ela não precisa interpolar todas as séries para colocá-las em um calendário comum, linha por linha.

Q2Regressão MIDAS é a mesma coisa que GARCH-MIDAS?

Não. MIDAS é um arcabouço de defasagens ponderadas para frequências mistas. GARCH-MIDAS combina um componente de longo prazo no estilo MIDAS com uma recursão GARCH de variância de curto prazo. Examine as equações do modelo para identificar a variável-alvo e seus componentes.

Q3Uma previsão MIDAS de volatilidade melhor pode ser usada como sinal de negociação?

Não por si só. Uma previsão de volatilidade descreve uma medida de dispersão escolhida. Uma estratégia exige uma regra direcional ou de risco especificada separadamente, custos realistas de execução e uma avaliação cronológica após custos.

Fontes e leituras adicionais

Relatar um problema

Vamos preparar um e-mail com o link deste artigo. Mark só receberá o relato depois que você enviar

Verificação rápida

Terminou o guia? Confira o que aprendeu com 3 perguntas

Pergunta 1 / 3

Pergunta 01

Qual é a principal função da função de pesos MIDAS?

Escolha uma resposta para ver a explicação

Glossário de opções