Janelas expansivas e móveis na validação walk-forward
Compare janelas de treinamento expansivas e móveis de tamanho fixo, separe a validação do teste final e escolha regras sem usar resultados futuros.
Neste guiaUm fold walk-forward tem janelas distintas de treinamento e avaliação
Resumo breve
Uma janela de treinamento expansiva mantém o histórico elegível mais antigo e acrescenta dados novos à medida que são observados. Uma janela móvel mantém uma quantidade fixa das observações elegíveis mais recentes e descarta as linhas antigas. As duas podem ser usadas na avaliação walk-forward em ordem cronológica; nenhuma elimina a necessidade de separar a seleção do modelo do período de teste final.
Um fold walk-forward tem janelas distintas de treinamento e avaliação
Na origem de uma previsão, o pesquisador conhece alguns recursos e resultados passados, ajusta ou atualiza o modelo e o avalia em um bloco posterior. Ao mover a origem para a frente, surgem períodos sequenciais fora da amostra. A regra da janela de treinamento define quais linhas passadas elegíveis entram em cada ajuste. As regras de validação e teste definem quais resultados posteriores são usados para comparar opções e estimar o desempenho. São decisões relacionadas, mas não representam a mesma janela.
A regra expansiva começa em um limite histórico fixo e cresce quando novos resultados ficam disponíveis. A regra móvel desloca as duas extremidades, mantendo o número de observações constante após o aquecimento inicial. Em ambos os casos, não use um alvo cujo resultado ainda não tenha terminado na origem da previsão. Se os rótulos abrangem várias sessões, a data da linha pode não indicar quando o resultado ficou conhecido; registre o horário de término do rótulo e respeite esse limite.
Separe também o período retrospectivo dos recursos da janela de treinamento. Um sinal pode calcular a volatilidade de cada linha usando um período recente curto, enquanto o modelo ajustado usa linhas de vários anos. Alterar o retrospecto do recurso muda os preditores; alterar a janela de treinamento muda as observações usadas para estimar o modelo.
Uma janela expansiva mantém o histórico inicial
Seja \(s\) o índice da primeira observação elegível e \(t\) o da observação mais recente cujo rótulo já terminou no momento do ajuste. O conjunto expansivo de treinamento é \(\{s,s+1,\ldots,t\}\). Na origem seguinte, as linhas são mantidas e novas linhas elegíveis são adicionadas. Portanto, o tamanho cresce com o tempo, a menos que uma regra separada filtre ou remova dados.
Mais observações podem reduzir o ruído amostral das estimativas dos parâmetros se os dados antigos ainda descreverem o processo estudado. Também podem preservar condições de mercado raras que uma amostra recente e curta deixaria de fora, além de evitar um corte histórico arbitrário. Por outro lado, linhas antigas não perdem influência só por serem antigas. Se a relação entre preditores e retornos mudar, os dados iniciais podem puxar as estimativas para condições que já não se parecem com o mercado atual. Ajustes maiores também podem ficar mais lentos. Preservar o histórico não o torna automaticamente mais representativo.
Uma janela móvel remove observações fora do intervalo escolhido
Para um tamanho fixo \(W\), o conjunto de treinamento na origem \(t\) é \(\{t-W+1,\ldots,t\}\), considerando o atraso dos rótulos e qualquer intervalo de separação na fronteira. Na origem seguinte, o fim avança e a linha elegível mais antiga sai. O tamanho pode ser expresso em número de observações ou tempo de calendário, mas essas unidades não são intercambiáveis quando os dados são irregulares.
A janela móvel estabelece uma regra de atualidade. Ela pode ser útil quando a pergunta de pesquisa trata da adaptação a condições variáveis ou quando a operação exige um tamanho de treinamento limitado. Mas não torna o modelo adaptativo por si só. Reajustes pouco frequentes ou mudanças graduais podem atrasar a resposta. Um intervalo curto fornece menos informação, pode tornar as estimativas instáveis, omitir períodos raros de estresse ou deixar poucos exemplos para um modelo complexo. Um intervalo mais longo preserva mais histórico, mas pode diluir padrões recentes.
A unidade de medida também importa: o mesmo número de linhas pode cobrir períodos de calendário diferentes por causa de feriados, dados ausentes ou frequência distinta. Em dados em painel, defina se a janela remove linhas ou grupos de ativos por data. Se \(W\) for escolhido depois de examinar o teste final, esse período passa a fazer parte da seleção e deixa de ser um teste independente.
As duas regras fornecem históricos diferentes a cada ajuste
| Escolha | Linhas de treinamento no ajuste | Vantagem possível | Custo a examinar |
|---|---|---|---|
| Expansiva | Todas as linhas elegíveis desde um início fixo até a origem | Mais observações e retenção de episódios antigos | Regimes antigos continuam influenciando; os ajustes podem ficar mais lentos |
| Móvel | O intervalo fixo mais recente de linhas elegíveis | Limite explícito de atualidade e tamanho de amostra controlado | Menos informação e maior sensibilidade ao tamanho escolhido |
Para isolar a política da janela, mantenha iguais o corte de informações, os recursos, a classe do modelo, o objetivo de treinamento, as datas de ajuste, o horizonte de previsão, os blocos de teste e as premissas de execução. Se o modelo móvel também for reajustado com mais frequência ou usar outros recursos, a diferença de pontuação não pode ser atribuída apenas à janela.
Essas regras também não definem a origem da previsão. É possível avaliar as duas janelas com origens móveis: treinar nos dados passados elegíveis, prever o próximo bloco, avançar e repetir. A revisão de Leonard Tashman sobre testes de previsão fora da amostra00065-0) discute origens móveis e janelas móveis de estimação. Uma define quando ocorre a avaliação; a outra, quais linhas de treinamento permanecem.
Uma linha do tempo hipotética mostra o que entra em cada ajuste
Todos os números e datas a seguir são hipotéticos. Suponha que o modelo seja reajustado mensalmente para prever o retorno do mês seguinte, e que o primeiro ajuste use 60 observações elegíveis até o mês 120. Um rótulo só pode ser usado depois que seu resultado termina. Na primeira origem, as duas regras usam as mesmas 60 linhas se a janela móvel tiver tamanho 60.
Quando um novo resultado mensal fica conhecido, o conjunto expansivo passa a ter 61 linhas elegíveis. O móvel adiciona a nova linha e remove a mais antiga, mantendo 60. Após 12 atualizações, o expansivo terá 72 linhas desde o início original, enquanto o móvel conservará as 60 mais recentes. As estimativas podem divergir porque os históricos são diferentes, mesmo que cada linha estivesse disponível no momento do respectivo ajuste.
Neste exemplo, reserve os últimos 24 meses para um teste externo. A regra e o tamanho da janela, os recursos e as demais configurações devem ser escolhidos em períodos de validação cronológica anteriores. Depois, avalie a seleção congelada conforme o cronograma de ajustes definido previamente. Alterar o tamanho após ver os resultados externos usa o teste para selecionar e exagera a força da evidência final.
Escolha a regra da janela dentro da validação cronológica
Formule a pergunta antes de comparar: o modelo deve usar todo o histórico disponível em cada ajuste ou há uma razão para excluir exemplos antigos? A relação-alvo deve permanecer estável ou as entradas relevantes podem mudar? Essas perguntas orientam os candidatos, mas não comprovam antecipadamente qual regra terá melhor resultado em determinado mercado.
Use dados de desenvolvimento anteriores para comparar um conjunto pequeno e predefinido, como a janela expansiva e algumas durações móveis plausíveis, nos mesmos blocos de validação cronológica e com a mesma frequência de ajuste. Defina o objetivo antes de calcular as pontuações: perda de previsão, calibração, utilidade da carteira ajustada por giro e drawdown máximo respondem a perguntas diferentes. Mantenha custos e restrições iguais e registre ajustes malsucedidos e previsões ausentes. Se alvos ou blocos se sobrepõem, pontuações próximas podem compartilhar retornos; descreva essa dependência em vez de contar cada linha como um experimento independente.
Reserve um período cronológico posterior, sem consulta, para o teste final. Em um desenho aninhado, a validação interna seleciona a janela e outras configurações usando apenas dados anteriores a cada bloco de teste externo; os resultados externos avaliam todo o procedimento de seleção. O [guia de validação cruzada purgada](/pt-BR/learn/purged-cross-validation-embargo-time-series-finance-explained) explica limites com rótulos sobrepostos; o [overfitting de modelos financeiros](/pt-BR/learn/bias-variance-tradeoff-financial-model-overfitting-explained) e os [testes múltiplos](/pt-BR/learn/multiple-testing-false-discovery-rate-finance-explained) abordam riscos de seleção relacionados.
Alinhe rótulos, pré-processamento e momento do ajuste às informações disponíveis então
Em cada origem, use somente recursos e rótulos que já eram conhecidos. Um retorno futuro de várias sessões pode continuar incompleto perto do limite de validação, mesmo se a data da decisão for anterior. Quando necessário, deixe uma lacuna ou remova linhas conforme os intervalos reais dos rótulos; um número fixo de linhas só é adequado se a frequência das observações e o horizonte justificarem. Nenhuma regra de janela corrige um recurso que contenha informação futura.
Ajuste imputação, escalonamento, seleção de recursos e outros pré-processamentos aprendidos apenas na parte de treinamento de cada fold. Se um limiar ou hiperparâmetro precisar ser escolhido, use uma validação cronológica interna ao período de treinamento e congele a escolha ao pontuar o bloco posterior. A documentação oficial do scikit-learn para TimeSeriesSplit descreve um conjunto de treinamento expansivo por padrão e max_train_size para limitar seu tamanho. gap conta amostras; durações de fold comparáveis pressupõem observações igualmente espaçadas. Verifique também os horários dos rótulos financeiros e a versão da biblioteca usada.
Informe o desempenho por origem e descreva os limites da avaliação
Informe a regra e o tamanho exato da janela, a data mais antiga mantida, o número de linhas elegíveis em cada ajuste, a regra de disponibilidade dos rótulos, as datas de validação e teste final, o horizonte e o cronograma de ajustes. Mostre resultados por bloco de teste além do agregado. A média pode ocultar o domínio de um episódio de mercado, e previsões próximas podem compartilhar resultados, não sendo evidências independentes.
A precisão da previsão não equivale ao resultado líquido de negociação. Construção de posições, alavancagem, giro, liquidez, taxas, spread, impacto de mercado, empréstimo, funding e horário de execução afetam o resultado. Mantenha essas premissas iguais ao comparar e informe o que foi omitido. O estudo de Cerqueira, Torgo e Mozetič sobre estimativa de desempenho em séries temporais relata que as estimativas podem diferir entre condições estacionárias e não estacionárias. O estudo não compara diretamente políticas de janela financeira nem prova que uma regra sempre vence.
Considere cada backtest como evidência sobre um histórico e um processo específicos. A janela expansiva pode reter um regime obsoleto; a móvel pode descartar informações úteis e ficar ruidosa. A regra escolhida pode falhar em outro regime, universo de ativos ou ambiente de custos. A validação reduz a incerteza sobre o procedimento testado, mas não promete retornos futuros nem prova que alguma janela seja ótima.
Perguntas frequentes
Q1Uma janela expansiva é sempre melhor porque usa mais dados?
Não. Mais linhas podem estabilizar as estimativas se as observações antigas ainda forem relevantes, mas regimes obsoletos podem continuar influenciando o modelo. Isso depende dos dados, do alvo, dos recursos, do estimador e do período de avaliação.
Q2Uma janela móvel se adapta automaticamente a uma mudança de regime de mercado?
Não. Ela remove linhas que saem do intervalo escolhido, mas não detecta a mudança nem garante que a nova amostra represente o próximo regime. Frequência de ajuste, tamanho da janela e desenho do modelo continuam importantes.
Q3Posso usar o mesmo período para ajustar a janela e informar o desempenho final?
Esse período passaria a fazer parte da seleção do modelo. Escolha a regra pela validação cronológica e avalie o procedimento congelado em um teste posterior não consultado. Mesmo esse resultado descreve apenas o histórico e as premissas testadas.
Fontes e leituras adicionais
Relatar um problema
Vamos preparar um e-mail com o link deste artigo. Mark só receberá o relato depois que você enviar
Verificação rápida
Terminou o guia? Confira o que aprendeu com 3 perguntas
Pergunta 01
O que muda no próximo ajuste de uma janela de treinamento móvel de tamanho fixo?
Escolha uma resposta para ver a explicação
Glossário de opções
The relationship between systematic prediction error from model mismatch and instability caused by sensitivity to the training sample.
Ler o guia completoFamily-wise error rateThe probability of falsely rejecting at least one true null hypothesis within a predefined family of tests.
Ler o guia completoAlocação de opçõesProcesso em que a obrigação de cumprir o contrato, após um aviso de exercício, é atribuída ao vendedor e pode criar entrega ou compra de ações.
Ler o guia completo