Alle optiegidsen
Waarom een drempel faalt als onderzoekers veel ideeën testen16 min.

Meerdere tests en valse ontdekkingstochten in de financiën

Begrijp meerdere vergelijkingen, familie-wijs fout, valse ontdekkingscijfer, Bonferroni, Holm, Benjamini . Hochberg, afhankelijkheid, q-waarden, factor mining, backtest selectie, en onderzoek governance

Samengesteld door Mark · Primaire bronnen hieronder

Direct antwoord

Meerdere tests ontstaan wanneer veel hypothesen, strategieën, factoren, activa, horizons, of specificaties worden gezocht samen. Zelfs geldige single-test p-waarden dan kans winnaars genereren. Familie-wise fout tarief controleert de kans op ten minste een valse afwijzing, terwijl valse ontdekking tarief controleert het verwachte valse aandeel onder afwijzingen onder gestelde aannames. De onderzoeksfamilie, niet alleen de finale tabel, bepaalt het probleem

Meer tests creëren meer kans winnaars

Als m onafhankelijke true nulls elk op niveau α worden getest, is de kans op ten minste één valse afstoting 1−(1−α)^m

Bij α=0,05 en m=20, is die kans ongeveer 64%, ook al heeft elke individuele test een nominale 5% vals-afstotend percentage

Afhankelijkheid verandert de exacte berekening, maar het rechtvaardigt niet dat doen alsof alleen de gemelde winnaar werd getest

De familie definieert de foutvraag

Een testfamilie kan alle factoren, transformaties, universa, vertragingen, horizonten, filters, modelkeuzes, en herhalingen die voor één onderzoek claim worden overwogen omvatten

Definieer de familie na het zien van resultaten onderstaat veelheid en laat onderzoekers verwante proeven scheiden totdat de correctie onschadelijk wordt

De verdedigbare familie volgt het besluitproces en de selectiemogelijkheid, niet alleen de rijen die overleven in een papier of dashboard

FWER en FDR beheersen verschillende verliezen

Familie-wise foutenpercentage is de kans op ten minste één valse afwijzing binnen de familie

Valse ontdekkingsfrequentie is E[V/max(R,1)], waarbij V het aantal valse afwijzingen is en R het totale aantal afwijzingen is

FWER is strenger wanneer elke valse claim kostbaar is; FDR is vaak krachtiger wanneer screening veel kandidaten een gecontroleerd vals aandeel kunnen tolereren

De procedures moeten worden veronderstellingen

Bonferroni test elke hypothese op α/m en controleert FWER zonder onafhankelijkheid te vereisen, hoewel het conservatief kan zijn

Holm's stap-down methode ook controleert FWER en is nooit minder krachtig dan de basis Bonferroni afwijzing regel

Benjamini .Hochberg bestelt p-waarden en controleert FDR onder onafhankelijkheid en bepaalde positieve afhankelijkheid; andere afhankelijkheidsstructuren vereisen gerechtvaardigde methoden

Aangepaste waarden zijn geen achterliggende waarheid waarschijnlijkheden

Een aangepaste p-waarde is het kleinste foutenniveau van de familie waarbij een hypothese volgens een gekozen procedure zou worden afgewezen.

Een q-waarde wordt gewoonlijk geïnterpreteerd als een geschatte minimum FDR-drempel voor het aanroepen van een resultaat tot ontdekking, afhankelijk van de methode en aannames

Geen van beide hoeveelheden is automatisch de kans dat een geselecteerde strategie onjuist is; dat vereist een ander model en een andere conditionering statement

Financiën verbergt een grote adaptieve familie

Factor mining, technische regels, optiesignalen, alternatieve gegevens, portefeuillebeperkingen en kostenaannamen creëren duizenden samenhangende proeven

Gepubliceerde factoren worden geselecteerd uit eerdere zoekopdrachten, dus het evalueren van een nieuwe factor tegen een geïsoleerde t-statistische in de buurt van twee negeert verzamelde ontdekkingsdruk

Gedeelde activa en perioden maken tests afhankelijk, terwijl verandering van de regeling betekent dat een correctie voor selectie geen toekomstige economische prestaties kan garanderen

Bestuur moet het zoekrecord behouden

Neem elke hypothese, codeversie, universum, uitkomst, transformatie, vertraging, kosten, en stoppen keuze met een stabiele onderzoeksidentificatie

Afzonderlijke ontdekking, bevestiging en live monitoring; bevriezing van bevestigingsregels en gebruik van werkelijk ongerepte gegevens of prospectieve evaluatie

Rapporteer ruw en aangepast bewijsmateriaal, de definitie van het gezin, afhankelijkheid veronderstellingen, effect groottes, kosten, stabiliteit, afgewezen ideeën, en levende afbraak

Veelgestelde vragen

Wat is het meervoudige testprobleem?

Het is de toename van valse ontdekkingen veroorzaakt door het testen en selecteren van een groot aantal hypothesen terwijl het beoordelen van winnaars alsof elke test stond alleen

Wat is het verschil tussen FWER en FDR?

FWER controleert de waarschijnlijkheid van ten minste één valse afwijzing; FDR controleert het verwachte valse aandeel van alle afwijzingen

Hoe werkt Benjamini ?

Het bestelt p-waarden, vergelijkt ze met rangafhankelijke drempels, en verwerpt via de grootste kwalificatieklasse onder haar genoemde aannames

Maakt FDR-controle een handelsstrategie betrouwbaar?

Nee. Het behandelt selectiefout in een gedefinieerde testfamilie, geen regimewijziging, kosten, lekkage, modelrisico of toekomstige winstgevendheid

Bronnen en verder lezen

Snelle check

De gids gelezen? Test jezelf met 3 vragen

1 / 3

Vraag 01

Welke verklaring past het beste bij deze gids Meer tests maken meer kans winnaars?

Kies een antwoord om de uitleg te zien

Optiewoordenlijst