Skip to content
Semua panduan opsi dan kontrak berjangka
Evaluasi ramalan arah13 menit membaca

Uji Pesaran–Timmermann: Apakah Ramalan Arah Menambah Informasi?

Pelajari cara uji Pesaran–Timmermann membandingkan ketepatan arah dengan patokan yang memakai proporsi kenaikan aktual dan ramalan, serta mengapa dependensi serial mengubah inferensi.

Dalam panduan iniTingkat kecocokan 64% bisa biasa saja atau berguna, bergantung pada patokannya

Ringkasan singkat

Uji Pesaran–Timmermann (PT) menanyakan apakah ramalan memuat informasi tentang arah pergerakan suatu hasil. Untuk ramalan biner naik/turun, uji ini membandingkan tingkat kecocokan yang diamati dengan tingkat kecocokan yang tersirat dari proporsi kenaikan aktual dan proporsi ramalan naik secara terpisah. Patokan itu belum tentu 50%. Uji yang lazim juga bergantung pada asumsi mengenai dependensi antarwaktu asal ramalan, dan signifikansi statistik tidak membuktikan bahwa aturan trading menguntungkan.

Tingkat kecocokan 64% bisa biasa saja atau berguna, bergantung pada patokannya

Misalkan pasar naik pada 60% tanggal dalam sampel evaluasi. Seorang peramal menyebut “naik” pada 70% tanggal tersebut. Sekalipun ramalan dan hasil tidak berkaitan, keduanya cukup sering akan cocok: pada sebagian tanggal keduanya menyebut naik, dan pada tanggal lain keduanya menyebut turun. Membandingkan tingkat kecocokan begitu saja dengan 50% akan mengabaikan ketimpangan ini.

Kerangka PT membuat perbandingan itu eksplisit. Uji ini menanyakan apakah arah ramalan dan arah realisasi lebih sering sejalan daripada yang tersirat dari frekuensi masing-masing jika keduanya independen. Ini adalah uji informasi prediktif arah, bukan skor untuk besar imbal hasil, waktu transaksi, atau nilai suatu strategi secara keseluruhan. Pesaran dan Timmermann memperkenalkan uji kinerja prediktif dengan tabel kontingensi; untuk kasus biner 2×2, uji mereka asimtotik setara dengan pengujian independensi {source:pesaranTimmermannDirectionalTests1992}.

Masukkan setiap ramalan yang berpasangan ke tabel 2×2

Misalkan \(Y_t=1\) jika hasil yang terealisasi diklasifikasikan naik dan \(Y_t=0\) jika diklasifikasikan turun. Misalkan \(Z_t=1\) jika ramalan menyatakan naik dan \(Z_t=0\) jika menyatakan turun. Setiap baris evaluasi harus memasangkan ramalan yang dibuat pada asal ramalan \(t\) dengan hasil untuk horizon yang hendak diramalkan.

Empat sel menghitung pasangan naik/naik, naik/turun, turun/naik, dan turun/turun. Jika \(n_{11}\) dan \(n_{00}\) adalah dua sel yang cocok, sedangkan \(n\) adalah jumlah pasangan layak pakai yang berhasil dipadankan, tingkat kecocokan arah yang diamati adalah

\[ \widehat{P}=\frac{n_{11}+n_{00}}{n}. \]

Susunan ini bersifat biner. Tentukan terlebih dahulu cara menangani imbal hasil nol, ramalan nol, atau rentang netral. Sebagai contoh, studi dapat menggolongkan imbal hasil nol atau lebih rendah sebagai “tidak naik”, dan ramalan yang sama dengan atau di bawah ambang sebagai “tidak naik”. Mengecualikan nilai yang sama juga mungkin, tetapi mengubah sampel sehingga aturannya harus diterapkan secara konsisten. Jangan menghitung kasus nol-nol sebagai jenis kecocokan ketiga ketika memakai rumus patokan dua kategori.

Turunkan patokan independensi dari kedua proporsi kenaikan

Misalkan \(\hat p_y\) adalah proporsi sampel hasil aktual yang diklasifikasikan naik dan \(\hat p_z\) adalah proporsi sampel ramalan yang menyebut naik. Jika label aktual dan ramalan independen, proporsi kecocokan yang diharapkan adalah

\[ \widehat{P}^{*}=\hat p_y\hat p_z+(1-\hat p_y)(1-\hat p_z). \]

Hasil kali pertama adalah peluang cocok naik/naik dalam keadaan independen; hasil kali kedua adalah peluang cocok turun/turun. Karena itu, patokan bergantung pada kedua proporsi marginal dan dapat berada di atas atau di bawah 50%. Model yang selalu meramalkan arah yang lebih sering muncul dapat memiliki tingkat kecocokan yang tampak baik tanpa menambah informasi.

Kasus ekstrem memperjelas hal ini. Jika pengklasifikasi selalu memprediksi “naik”, maka \(\hat p_z=1\), tingkat kecocokan yang diamati sama dengan proporsi kenaikan aktual \(\hat p_y\), dan patokan independensinya juga \(\hat p_y\). Kecocokan berlebih secara konstruksi bernilai nol. Ramalan konstan seperti ini dapat tampak akurat ketika hasil naik umum terjadi, tetapi tidak membedakan tanggal mana yang akan naik; varians estimasinya juga dapat degenerat sehingga nilai-p PT konvensional mungkin tidak terdefinisi.

Pertimbangkan 100 tanggal berpasangan hipotetis. Hasil aktual naik pada 60 tanggal dan ramalan menyebut naik pada 70 tanggal. Misalkan tabelnya sebagai berikut:

Arah aktualRamalan naikRamalan turunTotal
Naik471360
Turun231740
Total7030100

Ada 64 kecocokan, sehingga \(\widehat P=0.64\). Patokan independensi adalah \(0.60\times0.70+0.40\times0.30=0.54\). Tingkat kecocokan yang diamati 10 poin persentase di atas patokan. Hitungan rekaan ini hanya menunjukkan cara menghitung; selisihnya saja bukan estimasi ketidakpastian yang sah atau bukti kinerja trading yang berguna.

Skala selisih tingkat kecocokan dengan ketidakpastian estimasinya

Untuk statistik PT biner standar, definisikan

\[ \widehat v=\frac{\widehat P^{*}(1-\widehat P^{*})}{n} \]

dan

\[ \widehat w=\frac{(2\hat p_y-1)^2\hat p_z(1-\hat p_z)+(2\hat p_z-1)^2\hat p_y(1-\hat p_y)}{n}. \]

Maka

\[ PT=\frac{\widehat P-\widehat P^{*}}{\sqrt{\widehat v-\widehat w}}. \]

Di bawah hipotesis nol dan asumsi sampel besar yang lazim, distribusi acuan statistik ini secara asimtotik adalah normal standar. Pembilangnya adalah kecocokan berlebih di atas patokan independensi. Penyebutnya memperhitungkan bahwa patokan tersebut diestimasi dari sampel yang sama, bukan dianggap sebagai target tetap 50%. Rumus dan notasinya didokumentasikan pada implementasi statsmodels {source:statsmodelsPesaranTimmermannAPI}.

Rumus di atas adalah bentuk varians asimtotik utama yang didokumentasikan statsmodels. Rumus delta untuk varians sampel kecil yang lebih lengkap dalam pembahasan asli menambahkan \(4\hat p_y\hat p_z(1-\hat p_y)(1-\hat p_z)/n^2\) ke \(\widehat w\). Suku berorde lebih kecil itu tidak mengubah hasil asimtotik orde pertama, tetapi dapat menggeser statistik pada sampel terbatas. Jika hasil bergantung pada implementasi, nyatakan rumus dan versi perangkat lunak yang dipakai; jangan menganggap semua paket melakukan perhitungan sampel terbatas yang identik.

Rumus ini bukan obat untuk rancangan yang lemah. Sampel yang sangat kecil, ramalan yang hampir selalu sama, sel kosong, atau estimasi varians yang nol maupun tidak valid dapat membuat pendekatan biasa tidak andal atau tidak terdefinisi. Dalam keadaan demikian, jangan memaksakan p-value dari rumus tersebut; laporkan proporsi marginal dan tabelnya, lalu pilih prosedur inferensi yang sesuai dengan data dan ukuran sampel.

Untuk tabel hipotetis di atas, komponen dengan rumus utama adalah \(\widehat v=0.54(0.46)/100=0.002484\) dan \(\widehat w=[0.2^2(0.7)(0.3)+0.4^2(0.6)(0.4)]/100=0.000468\). Galat bakunya \(\sqrt{0.002484-0.000468}\approx0.0449\), sehingga \(PT\approx0.10/0.0449=2.23\). Acuan normal standar dua sisi memberikan nilai-p sekitar 0.026. Ini adalah hitungan dari angka rekaan dengan rumus asimtotik utama; suku sampel-terbatas yang lebih lengkap sedikit mengubah nilainya, dan dependensi serial dapat membuat acuan normal tidak berlaku. Jangan sajikan ini sebagai hasil empiris.

Diagram konseptual arah aktual dan ramalan dalam kisi 2×2, dengan panah berpasangan berwarna tembaga dan teal yang menunjukkan kesesuaian, ketidaksesuaian, serta proporsi marginal yang berbeda.
Ilustrasi ini menjelaskan pasangan arah aktual dan ramalan serta tingkat kecocokan yang diharapkan dari proporsi marginal; ini adalah konsep, bukan data empiris.

Baca hasil penolakan sebagai bukti tentang arah, bukan vonis trading

Pembilang positif berarti arah aktual lebih sering cocok daripada patokan independensi; nilai negatif berarti lebih jarang. Uji satu sisi yang ditetapkan sebelumnya dapat menanyakan apakah kecocokan melampaui patokan. Uji dua sisi menanyakan apakah asosiasi arah berbeda ke salah satu arah. Hipotesis alternatif dan tingkat signifikansi sebaiknya ditentukan sebelum melihat hasil.

P-value kecil adalah bukti yang menentang hipotesis nol yang dinyatakan, dengan asumsi uji terpenuhi. Itu bukan probabilitas bahwa hipotesis nol benar dan bukan peluang ramalan akan berhasil pada periode berikutnya. Nilai itu juga tidak menyatakan imbal hasil cukup besar untuk menutup spread, biaya, dampak pasar, pendanaan, atau biaya pinjam. Uji ini pun tidak mengoreksi pencarian banyak aset, horizon, ambang, varian model, atau arah ramalan lalu hanya melaporkan pemenangnya. Jika strategi kandidat dicari, panduan White Reality Check menjelaskan mengapa seleksi perlu diperhitungkan dalam inferensi.

Sebaliknya, kegagalan menolak bukan bukti bahwa arah aktual dan ramalan independen. Sampel yang singkat atau tidak seimbang mungkin memiliki daya rendah untuk mendeteksi asosiasi. Pembilang PT yang negatif juga tidak membuktikan bahwa ramalan sama sekali tidak memiliki struktur; hasil itu dapat menunjukkan ketidakcocokan yang sistematis. Membalik tanda ramalan setelah melihat hasil tersebut merupakan pilihan model baru dan harus dievaluasi dengan data baru atau dimasukkan ke dalam prosedur pencarian awal.

Laporkan bersama-sama proporsi kenaikan aktual, proporsi kenaikan ramalan, tingkat kecocokan yang diamati, patokan independensi, kenaikan dalam poin persentase, hipotesis alternatif, dan metode estimasi ketidakpastian. Nilai-p tanpa margin tabel dan ukuran efek menyulitkan pembaca membedakan kenaikan kecil yang diestimasi dengan presisi dari kenaikan lebih besar yang masih tidak pasti.

Dependensi serial dapat menyesatkan distribusi acuan buku teks

Statistik PT biasa umumnya disajikan untuk observasi arah yang independen sepanjang waktu. Label keuangan justru dapat muncul beruntun. Observasi harian dapat berbagi target beberapa hari yang saling tumpang tindih; rezim volatilitas bisa bertahan; dan ramalan bergulir dapat menggunakan kembali sebagian besar data estimasi yang sama. Maka \(n\) pasangan itu bukan \(n\) potong informasi yang independen. Galat baku biasa bisa terlalu kecil sehingga hipotesis nol terlalu sering ditolak.

Dalam penelitian selanjutnya, Pesaran dan Timmermann mengembangkan uji dependensi untuk variabel multi-kategori yang berkorelasi serial, menggunakan regresi yang diperluas secara dinamis dan kerangka Markov berorde hingga {source:pesaranTimmermannSerialCategories2009}. Penelitian yang berfokus pada ramalan arah juga menemukan bahwa prosedur PT konvensional berbasis independensi dapat mengalami kelebihan penolakan saat ada korelasi serial, dan mengkaji alternatif tahan-dependensi termasuk metode bootstrap {source:blaskowitzHerwartzDirectionalSerialCorrelation2014}. Metode yang tepat bergantung pada cara ramalan dihasilkan, horizon ramalan, dan struktur dependensi; resep resampling umum tidak otomatis valid.

Nyatakan apakah asal ramalan saling tumpang tindih, berapa jaraknya, dan metode dependensi apa yang memasok estimasi ketidakpastian. Jika statistik buku teks dilaporkan sebagai tolok ukur deskriptif, beri label asumsi independensinya. Jangan menafsirkan hasil nominal 5% seolah-olah tingkat penolakan salahnya juga 5% ketika rancangan melanggar asumsi tersebut.

Susun evaluasi dari ramalan yang memang bisa dibuat saat itu

Untuk setiap asal ramalan, simpan nilai ramalan persis seperti yang tersedia saat itu, horizon, batas waktu informasi, hasil yang terealisasi, serta aturan yang mengubah masing-masing menjadi label naik/turun. Selaraskan cap waktu, instrumen, definisi harga atau imbal hasil, serta penanganan nilai hilang sebelum membentuk tabel. Ramalan yang memakai data makroekonomi yang direvisi atau sinyal yang disetel pada periode evaluasi bukan ramalan out-of-sample yang belum tersentuh.

Tentukan ambang klasifikasi sebelum melihat hasil holdout. Jika model mengeluarkan probabilitas, ambang mengubahnya menjadi arah biner; mencari ambang di sampel yang sama mengubah pertanyaan dan menimbulkan bias seleksi. Pisahkan peran data pelatihan, validasi, dan evaluasi akhir. Jika prosedur resampling dimaksudkan untuk memperhitungkan pencarian model, ulangi seluruh proses seleksi di dalam setiap resampel.

Pertanyaan PT berbeda dari perbandingan besar kesalahan ramalan. Panduan Diebold–Mariano membandingkan selisih kerugian berpasangan, sedangkan panduan Giacomini–White menanyakan apakah kemampuan prediktif relatif berubah menurut informasi yang ditentukan sebelumnya. Untuk model ramalan bersarang, lihat panduan penyesuaian Clark–West. Uji-uji ini menjawab pertanyaan berbeda dan tidak dapat saling menggantikan hanya karena menghasilkan statistik uji yang familier.

Signifikansi arah tidak membuktikan strategi menguntungkan

Uji PT mereduksi setiap hasil menjadi satu label arah. Kenaikan satu tick dan reli besar sama-sama dihitung sebagai naik; salah prediksi kecil dan kerugian besar sama-sama dihitung sebagai satu kesalahan arah. Tingkat kecocokan dapat meningkat sementara strategi tetap merugi jika kesalahan lebih besar daripada keuntungan, sinyal datang setelah pergerakan harga, atau biaya trading menghabiskan keunggulan.

Sebagai contoh, bayangkan 100 transaksi hipotetis dengan ukuran posisi yang sama: 64 arah benar menghasilkan rata-rata 0.10% per transaksi, sedangkan 36 arah keliru merugi rata-rata 0.25% per transaksi. Jumlah bruto sederhana adalah \(64(0.10\%)-36(0.25\%)=-2.6\) poin persentase sebelum biaya, meskipun tingkat kecocokannya 64%. Perhitungan yang sengaja disederhanakan ini mengabaikan pemajemukan dan bukan bukti pasar; contoh ini menunjukkan mengapa tingkat kecocokan saja tidak menentukan ekspektasi hasil.

Pertanyaan umum

Q1Apakah uji Pesaran–Timmermann membandingkan akurasi dengan 50%?

Tidak. Uji ini membandingkan kecocokan yang diamati dengan patokan independensi yang dihitung dari proporsi aktual naik dan ramalan naik secara terpisah. Patokan dapat berada di atas atau di bawah 50%.

Q2Bolehkah memakai p-value PT biasa jika horizon ramalan saling tumpang tindih?

Jangan menggunakannya tanpa menangani dependensi. Target yang tumpang tindih dan label arah yang persisten dapat membuat estimasi ketidakpastian berbasis independensi terlalu kecil. Gunakan metode yang asumsinya cocok dengan horizon dan struktur dependensi.

Q3Apakah hasil PT signifikan berarti strategi trading menghasilkan keuntungan?

Tidak. Uji ini memakai label arah dan tidak mengukur besar pergerakan, harga masuk dan keluar, ukuran posisi, biaya, slippage, atau pendanaan. Evaluasi imbal hasil bersih out-of-sample secara terpisah.

Sumber dan bacaan lanjutan

Laporkan masalah

Kami akan menyiapkan email berisi tautan artikel ini. Mark menerima laporan setelah Anda mengirimkannya

Cek cepat

Sudah membaca panduannya? Uji diri dengan 3 pertanyaan

Pertanyaan 1 / 3

Pertanyaan 01

Jika hasil aktual naik 60% dan ramalan menyebut naik 70%, berapa patokan kecocokan independensinya?

Pilih jawaban untuk melihat penjelasannya

Glosarium opsi

Definisi jelas untuk istilah inti, dari call, put, dan rantai opsi hingga IV, Greeks, serta spread bid-ask

Lihat glosarium opsi