Pesaran–Timmermann পরীক্ষা: দিকের পূর্বাভাস কি বাড়তি তথ্য দেয়?
Pesaran–Timmermann পরীক্ষা কীভাবে প্রকৃত ও পূর্বাভাসিত ঊর্ধ্বমুখী হারের ভিত্তিতে দিক-সংক্রান্ত মিলের হার তুলনা করে এবং সময়ক্রমিক নির্ভরতা কেন পরিসংখ্যানগত সিদ্ধান্ত বদলে দেয়, তা জানুন।
এই গাইডেভিত্তিমাত্রার তুলনায় ৬৪% মিল কখনো দুর্বল, কখনো কার্যকর হতে পারে
সংক্ষিপ্ত সারাংশ
Pesaran–Timmermann (PT) পরীক্ষা জানতে চায়, পূর্বাভাসে ফল কোন দিকে যাবে সে সম্পর্কে তথ্য আছে কি না। ঊর্ধ্বমুখী/নিম্নমুখী পূর্বাভাসকে দ্বিমাত্রিক শ্রেণিতে আনলে, এটি দেখা মিলের হারকে প্রকৃত ফলের ঊর্ধ্বমুখী অংশ এবং পূর্বাভাসের ঊর্ধ্বমুখী অংশ আলাদাভাবে ধরে পাওয়া প্রত্যাশিত মিলের সঙ্গে তুলনা করে। এই ভিত্তিমাত্রা যে সব সময় ৫০% হবে, তা নয়। প্রচলিত পরীক্ষাটির জন্যও পূর্বাভাসের সময়বিন্দুগুলোর মধ্যকার নির্ভরতা নিয়ে অনুমান দরকার; আর পরিসংখ্যানগত তাৎপর্য ট্রেডিং নিয়মের লাভজনকতা প্রমাণ করে না।
ভিত্তিমাত্রার তুলনায় ৬৪% মিল কখনো দুর্বল, কখনো কার্যকর হতে পারে
ধরা যাক, মূল্যায়ন নমুনার ৬০% দিনে বাজার বেড়েছে। পূর্বাভাসক ঐ দিনগুলোর ৭০%-এ “বাড়বে” বলেছে। পূর্বাভাস ও ফলের মধ্যে কোনো সম্পর্ক না থাকলেও দুই ধারার মিল প্রায়ই ঘটত: কিছু দিনে দুটিই ঊর্ধ্বমুখী বলত, অন্য দিনে দুটিই নিম্নমুখী বলত। মিলের হারকে যান্ত্রিকভাবে ৫০%-এর সঙ্গে তুলনা করলে এই ভারসাম্যহীনতা উপেক্ষিত হয়।
PT কাঠামো এই তুলনাটি স্পষ্ট করে। এটি জিজ্ঞেস করে, পূর্বাভাসের দিক ও বাস্তব ফলের দিক কি তাদের পৃথক হার থেকে স্বাধীনতার অধীনে যতটা মিল প্রত্যাশিত, তার চেয়ে বেশি মেলে? এটি দিক-সংক্রান্ত পূর্বাভাসের তথ্যমূল্য পরীক্ষা করে; রিটার্নের আকার, ট্রেডের সময় নির্বাচন বা সম্পূর্ণ কৌশলের মূল্য মাপে না। Pesaran ও Timmermann contingency table ব্যবহার করে পূর্বাভাস-দক্ষতার পরীক্ষা প্রস্তাব করেন; দ্বিমাত্রিক ২×২ ক্ষেত্রে তাঁদের পরীক্ষাটি স্বাধীনতার পরীক্ষার সঙ্গে asymptotically সমতুল্য {source:pesaranTimmermannDirectionalTests1992}।
প্রতিটি মেলানো পূর্বাভাসকে ২×২ সারণিতে রাখুন
বাস্তব ফলকে ঊর্ধ্বমুখী হিসেবে শ্রেণিবদ্ধ করলে \(Y_t=1\), আর নিম্নমুখী করলে \(Y_t=0\) ধরা যাক। পূর্বাভাস ঊর্ধ্বমুখী বললে \(Z_t=1\), আর নিম্নমুখী বললে \(Z_t=0\)। মূল্যায়নের প্রতিটি সারিতে সময়বিন্দু \(t\)-এ করা পূর্বাভাসের সঙ্গে সেটি যে সময়সীমার ফল অনুমান করতে চেয়েছিল, সেই বাস্তব ফল জুড়তে হবে।
চারটি ঘরে ঊর্ধ্ব/ঊর্ধ্ব, ঊর্ধ্ব/নিম্ন, নিম্ন/ঊর্ধ্ব ও নিম্ন/নিম্ন জোড়ার সংখ্যা থাকবে। \(n_{11}\) ও \(n_{00}\) যদি দুই মিলের ঘর হয় এবং \(n\) ব্যবহারযোগ্য মেলানো জোড়ার সংখ্যা হয়, তবে পর্যবেক্ষিত দিক-নির্ভুলতার হার
\[ \widehat{P}=\frac{n_{11}+n_{00}}{n}. \]
এই শ্রেণিবিন্যাসে দুটি বিভাগ। শূন্য রিটার্ন, শূন্য পূর্বাভাস বা নিরপেক্ষ সীমা কীভাবে সামলাবেন, আগে স্থির করুন। যেমন, শূন্য বা তার কম রিটার্নকে “ঊর্ধ্বমুখী নয়” বলা যায়; পূর্বাভাসও নির্ধারিত সীমায় বা তার নিচে হলে একই শ্রেণি দেওয়া যায়। সমান ফল বাদ দেওয়াও সম্ভব, তবে তাতে নমুনা বদলায় এবং নিয়মটি ধারাবাহিকভাবে প্রয়োগ করতে হয়। দুই-বিভাগের ভিত্তিমাত্রার সূত্র ব্যবহার করে শূন্য-শূন্যকে তৃতীয় ধরনের মিল হিসেবে গুনবেন না।
পূর্বাভাসের origin ও target horizon-ও মিলতে হবে। \(Z_t\) যদি পরের পাঁচ trading session-এর cumulative return-এর sign বলে, \(Y_t\)-কেও একই origin-এর সেই পাঁচ-session return চিহ্নিত করতে হবে—পরের এক দিনের return নয়। ভিন্ন target দিলে সারণিতে আলাদা ঘটনা মিশবে। প্রতিদিনের overlapping পাঁচ-session forecast descriptive table-এ রাখা যায়, তবে তাতে পরের dependence সমস্যা তৈরি হয়।
দুই ঊর্ধ্বমুখী হার থেকে স্বাধীনতার ভিত্তিমাত্রা বের করুন
\(\hat p_y\) হোক বাস্তব ফলের মধ্যে ঊর্ধ্বমুখী বলে শ্রেণিবদ্ধ অংশ, আর \(\hat p_z\) হোক ঊর্ধ্বমুখী পূর্বাভাসের নমুনা-অংশ। বাস্তব ফল ও পূর্বাভাসের শ্রেণি স্বাধীন হলে প্রত্যাশিত মিলের অংশ
\[ \widehat{P}^{*}=\hat p_y\hat p_z+(1-\hat p_y)(1-\hat p_z). \]
প্রথম গুণফলটি স্বাধীনতার অধীনে ঊর্ধ্ব/ঊর্ধ্ব মিলের সম্ভাবনা, আর দ্বিতীয়টি নিম্ন/নিম্ন মিলের সম্ভাবনা। তাই ভিত্তিমাত্রা দুই প্রান্তিক হারের সঙ্গে বদলায়। এটি ৫০%-এর বেশি বা কম হতে পারে। সবচেয়ে প্রচলিত দিকটি সব সময় বললেও আপাতদৃষ্টিতে মিলের হার ভালো হতে পারে, যদিও পূর্বাভাস বাড়তি তথ্য দেয় না।
চরম উদাহরণটি বিষয়টি দেখায়। classifier সব তারিখে “up” বললে \(\hat p_z=1\); observed hit rate ও independence baseline দুটিই actual-up share \(\hat p_y\), তাই excess agreement শূন্য। up সাধারণ হলে constant forecast নির্ভুল দেখাতে পারে, কিন্তু কোন তারিখে বাড়বে তা চেনে না; estimated variance degenerate হয়ে usual PT p-value নাও থাকতে পারে।
কাল্পনিক ১০০টি মেলানো তারিখ নিন। বাস্তবে ৬০ দিনে দাম বেড়েছে, আর পূর্বাভাস ৭০ দিনে ঊর্ধ্বমুখী বলেছে। সারণিতে ৪৭টি ঊর্ধ্ব/ঊর্ধ্ব, ১৩টি বাস্তব ঊর্ধ্ব/পূর্বাভাস নিম্ন, ২৩টি বাস্তব নিম্ন/পূর্বাভাস ঊর্ধ্ব এবং ১৭টি নিম্ন/নিম্ন জোড়া আছে ধরা যাক। মিল হয়েছে ৬৪টি, তাই \(\widehat P=0.64\)। স্বাধীনতার ভিত্তিমাত্রা \(0.60\times0.70+0.40\times0.30=0.54\)। পর্যবেক্ষিত মিলের হার ভিত্তিমাত্রার চেয়ে ১০ শতাংশ-পয়েন্ট বেশি। এই বানানো গণনাগুলো শুধু হিসাব দেখায়; ব্যবধানটুকু অনিশ্চয়তার যথার্থ অনুমান বা ট্রেডিংয়ের উপযোগিতার প্রমাণ নয়।
| বাস্তব দিক | Forecast up | Forecast down | মোট |
|---|---|---|---|
| Up | 47 | 13 | 60 |
| Down | 23 | 17 | 40 |
| মোট | 70 | 30 | 100 |
অনুমিত অনিশ্চয়তা দিয়ে মিলের ব্যবধানকে পরিমাপ করুন
প্রচলিত দ্বিমাত্রিক PT পরিসংখ্যানে সংজ্ঞায়িত করি
\[ \widehat v=\frac{\widehat P^{*}(1-\widehat P^{*})}{n} \]
এবং
\[ \widehat w=\frac{(2\hat p_y-1)^2\hat p_z(1-\hat p_z)+(2\hat p_z-1)^2\hat p_y(1-\hat p_y)}{n}. \]
তাহলে
\[ PT=\frac{\widehat P-\widehat P^{*}}{\sqrt{\widehat v-\widehat w}}. \]
নাল অনুমান ও প্রচলিত বৃহৎ-নমুনার শর্তে এই পরিসংখ্যানের asymptotic reference distribution হলো standard normal। লব স্বাধীনতার ভিত্তিমাত্রার অতিরিক্ত মিল দেখায়। হর একই নমুনা থেকে ভিত্তিমাত্রা অনুমান করার অনিশ্চয়তা ধরে; এটিকে স্থির ৫০% লক্ষ্য ধরে না। statsmodels-এর implementation-এ সূত্র ও প্রতীক ব্যাখ্যা করা হয়েছে {source:statsmodelsPesaranTimmermannAPI}।
উপরেরটি statsmodels-এ নথিভুক্ত leading asymptotic variance formula। মূল লেখার পূর্ণতর finite-sample delta variance-এ \(\widehat w\)-এর সঙ্গে \(4\hat p_y\hat p_z(1-\hat p_y)(1-\hat p_z)/n^2\) পদটি যোগ হয়। উচ্চতর ক্রমের এই পদ first-order asymptotics বদলায় না, তবে finite-sample statistic বদলাতে পারে। Implementation-ভেদে ফল গুরুত্বপূর্ণ হলে ব্যবহৃত সূত্র ও software version জানান; সব package একই finite-sample arithmetic ব্যবহার করে ধরে নিয়ে p-value তুলনা করবেন না।
দুর্বল evaluation design-কে সূত্রটি ঠিক করে না। নমুনা খুব ছোট, পূর্বাভাস প্রায় একই, কিছু ঘর ফাঁকা, কিংবা অনুমিত variance শূন্য বা অবৈধ হলে প্রচলিত approximation অনির্ভরযোগ্য বা অনির্ধারিত হতে পারে। এমন ক্ষেত্রে জোর করে সূত্র থেকে p-value বের করবেন না; প্রান্তিক হার ও সারণি দেখান, তারপর তথ্য ও নমুনার আকারের উপযোগী inference পদ্ধতি বেছে নিন।
আগের সারণিতে \(\widehat v=0.54(0.46)/100=0.002484\), \(\widehat w=[0.2^2(0.7)(0.3)+0.4^2(0.6)(0.4)]/100=0.000468\)। Standard error \(\sqrt{0.002484-0.000468}\approx0.0449\), তাই \(PT\approx0.10/0.0449=2.23\); two-sided standard-normal reference-এ \(p\approx0.026\)। এটি বানানো count ও leading asymptotic formula-র হিসাব; finite-sample term মান সামান্য বদলায়, আর serial dependence normal reference অকার্যকর করতে পারে। এটি empirical result নয়।

প্রত্যাখ্যানকে দিক-সংক্রান্ত প্রমাণ হিসেবে পড়ুন, ট্রেডিংয়ের রায় হিসেবে নয়
লব ধনাত্মক হলে পর্যবেক্ষিত দিকের মিল স্বাধীনতার ভিত্তিমাত্রার চেয়ে বেশি; ঋণাত্মক হলে কম। আগে নির্ধারিত একপাক্ষিক পরীক্ষায় ভিত্তিমাত্রার চেয়ে বেশি মিল আছে কি না দেখা যায়। দ্বিপাক্ষিক পরীক্ষায় দিক-নির্ভরতার পার্থক্য যেকোনো দিকে আছে কি না দেখা হয়। ফল দেখার আগেই বিকল্প অনুমান ও তাৎপর্যের স্তর বেছে নেওয়া উচিত।
কম p-value পরীক্ষার অনুমানের অধীনে উল্লিখিত নাল অনুমানের বিপক্ষে প্রমাণ। এটি নাল অনুমান সত্য হওয়ার সম্ভাবনা নয়, পরের সময়ে পূর্বাভাস কাজে লাগার সম্ভাবনাও নয়। এটিও বলে না যে bid–ask spread, fee, market impact, funding বা borrow cost মিটিয়ে দেওয়ার মতো বড় রিটার্ন ছিল। অনেক সম্পদ, horizon, threshold, model variant বা forecast sign চেষ্টা করে শুধু বিজয়ীটি প্রকাশ করার ফলও এটি সংশোধন করে না। প্রার্থী কৌশল খোঁজা হয়ে থাকলে White Reality Check নির্দেশিকা দেখায় কেন নির্বাচনকে inference-এ ধরতে হয়।
Null reject না করা direction স্বাধীন—এমন প্রমাণ নয়; ছোট বা imbalanced sample-এ test power কম হতে পারে। PT numerator negative মানে systematic disagreement-ও হতে পারে, forecast-এ structure নেই তা নয়। ফল দেখার পর sign উল্টানো নতুন model choice; নতুন ডেটায় পরীক্ষা করুন বা মূল search-এ ধরুন।
একসঙ্গে actual-up ও forecast-up share, observed hit rate, independence baseline, percentage-point lift, alternative hypothesis, এবং uncertainty method জানান। শুধু p-value দিলে effect-এর আকার ও নির্ভুলতা বোঝা যায় না।
সময়ক্রমিক নির্ভরতা প্রচলিত reference distribution-কে বিভ্রান্ত করতে পারে
সাধারণ PT statistic প্রায়ই সময়ক্রমে দিক-শ্রেণিগুলোর স্বাধীনতা ধরে উপস্থাপিত হয়। কিন্তু আর্থিক label ধারাবাহিকভাবে আসতে পারে। দৈনিক পর্যবেক্ষণে বহু-দিনের লক্ষ্য পরস্পরকে overlap করতে পারে, volatility regime স্থায়ী হতে পারে, আর rolling forecast প্রায় একই estimation data বারবার ব্যবহার করতে পারে। তখন \(n\)টি জোড়া \(n\)টি স্বাধীন তথ্য নয়। প্রচলিত standard error অতিরিক্ত ছোট হতে পারে, ফলে ভুলভাবে নাল প্রত্যাখ্যান বেশি ঘটতে পারে।
Pesaran ও Timmermann পরবর্তী গবেষণায় dynamic augmented regression ও finite-order Markov framework দিয়ে serially correlated বহু-বিভাগের চলকের নির্ভরতা পরীক্ষা করেন {source:pesaranTimmermannSerialCategories2009}। দিক-সংক্রান্ত পূর্বাভাস নিয়ে কাজেও serial correlation থাকলে প্রচলিত independence-based PT পদ্ধতির অতিরিক্ত rejection দেখা গেছে, এবং bootstrap-সহ dependence-robust বিকল্প পরীক্ষা করা হয়েছে {source:blaskowitzHerwartzDirectionalSerialCorrelation2014}। উপযুক্ত পদ্ধতি নির্ভর করে পূর্বাভাস কীভাবে তৈরি, horizon কত, এবং dependence structure কেমন—সাধারণ resampling recipe নিজে থেকেই বৈধ নয়।
forecast origin overlap করে কি না, তাদের ব্যবধান কত, এবং uncertainty estimate-এর জন্য কোন dependence method ব্যবহৃত হয়েছে, জানান। textbook statistic-কে descriptive benchmark হিসেবে দিলে independence assumption স্পষ্ট করুন। Design সেই assumption ভাঙলেও nominal 5% ফলকে প্রকৃত false-rejection rate-ও 5%—এভাবে ব্যাখ্যা করবেন না।
বাস্তবে করা সম্ভব ছিল এমন পূর্বাভাস দিয়ে মূল্যায়ন সাজান
প্রতিটি origin-এ ঠিক তখন যতটুকু forecast পাওয়া গিয়েছিল, forecast horizon, তথ্য cutoff, realized outcome, এবং যেভাবে up/down label তৈরি হয়েছে তা সংরক্ষণ করুন। সারণি করার আগে timestamp, instrument, price বা return definition, এবং missing-value treatment এক করুন। সংশোধিত macroeconomic data বা evaluation period দেখে tune করা signal-নির্ভর পূর্বাভাস অপরিবর্তিত out-of-sample forecast নয়।
Holdout result দেখার আগে classification threshold ঠিক করুন। Model probability দিলে threshold সেটিকে binary direction-এ বদলায়; একই sample-এ threshold খুঁজলে প্রশ্ন বদলে যায় এবং selection bias তৈরি হয়। Training, validation, final evaluation-এর ভূমিকা আলাদা রাখুন, আর model search ধরার জন্য resampling করলে প্রতিবার সম্পূর্ণ selection process নতুন করে চালান।
PT-র প্রশ্ন forecast error-এর magnitude তুলনা করা থেকে আলাদা। Diebold–Mariano নির্দেশিকা paired loss difference তুলনা করে, আর Giacomini–White নির্দেশিকা পূর্বনির্ধারিত তথ্যের সঙ্গে relative predictive ability বদলায় কি না জিজ্ঞেস করে। Nested forecast model-এর জন্য Clark–West adjustment নির্দেশিকা দেখুন। পরিচিত test statistic ফেরত দেয় বলে আলাদা প্রশ্নের পরীক্ষাগুলো একে অন্যের বদলে ব্যবহার করা উচিত নয়।
দিকের তাৎপর্য মানেই কৌশলের লাভ নয়
PT test প্রতিটি ফলকে একটি direction label-এ নামিয়ে আনে। এক tick বৃদ্ধি ও বড় rally—দুটিই একই up; ছোট miss ও বড় loss—দুটিই এক direction error। তাই hit rate বাড়লেও কৌশল লোকসান করতে পারে, যদি ভুল পূর্বাভাসের ক্ষতি জয়ের চেয়ে বড় হয়, signal price move-এর পরে আসে, বা trading cost edge মুছে দেয়।
ধরা যাক, সমান আকারের ১০০টি কাল্পনিক trade-এ ৬৪টি ঠিক direction-এর প্রতিটিতে গড় 0.10% লাভ এবং ৩৬টি ভুলের প্রতিটিতে গড় 0.25% ক্ষতি। খরচের আগে সরল gross sum \(64(0.10\%)-36(0.25\%)=-2.6\) percentage point, ৬৪% hit rate সত্ত্বেও। হিসাবটি compounding বাদ দেয়, market evidence নয়; hit rate একা expectancy নির্ধারণ করে না।
Trade মূল্যায়নে entry ও exit timing, position size, risk limit, এবং unfilled order-এর treatment return হিসাবের আগেই নির্ধারণ করুন। প্রযোজ্য ক্ষেত্রে bid–ask spread, commission, slippage, market impact, financing, এবং venue-specific cost ধরুন। উপযুক্ত benchmark-এর বিপরীতে out-of-sample net return তুলনা করুন এবং rule তৈরির সময় করা multiple testing-ও হিসাব করুন। PT result directional association-এর একটি প্রমাণ হতে পারে; বাস্তবে কার্যকর, cost-aware মূল্যায়নের বিকল্প নয়।
সাধারণ প্রশ্ন
Q1Pesaran–Timmermann test কি accuracy-কে ৫০%-এর সঙ্গে তুলনা করে?
না। এটি observed agreement-কে actual-up ও forecast-up share আলাদাভাবে ধরে হিসাব করা independence baseline-এর সঙ্গে তুলনা করে। সেই baseline ৫০%-এর বেশি বা কম হতে পারে।
Q2Forecast horizon overlap করলে usual PT p-value ব্যবহার করা যাবে?
Dependence সমাধান না করে নয়। Overlapping target ও persistent label independence-based uncertainty estimate-কে অতিরিক্ত ছোট করতে পারে। Forecast horizon ও dependence structure-এর সঙ্গে মেলে এমন পদ্ধতি ব্যবহার করুন।
Q3Significant PT result কি trading strategy লাভজনক বোঝায়?
না। পরীক্ষাটি direction label ব্যবহার করে; move size, entry ও exit price, position size, fee, slippage বা funding মাপে না। Out-of-sample net return আলাদাভাবে মূল্যায়ন করুন।
উৎস ও আরও পড়ুন
সমস্যা জানান
এই নিবন্ধের লিংকসহ একটি ইমেল তৈরি হবে। পাঠানোর পরেই Mark প্রতিবেদনটি পাবে
দ্রুত যাচাই
গাইডটি পড়ার পর 3টি প্রশ্নে নিজেকে যাচাই করুন
প্রশ্ন 01
বাস্তব ফল ৬০% সময় ঊর্ধ্বমুখী এবং forecast ৭০% সময় ঊর্ধ্বমুখী হলে independence agreement baseline কত?
ব্যাখ্যা দেখতে একটি উত্তর বেছে নিন
অপশন শব্দকোষ
কল, পুট ও অপশন চেইন থেকে অন্তর্নিহিত অস্থিরতা, গ্রিকস এবং বিড-আস্ক স্প্রেড পর্যন্ত গুরুত্বপূর্ণ শব্দের পরিষ্কার সংজ্ঞা
অপশন শব্দকোষ দেখুন