การทดสอบ Cointegration ของ Johansen: อันดับ Trace และค่า Eigenvalue สูงสุด
ทำความเข้าใจว่าอันดับ cointegration ในการทดสอบ Johansen นับอะไร การทดสอบ trace ต่างจาก maximum-eigenvalue อย่างไร และเหตุใดการเลือก lag กับองค์ประกอบเชิงกำหนดจึงสำคัญ
ในคู่มือนี้อันดับ cointegration นับความสัมพันธ์นิ่งที่เป็นอิสระ
สรุปสั้น
ขั้นตอนของ Johansen ใช้ทดสอบอันดับของเมทริกซ์ระยะยาวในระบบอนุกรมเวลาหลายตัวแปร อันดับ \(r\) นับจำนวนองค์ประกอบเชิงเส้นที่นิ่งและเป็นอิสระภายใต้แบบจำลองที่กำหนด ค่าอันดับนี้ไม่ได้ระบุพอร์ตที่นำไปซื้อขายได้ด้วยตัวเอง ไม่ได้พิสูจน์เหตุและผล และไม่รับประกันว่าความสัมพันธ์ที่ประมาณได้จะคงอยู่
อันดับ cointegration นับความสัมพันธ์นิ่งที่เป็นอิสระ
สมมติว่า \(y_t\) มีตัวแปร \(k\) ตัว โดยแต่ละตัวถือว่าเป็น \(I(1)\) ภายใต้กระบวนการกำเนิดข้อมูลที่ระบุไว้ อันดับ cointegration \(r\) คือจำนวนองค์ประกอบเชิงเส้นที่เป็นอิสระจากระดับของตัวแปรเหล่านี้และมีภาวะนิ่ง หาก \(r=0\) แบบจำลองไม่พบองค์ประกอบดังกล่าวภายใต้ข้อกำหนดนี้ หาก \(0<r<k\) จะมีความสัมพันธ์ระยะยาวที่เป็นอิสระ \(r\) ความสัมพันธ์ และภายใต้เงื่อนไขทั่วไปของระบบ \(I(1)\) จะเหลือแนวโน้มสุ่มร่วม \(k-r\) แนวโน้ม อันดับหนึ่งหมายถึงมีหนึ่งความสัมพันธ์ครอบคลุมทั้งระบบ ไม่จำเป็นต้องเป็นคู่สินทรัพย์ที่เห็นได้ชัดหนึ่งคู่
นี่เป็นคำถามเกี่ยวกับทั้งระบบ ขั้นตอน Engle–Granger สองขั้นประมาณสมการระยะยาวที่กำหนด normalization ไว้หนึ่งสมการ แล้วทดสอบ residual ที่ประมาณได้ ส่วนวิธี likelihood ของ Johansen ประมาณและทดสอบมิติของ cointegrating space ใน vector autoregression จึงรองรับความสัมพันธ์อิสระได้มากกว่าหนึ่งแบบ วิธีทั้งสองตอบคำถามที่เกี่ยวข้องกันแต่ต่างกัน และอาจได้ผลไม่ตรงกันเมื่อใช้ตัวอย่างจำกัดหรือเลือก lag และองค์ประกอบเชิงกำหนดต่างกัน
VECM ทำให้อันดับมองเห็นได้
VAR ในระดับสามารถจัดรูปใหม่เป็น vector error-correction แบบย่อ โดยละองค์ประกอบเชิงกำหนดไว้ในที่นี้:
\[ \Delta y_t = \Pi y_{t-1} + \sum_{j=1}^{p-1}\Gamma_j\Delta y_{t-j}+\varepsilon_t, \qquad \Pi=\alpha\beta^{\mathsf T}. \]
ในสมการนี้ \(p\) คืออันดับ lag ของ VAR ในระดับ คอลัมน์ของ \(\beta\) แสดงองค์ประกอบระยะยาว ส่วน \(\alpha\) มีค่าน้ำหนักการปรับตัวที่เชื่อมภาวะไม่สมดุลในอดีตกับการเปลี่ยนแปลงปัจจุบัน เมื่ออันดับของ \(\Pi\) เท่ากับ \(r\) สามารถแยกตัวประกอบเป็นเมทริกซ์ \(\alpha\) และ \(\beta\) ขนาด \(k\times r\) ได้ อันดับของเมทริกซ์—not จำนวนตัวแปรเพียงอย่างเดียว—เป็นตัวกำหนดจำนวน error-correction terms ในระบบ
หากอนุกรมทั้ง \(k\) ตัวเป็น \(I(1)\) จริง กรณี cointegration ทั่วไปจะมี \(r<k\) ผลที่ได้เป็น full rank ชี้ว่าระดับตัวแปรนิ่งรอบองค์ประกอบเชิงกำหนดที่ข้อกำหนดแบบจำลองยอมให้ จึงควรตรวจสอบสมมติฐานเดิมเรื่องอันดับ integration อีกครั้ง ส่วนอันดับศูนย์ไม่ได้พิสูจน์ว่าตัวแปรไม่มีความเกี่ยวข้องกันในทุกแง่มุม แต่หมายถึงแบบจำลองที่เลือกไม่พบองค์ประกอบระดับที่นิ่ง ณ อันดับที่ทดสอบ

การทดสอบ trace และ maximum eigenvalue ใช้สมมติฐานทางเลือกต่างกัน
เรียงค่า eigenvalue ที่ประมาณได้เป็น \(1>\hat\lambda_1\ge\hat\lambda_2\ge\cdots\ge\hat\lambda_k\ge0\) ค่าเหล่านี้มาจากปัญหา reduced-rank ในขั้นตอน likelihood ไม่ใช่สัดส่วนความแปรปรวนที่อธิบายได้ตามปกติ สำหรับอันดับผู้สมัคร \(r\) สถิติ trace คือ
\[ \operatorname{LR}_{\mathrm{trace}}(r)=-T\sum_{i=r+1}^{k}\ln(1-\hat\lambda_i), \]
และทดสอบ \(H_0:\operatorname{rank}(\Pi)\le r\) เทียบกับ \(H_A:\operatorname{rank}(\Pi)>r\) โดยรวมหลักฐานจาก eigenvalue ที่เหลือ สถิติ maximum eigenvalue คือ
\[ \operatorname{LR}_{\max}(r,r+1)=-T\ln(1-\hat\lambda_{r+1}), \]
และทดสอบอันดับ \(r\) เทียบกับอันดับถัดไป \(r+1\) ดังนั้น trace ถามว่าจำนวนความสัมพันธ์ทั้งหมดมากกว่า \(r\) หรือไม่ ส่วน maximum eigenvalue ถามว่าข้อมูลสนับสนุนการเพิ่มความสัมพันธ์รายการถัดไปหรือไม่ ภายใต้สมมติฐานศูนย์เรื่องอันดับ สถิติทั้งสองไม่ได้มีการแจกแจงอ้างอิงแบบไคสแควร์ทั่วไป
ตัวอย่าง eigenvalue สมมติแสดงวิธีคำนวณ
พิจารณาระบบสามตัวแปรที่มีข้อมูลใช้ได้ 200 ค่า และค่า eigenvalue ที่ประมาณได้เรียงจากมากไปน้อยเป็น \(0.16\), \(0.05\), และ \(0.01\) ตัวเลขเหล่านี้สมมติขึ้นเพื่อการเรียนรู้ ไม่ใช่ค่าประมาณจากตลาด ที่ \(r=0\) สถิติ trace รวมทั้งสามพจน์ได้ประมาณ \(47.14\) ขณะที่สถิติ maximum eigenvalue ใช้เฉพาะพจน์แรกได้ประมาณ \(34.87\) ที่ \(r=1\) ค่าที่สอดคล้องกันประมาณ \(12.27\) และ \(10.26\); ที่ \(r=2\) ทั้งสองสถิติใช้ eigenvalue ตัวสุดท้ายและเท่ากับประมาณ \(2.01\)
การคำนวณให้ค่าสถิติทดสอบ แต่ยังไม่ใช่คำตัดสินเรื่องอันดับ ในการตัดสินใจ ให้นำแต่ละสถิติไปเทียบกับค่า critical หรือ p-value ที่ตรงกับกรณีเชิงกำหนดและลำดับการทดสอบอย่างแม่นยำ เช่น ผลในตารางซอฟต์แวร์ที่ระบุว่า “ปฏิเสธที่ \(r=0\)” เป็นหลักฐานต่ออันดับศูนย์ภายใต้สมมติฐานของตารางนั้นและระดับนัยสำคัญที่เลือก ไม่ใช่ความน่าจะเป็นโดยตรงที่สเปรดของสินทรัพย์หนึ่งจะนิ่ง หาก p-value สูงกว่าเกณฑ์ หมายถึงยังปฏิเสธสมมติฐานศูนย์ของอันดับนั้นไม่ได้ ไม่ได้พิสูจน์ว่าสมมติฐานนั้นเป็นจริง
อันดับ lag และองค์ประกอบเชิงกำหนดเป็นตัวกำหนดระบบที่ทดสอบ
เลือกอันดับ VAR ที่มีเหตุผลรองรับก่อนตีความอันดับ cointegration VAR ในระดับอันดับ \(p\) สอดคล้องกับ lag ของผลต่าง \(p-1\) ช่วงใน VECM หากใส่ lag น้อยเกินไป อาจเหลือ serial correlation ใน residual; หากใส่มากเกินไปจะใช้ degrees of freedom และทำให้การอนุมานในตัวอย่างจำกัดไม่เสถียร เกณฑ์สารสนเทศช่วยจัดลำดับตัวเลือกได้ แต่ต้องพิจารณาการวินิจฉัย residual ขนาดตัวอย่าง และจังหวะทางเศรษฐกิจด้วย ระบุวิธีเลือกอันดับและตรวจทางเลือกที่สมเหตุสมผล
กำหนดตำแหน่งของ intercept และ trend ว่าอยู่นอกความสัมพันธ์ cointegration ถูกจำกัดให้อยู่ภายใน หรือไม่มีในแบบจำลองที่ตั้งสมมติฐานไว้ แต่ละกรณีหมายถึงพลวัตระยะยาวและการแจกแจงของสถิติอันดับที่ต่างกัน เลือกข้อกำหนดให้เหมาะกับคำถามและข้อมูล ไม่ใช่ค้นหาค่า p-value ที่เอื้อที่สุด ใช้ค่า critical ที่ตรงกับกรณีเชิงกำหนด จำนวนตัวแปร และการนำไปใช้จริง สถิติอันดับ Johansen มีการแจกแจงแบบ nonstandard MacKinnon, Haug และ Michelis คำนวณการแจกแจง response-surface สำหรับการทดสอบ likelihood-ratio แบบ Johansen ในข้อกำหนดที่ระบุ รวมถึงส่วนขยายที่อนุญาตให้มีตัวแปรภายนอก \(I(1)\) ค่าเหล่านี้ใช้แทนกันได้กับทุกการตั้งค่าทดสอบอันดับไม่ได้
ตำแหน่งขององค์ประกอบเชิงกำหนดไม่ใช่ตัวเลือกตกแต่งในซอฟต์แวร์ ในการกำหนดพารามิเตอร์ที่ใช้กันทั่วไป ค่าคงที่ที่มีข้อจำกัดอยู่ภายในความสัมพันธ์ cointegration ทำให้ผลรวมดุลยภาพนั้นมีค่าเฉลี่ยที่ไม่เป็นศูนย์ได้ ส่วนค่าคงที่ที่ไม่มีข้อจำกัดอยู่นอกความสัมพันธ์อาจทำให้ระดับมีแนวโน้มเชิงกำหนดแบบอื่นได้ ข้อจำกัดของแนวโน้มยังเปลี่ยนเส้นทางระยะยาวที่สมมติไว้ด้วย ดังนั้นตารางที่ระบุเพียงว่า “ใส่ค่าคงที่” ยังไม่ครบ หากไม่บอกตำแหน่ง อ่านสมการของแบบจำลองและรายงานข้อจำกัดแต่ละข้อ.
เวกเตอร์ที่ประมาณได้ต้องมี normalization และการตีความทางเศรษฐกิจ
Cointegrating space คือสิ่งที่ต้องการประมาณเป็นหลัก ในแบบจำลองอันดับหนึ่ง การคูณเวกเตอร์ \(\beta\) ด้วยค่าคงที่ที่ไม่เป็นศูนย์ไม่เปลี่ยนว่าองค์ประกอบระดับใดมีภาวะนิ่ง นักวิเคราะห์จึงเลือก normalization เช่น กำหนดให้สัมประสิทธิ์หนึ่งเท่ากับหนึ่ง เมื่ออันดับสูงขึ้น มีหลาย basis ที่ครอบคลุม space เดียวกัน เวกเตอร์ที่ซอฟต์แวร์แสดงจึงไม่ได้เป็นความสัมพันธ์ทางเศรษฐกิจเฉพาะหนึ่งเดียวโดยอัตโนมัติ การตีความเวกเตอร์หนึ่งรายการต้องมีข้อจำกัดหรือทฤษฎีเพิ่มเติม และควรรายงาน normalization
เมทริกซ์การปรับตัว \(\alpha\) แสดงว่าตัวแปรใดตอบสนองต่อภาวะไม่สมดุลในระบบที่ประมาณได้ เครื่องหมายของค่าสัมประสิทธิ์ขึ้นอยู่กับ normalization ที่เลือก และแต่ละค่าเป็นสัมประสิทธิ์แบบมีเงื่อนไขในระบบ ไม่ใช่ผลเชิงสาเหตุที่แยกเดี่ยวได้ loading ที่เล็กหรือเป็นศูนย์อาจนำไปสู่สมมติฐาน weak exogeneity แต่ข้อสรุปนี้ต้องอาศัยข้อจำกัดอย่างเป็นทางการที่สอดคล้องและแบบจำลองที่ตั้งไว้ อันดับ cointegration เพียงอย่างเดียวไม่ได้บอกว่าตัวแปรใดเป็น “ตัวนำ” ความสัมพันธ์ใดมีความหมายทางเศรษฐกิจ หรือ shock จะมีผลต่อราคาในอนาคตอย่างไร
ความไม่เป็นเอกลักษณ์เป็นคุณสมบัติของการแยกตัวประกอบ ไม่ใช่แค่ปัญหาการแสดงผล เมื่อ \(H\) ไม่เอกฐาน เมทริกซ์ \(\beta H\) และ \(\alpha(H^{-1})^{\mathsf T}\) ให้เมทริกซ์ระยะยาว \(\Pi\) เดียวกัน ดังนั้นอาจระบุปริภูมิที่ประมาณได้ แม้ชุดเวกเตอร์ที่แสดงชุดหนึ่งจะไม่ได้มีเอกลักษณ์ การเลือกเวกเตอร์หนึ่งตัวเป็น spread สำหรับซื้อขายต้องมี normalization ที่ชัดเจนหรือข้อจำกัดทางเศรษฐกิจ และยังต้องวิเคราะห์หน่วยกับความเสี่ยงแยกต่างหาก.
การตัดสินใจแบบลำดับและความไม่แน่นอนของแบบจำลองจำกัดข้อสรุปเรื่องอันดับ
โดยทั่วไปจะประเมินอันดับด้วยการทดสอบค่าอันดับที่เป็นไปได้ตามลำดับ เริ่มที่ศูนย์แล้วเพิ่มขึ้นจนพบสมมติฐานศูนย์ข้อแรกที่ยังปฏิเสธไม่ได้ อันดับที่เลือกเป็นผลจากการเลือกแบบจำลองภายใต้ระดับนัยสำคัญและข้อกำหนดที่เลือก หากผลจาก trace กับ maximum eigenvalue ต่างกัน ให้รายงานทั้งคู่และตรวจจำนวน lag องค์ประกอบเชิงกำหนด power ที่ต่ำ structural break และความไวต่อข้อมูล แทนการปิดบังความไม่ตรงกัน
ค่า critical ของ likelihood-ratio เป็นค่า nonstandard และขึ้นอยู่กับข้อกำหนดของระบบ พฤติกรรมใกล้ unit root ตัวอย่างสั้น outlier การเปลี่ยน regime ตัวแปร \(I(2)\) หรือ regressors ภายนอกที่ integrated อาจทำให้กรอบ \(I(1)\) แบบง่ายไม่เหมาะสม ตารางอันดับมาตรฐานไม่ได้ครอบคลุมกรณีเหล่านี้โดยอัตโนมัติ งานต้นฉบับของ Johansen พัฒนาการอนุมาน likelihood ภายใต้สมมติฐาน Gaussian VAR; การคำนวณ response-surface ในภายหลังให้การแจกแจงอ้างอิงสำหรับการทดสอบบางรูปแบบ ไม่ใช่ปัญหาข้อมูลทุกชนิด
ตัวอย่างเช่น หากการทดสอบ trace ปฏิเสธ \(r=0\) และ \(r=1\) แต่ไม่ปฏิเสธ \(r=2\) ลำดับการทดสอบแบบทั่วไปจะเลือกอันดับสองภายใต้ข้อกำหนดแบบจำลองและระดับนัยสำคัญนั้น ไม่ได้หมายความว่าความน่าจะเป็นที่อันดับสองเป็นจริงเท่ากับหนึ่ง ลำดับของการทดสอบค่าสูงสุดเปรียบเทียบสมมติฐานของอันดับที่อยู่ติดกัน จึงควรรายงานผลการตัดสินใจนั้นด้วย อย่านำค่าวิกฤตของการทดสอบหนึ่งไปใช้กับสถิติของอีกการทดสอบ.
อันดับที่เลือกยังขึ้นกับช่วงตัวอย่างด้วย การเปลี่ยนแปลงของความสัมพันธ์ทางเศรษฐกิจ โครงสร้างตลาด หรือนิยามตัวแปรอาจทำให้ค่าประมาณช่วงต้นกับช่วงท้ายต่างกัน การวิเคราะห์ความไวอาจเผยความไม่เสถียรนี้ แต่การค้นหาจุดสิ้นสุดหลายตำแหน่งทำให้เกิดปัญหาการทดสอบหลายครั้งเพิ่มเติม ระบุว่าช่วงใดกำหนดไว้ล่วงหน้า และถือว่าการแบ่งช่วงที่ไม่ได้วางแผนเป็นหลักฐานเชิงสำรวจ.
อันดับ cointegration ไม่ใช่สัญญาณ pairs trading
ในการศึกษาการเทรด เวกเตอร์ \(\beta\) ที่ประมาณได้อาจเป็นตัวเลือกหนึ่งสำหรับนิยามสเปรด แต่อันดับไม่ได้กำหนดระดับเข้าออก ขนาดสถานะ หรือผลตอบแทนที่คาดหวัง หากมี cointegrating vectors หลายตัว การเลือกองค์ประกอบหนึ่งอาจเกี่ยวข้องกับ normalization ข้อจำกัด และการคัดเลือกข้อมูล แม้ประมาณพบความสัมพันธ์ทางสถิติแล้ว น้ำหนักอาจสื่อถึงสถานะ short การใช้ leverage หรือสภาพคล่องต่ำ
ประมาณระบบโดยใช้เฉพาะข้อมูลที่มี ณ แต่ละวันตัดสินใจ และทดสอบกระบวนการคัดเลือกกับการประมาณซ้ำทั้งหมดตามลำดับเวลา ตรวจว่าความสัมพันธ์ยังเสถียรนอกตัวอย่างหรือไม่ และรวมเงินปันผล การ roll สัญญา การแปลงสกุลเงิน ต้นทุนเงินทุน ความพร้อมในการยืม ส่วนต่าง bid–ask ผลกระทบต่อตลาด และเวลาส่งคำสั่งตามความเหมาะสม การปฏิเสธสมมติฐานอันดับเป็นหลักฐานเกี่ยวกับแบบจำลองที่ระบุ ไม่ใช่คำกล่าวอ้างเรื่องกำไร คู่มือ การทดสอบ Engle–Granger และ error correction อธิบายทางเลือกแบบสมการเดียว ส่วน cointegration เทียบกับ correlation ใน pairs trading อธิบายว่า correlation ไม่ใช่คุณสมบัติเดียวกัน
รายงานรายละเอียดให้เพียงพอต่อการทำซ้ำการทดสอบอันดับ
ระบุตัวแปร \(k\) ตัว การแปลงข้อมูล ความถี่การสังเกต วันที่ของตัวอย่าง และหลักฐานเรื่องอันดับ integration รายงานอันดับ lag ของ VAR ในระดับ ตำแหน่งองค์ประกอบเชิงกำหนด ขนาดตัวอย่างที่ใช้จริง สถิติ trace และ maximum eigenvalue ค่า critical หรือ p-value ที่ตรงกัน ระดับนัยสำคัญ และการตัดสินอันดับแบบลำดับ ระบุว่าการทดสอบสองแบบเห็นตรงกันหรือไม่ ใช้อันดับใดต่อ และการตรวจความไวแบบใดเปลี่ยนผล
เมื่อนำเสนอเวกเตอร์ ให้ระบุ normalization ข้อจำกัด และ loading การปรับตัวที่เกี่ยวข้อง สำหรับการใช้งานเทรด ให้เปิดเผยข้อมูลที่มีในแต่ละครั้งที่ปรับสมดุล กฎเลือกเวกเตอร์ การออกแบบทดสอบนอกตัวอย่าง ต้นทุน และวิธีจัดการความล้มเหลว งานวิเคราะห์เวกเตอร์ cointegration ของ Johansen ปี 198890041-3) พัฒนาวิธี likelihood สำหรับ cointegrating space และอันดับ งาน Gaussian VAR ปี 1991 กล่าวถึงการอนุมานอันดับและสมมติฐานเกี่ยวกับเวกเตอร์ MacKinnon, Haug และ Michelis เสนอ การแจกแจง response-surface สำหรับการทดสอบ likelihood-ratio ของ cointegration คู่มือที่เกี่ยวข้องอธิบาย ภาวะนิ่งและ unit root
คำถามที่พบบ่อย
Q1อันดับหนึ่งหมายความว่ามีสินทรัพย์สองตัวเป็นคู่กันพอดีหรือไม่?
ไม่ใช่ หมายถึงมีองค์ประกอบนิ่งที่เป็นอิสระหนึ่งองค์ประกอบในระบบทั้งหมด ความสัมพันธ์นั้นอาจมีหลายตัวแปรและต้องกำหนด normalization ที่ตีความได้
Q2การทดสอบ trace และ maximum eigenvalue ต้องเลือกอันดับเดียวกันหรือไม่?
ไม่จำเป็น เพราะใช้สมมติฐานทางเลือกต่างกันและผลอาจไม่ตรงกัน ให้รายงานทั้งคู่และตรวจแบบจำลอง lag องค์ประกอบเชิงกำหนด และความไวของตัวอย่าง
Q3การปฏิเสธอันดับศูนย์พิสูจน์ว่าสเปรดจะทำกำไรหรือไม่?
ไม่ใช่ เป็นหลักฐานคัดค้านสมมติฐานไม่มี cointegration ภายใต้แบบจำลองที่ระบุ ผลนี้ไม่ได้ให้กฎเทรด ความเสถียรนอกตัวอย่าง หรือผลตอบแทนสุทธิหลังต้นทุนการดำเนินการ
แหล่งข้อมูลและการอ่านเพิ่มเติม
รายงานปัญหา
เราจะเตรียมอีเมลพร้อมลิงก์บทความนี้ Mark จะได้รับรายงานเมื่อคุณส่งอีเมลแล้วเท่านั้น
ตรวจสอบอย่างรวดเร็ว
อ่านคู่มือจบแล้ว ลองตอบคำถาม 3 ข้อ
คำถาม 01
ระบบสามตัวแปรที่ถือว่าเป็น I(1) มีอันดับ cointegration เท่ากับหนึ่ง หมายความว่าอย่างไร?
เลือกคำตอบเพื่อดูคำอธิบาย
อภิธานศัพท์ออปชัน
The existence of a stationary linear combination among nonstationary series, implying a shared long-run equilibrium restriction under a specified model.
อ่านคู่มือฉบับละเอียดMean reversionA model-dependent tendency for a variable to move back toward a fixed or changing reference; it does not automatically imply stationarity or tradability.
อ่านคู่มือฉบับละเอียดAt the moneyA call or put whose strike is near the underlying price; it has little intrinsic value and often substantial sensitivity to time and volatility.
อ่านคู่มือฉบับละเอียด