Kiểm định Kolmogorov-Smirnov
Kiểm định Kolmogorov-Smirnov (thường viết tắt là kiểm định K-S) là một trong những kiểm định phi tham số phổ biến nhất trong thống kê, được phát triển bởi nhà toán học người Nga Andrey Kolmogorov vào năm 1933 và sau đó được Nikolai Smirnov mở rộng vào năm 1939 để áp dụng cho trường hợp so sánh hai mẫu độc lập. Mục tiêu cốt lõi của kiểm định này là đo lường mức độ khác biệt giữa hàm phân phối tích lũy thực nghiệm (Empirical Cumulative Distribution Function - ECDF) của một mẫu dữ liệu và một hàm phân phối lý thuyết đã được chỉ định trước (như phân phối chuẩn, phân phối đều, phân phối mũ), hoặc so sánh ECDF của hai mẫu dữ liệu với nhau. Đây là công cụ đặc biệt hữu ích trong lĩnh vực phân tích rủi ro và xây dựng mô hình tại các ngân hàng Việt Nam, nơi các chuyên viên phân tích dữ liệu thường xuyên phải kiểm tra các giả định phân phối trước khi áp dụng các mô hình định lượng như Value at Risk (VaR), mô hình tín dụng chấm điểm (credit scoring), hay mô hình dự báo tỷ lệ vỡ nợ.
Nguyên lý hoạt động và chỉ số thống kê D
Nguyên lý cơ bản của kiểm định Kolmogorov-Smirnov dựa trên việc tính toán khoảng cách lớn nhất (supremum) giữa hai hàm phân phối tích lũy đang được so sánh. Chỉ số thống kê D được tính theo công thức: D = sup|F_n(x) - F_0(x)|, trong đó F_n(x) là hàm phân phối tích lũy thực nghiệm từ mẫu dữ liệu quan sát được, và F_0(x) là hàm phân phối tích lũy lý thuyết đang được giả thuyết. Giá trị D nằm trong khoảng từ 0 đến 1, trong đó D = 0 có nghĩa là hai phân phối hoàn toàn trùng khớp, còn D càng gần 1 thì mức độ khác biệt càng lớn. Đây là đặc điểm khiến kiểm định K-S trở nên trực quan và dễ diễn giải hơn so với nhiều kiểm định khác.
Quy trình thực hiện kiểm định K-S gồm các bước cơ bản sau: thứ nhất, sắp xếp dữ liệu mẫu theo thứ tự tăng dần; thứ hai, tính toán hàm phân phối tích lũy thực nghiệm tại mỗi điểm dữ liệu bằng công thức i/n với i là thứ hạng của quan sát và n là kích thước mẫu; thứ ba, tính giá trị của hàm phân phối lý thuyết tại cùng các điểm dữ liệu; thứ tư, xác định khoảng cách lớn nhất tuyệt đối giữa hai hàm phân phối tích lũy, chính là giá trị D. Sau khi có giá trị D, người phân tích so sánh với giá trị tới hạn (critical value) tương ứng với mức ý nghĩa alpha đã chọn (thường là 0.05) và kích thước mẫu n. Nếu D lớn hơn giá trị tới hạn, bác bỏ giả thuyết không (null hypothesis) rằng dữ liệu tuân theo phân phối lý thuyết đã giả định.
Phân loại: Kiểm định một mẫu và kiểm định hai mẫu
Kiểm định Kolmogorov-Smirnov có hai biến thể chính mà ứng viên thi tuyển dụng ngân hàng cần nắm rõ. Biến thể thứ nhất là kiểm định một mẫu (one-sample K-S test), được sử dụng để kiểm tra xem một mẫu dữ liệu duy nhất có tuân theo một phân phối lý thuyết đã định hay không. Ví dụ, chuyên viên rủi ro thị trường tại một ngân hàng thương mại có thể sử dụng kiểm định này để kiểm tra giả thuyết rằng tỷ suất sinh lợi hàng ngày của cổ phiếu trong danh mục đầu tư tuân theo phân phối chuẩn hay không. Biến thể thứ hai là kiểm định hai mẫu (two-sample K-S test), dùng để so sánh phân phối của hai mẫu dữ liệu độc lập với nhau. Ứng dụng thực tế trong ngân hàng bao gồm việc so sánh phân phối thời gian xử lý giao dịch giữa hai chi nhánh khác nhau, hoặc so sánh phân phối số tiền gửi tiết kiệm giữa nhóm khách hàng cá nhân và nhóm khách hàng doanh nghiệp.
Ưu điểm và hạn chế của kiểm định Kolmogorov-Smirnov
Về ưu điểm, kiểm định K-S là kiểm định phi tham số, nghĩa là không đòi hỏi dữ liệu phải tuân theo bất kỳ phân phối cụ thể nào trước khi thực hiện, đây là điểm mạnh quan trọng khi làm việc với dữ liệu tài chính thường có phân phối lệch nặng (heavy-tailed distribution). Thứ hai, kiểm định K-S có thể áp dụng cho mọi loại dữ liệu liên tục và rất nhạy với cả sự khác biệt về vị trí (location) lẫn hình dạng (shape) của phân phối. Thứ ba, thuật toán tính toán tương đối đơn giản và có thể triển khai dễ dàng trên các phần mềm thống kê phổ biến như R, Python (scipy.stats.ks_2samp), SPSS, Stata, EViews.
Tuy nhiên, kiểm định K-S cũng tồn tại một số hạn chế đáng lưu ý. Hạn chế lớn nhất là kiểm định này yêu cầu phân phối lý thuyết phải được xác định hoàn toàn trước khi thực hiện kiểm định, tức là các tham số như giá trị trung bình và phương sai phải được biết trước thay vì ước lượng từ dữ liệu mẫu. Khi các tham số này được ước lượng từ cùng mẫu dữ liệu đang kiểm tra, kiểm định K-S sẽ trở nên thiên lệch và có xu hướng chấp nhận giả thuyết không quá mức. Ngoài ra, kiểm định K-S có thể kém nhạy hơn so với kiểm định Anderson-Darling trong việc phát hiện sự khác biệt ở phần đuôi của phân phối, một yếu tố rất quan trọng trong phân tích rủi ro tài chính.
So sánh với các kiểm định khác và ứng dụng trong ngân hàng
Trong thực hành phân tích thống kê tại ngân hàng, kiểm định Kolmogorov-Smirnov thường được so sánh với kiểm định Shapiro-Wilk (chuyên kiểm tra tính chuẩn), kiểm định Anderson-Darling (nhạy hơn với phần đuôi), kiểm định chi-squared (phù hợp với dữ liệu rời rạc), và kiểm định Jarque-Bera (dựa trên skewness và kurtosis). Mỗi kiểm định có thế mạnh riêng và việc lựa chọn kiểm định phụ thuộc vào đặc điểm của dữ liệu cũng như mục đích phân tích.
Trong bối cảnh tuyển dụng ngân hàng tại Việt Nam, các câu hỏi phỏng vấn về kiểm định Kolmogorov-Smirnov thường xuất hiện ở các vị trí chuyên viên phân tích dữ liệu, chuyên viên quản trị rủi ro, chuyên viên mô hình tín dụng thuộc khối quản trị rủi ro (Risk Management), khối dữ liệu và phân tích (Data Analytics), hoặc khối tài chính định lượng (Quantitative Finance). Ứng viên cần hiểu rõ cách diễn giải giá trị p-value, phân biệt được khi nào nên dùng kiểm định một mẫu và khi nào nên dùng kiểm định hai mẫu, đồng thời biết cách kết hợp kiểm định K-S với phương pháp Q-Q plot trực quan để có kết luận đáng tin cậy hơn. Các phần mềm phân tích dữ liệu mà ứng viên nên thành thạo bao gồm Python với thư viện SciPy, R với gốc dgof, và SAS với thủ tục PROC NPAR1WAY.
Lưu ý: Nội dung mang tính tham khảo và hướng dẫn ôn tập, không thay thế cho tư vấn chuyên môn về phương pháp luận thống kê trong từng nghiệp vụ ngân hàng cụ thể. Người đọc nên tham khảo thêm tài liệu chính thống và quy định nội bộ của tổ chức khi áp dụng vào thực tiễn.