Mã hóa và regularization
- Biến không có thứ tự: one-hot encoding (1 cho nhóm của quan sát, 0 cho nhóm khác). Biến có thứ bậc: gán 0, 1, 2, … theo thứ tự.
- Regularization thêm penalty vào loss để thu nhỏ hệ số, giảm overfitting. Ridge (L2): L = RSS + λΣβ2, thu nhỏ về gần 0, giải tích. LASSO (L1): L = RSS + λΣ|β|, đưa hệ số kém quan trọng về đúng 0 (chọn feature), phương pháp số. Elastic net cộng cả hai penalty. λ là hyperparameter.
Logistic regression
- Đầu ra nhị phân: Pj = 1 ÷ [1 + e−(α + Σβx)], nằm trong (0, 1); ước lượng bằng maximum likelihood (log-likelihood), không dùng OLS.
- Phân loại: ŷ = 1 nếu P ≥ Z. Z = 0.5 khi chi phí sai lầm cân xứng; hạ Z (ví dụ 0.1) khi bỏ sót vỡ nợ rất tốn kém.
- Đầu ra liên tục: MSFE = (1 ÷ ntest)Σ(y − ŷ)2; hoặc mean absolute forecast error.
Decision tree và ensemble
- Root node, decision node, terminal node; CART là white-box. Entropy = −Σp log2p; Gini = 1 − Σp2. Information gain = thước đo node cha − bình quân gia quyền node con; chọn feature có gain lớn nhất. Pre-pruning và post-pruning chống overfitting.
- Ensemble: wisdom of crowds, chống overfitting. Bagging (có hoàn lại, out-of-bag), pasting (không hoàn lại), random forest (tập con feature khoảng √m, giảm tương quan giữa cây), boosting (gradient boosting trên phần dư; AdaBoost tăng trọng số quan sát bị phân loại sai).
KNN, SVM, neural network
- KNN: lazy learner; K lớn → bias cao, variance thấp; K ≈ √n. SVM: con đường rộng nhất; support vectors nằm trên mép, separation boundary ở giữa; hyperplane có số chiều bằng số feature − 1.
- Neural network: output = bias + Σwjxj, activation function tạo phi tuyến; gradient descent với learning rate; dừng khi kết quả validation bắt đầu xấu đi dù training vẫn cải thiện.
Đánh giá phân loại
- Accuracy = (TP + TN) ÷ tổng; precision = TP ÷ (TP + FP); recall = TP ÷ (TP + FN); error rate = (FP + FN) ÷ tổng = 1 − accuracy.
- ROC: TPR theo FPR; AUC = 1 hoàn hảo, 0.5 ngẫu nhiên, < 0.5 tệ hơn ngẫu nhiên. So sánh mô hình khi các chỉ số mâu thuẫn: nhìn confusion matrix và chi phí sai lầm.