Tóm tắt Chương 6: Data science and analytics

Môn Advanced Performance Management (APM), chương 6/14

Big data

  • Big data: tập dữ liệu lớn, nhanh hoặc đa dạng tới mức công cụ truyền thống không xử lý nổi; nguồn là internet, điện thoại, mạng xã hội, giao dịch điện tử, cảm biến (IoT).
  • Năm V: volume (khối lượng), velocity (tốc độ sinh ra và cần xử lý), variety (nhiều dạng, phần lớn phi cấu trúc), veracity (độ chính xác, đầy đủ, đại diện, còn mới), value (lợi ích có lớn hơn chi phí). Ba V đầu theo định nghĩa của Gartner.
  • Năm hướng tạo giá trị: minh bạch, cải thiện hiệu quả hoạt động, phân khúc và cá nhân hóa, hỗ trợ hoặc tự động hóa quyết định, sản phẩm và dịch vụ mới.
  • Tác động tới đo lường: KPI gần thời gian thực, đo được điều trước đây chỉ đoán (cảm nhận khách, lý do bỏ giỏ hàng), báo cáo chi tiết hơn nhưng dễ quá tải thông tin.
  • Rủi ro và thách thức: không đại diện, chất lượng dữ liệu, giá trị chưa chắc, chi phí hạ tầng và tuân thủ, quá tải IT, thiếu kỹ năng, rò rỉ dữ liệu, algorithmic bias, tác động xã hội và social cooling.
  • Vai trò của kế toán quản trị: bảo đảm dữ liệu đáng tin, thúc đẩy văn hóa quyết định dựa trên bằng chứng, cầu nối giữa IT, nhà khoa học dữ liệu và kinh doanh; ba điều kiện để đưa analytics vào tổ chức là văn hóa, con người và kỹ năng, chiến lược công nghệ.

Quy trình data science

  • Đặt mục tiêu: vấn đề kinh doanh, câu hỏi cần trả lời, tiêu chí thành công.
  • Chọn dữ liệu: nguồn nội bộ (CRM, ERP, sổ sách, nhật ký vận hành) và bên ngoài (thị trường, mạng xã hội, đối thủ, chỉ số kinh tế); tiêu chí liên quan, sẵn có, chất lượng.
  • Làm sạch: bỏ trùng, xử lý giá trị thiếu (điền, loại, đánh dấu), sửa lỗi, chuẩn hóa đơn vị và định dạng; bước giữ veracity.
  • Biến đổi: normalisation, encoding, aggregation, feature engineering.
  • Lưu trữ: cơ sở dữ liệu SQL hoặc NoSQL, cloud, data warehouse (dữ liệu có cấu trúc), data lake (dữ liệu phi cấu trúc dạng thô); tính tới luật bảo vệ dữ liệu, phân quyền, kết nối công cụ phân tích.

Bốn cấp độ analytics

  • Descriptive: chuyện gì đã xảy ra. Diagnostic: vì sao. Predictive: điều gì có thể xảy ra. Prescriptive: nên làm gì.
  • Càng lên cao giá trị càng lớn nhưng cần dữ liệu tốt hơn, mô hình phức tạp hơn; prescriptive dựa trên kết quả predictive.

Thống kê mô tả

  • Mean = Σx ÷ n, bị kéo mạnh bởi outlier; median là giá trị giữa; mode là giá trị xuất hiện nhiều nhất.
  • Range = lớn nhất − nhỏ nhất. Standard deviation σ = Σ(x − x̄)² ÷ n (mẫu chia n − 1). Coefficient of variation = σ ÷ mean × 100%, dùng để so độ phân tán giữa các tập dữ liệu khác quy mô.
  • Phân phối: chuẩn (đối xứng), lệch (mean khác median), phân cực (dồn hai đầu, mean không đại diện cho ai).
  • Outlier: tìm nguyên nhân trước; lỗi thì sửa, sự kiện một lần thì trình bày riêng, tín hiệu thật thì giữ lại.
  • Expected value = Σ(p × x); risk neutral chọn EV cao nhất; EV bằng nhau thì độ lệch chuẩn, hệ số biến thiên cho biết rủi ro; EV là trung bình dài hạn, ít ý nghĩa với quyết định một lần.

Regression và correlation

  • y = a + bx; b = (nΣxy − ΣxΣy) ÷ (nΣx² − (Σx)²); a = Σy/n − bΣx/n; đường đi qua (x̄, ȳ).
  • b: y đổi bao nhiêu khi x tăng 1 đơn vị (diễn giải kèm đơn vị); còn a là giá trị y khi x = 0, không có nghĩa kinh tế nếu dữ liệu không có điểm gần 0.
  • r = (nΣxy − ΣxΣy) ÷ (nΣx² − (Σx)²)(nΣy² − (Σy)²), từ −1 tới +1, cùng dấu với b. R² = r², tỷ lệ biến động của y được x giải thích.
  • Nội suy tương đối tin cậy; ngoại suy ngoài vùng dữ liệu rủi ro cao.
  • Giới hạn: dữ liệu quá khứ, tương quan không phải nhân quả (spurious correlation), ít quan sát, outlier, quan hệ phi tuyến, bỏ sót biến hoặc quá nhiều biến liên quan nhau.
  • Quá nhiều biến: các biến độc lập liên quan nhau nên khó tách tác động riêng, khớp quá mức với dữ liệu cũ, và giảm statistical power (khả năng phát hiện một tác động khi nó thật sự tồn tại).
  • Bias: selection bias, survivorship bias, self-selection bias; nguồn mất thị phần, định kiến trong dữ liệu lịch sử, confirmation bias.

Các loại dữ liệu

  • Dữ liệu có cấu trúc nằm trong trường định sẵn; phi cấu trúc (khoảng 80%) phải gắn nhãn, thêm metadata trước khi phân tích.
  • Text analytics, image analytics, video analytics, voice analytics; sentiment analysis xác định thái độ trong văn bản hoặc giọng nói.
  • Phi cấu trúc cho biết vì sao, chi tiết và thật hơn bảng hỏi; nhưng tốn lưu trữ, phân tích phức tạp, máy dễ hiểu sai, không đại diện, có thể bị thao túng, vướng quyền riêng tư.

Machine learning và AI

  • AI: hệ thống cảm nhận, hiểu, hành động và học. Machine learning: tự học mẫu hình từ dữ liệu, không cần lập trình từng quy tắc.
  • Ứng dụng: phát triển sản phẩm, sản xuất, kho vận, bảo trì dự báo, xử lý khiếu nại, an ninh mạng, tương tác khách hàng, báo cáo, phát hiện gian lận.
  • Hạn chế: thiếu tin tưởng, chạy ngoài dự kiến, bị bỏ qua hoặc dùng sai, dữ liệu hạn chế hoặc thiên lệch, quyết định thiếu bối cảnh, black box (không giải thích, không kiểm toán được, trách nhiệm mờ).

Data model: đánh giá và truyền đạt

  • Tiêu chí: accuracy, relevance, timeliness, interpretability; soát giả định và độ nhạy.
  • Đọc output: tìm mẫu hình qua chỉ tiêu, nối chuỗi nhân quả có thể có, đối chiếu mục tiêu và điểm mạnh của công ty, đánh giá độ tin cậy.
  • Refine: cải thiện dữ liệu, xem lại giả định, thêm hoặc bỏ biến, chỉnh thuật toán, phân tích kịch bản, kiểm tra ngược định kỳ.
  • Truyền đạt: tóm tắt phát hiện chính, ý nghĩa với hiệu quả, khuyến nghị có chi phí lợi ích, rủi ro và độ bất định; điều chỉnh theo người đọc (hội đồng quản trị, quản lý vận hành, nhân viên tiếp xúc khách).
  • Lợi ích của hành động tính trên phần thực sự giữ lại được, tốt nhất trên biên đóng góp, không trên toàn bộ doanh thu có rủi ro.

Đạo đức dữ liệu

  • Vấn đề: quyền riêng tư, đồng ý và mục đích, dữ liệu của người thứ ba, algorithmic bias, minh bạch và black box, máy tự quyết, nhắm nhóm dễ tổn thương, social cooling, thu thập quy mô lớn.
  • Sáu nguyên tắc GDPR: lawfulness, fairness and transparency; purpose limitation; data minimisation; accuracy; storage limitation; integrity and confidentiality.
  • Biện pháp: đồng ý cụ thể, tối thiểu hóa và ẩn danh, thẩm định nguồn dữ liệu mua, đánh giá tác động, kiểm tra bias, con người duyệt quyết định quan trọng, kiểm soát an ninh, quy tắc đạo đức dữ liệu.
  • Lập luận: thu thập thế nào, dùng vào việc gì, ai lợi ai thiệt, trách nhiệm với cổ đông và xã hội, khuyến nghị; tách sản phẩm hợp pháp khỏi cách dùng dữ liệu.
  • App theo dõi người trong tổ chức: đồng ý gộp vào giấy tờ bắt buộc không phải đồng ý thật; theo dõi vượt nhu cầu chính đáng (ngoài giờ, ngoài nơi làm); chia cho bên thứ ba; mục đích công bố (sức khỏe, an toàn) khác mục đích thật (doanh thu).

Bản đầy đủ gồm

Bài giảng chi tiết, flashcard lặp lại ngắt quãng, ngân hàng câu hỏi luyện thi, lộ trình theo ngày thi. Dùng trọn 1 năm.