Phân tích dữ liệu kinh doanh (MAS501) — Học từ số 0
Nội dung bám 100% tài liệu tóm tắt ôn thi của môn (TS. Hà Thúc Huân — Viện Quản trị & Công nghệ FSB), viết lại theo lối người thầy giảng cho người mới. Có bài trắc nghiệm 45 câu (chuyển thể từ bộ câu hỏi tự kiểm tra chính thức) để tự kiểm tra.
BẢN ĐỒ TOÀN MÔN — nhìn một phát biết học gì
Cả môn chỉ xoay quanh 6 module, mỗi module trả lời một câu hỏi kinh doanh:
| Module | Trả lời câu hỏi | Kỹ thuật chính |
|---|---|---|
| 1. Giới thiệu | Phân tích dữ liệu là gì, đặt câu hỏi thế nào? | DDDM, MECE, 5 Whys |
| 2. Mô tả | Chuyện gì đã và đang xảy ra? | Trực quan hóa, mean/median/mode, độ lệch chuẩn, CV |
| 3. Suy luận thống kê | Kết quả này là thật hay do ngẫu nhiên? | CLT, khoảng tin cậy, kiểm định, p-value, A/B test |
| 4. Dự báo | Điều gì sẽ xảy ra tiếp theo? | Hồi quy đơn & đa biến, phần dư, chuỗi thời gian, Delphi |
| 5. Data Mining | Có nhóm/mẫu hình ẩn nào trong dữ liệu? | Phân cụm, phân loại (k-NN), luật kết hợp |
| 6. Đề xuất | Nên làm gì là tốt nhất? | Tối ưu hóa: biến quyết định, hàm mục tiêu, ràng buộc |
MODULE 1 — Giới thiệu phân tích dữ liệu kinh doanh
1.1. Hai khung tư duy đặt câu hỏi
Sếp phán: "Doanh thu đang giảm, hãy tìm hiểu đi!" — đây là kiểu yêu cầu tồi kinh điển: quá mơ hồ, không giả thuyết, không biết bắt đầu từ đâu. Người làm phân tích chuyên nghiệp xử lý bằng 2 công cụ:
- MECE (Mutually Exclusive, Collectively Exhaustive — "không trùng lặp, không bỏ sót", do McKinsey phổ biến): chia nhỏ vấn đề thành các nhánh không chồng chéo (ME) và không bỏ sót trường hợp nào (CE) — ví dụ chia doanh thu theo sản phẩm × kênh — để khoanh vùng khu vực có vấn đề.
- 5 Whys (Sakichi Toyoda — Hệ thống sản xuất Toyota): hỏi "vì sao" nhiều lần liên tiếp, không dừng ở câu trả lời bề mặt, đào đến lỗi gốc rễ ở quy trình/hệ thống.
1.2. Nguồn dữ liệu — "mỏ vàng" 3 tầng
| Tầng | Trạng thái | Nội dung | Trả lời |
|---|---|---|---|
| Dữ liệu vận hành | Sẵn có | Máy móc (tốc độ, hiệu suất, tỷ lệ lỗi), ERP (tồn kho, đơn hàng), năng suất nhân công | Chúng ta vận hành hiệu quả đến đâu? |
| Dữ liệu kinh doanh | Cần xây dựng | Bán hàng, khách hàng (nhân khẩu, lịch sử mua), hiệu quả marketing | CÁI GÌ đang diễn ra trên thị trường? |
| Dữ liệu bên ngoài | Cần khai thác | Xu hướng ngành, đối thủ (giá, khuyến mãi), review khách hàng | TẠI SAO thị trường diễn ra như vậy? |
Big Data — 3V: Volume (khối lượng cực lớn) · Velocity (tốc độ cao) · Variety (đa dạng loại hình) — tập dữ liệu lớn tới mức công cụ truyền thống như Excel không xử lý hiệu quả.
1.3. Độ tin cậy vs. Tính hợp lệ (rất hay ra đề!)
- Thiết bị đo áp suất lốp luôn hiển thị thấp hơn thực tế 2 bar → KHÔNG tin cậy (sai lệch hệ thống) nhưng HỢP LỆ (vẫn đo đúng áp suất lốp).
- Đếm chính xác số cuộc gọi đến CSKH để đo "mức độ không hài lòng" → TIN CẬY nhưng KHÔNG hợp lệ (nhiều cuộc gọi chỉ hỏi thông tin).
- Câu hỏi về chất lượng thức ăn dùng đo "hài lòng tổng thể" → không tin cậy, cũng không hợp lệ (hài lòng còn gồm cả dịch vụ).
MODULE 2 — Phân tích mô tả (Descriptive)
2.1. Trực quan hóa — kể chuyện bằng hình
Con số phải nhớ: não người xử lý hình ảnh nhanh hơn văn bản tới 60.000 lần. Trước khi vẽ bất kỳ biểu đồ nào, hỏi 3 câu: Ai đọc? Họ kỳ vọng gì? Đọc xong họ sẽ hành động thế nào?
| Biểu đồ | Kể câu chuyện về | Lưu ý |
|---|---|---|
| Đường (line) | XU HƯỚNG theo thời gian | Tăng/giảm/đi ngang, có mùa vụ không |
| Cột / Thanh (column/bar) | SO SÁNH | Thanh ngang ưu tiên khi tên biến dài |
| Tròn (pie) | TỶ TRỌNG | Không dùng so sánh nhiều giá trị; tránh pie 3D (nghịch lý thị giác: phần 31% trông lớn hơn 34%) |
| Điểm phân tán (scatter) | QUAN HỆ 2 biến | Xem 4 thứ: hướng · hình dạng · độ mạnh · ngoại lai |
| Bản đồ nhiệt | SỰ TẬP TRUNG | Thị trường trọng điểm ở đâu |
| Thanh xếp chồng | So sánh + cơ cấu | Bản 100% chỉ so tỷ trọng, bỏ qua khác biệt tổng |
| Thác nước (waterfall) | Thay đổi lũy kế | "Chuyện gì xảy ra ở giữa": phân tích lợi nhuận, biến động nhân sự |
| Dốc (slope) | Thay đổi giữa 2 mốc | So thứ hạng, phát hiện xu hướng trái ngược |
2.2. Mô tả bằng số — 3 đặc điểm: Trung tâm · Biến thiên · Hình dạng
① Trung tâm — dữ liệu tập trung ở đâu:
| Thước đo | Công thức | Khi nào dùng |
|---|---|---|
| Trung bình cộng (Mean) | x̄ = (Σxᵢ)/n | Chịu ảnh hưởng mọi phần tử → nhạy với ngoại lai |
| Trung vị (Median) | Phân vị thứ 50 | Không nhạy ngoại lai → dùng khi dữ liệu lệch (thu nhập, giá nhà) |
| Mode | Giá trị xuất hiện nhiều nhất | Hữu ích với dữ liệu rời rạc/phân loại |
| Trung bình nhân | G = ⁿ√(x₁·x₂·…·xₙ) | Dữ liệu theo tỷ lệ: tăng trưởng, tỷ suất. Nhược: không xử lý được 0 và số âm |
② Độ biến thiên — phân tán rộng hay hẹp:
| Thước đo | Công thức | Ghi nhớ |
|---|---|---|
| Phạm vi (Range) | R = x_max − x_min | Dễ tính nhưng chỉ dựa 2 cực trị |
| Phương sai mẫu | s² = Σ(xᵢ − x̄)²/(n−1) | Đơn vị bị bình phương, khó diễn giải |
| Độ lệch chuẩn | s = √s² | Cùng đơn vị với biến → dùng nhiều nhất |
| Hệ số biến thiên (CV) | CV = 100·(s/x̄) % | So sánh độ phân tán giữa các tập khác đơn vị/khác trung bình. CV > 100% khi s > x̄ |
③ Hình dạng — quy tắc so sánh Mean vs Median:
| Hình dạng | Đuôi dài về | Quan hệ | Ví dụ trên slide |
|---|---|---|---|
| Lệch trái (âm) | Bên trái | Mean < Median | GPA của 158 sinh viên |
| Đối xứng | Cân đối | Mean = Median = Mode | Phân phối chuẩn |
| Lệch phải (dương) | Bên phải | Mean > Median | Chi tiêu tại 74 quán mì |
2.3. Hệ số tương quan r
Đo mức độ tuyến tính giữa hai biến định lượng: −1 ≤ r ≤ +1. r ≈ +1: đồng biến chặt; r ≈ −1: nghịch biến chặt; r ≈ 0: gần như không có quan hệ tuyến tính.
MODULE 3 — Suy luận thống kê
3.1. Phân phối chuẩn & quy tắc 68–95–99,7
Phân phối chuẩn: đối xứng, đỉnh chuông tại mean = median = mode; σ quyết định chuông "béo hay gầy". Quy tắc vàng:
≈ 68% dữ liệu trong μ ± 1σ · ≈ 95% trong μ ± 2σ · ≈ 99,7% trong μ ± 3σ
3.2. Định lý giới hạn trung tâm (CLT) — định lý quan trọng nhất
Minh họa (chuỗi cà phê, thang điểm 1–10): lấy 30 khách → TB mẫu 7,2; lặp 1.000 lần → dãy 7,2 · 7,5 · 7,1 · 7,3…; vẽ biểu đồ 1.000 trung bình đó → luôn ra hình chuông. Hai hệ quả: (1) trung bình của các trung bình mẫu = trung bình tổng thể; (2) độ lệch chuẩn của phân phối này — gọi là sai số chuẩn (Standard Error) — nhỏ hơn độ lệch chuẩn tổng thể.
3.3. Khoảng tin cậy (Confidence Interval)
Khoảng giá trị xây quanh trung bình mẫu, kèm biên độ sai số hợp lý, nhằm chứa giá trị thật của tổng thể. Ví dụ: khảo sát 100 khách, chi tiêu TB 500.000đ → KTC 95% = [480.000 ; 520.000].
3.4. Kiểm định giả thuyết & p-value
Tinh thần: "vô tội cho đến khi được chứng minh có tội" — H₀ là giả định vô tội, chỉ bác bỏ khi bằng chứng đủ mạnh. Quy trình 4 bước qua ví dụ: nhà cung cấp cam kết CTR 3%, chạy 10.000 lượt chỉ được 2,5%:
- Đặt giả thuyết — H₀: CTR thật = 3%; H₁: CTR thật < 3%.
- Thu thập bằng chứng — mẫu cho CTR 2,5%.
- Hỏi câu cốt lõi — "Nếu H₀ đúng, xác suất quan sát kết quả kém như vầy (hoặc tệ hơn) chỉ do ngẫu nhiên là bao nhiêu?"
- Xác suất đó là p-value → so ngưỡng α: p < 0,05 → bác bỏ H₀ ("bằng chứng đủ mạnh"); p ≥ 0,05 → không đủ cơ sở bác bỏ.
3.5. A/B Testing
So sánh khoa học hai phiên bản: A = bản gốc, B = biến thể đổi một yếu tố. Ví dụ: 1.000 người xem A → 4%; 1.000 người xem B (nút "Mua Ngay" cam) → 5,5%.
3.6. "Có ý nghĩa thống kê" ≠ "Quan trọng"
MODULE 4 — Phân tích dự báo (Predictive)
4.1. Hồi quy — bắt đầu đúng cách
Hồi quy mô tả quan hệ giữa biến phụ thuộc Y và (các) biến độc lập X, mọi biến đều dạng số. Mô hình tổng thể: Y = β₀ + β₁X + ε; ước lượng từ mẫu: Ŷ = b₀ + b₁X.
Phần dư (residual) = Y thực tế − Y dự báo. Đường hồi quy "tốt nhất" = đường tối thiểu hóa tổng bình phương phần dư (SSE) — bình phương để sai số âm/dương không triệt tiêu nhau và phạt nặng sai số lớn.
4.2. Đọc kết quả hồi quy
| Chỉ số | Ý nghĩa | Cách đọc |
|---|---|---|
| Hệ số góc b₁ | Tác động biên của X lên Y | "X tăng 1 đơn vị ⇒ Y thay đổi b₁, các yếu tố khác không đổi" |
| R² | % biến động của Y được mô hình giải thích | 0 → 1. R² = 0,53 → "53% biến động giá nhà được giải thích bởi diện tích" (KHÔNG phải "dự đoán đúng 53% trường hợp") |
| R² hiệu chỉnh | R² đã hiệu chỉnh theo cỡ mẫu & số biến | Dùng để so sánh mô hình khác số biến |
| p-value của hệ số | Biến X có ý nghĩa thống kê không | p < 0,05 ⇒ biến có giá trị giải thích |
| KTC 95% của hệ số | Giới hạn của hệ số thật | KTC không chứa 0 ⇒ biến có ý nghĩa |
Công cụ Excel: =SLOPE(Y,X) và =INTERCEPT(Y,X) lấy nhanh hệ số · Trendline trên scatter (tick hiện phương trình + R²) · Data → Data Analysis → Regression (đầy đủ nhất: R², Adjusted R², p-value, KTC, phần dư). Lưu ý: hồi quy đa biến trong Excel yêu cầu các cột X liền kề nhau.
4.3. Phân tích phần dư — "khám sức khỏe" mô hình
| Biểu đồ phần dư | Chẩn đoán | Xử lý |
|---|---|---|
| Rải ngẫu nhiên quanh 0 | Mô hình tốt | Giữ nguyên |
| Hình chữ U | Quan hệ phi tuyến | Thêm hạng tử bậc hai X² |
| Hình phễu (loe dần) | Phương sai sai số không đều | Biến đổi biến (log) hoặc đổi mô hình |
| Điểm có phần dư chuẩn hóa ngoài ±2 | Ngoại lai tiềm năng | Kiểm tra lỗi nhập liệu/sự kiện bất thường |
4.4. Hồi quy đa biến — 3 cái bẫy
4.5. Biến giả, phi tuyến & tương tác
- Biến giả (dummy): dữ liệu phân loại phải mã hóa số. k phân loại → tạo k − 1 biến 0/1 (tạo đủ k biến gây đa cộng tuyến hoàn hảo). Ví dụ: X₂ = có mặt tiền (0/1) → β₂ là chênh lệch giá so với nhà không mặt tiền.
- Hạng tử phi tuyến: Y = β₀ + β₁X + β₂X² — nhận biết khi phần dư hình chữ U; vẫn chạy được bằng hồi quy tuyến tính Excel. Ví dụ: Doanh số = 142.850 − 3.643,17×nhiệt độ + 23,3×nhiệt độ².
- Tương tác: tác động của biến này phụ thuộc biến kia — kiểm tra bằng X₃ = X₁×X₂. Quy tắc bắt buộc: nếu X₃ có ý nghĩa → luôn giữ cả X₁ và X₂ trong mô hình, dù chúng không có ý nghĩa thống kê.
4.6. Dự báo định tính & Delphi
Khi không có dữ liệu lịch sử (sản phẩm mới) hoặc dự báo tương lai xa → dùng dự báo định tính/phán đoán. Cảnh báo từ case giá dầu 1988: đầu năm ~22 USD/thùng, giữa năm còn 11; quá khứ OPEC thường đẩy giá lên nhưng giá vẫn giảm dù cắt sản lượng → tương đồng quá khứ không phải lúc nào cũng đúng.
4.7. Chuỗi thời gian
4 thành phần: hành vi ngẫu nhiên · xu hướng (trend) · hiệu ứng theo mùa (lặp theo năm/tháng/tuần/ngày) · hiệu ứng chu kỳ (khung dài nhiều năm — vd lãi suất). Chuỗi dừng = chỉ có thành phần ngẫu nhiên.
- Trung bình trượt: dự báo kỳ tới = TB của k quan sát gần nhất. k càng lớn ⇒ càng trơn (cực trị ít tác động).
- Làm trơn hàm mũ: F(t+1) = α·A(t) + (1−α)·F(t), với 0 < α < 1. α lớn ⇒ phản ứng nhanh với dữ liệu mới (nhưng nhiễu hơn).
4 chỉ số đo sai số: MAD (cùng đơn vị dữ liệu, dễ hiểu) · MSE (phạt nặng sai số lớn, đơn vị bình phương) · RMSE (căn của MSE, về lại đơn vị gốc) · MAPE (theo %, so sánh được giữa các chuỗi khác đơn vị/quy mô).
MODULE 5 — Data Mining
| Kỹ thuật | Trả lời câu hỏi | Đặc điểm cốt lõi |
|---|---|---|
| Phân cụm (Clustering) | Khách hàng của tôi chia mấy nhóm? | Không có nhãn trước (học không giám sát); còn gọi phân đoạn. Tương đồng cao trong cụm, khác biệt cao giữa cụm |
| Phân loại (Classification) | Khách mới này thuộc nhóm nào? | Nhãn xác định trước; gán bản ghi mới vào nhãn |
| Luật kết hợp | Mua A thì thường mua kèm gì? | Câu lệnh nếu–thì; phân tích giỏ hàng (market basket) |
5.1. k-NN (k láng giềng gần nhất)
Tìm k điểm gần nhất (đo bằng khoảng cách Euclide chuẩn hóa: d = √[(x₁−x₂)² + (y₁−y₂)² + …]), nhãn nào chiếm đa số thì gán nhãn đó. Chọn k bằng cách thử nhiều giá trị và so kết quả.
5.2. Luật kết hợp — 3 thước đo phải thuộc
| Thước đo | Cách tính | Trả lời | Ngưỡng |
|---|---|---|---|
| Support | % giao dịch chứa tất cả sản phẩm trong luật (mẫu số: toàn bộ giao dịch) | Kết hợp này có phổ biến không? | Càng cao càng đáng chú ý |
| Confidence | Trong các giao dịch có vế "Nếu", % có vế "Thì" (mẫu số: nhóm đã mua A) | Mua A thì khả năng mua B? | Càng cao luật càng chắc |
| Lift | Confidence ÷ mức phổ biến của vế "Thì" | Mua A làm tăng mấy lần khả năng mua B? | Lift > 1 luật mới có giá trị |
MODULE 6 — Phân tích đề xuất & Tối ưu hóa (Prescriptive)
6.1. Ba thành phần của mọi bài toán tối ưu
| Thành phần | Là gì | Câu hỏi để tìm ra |
|---|---|---|
| Biến quyết định | Con số nhà quản lý cần tìm | "Tôi đang phải quyết định cái gì?" (ghi rõ đơn vị) |
| Hàm mục tiêu | Đại lượng cần max/min | "Mục tiêu cuối cùng: tối đa lợi nhuận hay tối thiểu chi phí?" |
| Ràng buộc | Giới hạn ngăn mục tiêu vô hạn | "Cái gì đang giới hạn tôi?" (nguồn lực, công suất, thị trường) |
Mô hình: Max 50J + 65D, với: 3,5J + 4D ≤ 84 · 1J + 1,5D ≤ 21 · D ≥ 2J · J, D ≥ 0.
📋 PHỤ LỤC A — Gặp bài này thì dùng kỹ thuật nào
Bảng tra nhanh "nhận diện dạng bài" — ôn trước khi thi cực hợp.
| Tình huống / câu hỏi kinh doanh | Kỹ thuật | Module |
|---|---|---|
| Mô tả tình hình bán hàng quý vừa qua cho BGĐ | Trực quan hóa + thống kê mô tả | 2 |
| So độ ổn định doanh thu giữa 2 chi nhánh khác quy mô | Hệ số biến thiên (CV) | 2 |
| Dữ liệu có vài giá trị cực lớn làm lệch trung bình | Dùng trung vị | 2 |
| Tốc độ tăng trưởng trung bình qua nhiều năm | Trung bình nhân | 2 |
| Khảo sát 200 khách, muốn suy ra cả tệp khách | Khoảng tin cậy | 3 |
| Đổi thiết kế, chuyển đổi tăng — thật hay ngẫu nhiên? | A/B test + p-value (ngưỡng 0,05) | 3 |
| Nhà cung cấp cam kết chỉ số, thực tế thấp hơn | Kiểm định giả thuyết một mẫu | 3 |
| Chi bao nhiêu quảng cáo ra bao nhiêu doanh thu? | Hồi quy tuyến tính | 4 |
| Nhiều yếu tố cùng ảnh hưởng, yếu tố nào quan trọng? | Hồi quy đa biến + đọc p-value từng biến | 4 |
| Biến đầu vào là loại hình/nhóm | Biến giả (k nhóm → k−1 biến) | 4 |
| Quan hệ X–Y có dạng cong | Thêm hạng tử bậc hai X² | 4 |
| Dự báo doanh số tuần tới từ dữ liệu lịch sử | Trung bình trượt / làm trơn hàm mũ | 4 |
| Sản phẩm hoàn toàn mới, không có dữ liệu | Dự báo định tính / Delphi | 4 |
| So độ chính xác các mô hình dự báo khác đơn vị | MAPE | 4 |
| Chia khách thành nhóm để chăm sóc khác nhau | Phân cụm | 5 |
| Dự đoán khách mới thuộc nhóm nào | Phân loại / k-NN | 5 |
| Xây gợi ý "mua kèm", combo sản phẩm | Luật kết hợp (support, confidence, lift) | 5 |
| Nguồn lực có hạn, phân bổ sao cho lợi nhuận cao nhất | Tối ưu hóa / quy hoạch tuyến tính | 6 |
🔢 PHỤ LỤC B — Con số, ngưỡng & bẫy phải thuộc
| Con số | Ý nghĩa |
|---|---|
| 60.000 lần | Tốc độ não xử lý hình ảnh so với văn bản |
| −1 ≤ r ≤ +1 | Phạm vi hệ số tương quan |
| 68 – 95 – 99,7% | Tỷ lệ dữ liệu trong μ ± 1σ, ± 2σ, ± 3σ |
| p < 0,05 | Ngưỡng bác bỏ H₀ (độ tin cậy 95%) |
| KTC 95% không chứa 0 | Hệ số hồi quy có ý nghĩa thống kê |
| 0 ≤ R² ≤ 1 | 0 = không phù hợp, 1 = hoàn toàn phù hợp |
| ±2 độ lệch chuẩn | Ngưỡng phần dư chuẩn hóa xác định ngoại lai |
| |r| > 0,7 | Ngưỡng cảnh báo đa cộng tuyến giữa 2 biến X |
| k − 1 | Số biến giả cho biến phân loại k nhóm |
| Lift > 1 | Luật kết hợp có giá trị |
| 0 < α < 1 | Phạm vi hằng số làm trơn (exponential smoothing) |
| 3V | Volume – Velocity – Variety (Big Data) |
- Tương quan ≠ nhân quả — r cao không chứng minh X gây ra Y.
- Có ý nghĩa thống kê ≠ quan trọng — cỡ mẫu lớn làm khác biệt tí hon cũng "có ý nghĩa".
- R² ≠ R² hiệu chỉnh — chỉ R² hiệu chỉnh so được các mô hình khác số biến.
- Độ tin cậy ≠ tính hợp lệ — chính xác nhất quán không có nghĩa là đo đúng thứ cần đo.
- Phân cụm ≠ phân loại — phân cụm không có nhãn trước, phân loại có nhãn trước.
- Support ≠ Confidence — support tính trên toàn bộ giao dịch, confidence chỉ trên các giao dịch có vế "Nếu".
Tài liệu tổng hợp từ bản tóm tắt ôn thi chính thức của môn (TS. Hà Thúc Huân), bám sát 100% nội dung nguồn — không thêm công thức ngoài bài. Kèm bài trắc nghiệm 45 câu để tự ôn.