📊 Tài liệu học tập — Phân tích dữ liệu kinh doanh (MAS501)

Tóm tắt ôn thi trọn môn · 6 Module + 2 Phụ lục tra nhanh · lớp SEM59

📝 Làm bài trắc nghiệm 45 câu → ⬇️ Tải bản tóm tắt (PDF)
🔄Bạn đang xem môn Phân tích dữ liệu kinh doanh. Môn khác: Kinh tế học quản trị (ECO503) →
Mục lục
  1. BẢN ĐỒ TOÀN MÔN
  2. MODULE 1 — GIỚI THIỆU PHÂN TÍCH DỮ LIỆU KINH DOANH
  3. MODULE 2 — PHÂN TÍCH MÔ TẢ (DESCRIPTIVE)
  4. MODULE 3 — SUY LUẬN THỐNG KÊ
  5. MODULE 4 — PHÂN TÍCH DỰ BÁO (PREDICTIVE)
  6. MODULE 5 — DATA MINING
  7. MODULE 6 — PHÂN TÍCH ĐỀ XUẤT & TỐI ƯU HÓA
  8. 📋 PHỤ LỤC A — GẶP BÀI NÀY DÙNG KỸ THUẬT NÀO
  9. 🔢 PHỤ LỤC B — CON SỐ & BẪY PHẢI THUỘC

Phân tích dữ liệu kinh doanh (MAS501) — Học từ số 0

Nội dung bám 100% tài liệu tóm tắt ôn thi của môn (TS. Hà Thúc Huân — Viện Quản trị & Công nghệ FSB), viết lại theo lối người thầy giảng cho người mới. Có bài trắc nghiệm 45 câu (chuyển thể từ bộ câu hỏi tự kiểm tra chính thức) để tự kiểm tra.

📑
Bản tóm tắt ôn thi gốc (PDF) Tài liệu cô đọng 20 trang của thầy Hà Thúc Huân · tải về xem offline hoặc in ra ôn tập.
⬇️ Tải PDF
🧭 Trước khi bắt đầu — môn này dạy cái gì? Hãy hình dung bạn là nhà quản lý đứng trước một núi số liệu: doanh thu, khách hàng, quảng cáo, tồn kho… Môn này dạy bạn biến dữ liệu thô thành insight, rồi thành quyết định kinh doanh tốt hơn. Phân tích dữ liệu không thay thế trực giác lãnh đạo — nó là "trợ lý thông minh" giúp kiểm chứng và làm sắc bén trực giác. Nhưng nhớ: kinh nghiệm là con dao hai lưỡi — khi thị trường thay đổi, kinh nghiệm dễ thành "lối mòn". DDDM (ra quyết định dựa trên dữ liệu) không còn là lựa chọn mà là yêu cầu bắt buộc.

BẢN ĐỒ TOÀN MÔN — nhìn một phát biết học gì

Cả môn chỉ xoay quanh 6 module, mỗi module trả lời một câu hỏi kinh doanh:

ModuleTrả lời câu hỏiKỹ thuật chính
1. Giới thiệuPhân tích dữ liệu là gì, đặt câu hỏi thế nào?DDDM, MECE, 5 Whys
2. Mô tảChuyện gì đã và đang xảy ra?Trực quan hóa, mean/median/mode, độ lệch chuẩn, CV
3. Suy luận thống kêKết quả này là thật hay do ngẫu nhiên?CLT, khoảng tin cậy, kiểm định, p-value, A/B test
4. Dự báoĐiều gì sẽ xảy ra tiếp theo?Hồi quy đơn & đa biến, phần dư, chuỗi thời gian, Delphi
5. Data MiningCó nhóm/mẫu hình ẩn nào trong dữ liệu?Phân cụm, phân loại (k-NN), luật kết hợp
6. Đề xuấtNên làm gì là tốt nhất?Tối ưu hóa: biến quyết định, hàm mục tiêu, ràng buộc
📌 Ghi nhớ ba cấp độ phân tích Mô tả (Descriptive) — "Chuyện gì đã xảy ra?" · Dự báo (Predictive) — "Chuyện gì sẽ xảy ra?" · Đề xuất (Prescriptive) — "Nên làm gì?". Chuỗi giá trị: Dữ liệu thô → Insight → Quyết định tốt hơn.

MODULE 1 — Giới thiệu phân tích dữ liệu kinh doanh

Chương này để làm gì? Trước khi đụng tới con số, phải biết đặt câu hỏi đúng và đánh giá dữ liệu có đáng tin không. Hai khung tư duy (MECE, 5 Whys) + cặp khái niệm tin cậy/hợp lệ ở chương này được hỏi rất nhiều.

1.1. Hai khung tư duy đặt câu hỏi

Sếp phán: "Doanh thu đang giảm, hãy tìm hiểu đi!" — đây là kiểu yêu cầu tồi kinh điển: quá mơ hồ, không giả thuyết, không biết bắt đầu từ đâu. Người làm phân tích chuyên nghiệp xử lý bằng 2 công cụ:

1.2. Nguồn dữ liệu — "mỏ vàng" 3 tầng

TầngTrạng tháiNội dungTrả lời
Dữ liệu vận hànhSẵn cóMáy móc (tốc độ, hiệu suất, tỷ lệ lỗi), ERP (tồn kho, đơn hàng), năng suất nhân côngChúng ta vận hành hiệu quả đến đâu?
Dữ liệu kinh doanhCần xây dựngBán hàng, khách hàng (nhân khẩu, lịch sử mua), hiệu quả marketingCÁI GÌ đang diễn ra trên thị trường?
Dữ liệu bên ngoàiCần khai thácXu hướng ngành, đối thủ (giá, khuyến mãi), review khách hàngTẠI SAO thị trường diễn ra như vậy?

Big Data — 3V: Volume (khối lượng cực lớn) · Velocity (tốc độ cao) · Variety (đa dạng loại hình) — tập dữ liệu lớn tới mức công cụ truyền thống như Excel không xử lý hiệu quả.

1.3. Độ tin cậy vs. Tính hợp lệ (rất hay ra đề!)

📌 Cặp khái niệm phải phân biệt Độ tin cậy (Reliability) = dữ liệu chính xác và nhất quán. Tính hợp lệ (Validity) = dữ liệu đo đúng thứ cần đo. Hai thứ này độc lập nhau — có thể có cái này mà thiếu cái kia.
💡 Ba tình huống kinh điển
  • Thiết bị đo áp suất lốp luôn hiển thị thấp hơn thực tế 2 bar → KHÔNG tin cậy (sai lệch hệ thống) nhưng HỢP LỆ (vẫn đo đúng áp suất lốp).
  • Đếm chính xác số cuộc gọi đến CSKH để đo "mức độ không hài lòng" → TIN CẬY nhưng KHÔNG hợp lệ (nhiều cuộc gọi chỉ hỏi thông tin).
  • Câu hỏi về chất lượng thức ăn dùng đo "hài lòng tổng thể" → không tin cậy, cũng không hợp lệ (hài lòng còn gồm cả dịch vụ).
⚠️ 5 lý do doanh nghiệp "ngại" dữ liệu (1) tư duy chủ nghĩa kinh nghiệm/linh cảm; (2) thiếu nhân lực phân tích; (3) chi phí đầu tư công nghệ; (4) chất lượng dữ liệu thấp, phân mảnh; (5) tâm lý "làm nhanh thắng nhanh".

MODULE 2 — Phân tích mô tả (Descriptive)

Chương này để làm gì? Trả lời "chuyện gì đã xảy ra?" bằng 2 vũ khí: biểu đồ (kể chuyện bằng hình) và con số mô tả (trung bình, trung vị, độ lệch chuẩn…). Chọn sai biểu đồ hoặc sai thước đo là "kể sai câu chuyện" — chương này dạy chọn đúng.

2.1. Trực quan hóa — kể chuyện bằng hình

Con số phải nhớ: não người xử lý hình ảnh nhanh hơn văn bản tới 60.000 lần. Trước khi vẽ bất kỳ biểu đồ nào, hỏi 3 câu: Ai đọc? Họ kỳ vọng gì? Đọc xong họ sẽ hành động thế nào?

Biểu đồKể câu chuyện vềLưu ý
Đường (line)XU HƯỚNG theo thời gianTăng/giảm/đi ngang, có mùa vụ không
Cột / Thanh (column/bar)SO SÁNHThanh ngang ưu tiên khi tên biến dài
Tròn (pie)TỶ TRỌNGKhông dùng so sánh nhiều giá trị; tránh pie 3D (nghịch lý thị giác: phần 31% trông lớn hơn 34%)
Điểm phân tán (scatter)QUAN HỆ 2 biếnXem 4 thứ: hướng · hình dạng · độ mạnh · ngoại lai
Bản đồ nhiệtSỰ TẬP TRUNGThị trường trọng điểm ở đâu
Thanh xếp chồngSo sánh + cơ cấuBản 100% chỉ so tỷ trọng, bỏ qua khác biệt tổng
Thác nước (waterfall)Thay đổi lũy kế"Chuyện gì xảy ra ở giữa": phân tích lợi nhuận, biến động nhân sự
Dốc (slope)Thay đổi giữa 2 mốcSo thứ hạng, phát hiện xu hướng trái ngược
⚠️ 5 sai lầm phổ biến khi trực quan hóa Quá tải KPI trên một dashboard · thiếu ngữ cảnh (không có so sánh lịch sử/mục tiêu) · chọn biểu đồ kém (pie để so sánh, biểu đồ 3D) · hình ảnh gây hiểu lầm (cắt trục Y, thang đo không nhất quán) · không tinh chỉnh cho người đọc.

2.2. Mô tả bằng số — 3 đặc điểm: Trung tâm · Biến thiên · Hình dạng

① Trung tâm — dữ liệu tập trung ở đâu:

Thước đoCông thứcKhi nào dùng
Trung bình cộng (Mean)x̄ = (Σxᵢ)/nChịu ảnh hưởng mọi phần tử → nhạy với ngoại lai
Trung vị (Median)Phân vị thứ 50Không nhạy ngoại lai → dùng khi dữ liệu lệch (thu nhập, giá nhà)
ModeGiá trị xuất hiện nhiều nhấtHữu ích với dữ liệu rời rạc/phân loại
Trung bình nhânG = ⁿ√(x₁·x₂·…·xₙ)Dữ liệu theo tỷ lệ: tăng trưởng, tỷ suất. Nhược: không xử lý được 0 và số âm

② Độ biến thiên — phân tán rộng hay hẹp:

Thước đoCông thứcGhi nhớ
Phạm vi (Range)R = x_max − x_minDễ tính nhưng chỉ dựa 2 cực trị
Phương sai mẫus² = Σ(xᵢ − x̄)²/(n−1)Đơn vị bị bình phương, khó diễn giải
Độ lệch chuẩns = √s²Cùng đơn vị với biến → dùng nhiều nhất
Hệ số biến thiên (CV)CV = 100·(s/x̄) %So sánh độ phân tán giữa các tập khác đơn vị/khác trung bình. CV > 100% khi s > x̄
💡 Bẫy kinh điển: chi nhánh nào ổn định hơn? Chi nhánh A: TB 200 triệu, s = 40 triệu. Chi nhánh B: TB 2.000 triệu, s = 300 triệu. So s trực tiếp thì A "ổn" hơn — SAI! Quy mô khác nhau phải dùng CV: CV(A) = 20%, CV(B) = 15% → B ổn định hơn.

③ Hình dạng — quy tắc so sánh Mean vs Median:

Hình dạngĐuôi dài vềQuan hệVí dụ trên slide
Lệch trái (âm)Bên tráiMean < MedianGPA của 158 sinh viên
Đối xứngCân đốiMean = Median = ModePhân phối chuẩn
Lệch phải (dương)Bên phảiMean > MedianChi tiêu tại 74 quán mì
⚠️ Lưu ý khi thi (phương sai mẫu) Slide viết phương sai mẫu với mẫu số N; công thức chuẩn thống kê là n − 1 (bậc tự do). Nếu đề yêu cầu tính phương sai mẫu → dùng n − 1 (đây cũng là cách Excel tính với VAR.S / STDEV.S).

2.3. Hệ số tương quan r

Đo mức độ tuyến tính giữa hai biến định lượng: −1 ≤ r ≤ +1. r ≈ +1: đồng biến chặt; r ≈ −1: nghịch biến chặt; r ≈ 0: gần như không có quan hệ tuyến tính.

⚠️ Hai điều tuyệt đối nhớ về r (1) Tương quan ≠ nhân quả — r cao không chứng minh X gây ra Y. (2) r chỉ đo quan hệ tuyến tính — hai biến quan hệ cong rất chặt vẫn có thể cho r ≈ 0.

MODULE 3 — Suy luận thống kê

Chương này để làm gì? Khảo sát 100 khách thấy 30% nhận diện thương hiệu — nhưng con số thật của cả thị trường có thể là 20% hay 40%? Chương này dạy cách "nhảy" từ mẫu sang tổng thể một cách khoa học, và phân biệt kết quả thật với may rủi. Câu chốt: chuyển từ "chúng tôi nghĩ rằng…" sang "dữ liệu cho thấy rằng…".

3.1. Phân phối chuẩn & quy tắc 68–95–99,7

Phân phối chuẩn: đối xứng, đỉnh chuông tại mean = median = mode; σ quyết định chuông "béo hay gầy". Quy tắc vàng:

≈ 68% dữ liệu trong μ ± 1σ · ≈ 95% trong μ ± 2σ · ≈ 99,7% trong μ ± 3σ

💡 Ứng dụng ngay Thời gian đi làm TB 40 phút, σ = 10 → 95% nhân viên đến văn phòng trong khoảng 40 ± 20 = [20 ; 60] phút → dùng để xếp lịch họp buổi sáng.

3.2. Định lý giới hạn trung tâm (CLT) — định lý quan trọng nhất

📌 Phát biểu Phân phối của TRUNG BÌNH MẪU luôn là phân phối chuẩn, miễn cỡ mẫu đủ lớn — bất kể phân phối gốc của tổng thể kỳ quặc thế nào.

Minh họa (chuỗi cà phê, thang điểm 1–10): lấy 30 khách → TB mẫu 7,2; lặp 1.000 lần → dãy 7,2 · 7,5 · 7,1 · 7,3…; vẽ biểu đồ 1.000 trung bình đó → luôn ra hình chuông. Hai hệ quả: (1) trung bình của các trung bình mẫu = trung bình tổng thể; (2) độ lệch chuẩn của phân phối này — gọi là sai số chuẩn (Standard Error) — nhỏ hơn độ lệch chuẩn tổng thể.

3.3. Khoảng tin cậy (Confidence Interval)

Khoảng giá trị xây quanh trung bình mẫu, kèm biên độ sai số hợp lý, nhằm chứa giá trị thật của tổng thể. Ví dụ: khảo sát 100 khách, chi tiêu TB 500.000đ → KTC 95% = [480.000 ; 520.000].

📌 Diễn giải chuẩn (dùng khi thi) "Nếu lặp lại quy trình lấy mẫu này 100 lần thì khoảng 95 trong 100 lần, khoảng tin cậy tạo ra sẽ chứa giá trị trung bình thật của tổng thể." (Cách nói đơn giản chấp nhận được: "với mức tự tin 95%, chi tiêu TB của tất cả khách nằm trong 480–520 nghìn.")

3.4. Kiểm định giả thuyết & p-value

Tinh thần: "vô tội cho đến khi được chứng minh có tội" — H₀ là giả định vô tội, chỉ bác bỏ khi bằng chứng đủ mạnh. Quy trình 4 bước qua ví dụ: nhà cung cấp cam kết CTR 3%, chạy 10.000 lượt chỉ được 2,5%:

  1. Đặt giả thuyết — H₀: CTR thật = 3%; H₁: CTR thật < 3%.
  2. Thu thập bằng chứng — mẫu cho CTR 2,5%.
  3. Hỏi câu cốt lõi — "Nếu H₀ đúng, xác suất quan sát kết quả kém như vầy (hoặc tệ hơn) chỉ do ngẫu nhiên là bao nhiêu?"
  4. Xác suất đó là p-value → so ngưỡng α: p < 0,05 → bác bỏ H₀ ("bằng chứng đủ mạnh"); p ≥ 0,05 → không đủ cơ sở bác bỏ.
⚠️ p-value KHÔNG phải là… …xác suất H₀ đúng, cũng không phải xác suất kết quả là ngẫu nhiên. Nó là xác suất quan sát được kết quả như mẫu (hoặc cực đoan hơn) VỚI ĐIỀU KIỆN H₀ đúng. Và "không bác bỏ được H₀" ≠ "chứng minh H₀ đúng".

3.5. A/B Testing

So sánh khoa học hai phiên bản: A = bản gốc, B = biến thể đổi một yếu tố. Ví dụ: 1.000 người xem A → 4%; 1.000 người xem B (nút "Mua Ngay" cam) → 5,5%.

📌 Nguyên tắc vàng Tại một thời điểm chỉ thay đổi MỘT yếu tố. Đúng: chỉ đổi màu nút. Sai: vừa đổi màu vừa đổi câu chữ — không biết yếu tố nào tạo khác biệt.

3.6. "Có ý nghĩa thống kê" ≠ "Quan trọng"

💡 Ví dụ kinh điển Test 1 triệu người: B = 5,01% vs A = 5,00%, p-value cực nhỏ → có ý nghĩa thống kê (khác biệt là thật). Nhưng chênh 0,01% không đáng chi 1 tỷ thay đổi hệ thống. Ý nghĩa thống kê trả lời "khác biệt có thật không?"; ý nghĩa thực tiễn trả lời "có đáng đầu tư không?" — cái sau là phán quyết của nhà quản lý, không phải của p-value.

MODULE 4 — Phân tích dự báo (Predictive)

Chương này để làm gì? Chương dài nhất và "nặng đề" nhất: dùng hồi quy để trả lời "chi X thì được Y bao nhiêu?", đọc kết quả cho đúng (R², p-value, phần dư), né 3 cái bẫy lớn, rồi dự báo chuỗi thời gian và dự báo khi không có dữ liệu.

4.1. Hồi quy — bắt đầu đúng cách

Hồi quy mô tả quan hệ giữa biến phụ thuộc Y và (các) biến độc lập X, mọi biến đều dạng số. Mô hình tổng thể: Y = β₀ + β₁X + ε; ước lượng từ mẫu: Ŷ = b₀ + b₁X.

📌 Việc BẮT BUỘC đầu tiên Vẽ scatter plot trước khi chạy hồi quy để xem quan hệ: (a) tuyến tính → hồi quy tuyến tính; (b) phi tuyến → thêm hạng tử bậc hai; (c) không có quan hệ → hồi quy vô nghĩa. Chạy hồi quy mà không nhìn scatter là rủi ro lớn nhất của người mới.

Phần dư (residual) = Y thực tế − Y dự báo. Đường hồi quy "tốt nhất" = đường tối thiểu hóa tổng bình phương phần dư (SSE) — bình phương để sai số âm/dương không triệt tiêu nhau và phạt nặng sai số lớn.

💡 Case xuyên suốt: giá 42 ngôi nhà Giá trị thị trường = 32.673 + 35,036 × diện tích (ft²), R² ≈ 0,53. Nhà 2.200 ft² → dự báo $109.752. Diễn giải hệ số góc: "Các yếu tố khác không đổi, diện tích tăng 1 ft² làm giá nhà tăng $35,03" — cụm "các yếu tố khác không đổi" là bắt buộc.

4.2. Đọc kết quả hồi quy

Chỉ sốÝ nghĩaCách đọc
Hệ số góc b₁Tác động biên của X lên Y"X tăng 1 đơn vị ⇒ Y thay đổi b₁, các yếu tố khác không đổi"
R²% biến động của Y được mô hình giải thích0 → 1. R² = 0,53 → "53% biến động giá nhà được giải thích bởi diện tích" (KHÔNG phải "dự đoán đúng 53% trường hợp")
R² hiệu chỉnhR² đã hiệu chỉnh theo cỡ mẫu & số biếnDùng để so sánh mô hình khác số biến
p-value của hệ sốBiến X có ý nghĩa thống kê khôngp < 0,05 ⇒ biến có giá trị giải thích
KTC 95% của hệ sốGiới hạn của hệ số thậtKTC không chứa 0 ⇒ biến có ý nghĩa

Công cụ Excel: =SLOPE(Y,X) và =INTERCEPT(Y,X) lấy nhanh hệ số · Trendline trên scatter (tick hiện phương trình + R²) · Data → Data Analysis → Regression (đầy đủ nhất: R², Adjusted R², p-value, KTC, phần dư). Lưu ý: hồi quy đa biến trong Excel yêu cầu các cột X liền kề nhau.

4.3. Phân tích phần dư — "khám sức khỏe" mô hình

Biểu đồ phần dưChẩn đoánXử lý
Rải ngẫu nhiên quanh 0Mô hình tốtGiữ nguyên
Hình chữ UQuan hệ phi tuyếnThêm hạng tử bậc hai X²
Hình phễu (loe dần)Phương sai sai số không đềuBiến đổi biến (log) hoặc đổi mô hình
Điểm có phần dư chuẩn hóa ngoài ±2Ngoại lai tiềm năngKiểm tra lỗi nhập liệu/sự kiện bất thường

4.4. Hồi quy đa biến — 3 cái bẫy

⚠️ Bẫy 1 — R² luôn tăng khi thêm biến Thêm bất kỳ biến nào (kể cả vô nghĩa) cũng làm R² bằng hoặc tăng → so sánh mô hình phải dùng R² hiệu chỉnh. Quy trình loại lùi: (1) chạy đủ biến; (2) tìm biến có p lớn nhất vượt α; (3) loại từng biến một rồi xem R² hiệu chỉnh (tăng → loại hẳn; giảm → giữ lại). Mô hình tốt là mô hình đơn giản nhất có thể (parsimony).
⚠️ Bẫy 2 — Đa cộng tuyến Khi các biến X tương quan chặt với nhau: ngưỡng cảnh báo |r| > 0,7. Hậu quả: khó tách tác động từng biến, dấu hệ số trái lý thuyết, p-value bị thổi phồng. Xử lý: bỏ bớt một biến hoặc gộp lại.
⚠️ Bẫy 3 — Quá khớp (Overfitting) Mô hình khớp dữ liệu mẫu đến mức không tổng quát hóa được. Nguyên nhân: quá nhiều biến. Giảm thiểu bằng logic, lý thuyết và tính tối giản.

4.5. Biến giả, phi tuyến & tương tác

4.6. Dự báo định tính & Delphi

Khi không có dữ liệu lịch sử (sản phẩm mới) hoặc dự báo tương lai xa → dùng dự báo định tính/phán đoán. Cảnh báo từ case giá dầu 1988: đầu năm ~22 USD/thùng, giữa năm còn 11; quá khứ OPEC thường đẩy giá lên nhưng giá vẫn giảm dù cắt sản lượng → tương đồng quá khứ không phải lúc nào cũng đúng.

📌 Delphi — 3 nguyên lý (1) Ẩn danh (quan trọng nhất) — triệt tiêu hiệu ứng HiPPO (Highest Paid Person's Opinion) và groupthink; (2) phản hồi có kiểm soát — mỗi vòng chỉ công bố tóm tắt thống kê; (3) tự điều chỉnh — người có dự báo ngoại lai tự soát lại. Hạn chế: chậm, phụ thuộc chất lượng chuyên gia, nguy cơ đồng thuận giả tạo.

4.7. Chuỗi thời gian

4 thành phần: hành vi ngẫu nhiên · xu hướng (trend) · hiệu ứng theo mùa (lặp theo năm/tháng/tuần/ngày) · hiệu ứng chu kỳ (khung dài nhiều năm — vd lãi suất). Chuỗi dừng = chỉ có thành phần ngẫu nhiên.

4 chỉ số đo sai số: MAD (cùng đơn vị dữ liệu, dễ hiểu) · MSE (phạt nặng sai số lớn, đơn vị bình phương) · RMSE (căn của MSE, về lại đơn vị gốc) · MAPE (theo %, so sánh được giữa các chuỗi khác đơn vị/quy mô).


MODULE 5 — Data Mining

Chương này để làm gì? Tìm mẫu hình ẩn trong dữ liệu lớn: khách chia mấy nhóm (phân cụm), khách mới thuộc nhóm nào (phân loại), và mua A thường kèm gì (luật kết hợp) — nền tảng của hệ thống gợi ý "mua kèm".

Kỹ thuậtTrả lời câu hỏiĐặc điểm cốt lõi
Phân cụm (Clustering)Khách hàng của tôi chia mấy nhóm?Không có nhãn trước (học không giám sát); còn gọi phân đoạn. Tương đồng cao trong cụm, khác biệt cao giữa cụm
Phân loại (Classification)Khách mới này thuộc nhóm nào?Nhãn xác định trước; gán bản ghi mới vào nhãn
Luật kết hợpMua A thì thường mua kèm gì?Câu lệnh nếu–thì; phân tích giỏ hàng (market basket)
📌 Nói ngắn cho dễ nhớ Phân cụm đi TÌM nhóm — phân loại đi GÁN nhóm.

5.1. k-NN (k láng giềng gần nhất)

Tìm k điểm gần nhất (đo bằng khoảng cách Euclide chuẩn hóa: d = √[(x₁−x₂)² + (y₁−y₂)² + …]), nhãn nào chiếm đa số thì gán nhãn đó. Chọn k bằng cách thử nhiều giá trị và so kết quả.

⚠️ Quy tắc hay ra đề Bài phân loại có đúng 2 nhãn → có thể áp dụng hồi quy. Nhiều hơn 2 nhãn → KHÔNG dùng hồi quy tuyến tính được, phải dùng phân tích phân biệt (discriminant analysis) với phần mềm chuyên biệt.

5.2. Luật kết hợp — 3 thước đo phải thuộc

Thước đoCách tínhTrả lờiNgưỡng
Support% giao dịch chứa tất cả sản phẩm trong luật (mẫu số: toàn bộ giao dịch)Kết hợp này có phổ biến không?Càng cao càng đáng chú ý
ConfidenceTrong các giao dịch có vế "Nếu", % có vế "Thì" (mẫu số: nhóm đã mua A)Mua A thì khả năng mua B?Càng cao luật càng chắc
LiftConfidence ÷ mức phổ biến của vế "Thì"Mua A làm tăng mấy lần khả năng mua B?Lift > 1 luật mới có giá trị
💡 Ví dụ bẫy Lift Luật "mua i7 → mua ổ 750GB" có confidence 40%; nhưng 50% khách nói chung đã mua ổ 750GB → Lift = 0,40/0,50 = 0,8 < 1 → luật VÔ giá trị, gợi ý bán kèm còn phản tác dụng. Confidence cao một mình không đủ kết luận!

MODULE 6 — Phân tích đề xuất & Tối ưu hóa (Prescriptive)

Chương này để làm gì? Bước cuối của phân tích: "Nên làm gì là tốt nhất?" — chọn giá trị các biến quyết định để tối đa/tối thiểu hóa mục tiêu trong giới hạn nguồn lực. Trọng tâm thi là dựng mô hình đúng (3 thành phần), không phải giải.

6.1. Ba thành phần của mọi bài toán tối ưu

Thành phầnLà gìCâu hỏi để tìm ra
Biến quyết địnhCon số nhà quản lý cần tìm"Tôi đang phải quyết định cái gì?" (ghi rõ đơn vị)
Hàm mục tiêuĐại lượng cần max/min"Mục tiêu cuối cùng: tối đa lợi nhuận hay tối thiểu chi phí?"
Ràng buộcGiới hạn ngăn mục tiêu vô hạn"Cái gì đang giới hạn tôi?" (nguồn lực, công suất, thị trường)
💡 Case SSC — công ty ván trượt tuyết Hai mẫu ván: Jordanelle (3,5h chế tạo + 1h hoàn thiện, lãi $50) và Deercrest (4h + 1,5h, lãi $65). Năng lực: 84h chế tạo + 21h hoàn thiện mỗi ngày; thị trường yêu cầu D bán ít nhất gấp đôi J.
Mô hình: Max 50J + 65D, với: 3,5J + 4D ≤ 84 · 1J + 1,5D ≤ 21 · D ≥ 2J · J, D ≥ 0.
⚠️ Hai lỗi kinh điển khi dựng mô hình (1) Quên ràng buộc không âm (luôn viết đủ!). (2) Viết ngược ràng buộc tỷ lệ: "D ít nhất gấp đôi J" là D ≥ 2J, không phải 2D ≥ J — mẹo kiểm tra: thử J=5 thì D phải ≥ 10. Bài 2 biến giải bằng phương pháp đồ thị (vẽ miền khả thi, kiểm tra các đỉnh); nhiều biến → Excel Solver.

📋 PHỤ LỤC A — Gặp bài này thì dùng kỹ thuật nào

Bảng tra nhanh "nhận diện dạng bài" — ôn trước khi thi cực hợp.

Tình huống / câu hỏi kinh doanhKỹ thuậtModule
Mô tả tình hình bán hàng quý vừa qua cho BGĐTrực quan hóa + thống kê mô tả2
So độ ổn định doanh thu giữa 2 chi nhánh khác quy môHệ số biến thiên (CV)2
Dữ liệu có vài giá trị cực lớn làm lệch trung bìnhDùng trung vị2
Tốc độ tăng trưởng trung bình qua nhiều nămTrung bình nhân2
Khảo sát 200 khách, muốn suy ra cả tệp kháchKhoảng tin cậy3
Đổi thiết kế, chuyển đổi tăng — thật hay ngẫu nhiên?A/B test + p-value (ngưỡng 0,05)3
Nhà cung cấp cam kết chỉ số, thực tế thấp hơnKiểm định giả thuyết một mẫu3
Chi bao nhiêu quảng cáo ra bao nhiêu doanh thu?Hồi quy tuyến tính4
Nhiều yếu tố cùng ảnh hưởng, yếu tố nào quan trọng?Hồi quy đa biến + đọc p-value từng biến4
Biến đầu vào là loại hình/nhómBiến giả (k nhóm → k−1 biến)4
Quan hệ X–Y có dạng congThêm hạng tử bậc hai X²4
Dự báo doanh số tuần tới từ dữ liệu lịch sửTrung bình trượt / làm trơn hàm mũ4
Sản phẩm hoàn toàn mới, không có dữ liệuDự báo định tính / Delphi4
So độ chính xác các mô hình dự báo khác đơn vịMAPE4
Chia khách thành nhóm để chăm sóc khác nhauPhân cụm5
Dự đoán khách mới thuộc nhóm nàoPhân loại / k-NN5
Xây gợi ý "mua kèm", combo sản phẩmLuật kết hợp (support, confidence, lift)5
Nguồn lực có hạn, phân bổ sao cho lợi nhuận cao nhấtTối ưu hóa / quy hoạch tuyến tính6

🔢 PHỤ LỤC B — Con số, ngưỡng & bẫy phải thuộc

Con sốÝ nghĩa
60.000 lầnTốc độ não xử lý hình ảnh so với văn bản
−1 ≤ r ≤ +1Phạm vi hệ số tương quan
68 – 95 – 99,7%Tỷ lệ dữ liệu trong μ ± 1σ, ± 2σ, ± 3σ
p < 0,05Ngưỡng bác bỏ H₀ (độ tin cậy 95%)
KTC 95% không chứa 0Hệ số hồi quy có ý nghĩa thống kê
0 ≤ R² ≤ 10 = không phù hợp, 1 = hoàn toàn phù hợp
±2 độ lệch chuẩnNgưỡng phần dư chuẩn hóa xác định ngoại lai
|r| > 0,7Ngưỡng cảnh báo đa cộng tuyến giữa 2 biến X
k − 1Số biến giả cho biến phân loại k nhóm
Lift > 1Luật kết hợp có giá trị
0 < α < 1Phạm vi hằng số làm trơn (exponential smoothing)
3VVolume – Velocity – Variety (Big Data)
⚠️ 6 bẫy khái niệm hay bị nhầm
  • Tương quan ≠ nhân quả — r cao không chứng minh X gây ra Y.
  • Có ý nghĩa thống kê ≠ quan trọng — cỡ mẫu lớn làm khác biệt tí hon cũng "có ý nghĩa".
  • R² ≠ R² hiệu chỉnh — chỉ R² hiệu chỉnh so được các mô hình khác số biến.
  • Độ tin cậy ≠ tính hợp lệ — chính xác nhất quán không có nghĩa là đo đúng thứ cần đo.
  • Phân cụm ≠ phân loại — phân cụm không có nhãn trước, phân loại có nhãn trước.
  • Support ≠ Confidence — support tính trên toàn bộ giao dịch, confidence chỉ trên các giao dịch có vế "Nếu".

Tài liệu tổng hợp từ bản tóm tắt ôn thi chính thức của môn (TS. Hà Thúc Huân), bám sát 100% nội dung nguồn — không thêm công thức ngoài bài. Kèm bài trắc nghiệm 45 câu để tự ôn.

↑