Câu hỏi «luận văn cần bao nhiêu mẫu» được hỏi nhiều nhất, nhưng nó là câu hỏi thứ hai. Câu hỏi thứ nhất là: bạn có danh sách của tổng thể không?
Danh sách đó gọi là khung lấy mẫu, và nó quyết định mọi thứ phía sau. Không có khung lấy mẫu thì dù bạn bốc thăm cẩn thận đến đâu, mẫu của bạn vẫn là mẫu phi xác suất, và kết luận của bạn không được phép suy rộng ra tổng thể. Nhiều bản thảo bị hội đồng bắt đúng chỗ này: quy trình nghe rất ngẫu nhiên, nhưng danh sách gốc không tồn tại.

Khung lấy mẫu: câu hỏi trước mọi câu hỏi
Khung lấy mẫu là danh sách cụ thể các đơn vị thuộc tổng thể mà bạn thực sự có trong tay: danh sách sinh viên của khoa, danh sách bệnh nhân đang quản lý tại trạm y tế, danh sách doanh nghiệp niêm yết trên một sàn, danh sách bản án đã công bố.
Ba tình huống và hệ quả của từng tình huống:
- Có danh sách đầy đủ → dùng được kỹ thuật xác suất → được suy rộng ra tổng thể, kèm sai số.
- Có danh sách nhưng thiếu một phần → vẫn là xác suất trong phạm vi danh sách có được → phải nêu rõ phần bị thiếu ở mục hạn chế.
- Không có danh sách → chỉ dùng được kỹ thuật phi xác suất → mô tả được mẫu, không suy rộng ra tổng thể.
Tình huống thứ ba rất phổ biến trong luận văn Việt Nam và nó không làm luận văn kém giá trị. Điều làm luận văn kém giá trị là ở tình huống ba mà vẫn viết kết luận như thể ở tình huống một.

Sáu kỹ thuật chọn mẫu
| Kỹ thuật | Cách làm | Cần khung lấy mẫu? | Ví dụ |
|---|---|---|---|
| Ngẫu nhiên đơn giản | Đánh số toàn bộ danh sách rồi rút ngẫu nhiên | Có, đầy đủ | Rút 200 sinh viên từ danh sách 1.500 sinh viên của khoa |
| Hệ thống | Chọn đơn vị đầu ngẫu nhiên rồi lấy cách đều mỗi k đơn vị | Có, đầy đủ | Lấy mỗi hồ sơ thứ 5 trong sổ tiếp nhận đã xếp theo ngày |
| Phân tầng | Chia tổng thể thành các tầng rồi rút ngẫu nhiên trong từng tầng | Có, kèm thông tin tầng | Chia theo năm học rồi rút tỷ lệ mỗi năm, để mẫu không dồn vào năm cuối |
| Cụm | Chọn ngẫu nhiên các cụm rồi khảo sát toàn bộ trong cụm | Có danh sách cụm | Chọn ngẫu nhiên 6 lớp rồi khảo sát tất cả học sinh trong 6 lớp đó |
| Thuận tiện | Lấy những đơn vị tiếp cận được | Không | Phát phiếu cho khách đang lưu trú tại cơ sở trong hai tuần |
| Quả cầu tuyết | Người trả lời giới thiệu người tiếp theo | Không | Tiếp cận nhóm khó gặp qua giới thiệu dây chuyền |
Phân tầng là kỹ thuật bị bỏ phí nhiều nhất trong luận văn. Nếu bạn có danh sách kèm một biến phân loại rõ ràng (năm học, giới tính, khu vực, quy mô doanh nghiệp) thì phân tầng gần như luôn tốt hơn ngẫu nhiên đơn giản với cùng một cỡ mẫu: nó đảm bảo mọi tầng đều có mặt và làm ước lượng chính xác hơn. Chi phí thêm chỉ là một bước chia danh sách.
Phân bổ trong phân tầng có hai cách: theo tỷ lệ (tầng chiếm 30% tổng thể thì chiếm 30% mẫu) và đều nhau (mỗi tầng một số như nhau). Dùng cách đều nhau khi bạn muốn so sánh các tầng với nhau; dùng theo tỷ lệ khi bạn muốn ước lượng cho toàn tổng thể.
Công thức Slovin và điều nó không làm được
Công thức Slovin được dùng rất rộng rãi trong luận văn Việt Nam vì nó chỉ cần một con số:
n = N / (1 + N × e²)
trong đó n là cỡ mẫu, N là quy mô tổng thể, e là sai số cho phép.
Ví dụ với N = 1.500 và e = 0,05: n = 1.500 / (1 + 1.500 × 0,0025) = 1.500 / 4,75 ≈ 316. Với e = 0,10 thì n ≈ 94.
Bảng tra nhanh (làm tròn lên):
| N | e = 5% | e = 10% |
|---|---|---|
| 500 | 223 | 84 |
| 1.000 | 286 | 91 |
| 1.500 | 316 | 94 |
| 5.000 | 370 | 98 |
| 10.000 | 385 | 99 |
Ba điều công thức này không làm được, và bạn nên biết trước khi dựa vào nó:
- Nó không biết bạn định chạy phép thống kê gì. Nó cho cỡ mẫu để ước lượng một tỷ lệ, không cho cỡ mẫu để chạy hồi quy nhiều biến hay phân tích nhân tố.
- Nó giả định mẫu là mẫu xác suất. Áp công thức lên một mẫu thuận tiện không biến mẫu đó thành mẫu xác suất — con số ra vẫn đúng số học, nhưng ý nghĩa «sai số 5%» thì không còn.
- Nó cần biết N. Khi tổng thể không xác định được, công thức không dùng được và bạn phải chuyển sang cách khác.
Vì vậy Slovin là điểm khởi đầu hợp lý cho một khảo sát mô tả có tổng thể đã biết, không phải câu trả lời cho mọi đề tài.
Bốn cách xác định cỡ mẫu, chọn theo đề tài
| Cách | Dùng khi | Cho ra |
|---|---|---|
| Công thức Slovin | Khảo sát mô tả, tổng thể N đã biết | Một con số theo sai số chấp nhận |
| Theo yêu cầu của phép phân tích | Có mô hình hồi quy hoặc phân tích nhân tố | Cỡ mẫu theo số biến quan sát hoặc số biến độc lập trong mô hình |
| Phân tích công suất thống kê | Muốn phát hiện một mức hiệu ứng định trước | Cỡ mẫu tối thiểu cho mức hiệu ứng, mức ý nghĩa và công suất đã chọn |
| Bão hòa dữ liệu | Nghiên cứu định tính | Không phải một con số ấn định trước — dừng khi phỏng vấn thêm không ra chủ đề mới |
Quy tắc chọn: nếu mô hình của bạn có nhiều biến, hãy lấy cỡ mẫu lớn hơn giữa kết quả Slovin và yêu cầu của phép phân tích. Một mô hình nhiều biến quan sát thường đòi hỏi nhiều hơn con số Slovin đưa ra, và đó là lý do nhiều bản thảo tính Slovin ra 94 rồi không chạy nổi phân tích nhân tố.
Với đề tài định tính, đừng ghi một con số cứng ở đề cương rồi coi như xong. Ghi khoảng dự kiến và tiêu chí dừng — cách trình bày này được chấp nhận rộng rãi hơn nhiều so với một con số không có căn cứ. Các phép phân tích tương ứng với từng loại dữ liệu được đối chiếu ở bài chọn phép kiểm định theo câu hỏi nghiên cứu.
Ba câu viết sẵn cho chương phương pháp
Mỗi câu kết thúc bằng mệnh đề nêu đúng phạm vi suy rộng mà kỹ thuật cho phép. Đó là mệnh đề hay bị bỏ nhất và là mệnh đề bảo vệ bạn ở buổi bảo vệ.
Phân tầng. «Tổng thể nghiên cứu gồm [N] [đơn vị] theo danh sách do [đơn vị cung cấp] cung cấp tính đến [ngày]. Mẫu được chọn theo phương pháp phân tầng theo [biến phân tầng], phân bổ theo tỷ lệ, sau đó rút ngẫu nhiên trong từng tầng. Cỡ mẫu [n] được xác định theo công thức Slovin với sai số [e]. Vì mẫu được rút từ khung lấy mẫu đầy đủ, kết quả được suy rộng cho [tổng thể] trong phạm vi sai số nêu trên.»
Hệ thống. «Khung lấy mẫu là [danh sách] gồm [N] đơn vị, xếp theo [tiêu chí xếp]. Đơn vị đầu tiên được chọn ngẫu nhiên trong [k] đơn vị đầu, sau đó lấy cách đều mỗi [k] đơn vị cho đến khi đủ [n]. Do danh sách không được xếp theo bất kỳ chu kỳ nào trùng với [k], cách lấy này tương đương ngẫu nhiên đơn giản.»
Thuận tiện. «Do không có khung lấy mẫu của [tổng thể], nghiên cứu sử dụng phương pháp chọn mẫu thuận tiện: phiếu được phát cho [đối tượng] tại [địa điểm] trong khoảng [thời gian], thu về [n] phiếu hợp lệ. Kết quả mô tả đặc điểm của mẫu khảo sát và không được suy rộng cho toàn bộ [tổng thể]; hạn chế này được nêu ở [mục].»
Câu thứ ba là câu nhiều người ngại viết. Nhưng viết nó ra là cách duy nhất để phần kết luận của bạn không bị bắt lỗi về mức độ khẳng định — vấn đề được bàn kỹ ở bảng đối chiếu năm mức chắc chắn.
Mẫu thu về ít hơn dự kiến thì làm gì
Đây là tình huống gần như chắc chắn xảy ra. Bốn việc nên làm, theo thứ tự:
- Báo cáo trung thực tỷ lệ phản hồi: phát bao nhiêu, thu bao nhiêu, loại bao nhiêu phiếu và loại vì lý do gì.
- Kiểm tra mẫu thu được có lệch không: so cơ cấu mẫu với cơ cấu tổng thể ở vài biến bạn biết (giới tính, năm học, khu vực). Nếu lệch, nói rõ lệch ở đâu.
- Điều chỉnh phép phân tích cho khớp cỡ mẫu thật, thay vì cố chạy một mô hình mà cỡ mẫu không đỡ nổi.
- Đưa vào mục hạn chế, không đưa vào mục phạm vi — đây là ràng buộc phát hiện sau, không phải đường biên chọn trước. Phân biệt này được giải thích ở bài về đối tượng và phạm vi nghiên cứu.
Việc không nên làm: âm thầm hạ mức ý nghĩa, hoặc gộp nhóm cho đến khi kết quả có ý nghĩa thống kê.
Sáu lỗi hội đồng hay hỏi
- Gọi mẫu thuận tiện là mẫu ngẫu nhiên. Câu hỏi tiếp theo sẽ là «danh sách gốc của anh/chị ở đâu?».
- Áp Slovin cho mô hình nhiều biến. Ra cỡ mẫu quá nhỏ để chạy phân tích đã hứa.
- Không nêu ngày chốt danh sách. Tổng thể luôn thay đổi; không có ngày chốt thì N không kiểm chứng được.
- Phân tầng nhưng không nói phân bổ kiểu gì. Theo tỷ lệ hay đều nhau là hai thiết kế khác nhau với hai mục đích khác nhau.
- Suy rộng vượt khung lấy mẫu. Khảo sát một trường rồi kết luận cho «sinh viên Việt Nam».
- Không báo cáo phiếu bị loại. Thu 300, dùng 240, và không giải thích 60 phiếu kia đi đâu.
Viết luận văn cùng Tesify
Chương phương pháp là chương dễ viết nhất khi các quyết định đã rõ, và khó nhất khi chưa. Tesify đi cùng bạn từ khung lấy mẫu đến câu viết vào chương 3 — nội dung vẫn 100% do bạn viết. Hơn 9.000 sinh viên và học viên đã dùng Tesify cho hơn 15.000 chương.
Câu hỏi thường gặp
Công thức Slovin tính thế nào?
n = N / (1 + N × e²), với N là quy mô tổng thể và e là sai số cho phép. Với N = 1.500 và e = 5%, cỡ mẫu là khoảng 316.
Mẫu thuận tiện có được chấp nhận trong luận văn không?
Có, rất phổ biến và hợp lệ — với điều kiện bạn gọi đúng tên nó và không suy rộng kết quả ra tổng thể. Vấn đề không nằm ở kỹ thuật mà ở mức độ khẳng định.
Khi nào nên dùng chọn mẫu phân tầng?
Khi bạn có danh sách kèm một biến phân loại rõ ràng và muốn chắc chắn mọi nhóm đều có mặt. Với cùng cỡ mẫu, phân tầng thường cho ước lượng chính xác hơn ngẫu nhiên đơn giản.
Không biết quy mô tổng thể thì tính cỡ mẫu ra sao?
Không dùng được Slovin. Chuyển sang xác định cỡ mẫu theo yêu cầu của phép phân tích bạn định chạy, hoặc theo phân tích công suất thống kê.
Cỡ mẫu cho nghiên cứu định tính là bao nhiêu?
Không có con số ấn định. Tiêu chí là bão hòa dữ liệu: dừng khi những cuộc phỏng vấn tiếp theo không còn sinh ra chủ đề mới. Ghi khoảng dự kiến kèm tiêu chí dừng.
Khung lấy mẫu là gì và vì sao quan trọng?
Là danh sách thật các đơn vị thuộc tổng thể mà bạn có trong tay. Có nó thì dùng được kỹ thuật xác suất và được suy rộng; không có thì chỉ mô tả được mẫu.
Chọn mẫu hệ thống có phải là ngẫu nhiên không?
Tương đương ngẫu nhiên đơn giản, miễn là danh sách không được sắp xếp theo một chu kỳ trùng với bước nhảy k. Nếu có chu kỳ như vậy, mẫu sẽ bị lệch hệ thống.
Thu không đủ mẫu trước hạn nộp thì xử lý sao?
Báo cáo trung thực tỷ lệ phản hồi, kiểm tra mẫu có lệch cơ cấu không, chọn phép phân tích phù hợp với cỡ mẫu thật, và đưa việc này vào mục hạn chế chứ không vào mục phạm vi.
