Một nhóm sinh viên làm ứng dụng đặt lịch khám, mời 5 người bạn cùng lớp dùng thử, cả 5 đều hoàn thành. Nhóm kết luận giao diện ổn. Tuần sau đưa cho mẹ một bạn trong nhóm, bà mất 7 phút không tìm ra nút chọn giờ vì nó nằm dưới mép màn hình, phải cuộn mới thấy.
Con số 5 không sai. Cái sai là 5 người nào, làm nhiệm vụ gì, và đọc kết quả ra sao.
Con số 5 đến từ đâu và điều kiện đi kèm
Lập luận gốc của Jakob Nielsen dựa trên một mô hình đơn giản: mỗi người thử phát hiện một tỷ lệ nào đó trong tổng số vấn đề, và các vấn đề lớn thì hầu như ai cũng vấp. Người thứ nhất lộ ra nhiều nhất, người thứ hai lặp lại phần lớn cái đã thấy và thêm ít cái mới, tới người thứ năm thì bạn chủ yếu xem lại những lỗi đã ghi. Vì vậy thay vì một vòng 15 người, nên làm ba vòng 5 người, sửa giữa các vòng.
Ba điều kiện hay bị lược đi:
- Cùng một nhóm người dùng. Nếu sản phẩm phục vụ cả bệnh nhân lớn tuổi lẫn lễ tân phòng khám, đó là hai nhóm, mỗi nhóm cần 3–5 người riêng.
- Kiểm thử định tính, không đo lường. 5 người cho bạn biết người ta vấp ở đâu, không cho bạn tỷ lệ hoàn thành đáng tin. Muốn nói “78% người dùng hoàn thành” thì cần mẫu lớn hơn nhiều.
- Lặp lại. Giá trị của 5 người nằm ở chỗ bạn sửa rồi thử tiếp. Một vòng 5 người rồi thôi thì chỉ thấy lớp lỗi trên cùng; lỗi bên dưới bị che bởi lỗi trên.
Chọn người thử: sai lầm nằm ở đây nhiều nhất
Bạn cùng lớp, đồng nghiệp trong công ty và người nhà là ba nguồn tiện nhất và cũng lệch nhất. Họ quen cách nghĩ của bạn, biết bạn muốn gì, và ngại chê.
Viết một bộ câu hỏi sàng lọc ngắn, bám vào hành vi chứ không vào nhân khẩu học:
- Trong 3 tháng qua, anh chị đã đặt lịch khám qua điện thoại hay ứng dụng lần nào chưa?
- Anh chị thường dùng điện thoại để làm những việc gì ngoài nghe gọi?
- Anh chị có làm trong lĩnh vực thiết kế, công nghệ, marketing không? (có thì loại)
Câu cuối rất quan trọng. Người làm nghề nhìn giao diện bằng mắt người phê bình, họ sẽ góp ý về màu sắc thay vì cho bạn thấy họ bị lạc.
Viết nhiệm vụ: kịch bản, không phải chỉ dẫn
Nhiệm vụ tồi: “Hãy bấm vào mục Đặt lịch và chọn bác sĩ.” Câu này đã chỉ đường, dùng đúng chữ trên giao diện, người thử chỉ việc dò chữ.
Nhiệm vụ tốt: “Con anh chị bị sốt từ hôm qua, anh chị muốn đưa cháu đi khám chiều thứ Bảy này. Hãy dùng ứng dụng để sắp xếp việc đó.”
Kịch bản tốt có ba đặc điểm:
- Có động cơ thật, để người thử ra quyết định như ngoài đời.
- Không dùng từ trên giao diện. Nếu nút ghi “Đặt lịch”, trong nhiệm vụ nói “sắp xếp”, “hẹn”.
- Có điểm kết rõ, người điều phối biết khi nào là xong hay bỏ cuộc.
Một buổi 45–60 phút nên có 4–6 nhiệm vụ. Nhiều hơn thì người thử mệt, ba nhiệm vụ cuối cho dữ liệu kém.
Điều phối buổi thử: im lặng là kỹ năng khó nhất
Yêu cầu người thử nói to suy nghĩ (think aloud). Họ sẽ quên sau vài phút, nhắc nhẹ: “Anh đang nghĩ gì vậy?”
Những câu người điều phối không được nói:
- “Anh thử nhìn góc trên xem.” — bạn vừa làm hộ.
- “Cái này có dễ hiểu không?” — câu hỏi dẫn dắt, hầu hết sẽ trả lời có.
- “Bọn em mới làm, còn nhiều lỗi lắm.” — người thử sẽ nhẹ tay.
Khi người thử hỏi “Bấm chỗ này phải không?”, trả lời bằng câu hỏi: “Anh nghĩ sao?” Khi họ bế tắc quá 3 phút và rõ ràng không tự thoát được, ghi nhận là thất bại rồi mới gỡ, để còn thử các phần sau.
Ghi chép: tách quan sát khỏi diễn giải
Người ghi chép (nên là người thứ hai, không phải người điều phối) ghi theo ba cột: thời điểm, việc người thử làm, lời họ nói. Chưa đánh giá.
| Quan sát (ghi trong buổi) | Diễn giải (làm sau buổi) |
|---|---|
| Cuộn lên xuống 3 lần ở màn chọn bác sĩ, nói “ủa giờ đâu” | Ô chọn giờ nằm dưới nếp gấp, không có gợi ý cuộn |
| Bấm vào ảnh bác sĩ, không có gì xảy ra, bấm lại lần nữa | Ảnh trông như bấm được nhưng không có hành động |
| Chọn nhầm ngày Chủ nhật, không nhận ra | Ngày đã chọn không đủ nổi bật so với ngày thường |
Tách như vậy để khi tổng hợp, cả nhóm tranh luận về diễn giải trên cùng một nền dữ kiện, không phải cãi nhau về chuyện người thử “có thật sự bối rối không”.
Tổng hợp: xếp theo mức nghiêm trọng, không theo số lần
Dán mỗi quan sát lên một thẻ, gom nhóm các thẻ cùng một nguyên nhân (affinity mapping). Sau đó chấm từng vấn đề theo thang bốn bậc:
- Chặn: người thử không hoàn thành được nhiệm vụ.
- Nghiêm trọng: hoàn thành nhưng mất nhiều thời gian hoặc làm sai mà không biết.
- Nhỏ: khựng lại, tự gỡ được.
- Thẩm mỹ: có nhận xét nhưng không ảnh hưởng hành vi.
Một lỗi chỉ 1/5 người gặp nhưng ở mức “làm sai mà không biết”, như chọn nhầm ngày khám, đáng sửa trước một lỗi 4/5 người khựng hai giây. Đếm tần suất thì dễ, nhưng tần suất với 5 người không có ý nghĩa thống kê; mức độ hậu quả mới quyết định thứ tự.
Áp dụng ngay: một vòng kiểm thử trong một tuần
- Thứ Hai: viết mục tiêu (muốn biết gì), 4 nhiệm vụ, 3 câu sàng lọc.
- Thứ Ba: tuyển 5 người qua nhóm cộng đồng, có quà nhỏ cảm ơn. Chạy thử kịch bản với một người trong nhóm để bắt nhiệm vụ mơ hồ.
- Thứ Tư–Thứ Năm: 5 buổi, mỗi buổi 45 phút, cách nhau ít nhất 15 phút để ghi bổ sung.
- Thứ Sáu sáng: gom thẻ, chấm mức độ, chọn tối đa 5 vấn đề để sửa.
- Tuần sau: sửa trên nguyên mẫu, lặp lại với 5 người mới.
Không cần phòng lab. Một điện thoại quay màn hình, một người cầm máy quay tay người thử từ phía sau, một bàn yên tĩnh là đủ.
Khi 5 người không đủ
- So sánh hai phương án để chọn một: cần đo, cần mẫu lớn hơn, thường dùng kiểm thử không điều phối trực tuyến.
- Sản phẩm nhiều nhóm người dùng khác hẳn nhau: 3–5 người mỗi nhóm.
- Tìm lỗi hiếm nhưng nguy hiểm, như trong phần mềm y tế: kiểm thử khả dụng chỉ là một lớp, cần thêm phân tích lỗi thao tác có hệ thống.
Việc nên làm tiếp theo: lấy một ứng dụng bạn đang dùng hằng ngày, viết 4 nhiệm vụ theo kiểu kịch bản cho nó, rồi thử với 2 người lớn tuổi trong nhà. Bạn sẽ thấy phần lớn kỹ năng nằm ở cách viết nhiệm vụ và cách giữ im lặng, không nằm ở công cụ.
Câu hỏi thường gặp
Kiểm thử khả dụng 5 người có đủ không?
Đủ để phát hiện phần lớn vấn đề lớn nếu 5 người thuộc cùng một nhóm người dùng và bạn làm nhiều vòng, sửa giữa các vòng. Không đủ nếu bạn cần số liệu đo lường hay so sánh hai phương án.
Nên tuyển người thử khả dụng ở đâu?
Tuyển theo hành vi phù hợp với sản phẩm qua nhóm cộng đồng, kèm vài câu sàng lọc. Tránh đồng nghiệp, bạn học và người làm nghề thiết kế vì họ lệch và ngại chê.
Think aloud là gì?
Là phương pháp yêu cầu người thử vừa thao tác vừa nói to suy nghĩ của mình. Nhờ đó bạn biết vì sao họ bấm chỗ này thay vì chỉ thấy họ bấm.
Một buổi kiểm thử khả dụng kéo dài bao lâu?
Thường 45–60 phút với 4–6 nhiệm vụ. Dài hơn thì người thử mệt và dữ liệu các nhiệm vụ cuối kém tin cậy.
Nên sửa lỗi nào trước sau kiểm thử?
Xếp theo mức hậu quả: lỗi chặn nhiệm vụ và lỗi khiến người dùng làm sai mà không biết đứng đầu, kể cả khi chỉ một người gặp. Lỗi thẩm mỹ để sau.