Kiểm thử khả năng sử dụng là một phương pháp nghiên cứu trong đó người dùng thực tế hoặc người dùng đại diện cố gắng hoàn thành các nhiệm vụ cụ thể bằng cách sử dụng một sản phẩm, nguyên mẫu hoặc trang web, trong khi người quan sát ghi lại những điểm họ thành công, những điểm họ gặp khó khăn và cách họ mô tả trải nghiệm của mình, thường bằng cách nói to suy nghĩ của họ trong quá trình làm việc. Không giống như các cuộc khảo sát hoặc phân tích, vốn chỉ báo cáo những gì người dùng đã làm hoặc nói sau khi sự việc đã xảy ra, kiểm thử khả năng sử dụng quan sát hành vi trực tiếp và trong bối cảnh cụ thể, khiến nó trở thành một trong những cách trực tiếp nhất để xác định xem giao diện có thực sự dễ hiểu và dễ sử dụng hay chỉ là giả định của nhóm phát triển.
Phương pháp này rất quan trọng vì những vấn đề về giao diện mà người thiết kế không nhận ra thường lại dễ dàng bị người dùng lần đầu phát hiện, một khoảng cách thường được giải thích bằng "lời nguyền của kiến thức", trong đó các nhà thiết kế và các bên liên quan, những người rất quen thuộc với sản phẩm, lại khó nhận ra sự mơ hồ mà người dùng mới gặp phải ngay lập tức. Nghiên cứu về khả năng sử dụng được trích dẫn rộng rãi đã chỉ ra rằng việc thử nghiệm với chỉ năm người tham gia thường phát hiện ra phần lớn, thường được trích dẫn là khoảng 85%, các vấn đề về khả năng sử dụng có trong một giao diện nhất định, đó là lý do tại sao thử nghiệm khả năng sử dụng thường được thực hiện với các vòng thử nghiệm nhỏ, lặp đi lặp lại với số lượng người tham gia ít hơn là các nghiên cứu quy mô lớn, cho phép các nhóm thử nghiệm, sửa chữa và thử nghiệm lại nhanh chóng thay vì phải chờ thu thập một mẫu lớn trước khi thực hiện bất kỳ thay đổi nào.
Kiểm thử khả năng sử dụng được thực hiện theo nhiều hình thức: kiểm thử có người điều phối, trong đó người điều phối hướng dẫn người tham gia thực hiện các nhiệm vụ trong thời gian thực, trực tiếp hoặc qua video, và có thể đặt câu hỏi bổ sung để làm rõ những điểm khó hiểu; kiểm thử từ xa không có người điều phối, trong đó người tham gia hoàn thành các nhiệm vụ một cách độc lập bằng cách sử dụng nền tảng kiểm thử, màn hình và giọng nói của họ được ghi lại để xem xét sau này, giúp thu thập dữ liệu nhanh hơn và ít tốn kém hơn nhưng không thể thu thập phản hồi ngay tại chỗ; và kiểm thử du kích, một phương pháp không chính thức, chi phí thấp, thu thập phản hồi nhanh chóng từ những người tham gia có sẵn, chẳng hạn như đồng nghiệp hoặc người qua đường, hữu ích cho việc xác thực giai đoạn đầu khi chưa cần thiết phải tiến hành một nghiên cứu đầy đủ. Các phiên kiểm thử thường được cấu trúc xung quanh các kịch bản nhiệm vụ cụ thể, thực tế hơn là khám phá mở, và sự thành công được đánh giá bằng các thước đo như tỷ lệ hoàn thành nhiệm vụ, thời gian thực hiện nhiệm vụ, số lỗi và xếp hạng mức độ dễ sử dụng chủ quan của người tham gia, thường được thu thập thông qua một công cụ tiêu chuẩn hóa như Thang đo khả năng sử dụng hệ thống (System Usability Scale).
Một quan niệm sai lầm phổ biến là kiểm thử khả năng sử dụng và kiểm thử A/B phục vụ cùng một mục đích, trong khi thực tế chúng giải quyết các câu hỏi khác nhau ở các giai đoạn khác nhau: kiểm thử khả năng sử dụng xác định lý do tại sao người dùng gặp khó khăn với giao diện trước khi nó được xây dựng hoặc ra mắt rộng rãi, thường là trên một nguyên mẫu hoặc một thiết kế đã được sử dụng nhưng chưa được xác thực, trong khi kiểm thử A/B đo lường xem biến thể nào trong số nhiều biến thể đã được xây dựng hoạt động tốt hơn ở quy mô lớn khi có lưu lượng truy cập. Một sai lầm thường gặp trong chính việc kiểm thử khả năng sử dụng là tuyển chọn những người tham gia không đại diện cho đối tượng mục tiêu thực sự, chẳng hạn như kiểm thử quy trình làm việc của phần mềm doanh nghiệp với những người tham gia không quen thuộc với quy trình kinh doanh cơ bản, điều này tạo ra các điểm khó khăn gây hiểu nhầm mà sẽ không xuất hiện với người dùng mục tiêu thực sự. Hướng dẫn người tham gia bằng các gợi ý hoặc đề xuất trong suốt phiên kiểm thử, thay vì để họ tự vật lộn và quan sát sự vật lộn đó một cách trung thực, là một lỗi phổ biến khác làm suy yếu tính hợp lệ của các phát hiện.
Trong CRO và UX Trong các dự án tư vấn, kiểm thử khả năng sử dụng thường được dùng để chẩn đoán, nhằm hiểu lý do tại sao quy trình hiện tại hoạt động kém hiệu quả, và để xác thực trước khi thiết kế lại được triển khai rộng rãi. Việc kiểm thử nguyên mẫu mới được thực hiện với một nhóm nhỏ người dùng đại diện để phát hiện các vấn đề lớn về khả năng sử dụng trước khi dành nguồn lực phát triển và thử nghiệm cho một bài kiểm tra A/B đầy đủ. Kết quả từ kiểm thử khả năng sử dụng thường được tổng hợp thành một danh sách các vấn đề được ưu tiên, thường được xếp hạng theo mức độ nghiêm trọng và số lượng người tham gia gặp phải từng vấn đề, từ đó trực tiếp đưa vào các thay đổi thiết kế hoặc giả thuyết thử nghiệm tạo nên lộ trình tối ưu hóa tổng thể của khách hàng.
Một ví dụ cụ thể minh họa hiệu quả của phương pháp: một nhóm thử nghiệm trang cài đặt tài khoản được thiết kế lại với năm người tham gia có thể nhận thấy rằng bốn trong số năm người không tìm thấy tùy chọn để thay đổi tùy chọn thông báo của họ, mỗi người đều tìm kiếm độc lập ở cùng một vị trí sai trong giao diện. Phát hiện duy nhất, rất nhất quán này, xuất hiện từ một vòng thử nghiệm nhỏ và không tốn kém, thường đủ để biện minh cho việc di chuyển vị trí cài đặt trước khi ra mắt, mà không cần một nghiên cứu lớn hơn và tốn nhiều thời gian hơn để xác nhận điều đã được quan sát thấy là lỗi xảy ra một cách đáng tin cậy và lặp đi lặp lại ở hầu hết mọi người tham gia được thử nghiệm.