Chúng tôi đo lường sự thành công của CRO ở ba cấp độ, và chỉ số chính của chúng tôi là doanh thu trên mỗi lượt truy cập — chứ không phải chỉ riêng tỷ lệ chuyển đổi. Tỷ lệ chuyển đổi có thể tăng trong khi giá trị đơn hàng trung bình giảm, khiến tổng doanh thu không thay đổi. RPV (Return Per Visit Value - Giá trị đơn hàng trung bình) giúp thu hẹp khoảng cách đó. Ở cấp độ thử nghiệm, chúng tôi báo cáo mức tăng trưởng, độ tin cậy thống kê và doanh thu gia tăng. Mỗi thử nghiệm đều được chạy trong toàn bộ chu kỳ kinh doanh để các yếu tố như ngày trong tuần, ngày trả lương và mô hình chiến dịch không làm sai lệch kết quả, và chúng tôi xác định hiệu ứng tối thiểu có thể phát hiện và kích thước mẫu cần thiết trước khi thử nghiệm được triển khai — chứ không phải sau khi chúng tôi đã xem xét các con số. Ở cấp độ chương trình, chúng tôi theo dõi tốc độ thử nghiệm, tỷ lệ thắng, mức tăng trưởng trung bình trên mỗi thử nghiệm thắng cuộc và doanh thu gia tăng tích lũy hàng năm trong vòng 6-12 tháng. Một thử nghiệm đơn lẻ có thể là do may mắn; nhưng kết quả của một năm chương trình thì không thể. Đây cũng là con số trả lời câu hỏi duy nhất mà Giám đốc tài chính thực sự đặt ra: doanh thu gia tăng hàng năm so với chi phí chương trình. Cùng với cả hai, chúng tôi theo dõi các chỉ số kiểm soát — giá trị đơn hàng trung bình, tỷ lệ hoàn trả và hủy đơn hàng, số lượng yêu cầu hỗ trợ và hiệu suất trang — để một thử nghiệm thắng cuộc không bao giờ thắng bằng cách chuyển chi phí sang nơi khác trong doanh nghiệp. Chúng tôi cũng tính cả các thử nghiệm thua cuộc là kết quả. Một biến thể hoạt động kém hiệu quả là một quyết định ra mắt mà bạn đã không thực hiện và doanh thu mà bạn đã không bị mất, được xác nhận trong ba tuần thay vì được phát hiện trong một quý. Mỗi thử nghiệm đều được báo cáo kèm theo giả thuyết, dữ liệu và quyết định mà nó đưa ra, bất kể thành công hay thất bại. Tất cả những điều này đều không hiệu quả nếu không có một điểm chuẩn được xác định rõ ràng. Trước khi chạy bất kỳ thử nghiệm nào, chúng tôi xác thực thiết lập phân tích và thiết lập điểm chuẩn trước chương trình — chúng tôi không tuyên bố cải thiện dựa trên những con số mà chúng tôi không thể đo lường ngay từ đầu.