Muốn Biết AI Có Hợp Với Bạn, Hãy Tự Kiểm Tra
Bảng xếp hạng chỉ cho biết kết quả trung bình. Điều quan trọng là thử mô hình trên chính công việc của bạn.
Hãy tưởng tượng bạn đang mua một chiếc xe cho gia đình. Một tạp chí có thể trao giải "Xe của năm", nhưng giải thưởng đó được tính từ nhiều tiêu chí khác nhau như tốc độ tối đa, mức tiêu hao nhiên liệu, độ an toàn khi va chạm, khoang chứa đồ và giá bán. Chiếc xe chạy nhanh nhất trên đường đua chưa chắc phù hợp để chở ba đứa trẻ cùng một chiếc xe đẩy. Vì vậy, người mua thông minh sẽ không chỉ nhìn vào giải thưởng. Họ sẽ xác định rõ mình thật sự cần gì, chẳng hạn như đưa con đi học, đi chợ, đậu vừa trong ga ra nhỏ, rồi lái thử xe quanh khu phố của mình trước khi quyết định mua. Bảng xếp hạng AI công khai cũng giống như giải thưởng trên tạp chí. Nó có thể hữu ích, nhưng không đủ để quyết định công cụ nào phù hợp với bạn. Danh sách các việc bạn thật sự cần làm mới là tiêu chí quan trọng nhất, còn việc thử một prompt trên một mẫu nhỏ giống như lái thử xe. Cách đó rẻ hơn, nhanh hơn và phản ánh nhu cầu thực tế tốt hơn nhiều so với những con số xếp hạng gây chú ý.
"AI tốt nhất" còn tùy bạn dùng để làm gì
Trước hết, không nên dùng cụm từ "mô hình tốt nhất". Cụm từ này nghe có vẻ rõ ràng, giống như nói "chiếc xe nhanh nhất", nhưng chất lượng của một mô hình không chỉ là một tiêu chí duy nhất. Nó gồm nhiều phẩm chất khác nhau, và các phẩm chất đó đôi khi mâu thuẫn với nhau. Dự án HELM của Đại học Stanford, tên đầy đủ là Holistic Evaluation of Language Models, tức Đánh giá Toàn diện các Mô hình Ngôn ngữ, đã cho thấy điều này bằng các số liệu cụ thể. Thay vì xếp tất cả mô hình vào một bảng hạng chung, HELM đánh giá từng mô hình theo bảy chỉ số riêng: độ chính xác, độ hiệu chỉnh, độ bền vững, tính công bằng, độ chệch, độ độc hại và hiệu suất. Cách làm này giúp người đọc thấy rõ mỗi mô hình mạnh ở đâu, yếu ở đâu, và phải đánh đổi điều gì.1 Một mô hình có thể đứng đầu về độ chính xác nhưng lại rất kém về tính công bằng hoặc độ độc hại. Nếu gom tất cả thành một danh hiệu "tốt nhất", ta sẽ che mất những đánh đổi quan trọng cần được nhìn thấy.
Vì vậy, khi một tiêu đề gọi một mô hình là "tốt nhất", bạn nên hỏi ba điều: nó tốt nhất ở việc gì, được đo bằng cách nào, và kết quả đó có phù hợp với nhu cầu thật sự của bạn không? Gần như lúc nào, câu trả lời cho câu hỏi cuối cũng là "không ai đo điều đó", vì các bảng xếp hạng thường dựa trên rất nhiều bài kiểm tra của người khác, chứ không phải công việc cụ thể của bạn.
Bài kiểm tra đáng tin nhất là việc thật của bạn
Đây là lúc khoảng cách giữa điểm số trên bảng xếp hạng và công việc thực tế trở nên rõ ràng nhất. Có một thử nghiệm nhỏ cho thấy điều này. Ở lần chạy đầu tiên, gpt-5.5 được yêu cầu viết tin nhắn nhắc lịch hẹn cho một phòng khám nha khoa. Đây là loại việc đơn giản mà nhiều người có thể muốn tự động hóa. Mô hình chỉ nhận một yêu cầu chung: hãy viết "hay nhất có thể". Ở một cuộc trò chuyện khác, mô hình cũng nhận đúng nhiệm vụ đó, nhưng lần này có bốn tiêu chí rõ ràng: tin nhắn phải dưới 160 ký tự để vừa một SMS, không được đưa ra lời khuyên y tế, phải có đủ thông tin cần thiết, và phải dùng từ ngữ đơn giản để người đang vội vẫn đọc lướt là hiểu.
Dạ, Phòng khám Nha khoa [Tên phòng khám] xin nhắc lịch hẹn của Anh/Chị [Tên bệnh nhân] vào lúc [Giờ] ngày [Ngày/Tháng] tại [Địa chỉ phòng khám].
Anh/Chị vui lòng đến trước 5–10 phút để phòng khám hỗ trợ làm thủ tục và chuẩn bị tốt nhất cho buổi thăm khám. Nếu cần thay đổi lịch hẹn, Anh/Chị vui lòng phản hồi tin nhắn này hoặc liên hệ [Số điện thoại] để được hỗ trợ.
Rất hân hạnh được đón tiếp Anh/Chị!
PK Nha khoa An Tâm nhắc lịch hẹn của bạn lúc 09:00 ngày 15/07. Trả lời OK để xác nhận hoặc gọi 0901234567 để đổi lịch.
Cả hai phiên bản đều ổn. Nếu chỉ đọc như một đoạn văn, phiên bản đầu còn có vẻ dễ thương hơn. Nhưng "hay nhất có thể" chỉ là một mong muốn, không phải tiêu chuẩn rõ ràng. Khi so với bốn tiêu chuẩn đã đặt ra, phiên bản đầu không đạt. Nó dài hơn 400 ký tự, vượt xa giới hạn 160 ký tự, và còn có nhiều chỗ trống trong ngoặc cần người khác điền tay. Phiên bản thứ hai bám sát các yêu cầu hơn. Nó chỉ có 118 ký tự, không đưa ra lời khuyên y tế, có đủ tên phòng khám, ngày giờ và cách xác nhận, đồng thời dùng từ đơn giản nên đọc lướt vẫn hiểu. Mô hình không giỏi hơn sau hai lần chạy. Người ra đề mới là bên tiến bộ, vì đã nói rõ "hay" thật sự có nghĩa là gì. Những tiêu chuẩn rõ ràng đó chính là thước đo của bạn. Không bảng xếp hạng nào có thể trao thước đo ấy cho bạn, vì chỉ bạn mới biết mình đang được đánh giá theo những tiêu chí nào.
Thử trên vài ví dụ nhỏ trước khi giao việc lớn
Một cách đánh giá chỉ có ích khi bạn thật sự dùng nó để kiểm tra công việc. Trước khi để hệ thống xử lý mọi thứ, hãy thử nó trên một nhóm nhỏ ví dụ thực tế. Có thể gọi thói quen này là thử trên một phần nhỏ trước. Hướng dẫn của Anthropic dành cho các đội xây dựng sản phẩm bằng các mô hình này cũng khuyên tương tự: hãy lấy bài kiểm tra từ chính những tình huống thật của bạn. Chỉ cần 20 đến 50 tác vụ đơn giản, rút ra từ những lần hệ thống từng làm sai, cũng đã là một điểm khởi đầu rất tốt.2 Bạn không cần một phòng nghiên cứu. Bạn chỉ cần một số ví dụ thật, bao gồm cả những trường hợp khó, và đủ kỷ luật để tự kiểm tra lại các câu trả lời.
Hãy xem kiểu kiểm tra này phát hiện được gì. Lần này, gpt-5.5 được giao năm hóa đơn chi tiêu và phải phân loại từng hóa đơn là "Được hoàn" hoặc "Cá nhân". Trong đó có một quy định được viết sẵn để tạo bẫy: đồ uống có cồn không bao giờ được hoàn tiền, không có ngoại lệ. Khoản thứ ba là hai ly rượu vang trong một bữa tối với khách hàng. Thoạt nhìn, khoản này có vẻ được hoàn vì đó là bữa ăn tiếp khách, nhưng theo quy định thì không được hoàn.
- Được hoàn
- Cá nhân
- Cá nhân
- Được hoàn
- Được hoàn
Mô hình đã vượt qua bài kiểm tra. Nó xếp ly rượu vang vào nhóm "Cá nhân" theo đúng quy định rõ ràng đã đặt ra, không dựa vào ấn tượng bên ngoài. Nó cũng xử lý tốt những trường hợp hiển nhiên. Với trường hợp còn gây tranh cãi, như chiếc tai nghe chống ồn được mua "để tập trung làm việc", mô hình đưa ra một nhận định có thể chấp nhận được, nhưng vẫn nên để con người kiểm tra lại. Đây là tín hiệu tốt. Tuy vậy, cần chú ý niềm tin này đến từ đâu. Niềm tin không đến từ việc mô hình trả lời có vẻ tự tin, cũng không đến từ việc một trang web nào đó xếp hạng mô hình cao. Nó đến từ năm trường hợp thử nghiệm đã biết trước đáp án đúng, nơi mô hình chứng minh được khả năng của mình ngay tại chỗ. Với một quy định tinh tế hơn, hoặc một mô hình yếu hơn, chính năm trường hợp thử nghiệm đó có thể giúp phát hiện sai sót trước khi sai sót lan ra toàn bộ hệ thống.
Vì sao con người vẫn phải đọc lại kết quả
Có một lý do rất quan trọng khiến bước kiểm tra này không thể giao hoàn toàn cho máy. Đây cũng là ý chính xuyên suốt phần này của cuốn sách. Mô hình có thể tạo ra những đoạn văn rất trôi chảy, bóng bẩy và có vẻ tự tin, nhưng nội dung vẫn có thể sai. Đó chính là hiện tượng ảo giác đã nói ở Chương 14. Vấn đề là mô hình thường không tự chỉ ra được chỗ nào đáng nghi, vì bản thân nó không biết phần nào chưa chắc chắn. Điểm số trên bảng xếp hạng cũng không đảm bảo phát hiện được lỗi trong đúng công việc của bạn. Mức độ tự tin của mô hình cũng không đáng tin hoàn toàn. Vì vậy, việc con người xem nhanh một mẫu nhỏ vẫn là bước kiểm tra an toàn cần thiết, và một đoạn văn viết hay không thể thay thế bước này. Tin tốt là việc kiểm tra này không tốn nhiều công sức: chỉ cần xem thử năm hóa đơn, ba bản tóm tắt hoặc một nhóm email nhỏ. Việc đó chỉ mất vài phút, chứ không cần biến thành cả một dự án.
Cái bẫy: đứng đầu bảng xếp hạng chưa chắc hợp với việc của bạn
"Mô hình đứng đầu bảng xếp hạng là mô hình tốt nhất, nên mình cứ dùng cái đó là xong." Thứ hạng là con số trung bình trên một bài kiểm chung chung do người khác thiết kế, và nó chưa bao giờ được đo trên email, tài liệu, hay khách hàng của bạn. Bài kiểm duy nhất cho biết đúng thứ bạn cần biết là bài bạn tự chạy trên chính công việc thật của mình.
Hãy chọn một việc nhỏ mà bạn muốn giao cho chatbot làm thường xuyên, ví dụ chuyển ghi chú cuộc họp thành bản tóm tắt ngắn gọn. Sau đó, hãy chuẩn bị ba hoặc bốn ví dụ thật, trong đó có ít nhất một ví dụ khó. Viết rõ kết quả tốt cần đạt được những gì, chẳng hạn: bản tóm tắt dài dưới một trang, không tự bịa thêm đầu việc, viết đúng tên người. Tiếp theo, đưa tất cả ví dụ đó cho chatbot xử lý. Tự chấm từng kết quả theo tiêu chí đã viết: tốt, tạm được, hay sai, rồi ghi lại lý do. Dựa trên những gì bạn thấy, chỉnh prompt một lần, sau đó chạy lại đúng các ví dụ cũ. Như vậy, bạn đã tạo ra một thước đo riêng và thử chatbot trên một nhóm ví dụ nhỏ. Cách này sẽ cho bạn nhiều thông tin hữu ích hơn hẳn so với các điểm đánh giá chung chung. Hãy giữ lại bộ ví dụ đó. Mỗi khi AI khiến bạn bất ngờ vì một câu trả lời tệ, hãy thêm ví dụ ấy vào bộ kiểm tra. Dần dần, bộ kiểm tra nhỏ này sẽ trở thành một hệ thống cảnh báo sớm rất hữu ích, được thiết kế riêng cho nhu cầu của bạn.
Vì sao vài phút kiểm tra có thể tránh lỗi lớn
Dù bạn chọn công cụ AI cho cả đội hay chỉ cân nhắc dùng nó cho công việc cá nhân, thói quen kiểm tra này giúp bạn tránh những sai lầm tốn kém. Chỉ cần thử trong năm phút với vài tình huống thật, bạn có thể phát hiện những vấn đề mà các lời khen trên mạng hoặc những con số ấn tượng trên trang web không cho thấy. Nhờ vậy, lỗi được phát hiện trước khi xuất hiện trước mặt sếp, khách hàng hoặc người dùng. Chương tiếp theo sẽ nói về một lý do khác khiến ta cần đọc kỹ đầu ra: ngay cả khi mô hình trả lời đúng, giọng văn bình tĩnh và có vẻ cân bằng của nó cũng là kết quả của quá trình huấn luyện, và giọng văn ấy luôn nghiêng theo một hướng nào đó.
Nguồn
- 1.Percy Liang, Rishi Bommasani, Tony Lee, và cộng sự, "Holistic Evaluation of Language Models," arXiv:2211.09110 (2022). Phần tóm tắt viết: "We measure 7 metrics (accuracy, calibration, robustness, fairness, bias, toxicity, and efficiency) for each of 16 core scenarios to the extent possible (87.5% of the time), ensuring that metrics beyond accuracy don't fall to the wayside, and that trade-offs across models and metrics are clearly exposed." Cả hai cụm được trích đều khớp nguyên văn với nguồn.
- 2.Anthropic, "Demystifying evals for AI agents," anthropic.com/engineering. Hướng dẫn viết: "In reality, 20-50 simple tasks drawn from real failures is a great start," khuyên các đội dựng bộ đánh giá từ những ca hỏng thật thay vì chờ một benchmark lớn, chính thức. Cụm được trích khớp nguyên văn với nguồn.