AI Không Hoàn Toàn Trung Lập
Giọng điệu bình tĩnh, cân bằng không có nghĩa là không có quan điểm. Mỗi câu trả lời vẫn chịu ảnh hưởng từ dữ liệu và cách mô hình được dạy.
Hãy tưởng tượng một chatbot giống như một nhân viên mới rất giỏi. Người này đã đọc gần như cả Internet, nhưng lại chưa từng thật sự trải nghiệm cuộc sống hằng ngày. Những gì chatbot nói ra được hình thành từ hai nguồn chính. Nguồn thứ nhất là tất cả những gì nó đã đọc. Nếu "thư viện" mà nó học từ đó chứa nhiều thông tin thiên lệch, thì cách nó hiểu về điều gì là bình thường cũng sẽ bị nghiêng theo, dù chính nó không nhận ra. Nguồn thứ hai là quá trình được huấn luyện. Trong quá trình đó, một nhóm người liên tục đánh giá rằng câu trả lời này tốt, câu trả lời kia chưa tốt. Dần dần, chatbot học cách trả lời sao cho phù hợp với những đánh giá ấy. Vì vậy, khi chatbot đưa cho bạn một câu trả lời nghe có vẻ bình tĩnh, cân bằng về một chủ đề nhạy cảm, đó không hẳn là tiếng nói trung lập của một thực thể vô danh. Đó là kết quả từ một kho dữ liệu cụ thể và từ cách đánh giá của một nhóm huấn luyện cụ thể. Câu trả lời có thể rất trôi chảy và thuyết phục, nhưng nó vẫn có thể nghiêng về một hướng nào đó.
Thiên lệch của AI đến từ đâu
Cả hai "người thợ nặn" ấy đều đã xuất hiện ở các chương trước. Ở Phần 1, ta thấy một chatbot ban đầu giống như một cỗ máy đoán chữ rất lớn. Nó được huấn luyện bằng một kho văn bản khổng lồ do con người tạo ra. Vì vậy, những giả định, thành kiến và sai lệch có trong kho văn bản ấy cũng đi vào mô hình. Lúc đầu, nhiệm vụ chính của nó chỉ là học cách lặp lại và dự đoán kiểu chữ nghĩa mà nó đã được cho đọc. Sau đó, như Chương 3 đã kể, cỗ máy này được biến thành một trợ lý hữu ích hơn qua bước huấn luyện thứ hai gọi là RLHF, tức học tăng cường từ phản hồi của con người. Ở bước này, con người chấm điểm các câu trả lời mẫu, rồi mô hình được điều chỉnh để tạo ra những câu trả lời mà người chấm thích hơn. Chính bước thứ hai này tạo nên phần lớn cá tính và khả năng phán đoán của trợ lý. Điều đó cũng có nghĩa là sở thích của người chấm, cùng với các chỉ dẫn họ nhận được, sẽ ảnh hưởng đến cách mô hình trả lời những câu hỏi gây tranh cãi. Không bước huấn luyện nào tạo ra một góc nhìn hoàn toàn trung lập từ hư không. Chúng tạo ra một góc nhìn cụ thể, rồi trình bày góc nhìn ấy với bạn bằng một giọng nói dễ nghe.
Thiên lệch thường nằm trong lựa chọn mặc định
Bạn có thể thấy mô hình thiên về nguồn nào rõ nhất khi đặt một câu hỏi không nhắc đến nền văn hóa cụ thể, rồi xem nó sẽ chọn ví dụ từ đâu trước. Trước hết, có một điểm đáng mừng. Khi hỏi bằng tiếng Việt, gpt-5.5 thường trả lời khá đúng với bối cảnh Việt Nam. Nếu xin năm câu tục ngữ về sự chăm chỉ, mô hình sẽ đưa ra những câu như "Có công mài sắt, có ngày nên kim", "Cần cù bù thông minh", "Kiến tha lâu cũng đầy tổ". Đây đều là tục ngữ Việt, không phải bản dịch từ các câu châm ngôn phương Tây. Nếu nhờ đặt tên cho vài nhân vật trong truyện ngắn, mô hình có thể gợi ý những cái tên như Lâm An, Hoài Tâm, Tạ Nguyệt Chi, đều mang sắc thái Việt. Nếu hỏi một đám cưới điển hình diễn ra như thế nào, mô hình sẽ kể đến lễ dạm ngõ, lễ ăn hỏi, lễ rước dâu và lễ gia tiên. Còn nếu hỏi một bữa sáng điển hình gồm những gì, mô hình thậm chí còn tự nói trước rằng điều này có thể khác nhau tùy vùng miền.
Một bữa sáng điển hình tùy theo văn hóa và thói quen … Ở Việt Nam, một bữa sáng phổ biến có thể là phở/bún, bánh mì trứng hoặc thịt, xôi, cháo, kèm cà phê, sữa đậu nành hoặc trà đá.
Mức thiên lệch đã giảm so với trước. Với một mô hình thiên lệch nặng hơn, hoặc khi đặt câu hỏi bằng tiếng Anh, câu hỏi về "bữa sáng điển hình" thường dễ dẫn đến các câu trả lời như trứng, bánh mì nướng, ngũ cốc và cà phê. Đó chỉ là bữa sáng phổ biến ở một phần của thế giới, không phải ở mọi nơi. Việc gpt-5.5 mở đầu bằng cách nói "tùy theo văn hóa", rồi nêu thêm phở, xôi, cháo, cho thấy kiểu thiên lệch rõ rệt này đã được cố ý huấn luyện để giảm bớt. Đây là một tin mừng, và điều đó là có thật.
Tuy nhiên, ngón tay vẫn chưa rời hẳn khỏi cân. Hãy đặt một câu hỏi duy nhất bằng tiếng Việt: "Kể tên năm cuốn tiểu thuyết nổi tiếng."
Năm cuốn tiểu thuyết nổi tiếng:
- Đôn Kihôtê – Miguel de Cervantes
- Chiến tranh và Hòa bình – Lev Tolstoy
- Kiêu hãnh và Định kiến – Jane Austen
- Trăm năm cô đơn – Gabriel García Márquez
- 1984 – George Orwell
Năm cuốn sách được chọn, không thiếu cuốn nào, đều là tiểu thuyết phương Tây: Đôn Kihôtê của Cervantes, Chiến tranh và Hòa bình của Tolstoy, Kiêu hãnh và Định kiến của Austen, Trăm năm cô đơn của García Márquez và 1984 của Orwell. Không có Truyện Kiều, Số Đỏ, Chí Phèo hay Nỗi buồn chiến tranh, dù câu hỏi được đặt bằng tiếng Việt. Chỉ vài phút trước, mô hình còn đọc rất rõ tục ngữ Việt và đặt tên nhân vật Việt. Điều này không cho thấy mô hình thiếu kiến thức về văn học Việt. Nó cho thấy khi không được hướng dẫn cụ thể, mô hình có xu hướng mặc định chọn các tác phẩm phương Tây trước. Mô hình chắc chắn biết Truyện Kiều, vì nó vừa thể hiện rằng mình hiểu khá nhiều về văn hóa Việt. Vì vậy, vấn đề không nằm ở việc mô hình không biết, mà nằm ở việc nó ưu tiên chọn gì để đưa ra. Đây là một sự thiên lệch trong lựa chọn, không phải một khoảng trống kiến thức.
Giọng trung lập cũng là kết quả của huấn luyện
Thư viện cho thấy vì sao mô hình có những lựa chọn mặc định. Còn quá trình kèm cặp cho thấy một điều tinh tế hơn: vì sao mô hình thường nói bằng giọng bình tĩnh, cân bằng. Việc quyết định điều gì được xem là "cân bằng", khung nhìn nào được đưa ra, khung nhìn nào bị bỏ qua, bên nào được nói trước, tất cả đều là những lựa chọn trong quá trình huấn luyện, chứ không phải quy luật tự nhiên. Các nhà nghiên cứu đã đo được điều này. Khi Anthropic cho một trong các mô hình trả lời hàng nghìn câu hỏi về quan điểm, lấy từ các khảo sát trên toàn cầu, họ thấy rằng ở trạng thái mặc định, câu trả lời của mô hình thường giống ý kiến của một số nhóm dân cư hơn những nhóm khác, chẳng hạn người ở Hoa Kỳ và một số nước châu Âu, Nam Mỹ. Họ cũng thấy rằng nếu yêu cầu mô hình trả lời từ góc nhìn của một quốc gia cụ thể, câu trả lời sẽ thay đổi theo hướng đó.1 Một nghiên cứu khác cho thấy khi không được nhắc theo hướng nào, quan điểm mặc định của mô hình không đại diện cho công chúng nói chung, mà nghiêng về một số nhóm nhân khẩu nhất định. Mức chênh lệch này được các tác giả ví với khoảng cách giữa phe Dân chủ và phe Cộng hòa trong vấn đề biến đổi khí hậu.2 Vì vậy, giọng nói có vẻ cân bằng ấy là có thật, nhưng nó vẫn là một lập trường cụ thể, đã được chọn và huấn luyện, chỉ được trình bày như thể không mang lập trường nào.
Đó là lý do những người nghiên cứu các hệ thống này xem độ chệch (bias) như một yếu tố cần được đo riêng, chứ không phải một vấn đề phụ. Trong bài đánh giá HELM ở chương trước, độ chệch và tính công bằng được tách thành hai trong bảy điểm số riêng, không gộp chung với độ chính xác thô,3 vì một mô hình có thể vừa trả lời đúng nhiều, vừa vẫn nghiêng lệch. Một tác dụng phụ đã được ghi nhận trong giai đoạn kèm cặp, tức thói nịnh bợ ở Chương 15, cũng dẫn đến cùng vấn đề này: mô hình có xu hướng ngả theo ý kiến mà bạn đưa ra, nên sự "cân bằng" của nó có thể âm thầm lệch về phía bạn.
Cái bẫy: nghe cân bằng chưa chắc đã trung lập
"Nếu một chatbot nghe điềm tĩnh, cân bằng, và tránh ngả về bên nào, thì điều đó chứng tỏ nó trung lập và chẳng mang độ nghiêng bẩm sinh nào." Không phải vậy. Cái giọng cân bằng là một lối viết được huấn luyện, và cái gì được coi là "cân bằng" là do con người định đoạt trong lúc huấn luyện. Một lối trình bày bóng bẩy, không-ý-kiến-mạnh vẫn có thể đóng khung một chủ đề gây tranh cãi theo hướng này thay vì hướng kia, với tay lấy ví dụ của một nền văn hóa theo mặc định, và ngả về bất cứ quan điểm nào bạn đã phát tín hiệu. Cái trung lập mượt mà của giọng điệu không giống với sự vắng mặt của một quan điểm.
Hãy chọn một chủ đề thật sự vẫn còn gây tranh cãi. Sau đó, hỏi chatbot về chủ đề đó theo ba cách khác nhau, mỗi cách trong một cuộc trò chuyện mới. Lần thứ nhất, hãy hỏi một cách bình tĩnh và trung lập, chẳng hạn: "Những lập luận xung quanh vấn đề X là gì?" Lần thứ hai, hãy cho thấy bạn nghiêng về một phía, chẳng hạn: "Là người ủng hộ mạnh mẽ X, chẳng phải rõ ràng là...?" Lần thứ ba, hãy thể hiện rằng bạn nghiêng về phía ngược lại. Sau đó, so sánh các câu trả lời. Hãy chú ý hai điều. Thứ nhất, mô hình có âm thầm đồng tình nhiều hơn với phía mà bạn tỏ ra ủng hộ không, giống kiểu chiều theo người hỏi đã nói ở Chương 15 không? Thứ hai, trong câu trả lời trung lập, quan điểm nào được nêu trước, quan điểm nào được mô tả thiện cảm hơn, và quan điểm nào được dùng để kết luận? Mục đích của bạn không phải là bắt lỗi mô hình nói dối, mà là quan sát xem nó nghiêng về phía nào và có xu hướng làm vừa lòng người hỏi ra sao do quá trình huấn luyện tạo nên. Nếu muốn thử một phiên bản nhẹ nhàng hơn, bạn có thể chỉ cần hỏi "năm cuốn tiểu thuyết nổi tiếng" hoặc "một mâm cỗ ngày lễ điển hình", rồi để ý xem đó là tiểu thuyết của ai và mâm cỗ của ai.
Vì sao bạn nên xem câu trả lời AI như một góc nhìn
Nếu có lúc bạn dựa vào một chatbot để cân nhắc một quyết định tuyển dụng, một vấn đề chính trị, một lựa chọn về y tế hay tài chính, hoặc bất kỳ chuyện nào mà ngay cả người hiểu biết cũng có thể bất đồng, hãy nhớ rằng câu trả lời bạn nhận được chỉ là một góc nhìn. Góc nhìn đó được hình thành từ một tập dữ liệu cụ thể và một quá trình phản hồi cụ thể, rồi được trình bày bằng giọng điệu tự tin và dễ nghe. Hãy dùng công cụ ấy để thu thập thêm ý kiến, sau đó tự kiểm tra lại những điểm còn gây tranh cãi từ nhiều nguồn khác. Đừng nhầm giọng nói điềm tĩnh của mô hình với bằng chứng rằng nó hoàn toàn khách quan. Chương tiếp theo sẽ mở rộng góc nhìn thêm một bước, từ những thiên lệch bên trong chatbot đến những thiên lệch trong các dòng tin đang âm thầm quyết định điều bạn nhìn thấy suốt cả ngày.
Nguồn
- 1.Durmus và cộng sự, "Towards Measuring the Representation of Subjective Global Opinions in Language Models," Anthropic, 2023. Nghiên cứu ghi nhận rằng "by default, LLM responses tend to be more similar to the opinions of certain populations, such as those from the USA, and some European and South American countries," và rằng nhắc mô hình lấy góc nhìn của một quốc gia cho trước sẽ đẩy câu trả lời về phía ý kiến của nhóm dân cư đó. Các câu hỏi quan điểm rút từ những khảo sát xuyên quốc gia (World Values Survey và Pew Global Attitudes).
- 2.Santurkar và cộng sự, "Whose Opinions Do Language Models Reflect?" 2023 (OpinionQA). Bài báo thấy "substantial misalignment between the views reflected by current LMs and those of US demographic groups: on par with the Democrat-Republican divide on climate change," với những quan điểm mặc định không được nhắc của mô hình lệch về phía các nhóm nhân khẩu nhất định thay vì công chúng nói chung. Thước đo dựng trên các cuộc thăm dò dư luận Hoa Kỳ (Pew American Trends Panel).
- 3.Liang và cộng sự, "Holistic Evaluation of Language Models" (HELM), 2022. HELM đo bảy chỉ số, liệt kê trong bài là accuracy, calibration, robustness, fairness, bias, toxicity, và efficiency, với bias và fairness được giữ thành hai điểm số riêng, tách khỏi accuracy.