learningai.vn
VI
Phần 5 · Chương 14

Vì Sao AI Có Thể Nói Sai Rất Tự Tin

Thời gian đọc: 13 phút

Mô hình có thể nói rất tự tin mà vẫn sai. Cách nói hay không phải là bằng chứng cho câu trả lời đúng.

Hãy tưởng tượng một hướng dẫn viên du lịch rất tự tin. Người này đã đọc hàng nghìn cuốn cẩm nang, nhưng chưa từng thật sự đến thành phố đó. Nếu bạn hỏi về một quảng trường nổi tiếng, họ sẽ trả lời rất trôi chảy và chi tiết, với giọng điềm tĩnh và chắc chắn. Họ có thể nói về các mốc thời gian, tên kiến trúc sư và kể thêm một giai thoại thú vị. Vấn đề là họ không kể lại điều mình đã tận mắt thấy. Họ chỉ đang tạo ra một câu trả lời giống với cách các cuốn cẩm nang thường viết. Phần lớn câu trả lời nghe có vẻ đúng, nên bạn dễ tin. Nhưng đôi khi tên kiến trúc sư là bịa ra, mốc thời gian sai cả trăm năm, còn giai thoại thì chưa từng xảy ra. Tất cả vẫn được nói bằng cùng một giọng chắc chắn như những thông tin đúng. Vì vậy, cách nói trôi chảy không giúp bạn biết câu trả lời có chính xác hay không. Một mô hình ngôn ngữ cũng giống như người hướng dẫn viên đó.

Khi AI "ảo giác": nói nghe đúng nhưng lại sai

Trong giới làm nghề, hiện tượng này thường được gọi là ảo giác (hallucination). Nghĩa là mô hình tạo ra câu trả lời nghe rất trôi chảy và có vẻ hợp lý, nhưng thông tin lại sai, hoặc không đúng với tài liệu mà nó được yêu cầu dựa vào. Đây không phải là lỗi hiếm gặp, cũng không có nghĩa là hệ thống đã bị hỏng. Các nhà nghiên cứu xem đây là một dạng lỗi phổ biến và đã được ghi nhận nhiều lần. Lỗi này bắt nguồn từ chính cách các mô hình ngôn ngữ hoạt động. Như Phần 1 đã giải thích, mô hình chủ yếu đoán chữ tiếp theo dựa trên những gì đã có trước đó. Nó được tối ưu để tạo ra phần tiếp theo nghe có vẻ đúng, chứ không thật sự kiểm tra xem nội dung đó có đúng sự thật hay không. Trong quá trình tạo câu trả lời, không có bước nào tự động dừng lại để hỏi: "Điều này có thật không?". Vì vậy, với mô hình, một câu sai nhưng viết trôi chảy có thể trông giống như một câu đúng và cũng viết trôi chảy.

Trước khi nói đến lời cảnh báo, hãy bắt đầu bằng một tin vui: các mô hình AI hàng đầu hiện nay đã làm việc này tốt hơn nhiều so với các thế hệ trước. Khi các nhà nghiên cứu yêu cầu ChatGPT viết những bài điểm tài liệu ngắn rồi kiểm tra từng trích dẫn, một mô hình cũ đã bịa ra 55% số trích dẫn. Một mô hình mới hơn giảm tỷ lệ đó xuống còn 18%. Những lỗi còn lại cũng không xuất hiện một cách ngẫu nhiên. Chúng thường rơi vào các nguồn ít người biết, ít được trích dẫn. Ngược lại, với những nguồn nổi tiếng và được trích dẫn nhiều, mô hình thường làm đúng. Đây là một tiến bộ thật sự, và bạn sẽ thấy cả mặt mạnh lẫn mặt yếu của nó trong các ví dụ bên dưới. Tuy vậy, "giỏi hơn" không có nghĩa là "không còn sai". Những chỗ mô hình vẫn dễ mắc lỗi khá rõ ràng, có thể đoán trước và cũng dễ phát hiện nếu bạn biết cần nhìn vào đâu. Chương này sẽ tập trung vào đúng những chỗ đó.

Khi hỏi thông tin có thể kiểm chứng

Trong phép thử đầu tiên, tôi yêu cầu GPT-5.5 giới thiệu ba cuốn sách về nuôi ong dành cho người mới bắt đầu. Tôi cũng cố tình hỏi thêm những thông tin dễ gây sai sót: tên sách, tác giả, nhà xuất bản, năm xuất bản và mã ISBN, tức dãy số riêng thường in ở bìa sau của mỗi cuốn sách.

Một lần chạy thật, gpt-5.5. Sau đó từng chi tiết được đối chiếu với hồ sơ thư viện:
PROMPT
Hãy giới thiệu cho mình ba cuốn sách được đánh giá cao dành cho người mới bắt đầu nuôi ong. Với mỗi cuốn, cho mình biết chính xác tựa sách, tác giả, nhà xuất bản, năm xuất bản, và mã số ISBN của nó.
gpt-5.5

Dưới đây là 3 cuốn sách tiếng Anh được đánh giá cao …

#Tựa sáchTác giảNhà xuất bảnNăm xuất bảnISBN
1Beekeeping For Dummies, 5th EditionHowland BlackistonFor Dummies2020ISBN-13: 978-1-119-70258-0
2The Beekeeper’s Handbook, 4th EditionDiana Sammataro; Alphonse AvitabileCornell University Press2011ISBN-13: 978-0-8014-7694-5
3Storey’s Guide to Keeping Honey Bees, 2nd EditionMalcolm T. Sanford; Richard E. BonneyStorey Publishing2018ISBN-13: 978-1-61212-978-5

Hãy đọc nó như cách bạn đọc một câu trả lời từ một trợ lý tự tin: rõ ràng, ngắn gọn và đầy đủ. Lần này, khi kiểm tra từng chi tiết trong hồ sơ thư viện, mọi thông tin đều chính xác. Cả ba cuốn sách đều có thật, đúng tác giả, đúng nhà xuất bản và đúng năm phát hành. Ba mã ISBN cũng là mã thật, hợp lệ và khớp với từng cuốn sách. Với một chủ đề đã được viết rất nhiều, câu trả lời tự tin lần này cũng là câu trả lời đúng.

Thông tin càng hiếm, AI càng dễ bịa

Liệu đó chỉ là may mắn? Ở phép thử tiếp theo, câu hỏi được chuyển sang một chủ đề hiếm gặp hơn và khó tra cứu hơn: hồi ký của những người từng làm nghề gác hải đăng, một mảng có rất ít sách được viết.

Một lần chạy thật, gpt-5.5. Từng cuốn lại được kiểm như trước:
PROMPT
Hãy giới thiệu ba cuốn hồi ký hoặc ghi chép của những người từng làm nghề gác hải đăng. Với mỗi cuốn, cho mình biết chính xác tựa sách, tác giả, nhà xuất bản, năm xuất bản, và mã số ISBN.
gpt-5.5

Dưới đây là 3 cuốn hồi ký/ghi chép … của những người từng làm nghề gác hải đăng:

#Tựa sáchTác giảNhà xuất bảnNăm xuất bảnISBN
1Stargazing: Memoirs of a Young Lighthouse KeeperPeter HillCanongate Books2003ISBN 978-1841954059
2Relief Chief: A Lighthouse Keeper’s StoryPeter B. WilliamsWhittles Publishing2013ISBN 978-1849950918
3The Last Lighthouse Keeper: A MemoirJohn Cook, with Jon BauerAllen & Unwin2020ISBN 978-1760877110

Ba cái tên vẫn nghe rất chắc chắn và gọn như trước. Nhưng lần này, mọi chuyện khác hẳn. Trong ba cuốn sách, có hai cuốn là sách thật: Stargazing của Peter Hill và The Last Lighthouse Keeper của John Cook. Cả tác giả, nhà xuất bản và năm xuất bản đều đúng. Cuốn còn lại, Relief Chief, thì hoàn toàn không tồn tại. Đó chỉ là một cái tên nghe có vẻ hợp lý, đi kèm một tác giả bịa ra và được gắn với một nhà xuất bản có thật. Ngoài ra, cả ba mã ISBN được đưa ra đều không có thật.

Đây là điểm quan trọng nhưng rất dễ bị bỏ qua: bạn có thể phát hiện phần lớn những con số giả đó ngay trên trang giấy, không cần tra cứu ở đâu xa. Chữ số cuối của một mã ISBN không phải là dữ liệu gốc. Nó là một chữ số kiểm tra, được tính từ mười hai chữ số đứng trước, giống như cách một trang web phát hiện bạn nhập sai số thẻ tín dụng. Khi thử phép kiểm tra này với ba mã ISBN, hai mã sai ngay lập tức vì chữ số cuối không khớp với các chữ số còn lại. Mã thứ ba vượt qua được phép kiểm tra, nhưng vẫn là mã giả. Khi tra trong mục lục thư viện, mã đó lại thuộc về một cuốn sách khác của cùng nhà xuất bản Canongate, chứ không phải cuốn hồi ký đang được nói đến. Bài học của cả chương nằm ở đây: khi điều bạn hỏi càng hiếm và càng cụ thể, các chi tiết càng dễ âm thầm trượt từ ký ức sang bịa đặt, dù giọng kể vẫn tự tin như không có gì sai.

Nguy hiểm là AI thường đúng đủ nhiều để ta tin

Sẽ đơn giản hơn nếu ta kết luận rằng mô hình này hoàn toàn không đáng tin khi nói về nguồn tài liệu. Nhưng thực tế không phải vậy, và đó mới là điểm nguy hiểm. Khi được hỏi về những bài báo học thuật nổi tiếng, được trích dẫn nhiều, mô hình lại trả lời rất chính xác:

Một lần chạy thật, gpt-5.5 (hiện trích dẫn đầu trong ba; cả ba đều đã được kiểm):
PROMPT
Mình đang viết một bài điểm tài liệu ngắn về việc mái nhà xanh ở đô thị ảnh hưởng thế nào đến mức tiêu thụ năng lượng của các tòa nhà bên dưới. Hãy cho mình ba bài báo khoa học có bình duyệt thật sự về đúng chủ đề này. Với mỗi bài, cho mình biết các tác giả, tựa bài, tên tạp chí, năm, số tập (volume) và số kỳ (issue), khoảng số trang, và mã DOI.
gpt-5.5

… Niachou, A.; Papakonstantinou, K.; Santamouris, M.; Tsangrassoulis, A.; Mihalakakou, G. … Analysis of the green roof thermal properties and investigation of its energy performance. … Energy and Buildings, 2001, 33(7), 719–729. DOI: 10.1016/S0378-7788(01)00062-7 …

Tên tác giả, tên tạp chí, năm xuất bản, số tập, số kỳ, khoảng trang và mã DOI ở cuối đều đã được kiểm tra với hồ sơ chính thức của tạp chí. Cả ba trích dẫn đều khớp, đúng đến từng ký tự. Đây chính là cái bẫy trong phép so sánh này. Mô hình thường đoán rất giỏi nên phần lớn câu trả lời trông có vẻ đúng. Nó cũng nói với cùng một giọng chắc chắn khi bịa ra một mã ISBN như khi nhắc lại một trích dẫn có thật. Vì vậy, sự tự tin chỉ là một cách viết, được tạo ra giống nhau trong cả hai trường hợp. Mô hình sẽ không tự chỉ ra chỗ nào đáng nghi, vì đối với nó, không có chỗ nào đáng nghi cả.

trông giống nhau trên màn hình
Xây năm 1889trôi chảy, tự tin
tra nguồn tin cậycó thật
Xây năm 1921trôi chảy, tự tin
tra nguồn tin cậybịa ra
văn phong không cho biết câu nào đúng
Hai câu trả lời có thể đều trôi chảy và tự tin, dù một câu đúng và một câu bịa. Muốn phân biệt, bạn cần kiểm tra bằng nguồn tin cậy.

Khi AI biết nói "tôi không chắc"

Cũng có một tin đáng mừng và đáng chú ý không kém. Khi được hỏi về ba cuốn sách tiếng Việt viết về nghề gốm truyền thống ở Bát Tràng, một đề tài khá hẹp và mang tính địa phương, GPT-5.5 đã làm điều mà các mô hình trước đây hiếm khi làm: từ chối bịa thông tin.

Một lần chạy thật, gpt-5.5:
PROMPT
Hãy giới thiệu ba cuốn sách tiếng Việt viết về nghề làm gốm truyền thống ở làng gốm Bát Tràng. Với mỗi cuốn, cho mình biết chính xác tựa sách, tác giả, nhà xuất bản, năm xuất bản, và mã số ISBN.
gpt-5.5

Mình không thể cung cấp ba cuốn sách với đầy đủ và chính xác các trường … vì ISBN là thông tin rất dễ bị sai nếu dựa vào trí nhớ hoặc nguồn thứ cấp. Mình không muốn bịa hoặc đưa mã ISBN không kiểm chứng.

Thay vì tự nghĩ ra ba tựa sách nghe có vẻ hợp lý kèm các mã số bịa đặt, mô hình đã từ chối cung cấp những mã ISBN chưa được kiểm chứng. Sau đó, nó khuyên người hỏi tra cứu tại Thư viện Quốc gia hoặc trong các mục lục thư viện. Đây là một tiến bộ thật sự, nhưng mới chỉ giải quyết được một phần vấn đề. Nguy hiểm không nằm ở những chủ đề quá mù mờ, như gốm Bát Tràng, nơi mô hình gần như không có dữ liệu để dựa vào. Nguy hiểm nằm ở vùng lưng chừng: những cuốn sách ít người biết, nhưng vẫn đủ quen để mô hình tiếp tục trả lời, đồng thời đủ lạ để nó phải tự bịa thêm. Chính ở vùng đó, những mã ISBN bịa đặt nhưng được trình bày rất tự tin đã xuất hiện.

Vì sao tên riêng, số liệu và nguồn dẫn dễ sai

Các lỗi thường xuất hiện ở tên riêng, ngày tháng, câu trích, số liệu, nguồn dẫn và các mã định danh như ISBN hoặc đường link là có lý do. Với những bài báo nổi tiếng, các chi tiết của chúng đã xuất hiện rất nhiều lần trong dữ liệu mà mô hình học từ đó. Vì vậy, phần chữ nghe có vẻ hợp lý thường cũng chính là phần chữ đúng. Nhưng với mã ISBN của một cuốn sách ít người biết, mô hình có thể chưa từng thấy mã đó bao giờ. Khi ấy, với mô hình, một chữ số nghe hợp lý cũng không khác nhiều so với một chữ số đúng. Nó không có ký ức chắc chắn rằng mình đã từng thấy đúng con số này, nên cũng không biết rằng mình đang đoán một thứ chưa từng có trong dữ liệu. Mô hình chỉ làm điều nó vẫn làm: tạo ra chuỗi ký tự có vẻ đúng nhất rồi trình bày như thể rất chắc chắn. Đây không phải là lười biếng hay lỗi hệ thống. Đó là cách một cỗ máy đoán chữ hoạt động, nhất là ở những chỗ mà "nghe có lý" và "đúng sự thật" không còn trùng nhau.

Cái bẫy: AI nói chắc không có nghĩa là AI biết chắc

"Nếu AI trả lời một cách bình tĩnh, chi tiết, và tự tin, thì hẳn AI đang nắm chắc vấn đề; mà nếu không nắm chắc, hẳn AI đã nói vậy." Cả hai vế đều sai. Cái giọng tự tin là lối viết mà hệ thống tạo ra mỗi lần, sinh ra theo cùng một kiểu cho dữ kiện bịa cũng như cho dữ kiện thật. Và thường thì hệ thống sẽ không tự khai rằng một chi tiết nào đó lung lay, bởi hệ thống không phân biệt được chi tiết nào lung lay. Nghe cho chắc và nói cho đúng là hai kỹ năng khác nhau, và mô hình mới chỉ thành thạo nhuần nhuyễn đúng cái thứ nhất.

Tự thử: kiểm tra một câu trả lời thật cụ thể

Bạn vừa xem phần thử nghiệm, giờ hãy tự làm một phép thử của riêng mình. Hãy hỏi trợ lý một câu thật cụ thể, có thể kiểm chứng được, nằm trong một mảng thông tin rất chi tiết và ít người biết. Ví dụ, bạn có thể yêu cầu kể tên ba cuốn sách ít nổi tiếng về một sở thích bạn yêu thích, kèm tác giả, nhà xuất bản, năm xuất bản và mã ISBN. Hoặc bạn có thể yêu cầu một câu trích từ một bài phát biểu cụ thể, kèm đúng ngày câu đó được nói ra. Hãy để ý xem câu trả lời trông gọn gàng, tự tin và đáng tin đến mức nào. Sau đó, hãy kiểm tra lại. Với mã ISBN, bạn thậm chí không cần đến thư viện. Các trang kiểm tra chữ số ISBN miễn phí trên mạng có thể tính đúng phép kiểm tra đó, và một mã bịa sẽ bị phát hiện ngay. Với các thông tin còn lại, hãy xác nhận từng tựa sách, tác giả và ngày tháng bằng một nguồn độc lập, đáng tin cậy, chẳng hạn mục lục thư viện, trang của nhà sách hoặc chính tạp chí có liên quan. Cũng cần lưu ý rằng nếu trợ lý của bạn đang bật tính năng tìm kiếm web trực tiếp, nó có thể âm thầm tra cứu và trả lời đúng. Điều đó cũng chính là điểm quan trọng của bài học này. Dù việc kiểm chứng do mô hình làm hay do bạn tự làm, vẫn phải có ai đó kiểm chứng. Chỉ cần làm một lần, bạn sẽ nhớ bài học này: một câu trả lời được viết trơn tru và bóng bẩy không cho bạn biết nó có đúng hay không.

Vì sao bạn phải kiểm chứng trước khi dùng

Nếu bạn từng dán câu trả lời của AI vào email, báo cáo, câu hỏi y tế, ghi chú pháp lý hoặc bài tập ở trường mà không kiểm tra lại, thì bạn đang tự chịu trách nhiệm cho những thông tin mà AI có thể đã bịa ra rất tự tin. Đây không chỉ là chuyện giả định. Năm 2023, trong một vụ án ở New York, hai luật sư đã bị phạt vì nộp một bản tóm tắt có trích dẫn sáu phán quyết không hề tồn tại. Tất cả đều do ChatGPT tạo ra, với giọng văn chắc chắn như thể đó là luật thật. Chỉ cần bỏ ra vài phút để kiểm tra tên, con số và nguồn trích dẫn, bạn có thể tránh được một sai lầm tốn kém, đáng xấu hổ, hoặc còn nghiêm trọng hơn. Điều này không có nghĩa là AI vô dụng. Ngược lại, công cụ này rất hữu ích, thậm chí cực kỳ hữu ích. Nhưng cách dùng đúng vẫn là cách cũ: có thể tin, nhưng phải kiểm chứng. Hãy tận dụng sự trôi chảy của AI, nhưng luôn để con người giám sát những phần quan trọng. Chương tiếp theo sẽ chuyển từ một mô hình tự tin dù sai sang một mô hình sai vì quá muốn làm vừa lòng người dùng, đó là thói quen âm thầm của trợ lý khi nói cho bạn nghe điều bạn muốn nghe.

Nguồn

Survey of Hallucination in Natural Language Generation
Nền cho thuật ngữ ảo giác, khảo sát nằm sau luận điểm của chương rằng giới nghiên cứu coi đầu ra trôi-chảy-mà-sai là một kiểu hỏng phổ biến, có sẵn trong thiết kế.
Fabrication and errors in the bibliographic citations generated by ChatGPT
Nguồn cho những con số của chương: một ChatGPT đời cũ bịa ra 55% số trích dẫn trong khi một bản mới hơn hạ con số ấy xuống 18%.
Mata v. Avianca, Inc.: sanctions for fabricated, AI-generated case citations
Hồ sơ tòa án nằm sau lời cảnh báo đời thực của chương: hai luật sư ở New York bị phạt vì nộp sáu phán quyết tòa án mà ChatGPT bịa ra.
CHÚ THÍCH
  1. 1.
    William H. Walters và Esther Isabelle Wilder, "Fabrication and errors in the bibliographic citations generated by ChatGPT," Scientific Reports 13, 14045 (2023). Qua 636 trích dẫn trong các bài điểm tài liệu do ChatGPT tạo ra trên 42 chủ đề, 55% số trích dẫn của GPT-3.5 và 18% số trích dẫn của GPT-4 là bịa (không hề tồn tại).
  2. 2.
    Mata kiện Avianca, Inc., 678 F. Supp. 3d 443 (S.D.N.Y. 2023). Ngày 22/6/2023, thẩm phán P. Kevin Castel phạt các luật sư Steven A. Schwartz và Peter LoDuca, cùng công ty luật của họ, khoản 5.000 đô la sau khi họ nộp một bản tóm tắt trích dẫn sáu phán quyết tòa án không tồn tại do ChatGPT tạo ra.