learningai.vn
VI
Phần 3 · Chương 10

Khi Đoạn Chat Rối: Tóm Tắt, Làm Lại, Rồi Cải Thiện Từng Vòng

Thời gian đọc: 11 phút

Đoạn chat dài không có nghĩa là mô hình hiểu hơn. Khi cần, hãy tóm tắt điều quan trọng rồi bắt đầu một chat mới.

Trong một cuộc trò chuyện dài, sẽ có lúc AI bắt đầu trả lời kém thông minh hơn. Nó có thể quên một quyết định bạn đã đưa ra từ hai mươi tin nhắn trước. Nó có thể đề xuất lại một ý tưởng bạn đã loại bỏ. Nó cũng có thể trả lời câu hỏi của vài lượt trước thay vì câu hỏi hiện tại. Khi đó, phản ứng tự nhiên của nhiều người là tiếp tục giải thích, thêm chi tiết và đưa thêm ngữ cảnh với hy vọng AI sẽ hiểu đúng. Nhưng cách làm này thường không hiệu quả. Cuộc trò chuyện trở nên rối không phải vì AI có quá ít thông tin, mà vì nó đang phải xử lý quá nhiều thông tin. Cách xử lý tốt hơn là giảm bớt, không phải thêm vào. Kỹ năng quan trọng trong chương này là biết khi nào nên bắt đầu lại, biết phần nào cần giữ lại, và biết cách biến một lần thử may mắn thành một bước tiến rõ ràng để tạo ra kết quả thật sự hữu ích.

Vì sao chat càng dài càng dễ lệch hướng

Hãy nhớ lại tấm bảng trắng ở Chương 8, nơi ghi tất cả những gì mô hình được phép biết. Khi một cuộc trò chuyện kéo dài, người ta cứ thêm thông tin lên tấm bảng đó: một ý mới ở chỗ này, một chỉnh sửa ở chỗ kia, rồi cả những đoạn lạc đề từng có vẻ quan trọng. Dần dần, tấm bảng trở thành một mảng chữ chồng chéo và chật kín. Điều thật sự quan trọng bị vùi ở đâu đó giữa đống chữ ấy, đến mức rất khó tìm ra. Tấm bảng không trở nên thông minh hơn khi có nhiều chữ hơn. Nó chỉ trở nên rối và chật hơn.

Cái tấm bảng ấy có một cái tên bạn đã gặp: cửa sổ ngữ cảnh, đúng một khoảng trống có hạn mà mọi câu hỏi, câu trả lời và đoạn văn dán vào trong một đoạn chat đều phải chia nhau. Khi nó đầy lên, khả năng của mô hình nhớ lại và dùng những chi tiết trước đó lặng lẽ nhạt đi, đúng cái context rot bạn đã biết. Điều đáng kể ở đây là một sự trượt dần, không phải một vách đá dựng đứng: đoạn chat không vỡ trong một khoảnh khắc kịch tính, nó chỉ trôi dạt, câu trả lời này qua câu trả lời khác, từ sắc bén sang mù mờ, thường chẳng có dấu hiệu rõ ràng nào báo rằng có gì đó không ổn.

Thêm vào đó là hiệu ứng thứ hai đã nói ở chương trước: trong một ngữ cảnh dài, những thông tin nằm ở phần đầu hoặc phần cuối thường được dùng tốt hơn, còn những thông tin nằm ở giữa dễ bị bỏ sót. Đây là vấn đề "lạc ở khúc giữa". Một tấm bảng ngắn tránh được vấn đề này, vì nó không có phần giữa quá dài để thông tin bị chôn vùi. Khi kết hợp hai ý này, bài học chính của chương trở nên rõ ràng: kích thước của tấm bảng có thể đang gây bất lợi cho bạn, và một tấm bảng nhỏ hơn thường là lựa chọn thông minh hơn.

Cách làm lại: giữ ý chính, mở đoạn chat mới

Vậy bạn nên làm gì khi tấm bảng đã đầy? Đừng tìm một tấm bảng lớn hơn. Hãy dừng lại, ghi ba ý quan trọng nhất sang một tấm bảng sạch, xóa những phần còn lại, rồi tiếp tục. Trong một đoạn chat cũng vậy. Khi cuộc trò chuyện bắt đầu chậm lại hoặc trở nên rối, việc nên làm là tóm tắt những ý chính, rồi bắt đầu lại từ đó.

Cách làm trong thực tế là như sau. Khi cuộc trò chuyện bắt đầu rối và kém hiệu quả, hãy viết một bản tóm tắt ngắn về những điểm quan trọng: các quyết định đã thống nhất, các thông tin cần giữ lại và mục tiêu đang hướng tới. Sau đó, dán bản tóm tắt này vào một cuộc trò chuyện mới. Chỉ cần như vậy. Bạn giữ lại phần cốt lõi và bỏ đi phần lộn xộn. Cuộc trò chuyện mới bắt đầu như trên một trang giấy sạch, chỉ có những ý chính cần thiết, không còn các nhánh đã bỏ, các bản nháp không dùng nữa hay phần trao đổi dài dòng khiến ý hay bị chìm mất. Vì chỉ chứa những điểm quan trọng, cuộc trò chuyện mới giúp mô hình ít hiểu nhầm hơn và ít bị phân tâm hơn. Bạn không làm cho mô hình thông minh hơn, bạn chỉ đưa cho cùng một mô hình một ngữ cảnh sạch hơn.

Việc này thuộc về một kỹ năng bạn có thể đã biết: kỹ thuật ngữ cảnh. Đó là cách chủ động chọn nội dung nào được đưa vào cửa sổ ngữ cảnh có giới hạn, thay vì để cuộc trò chuyện tự chất đầy bằng mọi thứ tình cờ xuất hiện. Thao tác làm lại cũng chính là kỹ năng đó, nhưng được áp dụng cho toàn bộ cuộc trò chuyện thay vì chỉ cho một prompt riêng lẻ. Bạn đang chỉnh sửa và tổ chức một đoạn chat đang tiếp diễn, chứ không chỉ viết một tin nhắn hay. Bạn không cần dùng thuật ngữ mới để áp dụng cách này. Chỉ cần nhớ rằng những gì xuất hiện trước mắt mô hình là một nguồn lực do bạn kiểm soát, và việc chọn lọc, biên soạn chúng sẽ hiệu quả hơn nhiều so với việc giữ lại tất cả.

cuộc trò chuyện dài
ngữ cảnh dài và rối
chuyển phần cần giữ
cuộc trò chuyện mới
bỏ phần không cần giữ
ngữ cảnh mới, tập trung
Khi một cuộc trò chuyện dài trở nên rối, hãy tóm tắt những thông tin cần giữ trong một cuộc trò chuyện mới. Sau đó tiếp tục cải thiện kết quả theo từng vòng, dựa trên bản tóm tắt đó.

Cải thiện theo vòng: tạo nhiều phương án, chọn bản tốt nhất, làm tiếp

Cách làm lại giúp sửa một cuộc trò chuyện đã đi sai hướng. Còn kỹ thuật lặp vòng giúp bạn chủ động cải thiện cuộc trò chuyện ngay từ đầu, theo cùng một logic như tấm bảng. Ở mỗi vòng, bạn viết ra vài ý, chọn ý tốt nhất, rồi dùng ý đó làm điểm bắt đầu cho vòng tiếp theo. Cứ đưa ra nhiều phương án, chọn phương án tốt nhất, rồi tiếp tục lặp lại.

Cụ thể, thay vì hỏi một lần rồi hy vọng nhận được một câu trả lời hoàn hảo, bạn hãy yêu cầu vài phương án khác nhau. Sau đó, bạn chọn phương án tốt nhất và dùng nó làm nền cho prompt tiếp theo. Từ phương án đã chọn, bạn tiếp tục yêu cầu những biến thể mới tốt hơn. Cứ lặp lại như vậy, bạn chủ động đưa phần nội dung tốt nhất trở lại vào quá trình làm việc. Đây chính là mẹo quan trọng nhưng thường ít được chú ý. Bạn không trông chờ vào một lần may mắn, mà đang dần tạo ra ngữ cảnh tốt hơn sau mỗi vòng. Ở mỗi lần thử mới, bạn đưa cho mô hình kết quả tốt nhất hiện có để làm điểm khởi đầu. Các mô hình rất giỏi trong việc phát triển tiếp từ một ví dụ cụ thể mà bạn đưa ra. Vì vậy, việc lặp lại nhiều vòng biến thế mạnh này thành một phương pháp: dùng kết quả thắng ở vòng trước làm hạt giống cho vòng sau.

Có một thói quen rất hữu ích cần nhắc đến, vì nó giúp xử lý lý do phổ biến nhất khiến nhiều người không muốn thử lại nhiều lần: mình không biết phải hỏi thế nào để nhận được kết quả mình muốn. Khi bạn chưa biết cách viết yêu cầu cho rõ, bạn có thể nhờ AI giúp viết chính yêu cầu đó. Cách dùng AI để soạn hoặc chỉnh prompt được gọi là meta-prompting. Nói đơn giản, bạn mô tả điều mình muốn đạt được, nhờ AI viết một prompt tốt hơn cho mục tiêu đó, rồi dùng prompt ấy để chạy tiếp. Đây là một vòng lặp nhỏ giúp cải thiện vòng lặp lớn.

Mỗi vòng nên chọn: tìm hướng mới hay tinh chỉnh hướng cũ

Khi bạn làm việc theo nhiều vòng lặp, bạn sẽ thấy mỗi vòng đều buộc bạn đưa ra một quyết định nhỏ, dù bạn có nhận ra hay không. Bạn muốn yêu cầu thêm nhiều phương án mới và khác biệt, hay muốn lấy câu trả lời tốt nhất hiện có rồi cải thiện nó? Đây là hai cách làm khác nhau. Khám phá nghĩa là tìm thêm những phương án mới, đa dạng hơn, mở rộng phạm vi để có thể bắt gặp điều bạn chưa nghĩ tới. Khai thác nghĩa là chọn phương án mạnh nhất đang có rồi chỉnh sửa, tinh luyện và làm cho nó tốt hơn. Vì vậy, làm việc theo vòng lặp hiệu quả là biết ở mỗi vòng mình nên khám phá hay khai thác. Hãy khám phá ở giai đoạn đầu, khi bạn còn đang tìm hướng đi đúng. Hãy khai thác ở giai đoạn sau, khi bạn đã tìm được hướng tốt và muốn làm cho nó thật sắc bén.

Bạn có thể điều chỉnh việc mô hình tạo ra câu trả lời đa dạng hay lặp lại. Ở Chương 4, bạn đã gặp thiết lập temperature. Khi tăng temperature, mô hình sẽ mạnh dạn hơn và đưa ra nhiều phương án hơn. Khi giảm temperature, mô hình sẽ chọn cách an toàn hơn. Nếu bạn có thể chỉnh thiết lập này, thì nó giống như một cách điều khiển tự động cho lựa chọn mà bạn đang làm thủ công: tăng độ đa dạng khi muốn khám phá nhiều ý tưởng, rồi giảm độ đa dạng khi muốn tập trung vào phương án tốt nhất.

Vì sao chat dài không có nghĩa là AI hiểu bạn hơn

Ở đây có một niềm tin nghe có vẻ hợp lý nhưng lại âm thầm gây hại: "Trò chuyện với AI càng lâu thì AI càng hiểu mình hơn, vì vậy mình nên giữ mọi thứ trong một đoạn chat thật dài." Phần sai nằm ở ý cuối: giữ tất cả lượt trao đổi trong cùng một cuộc trò chuyện không có điểm dừng. Điều này nghe giống như khi nói chuyện với một người bạn quen lâu năm, bạn không cần giải thích lại nhiều. Nhưng như bạn đã thấy ở chương nói về trí nhớ của AI, mô hình không thật sự xây dựng một mối quan hệ lâu dài dựa trên toàn bộ đoạn chat đó. Nó chỉ đang đọc lại một "tấm bảng" ngày càng dài và ngày càng khó theo dõi sau mỗi dòng bạn thêm vào. Khi bạn nhồi quá nhiều chữ vào cùng một cuộc trò chuyện, không gian làm việc có giới hạn của mô hình sẽ bị chật hơn. Điều này có thể làm câu trả lời kém đi, khiến những chi tiết quan trọng bị lẫn mất, đặc biệt là các thông tin nằm ở phần giữa cuộc trò chuyện. Vì vậy, cách làm khôn ngoan thường không phải là tích trữ mọi thứ, mà là tóm tắt những điểm quan trọng rồi bắt đầu một cuộc trò chuyện mới, gọn gàng hơn.

Tự thử: lặp nhiều vòng để làm kết quả sắc hơn

Hãy chọn một việc cần một câu trả lời sáng tạo, chẳng hạn như viết khẩu hiệu cho một dự án phụ, viết tiêu đề cho một email bạn cứ trì hoãn, hoặc đặt tựa cho một bài blog. Vòng 1: yêu cầu năm phương án, rồi chọn phương án bạn thích nhất. Vòng 2: dán lại phương án đã chọn vào đoạn chat và nói: "Mình thích cái này. Hãy cho mình năm biến thể mới dựa trên nó." Sau đó, bạn lại chọn phương án hay nhất và tiếp tục thêm một vòng như vậy. Hãy quan sát cách các phương án ngày càng sắc nét hơn khi bạn đưa lựa chọn của mình trở lại cuộc trò chuyện. Chúng sẽ bớt lan man và dần tập trung vào một kết quả nghe giống phong cách của bạn hơn. Đó là quá trình lặp lại và cải thiện từng bước, trong đó bạn điều hướng kết quả chỉ bằng những lựa chọn của mình.

Nếu muốn chắc hơn, hãy thử làm lại từ đầu. Mở một cuộc trò chuyện mới, rồi dán vào đó bản tóm tắt khoảng hai dòng về những gì bạn đã quyết định và điều bạn muốn làm tiếp theo. Như vậy, mô hình chỉ nhận phần quan trọng nhất trong một ngữ cảnh mới, không bị rối bởi những đoạn trao đổi dài dòng trước đó.

Các lần chạy thật, gpt-5.5:
Vòng 1:
PROMPT
Cho mình năm khẩu hiệu ngắn gọn, bắt tai cho một ứng dụng giúp lên thực đơn bữa cơm cuối tuần cho gia đình.
gpt-5.5
  1. Cuối tuần ngon, cả nhà vui!
  2. Lên mâm dễ, sum vầy mê!
  3. Thực đơn hay, cuối tuần đầy vị!
  4. Chọn món nhanh, bữa nhà đậm đà!
  5. Cơm cuối tuần, ấm trọn yêu thương!
Vòng 2:
PROMPT
Mình thích cái thứ hai. Cho mình năm biến thể mới dựa trên nó.
gpt-5.5
  1. Lên mâm nhanh, cả nhà mê!
  2. Lên mâm dễ, bữa nhà mê!
  3. Lên mâm vui, sum vầy ngon!
  4. Lên mâm gọn, sum vầy trọn!
  5. Lên mâm hay, cuối tuần say!

Nhìn vào những gì đã xảy ra ở vòng hai. Đây là giai đoạn khai thác trong thực tế: bạn đã tìm được câu đáng giữ, nên mọi phương án tiếp theo đều tập trung làm sắc nét "Lên mâm dễ, sum vầy mê!". Mỗi phiên bản chỉ là một cách đánh bóng hơi khác cho câu đã thắng, chứ không phải một ý tưởng mới. Đó chính là điều bạn cần khi đã chốt được một hướng. Khi đưa lựa chọn của bạn trở lại vào quy trình, mô hình không trở nên nhạt hơn. Việc đó chỉ cho mô hình biết rằng nó nên ngừng tìm kiếm hướng mới và bắt đầu tinh chỉnh. Sự hội tụ có chủ đích này cho thấy vòng lặp đang hoạt động đúng.

Từ chật vật đến chủ động điều khiển AI

Đây là điểm khác nhau giữa việc chật vật với một công cụ và thật sự điều khiển được nó. Khi bạn biết lúc nào nên làm lại và biết cách lặp lại từng bước, một cuộc trò chuyện dài dòng và gây bực bội sẽ không còn là bức tường cản đường bạn. Nó trở thành con đường nhanh hơn để tạo ra một bản nháp có thể dùng được, dù bạn đang đặt tên sản phẩm, lên kế hoạch cho một sự kiện hay chỉnh sửa một email khó viết. Bản thân mô hình không thay đổi. Điều thay đổi là cách bạn dùng nó. Bạn không còn gom thật nhiều chữ một cách lộn xộn, mà bắt đầu quản lý thông tin: cắt bớt phần thừa khi cuộc trò chuyện quá đầy, chỉ giữ lại những gì quan trọng, rồi xây tiếp từ phiên bản tốt nhất hiện có. Đó là cách xử lý ngữ cảnh có chủ đích, thay vì phó mặc cho may rủi. Khi bạn đã kiểm soát được những gì mô hình nhìn thấy, bước tiếp theo là để mô hình bắt đầu hành động trong thế giới thật, biến chatbot thành một trợ lý có thể làm việc thay bạn. Đó cũng là nơi phần tiếp theo bắt đầu.

Nguồn

Effective context engineering for AI agents
Nguồn cho cái kỷ luật được chương này gọi tên là kỹ thuật ngữ cảnh: chủ đích biên soạn cái gì đi vào cửa sổ có hạn thay vì để một đoạn chat chất lên bất cứ thứ gì tình cờ dồn tới.
Lost in the Middle: How Language Models Use Long Contexts
Nghiên cứu nằm sau luận điểm lạc-ở-khúc-giữa của chương: các mô hình dùng tốt những dữ kiện ở đầu hoặc cuối một ngữ cảnh dài nhưng hay đánh mất những cái mắc kẹt ở khúc giữa.
Context Rot: How Increasing Input Tokens Impacts LLM Performance
Báo cáo nằm sau luận điểm context rot của chương: độ chính xác của một đoạn chat lặng lẽ nhạt đi khi nó dài ra, trôi dạt từ sắc bén sang mù mờ thay vì vỡ tan trong một lần.
Defeating Nondeterminism in LLM Inference
Phần kỹ thuật sâu hơn về vì sao cùng một câu hỏi có thể cho những câu trả lời khác nhau, cái tính khó đoán mà chương này buộc vào thiết lập temperature nằm sau sự đa dạng của một mô hình.
The Curious Case of Neural Text Degeneration
Phần nền về cách thiết lập temperature nhào nặn lựa chọn từ của một mô hình, đúng thiết lập mà chương này bảo bạn vặn lên để khám phá và hạ xuống để khai thác.
Language Models are Few-Shot Learners (GPT-3)
Công trình nền tảng về cách các mô hình dựng tiếp trên những ví dụ bạn đặt trước mặt chúng, đúng cái thế mạnh mà kỹ thuật lặp vòng của chương biến thành một phương pháp có chủ đích.
Survey of Hallucination in Natural Language Generation
Phần đọc thêm về cách văn bản sinh ra có thể trôi dạt và đi sai, cái kiểu mù mờ mà những nước cờ làm lại và lặp vòng của chương nhằm đẩy lùi.
CHÚ THÍCH
  1. 1.
    Kelly Hong và cộng sự, "Context Rot: How Increasing Input Tokens Impacts LLM Performance," Chroma Research (2025), https://research.trychroma.com/context-rot. Đánh giá 18 mô hình ngôn ngữ lớn, báo cáo thấy các mô hình không dùng ngữ cảnh của mình một cách đồng đều và rằng hiệu năng ngày càng kém tin cậy khi độ dài đầu vào tăng lên, với độ chính xác giảm ngay cả trên những tác vụ truy hồi và chép-lại-từ đơn giản.
  2. 2.
    Nelson F. Liu và cộng sự, "Lost in the Middle: How Language Models Use Long Contexts," Transactions of the Association for Computational Linguistics (2024), https://aclanthology.org/2024.tacl-1.9/. Nghiên cứu thấy hiệu năng cao nhất khi thông tin liên quan nằm ở đầu hoặc cuối đầu vào và suy giảm đáng kể khi mô hình phải truy hồi nó từ khúc giữa, một đường cong hình chữ U dai dẳng ngay cả ở những mô hình được dựng cho ngữ cảnh dài.