Sự phổ biến của các mô hình ngôn ngữ lớn (LLM) với cửa sổ ngữ cảnh (context window) ngày càng mở rộng đã củng cố một ngộ nhận phổ biến: việc tải lên một tài liệu dài (như báo cáo hàng chục, hàng trăm trang) đồng nghĩa với việc AI đã "đọc" và "thấu hiểu" toàn bộ tài liệu từ trang đầu đến trang cuối.
Tuy nhiên, các phân tích thực nghiệm về khả năng đọc hiểu văn bản của AI cho thấy một bức tranh khác. Sự hiện diện của tài liệu trong ngữ cảnh không đảm bảo rằng mọi bằng chứng (evidence) bên trong đều được nhận diện, duy trì và liên kết chính xác. Thách thức này xuất phát từ ba điểm nghẽn cốt lõi:
- Biểu diễn dữ liệu (representation)
- Chọn lọc thông tin (selection)
- T tích hợp bằng chứng xuyên trang (evidence integration)
1. Điểm nghẽn thứ nhất: Thách thức về biểu diễn dữ liệu (Representation)
Quá trình xử lý tài liệu khoa học và kỹ thuật không chỉ đơn thuần là bóc tách văn bản thô (text extraction). Các tài liệu nghiên cứu thường chứa đựng lượng thông tin phi văn bản dày đặc bao gồm bảng biểu, sơ đồ, hình ảnh, chú thích và cấu trúc định vị không gian.
Các kết quả thực nghiệm chỉ ra sự khác biệt rõ rệt về độ chính xác tùy thuộc vào phương thức tiếp cận dữ liệu:
- Định dạng thị giác đơn thuần (Vision-only): Đạt độ chính xác trung bình 45,6%.
- Kết hợp Văn bản, Bố cục và Thị giác (Text + Layout + Vision): Độ chính xác tăng lên 52,5%.
Điều này cho thấy tính bổ trợ tương hỗ giữa các thành phần. Trình phân tích văn bản (parser) có ưu thế trong việc trích xuất ký tự nhưng lại làm mất đi cấu trúc thị giác quan trọng; ngược lại, việc xử lý toàn trang PDF giữ nguyên được bố cục không gian nhưng dễ làm bỏ sót các chi tiết chữ kích thước nhỏ. Do đó, bài toán tiên quyết không chỉ nằm ở năng lực suy luận của mô hình, mà là việc mô hình đã thực sự "nhìn thấy" chính xác dạng thức thông tin cần thiết hay chưa.
2. Điểm nghẽn thứ hai: Cơ chế chọn lọc và tỷ lệ thu hồi bằng chứng (Selection & Recall)
Một yếu tố mang tính quyết định khác là khả năng trích xuất chính xác các trang chứa bằng chứng cốt lõi. Dữ liệu thực nghiệm chứng minh rằng hệ quả của việc thiếu sót bằng chứng nguy hiểm hơn rất nhiều so với việc dư thừa thông tin nhiễu:
- Khi cung cấp đầy đủ các trang chứa bằng chứng cần thiết: Độ chính xác của mô hình đạt 38,6%.
- Nếu bỏ sót chỉ một trang bằng chứng bắt buộc: Độ chính xác sụt giảm nghiêm trọng xuống mức 16% - 18%.
- Khi có sự xuất hiện của thông tin nhiễu: Trong bài toán chỉ yêu cầu một trang bằng chứng, việc chủ động bổ sung thêm các trang không liên quan chỉ làm giảm nhẹ độ chính xác từ 64,6% xuống 63,1%.
Phát hiện này dẫn đến một nguyên tắc chiến lược trong việc thiết kế hệ thống truy xuất tài liệu: các hệ thống RAG (Retrieval-Augmented Generation) cần đặt ưu tiên hàng đầu cho độ bao phủ (recall) nhằm tránh bỏ sót bằng chứng, thay vì sa đà vào việc cố gắng lọc ra một vài đoạn văn bản hẹp được cho là phù hợp nhất.
3. Điểm nghẽn thứ ba: Hạn chế trong tích hợp bằng chứng xuyên trang (Evidence Integration)
Thách thức lớn nhất đối với các tác vụ phân tích tài liệu chuyên sâu không nằm ở độ dài của ngữ cảnh, mà nằm ở khả năng tổng hợp thông tin phân tán.
- Tác vụ đơn trang (Single-page): Khi câu trả lời chỉ phụ thuộc vào thông tin trên một trang duy nhất, mô hình đạt độ chính xác 64,6%.
- Tác vụ đa trang (Multi-page): Khi câu hỏi yêu cầu liên kết thông tin rải rác từ hai trang trở lên, độ chính xác giảm mạnh xuống còn 38,6%, mặc dù toàn bộ các mảnh bằng chứng cần thiết đều nằm trọn vẹn trong giới hạn cửa sổ ngữ cảnh.
Điều này chứng minh rằng việc mô hình "nhìn thấy" từng mảnh dữ liệu riêng lẻ không đồng nghĩa với việc nó có khả năng tự động khâu nối chúng lại thành một lập luận hoàn chỉnh. Đây là lỗi tích hợp bằng chứng (evidence integration failure) điển hình.
Ảnh hưởng của quy mô mô hình và phương pháp suy luận
- Mở rộng quy mô (Scaling): Khi nâng cấp lên các mô hình lớn hơn (ví dụ: biến thể 32B), độ chính xác đối với câu hỏi đa trang cải thiện lên 46,4%. Tuy nhiên, khoảng cách hiệu suất giữa tác vụ đơn trang và đa trang vẫn tồn tại.
- Chuỗi suy luận có cấu trúc (Chain-of-Thought - CoT): Việc định hướng mô hình thực hiện quá trình suy luận theo từng bước đã nâng độ chính xác từ 38,6% lên 44,9%, đồng thời thu hẹp đáng kể khoảng cách hiệu suất giữa hai dạng tác vụ. Điều này gợi ý rằng cấu trúc tổ chức bằng chứng và cách thức ép mô hình thực thi quy trình tổng hợp đóng vai trò quan trọng không kém năng lực phần cứng thuần túy.
4. Hàm ý phương pháp luận cho việc ứng dụng AI trong nghiên cứu
Từ các góc nhìn thực nghiệm trên, cách thức tiếp cận và thiết kế quy trình xử lý tài liệu dài (như systematic reviews, guideline y khoa, báo cáo kỹ thuật) bằng AI cần được cấu trúc lại một cách bài bản thay vì chỉ phụ thuộc vào thao tác upload trực quan:
- Kiểm soát biểu diễn dữ liệu: Đảm bảo tài liệu được chuyển đổi với đầy đủ cấu trúc, văn bản, bảng biểu và không gian thị giác.
- Ưu tiên độ bao phủ thông tin: Xây dựng chiến lược truy xuất rộng (broad retrieval) nhằm bảo đảm không bỏ sót các trang chứa bằng chứng trọng yếu.
- Thúc đẩy suy luận có cấu trúc: Chia nhỏ các nhiệm vụ phức tạp thành chuỗi thao tác: xác định bằng chứng $\rightarrow$ kiểm tra chéo $\rightarrow$ tổng hợp và suy luận từng bước.
5. Kết luận
Sự thành công trong việc tải lên một tài liệu cồng kềnh không đồng nghĩa với sự thành công trong quá trình đọc hiểu. Khả năng xử lý kỹ thuật của LLM với PDF là một chuyện, nhưng việc nhận diện đúng, nhìn đủ và ghép nối chính xác các bằng chứng phân tán lại là một năng lực hoàn toàn khác đòi hỏi quy trình kiểm soát chặt chẽ từ phía người sử dụng.


