Vấn đề Lost in the Middle của các hệ thống RAG

AI
Author

Thang V. Pham

Published

September 12, 2026

Khóa luận nghiên cứu hiện tượng Lost in the Middle (LITM) trong các hệ thống truy xuất tăng cường (Retrieval-Augmented Generation - RAG), hiện tượng mô hình ngôn ngữ suy giảm hiệu suất khi thông tin quan trọng nằm ở khu vực giữa của ngữ cảnh dài. Mặc dù RAG giúp truy xuất các tài liệu liên quan để hỗ trợ sinh câu trả lời, việc kết hợp nhiều đoạn văn bản trong cùng một ngữ cảnh vẫn có thể ảnh hưởng đến khả năng khai thác thông tin theo vị trí của mô hình. Mục tiêu của đề tài là đánh giá mức độ ảnh hưởng của hiện tượng này, đồng thời so sánh hiệu quả giữa kiến trúc RAG và phương pháp xử lý ngữ cảnh dài trực tiếp (Long-Context Inference - LC) trong điều kiện tài nguyên tính toán hạn chế.

Hệ thống thực nghiệm được xây dựng trên môi trường cục bộ với giới hạn 8GB VRAM, sử dụng dữ liệu kế thừa từ LaRA Benchmark. Quy trình đánh giá được thiết kế lại với cơ chế Oracle Evidence Selection, chia văn bản thành 10–20 phân đoạn để kiểm soát vị trí thông tin, kết hợp bộ lọc chống rò rỉ đáp án nhằm đảm bảo tính khách quan. Hai nhóm tác vụ được lựa chọn gồm Định vị (Location) và Suy luận (Reasoning), cùng chiến lược đánh giá lai (Hybrid Evaluation) kết hợp giữa đánh giá tự động và LLM-as-a-Judge. Thực nghiệm được tiến hành trên các mô hình Gemma4:e4b, Qwen2.5:3b và GPT-OSS:120b-cloud với các mức ngữ cảnh 32k và 128k token.

Kết quả cho thấy hiện tượng LITM vẫn xuất hiện trong kiến trúc LC, kể cả trên các mô hình quy mô lớn, với xu hướng hiệu suất suy giảm khi thông tin quan trọng nằm ở vùng giữa của ngữ cảnh. Trong khi đó, RAG giúp giảm đáng kể ảnh hưởng của thiên kiến vị trí nhờ giới hạn đầu vào ở các bằng chứng liên quan, từ đó cải thiện độ ổn định và độ tin cậy của hệ thống khi xử lý văn bản dài.

Từ khóa: Lost in the Middle; truy xuất tăng cường; xử lý ngữ cảnh dài; xô hình ngôn ngữ lớn; môi trường cục bộ.

Đinh Công Tú, tóm tắt khóa luận tại Trường Đại học Công nghệ, Đại học Quốc gia Hà Nội, 2026