Ảnh minh hoạ bởi Unsplash
Vài tuần trước, giám đốc nhân sự (HR) của công ty tôi đến gặp tôi với vẻ mặt vô cùng mệt mỏi: "Mỗi ngày chị phải trả lời hàng chục tin nhắn của nhân viên hỏi về quy trình xin nghỉ phép, chính sách bảo hiểm, quy định công tác phí... Chị muốn dùng ChatGPT để nó tự động trả lời thay chị. Nhưng khi chị hỏi nó 'Chính sách thai sản của công ty XYZ là gì?', nó trả lời sai bét và chém gió linh tinh. Tại sao nó thông minh như thế mà lại không biết?".
Tôi mỉm cười và trả lời: "Bởi vì nó chưa bao giờ đọc Sổ tay nhân viên của công ty mình cả. Cuốn sổ đó nằm bí mật trong máy tính của chị, chứ không có trên mạng Internet để nó học."
Đó chính là giới hạn lớn nhất của các mô hình ngôn ngữ khổng lồ (LLMs). Chúng sở hữu một lượng kiến thức khổng lồ về lịch sử, toán học, lập trình... được huấn luyện từ toàn bộ dữ liệu công khai trên Internet tính đến một thời điểm cắt (Cut-off date) nhất định. Tuy nhiên, chúng lại BỊ MÙ hoàn toàn trước dữ liệu nội bộ (Private Data) của doanh nghiệp bạn - những thứ như hợp đồng mật, báo cáo tài chính quý mới nhất, hay kho tài liệu API nội bộ. Nếu ép chúng trả lời những thứ chúng không biết, chúng sẽ "ảo giác" (Hallucination) và bịa ra câu trả lời nghe cực kỳ thuyết phục để lừa bạn.
Vậy làm sao để bơm kiến thức công ty vào đầu AI mà không cần tốn hàng triệu đô la để huấn luyện lại (Retrain) từ đầu? Giới công nghệ đã tạo ra một cứu cánh tuyệt vời mang tên: RAG (Retrieval-Augmented Generation).
Phần 1: RAG Hoạt Động Như Thế Nào? Giải Ngố Bằng Ví Dụ Đời Thường
Thuật ngữ RAG (Tạo sinh Tăng cường Truy xuất) nghe có vẻ hàn lâm, nhưng bản chất của nó rất đơn giản. Hãy tưởng tượng ChatGPT là một cậu sinh viên cực kỳ thông minh, giỏi ngữ pháp, biết cách diễn đạt trôi chảy, nhưng đang ngồi trong phòng thi (không được nối mạng Internet) và làm bài thi mở (Open-book Exam).
- Không có RAG: Giám thị hỏi: "Quy định bồi thường hợp đồng của dự án Alpha là gì?". Cậu sinh viên vò đầu bứt tai, vì cậu ta chưa từng được học về dự án Alpha. Để giữ thể diện, cậu ta chém gió ra một mức bồi thường bịa đặt. Chuyện này sẽ dẫn đến thảm họa pháp lý.
- Có RAG: RAG chính là một hệ thống thư viện thu nhỏ được lắp đặt ngay bên cạnh cậu sinh viên. Khi nhận câu hỏi, cậu sinh viên không tự trả lời ngay. Cậu ta sẽ nói: "Khoan đã, hãy để tôi tra cứu sách". Hệ thống thư viện sẽ tự động lục lọi trong chồng tài liệu nội bộ, rút ra đúng 3 trang văn bản nói về dự án Alpha, và đặt trước mặt cậu sinh viên. Lúc này, cậu ta chỉ việc đọc 3 trang đó, kết hợp với khả năng diễn đạt lưu loát của mình, để viết ra một câu trả lời hoàn hảo, chính xác 100% dựa trên tài liệu được cung cấp.
Nói một cách kỹ thuật, RAG là sự kết hợp giữa Cỗ máy Tìm kiếm (Search Engine) và Cỗ máy Tạo sinh (Generative AI). Nó lấy thông tin đúng nhất mang về, rồi nhét thông tin đó vào Prompt (Câu lệnh) để ChatGPT đọc và tóm tắt lại cho bạn.
Phần 2: 3 Bước Kỹ Thuật Cốt Lõi Để Xây Dựng Hệ Thống RAG
Để biến hàng ngàn file PDF, Word cứng nhắc thành một kho tri thức cho AI tìm kiếm, chúng ta phải đi qua một đường ống xử lý dữ liệu (Data Pipeline) khá kỳ công:
Bước 1: Băm nhỏ dữ liệu (Chunking)
Bạn không thể ném nguyên một cuốn sách PDF dài 1000 trang vào cửa sổ chat của AI vì nó sẽ vượt quá giới hạn bộ nhớ (Token limit) và làm mô hình mất tập trung. Bạn phải "băm" cuốn sách đó ra thành các đoạn nhỏ (Chunks), mỗi đoạn khoảng một vài đoạn văn (tầm 500 từ). Hãy tưởng tượng bạn đang xé cuốn sách ra thành từng thẻ flashcard nhỏ.
Bước 2: Ma thuật số hóa bằng Nhúng (Embedding)
Máy tính không hiểu tiếng Việt hay tiếng Anh, nó chỉ hiểu những con số. Quá trình Embedding là việc đưa từng mảnh thẻ flashcard ở Bước 1 chạy qua một thuật toán AI, để biến những câu chữ đó thành một chuỗi những con số toán học khổng lồ (Vector).
Sự kỳ diệu của Vector nằm ở chỗ: Nó bắt giữ được Ý NGHĨA Ngữ nghĩa (Semantic Meaning) của câu nói. Ví dụ, câu "Chó sủa gâu gâu" và "Con cún đang sủa" tuy dùng từ vựng hoàn toàn khác nhau, nhưng hệ thống sẽ biến chúng thành hai bộ số Vector nằm rất gần nhau trong không gian đa chiều.
Bước 3: Lưu trữ và Truy xuất bằng Vector Database (Cơ sở dữ liệu Vector)
Toàn bộ hàng triệu thẻ flashcard đã bị biến thành số này sẽ được cất vào một kho lưu trữ đặc biệt gọi là Vector Database (như Pinecone, Qdrant, Chroma).
Khi người dùng đặt câu hỏi: "Bảo hiểm thai sản được nghỉ bao lâu?". Hệ thống cũng sẽ biến câu hỏi này thành Vector. Sau đó nó bay vào kho dữ liệu, tìm kiếm xem Vector của câu hỏi ĐANG NẰM GẦN với Vector thẻ flashcard nào nhất (Semantic Search - Tìm kiếm theo ngữ nghĩa). Nó sẽ bốc đúng thẻ flashcard có chứa đoạn quy định nghỉ sinh con ra, và đẩy cho ChatGPT tổng hợp trả lời.
Phần 3: Tại Sao Tìm Kiếm Bằng RAG Lại Tuyệt Vời Hơn Tìm Kiếm Keyword Truyền Thống?
Trước đây, nếu bạn mở trang web công ty lên và dùng ô tìm kiếm, gõ chữ "Cách lấy lại mật khẩu". Nếu trong hệ thống tài liệu, người viết dùng từ "Khôi phục password", thì máy tính truyền thống (như Ctrl+F) sẽ báo là KHÔNG TÌM THẤY. Tìm kiếm Keyword là tìm kiếm theo kiểu cọ xát đúng từng ký tự vô hồn.
Nhưng với RAG (sức mạnh của Vector Embedding), hệ thống HIỂU RÕ "lấy lại mật khẩu" và "khôi phục password" có cùng một ý nghĩa ngữ cảnh. Nó sẽ lập tức lôi đúng tài liệu đó ra cho bạn. Đây là một cuộc lột xác hoàn toàn cho ngành lưu trữ và quản trị tri thức doanh nghiệp (Knowledge Management).
Phần 4: Chặn Đứng Sự Bịa Đặt (Hallucination) - Quy Tắc Sống Còn
RAG là liều thuốc giải độc tốt nhất cho chứng "ảo giác" của LLMs, nhưng nếu thiết lập không khéo, chatbot vẫn có thể xuyên tạc tài liệu nội bộ của bạn. Để kiểm soát cỗ máy này, bạn phải cài đặt một đoạn Prompt hệ thống (System Prompt) có tính chất kỷ luật thép:
"Bạn là trợ lý AI nội bộ của công ty. Tôi sẽ cung cấp cho bạn các trích đoạn tài liệu (Context) bên dưới.
1. Bạn CHỈ ĐƯỢC PHÉP trả lời dựa trên những thông tin có trong tài liệu này.
2. Tuyệt đối KHÔNG được sử dụng kiến thức bên ngoài internet của bạn.
3. Nếu tài liệu không chứa câu trả lời, hãy thành thật nói: 'Xin lỗi, tôi không tìm thấy thông tin này trong tài liệu nội bộ', tuyệt đối không được tự bịa ra câu trả lời."
Cùng với đó, luôn yêu cầu Chatbot phải Trích dẫn nguồn (Citation). Bất cứ câu nói nào phát ra phải kèm theo chú thích `[Theo Sổ tay nhân sự trang 15]`. Điều này giúp người dùng dễ dàng bấm vào link để kiểm chứng lại với bản gốc, xây dựng niềm tin vào hệ thống AI.
Lời kết:
RAG đang biến mọi tổ chức, từ công ty luật, bệnh viện cho đến trường học, thành một siêu bộ não có khả năng truy xuất hàng triệu trang giấy chỉ trong một phần nghìn giây. Tuy nhiên, kiến trúc RAG này hiện tại mới chỉ giải quyết rất tốt các tài liệu thuần chữ (Văn bản Text). Rắc rối thực sự sẽ nổ ra khi tài liệu nội bộ của bạn ngập tràn những biểu đồ hình tròn phức tạp, ảnh chụp hóa đơn mờ nhòe, hay file ghi âm cuộc gọi. Làm thế nào để AI có thể "Nhìn" và "Nghe" được thế giới xung quanh? Hãy cùng bước sang chương tiếp theo của tương lai với Công nghệ AI Đa Phương Thức (Multimodal AI).