Nếu không có RAG, LLM nhận đầu vào của người dùng và tạo ra phản hồi dựa trên thông tin mà nó đã được đào tạo — hoặc những gì nó đã biết. Với RAG, một thành phần truy xuất thông tin được giới thiệu sử dụng đầu vào của người dùng để lấy trước thông tin từ một nguồn dữ liệu mới. Truy vấn người dùng và thông tin có liên quan đều được cung cấp cho LLM. LLM sử dụng kiến thức mới và dữ liệu đào tạo của nó để tạo ra phản hồi tốt hơn. Các phần sau đây cung cấp thông tin tổng quan về quy trình.
Dữ liệu mới bên ngoài tập dữ liệu đào tạo ban đầu của LLM được gọi là dữ liệu bên ngoài. Nó có thể đến từ nhiều nguồn dữ liệu như API, cơ sở dữ liệu hoặc kho tài liệu. Dữ liệu có thể tồn tại ở nhiều định dạng khác nhau như tệp, bản ghi cơ sở dữ liệu hoặc văn bản dạng dài. Một kỹ thuật AI khác, được gọi là mô hình ngôn ngữ nhúng, chuyển đổi dữ liệu thành các dạng trình bày số và lưu trữ nó trong cơ sở dữ liệu véc-tơ. Quá trình này tạo ra một thư viện kiến thức mà các mô hình AI tạo sinh có thể hiểu được.
Bước tiếp theo là thực hiện tìm kiếm sự liên quan. Truy vấn người dùng được chuyển đổi thành dạng trình bày véc-tơ và khớp với cơ sở dữ liệu véc-tơ. Ví dụ: hãy xem xét một chatbot thông minh có thể trả lời những câu hỏi về nguồn nhân lực cho một tổ chức. Nếu một nhân viên tìm kiếm, “Tôi có bao nhiêu thời gian nghỉ phép hàng năm?” hệ thống sẽ truy xuất các tài liệu chính sách nghỉ phép hàng năm cùng với hồ sơ nghỉ phép trước đây của từng nhân viên. Những tài liệu cụ thể này sẽ được trả lại vì chúng khá liên quan đến những gì nhân viên có đầu vào. Sự liên quan được tính toán và thiết lập bằng các phép tính và dạng trình bày véc-tơ toán học.
Tiếp theo, mô hình RAG tăng cường đầu vào của người dùng (hoặc lời nhắc) bằng cách thêm dữ liệu truy xuất liên quan trong ngữ cảnh. Bước này sử dụng các kỹ thuật tạo câu lệnh để giao tiếp hiệu quả với LLM. Với lời nhắc tăng cường, các mô hình ngôn ngữ lớn có thể tạo ra câu trả lời chính xác cho các truy vấn của người dùng.
Câu hỏi tiếp theo có thể là—điều gì sẽ xảy ra nếu dữ liệu bên ngoài cũ? Để duy trì thông tin hiện tại để truy xuất, cập nhật không đồng bộ các tài liệu và cập nhật nhúng bản trình bày của tài liệu. Bạn có thể làm điều này nhờ các quy trình thời gian thực tự động hoặc xử lý hàng loạt định kỳ. Đây là một thách thức thường gặp trong phân tích dữ liệu — có thể sử dụng các phương pháp tiếp cận khoa học dữ liệu khác nhau để quản lý thay đổi.
Sơ đồ sau đây cho thấy quy trình mang tính khái niệm của việc sử dụng RAG với LLM.
Link nội dung: https://ohanapreschool.edu.vn/cong-viec-thuong-gap-khi-xu-ly-thong-tin-cua-mot-to-chuc-la-gi-a57666.html