Tổ chức thường có khối lượng lớn PDF, hợp đồng và hóa đơn. Để mô hình khai thác được nội dung đó cần một pipeline xử lý tài liệu, không phải đưa nguyên file vào một prompt duy nhất.
IN
Tài liệu
PDF, Word, ảnh scan, email, bảng tính
OCR
Extract / OCR
Biến trang ảnh → text thô
CUT
Chunk
Cắt đoạn ngắn + metadata (file, trang)
VEC
Embedding
Mỗi chunk → vector
DB
Vector DB
Lưu text + embedding
ASK
Search / RAG
Câu hỏi → top-k → LLM trả lời
Ví dụ một trang scan
Minh họa lớp học
1. Ảnh / PDF
2. Text sau OCR
“Điều 5. Nghỉ bệnh: nhân viên được nghỉ tối đa 5 ngày/năm có lương…”
3. Chunk + vector
id=c12
text=Điều 5…
emb=[0.02, -0.11, …]