AIfor Educations
07

Pipeline tài liệu (OCR → Vector)

Tổ chức thường có khối lượng lớn PDF, hợp đồng và hóa đơn. Để mô hình khai thác được nội dung đó cần một pipeline xử lý tài liệu, không phải đưa nguyên file vào một prompt duy nhất.

IN

Tài liệu

PDF, Word, ảnh scan, email, bảng tính

OCR

Extract / OCR

Biến trang ảnh → text thô

CUT

Chunk

Cắt đoạn ngắn + metadata (file, trang)

VEC

Embedding

Mỗi chunk → vector

DB

Vector DB

Lưu text + embedding

ASK

Search / RAG

Câu hỏi → top-k → LLM trả lời

Ví dụ một trang scan

Minh họa lớp học

1. Ảnh / PDF

[scan hợp đồng.pdf]

2. Text sau OCR

“Điều 5. Nghỉ bệnh: nhân viên được nghỉ tối đa 5 ngày/năm có lương…”

3. Chunk + vector

id=c12
text=Điều 5…
emb=[0.02, -0.11, …]