Trước khi xử lý ngữ nghĩa, mô hình tách văn bản thành token. Một token không nhất thiết trùng với một từ tiếng Việt: có thể là phần từ, chữ số hoặc dấu câu. Chi phí gọi API thường được tính theo số token.
Demo tokenizer (đơn giản hóa)
Gõ hoặc chọn mẫu
Tổng: 10 token (minh họa lớp học — tokenizer thật như BPE phức tạp hơn)
Câu → các hộp token
#0
Học
id≈1072
#1
máy
id≈1019
#2
giúp
id≈1013
#3
máy
id≈1019
#4
tính
id≈1026
#5
học
id≈1014
#6
từ
id≈1026
#7
dữ
id≈1010
#8
liệu
id≈1018
#9
.
id≈1046
Máy không giữ nguyên câu tiếng Việt — nó làm việc trên danh sách số (token id).