Bộ công cụ Token & Prompt cho LLM
Đếm token chính xác cho mô hình OpenAI, ước lượng cho Claude, Gemini, Llama và Mistral, quy đổi độ dài prompt thành hoá đơn API hằng tháng, chia tài liệu thành các đoạn cho RAG, và tạo mẫu prompt hoặc file fine-tune dùng lại được. Mọi thứ chạy trong trình duyệt — không có văn bản nào bị tải lên.
Các bước sử dụng
- Chọn Bộ tách token ở đầu trang. Hai lựa chọn GPT đếm chính xác; các lựa chọn Claude, Gemini, Llama và Mistral được ghi rõ là ước lượng. Lựa chọn này áp dụng cho mọi tab.
- Ở tab Đếm token, dán văn bản vào. Các thẻ hiển thị Token, Ký tự, Từ và Token mỗi từ. Với số ước lượng, thẻ token hiện một giá trị kèm khoảng dao động.
- Kéo xuống Hiển thị token để xem văn bản bị tách ở đâu: mỗi khối màu là một token, rê chuột lên khối để xem mã token. Chuyển sang Mã token để lấy danh sách mã thô có thể sao chép.
- Bấm Dùng cho bảng chi phí để mang số token sang tab Chi phí & ngữ cảnh.
- Ở tab Chi phí & ngữ cảnh, nhập Token prompt, Token đầu ra, Số yêu cầu mỗi ngày và, nếu dùng prompt caching, % prompt từ cache. Mỗi dòng mô hình hiện chi phí Mỗi yêu cầu, Mỗi ngày và Mỗi tháng, cùng cột Vừa ngữ cảnh — cho biết prompt cộng đầu ra có lọt cửa sổ ngữ cảnh của mô hình không và còn dư bao nhiêu token.
- Sửa trực tiếp bất kỳ giá hay kích thước ngữ cảnh nào trong bảng (khi có giá thương lượng riêng hoặc mô hình mới), lọc theo Nhà cung cấp, và bấm Khôi phục giá để quay về số liệu có sẵn.
- Ở tab Chia đoạn (chunk), dán tài liệu, chọn Đơn vị, Kích thước đoạn và Chồng lấn, chọn cách Tách theo và, với Markdown, bật Tiêu đề Markdown để mỗi đoạn ghi lại đường dẫn tiêu đề. Xuất toàn bộ đoạn ra JSON, JSONL hoặc CSV, hoặc bấm Sao chép JSONL.
- Ở tab Mẫu prompt, chọn Mẫu có sẵn hoặc tự viết Prompt hệ thống và Prompt người dùng với các biến
{{variable}}. Mỗi biến có một ô nhập riêng; phần kết quả chuyển được giữa Văn bản thuần, OpenAI messages và Anthropic Messages. - Ở tab JSONL fine-tune, dán CSV hoặc TSV có dòng tiêu đề như
prompt,completionhoặcsystem,user,assistant. Chỉnh Dấu phân cách và Token tối đa mỗi ví dụ nếu cần, sửa các dòng được liệt kê trong bảng kiểm tra, rồi sao chép hoặc tải JSONL.
Mẹo
- Tiếng Việt tốn token hơn tiếng Anh. Câu "Xin chào thế giới, hôm nay trời đẹp quá." là 24 token với cl100k_base nhưng chỉ 12 token với o200k_base, trong khi một câu tiếng Anh có độ dài tương đương là 10 token ở cả hai — bộ từ vựng mới xử lý chữ có dấu tốt hơn nhiều.
- Mỗi tin nhắn trong yêu cầu chat còn tốn thêm vài token định dạng ngoài phần văn bản, nên hãy chừa một chút dư khi prompt đã sát giới hạn.
- % prompt từ cache chỉ làm giảm chi phí với mô hình có giá đầu vào từ cache. Nó mô phỏng việc đọc cache, không tính phí ghi cache lần đầu.
- Với RAG, Kích thước đoạn 300–800 token và Chồng lấn khoảng 10–20% là điểm khởi đầu phổ biến; đoạn nhỏ truy xuất chính xác hơn, đoạn lớn giữ ngữ cảnh liền mạch hơn.
- Khi bật Tiêu đề Markdown, đoạn không bao giờ vắt qua một tiêu đề, nên có thể lọc hoặc trích dẫn các đoạn theo đường dẫn tiêu đề của chúng.
- Một tên biến xuất hiện nhiều lần trong mẫu chỉ có một ô nhập — điền một lần là mọi chỗ đều được cập nhật.
- Trong kết quả Anthropic Messages, prompt hệ thống là một trường ở cấp ngoài cùng chứ không phải tin nhắn; trong OpenAI messages nó là tin nhắn đầu tiên.
- Với ví dụ fine-tune nhiều lượt, thêm các cặp cột:
system,user,assistant,user,assistant. Để trống cặp cuối ở những dòng có ít lượt hơn.
Câu hỏi thường gặp
Văn bản của tôi có bị gửi tới OpenAI, Anthropic hay bên nào khác không?
Không. Việc tách token, tính chi phí, chia đoạn và điền mẫu prompt đều chạy ngay trong trình duyệt. Bảng dữ liệu của bộ tách token OpenAI chỉ được tải một lần từ chính trang này khi bạn chọn lựa chọn GPT lần đầu; văn bản của bạn không rời khỏi thiết bị.
Tại sao số token của Claude chỉ là ước lượng?
Anthropic, cũng như Google và Mistral, không công bố bộ tách token có thể chạy trong trang web — số token của Claude chỉ lấy được qua API đếm token của chính Anthropic. Vì vậy công cụ ước lượng: số ký tự ÷ 3,5 với tiếng Anh thông thường, mỗi ký tự ngoài ASCII tính gấp đôi, kèm khoảng dao động ±20%. Con số đủ dùng để lập ngân sách và kiểm tra xem còn xa giới hạn ngữ cảnh không; khi cần số chính xác để tính tiền, hãy gọi endpoint đếm token của nhà cung cấp.
Nên chọn lựa chọn GPT nào?
o200k_base được dùng cho GPT-5, GPT-4.1, GPT-4o và các mô hình dòng o. cl100k_base là bảng mã cũ hơn của GPT-4 và GPT-3.5 Turbo. Nếu không chắc, hãy chọn o200k_base — nó bao phủ mọi mô hình OpenAI hiện hành.
Giá trong bảng có mới không?
Giá được lấy từ trang bảng giá của từng nhà cung cấp vào ngày ghi trong thông báo phía trên bảng, là giá gói tiêu chuẩn và chỉ tính văn bản. Chưa gồm giảm giá batch, phụ phí ngữ cảnh dài và phí ghi cache. Hãy sửa các ô nếu mức giá của bạn khác.
Có đoạn nào lớn hơn kích thước đoạn đã đặt không?
Chỉ trong trường hợp hiếm khi một ký tự đơn lẻ cần nhiều token hơn giới hạn (ví dụ một emoji với kích thước đoạn là 1). Còn lại, bộ chia sẽ lần lượt lùi từ đoạn văn xuống dòng, câu, từ và cuối cùng là ký tự cho tới khi mọi đoạn đều vừa, và đo lại chính xác từng đoạn trước khi chấp nhận.