Bảng giá Claude API 2026: Sonnet, Opus hay Haiku? | RevidAPI

bảng giá Claude API — ảnh bìa | RevidAPI

Bảng giá Claude API 2026: Sonnet, Opus hay Haiku? | RevidAPI

Theo mức giá trong brief, Claude Haiku 4.5 thấp nhất, Sonnet 5 ở giữa, còn Opus 5 cao nhất khi tính input, output và cache read. Bài viết giúp bạn đọc đúng đơn vị 1 triệu token, tách chi phí input, output và cache read, rồi ước tính hóa đơn cho chatbot, Claude Code hoặc pipeline nội dung. Các con số lấy từ brief sheet; tên model và mức giá vẫn cần đối chiếu với Anthropic trước khi xuất bản.

Tóm tắt nhanh

  • Claude Haiku 4.5: 4.800đ input, 24.000đ output và 480đ cache read cho mỗi 1 triệu token.
  • Claude Sonnet 5: 14.400đ input, 72.000đ output và 1.440đ cache read cho mỗi 1 triệu token.
  • Claude Opus 5: 24.000đ input, 120.000đ output và 2.400đ cache read cho mỗi 1 triệu token; cache read trong cả ba mức bằng 10% giá input theo brief.

Claude API tính phí theo ba loại token nào? (~300 từ)

Một request Claude không tính theo số lần bạn bấm gửi, mà theo lượng dữ liệu đi vào, nội dung model tạo ra và phần dữ liệu cũ được đọc lại từ cache. Với chatbot, một request có thể gồm system prompt, lịch sử hội thoại, câu hỏi mới và câu trả lời; mỗi phần cần được tách khi đọc chi phí. Claude API phục vụ developer tích hợp model vào sản phẩm như chatbot chăm sóc khách hàng, công cụ phân tích file, hệ thống viết mô tả sản phẩm hoặc quy trình tự động hóa. Đây là luồng API riêng, không phải bảng giá của Claude Free, Pro, Max, Team hay Enterprise. Vì vậy, không lấy giá gói người dùng cuối để dự toán ngân sách cho một ứng dụng gửi request bằng API.

Ba loại token cần tách

Loại token Dữ liệu được tính Ví dụ khi tích hợp
Input token Nội dung bạn gửi vào model System prompt, câu hỏi khách hàng, lịch sử chat, văn bản trong file
Output token Nội dung model tạo ra Câu trả lời, đoạn tóm tắt, mã JSON hoặc code trả về
Cache read Input đã lưu trước đó và được đọc lại Catalog sản phẩm hoặc bộ hướng dẫn cố định được dùng lại ở request sau

Bảng giá Claude API theo model: Haiku thấp nhất, Sonnet cân bằng, Opus cao nhất (~450 từ)

Mức giá trong brief Theo brief sheet, Claude Haiku 4.5 có đơn giá thấp nhất, Claude Sonnet 5 nằm ở khoảng giữa, còn Claude Opus 5 cao nhất trong ba model. Các con số dưới đây tính trên 1 triệu token

Cột 1 Cột 2 Cột 3 Cột 4 Cột 5
Model theo brief Input / 1 triệu token Output / 1 triệu token Cache read / 1 triệu token Ghi chú xác minh
Claude Haiku 4.5 4.800đ 24.000đ 480đ Brief sheet, cần đối chiếu nguồn chính thức
Claude Sonnet 5 14.400đ 72.000đ 1.440đ Brief sheet, cần đối chiếu nguồn chính thức
Claude Opus 5 24.000đ 120.000đ 2.400đ Brief sheet, cần đối chiếu nguồn chính thức

Cách ước tính hóa đơn Claude API khi có cache (~400 từ)

Một phiên có 1 triệu token đầu vào chưa chắc bị tính đủ 1 triệu token theo giá input. Nếu log ghi 700.000 token là cache read, chỉ 300.000 token còn lại đi theo giá input thông thường; phần cache read dùng đơn giá riêng. Với các mức trong brief, cache read bằng 10% giá input: Sonnet 5 là 14.400đ input và 1.440đ cache read cho mỗi 1 triệu token; Opus 5 là 24.000đ và 2.400đ; Haiku 4.5 là 4.800đ và 480đ. Vì vậy, prompt hệ thống, hướng dẫn hoặc dữ liệu lặp lại có thể làm hóa đơn thấp hơn dự toán coi toàn bộ input là token mới. Con số cache hit 70% của Claude Code chỉ nên xem là giả định cho đến khi usage metadata hoặc log của phiên xác nhận. Công thức cần dùng là: `Chi phí = input token × đơn giá input + output token × đơn giá output + cache read × đơn giá cache read`. Trước khi nhân giá, đổi từng loại token về đơn vị một triệu token và không cộng cache read vào input lần nữa. Ví dụ, nếu một request Sonnet có 300.000 input token mới, 700.000 cache read và 100.000 output token, dự toán là `0,3 × 14.400 + 0,7 × 1.440 + 0,1 × 72.000 = 12.528đ`. Nếu không có cache, cùng 1 triệu input và 100.000 output sẽ là `14.400 + 7.200 = 21.600đ`. Đây là phép tính minh họa; giá model và tên field usage vẫn cần đối chiếu nguồn chính thức tại thời điểm lập ngân sách.

Quy trình đối chiếu hóa đơn

Bước Việc cần làm Dữ liệu cần kiểm tra
1 Chốt model trước khi ước tính Tên model trong request và bảng giá đã xác minh
2 Tách ba loại token Input, output, cache read trong usage metadata
3 Quy đổi về một triệu token Chia từng số token cho 1.000.000
4 Nhân từng loại với đơn giá Node tính toán nội bộ, giữ riêng ba thành phần
5 So sánh sau mỗi giai đoạn Usage thực tế với dashboard hoặc báo cáo billing

Vì sao dự toán Claude API có thể lệch hóa đơn thực tế? (~300 từ)

Ứng dụng Mô tả Đối tượng
Một dự toán dùng Claude Sonnet 5 có thể lệch ngay từ tên model. SERP được cung cấp nhắc Sonnet 4.6 và Opus 4.6, còn brief ghi Sonnet 5 và Opus 5. Vì vậy, các mức 14.400đ input, 72.000đ output và 1.440đ cache read cho mỗi 1 triệu token mới là số liệu trong brief, chưa phải giá Anthropic đã xác nhận. Cần kiểm tra lại trang giá và ngày áp dụng trước khi xuất bản hoặc báo ngân sách. Cache read cũng không phải khoản giảm tự động cho mọi input token. Theo brief, 1.440đ bằng 10% mức input 14.400đ, nên chỉ có thể nói thấp hơn 90% trong trường hợp token thực sự được tính là cache read. Prompt mới, cache hết hạn hoặc request không đáp ứng điều kiện cache vẫn có thể bị tính theo input thông thường. Không có log usage thì không thể kết luận một phiên Claude Code luôn đạt cache hit 70%. Điểm gây lệch Cần kiểm tra cụ thể
Tên model Đối chiếu Sonnet 4.6/5 và Opus 4.6/5 với bảng giá chính thức
Loại token Tách input, output và cache read trong usage của từng request
Thanh toán Kiểm tra tỷ giá, phí giao dịch quốc tế, thuế và phí tài khoản
Điều kiện sử dụng Kiểm tra rate limit, trạng thái billing và khu vực API được hỗ trợ Dự toán token còn lệch khi ứng dụng gửi lại system prompt, lịch sử hội thoại hoặc dữ liệu tài liệu ở mỗi request. Chẳng hạn, 1 triệu token dự kiến là input thông thường nhưng một phần được ghi nhận thành cache read sẽ cho tổng khác; ngược lại, output dài hơn dự kiến làm hóa đơn tăng dù số request không đổi. Quy tắc billing và cách tích hợp quyết định cách usage được ghi nhận. Trước khi chốt ngân sách, hãy chạy một lượng request nhỏ, lưu usage theo model, rồi đối chiếu với billing sau khi thanh toán. Nếu trang chính thức chưa xác nhận giá bằng VND, hãy giữ nguyên đơn vị tiền gốc và ghi riêng phần tỷ giá, phí quốc tế, thuế thay vì gộp thành một con số chắc chắn.

Hai tình huống dùng Claude API tại Việt Nam và mini case study (~300 từ)

Developer xây trợ lý nội bộ Một developer có thể nối Claude API vào trợ lý nội bộ để nhận yêu cầu từ Slack, biểu mẫu hoặc ticket, sau đó phân loại thành nhóm như “lỗi thanh toán”, “xin quyền truy cập” và “yêu cầu pháp chế”. Kết quả không nên dừng ở câu trả lời

của model: hệ thống có thể chuyển nhãn, phần tóm tắt và mã ticket cho đúng quy trình xử lý. Với tác vụ phân loại ngắn, nhóm có thể thử Haiku 4.5 ở mức 4.800đ input và 24.000đ output cho mỗi 1 triệu token theo brief. Sonnet 5 ở mức 14.400đ input và 72.000đ output phù hợp hơn khi yêu cầu cần tóm tắt nội dung dài hoặc viết hướng dẫn chuyển tiếp. Developer vẫn cần đặt bước kiểm tra quyền truy cập trước khi gửi dữ liệu nội bộ vào API.

Marketer hoặc creator xử lý phản hồi Một nhóm marketer có thể gom phản hồi từ bình luận Facebook, email và form khảo sát, rồi yêu cầu Claude nhóm các chủ đề như giao hàng, kích thước, đổi trả hoặc lỗi thanh toán. Từ nhóm đã chuẩn hóa, Claude tạo bản nháp kịch bản video, tiêu đề hoặc câu trả lời; người phụ trách duyệt trước khi đăng. Workflow này cũng dùng

được cho nhóm phân tích dữ liệu: Claude tóm tắt báo cáo tháng và đánh dấu các đoạn cần kiểm tra, còn người có trách nhiệm đối chiếu số liệu gốc. Không nên xem bản tóm tắt là kết luận cuối cùng, nhất là khi báo cáo chứa doanh thu, điều khoản hợp đồng hoặc dữ liệu khách hàng.

Mini case study: theo dõi ba loại usage Một nhóm dùng cùng prompt hệ thống trong nhiều yêu cầu cần ghi riêng ba khoản sau. Cache read trong brief có giá bằng 10% input, tức thấp hơn 90%, nhưng nhóm chỉ nên kết luận hóa đơn giảm

sau khi đối chiếu log thực tế. – Input: Prompt hệ thống, câu hỏi và tài liệu gửi lên — Tách khỏi output trước khi nhân đơn giá

  • Output: Nhãn phân loại, bản tóm tắt hoặc bản nháp — Ghi theo từng request
  • Cache read: Phần prompt hệ thống lặp lại được đọc từ cache — So với usage và hóa đơn thực tế Bảng theo dõi này giúp nhóm so sánh dự toán với usage mà không nhầm cache read với input thông thường. Với Claude Code, con số cache hit 70% chỉ nên dùng như giả định lập ngân sách khi đã có log xác nhận, không phải kết quả mặc định cho mọi dự án.

Chuẩn bị kết nối Claude API trên RevidAPI: endpoint thật và code ngắn (~300 từ)

RevidAPI trong quy trình này là lớp tích hợp workflow để gọi model qua một API tương thích OpenAI, không phải đơn vị phát triển Claude. Endpoint cần dùng là `POST https://revidapi.com/v1/chat/completions`; xác thực bằng header `x-api-key: YOUR_API_KEY` hoặc khóa truyền qua SDK OpenAI. Trước request đầu tiên, gọi `GET https://revidapi.com/v1/chat/models` để kiểm tra model và giá đang được connector công bố. Chọn model theo độ phức tạp của request. Theo sheet giá hiện tại, Haiku 4.5 là 4.800đ input, Sonnet 5 là 14.400đ, còn Opus 5 là 24.000đ cho mỗi 1 triệu token; vì vậy một tác vụ phân loại ngắn không nên mặc định chạy Opus. Sonnet phù hợp khi cần cân bằng giữa khả năng xử lý và chi phí, nhưng tên model vẫn nên lấy từ endpoint danh sách thay vì gắn cứng trong ứng dụng. Tách prompt cố định khỏi dữ liệu biến đổi để biết phần nào có thể tái sử dụng qua cache. Chẳng hạn, system prompt 2.000 token chứa quy tắc trả lời nằm riêng, còn nội dung đơn hàng đặt trong message theo từng request. Sheet ghi cache read thấp hơn 90% so với input; mốc cache hit 70% của phiên Claude Code chỉ nên dùng làm giả định kiểm thử cho đến khi log thực tế xác nhận. Sau mỗi request, ghi riêng input, output và cache read nếu response trả về các trường usage tương ứng. Không tự suy ra hóa đơn từ số ký tự; hãy đối chiếu JSON response với Credit & Lịch sử dùng, rồi đặt ngân sách theo ngày và cảnh báo khi số credit vượt ngưỡng. Nếu connector trả về field khác tài liệu, lưu nguyên response để kiểm tra trước khi sửa bộ tính phí.

Gọi Claude qua endpoint tương thích OpenAI

curl https://revidapi.com/v1/chat/completions \ -H "x-api-key: YOUR_API_KEY" \ -H "Content-Type: application/json" \ -d '{"model":"claude-sonnet-5","messages":[{"role":"user","content":"Xin chào"}]}'
from openai import OpenAI client = OpenAI( base_url="https://revidapi.com/v1", api_key="YOUR_API_KEY",
)
response = client.chat.completions.create( model="claude-sonnet-5", messages=[{"role": "user", "content": "Xin chào"}],
)
print(response.choices[0].message.content)
print(response.model_dump_json()) # lưu cả usage nếu connector trả về

Mẫu trên đọc nội dung từ response chuẩn OpenAI và lưu toàn bộ JSON thay vì giả định tên field usage. Khi đổi sang Haiku hoặc Opus, thay `model`

sau khi kiểm tra lại `GET /v1/chat/models` và đơn giá tương ứng.

FAQ về bảng giá Claude API và cách chọn model (~250 từ)

Bảng giá Claude API

được tính theo những loại token nào? Bạn tách riêng input, output và cache read, rồi quy đổi từng loại về 1 triệu token. Theo brief sheet, Haiku 4.5 có mức 4.800đ input, 24.000đ output và 480đ cache read; Sonnet 5 là 14.400đ, 72.000đ và 1.440đ; Opus 5 là 24.000đ, 120.000đ và 2.400đ. Các số này cần đối chiếu với bảng giá Anthropic trước khi xuất bản hoặc lập ngân sách.

Model Claude nào có giá thấp nhất? Trong ba model

của brief, Haiku 4.5 có giá thấp nhất ở cả input, output và cache read. Sonnet 5 nằm ở mức giữa, còn Opus 5 cao nhất; tên model và đơn giá có thể thay đổi nên bạn cần kiểm tra nguồn chính thức tại thời điểm gọi API.

Cache read có giảm phí không?

Có, theo brief cache read bằng 10% giá input, tức thấp hơn 90% so với token input thông thường. Chẳng hạn, 1 triệu cache read

của Sonnet 5 là 1.440đ thay vì 14.400đ input. Nếu log một phiên Claude Code ghi nhận 70% input là cache read, phần chi phí thực tế có thể thấp hơn dự toán toàn bộ input, nhưng 70% không nên xem là tỷ lệ mặc định khi chưa có log.

Vì sao Claude Code có thể rẻ hơn dự toán? Prompt hệ thống, hướng dẫn và nội dung lặp lại có thể

được tính vào cache read khi đáp ứng điều kiện cache. Bạn nên xem usage metadata và hóa đơn thực tế thay vì giả định mọi phiên đều đạt cùng tỷ lệ cache.

Nên chọn Sonnet hay Opus?

Chọn Sonnet khi cần cân bằng giữa chất lượng và mức 14.400đ input, 72.000đ output mỗi 1 triệu token theo brief. Chọn Opus ở mức 24.000đ input và 120.000đ output khi bạn đã kiểm thử và xác nhận chất lượng cao hơn cần thiết cho tác vụ cụ thể.

Khám phá workflow miễn phí tại AI Tạo ảnh & Video và lấy API key tại API Marketplace RevidAPI.

Tích hợp Veo 3.1 Omni với RevidAPI giúp tự động hóa TTS, lipsync và xuất video qua AI Studio. Developer có thể ghép n8n workflow với endpoint thật trên dashboard — phù hợp creator và startup Việt muốn scale sản xuất video AI mà không cần hạ tầng riêng.

Khám phá API Marketplace RevidAPI — lấy API key miễn phí · Telegram · revidapi@gmail.com

Khám phá RevidAPI

API Marketplace · Telegram

Zalo Messenger Phone
Gọi miễn phí 0978382335
Gọi miễn phí 0978382335