Anthropic vừa công bố Claude Sonnet 5.5, mô hình thứ hai trong nhóm Claude 5.5. Phần dễ lướt qua nhất trong công bố lại là phần ảnh hưởng trực tiếp nhất tới hóa đơn: đơn giá token không thay đổi so với Sonnet 5.
Những gì thay đổi
- Đơn giá giữ nguyên: 2 USD cho 1 triệu token đầu vào, 10 USD cho 1 triệu token đầu ra, 0,20 USD cho 1 triệu token đọc cache.
- Chi phí mỗi tác vụ giảm tới 30%, vì mô hình cần ít token hơn để làm xong cùng một việc.
- Tốc độ sinh kết quả nhanh hơn trên 30% — bản Sonnet nhanh nhất cho tới nay.
- Terminal-Bench 4.0, bài đánh giá lập trình dạng agent: 70,6% so với 10,3% của Sonnet 5.
- GDPval-AA, bài đo công việc thực tế của 44 nghề: 1844 điểm, kém Opus 5.5 đúng hai điểm.
- Lần đầu một mô hình Sonnet chơi hết Pokémon Red chỉ bằng ảnh chụp màn hình.
Vì sao con số đáng nhìn là token, không phải điểm số
Chi phí vận hành một tính năng AI là tích của hai vế: số token nhân đơn giá. Điểm benchmark cho biết mô hình làm được gì; hóa đơn cuối tháng lại phụ thuộc vế thứ nhất. Lần này Anthropic giữ nguyên đơn giá, nên toàn bộ phần tiết kiệm nằm ở chỗ mô hình tiêu ít token hơn.
Các đơn vị thử nghiệm sớm báo cáo mức giảm rất khác nhau, và chính sự khác nhau đó mới đáng chú ý. Balyasny Asset Management chạy bộ 2.441 tác vụ tài chính, ghi nhận khoảng 121 nghìn token mỗi câu trả lời so với 497 nghìn của Sonnet 5. Base44 dựng 118 ứng dụng thật, trung bình 3,6 vòng lặp mỗi lần thay vì 7,7. Lovable báo số lệnh gọi công cụ giảm một phần ba. Slack đo được ít hơn khoảng 14% token đầu ra mà không sửa câu lệnh nào. Box ghi nhận giảm 12% tổng token và nhanh gấp 2,4 lần.

Khoảng cách giữa 76% và 12% không phải mâu thuẫn. Mỗi con số gắn với một loại công việc khác nhau, và phần tiết kiệm lớn nhất rơi vào những chỗ mô hình cũ hay tra cứu thừa hoặc lặp lại nhiều bước. Vì vậy con số duy nhất dùng được để lập kế hoạch là con số đo trên chính tập yêu cầu của bạn.
Mức nỗ lực là một tham số kinh doanh
Cả hai mô hình đều cho chỉnh mức nỗ lực: để thấp thì trả lời nhanh và tốn ít token, để cao thì mô hình suy nghĩ lâu hơn và tự kiểm tra kỹ hơn. Mặc định là Medium trong các ứng dụng Claude và Claude Code, High trên Claude Platform.
Theo số liệu Anthropic công bố, ở mức Low hoặc Medium, Sonnet 5.5 vượt điểm tốt nhất của Sonnet 5 trên một số bài đánh giá với khoảng một phần mười chi phí mỗi tác vụ. Nói cách khác, mức nỗ lực nên được đặt theo giá trị của việc chứ không đặt một lần cho cả hệ thống: chỗ sai thì tốn kém đặt cao, chỗ lặp hàng nghìn lần mỗi ngày và rủi ro thấp thì hạ xuống. Đây cũng chính là logic của ngưỡng tin cậy mà chúng tôi đã viết.
Phân tầng mô hình, không phải chọn một
Anthropic định vị Sonnet 5.5 là bản bổ trợ nhanh và rẻ cho Opus 5.5, chứ không thay thế: Opus 5.5 dành cho việc phức tạp cần phán đoán kéo dài, Sonnet 5.5 mạnh ở những việc có phạm vi rõ ràng. Một người thử nghiệm sớm mô tả cách chia việc rất gọn — để Opus 5.5 dựng kiến trúc và khung tổng thể, rồi giao Sonnet 5.5 hiện thực hóa.
Cách chia đó quen thuộc với bất kỳ ai từng thiết kế hệ thống: đặt phần đắt tiền ở chỗ quyết định, đặt phần rẻ ở chỗ khối lượng. Điều kiện để nó chạy được là quy trình phải rõ ràng trước, chứ không phải mô hình phải giỏi trước — đúng khoảng trống kiến trúc khiến nhiều khoản đầu tư AI không ra lợi nhuận.
Ba điểm kỹ thuật cần biết trước khi chuyển
- Nếu đang chạy Sonnet với chế độ suy nghĩ tắt, phải chuyển sang thiết lập between_tools trước khi đổi sang Sonnet 5.5. Anthropic có hướng dẫn chuyển đổi riêng cho việc này.
- Phần suy nghĩ của mô hình nay gắn với tài khoản tạo ra nó. Nếu bạn chuyển hội thoại giữa các tài khoản, kể cả việc đổi tài khoản giữa phiên trong Claude Code, hành vi sẽ khác trước; xem tài liệu về preserved thinking.
- Các yêu cầu an ninh mạng rủi ro cao sẽ bị chuyển về Sonnet 5 một cách lộ rõ. Việc tìm và sửa lỗi trong mã nguồn hằng ngày không bị ảnh hưởng.
Mã mô hình trên Claude Platform là claude-sonnet-5-5. Mô hình có mặt trên Amazon Web Services, Google Cloud và Microsoft Azure, và hỗ trợ chế độ không lưu dữ liệu.
Với doanh nghiệp Việt Nam
Nếu bạn đang chạy một tính năng AI ở quy mô — phân loại yêu cầu khách hàng, trích xuất trường từ chứng từ, trả lời tầng một, gán nhãn giao dịch — thì việc đáng làm trước không phải là đổi mô hình, mà là đo lại nền: số token mỗi yêu cầu, số bước mỗi tác vụ, tỷ lệ phải chuyển cho người xử lý. Không có ba con số đó thì không cách nào biết việc đổi mô hình hay hạ mức nỗ lực đem lại bao nhiêu.
Và như mọi lần, phần quyết định giá trị vẫn nằm ngoài mô hình: ngưỡng tin cậy, điểm dừng để người duyệt, nhật ký truy vết. Nếu bạn đang xây những luồng như vậy, xem trang tự động hóa và AI của chúng tôi.
Nguồn: Anthropic — Introducing Claude Sonnet 5.5 · Sonnet 5.5 System Card · Hướng dẫn chuyển đổi
