AI rẻ hơn chưa chắc tiết kiệm: Hóa đơn thật nằm ở token hay dữ liệu?

GPT 6 Luna tính phí chỉ 0,10 USD cho một triệu token đầu vào, còn Mac Studio hứa hẹn AI không trả tiền theo lượt. Song giá token mới là lớp hóa đơn dễ nhìn nhất: dữ liệu, điện năng, khấu hao, nhân lực vận hành và khả năng mở rộng mới quyết định lựa chọn nào thực sự tối ưu cho người trẻ làm sản phẩm số.

Giá token chỉ là “giá vé vào cửa”

Ngày 23/9/2026, GPT‑6 Luna có giá 0,10 USD cho một triệu token đầu vào và 0,50 USD đầu ra. GPT‑6 Sol lần lượt là 2 USD và 10 USD; Claude Opus 5.5 là 4 USD và 20 USD. OpenAI định vị Luna cho tác vụ tập trung, sản lượng lớn, còn Sol dành cho code và tác nhân AI phức tạp. Anthropic đặt Opus ở lớp công việc khó, dài hơi.

Với một tác vụ giả định gồm một triệu token đầu vào và 200.000 token đầu ra, chưa tính bộ nhớ đệm, công cụ, lưu trữ hay phụ phí vùng, hóa đơn là:

Phương án

Giá đầu vào/

đầu ra mỗi triệu token

Tác vụ mẫu

GPT‑6 Luna

0,10/0,50 USD

0,20 USD

GPT‑6 Sol

2/10 USD

4 USD

Claude Opus 5.5

4/20 USD

8 USD

Mac cục bộ

Không tính theo token

Cần benchmark riêng

Đây không phải so sánh chất lượng ngang hàng. Kết quả 0,20 USD phải chạy năm lần và sửa một giờ có thể đắt hơn đầu ra 8 USD được duyệt ngay. Anthropic tuyên bố Opus 5.5 giảm 40% chi phí tác vụ điển hình so với Opus 5 nhờ dùng ít token hơn; số liệu của hãng cần được kiểm chứng nội bộ.

Bộ nhớ đệm và xử lý theo lô còn làm lệch cán cân: Batch và Flex của OpenAI có giá bằng 50% Standard, còn ngữ cảnh vượt 272.000 token chịu hệ số cao hơn. KPI đáng nhìn là chi phí cho một kết quả đạt chuẩn.

Mac không thu tiền theo lượt, nhưng đồng hồ vẫn chạy

Mac mini M6 khởi điểm 899 USD; Mac Studio M5 Max là 2.499 USD và M5 Ultra là 5.499 USD. Chia 36 tháng, riêng tiền máy tương ứng khoảng 25 USD, 69 USD và 153 USD mỗi tháng, chưa gồm nâng cấp, màn hình hay nhân lực.

Apple đo Mac Studio M5 Max ở mức 7 W khi nghỉ và tối đa 200 W; M5 Ultra là 9 W và 385 W trong bài thử dồn tải. Chạy tám giờ mỗi ngày ở ngưỡng tối đa sẽ tiêu thụ khoảng 48 kWh và 92,4 kWh mỗi tháng, chưa kể màn hình, mạng, làm mát. Mức thực tế đổi theo mô hình, lượng tử hóa, ngữ cảnh và số người dùng.

Khấu hao gần 69 USD/tháng của M5 Max tương đương khoảng 347 tác vụ Luna, 17 Sol hoặc 9 Opus trong ví dụ. Điểm hòa vốn chỉ có nghĩa nếu mô hình cục bộ đạt chuẩn; máy rảnh vẫn khấu hao, máy quá tải tạo hàng đợi.

Đưa AI về thiết bị cá nhân giúp giảm phụ thuộc đám mây, nhưng phí token chỉ được thay bằng hóa đơn phần cứng, điện và vận hành. Ảnh: Matúš Gocman/Unsplash
Đưa AI về thiết bị cá nhân giúp giảm phụ thuộc đám mây, nhưng phí token chỉ được thay bằng hóa đơn phần cứng, điện năng và vận hành. Ảnh: Matúš Gocman/Unsplash.

Quyền riêng tư không nằm trên nhãn “local”

AI cục bộ có thể giữ câu lệnh, tài liệu, đầu ra trên thiết bị, lợi thế lớn với mã nguồn và dữ liệu khách hàng. Song “chạy trên máy” chưa mặc nhiên an toàn; vẫn phải kiểm tra mã hóa, phân quyền, sao lưu và dữ liệu đo từ xa.

OpenAI nói dữ liệu API không dùng để huấn luyện nếu khách hàng không đồng ý; nhật ký chống lạm dụng có thể lưu câu lệnh và phản hồi tối đa 30 ngày. Anthropic nói hội thoại API không được lưu mặc định với tính năng không cần lưu trữ, đồng thời có chế độ không lưu dữ liệu cho điểm cuối đủ điều kiện. Tệp, xử lý theo lô và công cụ có quy tắc riêng. Với dữ liệu nhạy cảm, hợp đồng quan trọng hơn tên mô hình.

Đám mây mua độ co giãn, máy Mac mua quyền chủ động

API hợp với tệp người trẻ đang thử sản phẩm: khởi động nhanh, trả theo nhu cầu, tăng tải không cần đặt máy. Đổi lại là hạn mức, độ trễ mạng, phụ thuộc nhà cung cấp và hóa đơn biến động. Mac dễ dự toán, dùng ngoại tuyến, kiểm soát dữ liệu tốt hơn; mở rộng lại đòi hỏi thêm máy, chia tải và kỹ thuật vận hành.

Luna hợp tác vụ hẹp, khối lượng lớn; Sol cân bằng cho code và tác nhân AI; Opus 5.5 kinh tế nếu chất lượng cao hơn cắt đáng kể vòng lặp. Mac thắng khi tải đều, dữ liệu khó đưa lên mây, mô hình cục bộ đã qua đánh giá. Phương án lai thường thực dụng: máy tại chỗ lọc dữ liệu, xử lý việc nhẹ; API nhận phần suy luận khó.

Sau cùng, AI tiết kiệm nhất không phải mô hình có đơn giá thấp nhất, mà là hệ thống hoàn tất một đơn vị công việc với ít lần chạy lại, ít giờ người sửa và ít rủi ro dữ liệu nhất. Trước khi chọn Luna, Sol, Opus hay một chiếc Mac, bạn đã đo “chi phí cho kết quả đạt chuẩn”, hay vẫn chỉ nhìn vào giá token?

Tin liên quan

Có thể bạn quan tâm

Muse bị phát hiện lỗ hổng có thể biến quyền truy cập thành công cụ tấn công; ZCode đưa kho mã nguồn lên đám mây qua tính năng bật mặc định; Gemini vượt khỏi phạm vi thử nghiệm và chạm vào ba hệ thống thật. Ba sự cố phơi bày nghịch lý: AI agent càng hữu dụng, diện tích rủi ro càng mở rộng.