Bạn nghĩ một mô hình AI mới ra mắt với giá API giảm một nửa sẽ là tin tốt cho tất cả? Hãy nghĩ lại. Tôi đã nhìn thấy đủ pattern này trong audit smart contract: một bản nâng cấp hứa hẹn 'rẻ hơn, nhanh hơn' thường ẩn giấu những trade-off mà chỉ khi chạy production mới lộ ra. Gemini 3.7 Flash, với cái giá 0.75 đô la cho mỗi triệu token đầu vào, có thể là một cú twist như vậy.
Tuần trước, một leak từ Google Python GenAI SDK xuất hiện tên gemini-3.7-flash. Cùng lúc đó, blogger Leo và SemiAnalysis đồng loạt đưa tin: mô hình này sẽ ra mắt với giá API chỉ bằng một nửa so với 3.6 Flash, và Google được cho là đã hủy bỏ 3.5 Pro để chuyển hướng sang Gemini 4. Không có xác nhận chính thức nào từ Google. Nhưng với tư cách một auditor, tôi biết rằng 'xuất hiện trong SDK' không đồng nghĩa với 'sẵn sàng production'. Đó giống như một dòng code chưa được test, nhưng đã được deploy lên mainnet.
Hãy bỏ qua buzz về 'giá rẻ'. Điều tôi quan tâm là cấu trúc chi phí và rủi ro kỹ thuật đằng sau con số đó. Google có TPU tự sản xuất, chuỗi cung ứng chip khép kín. Họ có thể giảm giá mà vẫn giữ margin. Nhưng nếu giá giảm một nửa, điều đó có nghĩa là họ đã tối ưu inference engine (KV cache, quantization, speculative decoding) hoặc họ đang chấp nhận margin thấp hơn để chiếm thị phần. Cả hai kịch bản đều có mặt trái. Nếu là tối ưu engine, liệu độ chính xác có bị ảnh hưởng? Từng có những trường hợp quantization làm tăng false positive rate trong phân tích code. Nếu là margin thấp, ai sẽ chịu chi phí khi lượng gọi API tăng đột biến? Đây là câu hỏi tôi từng đặt ra khi audit một giao thức cho vay: thanh khoản rẻ nhưng ẩn rủi ro thanh lý hàng loạt.
Tôi nhìn vào lịch sử. Năm 2020, khi Uniswap v2 fork, tôi phát hiện lỗi tính reserve trong YammySwap. Lỗi đó không phải do code sai, mà do hiểu sai constant product formula. Cộng đồng đổ xô fork vì 'rẻ, nhanh', nhưng bỏ qua kiểm tra chi tiết. Gemini 3.7 Flash cũng vậy: 'giá rẻ' là cái móc, nhưng câu hỏi thực sự là nó rẻ hơn ở đâu? Trong token hóa, rẻ hơn có thể đồng nghĩa với bỏ qua safety checks. Trong AI, rẻ hơn có thể là giảm context window, giảm số lượng tham số, hoặc dùng model distillation từ một mô hình lớn hơn mà không công bố. Bài báo gốc không có bất kỳ benchmark nào. Tôi không thể tin vào một mô hình mà không thấy số liệu.
Một chi tiết thú vị khác: việc hủy 3.5 Pro và nhảy thẳng lên Gemini 4. Điều này gợi cho tôi nhớ đến các dự án DeFi thay đổi version number để tạo buzz. 'V2.0' thường là một bản vá lỗi, không phải một kiến trúc mới. Google có thể đang làm điều tương tự: bỏ qua một bản phát hành trung gian để tạo cảm giác đột phá. Nhưng nếu 3.5 Pro bị hủy vì không đạt tiêu chuẩn, thì Gemini 4 có thể cũng đang đối mặt với áp lực tương tự. Từ góc nhìn auditor, một roadmap bị thay đổi đột ngột là red flag. Nó cho thấy sự không ổn định trong chiến lược phát triển.
Tôi muốn nhìn vào tác động đến hệ sinh thái. Nếu Gemini 3.7 Flash thực sự rẻ hơn 50%, các ứng dụng agent, chatbot, tự động hóa sẽ giảm chi phí vận hành. Nhưng điều này cũng tạo ra một 'rủi ro tập trung hóa' mới: các nhà phát triển có thể đặt cược toàn bộ stack AI vào một provider duy nhất vì giá rẻ. Điều này tương tự như việc các dự án DeFi phụ thuộc quá nhiều vào một oracle feed. Nếu Google tăng giá sau 6 tháng, hoặc ngừng hỗ trợ phiên bản cũ, toàn bộ ứng dụng sẽ chịu shock. Tôi đã từng chứng kiến điều này trong NFT: khi metadata off-chain bị thay đổi URI, cả bộ sưu tập mất giá trị.
Còn về mặt cạnh tranh, nếu Google đẩy giá xuống thấp, OpenAI và Anthropic sẽ phải theo hoặc mất thị phần. Nhưng cuộc chiến giá AI không giống cuộc chiến giá cloud storage. AI model có chi phí biên đáng kể. Nếu tất cả cùng giảm giá, ngành có thể rơi vào tình trạng 'chạy đua xuống đáy', nơi chất lượng và an toàn bị hy sinh. Từ kinh nghiệm audit, tôi biết rằng khi các công ty cắt giảm chi phí, nhân viên an toàn và QA là những người đầu tiên bị sa thải.
Tôi không có đủ dữ liệu để kết luận Gemini 3.7 Flash là tốt hay xấu. Nhưng tôi có đủ kinh nghiệm để nói rằng: mọi sự giảm giá đột ngột trong một thị trường kỹ thuật cao đều cần được kiểm tra kỹ lưỡng. Đừng nhìn vào giá API. Hãy nhìn vào cấu trúc model, benchmark, và kế hoạch hỗ trợ dài hạn. Nếu không có những thứ đó, bạn chỉ đang chạy một smart contract chưa được audit trên mainnet.