
Hôm nay, Google đã ra mắt ba mô hình AI mới: Gemini 3.6 Flash, 3.5 Flash-Lite và 3.5 Flash Cyber. Điều này không như hầu hết mọi người mong đợi.
Sau khi công bố Gemini 3.5 Flash tại Google I/O 2026 vào tháng 5 và hứa hẹn phiên bản Pro sẽ ra mắt trong vòng một tháng, Google đã lặng lẽ bỏ lỡ thời hạn của chính mình. Gemini 3.5 Pro bị trì hoãn do không đạt được các mục tiêu nội bộ, theo Bloomberg, đặc biệt là trong các tác vụ lập trình. Một nỗ lực vào cuối tháng 6 nhằm khắc phục bằng cách cập nhật dữ liệu huấn luyện—các bộ dữ liệu khổng lồ mà mô hình học hỏi từ đó—đã mang lại kết quả đáng thất vọng. Cổ phiếu Alphabet đã giảm khoảng 4,4% sau báo cáo này, xóa sổ ước tính 200 tỷ USD vốn hóa thị trường chỉ trong một phiên giao dịch.
Mô hình cấp Pro gần đây nhất mà Google phát hành là phiên bản kế nhiệm của Gemini 3, Gemini 3.1 Pro, vào tháng 2.
Dòng Flash là các mô hình được Google tối ưu hóa về tốc độ—nhanh, hiệu quả về chi phí và được xây dựng cho các tác nhân AI, là các chương trình hoạt động bán tự động để xử lý các tác vụ như quản lý tài liệu, xử lý các luồng dữ liệu, hoặc duyệt web mà không cần con người nhấp qua từng bước. Các mô hình Pro là những "người nâng vác nặng": chậm hơn, đắt hơn và được xây dựng cho các lập luận phức tạp, nơi sức mạnh thô quan trọng hơn tốc độ.
Gemini 3.6 Flash là phiên bản phát hành chính. Nó sử dụng ít hơn 17% token đầu ra—token là đơn vị cơ bản mà AI xử lý, tương đương khoảng ba phần tư của một từ—so với 3.5 Flash, theo Chỉ số Phân tích Nhân tạo. Nó cũng rẻ hơn: 1,50 USD cho mỗi triệu token đầu vào và 7,50 USD cho mỗi triệu token đầu ra, giảm từ 9 USD ở phía đầu ra của 3.5 Flash. Đối với các doanh nghiệp vận hành tác nhân ở quy mô lớn, sự khác biệt này sẽ nhanh chóng tích lũy.
Trong các bài kiểm tra chuẩn—các bài kiểm tra tiêu chuẩn đánh giá AI theo tỷ lệ phần trăm các tác vụ hoàn thành chính xác—3.6 Flash đạt 49% trên DeepSWE v1.1, kiểm tra kỹ thuật phần mềm tầm xa như xây dựng và gỡ lỗi toàn bộ cơ sở mã, so với 37% của 3.5 Flash. Trong MLE-Bench, một bài kiểm tra kỹ thuật học máy, nó đạt 63,9% so với 49,7%. Nó đứng đầu bảng trên OSWorld-Verified—một bài kiểm tra trong đó AI điều khiển màn hình máy tính để hoàn thành các tác vụ thực tế—ở mức 83,0%, vượt qua Claude Sonnet 5 (81,2%) và GPT-5.6 Luna (72,6%).
Các đối thủ cùng loại vẫn dẫn đầu ở những nơi khác: GPT-5.6 Luna đạt 67% trên DeepSWE và 84,7% trên Terminal-Bench 2.1, kiểm tra khả năng lập trình terminal tác nhân. Claude Sonnet 5 đứng đầu về công việc tri thức trên GDPval-AA v2—một điểm chuẩn được chấm theo thang điểm Elo giống cờ vua, trong đó số điểm cao hơn có nghĩa là hiệu suất tác vụ thực tế tốt hơn—ở mức 1607 so với 1421 của 3.6 Flash.
Chúng tôi đã thử nghiệm mô hình này để lập trình và kết quả… ít nhất là không mấy ấn tượng. Bài kiểm tra lập trình đơn giản của chúng tôi đã tạo ra một tệp không thể sử dụng. HTML không được định dạng đúng cách, và các yếu tố không được hiển thị chính xác. Các lần thử nghiệm tiếp theo để "vibe code" tìm cách giải quyết vấn đề đều không thành công.
Chúng tôi đã yêu cầu Deepseek biến mô hình đầu tiên thành một thứ có thể chơi được bằng cách đơn giản sửa lỗi. Nó đã xác định 11 lỗi và thực hiện 8 sửa lỗi quan trọng, mang lại một trò chơi khá tốt.
Những điều chỉnh nhỏ của Deepseek đã sửa được trò chơi, có nghĩa là, tư duy cốt lõi của Gemini là đúng, nhưng các chi tiết và sự thiếu chính xác đã khiến kết quả trở nên vô dụng. Hãy chuẩn bị cho những phiên "vibe code" dài với một mô hình rẻ nhưng hoạt động kém nếu bạn định sử dụng mô hình đó cho mục đích này.
Mô hình thứ hai do Google phát hành, Gemini 3.5 Flash-Lite, được xây dựng hoàn toàn cho khối lượng lớn: 350 token đầu ra mỗi giây với chi phí 0,30 USD/triệu token đầu vào và 2,50 USD/triệu token đầu ra. Nó hướng đến các luồng dữ liệu thông lượng cao—hãy nghĩ đến việc xử lý tài liệu ở quy mô lớn hoặc các hệ thống tìm kiếm tác nhân—và vượt trội hơn 3 Flash cũ hơn trong các tác vụ lập trình quan trọng, bao gồm Terminal-Bench 2.1 (54% so với 31%), mặc dù rẻ hơn đáng kể.
Nó cũng có thể là một công cụ nén phiên hiệu quả (phân tích các phiên dài và trích xuất các yếu tố chính để tác nhân của bạn không bị nhiễu) cho những ai đang sử dụng Hermes và Openclaw.
Mô hình thứ ba, Gemini 3.5 Flash Cyber, sẽ không được cung cấp công khai. Google đang hạn chế nó cho các chính phủ và các đối tác được kiểm duyệt cần tìm và khắc phục các lỗ hổng phần mềm—một khả năng sử dụng kép mà công ty không thoải mái phát hành rộng rãi.
Trong khi đó, nhóm DeepMind của Google đã chuyển sang bước tiếp theo. Google xác nhận trong thông báo chính thức rằng họ đã bắt đầu "đợt tiền huấn luyện tham vọng nhất từ trước đến nay, dành cho Gemini 4," và đội ngũ này đang rất kỳ vọng vào nó.
Tiền huấn luyện là giai đoạn nền tảng nơi một mô hình học hỏi từ các bộ dữ liệu khổng lồ trước khi bắt đầu tinh chỉnh cho các tác vụ cụ thể—có nghĩa là Gemini 4 đang được xây dựng, chứ không phải chỉ đang được lên kế hoạch.
Chúng tôi đã bắt đầu đợt tiền huấn luyện tham vọng nhất từ trước đến nay, dành cho Gemini 4, và rất hào hứng với tiến độ : )
— Logan Kilpatrick (@OfficialLoganK) ngày 21 tháng 7 năm 2026
Cả 3.6 Flash và 3.5 Flash-Lite đều đã có mặt hôm nay trong ứng dụng Gemini, Google AI Studio và thông qua API. Gemini 3.5 Pro sẽ được phát hành, theo Google, "ngay khi sẵn sàng," bất cứ khi nào đó.