Các nhà phát triển và khách hàng đang xây dựng AI agent production cần hiệu suất token cao hơn, độ trễ thấp hơn và hiệu suất đáng tin cậy hơn. Dòng Flash của chúng tôi được xây dựng để đáp ứng điểm cân bằng giữa hiệu quả và chất lượng, giúp mở rộng quy mô quy trình agentic.
Thank you for reading this post, don't forget to subscribe!- 3.6 Flash: Mô hình chủ lực mang lại hiệu suất coding, làm việc tri thức và đa phương thức tốt hơn. Theo Artificial Analysis Index, mô hình giảm 17% lượng token đầu ra so với 3.5 Flash, và trong một số benchmark như DeepSWE của Datacurve, chúng tôi ghi nhận mức giảm lên tới 65%, tất cả với chi phí mỗi token đầu ra thấp hơn.
- 3.5 Flash-Lite: Mô hình nhanh nhất, tiết kiệm chi phí nhất trong dòng 3.5, đạt 350 token đầu ra mỗi giây theo Artificial Analysis Index, đồng thời vượt trội so với các thế hệ Flash-Lite trước trong quy trình agentic.
- 3.5 Flash Cyber trong CodeMender: Các ứng dụng an ninh mạng thành công đòi hỏi sự phối hợp cẩn thận giữa mô hình và hạ tầng agent. Chúng tôi giới thiệu sự kết hợp giữa một mô hình chuyên biệt về an ninh mạng mới, hiệu quả cao, cùng với agent bảo mật mã CodeMender, mang lại hiệu suất cạnh tranh ở cấp độ tiên phong.
Ngoài các bản phát hành hôm nay, Gemini 3.5 Pro hiện đang được thử nghiệm với đối tác và chúng tôi dự kiến sẽ phát hành rộng rãi ngay khi sẵn sàng. Song song đó, đội ngũ của chúng tôi đã bắt đầu tập trung xây dựng thế hệ mô hình tiếp theo. Chúng tôi đã khởi động đợt tiền huấn luyện tham vọng nhất từ trước đến nay cho Gemini 4 và rất hào hứng với tiến trình đạt được.
3.6 Flash: Hiệu quả hơn và chất lượng tốt hơn 3.5 Flash
Gemini 3.6 Flash được xây dựng dựa trên phản hồi trực tiếp từ nhà phát triển và khách hàng đối với 3.5 Flash. 3.6 Flash không chỉ mang lại bước tiến trong coding và làm việc tri thức mà còn cải thiện đáng kể hiệu suất token. Ví dụ, trên Artificial Analysis Index, chúng tôi thấy 3.6 Flash tiêu thụ ít hơn 17% token đầu ra so với 3.5 Flash. Nó cũng cần ít bước suy luận và gọi công cụ hơn để hoàn thành quy trình đa bước.
Hiệu suất nâng cao này đi kèm với mức giá thấp hơn so với 3.5 Flash. Với $1,50/1M token đầu vào và $7,50/1M token đầu ra, 3.6 Flash giảm tổng chi phí cho mỗi tác vụ agentic, giúp việc xây dựng và vận hành agent trở nên tiết kiệm hơn.

3.6 Flash cho thấy hiệu suất token tốt hơn và giảm độ dài dòng so với 3.5 Flash trong tác vụ OSWorld đã xác minh (API)
Mặc dù hiệu quả hơn, 3.6 Flash vẫn ghi nhận tăng trưởng hiệu suất so với 3.5 Flash trên nhiều trường hợp sử dụng:
- 3.6 Flash đạt độ chính xác cao hơn với ít chỉnh sửa mã không mong muốn và giảm vòng lặp thực thi, như trong DeepSWE (49% so với 37%), và cải thiện đáng kể trong Nghiên cứu Học máy, như MLE Bench (63,9% so với 49,7%).
- Nó cải thiện khả năng sử dụng máy tính (computer use) như trong OSWorld-Verified (83,0% so với 78,4%). Computer use hiện là công cụ tích hợp sẵn phía client qua Gemini API và Gemini Enterprise.
- Nó vượt trội so với 3.5 Flash trong làm việc tri thức, bằng chứng qua các benchmark như GDPval-AA v2 (1421 so với 1349). Các khách hàng như Hebbia và Harvey nhận thấy nó đặc biệt mạnh trong các tác vụ đa phương thức như phân tích tài liệu, biểu đồ và dữ liệu, và soạn thảo báo cáo.


Khách hàng cho biết 3.6 Flash là một bước tiến về cả chi phí lẫn chất lượng, cân bằng hiệu suất token, độ chính xác và tốc độ trên các quy trình phức tạp và tác vụ tri thức:




Được xây dựng với an toàn
3.6 Flash được phát hành với các biện pháp bảo vệ Frontier Safety nâng cao trong các lĩnh vực lạm dụng hóa học, sinh học, phóng xạ, hạt nhân (CBRN) và tấn công mạng. Các biện pháp này giúp mô hình chống lại các cuộc tấn công jailbreak tốt hơn. Đồng thời, mô hình đã được huấn luyện để giảm thiểu từ chối đối với các sử dụng có lợi.
Để biết thêm thông tin, hãy xem thẻ mô hình 3.6 Flash.
3.5 Flash-Lite: Được xây dựng để mở rộng quy mô quy trình agentic
Ngoài Flash, chúng tôi cũng phát hành Gemini 3.5 Flash-Lite, được thiết kế cho cả tác vụ có độ trễ thấp và tác vụ cần thông lượng cao trong quy trình của nhà phát triển, như tìm kiếm agentic và xử lý tài liệu.
3.5 Flash-Lite là mô hình nhanh nhất trong dòng 3.5. Theo Artificial Analysis, nó chạy ở tốc độ 350 token/s. Với giá $0,3/1M token đầu vào và $2,5/1M token đầu ra, chất lượng tốt hơn đáng kể so với 3.1 Flash-Lite, 3.5 Flash-Lite mang lại tỷ lệ giá-hiệu suất mạnh mẽ cho các nhà phát triển và khách hàng chạy lưu lượng production cao.

3.5 Flash-Lite thực thi tác vụ khối lượng lớn với độ trễ thấp hơn 3.5 Flash.
3.5 Flash-Lite cho phép mở rộng quy mô hiệu quả cho hệ thống agentic. Ở tất cả các mức suy luận, mô hình vượt trội so với 3.1 Flash-Lite. Tùy theo khối lượng công việc, nhà phát triển có thể cấu hình mô hình để ưu tiên thực thi có độ trễ thấp, chi phí thấp cho các tác vụ khối lượng lớn với mức suy luận tối thiểu và thấp, hoặc sử dụng mức suy luận cao hơn để xử lý khối lượng công việc của subagent đa bước. Mô hình hiện cũng có computer use như một công cụ tích hợp để hỗ trợ đáng tin cậy các tác vụ agentic trên nhiều bề mặt.
Đây là bước tiến đáng kể trong coding và tác vụ agentic, thể hiện qua Terminal-Bench 2.1 (54% so với 31%), ngữ cảnh dài qua GDM-MRCR v2 (72,2% so với 60,1%), và thực thi tác vụ thực tế qua GDPval-AA v2 (1140 so với 642).

Thực tế, trên nhiều eval agentic và coding, 3.5 Flash-Lite thậm chí vượt trội hơn cả 3 Flash, bao gồm SWE-Bench Pro (54,2% so với 49,6%) và OSWorld-Verified (74,0% so với 65,1%), khiến nó trở thành lựa chọn nhanh hơn và mạnh hơn cho khối lượng công việc trên cả 2.5 và 3 Flash.



Để biết thêm thông tin về mô hình, hãy xem thẻ mô hình 3.5 Flash-Lite.
3.5 Flash Cyber trong CodeMender: Tìm và sửa lỗ hổng hiệu quả
Các mô hình AI đã trở nên có khả năng phát hiện lỗ hổng bảo mật nhanh hơn các hệ thống hiện tại có thể sửa chúng. Giải quyết mối đe dọa ngày càng tăng này đòi hỏi một cách tiếp cận bảo mật phần mềm có năng lực cao và hiệu quả.
Hiệu suất và hiệu quả của Flash khiến nó trở thành nền tảng lý tưởng để phát hiện, xác thực và vá các vấn đề bảo mật mã ở quy mô lớn. Gemini 3.5 Flash Cyber được xây dựng trên cơ sở 3.5 Flash và tinh chỉnh để tìm và sửa các lỗ hổng an ninh mạng với giá mỗi token thấp hơn so với các mô hình lớn hơn.
Trong CodeMender, sử dụng nhiều agent 3.5 Flash Cyber làm việc cùng nhau để tạo ra một báo cáo tổng hợp duy nhất, 3.5 Flash Cyber đạt hiệu suất cạnh tranh ở cấp độ tiên phong trên benchmark CyberGym phổ biến.

Với tính chất sử dụng kép của công nghệ này, chúng tôi đã có cách tiếp cận có chủ đích trong việc triển khai 3.5 Flash Cyber. Mô hình sẽ chỉ được cung cấp độc quyền cho các chính phủ và đối tác tin cậy thông qua CodeMender trong khuôn khổ chương trình thí điểm truy cập hạn chế. Điều này giúp những người bảo vệ tuyến đầu có lợi thế trong việc tìm và sửa các lỗ hổng quan trọng trước khi chúng bị khai thác, đồng thời giảm thiểu lạm dụng rộng rãi.
3.6 Flash và 3.5 Flash-Lite: Bắt đầu ngay hôm nay
3.6 Flash và 3.5 Flash-Lite đã có sẵn từ hôm nay:
- Dành cho nhà phát triển trong Gemini API qua Google AI Studio và Android Studio. 3.6 Flash cũng có sẵn trong Google Antigravity. Bắt đầu với Hướng dẫn dành cho nhà phát triển.
- Dành cho doanh nghiệp trong Gemini Enterprise Agent Platform. 3.6 Flash cũng có sẵn trong ứng dụng Gemini Enterprise.
- Dành cho mọi người qua ứng dụng Gemini. 3.5 Flash-Lite cũng đang được triển khai trong Google Search.
Khi bạn bắt đầu xây dựng với 3.6 Flash và 3.5 Flash-Lite, chúng tôi hoan nghênh phản hồi của bạn để cải thiện các mô hình Gemini trong tương lai và mong sớm phát hành 3.5 Pro.
Bài viết được biên dịch và tổng hợp từ bài gốc.

