Warto odnotować, że jest to trzecia duża aktualizacja modeli z tej serii w ciągu raptem sześciu tygodni. Gemini 3.7 Flash został bowiem wydany w sierpniu, a Gemini 3.6 Flash w lipcu.
Zmiany w najnowszej iteracji nie wynikają jednak wyłącznie z nowej architektury. Model po prostu dostał przyzwolenie na dłuższą i bardziej zasobożerną pracę. Najpewniej to odpowiedź na dynamiczny rozwój modeli Anthropic, OpenAI czy xAI, które coraz lepiej radzą sobie z pisaniem kodu.
WIDEO
Gemini 3.8 Flash: programowanie i wieloetapowe wnioskowanie
Podstawowy wariant 3.8 Flash ma sprawdzać się przede wszystkim w roli autonomicznego agenta programistycznego. Google chwali się, że w teście DeepSWE v1.1, weryfikującym rozwiązywanie złożonych zadań inżynieryjnych od początku do końca, model osiąga wyniki przewyższające część znacznie większych i droższych systemów konkurencji. Podobne wzrosty widać w benchmarkach branżowych - od analiz finansowych (Vals Finance Agent V2), przez zadania prawne (Harvey), aż po ogólny sprawdzian wiedzy akademickiej HLE-Verified, gdzie zanotowano wynik na poziomie 54,9 proc.
Co istotne, twórcy wprost tłumaczą, skąd biorą się te zyski. Gemini 3.8 Flash nie tyle zyskał skokowy przyrost wiedzy, ile działa bardziej skrupulatnie:
- wykonuje dodatkowe kroki analityczne przed udzieleniem odpowiedzi;
- częściej i w sposób powtarzalny sięga po zewnętrzne narzędzia;
- przy skomplikowanych poleceniach generuje wyraźnie więcej tokenów roboczych.
Dla deweloperów oznacza to kompromis: wyższa skuteczność może wiązać się z większym zużyciem tokenów i dłuższym czasem oczekiwania. Z tego powodu Google pozwala regulować poziom wysiłku obliczeniowego (effort levels), a dla projektów, w których priorytetem pozostaje minimalny koszt i natychmiastowa odpowiedź, nadal utrzymuje wsparcie dla wersji 3.7 Flash.
Gemini 3.8 Flash Cyber: automatyczne łatanie zamiast exploitów
Druga z nowości, wariant Cyber, została stworzona z myślą o zespołach odpowiedzialnych za bezpieczeństwo IT. Google zrezygnował ze wzmacniania funkcji ofensywnych (tworzenie exploitów) na rzecz automatycznego wyszukiwania i naprawiania podatności.
Google powołuje się na testy branżowe, według których model radzi sobie zauważalnie lepiej od poprzedników:
- Wykrywanie luk: w teście CyberGym przewyższa model 3.5 Flash Cyber, a w wewnętrznych testach Google obejmujących 20 języków programowania osiąga ponad 70 proc. skuteczności w lokalizowaniu błędów.
- Naprawa kodu: na benchmarku CWE-Bench model uzyskał 47,2 proc. wskaźnika poprawnych poprawek (pass@1), co zbliża go do czołówki modeli wiodących (47,8 proc.), przy wielokrotnie niższym koszcie pojedynczego zapytania.
Google wdrożył już wersję Cyber we własnych strukturach. Zespół Chrome Security miał odnotować 2,6-krotnie więcej poprawnych łatek niż przy użyciu konkurencyjnych, dużych modeli komercyjnych. Z kolei badacze bezpieczeństwa chmury Google wykorzystali model do namierzenia krytycznej luki systemowej w niespełna dwie godziny, podczas gdy w tradycyjnych warunkach proces ten miał zajmować zazwyczaj całe miesiące.
Podstawowe wydanie Gemini 3.8 Flash trafi do szerokiego grona użytkowników.
- Dla użytkowników indywidualnych: model zasila aplikację Gemini, tryb AI w wyszukiwarce Google oraz Arkusze Google dla subskrybentów planów Google AI Pro i Ultra.
- Dla deweloperów i firm: dostępne przez Gemini API (Google AI Studio, Android Studio), Google Antigravity, narzędzie Stitch oraz w ramach pakietu Gemini Enterprise.
Ze względu na specyfikę narzędzi cyberbezpieczeństwa, wariant 3.8 Flash Cyber nie będzie powszechnie dostępny. Google ogranicza do niego dostęp w ramach programu Fairwind, kierując go wyłącznie do zweryfikowanych podmiotów: operatorów infrastruktury krytycznej, instytucji rządowych oraz opiekunów kluczowych projektów open source.