31 marca 2026 roku Google ogłosiło premierę Gemma 4 – nowej rodziny otwartych modeli językowych, dostępnych na licencji Apache 2.0. Działa lokalnie na telefonie, radzi sobie z obrazami i dźwiękiem, a do uruchomienia wystarczy kilka gigabajtów wolnego miejsca. Sprawdziłem to osobiście na Pixelu 10 Pro, używając aplikacji AI Edge Gallery i mam kilka wniosków, które mogą Cię zaskoczyć.
Co to jest Gemma 4 i czy warto zwrócić na nią uwagę
Gemma to rodzina modeli open-source od Google, budowanych na tej samej bazie badawczej co komercyjny Gemini. Gemma 4 to czwarta generacja tej linii i jednocześnie pierwsza wydana na licencji Apache 2.0 – co w praktyce oznacza, że możesz ją swobodnie modyfikować, dystrybuować i wdrażać w produktach komercyjnych bez opłat licencyjnych. Poprzednie wersje były dostępne na własnej, bardziej restrykcyjnej licencji Google.
Rodzina Gemma 4 składa się z czterech wariantów: E2B (Effective 2B), E4B (Effective 4B), 26B w architekturze Mixture of Experts oraz 31B Dense. Dwa pierwsze są zaprojektowane z myślą o urządzeniach mobilnych i komputerach z ograniczonymi zasobami. Wariant 31B zajął 3. miejsce wśród otwartych modeli w rankingu Arena AI leaderboard, bijąc modele dwudziestokrotnie większe pod względem liczby parametrów.
Co nowego w porównaniu z poprzednią generacją
Gemma 4 wprowadza obsługę wielu modalności wejściowych – model przetwarza tekst, obrazy i dźwięk w jednym oknie kontekstowym sięgającym 128 000 tokenów. Poprzednie modele z serii Gemma 3n obsługiwały głównie tekst. Zmiana licencji na Apache 2.0 to z kolei ruch, który wielu deweloperów czekało od miesięcy – daje pełną swobodę wdrożeń bez prawniczych niespodzianek.
Pełna wersja Gemma 4 E4B oferuje okno kontekstowe 128 000 tokenów – czterokrotnie więcej niż Gemma 3n z jej 32K. Warto jednak wiedzieć, że wersja zoptymalizowana pod Androida za pomocą LiteRT-LM, dostępna w Edge Gallery, ma okno ograniczone do 32K tokenów. Ograniczenie wynika z zasobów pamięci RAM smartfonów – przechowywanie cache dla 128K tokenów po prostu nie mieści się w budżecie pamięciowym przeciętnego urządzenia mobilnego. Jeśli potrzebujesz pełnego okna kontekstowego, musisz sięgnąć po wersję na PC lub laptop.
Wariant E2B może działać przy zużyciu poniżej 1,5 GB pamięci RAM, dzięki wsparciu dla kwantyzacji 2-bitowej i 4-bitowej w LiteRT oraz mechanizmowi memory-mapped embeddings per layer. Model E4B po kwantyzacji zajmuje około 3,6 GB na dysku – co widać na liście modeli w Edge Gallery. Gemma 4 E2B waży 2,5 GB. Dla porównania, klasyczne Gemma3-1B-IT zajmuje 584 MB, ale możliwości są nieporównywalnie węższe.
Testy na Pixelu 10 Pro – Edge Gallery w akcji
AI Edge Gallery to aplikacja od Google służąca do lokalnego testowania modeli językowych bezpośrednio na urządzeniu. Benchmarki przeprowadziłem 6 kwietnia 2026 roku na procesorze (bez akceleratora GPU), każdy model uruchamiany był trzykrotnie, z 256 tokenami prefill i 256 tokenami dekodowania. Wyniki poniżej pokazują uśrednione wartości z trzech przebiegów.
Gemma 4 E4B – wyniki
Gemma-4-E4B-it osiągnęła prędkość prefill na poziomie 54,87 tokenów/sek oraz dekodowanie 3,76 tokenów/sek. Czas do pierwszego tokena wyniósł 4,97 sekundy, pierwsze uruchomienie zajęło 16 425 ms, a kolejne uruchomienia stabilizowały się na 1781 ms. Jak na model obsługujący obraz i dźwięk, działający w całości na CPU smartfona – to wynik godny uwagi.
Gemma 3n E4B – wyniki dla porównania
Poprzednia generacja – Gemma-3n-E4B-it – wypadła szybciej w kilku kategoriach: prefill 69,25 tokenów/sek, dekodowanie 5,22 tokenów/sek, czas do pierwszego tokena 4,10 sek. Inicjalizacja przy pierwszym uruchomieniu wyniosła 13 275 ms, a stały czas inicjalizacji – 1685 ms. Na samej prędkości przetwarzania tekstu Gemma 3n wygrywa z Gemma 4 w testach CPU – co jest logiczne, bo poprzedni model był od podstaw projektowany pod urządzenia mobilne, podczas gdy Gemma 4 niesie ze sobą znacznie więcej możliwości za tę samą cenę parametrów.
DeepSeek-R1-Distill-Qwen-1.5B – punkt odniesienia
Dla pełnego obrazu sytuacji przetestowałem też DeepSeek-R1-Distill-Qwen-1.5B – distillowany model rozumowania od DeepSeek, skompresowany do 1,5B parametrów. Prefill osiągnął 71,07 tokenów/sek, dekodowanie 14,63 tokenów/sek, czas do pierwszego tokena 3,67 sek, a inicjalizacja przy pierwszym uruchomieniu zajęła tylko 6352 ms. Prędkość dekodowania jest kilkukrotnie wyższa od Gemmy 4 E4B – ale model jest też kilkukrotnie mniejszy i ma znacznie węższy zakres zastosowań. Dokładne porównanie wymagałoby zbliżonych rozmiarów modeli.
Zestawienie wyników benchmarków
Poniższa tabela pokazuje zestawienie wszystkich trzech testowanych modeli na Pixelu 10 Pro (CPU, śr. z 3 przebiegów):
| Model | Prefill (tok/sek) | Decode (tok/sek) | Czas do 1. tokena (sek) | Init (pierwsze uruch.) |
|---|---|---|---|---|
| Gemma-4-E4B-it | 54,87 | 3,76 | 4,97 | 16 425 ms |
| Gemma-3n-E4B-it | 69,25 | 5,22 | 4,10 | 13 275 ms |
| DeepSeek-R1-Distill-Qwen-1.5B | 71,07 | 14,63 | 3,67 | 6 352 ms |
Dlaczego Gemma 4 jest wolniejsza od poprzedniczki
Wielu użytkowników może zdziwić fakt, że Gemma 4 E4B jest wolniejsza od Gemma 3n E4B w testach CPU na tym samym urządzeniu. Wyjaśnienie jest dość proste: Gemma 3n była projektowana specjalnie pod kątem wydajności na urządzeniach mobilnych, z mechanizmami jak Per Layer Embeddings czy KVC sharing, które zmniejszają zużycie pamięci i przyspieszają inferencję. Gemma 4 jest modelem szerszym – obsługuje dodatkowe modalności i niesie więcej wiedzy, co ma swoją cenę obliczeniową.
Dla maksymalnej prędkości na telefonach trzeba uruchomić Gemma 4 z akceleracją GPU – według danych z Hugging Face, na iPhonie 17 Pro z backendem GPU model E4B osiąga prędkość dekodowania 25,1 tokenów/sek przy czasie do pierwszego tokena zaledwie 0,9 sekundy. Na procesorze Arm 2.3–2.8 GHz prefill wynosi 82 tokeny/sek. Mój test na CPU Pixela 10 Pro daje wyobrażenie o dolnej granicy wydajności – w realnym użyciu z NPU wyniki byłyby wyraźnie lepsze.
Wielomodalność – co to oznacza w praktyce
Gemma 4 może analizować obraz, czytać tekst i przetworzyć dźwięk w jednym zapytaniu – bez potrzeby wysyłania czegokolwiek do chmury. Dla dewelopera budującego aplikację mobilną oznacza to możliwość stworzenia asystenta, który odpowie na pytanie o treść zdjęcia, przeczyta fakturę albo przeanalizuje nagranie głosowe – wszystko lokalnie, bez konta, bez API, bez rachunków za tokeny.
W wersji mobilnej LiteRT-LM okno kontekstowe wynosi 32K tokenów – wystarczająco, żeby przetworzyć kilkanaście stron tekstu w jednej rozmowie. Jeśli projekt wymaga dłuższych dokumentów, pełne 128K jest dostępne w wersji desktopowej przez Ollama, LM Studio lub Unsloth.
Licencja Apache 2.0 – zmiana, która naprawdę dużo zmienia
Poprzednie modele z serii Gemma były dostępne na własnej licencji Google, która ograniczała komercyjne zastosowania i wymagała akceptacji dodatkowych warunków użytkowania. Od teraz z Apache 2.0 możesz wbudować Gemma 4 w produkt, sprzedawać go, modyfikować model i dystrybuować zmodyfikowaną wersję. Google wprost pisze o „cyfrowej suwerenności" i pełnej kontroli nad danymi, infrastrukturą i modelem.
Z perspektywy dewelopera czy małej firmy budującej produkty AI – Apache 2.0 usuwa dużą część prawnej niepewności, która przez lata hamowała wdrożenia otwartych modeli w poważnych zastosowaniach biznesowych. Jeśli wcześniej ktoś wzdychał przy czytaniu licencji Gemma 1 lub 2, teraz ma powód, żeby wrócić do lektury.
Jak uruchomić Gemma 4 na telefonie
Najprostszą drogą na Androidzie jest aplikacja AI Edge Gallery, dostępna w Google Play. Po zainstalowaniu widzisz listę dostępnych modeli – Gemma 4 E2B zajmuje 2,5 GB, E4B to 3,6 GB. Model pobierasz jednym kliknięciem i możesz od razu uruchomić benchmark albo porozmawiać z modelem w trybie czatu. Aplikacja obsługuje tryb testowy z konfigurowalnymi parametrami (liczba tokenów prefill i decode, liczba przebiegów), co pozwala na precyzyjne pomiary na własnym urządzeniu.
Na komputerze lokalnie, z użyciem LiteRT-LM, Gemma 4 E2B uruchomisz na Raspberry Pi 5 z prędkością 133 tokenów/sek prefill i 7,6 tokenów/sek decode – Google podaje to jako oficjalny benchmark. Dla laptopów i desktopów dostępne są też warianty przez Unsloth Studio, gdzie E2B i E4B działają w kwoantyzacji 4-bit przy 4–5 GB RAM z prędkością powyżej 10 tokenów/sek.
Gemma 4 a ekosystem modeli mobilnych
Rynek lokalnych modeli językowych na urządzenia mobilne rozwija się szybko. Według danych z Hugging Face, liczba pobrań modeli zoptymalizowanych pod urządzenia mobilne wzrosła kilkukrotnie w ciągu ostatnich 12 miesięcy. Gemma 4, Meta Llama 4 i distillowane modele DeepSeek tworzą nową kategorię - modele kieszonkowe zdolne do zadań, które rok temu wymagały chmury lub serwera GPU.
DeepSeek-R1-Distill-Qwen-1.5B w moich testach osiągnął 14,63 tokenów/sek dekodowania – prawie czterokrotnie więcej niż Gemma 4 E4B na tym samym CPU. Model rozumowania w tak kompaktowej formie to solidna propozycja dla zadań wymagających logicznego wnioskowania. Jeśli zależy Ci głównie na szybkości i masz prostsze zapytania tekstowe, mały model może być lepszym wyborem niż duży model multimodalny. Wszystko zależy od zastosowania.
Gemma 4 nie jest dla każdego ani do wszystkiego i w zasadzie to dobrze, że Google nie próbuje udawać, że jest inaczej. Model E4B na CPU smartfona działa wolniej od poprzednika, ale oferuje coś, czego poprzednik nie miał - wielomodalność, większy kontekst i otwartą licencję bez niespodzianek. Jeśli budujesz cokolwiek, co ma działać lokalnie, przetwarzać różne formaty danych i być wdrażalne bez umów licencyjnych z prawnikiem w tle – Gemma 4 jest warta poświęcenia godziny na testy.
Źródła: Własne, Hugging Face, GitHub, Google