Gemini 3.8 Flash

Gemini 3.8 Flash od Google AI: $0.75 wejście i $3.75 wyjście za 1M tokenów, kontekst 1.0M. Wywołuj przez bramkę LLM odnogi.

RozumowanieCzyta obrazyWywoływanie narzędziSchemat JSONStreamingWyszukiwanie w sieciCache promptuBatch

Gemini 3.8 Flash jest dostarczany przez Google AI i wywoływany przez odnogę na /v1/chat/completions, w tym samym formacie zgodnym z OpenAI co pozostałe modele na tym endpoincie. To model rozumujący — zużywa dodatkowe tokeny wyjściowe na rozumowanie, więc przy trudnych zadaniach licz się z wyższym kosztem wyjścia. Przyjmuje obrazy obok tekstu. Obsługuje wywoływanie narzędzi i funkcji. Można wymusić zwracanie ustrukturyzowanego JSON-a. Okno kontekstu 1.0M tokenów wyznacza, ile wejścia zmieścisz w jednym wywołaniu. Pamięć podręczna wejścia kosztuje $0.075 za 1M tokenów, więc powtarzane prefiksy są tańsze.

Specyfikacja i cena

DostawcaGoogle AI
ID modelugemini-3.8-flash
Okno kontekstu1.0M tokenów
Maks. wyjście66K tokenów
Wywołanie przez/v1/chat/completions
MożliwościRozumowanie, Czyta obrazy, Wywoływanie narzędzi, Schemat JSON, Streaming, Wyszukiwanie w sieci, Cache promptu, Batch
Twój plan
Za 1M tokenówKoszt dostawcyTwoja cena na planie Free+7%
Wejście$0.75$0.806
Wyjście$3.75$4.03
Pamięć podręczna wejścia$0.075$0.081

Koszt dostawcy to cena katalogowa za milion tokenów zapisana w katalogu odnoga; Twoja cena stosuje marżę planu tym samym wzorem, który rozlicza każdy request — zobacz cennik. Cennik

Wywołaj przez odnogę

const res = await fetch("https://api.odnoga.com/v1/chat/completions", {
  method: "POST",
  headers: {
    Authorization: `Bearer ${process.env.ODNOGA_API_KEY}`,
    "Content-Type": "application/json",
  },
  body: JSON.stringify({
    model: "gemini-3.8-flash",
    messages: [{ role: "user", content: "Hello" }],
  }),
});

Jeden endpoint, jeden klucz, jeden rachunek — /v1/chat/completions ma ten sam format niezależnie od dostawcy. Zmieniasz identyfikator modelu, a odnoga zajmuje się kluczami, routingiem, limitami i rozliczeniem kosztów.

Co potrafi Gemini 3.8 Flash

Wszystko poniżej to funkcje, które obsługuje sam model. Jeśli poprosisz o coś, czego nie potrafi, odnoga powie Ci o tym, zanim wywołanie trafi do dostawcy — zamiast zwrócić gorszą odpowiedź.

Rozumowanie

Rozkłada problem na kroki, zanim odpowie — zużywa więcej tokenów, ale lepiej radzi sobie z trudnymi zadaniami.

Czyta obrazy

Wyślij zrzut ekranu, zdjęcie albo skan w tej samej wiadomości co tekst.

Wywoływanie narzędzi

Model wywołuje funkcje, które sam zdefiniujesz, i korzysta z tego, co zwrócą.

Tryb JSON

Odpowiada poprawnym JSON-em, zamiast tekstem, który trzeba dopiero parsować.

Schemat JSON

Odpowiada dokładnie w takiej strukturze, jaką podasz — odpowiedź pasuje do Twoich typów bez ścieżki awaryjnej.

Streaming

Tokeny przychodzą na bieżąco, więc Twój interfejs zaczyna odpowiadać od razu.

Wyszukiwanie w sieci

Potrafi sprawdzić coś w sieci, zamiast odpowiadać wyłącznie z danych treningowych. Rozliczane za wyszukiwanie.

Cache promptu

Prompt wysyłany wielokrotnie liczy się po stawce cache — ułamku ceny wejścia.

Batch

Zadania, które mogą poczekać, przechodzą taniej.

Poza tekstem

Słucha dźwięku

Przyjmuje nagraną mowę jako wejście.

Ogląda wideo

Przyjmuje wideo na wejściu i odpowiada na pytania o to, co się w nim dzieje.

Dokładniejsza kontrola

  • Wyjście strukturalne · Dostawca gwarantuje zgodność ze schematem, a nie tylko do niej dąży.

Jak używać Gemini 3.8 Flash

Opracowano na podstawie danych tego modelu w katalogu odnogi.

Najlepszy do

  • Problemy wieloetapowe, które trzeba rozpisać: planowanie, debugowanie, uzgadnianie danych, analiza z krokami pośrednimi.
  • Zadania łączące obraz z tekstem — zrzuty ekranu, skany dokumentów, wykresy, zdjęcia produktów.
  • Agenci i workflow wywołujące Twoje funkcje — model obsługuje wywoływanie narzędzi.
  • Wyjście nadające się do zapisu w bazie — wymuszony JSON.
  • Długie wejścia: okno 1.0M tokenów mieści całe umowy, repozytoria lub transkrypcje w jednym requeście.
  • Czaty dla użytkownika, gdzie odpowiedź ma pojawiać się w trakcie pisania.

Nie wybieraj go, gdy

  • Proste, częste wywołania — rozumowanie zużywa dodatkowe tokeny wyjściowe, więc model bez rozumowania z tego samego katalogu bywa tańszy i szybszy.
  • Zadania, gdzie błędna odpowiedź jest kosztowna bez kontroli człowieka — żaden model w katalogu tego nie znosi.

Praktyczne wskazówki dla odnogi

  1. 01Przypnij id modelu do wersji zarządzanego promptu — zmiana modelu jest wtedy zmianą wersji, którą można porównać i wycofać, a nie edycją w kodzie aplikacji.
  2. 02Porównaj go z 2–8 innymi modelami na tych samych zamrożonych przypadkach testowych w laboratorium ewaluacji, zanim ustawisz go jako domyślny w produkcji.
  3. 03Trzymaj stałą część promptu na początku: cache wejścia kosztuje $0.075 za 1M tokenów zamiast $0.75.
  4. 04Przy powtarzalnych, deterministycznych wywołaniach odnoga zwraca zapisaną odpowiedź i nie nalicza tokenów vendora — wyłącz to dla treści kreatywnych.
  5. 05Proś o JSON przez format odpowiedzi, a nie w treści promptu — schemat jest wtedy wymuszony, a nie sugerowany.
  6. 06Zaplanuj budżet tokenów wyjściowych: rozumowanie liczy się po stronie wyjścia, więc krótka odpowiedź nadal bywa drogim wywołaniem.
  7. 07Ustaw model zapasowy na trasie, by awaria vendora obniżała jakość zamiast zwracać błąd, oraz budżet na tenanta, by jeden klient nie wydał całego miesiąca.

Ile kosztuje miesiąc

1 000 wywołań miesięcznie, po 10 000 tokenów wejścia i 2 000 tokenów wyjścia, w Twojej cenie na planie Free (koszt dostawcy +7%):

Wejście (10M tokenów)$8.06
Wyjście (2M tokenów)$8.06
Twój koszt miesięcznie na planie Free$16.13

Koszt katalogowy dostawcy $15.00 + marża odnogi $1.13 (+7%). Pamięć podręczna wejścia lub ponowne użycie odpowiedzi ją obniża; odnoga zapisuje obie wartości dla każdego requestu.

Jeśli Gemini 3.8 Flash to nie to

Modele, które przyjmują ten sam rodzaj danych, są rozliczane tak samo i robią najbardziej zbliżone rzeczy. To nie ranking jakości — odnoga nie testuje modeli porównawczo.

ModelKontekstWejście / 1MWyjście / 1MMożliwości
Gemini 3.8 Flash1.0M$0.75$3.75Rozumowanie, Czyta obrazy, Wywoływanie narzędzi, Schemat JSON, Streaming, Wyszukiwanie w sieci, Cache promptu, Batch
Gemini 3.6 Flash1.0M$0.75$3.75Rozumowanie, Czyta obrazy, Wywoływanie narzędzi, Schemat JSON, Streaming, Wyszukiwanie w sieci, Cache promptu, Batch
Gemini 3.7 Flash1.0M$0.75$3.75Rozumowanie, Czyta obrazy, Wywoływanie narzędzi, Schemat JSON, Streaming, Wyszukiwanie w sieci, Cache promptu, Batch
Gemini 3 Flash Preview1.0M$0.5$3Rozumowanie, Czyta obrazy, Wywoływanie narzędzi, Schemat JSON, Streaming, Wyszukiwanie w sieci, Cache promptu, Batch

Pytania

Ile kosztuje Gemini 3.8 Flash za 1M tokenów?
Google AI podaje $0.75 / $3.75 za 1M tokenów wejścia / wyjścia w katalogu odnoga. Przez odnoga płacisz cenę vendora plus marżę planu, a każdy request zapisuje obie wartości.
Do czego najlepiej nadaje się Gemini 3.8 Flash?
Problemy wieloetapowe, które trzeba rozpisać: planowanie, debugowanie, uzgadnianie danych, analiza z krokami pośrednimi. Zadania łączące obraz z tekstem — zrzuty ekranu, skany dokumentów, wykresy, zdjęcia produktów. Agenci i workflow wywołujące Twoje funkcje — model obsługuje wywoływanie narzędzi.
Czy mogę przełączyć się na Gemini 3.8 Flash bez zmiany kodu?
Tak. odnoga udostępnia jeden endpoint zgodny z OpenAI — przełączenie to wysłanie "gemini-3.8-flash" jako id modelu lub zmiana w wersji zarządzanego promptu, bez wdrożenia aplikacji.
Jak duże jest okno kontekstu Gemini 3.8 Flash?
1.0M tokenów wejścia, do 66K tokenów wyjścia na odpowiedź.

Wszystkie modele · Cennik · Dokumentacja · Porównaj modele w laboratorium ewaluacji

Jedna bramka, każdy model.