Sprytne Okazje — promocje, kody rabatowe i wyprzedaże

Licznik tokenów ChatGPT (GPT-4o, GPT-5) — policz tokeny w tekście

Poznaj liczbę tokenów, znaków, słów i kolorowy podział tekstu na tokeny.

Bezpieczne (SSL)
Przetwarzanie Lokalne
100% Darmowe
Instrukcja
  • 1
    Wprowadź dane
    Wpisz treść, wklej tekst lub załaduj plik z dysku.
  • 2
    Kliknij przycisk
    Narzędzie natychmiast przetworzy Twoje dane w przeglądarce.
  • 3
    Pobierz wynik
    Skopiuj gotowy tekst lub zapisz plik na urządzeniu.
function runTool() {
  return "Wynik gotowy w 0.1s";
}

Ładuję słownik tokenizera…

Liczenie odbywa się w przeglądarce, tekst nie jest nigdzie wysyłany. Modele Claude, Gemini i Llama mają własne tokenizery (niepublikowane lub inne) — dla nich wynik jest tylko orientacyjny, zwykle w granicach kilkunastu procent.

Oceń to narzędzie:

Powiązane narzędzia

Inne narzędzia, które mogą Ci się przydać

Czym jest token i dlaczego modele AI liczą tekst w tokenach

Token to najmniejszy fragment tekstu, na jaki tokenizer dzieli dane wejściowe. To nie zawsze całe słowo: może być część wyrazu, pojedynczy znak, znak interpunkcyjny albo spacja połączona z sąsiednim fragmentem. Modele AI nie czytają tekstu litera po literze — przetwarzają właśnie tokeny, dlatego ich liczba wpływa na to, ile pracy wykonuje model i jak długi tekst może przyjąć.

Nowoczesne modele OpenAI korzystają z tokenizacji BPE, czyli dzielenia na częste fragmenty. Im częstszy fragment w danych treningowych, tym większa szansa, że trafi do słownika jako jeden token. Dzięki temu popularne słowa i zwroty są reprezentowane oszczędnie, a rzadsze konstrukcje mogą rozpaść się na kilka tokenów.

Licznik tokenów w naszym narzędziu używa prawdziwego tokenizera BPE modeli OpenAI z biblioteki gpt-tokenizer. Słowniki są ładowane z serwera, ale obliczenia wykonują się w Twojej przeglądarce. Dzięki temu możesz sprawdzić, jak tokenizer potnie konkretny tekst, zanim wyślesz go do modelu.

Jak policzyć tokeny w narzędziu i jak czytać wynik

Wklej tekst do pola, a licznik pokaże liczbę tokenów, znaków i słów. Zobaczysz też tokeny na słowo oraz znaki na token, a także kolorowy podział tekstu na tokeny — dla tekstów do 3000 tokenów. Kolory pomagają zauważyć, które fragmenty tokenizer połączył w jeden token, a które rozbił na mniejsze części.

Interpretacja jest prosta: tokeny na słowo mówią, ile tokenów przypada średnio na jedno słowo. Wartość bliska 1 oznacza, że większość słów mieści się w pojedynczych tokenach. Wartość wyraźnie większa od 1 sygnalizuje, że tokenizer dzieli słowa na części. Z kolei znaki na token pokazują, jak gęsty jest tekst: im więcej znaków na token, tym mniej tokenów potrzeba na tę samą długość.

Przykład z narzędzia: polski tekst testowy ma 147 znaków i 22 słowa. W tokenizerze o200k_base to 50 tokenów, czyli 2,27 tokenu na słowo. Ten sam tekst w cl100k_base to 52 tokeny. Różnica pokazuje, że nawet dla tego samego języka wynik zależy od użytego słownika.

  • Liczba tokenów — najważniejsza wartość przy planowaniu promptu.
  • Liczba znaków i słów — pomaga porównać teksty o różnej długości.
  • Tokeny na słowo — pokazuje, jak bardzo tokenizer dzieli wyrazy.
  • Znaki na token — pozwala szybko ocenić efektywność zapisu.
  • Kolorowy podział — wizualnie wyjaśnia granice tokenów.

Dlaczego polski tekst zużywa więcej tokenów niż angielski

Polski jest językiem fleksyjnym: słowa zmieniają formę przez przypadki, rodzaje, osoby i liczby. Do tego dochodzą znaki diakrytyczne oraz często dłuższe wyrazy. W danych treningowych modeli angielski występuje zwykle znacznie częściej, więc tokenizer ma dla niego więcej gotowych, częstych fragmentów. Polskie słowa częściej muszą być dzielone na mniejsze kawałki, dlatego zużywają więcej tokenów niż angielskie odpowiedniki.

Skutki są praktyczne. Jeśli ten sam pomysł opiszesz po polsku i po angielsku, polska wersja może zająć więcej tokenów. To oznacza większe zużycie w rozliczeniach API, bo koszty zwykle zależą od liczby przetwarzanych tokenów — narzędzie nie podaje jednak cen ani limitów. Większa liczba tokenów wpływa też na limit kontekstu: prompt, historia rozmowy i odpowiedź muszą zmieścić się w oknie modelu, a polski tekst zajmuje w nim więcej miejsca.

Nie oznacza to, że masz pisać po angielsku. Warto jednak świadomie skracać powtarzalne fragmenty, usuwać zbędne uprzejmości i sprawdzać liczbę tokenów przed wysłaniem długiego tekstu. Dzięki temu lepiej wykorzystasz dostępny kontekst i unikniesz sytuacji, w której model musi ciąć wypowiedź z powodu zbyt długiego wejścia.

Tokenizery o200k_base i cl100k_base — które modele i co z Claude, Gemini i Llama

Narzędzie korzysta z dwóch słowników OpenAI. Poniższa tabela pokazuje przypisanie modeli do słowników.

TokenizerModele
o200k_baseGPT-4o, GPT-4.1, GPT-5, o3, o4-mini
cl100k_baseGPT-4, GPT-3.5 Turbo, embeddingi text-embedding-3

Modele Claude, Gemini i Llama mają własne tokenizery. Dla nich wynik z naszego licznika jest orientacyjny — zwykle mieści się w granicach kilkunastu procent od rzeczywistej liczby tokenów. To wystarczy do oszacowania długości promptu, ale jeśli potrzebujesz dokładnej wartości dla konkretnego modelu spoza OpenAI, traktuj wynik jako przybliżenie.

W praktyce sprawdzaj wynik dla tokenizera zgodnego z modelem, którego używasz. Dla nowszych modeli OpenAI będzie to zwykle o200k_base, a dla starszych GPT-4 i GPT-3.5 Turbo — cl100k_base. Dzięki temu zobaczysz realistyczny podział tekstu i lepiej ocenisz, ile miejsca zajmie prompt.

Jak skrócić prompt bez utraty sensu

Krótszy prompt to mniej tokenów, szybsza analiza i więcej miejsca na odpowiedź modelu. Nie chodzi jednak o wycinanie ważnych informacji, lecz o usuwanie tego, co nie wnosi wartości. Zacznij od celu: napisz jasno, co model ma zrobić, a potem dodaj tylko te dane, które są potrzebne do wykonania zadania.

  1. Usuń powtórzenia i zwroty grzecznościowe, które nie zmieniają instrukcji.
  2. Połącz podobne polecenia w jedno zdanie lub zwięzłą listę.
  3. Zamień długie opisy na konkretne warunki: temat, odbiorca, format, styl.
  4. Nie dawaj kilku przykładów, jeśli wystarczy jeden dobrze dobrany.
  5. Skróć kontekst do faktów i danych, które naprawdę mają wpływ na wynik.
  6. Poproś o odpowiedź w konkretnym formacie, np. listy lub tabeli, zamiast opisywać go rozwlekle.

Po każdej zmianie wklej prompt do licznika tokenów i porównaj wynik. Zobaczysz, które fragmenty zajmują najwięcej tokenów, i łatwiej zdecydujesz, co można skrócić. Pamiętaj, że polski tekst często dzieli się na więcej tokenów niż angielski, więc oszczędzanie słów ma tym większe znaczenie.

Najczęstsze pytania

Ile tokenów ma moje słowo?

To zależy od tokenizera i kontekstu, w jakim słowo występuje. Polskie wyrazy często dzielą się na kilka tokenów, dlatego najlepiej sprawdzić cały tekst w liczniku.

Czy licznik tokenów obsługuje GPT-4o i GPT-5?

Tak. Dla tych modeli używa tokenizera o200k_base, podobnie jak dla GPT-4.1, o3 i o4-mini.

Czym różni się o200k_base od cl100k_base?

To dwa różne słowniki OpenAI. o200k_base obsługuje nowsze modele, a cl100k_base między innymi GPT-4, GPT-3.5 Turbo i embeddingi text-embedding-3.

Dlaczego polski tekst ma więcej tokenów niż angielski?

Polski ma bogatą fleksję, dłuższe wyrazy i znaki diakrytyczne, przez co tokenizer częściej dzieli słowa. Angielski jest lepiej reprezentowany w słownikach, więc jego fragmenty częściej mieszczą się w jednym tokenie.

Czy policzę tokeny dla Claude, Gemini lub Llama?

Możesz sprawdzić tekst, ale wynik będzie orientacyjny. Te modele mają inne tokenizery, a różnica zwykle mieści się w granicach kilkunastu procent.

Czy moje dane są wysyłane na serwer?

Nie. Obliczenia i kolorowy podział tekstu odbywają się w Twojej przeglądarce, a pliki i dane nie są wysyłane na serwer serwisu. Z serwera ładowane są tylko słowniki tokenizerów.

Zobacz też — powiązane narzędzia

Tokenizer: gpt-tokenizer (licencja MIT), słowniki o200k_base i cl100k_base.

Zainstaluj Webp.pl Miej narzędzia we własnej kieszeni!