Piaskownica rozpoznawania mowy
Testuj Web Speech Recognition API przeglądarki: zamień mowę na tekst na żywo. Sprawdź obsługę języków i dokładność. Bezpłatnie.
-
1Wprowadź dane
Wpisz treść, wklej tekst lub załaduj plik z dysku. -
2Kliknij przycisk
Narzędzie natychmiast przetworzy Twoje dane w przeglądarce. -
3Pobierz wynik
Skopiuj gotowy tekst lub zapisz plik na urządzeniu.
return "Wynik gotowy w 0.1s";
}
Oceń to narzędzie:
Powiązane narzędzia
Inne narzędzia, które mogą Ci się przydaćPiaskownica rozpoznawania mowy — Web Speech API w przeglądarce
Piaskownica rozpoznawania mowy to interaktywne narzędzie do testowania przeglądarkowegyo API Web Speech — technologii umożliwiającej zamienianie mowy na tekst (Speech-to-Text) bezpośrednio w przeglądarce, bez konieczności instalowania dodatkowego oprogramowania.
Czym jest Web Speech API?
Web Speech API to standard W3C umożliwiający aplikacjom webowym dostęp do funkcji rozpoznawania mowy (SpeechRecognition) i syntezy głosu (SpeechSynthesis) wbudowanych w przeglądarkę. Rozpoznawanie mowy jest obsługiwane przez Google Chrome, Microsoft Edge i Safari — Firefox nie obsługuje SpeechRecognition w wersji stabilnej. API wysyła nagrany dźwięk do chmury Google lub systemu lokalnego i zwraca transkrybowany tekst.
Jak działa piaskownica rozpoznawania mowy?
Kliknij przycisk uruchomienia i zezwól przeglądarce na dostęp do mikrofonu. Mów wyraźnie — API w czasie rzeczywistym transkrybuje Twoją mowę. Wyniki pojawiają się na bieżąco (interim results) i są finalizowane po zakończeniu wypowiedzi (final results). Możesz wybrać język rozpoznawania (polski, angielski, niemiecki i inne), włączyć tryb ciągłego nasłuchiwania oraz zobaczyć poziom pewności (confidence score) dla każdej transkrypcji.
Zastosowania rozpoznawania mowy w aplikacjach
Web Speech API otwiera wiele możliwości: dyktowanie tekstu zamiast pisania (szczególnie przydatne na urządzeniach mobilnych), sterowanie głosem aplikacją webową, wyszukiwanie głosowe, transkrypcja notatek i nagrań spotkań, wspomaganie dla osób z niepełnosprawnościami ruchowymi, nauka języków obcych (porównywanie wymowy z transkrypcją) oraz tworzenie chatbotów głosowych.
Ograniczenia Web Speech API
API wymaga połączenia z internetem (wysyła audio do serwera Google), działą głównie w Chrome i Edge, jakość rozpoznawania zależy od mikrofonu i warunków akustycznych, a prywatność może być kwestią sporną (nagrania trafiają na serwery Google). Dla zastosowań produkcyjnych rozważ alternatywy: Whisper (OpenAI, open-source, działa lokalnie) lub Azure Cognitive Services Speech.
Najczęściej zadawane pytania
Czy rozpoznawanie mowy działa po polsku?
Tak — Web Speech API obsługuje język polski (kod: pl-PL). Jakość rozpoznawania polskiego jest dobra, choć nieco gorsza niż angielskiego ze względu na złożoną morfologię i fleksję. Słowa specjalistyczne, nazwy własne i regionalny akcent mogą być transkrybowane z błędami.
Czy mowa jest przetwarzana lokalnie czy w chmurze?
W Chrome mowa jest wysyłana do serwerów Google do przetworzenia. Oznacza to, że potrzebujesz internetu i akceptujesz politykę prywatności Google. Nie ma możliwości lokalnego przetwarzania przez Web Speech API. Dla przetwarzania offline użyj biblioteki Whisper.cpp lub Vosk.
Jak poprawić dokładność rozpoznawania mowy?
Mów wyraźnie i w normalnym tempie, używaj dobrej jakości mikrofonu, minimalizuj szum w tle, mów do mikrofonu z odległości 20–30 cm. W kodzie możesz użyć SpeechGrammarList do wskazania specyficznych fraz i słów kluczowych, co znacznie poprawia rozpoznawanie terminologii technicznej lub nazw własnych.
Na jakich przeglądarkach działa Web Speech API?
Pełne wsparcie: Chrome (desktop i Android), Microsoft Edge. Częściowe: Safari (tylko synteza głosu od iOS 14.5, rozpoznawanie od Safari 14.1 na macOS). Brak wsparcia: Firefox (rozpoznawanie mowy nie jest zaimplementowane w stabilnej wersji), Opera, starsze wersje przeglądarek mobilnych.
Jak zintegrować rozpoznawanie mowy w swojej aplikacji webowej?
Podstawowy kod JavaScript: const recognition = new webkitSpeechRecognition(); recognition.lang = 'pl-PL'; recognition.onresult = (e) => console.log(e.results[0][0].transcript); recognition.start();. Pamiętaj o obsłudze błędów (onerror), informowaniu użytkownika o wymaganym zezwoleniu na mikrofon i testowaniu na obsługiwanych przeglądarkach.