Boty AI szturmują strony logowania. Ruch złośliwych botów wzrósł o 124%

Boty AI szturmują strony logowania. Ruch złośliwych botów wzrósł o 124%

Scraping rośnie o 185%, a agenci AI coraz częściej celują w konta użytkowników

Złośliwy ruch botów w internecie rośnie ponad dziewięć razy szybciej niż ruch ludzi. Boty AI nie poprzestają już na kopiowaniu treści stron. W pierwszej połowie 2026 roku liczba ich zapytań do stron logowania wzrosła ponad ośmiokrotnie. Tak wynika z raportu firmy DataDome, opartego na ponad bilionie zapytań.

Najważniejsze liczby z raportu DataDome

DataDome zajmuje się ochroną stron przed botami. Raport powstał na podstawie ponad biliona zapytań z 75 tysięcy stron klientów firmy oraz testów ponad 20 tysięcy popularnych serwisów.

Wzrost ruchu złośliwych botów (lipiec 2025 – czerwiec 2026)+124%
Wzrost scrapingu, czyli automatycznego pobierania treści+185,2%
Udział scrapingu w ruchu złośliwych botów70,9%
Zapytania botów AI do stron logowania (I połowa 2026)ponad 8 razy więcej
Podszywanie się pod agentów AI (luty – lipiec 2026)+45%
Agenci AI, którzy nie przedstawiają się poprawnie80%

Jérôme Segura, wiceprezes DataDome ds. badań nad zagrożeniami, ujął to tak: zautomatyzowany ruch to już nie tylko problem skali na obrzeżach internetu. Rośnie szybko i sięga coraz głębiej.

Dlaczego scraping tak przyspieszył

Segura wskazuje kilka przyczyn. Narzędzia do automatycznego pobierania stron mnożą się, bo rośnie zapotrzebowanie na dane do trenowania modeli AI, odpowiedzi agentów i innych usług opartych na AI. Jednocześnie frameworki maskujące odcisk przeglądarki, zautomatyzowane przeglądarki i tanie usługi typu „bot jako usługa” sprawiły, że zaawansowane omijanie zabezpieczeń stało się dostępne dla każdego. AI dodatkowo przyspiesza i obniża koszt budowy takich narzędzi.

Jacob Krell z Suzu Labs tłumaczy wzrost o 185% bardzo obrazowo: to agenci pobierający odpowiedzi ze stron zbudowanych dla ludzi. Jedno pytanie zadane przez człowieka wyszukiwarce AI może zamienić się w zapytania do wielu stron i serwisów. To zapotrzebowanie na poziomie maszyn obsługiwane przez infrastrukturę zaprojektowaną dla ludzi.

Dla właścicieli stron skutki są konkretne. Ensar Seker z SOCRadar wymienia koszty serwerów, przekłamane statystyki odwiedzin oraz utratę wartości handlowej danych i treści, takich jak ceny, opisy produktów czy wyniki badań. Każdy, kto prowadzi sklep internetowy, zna ten problem z widoku logów: konkurencja albo agregator codziennie pobiera cały cennik.

Od skryptów do botów, które myślą

Krell wskazuje kolejny czynnik: przeglądarki sterowane przez agentów AI. Modele od dawna potrafiły zaplanować sekwencję działań. Modele rozpoznające obraz i narzędzia do sterowania przeglądarką sprawiły, że taki plan da się wykonać na zwykłej stronie. Agent czyta wyrenderowaną stronę, znajduje przyciski, wypełnia formularze i przechodzi przez cały proces w tempie maszyny.

Seker podsumowuje to jako przejście od przewidywalnych botów działających według skryptu do adaptacyjnej automatyzacji, która porusza się po stronie, podejmuje decyzje i zmienia zachowanie w zależności od tego, co napotka. Przeglądarki bez interfejsu (headless), sieci proxy z domowymi adresami IP i techniki antywykrywania sprawiają, że boty coraz lepiej udają ludzi.

Dlaczego strony logowania to sygnał alarmowy

Seker uważa ośmiokrotny wzrost zapytań do stron logowania za jedno z najważniejszych odkryć raportu. Przeglądanie strony głównej to dostęp do informacji. Interakcja ze stroną logowania oznacza, że automatyzacja wchodzi głębiej, w stronę tożsamości, kont i transakcji. Te same technologie, które pozwalają legalnemu agentowi AI zalogować się w imieniu użytkownika, można nadużyć do:

  • credential stuffingu, czyli masowego sprawdzania loginów i haseł z wycieków,
  • przejmowania kont,
  • nadużyć sesji i zautomatyzowanych oszustw.

Pytanie „człowiek czy bot?” przestaje wystarczać. Według Sekera trzeba ustalić, kto steruje agentem, czy ma do tego uprawnienia i co próbuje zrobić. Segura proponuje podobne podejście: zamiast pytać, czy odwiedzający jest botem, pytać, co próbuje zrobić i czy to służy firmie. Sama deklarowana tożsamość nie wystarczy, skoro 80% agentów AI nie przedstawia się poprawnie, a podszywanie się pod agentów rośnie. Rozwiązaniem jest połączenie zweryfikowanej tożsamości agenta z analizą zachowania.

Aviv Nahum z Above Security radzi firmom traktować agentów AI jak pełnoprawne tożsamości i nowy rodzaj „insiderów”. Trzeba wiedzieć, jacy agenci działają w organizacji, kto nimi zarządza i do jakich systemów oraz danych logowania mają dostęp.

Koniec CAPTCHA?

Kevin Alan Tussy z FaceTec, firmy zajmującej się biometrią, uważa, że klasyczne metody uwierzytelniania nie nadążają. Agent może posłużyć się praktycznie każdym czynnikiem: hasłem, kluczem dostępu, kodem z e-maila lub SMS-a. Bot może też obejrzeć, jak człowiek rozwiązuje CAPTCHA w 15–30 sekund, i nauczyć się to idealnie naśladować. Dlatego obrony w stylu testu Turinga są według niego ślepą uliczką. Tussy przekonuje, że jedyne, czego agent nie ma, to żywa ludzka twarz przed kamerą. To oczywiście głos firmy, która sprzedaje taką technologię, więc warto go traktować jako jedną z opcji, a nie gotowe rozwiązanie.

Co z tego wynika dla ciebie

Jako użytkownik

  1. Nie używaj tego samego hasła w wielu serwisach. Credential stuffing działa tylko wtedy, gdy hasło z jednego wycieku pasuje gdzie indziej. Unikalne hasła wygenerujesz w naszym generatorze haseł, a menedżer haseł je zapamięta.
  2. Sprawdź, czy twój e-mail był w wycieku, korzystając z narzędzia do sprawdzania wycieków. Jeśli tak, zmień hasła w serwisach, w których użyłeś tego samego.
  3. Włącz klucze dostępu (passkeys) lub aplikację uwierzytelniającą tam, gdzie to możliwe. Kod SMS jest lepszy niż nic, ale słabszy od tych metod.
  4. Reaguj na powiadomienia o logowaniu z nowego urządzenia. To często pierwszy sygnał udanego ataku.

Jako właściciel strony

  1. Limituj próby logowania per IP i per konto, a nietypowe wzorce (wiele kont z jednego adresu, logowania w regularnych odstępach) traktuj jako alarm.
  2. Analizuj logi serwera. Wiele botów podszywa się pod znane przeglądarki lub agentów AI. Nagłówek User-Agent możesz rozłożyć na części w naszym parserze User-Agent, ale pamiętaj, że to deklaracja, a nie dowód.
  3. Określ politykę wobec botów AI w robots.txt i na poziomie serwera, wiedząc, że nie wszystkie ją respektują.

Boty AI w praktyce: robots.txt i logi serwera

Duże firmy AI publikują nazwy swoich robotów i deklarują, że respektują plik robots.txt. Najczęściej spotykane to m.in.:

  • GPTBot (OpenAI, zbieranie danych do trenowania), OAI-SearchBot i ChatGPT-User (wyszukiwanie i pobieranie stron na prośbę użytkownika),
  • ClaudeBot (Anthropic),
  • PerplexityBot (Perplexity),
  • CCBot (Common Crawl, którego zbiory wykorzystuje wiele firm AI),
  • Google-Extended: to nie osobny robot, tylko token, którym możesz zablokować wykorzystanie treści do trenowania modeli Gemini bez wpływu na indeksowanie w wyszukiwarce,
  • Applebot-Extended: analogiczny token Apple.

Przykładowy fragment robots.txt, który blokuje roboty trenujące, a nie dotyka zwykłego indeksowania:

User-agent: GPTBot
Disallow: /

User-agent: CCBot
Disallow: /

User-agent: Google-Extended
Disallow: /

Trzeba jednak pamiętać o dwóch ograniczeniach. Po pierwsze, robots.txt to prośba, a nie zabezpieczenie: złośliwe boty go ignorują. Po drugie, jak pokazuje raport DataDome, wiele botów podszywa się pod znane nazwy. Prawdziwość Googlebota czy robota OpenAI można sprawdzić odwrotnym zapytaniem DNS albo porównując adres IP z listami publikowanymi przez te firmy. Do tego przydadzą się nasze narzędzia do sprawdzania WHOIS i routingu IP oraz wyszukiwania DNS.

Ograniczanie prób logowania

Najprostszą obroną przed credential stuffingiem jest limit liczby prób logowania. Na serwerze nginx można to zrobić dyrektywami limit_req_zone i limit_req dla adresu strony logowania, a w aplikacji przez czasową blokadę konta po kilku nieudanych próbach. Boty korzystające z tysięcy domowych adresów IP potrafią rozłożyć próby tak, by nie przekroczyć limitu dla pojedynczego adresu, dlatego warto liczyć również próby na konto i reagować na nietypowe wzorce, np. wiele różnych kont logujących się z tej samej przeglądarki.

Jak podsumowuje Segura, wyzwaniem nie jest już samo wykrycie automatyzacji, tylko ustalenie, czy jest ona pożyteczna, czy szkodliwa.

Najczęściej zadawane pytania

Czy blokowanie botów AI zaszkodzi mojej stronie w Google?

Zablokowanie GPTBot, CCBot czy tokena Google-Extended nie wpływa na indeksowanie w wyszukiwarce Google. Zablokowanie samego Googlebota usunęłoby jednak stronę z wyników, więc trzeba uważać na zbyt ogólne reguły.

Czym różni się scraping od zwykłego indeksowania?

Wyszukiwarka pobiera stronę, żeby pokazać ją w wynikach i skierować do ciebie ruch. Scraper pobiera treść, żeby wykorzystać ją gdzie indziej, często bez żadnego odesłania do źródła, na przykład do trenowania modelu albo kopiowania cennika.

Czy CAPTCHA nadal ma sens?

Jako jedna z warstw tak, bo odsiewa najprostsze boty. Nie należy jednak traktować jej jako głównego zabezpieczenia, bo zaawansowane boty i tanie usługi rozwiązywania CAPTCHA ją omijają.

Źródło: John P. Mello Jr., „AI Bots Push Beyond Web Scraping Into Customer Accounts”, TechNewsWorld, 22 września 2026. Raport: DataDome.

Zainstaluj Webp.pl Miej narzędzia we własnej kieszeni!