Usuwanie tagów HTML
Usuń tagi HTML z kodu lub treści strony. Zachowaj czysty tekst, opcjonalnie dekoduj encje HTML. Szybkie narzędzie online. Bezpłatnie.
-
1Wprowadź dane
Wpisz treść, wklej tekst lub załaduj plik z dysku. -
2Kliknij przycisk
Narzędzie natychmiast przetworzy Twoje dane w przeglądarce. -
3Pobierz wynik
Skopiuj gotowy tekst lub zapisz plik na urządzeniu.
return "Wynik gotowy w 0.1s";
}
Oceń to narzędzie:
Powiązane narzędzia
Inne narzędzia, które mogą Ci się przydaćUsuwanie tagów HTML – konwersja HTML na czysty tekst
Usuwanie tagów HTML (HTML stripping) przekształca kod HTML na czysty tekst – przydatne przy przetwarzaniu treści web, migracjach CMS, przygotowywaniu tekstu do analizy NLP lub czyszczeniu danych. Narzędzie usuwa tagi, opcjonalnie dekoduje encje HTML (& → &, → spacja) i normalizuje białe znaki.
Jak działa usuwanie tagów HTML
Algorytm: znajdź i usuń wszystko między < a > (regex lub parser DOM). Regex (prosty): /<[^>]+>/g. Parser DOM (bezpieczny): utwórz element, przypisz innerHTML, odczytaj textContent. Regex problemy: CDATA, komentarze HTML, zagnieżdżone cudzysłowy w atrybutach. Dla produkcji: zawsze parser DOM lub dedykowana biblioteka (DOMPurify, Sanitize.js).
Encje HTML do dekodowania
& → &. < → <. > → >. " → ". ' → '. → spacja nierozdzielająca (U+00A0). © → ©. € → €. Numeryczne: © → © (decimal). © → © (hex). Narzędzie dekoduje encje po usunięciu tagów, zwracając naturalnie czytelny tekst.
Zastosowania
NLP i analiza tekstu: modele wymagają czystego tekstu bez HTML. Web scraping: BeautifulSoup .get_text(). Migracja treści: Drupal/WordPress export → czyść HTML. Porównywanie wersji: diff dwóch stron bez szumu tagów. Przeszukiwanie pełnotekstowe: Elasticsearch indeksuje czysty tekst. Email marketing: konwersja HTML emaila na plain text fallback.
Zachowanie struktury przy usuwaniu
Problem:
Akapit 1
Akapit 2
→ "Akapit 1Akapit 2" (bez spacji). Rozwiązanie: zamień ,na \n przed usunięciem tagów.
Najczęstsze pytania
Jak usunąć tagi HTML w PHP?
strip_tags($html): usuwa tagi HTML, opcjonalnie zachowuje wybrane. strip_tags($html, '
') zachowa p i br. html_entity_decode() po strip_tags() do dekodowania encji. Dla bezpieczeństwa: htmlspecialchars() do wyświetlania, DOMDocument do parsowania. Nie używaj regex do walidacji HTML w PHP – zbyt wiele edge cases.
Jak usunąć tagi HTML w Python?
BeautifulSoup: soup = BeautifulSoup(html, "html.parser"); soup.get_text(). lxml: lxml.html.fromstring(html).text_content(). Regex (ostrożnie): import re; re.sub("<[^>]+>", "", html). Markdownify: konwersja HTML na Markdown (zachowuje strukturę). html2text: HTML na plain text z zachowaniem formatowania.
Jak usunąć tagi HTML w JavaScript?
DOM: document.createElement("div"); el.innerHTML = html; return el.textContent. DOMParser: new DOMParser().parseFromString(html, "text/html").body.textContent. Regex: html.replace(/<[^>]*>/g, ""). Striptags (npm): bezpieczna biblioteka. Sanitize-html (npm): usuwa niebezpieczne tagi, zachowuje wybrane.
Czy usuwanie tagów HTML jest bezpieczne?
Ryzyko: po usunięciu tagów = "alert(xss)" – tekst, nie kod. Ale: jeśli wynik trafia z powrotem do HTML bez escaping = XSS. Bezpieczna praktyka: strip tags → encode result (htmlspecialchars) przed wyświetleniem w HTML. Nie ufaj wyniku jako bezpiecznemu HTML.
Jak zachować formatowanie przy konwersji HTML na email?
HTML email → plain text fallback: zamień
na \n,
na \n\n, tekst na *tekst*, tekst na "tekst (URL)". Biblioteki: Mailchecker, html-to-text (npm), premailer (Ruby). Plain text email: alternatywna wersja MIME multipart/alternative wymagana przez Email on Acid i Litmus.
Powiązane narzedzia: formatowanie HTML, koder encji HTML i konwerter HTML na Markdown.