Text se zpracuje přímo ve vašem prohlížeči, nic se neodesílá na server. Vstup není omezený počtem znaků.
Odstavce, nadpisy a značky <br> se převedou na nové řádky. Vypnuto vrátí text na jednom řádku.
Položky <ul> dostanou pomlčku, položky <ol> pořadové číslo.
Obrázek s atributem alt se do textu zapíše jako [popis obrázku].
Entita se dekóduje na neviditelný znak U+00A0, který rozbíjí import dat i vyhledávání.
Zkrátí mezery vzniklé z entit a vnořených bloků a ořeže mezery na začátcích a koncích řádků.
Druhá volba zapíše adresu za text odkazu do závorky.
Jak odstranit HTML tagy z textu
- Vložte HTML do horního pole. Může to být celá stránka i jen kus zkopírovaný z editoru.
- Rozhodněte, co má z formátování zůstat. Zalomení odstavců a odrážky seznamů udrží text čitelný.
- U odkazů zvolte, jestli chcete jen jejich text, nebo i adresu v závorce za ním.
- Zkopírujte čistý text, nebo si ho stáhněte jako soubor txt.
Kdy se hodí převést HTML na text
Nejčastěji při přenosu obsahu mezi systémy. Zkopírujete text z webu do redakčního systému a spolu s ním se přenesou i značky, cizí třídy a inline styly. Text pak v novém webu vypadá rozbitě a nedá se nastylovat.
Druhý případ jsou popisy produktů v e-shopech. Feedy pro srovnávače a inzertní systémy často značky nepovolují a vrátí chybu při importu. Odstranit je předem je rychlejší než dohledávat, na které položce import spadl.
Do počítání znaků značky také nepatří, jinak by se započítaly do součtu a číslo by sedělo na kód, ne na text. Nástroj proto ukazuje statistiky až z výsledku. Podrobnější rozbor nabízí počítadlo znaků a slov.
Jak odstranit HTML tagy v kódu
V PHP na to je funkce strip_tags. Umí i druhý parametr se seznamem značek, které mají zůstat. Pozor na to, že entity nedekóduje, takže po ní obvykle ještě voláte html_entity_decode.
V JavaScriptu je nejjednodušší cesta přes vlastnost textContent. Vložíte HTML do prvku a přečtete si z něj čistý text. Entity se dekódují samy, protože je zpracuje prohlížeč.
Regulárnímu výrazu se vyhněte. Na první pohled funguje, ale rozbije se na neuzavřených značkách, na ostré závorce uvnitř atributu a na komentářích. Nástroj proto vstup parsuje stejně jako prohlížeč, takže se chová předvídatelně i na rozbitém HTML.
Co se stane s entitami a mezerami
Entity se dekódují na skutečné znaky: z & vznikne & a z < vznikne <. Nástroj zvládne pojmenované i číselné zápisy včetně hexadecimálních.
Nedělitelné mezery jsou zvláštní případ. Vypadají jako obyčejná mezera, ale je to jiný znak, který se v cizím systému může zobrazit jako otazník nebo nečitelný symbol. Přepínačem je proto můžete převést na obyčejné mezery, nebo je nechat být, když na nich v sazbě záleží.
Obsah značek script a style se do výsledku nedostane nikdy. Je to kód, ne text, a v čistém textu by nedával smysl. Když nástroj takový obsah najde, napíše to nad výstupem.
Časté otázky
Zůstane zachované odsazení a odstavce?
Podle nastavení. Se zapnutým zachováním odstavců se z každého odstavce a nadpisu stane samostatný blok oddělený prázdným řádkem. Když volbu vypnete, dostanete text v jednom souvislém proudu.
Jaký je rozdíl proti minifikaci nebo formátování?
Po odstranění tagů žádné HTML nezbude. Když chcete kód jen zpřehlednit a značky zachovat, použijte HTML beautifier. Pro převod mezi značkovacími jazyky slouží převodník Markdown a HTML.
Co se stane s obrázky?
Obrázek sám o sobě zmizí, protože v textu ho zobrazit nelze. Můžete ale zapnout doplnění alternativních textů. Do výstupu se pak vloží popis z atributu alt, což se hodí, když text slouží jako podklad pro další zpracování.
Zvládne nástroj rozbité HTML?
Ano. Neuzavřené značky a překřížené elementy zpracuje stejně jako prohlížeč, tedy si je po svém opraví a text z nich vytáhne. Vstup proto nemusíte nijak upravovat předem.
Odchází vložený kód na server?
Ne, zpracování běží celé ve vašem prohlížeči. Vložit sem proto můžete i obsah z neveřejné administrace nebo z testovacího prostředí.