Adresy se hledají průběžně při psaní. Text zůstává ve vašem prohlížeči, nic se neodesílá na server.
Nechte prázdné pro všechny domény. Oddělujte čárkou; položka s pomlčkou na začátku doménu vyloučí. Zahrnují se i subdomény.
Vypnutím vypíšete každý výskyt zvlášť v pořadí, jak je v textu.
Sjednotí zápisy jako Info@Firma.cz a info@firma.cz do jedné adresy.
Zahodí vše od otazníku nebo mřížky, tedy i sledovací parametry utm_source.
Zápisy typu jmeno [at] firma (dot) cz převede na běžnou adresu. Může přinést falešné shody.
Nalezené adresy
Četnost výskytu
| Hodnota | Typ | Doména | Výskytů |
|---|
Jak extraktor e-mailů a URL použít
- Vložte text do velkého pole. Může to být e-mail, výpis z tabulky, zdrojový kód stránky nebo cokoli jiného.
- Vyberte, co chcete vytáhnout: e-maily, odkazy, nebo obojí najednou.
- Podle potřeby zapněte slučování duplicit, odstranění parametrů z URL nebo rozpoznání zamaskovaných adres.
- Do pole s filtrem domény napište doménu, kterou chcete nechat. Zápis
-firma.czs minusem na začátku ji naopak vyloučí. - Zvolte formát výstupu a klikněte na Kopírovat. Na výběr je prostý seznam, řetězec s čárkami, CSV pro Excel a JSON.
Jak vytáhnout e-maily z textu bez ručního hledání
Ruční procházení dlouhého výpisu je zdlouhavé a snadno v něm něco přehlédnete. Nástroj projde text jedním průchodem, najde všechno, co vypadá jako adresa nebo odkaz, a rovnou spočítá, kolikrát se tam každá položka objevila. Adresu psanou velkými písmeny bere jako stejnou jako tu s malými.
Zpracování běží celé ve vašem prohlížeči. Vložený text se nikam neodesílá, což je u kontaktů z e-mailové komunikace nebo z interního dokumentu podstatný rozdíl proti nástrojům, které vstup posílají na server.
Jak vypadá regulární výraz pro e-mail
Nejčastěji používaný tvar je [\w.%+-]+@[\w.-]+\.[a-zA-Z]{2,}. Zachytí adresy, na které v praxi narazíte, ale úplný standard nepokrývá. Plná definice z RFC 5322 zabírá stovky znaků a povoluje i tvary, na které v praxi nenarazíte, třeba adresu s uvozovkami nebo s komentářem v závorce.
Praktičtější je držet se dvou tvrdých pravidel ze standardu: lokální část před zavináčem smí mít nejvýš 64 znaků a celá adresa nejvýš 254. Náš nástroj tyhle meze respektuje, takže z dlouhého řetězce písmen a číslic nevyrobí nesmyslnou adresu. Pokud chcete regulární výraz doladit na vlastních datech, hodí se tester regulárních výrazů.
Extrakce odkazů z HTML kódu
Do pole můžete vložit rovnou zdrojový kód stránky. Nástroj z něj vytáhne adresy ze všech atributů href i src, protože hledá samotné URL, ne konkrétní značku. Rozpozná adresy se schématem http, https i ftp a navíc ty, které začínají na www.
Holá doména bez schématu, například firma.cz/kontakt, se schválně nevytahuje. V běžném textu by se do výsledku pletly názvy souborů a zkratky s tečkou. Volba pro odstranění parametrů a kotvy se hodí, když potřebujete seznam unikátních stránek, a ne padesát variant téže adresy s různým utm_source. Rozebrat jednu konkrétní adresu na části umí parser URL adres.
Zamaskované adresy typu jmeno [at] firma (dot) cz
Na webech a v diskuzích se adresy často píšou opisem, aby je nesebral robot. Se zapnutou volbou pro maskované zápisy nástroj převede závorkované varianty [at], (at), {at}, <at> i české (zavinac) na zavináč, a totéž udělá s (dot), (tecka) a (tečka).
Volba je výchozí vypnutá záměrně. Zápis bez závorek, tedy „jan zavinac firma tecka cz“, se nerozpoznává, protože v souvislém textu by taková pravidla vyráběla adresy, které nikdo nenapsal.
Časté otázky
Odesílá se vložený text někam na server?
Ne, celá extrakce běží v prohlížeči a text neopustí váš počítač.
Můžu vytažené adresy použít k rozeslání nabídky?
Obchodní sdělení se v Česku řídí zákonem č. 480/2004 Sb. Posílat ho smíte tomu, kdo k tomu dal souhlas, nebo svému zákazníkovi, který má možnost se odhlásit. Adresa posbíraná z webu souhlas nezakládá a rozesílka na takový seznam je nevyžádané sdělení, které řeší Úřad pro ochranu osobních údajů.
Kolik textu nástroj zvládne?
Limit je 200 000 znaků, tedy zhruba sto normostran. Delší vstup se ořízne a nástroj na to upozorní. Tabulka s četnostmi ukazuje prvních 200 položek, ale textový výstup a kopírování obsahují vždycky všechno.
Proč se stejná adresa v seznamu neopakuje?
Duplicity se ve výchozím nastavení slučují a počet výskytů se ukáže ve sloupci vedle. Když potřebujete pořadí tak, jak se adresy v textu objevily, i s opakováním, vypněte volbu pro unikátní položky.
Jak dostanu výsledek do Excelu?
Zvolte formát CSV. Oddělovačem je středník a hlavičky jsou bez diakritiky, takže se soubor v českém Excelu rozdělí do sloupců sám, bez průvodce importem. Zkopírovaný obsah vložte do prázdného listu, nebo ho uložte jako soubor s příponou .csv.