Nettoyeur HTML : retirer attributs, scripts et bruit en ligne
Collez du HTML désordonné pour obtenir une structure propre sans attributs et un aperçu JSON ; scripts, styles, commentaires, SVG, formulaires et sélecteurs personnalisés sont supprimés.
Tout s’exécute dans votre navigateur avec l’analyseur HTML natif ; rien n’est envoyé. Idéal pour extraire du contenu, créer des pipelines de scraping, migrer un CMS ou préparer du HTML pour un LLM.
Nettoyeur HTML : retirer attributs, scripts et bruit en ligne
Collez du HTML désordonné pour obtenir une structure propre sans attributs et un aperçu JSON ; scripts, styles, commentaires, SVG, formulaires et sélecteurs personnalisés sont supprimés.
À propos du nettoyeur HTML
Le HTML copié de vrais sites web transporte une quantité énorme de bagages : classes de frameworks, styles en ligne, attributs data-*, scripts de suivi, icônes SVG, marqueurs de commentaires et couches de div conteneurs à usage unique. Quand vous voulez simplement la structure du contenu — pour un pipeline de scraping, une migration de CMS, une comparaison ou pour alléger une page avant de l’envoyer à un modèle de langage — tout cela n’est que du bruit qui masque l’essentiel et gaspille des tokens.
Cet outil analyse votre HTML avec le parseur du navigateur (DOMParser), puis applique un nettoyage configurable : tous les attributs sont retirés (avec conservation facultative de href sur les liens), les nœuds script, style, commentaire, SVG et formulaire sont supprimés, les éléments correspondant à vos sélecteurs CSS personnalisés sont retirés (un par ligne, pratique pour la navigation ou les bannières de cookies), les balises vides restantes sont éliminées et, en option, chaque conteneur qui contient exactement un enfant sans texte propre est supprimé pour aplatir les div imbriqués.
Deux sorties sont produites côte à côte : le HTML nettoyé et un aperçu JSON de la structure restante (tag, text, children, href), pratique pour le traitement programmatique. Le badge de taille indique la réduction ; sur les pages modernes typiques, la structure nettoyée est généralement 80-95% plus petite que l’entrée. Tout reste local dans l’onglet du navigateur : le HTML ne quitte jamais votre appareil.
Exemples de nettoyage HTML
Effet de chaque option sur un extrait.
| Entrée | Sortie | Notes |
|---|---|---|
| ⟨div class="a b c" data-x="1"⟩⟨p style="color:red"⟩Hi⟨/p⟩⟨/div⟩ | ⟨div⟩⟨p⟩Hi⟨/p⟩⟨/div⟩ | Tous les attributs sont supprimés ; structure et texte sont conservés. |
| ⟨p⟩Text⟨script⟩evil()⟨/script⟩⟨/p⟩ | ⟨p⟩Text⟨/p⟩ | Les balises script sont entièrement supprimées. |
| ⟨a class="btn" href="/docs"⟩Docs⟨/a⟩ | ⟨a href="/docs"⟩Docs⟨/a⟩ | Avec « Conserver href » activé, les liens restent utilisables. |
| ⟨div⟩⟨div⟩⟨p⟩Deep⟨/p⟩⟨/div⟩⟨/div⟩ | ⟨p⟩Deep⟨/p⟩ | « Remonter les conteneurs à enfant unique » aplatit l’imbrication pure. |
Comment utiliser le nettoyeur HTML
- Collez le HTML dans la zone de saisie.
- Cochez les options voulues ; ajoutez un sélecteur CSS par ligne pour les éléments propres au site, comme les barres de navigation ou les blocs publicitaires.
- Cliquez sur « Nettoyer le HTML ».
- Copiez le HTML nettoyé, ou la structure JSON pour un traitement programmatique.
- Le badge de taille indique la quantité de bruit supprimée.
FAQ du nettoyeur HTML
Mon HTML est-il envoyé à un serveur ?
Non. L’analyse et le nettoyage s’effectuent entièrement dans votre navigateur avec DOMParser. La page fonctionne hors ligne une fois chargée.
À quoi servent les sélecteurs personnalisés ?
Tout élément correspondant à l’un de vos sélecteurs CSS (un par ligne) est supprimé avant le nettoyage, par exemple « nav », « #sidebar » ou « div[class*=ads] ». Les sélecteurs invalides sont ignorés.
À quoi sert la sortie JSON ?
C’est un aperçu de la structure nettoyée : des objets avec tag, text, children et éventuellement href. Il est pratique pour les scrapers, les tests ou le traitement de contenu structuré sans réanalyser le HTML.
Que signifie « remonter les conteneurs à enfant unique » ?
Si un élément contient exactement un élément enfant et aucun texte propre, le conteneur est supprimé et l’enfant prend sa place. Appliqué récursivement, cela aplatit les profondes imbrications de div des sites modernes.
Pourquoi nettoyer le HTML avant de l’envoyer à un LLM ?
Les noms de classes, styles en ligne et scripts consomment des tokens sans apporter de sens. La structure nettoyée est généralement 80-95% plus petite, ce qui réduit le coût et laisse plus de place au contenu.
Les images et les retours à la ligne sont-ils conservés ?
Le nettoyage des balises vides conserve explicitement les éléments br et img, même sans enfants, car ils ont un sens propre.