Le Title, la Description et les titres H1–H6 sont les éléments qui permettent au moteur de recherche de comprendre le sujet d'une page, et à l'utilisateur de décider s'il clique sur le snippet. Sur un site de plusieurs centaines ou milliers de pages, impossible de les vérifier manuellement : ici un Title est vide, là il est dupliqué sur des dizaines de pages, ailleurs le H1 manque ou la hiérarchie des titres n'est pas respectée. Un scraper de balises rassemble toutes les métadonnées du site dans un seul tableau, et les problèmes deviennent immédiatement visibles.
Cet article fait partie de notre série sur le web scraping appliqué au SEO. Voyons ce que l'on collecte, pourquoi, et avec quels outils.
Ce que collecte un scraper de métadonnées
En parcourant le site, le scraper extrait pour chaque URL :
- Title — le titre de la page affiché dans l'onglet et le snippet.
- Description — la méta-description.
- H1 — le titre principal de la page.
- H2–H6 — les sous-titres et leur hiérarchie.
- La longueur des balises, pour repérer celles trop courtes ou tronquées dans les résultats de recherche.
C'est en réalité le même parcours que pour le scraping de la structure d'un site : un seul passage du crawler fournit à la fois l'arborescence des rubriques et le tableau des métadonnées. C'est pourquoi balises title et titres se collectent généralement avec les mêmes logiciels que la structure.
Quels problèmes recherche-t-on
Doublons de Title et de Description. Des métabalises identiques sur des pages différentes sont une cause fréquente de cannibalisation : les pages se concurrencent entre elles et se positionnent moins bien. Le scraper détecte rapidement tous les doublons.
Balises vides ou absentes. Les pages sans Title ou sans H1 perdent en pertinence. Dans le tableau, elles se repèrent immédiatement aux cellules vides.
Suroptimisation et longueur. Les Title trop longs sont tronqués dans les résultats, les titres bourrés de mots-clés peuvent déclencher des filtres. Un export avec les longueurs aide à remettre de l'ordre.
Hiérarchie des titres non respectée. Plusieurs H1 sur une même page, des niveaux sautés, un H2 avant le H1 — des erreurs structurelles de balisage qui gênent à la fois le robot et l'accessibilité.
Le résultat d'un tel audit est un cahier des charges pour la réécriture des métabalises : quelles pages corriger, où supprimer les doublons, où compléter ce qui manque.
Avec quoi scraper balises et titres
Screaming Frog SEO Spider et Netpeak Spider sont les outils de référence. Lors d'un crawl classique, ils collectent déjà les Title, Description et titres, et signalent les valeurs dupliquées, vides ou trop longues. Grâce à l'extraction personnalisée (Custom Extraction via XPath ou expressions régulières), on peut aussi extraire des éléments non standard — par exemple toutes les balises <strong> ou le contenu d'un bloc précis.
ComparseR enregistre lui aussi les Title lors du crawl et permet de trouver les doublons et les pages sans titre.
Un scénario à part : collecter balises et titres non pas sur son propre site, mais dans les résultats de recherche ou sur les sites des concurrents. Beaucoup optimisent leurs métabalises pour le référencement, si bien que les Title, Description et H1–H6 des autres regorgent d'expressions clés toutes prêtes et d'idées pour le plan de contenu. Des outils pratiques existent pour cela : le complément Excel gratuit SEMTools, le scraper de titres Arsenkin Tools (compatible Yandex et Google), ainsi que l'outil d'extraction de métabalises de Click.ru. On rejoint ici la collecte de mots-clés : les titres des concurrents sont une bonne source de requêtes manquées.
Le lien avec le reste du travail
Le scraping de balises est le diagnostic du volet contenu d'un site, en complément du diagnostic technique via le scraping de la structure. Pour réécrire correctement les métabalises, il faut des mots-clés — fournis par la collecte de mots-clés, les suggestions Yandex et Wordstat. Et après les corrections, on mesure l'effet grâce au suivi des positions.
Si l'objectif est d'analyser non pas les balises de sites précis, mais les snippets et titres directement dans le top des résultats, il s'agit de l'extraction de SERP Yandex et de l'extraction de SERP Google — des prestations à part entière de notre agence.