Le corpus de mots-clés est un ensemble de requêtes structuré, nettoyé et regroupé, rattaché aux pages du site. Ce n'est pas une simple liste de mots-clés, mais le socle de toute la stratégie SEO : c'est à partir du noyau que l'on construit la structure du site, rédige les textes, renseigne les balises meta et lance les campagnes payantes. Constituer manuellement un noyau de qualité pour un grand projet est impossible : les volumes sont trop importants et il est trop facile de passer à côté de phrases essentielles. C'est pourquoi les mots-clés se collectent par scraping, en combinant plusieurs sources.
Cet article fait partie de notre série sur le web scraping en SEO et relie entre eux les articles consacrés à Wordstat, aux suggestions de recherche et aux requêtes Google.
Les sources de mots-clés
Un corpus complet ne se collecte pas à partir d'une seule source, mais de plusieurs sources complémentaires :
- Yandex Wordstat — les statistiques de base de la demande sur le web russophone : volumes de recherche, saisonnalité, géographie, colonnes gauche et droite.
- Suggestions de recherche Yandex — des formulations « vivantes » issues de la barre de recherche, y compris longues et conversationnelles.
- Requêtes Google — Keyword Planner, suggestions Google et données des concurrents pour les projets orientés Google.
- Sémantique des concurrents — les requêtes sur lesquelles se positionnent les sites leaders de la niche ; elles aident à repérer les phrases oubliées.
- Yandex Metrica et Search Console — les phrases qui amènent déjà des visiteurs.
Plus les sources sont nombreuses, plus le noyau est complet. Mais la collecte brute n'est que la moitié du travail.
Les étapes du travail sur le corpus de mots-clés
Collecte. À partir de mots-clés de départ, on scrape les phrases de toutes les sources. À cette étape, la profondeur de collecte, les permutations et les mots à exclure sont déterminants, faute de quoi on obtient soit du bruit, soit un noyau incomplet.
Nettoyage. On élimine du corpus les requêtes non pertinentes, les phrases parasites et « vides ». Les suggestions passent obligatoirement par une vérification des volumes de recherche afin d'écarter les phrases générées automatiquement que personne n'utilise.
Relevé des volumes de recherche. Chaque phrase reçoit son volume de recherche (y compris exact, entre guillemets et avec point d'exclamation) pour mesurer la demande réelle.
Clustering. Les requêtes sont regroupées par sens et par similarité du top des résultats de recherche : les phrases qui peuvent se positionner sur une même page forment un cluster. Les clusters alimentent la structure du site : un cluster = une page de destination.
Outils pour collecter et traiter les mots-clés
Key Collector 4 — la « moissonneuse » desktop de la sémantique. Il collecte les phrases depuis Wordstat et les suggestions, relève les volumes de recherche, filtre et regroupe le noyau, et s'intègre à des API payantes. La prise en charge de certaines fonctions de collecte de statistiques n'est plus garantie par l'éditeur, et le travail s'est compliqué après les mises à jour de Yandex, mais pour les noyaux volumineux et complexes, Key Collector reste l'une des solutions les plus puissantes.
Rush Analytics — un service en ligne pour créer et regrouper rapidement des noyaux : suggestions, volumes de recherche, collecte de mots-clés Google Ads, clustering — sans se battre avec les proxys et les captchas.
Bukvarix — une base de milliards de requêtes avec sélection de la sémantique par domaines concurrents, comparaison de noyaux et recherche avancée avec mots à exclure. Pratique pour démarrer vite et analyser les concurrents ; un accès freemium existe.
Serpstat — une plateforme prenant en charge Yandex et Google : recherche de phrases, requêtes similaires et manquantes, comparaison de domaines, clustering et analyse textuelle. Excellente pour l'analyse concurrentielle.
Keys.so — un service de collecte de sémantique fondé sur les concurrents et d'analyse des requêtes qui convertissent ; les données peuvent être actualisées via le scraping des volumes Wordstat.
MOAB.Tools et SpyWords — d'autres outils pour élargir le noyau grâce à des bases de données et à l'analyse des concurrents en organique et en publicité payante.
Pour le clustering, on utilise souvent des outils dédiés (notamment ceux intégrés à Rush Analytics, Serpstat, Just-Magic) : ils regroupent les requêtes selon le recoupement du top des résultats de recherche.
Les mots-clés et les autres étapes
La collecte de mots-clés s’appuie sur l'analyse des résultats de recherche : qui figure dans le top sur chaque requête et comment les clusters se regroupent. La collecte détaillée des SERP fait chez nous l'objet de prestations dédiées : extraction des SERP Yandex et extraction des SERP Google. Le noyau finalisé part ensuite en suivi de positions pour contrôler le référencement.
Le plus simple est de commencer par les sources de base : la collecte des volumes de recherche dans Wordstat et les suggestions Yandex.