La mission
La startup avait besoin de la liste la plus complète possible des sites éditoriaux de la zone .co.uk — blogs, sites d'actualité et autres plateformes de contenu — comme socle d'un corpus d'entraînement. La valeur tenait précisément à l'exhaustivité et à la propreté : capter tous les sites de contenu sans entraîner dans la liste des sites commerciaux ni des domaines poubelles.
Ce que nous avons fait et les données collectées
Nous avons parcouru la zone de domaines, retenu les sites vivants et relevé pour chacun les signaux d'un site éditorial : structure des rubriques, présence de fils et de RSS, fréquence de publication et thématique. L'anglais était une condition d'inclusion stricte — les sites de la zone dans d'autres langues étaient écartés. Le segment actualité était en plus recoupé avec l'index Google News — c'est ainsi que nous avons confirmé et complété les médias relevant réellement de l'actualité.
Nous avons ensuite procédé par soustraction — non seulement chercher « nos » sites, mais aussi nettoyer activement le superflu :
- retirer de la liste les sites d'entreprises présentes sur Google Maps dans des catégories hors sujet (boutiques, services, restauration, etc.) — éliminant ainsi les sites commerciaux qui, par leur structure, auraient pu passer pour des sites éditoriaux ;
- filtrer les sites à la note nulle dans les outils SEO — presque à coup sûr des domaines poubelles ou abandonnés.
Outre le répertoire de domaines lui-même (typé blog / actualité), nous avons aussi collecté les pages HTML de ces sites pour le corpus.
Difficultés et solutions
Premièrement, l'exhaustivité de la zone : il n'existe aucune liste publique complète. Nous avons assemblé le répertoire à partir de plusieurs sources et l'avons recoupé avec Google News pour combler les lacunes côté actualité.
Deuxièmement — le point clé — séparer les sites éditoriaux des sites commerciaux. À cette échelle, les signaux positifs « ceci est un blog ou un média » sont rares ; nous avons donc inversé le problème et soustrait les domaines commerciaux connus par croisement avec Google Maps : si un domaine appartient à une entreprise d'une catégorie hors sujet, ce n'est pas notre site.
Troisièmement, les sites poubelles et abandonnés. Nous les avons écartés en raison d'une note nulle dans les outils SEO, pour que le corpus ne capte pas de bruit.
Le résultat
La startup a reçu à la fois un répertoire propre des domaines éditoriaux de la zone (blogs et actualité, sans commerce ni déchets) et le contenu lui-même — un ensemble de pages HTML compressées en gzip et rangées dans un stockage objet de type S3 auquel nous avons donné accès. Autrement dit, un corpus prêt à l'emploi, pas une simple liste de sites.
Services dans ce projet : Base de noms de domaine · Extraction d'articles de presse · Base de données des médias · Extraction de données Google Maps · Données pour l'IA et le machine learning · DaaS et données via API
Ressources utiles : Parsing de flux RSS · Crawl de la structure d'un site · Comment collecter les données d'un site