La mission
L'agence devait repérer des domaines de confiance parmi ceux en cours de libération (drops) — avec de bons indicateurs, un âge respectable et un historique propre — afin de les récupérer et de les exploiter. Les listes de domaines expirés sont dispersées sur des dizaines de plateformes, les formats varient et les volumes sont énormes — impossible de couvrir cela manuellement.
Ce que nous avons fait et les données collectées
Nous avons dressé la liste des plateformes qui publient des listes de domaines expirés et de drops — GoDaddy, DropCatch, SnapNames, nicsell, Dynadot, Kifdom, Sav, UKBackorder, Catched, park.io, Namecheap, NameSilo, Gname, Aftermarket, Domainlore.uk et d'autres — et mis en place une collecte régulière de leurs exports dans un flux unique.
Ensuite, l'enrichissement. Nous avons ramené les dates de drop à un fuseau unique pour savoir quand un domaine se libère réellement. Nous avons complété les indicateurs via les API d'Ahrefs et de Moz (autorité et profil de liens), récupéré le WHOIS pour l'âge et l'historique d'enregistrement, et, pour les domaines présélectionnés, ajouté les données des archives du web — pour voir ce qui était hébergé auparavant sur le domaine et dans quelle langue. En complément, nous avons construit une interface où les analystes de l'agence effectuent la notation manuelle finale sur des candidats déjà collectés et enrichis.
Le projet s'est structuré comme une recherche et un enrichissement de données à partir d'une base de noms de domaine, avec livraison dans une interface pratique et des exports (DaaS).
Difficultés et solutions
La principale difficulté : l'échelle. Des centaines de milliers de domaines expirent chaque jour, et dérouler l'ensemble des vérifications sur chacun n'a pas de sens. Nous avons monté une chaîne de traitement : d'abord collecter et dédupliquer les listes de domaines expirés, puis enrichir de métriques, et n'exécuter les étapes coûteuses (archives du web) que sur les domaines présélectionnés. La chaîne de traitement tourne quotidiennement.
Deuxième difficulté : l'hétérogénéité des sources. Chaque plateforme a son format de liste et sa façon d'indiquer la date et l'heure du drop. Nous avons tout ramené à un schéma unique et à un fuseau unique ; sur la mise en forme commune, voir notre article sur la normalisation des données.
Troisième difficulté, la plus critique : écarter les domaines au passé « sale » — ceux qui avaient déjà droppé et hébergé du spam. Sur les seules métriques, un tel domaine peut sembler attractif alors qu'il est en réalité compromis. Nous avons examiné l'historique via les archives du web et les signes d'expirations antérieures pour que ces candidats ne passent pas. Le travail avec des API externes (Ahrefs, Moz, WHOIS) s'est aussi révélé précieux pour un enrichissement rapide.
À noter : ces plateformes n'ont aucune protection anti-scraping — l'enjeu n'était pas de contourner des blocages, mais l'échelle et la qualité des données.
Le résultat
L'agence dispose d'un flux quotidien unique de domaines expirés, enrichi d'indicateurs, d'âge et d'historique, avec une interface de notation manuelle — l'évaluation des candidats se fait au même endroit, au lieu de parcourir des dizaines de plateformes et de recouper les métriques à la main.
Services dans ce projet : Recherche et enrichissement de données · Base de noms de domaine · DaaS et données via API · Données pour le SEO et la recherche
Ressources utiles : Enrichissement de données · Normalisation des données · Parsing d'API