Ressources · Blog

Le blog de la collecte de données

Guides, études et cas clients sur le web scraping, la veille tarifaire et la livraison de données pour l'analyse, le marketing et le produit.

Guide général du web scraping
Quel langage choisir pour écrire un scraper ? Panorama des principales solutions

Comparatif des langages pour écrire des scrapers — Python, JavaScript, PHP, Go, Java et C# : vitesse, écosystème, courbe d'apprentissage et cas d'usage.

6 février · 12 min
Technologies et protections
Parser le DOM : analyse détaillée

Qu'est-ce qu'un parser DOM et comment fonctionne-t-il : construction de l'arbre du document, navigation entre les nœuds et différences avec les approches en flux et par regex.

4 février · 6 min
Technologies et protections
Sélecteurs CSS pour le web scraping : panorama des syntaxes

Aide-mémoire des sélecteurs CSS pour l'extraction de données : classes, attributs, pseudo-classes, combinateurs et erreurs typiques lors de la sélection d'éléments.

2 février · 8 min
Guide général du web scraping
Bibliothèques pour le web scraping

Catalogue des bibliothèques de web scraping pour Python, JavaScript, PHP, Java, C# et Go : que choisir pour les pages statiques, le contenu dynamique et les API.

31 janvier · 11 min
Le scraping par langage
Collecte de mots-clés à partir de Google : pour le SEO international et russophone

Collecte de mots-clés depuis Google : suggestions, Keyword Planner, résultats de recherche et requêtes associées — pour le SEO international et russophone.

29 janvier · 3 min
Le scraping par langage
Parsing XML en Python : ElementTree, lxml et traitement en flux

Travailler avec le XML en Python : ElementTree pour les tâches simples, lxml pour XPath et le parsing en flux de fichiers de plusieurs gigaoctets avec iterparse.

27 janvier · 8 min
SEO et moteurs de recherche
Scraper Yandex Wordstat : collecte des volumes de recherche et des mots-clés

Comment automatiser la collecte des volumes de recherche depuis Yandex Wordstat : opérateurs, limites du service, captcha et solutions de contournement via l'API et les scrapers.

25 janvier · 3 min
SEO et moteurs de recherche
Scraping de mots-clés : comment collecter et regrouper un corpus de mots-clés

Collecte et regroupement d'un corpus de mots-clés par scraping : sources de mots-clés, volumes de recherche, regroupement et préparation au référencement.

23 janvier · 3 min
Le scraping par langage
Web scraping en Python avec lxml : vitesse et XPath

Pourquoi lxml est l'un des parseurs HTML/XML les plus rapides pour Python : requêtes XPath, comparaison avec BeautifulSoup et techniques pour traiter les documents volumineux.

21 janvier · 6 min