Ressources · Blog

Le blog de la collecte de données

Guides, études et cas clients sur le web scraping, la veille tarifaire et la livraison de données pour l'analyse, le marketing et le produit.

Technologies et protections
Protection anti-scraping : comment fonctionnent les systèmes anti-bots modernes

Comment fonctionnent les systèmes anti-bots modernes : fingerprinting, analyse comportementale, CAPTCHA — et ce que cela signifie pour les propriétaires de sites.

7 mai · 14 min
Formats et sources de données
Scraping, parsing et crawling : quelles différences ?

Scraping, parsing et crawling : en quoi ces processus diffèrent, comment ils s'articulent et pourquoi on confond sans cesse les termes.

5 mai · 8 min
Guide général du web scraping
Comment collecter les données d'un ou plusieurs sites web : le guide pour les non-initiés

Comment collecter les données de sites web sans être programmeur : de la copie manuelle et des extensions de navigateur jusqu'au service de scraping clé en main.

3 mai · 12 min
Le scraping par langage
Web scraping en Ruby : le guide complet, du simple au complexe

Le web scraping en Ruby : Nokogiri, HTTParty, Mechanize et Watir — du parsing de pages statiques à l'automatisation du navigateur.

1 mai · 30 min
Formats et sources de données
Parsing de flux RSS : comment extraire les données des flux et pourquoi

Parsing des flux RSS et Atom : structure des formats, bibliothèques prêtes à l'emploi et veille des actualités et blogs sans crawler les pages.

29 avril · 7 min
Technologies et protections
Expressions régulières pour le parsing : syntaxe, motifs et limites

Les expressions régulières dans le parsing : syntaxe, motifs utiles, limites d'application et pourquoi le HTML exige un parseur, pas une regex.

27 avril · 8 min
Technologies et protections
Proxys pour le web scraping : guide des types, de la confidentialité et de la détection

Guide des proxys pour le web scraping : datacenter, résidentiels et mobiles, rotation, vérification de la confidentialité et protection contre la détection.

25 avril · 14 min
Le scraping par langage
Web scraping en PHP avec un navigateur

Piloter un vrai navigateur depuis PHP : Symfony Panther, chrome-php et Selenium — parser le contenu dynamique sans quitter la stack PHP.

23 avril · 12 min
Formats et sources de données
Parsing XML : bibliothèques, XPath et exemples multi-langages

Travailler avec XML dans plusieurs langages : DOM contre SAX, XPath, espaces de noms et analyse de gros exports sans saturer la mémoire.

21 avril · 5 min