Guides, études et cas clients sur le web scraping, la veille tarifaire et la livraison de données pour l'analyse, le marketing et le produit.
Comment fonctionnent les systèmes anti-bots modernes : fingerprinting, analyse comportementale, CAPTCHA — et ce que cela signifie pour les propriétaires de sites.
Scraping, parsing et crawling : en quoi ces processus diffèrent, comment ils s'articulent et pourquoi on confond sans cesse les termes.
Comment collecter les données de sites web sans être programmeur : de la copie manuelle et des extensions de navigateur jusqu'au service de scraping clé en main.
Le web scraping en Ruby : Nokogiri, HTTParty, Mechanize et Watir — du parsing de pages statiques à l'automatisation du navigateur.
Parsing des flux RSS et Atom : structure des formats, bibliothèques prêtes à l'emploi et veille des actualités et blogs sans crawler les pages.
Les expressions régulières dans le parsing : syntaxe, motifs utiles, limites d'application et pourquoi le HTML exige un parseur, pas une regex.
Guide des proxys pour le web scraping : datacenter, résidentiels et mobiles, rotation, vérification de la confidentialité et protection contre la détection.
Piloter un vrai navigateur depuis PHP : Symfony Panther, chrome-php et Selenium — parser le contenu dynamique sans quitter la stack PHP.
Travailler avec XML dans plusieurs langages : DOM contre SAX, XPath, espaces de noms et analyse de gros exports sans saturer la mémoire.