Technologies et protections : sites dynamiques, systèmes anti-bots, proxys et contournement des blocages.
Comment fonctionnent les systèmes anti-bots modernes : fingerprinting, analyse comportementale, CAPTCHA — et ce que cela signifie pour les propriétaires de sites.
Les expressions régulières dans le parsing : syntaxe, motifs utiles, limites d'application et pourquoi le HTML exige un parseur, pas une regex.
Guide des proxys pour le web scraping : datacenter, résidentiels et mobiles, rotation, vérification de la confidentialité et protection contre la détection.
Parser des sites nécessitant une authentification : cookies et sessions, jetons, CSRF, captcha à la connexion et exemples de connexion par programmation.
Selenium pour scraper les sites dynamiques : configuration des drivers, attentes, contournement de la détection d'automatisation et quand il vaut mieux utiliser une API.
Deux façons de scraper les sites dynamiques : la rétro-ingénierie des requêtes XHR vers l'API et les navigateurs headless — avantages, inconvénients et critères de choix.
Qu'est-ce que l'enrichissement de données : quels attributs ajouter aux entreprises, produits et contacts, où les trouver et comment cela fonctionne techniquement.
Le terme « normalisation des données » a trois significations : bases relationnelles, machine learning et nettoyage de données scrapées — nous les passons en revue.
Qu'est-ce qu'un parser DOM et comment fonctionne-t-il : construction de l'arbre du document, navigation entre les nœuds et différences avec les approches en flux et par regex.