Ressources · Blog

Technologies et protections

Technologies et protections : sites dynamiques, systèmes anti-bots, proxys et contournement des blocages.

Technologies et protections
Protection anti-scraping : comment fonctionnent les systèmes anti-bots modernes

Comment fonctionnent les systèmes anti-bots modernes : fingerprinting, analyse comportementale, CAPTCHA — et ce que cela signifie pour les propriétaires de sites.

7 mai · 14 min
Technologies et protections
Expressions régulières pour le parsing : syntaxe, motifs et limites

Les expressions régulières dans le parsing : syntaxe, motifs utiles, limites d'application et pourquoi le HTML exige un parseur, pas une regex.

27 avril · 8 min
Technologies et protections
Proxys pour le web scraping : guide des types, de la confidentialité et de la détection

Guide des proxys pour le web scraping : datacenter, résidentiels et mobiles, rotation, vérification de la confidentialité et protection contre la détection.

25 avril · 14 min
Technologies et protections
Scraper un site avec authentification : guide complet avec exemples de code

Parser des sites nécessitant une authentification : cookies et sessions, jetons, CSRF, captcha à la connexion et exemples de connexion par programmation.

19 avril · 10 min
Technologies et protections
Web scraping avec Selenium : guide détaillé

Selenium pour scraper les sites dynamiques : configuration des drivers, attentes, contournement de la détection d'automatisation et quand il vaut mieux utiliser une API.

7 avril · 10 min
Technologies et protections
Scraping de sites dynamiques : deux approches

Deux façons de scraper les sites dynamiques : la rétro-ingénierie des requêtes XHR vers l'API et les navigateurs headless — avantages, inconvénients et critères de choix.

2 mars · 16 min
Technologies et protections
Enrichissement de données : définition, quelles données enrichir et à partir de quelles sources

Qu'est-ce que l'enrichissement de données : quels attributs ajouter aux entreprises, produits et contacts, où les trouver et comment cela fonctionne techniquement.

10 février · 9 min
Technologies et protections
Normalisation des données : trois sens différents d'un même terme

Le terme « normalisation des données » a trois significations : bases relationnelles, machine learning et nettoyage de données scrapées — nous les passons en revue.

8 février · 8 min
Technologies et protections
Parser le DOM : analyse détaillée

Qu'est-ce qu'un parser DOM et comment fonctionne-t-il : construction de l'arbre du document, navigation entre les nœuds et différences avec les approches en flux et par regex.

4 février · 6 min