Formats et sources de données : HTML, XML, JSON, API et bases de données.
Extraire le texte et les liens du HTML : encodages, balisage cassé, URL relatives et exemples de solutions dans les langages populaires.
Analyse de fichiers Excel en code : feuilles, formules, cellules fusionnées, styles et exemples de lecture en Python, PHP, JavaScript et C#.
Web scraping avec Excel et VBA : requêtes vers les pages, analyse du HTML et mise à jour automatique des tableaux sans programme externe.
Tour d'horizon du parsing de documents : PDF, Word, Excel, présentations et scans — quelles bibliothèques et approches fonctionnent pour chaque format.
Tout sur le parsing des CSV : séparateurs, guillemets, encodages, fichiers mal formés issus d'Excel et exemples de lecture en Python, PHP, JavaScript et Go.
L'extraction de données via API plutôt que via HTML : comment trouver les endpoints cachés des sites, gérer l'authentification, les limites de requêtes et la pagination.
Sélection de livres sur le web scraping et l'extraction de données : des manuels de scraping en Python aux ouvrages sur les crawlers, les protections anti-bots et les bases de données.