Formats et sources de données : HTML, XML, JSON, API et bases de données.
Scraping, parsing et crawling : en quoi ces processus diffèrent, comment ils s'articulent et pourquoi on confond sans cesse les termes.
Parsing des flux RSS et Atom : structure des formats, bibliothèques prêtes à l'emploi et veille des actualités et blogs sans crawler les pages.
Travailler avec XML dans plusieurs langages : DOM contre SAX, XPath, espaces de noms et analyse de gros exports sans saturer la mémoire.
Parsing d'URL : de quoi se compose une adresse, comment décomposer et assembler les liens, gérer les paramètres de requête et l'encodage dans différents langages.
Analyser des fichiers texte : lecture ligne par ligne de gros volumes, encodages, expressions régulières et exemples dans plusieurs langages.
Pourquoi démarrer la collecte par sitemap.xml : index de cartes, sélection des URL utiles et économie de requêtes avant le scraping.
Extraire texte et tableaux des PDF : couches texte contre scans, OCR avec Tesseract et exemples en Python, JavaScript et Java.
Parsing des logs de serveurs et d'applications : formats des journaux d'accès et d'erreurs, expressions régulières, outils prêts à l'emploi et exemples d'analyse.
Le parsing JSON en détail : structures imbriquées, streaming des gros fichiers et erreurs typiques lors de l'utilisation d'API.