Vous cherchez de nouveaux clients B2B, mais acheter un fichier de prospects vous semble cher, et le copier-coller depuis Google vous prend des journées entières ? Il existe une troisième voie : récupérer automatiquement les informations que les entreprises publient elles-mêmes sur le web. C’est ce qu’on appelle le web scraping, et appliqué à la prospection, le lead scraping.
Dans ce guide, vous verrez ce que le web scraping peut réellement vous apporter pour obtenir des leads, où trouver vos prospects en ligne, les quatre façons de les extraire en 2026 (y compris avec un agent IA), et comment transformer des données brutes en leads qualifiés sans enfreindre le RGPD. Aucune compétence technique n’est nécessaire pour suivre cet article.
Lead scraping : de quoi parle-t-on ?
Le web scraping (ou extraction de données web) consiste à collecter automatiquement des informations affichées sur des pages web et à les ranger dans un tableau structuré : fichier Excel, CSV, Google Sheets ou base de données. Là où vous copieriez chaque fiche à la main, un logiciel parcourt les pages et remplit le tableau à votre place.
Le lead scraping est l’application de cette technique à la prospection : on extrait des informations sur des entreprises ou des professionnels susceptibles de devenir vos clients.
Concrètement, voici à quoi ressemble une ligne de fichier obtenue par scraping à partir d’un annuaire ou d’une carte en ligne :
| Entreprise | Secteur | Ville | Téléphone | Site web | E-mail générique | Source | Date de collecte |
|---|---|---|---|---|---|---|---|
| Garage Martin & Fils | Réparation automobile | Lyon 7e | 04 XX XX XX XX | garagemartin.fr | contact@… | Google Maps | 29/09/2026 |
Chaque ligne n’est pas encore un client, ni même un lead qualifié : c’est une entreprise identifiée, que vous pourrez ensuite trier, enrichir et contacter. Nous y reviendrons plus loin, car c’est là que se joue la qualité de vos leads.
Pourquoi le web scraping fonctionne pour trouver des prospects B2B
Les entreprises publient elles-mêmes leurs coordonnées
En B2B, la plupart des informations dont vous avez besoin sont publiques, et ce n’est pas un hasard : une entreprise veut être trouvée. Elle crée sa fiche Google, s’inscrit sur PagesJaunes ou dans un annuaire professionnel, expose sur des salons, publie ses offres d’emploi et affiche ses coordonnées sur son site. Le web est donc, de fait, la plus grande base de données B2B disponible, et elle est mise à jour en permanence par les entreprises elles-mêmes.
Le problème n’est pas l’accès à l’information, mais son volume : 500 fiches d’artisans dans une ville, c’est plusieurs jours de copier-coller. Le scraping résout précisément ce problème d’échelle.
Scraper, acheter un fichier ou copier-coller : que choisir ?
| Critère | Copier-coller manuel | Acheter un fichier | Web scraping |
|---|---|---|---|
| Coût | Gratuit, mais très chronophage | Élevé, souvent facturé au contact | Faible (outil gratuit ou abonnement) |
| Fraîcheur des données | Actuelle | Variable, parfois ancienne | Actuelle, au moment de la collecte |
| Précision du ciblage | Totale | Limitée aux filtres du fournisseur | Totale : vous choisissez la source et les critères |
| Volume | Quelques dizaines de fiches | Illimité | Des centaines à des milliers de fiches |
| Transparence sur l’origine | Totale | Parfois floue | Totale : vous savez d’où vient chaque ligne |
| Contacts nominatifs vérifiés | Rarement | Souvent | Rarement : à compléter par un outil d’enrichissement |
Le scraping n’est donc pas la solution à tout. Il excelle pour constituer une base ciblée et à jour d’entreprises, beaucoup moins pour obtenir directement l’e-mail vérifié d’un décideur. C’est pourquoi on le combine souvent avec des outils d’enrichissement, que nous présentons dans notre comparatif des outils de génération de leads B2B.
Où trouver des leads sur le web : 6 types de sources
La qualité de vos leads dépend d’abord de la source choisie. Avant toute extraction, posez-vous deux questions : où mes clients idéaux sont-ils visibles en ligne ? et quelle information me dit qu’ils ont besoin de moi maintenant ?
| Type de source | Exemples | Idéal pour | Données typiques |
|---|---|---|---|
| Cartes en ligne | Google Maps | Commerces, artisans, professions libérales, prospection locale | Nom, adresse, téléphone, site, note, nombre d’avis |
| Annuaires professionnels | PagesJaunes, Kompass, Europages | TPE/PME par secteur et zone géographique | Raison sociale, activité, coordonnées, parfois SIRET |
| Annuaires d’exposants | Salons professionnels | Entreprises actives dans un secteur précis | Nom, stand, site web, description, pays |
| Réseaux professionnels | Décideurs, fonctions précises | Nom, poste, entreprise, localisation | |
| Sites d’offres d’emploi | Welcome to the Jungle, Indeed | Détecter un besoin (signal d’achat) | Entreprise, poste recherché, lieu, date de publication |
| Registres d’entreprises | Societe.com, Pappers | Qualifier : taille, ancienneté, chiffre d’affaires | SIREN, dirigeants, effectif, date de création |
Quelques pistes pour aller plus loin, source par source :
- Google Maps, la source la plus utilisée pour la prospection locale : constituer un fichier de prospection depuis Google Maps.
- PagesJaunes, pour les TPE et artisans français : extraire les contacts d’entreprises depuis PagesJaunes.
- Salons professionnels, une source souvent négligée alors qu’elle concentre des entreprises actives d’un même secteur : extraire la liste des exposants d’un salon.
- LinkedIn, pour atteindre les décideurs : scraper LinkedIn sans coder.
Les signaux d’achat : la source la plus sous-estimée
Les annuaires vous disent qui existe. Certaines sources vous disent qui a un besoin maintenant. C’est ce qu’on appelle un signal d’achat :
- une entreprise qui recrute un(e) chargé(e) de marketing a probablement un projet marketing en cours ;
- une entreprise qui expose à un salon investit dans son développement commercial ;
- une entreprise récemment créée (visible dans les registres) doit s’équiper : comptable, assurance, site web, logiciels ;
- un commerce avec peu d’avis Google ou sans site web est un prospect naturel pour une agence web.
Scraper ces signaux, plutôt qu’une liste générique, est souvent ce qui fait la différence entre un taux de réponse de quelques pourcents et une prospection réellement rentable. Vous en verrez un exemple concret plus bas.
Comment extraire des leads : 4 méthodes en 2026
Il existe aujourd’hui quatre grandes façons de scraper des leads. Elles ne demandent ni les mêmes compétences, ni le même budget.
1. Les modèles prêts à l’emploi
Pour les sources les plus courantes (Google Maps, annuaires, réseaux sociaux…), des outils comme Octoparse proposent des modèles de scraping préconfigurés : vous saisissez un mot-clé et une ville, ou collez une URL, et l’outil renvoie un tableau. C’est la méthode la plus rapide pour démarrer, sans aucune configuration. Vous pouvez parcourir les modèles de génération de leads disponibles.
2. Les outils de scraping no-code
Lorsque votre source est plus spécifique (un annuaire de niche, un site d’exposants, une plateforme sectorielle), un outil no-code vous permet de créer votre propre robot en cliquant sur les éléments à extraire, directement dans un navigateur intégré. L’outil gère la pagination, le chargement des contenus dynamiques et l’export. C’est la méthode la plus polyvalente pour une équipe commerciale ou marketing sans développeur.
3. Le code (Python et bibliothèques de scraping)
Les profils techniques peuvent écrire leurs propres scripts, par exemple en Python avec BeautifulSoup ou Playwright. Cette approche offre une liberté totale, mais demande du temps de développement et surtout de maintenance : dès qu’un site modifie sa structure, le script doit être corrigé. Elle se justifie surtout pour des besoins très spécifiques ou des volumes très importants.
4. Les agents IA connectés à un outil de scraping
C’est la méthode la plus récente : vous décrivez votre besoin en langage naturel à un assistant IA (Claude, ChatGPT…), qui pilote lui-même un outil de scraping pour exécuter la collecte. Nous la détaillons dans la section suivante.
Et si vous ne voulez rien faire vous-même ? Il est aussi possible de confier entièrement la collecte à un prestataire. Octoparse propose par exemple un service de données qui livre directement le fichier.
Quelle méthode choisir ?
| Méthode | Compétences | Coût | Volume | Fiabilité dans le temps | Pour qui ? |
|---|---|---|---|---|---|
| Modèles prêts à l’emploi | Aucune | Faible | Élevé | Élevée (maintenus par l’éditeur) | Démarrer vite sur une source courante |
| Outil no-code | Faibles | Faible à moyen | Élevé | Bonne | Sources spécifiques, équipes sans développeur |
| Code | Élevées | Temps de développement | Très élevé | À maintenir soi-même | Développeurs, besoins sur mesure |
| Agent IA + outil de scraping | Aucune | Faible à moyen | Moyen à élevé | Dépend de l’outil connecté | Automatiser toute la chaîne en langage naturel |
Agents IA et web scraping : la nouvelle façon de générer des leads
Un assistant IA peut-il trouver des prospects à votre place ?
Oui et non. Posez la question « trouve-moi 200 agences immobilières à Lyon avec leur téléphone » à un assistant IA seul, et vous obtiendrez au mieux quelques dizaines de résultats, au pire des coordonnées inventées. Un modèle de langage n’est pas une base de données : il ne parcourt pas des centaines de pages de façon systématique, et il peut « halluciner » des informations qui ont l’air plausibles, comme une adresse e-mail construite au hasard.
Ce qui change la donne, c’est la possibilité de connecter l’assistant IA à un véritable outil de scraping. C’est le rôle du protocole MCP (Model Context Protocol) : il permet à un agent IA d’utiliser des outils externes, comme un logiciel d’extraction de données, au lieu de tout « deviner ».
Comment fonctionne un agent IA de prospection
Avec un serveur MCP comme celui d’Octoparse, le déroulé ressemble à ceci :
- Vous formulez votre besoin en français : « Récupère les agences immobilières de Lyon sur Google Maps, avec leur téléphone, leur site web et leur note. »
- L’agent cherche le modèle de scraping adapté et configure la tâche.
- La collecte s’exécute dans le cloud, et l’agent suit son avancement.
- L’agent récupère les données (au format CSV ou JSON) et peut enchaîner : trier, dédoublonner, repérer les entreprises sans site web, rédiger une première version de message d’approche.
L’intérêt est double : vous n’avez plus à configurer l’outil vous-même, et les données restent issues d’une collecte réelle, donc vérifiables ligne par ligne. Pour une mise en place pas à pas, consultez notre guide Claude + Octoparse MCP.
Les limites à connaître
- Contrôlez toujours les données. Même connecté à un outil, un agent peut mal interpréter une consigne. Vérifiez un échantillon avant toute campagne.
- Ne laissez pas l’IA « compléter » les coordonnées manquantes. Un e-mail absent doit être recherché avec un outil d’enrichissement, pas deviné.
- Pour les gros volumes et les collectes récurrentes, une tâche de scraping planifiée reste plus stable et plus économique qu’une conversation avec un agent. L’agent est idéal pour lancer, explorer et automatiser, et l’outil de scraping pour produire la donnée de façon fiable.
Des données brutes aux leads qualifiés
Un fichier extrait n’est qu’une matière première. Pour en faire des leads exploitables, quatre étapes sont indispensables.
- Nettoyer et dédoublonner. Une même entreprise peut apparaître plusieurs fois (plusieurs pages, plusieurs sources). Harmonisez aussi les formats : numéros de téléphone, adresses, casse des noms. Notre guide data cleaning explique comment automatiser ce travail sans code.
- Filtrer selon votre client idéal. Retirez les entreprises hors cible : taille, secteur, zone, chaînes nationales si vous visez les indépendants, etc.
- Enrichir. Complétez les données d’entreprise avec des contacts nominatifs (e-mail professionnel du décideur, ligne directe) grâce à un outil d’enrichissement comme Dropcontact ou Kaspr, ou un extracteur d’e-mails pour les adresses publiées sur les sites.
- Prioriser. Attribuez un score simple : présence d’un signal d’achat, taille, proximité géographique. Commencez par les prospects les mieux notés, puis importez-les dans votre CRM ou votre outil de cold email.
Ces étapes peuvent être automatisées de bout en bout, de l’extraction à l’import dans le CRM : voir notre exemple de workflow de prospection automatisée depuis Google Maps.
Exemple concret : repérer des prospects grâce aux offres d’emploi
Le contexte. Prenons une agence de marketing digitale qui accompagne les PME. Ses meilleurs clients ont un point commun : ils ont un projet marketing, mais pas encore l’équipe pour le mener. Plutôt que de prospecter une liste générique de PME, l’agence cherche les entreprises qui recrutent en ce moment un profil marketing : c’est le signe qu’elles investissent dans leur marketing, et qu’un renfort externe pourrait être envisagé.
La source. Welcome to the Jungle, et plus précisément sa page qui regroupe toutes les offres de Marketing Manager à Paris (75) : 60 offres au moment de la collecte, le 29 septembre 2026. Pour chaque offre, nous avons récupéré l’intitulé, le type de contrat, la date de publication, ainsi que les informations affichées sur l’entreprise : secteur, nombre de collaborateurs et site web.
Ce que la collecte a donné :
| Étape | Résultat |
|---|---|
| Offres extraites (liste + fiches détaillées) | 60 offres, publiées par 53 entreprises |
| Offres hors sujet retirées (postes d’achats dont l’intitulé contient « marketing ») | 57 offres |
| Stages et VIE retirés, pour ne garder que les CDI et CDD | 46 offres, soit 43 entreprises uniques |
| Entreprises de 15 à 250 salariés | 26 entreprises |
| Hors agences, cabinets de conseil et acteurs du marketing (concurrents potentiels) | 21 entreprises |
| Durée de la collecte automatique | 25 min 40 s |

Ce que l’on retient. Sur 60 offres extraites, seules 21 entreprises correspondaient réellement à la cible, soit environ une sur trois. Les exclusions ne sont pas des erreurs de collecte : ce sont des entreprises de plus de 250 salariés (jusqu’à de très grands groupes), des start-up de moins de 15 personnes, des stages, ou des agences qui font déjà le même métier que vous. C’est tout l’enjeu du lead scraping : le volume brut compte moins que le choix du signal et la rigueur du tri. En contrepartie, chaque entreprise de la liste finale a une raison concrète d’être contactée, ce qui permet un message d’approche personnalisé (« J’ai vu que vous recrutiez un(e) Marketing Manager… »).
Reste une étape : la page Welcome to the Jungle fournit le site web de l’entreprise, mais pas le contact du décideur. C’est là qu’intervient l’enrichissement décrit plus haut, pour retrouver l’e-mail professionnel du dirigeant ou du responsable marketing.
Dans cet exemple, la collecte a été réalisée avec un outil no-code (Octoparse). Pour reproduire la démarche pas à pas, consultez notre guide : comment extraire des leads B2B avec Octoparse.
Lead scraping et RGPD : ce qu’il faut savoir
Le scraping de données publiques n’est pas interdit en France, mais il est encadré. Voici les principes essentiels, à valider avec votre juriste ou votre DPO.
- Données d’entreprise ou données personnelles ? Les informations qui concernent une personne morale (raison sociale, adresse du siège, standard téléphonique, e-mail générique de type contact@) ne sont pas des données personnelles au sens du RGPD. En revanche, le nom d’un dirigeant ou un e-mail nominatif (prenom.nom@) en sont, même s’ils sont publiés en ligne.
- Une base légale : l’intérêt légitime. La collecte de données personnelles à des fins de prospection B2B peut reposer sur l’intérêt légitime, à condition que votre offre soit en lien avec la fonction professionnelle de la personne contactée.
- Minimisation. Ne collectez que les données utiles à votre prospection. Inutile d’extraire tout ce qu’une page affiche.
- Information et droit d’opposition. Indiquez dès le premier contact d’où proviennent les données et offrez un moyen simple de ne plus être sollicité (lien de désinscription).
- Durée de conservation. La CNIL recommande de ne pas conserver les données d’un prospect inactif plus de 3 ans après la collecte ou le dernier contact.
- Conditions d’utilisation des sites. Certaines plateformes encadrent ou interdisent la collecte automatisée : consultez-les avant de lancer une extraction.
Pour une analyse plus détaillée (positions de la CNIL, prospection téléphonique, cas de Google Maps), lisez notre article : extraire des données Google Maps est-il légal en France ?. Référence officielle : la fiche de la CNIL sur la prospection commerciale par courrier électronique.
Cet article a une vocation informative et ne constitue pas un conseil juridique.
FAQ sur le lead scraping
Le lead scraping est-il légal en France ?
Oui, dans un cadre précis. Extraire des données publiques d’entreprises (raison sociale, adresse, standard) pose peu de difficultés. Dès que vous collectez des données personnelles (nom d’un dirigeant, e-mail nominatif), vous devez respecter le RGPD : base légale (généralement l’intérêt légitime), minimisation, information des personnes et droit d’opposition. Respectez aussi les conditions d’utilisation des sites visés.
Comment obtenir des leads gratuitement ?
Les sources publiques (Google Maps, PagesJaunes, annuaires d’exposants, sites d’emploi) sont gratuites. Pour les extraire, vous pouvez utiliser la version gratuite d’un outil de scraping : celle d’Octoparse permet par exemple de créer 10 tâches et d’exporter jusqu’à 50 000 lignes par mois. Découvrez ce que permet la version gratuite d’Octoparse.
ChatGPT peut-il trouver des prospects ?
Seul, un assistant IA n’est pas fiable pour constituer un fichier : il traite peu de résultats et peut inventer des coordonnées. Connecté à un outil de scraping via le protocole MCP, il devient en revanche capable de lancer une vraie collecte et de vous restituer des données vérifiables. Voir notre guide : utiliser ChatGPT comme scraper web avec Octoparse MCP.
Faut-il savoir coder pour scraper des leads ?
Non. Les modèles prêts à l’emploi et les outils no-code permettent d’extraire des leads sans écrire une ligne de code. Le code n’est utile que pour des besoins très spécifiques ou des volumes très importants.
Vaut-il mieux scraper ses leads ou acheter un fichier ?
Le scraping offre des données plus fraîches, un ciblage plus précis et une origine transparente, pour un coût bien plus faible. L’achat de fichier peut être pertinent si vous avez besoin immédiatement de contacts nominatifs vérifiés en grand volume. Beaucoup d’équipes combinent les deux : scraping pour constituer la base, puis enrichissement pour obtenir les contacts des décideurs.
Conclusion
Le web scraping ne remplace pas une stratégie de prospection : il lui donne une matière première plus fraîche, plus ciblée et moins coûteuse. La méthode tient en quatre points : choisir une source où vos clients sont visibles, de préférence porteuse d’un signal d’achat ; extraire les données avec la méthode adaptée à vos compétences, des modèles prêts à l’emploi jusqu’aux agents IA ; nettoyer, enrichir et prioriser ; et respecter le RGPD à chaque étape.
Prêt à passer à la pratique ? Suivez notre guide pas à pas pour extraire vos premiers leads B2B avec Octoparse.



