📌 Comment pouvez-vous extraire du contenu structuré de plusieurs sites web publics avec un seul crawler ?
Ce modèle collecte le contenu structuré des pages et les métadonnées des pages de sites web publics fournis par l'utilisateur, sous réserve de la profondeur de crawl, de la limite de pages et des règles d'exclusion configurées. Il est utile pour les chercheurs de contenu, les équipes de bases de connaissances et les équipes d'opérations de données.
Les données sont collectées à partir de sites web publics fournis par l'utilisateur. Ce modèle n'est pas lié à un seul site web source. Il part des URL de sites web publics fournies par l'utilisateur et extrait le contenu des pages dans le cadre de l'exploration configuré.
💰 Tarifs
Ce modèle est actuellement gratuit et n'a pas de frais d'utilisation par ligne. Les limites du plan ou des ressources Octoparse peuvent toujours s'appliquer.
📦 Sortie
L'implémentation publiée actuelle peut retourner les champs suivants :
msg_typecontenturltitleauthorpublished_atformaterror_message
{
"msg_type": null,
"content": "{\"text\": \"Eighty feet below the streets of Manhattan...\"}",
"url": "https://www.bloomberg.com/opinion/articles/...",
"title": "Why Is Germany Sitting on $599 Billion of Gold?",
"author": "Chris Bryant",
"published_at": "2026-01-29",
"format": "json",
"error_message": null
}
🎯 Cas d'utilisation
- Créer des archives de contenu en utilisant l'URL de la page, le titre, l'auteur et l'heure de publication.
- Préparer le contenu du site web pour une analyse en aval en utilisant le format sélectionné.
- Explorer des sections de site délimitées en utilisant les contrôles de profondeur, de limite de pages et d'exclusion.
- Auditer les pages inaccessibles en utilisant les champs URL et message d'erreur.
🐙 Pourquoi Octoparse
- Flux de travail prêt à l'emploi : Les étapes d'extraction pour les sites web publics fournis par l'utilisateur sont déjà configurées, vous n'avez donc pas besoin de créer le scraper à partir de zéro.
- Exécution flexible : Exécutez la tâche prête à l'emploi dans le cloud sans avoir à garder un ordinateur local en ligne pour la collecte.
- Sortie structurée et reproductible : Les résultats sont retournés sous forme de lignes cohérentes, plus faciles à comparer, filtrer, dédupliquer et traiter que des pages copiées manuellement.
- Garde-fous d'entrée vérifiés : Le formulaire expose les entrées actuelles, les valeurs sélectionnables et les limites significatives configurées pour ce modèle.
- Transfert de données pratique : Examinez les résultats dans Octoparse et exportez-les ou traitez-les en utilisant les options prises en charge par votre environnement Octoparse.
📝 Entrée
Remplissez les champs suivants :
- URL du site web (Requis) — Entrez l'URL ou les URL du site web public où l'exploration doit commencer. Jusqu'à 10 000 entrées par exécution.
- Profondeur de crawl maximale (Optionnel) — Définissez le nombre de niveaux de liens que le crawler peut suivre à partir de chaque URL de départ. Laissez vide pour utiliser une profondeur de crawl de 0. Plage acceptée : 0 à 5.
- Nombre maximum de pages par URL (Optionnel) — Définissez le nombre maximum de pages à collecter pour chaque URL de départ. Laissez vide pour utiliser 10 pages. Plage acceptée : 1 à 1000.
- Format (Optionnel)
- Exclude_Glob (Optionnel) — Entrez un modèle glob pour les URL ou les chemins qui doivent être exclus de l'exploration.
- Output_Field_Name (Optionnel)
🚀 Comment utiliser
- Ouvrez le modèle et sélectionnez Essayer ou Démarrer.
- Remplissez les champs d'entrée listés ci-dessus.
- Démarrez la tâche en utilisant le mode d'exécution cloud pris en charge.
- Examinez les lignes de sortie et exportez ou traitez les données structurées.
⚠️ Limites
Les résultats dépendent de ce que le site source expose au moment de l'exécution. Un champ de sortie listé peut être vide lorsque la page source ne fournit pas cette valeur. Les limites d'entrée indiquées ci-dessus sont appliquées par le modèle.
💡 Astuces
Utilisez des entrées spécifiques et valides et examinez un résultat représentatif avant de lancer un grand lot. Supprimez les entrées en double lorsque des enregistrements répétés ne sont pas nécessaires.
❓ FAQ
Comment Octoparse collecte-t-il les données des sites web publics fournis par l'utilisateur ?
L'automatisation Python part de chaque URL de site web soumise, suit les liens éligibles dans la limite de la profondeur et du nombre de pages configurés, exclut les liens correspondant au glob fourni, transforme le contenu de la page dans le format sélectionné et télécharge un enregistrement par page traitée.
Quelles sont les entrées requises pour ce Scraper de Contenu Universel ?
Utilisez les champs et les valeurs acceptées indiqués dans la section Entrée. Seules les limites pertinentes pour l'utilisateur et les options sélectionnables sont listées.
Quelles données puis-je extraire des sites web publics fournis par l'utilisateur ?
Les champs de sortie actuels et un Aperçu de données JSON représentatif sont listés dans la section Sortie. La disponibilité des champs peut varier lorsque la page source n'affiche pas de valeur.
L'utilisation de ce Scraper de Contenu Universel est-elle gratuite ?
Il est actuellement gratuit et n'a pas de frais d'utilisation par ligne. Les limites du plan ou des ressources Octoparse peuvent toujours s'appliquer.
Pourquoi certains champs des sites web publics fournis par l'utilisateur peuvent-ils être vides ?
Les pages sources n'exposent pas toujours toutes les valeurs pour chaque enregistrement, et les mises en page peuvent varier selon l'article, le marché ou la réponse actuelle du site. Le modèle retourne un champ lorsque la page actuelle le fournit.
Puis-je exporter les données collectées des sites web publics fournis par l'utilisateur ?
Vous pouvez examiner les lignes structurées dans Octoparse et les exporter ou les traiter en utilisant les options prises en charge par votre environnement Octoparse.
🔗 Modèles associés
- AI Crawl — Utilisez la portée et les filtres guidés par l'IA lorsqu'un site web nécessite une exploration multi-pages plus large.
- AI Scraper — Extrayez des champs personnalisés lorsque les URL exactes des pages cibles sont déjà connues.
- Google Search Scraper — Utilisez les URL des résultats de recherche Google pour identifier les sites web ou les pages publics pour l'extraction de contenu.