logo
languageFRdown
menu
GalerieDétails

📌 Comment l'IA peut-elle extraire des champs personnalisés d'une liste de pages web ?

Ce modèle collecte des champs structurés demandés par l'utilisateur à partir de chaque URL de page publique fournie. Il est utile pour les utilisateurs de données sans code, les équipes de recherche et les équipes d'opérations de données.

Les données sont collectées à partir de pages web publiques fournies par l'utilisateur. Ce modèle n'est pas lié à un site web source unique. Il extrait les champs demandés par l'utilisateur à partir des URL de pages publiques fournies pour la tâche.


💰 Tarification

Ce modèle n'a pas de frais d'utilisation par ligne. Le Proxy Basique est gratuit. Le Proxy Amélioré ajoute 0,04 $ par URL. Le mode Auto essaie d'abord le Proxy Basique et passe automatiquement au Proxy Amélioré si le Basique échoue ; ce changement peut entraîner des frais pour le Proxy Amélioré.


📦 Sortie

Les champs de sortie sont définis par les instructions d'extraction de l'utilisateur, ce modèle n'a donc pas de schéma de champs de sortie fixe.

{}

🎯 Cas d'utilisation

  • Extraire les attributs de produits tels que les titres et les prix lorsque ces champs sont explicitement demandés.
  • Collecter les attributs d'articles ou d'annonces à partir de mises en page hétérogènes en utilisant une spécification de champ partagée.
  • Prototyper un ensemble de données structurées avant de construire un scraper spécifique à un site.
  • Traiter les pages qui nécessitent le proxy sélectionné ou les cookies fournis lorsque ces paramètres sont spécifiés.

🐙 Pourquoi Octoparse

  • Flux de travail prêt à l'emploi : Les étapes d'extraction pour les pages web publiques fournies par l'utilisateur sont déjà configurées, vous n'avez donc pas besoin de construire le scraper à partir de zéro.
  • Exécution flexible : Exécutez la tâche préconfigurée dans le cloud sans avoir à garder un ordinateur local en ligne pour la collecte.
  • Sortie structurée et reproductible : Les résultats sont retournés sous forme de lignes cohérentes, plus faciles à comparer, filtrer, dédupliquer et traiter que des pages copiées manuellement.
  • Garde-fous d'entrée vérifiés : Le formulaire expose les entrées actuelles, les valeurs sélectionnables et les limites significatives configurées pour ce modèle.
  • Transfert de données pratique : Examinez les résultats dans Octoparse et exportez-les ou traitez-les en utilisant les options prises en charge par votre environnement Octoparse.

📝 Entrée

Remplissez les champs suivants :

  • URL cibles (Requis) — Saisissez les URL des pages publiques à traiter. Il est recommandé de commencer avec un maximum de 10 URL pour éviter une utilisation excessive de crédits. Jusqu'à 10 000 entrées par exécution.
  • Champs à extraire (Requis)
  • Proxy (Requis) — Choisissez le Proxy Basique pour un traitement gratuit, le Proxy Amélioré pour un coût additionnel de 0,04 $ par URL, ou Auto pour essayer d'abord le Basique et passer automatiquement à l'Amélioré si le Basique échoue. Options disponibles : Proxy Basique - Gratuit, Proxy Amélioré - 0,04 $ supplémentaire par URL, Auto - Essaye d'abord le Basique et passe à l'Amélioré si le Basique échoue.
  • Cookies (Optionnel) — Collez éventuellement des cookies pour les pages qui nécessitent une connexion. Utilisez les cookies d'un seul site web pour chaque tâche.

🚀 Comment utiliser

  1. Ouvrez le modèle et sélectionnez Essayer ou Démarrer.
  2. Remplissez les champs d'entrée listés ci-dessus.
  3. Démarrez la tâche en utilisant le mode d'exécution cloud pris en charge.
  4. Examinez les lignes de sortie et exportez ou traitez les données structurées.

⚠️ Limites

Les résultats dépendent de ce que le site source expose au moment de l'exécution. Un champ de sortie listé peut être vide lorsque la page source ne fournit pas cette valeur. Les limites d'entrée indiquées ci-dessus sont appliquées par le modèle.


💡 Conseils

Utilisez des entrées spécifiques et valides et examinez un résultat représentatif avant de lancer un grand lot. Supprimez les entrées en double lorsque des enregistrements répétés ne sont pas nécessaires.


❓ FAQ

Comment Octoparse collecte-t-il les données des pages web publiques fournies par l'utilisateur ?

L'automatisation Python valide chaque URL cible, soumet la page avec la spécification de champ définie par l'utilisateur et les paramètres de proxy ou de cookie sélectionnés au service d'extraction par IA, attend le résultat et renvoie l'enregistrement formaté dynamiquement.

Quelle entrée ce Scraper IA nécessite-t-il ?

Utilisez les champs et les valeurs acceptées indiqués dans la section Entrée. Seules les limites pertinentes pour l'utilisateur et les options sélectionnables sont listées.

Quelles données puis-je extraire des pages web publiques fournies par l'utilisateur ?

Les champs de sortie actuels et un Aperçu de données JSON représentatif sont listés dans la section Sortie. La disponibilité des champs peut varier lorsque la page source n'affiche pas de valeur.

Ce Scraper IA est-il gratuit ?

Il n'y a pas de frais d'utilisation par ligne. Le Proxy Basique est gratuit, tandis que le Proxy Amélioré coûte 0,04 $ de plus par URL. En mode Auto, le modèle essaie d'abord le Proxy Basique et ne passe au Proxy Amélioré que si le Basique échoue.

Pourquoi certains champs des pages web publiques fournies par l'utilisateur peuvent-ils être vides ?

Les pages sources n'exposent pas toujours toutes les valeurs pour chaque enregistrement, et les mises en page peuvent varier selon l'article, le marché ou la réponse actuelle du site. Le modèle renvoie un champ lorsque la page actuelle le fournit.

Puis-je exporter les données collectées des pages web publiques fournies par l'utilisateur ?

Vous pouvez examiner les lignes structurées dans Octoparse et les exporter ou les traiter en utilisant les options prises en charge par votre environnement Octoparse.


🔗 Modèles associés

  • AI Crawl — Utilisez le flux de travail de crawl lorsque les pages doivent d'abord être découvertes à partir d'un site web de départ.
  • Universal Content Scraper — Utilisez un flux de travail de crawl de contenu fixe pour une extraction structurée sur l'ensemble d'un site web.
  • Google Search Scraper — Utilisez les URL des résultats de recherche Google comme pages cibles pour une extraction personnalisée.
Share