ForHosting KIT · Veille et lecture de sites web

Extraction de données par IA

L’extraction par IA récupère des données d’une page à partir d’une consigne en langage courant : vous décrivez ce que vous voulez — le nom, le prix et la note de chaque produit — et le modèle repère les informations, sans le moindre sélecteur. Le résultat revient organisé, prêt à exploiter.

● Stablepar requête + par URL$0.046
Utilisez-le depuis WebAPIE-mailApp bientôtTelegram bientôt

Exécutez cette tâche sur nos serveurs, avec votre compte. Les outils gratuits tournent dans votre navigateur ; celui-ci est facturé sur votre solde KIT au prix affiché ci-dessus.

Décrire plutôt que programmer

Ici, pas de sélecteur à trouver ni de code à écrire : vous formulez votre besoin en français, comme vous l’expliqueriez à un collègue. Le modèle lit la page, comprend son organisation et en tire les éléments demandés. Cette approche ouvre l’extraction à qui n’a jamais touché à une ligne de code, et fait gagner du temps même aux développeurs, qui évitent d’écrire et d’entretenir des sélecteurs sur des pages qui changent régulièrement de structure.

Ce que l’IA sait retrouver

Parce qu’il comprend le sens du contenu, le modèle s’en sort là où un sélecteur rigide échoue : une page reformatée, une information exprimée de plusieurs façons, un champ tantôt présent, tantôt absent. Il relie les libellés à leurs valeurs, distingue un prix d’une référence, associe une note à un produit. Cette souplesse est précieuse sur les pages irrégulières, où la même donnée n’occupe pas toujours la même place d’une fiche à l’autre.

Formuler une bonne consigne

La qualité du résultat tient beaucoup à la clarté de la demande. Nommez précisément chaque donnée voulue et, si besoin, son format attendu : un prix en chiffres, une date au format court. Une consigne vague — « les infos importantes » — laisse trop de place à l’interprétation ; une consigne précise — « le titre, l’auteur et la date de chaque annonce » — guide le modèle vers exactement ce que vous attendez, et rend le résultat plus régulier.

Vérifier, car l’IA peut se tromper

Un modèle de langage interprète : il lui arrive de manquer un élément ou d’en déduire un autre à tort, surtout sur une page ambiguë. Le résultat est un très bon point de départ, pas une vérité gravée : sur des données qui comptent — un prix, un montant — un coup d’œil de contrôle reste de mise. Ce surcroît d’intelligence a aussi un coût : l’extraction par IA est plus chère qu’un simple relevé par sélecteur.

Catalogue sans sélecteur

Camille Moreau extrait le nom, le prix et la disponibilité de chaque produit d’une page, en décrivant sa demande, sans écrire de sélecteur.

Page mal structurée

Sur un site où l’information change de place d’une fiche à l’autre, Studio Lumen SAS obtient malgré tout des données rangées, grâce à la souplesse du modèle.

Caractéristiques produit

Menuiserie Rousseau & Fils relève les caractéristiques d’un outillage — dimensions, matière, puissance — même quand elles sont dispersées dans le texte.

Prototype rapide

Un développeur teste une idée d’extraction en langage courant avant de décider s’il vaut la peine d’écrire un sélecteur durable.

Dois-je écrire du code ou un sélecteur ?

Non. Vous décrivez en français ce que vous cherchez, et le modèle repère les données correspondantes. Aucune connaissance technique n’est requise pour formuler la demande.

Le résultat est-il toujours exact ?

C’est un excellent point de départ, pas une garantie. Le modèle interprète et peut manquer ou déduire un élément à tort ; sur des données qui comptent, un contrôle rapide reste conseillé.

En quoi est-ce différent de l’extraction par sélecteur ?

Le sélecteur vise une position exacte et suppose une page stable. L’IA comprend le contenu et tolère les pages irrégulières ou changeantes, au prix d’un traitement plus coûteux.

Combien coûte l’extraction par IA ?

Le tarif est de $0.046 par requête et $0.0145 par URL, en dollars US. Ce prix, plus élevé qu’un relevé par sélecteur, couvre le travail du modèle de langage.

L’adresse et les données sont-elles conservées ?

Non. La page est lue le temps d’en extraire les données, qui vous sont renvoyées, puis l’URL et le résultat sont écartés de nos serveurs.

Faut-il un compte ?

Non, aucune inscription. Le service se règle à l’usage ; pour une facture, écrivez à [email protected].

Tout sur cette page est disponible par programmation. Cette section s'adresse aux équipes qui veulent l'intégrer à leurs systèmes ; les autres peuvent simplement utiliser l'outil ci-dessus.

POSThttps://api.kit.forhosting.com/web/scrape-ai

Authentification par jeton Bearer : un seul POST met la tâche en file d’attente, et le résultat vous parvient par webhook ou lien signé.

curl -X POST https://api.kit.forhosting.com/web/scrape-ai \
  -H "Authorization: Bearer $KIT_KEY" \
  -H "Content-Type: application/json" \
  -d '{"url":"https://ejemplo.com"}'
{
  "url": "https://ejemplo.com"
}
{
  "task_id": "tsk_a1b2c3d4e5f6a1b2c3d4e5f6",
  "type": "web.scrape_ai",
  "status": "queued",
  "_links": {
    "result": "/tasks/tsk_…/result"
  }
}

L’API est asynchrone : chaque appel renvoie un task_id immédiatement, puis vous interrogez l’état à raison d’une requête par seconde.

par requête$0.046
par URL$0.0145

Le prix est publié, sans tokens ni crédits. Une tâche qui échoue n’est pas facturée.

timeout_sec30
max_crawl_pages25
HTTPCodeSignification
401unauthorizedClé API absente ou invalide : vérifiez l’en-tête Authorization.
402insufficient_balanceSolde insuffisant : rechargez votre compte pour lancer cette tâche.
404unknown_typeType de tâche inconnu : vérifiez le champ type de votre requête.
429rate_limitedTrop de requêtes : ralentissez la cadence, puis réessayez.
422task_failedLa tâche a échoué : elle ne vous est pas facturée.

Consulter la documentation complète du KIT →