Extraction de données par IA
L’extraction par IA récupère des données d’une page à partir d’une consigne en langage courant : vous décrivez ce que vous voulez — le nom, le prix et la note de chaque produit — et le modèle repère les informations, sans le moindre sélecteur. Le résultat revient organisé, prêt à exploiter.
Exécuter en ligne
Exécutez cette tâche sur nos serveurs, avec votre compte. Les outils gratuits tournent dans votre navigateur ; celui-ci est facturé sur votre solde KIT au prix affiché ci-dessus.
Décrire plutôt que programmer
Ici, pas de sélecteur à trouver ni de code à écrire : vous formulez votre besoin en français, comme vous l’expliqueriez à un collègue. Le modèle lit la page, comprend son organisation et en tire les éléments demandés. Cette approche ouvre l’extraction à qui n’a jamais touché à une ligne de code, et fait gagner du temps même aux développeurs, qui évitent d’écrire et d’entretenir des sélecteurs sur des pages qui changent régulièrement de structure.
Ce que l’IA sait retrouver
Parce qu’il comprend le sens du contenu, le modèle s’en sort là où un sélecteur rigide échoue : une page reformatée, une information exprimée de plusieurs façons, un champ tantôt présent, tantôt absent. Il relie les libellés à leurs valeurs, distingue un prix d’une référence, associe une note à un produit. Cette souplesse est précieuse sur les pages irrégulières, où la même donnée n’occupe pas toujours la même place d’une fiche à l’autre.
Formuler une bonne consigne
La qualité du résultat tient beaucoup à la clarté de la demande. Nommez précisément chaque donnée voulue et, si besoin, son format attendu : un prix en chiffres, une date au format court. Une consigne vague — « les infos importantes » — laisse trop de place à l’interprétation ; une consigne précise — « le titre, l’auteur et la date de chaque annonce » — guide le modèle vers exactement ce que vous attendez, et rend le résultat plus régulier.
Vérifier, car l’IA peut se tromper
Un modèle de langage interprète : il lui arrive de manquer un élément ou d’en déduire un autre à tort, surtout sur une page ambiguë. Le résultat est un très bon point de départ, pas une vérité gravée : sur des données qui comptent — un prix, un montant — un coup d’œil de contrôle reste de mise. Ce surcroît d’intelligence a aussi un coût : l’extraction par IA est plus chère qu’un simple relevé par sélecteur.
Cas d’usage
Catalogue sans sélecteur
Camille Moreau extrait le nom, le prix et la disponibilité de chaque produit d’une page, en décrivant sa demande, sans écrire de sélecteur.
Page mal structurée
Sur un site où l’information change de place d’une fiche à l’autre, Studio Lumen SAS obtient malgré tout des données rangées, grâce à la souplesse du modèle.
Caractéristiques produit
Menuiserie Rousseau & Fils relève les caractéristiques d’un outillage — dimensions, matière, puissance — même quand elles sont dispersées dans le texte.
Prototype rapide
Un développeur teste une idée d’extraction en langage courant avant de décider s’il vaut la peine d’écrire un sélecteur durable.
Questions fréquentes
Dois-je écrire du code ou un sélecteur ?
Non. Vous décrivez en français ce que vous cherchez, et le modèle repère les données correspondantes. Aucune connaissance technique n’est requise pour formuler la demande.
Le résultat est-il toujours exact ?
C’est un excellent point de départ, pas une garantie. Le modèle interprète et peut manquer ou déduire un élément à tort ; sur des données qui comptent, un contrôle rapide reste conseillé.
En quoi est-ce différent de l’extraction par sélecteur ?
Le sélecteur vise une position exacte et suppose une page stable. L’IA comprend le contenu et tolère les pages irrégulières ou changeantes, au prix d’un traitement plus coûteux.
Combien coûte l’extraction par IA ?
Le tarif est de $0.046 par requête et $0.0145 par URL, en dollars US. Ce prix, plus élevé qu’un relevé par sélecteur, couvre le travail du modèle de langage.
L’adresse et les données sont-elles conservées ?
Non. La page est lue le temps d’en extraire les données, qui vous sont renvoyées, puis l’URL et le résultat sont écartés de nos serveurs.
Faut-il un compte ?
Non, aucune inscription. Le service se règle à l’usage ; pour une facture, écrivez à [email protected].
Pour les développeurs — accès API
Tout sur cette page est disponible par programmation. Cette section s'adresse aux équipes qui veulent l'intégrer à leurs systèmes ; les autres peuvent simplement utiliser l'outil ci-dessus.
Endpoint
Authentification par jeton Bearer : un seul POST met la tâche en file d’attente, et le résultat vous parvient par webhook ou lien signé.
Appeler depuis votre stack
curl -X POST https://api.kit.forhosting.com/web/scrape-ai \
-H "Authorization: Bearer $KIT_KEY" \
-H "Content-Type: application/json" \
-d '{"url":"https://ejemplo.com"}'const res = await fetch("https://api.kit.forhosting.com/web/scrape-ai", {
method: "POST",
headers: {
"Authorization": `Bearer ${process.env.KIT_KEY}`,
"Content-Type": "application/json"
},
body: JSON.stringify({
"url": "https://ejemplo.com"
})
});
const { task_id } = await res.json();import os, requests
res = requests.post(
"https://api.kit.forhosting.com/web/scrape-ai",
headers={"Authorization": f"Bearer {os.environ['KIT_KEY']}"},
json={
"url": "https://ejemplo.com"
},
)
task_id = res.json()["task_id"]<?php
$res = file_get_contents("https://api.kit.forhosting.com/web/scrape-ai", false, stream_context_create([
"http" => [
"method" => "POST",
"header" => "Authorization: Bearer " . getenv("KIT_KEY") . "\r\nContent-Type: application/json",
"content" => '{"url":"https://ejemplo.com"}',
],
]));
$task = json_decode($res, true);body := bytes.NewBufferString(`{"url":"https://ejemplo.com"}`)
req, _ := http.NewRequest("POST", "https://api.kit.forhosting.com/web/scrape-ai", body)
req.Header.Set("Authorization", "Bearer "+os.Getenv("KIT_KEY"))
req.Header.Set("Content-Type", "application/json")
res, _ := http.DefaultClient.Do(req)Exemple de requête
{
"url": "https://ejemplo.com"
}Exemple de réponse
{
"task_id": "tsk_a1b2c3d4e5f6a1b2c3d4e5f6",
"type": "web.scrape_ai",
"status": "queued",
"_links": {
"result": "/tasks/tsk_…/result"
}
}L’API est asynchrone : chaque appel renvoie un task_id immédiatement, puis vous interrogez l’état à raison d’une requête par seconde.
Tarifs
Le prix est publié, sans tokens ni crédits. Une tâche qui échoue n’est pas facturée.
Limites
timeout_sec | 30 |
max_crawl_pages | 25 |
Erreurs
| HTTP | Code | Signification |
|---|---|---|
401 | unauthorized | Clé API absente ou invalide : vérifiez l’en-tête Authorization. |
402 | insufficient_balance | Solde insuffisant : rechargez votre compte pour lancer cette tâche. |
404 | unknown_type | Type de tâche inconnu : vérifiez le champ type de votre requête. |
429 | rate_limited | Trop de requêtes : ralentissez la cadence, puis réessayez. |
422 | task_failed | La tâche a échoué : elle ne vous est pas facturée. |