Extraire l’article d’une page
Cet outil repère et extrait l’article principal d’une page : le titre, l’auteur quand il est indiqué, la date et le corps du texte, sans ce qui l’entoure. C’est le mode lecture appliqué automatiquement : vous obtenez le seul contenu utile, propre et ordonné.
Exécuter en ligne
Exécutez cette tâche sur nos serveurs, avec votre compte. Les outils gratuits tournent dans votre navigateur ; celui-ci est facturé sur votre solde KIT au prix affiché ci-dessus.
Reconnaître le vrai contenu
Sur une page d’actualité ou de blog, l’article se noie parmi les menus, les encarts, les articles suggérés et les publicités. L’outil analyse la structure de la page pour distinguer le bloc principal — celui qui porte le texte suivi — de tout le reste. Il ne se fie pas à un emplacement fixe, mais à des indices de densité et d’organisation, ce qui lui permet de fonctionner sur des sites très différents sans réglage préalable de votre part.
Les informations de l’article
Au-delà du corps du texte, l’outil récupère les métadonnées utiles quand elles sont présentes : le titre, le nom de l’auteur, la date de publication, parfois une image principale. Ces éléments transforment un simple bloc de texte en référence exploitable : vous savez de qui vient le propos et de quand il date. Pour une revue de presse ou un dossier documentaire, ce sont précisément ces repères qui donnent sa valeur au contenu extrait.
À distinguer du texte brut
L’extraction de texte ramène tout le contenu lisible d’une page ; l’extraction d’article, elle, fait un choix : elle ne garde que le contenu principal et écarte le reste, y compris ce qui, ailleurs sur la page, serait pourtant du texte. C’est la différence entre tout aspirer et sélectionner l’essentiel. Préférez l’article quand une page mêle un contenu central à beaucoup d’à-côtés dont vous ne voulez pas.
Les pages qui résistent
Le procédé donne d’excellents résultats sur les articles bien structurés. Il est moins à l’aise là où il n’y a pas d’article unique : une galerie, un forum, une page d’accueil, une fiche produit. Sur ces formats, le contenu principal est diffus, et l’extraction peut se tromper de bloc ou en renvoyer un incomplet. Dans le doute, l’extraction de texte ou la conversion en Markdown offrent une prise plus large sur le contenu.
Cas d’usage
Revue de presse
Sophie Nguyen extrait chaque matin le texte propre de plusieurs articles, avec titre, auteur et date, pour préparer une synthèse quotidienne.
Résumé assisté
Avant de demander un résumé, Julien Lefèvre isole l’article seul, sans les recommandations autour, pour que la synthèse porte sur le bon texte.
Dossier documentaire
Pour un mémoire, Nadia Benali archive le contenu net de ses sources, chacune datée et attribuée, plutôt que la page entière encombrée.
Lecture sans distraction
Thomas Rousseau récupère le corps d’un long article pour le lire au calme, sans les bandeaux ni les fenêtres qui interrompent la page d’origine.
Questions fréquentes
Comment l’outil sait-il quel est l’article ?
Il analyse la structure de la page pour trouver le bloc de texte principal, à partir d’indices de densité et d’organisation, sans se fier à un emplacement fixe. Cela lui permet de s’adapter à des sites variés.
Récupère-t-il l’auteur et la date ?
Oui, quand ces informations figurent sur la page : titre, auteur, date de publication et parfois image principale sont renvoyés avec le corps du texte.
Fonctionne-t-il sur tous les types de pages ?
Il excelle sur les articles bien structurés, mais peine là où il n’y a pas d’article unique — galerie, forum, page d’accueil. Dans ces cas, l’extraction de texte convient mieux.
Combien coûte l’extraction d’un article ?
Le tarif est de $0.040 par requête et $0.001 par URL, en dollars US, sans abonnement. Vous ne payez que les pages traitées.
L’adresse et le texte sont-ils conservés ?
Non. La page est lue le temps d’en extraire l’article, qui vous est renvoyé, puis l’URL et le résultat sont écartés de nos serveurs.
Faut-il un compte ?
Non, aucune inscription. Le service se règle à l’usage ; pour une facture, écrivez à [email protected], où une vraie personne vous répond.
Pour les développeurs — accès API
Tout sur cette page est disponible par programmation. Cette section s'adresse aux équipes qui veulent l'intégrer à leurs systèmes ; les autres peuvent simplement utiliser l'outil ci-dessus.
Endpoint
Authentification par jeton Bearer : un seul POST met la tâche en file d’attente, et le résultat vous parvient par webhook ou lien signé.
Appeler depuis votre stack
curl -X POST https://api.kit.forhosting.com/web/article \
-H "Authorization: Bearer $KIT_KEY" \
-H "Content-Type: application/json" \
-d '{"url":"https://ejemplo.com"}'const res = await fetch("https://api.kit.forhosting.com/web/article", {
method: "POST",
headers: {
"Authorization": `Bearer ${process.env.KIT_KEY}`,
"Content-Type": "application/json"
},
body: JSON.stringify({
"url": "https://ejemplo.com"
})
});
const { task_id } = await res.json();import os, requests
res = requests.post(
"https://api.kit.forhosting.com/web/article",
headers={"Authorization": f"Bearer {os.environ['KIT_KEY']}"},
json={
"url": "https://ejemplo.com"
},
)
task_id = res.json()["task_id"]<?php
$res = file_get_contents("https://api.kit.forhosting.com/web/article", false, stream_context_create([
"http" => [
"method" => "POST",
"header" => "Authorization: Bearer " . getenv("KIT_KEY") . "\r\nContent-Type: application/json",
"content" => '{"url":"https://ejemplo.com"}',
],
]));
$task = json_decode($res, true);body := bytes.NewBufferString(`{"url":"https://ejemplo.com"}`)
req, _ := http.NewRequest("POST", "https://api.kit.forhosting.com/web/article", body)
req.Header.Set("Authorization", "Bearer "+os.Getenv("KIT_KEY"))
req.Header.Set("Content-Type", "application/json")
res, _ := http.DefaultClient.Do(req)Exemple de requête
{
"url": "https://ejemplo.com"
}Exemple de réponse
{
"task_id": "tsk_a1b2c3d4e5f6a1b2c3d4e5f6",
"type": "web.article",
"status": "queued",
"_links": {
"result": "/tasks/tsk_…/result"
}
}L’API est asynchrone : chaque appel renvoie un task_id immédiatement, puis vous interrogez l’état à raison d’une requête par seconde.
Tarifs
Le prix est publié, sans tokens ni crédits. Une tâche qui échoue n’est pas facturée.
Limites
timeout_sec | 30 |
max_crawl_pages | 25 |
Erreurs
| HTTP | Code | Signification |
|---|---|---|
401 | unauthorized | Clé API absente ou invalide : vérifiez l’en-tête Authorization. |
402 | insufficient_balance | Solde insuffisant : rechargez votre compte pour lancer cette tâche. |
404 | unknown_type | Type de tâche inconnu : vérifiez le champ type de votre requête. |
429 | rate_limited | Trop de requêtes : ralentissez la cadence, puis réessayez. |
422 | task_failed | La tâche a échoué : elle ne vous est pas facturée. |