ForHosting KIT · Veille et lecture de sites web

Extraire l’article d’une page

Cet outil repère et extrait l’article principal d’une page : le titre, l’auteur quand il est indiqué, la date et le corps du texte, sans ce qui l’entoure. C’est le mode lecture appliqué automatiquement : vous obtenez le seul contenu utile, propre et ordonné.

● Stablepar requête + par URL$0.040
Utilisez-le depuis WebAPIE-mailApp bientôtTelegram bientôt

Exécutez cette tâche sur nos serveurs, avec votre compte. Les outils gratuits tournent dans votre navigateur ; celui-ci est facturé sur votre solde KIT au prix affiché ci-dessus.

Reconnaître le vrai contenu

Sur une page d’actualité ou de blog, l’article se noie parmi les menus, les encarts, les articles suggérés et les publicités. L’outil analyse la structure de la page pour distinguer le bloc principal — celui qui porte le texte suivi — de tout le reste. Il ne se fie pas à un emplacement fixe, mais à des indices de densité et d’organisation, ce qui lui permet de fonctionner sur des sites très différents sans réglage préalable de votre part.

Les informations de l’article

Au-delà du corps du texte, l’outil récupère les métadonnées utiles quand elles sont présentes : le titre, le nom de l’auteur, la date de publication, parfois une image principale. Ces éléments transforment un simple bloc de texte en référence exploitable : vous savez de qui vient le propos et de quand il date. Pour une revue de presse ou un dossier documentaire, ce sont précisément ces repères qui donnent sa valeur au contenu extrait.

À distinguer du texte brut

L’extraction de texte ramène tout le contenu lisible d’une page ; l’extraction d’article, elle, fait un choix : elle ne garde que le contenu principal et écarte le reste, y compris ce qui, ailleurs sur la page, serait pourtant du texte. C’est la différence entre tout aspirer et sélectionner l’essentiel. Préférez l’article quand une page mêle un contenu central à beaucoup d’à-côtés dont vous ne voulez pas.

Les pages qui résistent

Le procédé donne d’excellents résultats sur les articles bien structurés. Il est moins à l’aise là où il n’y a pas d’article unique : une galerie, un forum, une page d’accueil, une fiche produit. Sur ces formats, le contenu principal est diffus, et l’extraction peut se tromper de bloc ou en renvoyer un incomplet. Dans le doute, l’extraction de texte ou la conversion en Markdown offrent une prise plus large sur le contenu.

Revue de presse

Sophie Nguyen extrait chaque matin le texte propre de plusieurs articles, avec titre, auteur et date, pour préparer une synthèse quotidienne.

Résumé assisté

Avant de demander un résumé, Julien Lefèvre isole l’article seul, sans les recommandations autour, pour que la synthèse porte sur le bon texte.

Dossier documentaire

Pour un mémoire, Nadia Benali archive le contenu net de ses sources, chacune datée et attribuée, plutôt que la page entière encombrée.

Lecture sans distraction

Thomas Rousseau récupère le corps d’un long article pour le lire au calme, sans les bandeaux ni les fenêtres qui interrompent la page d’origine.

Comment l’outil sait-il quel est l’article ?

Il analyse la structure de la page pour trouver le bloc de texte principal, à partir d’indices de densité et d’organisation, sans se fier à un emplacement fixe. Cela lui permet de s’adapter à des sites variés.

Récupère-t-il l’auteur et la date ?

Oui, quand ces informations figurent sur la page : titre, auteur, date de publication et parfois image principale sont renvoyés avec le corps du texte.

Fonctionne-t-il sur tous les types de pages ?

Il excelle sur les articles bien structurés, mais peine là où il n’y a pas d’article unique — galerie, forum, page d’accueil. Dans ces cas, l’extraction de texte convient mieux.

Combien coûte l’extraction d’un article ?

Le tarif est de $0.040 par requête et $0.001 par URL, en dollars US, sans abonnement. Vous ne payez que les pages traitées.

L’adresse et le texte sont-ils conservés ?

Non. La page est lue le temps d’en extraire l’article, qui vous est renvoyé, puis l’URL et le résultat sont écartés de nos serveurs.

Faut-il un compte ?

Non, aucune inscription. Le service se règle à l’usage ; pour une facture, écrivez à [email protected], où une vraie personne vous répond.

Tout sur cette page est disponible par programmation. Cette section s'adresse aux équipes qui veulent l'intégrer à leurs systèmes ; les autres peuvent simplement utiliser l'outil ci-dessus.

POSThttps://api.kit.forhosting.com/web/article

Authentification par jeton Bearer : un seul POST met la tâche en file d’attente, et le résultat vous parvient par webhook ou lien signé.

curl -X POST https://api.kit.forhosting.com/web/article \
  -H "Authorization: Bearer $KIT_KEY" \
  -H "Content-Type: application/json" \
  -d '{"url":"https://ejemplo.com"}'
{
  "url": "https://ejemplo.com"
}
{
  "task_id": "tsk_a1b2c3d4e5f6a1b2c3d4e5f6",
  "type": "web.article",
  "status": "queued",
  "_links": {
    "result": "/tasks/tsk_…/result"
  }
}

L’API est asynchrone : chaque appel renvoie un task_id immédiatement, puis vous interrogez l’état à raison d’une requête par seconde.

par requête$0.040
par URL$0.001

Le prix est publié, sans tokens ni crédits. Une tâche qui échoue n’est pas facturée.

timeout_sec30
max_crawl_pages25
HTTPCodeSignification
401unauthorizedClé API absente ou invalide : vérifiez l’en-tête Authorization.
402insufficient_balanceSolde insuffisant : rechargez votre compte pour lancer cette tâche.
404unknown_typeType de tâche inconnu : vérifiez le champ type de votre requête.
429rate_limitedTrop de requêtes : ralentissez la cadence, puis réessayez.
422task_failedLa tâche a échoué : elle ne vous est pas facturée.

Consulter la documentation complète du KIT →