ForHosting KIT · Veille et lecture de sites web

Extraire le texte d’une page web

Cet outil récupère le texte brut d’une page web : les mots, sans mise en forme, menu, publicités ni code autour. Nos serveurs ouvrent l’adresse, isolent le contenu lisible et vous le renvoient en texte simple, prêt à coller, compter, citer ou confier à un autre outil.

● Stablepar requête + par URL$0.040
Utilisez-le depuis WebAPIE-mailApp bientôtTelegram bientôt

Exécutez cette tâche sur nos serveurs, avec votre compte. Les outils gratuits tournent dans votre navigateur ; celui-ci est facturé sur votre solde KIT au prix affiché ci-dessus.

Du texte, sans le décor

Là où la page mêle contenu, navigation et publicités, l’extraction ne retient que la matière lisible : les phrases, les paragraphes, les listes réduites à leur texte. Aucune balise, aucune couleur, aucune colonne — juste une suite de mots dans l’ordre de lecture. C’est la forme la plus dépouillée qui soit, celle qu’on obtient en imaginant la page lue à voix haute, sans rien de ce qui, à l’écran, entoure et distrait du propos principal.

À quoi sert le texte brut

Compter le nombre de mots d’un article, coller un contenu dans un traitement de texte, alimenter une analyse de sentiment ou une recherche, préparer une citation exacte : le texte brut est le point de départ commun à mille usages. Il est aussi le format le plus économe à transmettre et le plus simple à comparer d’une page à l’autre, car rien ne s’interpose entre vous et les mots effectivement présents sur la page.

Texte brut ou Markdown : lequel choisir

Les deux écartent le décor, mais le texte brut va plus loin dans le dépouillement : il abandonne aussi la structure. Choisissez le texte quand seuls les mots comptent — un décompte, une analyse, un collage rapide. Préférez le Markdown quand vous voulez garder les titres, les listes et les liens, par exemple pour des notes ou pour nourrir une IA qui tire parti de la structure. Le bon format dépend de ce que vous ferez ensuite du contenu.

Ce que le texte ne garde pas

En simplifiant, l’extraction laisse de côté la mise en page, les images, les tableaux mis en forme et la plupart des liens en tant que tels. Un tableau devient une suite de valeurs, une galerie disparaît. C’est le prix de la légèreté : vous gagnez un texte propre et universel, au prix de la forme. Pour conserver la structure, tournez-vous vers la conversion en Markdown ; pour l’apparence, vers une capture d’écran.

Décompte de mots

Sophie Nguyen extrait le texte d’un article pour en compter les mots avant d’en commander une traduction facturée au volume.

Collage rapide

Thomas Rousseau récupère le contenu d’une page en texte simple pour le coller dans un document de travail, sans traîner la mise en forme du site.

Analyse automatisée

Studio Lumen SAS alimente une analyse de tonalité avec le texte brut de plusieurs pages, sans le bruit du menu ni des publicités.

Citation exacte

Pour un mémoire, Nadia Benali obtient le texte fidèle d’une page afin d’en citer un passage sans erreur de recopie.

Quelle différence avec la conversion en Markdown ?

Le texte brut abandonne aussi la structure : ni titres, ni listes marquées, ni liens. Le Markdown garde cette organisation. Choisissez selon que vous voulez les mots seuls ou le contenu structuré.

La mise en forme est-elle conservée ?

Non, c’est le but : vous obtenez les mots sans styles, sans couleurs et sans colonnes. Pour garder la forme, préférez la conversion en Markdown ou une capture d’écran.

Le texte respecte-t-il l’ordre de lecture ?

Oui : l’outil suit l’enchaînement du contenu principal tel qu’il se lit. Les éléments de décor, eux, sont écartés plutôt que replacés au fil du texte.

Combien coûte l’extraction du texte ?

Le tarif est de $0.040 par requête et $0.001 par URL, en dollars US. Aucun abonnement : vous ne réglez que les pages traitées.

L’adresse saisie est-elle conservée ?

Non. La page est lue le temps d’en extraire le texte, qui vous est renvoyé, puis l’URL et le résultat sont écartés de nos serveurs.

Faut-il un compte ?

Non, aucune inscription. Le service se règle à l’usage ; pour une facture, écrivez à [email protected].

Tout sur cette page est disponible par programmation. Cette section s'adresse aux équipes qui veulent l'intégrer à leurs systèmes ; les autres peuvent simplement utiliser l'outil ci-dessus.

POSThttps://api.kit.forhosting.com/web/to-text

Authentification par jeton Bearer : un seul POST met la tâche en file d’attente, et le résultat vous parvient par webhook ou lien signé.

curl -X POST https://api.kit.forhosting.com/web/to-text \
  -H "Authorization: Bearer $KIT_KEY" \
  -H "Content-Type: application/json" \
  -d '{"url":"https://ejemplo.com"}'
{
  "url": "https://ejemplo.com"
}
{
  "task_id": "tsk_a1b2c3d4e5f6a1b2c3d4e5f6",
  "type": "web.to_text",
  "status": "queued",
  "_links": {
    "result": "/tasks/tsk_…/result"
  }
}

L’API est asynchrone : chaque appel renvoie un task_id immédiatement, puis vous interrogez l’état à raison d’une requête par seconde.

par requête$0.040
par URL$0.001

Le prix est publié, sans tokens ni crédits. Une tâche qui échoue n’est pas facturée.

timeout_sec30
max_crawl_pages25
HTTPCodeSignification
401unauthorizedClé API absente ou invalide : vérifiez l’en-tête Authorization.
402insufficient_balanceSolde insuffisant : rechargez votre compte pour lancer cette tâche.
404unknown_typeType de tâche inconnu : vérifiez le champ type de votre requête.
429rate_limitedTrop de requêtes : ralentissez la cadence, puis réessayez.
422task_failedLa tâche a échoué : elle ne vous est pas facturée.

Consulter la documentation complète du KIT →