Extraire le texte d’une page web
Cet outil récupère le texte brut d’une page web : les mots, sans mise en forme, menu, publicités ni code autour. Nos serveurs ouvrent l’adresse, isolent le contenu lisible et vous le renvoient en texte simple, prêt à coller, compter, citer ou confier à un autre outil.
Exécuter en ligne
Exécutez cette tâche sur nos serveurs, avec votre compte. Les outils gratuits tournent dans votre navigateur ; celui-ci est facturé sur votre solde KIT au prix affiché ci-dessus.
Du texte, sans le décor
Là où la page mêle contenu, navigation et publicités, l’extraction ne retient que la matière lisible : les phrases, les paragraphes, les listes réduites à leur texte. Aucune balise, aucune couleur, aucune colonne — juste une suite de mots dans l’ordre de lecture. C’est la forme la plus dépouillée qui soit, celle qu’on obtient en imaginant la page lue à voix haute, sans rien de ce qui, à l’écran, entoure et distrait du propos principal.
À quoi sert le texte brut
Compter le nombre de mots d’un article, coller un contenu dans un traitement de texte, alimenter une analyse de sentiment ou une recherche, préparer une citation exacte : le texte brut est le point de départ commun à mille usages. Il est aussi le format le plus économe à transmettre et le plus simple à comparer d’une page à l’autre, car rien ne s’interpose entre vous et les mots effectivement présents sur la page.
Texte brut ou Markdown : lequel choisir
Les deux écartent le décor, mais le texte brut va plus loin dans le dépouillement : il abandonne aussi la structure. Choisissez le texte quand seuls les mots comptent — un décompte, une analyse, un collage rapide. Préférez le Markdown quand vous voulez garder les titres, les listes et les liens, par exemple pour des notes ou pour nourrir une IA qui tire parti de la structure. Le bon format dépend de ce que vous ferez ensuite du contenu.
Ce que le texte ne garde pas
En simplifiant, l’extraction laisse de côté la mise en page, les images, les tableaux mis en forme et la plupart des liens en tant que tels. Un tableau devient une suite de valeurs, une galerie disparaît. C’est le prix de la légèreté : vous gagnez un texte propre et universel, au prix de la forme. Pour conserver la structure, tournez-vous vers la conversion en Markdown ; pour l’apparence, vers une capture d’écran.
Cas d’usage
Décompte de mots
Sophie Nguyen extrait le texte d’un article pour en compter les mots avant d’en commander une traduction facturée au volume.
Collage rapide
Thomas Rousseau récupère le contenu d’une page en texte simple pour le coller dans un document de travail, sans traîner la mise en forme du site.
Analyse automatisée
Studio Lumen SAS alimente une analyse de tonalité avec le texte brut de plusieurs pages, sans le bruit du menu ni des publicités.
Citation exacte
Pour un mémoire, Nadia Benali obtient le texte fidèle d’une page afin d’en citer un passage sans erreur de recopie.
Questions fréquentes
Quelle différence avec la conversion en Markdown ?
Le texte brut abandonne aussi la structure : ni titres, ni listes marquées, ni liens. Le Markdown garde cette organisation. Choisissez selon que vous voulez les mots seuls ou le contenu structuré.
La mise en forme est-elle conservée ?
Non, c’est le but : vous obtenez les mots sans styles, sans couleurs et sans colonnes. Pour garder la forme, préférez la conversion en Markdown ou une capture d’écran.
Le texte respecte-t-il l’ordre de lecture ?
Oui : l’outil suit l’enchaînement du contenu principal tel qu’il se lit. Les éléments de décor, eux, sont écartés plutôt que replacés au fil du texte.
Combien coûte l’extraction du texte ?
Le tarif est de $0.040 par requête et $0.001 par URL, en dollars US. Aucun abonnement : vous ne réglez que les pages traitées.
L’adresse saisie est-elle conservée ?
Non. La page est lue le temps d’en extraire le texte, qui vous est renvoyé, puis l’URL et le résultat sont écartés de nos serveurs.
Faut-il un compte ?
Non, aucune inscription. Le service se règle à l’usage ; pour une facture, écrivez à [email protected].
Pour les développeurs — accès API
Tout sur cette page est disponible par programmation. Cette section s'adresse aux équipes qui veulent l'intégrer à leurs systèmes ; les autres peuvent simplement utiliser l'outil ci-dessus.
Endpoint
Authentification par jeton Bearer : un seul POST met la tâche en file d’attente, et le résultat vous parvient par webhook ou lien signé.
Appeler depuis votre stack
curl -X POST https://api.kit.forhosting.com/web/to-text \
-H "Authorization: Bearer $KIT_KEY" \
-H "Content-Type: application/json" \
-d '{"url":"https://ejemplo.com"}'const res = await fetch("https://api.kit.forhosting.com/web/to-text", {
method: "POST",
headers: {
"Authorization": `Bearer ${process.env.KIT_KEY}`,
"Content-Type": "application/json"
},
body: JSON.stringify({
"url": "https://ejemplo.com"
})
});
const { task_id } = await res.json();import os, requests
res = requests.post(
"https://api.kit.forhosting.com/web/to-text",
headers={"Authorization": f"Bearer {os.environ['KIT_KEY']}"},
json={
"url": "https://ejemplo.com"
},
)
task_id = res.json()["task_id"]<?php
$res = file_get_contents("https://api.kit.forhosting.com/web/to-text", false, stream_context_create([
"http" => [
"method" => "POST",
"header" => "Authorization: Bearer " . getenv("KIT_KEY") . "\r\nContent-Type: application/json",
"content" => '{"url":"https://ejemplo.com"}',
],
]));
$task = json_decode($res, true);body := bytes.NewBufferString(`{"url":"https://ejemplo.com"}`)
req, _ := http.NewRequest("POST", "https://api.kit.forhosting.com/web/to-text", body)
req.Header.Set("Authorization", "Bearer "+os.Getenv("KIT_KEY"))
req.Header.Set("Content-Type", "application/json")
res, _ := http.DefaultClient.Do(req)Exemple de requête
{
"url": "https://ejemplo.com"
}Exemple de réponse
{
"task_id": "tsk_a1b2c3d4e5f6a1b2c3d4e5f6",
"type": "web.to_text",
"status": "queued",
"_links": {
"result": "/tasks/tsk_…/result"
}
}L’API est asynchrone : chaque appel renvoie un task_id immédiatement, puis vous interrogez l’état à raison d’une requête par seconde.
Tarifs
Le prix est publié, sans tokens ni crédits. Une tâche qui échoue n’est pas facturée.
Limites
timeout_sec | 30 |
max_crawl_pages | 25 |
Erreurs
| HTTP | Code | Signification |
|---|---|---|
401 | unauthorized | Clé API absente ou invalide : vérifiez l’en-tête Authorization. |
402 | insufficient_balance | Solde insuffisant : rechargez votre compte pour lancer cette tâche. |
404 | unknown_type | Type de tâche inconnu : vérifiez le champ type de votre requête. |
429 | rate_limited | Trop de requêtes : ralentissez la cadence, puis réessayez. |
422 | task_failed | La tâche a échoué : elle ne vous est pas facturée. |