ForHosting KIT · Documents et PDF

Extraire le texte d’un PDF

Cette capacité récupère le texte contenu dans un PDF et vous le rend en texte brut, dans l’ordre de lecture. Fini le copier-coller qui déstructure tout ou la ressaisie fastidieuse : vous obtenez le contenu écrit du document, prêt à coller dans un traitement de texte, un tableur ou un autre outil.

● Stablepar requête + par page$0.002
Utilisez-le depuis WebAPIE-mailApp bientôtTelegram bientôt

Exécutez cette tâche sur nos serveurs, avec votre compte. Les outils gratuits tournent dans votre navigateur ; celui-ci est facturé sur votre solde KIT au prix affiché ci-dessus.

Le texte, libéré de sa page

Un PDF fige le texte dans une mise en page ; le récupérer proprement relève souvent du casse-tête. Copier une colonne colle deux colonnes mélangées, un tableau se disloque, les sauts de ligne partent de travers. L’extraction lit la couche de texte du document et la restitue en flux lisible, dans l’ordre naturel de lecture. Vous récupérez les mots tels qu’ils sont écrits, sans les fantaisies de mise en forme qui gênent le réemploi.

Ce qu’un PDF texte contient vraiment

Deux familles de PDF cohabitent. Ceux qui sont nés d’un logiciel — un rapport exporté, un contrat généré — portent une vraie couche de texte, exploitable directement. Ceux qui sont issus d’un scanner ne contiennent, eux, que des images de pages : sans reconnaissance de caractères, il n’y a rien à extraire. Cette capacité s’adresse à la première famille ; pour un document scanné, il faut d’abord lui ajouter une couche OCR.

Un tarif de base, pour un geste courant

Extraire du texte est une opération fréquente et légère, facturée en conséquence : $0.002 par requête, en dollars US, sans abonnement. La capacité s’exécute depuis cette page pour un document isolé, et via l’API (alias /pdf/to-text) pour alimenter un traitement en série — indexer une archive, vérifier des documents, préparer une analyse. Le texte sort brut, à charge pour vous de le structurer ensuite selon votre besoin.

Réutiliser un ancien rapport

Julien Lefèvre doit reprendre des passages d’un rapport de l’an dernier, disponible seulement en PDF. Il extrait le texte et le colle dans son traitement de texte, sans retaper trois pages ni se battre avec un copier-coller qui déforme tout.

Citer un contrat avec exactitude

Sophie Nguyen prépare une note qui cite plusieurs clauses d’un contrat. L’extraction lui donne le texte exact, mot pour mot, ce qui évite les erreurs de recopie sur des formulations juridiques sensibles.

Indexer une documentation

Atelier Garnier SARL veut rendre ses notices consultables par mots-clés. En extrayant le texte de chaque PDF via l’API, l’entreprise nourrit son moteur de recherche interne sans ressaisir le contenu.

Cela fonctionne-t-il sur un PDF scanné ?

Non, pas directement. Un scan ne contient que des images de pages, sans couche de texte à extraire. Il faut d’abord lui appliquer une reconnaissance de caractères (OCR) ; l’extraction agira ensuite sur le texte reconnu.

La mise en page est-elle conservée ?

Non, et c’est voulu : vous obtenez du texte brut, dans l’ordre de lecture, sans colonnes ni cadres. Pour préserver titres et structure, la conversion en Markdown est plus adaptée.

Les tableaux ressortent-ils correctement ?

Le texte des cellules est récupéré, mais un tableau complexe perd sa grille dans un flux brut. Pour un rendu structuré des tableaux, orientez-vous vers une conversion dédiée.

Jusqu’à quelle taille de PDF puis-je extraire le texte ?

Oui, jusqu’à 25 Mo et 200 pages par document. Cela couvre la plupart des rapports et contrats ; un fichier plus lourd gagne à être scindé au préalable.

Combien coûte une extraction ?

$0.002 par requête, en dollars US, réglés par PayPal, sans compte ni abonnement. Une facture est délivrée sur demande.

Mon document est-il lu par quelqu’un ?

Non. L’extraction est automatisée de bout en bout, l’échange est chiffré, et le fichier est effacé une fois le texte renvoyé. Personne ne consulte son contenu.

Tout sur cette page est disponible par programmation. Cette section s'adresse aux équipes qui veulent l'intégrer à leurs systèmes ; les autres peuvent simplement utiliser l'outil ci-dessus.

POSThttps://api.kit.forhosting.com/pdf/to-text

Authentification par jeton Bearer : un seul POST met la tâche en file d’attente, et le résultat vous parvient par webhook ou lien signé.

curl -X POST https://api.kit.forhosting.com/pdf/to-text \
  -H "Authorization: Bearer $KIT_KEY" \
  -H "Content-Type: application/json" \
  -d '{"pdf":"https://ejemplo.com/documento.pdf"}'
{
  "pdf": "https://ejemplo.com/documento.pdf"
}
{
  "task_id": "tsk_a1b2c3d4e5f6a1b2c3d4e5f6",
  "type": "pdf.to_text",
  "status": "queued",
  "_links": {
    "result": "/tasks/tsk_…/result"
  }
}

L’API est asynchrone : chaque appel renvoie un task_id immédiatement, puis vous interrogez l’état à raison d’une requête par seconde.

par requête$0.002

Le prix est publié, sans tokens ni crédits. Une tâche qui échoue n’est pas facturée.

max_mb25
max_pages200
HTTPCodeSignification
401unauthorizedClé API absente ou invalide : vérifiez l’en-tête Authorization.
402insufficient_balanceSolde insuffisant : rechargez votre compte pour lancer cette tâche.
404unknown_typeType de tâche inconnu : vérifiez le champ type de votre requête.
429rate_limitedTrop de requêtes : ralentissez la cadence, puis réessayez.
413input_too_largeEntrée trop volumineuse : consultez la limite de taille de cette capacité.

Consulter la documentation complète du KIT →