Repérez les pages PDF à OCR
Beaucoup de PDF mélangent des pages nativement numériques, déjà pourvues d'une couche de texte sélectionnable, et des pages scannées qui s'affichent correctement mais ne permettent ni de copier, ni de rechercher, ni d'indexer.
Lancer gratuitement
Tout se passe dans votre navigateur : gratuit, sans envoi de vos données.
Avant de dépenser un budget d'OCR sur tout le document ou d'envoyer le fichier dans un pipeline qui suppose un texte extractible, vous avez besoin de la liste exacte des numéros de page sans couche texte. Cette capacité accepte cette carte booléenne de présence—true si la page a du texte extractible, false si elle n'est qu'image—et renvoie les pages qui nécessitent l'OCR, celles déjà interrogeables, les comptes, le ratio d'OCR et un résumé d'une ligne. Une entrée vide est rejetée pour que le silence ne soit jamais pris pour un succès. La même logique parse pure s'exécute gratuitement dans le widget du navigateur et sur le chemin API, de sorte que les contrôles préalables et l'automatisation de production ne divergent jamais sur les pages à OCR-iser.
Comment l’utiliser
Saisissez vos données dans le formulaire ci-dessus. L’outil les vérifie avant le calcul et affiche le résultat sur la même page.
Vérifiez vos données
Suivez les libellés et les unités de chaque champ. Si une valeur manque ou sort de la plage autorisée, la page indique quoi corriger.
Relancez le calcul ou automatisez-le
Utilisez l’outil web pour les vérifications ponctuelles et l’API pour intégrer la même capacité à un flux automatisé.
Cas d’usage
Obtenez une réponse maintenant
Saisissez un jeu de valeurs et consultez le résultat sans créer de feuille de calcul ni de script.
Comparez des scénarios
Modifiez une valeur à la fois et relancez le calcul pour voir ce qui influence le résultat.
Automatisez les tâches répétées
Utilisez l’API lorsque le même calcul doit s’exécuter dans votre produit ou votre flux.
Questions fréquentes
Comment utiliser cette capacité ?
Remplissez les champs ci-dessus et lancez-la sur cette page. Le formulaire signale les données à corriger.
Pour les développeurs — accès API
Tout sur cette page est disponible par programmation. Cette section s'adresse aux équipes qui veulent l'intégrer à leurs systèmes ; les autres peuvent simplement utiliser l'outil ci-dessus.
Endpoint
Authentification par jeton Bearer : un seul POST met la tâche en file d’attente, et le résultat vous parvient par webhook ou lien signé.
Appeler depuis votre stack
curl -X POST https://api.kit.forhosting.com/pdf/searchable-ocr-flag \
-H "Authorization: Bearer $KIT_KEY" \
-H "Content-Type: application/json" \
-d '{"text_layer":[true,false,true,false]}'const res = await fetch("https://api.kit.forhosting.com/pdf/searchable-ocr-flag", {
method: "POST",
headers: {
"Authorization": `Bearer ${process.env.KIT_KEY}`,
"Content-Type": "application/json"
},
body: JSON.stringify({
"text_layer": [
true,
false,
true,
false
]
})
});
const { task_id } = await res.json();import os, requests
res = requests.post(
"https://api.kit.forhosting.com/pdf/searchable-ocr-flag",
headers={"Authorization": f"Bearer {os.environ['KIT_KEY']}"},
json={
"text_layer": [
true,
false,
true,
false
]
},
)
task_id = res.json()["task_id"]<?php
$res = file_get_contents("https://api.kit.forhosting.com/pdf/searchable-ocr-flag", false, stream_context_create([
"http" => [
"method" => "POST",
"header" => "Authorization: Bearer " . getenv("KIT_KEY") . "\r\nContent-Type: application/json",
"content" => '{"text_layer":[true,false,true,false]}',
],
]));
$task = json_decode($res, true);body := bytes.NewBufferString(`{"text_layer":[true,false,true,false]}`)
req, _ := http.NewRequest("POST", "https://api.kit.forhosting.com/pdf/searchable-ocr-flag", body)
req.Header.Set("Authorization", "Bearer "+os.Getenv("KIT_KEY"))
req.Header.Set("Content-Type", "application/json")
res, _ := http.DefaultClient.Do(req)Exemple de requête
{
"text_layer": [
true,
false,
true,
false
]
}Exemple de réponse
{
"task_id": "tsk_a1b2c3d4e5f6a1b2c3d4e5f6",
"type": "pdf.searchable_ocr_flag",
"status": "queued",
"_links": {
"result": "/tasks/tsk_…/result"
}
}L’API est asynchrone : chaque appel renvoie un task_id immédiatement, puis vous interrogez l’état à raison d’une requête par seconde.
Tarifs
Le prix est publié, sans tokens ni crédits. Une tâche qui échoue n’est pas facturée.
Limites
max_mb | 25 |
max_pages | 200 |
Erreurs
| HTTP | Code | Signification |
|---|---|---|
401 | unauthorized | Clé API absente ou invalide : vérifiez l’en-tête Authorization. |
402 | insufficient_balance | Solde insuffisant : rechargez votre compte pour lancer cette tâche. |
404 | unknown_type | Type de tâche inconnu : vérifiez le champ type de votre requête. |
429 | rate_limited | Trop de requêtes : ralentissez la cadence, puis réessayez. |