ForHosting KIT · OCR y extracción de datos

¿Este PDF está escaneado?

Antes de mandar un documento a un flujo de OCR conviene saber un dato concreto: ¿el PDF ya trae una capa de texto o es apenas la fotografía de una página? Este endpoint responde eso en una sola llamada, para que deje de gastar ciclos de OCR en archivos que nunca lo necesitaron.

● EstablePor solicitud + por documento$0.002
Úselo desde WebAPIEmailApp prontoTelegram pronto

Ejecute esto en nuestros servidores con su cuenta. Las herramientas gratuitas corren en su navegador; esta cobra de su saldo del KIT según el precio de arriba.

Por qué esta pregunta importa más de lo que parece

La mayoría de los flujos de documentos asumen que todos los PDF que reciben son iguales, pero en la práctica una carpeta de 'contratos' o 'facturas' suele ser una mezcla: algunos se exportaron directo de Word o de un sistema contable con una capa de texto completa, y otros son escaneos planos, faxes o fotos de papel metidas dentro de un PDF. Correr OCR sobre el primer grupo es desperdicio puro, porque se paga por reconocer texto que ya era legible por máquina. Saltarse el OCR en el segundo grupo produce fallas silenciosas más adelante: la búsqueda, la indexación o la extracción de datos simplemente no encuentran nada, porque nunca hubo texto que encontrar.

Qué revisa realmente el endpoint

La tarea abre el PDF e inspecciona su estructura interna página por página: busca una capa de texto extraíble, mide cuánto de cada página está cubierto por fuentes tipográficas incrustadas frente a imágenes rasterizadas, y marca las páginas que son en la práctica una fotografía sin texto subyacente. El resultado llega como un veredicto claro por documento — nativo, escaneado o mixto cuando algunas páginas tienen texto y otras no — junto con un desglose sencillo por página para poder enrutar cada una correctamente en lugar de tratar todo el archivo como una sola unidad.

Una breve nota sobre por qué existe este problema

El formato PDF se diseñó a inicios de los años noventa como un formato de descripción de página, no de texto, así que siempre ha sido posible construir un PDF perfectamente válido que no sea más que una imagen, sin ninguna noción de caracteres, palabras u orden de lectura. Décadas después esa particularidad sigue confundiendo a los sistemas automatizados: un escáner, una pasarela de fax a PDF o un archivo antiguo pueden producir archivos que a simple vista se ven idénticos pero que, estructuralmente, son opuestos a lo que un sistema automatizado espera recibir.

Cómo encaja en un flujo más amplio

Llame a este endpoint como primer filtro de cualquier flujo documental, justo después de recibir el archivo y antes de extraer, clasificar o indexar. Envíe los resultados nativos directo a extracción de texto, mande los escaneados a su paso de OCR, y divida los mixtos página por página para que ninguna de las dos rutas haga trabajo de más. Como la tarea es asíncrona, puede lanzarla sobre toda una cola de ingesta y dejar que el webhook le indique a cada proceso posterior qué hacer, sin que una persona tenga que abrir el archivo para revisarlo.

Prefiltrar una cola de OCR

Un sistema de ingesta de documentos revisa cada PDF entrante primero y solo envía a OCR los que resultan escaneados, reduciendo el gasto en archivos que ya eran nativamente digitales.

Auditar un archivo histórico

Un equipo legal o contable que migra un repositorio de diez años corre esta verificación sobre todo el archivo para saber, antes de armar cualquier plan de proyecto, cuántos documentos realmente necesitan OCR.

Enrutamiento inteligente en un flujo de carga SaaS

Un producto de gestión documental usa el veredicto para decidir en tiempo real si muestra al instante una vista previa con el texto extraído o pone el archivo en cola para OCR.

Control de calidad a proveedores de escaneo

Un equipo de operaciones audita lotes entregados por un proveedor externo de escaneo para confirmar que los PDF realmente llevan una capa de texto según lo contratado, y no solo imágenes.

¿Qué devuelve exactamente la verificación de escaneado o nativo?

Un veredicto de nativo, escaneado o mixto para el documento, más un desglose por página que indica cuáles páginas tienen una capa de texto real y cuáles no.

¿Esto es lo mismo que correr OCR?

No, nunca realiza reconocimiento de texto. Solo inspecciona la estructura interna del PDF para decirle si el OCR es siquiera necesario.

¿Existe un plan gratuito para esta api?

No hay capa gratuita: las capas gratis se abusan y ralentizan a todos. El acceso funciona con un saldo prepago de ForHosting KIT: se recarga desde $10.00 (no caduca) y cada solicitud se cobra a su precio publicado, así que una llamada sin saldo devuelve HTTP 402. Sin suscripción, sin tokens ni créditos inventados, y una tarea fallida no se cobra.

¿Cuánto cuesta verificar si un pdf es escaneado?

$0.002 por solicitud, un costo lo bastante bajo como para correrlo en cada documento antes de decidir si vale la pena pagar por OCR.

¿Cómo recibo el resultado?

La tarea corre de forma asíncrona y devuelve un task_id de inmediato; el veredicto llega por webhook firmado, que es lo recomendado, o mediante un enlace firmado válido por 24 horas.

¿Qué pasa con pdf protegidos con contraseña o dañados?

La tarea intenta la verificación automáticamente hasta tres veces; si aun así no puede completarse, recibe un error claro y, como nunca se cobra un intento fallido, tampoco hay costo.

¿Puede manejar pdf mixtos donde solo algunas páginas están escaneadas?

Sí, para eso existe el veredicto mixto, y el desglose por página indica con precisión cuáles páginas necesitan OCR y cuáles no.

¿Se guardan los datos de mi documento después de la verificación?

Los resultados y los archivos de origen se eliminan al vencer la ventana de retención y nunca se usan para entrenar modelos, así que puede correr esto sobre documentos sensibles sin preocuparse por la retención de datos.

Todo lo de esta página está disponible por programación. Esta sección es para equipos que quieren integrarlo en sus sistemas; el resto puede usar la herramienta de arriba sin más.

POSThttps://api.kit.forhosting.com/ocr/scanned-or-native

¿Prefiere automatizarlo? Un POST autenticado crea la tarea; el resultado llega por webhook o enlace firmado. La misma capacidad también se ejecuta aquí en la web, y pronto desde nuestra app, el email y Telegram.

curl -X POST https://api.kit.forhosting.com/ocr/scanned-or-native \
  -H "Authorization: Bearer $KIT_KEY" \
  -H "Content-Type: application/json" \
  -d '{"input":"…"}'
{
  "input": "…"
}
{
  "task_id": "tsk_a1b2c3d4e5f6a1b2c3d4e5f6",
  "type": "ocr.scanned_or_native",
  "status": "queued",
  "_links": {
    "result": "/tasks/tsk_…/result"
  }
}

La API es asíncrona: la llamada devuelve un task_id al instante y el resultado llega por webhook. El polling está limitado a 1 req/s por tarea.

Por solicitud$0.002

Precio publicado — sin tokens ni créditos inventados. Una tarea fallida no se cobra.

max_mb25
max_pages10
HTTPCódigoSignificado
401unauthorizedAPI key ausente o inválida.
402insufficient_balanceEl saldo no cubre el precio de la tarea.
404unknown_typeEl tipo de tarea no existe.
429rate_limitedDemasiadas peticiones. Use el webhook en vez de sondear.
413input_too_largeEl archivo supera el límite de tamaño.

Ver la documentación completa del KIT →