ForHosting KIT · Documentos y PDF

Hacer un escaneo buscable

Un documento escaneado es una fotografía, no texto, así que no se puede buscar, seleccionar ni copiar por más nítido que se vea el escaneo. Esta API PDF buscable lee los píxeles, reconoce las palabras y coloca una capa de texto invisible exactamente encima, de modo que la página se sigue viendo como el escaneo original pero por dentro se comporta como un documento real.

● EstablePor solicitud + por página$0.042
Úselo desde WebAPIEmailApp prontoTelegram pronto

Ejecute esto en nuestros servidores con su cuenta. Las herramientas gratuitas corren en su navegador; esta cobra de su saldo del KIT según el precio de arriba.

La diferencia entre parecer texto y ser texto

Abre un contrato escaneado y puede leer cada palabra con los ojos, pero si intenta seleccionar una frase o buscar con Ctrl-F no pasa nada, porque la página es una sola imagen plana. Esa diferencia entre lo que ve una persona y lo que puede analizar un software es justo lo que cierra una capa de texto OCR. El software de reconocimiento identifica cada carácter de la página y, en lugar de reemplazar el escaneo con texto plano, coloca texto transparente y perfectamente posicionado justo encima de la imagen original, de modo que sigue siendo invisible al ojo pero totalmente presente para la búsqueda.

A quién le ahorra horas en silencio

Cualquiera que haya recorrido un PDF escaneado buscando una cláusula conoce el problema que esto resuelve. Los bufetes que digitalizan décadas de expedientes en papel necesitan buscar en miles de páginas escaneadas sin abrir cada una. Los archivos y las bibliotecas quieren que sus colecciones se indexen por contenido, no solo por nombre de archivo. Los equipos de cuentas por pagar necesitan extraer totales de facturas escaneadas con un script en vez de con los ojos de una persona. En todos los casos el escaneo está bien; lo que falta es la capa legible por máquina que va por debajo.

Qué pasa cuando llama al endpoint

Envía su PDF escaneado con un POST a /pdf/ocr-layer y recibe un task_id de inmediato, porque reconocer texto en varias páginas toma un procesamiento real que nunca debe bloquear su petición. El motor analiza cada página, detecta las regiones de texto y el orden de lectura, reconoce los caracteres y los escribe como una capa invisible alineada con los píxeles originales. El PDF terminado, ya buscable, se entrega a su webhook firmado o queda disponible en un enlace firmado por 24 horas, visualmente idéntico a lo que envió, solo que ya no es ciego a la búsqueda.

Un formato hecho justo para esto

El PDF admite modos de renderizado de texto invisible desde sus primeras especificaciones, que es precisamente el mecanismo del que depende la capa OCR: dibujar texto con un modo de render que no pinta nada, posicionado para coincidir con los glifos de la imagen debajo. Esa capacidad, en gran parte dormida hasta que el software de OCR maduró lo suficiente para usarla de forma confiable, es la razón por la que una página escaneada puede volverse buscable sin que cambie un solo píxel visible. Es una función discreta y de décadas del formato haciendo exactamente el trabajo para el que se diseñó.

Cómo encaja en un flujo automatizado

Como la entrega es asíncrona y estructurada, el endpoint encaja de forma natural después de cualquier paso de escaneo o ingesta: un escáner o una app de captura móvil sube una página, el webhook confirma que la versión buscable está lista y su sistema la indexa o archiva sin que nadie toque el archivo. El acceso requiere saldo prepago, lo que mantiene el servicio rápido y sin abuso, y el precio es fijo, $0.042 por petición más $0.0025 por página, sin unidades ocultas. Nota: este endpoint está en despliegue final y comenzará a aceptar trabajos en breve.

Digitalizar archivos legales

Un bufete escanea décadas de expedientes en papel y pasa cada lote por el endpoint para que toda página quede buscable por texto completo, dejando que los asociados encuentren una cláusula en segundos y no en horas.

Indexar colecciones de bibliotecas y museos

Un archivo procesa periódicos y manuscritos escaneados para que su catálogo se pueda buscar por contenido y no solo por título y fecha.

Automatizar la captura de datos de facturas

Un sistema de cuentas por pagar añade una capa OCR a las facturas escaneadas entrantes para que los scripts extraigan totales y proveedores analizando texto en vez de leer píxeles.

Hacer útiles los formularios capturados en campo

Una app de servicio de campo fotografía formularios en papel ya completados y los convierte en PDF buscables para que oficina encuentre cualquier envío por palabra clave.

¿Cómo hago buscable un PDF escaneado con una API?

Envíe un POST a /pdf/ocr-layer con su archivo escaneado. La api pdf buscable devuelve un task_id de inmediato y entrega el PDF con la capa de texto invisible a su webhook o a un enlace firmado al terminar.

¿Esta API es gratis?

No hay capa gratuita: las capas gratis se abusan y ralentizan a todos. El acceso funciona con un saldo prepago de ForHosting KIT: se recarga desde $10.00 (no caduca) y cada solicitud se cobra a su precio publicado, así que una llamada sin saldo devuelve HTTP 402. Sin suscripción, sin tokens ni créditos inventados, y una tarea fallida no se cobra.

¿La API ya acepta trabajos?

El endpoint está en despliegue final y todavía no está activo para peticiones, pero su comportamiento y precio ya están publicados para integrarlo apenas abra.

¿La capa OCR cambia cómo se ve la página?

No. El texto reconocido es invisible y queda posicionado exactamente sobre el escaneo original, así que la página se ve igual mientras por dentro se vuelve seleccionable, buscable y copiable.

¿Funciona con escritura a mano?

Está pensada para texto impreso o mecanografiado en páginas escaneadas. El contenido manuscrito es mucho menos predecible de reconocer y los resultados en ese caso pueden variar.

¿Puedo añadir la capa de texto a cientos de PDF escaneados en lote?

Sí. Cada documento se envía como su propio POST y se procesa de forma independiente, así que puede correr un lote grande por el endpoint y recoger los resultados por webhook a medida que terminan.

¿En qué se diferencia de convertir un escaneo a texto plano?

La extracción a texto plano descarta la imagen original de la página; este endpoint conserva el escaneo tal cual y coloca texto invisible encima, manteniendo la apariencia original del documento para verlo o imprimirlo.

¿Qué pasa con mi documento escaneado después?

El archivo y su resultado se eliminan tras la ventana de retención y jamás se usan para entrenar nada. La entrega es por webhook firmado o por un enlace firmado válido por 24 horas.

Todo lo de esta página está disponible por programación. Esta sección es para equipos que quieren integrarlo en sus sistemas; el resto puede usar la herramienta de arriba sin más.

POSThttps://api.kit.forhosting.com/pdf/ocr-layer

¿Prefiere automatizarlo? Un POST autenticado crea la tarea; el resultado llega por webhook o enlace firmado. La misma capacidad también se ejecuta aquí en la web, y pronto desde nuestra app, el email y Telegram.

curl -X POST https://api.kit.forhosting.com/pdf/ocr-layer \
  -H "Authorization: Bearer $KIT_KEY" \
  -H "Content-Type: application/json" \
  -d '{"pdf":"https://ejemplo.com/documento.pdf"}'
{
  "pdf": "https://ejemplo.com/documento.pdf"
}
{
  "task_id": "tsk_a1b2c3d4e5f6a1b2c3d4e5f6",
  "type": "pdf.ocr_layer",
  "status": "queued",
  "_links": {
    "result": "/tasks/tsk_…/result"
  }
}

La API es asíncrona: la llamada devuelve un task_id al instante y el resultado llega por webhook. El polling está limitado a 1 req/s por tarea.

Por solicitud$0.042
Por página$0.0025

Precio publicado — sin tokens ni créditos inventados. Una tarea fallida no se cobra.

max_mb25
max_pages200
HTTPCódigoSignificado
401unauthorizedAPI key ausente o inválida.
402insufficient_balanceEl saldo no cubre el precio de la tarea.
404unknown_typeEl tipo de tarea no existe.
429rate_limitedDemasiadas peticiones. Use el webhook en vez de sondear.
413input_too_largeEl archivo supera el límite de tamaño.

Ver la documentación completa del KIT →