ForHosting KIT · Documentos y PDF

Extraiga texto PDF de un rango de páginas

Extraiga texto PDF de un rango de páginas cuando ya disponga de un bloque de texto por página y solo necesite una sección concreta.

● BetaGratis · en su navegador
Úselo desde WebAPIEmailTelegramApp pronto

Envíe los bloques ordenados, la primera página y la última. La capacidad valida el rango, numerado desde uno, frente al total de páginas, incluye ambos extremos y une el texto elegido en orden con un marcador visible de salto de página. Resulta útil para informes, contratos, manuales y documentos extensos en los que el proceso posterior debe recibir un fragmento preciso en lugar del contenido completo.

Proporcione el texto ordenado y un rango inclusivo

Comience con el texto que un extractor de PDF o un proceso OCR haya obtenido de cada página. Coloque los objetos en el mismo orden que en el documento original e incluya las páginas cuyo texto extraído sea una cadena vacía. Después indique start_page y end_page con numeración desde uno. Ambos extremos se incluyen: el rango de 3 a 5 devuelve los bloques tercero, cuarto y quinto. Conservar las páginas vacías es esencial, pues eliminarlas desplazaría la numeración posterior. Cada página debe ser un objeto con una cadena text; los valores ausentes o de otro tipo se rechazan. Se admiten hasta diez mil bloques. Esta capacidad no abre ni descodifica el archivo PDF, sino que trabaja con texto por página obtenido previamente, de modo que la selección permanece explícita y predecible.

Comprenda la validación y los límites de página

Los rangos se numeran desde uno, son inclusivos y se validan estrictamente. El inicio y el final deben ser enteros iguales o superiores a uno, y el inicio no puede quedar después del final. Ningún extremo puede superar el número de bloques recibidos. Si un documento de tres páginas solicita terminar en la cuarta, se devuelve un error de entrada no válida en vez de un resultado parcial. Así se revela cualquier discrepancia entre los metadatos, la selección y la extracción. Las cadenas elegidas se unen mediante un marcador estable rodeado de líneas en blanco, sin recortar ni interpretar el texto. Un rango de una página no necesita marcador. La salida también informa del número de páginas y repite los extremos aceptados. No intervienen la red, valores aleatorios, el reloj, modelos de lenguaje ni inferencias: la misma entrada siempre produce la misma salida.

Integre el resultado en flujos documentales precisos

La extracción selectiva aporta más valor entre una etapa que conserva las páginas y otra que no debe recibir el documento entero. Puede aislar los anexos de un contrato antes de analizar cláusulas, conservar solo el análisis de gestión de un informe trimestral o indexar un capítulo de un manual. Como la entrada es texto y no un PDF binario, la capacidad se combina tanto con OCR para documentos escaneados como con extracción normal para archivos digitales. Conserve la matriz original hasta validar el rango y registre los extremos devueltos cuando necesite auditoría. El marcador de salto puede mantenerse para citas o dividirse después. La herramienta no resume, corrige, clasifica ni normaliza el contenido; esas operaciones pertenecen a pasos separados. Aquí se ofrece una primitiva determinista para dirigir texto con exactitud y reproducir automatizaciones documentales.

Aislar una sección de un informe

Seleccione las páginas exactas con comentarios de gestión antes de enviar el texto a un análisis o comparación.

Dirigir anexos contractuales

Extraiga solo el rango inclusivo que contiene un anexo y conserve los límites de página para la revisión.

Indexar un capítulo de un manual

Elija un capítulo del texto por páginas y envíe el resultado preciso al buscador o al sistema de asistencia.

¿Se incluyen las páginas inicial y final?

Sí. El rango es inclusivo, por lo que de la página 2 a la 4 se devuelven tres bloques de texto.

¿Qué ocurre si el rango supera el documento?

La solicitud devuelve un error de entrada no válida si algún extremo excede el número de páginas recibido.

¿Esta capacidad lee un archivo PDF?

No. Recibe texto ordenado por páginas que ya se ha extraído previamente de un PDF.

¿Cómo se separan las páginas seleccionadas?

Los textos contiguos se unen con un marcador estable de salto de página rodeado de líneas en blanco.

¿Cuánto cuesta una solicitud?

El precio de la API es $0.002 por solicitud. La ejecución determinista en el navegador está disponible gratis en la página.

Todo lo de esta página está disponible por programación. Esta sección es para equipos que quieren integrarlo en sus sistemas; el resto puede usar la herramienta de arriba sin más.

POSThttps://api.kit.forhosting.com/pdf/text-extract-by-page-range

¿Prefiere automatizarlo? Un POST autenticado crea la tarea; el resultado llega por webhook o enlace firmado. La misma capacidad también se ejecuta aquí en la web, por email y desde Telegram — y pronto también desde nuestra app.

curl -X POST https://api.kit.forhosting.com/pdf/text-extract-by-page-range \
  -H "Authorization: Bearer $KIT_KEY" \
  -H "Content-Type: application/json" \
  -d '{"pages":[{"text":"Cover page"},{"text":"Executive summary\nRevenue increased."},{"text":"Risk analysis\nSupply remains constrained."},{"text":"Appendix"}],"start_page":2,"end_page":3}'
{
  "pages": [
    {
      "text": "Cover page"
    },
    {
      "text": "Executive summary\nRevenue increased."
    },
    {
      "text": "Risk analysis\nSupply remains constrained."
    },
    {
      "text": "Appendix"
    }
  ],
  "start_page": 2,
  "end_page": 3
}
{
  "task_id": "tsk_a1b2c3d4e5f6a1b2c3d4e5f6",
  "type": "pdf.text_extract_by_page_range",
  "status": "queued",
  "_links": {
    "result": "/tasks/tsk_…/result"
  }
}

La API es asíncrona: la llamada devuelve un task_id al instante y el resultado llega por webhook. El polling está limitado a 1 req/s por tarea.

Por solicitud$0.002

Precio publicado — sin tokens ni créditos inventados. Una tarea fallida no se cobra.

max_mb25
max_pages200
HTTPCódigoSignificado
401unauthorizedAPI key ausente o inválida.
402insufficient_balanceEl saldo no cubre el precio de la tarea.
404unknown_typeEl tipo de tarea no existe.
429rate_limitedDemasiadas peticiones. Use el webhook en vez de sondear.

Ver la documentación completa del KIT →