ForHosting KIT · Web: scraping y monitoreo

Tabla web a CSV

Parte de los mejores datos de internet siguen atrapados en una tabla HTML sin botón de descarga: una lista de precios, un conjunto de datos gubernamental, un calendario deportivo, una tabla bursátil actualizada cada noche. Este endpoint extrae esas tablas directamente a CSV, con columnas y encabezados intactos, lista para llevar a una hoja de cálculo o una base de datos.

● EstablePor solicitud + por URL$0.040
Úselo desde WebAPIEmailApp prontoTelegram pronto

Ejecute esto en nuestros servidores con su cuenta. Las herramientas gratuitas corren en su navegador; esta cobra de su saldo del KIT según el precio de arriba.

La brecha entre 'visible' y 'utilizable'

Una tabla HTML se ve perfecta en el navegador y resulta casi inútil en cualquier otro lugar: copiar y pegar desde la página desordena las columnas, rompe las celdas combinadas y arrastra anuncios o notas al pie que nadie quería. Analistas, investigadores y equipos financieros necesitan constantemente esos mismos datos en una hoja de cálculo, y hasta ahora las únicas opciones eran copiar a mano o escribir un extractor a medida para ese sitio en particular.

Cómo funciona la extracción

Envía una o varias URL y este endpoint ubica la tabla (o las tablas) de cada página, lee las filas de encabezado para etiquetar las columnas correctamente y convierte el resultado a CSV, respetando el orden de las filas y resolviendo los casos difíciles que hacen fallar a un extractor ingenuo, como encabezados con colspan o tablas construidas con divs anidados en lugar de marcado correcto. La respuesta llega por webhook, o mediante un enlace firmado válido durante 24 horas, identificada con un task_id que puede consultar o esperar.

Un formato con historia propia

El elemento de tabla en HTML es anterior al diseño con CSS; antes de flexbox y grid, las tablas eran la forma de maquetar páginas enteras, y todavía aparecen restos de esa época como tablas de datos con estructura inconsistente. El CSV, en cambio, ha sido el denominador común de los datos tabulares desde mucho antes de que existiera la web, y por eso sigue siendo el formato que cualquier hoja de cálculo, base de datos o herramienta de negocio entiende sin necesitar un complemento.

Pensado para lotes, no para copias sueltas

Como el precio se cobra por URL además de la solicitud base, este endpoint está diseñado para correr sobre docenas o cientos de páginas en una sola llamada, útil para dar seguimiento a la tabla de precios de un competidor en el tiempo, compilar un conjunto de datos público repartido en muchas páginas, o convertir todo un archivo de páginas de reportes en una canalización de datos limpia hacia un almacén de datos.

Páginas de precios de la competencia

Extraiga tablas de precios de varios sitios competidores de forma programada y compárelas como filas estructuradas en lugar de capturas de pantalla.

Compilación de datos públicos

Convierta las tablas paginadas de un sitio gubernamental o de investigación en un solo CSV listo para analizar, sin copiar cada página a mano.

Seguimiento de calendarios y listas

Extraiga calendarios de eventos, tablas de posiciones o nóminas publicadas únicamente como tabla HTML en el sitio de una liga o un recinto.

Archivos de reportes financieros

Convierta informes históricos o tablas de tasas publicadas como páginas web a CSV para los modelos de hoja de cálculo de un equipo financiero.

¿Cómo extraigo una tabla de una página web con esta API?

Envíe la URL (o una lista de URL) por POST a /web/tables; recibe un task_id de inmediato y el resultado en CSV llega por webhook o por un enlace firmado cuando termina el procesamiento.

¿Es gratuita esta API de extracción de tablas?

No hay capa gratuita: las capas gratis se abusan y ralentizan a todos. El acceso funciona con un saldo prepago de ForHosting KIT: se recarga desde $10.00 (no caduca) y cada solicitud se cobra a su precio publicado, así que una llamada sin saldo devuelve HTTP 402. Sin suscripción, sin tokens ni créditos inventados, y una tarea fallida no se cobra.

¿Qué formato de salida recibo?

El resultado es un CSV con las filas de encabezado correctamente etiquetadas como columnas, listo para abrir en una hoja de cálculo o cargar en una base de datos.

¿Puede manejar una página con varias tablas?

Sí, cada tabla encontrada en la página se captura y se devuelve por separado en lugar de mezclarse con las demás.

¿Funciona con tablas construidas sin marcado HTML de tabla real?

Está diseñado para leer con fiabilidad estructuras de tabla genuinas; las páginas que simulan una tabla solo con divs pueden extraerse con menos precisión que un marcado estándar.

¿Puedo extraer tablas de muchas URL a la vez?

Sí, envíe una lista de URL en una sola llamada y pague la tarifa por URL además del precio base de la solicitud.

¿Cómo recibo el CSV extraído?

Puede elegir un webhook firmado para entrega automática o descargar el CSV desde un enlace firmado, válido durante 24 horas después de completarse la tarea.

¿Se conservan mis datos extraídos o se usan para entrenamiento?

No. Los datos se eliminan al terminar la ventana de retención y nunca se usan para entrenar ningún modelo.

Todo lo de esta página está disponible por programación. Esta sección es para equipos que quieren integrarlo en sus sistemas; el resto puede usar la herramienta de arriba sin más.

POSThttps://api.kit.forhosting.com/web/tables

¿Prefiere automatizarlo? Un POST autenticado crea la tarea; el resultado llega por webhook o enlace firmado. La misma capacidad también se ejecuta aquí en la web, y pronto desde nuestra app, el email y Telegram.

curl -X POST https://api.kit.forhosting.com/web/tables \
  -H "Authorization: Bearer $KIT_KEY" \
  -H "Content-Type: application/json" \
  -d '{"url":"https://ejemplo.com"}'
{
  "url": "https://ejemplo.com"
}
{
  "task_id": "tsk_a1b2c3d4e5f6a1b2c3d4e5f6",
  "type": "web.tables",
  "status": "queued",
  "_links": {
    "result": "/tasks/tsk_…/result"
  }
}

La API es asíncrona: la llamada devuelve un task_id al instante y el resultado llega por webhook. El polling está limitado a 1 req/s por tarea.

Por solicitud$0.040
Por URL$0.001

Precio publicado — sin tokens ni créditos inventados. Una tarea fallida no se cobra.

timeout_sec30
max_crawl_pages25
HTTPCódigoSignificado
401unauthorizedAPI key ausente o inválida.
402insufficient_balanceEl saldo no cubre el precio de la tarea.
404unknown_typeEl tipo de tarea no existe.
429rate_limitedDemasiadas peticiones. Use el webhook en vez de sondear.
422task_failedLa tarea falló tras 3 reintentos. No se cobra.

Ver la documentación completa del KIT →