ForHosting KIT · Web: scraping y monitoreo

Extraer JSON-LD

La mayoría de las páginas ya cargan un resumen de sí mismas legible por máquinas, escondido en una etiqueta de script, y casi nada lo lee salvo los rastreadores de buscadores. Este endpoint visita una página y le entrega cada bloque JSON-LD que encuentra, ya interpretado y listo, sin que usted escriba una sola línea de código para analizar HTML.

● EstableGratis · en su navegador
Úselo desde WebAPIEmailApp prontoTelegram pronto

Corre en su navegador. Gratis y sin límite: sus datos no salen de esta página.

Los datos siempre estuvieron ahí

Las páginas de producto describen su propio precio y disponibilidad. Las páginas de recetas listan sus propios ingredientes y tiempo de cocción. Las páginas de artículos declaran su propio autor y fecha de publicación. Todo eso vive dentro de etiquetas script type=application/ld+json porque los buscadores les pidieron a los sitios que lo pusieran ahí para habilitar resultados enriquecidos. La mayor parte de esos datos estructurados nunca los toca nada más que un rastreador; hasta ahora, leerlos por programa significaba descargar el HTML crudo usted mismo y construir a mano un analizador que se rompe apenas un sitio anida su marcado de otra forma.

Qué devuelve realmente la llamada

Envíe una URL por POST a /web/schema y reciba un task_id de inmediato; la descarga y la extracción ocurren de forma asíncrona, y el resultado terminado —cada objeto JSON-LD encontrado en la página, tal como el sitio lo publicó, sin reinterpretaciones— llega a su webhook o queda disponible en un enlace firmado por 24 horas. Si una página define varios bloques de schema, digamos un BreadcrumbList junto a un Product, ambos regresan por separado en lugar de mezclarse en una suposición.

Por qué JSON-LD se volvió el estándar

Los datos estructurados en la web pasaron por una etapa más desordenada con microdata y RDFa, ambos exigiendo entrelazar el marcado directamente dentro del HTML visible. JSON-LD se impuso porque vive en su propia etiqueta de script, separada del diseño visual, así que un rediseño no rompe accidentalmente los datos estructurados y un equipo de contenido puede actualizar el texto sin tocar el schema. Esa separación es justo lo que hace confiable extraerlo: los datos no están dispersos en decenas de atributos de clase, sino reunidos en un bloque limpio por cada tipo.

Dónde encaja en un flujo automatizado

Un sistema que vigila los precios de un competidor, una herramienta de investigación que arma un conjunto de datos de recetas, o una auditoría de SEO que revisa si las páginas de producto de un cliente realmente emiten schema Product válido, todos necesitan el mismo primer paso: extracción confiable a escala. Como cada llamada se cobra por solicitud sin trucos de planes escalonados, revisar diez mil páginas de producto cada noche cuesta lo mismo por página que revisar una sola, y las descargas fallidas —una página sin schema o que se cae por tiempo de espera— nunca se cobran, así que un barrido sobre una lista desordenada de URLs no desperdicia presupuesto en las páginas que no cooperan.

Monitoreo de precios de la competencia

Extraiga el schema Product cada noche de una lista de páginas de competidores para rastrear cambios de precio y disponibilidad sin analizar el diseño visible de la página.

Auditorías de datos estructurados para SEO

Verifique si las páginas de producto, artículo o preguntas frecuentes de un cliente realmente emiten JSON-LD válido antes de una revisión de elegibilidad para resultados enriquecidos.

Construcción de conjuntos de datos de recetas y reseñas

Reúna schema Recipe o Review de miles de URLs para armar un conjunto de datos estructurado sin analizar HTML crudo a mano.

Fuentes de agregación de contenido

Extraiga schema Article o Event de sitios asociados para poblar una página de listados con campos consistentes y estructurados.

¿Cómo extraigo JSON-LD con la API?

Envíe la URL de la página por POST a /web/schema, guarde el task_id devuelto y reciba los objetos JSON-LD extraídos por webhook o mediante un enlace firmado válido por 24 horas.

¿Es gratis la API para extraer schema?

No, no hay plan gratuito ni prueba; cuesta $0.002 por solicitud, y una extracción fallida nunca se cobra.

¿Qué devuelve si una página no tiene JSON-LD?

Un resultado vacío: la tarea igual se completa con éxito, solo que reporta que no encontró datos estructurados en esa página.

¿También soporta microdata o RDFa?

No, este endpoint apunta específicamente a JSON-LD, que es el formato que los buscadores modernos y la mayoría de los sitios usan hoy para resultados enriquecidos.

¿Puede manejar páginas con varios tipos de schema?

Sí, cada bloque JSON-LD de la página se devuelve por separado, así que una página con schema Product y BreadcrumbList a la vez devuelve ambos de forma distinta.

¿Puedo extraer schema de miles de URLs por lote?

Sí, envíe una tarea asíncrona por cada URL y reciba cada resultado por webhook a medida que termine, lo cual escala bien para auditorías grandes.

¿Ejecuta JavaScript para encontrar schema inyectado dinámicamente?

El endpoint descarga y analiza la página tal como se entrega; el schema inyectado puramente en el cliente tras un renderizado complejo conviene probarlo contra una URL específica antes de depender de él a escala.

¿Se guarda el contenido de la página después de la extracción?

No, las páginas descargadas y los datos extraídos se eliminan después del período de retención y nunca se usan para entrenamiento.

Todo lo de esta página está disponible por programación. Esta sección es para equipos que quieren integrarlo en sus sistemas; el resto puede usar la herramienta de arriba sin más.

POSThttps://api.kit.forhosting.com/web/schema

¿Prefiere automatizarlo? Un POST autenticado crea la tarea; el resultado llega por webhook o enlace firmado. La misma capacidad también se ejecuta aquí en la web, y pronto desde nuestra app, el email y Telegram.

curl -X POST https://api.kit.forhosting.com/web/schema \
  -H "Authorization: Bearer $KIT_KEY" \
  -H "Content-Type: application/json" \
  -d '{"url":"https://ejemplo.com"}'
{
  "url": "https://ejemplo.com"
}
{
  "task_id": "tsk_a1b2c3d4e5f6a1b2c3d4e5f6",
  "type": "web.schema",
  "status": "queued",
  "_links": {
    "result": "/tasks/tsk_…/result"
  }
}

La API es asíncrona: la llamada devuelve un task_id al instante y el resultado llega por webhook. El polling está limitado a 1 req/s por tarea.

Por solicitud$0.002

Precio publicado — sin tokens ni créditos inventados. Una tarea fallida no se cobra.

timeout_sec30
max_crawl_pages25
HTTPCódigoSignificado
401unauthorizedAPI key ausente o inválida.
402insufficient_balanceEl saldo no cubre el precio de la tarea.
404unknown_typeEl tipo de tarea no existe.
429rate_limitedDemasiadas peticiones. Use el webhook en vez de sondear.

Ver la documentación completa del KIT →