ForHosting KIT · Web: scraping y monitoreo

Rastrear un sitio

Le da una URL de partida y sigue los enlaces hacia afuera por todo el sitio, descubriendo páginas que no tenía listadas, mientras lee y obedece el robots.txt como debe hacerlo cualquier rastreador bien portado. Es el endpoint para cuando la pregunta no es "qué hay en esta página" sino "qué contiene realmente este sitio entero".

● EstablePor solicitud + por página$0.040
Úselo desde WebAPIEmailApp prontoTelegram pronto

Cuando necesita el mapa completo, no un solo alfiler

El scraping de una sola página asume que ya sabe en qué URL está la respuesta; rastrear es para cuando no lo sabe: auditar cada página de un sitio antes de una migración, descubrir cada URL de producto que un competidor tiene publicada, o reconstruir un mapa del sitio desde cero porque el sitemap.xml está desactualizado o no existe. Se cambia la velocidad de una sola solicitud por cobertura de un dominio entero.

Cómo avanza realmente el rastreo

Una llamada a POST /web/crawl con una URL de inicio y parámetros de rastreo (profundidad, límite de páginas, patrones de URL a incluir o excluir) devuelve un task_id de inmediato, y luego el rastreador avanza enlace por enlace, descargando primero el robots.txt y saltándose cualquier ruta que prohíba, tal como se espera de un rastreador legítimo. A medida que se descubren y procesan páginas, se acumulan en un único resultado estructurado entregado a su webhook firmado o a un enlace firmado cuando el rastreo termina o alcanza el límite configurado.

robots.txt: un acuerdo de 1994 que todavía gobierna la web

El Protocolo de Exclusión de Robots data de 1994, redactado de manera informal por administradores que querían una forma legible por máquina de indicar a los visitantes automatizados qué rutas estaban vedadas, y nunca necesitó un organismo formal de estándares para seguir siendo la norma aceptada. Respetarlo no es opcional aquí: se lee antes de descargar la primera página más allá del inicio, y las rutas prohibidas se saltan en lugar de rastrearse en silencio, lo cual es el mínimo ético y, a menudo, la diferencia entre un rastreo bienvenido y uno bloqueado.

Qué contiene realmente el resultado

Recibe una lista estructurada de cada página visitada, con su URL, código de estado y contenido extraído, más el grafo de enlaces que el rastreador usó para descubrirlas, suficiente para reconstruir la forma del sitio y no solo su texto. Como una página que falla al cargar se reintenta automáticamente hasta tres veces antes de marcarse como fallida en vez de descartarse en silencio, y como el precio es por página realmente rastreada, un puñado de páginas lentas o rotas no infla su factura ni deja huecos invisibles.

Dónde encaja el rastreo dentro de la automatización

Los resultados alimentan de forma natural auditorías de contenido, barridos de enlaces rotos, listas de verificación para migraciones y revisiones de estructura SEO, cualquier lugar donde el entregable sea un inventario completo y no una sola respuesta. Ajuste profundidad y límite de páginas al trabajo: un rastreo superficial y acotado para revisar rápido una sección, uno profundo con límites generosos cuando el objetivo es un mapa genuinamente completo antes de un rediseño o una adquisición.

Auditoría de contenido previa a una migración

Rastree un sitio antes de migrar de plataforma para obtener un inventario completo de cada URL activa, de modo que nada se pierda en el traslado sin que nadie lo note.

Mapeo del sitio de un competidor

Descubra cada página de producto o categoría que un competidor ha publicado, incluso las que no están enlazadas desde su navegación principal.

Reconstruir un sitemap desactualizado o inexistente

Rastree un sitio cuyo sitemap.xml está obsoleto o ausente para reconstruir una lista precisa y actual de sus páginas.

Auditoría de enlaces rotos y estados en todo el sitio

Recorra un dominio completo y recopile el código de estado de cada página para encontrar 404 y cadenas de redirección antes de que afecten el posicionamiento.

¿El rastreador respeta el robots.txt?

Sí, el robots.txt se descarga y se revisa antes de rastrear cualquier ruta más allá de la URL de inicio, y las rutas prohibidas se saltan en lugar de visitarse.

¿Cuánto cuesta web.crawl?

$0.040 por solicitud más $0.001 por página realmente rastreada, así que el costo escala directo con cuánto del sitio cubra.

¿Puedo limitar qué tan profundo o amplio llega el rastreo?

Sí, los límites de profundidad y cantidad de páginas, junto con patrones de URL para incluir o excluir, son configurables por solicitud.

¿Hay una prueba gratuita de la api rastrear un sitio web?

No hay capa gratuita: las capas gratis se abusan y ralentizan a todos. El acceso funciona con un saldo prepago de ForHosting KIT: se recarga desde $10.00 (no caduca) y cada solicitud se cobra a su precio publicado, así que una llamada sin saldo devuelve HTTP 402. Sin suscripción, sin tokens ni créditos inventados, y una tarea fallida no se cobra.

¿Qué pasa con las páginas que fallan al cargar durante un rastreo?

Se reintentan automáticamente hasta tres veces; si aun así fallan, quedan marcadas como fallidas en el resultado en lugar de omitirse en silencio.

¿Cómo recibo los resultados del rastreo?

Como un único resultado estructurado entregado a su webhook firmado cuando el rastreo termina, o mediante un enlace firmado válido por 24 horas.

¿Puedo rastrear solo una sección de un sitio en vez del dominio completo?

Sí, los patrones de URL le permiten acotar el rastreo a una ruta, subdominio o categoría específica en lugar de todo el sitio.

¿En qué se diferencia rastrear de raspar una sola página?

Los endpoints de scraping extraen datos de URLs que ya conoce; rastrear descubre esas URLs por usted siguiendo enlaces por todo el sitio, que es el punto cuando necesita cobertura en vez de una sola consulta.

Todo lo de esta página está disponible por programación. Esta sección es para equipos que quieren integrarlo en sus sistemas; el resto puede usar la herramienta de arriba sin más.

POSThttps://api.kit.forhosting.com/web/crawl

¿Prefiere automatizarlo? Un POST autenticado crea la tarea; el resultado llega por webhook o enlace firmado. La misma capacidad también se ejecuta aquí en la web, y pronto desde nuestra app, el email y Telegram.

curl -X POST https://api.kit.forhosting.com/web/crawl \
  -H "Authorization: Bearer $KIT_KEY" \
  -H "Content-Type: application/json" \
  -d '{"input":"…"}'
{
  "input": "…"
}
{
  "task_id": "tsk_a1b2c3d4e5f6a1b2c3d4e5f6",
  "type": "web.crawl",
  "status": "queued",
  "_links": {
    "result": "/tasks/tsk_…/result"
  }
}

La API es asíncrona: la llamada devuelve un task_id al instante y el resultado llega por webhook. El polling está limitado a 1 req/s por tarea.

Por solicitud$0.040
Por página$0.001

Precio publicado — sin tokens ni créditos inventados. Una tarea fallida no se cobra.

timeout_sec30
max_crawl_pages25
HTTPCódigoSignificado
401unauthorizedAPI key ausente o inválida.
402insufficient_balanceEl saldo no cubre el precio de la tarea.
404unknown_typeEl tipo de tarea no existe.
429rate_limitedDemasiadas peticiones. Use el webhook en vez de sondear.
413input_too_largeEl archivo supera el límite de tamaño.
422task_failedLa tarea falló tras 3 reintentos. No se cobra.

Ver la documentación completa del KIT →