ForHosting KIT · Web: scraping y monitoreo

Extraer imágenes

Envíe cualquier página pública a este endpoint y reciba un inventario limpio de todas sus imágenes: origen, dimensiones cuando estén disponibles y el texto alternativo que realmente vería un lector de pantalla o un buscador. Es la forma más rápida de saber qué imágenes tiene una página sin abrir las herramientas de desarrollador a mano.

● EstablePor solicitud + por URL$0.002
Úselo desde WebAPIEmailApp prontoTelegram pronto

Ejecute esto en nuestros servidores con su cuenta. Las herramientas gratuitas corren en su navegador; esta cobra de su saldo del KIT según el precio de arriba.

Por qué conviene una lista y no revisar a ojo

Equipos de contenido, auditores de accesibilidad y responsables de SEO chocan con el mismo problema: una página tiene cuarenta imágenes y nadie sabe cuáles no tienen texto alt hasta que un usuario con lector de pantalla se queja o una auditoría lo detecta tarde. Este endpoint convierte esa incertidumbre en una respuesta estructurada, para detectar los huecos antes de que los note un cliente.

Qué recibe de vuelta

Envía una URL, obtiene de inmediato un task_id y luego, por webhook o por enlace firmado válido 24 horas, una lista de cada imagen encontrada en el marcado ya renderizado: su src absoluto, su atributo alt tal cual está escrito (incluyendo cadenas vacías) y el ancho y alto cuando la etiqueta o el archivo los exponen. Las imágenes decorativas con alt vacío se marcan como tales en lugar de descartarse en silencio, porque 'sin alt' y 'alt vacío a propósito' significan cosas distintas para la accesibilidad.

Una nota sobre el atributo alt

El texto alternativo forma parte del HTML desde sus primeras especificaciones, pensado originalmente para navegadores de solo texto y hoy usado también por lectores de pantalla, indexación de búsqueda de imágenes y conexiones lentas donde la imagen no llega a cargar. Auditarlo a mano es tedioso y una expresión regular ingenua falla fácilmente, porque el marcado real anida imágenes dentro de etiquetas noscript, atributos de carga diferida y componentes renderizados por JavaScript.

Dónde encaja en una canalización de trabajo

Como la llamada es asíncrona, se pueden enviar cientos de páginas de un mapa del sitio en un solo lote, dejar que el webhook recoja cada resultado a medida que termina, y usar esa salida directamente en un panel de accesibilidad, un monitor de imágenes rotas o un script de migración de contenido que necesita saber con exactitud de qué medios depende una página antes de reescribirla o retirarla.

Auditorías de accesibilidad antes de un lanzamiento

Procese cada página de un sitio nuevo y marque cualquier imagen con alt ausente o genérico antes de que salga a producción.

Listas de control para migraciones de contenido

Obtenga un listado definitivo de las imágenes de una página antigua para que nada se pierda al reconstruirla en un nuevo gestor de contenido.

Cobertura de imágenes para SEO

Revise qué páginas de producto todavía tienen imágenes con alt vacío, una razón común por la que las fotos nunca aparecen en la búsqueda de imágenes.

Monitoreo de medios rotos

Combine la lista de src extraída con revisiones periódicas para detectar imágenes que empezaron a devolver un error 404 tras un cambio de infraestructura.

¿Cómo extraigo las imágenes de una URL con esta API?

Envíe una solicitud POST a /web/images con la URL de destino; recibe un task_id de inmediato y la lista completa de imágenes llega por webhook o por un enlace firmado cuando la tarea termina.

¿Existe un plan gratuito para esta API?

No hay capa gratuita: las capas gratis se abusan y ralentizan a todos. El acceso funciona con un saldo prepago de ForHosting KIT: se recarga desde $10.00 (no caduca) y cada solicitud se cobra a su precio publicado, así que una llamada sin saldo devuelve HTTP 402. Sin suscripción, sin tokens ni créditos inventados, y una tarea fallida no se cobra.

¿Detecta imágenes cargadas por JavaScript?

La página se renderiza antes de la extracción, así que las imágenes inyectadas por scripts del lado del cliente se capturan junto con las presentes en el HTML original.

¿Qué datos devuelve cada imagen?

Cada elemento incluye la URL absoluta de la imagen, el atributo alt tal como está escrito (incluso vacío) y el ancho y alto cuando esa información está disponible en el marcado o en el archivo.

¿Cuánto cuesta el endpoint de extracción de imágenes?

Cuesta $0.002 por solicitud, un precio fijo por página sin importar cuántas imágenes contenga.

¿Cómo recibo los resultados?

Puede elegir un webhook firmado para entrega automática, o consultar el resultado en un enlace firmado que permanece válido durante 24 horas.

¿Puedo usarlo en páginas que requieren inicio de sesión?

El endpoint obtiene URLs de acceso público; las páginas detrás de un muro de autenticación quedan fuera de su alcance.

¿Se almacenan los datos extraídos a largo plazo?

No. Los resultados se conservan solo durante la ventana de retención necesaria para la entrega y luego se eliminan; nada se usa para entrenamiento.

Todo lo de esta página está disponible por programación. Esta sección es para equipos que quieren integrarlo en sus sistemas; el resto puede usar la herramienta de arriba sin más.

POSThttps://api.kit.forhosting.com/web/images

¿Prefiere automatizarlo? Un POST autenticado crea la tarea; el resultado llega por webhook o enlace firmado. La misma capacidad también se ejecuta aquí en la web, y pronto desde nuestra app, el email y Telegram.

curl -X POST https://api.kit.forhosting.com/web/images \
  -H "Authorization: Bearer $KIT_KEY" \
  -H "Content-Type: application/json" \
  -d '{"url":"https://ejemplo.com"}'
{
  "url": "https://ejemplo.com"
}
{
  "task_id": "tsk_a1b2c3d4e5f6a1b2c3d4e5f6",
  "type": "web.images",
  "status": "queued",
  "_links": {
    "result": "/tasks/tsk_…/result"
  }
}

La API es asíncrona: la llamada devuelve un task_id al instante y el resultado llega por webhook. El polling está limitado a 1 req/s por tarea.

Por solicitud$0.002

Precio publicado — sin tokens ni créditos inventados. Una tarea fallida no se cobra.

timeout_sec30
max_crawl_pages25
HTTPCódigoSignificado
401unauthorizedAPI key ausente o inválida.
402insufficient_balanceEl saldo no cubre el precio de la tarea.
404unknown_typeEl tipo de tarea no existe.
429rate_limitedDemasiadas peticiones. Use el webhook en vez de sondear.

Ver la documentación completa del KIT →