ForHosting KIT · Web: scraping y monitoreo

Scraping con IA

En lugar de inspeccionar el HTML y escribir selectores CSS, escribe una frase, por ejemplo "el nombre del producto, el precio y si está en existencia", y un modelo de lenguaje lee la página renderizada para completarla. Existe para las páginas que rompen cualquier scraper basado en selectores: marcado inconsistente, diseños con pruebas A/B o sitios que nunca antes había tocado.

● EstablePor solicitud + por URL$0.046
Úselo desde WebAPIEmailApp prontoTelegram pronto

Ejecute esto en nuestros servidores con su cuenta. Las herramientas gratuitas corren en su navegador; esta cobra de su saldo del KIT según el precio de arriba.

El problema: el diseño cambia, el selector se rompe

Cualquiera que haya corrido un scraper basado en selectores por más de unos meses conoce la rutina: sale un rediseño del sitio, cambia el nombre de una clase, y un trabajo de monitoreo empieza a devolver nulos en silencio. Este endpoint apunta exactamente a ese modo de falla, además del caso puntual en que necesita datos de una página hoy mismo y no quiere pasar veinte minutos en las herramientas de desarrollador buscando el anidamiento correcto.

Cómo funciona realmente la extracción

Llama a POST /web/scrape-ai con una URL y una descripción en lenguaje natural de los campos que quiere; el task_id vuelve al instante mientras, detrás, se descarga la página, se prepara su contenido renderizado para un modelo de lenguaje, y a ese modelo se le indica devolver únicamente los campos que describió, en JSON, basándose en lo que realmente aparece en la página en vez de inventarlo a partir de conocimiento general.

Por qué la extracción en lenguaje natural ahora es práctica

Los modelos de lenguaje grandes apenas se volvieron lo bastante confiables para seguir instrucciones de salida estructurada sobre texto común en los últimos años; antes de eso, las únicas opciones eran selectores frágiles o expresiones regulares escritas a mano para cada dominio nuevo. Describir la intención en una frase, en lugar de codificarla como una ruta CSS, significa que la misma solicitud puede sobrevivir a un rediseño de sitio que habría roto en silencio un mapa de selectores.

Qué esperar del resultado y qué pasa cuando algo no coincide

La respuesta es un objeto JSON con las claves de los campos implícitos en su descripción; si la página genuinamente carece de un campo que pidió, vuelve como null en lugar de un valor inventado, porque el modelo está anclado al contenido de la página y se le instruye no fabricar datos. Como con cualquier tarea de la plataforma, una extracción fallida se reintenta automáticamente hasta tres veces antes de devolver un error claro, y solo se factura una vez que la tarea se completa con éxito.

Dónde encaja junto a los otros endpoints de scraping

Los equipos suelen recurrir primero a este endpoint al prototipar una nueva fuente de datos, y luego migran las páginas estables de alto volumen a scraping por selectores una vez que el diseño se conoce y no vale la pena redescribirlo en cada corrida. Para los casos donde necesita una forma estricta y verificable por máquina, con campos obligatorios, tipos fijos y valores enumerados, el endpoint de scraping con esquema añade esa garantía sobre la misma flexibilidad de lenguaje natural.

Prototipar una nueva fuente de scraping

Apúntelo a un sitio que nunca ha raspado antes y describa los campos que necesita, sin pasar por el trabajo de mapear selectores antes de saber siquiera si la fuente vale la pena.

Sitios con marcado inconsistente o con pruebas A/B

Extraiga los mismos campos de forma confiable en páginas de listado donde distintos productos se renderizan con estructuras HTML ligeramente distintas.

Investigación de cola larga en muchos dominios distintos

Extraiga campos comparables, autor, fecha de publicación, titular, de docenas de sitios de noticias sin relación entre sí sin escribir un mapa de selectores para cada uno.

Rescatar un trabajo de scraping roto

Cambie temporalmente un pipeline de monitoreo al endpoint con IA después de que un rediseño rompe sus selectores CSS, ganando tiempo para decidir si reconstruir el mapa de selectores.

¿En qué se diferencia el web scraping con IA del scraping por selectores?

Describe los campos que quiere en lenguaje natural en lugar de escribir selectores CSS, lo que lo hace más resistente a cambios de diseño a un costo por URL algo mayor.

¿Cuánto cuesta web.scrape_ai?

$0.046 por solicitud más $0.0145 por URL, y solo se cobra por tareas que se completan con éxito.

¿Puede raspar cualquier sitio web?

Funciona en cualquier página públicamente accesible cuyo contenido se renderice en la respuesta, incluyendo páginas con mucho JavaScript, aunque los sitios que requieren inicio de sesión quedan fuera de alcance.

¿Inventará datos que no están en la página?

No: el modelo está anclado al contenido real de la página y devuelve null para los campos que genuinamente no encuentra, en lugar de adivinar.

¿Hay una prueba gratuita de la api web scraping con ia?

No hay capa gratuita: las capas gratis se abusan y ralentizan a todos. El acceso funciona con un saldo prepago de ForHosting KIT: se recarga desde $10.00 (no caduca) y cada solicitud se cobra a su precio publicado, así que una llamada sin saldo devuelve HTTP 402. Sin suscripción, sin tokens ni créditos inventados, y una tarea fallida no se cobra.

¿Cómo escribo una buena descripción de extracción?

Nombre cada campo con claridad y anote su forma esperada cuando importe, por ejemplo "precio como número sin símbolo de moneda"; la especificidad en su descripción mejora la calidad del resultado.

¿Cómo recibo los resultados?

Por un webhook firmado cuando la tarea termina, o mediante un enlace firmado válido por 24 horas si prefiere consultarlo usted mismo.

¿Cuándo debo usar scrape_schema en vez de scrape_ai?

Recurra a scrape_schema cuando necesite una forma de datos estricta y validada, con campos obligatorios y tipos fijos; use scrape_ai cuando una descripción flexible en lenguaje natural sea suficiente.

Todo lo de esta página está disponible por programación. Esta sección es para equipos que quieren integrarlo en sus sistemas; el resto puede usar la herramienta de arriba sin más.

POSThttps://api.kit.forhosting.com/web/scrape-ai

¿Prefiere automatizarlo? Un POST autenticado crea la tarea; el resultado llega por webhook o enlace firmado. La misma capacidad también se ejecuta aquí en la web, y pronto desde nuestra app, el email y Telegram.

curl -X POST https://api.kit.forhosting.com/web/scrape-ai \
  -H "Authorization: Bearer $KIT_KEY" \
  -H "Content-Type: application/json" \
  -d '{"url":"https://ejemplo.com"}'
{
  "url": "https://ejemplo.com"
}
{
  "task_id": "tsk_a1b2c3d4e5f6a1b2c3d4e5f6",
  "type": "web.scrape_ai",
  "status": "queued",
  "_links": {
    "result": "/tasks/tsk_…/result"
  }
}

La API es asíncrona: la llamada devuelve un task_id al instante y el resultado llega por webhook. El polling está limitado a 1 req/s por tarea.

Por solicitud$0.046
Por URL$0.0145

Precio publicado — sin tokens ni créditos inventados. Una tarea fallida no se cobra.

timeout_sec30
max_crawl_pages25
HTTPCódigoSignificado
401unauthorizedAPI key ausente o inválida.
402insufficient_balanceEl saldo no cubre el precio de la tarea.
404unknown_typeEl tipo de tarea no existe.
429rate_limitedDemasiadas peticiones. Use el webhook en vez de sondear.
422task_failedLa tarea falló tras 3 reintentos. No se cobra.

Ver la documentación completa del KIT →