ForHosting KIT · Datos y archivos

HTML a texto

El HTML sin procesar está lleno de marcado que ningún índice de búsqueda, resumidor o lector humano pidió. Este endpoint extrae las palabras reales de las etiquetas, conservando los saltos de párrafo y el orden de las listas en vez de entregar un bloque de texto plano y desordenado.

● EstableGratis · en su navegador
Úselo desde WebAPIEmailApp prontoTelegram pronto

Corre en su navegador. Gratis y sin límite: sus datos no salen de esta página.

El marcado es ruido para la mayoría de los procesos posteriores

Una página raspada, un boletín guardado o una exportación de un gestor de contenidos comparten el mismo problema: las palabras que interesan están envueltas en una sopa de divs, estilos en línea, etiquetas de script y atributos que no significan nada para un modelo de lenguaje, un índice de búsqueda o un resumen en texto plano. Quitar etiquetas con una expresión regular rápida se rompe en cuanto un bloque de script o un comentario contiene un signo de mayor o menor suelto, y aplasta títulos y elementos de lista en una sola línea ilegible. data.html_to_text analiza el documento en vez de buscar patrones sobre él, así que el resultado se lee como lo leería una persona que revisa la página.

Qué hace la solicitud

Envíe POST a /data/html-to-text con el código HTML de origen, y la respuesta es un task_id mientras la extracción corre en segundo plano. El resultado final en texto plano, con los saltos de párrafo conservados y cada elemento de lista en su propia línea, llega mediante una llamada de webhook firmada o queda disponible en un enlace firmado válido por 24 horas.

La estructura sobrevive, las etiquetas no

La diferencia entre una buena extracción y un simple recorte está en qué pasa con la estructura: un título debe seguir empezando su propia línea, una lista con viñetas debe seguir leyéndose como lista, y una fila de tabla no debería colapsar en una sola oración sin espacios entre celdas. El HTML nunca fue pensado para cargar significado más allá del diseño visual; es un lenguaje de presentación heredado de los primeros años de la web, y los navegadores llevan treinta años siendo tolerantes con marcado mal formado, precisamente la razón por la que un analizador real resuelve casos límite que un reemplazo de texto no puede resolver.

Dónde encaja en la automatización

La indexación de búsqueda, los flujos de recuperación que alimentan a un modelo de lenguaje, los generadores de resúmenes por correo y las herramientas de comparación de contenido a lo largo del tiempo quieren texto limpio, no marcado, y ninguno debería mantener su propio analizador de HTML solo para conseguirlo. Como la tarea se cobra por solicitud y nunca se cobra si falla, un rastreador puede pasar cada página capturada por este endpoint sin presupuestar llamadas desperdiciadas, y el diseño asíncrono hace que un lote de diez mil páginas se convierta simplemente en diez mil entregas de webhook llegando a su propio ritmo en vez de un script esperando página por página.

Alimentar un índice de búsqueda

Una herramienta de búsqueda de sitio convierte las páginas HTML rastreadas a texto limpio antes de indexarlas, para que las coincidencias caigan sobre contenido real y no sobre restos de marcado.

Preparar contexto para un modelo de lenguaje

Un flujo de recuperación quita el HTML de las páginas obtenidas para que solo el texto legible entre en la ventana de contexto del modelo, reduciendo tokens desperdiciados.

Resúmenes de correo en texto plano

Un agregador de boletines convierte cada artículo en HTML a texto para armar un correo de resumen liviano en texto plano sin maquetación rota.

Comparar contenido a lo largo del tiempo

Una herramienta de monitoreo extrae el texto de una página en cada rastreo y compara ese texto plano, evitando falsos positivos por cambios cosméticos en el marcado.

¿Cómo convierto HTML a texto con la API?

Envíe su HTML por POST a /data/html-to-text, guarde el task_id devuelto y reciba el texto plano por webhook o mediante un enlace firmado válido por 24 horas.

¿Es gratis la API HTML a texto?

No, no hay plan gratuito ni prueba; cuesta $0.002 por solicitud, y una extracción fallida nunca se cobra.

¿Conserva la estructura de párrafos y listas?

Sí, los saltos de párrafo y los elementos de lista quedan en líneas separadas en vez de aplastarse en un solo bloque de texto.

¿También quita etiquetas de script y estilo?

Sí, las etiquetas de script, estilo y otros elementos no visibles se eliminan junto con su contenido, dejando solo texto legible.

¿Puedo usar esto para limpiar páginas raspadas antes de indexarlas?

Sí, es uno de sus usos más comunes: quitar el marcado antes de indexar evita coincidencias falsas sobre código de diseño.

¿Puedo procesar HTML por lote?

Sí, envíe una tarea asíncrona por documento y reciba cada resultado por webhook a medida que termine, algo ideal para lotes grandes de rastreo.

¿Ya está disponible este endpoint?

Sí, data.html_to_text está en producción y acepta solicitudes ahora mismo.

¿Se guarda mi HTML después de procesarlo?

No, el HTML enviado y el texto extraído se eliminan después del período de retención y nunca se usan para entrenamiento.

Todo lo de esta página está disponible por programación. Esta sección es para equipos que quieren integrarlo en sus sistemas; el resto puede usar la herramienta de arriba sin más.

POSThttps://api.kit.forhosting.com/data/html-to-text

¿Prefiere automatizarlo? Un POST autenticado crea la tarea; el resultado llega por webhook o enlace firmado. La misma capacidad también se ejecuta aquí en la web, y pronto desde nuestra app, el email y Telegram.

curl -X POST https://api.kit.forhosting.com/data/html-to-text \
  -H "Authorization: Bearer $KIT_KEY" \
  -H "Content-Type: application/json" \
  -d '{"input":"…"}'
{
  "input": "…"
}
{
  "task_id": "tsk_a1b2c3d4e5f6a1b2c3d4e5f6",
  "type": "data.html_to_text",
  "status": "queued",
  "_links": {
    "result": "/tasks/tsk_…/result"
  }
}

La API es asíncrona: la llamada devuelve un task_id al instante y el resultado llega por webhook. El polling está limitado a 1 req/s por tarea.

Por solicitud$0.002

Precio publicado — sin tokens ni créditos inventados. Una tarea fallida no se cobra.

max_mb25
HTTPCódigoSignificado
401unauthorizedAPI key ausente o inválida.
402insufficient_balanceEl saldo no cubre el precio de la tarea.
404unknown_typeEl tipo de tarea no existe.
429rate_limitedDemasiadas peticiones. Use el webhook en vez de sondear.

Ver la documentación completa del KIT →