ForHosting KIT · Búsqueda semántica y RAG

Agrupar textos

Diez mil tickets de soporte, reseñas o respuestas de encuesta esconden quizás una docena de temas reales, pero nadie tiene tiempo de leer los diez mil para encontrarlos. Este endpoint agrupa sus filas por significado y devuelve los grupos, así que la forma de un montón de texto sin estructura se vuelve visible en minutos en lugar de una semana de etiquetado manual.

● EstablePor solicitud + por 1000 filas$0.002
Úselo desde WebAPIEmailApp prontoTelegram pronto

Ejecute esto en nuestros servidores con su cuenta. Las herramientas gratuitas corren en su navegador; esta cobra de su saldo del KIT según el precio de arriba.

El problema que resuelve

Los datos de texto libre, reseñas, tickets, preguntas abiertas de encuestas, transcripciones de chat, son ricos pero no tienen forma. Las herramientas de análisis tradicionales necesitan una columna de categoría que todavía no existe, y crearla a mano no escala más allá de unos cientos de filas antes de convertirse en un trabajo de tiempo completo para alguien. El clustering se salta por completo el paso de etiquetar: lee el texto y encuentra los grupos naturales por sí mismo, permitiendo que un analista empiece desde una estructura en lugar de una hoja de cálculo vacía.

Qué envía y qué recibe

Envía un lote de filas de texto, una columna de cuerpos de ticket, reseñas de producto, respuestas de encuesta, lo que sea el conjunto de datos, y la tarea corre de forma asíncrona, devolviendo un task_id de inmediato. El resultado, entregado por webhook firmado o un enlace firmado de 24 horas, asigna cada fila a un grupo e incluye los grupos mismos, así puede ver de inmediato cuántos temas existen y qué tan grande es cada uno, sin tener que definir el número de categorías por adelantado.

Por qué funciona el agrupamiento sin supervisión

El clustering es una de las ideas más antiguas del análisis de datos, con raíces en técnicas como k-means desde los años sesenta, y la razón por la que sigue siendo útil es simple: no requiere que nadie haya decidido las categorías de antemano. En lugar de forzar los datos nuevos dentro de cajas viejas, el algoritmo observa qué es semánticamente cercano a qué y deja que los grupos surjan del texto mismo. Eso importa para todo lo que cambia con el tiempo, nuevos tipos de quejas, nuevos temas de retroalimentación de producto, nuevo lenguaje coloquial, porque los grupos reflejan lo que la gente dice este mes, no la taxonomía del año pasado.

Cómo encaja en un flujo de trabajo

La mayoría de los equipos lo ejecutan de forma recurrente: un lote semanal de tickets nuevos, una exportación mensual de reseñas de tienda de aplicaciones, una descarga fresca cada vez que cierra una encuesta de clientes. Como el precio es por solicitud más por cada 1000 filas, el costo de agrupar un conjunto de datos que crece escala con el volumen de forma fácil de presupuestar, y un lote que falla no cuesta nada porque las tareas fallidas se reintentan automáticamente y nunca se cobran.

Lo que no es

Esto agrupa textos por tema; no nombra los temas por usted ni explica por qué una fila terminó en un grupo más allá de la agrupación misma, y no se fusionará con una taxonomía predefinida rígida a menos que usted construya ese mapeo después. Piénselo como el primer paso rápido que convierte un montón de texto ilegible en una lista corta de grupos que merecen la atención de una persona.

Clasificación de tickets de soporte

Un equipo de soporte agrupa los tickets de la semana pasada automáticamente y descubre un pico en un solo tema, una queja por retraso de envío, antes de que aparezca como tendencia en ningún otro lado.

Análisis de reseñas de aplicaciones

Un equipo de producto agrupa un mes de reseñas de tienda de aplicaciones y obtiene un puñado de temas reales en lugar de leer mil comentarios de una línea uno por uno.

Respuestas abiertas de encuestas

Un investigador agrupa las respuestas de texto libre a '¿qué cambiarías?' de una encuesta de clientes, convirtiendo un muro de texto en un puñado de temas ordenados para la próxima reunión de planeación.

Preparación para deduplicar contenido

Un editor agrupa artículos archivados por tema antes de un rediseño del sitio, usando los grupos para decidir qué contenido antiguo fusionar, redirigir o retirar.

¿Cómo decide la API de clustering de textos los grupos?

Lee el significado de cada fila de texto y agrupa las filas que son semánticamente similares, sin necesitar categorías o etiquetas predefinidas.

¿Cuántos grupos obtendré?

El número de grupos refleja la estructura natural de sus datos en lugar de un número que deba adivinar de antemano, así que varía según el conjunto de datos.

¿Existe un plan gratuito para search.cluster?

No hay capa gratuita: las capas gratis se abusan y ralentizan a todos. El acceso funciona con un saldo prepago de ForHosting KIT: se recarga desde $10.00 (no caduca) y cada solicitud se cobra a su precio publicado, así que una llamada sin saldo devuelve HTTP 402. Sin suscripción, sin tokens ni créditos inventados, y una tarea fallida no se cobra.

¿Cuál es el precio de agrupar un conjunto de datos grande?

Es de $0.002 por solicitud más $0.002 por cada 1000 filas, así que el costo de un trabajo masivo es fácil de estimar antes de ejecutarlo.

¿Qué formatos de texto puedo agrupar?

Cualquier fila de texto plano, reseñas, tickets, comentarios, respuestas de encuesta, enviada como lote; el endpoint agrupa por significado sin importar la fuente original.

¿Etiqueta o nombra cada grupo?

Agrupa las filas entre sí; nombrar o interpretar cada tema queda de su lado, ya que ese criterio depende de sus datos y contexto específicos.

¿Cómo obtengo los resultados del clustering?

La llamada devuelve un task_id de inmediato, y los resultados se entregan mediante webhook firmado o un enlace firmado válido por 24 horas.

¿Puedo agrupar conjuntos de datos grandes en una sola llamada?

Sí, está diseñado para uso masivo: envíe miles de filas en un solo lote y el precio escala por cada 1000 filas procesadas, no por fila individual.

Todo lo de esta página está disponible por programación. Esta sección es para equipos que quieren integrarlo en sus sistemas; el resto puede usar la herramienta de arriba sin más.

POSThttps://api.kit.forhosting.com/search/cluster

¿Prefiere automatizarlo? Un POST autenticado crea la tarea; el resultado llega por webhook o enlace firmado. La misma capacidad también se ejecuta aquí en la web, y pronto desde nuestra app, el email y Telegram.

curl -X POST https://api.kit.forhosting.com/search/cluster \
  -H "Authorization: Bearer $KIT_KEY" \
  -H "Content-Type: application/json" \
  -d '{"text":"…"}'
{
  "text": "…"
}
{
  "task_id": "tsk_a1b2c3d4e5f6a1b2c3d4e5f6",
  "type": "search.cluster",
  "status": "queued",
  "_links": {
    "result": "/tasks/tsk_…/result"
  }
}

La API es asíncrona: la llamada devuelve un task_id al instante y el resultado llega por webhook. El polling está limitado a 1 req/s por tarea.

Por solicitud$0.002
Por 1000 filas$0.0015

Precio publicado — sin tokens ni créditos inventados. Una tarea fallida no se cobra.

max_chunks10000
max_tokens20000
HTTPCódigoSignificado
401unauthorizedAPI key ausente o inválida.
402insufficient_balanceEl saldo no cubre el precio de la tarea.
404unknown_typeEl tipo de tarea no existe.
429rate_limitedDemasiadas peticiones. Use el webhook en vez de sondear.

Ver la documentación completa del KIT →