ForHosting KIT · Texto e IA

Similitud de textos

Dos frases pueden no compartir ni una palabra y significar lo mismo, o compartir casi todas y significar cosas distintas. La API Similitud Semántica puntúa qué tan cerca están dos textos en significado, devolviendo un puntaje numérico por par en lugar de un conteo de palabras coincidentes, para que la lógica de búsqueda, deduplicación o emparejamiento se apoye en lo que un pasaje realmente dice.

● EstablePor solicitud + por par$0.002
Úselo desde WebAPIEmailApp prontoTelegram pronto

Ejecute esto en nuestros servidores con su cuenta. Las herramientas gratuitas corren en su navegador; esta cobra de su saldo del KIT según el precio de arriba.

El problema de comparar solo por palabras

El solapamiento de palabras clave y la distancia entre cadenas de texto son rápidos y baratos, pero fallan en ambas direcciones: 'la factura está vencida' y 'el pago todavía no llega' casi no comparten vocabulario y significan casi lo mismo, mientras que 'el informe no está terminado' y 'el informe está terminado' comparten casi todas las palabras y significan lo opuesto. Cualquiera que construya búsqueda, deduplicación o emparejamiento sobre comparación de texto ingenua termina chocando con esto. Este endpoint puntúa el significado directamente, de modo que la comparación se sostiene ante paráfrasis, redacciones equivalentes y negaciones, no solo ante coincidencia literal.

Cómo funciona una solicitud y su respuesta

Se envían por POST uno o varios pares de texto a /text/semantic-similarity. La tarea corre de forma asíncrona, y cada par del lote regresa con un puntaje de similitud una vez terminado el procesamiento, entregado por webhook o enlace firmado. Enviar pares en lote es el patrón habitual aquí: el endpoint está pensado y tarifado para puntuar muchas comparaciones en una sola llamada, no un par a la vez.

De dónde viene la idea de distancia semántica

La idea de fondo —que el significado puede representarse como una posición en un espacio de muchas dimensiones, donde la distancia corresponde a relación de sentido— tiene raíces en la investigación de semántica distribucional de los años noventa, mucho antes de convertirse en un componente estándar de los sistemas modernos de búsqueda y recomendación. Formaliza una intuición lingüística antigua: se conoce una palabra por la compañía que mantiene. El puntaje que devuelve este endpoint es una versión práctica y numérica de esa misma idea, aplicada a pasajes completos y no solo a palabras sueltas.

Dónde encaja dentro de un sistema automatizado

Al ser asíncrono y cobrarse por par, está pensado para insertarse en una lógica más amplia: un proceso de deduplicación puntúa cada ticket de soporte nuevo contra los recientes para marcar posibles duplicados, o una capa de relevancia de búsqueda reordena resultados por significado en lugar de coincidencias literales de palabras clave. Un lote fallido se reintenta automáticamente hasta tres veces y nunca se cobra si no se completa, así que ejecutar esto a escala de miles de pares mantiene un costo predecible.

Qué capta el puntaje y qué no

El puntaje refleja cercanía de significado, no coincidencia factual ni tono: dos textos pueden puntuar muy similares mientras difieren en un dato, y puntuar más bajo mientras coinciden en el fondo pero se expresan de forma muy distinta. Es una señal útil para ordenar y filtrar a escala, mejor combinada con un umbral que ajuste a su propio caso de uso que tratada como un juicio absoluto de corrección.

Detección de tickets duplicados en soporte

Una mesa de ayuda puntúa los tickets entrantes contra los abiertos para detectar duplicados probables aunque los clientes describan el mismo problema con palabras distintas.

Reordenamiento de relevancia en búsquedas

Una base de conocimiento reordena los resultados de búsqueda según similitud de significado con la consulta, en lugar de depender solo de coincidencias de palabras clave.

Detección de paráfrasis y plagio

Una plataforma educativa marca entregas que parafrasean muy de cerca un texto de referencia sin copiarlo palabra por palabra.

Deduplicación de contenido y FAQ

Un equipo de contenido puntúa artículos en borrador contra la biblioteca existente para detectar temas casi duplicados antes de publicar.

¿Cómo funciona la API de similitud semántica?

Se envían uno o varios pares de texto a /text/semantic-similarity, la tarea corre de forma asíncrona y cada par recibe un puntaje de similitud entregado por webhook o por un enlace firmado.

¿Existe un plan gratuito para esta API de similitud de textos?

No hay capa gratuita: las capas gratis se abusan y ralentizan a todos. El acceso funciona con un saldo prepago de ForHosting KIT: se recarga desde $10.00 (no caduca) y cada solicitud se cobra a su precio publicado, así que una llamada sin saldo devuelve HTTP 402. Sin suscripción, sin tokens ni créditos inventados, y una tarea fallida no se cobra.

¿Cómo se cobra la similitud semántica?

$0.002 por solicitud más $0.002 por cada par de textos puntuado, y solo se cobra al completarse con éxito.

¿Puedo enviar muchos pares en una sola solicitud?

Sí, agrupar pares en una sola llamada es la forma habitual y más eficiente de usar este endpoint a escala.

¿Qué significa realmente el puntaje de similitud?

Refleja la cercanía de significado entre dos textos, no vocabulario compartido ni coincidencia factual, así que un texto parafraseado puede puntuar alto aunque use palabras distintas.

¿Funciona con redacciones distintas o paráfrasis?

Sí, ese es justamente el caso de uso central: está diseñada para puntuar significado aunque los dos textos compartan poco o ningún vocabulario.

¿Qué pasa si falla una tarea de similitud?

Se reintenta automáticamente hasta tres veces y nunca se cobra si no llega a completarse con éxito.

¿Cómo y cuándo se entregan los resultados?

Mediante un webhook firmado, recomendado para automatización, o un enlace firmado válido por 24 horas; el texto de entrada se elimina al vencer la retención y nunca se usa para entrenamiento.

Todo lo de esta página está disponible por programación. Esta sección es para equipos que quieren integrarlo en sus sistemas; el resto puede usar la herramienta de arriba sin más.

POSThttps://api.kit.forhosting.com/text/semantic-similarity

¿Prefiere automatizarlo? Un POST autenticado crea la tarea; el resultado llega por webhook o enlace firmado. La misma capacidad también se ejecuta aquí en la web, y pronto desde nuestra app, el email y Telegram.

curl -X POST https://api.kit.forhosting.com/text/semantic-similarity \
  -H "Authorization: Bearer $KIT_KEY" \
  -H "Content-Type: application/json" \
  -d '{"input":"…"}'
{
  "input": "…"
}
{
  "task_id": "tsk_a1b2c3d4e5f6a1b2c3d4e5f6",
  "type": "text.semantic_similarity",
  "status": "queued",
  "_links": {
    "result": "/tasks/tsk_…/result"
  }
}

La API es asíncrona: la llamada devuelve un task_id al instante y el resultado llega por webhook. El polling está limitado a 1 req/s por tarea.

Por solicitud$0.002
Por par$0.0015

Precio publicado — sin tokens ni créditos inventados. Una tarea fallida no se cobra.

max_tokens20000
HTTPCódigoSignificado
401unauthorizedAPI key ausente o inválida.
402insufficient_balanceEl saldo no cubre el precio de la tarea.
404unknown_typeEl tipo de tarea no existe.
429rate_limitedDemasiadas peticiones. Use el webhook en vez de sondear.

Ver la documentación completa del KIT →