ForHosting KIT · Utilidades de desarrollo

Calculadora de relación tipo-token y diversidad léxica

La calculadora de relación tipo-token mide la variedad del vocabulario de un pasaje dividiendo el número de tipos de palabra distintos entre el total de tokens.

● BetaGratis · en su navegador
Úselo desde WebAPIEmailTelegramApp pronto

Pegue prosa, una transcripción, un ensayo o cualquier otro texto para obtener los recuentos de base y una relación reproducible entre cero y uno. El cálculo es determinista, admite palabras y números Unicode, conserva los apóstrofos internos y permite agrupar o distinguir palabras que solo cambian en mayúsculas y minúsculas.

Comprenda qué mide la relación

La relación tipo-token, abreviada habitualmente como TTR, compara la variedad del vocabulario con la longitud del texto. Un token es cada aparición de una palabra en el pasaje, mientras que un tipo es una forma de palabra distinta. En la frase «las aves cantan y las aves vuelan» hay seis tokens, pero cinco tipos, porque «aves» aparece dos veces. Al dividir los tipos entre los tokens se obtiene una puntuación mayor que cero y de hasta uno. El valor uno indica que cada token es único; un valor inferior señala más repeticiones. Esta interpretación sencilla permite una primera revisión de textos, transcripciones, lenguaje de estudiantes y colecciones de contenido. Sin embargo, la relación describe y no juzga la calidad. La repetición puede ser deliberada, necesaria o conveniente, sobre todo en instrucciones técnicas y explicaciones centradas. Examine los recuentos de tokens y tipos junto con la relación para entender su origen, en vez de considerar un único decimal como evaluación completa del estilo o la capacidad lingüística.

Compare textos en condiciones justas

La longitud influye mucho en una relación tipo-token básica. Los pasajes breves ofrecen menos oportunidades de repetir palabras y suelen obtener valores más altos que los extensos, incluso si proceden de la misma persona o del mismo tema. Para comparar con sentido, analice muestras de longitud, género, idioma y preparación similares. Por ejemplo, compare dos ensayos de quinientas palabras, no un mensaje corto con un informe completo. Esta calculadora reconoce como tokens las secuencias de letras o números Unicode y conserva apóstrofos rectos o tipográficos internos, por lo que las contracciones permanecen unidas. La puntuación alrededor de una palabra no crea otro tipo. Por defecto se agrupan las diferencias de mayúsculas: «Libro» y «libro» cuentan como el mismo tipo. Active el análisis sensible a mayúsculas solo si esa diferencia importa. Mantenga idénticos los ajustes, registre el total de tokens e interprete con prudencia las diferencias pequeñas, especialmente en muestras cortas o de temas distintos.

Integre el resultado en un proceso reproducible

Un proceso fiable comienza con una muestra bien definida. Decida antes de enviarla si debe incluir títulos, citas, etiquetas de hablante, números y texto repetitivo. Eliminar esos elementos de una muestra y conservarlos en otra altera tanto el numerador como el denominador. Ejecute cada pasaje preparado con el mismo ajuste de mayúsculas y guarde los cuatro campos devueltos: tokens totales, tipos distintos, relación tipo-token y regla de mayúsculas aplicada. Así el resultado se puede auditar y reproducir. La versión del navegador resulta práctica para comprobaciones individuales; la API encaja en lotes, paneles editoriales, herramientas educativas y preparación de datos de investigación. El cálculo es determinista y no envía el texto a un modelo de IA, por lo que una misma entrada produce la misma salida. Si no puede controlar la longitud, indíquelo o añada una medida de diversidad sensible a ella. Interprete siempre el número en contexto: un valor bajo puede reflejar terminología necesaria, coherencia temática, citas o diálogo repetido, no pobreza de vocabulario.

Comparar muestras de escritura

Mida borradores de igual longitud con ajustes constantes para observar cómo cambia la repetición del vocabulario entre versiones.

Analizar transcripciones

Añada una medida transparente de variedad léxica a procesos con entrevistas, clases, reuniones o transcripciones de investigación.

Auditar colecciones de contenido

Procese artículos o descripciones de productos por lotes y marque elementos inusualmente repetitivos para revisión humana.

¿Cómo se calcula la relación tipo-token?

Se divide el número de tipos de palabra distintos entre el total de tokens, y el resultado se redondea a seis decimales.

¿Qué significa una relación tipo-token alta?

Significa que una mayor proporción de los tokens es única en esa muestra. Por sí sola no demuestra que el texto sea mejor ni que el vocabulario sea más avanzado.

¿Por qué conviene que los textos tengan longitudes parecidas?

Los textos largos ofrecen naturalmente más ocasiones para repetir palabras, lo que suele reducir la TTR básica. Las longitudes similares permiten comparaciones más útiles.

¿Las mayúsculas afectan al resultado?

No de forma predeterminada. Establezca case_sensitive en true cuando formas como «Casa» y «casa» deban contar como tipos distintos.

¿Cómo se identifican las palabras?

Las secuencias Unicode de letras y números son tokens. Un apóstrofo recto o tipográfico interno permanece dentro del token; la puntuación exterior actúa como separador.

Todo lo de esta página está disponible por programación. Esta sección es para equipos que quieren integrarlo en sus sistemas; el resto puede usar la herramienta de arriba sin más.

POSThttps://api.kit.forhosting.com/str/type-token-ratio

¿Prefiere automatizarlo? Un POST autenticado crea la tarea; el resultado llega por webhook o enlace firmado. La misma capacidad también se ejecuta aquí en la web, por email y desde Telegram — y pronto también desde nuestra app.

curl -X POST https://api.kit.forhosting.com/str/type-token-ratio \
  -H "Authorization: Bearer $KIT_KEY" \
  -H "Content-Type: application/json" \
  -d '{"text":"The quick brown fox jumps over the lazy dog. The fox rests."}'
{
  "text": "The quick brown fox jumps over the lazy dog. The fox rests."
}
{
  "task_id": "tsk_a1b2c3d4e5f6a1b2c3d4e5f6",
  "type": "str.type_token_ratio",
  "status": "queued",
  "_links": {
    "result": "/tasks/tsk_…/result"
  }
}

La API es asíncrona: la llamada devuelve un task_id al instante y el resultado llega por webhook. El polling está limitado a 1 req/s por tarea.

Por solicitud$0.002

Precio publicado — sin tokens ni créditos inventados. Una tarea fallida no se cobra.

max_chars1000000
HTTPCódigoSignificado
401unauthorizedAPI key ausente o inválida.
402insufficient_balanceEl saldo no cubre el precio de la tarea.
404unknown_typeEl tipo de tarea no existe.
429rate_limitedDemasiadas peticiones. Use el webhook en vez de sondear.

Ver la documentación completa del KIT →