ForHosting KIT · Audio y voz

Texto a voz en español

Un modelo de voz multilingüe genérico leyendo en español suele arrastrar rastros de la cadencia del inglés en su acentuación y sus vocales, algo que quien habla español de forma nativa nota de inmediato aunque no sepa explicar qué suena raro. Esta API de texto a voz en español está construida sobre voces nativas en español, así que el resultado suena propio del idioma y no traducido hacia él.

● EstablePor solicitud + por 1000 caracteres$0.002
Úselo desde WebAPIEmailApp prontoTelegram pronto

Ejecute esto en nuestros servidores con su cuenta. Las herramientas gratuitas corren en su navegador; esta cobra de su saldo del KIT según el precio de arriba.

Por qué 'multilingüe' no es lo mismo que 'nativo'

El español no es un solo acento: el mexicano, el rioplatense, el caribeño y el castellano tienen ritmo, suavización de consonantes y claridad vocálica distintos, y un modelo de voz entrenado principalmente en otros idiomas tiende a aplanar esas diferencias en algo que técnicamente pronuncia las palabras pero no suena al español de nadie en particular. Este endpoint está construido específicamente sobre datos de voz en español, en lugar de tratar el español como un idioma más que un modelo general también soporta, y esa es la diferencia que realmente nota quien escucha.

Cómo funciona la solicitud

Envía texto en español plano en el cuerpo de la solicitud y la tarea se pone en cola de forma asíncrona, devolviendo un task_id de inmediato. Como generar habla natural toma tiempo real de procesamiento para cualquier cosa más allá de unas pocas palabras, el audio final llega después, mediante un webhook firmado, el camino recomendado para flujos automatizados, o mediante un enlace firmado válido por 24 horas si prefiere consultarlo manualmente. El endpoint lee el texto en español de forma directa; no hace falta ninguna bandera de idioma ni negociación de configuración regional más allá de enviar contenido en español.

A quién sirve esto específicamente

Empresas de medios que producen audio en español para audiencias latinoamericanas, sistemas de atención al cliente que necesitan un saludo de IVR que suene nativo y no doblado, y plataformas de e-learning que enseñan en español, todos necesitan un audio que quien escucha no perciba como extranjero. Ese punto importa más de lo que parece: una voz con la cadencia equivocada distrae del contenido, lo cual anula el propósito de narrarlo.

Números, moneda y texto cotidiano

El texto en español tiene sus propias convenciones que vale la pena respetar: coma decimal en lugar de punto decimal en muchos países, moneda leída a la manera local, fechas ordenadas día-mes-año, y los modelos de voz nativos en español manejan estas convenciones como lo haría un narrador hispanohablante, en vez de leerlas de forma literal como si vinieran de una plantilla en inglés. Esa atención a la convención es exactamente lo que separa un audio que suena producido en español de uno que suena convertido hacia él.

Precio, acceso y manejo de datos

El precio es una tarifa base pequeña por solicitud más una tarifa por cada 1000 caracteres, y las tareas fallidas, tras los reintentos automáticos, nunca se cobran. Como todo endpoint de la API, requiere saldo prepago; una solicitud sin saldo devuelve HTTP 402 en vez de una respuesta gratuita degradada. El audio generado y el texto fuente se eliminan al terminar el período de retención y nunca se usan para entrenar ningún modelo.

Producción de podcast en español

Genera una pista hablada a partir de un guion en español para un episodio de podcast sin contratar un locutor en cada actualización.

Saludos de IVR con voz nativa

Produce mensajes de voz para un sistema telefónico en español que suenen como grabados por alguien nativo, no como una voz en inglés traducida.

Narración de e-learning en español

Narra el texto de una lección para estudiantes hispanohablantes con una pronunciación y cadencia parecidas a las de un instructor nativo.

Lectura de noticias y artículos regionales

Ofrece una versión en audio en español de artículos publicados para lectores latinoamericanos que prefieren escuchar en vez de leer.

¿En qué se diferencia esta api del endpoint general de texto a voz?

Está construida sobre voces nativas en español en lugar de un modelo multilingüe que también soporta español, lo que produce una cadencia y pronunciación más naturales para quien escucha en español.

¿Soporta español latinoamericano y castellano?

Genera habla en español con sonido nativo; revise las opciones de voz disponibles en su cuenta para variantes regionales específicas.

¿Es gratuita la api de texto a voz en español?

No hay capa gratuita: las capas gratis se abusan y ralentizan a todos. El acceso funciona con un saldo prepago de ForHosting KIT: se recarga desde $10.00 (no caduca) y cada solicitud se cobra a su precio publicado, así que una llamada sin saldo devuelve HTTP 402. Sin suscripción, sin tokens ni créditos inventados, y una tarea fallida no se cobra.

¿Cuánto cuesta convertir texto a voz en español?

Cuesta $0.002 por solicitud más $0.0025 por cada 1000 caracteres del texto de entrada en español.

¿Puedo usar esto para números, fechas y moneda en español?

Sí, los modelos de voz nativos en español leen números, fechas y moneda siguiendo las convenciones del idioma español, no una traducción literal de un formato en inglés.

¿Cómo recibo el audio generado?

La tarea es asíncrona y devuelve un task_id de inmediato; el audio se entrega por webhook firmado o por un enlace firmado válido por 24 horas.

¿Puedo usar marcado ssml con el endpoint de voz en español?

Este endpoint recibe texto plano en español; para control explícito de pausas y énfasis en español, use el endpoint de texto a voz con SSML con texto marcado en español.

¿Qué pasa si falla una tarea de texto a voz en español?

Se reintenta automáticamente hasta tres veces sin costo; si aun así falla, recibe un error claro y no se le cobra.

Todo lo de esta página está disponible por programación. Esta sección es para equipos que quieren integrarlo en sus sistemas; el resto puede usar la herramienta de arriba sin más.

POSThttps://api.kit.forhosting.com/voice/tts-es

¿Prefiere automatizarlo? Un POST autenticado crea la tarea; el resultado llega por webhook o enlace firmado. La misma capacidad también se ejecuta aquí en la web, y pronto desde nuestra app, el email y Telegram.

curl -X POST https://api.kit.forhosting.com/voice/tts-es \
  -H "Authorization: Bearer $KIT_KEY" \
  -H "Content-Type: application/json" \
  -d '{"text":"…"}'
{
  "text": "…"
}
{
  "task_id": "tsk_a1b2c3d4e5f6a1b2c3d4e5f6",
  "type": "voice.tts_es",
  "status": "queued",
  "_links": {
    "result": "/tasks/tsk_…/result"
  }
}

La API es asíncrona: la llamada devuelve un task_id al instante y el resultado llega por webhook. El polling está limitado a 1 req/s por tarea.

Por solicitud$0.002
Por 1000 caracteres$0.0025

Precio publicado — sin tokens ni créditos inventados. Una tarea fallida no se cobra.

max_mb200
max_minutes180
HTTPCódigoSignificado
401unauthorizedAPI key ausente o inválida.
402insufficient_balanceEl saldo no cubre el precio de la tarea.
404unknown_typeEl tipo de tarea no existe.
429rate_limitedDemasiadas peticiones. Use el webhook en vez de sondear.

Ver la documentación completa del KIT →