ForHosting KIT · Audio y voz

Transcripción con marcas de tiempo

Una transcripción simple dice qué se dijo; no dice cuándo. Este endpoint devuelve el mismo texto preciso más una marca de tiempo por cada palabra, de modo que cualquier herramienta pueda saltar directo al segundo exacto en que se pronunció una frase en vez de escanear un bloque de texto.

● EstablePor solicitud + por minuto$0.002
Úselo desde WebAPIEmailApp prontoTelegram pronto

Ejecute esto en nuestros servidores con su cuenta. Las herramientas gratuitas corren en su navegador; esta cobra de su saldo del KIT según el precio de arriba.

El vacío que deja una transcripción simple

El texto solo basta para leer qué ocurrió en una grabación, pero se queda corto en cuanto necesita actuar sobre un momento específico: cortar un video justo en la frase correcta, llevar a un oyente directo a la parte de un podcast que responde su pregunta, o construir un índice donde una búsqueda devuelva el segundo exacto y no solo el episodio completo. Una transcripción sin tiempos es un resumen cuando debería ser un mapa.

Qué regresa en el resultado

Envía un archivo de audio por POST a /audio/transcribe-timestamps y la tarea devuelve la transcripción completa dividida en palabras, cada una con un tiempo de inicio y fin en segundos, junto con el mismo texto que entregaría una transcripción simple. Ese nivel de detalle es lo que la distingue de un archivo de subtítulos que solo marca líneas completas: está pensada para herramientas que necesitan razonar sobre palabras individuales, no solo frases.

Dónde se usa realmente el tiempo por palabra

Los editores de video la usan para ajustar un corte al fotograma exacto donde termina una palabra, las herramientas de subtítulos estilo karaoke la usan para resaltar cada palabra según se pronuncia, y los sistemas de búsqueda la usan para que un usuario haga clic en un resultado y caiga en el instante exacto del audio, no al inicio del archivo. Nada de eso es posible con una transcripción que solo dice qué se dijo, no cuándo.

Cómo se genera el tiempo

La tarea procesa el audio igual que una transcripción completa, detectando el habla y el idioma de forma automática, pero registra la posición de cada palabra reconocida respecto a la señal de audio en vez de descartar esa información al ensamblar el texto. Las grabaciones largas se trocean automáticamente, y el tiempo se mantiene consistente en los límites entre fragmentos, así que un corte cerca de la unión entre dos segmentos sigue cayendo en el punto correcto.

Facturación y confiabilidad

El precio es una tarifa base pequeña por solicitud más una tarifa por minuto, la misma estructura que la transcripción simple, así que el resultado con marcas de tiempo no trae un sobrecosto oculto más allá de los minutos realmente procesados. La tarea es asíncrona de principio a fin: envía el audio, recibe un task_id de inmediato, y obtiene la transcripción con tiempos por webhook firmado o desde un enlace firmado válido por 24 horas; una tarea fallida reintenta automáticamente hasta tres veces y nunca se cobra si sigue sin completarse.

Edición de video y creación de clips

Un editor busca una cita en la transcripción y salta directo a esa marca de tiempo en el material original en vez de recorrer toda la grabación.

Subtítulos resaltados palabra por palabra

Una plataforma de video resalta cada palabra hablada en sincronía con la reproducción, el estilo de subtítulo usado en clips para redes sociales y videos para aprender idiomas.

Archivos de podcasts y clases con búsqueda

Una biblioteca de medios permite buscar texto de la transcripción y saltar directo al audio en el momento exacto en que se dijo una frase.

Extracción precisa de fragmentos de audio

Una automatización recorta solo la oración en la que un cliente hizo una pregunta, usando las marcas de tiempo por palabra para fijar los puntos exactos de corte.

¿En qué se diferencia esto de una transcripción normal?

Una transcripción simple devuelve texto; este endpoint devuelve el mismo texto con un tiempo de inicio y fin por cada palabra, así las herramientas pueden actuar sobre momentos exactos y no solo leer el contenido.

¿El tiempo es por palabra o solo por oración?

El tiempo se entrega a nivel de palabra, un detalle más fino que el tiempo por línea que se encuentra en formatos de subtítulos como SRT o VTT.

¿Cómo se cobra la API de transcripción con marcas de tiempo?

Una tarifa base pequeña por solicitud más una tarifa por minuto según la duración del audio, publicada en esta página; una transcripción fallida nunca se cobra.

¿Qué idiomas y duraciones de audio admite?

Aplica la misma cobertura de idiomas y el mismo troceo de archivos largos que la transcripción estándar, con detección automática de idioma o selección explícita.

¿Cómo recibo el resultado con marcas de tiempo?

Por webhook firmado en cuanto la tarea termina, o descargándolo desde un enlace firmado que permanece válido por 24 horas tras completarse.

¿Puedo usar esto para generar subtítulos en su lugar?

Para archivos de subtítulos listos para usar, los endpoints de SRT y VTT agrupan los tiempos en líneas automáticamente; use este endpoint cuando necesite precisión por palabra.

¿Hay un plan gratuito para probarla?

No hay capa gratuita: las capas gratis se abusan y ralentizan a todos. El acceso funciona con un saldo prepago de ForHosting KIT: se recarga desde $10.00 (no caduca) y cada solicitud se cobra a su precio publicado, así que una llamada sin saldo devuelve HTTP 402. Sin suscripción, sin tokens ni créditos inventados, y una tarea fallida no se cobra.

¿Qué pasa si falla la transcripción?

La tarea reintenta automáticamente hasta tres veces antes de devolver un error claro, y nunca se cobra una solicitud que no se completa.

Todo lo de esta página está disponible por programación. Esta sección es para equipos que quieren integrarlo en sus sistemas; el resto puede usar la herramienta de arriba sin más.

POSThttps://api.kit.forhosting.com/audio/transcribe-timestamps

¿Prefiere automatizarlo? Un POST autenticado crea la tarea; el resultado llega por webhook o enlace firmado. La misma capacidad también se ejecuta aquí en la web, y pronto desde nuestra app, el email y Telegram.

curl -X POST https://api.kit.forhosting.com/audio/transcribe-timestamps \
  -H "Authorization: Bearer $KIT_KEY" \
  -H "Content-Type: application/json" \
  -d '{"audio":"https://ejemplo.com/audio.mp3"}'
{
  "audio": "https://ejemplo.com/audio.mp3"
}
{
  "task_id": "tsk_a1b2c3d4e5f6a1b2c3d4e5f6",
  "type": "audio.transcribe_timestamps",
  "status": "queued",
  "_links": {
    "result": "/tasks/tsk_…/result"
  }
}

La API es asíncrona: la llamada devuelve un task_id al instante y el resultado llega por webhook. El polling está limitado a 1 req/s por tarea.

Por solicitud$0.002
Por minuto$0.0055

Precio publicado — sin tokens ni créditos inventados. Una tarea fallida no se cobra.

max_mb200
max_minutes180
HTTPCódigoSignificado
401unauthorizedAPI key ausente o inválida.
402insufficient_balanceEl saldo no cubre el precio de la tarea.
404unknown_typeEl tipo de tarea no existe.
429rate_limitedDemasiadas peticiones. Use el webhook en vez de sondear.
422task_failedLa tarea falló tras 3 reintentos. No se cobra.

Ver la documentación completa del KIT →