Moderar audio
La moderación de texto lleva años de herramientas construidas a su alrededor; el contenido hablado, en su mayoría, no, aunque los mensajes de voz, las llamadas grabadas y el audio subido por usuarios cargan los mismos riesgos que una sección de comentarios. Este endpoint escucha una grabación y marca contenido tóxico, inseguro o que infringe políticas, con el contexto de lo que realmente se dijo.
Ejecútela online
Ejecute esto en nuestros servidores con su cuenta. Las herramientas gratuitas corren en su navegador; esta cobra de su saldo del KIT según el precio de arriba.
Por qué el audio se escapa de la moderación basada en texto
Una plataforma que analiza texto subido en busca de abuso no tiene nada que revisar cuando el abuso llega como un clip de voz, una llamada grabada o la pista de audio de un livestream: el contenido dañino existe, pero ningún sistema de moderación lo ve nunca porque no hay texto que analizar. Ese punto ciego ha crecido a medida que los mensajes de voz, las apps sociales centradas en audio y las llamadas grabadas se volvieron formas normales de comunicarse, y es justo el hueco que este endpoint viene a cerrar.
Qué revisa realmente la tarea
Envíe audio a POST /audio/moderate y la tarea lo transcribe internamente, luego evalúa el contenido hablado en categorías como acoso, amenazas, discurso de odio y otro material inseguro, devolviendo un resultado marcado con suficiente contexto para actuar, no solo un aprobado o rechazado, sino qué se encontró y aproximadamente dónde. Como corre de forma asíncrona, el resultado llega a su webhook cuando está listo, o espera en un enlace firmado durante 24 horas.
El giro de la moderación de contenido, del texto a la voz
La moderación automatizada empezó casi por completo como un problema de texto: filtrar palabras clave y luego usar modelos para juzgar contexto e intención en comentarios escritos. La moderación de voz y audio es una extensión más reciente de esa misma disciplina, que exige un paso de transcripción antes de que pueda hacerse cualquier evaluación, y por eso esta tarea combina conversión de voz a texto con evaluación de contenido en vez de tratarlas como dos trabajos separados que tendría que conectar usted mismo.
Dónde importa esto en la práctica
Las plataformas que aceptan audio generado por usuarios —mensajes de voz, podcasts comunitarios, llamadas grabadas subidas para soporte— necesitan una forma de detectar infracciones antes de que el contenido salga al público o antes de que una grabación se conserve a largo plazo. Las apps de comunidad y gaming con canales de voz dependen de la misma necesidad de fondo: saber cuándo el contenido hablado cruza una línea, a un volumen que ningún equipo humano de moderación podría cubrir escuchando manualmente.
Dónde encaja en un flujo de confianza y seguridad
Este endpoint funciona como una compuerta antes de la publicación o el almacenamiento: entra el audio, se revisa, y sigue su curso automáticamente o se enruta a un revisor humano en los casos marcados. Se complementa con la API de audio a texto cuando también necesita una transcripción guardada para revisión, y funciona junto a la API Extraer Keywords de Audio cuando quiere marcas de cumplimiento y visibilidad de temas a partir del mismo archivo.
Qué puede hacer con ella
Plataformas de mensajería de voz
Revise los mensajes de voz antes de entregarlos para detectar acoso o amenazas que un filtro de texto nunca vería.
Canales de voz de comunidad y gaming
Revise clips de voz grabados o reportes de clip contra la política de moderación sin que una persona escuche cada envío.
Archivos de llamadas de soporte
Marque llamadas de clientes grabadas que contienen lenguaje abusivo o amenazante, enrutándolas a revisión en lugar de archivarlas sin revisar.
Plataformas de podcast con contenido de usuarios
Revise episodios subidos en busca de infracciones de política antes de que salgan a un directorio público, protegiendo a los demás creadores y oyentes de la plataforma.
Preguntas frecuentes
¿Qué detecta realmente la API para moderar audio?
Transcribe el audio internamente y evalúa el contenido hablado en categorías como acoso, amenazas y discurso de odio, devolviendo marcas con suficiente contexto para revisar, no solo una señal de aprobado o rechazado.
¿Modera el tono de voz o solo las palabras?
La evaluación se basa en el contenido transcrito y en lo que se dijo, así que está diseñada para detectar infracciones expresadas con palabras y no solo por el tono vocal.
¿Hay alguna forma gratuita de probarla?
No hay capa gratuita: las capas gratis se abusan y ralentizan a todos. El acceso funciona con un saldo prepago de ForHosting KIT: se recarga desde $10.00 (no caduca) y cada solicitud se cobra a su precio publicado, así que una llamada sin saldo devuelve HTTP 402. Sin suscripción, sin tokens ni créditos inventados, y una tarea fallida no se cobra.
¿Cómo se cobra la API para moderar audio?
Una tarifa base por solicitud más una tarifa por minuto de audio, ambas publicadas en esta página, sin ningún cobro para una tarea que falla tras sus reintentos automáticos.
¿Funciona con transmisiones de audio en vivo?
Procesa grabaciones enviadas de forma asíncrona en vez de un flujo continuo en vivo, así que encaja mejor en clips, archivos subidos o llamadas ya grabadas que en monitoreo en tiempo real.
¿Qué idiomas cubre la moderación?
Funciona con el mismo rango de idiomas hablados que admite la transcripción subyacente, así que el audio en español o en otros idiomas se puede revisar igual que el contenido en inglés.
¿Qué tan rápido recibo los resultados marcados?
Los resultados llegan por webhook firmado en cuanto termina la tarea, o se pueden recoger de un enlace firmado válido durante 24 horas, según lo que mejor encaje con su flujo de revisión.
¿Se conserva el audio marcado como evidencia?
No, el audio se elimina tras el período de retención estándar y nunca se usa para entrenar modelos; si necesita conservar grabaciones marcadas por cumplimiento normativo, guárdelas usted antes de que ese período termine.
Para desarrolladores — acceso por API
Todo lo de esta página está disponible por programación. Esta sección es para equipos que quieren integrarlo en sus sistemas; el resto puede usar la herramienta de arriba sin más.
Endpoint de API
¿Prefiere automatizarlo? Un POST autenticado crea la tarea; el resultado llega por webhook o enlace firmado. La misma capacidad también se ejecuta aquí en la web, y pronto desde nuestra app, el email y Telegram.
Llámela desde su stack
curl -X POST https://api.kit.forhosting.com/audio/moderate \
-H "Authorization: Bearer $KIT_KEY" \
-H "Content-Type: application/json" \
-d '{"audio":"https://ejemplo.com/audio.mp3"}'const res = await fetch("https://api.kit.forhosting.com/audio/moderate", {
method: "POST",
headers: {
"Authorization": `Bearer ${process.env.KIT_KEY}`,
"Content-Type": "application/json"
},
body: JSON.stringify({
"audio": "https://ejemplo.com/audio.mp3"
})
});
const { task_id } = await res.json();import os, requests
res = requests.post(
"https://api.kit.forhosting.com/audio/moderate",
headers={"Authorization": f"Bearer {os.environ['KIT_KEY']}"},
json={
"audio": "https://ejemplo.com/audio.mp3"
},
)
task_id = res.json()["task_id"]<?php
$res = file_get_contents("https://api.kit.forhosting.com/audio/moderate", false, stream_context_create([
"http" => [
"method" => "POST",
"header" => "Authorization: Bearer " . getenv("KIT_KEY") . "\r\nContent-Type: application/json",
"content" => '{"audio":"https://ejemplo.com/audio.mp3"}',
],
]));
$task = json_decode($res, true);body := bytes.NewBufferString(`{"audio":"https://ejemplo.com/audio.mp3"}`)
req, _ := http.NewRequest("POST", "https://api.kit.forhosting.com/audio/moderate", body)
req.Header.Set("Authorization", "Bearer "+os.Getenv("KIT_KEY"))
req.Header.Set("Content-Type", "application/json")
res, _ := http.DefaultClient.Do(req)Ejemplo de solicitud
{
"audio": "https://ejemplo.com/audio.mp3"
}Ejemplo de respuesta
{
"task_id": "tsk_a1b2c3d4e5f6a1b2c3d4e5f6",
"type": "audio.moderate",
"status": "queued",
"_links": {
"result": "/tasks/tsk_…/result"
}
}La API es asíncrona: la llamada devuelve un task_id al instante y el resultado llega por webhook. El polling está limitado a 1 req/s por tarea.
Precio
Precio publicado — sin tokens ni créditos inventados. Una tarea fallida no se cobra.
Límites
max_mb | 200 |
max_minutes | 180 |
Errores
| HTTP | Código | Significado |
|---|---|---|
401 | unauthorized | API key ausente o inválida. |
402 | insufficient_balance | El saldo no cubre el precio de la tarea. |
404 | unknown_type | El tipo de tarea no existe. |
429 | rate_limited | Demasiadas peticiones. Use el webhook en vez de sondear. |
422 | task_failed | La tarea falló tras 3 reintentos. No se cobra. |