Narração com SSML
A síntese de voz com SSML aceita marcação dentro do texto para controlar como a narração sai: onde pausar, o que enfatizar, em que ritmo falar. É a versão para desenvolvedores e produtores que precisam de resultado previsível — URA, e-learning, audiolivro — em vez de aceitar a leitura padrão.
Rode online
Rode nos nossos servidores com a sua conta. As ferramentas grátis rodam no seu navegador; esta aqui é descontada do seu saldo do KIT pelo preço acima.
O que o SSML permite marcar
SSML é um padrão aberto de marcação para fala sintetizada: em vez de mandar texto puro e torcer pela leitura certa, você anota o próprio texto com instruções — uma pausa depois desta frase, ênfase nesta palavra, ritmo mais lento neste trecho, este número lido dígito a dígito. A diferença aparece nos detalhes que o texto puro não carrega: “2026” pode ser um ano ou quatro dígitos de protocolo, e só quem escreveu sabe qual leitura é a correta.
Quando usar SSML em vez do texto-para-voz simples
Se você está narrando um artigo ou um aviso comum, a síntese simples resolve — a leitura padrão é boa o suficiente. O SSML entra quando a forma importa tanto quanto o conteúdo: menus de atendimento telefônico em que a pausa errada confunde quem digita, material didático em que o termo novo precisa soar destacado, leitura de valores, códigos e documentos em que cada dígito conta. Regra prática: se você já pegou o telefone para reclamar de uma URA apressada, sabe exatamente o problema que essa marcação evita.
Preço: marcação fina, conta miúda
A cobrança é US$ 0,002 por chamada mais US$ 0,0025 por bloco de mil caracteres enviados. O roteiro completo de uma URA com 2.000 caracteres sai por US$ 0,007 — menos de um centavo de dólar para gerar a voz que milhares de clientes vão ouvir. Sem assinatura e sem cadastro: cada chamada é paga por uso, com o preço publicado em dólar americano nesta página.
Beta, integração e limites
Esta capacidade está em beta: já executa, mas o comportamento fino da marcação ainda recebe ajustes — vale gerar amostras curtas antes de produzir em série. A chamada é assíncrona, como todas as tarefas da plataforma: envia o texto marcado, recebe o áudio pronto depois. Os limites publicados são 200 MB e 180 minutos por tarefa. Encontrou uma marcação que não se comporta como esperava? Conte para a gente por e-mail ou WhatsApp: esse retorno é o que tira uma ferramenta do beta.
Casos de uso
URA que não atropela quem digita
A equipe de uma operadora regional monta o menu de atendimento com pausa marcada depois de cada opção: “para segunda via… digite dois”. O cliente tem tempo de reagir e a taxa de erro de digitação no menu cai.
E-learning com ênfase nos termos novos
Um curso técnico marca ênfase em cada conceito que aparece pela primeira vez e reduz o ritmo nas fórmulas. O aluno percebe pelo próprio som da narração o que precisa anotar.
Números lidos como devem ser lidos
Um sistema de cobrança gera avisos com CPF e número de protocolo lidos dígito a dígito, no ritmo certo para anotar — em vez de “cento e vinte e três milhões” quando o cliente esperava um documento.
Institucional com respiração natural
O vídeo institucional da Distribuidora Horizonte Verde usa pausas marcadas entre blocos do roteiro. O resultado soa como locutor que respira, não como leitura corrida de parágrafo único.
Perguntas frequentes
Qual a diferença para o texto-para-voz sem SSML?
Na síntese simples, o motor decide sozinho pausas, ritmo e entonação. Com SSML, quem decide é você, marcando o próprio texto. Para conteúdo comum a leitura automática basta; para URA, ensino e leitura de números, o controle manual muda o resultado.
Preciso aprender SSML do zero?
O básico se aprende em uma tarde: SSML é um padrão aberto, com documentação farta, e meia dúzia de elementos — pausa, ênfase, ritmo, forma de ler números — resolve a grande maioria dos casos reais.
A marcação entra na contagem de caracteres?
A unidade de cobrança é o bloco de mil caracteres do conteúdo que você envia na chamada — o texto marcado tal como chega. Como as tags são curtas e o preço é US$ 0,0025 por bloco, o efeito da marcação no custo é de frações de centavo.
Beta quer dizer que pode quebrar?
Quer dizer que já funciona, mas ainda está em ajuste fino — algum detalhe de interpretação da marcação pode mudar entre versões. Para produção sensível, valide com amostras curtas antes de gerar o lote inteiro.
O roteiro que eu mando fica em algum servidor?
O texto marcado é processado no servidor — é lá que a voz é gerada — e não é publicado em lugar algum. Roteiro estratégico ou confidencial? Escreva para o atendimento antes e pergunte o que quiser sobre o tratamento dos dados.
Quanto custa gerar a locução de um atendimento completo?
Um roteiro de URA de 2.000 caracteres custa US$ 0,002 de chamada mais US$ 0,005 pelos caracteres: US$ 0,007. Regravar depois de um ajuste custa a mesma fração de centavo — é aí que a síntese ganha do estúdio.
Para desenvolvedores — acesso via API
Tudo nesta página está disponível via API. Esta seção é para equipes que querem integrar a ferramenta aos próprios sistemas; quem não precisa disso pode simplesmente usar a ferramenta acima.
Endpoint
Autenticação por token Bearer. Um único POST coloca a tarefa na fila; o resultado chega por webhook ou link assinado.
Chame do seu código
curl -X POST https://api.kit.forhosting.com/voice/tts-ssml \
-H "Authorization: Bearer $KIT_KEY" \
-H "Content-Type: application/json" \
-d '{"text":"…"}'const res = await fetch("https://api.kit.forhosting.com/voice/tts-ssml", {
method: "POST",
headers: {
"Authorization": `Bearer ${process.env.KIT_KEY}`,
"Content-Type": "application/json"
},
body: JSON.stringify({
"text": "…"
})
});
const { task_id } = await res.json();import os, requests
res = requests.post(
"https://api.kit.forhosting.com/voice/tts-ssml",
headers={"Authorization": f"Bearer {os.environ['KIT_KEY']}"},
json={
"text": "…"
},
)
task_id = res.json()["task_id"]<?php
$res = file_get_contents("https://api.kit.forhosting.com/voice/tts-ssml", false, stream_context_create([
"http" => [
"method" => "POST",
"header" => "Authorization: Bearer " . getenv("KIT_KEY") . "\r\nContent-Type: application/json",
"content" => '{"text":"…"}',
],
]));
$task = json_decode($res, true);body := bytes.NewBufferString(`{"text":"…"}`)
req, _ := http.NewRequest("POST", "https://api.kit.forhosting.com/voice/tts-ssml", body)
req.Header.Set("Authorization", "Bearer "+os.Getenv("KIT_KEY"))
req.Header.Set("Content-Type", "application/json")
res, _ := http.DefaultClient.Do(req)Exemplo de requisição
{
"text": "…"
}Exemplo de resposta
{
"task_id": "tsk_a1b2c3d4e5f6a1b2c3d4e5f6",
"type": "voice.tts_ssml",
"status": "queued",
"_links": {
"result": "/tasks/tsk_…/result"
}
}A API é assíncrona: cada chamada devolve um task_id na hora. Se preferir polling, consulte o status a até 1 requisição por segundo.
Preço
Preço publicado, sem tokens nem créditos escondidos. Tarefa que falha não é cobrada.
Limites
max_mb | 200 |
max_minutes | 180 |
Erros
| HTTP | Código | O que significa |
|---|---|---|
401 | unauthorized | Token ausente ou inválido. Confira o header Authorization. |
402 | insufficient_balance | Saldo insuficiente para esta tarefa. Faça uma recarga e tente de novo. |
404 | unknown_type | Esse tipo de tarefa não existe. Confira o campo type no catálogo. |
429 | rate_limited | Muitas requisições em pouco tempo. Espere um instante e tente de novo. |