Sprachausgabe mit SSML steuern
KIT wandelt Text mit SSML-Markup in gesprochenes Audio um und beachtet dabei gezielt gesetzte Pausen, Betonungen und Ausspracheanweisungen. Gedacht für alle, denen die Standardstimme zu wenig Kontrolle bietet – etwa bei Zahlen, Fachbegriffen oder Ansagen, bei denen Tonfall und Timing genau stimmen müssen.
Online ausführen
Führen Sie dies mit Ihrem Konto auf unseren Servern aus. Kostenlose Tools laufen in Ihrem Browser; dieses wird zum oben genannten Preis von Ihrem KIT-Guthaben abgebucht.
Was SSML gegenüber reinem Text zusätzlich kann
SSML ist eine Auszeichnungssprache, mit der Sie einzelne Wörter betonen, Pausen an bestimmten Stellen einfügen oder die Aussprache eines Begriffs – etwa einer Abkürzung oder eines Fremdworts – gezielt vorgeben. Statt sich auf die automatische Betonung der Standardstimme zu verlassen, bestimmen Sie selbst, wie ein Satz klingt. Das eignet sich besonders für Ansagen, bei denen Timing und Tonfall genau passen müssen.
Aktueller Stand: Beta
Diese Funktion läuft im Beta-Status: Grundlegende SSML-Elemente wie Pausen und Betonung werden zuverlässig umgesetzt, bei komplexeren oder seltener genutzten Tags kann das Ergebnis vom Standard abweichen. Auch die Aussprache einzelner Fremdwörter über ein phonetisches Tag ist noch nicht bei jedem Begriff hundertprozentig zuverlässig. KIT weist das offen aus, statt eine vollständige SSML-Unterstützung zu versprechen, die noch nicht in jedem Detail erreicht ist.
Wer SSML gegenüber der Standardstimme braucht
Callcenter, die eine Telefonansage mit exakt platzierten Pausen benötigen; Unternehmen, die Fachbegriffe oder Produktnamen korrekt ausgesprochen haben wollen; Redaktionen, die eine Nachrichtenmeldung mit passender Betonung vertonen. Auch Lernmaterial, in dem einzelne Begriffe bewusst langsamer oder betonter vorgelesen werden sollen, profitiert von dieser Kontrolle. Für einfachen Fließtext ohne besondere Anforderungen an Tonfall reicht dagegen die Standardstimme der einfachen Sprachumwandlung meist aus.
Preis gegenüber der Standardstimme
Berechnet werden $0.002 pro Anfrage plus $0.0025 pro 1.000 Zeichen SSML-Markup – günstiger als die Standardstimme, da SSML-Anfragen im Beta-Betrieb reduziert bepreist sind. Ein 1.500 Zeichen langes Ansageskript kostet damit rund $0.006, ein umfangreicheres Skript mit 5.000 Zeichen rund $0.0145. Die Zählung erfolgt inklusive der SSML-Tags selbst, nicht nur des gesprochenen Textes, was bei knapp bemessenen Kalkulationen berücksichtigt werden sollte.
Anwendungsfälle
Telefonansage mit exakten Pausen
Eine Versicherung lässt die Warteschleifenansage mit SSML vertonen, damit zwischen Satzteilen genau die Pause entsteht, die für ein ruhiges Zuhören sorgt – statt sich auf die automatische Betonung zu verlassen.
Produktnamen korrekt aussprechen lassen
Ein Hersteller mit englischen Produktnamen legt per SSML fest, wie diese Begriffe ausgesprochen werden sollen, damit die Vertonung von Schulungsvideos nicht bei jedem Namen falsch betont.
Nachrichtenmeldung mit passender Betonung
Eine Lokalredaktion vertont eine kurze Nachrichtenmeldung und setzt gezielt Betonungen auf die wichtigsten Zahlen, damit die Kernaussage beim Hören sofort auffällt.
Häufige Fragen
Was ist SSML genau?
Eine standardisierte Auszeichnungssprache für Sprachausgabe, mit der sich Pausen, Betonung und Aussprache einzelner Wörter direkt im Text festlegen lassen, statt sie der automatischen Stimme zu überlassen.
Welche SSML-Elemente werden unterstützt?
Grundlegende Elemente wie Pausen und Betonung funktionieren zuverlässig; bei selteneren Tags kann das Ergebnis im aktuellen Beta-Status abweichen.
Was kostet die Sprachausgabe mit SSML?
$0.002 pro Anfrage plus $0.0025 pro 1.000 Zeichen Markup, günstiger als die Standardstimme der einfachen Sprachumwandlung.
Brauche ich Programmierkenntnisse, um SSML zu nutzen?
Grundkenntnisse der Syntax reichen aus; die gängigen Tags für Pausen und Betonung sind einfach aufgebaut und lassen sich ohne Entwicklerhintergrund erlernen.
Was passiert mit meinem Text nach der Verarbeitung?
Er wird ausschließlich zur Erstellung der Audiodatei verwendet und nicht veröffentlicht oder an Dritte weitergegeben.
Wann sollte ich stattdessen die einfache Sprachumwandlung nutzen?
Für gewöhnlichen Fließtext ohne besondere Anforderungen an Pausen oder Betonung reicht die Standardstimme meist aus und ist ohne Markup schneller einzurichten.
Für Entwickler — API-Zugang
Alles auf dieser Seite ist auch per API verfügbar. Dieser Abschnitt richtet sich an Teams, die es in ihre eigenen Systeme einbinden möchten; alle anderen nutzen einfach das Tool oben.
Endpunkt
Authentifizierung per Bearer-Token. Ein einziger POST stellt die Aufgabe in die Warteschlange; das Ergebnis erhalten Sie per Webhook oder über einen signierten Link.
Aufruf aus Ihrem Stack
curl -X POST https://api.kit.forhosting.com/voice/tts-ssml \
-H "Authorization: Bearer $KIT_KEY" \
-H "Content-Type: application/json" \
-d '{"text":"…"}'const res = await fetch("https://api.kit.forhosting.com/voice/tts-ssml", {
method: "POST",
headers: {
"Authorization": `Bearer ${process.env.KIT_KEY}`,
"Content-Type": "application/json"
},
body: JSON.stringify({
"text": "…"
})
});
const { task_id } = await res.json();import os, requests
res = requests.post(
"https://api.kit.forhosting.com/voice/tts-ssml",
headers={"Authorization": f"Bearer {os.environ['KIT_KEY']}"},
json={
"text": "…"
},
)
task_id = res.json()["task_id"]<?php
$res = file_get_contents("https://api.kit.forhosting.com/voice/tts-ssml", false, stream_context_create([
"http" => [
"method" => "POST",
"header" => "Authorization: Bearer " . getenv("KIT_KEY") . "\r\nContent-Type: application/json",
"content" => '{"text":"…"}',
],
]));
$task = json_decode($res, true);body := bytes.NewBufferString(`{"text":"…"}`)
req, _ := http.NewRequest("POST", "https://api.kit.forhosting.com/voice/tts-ssml", body)
req.Header.Set("Authorization", "Bearer "+os.Getenv("KIT_KEY"))
req.Header.Set("Content-Type", "application/json")
res, _ := http.DefaultClient.Do(req)Beispiel-Anfrage
{
"text": "…"
}Beispiel-Antwort
{
"task_id": "tsk_a1b2c3d4e5f6a1b2c3d4e5f6",
"type": "voice.tts_ssml",
"status": "queued",
"_links": {
"result": "/tasks/tsk_…/result"
}
}Die API arbeitet asynchron: Sie erhalten sofort eine task_id. Polling ist mit 1 Anfrage pro Sekunde erlaubt.
Preis
Der Preis steht auf der Seite – keine Tokens, keine Credits. Fehlgeschlagene Aufgaben werden nicht berechnet.
Limits
max_mb | 200 |
max_minutes | 180 |
Fehler
| HTTP | Code | Bedeutung |
|---|---|---|
401 | unauthorized | Der API-Schlüssel fehlt oder ist ungültig – prüfen Sie den Authorization-Header (Bearer). |
402 | insufficient_balance | Ihr Guthaben reicht für diese Aufgabe nicht aus – Aufladungen verfallen nicht. |
404 | unknown_type | Unbekannter Aufgabentyp – prüfen Sie das Feld „type“ gegen den Katalog. |
429 | rate_limited | Zu viele Anfragen – warten Sie kurz; Polling ist mit 1 Anfrage pro Sekunde erlaubt. |