ForHosting KIT · Audio & Sprache

Text in Sprache umwandeln

KIT wandelt geschriebenen Text in gesprochenes Audio um und liefert eine natürlich klingende Stimme als Audiodatei zurück. Gedacht für Voiceover, Vorleseansagen, barrierefreie Inhalte oder Sprachnachrichten, bei denen niemand selbst vor ein Mikrofon treten soll oder kann; Text hinein, fertige Sprachaufnahme heraus.

● Stabilpro Anfrage + pro 1.000 Zeichen$0.005
Nutzen Sie es über WebAPIE-MailApp baldTelegram bald

Führen Sie dies mit Ihrem Konto auf unseren Servern aus. Kostenlose Tools laufen in Ihrem Browser; dieses wird zum oben genannten Preis von Ihrem KIT-Guthaben abgebucht.

So entsteht aus Text eine Sprachaufnahme

Sie geben den Text auf dieser Seite ein oder senden ihn per API; KIT liest ihn mit einer natürlich klingenden Stimme vor und liefert das Ergebnis als Audiodatei zum Herunterladen zurück. Abgerechnet wird nach der Zeichenzahl des eingegebenen Textes, nicht nach der Länge der fertigen Audiodatei. Eine Anmeldung ist dafür nicht nötig, Sie zahlen ausschließlich pro Anfrage und pro verarbeitete Zeichenmenge, ohne Abonnement und ohne dass ein Guthaben vorab aufgeladen werden muss.

Wofür sich synthetische Sprache eignet

Unternehmen vertonen Produktvideos oder interne Schulungen, ohne einen Sprecher zu buchen; Redaktionen bieten Artikel zusätzlich zum Vorlesen an, für Leserinnen und Leser mit Sehbeeinträchtigung oder für unterwegs; Telefonanlagen und Ansagesysteme entstehen aus reinem Text statt aus einer Studioaufnahme. Überall dort, wo Text regelmäßig vertont werden muss, ersetzt die Funktion ein aufwendiges Sprecherbuchen durch einen einzelnen Aufruf, der sich zudem beliebig oft mit neuem Text wiederholen lässt, ohne erneut ein Studio zu beauftragen.

Grenzen der synthetischen Stimme

Die Stimme klingt bei normaler Satzstruktur natürlich, bei sehr langen Schachtelsätzen, ungewöhnlicher Betonung oder Fachbegriffen mit unklarer Aussprache kann das Ergebnis unnatürlich wirken. Auch Zahlen, Abkürzungen oder fremdsprachige Namen werden nicht immer wie gewünscht ausgesprochen, insbesondere wenn mehrere Lesarten möglich wären. Für feinere Kontrolle über Pausen, Betonung und Aussprache einzelner Wörter eignet sich die Sprachausgabe mit SSML besser als die Standardstimme dieser Funktion, gerade bei Ansagen mit hohen Anforderungen an den Tonfall.

Preis und was Sie erhalten

Berechnet werden $0.005 pro Anfrage plus $0.008 pro 1.000 Zeichen des eingegebenen Textes; ein kurzer Absatz von 500 Zeichen kostet damit rund $0.009, ein längerer Artikel mit 5.000 Zeichen rund $0.045. Sie erhalten die fertige Audiodatei zum direkten Download, ohne Abonnement und ohne Mindestabnahme, sowohl über diese Seite als auch über die API, sodass sich der Preis pro Vertonung vorab genau berechnen lässt.

Produktvideo vertonen ohne Sprecherbuchung

Schneider IT-Systeme GmbH & Co. KG lässt das Skript eines Erklärvideos automatisch vorlesen, statt einen Sprecher zu buchen – die fertige Tonspur liegt innerhalb von Minuten als Audiodatei vor.

Artikel zum Anhören anbieten

Eine Regionalzeitung wandelt ihre Online-Artikel zusätzlich zum Lesetext in eine gesprochene Version um, damit Leserinnen und Leser sie auch unterwegs im Auto hören können.

Ansagetext für die Telefonanlage

Eine Bäckerei-Kette lässt den Text für die Warteschleifenansage vertonen, statt dafür ein Tonstudio zu beauftragen, und tauscht die Ansage bei Bedarf einfach gegen eine neue Textversion aus.

Wie natürlich klingt die synthetische Stimme?

Bei normalem Fließtext deutlich näher an einer menschlichen Stimme als ältere Sprachausgaben, aber weiterhin erkennbar synthetisch; bei sehr langen Schachtelsätzen kann die Betonung unnatürlich wirken.

In welchem Format erhalte ich das Ergebnis?

Als Audiodatei zum direkten Download, die sich in Videos, auf Webseiten oder in einer Telefonanlage einsetzen lässt.

Was kostet die Vertonung eines Textes?

$0.005 pro Anfrage plus $0.008 pro 1.000 Zeichen des Textes; ein 2.000 Zeichen langer Absatz kostet damit rund $0.021.

Kann ich Pausen oder Betonung selbst festlegen?

Für diese Grundfunktion nicht direkt; für feine Kontrolle über Pausen, Betonung und Aussprache steht die Sprachausgabe mit SSML zur Verfügung.

Was passiert mit meinem Text nach der Vertonung?

Er wird ausschließlich zur Erstellung der Audiodatei verwendet und nicht veröffentlicht oder an Dritte weitergegeben.

Brauche ich ein Konto?

Nein. Es gibt derzeit keine Konten – Sie zahlen pro Nutzung, direkt über PayPal oder per Rechnung nach Absprache.

Alles auf dieser Seite ist auch per API verfügbar. Dieser Abschnitt richtet sich an Teams, die es in ihre eigenen Systeme einbinden möchten; alle anderen nutzen einfach das Tool oben.

POSThttps://api.kit.forhosting.com/voice/tts

Authentifizierung per Bearer-Token. Ein einziger POST stellt die Aufgabe in die Warteschlange; das Ergebnis erhalten Sie per Webhook oder über einen signierten Link.

curl -X POST https://api.kit.forhosting.com/voice/tts \
  -H "Authorization: Bearer $KIT_KEY" \
  -H "Content-Type: application/json" \
  -d '{"text":"Hola, este es un mensaje de prueba."}'
{
  "text": "Hola, este es un mensaje de prueba."
}
{
  "task_id": "tsk_a1b2c3d4e5f6a1b2c3d4e5f6",
  "type": "voice.tts",
  "status": "queued",
  "_links": {
    "result": "/tasks/tsk_…/result"
  }
}

Die API arbeitet asynchron: Sie erhalten sofort eine task_id. Polling ist mit 1 Anfrage pro Sekunde erlaubt.

pro Anfrage$0.005
pro 1.000 Zeichen$0.008

Der Preis steht auf der Seite – keine Tokens, keine Credits. Fehlgeschlagene Aufgaben werden nicht berechnet.

max_mb200
max_minutes180
HTTPCodeBedeutung
401unauthorizedDer API-Schlüssel fehlt oder ist ungültig – prüfen Sie den Authorization-Header (Bearer).
402insufficient_balanceIhr Guthaben reicht für diese Aufgabe nicht aus – Aufladungen verfallen nicht.
404unknown_typeUnbekannter Aufgabentyp – prüfen Sie das Feld „type“ gegen den Katalog.
429rate_limitedZu viele Anfragen – warten Sie kurz; Polling ist mit 1 Anfrage pro Sekunde erlaubt.

Vollständige KIT-Dokumentation lesen →