ForHosting KIT · Audio & Sprache

Wer spricht wann?

KIT trennt in einer Aufnahme mit mehreren Personen automatisch, wer wann spricht, und ordnet jeden Satz einem Sprecher wie „Sprecher 1“ oder „Sprecher 2“ zu. Gedacht für Interviews, Meetings und Podcasts mit mehreren Stimmen, bei denen ein einfaches Transkript nicht zeigt, wer was gesagt hat.

● Betapro Anfrage + pro Minute$0.002
Nutzen Sie es über WebAPIE-MailApp baldTelegram bald

Führen Sie dies mit Ihrem Konto auf unseren Servern aus. Kostenlose Tools laufen in Ihrem Browser; dieses wird zum oben genannten Preis von Ihrem KIT-Guthaben abgebucht.

Was Sprechererkennung leistet – und was nicht

Die Funktion erkennt anhand der Stimme, wann ein neuer Sprecher beginnt, und beschriftet die Abschnitte entsprechend; sie erkennt jedoch keine Namen, sondern nur „Sprecher 1“, „Sprecher 2“ und so weiter. Wer wirkliche Namen im Ergebnis braucht, ordnet sie nach der Verarbeitung manuell zu, etwa anhand der Reihenfolge der Wortmeldungen.

Aktueller Stand: Beta

Diese Funktion läuft im Beta-Status: Bei klar getrennten Stimmen und wenig Hintergrundgeräusch ist die Zuordnung zuverlässig, bei sich überlappenden Wortbeiträgen oder sehr ähnlichen Stimmen kann es zu Fehlzuordnungen kommen. KIT weist das Ergebnis entsprechend aus, statt eine Genauigkeit zu versprechen, die im Einzelfall nicht zutrifft.

So starten Sie

Laden Sie die Aufnahme auf dieser Seite hoch oder rufen Sie die Funktion per API auf; das Ergebnis kombiniert Text und Sprecherkennzeichnung in einer strukturierten Antwort. Für zusätzliche Zeitangaben pro Satz lässt sich das Ergebnis mit der Transkription mit Zeitstempeln kombinieren.

Typischer Einsatz

Redaktionen trennen in einem Streitgespräch, wer welche Position vertreten hat; Personalabteilungen dokumentieren, wer in einem Vorstellungsgespräch welche Frage gestellt hat; Podcast-Produzenten bereiten ein Transkript mit klar erkennbaren Sprecherwechseln für Shownotes oder Blogartikel vor.

Streitgespräch für die Redaktion

Eine Wirtschaftsredaktion lässt ein Streitgespräch zwischen zwei Gästen transkribieren und automatisch nach Sprecher trennen, um beide Positionen sauber gegenüberzustellen.

Vorstellungsgespräch dokumentieren

Eine Personalabteilung in Hamburg nimmt Vorstellungsgespräche auf und lässt Fragen der Interviewer und Antworten der Bewerber automatisch trennen, um das Protokoll später schneller auszuwerten.

Podcast mit mehreren Gästen

Ein Podcast-Team bereitet eine Folge mit drei Gästen für Shownotes vor und nutzt die Sprechertrennung, um Zitate eindeutig der richtigen Person zuzuordnen.

Erkennt die Funktion, wie viele Personen sprechen?

Ja, sie erkennt die Anzahl unterschiedlicher Stimmen in der Aufnahme automatisch und beschriftet sie fortlaufend als Sprecher 1, Sprecher 2 und so weiter.

Nennt das Ergebnis auch die Namen der Sprecher?

Nein, die Funktion erkennt nur unterschiedliche Stimmen, keine Namen. Eine Namenszuordnung nehmen Sie nach der Verarbeitung selbst vor.

Was bedeutet der Beta-Status genau?

Die Sprecherzuordnung ist noch in Verfeinerung; bei klaren, getrennten Stimmen funktioniert sie zuverlässig, bei Überlappungen oder sehr ähnlichen Stimmen kann sie Fehler machen.

Was kostet die Sprechererkennung pro Minute?

$0.002 pro Anfrage plus $0.0055 pro Minute, unabhängig von der Anzahl der Sprecher in der Aufnahme.

Brauche ich für mehrere Sprecher ein separates Mikrofon pro Person?

Nein, eine einzelne Aufnahme reicht aus; die Trennung erfolgt anhand der Stimmmerkmale im Audiosignal, nicht anhand der Tonspur.

Was passiert mit der Aufnahme nach der Verarbeitung?

Sie wird ausschließlich zur Erstellung dieses Ergebnisses verwendet und nicht gespeichert oder an Dritte weitergegeben.

Alles auf dieser Seite ist auch per API verfügbar. Dieser Abschnitt richtet sich an Teams, die es in ihre eigenen Systeme einbinden möchten; alle anderen nutzen einfach das Tool oben.

POSThttps://api.kit.forhosting.com/audio/diarize

Authentifizierung per Bearer-Token. Ein einziger POST stellt die Aufgabe in die Warteschlange; das Ergebnis erhalten Sie per Webhook oder über einen signierten Link.

curl -X POST https://api.kit.forhosting.com/audio/diarize \
  -H "Authorization: Bearer $KIT_KEY" \
  -H "Content-Type: application/json" \
  -d '{"audio":"https://ejemplo.com/audio.mp3"}'
{
  "audio": "https://ejemplo.com/audio.mp3"
}
{
  "task_id": "tsk_a1b2c3d4e5f6a1b2c3d4e5f6",
  "type": "audio.diarize",
  "status": "queued",
  "_links": {
    "result": "/tasks/tsk_…/result"
  }
}

Die API arbeitet asynchron: Sie erhalten sofort eine task_id. Polling ist mit 1 Anfrage pro Sekunde erlaubt.

pro Anfrage$0.002
pro Minute$0.0055

Der Preis steht auf der Seite – keine Tokens, keine Credits. Fehlgeschlagene Aufgaben werden nicht berechnet.

max_mb200
max_minutes180
HTTPCodeBedeutung
401unauthorizedDer API-Schlüssel fehlt oder ist ungültig – prüfen Sie den Authorization-Header (Bearer).
402insufficient_balanceIhr Guthaben reicht für diese Aufgabe nicht aus – Aufladungen verfallen nicht.
404unknown_typeUnbekannter Aufgabentyp – prüfen Sie das Feld „type“ gegen den Katalog.
429rate_limitedZu viele Anfragen – warten Sie kurz; Polling ist mit 1 Anfrage pro Sekunde erlaubt.
422task_failedDie Aufgabe ist fehlgeschlagen und wird nicht berechnet.

Vollständige KIT-Dokumentation lesen →