So erkennt KIT die Sprache Ihrer Audiodatei
KIT hört eine Audiodatei an und bestimmt automatisch, welche Sprache darin gesprochen wird, ohne dass Sie diese vorher angeben müssen. Nützlich als erster Schritt vor einer Transkription oder Übersetzung, wenn Aufnahmen aus verschiedenen Quellen stammen und die Sprache nicht sicher bekannt ist.
Online ausführen
Führen Sie dies mit Ihrem Konto auf unseren Servern aus. Kostenlose Tools laufen in Ihrem Browser; dieses wird zum oben genannten Preis von Ihrem KIT-Guthaben abgebucht.
Warum ein eigener Schritt für Spracherkennung sinnvoll ist
Bei einem einzelnen Interview kennen Sie die Sprache ohnehin; bei einem Archiv aus hundert Aufnahmen unterschiedlicher Herkunft nicht. KIT prüft jede Datei automatisch und liefert die erkannte Sprache als kurzes Ergebnis zurück, sodass Sie größere Mengen an Audiodateien vor der Weiterverarbeitung korrekt sortieren können, statt jede einzeln anzuhören.
So läuft die Erkennung ab
Sie laden die Datei hoch oder rufen die Funktion per API auf; KIT analysiert einen Ausschnitt der Aufnahme und liefert die erkannte Sprache samt Kürzel zurück. Das Ergebnis lässt sich direkt als Eingabe für Transkription, Übersetzung oder Untertitel in der jeweils passenden Sprache weiterverwenden.
Grenzen der Erkennung
Bei sehr kurzen Ausschnitten, starkem Dialekt oder mehreren Sprachen innerhalb derselben Aufnahme kann die Erkennung unsicher ausfallen; für gemischtsprachige Aufnahmen empfiehlt sich eine manuelle Prüfung des Ergebnisses. Die Datei darf bis zu 200 MB groß sein und bis zu 180 Minuten lang.
Anwendungsfälle
Audio-Archiv sortieren
Eine Redaktion mit einem Archiv aus hunderten Interviewaufnahmen unklarer Herkunft lässt jede Datei automatisch nach Sprache einordnen, bevor sie transkribiert wird.
Kundenanrufe vorsortieren
Ein Unternehmen mit internationaler Kundschaft erkennt automatisch, in welcher Sprache ein aufgezeichnetes Kundengespräch geführt wurde, um es an die passende Transkriptionssprache weiterzugeben.
Podcast-Feed prüfen
Ein Medienhaus prüft eingehende Audiobeiträge aus mehreren Ländern automatisch auf ihre Sprache, bevor die passende Übersetzungs- oder Untertitelfunktion angestoßen wird.
Häufige Fragen
Muss ich die Sprache vorher angeben?
Nein, genau das ist der Zweck dieser Funktion: Sie erkennt die Sprache automatisch aus der Aufnahme.
Was passiert bei einer Aufnahme mit mehreren Sprachen?
Die Funktion liefert die dominante Sprache der Aufnahme; bei häufigem Sprachwechsel ist das Ergebnis mit Vorsicht zu lesen.
Was kostet die Spracherkennung?
$0.002 pro Anfrage plus $0.0055 pro Minute der Aufnahme.
Wie zuverlässig ist die Erkennung bei Dialekt?
Bei klar identifizierbaren Sprachen ist die Trefferquote hoch; starker Dialekt oder sehr kurze Ausschnitte können die Erkennung erschweren.
Kann ich das Ergebnis direkt für eine Übersetzung weiterverwenden?
Ja, die erkannte Sprache lässt sich als Ausgangspunkt für die Transkriptions- oder Übersetzungsfunktion nutzen.
Für Entwickler — API-Zugang
Alles auf dieser Seite ist auch per API verfügbar. Dieser Abschnitt richtet sich an Teams, die es in ihre eigenen Systeme einbinden möchten; alle anderen nutzen einfach das Tool oben.
Endpunkt
Authentifizierung per Bearer-Token. Ein einziger POST stellt die Aufgabe in die Warteschlange; das Ergebnis erhalten Sie per Webhook oder über einen signierten Link.
Aufruf aus Ihrem Stack
curl -X POST https://api.kit.forhosting.com/audio/detect-language \
-H "Authorization: Bearer $KIT_KEY" \
-H "Content-Type: application/json" \
-d '{"audio":"https://ejemplo.com/audio.mp3"}'const res = await fetch("https://api.kit.forhosting.com/audio/detect-language", {
method: "POST",
headers: {
"Authorization": `Bearer ${process.env.KIT_KEY}`,
"Content-Type": "application/json"
},
body: JSON.stringify({
"audio": "https://ejemplo.com/audio.mp3"
})
});
const { task_id } = await res.json();import os, requests
res = requests.post(
"https://api.kit.forhosting.com/audio/detect-language",
headers={"Authorization": f"Bearer {os.environ['KIT_KEY']}"},
json={
"audio": "https://ejemplo.com/audio.mp3"
},
)
task_id = res.json()["task_id"]<?php
$res = file_get_contents("https://api.kit.forhosting.com/audio/detect-language", false, stream_context_create([
"http" => [
"method" => "POST",
"header" => "Authorization: Bearer " . getenv("KIT_KEY") . "\r\nContent-Type: application/json",
"content" => '{"audio":"https://ejemplo.com/audio.mp3"}',
],
]));
$task = json_decode($res, true);body := bytes.NewBufferString(`{"audio":"https://ejemplo.com/audio.mp3"}`)
req, _ := http.NewRequest("POST", "https://api.kit.forhosting.com/audio/detect-language", body)
req.Header.Set("Authorization", "Bearer "+os.Getenv("KIT_KEY"))
req.Header.Set("Content-Type", "application/json")
res, _ := http.DefaultClient.Do(req)Beispiel-Anfrage
{
"audio": "https://ejemplo.com/audio.mp3"
}Beispiel-Antwort
{
"task_id": "tsk_a1b2c3d4e5f6a1b2c3d4e5f6",
"type": "audio.detect_language",
"status": "queued",
"_links": {
"result": "/tasks/tsk_…/result"
}
}Die API arbeitet asynchron: Sie erhalten sofort eine task_id. Polling ist mit 1 Anfrage pro Sekunde erlaubt.
Preis
Der Preis steht auf der Seite – keine Tokens, keine Credits. Fehlgeschlagene Aufgaben werden nicht berechnet.
Limits
max_mb | 200 |
max_minutes | 180 |
Fehler
| HTTP | Code | Bedeutung |
|---|---|---|
401 | unauthorized | Der API-Schlüssel fehlt oder ist ungültig – prüfen Sie den Authorization-Header (Bearer). |
402 | insufficient_balance | Ihr Guthaben reicht für diese Aufgabe nicht aus – Aufladungen verfallen nicht. |
404 | unknown_type | Unbekannter Aufgabentyp – prüfen Sie das Feld „type“ gegen den Katalog. |
429 | rate_limited | Zu viele Anfragen – warten Sie kurz; Polling ist mit 1 Anfrage pro Sekunde erlaubt. |
422 | task_failed | Die Aufgabe ist fehlgeschlagen und wird nicht berechnet. |