Namen, Orte und Firmen aus Text extrahieren
Die Extraktion liest einen Text und listet alle erkannten Entitäten strukturiert auf: Personennamen, Firmennamen, Orte, Daten und weitere Kategorien, jeweils mit der Textstelle, an der sie vorkommen. Nützlich, um aus einem langen Dokument schnell die wichtigsten Bezugspunkte herauszuziehen, ohne jede Zeile selbst zu durchsuchen.
Online ausführen
Führen Sie dies mit Ihrem Konto auf unseren Servern aus. Kostenlose Tools laufen in Ihrem Browser; dieses wird zum oben genannten Preis von Ihrem KIT-Guthaben abgebucht.
Welche Kategorien erkannt werden
Das Werkzeug findet Personennamen, Firmennamen, Orte, Organisationen, Produktnamen und weitere gängige Kategorien im eingefügten Text und ordnet jeden Fund seiner Kategorie zu. Ein Vertrag liefert so auf einen Blick alle genannten Vertragsparteien und Orte, ein Zeitungsartikel alle erwähnten Personen und Institutionen, ohne dass jemand den Text von Hand durchsuchen muss. Die Liste lässt sich nach Kategorie filtern, wenn nur eine bestimmte Art von Entität von Interesse ist.
Vom Fließtext zur strukturierten Liste
Aus einem mehrseitigen Bericht der Weber Metallbau GmbH mit fortlaufendem Text entsteht eine strukturierte Liste: welche Firmen, welche Personen, welche Orte vorkommen, jeweils mit Häufigkeit. Diese Liste lässt sich in eine Tabelle übernehmen, als Grundlage für eine Recherche nutzen oder als erster Schritt vor einer weiteren automatisierten Verarbeitung, etwa dem Abgleich mit einer bestehenden Kundendatenbank. So wird aus einem einzelnen Bericht ein wiederverwendbarer, strukturierter Datensatz.
Wiederkehrende Erwähnungen zusammenführen
Wird eine Person im Text einmal mit vollem Namen und später nur mit Nachnamen erwähnt, ordnet das Werkzeug beide Erwähnungen derselben Entität zu, statt sie als zwei getrennte Personen aufzulisten. Das ist besonders bei längeren Dokumenten hilfreich, in denen ein Name selten durchgehend gleich geschrieben wird. Das gilt ebenso für Firmennamen, die in einem Vertrag einmal ausgeschrieben und später nur noch abgekürzt erscheinen.
Wo Sie es nutzen
Auf dieser Seite fügen Sie den Text ein und erhalten die Liste der Entitäten sofort. Über die API lässt sich die Extraktion in eine Recherchedatenbank, ein CRM oder eine Dokumentenanalyse einbinden, um aus vielen Dokumenten automatisiert strukturierte Daten zu gewinnen. Ein Rechercheteam etwa baut sich so über die Zeit eine durchsuchbare Übersicht aller in Dokumenten erwähnten Personen und Firmen auf, ohne jede Quelle erneut einzeln zu lesen.
Anwendungsfälle
Der Vertrag mit mehreren Parteien
Jonas Weber lässt einen komplexen Liefervertrag prüfen und erhält eine Liste aller genannten Firmen und Unterzeichnenden, um schnell zu sehen, wer welche Rolle im Vertrag übernimmt.
Die Recherche für einen Artikel
Eine Lokalredaktion lässt einen langen Gerichtsbericht analysieren und erhält alle erwähnten Personen, Orte und Institutionen als Liste, bevor die eigentliche Recherche für den Artikel beginnt.
Der Abgleich mit der Kundendatenbank
Die Schneider IT-Systeme GmbH & Co. KG extrahiert Firmennamen aus eingehenden Anfragen, um automatisch zu prüfen, ob der Absender bereits als Kunde in der Datenbank geführt wird.
Häufige Fragen
Werden mehrfache Erwähnungen derselben Person zusammengeführt?
Ja. Wird eine Person mehrfach unterschiedlich genannt, etwa mit vollem Namen und später nur mit Nachnamen, führt das Werkzeug beide Erwähnungen zu einer Entität zusammen.
Welche Kategorien werden unterschieden?
Unter anderem Personen, Firmen, Orte, Organisationen und Daten. Die Liste nennt zu jedem Fund die passende Kategorie.
Was passiert mit dem eingefügten Text?
Er wird ausschließlich zur Extraktion verarbeitet und danach nicht dauerhaft gespeichert.
Was kostet die Extraktion?
$0.003 pro Anfrage zuzüglich $0.0135 je 1.000 Wörter. Ein zweiseitiger Vertrag liegt damit klar unter einem US-Cent.
Gibt es ein Limit für die Textlänge?
Rund 20.000 Token pro Anfrage. Für längere Dokumente empfiehlt sich eine Aufteilung in Abschnitte.
Für Entwickler — API-Zugang
Alles auf dieser Seite ist auch per API verfügbar. Dieser Abschnitt richtet sich an Teams, die es in ihre eigenen Systeme einbinden möchten; alle anderen nutzen einfach das Tool oben.
Endpunkt
Authentifizierung per Bearer-Token. Ein einziger POST stellt die Aufgabe in die Warteschlange; das Ergebnis erhalten Sie per Webhook oder über einen signierten Link.
Aufruf aus Ihrem Stack
curl -X POST https://api.kit.forhosting.com/text/extract-entities \
-H "Authorization: Bearer $KIT_KEY" \
-H "Content-Type: application/json" \
-d '{"text":"…"}'const res = await fetch("https://api.kit.forhosting.com/text/extract-entities", {
method: "POST",
headers: {
"Authorization": `Bearer ${process.env.KIT_KEY}`,
"Content-Type": "application/json"
},
body: JSON.stringify({
"text": "…"
})
});
const { task_id } = await res.json();import os, requests
res = requests.post(
"https://api.kit.forhosting.com/text/extract-entities",
headers={"Authorization": f"Bearer {os.environ['KIT_KEY']}"},
json={
"text": "…"
},
)
task_id = res.json()["task_id"]<?php
$res = file_get_contents("https://api.kit.forhosting.com/text/extract-entities", false, stream_context_create([
"http" => [
"method" => "POST",
"header" => "Authorization: Bearer " . getenv("KIT_KEY") . "\r\nContent-Type: application/json",
"content" => '{"text":"…"}',
],
]));
$task = json_decode($res, true);body := bytes.NewBufferString(`{"text":"…"}`)
req, _ := http.NewRequest("POST", "https://api.kit.forhosting.com/text/extract-entities", body)
req.Header.Set("Authorization", "Bearer "+os.Getenv("KIT_KEY"))
req.Header.Set("Content-Type", "application/json")
res, _ := http.DefaultClient.Do(req)Beispiel-Anfrage
{
"text": "…"
}Beispiel-Antwort
{
"task_id": "tsk_a1b2c3d4e5f6a1b2c3d4e5f6",
"type": "text.extract_entities",
"status": "queued",
"_links": {
"result": "/tasks/tsk_…/result"
}
}Die API arbeitet asynchron: Sie erhalten sofort eine task_id. Polling ist mit 1 Anfrage pro Sekunde erlaubt.
Preis
Der Preis steht auf der Seite – keine Tokens, keine Credits. Fehlgeschlagene Aufgaben werden nicht berechnet.
Limits
max_tokens | 20000 |
Fehler
| HTTP | Code | Bedeutung |
|---|---|---|
401 | unauthorized | Der API-Schlüssel fehlt oder ist ungültig – prüfen Sie den Authorization-Header (Bearer). |
402 | insufficient_balance | Ihr Guthaben reicht für diese Aufgabe nicht aus – Aufladungen verfallen nicht. |
404 | unknown_type | Unbekannter Aufgabentyp – prüfen Sie das Feld „type“ gegen den Katalog. |
429 | rate_limited | Zu viele Anfragen – warten Sie kurz; Polling ist mit 1 Anfrage pro Sekunde erlaubt. |
422 | task_failed | Die Aufgabe ist fehlgeschlagen und wird nicht berechnet. |