PDF-Dokumente durchsuchbar machen
KIT liest ein PDF-Dokument Seite für Seite, versteht auch Tabellen und Layout, und legt den Inhalt in einem durchsuchbaren Index ab. Gedacht für Kanzleien, Steuerberatungen und Unternehmen, die viele PDF-Dateien besitzen und diese inhaltlich statt nur über den Dateinamen wiederfinden wollen.
Online ausführen
Führen Sie dies mit Ihrem Konto auf unseren Servern aus. Kostenlose Tools laufen in Ihrem Browser; dieses wird zum oben genannten Preis von Ihrem KIT-Guthaben abgebucht.
Warum PDF-Dokumente mehr brauchen als reine Texterkennung
Ein PDF enthält oft Tabellen, mehrspaltiges Layout oder eingebettete Bilder, die eine einfache Texterkennung falsch oder unvollständig erfasst. KIT nutzt dafür ein Modell, das Seiten visuell versteht, statt nur Zeichen zu erkennen, und ordnet den erkannten Inhalt anschließend dem richtigen Abschnitt im Index zu. So bleibt etwa der Zusammenhang zwischen einer Tabellenüberschrift und den zugehörigen Werten erhalten, statt in einzelne, unverbundene Textfragmente zu zerfallen.
So läuft die Indexierung ab
Sie laden das PDF hoch oder senden es per API; KIT verarbeitet es Seite für Seite und erstellt daraus einen durchsuchbaren Index. Bei einem mehrseitigen Dokument dauert das je nach Umfang einige Minuten, danach steht der Inhalt für die semantische Suche oder für Fragen an das Dokument bereit. Jede Seite wird dabei einzeln erfasst, sodass sich ein Treffer später bis auf die genaue Seite zurückverfolgen lässt.
Preis pro Seite
$0.010 pro Anfrage plus $0.059 je verarbeiteter Seite. Ein zwanzigseitiger Vertrag kostet damit rund $1.19 – ein überschaubarer Betrag gegenüber der Zeit, die eine manuelle Durchsicht mehrerer solcher Dokumente kostet. Bei umfangreicheren Beständen, etwa einem Vertragsarchiv mit Hunderten Dokumenten, lohnt sich ein Vergleich mit dem Aufwand, dieselbe Information manuell zu erschließen. Bei einem einzelnen kurzen Dokument bleibt der Gesamtpreis entsprechend gering.
Für welche Dokumente sich das eignet
Besonders lohnend ist die Funktion bei Verträgen, Gutachten, Handbüchern oder Studien, die immer wieder nach bestimmten Klauseln oder Kennzahlen durchsucht werden müssen. Für ein einzelnes kurzes Dokument reicht oft schon die einfache Texterkennung; der Mehraufwand der Indexierung zahlt sich vor allem bei Beständen aus, die wiederholt und über längere Zeit durchsucht werden, statt nur einmalig gelesen zu werden. Die einmalige Indexierung zahlt sich dann bei jeder weiteren Anfrage erneut aus.
Anwendungsfälle
Vertragsarchiv einer Kanzlei
Eine Kanzlei in Hamburg indexiert Hunderte Verträge, um später in Sekunden zu finden, in welchem Dokument eine bestimmte Klausel steht.
Handbücher eines Maschinenbauers
Weber Metallbau GmbH indexiert technische Handbücher, damit Servicetechniker die passende Anleitung per Suchbegriff statt per Inhaltsverzeichnis finden.
Gutachten einer Versicherung
Eine Versicherungsagentur indexiert eingereichte Gutachten, um Fälle mit ähnlichem Schadensbild schneller wiederzufinden.
Häufige Fragen
Was kostet die Indexierung eines 20-seitigen PDFs?
$0.010 pro Anfrage plus $0.059 je Seite, bei 20 Seiten also rund $1.19.
Erkennt die Funktion auch Tabellen im PDF?
Ja, das zugrunde liegende Modell versteht Tabellen und mehrspaltiges Layout, nicht nur reinen Fließtext.
Was passiert mit meinem Dokument nach der Indexierung?
Der Inhalt wird im Index gespeichert, damit die semantische Suche und die Fragenbeantwortung darauf zugreifen können, und nicht an Dritte weitergegeben.
Funktioniert das auch mit gescannten PDFs?
Ja, solange der Scan lesbar ist; bei sehr schlechter Scanqualität sinkt die Trefferquote wie bei jeder Texterkennung.
Gibt es einen AVV für die Verarbeitung von Mandantendokumenten?
Aktuell steht kein separater Auftragsverarbeitungsvertrag zur Verfügung. Wer das für seine Kanzlei benötigt, spricht uns bitte vorab per E-Mail an.
Wie viele Seiten kann ein Dokument haben?
Der Index selbst fasst bis zu 10.000 Textabschnitte; bei sehr umfangreichen Dokumenten empfiehlt sich eine Aufteilung in mehrere Teile.
Für Entwickler — API-Zugang
Alles auf dieser Seite ist auch per API verfügbar. Dieser Abschnitt richtet sich an Teams, die es in ihre eigenen Systeme einbinden möchten; alle anderen nutzen einfach das Tool oben.
Endpunkt
Authentifizierung per Bearer-Token. Ein einziger POST stellt die Aufgabe in die Warteschlange; das Ergebnis erhalten Sie per Webhook oder über einen signierten Link.
Aufruf aus Ihrem Stack
curl -X POST https://api.kit.forhosting.com/search/index-document \
-H "Authorization: Bearer $KIT_KEY" \
-H "Content-Type: application/json" \
-d '{"input":"…"}'const res = await fetch("https://api.kit.forhosting.com/search/index-document", {
method: "POST",
headers: {
"Authorization": `Bearer ${process.env.KIT_KEY}`,
"Content-Type": "application/json"
},
body: JSON.stringify({
"input": "…"
})
});
const { task_id } = await res.json();import os, requests
res = requests.post(
"https://api.kit.forhosting.com/search/index-document",
headers={"Authorization": f"Bearer {os.environ['KIT_KEY']}"},
json={
"input": "…"
},
)
task_id = res.json()["task_id"]<?php
$res = file_get_contents("https://api.kit.forhosting.com/search/index-document", false, stream_context_create([
"http" => [
"method" => "POST",
"header" => "Authorization: Bearer " . getenv("KIT_KEY") . "\r\nContent-Type: application/json",
"content" => '{"input":"…"}',
],
]));
$task = json_decode($res, true);body := bytes.NewBufferString(`{"input":"…"}`)
req, _ := http.NewRequest("POST", "https://api.kit.forhosting.com/search/index-document", body)
req.Header.Set("Authorization", "Bearer "+os.Getenv("KIT_KEY"))
req.Header.Set("Content-Type", "application/json")
res, _ := http.DefaultClient.Do(req)Beispiel-Anfrage
{
"input": "…"
}Beispiel-Antwort
{
"task_id": "tsk_a1b2c3d4e5f6a1b2c3d4e5f6",
"type": "search.index_document",
"status": "queued",
"_links": {
"result": "/tasks/tsk_…/result"
}
}Die API arbeitet asynchron: Sie erhalten sofort eine task_id. Polling ist mit 1 Anfrage pro Sekunde erlaubt.
Preis
Der Preis steht auf der Seite – keine Tokens, keine Credits. Fehlgeschlagene Aufgaben werden nicht berechnet.
Limits
max_chunks | 10000 |
max_tokens | 20000 |
Fehler
| HTTP | Code | Bedeutung |
|---|---|---|
401 | unauthorized | Der API-Schlüssel fehlt oder ist ungültig – prüfen Sie den Authorization-Header (Bearer). |
402 | insufficient_balance | Ihr Guthaben reicht für diese Aufgabe nicht aus – Aufladungen verfallen nicht. |
404 | unknown_type | Unbekannter Aufgabentyp – prüfen Sie das Feld „type“ gegen den Katalog. |
429 | rate_limited | Zu viele Anfragen – warten Sie kurz; Polling ist mit 1 Anfrage pro Sekunde erlaubt. |
413 | input_too_large | Die Eingabe überschreitet das Größenlimit dieser Aufgabe – die genaue Grenze steht auf der Seite. |
422 | task_failed | Die Aufgabe ist fehlgeschlagen und wird nicht berechnet. |