ForHosting KIT · Semantische Suche

PDF-Dokumente durchsuchbar machen

KIT liest ein PDF-Dokument Seite für Seite, versteht auch Tabellen und Layout, und legt den Inhalt in einem durchsuchbaren Index ab. Gedacht für Kanzleien, Steuerberatungen und Unternehmen, die viele PDF-Dateien besitzen und diese inhaltlich statt nur über den Dateinamen wiederfinden wollen.

● Stabilpro Anfrage + pro Seite$0.010
Nutzen Sie es über WebAPIE-MailApp baldTelegram bald

Führen Sie dies mit Ihrem Konto auf unseren Servern aus. Kostenlose Tools laufen in Ihrem Browser; dieses wird zum oben genannten Preis von Ihrem KIT-Guthaben abgebucht.

Warum PDF-Dokumente mehr brauchen als reine Texterkennung

Ein PDF enthält oft Tabellen, mehrspaltiges Layout oder eingebettete Bilder, die eine einfache Texterkennung falsch oder unvollständig erfasst. KIT nutzt dafür ein Modell, das Seiten visuell versteht, statt nur Zeichen zu erkennen, und ordnet den erkannten Inhalt anschließend dem richtigen Abschnitt im Index zu. So bleibt etwa der Zusammenhang zwischen einer Tabellenüberschrift und den zugehörigen Werten erhalten, statt in einzelne, unverbundene Textfragmente zu zerfallen.

So läuft die Indexierung ab

Sie laden das PDF hoch oder senden es per API; KIT verarbeitet es Seite für Seite und erstellt daraus einen durchsuchbaren Index. Bei einem mehrseitigen Dokument dauert das je nach Umfang einige Minuten, danach steht der Inhalt für die semantische Suche oder für Fragen an das Dokument bereit. Jede Seite wird dabei einzeln erfasst, sodass sich ein Treffer später bis auf die genaue Seite zurückverfolgen lässt.

Preis pro Seite

$0.010 pro Anfrage plus $0.059 je verarbeiteter Seite. Ein zwanzigseitiger Vertrag kostet damit rund $1.19 – ein überschaubarer Betrag gegenüber der Zeit, die eine manuelle Durchsicht mehrerer solcher Dokumente kostet. Bei umfangreicheren Beständen, etwa einem Vertragsarchiv mit Hunderten Dokumenten, lohnt sich ein Vergleich mit dem Aufwand, dieselbe Information manuell zu erschließen. Bei einem einzelnen kurzen Dokument bleibt der Gesamtpreis entsprechend gering.

Für welche Dokumente sich das eignet

Besonders lohnend ist die Funktion bei Verträgen, Gutachten, Handbüchern oder Studien, die immer wieder nach bestimmten Klauseln oder Kennzahlen durchsucht werden müssen. Für ein einzelnes kurzes Dokument reicht oft schon die einfache Texterkennung; der Mehraufwand der Indexierung zahlt sich vor allem bei Beständen aus, die wiederholt und über längere Zeit durchsucht werden, statt nur einmalig gelesen zu werden. Die einmalige Indexierung zahlt sich dann bei jeder weiteren Anfrage erneut aus.

Vertragsarchiv einer Kanzlei

Eine Kanzlei in Hamburg indexiert Hunderte Verträge, um später in Sekunden zu finden, in welchem Dokument eine bestimmte Klausel steht.

Handbücher eines Maschinenbauers

Weber Metallbau GmbH indexiert technische Handbücher, damit Servicetechniker die passende Anleitung per Suchbegriff statt per Inhaltsverzeichnis finden.

Gutachten einer Versicherung

Eine Versicherungsagentur indexiert eingereichte Gutachten, um Fälle mit ähnlichem Schadensbild schneller wiederzufinden.

Was kostet die Indexierung eines 20-seitigen PDFs?

$0.010 pro Anfrage plus $0.059 je Seite, bei 20 Seiten also rund $1.19.

Erkennt die Funktion auch Tabellen im PDF?

Ja, das zugrunde liegende Modell versteht Tabellen und mehrspaltiges Layout, nicht nur reinen Fließtext.

Was passiert mit meinem Dokument nach der Indexierung?

Der Inhalt wird im Index gespeichert, damit die semantische Suche und die Fragenbeantwortung darauf zugreifen können, und nicht an Dritte weitergegeben.

Funktioniert das auch mit gescannten PDFs?

Ja, solange der Scan lesbar ist; bei sehr schlechter Scanqualität sinkt die Trefferquote wie bei jeder Texterkennung.

Gibt es einen AVV für die Verarbeitung von Mandantendokumenten?

Aktuell steht kein separater Auftragsverarbeitungsvertrag zur Verfügung. Wer das für seine Kanzlei benötigt, spricht uns bitte vorab per E-Mail an.

Wie viele Seiten kann ein Dokument haben?

Der Index selbst fasst bis zu 10.000 Textabschnitte; bei sehr umfangreichen Dokumenten empfiehlt sich eine Aufteilung in mehrere Teile.

Alles auf dieser Seite ist auch per API verfügbar. Dieser Abschnitt richtet sich an Teams, die es in ihre eigenen Systeme einbinden möchten; alle anderen nutzen einfach das Tool oben.

POSThttps://api.kit.forhosting.com/search/index-document

Authentifizierung per Bearer-Token. Ein einziger POST stellt die Aufgabe in die Warteschlange; das Ergebnis erhalten Sie per Webhook oder über einen signierten Link.

curl -X POST https://api.kit.forhosting.com/search/index-document \
  -H "Authorization: Bearer $KIT_KEY" \
  -H "Content-Type: application/json" \
  -d '{"input":"…"}'
{
  "input": "…"
}
{
  "task_id": "tsk_a1b2c3d4e5f6a1b2c3d4e5f6",
  "type": "search.index_document",
  "status": "queued",
  "_links": {
    "result": "/tasks/tsk_…/result"
  }
}

Die API arbeitet asynchron: Sie erhalten sofort eine task_id. Polling ist mit 1 Anfrage pro Sekunde erlaubt.

pro Anfrage$0.010
pro Seite$0.059

Der Preis steht auf der Seite – keine Tokens, keine Credits. Fehlgeschlagene Aufgaben werden nicht berechnet.

max_chunks10000
max_tokens20000
HTTPCodeBedeutung
401unauthorizedDer API-Schlüssel fehlt oder ist ungültig – prüfen Sie den Authorization-Header (Bearer).
402insufficient_balanceIhr Guthaben reicht für diese Aufgabe nicht aus – Aufladungen verfallen nicht.
404unknown_typeUnbekannter Aufgabentyp – prüfen Sie das Feld „type“ gegen den Katalog.
429rate_limitedZu viele Anfragen – warten Sie kurz; Polling ist mit 1 Anfrage pro Sekunde erlaubt.
413input_too_largeDie Eingabe überschreitet das Größenlimit dieser Aufgabe – die genaue Grenze steht auf der Seite.
422task_failedDie Aufgabe ist fehlgeschlagen und wird nicht berechnet.

Vollständige KIT-Dokumentation lesen →