ForHosting KIT · Texterkennung (OCR) & Datenextraktion

Text aus gescannten PDFs extrahieren

Wandelt eine gescannte, nicht durchsuchbare PDF-Datei in maschinenlesbaren Text um: Seite für Seite wird gelesen und als Text zurückgegeben. Gedacht für Belege, alte Ordner, Verträge und Behördenschreiben, die bisher nur als Bild in der PDF-Datei liegen und sich weder kopieren noch durchsuchen lassen, obwohl der Inhalt eigentlich längst digital vorliegen sollte.

● Stabilpro Anfrage + pro Seite$0.010
Nutzen Sie es über WebAPIE-MailApp baldTelegram bald

Führen Sie dies mit Ihrem Konto auf unseren Servern aus. Kostenlose Tools laufen in Ihrem Browser; dieses wird zum oben genannten Preis von Ihrem KIT-Guthaben abgebucht.

Woran Sie eine gescannte PDF-Datei erkennen

Lässt sich in der PDF-Datei kein Text markieren oder kopieren und liefert die Suchfunktion des PDF-Programms keine Treffer, handelt es sich um eine gescannte, also bildbasierte Datei. Genau für diesen Fall ist die Funktion gedacht: Jede Seite wird als Bild gelesen und in Text zurückverwandelt, unabhängig davon, mit welchem Scanner, Kopierer oder Multifunktionsdrucker sie ursprünglich entstanden ist, und unabhängig von der Auflösung, in der gescannt wurde.

So läuft die Umwandlung ab

Sie laden die PDF-Datei auf dieser Seite hoch, wählen bei Bedarf den Seitenbereich aus und erhalten den Text je Seite zurück, bereit zum Kopieren oder Weiterverarbeiten in einem eigenen Dokument. Über die API lässt sich derselbe Ablauf in eine Buchhaltungs- oder Archivierungssoftware einbinden; App und E-Mail-Kanal folgen als weitere Wege, dieselbe Funktion ohne eigene Entwicklung zu nutzen, sobald sie verfügbar sind.

Preis pro Seite

$0.010 pro Anfrage plus $0.0575 pro verarbeiteter Seite, ohne Abonnement und ohne Mindestmenge, die zuerst erreicht werden müsste. Eine zehnseitige, gescannte Akte kostet damit rund $0.59. Der Preis gilt unabhängig davon, wie viel Text auf der jeweiligen Seite steht, und unabhängig davon, ob die Seite Tabellen, Fließtext oder handschriftliche Vermerke am Rand enthält. Auch bei sehr dicht beschriebenen Seiten mit kleiner Schrift ändert sich der Preis nicht, sodass sich die Kosten für eine ganze Akte schon vorab verlässlich abschätzen lassen.

Nutzen für die Ablage

Sobald der Text vorliegt, lässt er sich durchsuchen, filtern und in andere Systeme übernehmen – eine Voraussetzung für ein Archiv, das später schnell auffindbar sein soll, statt Ordner für Ordner von Hand durchgeblättert zu werden, wenn ein einzelnes Dokument gesucht wird. Die Funktion liefert den reinen Text; die eigentliche Ablage in PDF/A oder einem Dokumentenmanagementsystem übernimmt weiterhin Ihre eigene Software, wie es der Ablageprozess Ihres Betriebs vorsieht.

Belegordner ohne manuelles Abtippen

Katrin Baumann, selbstständige Grafikdesignerin, lässt eingescannte Belege aus den letzten Jahren auslesen, um die Beträge für die Steuererklärung in eine Tabelle zu übernehmen.

Altakten durchsuchbar machen

Schneider IT-Systeme GmbH & Co. KG digitalisiert einen Aktenordner mit eingescannten Verträgen, damit sich einzelne Klauseln später per Volltextsuche finden lassen.

Vereinsprotokolle aus Papierarchiven

Ein Sportverein liest jahrzehntealte, gescannte Sitzungsprotokolle aus und stellt den Mitgliedern eine durchsuchbare Textsammlung zur Verfügung.

Handwerksbetrieb ohne Papierarchiv

Lukas Fischer übernimmt gescannte Lieferscheine aus dem Papierarchiv seines Betriebs als Text, um sie in die Warenwirtschaft einzupflegen.

Ist das mit dem Datenschutz vereinbar? Wo wird die Datei verarbeitet?

Die PDF-Datei wird ausschließlich zur Texterstellung verarbeitet und nicht zu anderen Zwecken weiterverwendet. Es entstehen keine dauerhaft gespeicherten Kopien in einem Konto, da es keine Konten gibt.

Erkennt die Funktion, ob eine PDF-Datei bereits Text enthält?

Diese Funktion liest jede Seite als Bild und eignet sich damit besonders für gescannte Dateien. Enthält die Datei bereits eingebetteten Text, lässt sich dieser meist direkt mit der eigenen PDF-Software kopieren.

Was kostet eine zehnseitige Datei?

$0.010 Grundgebühr pro Anfrage plus $0.0575 je Seite – zehn Seiten kosten damit rund $0.59, ohne weitere Kosten.

Gibt es ein Limit für Seitenzahl oder Dateigröße?

Ja: bis zu 10 Seiten und bis zu 25 MB pro Datei in einem Lauf.

Bekomme ich eine Rechnung für die Nutzung?

Für jede Zahlung erhalten Sie einen Beleg über den bezahlten Betrag; ob dieser für Ihre Buchhaltung als Rechnung im formalen Sinn ausreicht, hängt von Ihrer internen Praxis ab.

Wie gut funktioniert das bei schlechten Scans?

Bei klaren Scans mit gedrucktem Text ist die Trefferquote hoch. Verwaschene Stempel, Kaffeeflecken oder sehr blasse Kopien senken die Genauigkeit spürbar.

Alles auf dieser Seite ist auch per API verfügbar. Dieser Abschnitt richtet sich an Teams, die es in ihre eigenen Systeme einbinden möchten; alle anderen nutzen einfach das Tool oben.

POSThttps://api.kit.forhosting.com/ocr/pdf

Authentifizierung per Bearer-Token. Ein einziger POST stellt die Aufgabe in die Warteschlange; das Ergebnis erhalten Sie per Webhook oder über einen signierten Link.

curl -X POST https://api.kit.forhosting.com/ocr/pdf \
  -H "Authorization: Bearer $KIT_KEY" \
  -H "Content-Type: application/json" \
  -d '{"input":"…"}'
{
  "input": "…"
}
{
  "task_id": "tsk_a1b2c3d4e5f6a1b2c3d4e5f6",
  "type": "ocr.pdf",
  "status": "queued",
  "_links": {
    "result": "/tasks/tsk_…/result"
  }
}

Die API arbeitet asynchron: Sie erhalten sofort eine task_id. Polling ist mit 1 Anfrage pro Sekunde erlaubt.

pro Anfrage$0.010
pro Seite$0.0575

Der Preis steht auf der Seite – keine Tokens, keine Credits. Fehlgeschlagene Aufgaben werden nicht berechnet.

max_mb25
max_pages10
HTTPCodeBedeutung
401unauthorizedDer API-Schlüssel fehlt oder ist ungültig – prüfen Sie den Authorization-Header (Bearer).
402insufficient_balanceIhr Guthaben reicht für diese Aufgabe nicht aus – Aufladungen verfallen nicht.
404unknown_typeUnbekannter Aufgabentyp – prüfen Sie das Feld „type“ gegen den Katalog.
429rate_limitedZu viele Anfragen – warten Sie kurz; Polling ist mit 1 Anfrage pro Sekunde erlaubt.
413input_too_largeDie Eingabe überschreitet das Größenlimit dieser Aufgabe – die genaue Grenze steht auf der Seite.
422task_failedDie Aufgabe ist fehlgeschlagen und wird nicht berechnet.

Vollständige KIT-Dokumentation lesen →