ForHosting KIT · Dokumente & PDF

Text aus PDF extrahieren

Diese Funktion liest den vollständigen Text einer PDF-Datei aus und liefert ihn als reinen Fließtext ohne Formatierung. Geeignet, wenn Sie den Inhalt eines Dokuments durchsuchen, in eine Tabelle kopieren oder in einem anderen Programm weiterverarbeiten möchten, ohne Layout oder Bilder zu übernehmen.

● Stabilpro Anfrage + pro Seite$0.002
Nutzen Sie es über WebAPIE-MailApp baldTelegram bald

Führen Sie dies mit Ihrem Konto auf unseren Servern aus. Kostenlose Tools laufen in Ihrem Browser; dieses wird zum oben genannten Preis von Ihrem KIT-Guthaben abgebucht.

Wenn Kopieren aus dem PDF-Reader nicht reicht

Text direkt aus einem PDF-Reader zu kopieren, funktioniert oft nur seitenweise und reißt dabei Absätze oder Spalten auseinander. Die Extraktion liest die Datei als Ganzes aus und liefert einen zusammenhängenden Text, der sich sofort durchsuchen, in eine Textverarbeitung einfügen oder an ein weiteres Programm übergeben lässt. Bei einem mehrseitigen Bericht summiert sich dieser Aufwand schnell zu einer mühsamen Bastelarbeit, die sich mit einem einzigen Durchlauf erledigen lässt.

Reiner Text, kein Layout

Ausgegeben wird der Textinhalt ohne Formatierung: keine Schriftgrößen, keine Spalten, keine eingebetteten Bilder. Das eignet sich für die Weiterverarbeitung, nicht für eine originalgetreue Ansicht – wer Struktur und Überschriften erhalten möchte, findet das in der Umwandlung nach Markdown. Für eine Volltextsuche, eine automatisierte Auswertung oder das Einspeisen in ein weiteres Programm reicht diese reine Textform in der Regel völlig aus und lässt sich sofort weiterverarbeiten.

Grenzen bei gescannten Dokumenten

Die Extraktion liest den in der Datei enthaltenen Text; ein eingescanntes Dokument ohne Textebene liefert daher wenig oder nichts. Für solche Fälle braucht es zunächst eine Texterkennung (OCR), erst danach lässt sich Text im eigentlichen Sinn extrahieren. Ein einfacher Test vorab hilft weiter: Lässt sich im PDF-Reader bereits ein einzelnes Wort markieren, ist eine Textebene vorhanden und die Extraktion liefert ein brauchbares Ergebnis.

Preis und Grenzen

Die Extraktion kostet $0.002 pro Anfrage, in US-Dollar, unabhängig von der Seitenzahl. Sie läuft auf dieser Seite für eine einzelne Datei oder über die API (Alias /pdf/to-text) für einen automatisierten Stapel. Verarbeitet werden Dateien bis 25 MB und 200 Seiten. Eine Rechnung stellen wir auf Anfrage aus, und der Preis bleibt unabhängig von der Textmenge auf jeder einzelnen Seite gleich.

Vertragstext in eine Prüfliste kopieren

Sabine Schneider extrahiert den Text eines mehrseitigen Vertrags, um einzelne Klauseln in eine interne Prüfliste zu kopieren, statt Absätze händisch aus dem PDF-Reader herauszureißen.

Volltextsuche in einem Archiv aufbauen

Weber Metallbau GmbH extrahiert den Text aller archivierten Protokolle, um eine Volltextsuche über mehrere Jahre Dokumentation aufzubauen.

Inhalt für die Weiterverarbeitung durch KI

Ein Freiberufler extrahiert den Text eines Berichts, um ihn anschließend automatisiert zusammenfassen zu lassen, statt den Bericht Seite für Seite manuell abzutippen.

Bleibt das Layout im extrahierten Text erhalten?

Nein, ausgegeben wird reiner Fließtext ohne Formatierung, Spalten oder Bilder.

Funktioniert das auch bei eingescannten PDF-Dateien?

Nur, wenn die Datei bereits eine Textebene enthält. Ein reiner Bildscan ohne Text liefert wenig oder nichts – dafür braucht es zunächst eine Texterkennung.

Wie unterscheidet sich das von der Umwandlung nach Markdown?

Die Textextraktion liefert reinen Fließtext ohne Struktur. Die Umwandlung nach Markdown erhält zusätzlich Überschriften, Listen und Tabellen als Struktur – für eine reine Weiterverarbeitung des Inhalts reicht meist der reine Text.

Was kostet die Extraktion?

$0.002 pro Anfrage, in US-Dollar, unabhängig von der Seitenzahl.

Werden meine Dateien danach gespeichert?

Nein. Die Übertragung erfolgt verschlüsselt, die Datei dient ausschließlich der Extraktion und wird danach von unseren Servern entfernt.

Gibt es eine Grenze für Dateigröße oder Seitenzahl?

Ja, verarbeitet werden Dateien bis 25 MB und 200 Seiten.

Alles auf dieser Seite ist auch per API verfügbar. Dieser Abschnitt richtet sich an Teams, die es in ihre eigenen Systeme einbinden möchten; alle anderen nutzen einfach das Tool oben.

POSThttps://api.kit.forhosting.com/pdf/to-text

Authentifizierung per Bearer-Token. Ein einziger POST stellt die Aufgabe in die Warteschlange; das Ergebnis erhalten Sie per Webhook oder über einen signierten Link.

curl -X POST https://api.kit.forhosting.com/pdf/to-text \
  -H "Authorization: Bearer $KIT_KEY" \
  -H "Content-Type: application/json" \
  -d '{"pdf":"https://ejemplo.com/documento.pdf"}'
{
  "pdf": "https://ejemplo.com/documento.pdf"
}
{
  "task_id": "tsk_a1b2c3d4e5f6a1b2c3d4e5f6",
  "type": "pdf.to_text",
  "status": "queued",
  "_links": {
    "result": "/tasks/tsk_…/result"
  }
}

Die API arbeitet asynchron: Sie erhalten sofort eine task_id. Polling ist mit 1 Anfrage pro Sekunde erlaubt.

pro Anfrage$0.002

Der Preis steht auf der Seite – keine Tokens, keine Credits. Fehlgeschlagene Aufgaben werden nicht berechnet.

max_mb25
max_pages200
HTTPCodeBedeutung
401unauthorizedDer API-Schlüssel fehlt oder ist ungültig – prüfen Sie den Authorization-Header (Bearer).
402insufficient_balanceIhr Guthaben reicht für diese Aufgabe nicht aus – Aufladungen verfallen nicht.
404unknown_typeUnbekannter Aufgabentyp – prüfen Sie das Feld „type“ gegen den Katalog.
429rate_limitedZu viele Anfragen – warten Sie kurz; Polling ist mit 1 Anfrage pro Sekunde erlaubt.
413input_too_largeDie Eingabe überschreitet das Größenlimit dieser Aufgabe – die genaue Grenze steht auf der Seite.

Vollständige KIT-Dokumentation lesen →