PDF in Markdown umwandeln
Diese Funktion wandelt eine PDF-Datei in Markdown um und erkennt dabei Überschriften, Listen, Tabellen und Absätze als Struktur, nicht nur als Text. Das Ergebnis lässt sich direkt in ein Wiki, eine Dokumentation oder ein KI-Werkzeug einfügen, ohne die Gliederung manuell nachzubauen.
Online ausführen
Führen Sie dies mit Ihrem Konto auf unseren Servern aus. Kostenlose Tools laufen in Ihrem Browser; dieses wird zum oben genannten Preis von Ihrem KIT-Guthaben abgebucht.
Struktur statt Textwüste
Reiner Text aus einem PDF verliert seine Gliederung: Eine Überschrift sieht dann aus wie ein normaler Satz, eine Tabelle wird zu einer Zeile aus zusammenhanglosen Zahlen. Die Umwandlung nach Markdown erkennt stattdessen Überschriftenebenen, Aufzählungen, nummerierte Listen und Tabellen und bildet sie mit den entsprechenden Markdown-Zeichen nach – die Gliederung des Originals bleibt lesbar erhalten. Wer den Unterschied einmal gesehen hat, möchte selten zur reinen Textextraktion zurück.
So funktioniert die Erkennung
Ein spracherkennendes Modell liest jede Seite visuell, ähnlich wie ein Mensch, und erschließt daraus die logische Struktur, statt sich nur auf eingebettete Textkoordinaten zu verlassen. Das gelingt auch bei mehrspaltigem Layout oder Tabellen mit verschachtelten Zellen zuverlässiger als eine rein technische Textextraktion. Überschriften werden dabei an Schriftgröße, Position und Kontext erkannt, nicht nur am reinen Textinhalt einer Zeile, was die Genauigkeit gegenüber einer rein technischen Analyse deutlich erhöht.
Wofür sich das Ergebnis eignet
Markdown lässt sich unmittelbar in ein Wiki, ein Dokumentationssystem oder ein KI-gestütztes Werkzeug einfügen, das mit strukturiertem Text besser umgehen kann als mit einem reinen Textblock. Auch für die Weiterverarbeitung eines technischen Handbuchs oder eines Berichts in eine Website eignet sich diese Struktur besser als unformatierter Fließtext. Gerade Tabellen mit Kennzahlen bleiben dabei als Tabellen erkennbar, statt zu einer Zahlenkette zu verschmelzen.
Preis pro Seite
Die Umwandlung kostet $0.010 pro Anfrage plus $0.0575 pro Seite, in US-Dollar – der höhere Preis erklärt sich durch das spracherkennende Modell, das jede Seite einzeln analysiert. Sie nutzen die Funktion auf dieser Seite oder über die API (Alias /pdf/to-markdown). Verarbeitet werden Dateien bis 25 MB und 200 Seiten. Bei einem kurzen Dokument mit wenigen Seiten bleibt der Gesamtbetrag trotzdem überschaubar.
Anwendungsfälle
Technisches Handbuch ins Wiki übernehmen
Weber Metallbau GmbH überführt ein Maschinenhandbuch mit Kapiteln, Tabellen und Aufzählungen ins interne Wiki, ohne die Gliederung von Hand nachzubauen.
Bericht für ein KI-Werkzeug vorbereiten
Ein Freiberufler wandelt einen mehrseitigen Bericht in Markdown um, bevor er ihn in ein Zusammenfassungswerkzeug einspeist, das strukturierten Text zuverlässiger auswertet als reinen Fließtext.
Alte Dokumentation in eine Website überführen
Schneider IT-Systeme GmbH & Co. KG überträgt eine archivierte PDF-Dokumentation in Markdown, um sie anschließend als durchsuchbare Website zu veröffentlichen.
Häufige Fragen
Was macht diese Umwandlung anders als die reine Textextraktion?
Sie erkennt zusätzlich die Struktur: Überschriften, Listen und Tabellen werden mit Markdown-Zeichen nachgebildet statt als ununterscheidbarer Fließtext ausgegeben.
Warum ist der Preis pro Seite höher als bei anderen PDF-Funktionen?
Weil ein spracherkennendes Modell jede Seite visuell analysiert, um Struktur statt nur Zeichen zu erkennen. Das ist rechenintensiver als eine technische Textextraktion, daher $0.0575 pro Seite.
Funktioniert das auch bei mehrspaltigem Layout?
Ja, das Modell erschließt die logische Lesereihenfolge auch bei mehreren Spalten oder verschachtelten Tabellen, zuverlässiger als eine rein positionsbasierte Extraktion.
Werden auch eingescannte Seiten ohne Textebene erkannt?
Das Modell liest Seiten visuell, daher lassen sich auch gescannte Abschnitte in vielen Fällen erfassen – die Genauigkeit hängt jedoch von der Qualität der Vorlage ab.
Wie hoch ist der Gesamtpreis für ein Dokument?
$0.010 pro Anfrage plus $0.0575 pro Seite, in US-Dollar. Ein Dokument mit fünf Seiten kostet damit $0.2975 insgesamt.
Werden meine Dateien nach der Umwandlung gespeichert?
Nein. Auch das spracherkennende Modell speichert nichts dauerhaft: Die Datei wird verschlüsselt übertragen, für die Umwandlung genutzt und danach gelöscht.
Für Entwickler — API-Zugang
Alles auf dieser Seite ist auch per API verfügbar. Dieser Abschnitt richtet sich an Teams, die es in ihre eigenen Systeme einbinden möchten; alle anderen nutzen einfach das Tool oben.
Endpunkt
Authentifizierung per Bearer-Token. Ein einziger POST stellt die Aufgabe in die Warteschlange; das Ergebnis erhalten Sie per Webhook oder über einen signierten Link.
Aufruf aus Ihrem Stack
curl -X POST https://api.kit.forhosting.com/pdf/to-markdown \
-H "Authorization: Bearer $KIT_KEY" \
-H "Content-Type: application/json" \
-d '{"pdf":"https://ejemplo.com/documento.pdf"}'const res = await fetch("https://api.kit.forhosting.com/pdf/to-markdown", {
method: "POST",
headers: {
"Authorization": `Bearer ${process.env.KIT_KEY}`,
"Content-Type": "application/json"
},
body: JSON.stringify({
"pdf": "https://ejemplo.com/documento.pdf"
})
});
const { task_id } = await res.json();import os, requests
res = requests.post(
"https://api.kit.forhosting.com/pdf/to-markdown",
headers={"Authorization": f"Bearer {os.environ['KIT_KEY']}"},
json={
"pdf": "https://ejemplo.com/documento.pdf"
},
)
task_id = res.json()["task_id"]<?php
$res = file_get_contents("https://api.kit.forhosting.com/pdf/to-markdown", false, stream_context_create([
"http" => [
"method" => "POST",
"header" => "Authorization: Bearer " . getenv("KIT_KEY") . "\r\nContent-Type: application/json",
"content" => '{"pdf":"https://ejemplo.com/documento.pdf"}',
],
]));
$task = json_decode($res, true);body := bytes.NewBufferString(`{"pdf":"https://ejemplo.com/documento.pdf"}`)
req, _ := http.NewRequest("POST", "https://api.kit.forhosting.com/pdf/to-markdown", body)
req.Header.Set("Authorization", "Bearer "+os.Getenv("KIT_KEY"))
req.Header.Set("Content-Type", "application/json")
res, _ := http.DefaultClient.Do(req)Beispiel-Anfrage
{
"pdf": "https://ejemplo.com/documento.pdf"
}Beispiel-Antwort
{
"task_id": "tsk_a1b2c3d4e5f6a1b2c3d4e5f6",
"type": "pdf.to_markdown",
"status": "queued",
"_links": {
"result": "/tasks/tsk_…/result"
}
}Die API arbeitet asynchron: Sie erhalten sofort eine task_id. Polling ist mit 1 Anfrage pro Sekunde erlaubt.
Preis
Der Preis steht auf der Seite – keine Tokens, keine Credits. Fehlgeschlagene Aufgaben werden nicht berechnet.
Limits
max_mb | 25 |
max_pages | 200 |
Fehler
| HTTP | Code | Bedeutung |
|---|---|---|
401 | unauthorized | Der API-Schlüssel fehlt oder ist ungültig – prüfen Sie den Authorization-Header (Bearer). |
402 | insufficient_balance | Ihr Guthaben reicht für diese Aufgabe nicht aus – Aufladungen verfallen nicht. |
404 | unknown_type | Unbekannter Aufgabentyp – prüfen Sie das Feld „type“ gegen den Katalog. |
429 | rate_limited | Zu viele Anfragen – warten Sie kurz; Polling ist mit 1 Anfrage pro Sekunde erlaubt. |
413 | input_too_large | Die Eingabe überschreitet das Größenlimit dieser Aufgabe – die genaue Grenze steht auf der Seite. |
422 | task_failed | Die Aufgabe ist fehlgeschlagen und wird nicht berechnet. |