Word-Datei als reinen Text extrahieren
Manchmal zählt nur der Inhalt eines Word-Dokuments, nicht sein Layout: für eine Volltextsuche, eine Weiterverarbeitung durch andere Software oder eine Migration in ein anderes System. Dieser Dienst liest eine DOCX-Datei ein und liefert ausschließlich den reinen Text zurück, ohne Formatierung.
Online ausführen
Führen Sie dies mit Ihrem Konto auf unseren Servern aus. Kostenlose Tools laufen in Ihrem Browser; dieses wird zum oben genannten Preis von Ihrem KIT-Guthaben abgebucht.
Was übrig bleibt, wenn das Layout wegfällt
Schriftarten, Farben, Tabellenrahmen und Seitenumbrüche verschwinden; erhalten bleiben der Fließtext, die Reihenfolge der Absätze und – je nach Einstellung – eine einfache Kennzeichnung von Überschriften. Für Menschen ist das reine Textergebnis weniger angenehm zu lesen als das Original, für eine Suchmaschine, eine Datenbank oder ein Sprachmodell ist es dagegen genau das, was gebraucht wird: sauberer Inhalt ohne visuellen Ballast. Genau dieser Rohstoff lässt sich anschließend beliebig weiterverarbeiten, ohne dass Formatierungsreste den Prozess stören.
Wozu reiner Text besser taugt als das Originaldokument
Eine interne Suche, die tausende Aktennotizen durchsuchbar machen soll, kommt mit einfachem Text schneller und zuverlässiger zurecht als mit Hunderten unterschiedlich formatierten Word-Dateien. Systeme, die Dokumente automatisch klassifizieren oder zusammenfassen, arbeiten ebenfalls auf Textbasis. Auch eine Migration alter Word-Bestände in ein neues Redaktionssystem beginnt meist mit genau diesem Schritt: Inhalt vom Layout trennen. Wer später ein neues Layout aufsetzt, tut das gezielt im Zielsystem, statt alte Formatierungsreste mitzuschleppen.
Wann die Formatierung doch gebraucht wird
Soll das Dokument am Ende wieder aussehen wie ein Word-Dokument – etwa für eine Bewerbung oder ein Angebot –, ist die reine Textextraktion der falsche Schritt; dafür eignet sich eher die Umwandlung von Word in PDF. Reiner Text lohnt sich immer dann, wenn der Inhalt weiterverarbeitet, durchsucht oder in ein anderes System übernommen wird, nicht, wenn er unverändert gelesen werden soll.
Preis und aktueller Stand
Diese Funktion befindet sich derzeit in der Bereitstellung und nimmt noch keine Ausführungen entgegen. Abgerechnet wird pro Dokument: $0.052 Grundgebühr plus $0.003 zusätzlich pro Datei, insgesamt $0.055 pro Dokument, unabhängig von der Seitenzahl. Die Grenze liegt bei 25 MB und 200 Seiten. Preis und Grenzen gelten unverändert, sobald die Funktion startet. Wer die Integration schon jetzt plant, kann mit exakt diesen Zahlen kalkulieren.
Anwendungsfälle
Aktennotizen durchsuchbar machen
Eine Kanzlei extrahiert den reinen Text aus tausenden alten Word-Aktennotizen, um sie in die interne Volltextsuche zu laden – gesucht wird künftig nach Begriffen, nicht mehr nach Ordnerstruktur.
Migration in ein neues Redaktionssystem
Ein Verlag überträgt jahrealte Word-Manuskripte in ein neues Redaktionssystem. Der reine Text wird importiert, das Layout entsteht im neuen System gezielt neu.
Textbasis für eine automatische Klassifizierung
Schneider IT-Systeme GmbH & Co. KG lässt eingehende Word-Berichte automatisch nach Themen einsortieren. Grundlage dafür ist der extrahierte reine Text jedes Dokuments.
Alte Protokolle für die Wissensdatenbank
Ein Verein wandelt Jahrzehnte an Sitzungsprotokollen aus Word in reinen Text um, um sie in eine durchsuchbare interne Wissensdatenbank zu überführen.
Häufige Fragen
Bleiben Überschriften irgendwie erkennbar?
Je nach Einstellung werden Überschriften mit einer einfachen Kennzeichnung versehen; die visuelle Formatierung selbst – Schriftgröße, Farbe – fällt in jedem Fall weg.
Was passiert mit Tabellen im Dokument?
Der Zellinhalt bleibt als Text erhalten, meist zeilenweise aneinandergereiht; die Tabellenstruktur selbst geht bei reiner Textextraktion verloren.
Ist das dasselbe wie Word in PDF umwandeln?
Nein. Diese Funktion liefert ausschließlich unformatierten Text, keine Seite mit Layout. Für ein optisch identisches Dokument ist die Umwandlung in PDF die richtige Wahl.
Was kostet die Verarbeitung eines einzelnen Dokuments?
$0.052 Grundgebühr plus $0.003, insgesamt $0.055 pro Dokument, unabhängig von der Seitenzahl.
Wird der Inhalt meiner Dokumente irgendwo abgelegt?
Nein, die Datei wird nur für die Dauer der Verarbeitung genutzt und danach gelöscht, ohne weitere Auswertung.
Ab wann ist diese Funktion nutzbar?
Sie befindet sich derzeit in der Bereitstellung und nimmt noch keine Ausführungen entgegen. Preis und Grenzen sind bereits veröffentlicht.
Für Entwickler — API-Zugang
Alles auf dieser Seite ist auch per API verfügbar. Dieser Abschnitt richtet sich an Teams, die es in ihre eigenen Systeme einbinden möchten; alle anderen nutzen einfach das Tool oben.
Endpunkt
Authentifizierung per Bearer-Token. Ein einziger POST stellt die Aufgabe in die Warteschlange; das Ergebnis erhalten Sie per Webhook oder über einen signierten Link.
Aufruf aus Ihrem Stack
curl -X POST https://api.kit.forhosting.com/doc/docx-to-text \
-H "Authorization: Bearer $KIT_KEY" \
-H "Content-Type: application/json" \
-d '{"input":"…"}'const res = await fetch("https://api.kit.forhosting.com/doc/docx-to-text", {
method: "POST",
headers: {
"Authorization": `Bearer ${process.env.KIT_KEY}`,
"Content-Type": "application/json"
},
body: JSON.stringify({
"input": "…"
})
});
const { task_id } = await res.json();import os, requests
res = requests.post(
"https://api.kit.forhosting.com/doc/docx-to-text",
headers={"Authorization": f"Bearer {os.environ['KIT_KEY']}"},
json={
"input": "…"
},
)
task_id = res.json()["task_id"]<?php
$res = file_get_contents("https://api.kit.forhosting.com/doc/docx-to-text", false, stream_context_create([
"http" => [
"method" => "POST",
"header" => "Authorization: Bearer " . getenv("KIT_KEY") . "\r\nContent-Type: application/json",
"content" => '{"input":"…"}',
],
]));
$task = json_decode($res, true);body := bytes.NewBufferString(`{"input":"…"}`)
req, _ := http.NewRequest("POST", "https://api.kit.forhosting.com/doc/docx-to-text", body)
req.Header.Set("Authorization", "Bearer "+os.Getenv("KIT_KEY"))
req.Header.Set("Content-Type", "application/json")
res, _ := http.DefaultClient.Do(req)Beispiel-Anfrage
{
"input": "…"
}Beispiel-Antwort
{
"task_id": "tsk_a1b2c3d4e5f6a1b2c3d4e5f6",
"type": "doc.docx_to_text",
"status": "queued",
"_links": {
"result": "/tasks/tsk_…/result"
}
}Die API arbeitet asynchron: Sie erhalten sofort eine task_id. Polling ist mit 1 Anfrage pro Sekunde erlaubt.
Preis
Der Preis steht auf der Seite – keine Tokens, keine Credits. Fehlgeschlagene Aufgaben werden nicht berechnet.
Limits
max_mb | 25 |
max_pages | 200 |
Fehler
| HTTP | Code | Bedeutung |
|---|---|---|
401 | unauthorized | Der API-Schlüssel fehlt oder ist ungültig – prüfen Sie den Authorization-Header (Bearer). |
402 | insufficient_balance | Ihr Guthaben reicht für diese Aufgabe nicht aus – Aufladungen verfallen nicht. |
404 | unknown_type | Unbekannter Aufgabentyp – prüfen Sie das Feld „type“ gegen den Katalog. |
429 | rate_limited | Zu viele Anfragen – warten Sie kurz; Polling ist mit 1 Anfrage pro Sekunde erlaubt. |