HTML-Tags entfernen
KIT entfernt alle HTML-Tags aus einer Seite oder einem Code-Ausschnitt und liefert ausschließlich den sichtbaren, reinen Text zurück. Gedacht für alle, die einen Textinhalt ohne Formatierung weiterverarbeiten müssen, etwa für eine Textanalyse, eine Suche oder das Einfügen in ein einfaches Textfeld.
Im Browser ausführen – kostenlos
Läuft direkt in Ihrem Browser – kostenlos. Ihre Datei verlässt Ihren Browser nicht und wird an keinen Server übertragen.
So funktioniert die Extraktion
Sie fügen den HTML-Code ein, KIT entfernt sämtliche Tags, Skripte und Formatierungsanweisungen und behält nur den für Leserinnen und Leser sichtbaren Text übrig, mit sinnvollen Zeilenumbrüchen zwischen Absätzen und Überschriften. Werbeblöcke, Navigationsleisten und versteckte Elemente werden dabei bewusst nicht mit einbezogen. Auch alternative Bildbeschreibungen können auf Wunsch als Text mit übernommen werden, wenn sie inhaltlich relevant für die weitere Verarbeitung sind.
Wofür sich das eignet
Für eine Textanalyse, eine Wortzählung oder eine Weiterverarbeitung mit einer KIT-Textfunktion wird oft nur der reine Inhalt benötigt, nicht das umgebende HTML-Gerüst einer Website. Auch beim Einfügen in ein einfaches Textfeld oder eine E-Mail stört überflüssiger HTML-Code eher, als dass er nützt. Auch für den Import in eine Datenbank, die nur reinen Text erwartet, ist dieser Zwischenschritt regelmäßig notwendig und spart Zeit.
Grenzen, die Sie kennen sollten
Der HTML-Code darf bis zu 25 MB groß sein. Bei sehr unübersichtlich aufgebauten Seiten mit vielen ineinander verschachtelten Werbeblöcken kann vereinzelt zusätzlicher Text im Ergebnis auftauchen; ein kurzer Blick auf das Ergebnis lohnt sich in solchen Fällen. Tabellen werden dabei in eine lesbare Textform überführt, wobei die ursprüngliche Spaltenausrichtung naturgemäß verloren geht, der eigentliche Inhalt selbst aber vollständig erhalten bleibt.
Nach der Extraktion
Der reine Text lässt sich direkt mit anderen KIT-Funktionen weiterverarbeiten, etwa zusammenfassen, auf Rechtschreibung prüfen oder in eine andere Sprache übersetzen. Das HTML-Gerüst spielt dabei keine Rolle mehr, nur noch der eigentliche Inhalt. So wird aus einer vollständigen Website in nur einem einzigen Schritt genau der Inhalt gewonnen, der für die eigentliche Auswertung tatsächlich zählt und danach weiterverarbeitet werden soll.
Anwendungsfälle
Text für eine Analyse extrahieren
Ein Marketing-Team in Stuttgart extrahiert den reinen Text mehrerer Konkurrenzseiten, um ihn anschließend mit einer KIT-Textfunktion auf häufig verwendete Begriffe zu untersuchen.
Newsletter-Inhalt vorbereiten
Eine Vereinsredaktion in Leipzig kopiert einen Artikel aus dem Content-Management-System und entfernt zunächst alle HTML-Reste, bevor der Text in eine einfache Textmail eingefügt wird.
Archivierung ohne Formatierung
Eine Kanzlei in Hamburg speichert den reinen Textinhalt einer Website als Nachweis für ein laufendes Verfahren, ohne das technische HTML-Gerüst mit abzulegen.
Häufige Fragen
Was kostet das Entfernen der HTML-Tags?
Kostenlos und ohne Limit, solange Sie im Browser arbeiten. Wer stattdessen automatisiert über die API zugreift, zahlt $0.002 je Anfrage.
Werden auch Skripte und Werbeblöcke entfernt?
Ja, Skripte, Style-Anweisungen und in der Regel auch Werbeblöcke werden nicht in den extrahierten Text übernommen.
Verlässt mein Code dabei den Browser?
Im Browser verlässt der Code Ihr Gerät nicht: Die Extraktion erfolgt vollständig lokal, ohne Serverkontakt.
Bleiben Absätze im Text erkennbar?
Ja, KIT setzt sinnvolle Zeilenumbrüche zwischen Absätzen und Überschriften, damit der Text auch ohne Formatierung lesbar bleibt.
Wie groß darf der HTML-Code sein?
Bis zu 25 MB.
Ist ein Konto erforderlich?
Nein, ein Konto ist nicht vorgesehen. Im Browser ist die Nutzung anonym und kostenlos, die API wird separat pro Anfrage berechnet.
Für Entwickler — API-Zugang
Alles auf dieser Seite ist auch per API verfügbar. Dieser Abschnitt richtet sich an Teams, die es in ihre eigenen Systeme einbinden möchten; alle anderen nutzen einfach das Tool oben.
Endpunkt
Authentifizierung per Bearer-Token. Ein einziger POST stellt die Aufgabe in die Warteschlange; das Ergebnis erhalten Sie per Webhook oder über einen signierten Link.
Aufruf aus Ihrem Stack
curl -X POST https://api.kit.forhosting.com/data/html-to-text \
-H "Authorization: Bearer $KIT_KEY" \
-H "Content-Type: application/json" \
-d '{"input":"…"}'const res = await fetch("https://api.kit.forhosting.com/data/html-to-text", {
method: "POST",
headers: {
"Authorization": `Bearer ${process.env.KIT_KEY}`,
"Content-Type": "application/json"
},
body: JSON.stringify({
"input": "…"
})
});
const { task_id } = await res.json();import os, requests
res = requests.post(
"https://api.kit.forhosting.com/data/html-to-text",
headers={"Authorization": f"Bearer {os.environ['KIT_KEY']}"},
json={
"input": "…"
},
)
task_id = res.json()["task_id"]<?php
$res = file_get_contents("https://api.kit.forhosting.com/data/html-to-text", false, stream_context_create([
"http" => [
"method" => "POST",
"header" => "Authorization: Bearer " . getenv("KIT_KEY") . "\r\nContent-Type: application/json",
"content" => '{"input":"…"}',
],
]));
$task = json_decode($res, true);body := bytes.NewBufferString(`{"input":"…"}`)
req, _ := http.NewRequest("POST", "https://api.kit.forhosting.com/data/html-to-text", body)
req.Header.Set("Authorization", "Bearer "+os.Getenv("KIT_KEY"))
req.Header.Set("Content-Type", "application/json")
res, _ := http.DefaultClient.Do(req)Beispiel-Anfrage
{
"input": "…"
}Beispiel-Antwort
{
"task_id": "tsk_a1b2c3d4e5f6a1b2c3d4e5f6",
"type": "data.html_to_text",
"status": "queued",
"_links": {
"result": "/tasks/tsk_…/result"
}
}Die API arbeitet asynchron: Sie erhalten sofort eine task_id. Polling ist mit 1 Anfrage pro Sekunde erlaubt.
Preis
Der Preis steht auf der Seite – keine Tokens, keine Credits. Fehlgeschlagene Aufgaben werden nicht berechnet.
Limits
max_mb | 25 |
Fehler
| HTTP | Code | Bedeutung |
|---|---|---|
401 | unauthorized | Der API-Schlüssel fehlt oder ist ungültig – prüfen Sie den Authorization-Header (Bearer). |
402 | insufficient_balance | Ihr Guthaben reicht für diese Aufgabe nicht aus – Aufladungen verfallen nicht. |
404 | unknown_type | Unbekannter Aufgabentyp – prüfen Sie das Feld „type“ gegen den Katalog. |
429 | rate_limited | Zu viele Anfragen – warten Sie kurz; Polling ist mit 1 Anfrage pro Sekunde erlaubt. |