ForHosting KIT · Websites auslesen & überwachen

Nur der Artikeltext einer Webseite

Diese Funktion erkennt auf einer Internetadresse den eigentlichen Artikel – anders als bei der reinen Textextraktion nicht die ganze Seite, sondern gezielt Titel, Autor, Datum und Fließtext eines Presse- oder Blogbeitrags, ohne Werbung, Empfehlungen am Rand und Kommentarspalte. Das Ergebnis liest sich wie im Reader-Modus eines Browsers.

● Stabilpro Anfrage + pro URL$0.040
Nutzen Sie es über WebAPIE-MailApp baldTelegram bald

Führen Sie dies mit Ihrem Konto auf unseren Servern aus. Kostenlose Tools laufen in Ihrem Browser; dieses wird zum oben genannten Preis von Ihrem KIT-Guthaben abgebucht.

Der Unterschied zur ganzen Seite

Eine Nachrichtenseite besteht selten nur aus dem Artikel: Empfehlungen, Werbebanner, eine Kommentarspalte und ein Newsletter-Hinweis nehmen oft mehr Platz ein als der eigentliche Text. Diese Funktion erkennt, welcher Bereich der Artikel selbst ist, ähnlich der Leseansicht eines Browsers, und liefert nur diesen Teil samt Titel, Autor und Datum, sofern die Seite diese Angaben in ihrem Quelltext enthält. Bilder innerhalb des Artikeltextes bleiben dabei als Verweis erhalten, Werbebilder außerhalb des Artikels dagegen nicht.

Wofür sich das eignet

Für einen Pressespiegel, der mehrere Artikel zu einem Thema zusammenstellt, reicht der reine Artikeltext ohne das Drumherum jeder einzelnen Seite völlig aus. Auch für die Vorbereitung eines internen Newsletters mit Fundstücken aus der Presse spart das gezielte Herausfiltern des Artikels gegenüber dem Kopieren von Hand deutlich Zeit, gerade wenn mehrere Quellen an einem Vormittag zusammenkommen und jede einzelne Seite ihr eigenes Layout mit unterschiedlicher Werbeplatzierung mitbringt.

Wenn die Seite kein klassischer Artikel ist

Bei Produktseiten, Foren oder Landingpages ohne klare Artikelstruktur liefert die Erkennung möglicherweise nicht den erwarteten Ausschnitt, da es dort keinen eindeutigen Hauptinhalt im journalistischen Sinn gibt. Für solche Seiten eignet sich die reine Textextraktion oder die Umwandlung in Markdown besser, da beide den gesamten sichtbaren Inhalt liefern, statt eine Vorauswahl zu treffen, die bei uneindeutiger Struktur ins Leere laufen kann.

Preis pro Anfrage

$0.040 pro Anfrage zuzüglich $0.001 pro URL, unabhängig davon, wie lang der erkannte Artikel ausfällt oder wie viele Werbeflächen auf der ursprünglichen Seite herausgefiltert werden mussten. Ein Abonnement ist dafür nicht erforderlich, abgerechnet wird ausschließlich die tatsächlich verarbeitete Anfrage, unabhängig davon, ob es sich um eine kurze Meldung oder eine ausführliche Reportage mit mehreren tausend Wörtern und vielen Zwischenüberschriften auf der ursprünglichen Seite handelt.

Pressespiegel für die Geschäftsführung

Anna Hoffmann stellt jeden Morgen einen Pressespiegel aus mehreren Artikeln über die eigene Branche zusammen, ohne aus jeder Seite Werbung und Kommentare von Hand zu entfernen.

Fundstücke für einen internen Newsletter

Weber Metallbau GmbH sammelt Fachartikel über neue Vorschriften im Metallbau für den monatlichen Mitarbeiter-Newsletter.

Interview für die Ablage archivieren

Ein Kommunikationsteam sichert ein Interview mit der eigenen Geschäftsführung als reinen Artikeltext, ohne die umliegende Werbung der Zeitschriften-Webseite.

Erkennt die Funktion auch Autor und Datum?

Sofern die Seite diese Angaben enthält, ja; bei Seiten ohne saubere Auszeichnung können sie fehlen.

Was, wenn die Seite gar kein Artikel ist, etwa eine Produktseite?

Dann liefert die Erkennung möglicherweise nicht den gewünschten Ausschnitt; für solche Seiten eignen sich die reine Textextraktion oder die Markdown-Umwandlung besser.

Bleibt die Kommentarspalte erhalten?

Nein, Kommentare, Empfehlungen und Werbung werden gezielt herausgefiltert, übrig bleibt der Artikel selbst.

Was kostet das Extrahieren eines Artikels?

$0.040 pro Anfrage plus $0.001 pro URL, unabhängig von der Länge des Artikels.

Darf ich fremde Artikel für einen internen Pressespiegel verwenden?

Für den internen Gebrauch im eigenen Unternehmen ist das üblich, für eine öffentliche Weiterveröffentlichung gilt weiterhin das Urheberrecht der jeweiligen Redaktion.

Wird der Artikel bei Ihnen gespeichert?

Nein, er wird ausschließlich zur Erstellung des Ergebnisses geladen und danach nicht dauerhaft vorgehalten.

Alles auf dieser Seite ist auch per API verfügbar. Dieser Abschnitt richtet sich an Teams, die es in ihre eigenen Systeme einbinden möchten; alle anderen nutzen einfach das Tool oben.

POSThttps://api.kit.forhosting.com/web/article

Authentifizierung per Bearer-Token. Ein einziger POST stellt die Aufgabe in die Warteschlange; das Ergebnis erhalten Sie per Webhook oder über einen signierten Link.

curl -X POST https://api.kit.forhosting.com/web/article \
  -H "Authorization: Bearer $KIT_KEY" \
  -H "Content-Type: application/json" \
  -d '{"url":"https://ejemplo.com"}'
{
  "url": "https://ejemplo.com"
}
{
  "task_id": "tsk_a1b2c3d4e5f6a1b2c3d4e5f6",
  "type": "web.article",
  "status": "queued",
  "_links": {
    "result": "/tasks/tsk_…/result"
  }
}

Die API arbeitet asynchron: Sie erhalten sofort eine task_id. Polling ist mit 1 Anfrage pro Sekunde erlaubt.

pro Anfrage$0.040
pro URL$0.001

Der Preis steht auf der Seite – keine Tokens, keine Credits. Fehlgeschlagene Aufgaben werden nicht berechnet.

timeout_sec30
max_crawl_pages25
HTTPCodeBedeutung
401unauthorizedDer API-Schlüssel fehlt oder ist ungültig – prüfen Sie den Authorization-Header (Bearer).
402insufficient_balanceIhr Guthaben reicht für diese Aufgabe nicht aus – Aufladungen verfallen nicht.
404unknown_typeUnbekannter Aufgabentyp – prüfen Sie das Feld „type“ gegen den Katalog.
429rate_limitedZu viele Anfragen – warten Sie kurz; Polling ist mit 1 Anfrage pro Sekunde erlaubt.
422task_failedDie Aufgabe ist fehlgeschlagen und wird nicht berechnet.

Vollständige KIT-Dokumentation lesen →