ForHosting KIT · Text & KI

Häufige Stoppwörter online aus Text entfernen

Stoppwörter sind häufige Strukturwörter wie Artikel, Konjunktionen, Pronomen und kurze Präpositionen.

● BetaKostenlos · im Browser
Nutzen Sie es über WebAPIE-MailTelegramApp bald

In gewöhnlichen Texten sind sie unverzichtbar, bei der Vorbereitung von Suchbegriffen, der Themenanalyse oder einem einfachen Ablauf zur Textverarbeitung erzeugen sie jedoch oft unnötiges Rauschen. Dieses Werkzeug wählt anhand des von Ihnen angegebenen Sprachcodes eine geprüfte Liste aus, zerlegt den Text einheitlich, entfernt passende Stoppwörter ohne die Schreibweise der übrigen Wörter zu verändern und gibt sowohl den bereinigten Text als auch nützliche Prüfsummen zurück.

Wählen Sie die zum Text passende Sprache

Stoppwörter sind sprachabhängig. Der Sprachcode ist deshalb ein wesentlicher Teil des Vorgangs und keine bloße Anzeigeeinstellung. Im Englischen kommen Wörter wie „the“, „is“ und „and“ besonders häufig vor, während Deutsch, Spanisch, Französisch, Italienisch und Portugiesisch jeweils andere Artikel, Pronomen, Kontraktionen und Präpositionen verwenden. Geben Sie einen der unterstützten zweistelligen Codes an: en, es, fr, de, it oder pt. Die Fähigkeit verwendet ausschließlich die dazugehörige geprüfte Liste. Sie versucht nicht, die Sprache zu erraten, denn kurze Texte können mehrdeutig sein und eine falsche Erkennung könnte wichtige Begriffe unbemerkt entfernen. Ein unbekannter Code führt zu einer eindeutigen Eingabefehlermeldung, anstatt ersatzweise Englisch anzuwenden. Teilen Sie mehrsprachiges Material zunächst in Abschnitte auf und verarbeiten Sie jeden Abschnitt mit dem tatsächlichen Code. Dadurch bleibt das Ergebnis nachvollziehbar und reproduzierbar. Zugleich wird verhindert, dass ein gewöhnliches Wort nur deshalb entfällt, weil es einem Stoppwort in einer anderen Sprache ähnelt. Bewahren Sie den Ausgangstext auf, wenn das Ergebnis redaktionelle oder analytische Entscheidungen beeinflusst.

Verstehen Sie Auswahl und Ausgabe der Wörter

Der Algorithmus normalisiert die Eingabe in eine stabile Unicode-Form und erkennt Folgen aus Buchstaben oder Zahlen, einschließlich Wörtern mit einem geraden oder typografischen Apostroph im Inneren. Beim Abgleich mit der Liste wird Groß- und Kleinschreibung ignoriert; beibehaltene Wörter bewahren jedoch ihre ursprüngliche Schreibweise. Satzzeichen erscheinen nicht im bereinigten Text, da die gewünschte Ausgabe eine Folge bedeutungstragender Wörter und kein neu formulierter Satz ist. Die Antwort enthält eine geordnete Wortliste, dieselben Wörter als praktische, durch Leerzeichen verbundene Zeichenfolge sowie Zähler für eingegebene, entfernte und verbleibende Wörter. Damit lassen sich Stapelverarbeitungen leicht prüfen und die Wirkung einer Stoppwortliste auf einen Abschnitt messen. Das Verfahren ist bewusst deterministisch: Gleiche Eingaben liefern ohne Modell, Spracherkennung, Netzwerkzugriff, Zufall oder verborgenen Kontext stets gleiche Ergebnisse. Eine Stoppwortliste ist eine praktische Konvention und kein allgemeingültiges Sprachgesetz. Prüfen Sie daher die entfernten und erhaltenen Begriffe, wenn Fachvokabular eine besondere Rolle spielt.

Nutzen Sie bereinigte Wörter in praktischen Abläufen

Bereinigte Wortfolgen eignen sich als frühe Umwandlung, wenn ein nachfolgender Schritt eher das Thema als die grammatische Struktur hervorheben soll. Sie können die Wörter an eine Häufigkeitsanalyse übergeben, den Wortschatz mehrerer Dokumente vergleichen, mögliche Schlagwörter vorbereiten, wiederkehrende Themen in Umfrageantworten untersuchen oder Rauschen in einem einfachen Suchindex reduzieren. Die Ausgabe ersetzt weder Stemming und Lemmatisierung noch Entitätserkennung, Stimmungsanalyse oder eine vollständige Sprachverarbeitung. Sie führt verwandte Wortformen nicht zusammen, erschließt keine Bedeutung aus dem Kontext und rekonstruiert nach dem Filtern keinen grammatischen Fließtext. Betrachten Sie das Ergebnis als transparente Merkmalsmenge, deren Reihenfolge weiterhin der Quelle folgt. Prüfen Sie bei automatisierten Abläufen die Zähler und speichern Sie den Sprachcode zusammen mit dem Ergebnis, damit die Umwandlung später reproduziert werden kann. Die Verarbeitung per API beginnt bei $0.002 pro Element; im Browser wird dieselbe reine Logik ausgeführt. Verwenden Sie den verbundenen Text nicht als Zitat, da Satzzeichen und Strukturwörter absichtlich entfernt wurden.

Mögliche Schlüsselbegriffe vorbereiten

Entfernen Sie grammatisches Füllmaterial, bevor Sie die treffendsten Begriffe für einen Artikel, eine Notiz oder ein Produkt prüfen.

Dokumentwortschatz vergleichen

Erstellen Sie einheitliche Listen wichtiger Wörter, bevor Sie wiederkehrenden Wortschatz in gleichsprachigen Texten zählen.

Umfrageantworten bereinigen

Reduzieren Sie Strukturwörter, damit wiederkehrende Themen in kurzen Freitextantworten leichter erkennbar werden.

Welche Sprachen werden unterstützt?

Englisch (en), Spanisch (es), Französisch (fr), Deutsch (de), Italienisch (it) und Portugiesisch (pt). Jeder andere Code erzeugt einen Eingabefehler.

Erkennt das Werkzeug die Sprache automatisch?

Nein. Sie geben den Sprachcode ausdrücklich an, damit der Vorgang vorhersehbar bleibt und nicht unbemerkt die falsche Liste verwendet.

Bleibt die Großschreibung erhalten?

Ja. Der Abgleich ignoriert Groß- und Kleinschreibung, doch jedes beibehaltene Wort behält seine ursprüngliche Schreibweise.

Was geschieht mit Satzzeichen?

Sie werden bei der Zerlegung ausgeschlossen. Das Ergebnis enthält eine geordnete Liste wichtiger Wörter und einen durch Leerzeichen verbundenen Text.

Führt das Werkzeug Stemming oder Lemmatisierung durch?

Nein. Es entfernt nur aufgeführte Stoppwörter und verbindet keine Wortformen, ermittelt keine Wortstämme und analysiert keine Grammatik.

Was kostet die Verarbeitung per API?

Die API-Verarbeitung beginnt bei $0.002 pro Element. Die Fähigkeit lässt sich mit derselben deterministischen Logik auch im Browser ausführen.

Alles auf dieser Seite ist auch per API verfügbar. Dieser Abschnitt richtet sich an Teams, die es in ihre eigenen Systeme einbinden möchten; alle anderen nutzen einfach das Tool oben.

POSThttps://api.kit.forhosting.com/text/remove-stopwords

Authentifizierung per Bearer-Token. Ein einziger POST stellt die Aufgabe in die Warteschlange; das Ergebnis erhalten Sie per Webhook oder über einen signierten Link.

curl -X POST https://api.kit.forhosting.com/text/remove-stopwords \
  -H "Authorization: Bearer $KIT_KEY" \
  -H "Content-Type: application/json" \
  -d '{"text":"The quick brown fox jumps over the lazy dog and runs into the forest.","language":"en"}'
{
  "text": "The quick brown fox jumps over the lazy dog and runs into the forest.",
  "language": "en"
}
{
  "task_id": "tsk_a1b2c3d4e5f6a1b2c3d4e5f6",
  "type": "text.remove_stopwords",
  "status": "queued",
  "_links": {
    "result": "/tasks/tsk_…/result"
  }
}

Die API arbeitet asynchron: Sie erhalten sofort eine task_id. Polling ist mit 1 Anfrage pro Sekunde erlaubt.

pro Anfrage$0.002

Der Preis steht auf der Seite – keine Tokens, keine Credits. Fehlgeschlagene Aufgaben werden nicht berechnet.

max_tokens20000
HTTPCodeBedeutung
401unauthorizedDer API-Schlüssel fehlt oder ist ungültig – prüfen Sie den Authorization-Header (Bearer).
402insufficient_balanceIhr Guthaben reicht für diese Aufgabe nicht aus – Aufladungen verfallen nicht.
404unknown_typeUnbekannter Aufgabentyp – prüfen Sie das Feld „type“ gegen den Katalog.
429rate_limitedZu viele Anfragen – warten Sie kurz; Polling ist mit 1 Anfrage pro Sekunde erlaubt.

Vollständige KIT-Dokumentation lesen →