ForHosting KIT · Semantische Suche

Ausreißer in Daten erkennen

KIT prüft eine Liste von Texten und markiert die Zeilen, die inhaltlich deutlich vom Rest abweichen – mögliche Fehleingaben, Ausreißer oder untypische Fälle. Die Funktion befindet sich in der Beta-Phase; Treffer sollten vor einer Entscheidung geprüft werden, statt automatisch aus der Liste entfernt zu werden.

● Betapro Anfrage + pro 1.000 Datensätze$0.002
Nutzen Sie es über WebAPIE-MailApp baldTelegram bald

Führen Sie dies mit Ihrem Konto auf unseren Servern aus. Kostenlose Tools laufen in Ihrem Browser; dieses wird zum oben genannten Preis von Ihrem KIT-Guthaben abgebucht.

Wie ein Ausreißer erkannt wird

KIT berechnet für jede Zeile ein Embedding und vergleicht es mit dem Rest der Liste. Zeilen, deren Embedding sich deutlich von der Mehrheit unterscheidet, werden als möglicher Ausreißer markiert, ohne dass vorher definiert werden muss, was „normal“ bedeutet. Die Funktion nutzt dabei dieselbe Grundlage wie die Gruppierung, wertet die Daten aber gezielt auf Abweichungen statt auf gemeinsame Themen aus. Beide Sichtweisen ergänzen sich, wenn sowohl Struktur als auch Fehler in einer Liste interessieren.

Warum die Funktion als Beta gekennzeichnet ist

Was als Ausreißer gilt, hängt stark von der jeweiligen Liste ab; bei sehr uneinheitlichen Daten markiert die Funktion mitunter mehr Zeilen, als tatsächlich fehlerhaft sind. Prüfen Sie markierte Zeilen daher stichprobenartig, statt sie automatisch zu entfernen. Bei einer sehr einheitlichen Liste, etwa standardisierten Bestellungen, fällt die Erkennung erfahrungsgemäß deutlich zuverlässiger aus als bei einer bunt gemischten Sammlung. Je einheitlicher die Ausgangsdaten, desto verlässlicher fällt die Markierung möglicher Ausreißer aus.

Typische Einsatzfälle

Genutzt wird die Funktion etwa, um fehlerhaft erfasste Produktbeschreibungen in einem Katalog zu finden, um untypische Support-Tickets zu erkennen, die möglicherweise eine gesonderte Bearbeitung brauchen, oder um Freitextfelder auf offensichtliche Ausreißer zu prüfen. Auch bei der Qualitätskontrolle importierter Daten aus einer fremden Quelle hilft die Funktion, auffällige Zeilen vor der Übernahme gezielt herauszufiltern. So lassen sich Datenfehler oft schon vor der eigentlichen Weiterverarbeitung erkennen.

Preis nach Zeilenzahl

$0.002 pro Anfrage plus $0.0015 je 1.000 Zeilen, wie bei der Gruppierung. Eine Liste mit 5.000 Zeilen kostet damit rund $0.0095. Da beide Funktionen auf derselben Berechnung beruhen, lassen sich Gruppierung und Ausreißererkennung auch nacheinander auf dieselbe Liste anwenden, ohne die Embeddings ein zweites Mal berechnen zu müssen, was die Kombination beider Funktionen günstiger macht. Beide Anfragen zusammen kosten damit kaum mehr als eine einzelne allein.

Fehlerhafte Produktdaten finden

Ein Online-Shop prüft seinen Produktkatalog auf Beschreibungen, die inhaltlich nicht zur restlichen Kategorie passen, etwa durch einen Kopierfehler.

Untypische Support-Tickets erkennen

Ein Softwareunternehmen lässt untypische Supportanfragen markieren, die möglicherweise eine gesonderte, dringendere Bearbeitung brauchen.

Prüfung von Freitextantworten

Ein Unternehmen prüft die Freitextantworten einer Umfrage auf Einträge, die inhaltlich nicht zu den übrigen Antworten passen, etwa wegen eines Missverständnisses der Frage.

Was bedeutet der Beta-Status bei dieser Funktion?

Die Erkennung ist nutzbar, aber weniger zuverlässig als eine stabile Funktion; prüfen Sie markierte Zeilen stichprobenartig, bevor Sie sie entfernen.

Was kostet die Prüfung von 5.000 Zeilen?

$0.002 pro Anfrage plus $0.0015 je 1.000 Zeilen, bei 5.000 Zeilen also rund $0.0095.

Werden erkannte Ausreißer automatisch gelöscht?

Nein, sie werden nur markiert; die endgültige Entscheidung treffen Sie selbst.

Wie groß darf die Liste sein?

Bis zu 10.000 Zeilen pro Anfrage.

Was passiert mit den gesendeten Daten?

Sie werden nur zur Berechnung verwendet und nicht dauerhaft gespeichert.

Brauche ich ein Konto?

Nein. Es gibt derzeit keine Konten – Sie zahlen pro Nutzung.

Alles auf dieser Seite ist auch per API verfügbar. Dieser Abschnitt richtet sich an Teams, die es in ihre eigenen Systeme einbinden möchten; alle anderen nutzen einfach das Tool oben.

POSThttps://api.kit.forhosting.com/search/outliers

Authentifizierung per Bearer-Token. Ein einziger POST stellt die Aufgabe in die Warteschlange; das Ergebnis erhalten Sie per Webhook oder über einen signierten Link.

curl -X POST https://api.kit.forhosting.com/search/outliers \
  -H "Authorization: Bearer $KIT_KEY" \
  -H "Content-Type: application/json" \
  -d '{"text":"…"}'
{
  "text": "…"
}
{
  "task_id": "tsk_a1b2c3d4e5f6a1b2c3d4e5f6",
  "type": "search.outliers",
  "status": "queued",
  "_links": {
    "result": "/tasks/tsk_…/result"
  }
}

Die API arbeitet asynchron: Sie erhalten sofort eine task_id. Polling ist mit 1 Anfrage pro Sekunde erlaubt.

pro Anfrage$0.002
pro 1.000 Datensätze$0.0015

Der Preis steht auf der Seite – keine Tokens, keine Credits. Fehlgeschlagene Aufgaben werden nicht berechnet.

max_chunks10000
max_tokens20000
HTTPCodeBedeutung
401unauthorizedDer API-Schlüssel fehlt oder ist ungültig – prüfen Sie den Authorization-Header (Bearer).
402insufficient_balanceIhr Guthaben reicht für diese Aufgabe nicht aus – Aufladungen verfallen nicht.
404unknown_typeUnbekannter Aufgabentyp – prüfen Sie das Feld „type“ gegen den Katalog.
429rate_limitedZu viele Anfragen – warten Sie kurz; Polling ist mit 1 Anfrage pro Sekunde erlaubt.

Vollständige KIT-Dokumentation lesen →