ForHosting KIT · Semantische Suche

Ähnliche Dokumente finden

KIT nimmt ein Dokument oder einen Textabschnitt und findet im eigenen Index die Einträge, die ihm inhaltlich am ähnlichsten sind. Gedacht für alle, die in einem größeren Archiv Duplikate, Vorlagen oder vergleichbare Fälle suchen, ohne jeden Ordner einzeln durchzusehen oder jedes Dokument von Hand mit den übrigen zu vergleichen.

● Stabilpro Anfrage + pro Abfrage$0.002
Nutzen Sie es über WebAPIE-MailApp baldTelegram bald

Führen Sie dies mit Ihrem Konto auf unseren Servern aus. Kostenlose Tools laufen in Ihrem Browser; dieses wird zum oben genannten Preis von Ihrem KIT-Guthaben abgebucht.

Was die Funktion von der Suche unterscheidet

Bei der semantischen Suche ist die Anfrage ein kurzer Suchbegriff; hier ist die Anfrage selbst ein ganzes Dokument oder ein längerer Abschnitt. KIT vergleicht dessen Embedding mit allen Einträgen im Index und gibt die ähnlichsten zurück, statt auf eine kurze, gezielte Frage zu antworten. Das eignet sich besonders, wenn der Ausgangspunkt der Suche selbst schon ein vollständiger Text ist. Für eine kurze, gezielte Frage eignet sich dagegen weiterhin die semantische Suche besser.

Ablauf einer Anfrage

Sie geben ein Dokument oder eine Dokument-ID aus dem Index an; KIT berechnet die Ähnlichkeit zu allen übrigen Einträgen und liefert eine sortierte Liste der nächstliegenden Treffer samt Ähnlichkeitswert zurück. Je höher der Wert, desto näher liegt ein Treffer inhaltlich am Ausgangsdokument; bei sehr hohen Werten handelt es sich häufig um Duplikate oder nur geringfügig veränderte Fassungen. Ein niedrigerer Wert weist dagegen eher auf ein thematisch verwandtes, aber eigenständiges Dokument hin.

Typische Anwendungsfälle

Besonders nützlich ist das bei der Suche nach Vertragsvorlagen mit ähnlichem Inhalt, bei der Erkennung möglicher Duplikate in einem Archiv oder beim Zusammenführen von Dokumenten aus mehreren Quellen, die inhaltlich überlappen. Auch beim Aufräumen eines gewachsenen Archivs, in dem sich über Jahre ähnliche Fassungen desselben Dokuments angesammelt haben, hilft die Funktion, den Überblick wiederherzustellen. So lassen sich verstreute Fassungen desselben Inhalts gezielt zusammenführen oder aussortieren.

Preis pro Anfrage

$0.002 pro Anfrage plus $0.0015 pro Abfrage, insgesamt $0.0035, unabhängig von der Größe des durchsuchten Index. Ein Archiv mit hundert oder mit zehntausend Dokumenten kostet pro Anfrage also gleich viel, da sich der Preis allein nach der einzelnen Suche richtet und nicht nach dem Umfang der zugrunde liegenden Sammlung, was auch für sehr große Archive kalkulierbar bleibt. Das gilt selbst dann, wenn der Index über die Zeit stetig weiterwächst.

Ähnliche Verträge finden

Eine Kanzlei in Hamburg lässt zu einem neuen Vertrag automatisch ähnliche frühere Verträge aus dem Archiv finden, um sich an bewährten Formulierungen zu orientieren.

Duplikate im Dokumentenarchiv

Ein Handwerksbetrieb prüft ein neu eingescanntes Dokument gegen das bestehende Archiv, um zu erkennen, ob es bereits inhaltlich vorliegt.

Vergleichbare Support-Fälle

Ein Softwareunternehmen findet zu einer neuen Supportanfrage automatisch inhaltlich ähnliche, bereits gelöste Fälle im Archiv.

Was kostet die Suche nach ähnlichen Dokumenten?

$0.002 pro Anfrage plus $0.0015 pro Abfrage, insgesamt $0.0035.

Muss das Vergleichsdokument bereits im Index liegen?

Nein, Sie können auch ein neues, noch nicht indexiertes Dokument als Anfrage senden; verglichen wird gegen den bestehenden Index.

Wie viele ähnliche Dokumente liefert eine Anfrage?

Die Anzahl lässt sich einstellen; als Ausgangswert liefert die Funktion die am besten passenden Treffer zuerst.

Eignet sich das zur Duplikaterkennung?

Ja, ein sehr hoher Ähnlichkeitswert weist typischerweise auf ein Duplikat oder eine Vorlage mit nur kleinen Änderungen hin.

Was passiert mit dem gesendeten Vergleichsdokument?

Es wird nur zur Berechnung der Ähnlichkeit verwendet und nicht automatisch in den Index übernommen.

Brauche ich ein Konto?

Nein. Es gibt derzeit keine Konten – Sie zahlen pro Nutzung.

Alles auf dieser Seite ist auch per API verfügbar. Dieser Abschnitt richtet sich an Teams, die es in ihre eigenen Systeme einbinden möchten; alle anderen nutzen einfach das Tool oben.

POSThttps://api.kit.forhosting.com/search/similar-docs

Authentifizierung per Bearer-Token. Ein einziger POST stellt die Aufgabe in die Warteschlange; das Ergebnis erhalten Sie per Webhook oder über einen signierten Link.

curl -X POST https://api.kit.forhosting.com/search/similar-docs \
  -H "Authorization: Bearer $KIT_KEY" \
  -H "Content-Type: application/json" \
  -d '{"input":"…"}'
{
  "input": "…"
}
{
  "task_id": "tsk_a1b2c3d4e5f6a1b2c3d4e5f6",
  "type": "search.similar_docs",
  "status": "queued",
  "_links": {
    "result": "/tasks/tsk_…/result"
  }
}

Die API arbeitet asynchron: Sie erhalten sofort eine task_id. Polling ist mit 1 Anfrage pro Sekunde erlaubt.

pro Anfrage$0.002
pro Abfrage$0.0015

Der Preis steht auf der Seite – keine Tokens, keine Credits. Fehlgeschlagene Aufgaben werden nicht berechnet.

max_chunks10000
max_tokens20000
HTTPCodeBedeutung
401unauthorizedDer API-Schlüssel fehlt oder ist ungültig – prüfen Sie den Authorization-Header (Bearer).
402insufficient_balanceIhr Guthaben reicht für diese Aufgabe nicht aus – Aufladungen verfallen nicht.
404unknown_typeUnbekannter Aufgabentyp – prüfen Sie das Feld „type“ gegen den Katalog.
429rate_limitedZu viele Anfragen – warten Sie kurz; Polling ist mit 1 Anfrage pro Sekunde erlaubt.

Vollständige KIT-Dokumentation lesen →