Ähnliche Dokumente finden
KIT nimmt ein Dokument oder einen Textabschnitt und findet im eigenen Index die Einträge, die ihm inhaltlich am ähnlichsten sind. Gedacht für alle, die in einem größeren Archiv Duplikate, Vorlagen oder vergleichbare Fälle suchen, ohne jeden Ordner einzeln durchzusehen oder jedes Dokument von Hand mit den übrigen zu vergleichen.
Online ausführen
Führen Sie dies mit Ihrem Konto auf unseren Servern aus. Kostenlose Tools laufen in Ihrem Browser; dieses wird zum oben genannten Preis von Ihrem KIT-Guthaben abgebucht.
Was die Funktion von der Suche unterscheidet
Bei der semantischen Suche ist die Anfrage ein kurzer Suchbegriff; hier ist die Anfrage selbst ein ganzes Dokument oder ein längerer Abschnitt. KIT vergleicht dessen Embedding mit allen Einträgen im Index und gibt die ähnlichsten zurück, statt auf eine kurze, gezielte Frage zu antworten. Das eignet sich besonders, wenn der Ausgangspunkt der Suche selbst schon ein vollständiger Text ist. Für eine kurze, gezielte Frage eignet sich dagegen weiterhin die semantische Suche besser.
Ablauf einer Anfrage
Sie geben ein Dokument oder eine Dokument-ID aus dem Index an; KIT berechnet die Ähnlichkeit zu allen übrigen Einträgen und liefert eine sortierte Liste der nächstliegenden Treffer samt Ähnlichkeitswert zurück. Je höher der Wert, desto näher liegt ein Treffer inhaltlich am Ausgangsdokument; bei sehr hohen Werten handelt es sich häufig um Duplikate oder nur geringfügig veränderte Fassungen. Ein niedrigerer Wert weist dagegen eher auf ein thematisch verwandtes, aber eigenständiges Dokument hin.
Typische Anwendungsfälle
Besonders nützlich ist das bei der Suche nach Vertragsvorlagen mit ähnlichem Inhalt, bei der Erkennung möglicher Duplikate in einem Archiv oder beim Zusammenführen von Dokumenten aus mehreren Quellen, die inhaltlich überlappen. Auch beim Aufräumen eines gewachsenen Archivs, in dem sich über Jahre ähnliche Fassungen desselben Dokuments angesammelt haben, hilft die Funktion, den Überblick wiederherzustellen. So lassen sich verstreute Fassungen desselben Inhalts gezielt zusammenführen oder aussortieren.
Preis pro Anfrage
$0.002 pro Anfrage plus $0.0015 pro Abfrage, insgesamt $0.0035, unabhängig von der Größe des durchsuchten Index. Ein Archiv mit hundert oder mit zehntausend Dokumenten kostet pro Anfrage also gleich viel, da sich der Preis allein nach der einzelnen Suche richtet und nicht nach dem Umfang der zugrunde liegenden Sammlung, was auch für sehr große Archive kalkulierbar bleibt. Das gilt selbst dann, wenn der Index über die Zeit stetig weiterwächst.
Anwendungsfälle
Ähnliche Verträge finden
Eine Kanzlei in Hamburg lässt zu einem neuen Vertrag automatisch ähnliche frühere Verträge aus dem Archiv finden, um sich an bewährten Formulierungen zu orientieren.
Duplikate im Dokumentenarchiv
Ein Handwerksbetrieb prüft ein neu eingescanntes Dokument gegen das bestehende Archiv, um zu erkennen, ob es bereits inhaltlich vorliegt.
Vergleichbare Support-Fälle
Ein Softwareunternehmen findet zu einer neuen Supportanfrage automatisch inhaltlich ähnliche, bereits gelöste Fälle im Archiv.
Häufige Fragen
Was kostet die Suche nach ähnlichen Dokumenten?
$0.002 pro Anfrage plus $0.0015 pro Abfrage, insgesamt $0.0035.
Muss das Vergleichsdokument bereits im Index liegen?
Nein, Sie können auch ein neues, noch nicht indexiertes Dokument als Anfrage senden; verglichen wird gegen den bestehenden Index.
Wie viele ähnliche Dokumente liefert eine Anfrage?
Die Anzahl lässt sich einstellen; als Ausgangswert liefert die Funktion die am besten passenden Treffer zuerst.
Eignet sich das zur Duplikaterkennung?
Ja, ein sehr hoher Ähnlichkeitswert weist typischerweise auf ein Duplikat oder eine Vorlage mit nur kleinen Änderungen hin.
Was passiert mit dem gesendeten Vergleichsdokument?
Es wird nur zur Berechnung der Ähnlichkeit verwendet und nicht automatisch in den Index übernommen.
Brauche ich ein Konto?
Nein. Es gibt derzeit keine Konten – Sie zahlen pro Nutzung.
Für Entwickler — API-Zugang
Alles auf dieser Seite ist auch per API verfügbar. Dieser Abschnitt richtet sich an Teams, die es in ihre eigenen Systeme einbinden möchten; alle anderen nutzen einfach das Tool oben.
Endpunkt
Authentifizierung per Bearer-Token. Ein einziger POST stellt die Aufgabe in die Warteschlange; das Ergebnis erhalten Sie per Webhook oder über einen signierten Link.
Aufruf aus Ihrem Stack
curl -X POST https://api.kit.forhosting.com/search/similar-docs \
-H "Authorization: Bearer $KIT_KEY" \
-H "Content-Type: application/json" \
-d '{"input":"…"}'const res = await fetch("https://api.kit.forhosting.com/search/similar-docs", {
method: "POST",
headers: {
"Authorization": `Bearer ${process.env.KIT_KEY}`,
"Content-Type": "application/json"
},
body: JSON.stringify({
"input": "…"
})
});
const { task_id } = await res.json();import os, requests
res = requests.post(
"https://api.kit.forhosting.com/search/similar-docs",
headers={"Authorization": f"Bearer {os.environ['KIT_KEY']}"},
json={
"input": "…"
},
)
task_id = res.json()["task_id"]<?php
$res = file_get_contents("https://api.kit.forhosting.com/search/similar-docs", false, stream_context_create([
"http" => [
"method" => "POST",
"header" => "Authorization: Bearer " . getenv("KIT_KEY") . "\r\nContent-Type: application/json",
"content" => '{"input":"…"}',
],
]));
$task = json_decode($res, true);body := bytes.NewBufferString(`{"input":"…"}`)
req, _ := http.NewRequest("POST", "https://api.kit.forhosting.com/search/similar-docs", body)
req.Header.Set("Authorization", "Bearer "+os.Getenv("KIT_KEY"))
req.Header.Set("Content-Type", "application/json")
res, _ := http.DefaultClient.Do(req)Beispiel-Anfrage
{
"input": "…"
}Beispiel-Antwort
{
"task_id": "tsk_a1b2c3d4e5f6a1b2c3d4e5f6",
"type": "search.similar_docs",
"status": "queued",
"_links": {
"result": "/tasks/tsk_…/result"
}
}Die API arbeitet asynchron: Sie erhalten sofort eine task_id. Polling ist mit 1 Anfrage pro Sekunde erlaubt.
Preis
Der Preis steht auf der Seite – keine Tokens, keine Credits. Fehlgeschlagene Aufgaben werden nicht berechnet.
Limits
max_chunks | 10000 |
max_tokens | 20000 |
Fehler
| HTTP | Code | Bedeutung |
|---|---|---|
401 | unauthorized | Der API-Schlüssel fehlt oder ist ungültig – prüfen Sie den Authorization-Header (Bearer). |
402 | insufficient_balance | Ihr Guthaben reicht für diese Aufgabe nicht aus – Aufladungen verfallen nicht. |
404 | unknown_type | Unbekannter Aufgabentyp – prüfen Sie das Feld „type“ gegen den Katalog. |
429 | rate_limited | Zu viele Anfragen – warten Sie kurz; Polling ist mit 1 Anfrage pro Sekunde erlaubt. |