ForHosting KIT · Semantische Suche

Text-Embeddings erstellen

KIT wandelt einen Text in ein Embedding um: eine Zahlenrepräsentation, die die inhaltliche Bedeutung des Textes abbildet und sich für semantische Suche, Empfehlungen oder Gruppierung weiterverwenden lässt. Gedacht für Entwicklerinnen und Entwickler, die eigene Inhalte mit KI durchsuchbar oder vergleichbar machen wollen, ohne ein eigenes Sprachmodell zu betreiben.

● Stabilpro Anfrage + pro 1.000 Tokens$0.002
Nutzen Sie es über WebAPIE-MailApp baldTelegram bald

Führen Sie dies mit Ihrem Konto auf unseren Servern aus. Kostenlose Tools laufen in Ihrem Browser; dieses wird zum oben genannten Preis von Ihrem KIT-Guthaben abgebucht.

Was ein Embedding ist

Ein Embedding ist eine Liste von Zahlen, die die Bedeutung eines Textes so darstellt, dass ähnliche Inhalte auch rechnerisch nahe beieinanderliegen. Zwei Sätze mit demselben Sinn, aber unterschiedlichen Wörtern, erhalten ähnliche Embeddings; ein Computer kann damit inhaltliche Nähe messen, ohne die Sprache selbst zu verstehen. Genau darauf baut semantische Suche auf, und genau deshalb liefert sie auch dann noch Treffer, wenn Anfrage und Text kein einziges gemeinsames Wort teilen.

Wie die Umwandlung abläuft

Sie senden den Text per API oder laden ihn auf dieser Seite hoch; KIT zerlegt ihn bei Bedarf in Abschnitte und gibt für jeden Abschnitt einen eigenen Vektor zurück. Die Aufgabe läuft asynchron: Sie erhalten sofort eine Vorgangsnummer und das fertige Ergebnis, sobald die Berechnung abgeschlossen ist – bei kurzen Texten meist innerhalb weniger Sekunden, bei umfangreicheren Anfragen entsprechend später, abhängig von Textmenge und aktueller Auslastung.

Grenzen der Funktion

Pro Anfrage verarbeitet KIT bis zu 20.000 Token; für größere Textmengen bietet sich die Stapelverarbeitung mehrerer Texte in einem einzigen Durchgang an. Das Embedding selbst enthält keine Erklärung, warum zwei Texte ähnlich sind – es liefert nur die Zahlen, mit denen sich eine Suche oder ein Vergleich später aufbauen lässt. Wer eine nachvollziehbare Begründung für einen Treffer braucht, muss diese aus dem Originaltext ableiten, nicht aus dem Vektor selbst.

Was Sie mit dem Ergebnis anfangen

Die Vektoren lassen sich in einer eigenen Datenbank speichern oder direkt an die Funktionen für semantische Suche, Empfehlungen oder Gruppierung weiterreichen, die auf denselben Embeddings aufbauen. So entsteht aus reinem Text die Grundlage für eine durchsuchbare Wissensbasis, ohne dass Sie selbst ein Sprachmodell betreiben oder eine eigene Infrastruktur für die Berechnung von Ähnlichkeiten aufbauen müssen. Ein einmal berechnetes Embedding lässt sich beliebig oft weiterverwenden, solange sich der Text nicht ändert.

Wissensdatenbank für den Kundensupport

Schneider IT-Systeme GmbH & Co. KG wandelt ihre internen Anleitungen in Embeddings um, um sie später über eine semantische Suche für den Support auffindbar zu machen.

Produktbeschreibungen vergleichbar machen

Ein Online-Shop aus Leipzig erstellt Embeddings für alle Produkttexte, um später ähnliche Artikel automatisch vorzuschlagen.

Rechtstexte vorbereiten

Eine Kanzlei in Hamburg wandelt Vertragsklauseln in Embeddings um, um sie in einer eigenen Datenbank nach inhaltlicher Ähnlichkeit statt nach Stichwort zu durchsuchen.

Was kostet die Umwandlung eines Textes in ein Embedding?

$0.002 pro Anfrage plus $0.0015 je 1.000 Token. Ein Text mit 5.000 Token kostet damit rund $0.0095.

Was passiert mit meinem Text nach der Berechnung?

Er wird ausschließlich zur Berechnung des Embeddings verwendet und nicht dauerhaft gespeichert oder veröffentlicht.

Brauche ich ein Konto?

Nein. Es gibt derzeit keine Konten – Sie zahlen pro Nutzung, direkt über PayPal oder per Rechnung nach Absprache.

Wie viel Text kann ich auf einmal verarbeiten?

Bis zu 20.000 Token pro Anfrage. Für größere Mengen eignet sich die Stapelverarbeitung mehrerer Texte.

In welchem Format erhalte ich das Ergebnis?

Als Liste von Zahlen (Vektor) im JSON-Format, direkt weiterverwendbar für eigene Datenbanken oder die semantische Suche von KIT.

Kann ich damit auch mehrsprachige Texte verarbeiten?

Ja, das zugrunde liegende Sprachmodell verarbeitet mehrere Sprachen; die Ähnlichkeit lässt sich auch sprachübergreifend berechnen.

Alles auf dieser Seite ist auch per API verfügbar. Dieser Abschnitt richtet sich an Teams, die es in ihre eigenen Systeme einbinden möchten; alle anderen nutzen einfach das Tool oben.

POSThttps://api.kit.forhosting.com/search/embed

Authentifizierung per Bearer-Token. Ein einziger POST stellt die Aufgabe in die Warteschlange; das Ergebnis erhalten Sie per Webhook oder über einen signierten Link.

curl -X POST https://api.kit.forhosting.com/search/embed \
  -H "Authorization: Bearer $KIT_KEY" \
  -H "Content-Type: application/json" \
  -d '{"text":"…"}'
{
  "text": "…"
}
{
  "task_id": "tsk_a1b2c3d4e5f6a1b2c3d4e5f6",
  "type": "search.embed",
  "status": "queued",
  "_links": {
    "result": "/tasks/tsk_…/result"
  }
}

Die API arbeitet asynchron: Sie erhalten sofort eine task_id. Polling ist mit 1 Anfrage pro Sekunde erlaubt.

pro Anfrage$0.002
pro 1.000 Tokens$0.0015

Der Preis steht auf der Seite – keine Tokens, keine Credits. Fehlgeschlagene Aufgaben werden nicht berechnet.

max_chunks10000
max_tokens20000
HTTPCodeBedeutung
401unauthorizedDer API-Schlüssel fehlt oder ist ungültig – prüfen Sie den Authorization-Header (Bearer).
402insufficient_balanceIhr Guthaben reicht für diese Aufgabe nicht aus – Aufladungen verfallen nicht.
404unknown_typeUnbekannter Aufgabentyp – prüfen Sie das Feld „type“ gegen den Katalog.
429rate_limitedZu viele Anfragen – warten Sie kurz; Polling ist mit 1 Anfrage pro Sekunde erlaubt.

Vollständige KIT-Dokumentation lesen →