Text-Embeddings erstellen
KIT wandelt einen Text in ein Embedding um: eine Zahlenrepräsentation, die die inhaltliche Bedeutung des Textes abbildet und sich für semantische Suche, Empfehlungen oder Gruppierung weiterverwenden lässt. Gedacht für Entwicklerinnen und Entwickler, die eigene Inhalte mit KI durchsuchbar oder vergleichbar machen wollen, ohne ein eigenes Sprachmodell zu betreiben.
Online ausführen
Führen Sie dies mit Ihrem Konto auf unseren Servern aus. Kostenlose Tools laufen in Ihrem Browser; dieses wird zum oben genannten Preis von Ihrem KIT-Guthaben abgebucht.
Was ein Embedding ist
Ein Embedding ist eine Liste von Zahlen, die die Bedeutung eines Textes so darstellt, dass ähnliche Inhalte auch rechnerisch nahe beieinanderliegen. Zwei Sätze mit demselben Sinn, aber unterschiedlichen Wörtern, erhalten ähnliche Embeddings; ein Computer kann damit inhaltliche Nähe messen, ohne die Sprache selbst zu verstehen. Genau darauf baut semantische Suche auf, und genau deshalb liefert sie auch dann noch Treffer, wenn Anfrage und Text kein einziges gemeinsames Wort teilen.
Wie die Umwandlung abläuft
Sie senden den Text per API oder laden ihn auf dieser Seite hoch; KIT zerlegt ihn bei Bedarf in Abschnitte und gibt für jeden Abschnitt einen eigenen Vektor zurück. Die Aufgabe läuft asynchron: Sie erhalten sofort eine Vorgangsnummer und das fertige Ergebnis, sobald die Berechnung abgeschlossen ist – bei kurzen Texten meist innerhalb weniger Sekunden, bei umfangreicheren Anfragen entsprechend später, abhängig von Textmenge und aktueller Auslastung.
Grenzen der Funktion
Pro Anfrage verarbeitet KIT bis zu 20.000 Token; für größere Textmengen bietet sich die Stapelverarbeitung mehrerer Texte in einem einzigen Durchgang an. Das Embedding selbst enthält keine Erklärung, warum zwei Texte ähnlich sind – es liefert nur die Zahlen, mit denen sich eine Suche oder ein Vergleich später aufbauen lässt. Wer eine nachvollziehbare Begründung für einen Treffer braucht, muss diese aus dem Originaltext ableiten, nicht aus dem Vektor selbst.
Was Sie mit dem Ergebnis anfangen
Die Vektoren lassen sich in einer eigenen Datenbank speichern oder direkt an die Funktionen für semantische Suche, Empfehlungen oder Gruppierung weiterreichen, die auf denselben Embeddings aufbauen. So entsteht aus reinem Text die Grundlage für eine durchsuchbare Wissensbasis, ohne dass Sie selbst ein Sprachmodell betreiben oder eine eigene Infrastruktur für die Berechnung von Ähnlichkeiten aufbauen müssen. Ein einmal berechnetes Embedding lässt sich beliebig oft weiterverwenden, solange sich der Text nicht ändert.
Anwendungsfälle
Wissensdatenbank für den Kundensupport
Schneider IT-Systeme GmbH & Co. KG wandelt ihre internen Anleitungen in Embeddings um, um sie später über eine semantische Suche für den Support auffindbar zu machen.
Produktbeschreibungen vergleichbar machen
Ein Online-Shop aus Leipzig erstellt Embeddings für alle Produkttexte, um später ähnliche Artikel automatisch vorzuschlagen.
Rechtstexte vorbereiten
Eine Kanzlei in Hamburg wandelt Vertragsklauseln in Embeddings um, um sie in einer eigenen Datenbank nach inhaltlicher Ähnlichkeit statt nach Stichwort zu durchsuchen.
Häufige Fragen
Was kostet die Umwandlung eines Textes in ein Embedding?
$0.002 pro Anfrage plus $0.0015 je 1.000 Token. Ein Text mit 5.000 Token kostet damit rund $0.0095.
Was passiert mit meinem Text nach der Berechnung?
Er wird ausschließlich zur Berechnung des Embeddings verwendet und nicht dauerhaft gespeichert oder veröffentlicht.
Brauche ich ein Konto?
Nein. Es gibt derzeit keine Konten – Sie zahlen pro Nutzung, direkt über PayPal oder per Rechnung nach Absprache.
Wie viel Text kann ich auf einmal verarbeiten?
Bis zu 20.000 Token pro Anfrage. Für größere Mengen eignet sich die Stapelverarbeitung mehrerer Texte.
In welchem Format erhalte ich das Ergebnis?
Als Liste von Zahlen (Vektor) im JSON-Format, direkt weiterverwendbar für eigene Datenbanken oder die semantische Suche von KIT.
Kann ich damit auch mehrsprachige Texte verarbeiten?
Ja, das zugrunde liegende Sprachmodell verarbeitet mehrere Sprachen; die Ähnlichkeit lässt sich auch sprachübergreifend berechnen.
Für Entwickler — API-Zugang
Alles auf dieser Seite ist auch per API verfügbar. Dieser Abschnitt richtet sich an Teams, die es in ihre eigenen Systeme einbinden möchten; alle anderen nutzen einfach das Tool oben.
Endpunkt
Authentifizierung per Bearer-Token. Ein einziger POST stellt die Aufgabe in die Warteschlange; das Ergebnis erhalten Sie per Webhook oder über einen signierten Link.
Aufruf aus Ihrem Stack
curl -X POST https://api.kit.forhosting.com/search/embed \
-H "Authorization: Bearer $KIT_KEY" \
-H "Content-Type: application/json" \
-d '{"text":"…"}'const res = await fetch("https://api.kit.forhosting.com/search/embed", {
method: "POST",
headers: {
"Authorization": `Bearer ${process.env.KIT_KEY}`,
"Content-Type": "application/json"
},
body: JSON.stringify({
"text": "…"
})
});
const { task_id } = await res.json();import os, requests
res = requests.post(
"https://api.kit.forhosting.com/search/embed",
headers={"Authorization": f"Bearer {os.environ['KIT_KEY']}"},
json={
"text": "…"
},
)
task_id = res.json()["task_id"]<?php
$res = file_get_contents("https://api.kit.forhosting.com/search/embed", false, stream_context_create([
"http" => [
"method" => "POST",
"header" => "Authorization: Bearer " . getenv("KIT_KEY") . "\r\nContent-Type: application/json",
"content" => '{"text":"…"}',
],
]));
$task = json_decode($res, true);body := bytes.NewBufferString(`{"text":"…"}`)
req, _ := http.NewRequest("POST", "https://api.kit.forhosting.com/search/embed", body)
req.Header.Set("Authorization", "Bearer "+os.Getenv("KIT_KEY"))
req.Header.Set("Content-Type", "application/json")
res, _ := http.DefaultClient.Do(req)Beispiel-Anfrage
{
"text": "…"
}Beispiel-Antwort
{
"task_id": "tsk_a1b2c3d4e5f6a1b2c3d4e5f6",
"type": "search.embed",
"status": "queued",
"_links": {
"result": "/tasks/tsk_…/result"
}
}Die API arbeitet asynchron: Sie erhalten sofort eine task_id. Polling ist mit 1 Anfrage pro Sekunde erlaubt.
Preis
Der Preis steht auf der Seite – keine Tokens, keine Credits. Fehlgeschlagene Aufgaben werden nicht berechnet.
Limits
max_chunks | 10000 |
max_tokens | 20000 |
Fehler
| HTTP | Code | Bedeutung |
|---|---|---|
401 | unauthorized | Der API-Schlüssel fehlt oder ist ungültig – prüfen Sie den Authorization-Header (Bearer). |
402 | insufficient_balance | Ihr Guthaben reicht für diese Aufgabe nicht aus – Aufladungen verfallen nicht. |
404 | unknown_type | Unbekannter Aufgabentyp – prüfen Sie das Feld „type“ gegen den Katalog. |
429 | rate_limited | Zu viele Anfragen – warten Sie kurz; Polling ist mit 1 Anfrage pro Sekunde erlaubt. |