ForHosting KIT · Ricerca semantica

Documenti simili

Questo strumento parte da un documento e trova, dentro un indice già costruito, quelli più simili per contenuto — non per nome o cartella. Serve per scoprire duplicati mascherati, versioni sovrapposte di uno stesso contratto o articoli che trattano lo stesso tema con parole diverse.

● Stabileper richiesta + per query$0.002
Usalo da WebAPIEmailApp prestoTelegram presto

Esegui questo sui nostri server con il tuo account. Gli strumenti gratuiti girano nel tuo browser; questo viene addebitato sul tuo saldo KIT al prezzo indicato sopra.

Simile per contenuto, non per nome file

Due documenti possono chiamarsi in modo completamente diverso ed essere quasi lo stesso testo, oppure avere nomi identici e parlare di cose distanti tra loro. La ricerca per documenti simili ignora il nome del file e confronta i vettori generati dal contenuto: trova quindi duplicati con nomi diversi e distingue file omonimi che in realtà non c'entrano nulla, cosa che un confronto per nome non potrebbe mai fare.

Da dove parte il confronto

Indichi un documento di riferimento — già presente nell'indice o caricato al momento della richiesta — e il motore restituisce gli altri elementi dell'indice più vicini per significato, ordinati per grado di somiglianza decrescente rispetto al primo. Funziona sull'indice creato con index_text, index_document o index_url: senza un indice preesistente non c'è nulla con cui confrontare il documento di partenza scelto.

Casi in cui torna utile

Ripulire un archivio da contratti quasi identici salvati più volte con nomi diversi, capire quali articoli del blog aziendale si sovrappongono prima di pubblicarne uno nuovo, trovare la versione più recente di un manuale tra tante copie con revisioni minime tra loro nel tempo. In tutti questi casi cercare per parola chiave non basta: serve confrontare il contenuto intero dei documenti coinvolti.

Prezzo per confronto

$0.002 a richiesta più $0.0015 ogni 1.000 token del documento di riferimento, in dollari, senza costi legati al numero di documenti presenti nell'indice consultato per il confronto finale. Dalla pagina del KIT carichi il file da confrontare; via API lo integri in un controllo automatico che gira ogni volta che arriva un documento nuovo nell'archivio aziendale gestito quotidianamente dal team.

I contratti duplicati dello Studio Bianchi

Lo Studio Commercialista Bianchi trova due versioni quasi identiche di un contratto di locazione, salvate con nomi diversi da due collaboratori, ed elimina il duplicato prima di consegnarlo al cliente.

Gli articoli del blog di Tecnoedil Verona

Prima di pubblicare un nuovo articolo tecnico, Tecnoedil Verona S.n.c. verifica che non copra lo stesso argomento di uno già online, evitando contenuti ripetuti sul proprio sito.

I manuali di un'officina meccanica

Un'officina di Torino trova la revisione più aggiornata di un manuale tra cinque copie salvate nel tempo, confrontando il contenuto invece di fidarsi solo della data di modifica del file.

Serve un indice già pronto per usarlo?

Sì, cerca la somiglianza dentro un indice costruito con index_text, index_document o index_url: senza indice non ha nulla da confrontare.

Riconosce documenti quasi identici con testo leggermente diverso?

Sì, la somiglianza si misura sul significato complessivo, quindi piccole differenze di formulazione non impediscono di trovare i documenti vicini.

Quanto costa confrontare un documento?

$0.002 a richiesta più $0.0015 ogni 1.000 token del documento di partenza, in dollari, senza costi aggiuntivi per il numero di risultati restituiti.

Posso confrontare un file che non è ancora nell'indice?

Sì, puoi caricare un documento nuovo come riferimento e cercare i suoi simili tra quelli già indicizzati, anche se il file stesso non viene aggiunto all'indice.

È utile per trovare copie di uno stesso modulo compilate da persone diverse?

Sì, è un caso tipico: moduli con la stessa struttura ma dati diversi risultano comunque simili perché il confronto guarda anche il contenuto testuale ricorrente.

Funziona anche su archivi in più lingue?

Sì, il modello è multilingue: puoi confrontare un documento in italiano con altri scritti in lingue diverse nello stesso indice.

Tutto quello che vedi in questa pagina è disponibile anche via API. Questa sezione è per i team che vogliono integrarlo nei propri sistemi; chi non ne ha bisogno può semplicemente usare lo strumento qui sopra.

POSThttps://api.kit.forhosting.com/search/similar-docs

Autenticazione con Bearer token: un POST mette in coda l'attività e il risultato arriva via webhook o link firmato.

curl -X POST https://api.kit.forhosting.com/search/similar-docs \
  -H "Authorization: Bearer $KIT_KEY" \
  -H "Content-Type: application/json" \
  -d '{"input":"…"}'
{
  "input": "…"
}
{
  "task_id": "tsk_a1b2c3d4e5f6a1b2c3d4e5f6",
  "type": "search.similar_docs",
  "status": "queued",
  "_links": {
    "result": "/tasks/tsk_…/result"
  }
}

L'API è asincrona: ricevi subito un task_id e puoi fare polling fino a 1 richiesta al secondo.

per richiesta$0.002
per query$0.0015

Prezzo pubblicato, senza token né crediti. Se l'attività fallisce, non paghi.

max_chunks10000
max_tokens20000
HTTPCodiceSignificato
401unauthorizedChiave API mancante o non valida: controlla l'header Authorization.
402insufficient_balanceCredito esaurito: ricarica per continuare a eseguire attività.
404unknown_typeTipo di attività sconosciuto: controlla il campo type della richiesta.
429rate_limitedTroppe richieste in poco tempo: rallenta e riprova tra qualche secondo.

Leggi la documentazione completa del KIT →