Come estrarre il testo da un PDF
Questo strumento tira fuori il testo da un PDF e te lo restituisce pulito, pronto da incollare in un editor, da cercare o da dare in pasto a un altro programma. Serve quando devi riusare il contenuto di un documento — una relazione, un contratto, un articolo — senza ridigitarlo parola per parola.
Esegui online
Esegui questo sui nostri server con il tuo account. Gli strumenti gratuiti girano nel tuo browser; questo viene addebitato sul tuo saldo KIT al prezzo indicato sopra.
Il contenuto c’è, ma è bloccato
Molti PDF nascono da Word o da un gestionale e contengono testo vero, non una foto: eppure copiarlo a mano è una pena, tra impaginazioni che si spezzano e formattazioni che si incollano storte. Estrarre il testo salta il problema: recuperi le parole così come sono scritte nel file, ordinate per pagina, e le riusi dove ti servono senza ricopiare né combattere con la selezione che salta da sola.
Testo nativo, non OCR
Questo strumento legge il testo già presente nel PDF: è velocissimo ed economico proprio perché non deve “indovinare” nulla. Se invece il documento è una scansione — una fattura o un contratto fotografati, dove le pagine sono immagini — non c’è testo da estrarre e il risultato sarà vuoto. In quel caso serve l’OCR, che riconosce i caratteri dall’immagine. Sui documenti nati digitali, l’estrazione diretta è la strada giusta e più pulita.
Un uso quotidiano
Francesca Colombo, giornalista, riceve comunicati in PDF e deve citarne dei passaggi. Invece di ribattere le frasi, estrae il testo e incolla la citazione esatta nel suo articolo, senza refusi. Stessa comodità per chi deve riportare una clausola di contratto in una email, alimentare un motore di ricerca interno con il contenuto dei documenti o preparare un testo per la traduzione.
Prezzo e limiti
$0.002 a documento, prezzo pubblicato, senza abbonamento né registrazione. Il file può arrivare a 25 MB e 200 pagine. Lo esegui qui sul sito o via API: quest’ultima è comoda per estrarre in blocco il testo di un archivio, un documento per volta, sommando i centesimi in dollari. Nessun costo nascosto oltre a quello scritto in pagina.
Casi d'uso
Citazioni esatte in un articolo
Una redazione estrae il testo dai comunicati in PDF per riportare le frasi alla lettera, senza il rischio di refusi introdotti ricopiando a mano sotto scadenza.
Clausole da riusare
Uno studio legale di Napoli recupera il testo di clausole ricorrenti dai contratti in PDF per incollarle in nuove bozze, invece di ridigitarle ogni volta.
Ricerca interna sui documenti
Rossi & Figli S.r.l. alimenta il motore di ricerca del gestionale con il testo estratto dai PDF ricevuti, così i documenti diventano ricercabili per parola e non solo per nome del file.
Preparare un testo per la traduzione
Un traduttore estrae il contenuto di un manuale in PDF per lavorarlo nel proprio strumento di traduzione, mantenendo l’ordine delle pagine senza reimpaginare a mano.
Domande frequenti
Funziona con i PDF scansionati?
No: se il documento è una scansione, le pagine sono immagini e non contengono testo da estrarre. In quel caso serve l’OCR, che riconosce i caratteri dall’immagine. Questo strumento è pensato per i PDF nati digitali, con testo selezionabile.
L’impaginazione originale viene mantenuta?
Recuperiamo il testo ordinato per pagina, non l’impaginazione grafica. Se ti serve la struttura — titoli, elenchi, tabelle — conviene la conversione in Markdown, che ricostruisce la gerarchia del documento.
Il documento viene modificato?
No, l’operazione è di sola lettura. Estraiamo il contenuto e ti restituiamo il testo; il PDF originale resta identico.
Come mai costa così poco?
$0.002 a documento perché leggiamo il testo già presente nel file, senza analisi pesanti. È il caso più semplice ed economico: prezzo pubblicato in dollari, a consumo, senza abbonamento.
Gli accenti e le lettere italiane vengono estratti bene?
Sì: à, è, é, ì, ò, ù e i simboli come € vengono recuperati correttamente dai PDF con testo nativo, senza caratteri strani al posto delle accentate.
Posso estrarre il testo da tanti file insieme?
Sì. Oltre alla pagina web c’è l’API, con prezzo a chiamata pubblicato: la richiami una volta per documento ed estrai il testo di un intero archivio. In arrivo anche altri canali come app ed email.
Per sviluppatori — accesso via API
Tutto quello che vedi in questa pagina è disponibile anche via API. Questa sezione è per i team che vogliono integrarlo nei propri sistemi; chi non ne ha bisogno può semplicemente usare lo strumento qui sopra.
Endpoint
Autenticazione con Bearer token: un POST mette in coda l'attività e il risultato arriva via webhook o link firmato.
Chiamala dal tuo stack
curl -X POST https://api.kit.forhosting.com/pdf/to-text \
-H "Authorization: Bearer $KIT_KEY" \
-H "Content-Type: application/json" \
-d '{"pdf":"https://ejemplo.com/documento.pdf"}'const res = await fetch("https://api.kit.forhosting.com/pdf/to-text", {
method: "POST",
headers: {
"Authorization": `Bearer ${process.env.KIT_KEY}`,
"Content-Type": "application/json"
},
body: JSON.stringify({
"pdf": "https://ejemplo.com/documento.pdf"
})
});
const { task_id } = await res.json();import os, requests
res = requests.post(
"https://api.kit.forhosting.com/pdf/to-text",
headers={"Authorization": f"Bearer {os.environ['KIT_KEY']}"},
json={
"pdf": "https://ejemplo.com/documento.pdf"
},
)
task_id = res.json()["task_id"]<?php
$res = file_get_contents("https://api.kit.forhosting.com/pdf/to-text", false, stream_context_create([
"http" => [
"method" => "POST",
"header" => "Authorization: Bearer " . getenv("KIT_KEY") . "\r\nContent-Type: application/json",
"content" => '{"pdf":"https://ejemplo.com/documento.pdf"}',
],
]));
$task = json_decode($res, true);body := bytes.NewBufferString(`{"pdf":"https://ejemplo.com/documento.pdf"}`)
req, _ := http.NewRequest("POST", "https://api.kit.forhosting.com/pdf/to-text", body)
req.Header.Set("Authorization", "Bearer "+os.Getenv("KIT_KEY"))
req.Header.Set("Content-Type", "application/json")
res, _ := http.DefaultClient.Do(req)Esempio di richiesta
{
"pdf": "https://ejemplo.com/documento.pdf"
}Esempio di risposta
{
"task_id": "tsk_a1b2c3d4e5f6a1b2c3d4e5f6",
"type": "pdf.to_text",
"status": "queued",
"_links": {
"result": "/tasks/tsk_…/result"
}
}L'API è asincrona: ricevi subito un task_id e puoi fare polling fino a 1 richiesta al secondo.
Prezzi
Prezzo pubblicato, senza token né crediti. Se l'attività fallisce, non paghi.
Limiti
max_mb | 25 |
max_pages | 200 |
Errori
| HTTP | Codice | Significato |
|---|---|---|
401 | unauthorized | Chiave API mancante o non valida: controlla l'header Authorization. |
402 | insufficient_balance | Credito esaurito: ricarica per continuare a eseguire attività. |
404 | unknown_type | Tipo di attività sconosciuto: controlla il campo type della richiesta. |
429 | rate_limited | Troppe richieste in poco tempo: rallenta e riprova tra qualche secondo. |
413 | input_too_large | Il file o il testo inviato supera il limite di questo strumento. |