Extrair texto de PDF
Esta ferramenta puxa todo o texto de um PDF e devolve o conteúdo puro, sem formatação, pronto para indexar, analisar ou colar onde você precisar. Funciona com documentos digitais — aqueles em que dá para selecionar o texto — e processa até 200 páginas de uma vez por US$ 0,002 a chamada.
Rode online
Rode nos nossos servidores com a sua conta. As ferramentas grátis rodam no seu navegador; esta aqui é descontada do seu saldo do KIT pelo preço acima.
Digital sim, escaneado não
Um PDF digital carrega o texto dentro de si: é o caso de contratos gerados no computador, faturas emitidas por sistema, artigos baixados da internet. Um PDF escaneado é fotografia de papel — não tem texto embutido, e esta extração devolverá pouco ou nada dele. O teste é simples: se você consegue selecionar o texto com o mouse no seu leitor, a extração funciona. Se não consegue, o documento precisa de reconhecimento óptico, que é outra etapa.
O que fazer com o texto extraído
Texto puro é matéria-prima universal: alimenta a busca interna do seu sistema, entra em planilhas de conferência, serve de insumo para análise com IA, permite localizar cláusulas em centenas de contratos de uma vez. Também resolve o incômodo cotidiano de copiar conteúdo de um PDF que embaralha a seleção — a extração devolve o texto corrido, na ordem das páginas, sem você brigar com o mouse.
Extração em lote
O fluxo em escala é o ponto forte: uma chamada por documento, e a pasta inteira de PDFs vira uma base de texto pesquisável. Um acervo de 3.000 contratos custa US$ 6 para extrair por completo. Cada arquivo pode ter até 25 MB e 200 páginas; acima disso, divida o documento antes de enviar.
Preço sem letra miúda
US$ 0,002 por chamada — o preço publicado é o cobrado, sem assinatura, franquia ou surpresa. Não há versão grátis desta capacidade: ela existe para rodar dentro de sistemas, via API, e o modelo é pagar por uso. Para estimar seu custo mensal, multiplique o número de documentos processados por US$ 0,002 e pronto: essa é a conta inteira.
Casos de uso
Conferência de faturas no escritório contábil
Um contador de Porto Alegre extrai o texto das faturas em PDF dos clientes e cruza os valores com a planilha de lançamentos. O que era conferência visual, linha por linha, virou verificação automática.
Busca interna em contratos
O jurídico da Distribuidora Horizonte Verde extraiu o texto de todos os contratos ativos. Hoje, localizar quais deles citam “reajuste pelo IPCA” é uma busca de segundos, não uma tarde de leitura.
Insumo para análise com IA
Uma startup alimenta seu assistente interno com o conteúdo de manuais e políticas da empresa. O primeiro passo do fluxo é a extração do texto de cada PDF — automática, a cada documento novo.
Pesquisa acadêmica sem retrabalho
Um mestrando extrai o texto de dezenas de artigos para montar seu fichamento. Citações saem limpas, sem as quebras de linha malucas que vêm do copiar-e-colar direto do leitor.
Perguntas frequentes
Como sei se meu PDF é digital ou escaneado?
Tente selecionar o texto no leitor: se o cursor marca as palavras, é digital e a extração funciona. Se a seleção vira um retângulo sobre a imagem, é escaneado — e aí o caminho é o reconhecimento óptico, não esta extração.
As tabelas do documento saem organizadas?
Saem como texto corrido, na ordem de leitura — sem a grade. Para tabelas com estrutura preservada, o mais indicado é uma conversão estruturada; a extração pura prioriza velocidade e custo baixo.
Acentos e cedilha vêm corretos?
Sim, o texto é devolvido com a codificação preservada: “ação”, “número” e “São Paulo” saem como devem. Se o PDF de origem tiver fontes corrompidas, o defeito já estava no arquivo — e é raro.
Qual o custo para uma base grande de documentos?
US$ 0,002 por documento: 10.000 PDFs custam US$ 20. Pagamento por uso com preço publicado; não existe plano, mínimo nem taxa de adesão.
O texto dos meus documentos fica com vocês?
Não — o arquivo é processado para devolver o texto e o tratamento termina aí. Nada de reutilização, treinamento ou repasse: finalidade única e dado mínimo, na linha do que a LGPD estabelece.
Tem limite de páginas por arquivo?
Sim: 200 páginas e 25 MB por documento. Arquivos maiores devem ser divididos antes do envio — o preço por chamada continua o mesmo para cada parte.
Para desenvolvedores — acesso via API
Tudo nesta página está disponível via API. Esta seção é para equipes que querem integrar a ferramenta aos próprios sistemas; quem não precisa disso pode simplesmente usar a ferramenta acima.
Endpoint
Autenticação por token Bearer. Um único POST coloca a tarefa na fila; o resultado chega por webhook ou link assinado.
Chame do seu código
curl -X POST https://api.kit.forhosting.com/pdf/to-text \
-H "Authorization: Bearer $KIT_KEY" \
-H "Content-Type: application/json" \
-d '{"pdf":"https://ejemplo.com/documento.pdf"}'const res = await fetch("https://api.kit.forhosting.com/pdf/to-text", {
method: "POST",
headers: {
"Authorization": `Bearer ${process.env.KIT_KEY}`,
"Content-Type": "application/json"
},
body: JSON.stringify({
"pdf": "https://ejemplo.com/documento.pdf"
})
});
const { task_id } = await res.json();import os, requests
res = requests.post(
"https://api.kit.forhosting.com/pdf/to-text",
headers={"Authorization": f"Bearer {os.environ['KIT_KEY']}"},
json={
"pdf": "https://ejemplo.com/documento.pdf"
},
)
task_id = res.json()["task_id"]<?php
$res = file_get_contents("https://api.kit.forhosting.com/pdf/to-text", false, stream_context_create([
"http" => [
"method" => "POST",
"header" => "Authorization: Bearer " . getenv("KIT_KEY") . "\r\nContent-Type: application/json",
"content" => '{"pdf":"https://ejemplo.com/documento.pdf"}',
],
]));
$task = json_decode($res, true);body := bytes.NewBufferString(`{"pdf":"https://ejemplo.com/documento.pdf"}`)
req, _ := http.NewRequest("POST", "https://api.kit.forhosting.com/pdf/to-text", body)
req.Header.Set("Authorization", "Bearer "+os.Getenv("KIT_KEY"))
req.Header.Set("Content-Type", "application/json")
res, _ := http.DefaultClient.Do(req)Exemplo de requisição
{
"pdf": "https://ejemplo.com/documento.pdf"
}Exemplo de resposta
{
"task_id": "tsk_a1b2c3d4e5f6a1b2c3d4e5f6",
"type": "pdf.to_text",
"status": "queued",
"_links": {
"result": "/tasks/tsk_…/result"
}
}A API é assíncrona: cada chamada devolve um task_id na hora. Se preferir polling, consulte o status a até 1 requisição por segundo.
Preço
Preço publicado, sem tokens nem créditos escondidos. Tarefa que falha não é cobrada.
Limites
max_mb | 25 |
max_pages | 200 |
Erros
| HTTP | Código | O que significa |
|---|---|---|
401 | unauthorized | Token ausente ou inválido. Confira o header Authorization. |
402 | insufficient_balance | Saldo insuficiente para esta tarefa. Faça uma recarga e tente de novo. |
404 | unknown_type | Esse tipo de tarefa não existe. Confira o campo type no catálogo. |
429 | rate_limited | Muitas requisições em pouco tempo. Espere um instante e tente de novo. |
413 | input_too_large | A entrada passou do tamanho máximo desta tarefa. Confira os limites publicados. |