ForHosting KIT · PDF e documentos

Extrair texto de PDF

Esta ferramenta puxa todo o texto de um PDF e devolve o conteúdo puro, sem formatação, pronto para indexar, analisar ou colar onde você precisar. Funciona com documentos digitais — aqueles em que dá para selecionar o texto — e processa até 200 páginas de uma vez por US$ 0,002 a chamada.

● Estávelpor páginaUS$ 0,002
Use pelo WebAPIE-mailApp em breveTelegram em breve

Rode nos nossos servidores com a sua conta. As ferramentas grátis rodam no seu navegador; esta aqui é descontada do seu saldo do KIT pelo preço acima.

Digital sim, escaneado não

Um PDF digital carrega o texto dentro de si: é o caso de contratos gerados no computador, faturas emitidas por sistema, artigos baixados da internet. Um PDF escaneado é fotografia de papel — não tem texto embutido, e esta extração devolverá pouco ou nada dele. O teste é simples: se você consegue selecionar o texto com o mouse no seu leitor, a extração funciona. Se não consegue, o documento precisa de reconhecimento óptico, que é outra etapa.

O que fazer com o texto extraído

Texto puro é matéria-prima universal: alimenta a busca interna do seu sistema, entra em planilhas de conferência, serve de insumo para análise com IA, permite localizar cláusulas em centenas de contratos de uma vez. Também resolve o incômodo cotidiano de copiar conteúdo de um PDF que embaralha a seleção — a extração devolve o texto corrido, na ordem das páginas, sem você brigar com o mouse.

Extração em lote

O fluxo em escala é o ponto forte: uma chamada por documento, e a pasta inteira de PDFs vira uma base de texto pesquisável. Um acervo de 3.000 contratos custa US$ 6 para extrair por completo. Cada arquivo pode ter até 25 MB e 200 páginas; acima disso, divida o documento antes de enviar.

Preço sem letra miúda

US$ 0,002 por chamada — o preço publicado é o cobrado, sem assinatura, franquia ou surpresa. Não há versão grátis desta capacidade: ela existe para rodar dentro de sistemas, via API, e o modelo é pagar por uso. Para estimar seu custo mensal, multiplique o número de documentos processados por US$ 0,002 e pronto: essa é a conta inteira.

Conferência de faturas no escritório contábil

Um contador de Porto Alegre extrai o texto das faturas em PDF dos clientes e cruza os valores com a planilha de lançamentos. O que era conferência visual, linha por linha, virou verificação automática.

Busca interna em contratos

O jurídico da Distribuidora Horizonte Verde extraiu o texto de todos os contratos ativos. Hoje, localizar quais deles citam “reajuste pelo IPCA” é uma busca de segundos, não uma tarde de leitura.

Insumo para análise com IA

Uma startup alimenta seu assistente interno com o conteúdo de manuais e políticas da empresa. O primeiro passo do fluxo é a extração do texto de cada PDF — automática, a cada documento novo.

Pesquisa acadêmica sem retrabalho

Um mestrando extrai o texto de dezenas de artigos para montar seu fichamento. Citações saem limpas, sem as quebras de linha malucas que vêm do copiar-e-colar direto do leitor.

Como sei se meu PDF é digital ou escaneado?

Tente selecionar o texto no leitor: se o cursor marca as palavras, é digital e a extração funciona. Se a seleção vira um retângulo sobre a imagem, é escaneado — e aí o caminho é o reconhecimento óptico, não esta extração.

As tabelas do documento saem organizadas?

Saem como texto corrido, na ordem de leitura — sem a grade. Para tabelas com estrutura preservada, o mais indicado é uma conversão estruturada; a extração pura prioriza velocidade e custo baixo.

Acentos e cedilha vêm corretos?

Sim, o texto é devolvido com a codificação preservada: “ação”, “número” e “São Paulo” saem como devem. Se o PDF de origem tiver fontes corrompidas, o defeito já estava no arquivo — e é raro.

Qual o custo para uma base grande de documentos?

US$ 0,002 por documento: 10.000 PDFs custam US$ 20. Pagamento por uso com preço publicado; não existe plano, mínimo nem taxa de adesão.

O texto dos meus documentos fica com vocês?

Não — o arquivo é processado para devolver o texto e o tratamento termina aí. Nada de reutilização, treinamento ou repasse: finalidade única e dado mínimo, na linha do que a LGPD estabelece.

Tem limite de páginas por arquivo?

Sim: 200 páginas e 25 MB por documento. Arquivos maiores devem ser divididos antes do envio — o preço por chamada continua o mesmo para cada parte.

Tudo nesta página está disponível via API. Esta seção é para equipes que querem integrar a ferramenta aos próprios sistemas; quem não precisa disso pode simplesmente usar a ferramenta acima.

POSThttps://api.kit.forhosting.com/pdf/to-text

Autenticação por token Bearer. Um único POST coloca a tarefa na fila; o resultado chega por webhook ou link assinado.

curl -X POST https://api.kit.forhosting.com/pdf/to-text \
  -H "Authorization: Bearer $KIT_KEY" \
  -H "Content-Type: application/json" \
  -d '{"pdf":"https://ejemplo.com/documento.pdf"}'
{
  "pdf": "https://ejemplo.com/documento.pdf"
}
{
  "task_id": "tsk_a1b2c3d4e5f6a1b2c3d4e5f6",
  "type": "pdf.to_text",
  "status": "queued",
  "_links": {
    "result": "/tasks/tsk_…/result"
  }
}

A API é assíncrona: cada chamada devolve um task_id na hora. Se preferir polling, consulte o status a até 1 requisição por segundo.

por chamadaUS$ 0,002

Preço publicado, sem tokens nem créditos escondidos. Tarefa que falha não é cobrada.

max_mb25
max_pages200
HTTPCódigoO que significa
401unauthorizedToken ausente ou inválido. Confira o header Authorization.
402insufficient_balanceSaldo insuficiente para esta tarefa. Faça uma recarga e tente de novo.
404unknown_typeEsse tipo de tarefa não existe. Confira o campo type no catálogo.
429rate_limitedMuitas requisições em pouco tempo. Espere um instante e tente de novo.
413input_too_largeA entrada passou do tamanho máximo desta tarefa. Confira os limites publicados.

Ver a documentação completa do KIT →