ForHosting KIT · Ler texto de imagem (OCR)

PDF escaneado não deixa copiar?

Serviço de OCR de PDF escaneado: recebe um PDF que na verdade é só imagem — digitalização, xerox, processo escaneado — e devolve o texto de cada página, pronto para copiar, buscar e reaproveitar. Feito para quem vive recebendo documentos digitalizados e precisa do conteúdo em texto de verdade, não em fotografia de papel.

● Estávelpor páginaUS$ 0,010
Use pelo WebAPIE-mailApp em breveTelegram em breve

Rode nos nossos servidores com a sua conta. As ferramentas grátis rodam no seu navegador; esta aqui é descontada do seu saldo do KIT pelo preço acima.

Por que seu PDF não deixa copiar o texto

Existem dois tipos de PDF que parecem iguais na tela. O PDF nativo, gerado por um programa, carrega o texto por dentro: dá para selecionar, copiar e buscar. Já o PDF escaneado é uma sequência de fotografias de papel — o Ctrl+F não acha nada porque, para o computador, ali não existe texto, só pixels. É por isso que aquele contrato digitalizado ou aquele processo baixado do tribunal não deixa você copiar um parágrafo sequer. O OCR resolve exatamente isso: lê a imagem de cada página e reconstrói o texto que estava preso nela.

O que você recebe de volta

O texto reconhecido de cada página, na ordem do documento, em resposta estruturada que preserva a divisão por página. Isso permite montar uma versão pesquisável do documento, indexar o conteúdo num sistema interno, citar trechos num parecer ou simplesmente colar o texto num e-mail. Acentuação e cedilha saem corretas — um detalhe que separa OCR sério de ferramenta improvisada, porque um texto jurídico ou fiscal cheio de caracteres trocados não serve para nada. Tabelas e carimbos são lidos como texto corrido; se a sua necessidade é estrutura de tabela, existe leitura específica para isso.

Cada página tem preço — e ele é público

A cobrança é por uso: US$ 0,010 por chamada mais US$ 0,0575 por página processada. Um documento de 10 páginas custa US$ 0,585, e a conta acaba aí — sem assinatura, sem franquia mínima, sem pegadinha de renovação automática. Compare com o caminho tradicional: reescanear com software de mesa, pagar licença anual ou digitar na mão. Para escritórios que digitalizam sob demanda, pagar centavos por página só quando precisa costuma sair muito mais barato do que manter ferramenta parada o ano inteiro.

Documentos grandes: como dividir

Cada chamada aceita arquivos de até 25 MB e processa até 10 páginas. Se o seu processo escaneado tem 80 páginas, é só fatiar o PDF em blocos de 10 e disparar as chamadas em sequência ou em paralelo — a resposta de cada bloco volta independente, e a numeração por página deixa fácil remontar o conjunto na ordem certa. Xerox de qualidade sofrível, página amarelada e carimbo por cima do texto são situações comuns em arquivo brasileiro; a leitura aguenta bem, mas vale conferir as páginas críticas depois da extração.

Processo escaneado com busca por palavra

O advogado Rafael Almeida Costa baixa autos digitalizados de processos antigos e roda o OCR para conseguir buscar nomes, datas e valores em segundos, em vez de folhear centenas de páginas na tela.

Contratos do arquivo físico entram no sistema

A Distribuidora Horizonte Verde S.A. escaneou anos de contratos guardados em caixa-arquivo. Com o texto extraído página a página, o time jurídico agora localiza qualquer cláusula sem depender da memória de ninguém.

Apostila de concurso pesquisável

Quem estuda com material escaneado transforma o PDF-imagem em texto e monta cadernos de revisão com busca, marcação e cópia livre — coisa que a digitalização pura não permite.

Diário oficial e publicações antigas

Uma assessoria acompanha publicações digitalizadas de anos anteriores: extrai o texto das páginas relevantes e cruza os nomes de interesse automaticamente, sem leitura manual.

Como sei se o meu PDF é escaneado ou já tem texto?

Teste rápido: tente selecionar uma frase com o mouse. Se o cursor marcar o texto, o PDF é nativo e você não precisa de OCR. Se a seleção virar um retângulo azul sobre a página inteira, é imagem — e é aqui que esta ferramenta entra.

A resposta mantém a separação por páginas?

Mantém. O texto volta organizado página a página, na ordem do arquivo, o que facilita citar trechos com referência exata ou remontar documentos divididos em blocos.

Xerox ruim, página torta ou carimbo atrapalham?

Atrapalham menos do que você imagina. O motor visual foi feito para documento do mundo real: aguenta cópia de cópia, inclinação e carimbos sobrepostos. Em páginas muito degradadas o resultado pode vir com falhas — vale uma conferida nesses casos.

Qual o limite por chamada?

Até 25 MB de arquivo e 10 páginas por processamento. Documentos maiores entram fatiados em blocos, com quantas chamadas forem necessárias.

Quanto sai um documento de 50 páginas?

Cinco chamadas de 10 páginas: 5 × (US$ 0,010 + 10 × US$ 0,0575) = US$ 2,925. O preço é sempre em dólares americanos, publicado na página, e você paga só o que processar — nada de mensalidade.

O conteúdo dos meus documentos fica armazenado por aí?

O arquivo enviado serve para uma coisa só: gerar o texto que volta para você. Documentos jurídicos e fiscais costumam carregar dados pessoais, então o tratamento segue sob sua responsabilidade perante a LGPD — a extração atua como operação de processamento a seu pedido.

Tudo nesta página está disponível via API. Esta seção é para equipes que querem integrar a ferramenta aos próprios sistemas; quem não precisa disso pode simplesmente usar a ferramenta acima.

POSThttps://api.kit.forhosting.com/ocr/pdf

Autenticação por token Bearer. Um único POST coloca a tarefa na fila; o resultado chega por webhook ou link assinado.

curl -X POST https://api.kit.forhosting.com/ocr/pdf \
  -H "Authorization: Bearer $KIT_KEY" \
  -H "Content-Type: application/json" \
  -d '{"input":"…"}'
{
  "input": "…"
}
{
  "task_id": "tsk_a1b2c3d4e5f6a1b2c3d4e5f6",
  "type": "ocr.pdf",
  "status": "queued",
  "_links": {
    "result": "/tasks/tsk_…/result"
  }
}

A API é assíncrona: cada chamada devolve um task_id na hora. Se preferir polling, consulte o status a até 1 requisição por segundo.

por chamadaUS$ 0,010
por páginaUS$ 0,0575

Preço publicado, sem tokens nem créditos escondidos. Tarefa que falha não é cobrada.

max_mb25
max_pages10
HTTPCódigoO que significa
401unauthorizedToken ausente ou inválido. Confira o header Authorization.
402insufficient_balanceSaldo insuficiente para esta tarefa. Faça uma recarga e tente de novo.
404unknown_typeEsse tipo de tarefa não existe. Confira o campo type no catálogo.
429rate_limitedMuitas requisições em pouco tempo. Espere um instante e tente de novo.
413input_too_largeA entrada passou do tamanho máximo desta tarefa. Confira os limites publicados.
422task_failedA tarefa falhou do nosso lado. Você não paga nada por ela.

Ver a documentação completa do KIT →