ForHosting KIT · Ler texto de imagem (OCR)

Extrair referências bibliográficas

Essa ferramenta localiza as referências bibliográficas dentro de um PDF — artigo, tese, apostila, até material escaneado — e devolve cada uma decomposta em campos: autores, título, veículo, ano, volume, páginas. É o fim da tarefa de recortar citação por citação para montar a lista ou alimentar o gerenciador.

● Betapor páginaUS$ 0,003
Use pelo WebAPIE-mailApp em breveTelegram em breve

Rode nos nossos servidores com a sua conta. As ferramentas grátis rodam no seu navegador; esta aqui é descontada do seu saldo do KIT pelo preço acima.

Onde mora o trabalho chato da pesquisa

Toda revisão de literatura passa pelo mesmo funil: dezenas de PDFs, cada um com sua seção de referências, e a necessidade de transportar aquilo para uma base própria. Copiar e colar quebra linhas no lugar errado, cola hífens de quebra de página no meio de sobrenomes e mistura numeração com texto. A extração automática lê a seção de referências como um bibliotecário leria — e entrega cada entrada separada e estruturada.

Campos decompostos, não texto corrido

Cada referência sai desmontada: lista de autores, título do trabalho, nome da revista ou editora, ano, volume, número, páginas, e identificadores quando presentes no texto (DOI, ISBN). Com os campos separados, você formata a lista final na norma que precisar — ABNT para o TCC, Vancouver para o artigo da área médica — usando a sua ferramenta de preferência. A extração entrega a matéria-prima limpa; a formatação da norma é a etapa seguinte, sob seu controle.

Material escaneado também entra

Boa parte da bibliografia brasileira relevante existe só em digitalização: teses antigas, livros esgotados, anais de congresso fotocopiados. O reconhecimento de texto está embutido no fluxo, então o PDF escaneado é aceito como entrada — com a ressalva honesta de que digitalização de baixa qualidade degrada o resultado. Está em beta: em acervos críticos, confira uma amostra antes de processar tudo. Custa US$ 0,003 por chamada mais US$ 0,0135 por página, com limite de 25 MB e 10 páginas por envio.

Mestranda montando a revisão de literatura

Juliana Nascimento tem 60 artigos em PDF para a dissertação. Extraindo as referências de cada um, ela monta em uma tarde a base consolidada no gerenciador — e descobre quais fontes se repetem entre os artigos, o núcleo da área que ela precisa ler primeiro.

Professor conferindo as citações de um TCC

Na banca, a suspeita clássica: a lista de referências bate com o que foi citado no texto? O orientador extrai as referências do PDF entregue e cruza com as citações — as entradas “fantasma”, listadas mas nunca citadas, aparecem em minutos.

Biblioteca digitalizando anais antigos

Uma biblioteca universitária digitalizou anais de congresso dos anos 1990. Extraindo as referências de cada trabalho escaneado, a equipe alimenta o catálogo e torna rastreável uma rede de citações que só existia no papel.

Grupo de pesquisa mapeando um campo

O grupo reúne os 30 artigos fundadores do seu tema e extrai todas as referências. A lista consolidada, ordenada por frequência, vira o mapa de leitura obrigatória para os ingressantes.

A lista sai formatada em ABNT?

A extração devolve os campos separados — autores, título, ano, veículo, páginas —, que é o que permite formatar em ABNT, APA ou Vancouver com consistência. A montagem da norma final acontece na sua ferramenta de referências, sem retrabalho de digitação.

Referências em nota de rodapé também são capturadas?

Sim, tanto a seção final de referências quanto notas de rodapé com citações completas. Notas que só dizem “op. cit.” ou “ibidem” são extraídas como estão — resolvê-las contra a referência original é decisão sua.

Funciona com tese escaneada dos anos 1980?

Funciona, com uma condição: a digitalização precisa estar legível. Manchas, texto cortado na margem e tinta falhada degradam a leitura. Teste algumas páginas do acervo antes de processar o conjunto — está em beta, e amostrar primeiro é a prática que recomendamos.

Quanto custa processar a bibliografia de uma dissertação?

Como só as páginas enviadas contam, o hábito eficiente é mandar as seções de referências: US$ 0,003 por chamada mais US$ 0,0135 por página. Sessenta artigos, enviando 2 páginas de referências de cada, custam cerca de US$ 1,80.

Trabalhos não publicados ficam protegidos?

O PDF é usado somente para gerar a extração pedida — não é indexado, compartilhado nem incorporado a qualquer acervo. Manuscritos inéditos permanecem inéditos.

Preciso de conta para usar?

Não: o serviço funciona por chamada de API com pagamento pelo uso, sem cadastro. Quem responde dúvidas de integração é uma pessoa de verdade, em espanhol ou inglês — pode escrever em português que a gente se entende.

Tudo nesta página está disponível via API. Esta seção é para equipes que querem integrar a ferramenta aos próprios sistemas; quem não precisa disso pode simplesmente usar a ferramenta acima.

POSThttps://api.kit.forhosting.com/ocr/citation

Autenticação por token Bearer. Um único POST coloca a tarefa na fila; o resultado chega por webhook ou link assinado.

curl -X POST https://api.kit.forhosting.com/ocr/citation \
  -H "Authorization: Bearer $KIT_KEY" \
  -H "Content-Type: application/json" \
  -d '{"input":"…"}'
{
  "input": "…"
}
{
  "task_id": "tsk_a1b2c3d4e5f6a1b2c3d4e5f6",
  "type": "ocr.citation",
  "status": "queued",
  "_links": {
    "result": "/tasks/tsk_…/result"
  }
}

A API é assíncrona: cada chamada devolve um task_id na hora. Se preferir polling, consulte o status a até 1 requisição por segundo.

por chamadaUS$ 0,003
por páginaUS$ 0,0135

Preço publicado, sem tokens nem créditos escondidos. Tarefa que falha não é cobrada.

max_mb25
max_pages10
HTTPCódigoO que significa
401unauthorizedToken ausente ou inválido. Confira o header Authorization.
402insufficient_balanceSaldo insuficiente para esta tarefa. Faça uma recarga e tente de novo.
404unknown_typeEsse tipo de tarefa não existe. Confira o campo type no catálogo.
429rate_limitedMuitas requisições em pouco tempo. Espere um instante e tente de novo.
413input_too_largeA entrada passou do tamanho máximo desta tarefa. Confira os limites publicados.
422task_failedA tarefa falhou do nosso lado. Você não paga nada por ela.

Ver a documentação completa do KIT →