Extrair referências bibliográficas
Essa ferramenta localiza as referências bibliográficas dentro de um PDF — artigo, tese, apostila, até material escaneado — e devolve cada uma decomposta em campos: autores, título, veículo, ano, volume, páginas. É o fim da tarefa de recortar citação por citação para montar a lista ou alimentar o gerenciador.
Rode online
Rode nos nossos servidores com a sua conta. As ferramentas grátis rodam no seu navegador; esta aqui é descontada do seu saldo do KIT pelo preço acima.
Onde mora o trabalho chato da pesquisa
Toda revisão de literatura passa pelo mesmo funil: dezenas de PDFs, cada um com sua seção de referências, e a necessidade de transportar aquilo para uma base própria. Copiar e colar quebra linhas no lugar errado, cola hífens de quebra de página no meio de sobrenomes e mistura numeração com texto. A extração automática lê a seção de referências como um bibliotecário leria — e entrega cada entrada separada e estruturada.
Campos decompostos, não texto corrido
Cada referência sai desmontada: lista de autores, título do trabalho, nome da revista ou editora, ano, volume, número, páginas, e identificadores quando presentes no texto (DOI, ISBN). Com os campos separados, você formata a lista final na norma que precisar — ABNT para o TCC, Vancouver para o artigo da área médica — usando a sua ferramenta de preferência. A extração entrega a matéria-prima limpa; a formatação da norma é a etapa seguinte, sob seu controle.
Material escaneado também entra
Boa parte da bibliografia brasileira relevante existe só em digitalização: teses antigas, livros esgotados, anais de congresso fotocopiados. O reconhecimento de texto está embutido no fluxo, então o PDF escaneado é aceito como entrada — com a ressalva honesta de que digitalização de baixa qualidade degrada o resultado. Está em beta: em acervos críticos, confira uma amostra antes de processar tudo. Custa US$ 0,003 por chamada mais US$ 0,0135 por página, com limite de 25 MB e 10 páginas por envio.
Casos de uso
Mestranda montando a revisão de literatura
Juliana Nascimento tem 60 artigos em PDF para a dissertação. Extraindo as referências de cada um, ela monta em uma tarde a base consolidada no gerenciador — e descobre quais fontes se repetem entre os artigos, o núcleo da área que ela precisa ler primeiro.
Professor conferindo as citações de um TCC
Na banca, a suspeita clássica: a lista de referências bate com o que foi citado no texto? O orientador extrai as referências do PDF entregue e cruza com as citações — as entradas “fantasma”, listadas mas nunca citadas, aparecem em minutos.
Biblioteca digitalizando anais antigos
Uma biblioteca universitária digitalizou anais de congresso dos anos 1990. Extraindo as referências de cada trabalho escaneado, a equipe alimenta o catálogo e torna rastreável uma rede de citações que só existia no papel.
Grupo de pesquisa mapeando um campo
O grupo reúne os 30 artigos fundadores do seu tema e extrai todas as referências. A lista consolidada, ordenada por frequência, vira o mapa de leitura obrigatória para os ingressantes.
Perguntas frequentes
A lista sai formatada em ABNT?
A extração devolve os campos separados — autores, título, ano, veículo, páginas —, que é o que permite formatar em ABNT, APA ou Vancouver com consistência. A montagem da norma final acontece na sua ferramenta de referências, sem retrabalho de digitação.
Referências em nota de rodapé também são capturadas?
Sim, tanto a seção final de referências quanto notas de rodapé com citações completas. Notas que só dizem “op. cit.” ou “ibidem” são extraídas como estão — resolvê-las contra a referência original é decisão sua.
Funciona com tese escaneada dos anos 1980?
Funciona, com uma condição: a digitalização precisa estar legível. Manchas, texto cortado na margem e tinta falhada degradam a leitura. Teste algumas páginas do acervo antes de processar o conjunto — está em beta, e amostrar primeiro é a prática que recomendamos.
Quanto custa processar a bibliografia de uma dissertação?
Como só as páginas enviadas contam, o hábito eficiente é mandar as seções de referências: US$ 0,003 por chamada mais US$ 0,0135 por página. Sessenta artigos, enviando 2 páginas de referências de cada, custam cerca de US$ 1,80.
Trabalhos não publicados ficam protegidos?
O PDF é usado somente para gerar a extração pedida — não é indexado, compartilhado nem incorporado a qualquer acervo. Manuscritos inéditos permanecem inéditos.
Preciso de conta para usar?
Não: o serviço funciona por chamada de API com pagamento pelo uso, sem cadastro. Quem responde dúvidas de integração é uma pessoa de verdade, em espanhol ou inglês — pode escrever em português que a gente se entende.
Para desenvolvedores — acesso via API
Tudo nesta página está disponível via API. Esta seção é para equipes que querem integrar a ferramenta aos próprios sistemas; quem não precisa disso pode simplesmente usar a ferramenta acima.
Endpoint
Autenticação por token Bearer. Um único POST coloca a tarefa na fila; o resultado chega por webhook ou link assinado.
Chame do seu código
curl -X POST https://api.kit.forhosting.com/ocr/citation \
-H "Authorization: Bearer $KIT_KEY" \
-H "Content-Type: application/json" \
-d '{"input":"…"}'const res = await fetch("https://api.kit.forhosting.com/ocr/citation", {
method: "POST",
headers: {
"Authorization": `Bearer ${process.env.KIT_KEY}`,
"Content-Type": "application/json"
},
body: JSON.stringify({
"input": "…"
})
});
const { task_id } = await res.json();import os, requests
res = requests.post(
"https://api.kit.forhosting.com/ocr/citation",
headers={"Authorization": f"Bearer {os.environ['KIT_KEY']}"},
json={
"input": "…"
},
)
task_id = res.json()["task_id"]<?php
$res = file_get_contents("https://api.kit.forhosting.com/ocr/citation", false, stream_context_create([
"http" => [
"method" => "POST",
"header" => "Authorization: Bearer " . getenv("KIT_KEY") . "\r\nContent-Type: application/json",
"content" => '{"input":"…"}',
],
]));
$task = json_decode($res, true);body := bytes.NewBufferString(`{"input":"…"}`)
req, _ := http.NewRequest("POST", "https://api.kit.forhosting.com/ocr/citation", body)
req.Header.Set("Authorization", "Bearer "+os.Getenv("KIT_KEY"))
req.Header.Set("Content-Type", "application/json")
res, _ := http.DefaultClient.Do(req)Exemplo de requisição
{
"input": "…"
}Exemplo de resposta
{
"task_id": "tsk_a1b2c3d4e5f6a1b2c3d4e5f6",
"type": "ocr.citation",
"status": "queued",
"_links": {
"result": "/tasks/tsk_…/result"
}
}A API é assíncrona: cada chamada devolve um task_id na hora. Se preferir polling, consulte o status a até 1 requisição por segundo.
Preço
Preço publicado, sem tokens nem créditos escondidos. Tarefa que falha não é cobrada.
Limites
max_mb | 25 |
max_pages | 10 |
Erros
| HTTP | Código | O que significa |
|---|---|---|
401 | unauthorized | Token ausente ou inválido. Confira o header Authorization. |
402 | insufficient_balance | Saldo insuficiente para esta tarefa. Faça uma recarga e tente de novo. |
404 | unknown_type | Esse tipo de tarefa não existe. Confira o campo type no catálogo. |
429 | rate_limited | Muitas requisições em pouco tempo. Espere um instante e tente de novo. |
413 | input_too_large | A entrada passou do tamanho máximo desta tarefa. Confira os limites publicados. |
422 | task_failed | A tarefa falhou do nosso lado. Você não paga nada por ela. |