Extrair nomes e entidades
A ferramenta identifica e lista as entidades citadas em um texto — pessoas, empresas, órgãos públicos, lugares, produtos — cada uma com seu tipo, em formato estruturado. É a ponte entre texto corrido e dado tabulável: do contrato, da notícia ou do e-mail direto para a planilha ou o banco de dados.
Rode online
Rode nos nossos servidores com a sua conta. As ferramentas grátis rodam no seu navegador; esta aqui é descontada do seu saldo do KIT pelo preço acima.
Do texto corrido para a estrutura
“A Distribuidora Horizonte Verde S.A. fechou contrato com a prefeitura de Recife, representada por Carlos Eduardo Souza” contém três entidades de três tipos — empresa, órgão, pessoa. A extração devolve exatamente isso: cada entidade com sua classificação, em JSON pronto para consumo. O que era leitura vira consulta: quem aparece nesses mil documentos? Quais empresas são citadas junto de qual órgão? Perguntas impossíveis num acervo de texto viram uma query.
Nomes à brasileira
Nome brasileiro é composto e traiçoeiro para extratores ingênuos: “Ana Paula” é uma pessoa, não duas; “Souza” solto no segundo parágrafo é a mesma pessoa do primeiro; “Horizonte Verde” sem o “Distribuidora” continua sendo a empresa. A extração entende sufixos societários (Ltda., ME, S.A., EPP), siglas de órgãos, apelidos de cidades e o hábito nacional de citar a mesma entidade de três formas no mesmo texto — e consolida as menções em vez de listar triplicado.
Escolha o que extrair
Nem todo uso quer tudo: um CRM quer pessoas e empresas; um mapa logístico quer só lugares; uma análise de mídia quer marcas e concorrentes. Você pode restringir os tipos extraídos ou pedir o espectro completo — pessoas, organizações, lugares, produtos, eventos — e a resposta vem na medida. Datas e valores monetários têm extratores dedicados no catálogo, afinados para esses formatos; para o resto das entidades, o lugar é aqui.
Preço e escala
US$ 0,003 por chamada, mais US$ 0,0135 por 1.000 palavras processadas, em dólar americano, até 20.000 tokens por chamada. Extrair as entidades de um acervo de 500 notícias — cerca de 350.000 palavras — custa por volta de US$ 4,80. A tarefa roda de forma assíncrona via API, então o acervo inteiro é questão de agendar, não de sentar e esperar.
Casos de uso
Diário oficial monitorado sem estagiário de plantão
Um escritório de advocacia em Belo Horizonte acompanha menções de clientes em publicações oficiais. O texto de cada edição passa pela extração; os nomes encontrados batem contra a carteira de clientes, e o alerta chega antes do prazo começar a correr.
E-mails que alimentam o CRM sozinhos
A equipe comercial da TecnoSul extrai pessoas e empresas dos e-mails de prospecção recebidos. Nome, empresa e cargo citados no corpo da mensagem entram no CRM estruturados — o vendedor confere em vez de digitar, e o cadastro parou de nascer incompleto.
Apuração jornalística em documentos vazados
Uma repórter recebeu centenas de páginas de documentos e precisava do mapa: quem aparece, com que empresas, em quais cidades. A extração produziu a lista consolidada de entidades por documento — e o cruzamento apontou onde a apuração devia cavar.
Perguntas frequentes
Quais tipos de entidade a extração devolve?
Pessoas, empresas e organizações, órgãos públicos, lugares (de país a bairro), produtos e marcas, e eventos nomeados. Cada ocorrência vem tipada, e você pode limitar a extração aos tipos que interessam.
O resultado vem em que formato?
Estruturado, em JSON: a entidade, o tipo e as menções no texto. Vai direto para planilha, banco ou o sistema que consumir a API — sem parsing artesanal do seu lado.
E quando “Almeida” pode ser pessoa, rua ou empresa?
O contexto da frase decide a classificação — é a vantagem sobre listas e regex. Quando nem o contexto resolve, a ambiguidade vem sinalizada, o que é mais útil que um chute confiante.
A mesma entidade citada cinco vezes vira cinco linhas?
Não: menções da mesma entidade são consolidadas — “Distribuidora Horizonte Verde S.A.”, “Horizonte Verde” e “a distribuidora” contam como uma entidade com várias ocorrências, com as posições preservadas.
Quanto custa processar documentos longos?
US$ 0,0135 por 1.000 palavras mais US$ 0,003 por chamada, em dólar. Um contrato de 8.000 palavras custa cerca de US$ 0,11; o limite de 20.000 tokens por chamada acomoda a maioria dos documentos inteiros.
Nomes extraídos são dados pessoais — como isso é tratado?
O texto é processado e o resultado devolvido na tarefa, sem acervo retido no serviço. O inventário de nomes que você constrói a partir daí é tratamento de dados seu — vale registrar a finalidade, como manda a LGPD.
Para desenvolvedores — acesso via API
Tudo nesta página está disponível via API. Esta seção é para equipes que querem integrar a ferramenta aos próprios sistemas; quem não precisa disso pode simplesmente usar a ferramenta acima.
Endpoint
Autenticação por token Bearer. Um único POST coloca a tarefa na fila; o resultado chega por webhook ou link assinado.
Chame do seu código
curl -X POST https://api.kit.forhosting.com/text/extract-entities \
-H "Authorization: Bearer $KIT_KEY" \
-H "Content-Type: application/json" \
-d '{"text":"…"}'const res = await fetch("https://api.kit.forhosting.com/text/extract-entities", {
method: "POST",
headers: {
"Authorization": `Bearer ${process.env.KIT_KEY}`,
"Content-Type": "application/json"
},
body: JSON.stringify({
"text": "…"
})
});
const { task_id } = await res.json();import os, requests
res = requests.post(
"https://api.kit.forhosting.com/text/extract-entities",
headers={"Authorization": f"Bearer {os.environ['KIT_KEY']}"},
json={
"text": "…"
},
)
task_id = res.json()["task_id"]<?php
$res = file_get_contents("https://api.kit.forhosting.com/text/extract-entities", false, stream_context_create([
"http" => [
"method" => "POST",
"header" => "Authorization: Bearer " . getenv("KIT_KEY") . "\r\nContent-Type: application/json",
"content" => '{"text":"…"}',
],
]));
$task = json_decode($res, true);body := bytes.NewBufferString(`{"text":"…"}`)
req, _ := http.NewRequest("POST", "https://api.kit.forhosting.com/text/extract-entities", body)
req.Header.Set("Authorization", "Bearer "+os.Getenv("KIT_KEY"))
req.Header.Set("Content-Type", "application/json")
res, _ := http.DefaultClient.Do(req)Exemplo de requisição
{
"text": "…"
}Exemplo de resposta
{
"task_id": "tsk_a1b2c3d4e5f6a1b2c3d4e5f6",
"type": "text.extract_entities",
"status": "queued",
"_links": {
"result": "/tasks/tsk_…/result"
}
}A API é assíncrona: cada chamada devolve um task_id na hora. Se preferir polling, consulte o status a até 1 requisição por segundo.
Preço
Preço publicado, sem tokens nem créditos escondidos. Tarefa que falha não é cobrada.
Limites
max_tokens | 20000 |
Erros
| HTTP | Código | O que significa |
|---|---|---|
401 | unauthorized | Token ausente ou inválido. Confira o header Authorization. |
402 | insufficient_balance | Saldo insuficiente para esta tarefa. Faça uma recarga e tente de novo. |
404 | unknown_type | Esse tipo de tarefa não existe. Confira o campo type no catálogo. |
429 | rate_limited | Muitas requisições em pouco tempo. Espere um instante e tente de novo. |
422 | task_failed | A tarefa falhou do nosso lado. Você não paga nada por ela. |