ForHosting KIT · Monitorar sites

Leitor de artigo

Extrai o artigo de uma página como o modo leitura do navegador faria: identifica o conteúdo principal e devolve título, autor, data e texto limpo, separados em campos. A poluição — barra lateral, banner, caixa de comentários, “leia também” — fica de fora. Feito para clipping, curadoria e arquivos de leitura.

● Estávelpor URLUS$ 0,040
Use pelo WebAPIE-mailApp em breveTelegram em breve

Rode nos nossos servidores com a sua conta. As ferramentas grátis rodam no seu navegador; esta aqui é descontada do seu saldo do KIT pelo preço acima.

Modo leitura, versão API

Todo navegador moderno tem um botão de modo leitura que limpa a página e deixa só o artigo. Esta ferramenta faz o mesmo trabalho, mas por chamada de API e com resultado estruturado: em vez de uma tela bonita, você recebe campos separados — título, autor, data de publicação e o corpo do texto — prontos para entrar em um sistema, uma planilha ou um fluxo automatizado. Uma URL por chamada, resultado assíncrono via task_id.

A diferença para extrair texto simples

A extração de texto devolve tudo o que a página tem de textual, sem julgar. A extração de artigo é mais exigente: ela procura o conteúdo editorial principal e separa os metadados dele. Se o seu insumo são matérias, posts e artigos — e você quer saber quem escreveu, quando e o quê —, esta é a ferramenta. Se você só precisa da massa de texto de qualquer página, a extração simples resolve por menos trabalho de pós-processamento.

De onde vêm autor e data

Dos metadados e da marcação que a própria página declara. Portais de notícia e blogs bem construídos publicam essas informações de forma estruturada, e é isso que a extração lê. Quando a página não declara autor ou data, o campo volta vazio — sem chute e sem invenção. É um comportamento deliberado: para clipping e arquivo, um campo em branco vale mais do que um dado inventado com confiança.

Preço por artigo

US$ 0,040 por chamada mais US$ 0,001 por URL. Um clipping diário com dez matérias custa cerca de US$ 0,41 por dia; uma curadoria semanal de cinquenta artigos, em torno de US$ 2,05 por edição. A página abre em navegador real, com limite de 30 segundos de carregamento — portais pesados de publicidade entram sem problema, porque a publicidade fica de fora do resultado.

Clipping de imprensa interno

A assessoria de uma empresa de Porto Alegre monta o clipping matinal com as matérias que citam a marca: título, veículo, data e texto limpo de cada uma, organizados no mesmo documento antes das 9h — sem estagiário copiando e colando de dez portais.

Newsletter de curadoria

Um criador de newsletter coleta os artigos da semana sobre o setor dele e trabalha em cima do texto extraído: resume, comenta e cita. O material chega sem banner nem “leia também” no meio do parágrafo.

Arquivo de leitura à prova de link quebrado

Uma advogada em São Paulo salva artigos técnicos que embasam pareceres. Com título, autor, data e texto estruturados, o arquivo continua íntegro e citável mesmo se o site original sair do ar.

Funciona em qualquer site de notícia?

Funciona onde existe um artigo principal identificável — matéria, post, coluna. Páginas-vitrine, como a home de um portal ou uma lista de categoria, não têm “o artigo”, e o resultado reflete isso.

E se a página não informar o autor?

O campo volta vazio. A extração lê o que a página declara; quando o dado não existe, preferimos entregar o branco a inventar um nome.

Os comentários dos leitores vêm junto?

Não — comentários, reações e caixas de discussão são tratados como poluição e ficam de fora. O resultado é o conteúdo editorial.

Posso republicar o texto extraído no meu site?

A ferramenta extrai; o direito autoral continua valendo. Republicar conteúdo de terceiros depende de autorização do veículo ou do autor — para uso interno, resumo e citação com crédito, você está em terreno muito mais tranquilo.

Qual o custo de um clipping diário?

Cada artigo sai por US$ 0,041. Dez matérias por dia dão cerca de US$ 0,41 diários — no mês, algo em torno de US$ 12,30, pagos por uso, sem plano.

As URLs que envio viram estatística de vocês?

Não. Cada URL é processada para responder à sua chamada e o resultado é entregue a você — não montamos ranking, histórico nem perfil com o que você lê.

Tudo nesta página está disponível via API. Esta seção é para equipes que querem integrar a ferramenta aos próprios sistemas; quem não precisa disso pode simplesmente usar a ferramenta acima.

POSThttps://api.kit.forhosting.com/web/article

Autenticação por token Bearer. Um único POST coloca a tarefa na fila; o resultado chega por webhook ou link assinado.

curl -X POST https://api.kit.forhosting.com/web/article \
  -H "Authorization: Bearer $KIT_KEY" \
  -H "Content-Type: application/json" \
  -d '{"url":"https://ejemplo.com"}'
{
  "url": "https://ejemplo.com"
}
{
  "task_id": "tsk_a1b2c3d4e5f6a1b2c3d4e5f6",
  "type": "web.article",
  "status": "queued",
  "_links": {
    "result": "/tasks/tsk_…/result"
  }
}

A API é assíncrona: cada chamada devolve um task_id na hora. Se preferir polling, consulte o status a até 1 requisição por segundo.

por chamadaUS$ 0,040
por URLUS$ 0,001

Preço publicado, sem tokens nem créditos escondidos. Tarefa que falha não é cobrada.

timeout_sec30
max_crawl_pages25
HTTPCódigoO que significa
401unauthorizedToken ausente ou inválido. Confira o header Authorization.
402insufficient_balanceSaldo insuficiente para esta tarefa. Faça uma recarga e tente de novo.
404unknown_typeEsse tipo de tarefa não existe. Confira o campo type no catálogo.
429rate_limitedMuitas requisições em pouco tempo. Espere um instante e tente de novo.
422task_failedA tarefa falhou do nosso lado. Você não paga nada por ela.

Ver a documentação completa do KIT →