ForHosting KIT · Monitorar sites

Extrair texto de página web

Serve para extrair texto de página web e ficar só com o que interessa: o conteúdo em texto puro, sem HTML, sem menu, sem publicidade, sem rodapé. Você manda a URL, a página é renderizada em navegador real e volta como texto corrido — pronto para análise, indexação ou processamento por IA.

● Estávelpor URLUS$ 0,040
Use pelo WebAPIE-mailApp em breveTelegram em breve

Rode nos nossos servidores com a sua conta. As ferramentas grátis rodam no seu navegador; esta aqui é descontada do seu saldo do KIT pelo preço acima.

Só o texto, nada em volta

Uma página web carrega muito mais do que o conteúdo: navegação, banners, chamadas para outras seções, avisos de cookie, rodapés quilométricos. Para quem quer analisar, indexar ou processar o que a página diz, tudo isso é ruído. A extração descarta a moldura e devolve o miolo em texto simples, na ordem de leitura — o formato mais barato de armazenar e mais fácil de processar que existe.

Quando texto puro é a escolha certa

Se você precisa da estrutura — títulos marcados, listas, tabelas —, o Markdown serve melhor; se precisa da página fiel, o HTML renderizado. O texto puro ganha quando a etapa seguinte é análise: classificar sentimento, contar termos, comparar versões, alimentar um índice de busca ou um modelo de linguagem. Nesses fluxos, marcação é peso morto, e o texto corrido vai direto ao ponto.

Renderização antes da extração

A extração acontece sobre a página pronta: um navegador real abre a URL, executa o JavaScript e só então o texto é colhido. Sites modernos que montam o conteúdo via script — cada vez mais comuns — entregam texto normalmente. O limite de carregamento é de 30 segundos por página, e o acesso é o de um visitante anônimo: o que está atrás de login não entra.

Preço

US$ 0,040 por chamada mais US$ 0,001 por URL. Extrair o texto de cem páginas — um portal de notícias inteiro, por exemplo — custa cerca de US$ 4,10. Não há assinatura nem franquia mínima: o custo acompanha exatamente o volume que você processa, e o preço fica publicado na página para você conferir antes.

Análise de sentimento de notícias

Uma equipe de comunicação em Recife coleta o texto das matérias que citam a marca e roda a análise de sentimento por cima. O texto puro entra direto no modelo, sem etapa de limpeza de HTML no meio do caminho.

Revisão de conteúdo do próprio site

Uma consultora de conteúdo extrai o texto de todas as páginas do cliente para revisar tom, repetição e clareza em um único documento — em vez de navegar página por página copiando trechos.

Busca interna com fontes externas

A Distribuidora Horizonte Verde indexa o texto das páginas públicas dos fornecedores no buscador interno da equipe de compras. Quem procura um insumo encontra também o que os fornecedores publicam sobre ele.

O que exatamente é removido da página?

A moldura: menus, banners, publicidade, barras laterais, avisos de cookie e rodapé. Fica o conteúdo textual principal, em ordem de leitura, sem tags nem formatação.

A ordem do texto é mantida?

Sim — o texto sai na sequência em que um leitor percorreria a página, do início ao fim do conteúdo principal.

Serve para extrair texto de PDF?

Não — esta ferramenta lê páginas web a partir de uma URL. Para PDFs, o KIT tem ferramentas específicas de documento, com tratamento próprio.

Quanto custa processar cem páginas?

Cerca de US$ 4,10: US$ 0,040 por chamada mais US$ 0,001 por URL, multiplicado pelas cem. O modelo é estritamente por uso.

Vocês leem ou armazenam o que eu extraio?

O texto é produzido para a sua tarefa e entregue a você. Não guardamos acervo das suas extrações nem cruzamos esse conteúdo com nada — processamos e devolvemos.

Tem que assinar algum plano?

Nenhum. Sem plano, sem cadastro, sem franquia: cada chamada é cobrada pelo preço publicado, e a compra é direta via PayPal, em dólar.

Tudo nesta página está disponível via API. Esta seção é para equipes que querem integrar a ferramenta aos próprios sistemas; quem não precisa disso pode simplesmente usar a ferramenta acima.

POSThttps://api.kit.forhosting.com/web/to-text

Autenticação por token Bearer. Um único POST coloca a tarefa na fila; o resultado chega por webhook ou link assinado.

curl -X POST https://api.kit.forhosting.com/web/to-text \
  -H "Authorization: Bearer $KIT_KEY" \
  -H "Content-Type: application/json" \
  -d '{"url":"https://ejemplo.com"}'
{
  "url": "https://ejemplo.com"
}
{
  "task_id": "tsk_a1b2c3d4e5f6a1b2c3d4e5f6",
  "type": "web.to_text",
  "status": "queued",
  "_links": {
    "result": "/tasks/tsk_…/result"
  }
}

A API é assíncrona: cada chamada devolve um task_id na hora. Se preferir polling, consulte o status a até 1 requisição por segundo.

por chamadaUS$ 0,040
por URLUS$ 0,001

Preço publicado, sem tokens nem créditos escondidos. Tarefa que falha não é cobrada.

timeout_sec30
max_crawl_pages25
HTTPCódigoO que significa
401unauthorizedToken ausente ou inválido. Confira o header Authorization.
402insufficient_balanceSaldo insuficiente para esta tarefa. Faça uma recarga e tente de novo.
404unknown_typeEsse tipo de tarefa não existe. Confira o campo type no catálogo.
429rate_limitedMuitas requisições em pouco tempo. Espere um instante e tente de novo.
422task_failedA tarefa falhou do nosso lado. Você não paga nada por ela.

Ver a documentação completa do KIT →