Extrair texto de página web
Serve para extrair texto de página web e ficar só com o que interessa: o conteúdo em texto puro, sem HTML, sem menu, sem publicidade, sem rodapé. Você manda a URL, a página é renderizada em navegador real e volta como texto corrido — pronto para análise, indexação ou processamento por IA.
Rode online
Rode nos nossos servidores com a sua conta. As ferramentas grátis rodam no seu navegador; esta aqui é descontada do seu saldo do KIT pelo preço acima.
Só o texto, nada em volta
Uma página web carrega muito mais do que o conteúdo: navegação, banners, chamadas para outras seções, avisos de cookie, rodapés quilométricos. Para quem quer analisar, indexar ou processar o que a página diz, tudo isso é ruído. A extração descarta a moldura e devolve o miolo em texto simples, na ordem de leitura — o formato mais barato de armazenar e mais fácil de processar que existe.
Quando texto puro é a escolha certa
Se você precisa da estrutura — títulos marcados, listas, tabelas —, o Markdown serve melhor; se precisa da página fiel, o HTML renderizado. O texto puro ganha quando a etapa seguinte é análise: classificar sentimento, contar termos, comparar versões, alimentar um índice de busca ou um modelo de linguagem. Nesses fluxos, marcação é peso morto, e o texto corrido vai direto ao ponto.
Renderização antes da extração
A extração acontece sobre a página pronta: um navegador real abre a URL, executa o JavaScript e só então o texto é colhido. Sites modernos que montam o conteúdo via script — cada vez mais comuns — entregam texto normalmente. O limite de carregamento é de 30 segundos por página, e o acesso é o de um visitante anônimo: o que está atrás de login não entra.
Preço
US$ 0,040 por chamada mais US$ 0,001 por URL. Extrair o texto de cem páginas — um portal de notícias inteiro, por exemplo — custa cerca de US$ 4,10. Não há assinatura nem franquia mínima: o custo acompanha exatamente o volume que você processa, e o preço fica publicado na página para você conferir antes.
Casos de uso
Análise de sentimento de notícias
Uma equipe de comunicação em Recife coleta o texto das matérias que citam a marca e roda a análise de sentimento por cima. O texto puro entra direto no modelo, sem etapa de limpeza de HTML no meio do caminho.
Revisão de conteúdo do próprio site
Uma consultora de conteúdo extrai o texto de todas as páginas do cliente para revisar tom, repetição e clareza em um único documento — em vez de navegar página por página copiando trechos.
Busca interna com fontes externas
A Distribuidora Horizonte Verde indexa o texto das páginas públicas dos fornecedores no buscador interno da equipe de compras. Quem procura um insumo encontra também o que os fornecedores publicam sobre ele.
Perguntas frequentes
O que exatamente é removido da página?
A moldura: menus, banners, publicidade, barras laterais, avisos de cookie e rodapé. Fica o conteúdo textual principal, em ordem de leitura, sem tags nem formatação.
A ordem do texto é mantida?
Sim — o texto sai na sequência em que um leitor percorreria a página, do início ao fim do conteúdo principal.
Serve para extrair texto de PDF?
Não — esta ferramenta lê páginas web a partir de uma URL. Para PDFs, o KIT tem ferramentas específicas de documento, com tratamento próprio.
Quanto custa processar cem páginas?
Cerca de US$ 4,10: US$ 0,040 por chamada mais US$ 0,001 por URL, multiplicado pelas cem. O modelo é estritamente por uso.
Vocês leem ou armazenam o que eu extraio?
O texto é produzido para a sua tarefa e entregue a você. Não guardamos acervo das suas extrações nem cruzamos esse conteúdo com nada — processamos e devolvemos.
Tem que assinar algum plano?
Nenhum. Sem plano, sem cadastro, sem franquia: cada chamada é cobrada pelo preço publicado, e a compra é direta via PayPal, em dólar.
Para desenvolvedores — acesso via API
Tudo nesta página está disponível via API. Esta seção é para equipes que querem integrar a ferramenta aos próprios sistemas; quem não precisa disso pode simplesmente usar a ferramenta acima.
Endpoint
Autenticação por token Bearer. Um único POST coloca a tarefa na fila; o resultado chega por webhook ou link assinado.
Chame do seu código
curl -X POST https://api.kit.forhosting.com/web/to-text \
-H "Authorization: Bearer $KIT_KEY" \
-H "Content-Type: application/json" \
-d '{"url":"https://ejemplo.com"}'const res = await fetch("https://api.kit.forhosting.com/web/to-text", {
method: "POST",
headers: {
"Authorization": `Bearer ${process.env.KIT_KEY}`,
"Content-Type": "application/json"
},
body: JSON.stringify({
"url": "https://ejemplo.com"
})
});
const { task_id } = await res.json();import os, requests
res = requests.post(
"https://api.kit.forhosting.com/web/to-text",
headers={"Authorization": f"Bearer {os.environ['KIT_KEY']}"},
json={
"url": "https://ejemplo.com"
},
)
task_id = res.json()["task_id"]<?php
$res = file_get_contents("https://api.kit.forhosting.com/web/to-text", false, stream_context_create([
"http" => [
"method" => "POST",
"header" => "Authorization: Bearer " . getenv("KIT_KEY") . "\r\nContent-Type: application/json",
"content" => '{"url":"https://ejemplo.com"}',
],
]));
$task = json_decode($res, true);body := bytes.NewBufferString(`{"url":"https://ejemplo.com"}`)
req, _ := http.NewRequest("POST", "https://api.kit.forhosting.com/web/to-text", body)
req.Header.Set("Authorization", "Bearer "+os.Getenv("KIT_KEY"))
req.Header.Set("Content-Type", "application/json")
res, _ := http.DefaultClient.Do(req)Exemplo de requisição
{
"url": "https://ejemplo.com"
}Exemplo de resposta
{
"task_id": "tsk_a1b2c3d4e5f6a1b2c3d4e5f6",
"type": "web.to_text",
"status": "queued",
"_links": {
"result": "/tasks/tsk_…/result"
}
}A API é assíncrona: cada chamada devolve um task_id na hora. Se preferir polling, consulte o status a até 1 requisição por segundo.
Preço
Preço publicado, sem tokens nem créditos escondidos. Tarefa que falha não é cobrada.
Limites
timeout_sec | 30 |
max_crawl_pages | 25 |
Erros
| HTTP | Código | O que significa |
|---|---|---|
401 | unauthorized | Token ausente ou inválido. Confira o header Authorization. |
402 | insufficient_balance | Saldo insuficiente para esta tarefa. Faça uma recarga e tente de novo. |
404 | unknown_type | Esse tipo de tarefa não existe. Confira o campo type no catálogo. |
429 | rate_limited | Muitas requisições em pouco tempo. Espere um instante e tente de novo. |
422 | task_failed | A tarefa falhou do nosso lado. Você não paga nada por ela. |