Rastrear um site inteiro
Com uma única chamada dá para rastrear todas as páginas de um site — até o limite de 25 por execução: o robô parte da URL inicial, segue os links internos e devolve o conteúdo de cada página encontrada. É o jeito rápido de enxergar um site inteiro sem visitar página por página.
Como o rastreador anda pelo site
Você informa a URL de partida; o robô abre a página em navegador real, coleta os links internos e segue por eles, página a página, até o teto de 25 por execução. Cada página tem até 30 segundos para carregar, e a renderização real significa que sites montados com JavaScript também são percorridos. O resultado volta como tarefa assíncrona, com o conteúdo de cada página visitada organizado para você processar.
O que você recebe de volta
Não é só uma lista de endereços: é o conjunto das páginas rastreadas com o conteúdo de cada uma, pronto para a etapa seguinte — indexar, analisar, inventariar, comparar. Em vez de escrever seu próprio rastreador, cuidar de fila, tempo de espera e renderização, você faz uma chamada e recebe o pacote. O que fazer com ele é decisão sua: o rastreamento entrega a matéria-prima.
Sites maiores que 25 páginas
O teto é por execução, não por site. Para cobrir um site grande, divida por seções e rode uma execução por trecho: comece uma em /blog, outra em /produtos, outra em /ajuda, e some os resultados. A divisão por seção costuma até melhorar a qualidade do inventário, porque cada execução volta tematicamente organizada. Sites de até 25 páginas — a maioria dos institucionais brasileiros — cabem inteiros em uma chamada.
Preço por página, não por site
US$ 0,040 pela chamada, mais US$ 0,001 por página efetivamente rastreada. Uma execução cheia, com 25 páginas, sai por cerca de US$ 0,065 — centavos para enxergar um site inteiro. Se o robô encontrar menos páginas que o teto, você paga menos: a cobrança acompanha o que foi de fato percorrido, e o preço está publicado antes de você usar.
Casos de uso
Diagnóstico de site herdado
Uma agência de Curitiba assumiu o site de um cliente sem documentação nenhuma. Antes de orçar o redesign, rastreou o site inteiro: em minutos sabia quantas páginas existiam, o que havia em cada uma e onde estava o conteúdo abandonado.
Inventário antes da migração
A equipe da Padaria Pão Dourado — site institucional pequeno — rastreou as próprias páginas antes de trocar de plataforma. O inventário virou o checklist da migração: nada ficou para trás, nenhuma URL foi esquecida no mapa de redirecionamentos.
Mapa da concorrência
Um consultor de marketing rastreia o site dos concorrentes do cliente para mapear a estrutura: quantas páginas de produto, quais categorias, que conteúdo de apoio publicam. O comparativo estrutural entra na análise de posicionamento.
Perguntas frequentes
Por que existe o limite de 25 páginas?
Para manter cada execução rápida, previsível e barata. Sites maiores se cobrem com várias execuções, uma por seção — o custo continua proporcional e o resultado chega organizado por trecho.
O robô sobrecarrega o site rastreado?
O rastreamento é limitado por desenho — no máximo 25 páginas por execução, com tempo de carregamento controlado. Não é uma enxurrada de requisições: é uma visita curta e educada.
Páginas construídas com JavaScript entram no rastreio?
Entram. Cada página abre em navegador real, que executa os scripts antes da coleta — o rastreador enxerga o site como um visitante enxerga.
Quanto custa rastrear meu site?
US$ 0,040 pela chamada mais US$ 0,001 por página. Um site de 25 páginas sai por cerca de US$ 0,065; um de cem páginas, dividido em quatro execuções, fica em torno de US$ 0,26.
Posso rastrear qualquer site da internet?
O robô percorre páginas públicas, como qualquer visitante. Termos de uso do site e LGPD continuam valendo para o que você faz com o conteúdo — coleta de dados pessoais em massa é assunto sério, e a responsabilidade do uso é de quem rastreia.
O conteúdo rastreado fica com vocês?
É entregue como resultado da sua tarefa e o assunto morre aí. Não formamos acervo com os sites que os clientes rastreiam.
Para desenvolvedores — acesso via API
Tudo nesta página está disponível via API. Esta seção é para equipes que querem integrar a ferramenta aos próprios sistemas; quem não precisa disso pode simplesmente usar a ferramenta acima.
Endpoint
Autenticação por token Bearer. Um único POST coloca a tarefa na fila; o resultado chega por webhook ou link assinado.
Chame do seu código
curl -X POST https://api.kit.forhosting.com/web/crawl \
-H "Authorization: Bearer $KIT_KEY" \
-H "Content-Type: application/json" \
-d '{"input":"…"}'const res = await fetch("https://api.kit.forhosting.com/web/crawl", {
method: "POST",
headers: {
"Authorization": `Bearer ${process.env.KIT_KEY}`,
"Content-Type": "application/json"
},
body: JSON.stringify({
"input": "…"
})
});
const { task_id } = await res.json();import os, requests
res = requests.post(
"https://api.kit.forhosting.com/web/crawl",
headers={"Authorization": f"Bearer {os.environ['KIT_KEY']}"},
json={
"input": "…"
},
)
task_id = res.json()["task_id"]<?php
$res = file_get_contents("https://api.kit.forhosting.com/web/crawl", false, stream_context_create([
"http" => [
"method" => "POST",
"header" => "Authorization: Bearer " . getenv("KIT_KEY") . "\r\nContent-Type: application/json",
"content" => '{"input":"…"}',
],
]));
$task = json_decode($res, true);body := bytes.NewBufferString(`{"input":"…"}`)
req, _ := http.NewRequest("POST", "https://api.kit.forhosting.com/web/crawl", body)
req.Header.Set("Authorization", "Bearer "+os.Getenv("KIT_KEY"))
req.Header.Set("Content-Type", "application/json")
res, _ := http.DefaultClient.Do(req)Exemplo de requisição
{
"input": "…"
}Exemplo de resposta
{
"task_id": "tsk_a1b2c3d4e5f6a1b2c3d4e5f6",
"type": "web.crawl",
"status": "queued",
"_links": {
"result": "/tasks/tsk_…/result"
}
}A API é assíncrona: cada chamada devolve um task_id na hora. Se preferir polling, consulte o status a até 1 requisição por segundo.
Preço
Preço publicado, sem tokens nem créditos escondidos. Tarefa que falha não é cobrada.
Limites
timeout_sec | 30 |
max_crawl_pages | 25 |
Erros
| HTTP | Código | O que significa |
|---|---|---|
401 | unauthorized | Token ausente ou inválido. Confira o header Authorization. |
402 | insufficient_balance | Saldo insuficiente para esta tarefa. Faça uma recarga e tente de novo. |
404 | unknown_type | Esse tipo de tarefa não existe. Confira o campo type no catálogo. |
429 | rate_limited | Muitas requisições em pouco tempo. Espere um instante e tente de novo. |
413 | input_too_large | A entrada passou do tamanho máximo desta tarefa. Confira os limites publicados. |
422 | task_failed | A tarefa falhou do nosso lado. Você não paga nada por ela. |