ForHosting KIT · Monitorar sites

Rastrear um site inteiro

Com uma única chamada dá para rastrear todas as páginas de um site — até o limite de 25 por execução: o robô parte da URL inicial, segue os links internos e devolve o conteúdo de cada página encontrada. É o jeito rápido de enxergar um site inteiro sem visitar página por página.

● Estávelpor páginaUS$ 0,040
Use pelo WebAPIE-mailApp em breveTelegram em breve

Como o rastreador anda pelo site

Você informa a URL de partida; o robô abre a página em navegador real, coleta os links internos e segue por eles, página a página, até o teto de 25 por execução. Cada página tem até 30 segundos para carregar, e a renderização real significa que sites montados com JavaScript também são percorridos. O resultado volta como tarefa assíncrona, com o conteúdo de cada página visitada organizado para você processar.

O que você recebe de volta

Não é só uma lista de endereços: é o conjunto das páginas rastreadas com o conteúdo de cada uma, pronto para a etapa seguinte — indexar, analisar, inventariar, comparar. Em vez de escrever seu próprio rastreador, cuidar de fila, tempo de espera e renderização, você faz uma chamada e recebe o pacote. O que fazer com ele é decisão sua: o rastreamento entrega a matéria-prima.

Sites maiores que 25 páginas

O teto é por execução, não por site. Para cobrir um site grande, divida por seções e rode uma execução por trecho: comece uma em /blog, outra em /produtos, outra em /ajuda, e some os resultados. A divisão por seção costuma até melhorar a qualidade do inventário, porque cada execução volta tematicamente organizada. Sites de até 25 páginas — a maioria dos institucionais brasileiros — cabem inteiros em uma chamada.

Preço por página, não por site

US$ 0,040 pela chamada, mais US$ 0,001 por página efetivamente rastreada. Uma execução cheia, com 25 páginas, sai por cerca de US$ 0,065 — centavos para enxergar um site inteiro. Se o robô encontrar menos páginas que o teto, você paga menos: a cobrança acompanha o que foi de fato percorrido, e o preço está publicado antes de você usar.

Diagnóstico de site herdado

Uma agência de Curitiba assumiu o site de um cliente sem documentação nenhuma. Antes de orçar o redesign, rastreou o site inteiro: em minutos sabia quantas páginas existiam, o que havia em cada uma e onde estava o conteúdo abandonado.

Inventário antes da migração

A equipe da Padaria Pão Dourado — site institucional pequeno — rastreou as próprias páginas antes de trocar de plataforma. O inventário virou o checklist da migração: nada ficou para trás, nenhuma URL foi esquecida no mapa de redirecionamentos.

Mapa da concorrência

Um consultor de marketing rastreia o site dos concorrentes do cliente para mapear a estrutura: quantas páginas de produto, quais categorias, que conteúdo de apoio publicam. O comparativo estrutural entra na análise de posicionamento.

Por que existe o limite de 25 páginas?

Para manter cada execução rápida, previsível e barata. Sites maiores se cobrem com várias execuções, uma por seção — o custo continua proporcional e o resultado chega organizado por trecho.

O robô sobrecarrega o site rastreado?

O rastreamento é limitado por desenho — no máximo 25 páginas por execução, com tempo de carregamento controlado. Não é uma enxurrada de requisições: é uma visita curta e educada.

Páginas construídas com JavaScript entram no rastreio?

Entram. Cada página abre em navegador real, que executa os scripts antes da coleta — o rastreador enxerga o site como um visitante enxerga.

Quanto custa rastrear meu site?

US$ 0,040 pela chamada mais US$ 0,001 por página. Um site de 25 páginas sai por cerca de US$ 0,065; um de cem páginas, dividido em quatro execuções, fica em torno de US$ 0,26.

Posso rastrear qualquer site da internet?

O robô percorre páginas públicas, como qualquer visitante. Termos de uso do site e LGPD continuam valendo para o que você faz com o conteúdo — coleta de dados pessoais em massa é assunto sério, e a responsabilidade do uso é de quem rastreia.

O conteúdo rastreado fica com vocês?

É entregue como resultado da sua tarefa e o assunto morre aí. Não formamos acervo com os sites que os clientes rastreiam.

Tudo nesta página está disponível via API. Esta seção é para equipes que querem integrar a ferramenta aos próprios sistemas; quem não precisa disso pode simplesmente usar a ferramenta acima.

POSThttps://api.kit.forhosting.com/web/crawl

Autenticação por token Bearer. Um único POST coloca a tarefa na fila; o resultado chega por webhook ou link assinado.

curl -X POST https://api.kit.forhosting.com/web/crawl \
  -H "Authorization: Bearer $KIT_KEY" \
  -H "Content-Type: application/json" \
  -d '{"input":"…"}'
{
  "input": "…"
}
{
  "task_id": "tsk_a1b2c3d4e5f6a1b2c3d4e5f6",
  "type": "web.crawl",
  "status": "queued",
  "_links": {
    "result": "/tasks/tsk_…/result"
  }
}

A API é assíncrona: cada chamada devolve um task_id na hora. Se preferir polling, consulte o status a até 1 requisição por segundo.

por chamadaUS$ 0,040
por páginaUS$ 0,001

Preço publicado, sem tokens nem créditos escondidos. Tarefa que falha não é cobrada.

timeout_sec30
max_crawl_pages25
HTTPCódigoO que significa
401unauthorizedToken ausente ou inválido. Confira o header Authorization.
402insufficient_balanceSaldo insuficiente para esta tarefa. Faça uma recarga e tente de novo.
404unknown_typeEsse tipo de tarefa não existe. Confira o campo type no catálogo.
429rate_limitedMuitas requisições em pouco tempo. Espere um instante e tente de novo.
413input_too_largeA entrada passou do tamanho máximo desta tarefa. Confira os limites publicados.
422task_failedA tarefa falhou do nosso lado. Você não paga nada por ela.

Ver a documentação completa do KIT →