ForHosting KIT · Monitorar sites

Extrair dados de site com IA

Permite extrair dados de site com IA: em vez de escrever seletor, você descreve em português o que quer da página — “o nome do produto, o preço à vista e o parcelamento” — e o modelo lê a página renderizada e devolve um JSON com esses campos. Menos código, mais tolerância a mudança de layout.

● Estávelpor URLUS$ 0,046
Use pelo WebAPIE-mailApp em breveTelegram em breve

Rode nos nossos servidores com a sua conta. As ferramentas grátis rodam no seu navegador; esta aqui é descontada do seu saldo do KIT pelo preço acima.

Você pede, a IA encontra

A chamada leva a URL e um pedido em linguagem natural. A página abre em navegador real — JavaScript incluído —, e um modelo de IA lê o conteúdo renderizado procurando exatamente o que você descreveu. O resultado volta como JSON estruturado, pela via assíncrona: task_id, status, download. Não é preciso inspecionar HTML, decorar classes nem manter seletor: o pedido é o contrato.

Onde a IA ganha do seletor

Em três cenários clássicos. Páginas que mudam de layout com frequência: o seletor quebra, o pedido em português continua fazendo sentido. Fontes heterogêneas: cada fornecedor formata a página de um jeito, e um único pedido cobre todas. E dado espalhado em texto corrido — condições de entrega no meio de um parágrafo, por exemplo —, onde simplesmente não existe um elemento certinho para apontar. Nesses casos, a IA extrai o que o seletor nem enxerga.

Honestidade sobre precisão

Um modelo de IA lê e interpreta — e interpretação tem margem de erro. O modelo trabalha instruído a extrair o que está na página, não a criar, mas pode se confundir com ambiguidades: dois preços na tela, promoção ao lado do valor cheio. Para dado que alimenta decisão automática, valide o resultado — formato, faixa de valores, campo obrigatório presente — antes de confiar. É a mesma disciplina de qualquer extração automatizada, com um grau extra de atenção.

Preço com IA no circuito

US$ 0,046 por chamada mais US$ 0,0145 por URL — mais caro que a raspagem por seletor, porque há um navegador e um modelo de linguagem trabalhando em cada execução. A conta fecha quando o seletor custa manutenção: cinquenta páginas de fornecedores diferentes saem por cerca de US$ 3,03, sem escrever nem manter uma linha de seletor sequer. O limite de carregamento segue sendo 30 segundos por página.

Catálogo de fornecedores bagunçado

A Distribuidora Horizonte Verde coleta nome, preço e unidade de venda nas páginas de dezenas de fornecedores — cada uma com um layout. Um único pedido em português cobre todas: “o nome do produto, o preço e a embalagem mínima”. O JSON cai padronizado na planilha de compras.

Comparativo de imóveis

Um corretor em Belo Horizonte extrai quartos, metragem, bairro e condomínio de anúncios espalhados por portais diferentes e monta o comparativo para o cliente na mesma tarde — sem digitar ficha por ficha.

Agenda regional de eventos

Uma produtora cultural de Recife coleta data, local e preço do ingresso das páginas de eventos da cidade. As páginas não seguem padrão nenhum; o pedido em linguagem natural resolve o que dezenas de seletores não resolveriam.

Preciso saber programar para usar?

Para chamar a API, o básico de uma requisição HTTP. Para descrever a extração, não: o pedido é texto comum, em português, dizendo quais campos você quer.

A IA pode inventar um dado que não está na página?

O modelo é orientado a extrair, não a criar — mas interpretação tem margem de erro, e ambiguidade na página pode gerar resposta errada. Para uso crítico, valide formato e plausibilidade do resultado antes de agir sobre ele.

Por que custa mais que a raspagem por seletor?

Porque cada execução envolve navegador real e um modelo de linguagem lendo a página: US$ 0,046 por chamada mais US$ 0,0145 por URL. Você troca esse custo pela manutenção de seletores que quebram.

Posso escrever o pedido em português mesmo?

Pode — é o caminho natural. Descreva os campos como descreveria para um estagiário atento: “o preço à vista, sem o parcelado” funciona melhor que um pedido vago.

Página pesada de JavaScript entra?

Entra: a leitura acontece sobre a página renderizada, com até 30 segundos de carregamento. O que um visitante vê, o modelo lê.

Minhas páginas e pedidos treinam a IA de vocês?

Não. A tarefa é processada para gerar a sua resposta e devolvida a você — o seu conteúdo não vira produto nosso nem insumo de treino.

Tudo nesta página está disponível via API. Esta seção é para equipes que querem integrar a ferramenta aos próprios sistemas; quem não precisa disso pode simplesmente usar a ferramenta acima.

POSThttps://api.kit.forhosting.com/web/scrape-ai

Autenticação por token Bearer. Um único POST coloca a tarefa na fila; o resultado chega por webhook ou link assinado.

curl -X POST https://api.kit.forhosting.com/web/scrape-ai \
  -H "Authorization: Bearer $KIT_KEY" \
  -H "Content-Type: application/json" \
  -d '{"url":"https://ejemplo.com"}'
{
  "url": "https://ejemplo.com"
}
{
  "task_id": "tsk_a1b2c3d4e5f6a1b2c3d4e5f6",
  "type": "web.scrape_ai",
  "status": "queued",
  "_links": {
    "result": "/tasks/tsk_…/result"
  }
}

A API é assíncrona: cada chamada devolve um task_id na hora. Se preferir polling, consulte o status a até 1 requisição por segundo.

por chamadaUS$ 0,046
por URLUS$ 0,0145

Preço publicado, sem tokens nem créditos escondidos. Tarefa que falha não é cobrada.

timeout_sec30
max_crawl_pages25
HTTPCódigoO que significa
401unauthorizedToken ausente ou inválido. Confira o header Authorization.
402insufficient_balanceSaldo insuficiente para esta tarefa. Faça uma recarga e tente de novo.
404unknown_typeEsse tipo de tarefa não existe. Confira o campo type no catálogo.
429rate_limitedMuitas requisições em pouco tempo. Espere um instante e tente de novo.
422task_failedA tarefa falhou do nosso lado. Você não paga nada por ela.

Ver a documentação completa do KIT →