Extrair dados de site com IA
Permite extrair dados de site com IA: em vez de escrever seletor, você descreve em português o que quer da página — “o nome do produto, o preço à vista e o parcelamento” — e o modelo lê a página renderizada e devolve um JSON com esses campos. Menos código, mais tolerância a mudança de layout.
Rode online
Rode nos nossos servidores com a sua conta. As ferramentas grátis rodam no seu navegador; esta aqui é descontada do seu saldo do KIT pelo preço acima.
Você pede, a IA encontra
A chamada leva a URL e um pedido em linguagem natural. A página abre em navegador real — JavaScript incluído —, e um modelo de IA lê o conteúdo renderizado procurando exatamente o que você descreveu. O resultado volta como JSON estruturado, pela via assíncrona: task_id, status, download. Não é preciso inspecionar HTML, decorar classes nem manter seletor: o pedido é o contrato.
Onde a IA ganha do seletor
Em três cenários clássicos. Páginas que mudam de layout com frequência: o seletor quebra, o pedido em português continua fazendo sentido. Fontes heterogêneas: cada fornecedor formata a página de um jeito, e um único pedido cobre todas. E dado espalhado em texto corrido — condições de entrega no meio de um parágrafo, por exemplo —, onde simplesmente não existe um elemento certinho para apontar. Nesses casos, a IA extrai o que o seletor nem enxerga.
Honestidade sobre precisão
Um modelo de IA lê e interpreta — e interpretação tem margem de erro. O modelo trabalha instruído a extrair o que está na página, não a criar, mas pode se confundir com ambiguidades: dois preços na tela, promoção ao lado do valor cheio. Para dado que alimenta decisão automática, valide o resultado — formato, faixa de valores, campo obrigatório presente — antes de confiar. É a mesma disciplina de qualquer extração automatizada, com um grau extra de atenção.
Preço com IA no circuito
US$ 0,046 por chamada mais US$ 0,0145 por URL — mais caro que a raspagem por seletor, porque há um navegador e um modelo de linguagem trabalhando em cada execução. A conta fecha quando o seletor custa manutenção: cinquenta páginas de fornecedores diferentes saem por cerca de US$ 3,03, sem escrever nem manter uma linha de seletor sequer. O limite de carregamento segue sendo 30 segundos por página.
Casos de uso
Catálogo de fornecedores bagunçado
A Distribuidora Horizonte Verde coleta nome, preço e unidade de venda nas páginas de dezenas de fornecedores — cada uma com um layout. Um único pedido em português cobre todas: “o nome do produto, o preço e a embalagem mínima”. O JSON cai padronizado na planilha de compras.
Comparativo de imóveis
Um corretor em Belo Horizonte extrai quartos, metragem, bairro e condomínio de anúncios espalhados por portais diferentes e monta o comparativo para o cliente na mesma tarde — sem digitar ficha por ficha.
Agenda regional de eventos
Uma produtora cultural de Recife coleta data, local e preço do ingresso das páginas de eventos da cidade. As páginas não seguem padrão nenhum; o pedido em linguagem natural resolve o que dezenas de seletores não resolveriam.
Perguntas frequentes
Preciso saber programar para usar?
Para chamar a API, o básico de uma requisição HTTP. Para descrever a extração, não: o pedido é texto comum, em português, dizendo quais campos você quer.
A IA pode inventar um dado que não está na página?
O modelo é orientado a extrair, não a criar — mas interpretação tem margem de erro, e ambiguidade na página pode gerar resposta errada. Para uso crítico, valide formato e plausibilidade do resultado antes de agir sobre ele.
Por que custa mais que a raspagem por seletor?
Porque cada execução envolve navegador real e um modelo de linguagem lendo a página: US$ 0,046 por chamada mais US$ 0,0145 por URL. Você troca esse custo pela manutenção de seletores que quebram.
Posso escrever o pedido em português mesmo?
Pode — é o caminho natural. Descreva os campos como descreveria para um estagiário atento: “o preço à vista, sem o parcelado” funciona melhor que um pedido vago.
Página pesada de JavaScript entra?
Entra: a leitura acontece sobre a página renderizada, com até 30 segundos de carregamento. O que um visitante vê, o modelo lê.
Minhas páginas e pedidos treinam a IA de vocês?
Não. A tarefa é processada para gerar a sua resposta e devolvida a você — o seu conteúdo não vira produto nosso nem insumo de treino.
Para desenvolvedores — acesso via API
Tudo nesta página está disponível via API. Esta seção é para equipes que querem integrar a ferramenta aos próprios sistemas; quem não precisa disso pode simplesmente usar a ferramenta acima.
Endpoint
Autenticação por token Bearer. Um único POST coloca a tarefa na fila; o resultado chega por webhook ou link assinado.
Chame do seu código
curl -X POST https://api.kit.forhosting.com/web/scrape-ai \
-H "Authorization: Bearer $KIT_KEY" \
-H "Content-Type: application/json" \
-d '{"url":"https://ejemplo.com"}'const res = await fetch("https://api.kit.forhosting.com/web/scrape-ai", {
method: "POST",
headers: {
"Authorization": `Bearer ${process.env.KIT_KEY}`,
"Content-Type": "application/json"
},
body: JSON.stringify({
"url": "https://ejemplo.com"
})
});
const { task_id } = await res.json();import os, requests
res = requests.post(
"https://api.kit.forhosting.com/web/scrape-ai",
headers={"Authorization": f"Bearer {os.environ['KIT_KEY']}"},
json={
"url": "https://ejemplo.com"
},
)
task_id = res.json()["task_id"]<?php
$res = file_get_contents("https://api.kit.forhosting.com/web/scrape-ai", false, stream_context_create([
"http" => [
"method" => "POST",
"header" => "Authorization: Bearer " . getenv("KIT_KEY") . "\r\nContent-Type: application/json",
"content" => '{"url":"https://ejemplo.com"}',
],
]));
$task = json_decode($res, true);body := bytes.NewBufferString(`{"url":"https://ejemplo.com"}`)
req, _ := http.NewRequest("POST", "https://api.kit.forhosting.com/web/scrape-ai", body)
req.Header.Set("Authorization", "Bearer "+os.Getenv("KIT_KEY"))
req.Header.Set("Content-Type", "application/json")
res, _ := http.DefaultClient.Do(req)Exemplo de requisição
{
"url": "https://ejemplo.com"
}Exemplo de resposta
{
"task_id": "tsk_a1b2c3d4e5f6a1b2c3d4e5f6",
"type": "web.scrape_ai",
"status": "queued",
"_links": {
"result": "/tasks/tsk_…/result"
}
}A API é assíncrona: cada chamada devolve um task_id na hora. Se preferir polling, consulte o status a até 1 requisição por segundo.
Preço
Preço publicado, sem tokens nem créditos escondidos. Tarefa que falha não é cobrada.
Limites
timeout_sec | 30 |
max_crawl_pages | 25 |
Erros
| HTTP | Código | O que significa |
|---|---|---|
401 | unauthorized | Token ausente ou inválido. Confira o header Authorization. |
402 | insufficient_balance | Saldo insuficiente para esta tarefa. Faça uma recarga e tente de novo. |
404 | unknown_type | Esse tipo de tarefa não existe. Confira o campo type no catálogo. |
429 | rate_limited | Muitas requisições em pouco tempo. Espere um instante e tente de novo. |
422 | task_failed | A tarefa falhou do nosso lado. Você não paga nada por ela. |