Scansiona le pagine di un sito
Uno strumento che percorre un sito da solo, di pagina in pagina. Parti da un indirizzo e il KIT segue i link interni raccogliendo il contenuto di ogni pagina che incontra, fino a un massimo di 25. Ottieni una mappa del sito con il testo di tutte le pagine visitate.
Da una pagina a tutto il sito
Gli strumenti che leggono una pagina lavorano su un solo indirizzo. La scansione invece parte da uno e si muove: trova i link interni, li apre, ne raccoglie il contenuto e continua, come farebbe un visitatore che clicca di collegamento in collegamento. Il risultato è l’insieme delle pagine del sito con il loro testo, utile quando devi avere il quadro completo — tutte le pagine di un piccolo sito, l’intera sezione di un blog — senza passarle una per una a mano.
Il limite delle 25 pagine
La scansione si ferma a 25 pagine per esecuzione: è un tetto pensato per tenere il servizio veloce ed economico, e va benissimo per siti piccoli e sezioni circoscritte. Per siti più grandi conviene partire da punti diversi — per esempio da ogni categoria — o lanciare più scansioni mirate. Ogni pagina viene aperta in un browser vero, con il consueto limite di 30 secondi per il caricamento, così anche i contenuti costruiti col JavaScript vengono raccolti.
Prezzo a pagina
Qui l’unità è la pagina: costa $0.040 a richiesta più $0.001 per ogni pagina visitata. Una scansione da 25 pagine si aggira quindi sui sette centesimi in tutto. Paghi solo le pagine effettivamente raccolte, a consumo, con PayPal e senza abbonamento. Dalla pagina avvii la scansione e scarichi il risultato; chi la integra in un flusso automatico — per esempio per aggiornare periodicamente un archivio — la comanda via API.
Casi d'uso
Il contenuto di un piccolo sito, tutto insieme
Un’agenzia di Bologna deve rivedere i testi del sito di Tecnoedil Verona S.n.c., una decina di pagine. Una scansione le raccoglie tutte in un colpo, pronte da leggere e correggere, senza aprirle una per una.
Archiviare una sezione di blog
Chiara vuole conservare gli articoli di una sezione. Parte dalla pagina della categoria e la scansione segue i link raccogliendo i pezzi, fino al tetto delle 25 pagine, in un unico risultato ordinato.
Una base per l’analisi o la ricerca interna
Rossi & Figli S.r.l. vuole rendere ricercabile il proprio sito. La scansione raccoglie il testo di tutte le pagine, che diventa la base da dare in pasto a uno strumento di ricerca del KIT.
Domande frequenti
Quante pagine scansiona al massimo?
Fino a 25 pagine per esecuzione. È un tetto pensato per restare veloci ed economici, adatto a siti piccoli e sezioni circoscritte. Per siti più grandi, conviene lanciare più scansioni partendo da punti diversi.
Come sceglie quali pagine visitare?
Parte dall’indirizzo che dai e segue i link interni al sito, di pagina in pagina, fino a raggiungere il limite. Resta all’interno del sito di partenza e non salta su domini esterni.
Cosa mi restituisce di ogni pagina?
L’elenco delle pagine visitate con il loro contenuto testuale. È la base ideale se poi vuoi convertirle in Markdown, analizzarle o renderle ricercabili con altri strumenti del KIT.
Quanto costa?
$0.040 a richiesta più $0.001 per ogni pagina visitata: una scansione da 25 pagine costa circa sette centesimi. Paghi solo le pagine raccolte, a consumo, con PayPal.
Il contenuto del sito viene conservato?
No. Le pagine vengono aperte solo per raccoglierne il contenuto durante la scansione e poi scartate: non conserviamo il sito. Il risultato resta a te.
Rispetta le regole del sito?
La scansione è pensata per siti tuoi o che hai il diritto di analizzare, e resta entro il tetto delle 25 pagine per non appesantire il server di destinazione. Usala in modo responsabile, sui contenuti che puoi legittimamente raccogliere.
Per sviluppatori — accesso via API
Tutto quello che vedi in questa pagina è disponibile anche via API. Questa sezione è per i team che vogliono integrarlo nei propri sistemi; chi non ne ha bisogno può semplicemente usare lo strumento qui sopra.
Endpoint
Autenticazione con Bearer token: un POST mette in coda l'attività e il risultato arriva via webhook o link firmato.
Chiamala dal tuo stack
curl -X POST https://api.kit.forhosting.com/web/crawl \
-H "Authorization: Bearer $KIT_KEY" \
-H "Content-Type: application/json" \
-d '{"input":"…"}'const res = await fetch("https://api.kit.forhosting.com/web/crawl", {
method: "POST",
headers: {
"Authorization": `Bearer ${process.env.KIT_KEY}`,
"Content-Type": "application/json"
},
body: JSON.stringify({
"input": "…"
})
});
const { task_id } = await res.json();import os, requests
res = requests.post(
"https://api.kit.forhosting.com/web/crawl",
headers={"Authorization": f"Bearer {os.environ['KIT_KEY']}"},
json={
"input": "…"
},
)
task_id = res.json()["task_id"]<?php
$res = file_get_contents("https://api.kit.forhosting.com/web/crawl", false, stream_context_create([
"http" => [
"method" => "POST",
"header" => "Authorization: Bearer " . getenv("KIT_KEY") . "\r\nContent-Type: application/json",
"content" => '{"input":"…"}',
],
]));
$task = json_decode($res, true);body := bytes.NewBufferString(`{"input":"…"}`)
req, _ := http.NewRequest("POST", "https://api.kit.forhosting.com/web/crawl", body)
req.Header.Set("Authorization", "Bearer "+os.Getenv("KIT_KEY"))
req.Header.Set("Content-Type", "application/json")
res, _ := http.DefaultClient.Do(req)Esempio di richiesta
{
"input": "…"
}Esempio di risposta
{
"task_id": "tsk_a1b2c3d4e5f6a1b2c3d4e5f6",
"type": "web.crawl",
"status": "queued",
"_links": {
"result": "/tasks/tsk_…/result"
}
}L'API è asincrona: ricevi subito un task_id e puoi fare polling fino a 1 richiesta al secondo.
Prezzi
Prezzo pubblicato, senza token né crediti. Se l'attività fallisce, non paghi.
Limiti
timeout_sec | 30 |
max_crawl_pages | 25 |
Errori
| HTTP | Codice | Significato |
|---|---|---|
401 | unauthorized | Chiave API mancante o non valida: controlla l'header Authorization. |
402 | insufficient_balance | Credito esaurito: ricarica per continuare a eseguire attività. |
404 | unknown_type | Tipo di attività sconosciuto: controlla il campo type della richiesta. |
429 | rate_limited | Troppe richieste in poco tempo: rallenta e riprova tra qualche secondo. |
413 | input_too_large | Il file o il testo inviato supera il limite di questo strumento. |
422 | task_failed | L'attività non è andata a buon fine: non ti viene addebitato nulla. |