ForHosting KIT · Veille et lecture de sites web

Explorer un site page par page

L’exploration parcourt un site en suivant ses liens internes, de page en page, jusqu’à une limite de 25 pages. Plutôt qu’une adresse à la fois, vous lancez une seule opération qui visite l’ensemble et rassemble le contenu de chaque page. Pratique pour un inventaire, une migration ou un audit.

● Stablepar requête + par page$0.040
Utilisez-le depuis WebAPIE-mailApp bientôtTelegram bientôt

Suivre les liens tout seul

Vous donnez une adresse de départ, et l’outil fait le reste : il lit la page, repère les liens qui mènent vers d’autres pages du même site, les visite à leur tour, et ainsi de suite. De proche en proche, il reconstitue le chemin à travers le site sans que vous ayez à lister les adresses une à une. C’est la différence entre traiter une page isolée et parcourir un ensemble de pages reliées entre elles.

Une limite de 25 pages

L’exploration s’arrête à 25 pages par opération. Cette borne garde le traitement rapide, prévisible et au coût maîtrisé, et convient à un site vitrine, un blog modeste ou une section précise d’un plus grand site. Elle n’est pas faite pour aspirer un site marchand de plusieurs milliers de pages : dans ce cas, mieux vaut cibler une rubrique, ou enchaîner plusieurs explorations sur des points de départ différents, chacune dans sa limite.

Ce que vous récupérez de chaque page

Pour chaque page visitée, l’outil rassemble le contenu utile — le texte, les liens rencontrés — de sorte que vous obtenez, en une fois, la matière de tout le parcours. Au lieu de vingt-cinq extractions séparées à recoller, vous disposez d’un ensemble cohérent, prêt à parcourir ou à traiter. C’est ce qui fait gagner du temps sur un inventaire ou une revue de contenu, où l’on veut voir le site dans son ensemble.

À quoi sert une exploration

Trois usages reviennent souvent : l’inventaire, pour savoir ce que contient un site avant une refonte ; la migration, pour récupérer le contenu existant et le porter ailleurs ; l’audit, pour passer en revue les pages et leurs liens. Dans chacun, l’intérêt est le même : embrasser plusieurs pages d’un coup plutôt que de cliquer de l’une à l’autre, en gardant une trace ordonnée de ce qui a été parcouru.

Inventaire avant refonte

Avant de refaire son site, Atelier Garnier SARL en explore les pages pour savoir exactement quel contenu existe et mérite d’être repris.

Migration de contenu

Studio Lumen SAS récupère en une opération le texte des pages d’un site vitrine, afin de le transférer vers une nouvelle plateforme.

Revue de contenu

Sophie Nguyen parcourt les pages d’un blog pour repérer les articles à mettre à jour, sans les ouvrir un par un dans le navigateur.

Section ciblée

Sur un grand site, Julien Lefèvre lance l’exploration depuis une rubrique précise pour n’en parcourir que les pages qui l’intéressent.

Combien de pages l’exploration couvre-t-elle ?

Jusqu’à 25 pages par opération. Cette limite garde le traitement rapide et le coût maîtrisé ; pour aller plus loin, enchaînez plusieurs explorations depuis des points de départ différents.

Comment l’outil choisit-il les pages à visiter ?

Il part de l’adresse fournie, suit les liens internes qu’il y trouve, puis ceux des pages suivantes, de proche en proche, jusqu’à atteindre la limite de pages.

Puis-je explorer un très grand site ?

Pas en une seule fois : la borne de 25 pages n’est pas conçue pour un site de milliers de pages. Ciblez une rubrique ou découpez l’exploration en plusieurs points de départ.

Combien coûte une exploration ?

Le tarif est de $0.040 par requête et $0.001 par page parcourue, en dollars US. Le coût dépend donc du nombre de pages effectivement visitées.

Les adresses et le contenu sont-ils conservés ?

Non. Le site est parcouru le temps de rassembler le contenu, qui vous est renvoyé, puis les adresses et les résultats sont écartés de nos serveurs.

Faut-il un compte ?

Non, aucune inscription. Le service se règle à l’usage ; pour une facture, écrivez à [email protected].

Tout sur cette page est disponible par programmation. Cette section s'adresse aux équipes qui veulent l'intégrer à leurs systèmes ; les autres peuvent simplement utiliser l'outil ci-dessus.

POSThttps://api.kit.forhosting.com/web/crawl

Authentification par jeton Bearer : un seul POST met la tâche en file d’attente, et le résultat vous parvient par webhook ou lien signé.

curl -X POST https://api.kit.forhosting.com/web/crawl \
  -H "Authorization: Bearer $KIT_KEY" \
  -H "Content-Type: application/json" \
  -d '{"input":"…"}'
{
  "input": "…"
}
{
  "task_id": "tsk_a1b2c3d4e5f6a1b2c3d4e5f6",
  "type": "web.crawl",
  "status": "queued",
  "_links": {
    "result": "/tasks/tsk_…/result"
  }
}

L’API est asynchrone : chaque appel renvoie un task_id immédiatement, puis vous interrogez l’état à raison d’une requête par seconde.

par requête$0.040
par page$0.001

Le prix est publié, sans tokens ni crédits. Une tâche qui échoue n’est pas facturée.

timeout_sec30
max_crawl_pages25
HTTPCodeSignification
401unauthorizedClé API absente ou invalide : vérifiez l’en-tête Authorization.
402insufficient_balanceSolde insuffisant : rechargez votre compte pour lancer cette tâche.
404unknown_typeType de tâche inconnu : vérifiez le champ type de votre requête.
429rate_limitedTrop de requêtes : ralentissez la cadence, puis réessayez.
413input_too_largeEntrée trop volumineuse : consultez la limite de taille de cette capacité.
422task_failedLa tâche a échoué : elle ne vous est pas facturée.

Consulter la documentation complète du KIT →