Estrai un articolo
Uno strumento che isola l’articolo vero da una pagina piena di contorno. Incolli l’indirizzo e il KIT riconosce il corpo del testo — titolo, autore, paragrafi, immagini interne — e scarta banner, menù, pop-up e articoli correlati. Ottieni il pezzo pulito e leggibile, pronto da leggere, salvare o riusare.
Esegui online
Esegui questo sui nostri server con il tuo account. Gli strumenti gratuiti girano nel tuo browser; questo viene addebitato sul tuo saldo KIT al prezzo indicato sopra.
Il pezzo, senza il rumore intorno
Una pagina di notizie oggi è un campo minato: pubblicità che si aprono, richieste di consenso, box di articoli suggeriti, newsletter da sottoscrivere. L’articolo vero è lì in mezzo, ma sepolto. Questo strumento fa quello che fa la modalità lettura del browser, ma in modo affidabile e riusabile: individua il contenuto principale e ti restituisce solo quello. Titolo, firma, data quando ci sono, e il testo integrale. Il resto sparisce.
Cosa riconosce
Oltre al corpo del testo, lo strumento prova a estrarre i metadati utili di un articolo: il titolo, l’autore, la data di pubblicazione e l’immagine principale, quando la pagina li dichiara. Funziona meglio sulle pagine pensate come articoli — notizie, blog, guide — ed è meno adatto a pagine che articoli non sono, come una home o un elenco di prodotti. Per quelle conviene lo strumento che estrae tutto il testo o quello per il Markdown.
Prezzo e canali
Costa $0.040 a richiesta più $0.001 per ogni URL, circa quattro centesimi ad articolo. Si paga a consumo con PayPal, senza abbonamento e senza account. Dalla pagina incolli il link e leggi l’articolo pulito; chi ne raccoglie molti — una rassegna stampa, per esempio — può automatizzare l’estrazione via API. In arrivo anche app, email e Telegram come canali.
Casi d'uso
Leggere in pace un pezzo lungo
Marco vuole leggere un’inchiesta senza essere interrotto da pop-up e richieste di consenso. Estrae l’articolo pulito e lo legge di fila, con titolo e firma al loro posto e nient’altro intorno.
Una rassegna stampa ordinata
L’ufficio comunicazione di un’azienda di Verona raccoglie ogni mattina gli articoli che citano il marchio. Estrae il corpo di ciascuno, così la rassegna è fatta di testi leggibili, non di pagine intere piene di banner.
Salvare una guida da consultare offline
Chiara trova una guida utile ma zeppa di pubblicità. Ne estrae l’articolo pulito e lo archivia: quando le servirà, avrà il testo essenziale senza il rumore del sito.
Domande frequenti
In cosa è diverso dall’estrarre tutto il testo?
L’estrazione del testo prende ogni parola della pagina, contorno compreso. Questo strumento invece riconosce l’articolo vero e restituisce solo quello, scartando menù, banner e box di articoli correlati, con titolo e firma quando disponibili.
Prende anche autore e data?
Quando la pagina li dichiara, sì: estrae titolo, autore, data di pubblicazione e immagine principale. Se un dato non è presente o non è indicato chiaramente, quel campo resta vuoto.
Funziona con qualsiasi pagina?
Dà il meglio sulle pagine pensate come articoli — notizie, blog, guide. Su home, elenchi o pagine prodotto il riconoscimento è meno affidabile: per quelle conviene lo strumento che estrae tutto il testo o quello per il Markdown.
Quanto costa?
$0.040 a richiesta più $0.001 per URL, circa quattro centesimi ad articolo. Nessun abbonamento; si paga a consumo con PayPal.
L’articolo che estraggo viene conservato?
No. L’indirizzo si apre solo per isolare l’articolo e poi viene scartato: non conserviamo né la pagina né il testo estratto.
Posso leggerlo dal telefono?
Sì. Incolli il link dal browser del telefono e ottieni l’articolo pulito, comodo da leggere anche su schermo piccolo.
Per sviluppatori — accesso via API
Tutto quello che vedi in questa pagina è disponibile anche via API. Questa sezione è per i team che vogliono integrarlo nei propri sistemi; chi non ne ha bisogno può semplicemente usare lo strumento qui sopra.
Endpoint
Autenticazione con Bearer token: un POST mette in coda l'attività e il risultato arriva via webhook o link firmato.
Chiamala dal tuo stack
curl -X POST https://api.kit.forhosting.com/web/article \
-H "Authorization: Bearer $KIT_KEY" \
-H "Content-Type: application/json" \
-d '{"url":"https://ejemplo.com"}'const res = await fetch("https://api.kit.forhosting.com/web/article", {
method: "POST",
headers: {
"Authorization": `Bearer ${process.env.KIT_KEY}`,
"Content-Type": "application/json"
},
body: JSON.stringify({
"url": "https://ejemplo.com"
})
});
const { task_id } = await res.json();import os, requests
res = requests.post(
"https://api.kit.forhosting.com/web/article",
headers={"Authorization": f"Bearer {os.environ['KIT_KEY']}"},
json={
"url": "https://ejemplo.com"
},
)
task_id = res.json()["task_id"]<?php
$res = file_get_contents("https://api.kit.forhosting.com/web/article", false, stream_context_create([
"http" => [
"method" => "POST",
"header" => "Authorization: Bearer " . getenv("KIT_KEY") . "\r\nContent-Type: application/json",
"content" => '{"url":"https://ejemplo.com"}',
],
]));
$task = json_decode($res, true);body := bytes.NewBufferString(`{"url":"https://ejemplo.com"}`)
req, _ := http.NewRequest("POST", "https://api.kit.forhosting.com/web/article", body)
req.Header.Set("Authorization", "Bearer "+os.Getenv("KIT_KEY"))
req.Header.Set("Content-Type", "application/json")
res, _ := http.DefaultClient.Do(req)Esempio di richiesta
{
"url": "https://ejemplo.com"
}Esempio di risposta
{
"task_id": "tsk_a1b2c3d4e5f6a1b2c3d4e5f6",
"type": "web.article",
"status": "queued",
"_links": {
"result": "/tasks/tsk_…/result"
}
}L'API è asincrona: ricevi subito un task_id e puoi fare polling fino a 1 richiesta al secondo.
Prezzi
Prezzo pubblicato, senza token né crediti. Se l'attività fallisce, non paghi.
Limiti
timeout_sec | 30 |
max_crawl_pages | 25 |
Errori
| HTTP | Codice | Significato |
|---|---|---|
401 | unauthorized | Chiave API mancante o non valida: controlla l'header Authorization. |
402 | insufficient_balance | Credito esaurito: ricarica per continuare a eseguire attività. |
404 | unknown_type | Tipo di attività sconosciuto: controlla il campo type della richiesta. |
429 | rate_limited | Troppe richieste in poco tempo: rallenta e riprova tra qualche secondo. |
422 | task_failed | L'attività non è andata a buon fine: non ti viene addebitato nulla. |