CSSセレクタでデータ抽出する方法
KITはCSSセレクタで指定した部分のテキストや属性を、Webページから取り出すツールです。同じ構造を持つページから、価格や在庫などの決まった項目を繰り返し収集したい担当者向けに使えます。
オンラインで実行
アカウントでログインし、当社のサーバー上で実行します。無料ツールはブラウザ内で動作しますが、これは上記の料金がKIT残高から差し引かれます。
セレクタで指定するとはどういうことか
取り出したい項目を、ブラウザの開発者ツールで確認できるクラス名やIDなどのCSSセレクタで指定します。指定した箇所のテキストや属性値だけが結果として返されます。
AIによる抽出との違い
ページの構造があらかじめ分かっている場合はこの機能が向いています。構造が分からない、またはページごとにレイアウトが異なる場合は、AIが内容を判断して抽出する別の機能の方が適しています。
どんな場面で使うか
自社サイトの商品一覧から価格を抽出する、求人サイトの決まった項目だけを定期的に取得するなど、構造が固定されたページの繰り返し処理に向いています。
料金と注意点
料金は1リクエストあたり$0.040(米ドル)に1件$0.001を加えた金額です。対象サイトのページ構造が変わると、セレクタが一致しなくなり結果が空になる場合があります。
活用例
自社サイトの価格一覧抽出
EC運営者の鈴木美咲が、自社サイトの商品一覧ページからセレクタを指定して価格だけを抽出している。
社内ツールへのデータ取り込み
開発者の佐藤健一が、決まった構造のページからセレクタでデータを取り出し、社内ツールへの取り込み処理に組み込んでいる。
求人情報の定期抽出
採用担当の山本翔太が、求人サイトの決まった項目だけをセレクタで指定し、定期的に抽出している。
よくある質問
CSSセレクタが分からない場合はどうすればよいですか。
ブラウザの開発者ツールで対象の要素を右クリックし「検証」を選ぶと、クラス名やIDを確認できます。
対象サイトの構造が変わったらどうなりますか。
指定したセレクタが一致しなくなり、結果が空になる場合があります。定期的にセレクタの確認をおすすめします。
AIで抽出する機能との違いは何ですか。
こちらはあらかじめ分かっている構造をセレクタで指定する方式です。構造が分からない場合は、AIが内容を判断する別の機能が向いています。
他社サイトを対象にしても問題ありませんか。
対象サイトの利用規約に従ってご利用ください。過度な頻度でのアクセスは対象サイトの負荷につながる場合があります。
料金の計算方法を教えてください。
1リクエストあたり$0.040に、処理件数1件ごと$0.001を加えた金額です。
日本語のサポートはありますか。
申し訳ありませんが、日本語でのサポートは行っておりません。サポートは英語またはスペイン語で、担当者が直接対応します。ツール自体は日本語で問題なくご利用いただけます。
開発者向け — APIアクセス
このページの機能はすべてAPIからも利用できます。自社システムに組み込みたいチーム向けのセクションです。それ以外の方は上のツールをそのままお使いください。
エンドポイント
Bearerトークンで認証し、POST1回でタスクをキューに登録します。結果はWebhookまたは署名付きリンクで受け取れます。
お使いのスタックから呼び出す
curl -X POST https://api.kit.forhosting.com/web/scrape-selector \
-H "Authorization: Bearer $KIT_KEY" \
-H "Content-Type: application/json" \
-d '{"url":"https://ejemplo.com","selectors":{"titulo":"h1","precio":".price"}}'const res = await fetch("https://api.kit.forhosting.com/web/scrape-selector", {
method: "POST",
headers: {
"Authorization": `Bearer ${process.env.KIT_KEY}`,
"Content-Type": "application/json"
},
body: JSON.stringify({
"url": "https://ejemplo.com",
"selectors": {
"titulo": "h1",
"precio": ".price"
}
})
});
const { task_id } = await res.json();import os, requests
res = requests.post(
"https://api.kit.forhosting.com/web/scrape-selector",
headers={"Authorization": f"Bearer {os.environ['KIT_KEY']}"},
json={
"url": "https://ejemplo.com",
"selectors": {
"titulo": "h1",
"precio": ".price"
}
},
)
task_id = res.json()["task_id"]<?php
$res = file_get_contents("https://api.kit.forhosting.com/web/scrape-selector", false, stream_context_create([
"http" => [
"method" => "POST",
"header" => "Authorization: Bearer " . getenv("KIT_KEY") . "\r\nContent-Type: application/json",
"content" => '{"url":"https://ejemplo.com","selectors":{"titulo":"h1","precio":".price"}}',
],
]));
$task = json_decode($res, true);body := bytes.NewBufferString(`{"url":"https://ejemplo.com","selectors":{"titulo":"h1","precio":".price"}}`)
req, _ := http.NewRequest("POST", "https://api.kit.forhosting.com/web/scrape-selector", body)
req.Header.Set("Authorization", "Bearer "+os.Getenv("KIT_KEY"))
req.Header.Set("Content-Type", "application/json")
res, _ := http.DefaultClient.Do(req)リクエスト例
{
"url": "https://ejemplo.com",
"selectors": {
"titulo": "h1",
"precio": ".price"
}
}レスポンス例
{
"task_id": "tsk_a1b2c3d4e5f6a1b2c3d4e5f6",
"type": "web.scrape_selector",
"status": "queued",
"_links": {
"result": "/tasks/tsk_…/result"
}
}非同期APIです。task_idは即時に返ります。ポーリングは1秒あたり1リクエストまでです。
料金
単価はすべて公開しています。トークン換算や独自クレジットはありません。失敗したタスクは課金されません。
制限
timeout_sec | 30 |
max_crawl_pages | 25 |
エラー
| HTTP | コード | 意味 |
|---|---|---|
401 | unauthorized | APIキーが無効か、指定されていません。Authorizationヘッダーを確認してください。 |
402 | insufficient_balance | 残高が不足しています。チャージ後に再度お試しください。 |
404 | unknown_type | 指定されたタスクタイプは存在しません。タイプ名を確認してください。 |
429 | rate_limited | リクエストが多すぎます。しばらく待ってから再度お試しください。 |
422 | task_failed | タスクの処理に失敗しました。このタスクは課金されません。 |