【セレクタ不要】AIがWebページからデータ抽出
KITはCSSセレクタを指定せず、抽出したい項目を伝えるだけでAIが内容を判断して取り出すツールです。サイトごとにページ構造がばらばらで、同じセレクタが使えない場合に向いています。
オンラインで実行
アカウントでログインし、当社のサーバー上で実行します。無料ツールはブラウザ内で動作しますが、これは上記の料金がKIT残高から差し引かれます。
セレクタ指定との違い
あらかじめ構造が分かっているページにはセレクタ指定の方式が向いていますが、この機能はページの内容をAIが読み取って判断するため、構造が分からないページやサイトごとにレイアウトが異なる場合にも対応できます。
料金がやや高い理由
ブラウザでページを開く処理に加えて、内容を判断するAIの処理が加わるため、セレクタ指定の機能より料金が高くなっています。基本料金は1リクエストあたり$0.046(米ドル)、これに1件$0.0145が加わります。
精度についての注意
AIが内容を判断して抽出するため、まれに項目を取り違えたり、該当する情報が見つからなかったりする場合があります。重要な用途では結果を確認してからご利用ください。
どんな場面で使うか
複数の仕入れ先サイトから型番と価格をまとめて抽出する、レイアウトが異なる求人媒体から条件をまとめて取り出すなど、サイトごとの構造の違いを気にせず使いたい場合に向いています。
活用例
仕入れ先サイトの価格・型番抽出
個人事業主の田中大輔が、レイアウトの異なる複数の仕入れ先サイトから型番と価格をAIに読み取らせている。
求人媒体ごとの条件抽出
採用担当の山本翔太が、媒体ごとにレイアウトが異なる求人ページから、給与や勤務地などの条件をまとめて抽出している。
商品リサーチの効率化
EC運営者の鈴木美咲が、構造の異なる複数の競合サイトから同じ項目(価格・在庫)をAIに抽出させている。
よくある質問
抽出結果が間違うことはありますか。
AIが内容を判断するため、まれに項目を取り違えたり、該当する情報が見つからなかったりする場合があります。重要な用途では結果をご確認ください。
セレクタ指定の機能より料金が高いのはなぜですか。
ブラウザでの描画処理に加えてAIによる判断処理が加わるためです。基本料金$0.046に1件$0.0145が加わります。
日本語のページにも対応していますか。
対応しています。ページの言語を問わず、指定した項目の抽出を試みます。
他社サイトを対象にしても問題ありませんか。
対象サイトの利用規約に従ってご利用ください。過度な頻度でのアクセスは対象サイトの負荷につながる場合があります。
処理にはどのくらい時間がかかりますか。
1回の処理は30秒以内に完了する必要があります。
日本語のサポートはありますか。
申し訳ありませんが、日本語でのサポートは行っておりません。サポートは英語またはスペイン語で、担当者が直接対応します。ツール自体は日本語で問題なくご利用いただけます。
開発者向け — APIアクセス
このページの機能はすべてAPIからも利用できます。自社システムに組み込みたいチーム向けのセクションです。それ以外の方は上のツールをそのままお使いください。
エンドポイント
Bearerトークンで認証し、POST1回でタスクをキューに登録します。結果はWebhookまたは署名付きリンクで受け取れます。
お使いのスタックから呼び出す
curl -X POST https://api.kit.forhosting.com/web/scrape-ai \
-H "Authorization: Bearer $KIT_KEY" \
-H "Content-Type: application/json" \
-d '{"url":"https://ejemplo.com"}'const res = await fetch("https://api.kit.forhosting.com/web/scrape-ai", {
method: "POST",
headers: {
"Authorization": `Bearer ${process.env.KIT_KEY}`,
"Content-Type": "application/json"
},
body: JSON.stringify({
"url": "https://ejemplo.com"
})
});
const { task_id } = await res.json();import os, requests
res = requests.post(
"https://api.kit.forhosting.com/web/scrape-ai",
headers={"Authorization": f"Bearer {os.environ['KIT_KEY']}"},
json={
"url": "https://ejemplo.com"
},
)
task_id = res.json()["task_id"]<?php
$res = file_get_contents("https://api.kit.forhosting.com/web/scrape-ai", false, stream_context_create([
"http" => [
"method" => "POST",
"header" => "Authorization: Bearer " . getenv("KIT_KEY") . "\r\nContent-Type: application/json",
"content" => '{"url":"https://ejemplo.com"}',
],
]));
$task = json_decode($res, true);body := bytes.NewBufferString(`{"url":"https://ejemplo.com"}`)
req, _ := http.NewRequest("POST", "https://api.kit.forhosting.com/web/scrape-ai", body)
req.Header.Set("Authorization", "Bearer "+os.Getenv("KIT_KEY"))
req.Header.Set("Content-Type", "application/json")
res, _ := http.DefaultClient.Do(req)リクエスト例
{
"url": "https://ejemplo.com"
}レスポンス例
{
"task_id": "tsk_a1b2c3d4e5f6a1b2c3d4e5f6",
"type": "web.scrape_ai",
"status": "queued",
"_links": {
"result": "/tasks/tsk_…/result"
}
}非同期APIです。task_idは即時に返ります。ポーリングは1秒あたり1リクエストまでです。
料金
単価はすべて公開しています。トークン換算や独自クレジットはありません。失敗したタスクは課金されません。
制限
timeout_sec | 30 |
max_crawl_pages | 25 |
エラー
| HTTP | コード | 意味 |
|---|---|---|
401 | unauthorized | APIキーが無効か、指定されていません。Authorizationヘッダーを確認してください。 |
402 | insufficient_balance | 残高が不足しています。チャージ後に再度お試しください。 |
404 | unknown_type | 指定されたタスクタイプは存在しません。タイプ名を確認してください。 |
429 | rate_limited | リクエストが多すぎます。しばらく待ってから再度お試しください。 |
422 | task_failed | タスクの処理に失敗しました。このタスクは課金されません。 |