スキャンPDFの中身を検索対象に
この機能はPDFを1ページずつ画像として解析し、表やレイアウトを保ったまま検索できる索引として保存します。事前にテキスト抽出を行う必要はありません。
オンラインで実行
アカウントでログインし、当社のサーバー上で実行します。無料ツールはブラウザ内で動作しますが、これは上記の料金がKIT残高から差し引かれます。
OCRとテキスト抽出をひとつにまとめる
スキャンした請求書や、レイアウトが複雑な報告書は、通常のテキスト抽出だけでは表の対応関係や図の位置関係が崩れます。この機能はページを画像として直接解析し、文字だけでなく表構造やレイアウトの意味を踏まえて索引化します。事前にOCRでテキスト化する手順は不要です。
印影が重なった書類にも強い
日本の書類には赤い印影が文字に重なった状態のものが少なくありません。ページを画像として解析するため、印影が一部の文字にかぶっていても、周囲の文脈から内容を読み取りやすい構成です。
料金はページ数で決まります
基本料金$0.010に、1ページあたり$0.059が加算されます。20ページの資料なら$0.010+$0.059×20=$1.19です。テキストだけの索引化に比べると単価は高めですが、スキャン書類や図表を含む資料に向いています。
上限と使い方
1つの索引は最大10,000チャンクまでです。このページからPDFを渡して索引を作成でき、継続的な取り込みにはAPIを利用します。
活用例
取引先から届く見積書PDFを検索対象に
経理担当者が、取引先ごとに書式が異なる見積書PDFを索引化し、金額や条件を後から横断的に検索できるようにしています。
印影が重なった契約書を索引化
法務担当者が、印影が文字に重なったスキャン契約書を索引化し、条項の検索に使っています。
図表入りの技術報告書を検索対象に
研究部門が、グラフや表を含む技術報告書PDFを索引化し、過去の実験条件を検索で探しています。
よくある質問
事前にOCRでテキスト化しておく必要はありますか?
必要ありません。ページを画像として直接解析するため、PDFをそのまま渡せます。
スキャンした紙の書類にも対応していますか?
対応しています。印影が文字に重なっている書類でも、周囲の文脈から読み取りやすい構成です。
表やグラフを含むページも扱えますか?
扱えます。レイアウトや表構造を踏まえて索引化します。
料金はどう計算されますか?
基本$0.010に、1ページあたり$0.059が加算されます。20ページなら$1.19です。
取り込んだPDFの内容は保存されますか?
索引としてベクトルの形で保存されます。元のPDFファイル自体を保管する用途ではありません。
縦書きの文書にも対応していますか?
横書き・縦書きいずれのページも画像として解析します。
開発者向け — APIアクセス
このページの機能はすべてAPIからも利用できます。自社システムに組み込みたいチーム向けのセクションです。それ以外の方は上のツールをそのままお使いください。
エンドポイント
Bearerトークンで認証し、POST1回でタスクをキューに登録します。結果はWebhookまたは署名付きリンクで受け取れます。
お使いのスタックから呼び出す
curl -X POST https://api.kit.forhosting.com/search/index-document \
-H "Authorization: Bearer $KIT_KEY" \
-H "Content-Type: application/json" \
-d '{"input":"…"}'const res = await fetch("https://api.kit.forhosting.com/search/index-document", {
method: "POST",
headers: {
"Authorization": `Bearer ${process.env.KIT_KEY}`,
"Content-Type": "application/json"
},
body: JSON.stringify({
"input": "…"
})
});
const { task_id } = await res.json();import os, requests
res = requests.post(
"https://api.kit.forhosting.com/search/index-document",
headers={"Authorization": f"Bearer {os.environ['KIT_KEY']}"},
json={
"input": "…"
},
)
task_id = res.json()["task_id"]<?php
$res = file_get_contents("https://api.kit.forhosting.com/search/index-document", false, stream_context_create([
"http" => [
"method" => "POST",
"header" => "Authorization: Bearer " . getenv("KIT_KEY") . "\r\nContent-Type: application/json",
"content" => '{"input":"…"}',
],
]));
$task = json_decode($res, true);body := bytes.NewBufferString(`{"input":"…"}`)
req, _ := http.NewRequest("POST", "https://api.kit.forhosting.com/search/index-document", body)
req.Header.Set("Authorization", "Bearer "+os.Getenv("KIT_KEY"))
req.Header.Set("Content-Type", "application/json")
res, _ := http.DefaultClient.Do(req)リクエスト例
{
"input": "…"
}レスポンス例
{
"task_id": "tsk_a1b2c3d4e5f6a1b2c3d4e5f6",
"type": "search.index_document",
"status": "queued",
"_links": {
"result": "/tasks/tsk_…/result"
}
}非同期APIです。task_idは即時に返ります。ポーリングは1秒あたり1リクエストまでです。
料金
単価はすべて公開しています。トークン換算や独自クレジットはありません。失敗したタスクは課金されません。
制限
max_chunks | 10000 |
max_tokens | 20000 |
エラー
| HTTP | コード | 意味 |
|---|---|---|
401 | unauthorized | APIキーが無効か、指定されていません。Authorizationヘッダーを確認してください。 |
402 | insufficient_balance | 残高が不足しています。チャージ後に再度お試しください。 |
404 | unknown_type | 指定されたタスクタイプは存在しません。タイプ名を確認してください。 |
429 | rate_limited | リクエストが多すぎます。しばらく待ってから再度お試しください。 |
413 | input_too_large | 入力データが上限を超えています。サイズを小さくして再度お試しください。 |
422 | task_failed | タスクの処理に失敗しました。このタスクは課金されません。 |