スキャンPDFを検索できるテキストに変換する方法
紙をスキャンしただけで文字情報を持たないPDFから、ページごとに文字を読み取ってテキストを取り出すツールです。ブラウザまたはAPIで実行でき、社内文書やFAX受信文書のデータ化に使えます。
オンラインで実行
アカウントでログインし、当社のサーバー上で実行します。無料ツールはブラウザ内で動作しますが、これは上記の料金がKIT残高から差し引かれます。
対象になるPDF
紙をスキャンした、または写真を並べただけの画像PDFが対象です。すでに文字情報を持つPDFかどうか分からない場合は、判定専用の機能で先に確認できます。1ファイル25MBまで、1回の実行で最大10ページまで処理します。
処理の流れ
このページでPDFをアップロードすると、ページごとに読み取った文字が表示されます。同じ機能はAPIからも呼び出せるため、FAXで受信したPDFを自動でテキスト化する仕組みにも組み込めます。会員登録は不要です。
料金
基本料金は1回の実行につき$0.010(米ドル)、ページ料金は1ページあたり$0.0575です。10ページのPDFなら合計は$0.585になります。ページ数が多いほど、基本料金の割合は相対的に下がります。
電子帳簿保存法との関係
電子帳簿保存法では、保存した文書を日付や金額で検索できる状態にしておく必要があります。画像のままのPDFはこの条件を満たしにくいため、テキスト化してから保存する運用が現実的です。
活用例
FAXで届いた発注書の保存
有限会社ささき印刷がFAXで受信し画像PDF化された発注書を、テキスト化してから社内の共有フォルダに保存します。
紙の議事録をまとめて検索可能に
田中大輔が過去5年分の紙の議事録をスキャンしたPDFをまとめて処理し、あとで日付や案件名から検索できるようにします。
役所から届いた通知の内容確認
伊藤さくらが役所から届いたスキャンPDFの通知文をテキスト化し、担当部署にメールで転送します。
よくある質問
アップロードしたPDFはどうなりますか。
テキストを生成する処理にのみ使用し、他の目的では利用しません。アカウントに保存され続けることはありません。
PDFのページ数に制限はありますか。
1ファイル25MBまで、1回の実行で最大10ページまでです。それを超える場合はファイルを分けて実行してください。
文字情報を持つPDFにも使えますか。
使えますが、すでに文字情報があるPDFには意味がありません。判定に迷う場合は、スキャンPDFかどうかを判定する機能を先にお使いください。
縦書きの文書にも対応していますか。
縦書き・横書きのどちらにも対応しています。ただし縦書きと横書きが混在する複雑なレイアウトでは、読み取り順が前後することがあります。
料金の支払い方法を教えてください。
料金は米ドル建てで、PayPalで直接お支払いいただけます。アカウント登録やサブスクリプションはありません。
日本語のサポートはありますか。
日本語での問い合わせ対応は行っておらず、英語とスペイン語での対応となります。ツールの画面は日本語でご利用いただけます。
開発者向け — APIアクセス
このページの機能はすべてAPIからも利用できます。自社システムに組み込みたいチーム向けのセクションです。それ以外の方は上のツールをそのままお使いください。
エンドポイント
Bearerトークンで認証し、POST1回でタスクをキューに登録します。結果はWebhookまたは署名付きリンクで受け取れます。
お使いのスタックから呼び出す
curl -X POST https://api.kit.forhosting.com/ocr/pdf \
-H "Authorization: Bearer $KIT_KEY" \
-H "Content-Type: application/json" \
-d '{"input":"…"}'const res = await fetch("https://api.kit.forhosting.com/ocr/pdf", {
method: "POST",
headers: {
"Authorization": `Bearer ${process.env.KIT_KEY}`,
"Content-Type": "application/json"
},
body: JSON.stringify({
"input": "…"
})
});
const { task_id } = await res.json();import os, requests
res = requests.post(
"https://api.kit.forhosting.com/ocr/pdf",
headers={"Authorization": f"Bearer {os.environ['KIT_KEY']}"},
json={
"input": "…"
},
)
task_id = res.json()["task_id"]<?php
$res = file_get_contents("https://api.kit.forhosting.com/ocr/pdf", false, stream_context_create([
"http" => [
"method" => "POST",
"header" => "Authorization: Bearer " . getenv("KIT_KEY") . "\r\nContent-Type: application/json",
"content" => '{"input":"…"}',
],
]));
$task = json_decode($res, true);body := bytes.NewBufferString(`{"input":"…"}`)
req, _ := http.NewRequest("POST", "https://api.kit.forhosting.com/ocr/pdf", body)
req.Header.Set("Authorization", "Bearer "+os.Getenv("KIT_KEY"))
req.Header.Set("Content-Type", "application/json")
res, _ := http.DefaultClient.Do(req)リクエスト例
{
"input": "…"
}レスポンス例
{
"task_id": "tsk_a1b2c3d4e5f6a1b2c3d4e5f6",
"type": "ocr.pdf",
"status": "queued",
"_links": {
"result": "/tasks/tsk_…/result"
}
}非同期APIです。task_idは即時に返ります。ポーリングは1秒あたり1リクエストまでです。
料金
単価はすべて公開しています。トークン換算や独自クレジットはありません。失敗したタスクは課金されません。
制限
max_mb | 25 |
max_pages | 10 |
エラー
| HTTP | コード | 意味 |
|---|---|---|
401 | unauthorized | APIキーが無効か、指定されていません。Authorizationヘッダーを確認してください。 |
402 | insufficient_balance | 残高が不足しています。チャージ後に再度お試しください。 |
404 | unknown_type | 指定されたタスクタイプは存在しません。タイプ名を確認してください。 |
429 | rate_limited | リクエストが多すぎます。しばらく待ってから再度お試しください。 |
413 | input_too_large | 入力データが上限を超えています。サイズを小さくして再度お試しください。 |
422 | task_failed | タスクの処理に失敗しました。このタスクは課金されません。 |