PDFからテキストを抽出
PDFファイルに含まれる文字情報を、コピーや検索に使えるテキストデータとして取り出すツールです。文字がコピーできない文書やページ数の多い資料に使います。
オンラインで実行
アカウントでログインし、当社のサーバー上で実行します。無料ツールはブラウザ内で動作しますが、これは上記の料金がKIT残高から差し引かれます。
PDFの文字をそのままテキスト化
PDFに埋め込まれた文字情報を読み取り、プレーンテキストとして出力します。レイアウトの再現ではなく、文字そのものを取り出すことに特化しています。ページ数が多い資料でも、まとめてテキスト化できます。
コピーできない文書への対応
一部のPDFは右クリックからのコピーが制限されていたり、そもそも文字の選択がしづらい構成になっていたりします。テキスト抽出ならファイル全体の文字を一度に取り出せるため、必要な部分を後から自由に検索・編集できます。
議事録や報告書の下準備に
会議で配布されたPDF資料から要点をまとめ直したいとき、まずテキストを抽出してから編集すると作業が早くなります。抽出したテキストをそのまま議事録の下書きに使う運用もできます。
料金は1件$0.002の固定
料金は1件$0.002の固定です。ページ数が多くても追加料金はかかりません。このページから直接実行できるほか、API経由での自動処理にも対応しています。
活用例
配布資料からの要点整理
会議で配布されたPDF資料からテキストを抽出し、議事録の下書きとして使っています。
契約書の条文検索
合同会社みどりデザインでは、長い契約書PDFをテキスト化し、特定の条文をキーワード検索できるようにしています。
報告書の再編集
過去の報告書PDFからテキストを抽出し、新しい資料の文面を作成する際の下敷きにしています。
社内マニュアルのデータ化
紙で配布していたマニュアルをPDF化したうえでテキストを抽出し、社内Wikiに転記しています。
よくある質問
抽出後のPDFは保存されますか
抽出処理のためだけに使用し、処理後は削除されます。恒久的な保存はしていません。
対応しているページ数は
1ファイル25MB、200ページまでのPDFに対応しています。
日本語でのサポートはありますか
日本語でのサポートは行っておりません。サポートは英語またはスペイン語で、担当者が直接対応します。
料金はいくらですか
1件$0.002の固定料金です。ページ数が多くても金額は変わりません。
スキャンした画像PDFにも使えますか
文字情報を持たないスキャンPDFには対応していません。その場合はOCR機能で文字を読み取ってからご利用ください。
文字のレイアウトや表組みは保持されますか
抽出結果はプレーンテキストで、レイアウトや表の形は保持されません。表を保ちたい場合はMarkdown変換のご利用をおすすめします。
開発者向け — APIアクセス
このページの機能はすべてAPIからも利用できます。自社システムに組み込みたいチーム向けのセクションです。それ以外の方は上のツールをそのままお使いください。
エンドポイント
Bearerトークンで認証し、POST1回でタスクをキューに登録します。結果はWebhookまたは署名付きリンクで受け取れます。
お使いのスタックから呼び出す
curl -X POST https://api.kit.forhosting.com/pdf/to-text \
-H "Authorization: Bearer $KIT_KEY" \
-H "Content-Type: application/json" \
-d '{"pdf":"https://ejemplo.com/documento.pdf"}'const res = await fetch("https://api.kit.forhosting.com/pdf/to-text", {
method: "POST",
headers: {
"Authorization": `Bearer ${process.env.KIT_KEY}`,
"Content-Type": "application/json"
},
body: JSON.stringify({
"pdf": "https://ejemplo.com/documento.pdf"
})
});
const { task_id } = await res.json();import os, requests
res = requests.post(
"https://api.kit.forhosting.com/pdf/to-text",
headers={"Authorization": f"Bearer {os.environ['KIT_KEY']}"},
json={
"pdf": "https://ejemplo.com/documento.pdf"
},
)
task_id = res.json()["task_id"]<?php
$res = file_get_contents("https://api.kit.forhosting.com/pdf/to-text", false, stream_context_create([
"http" => [
"method" => "POST",
"header" => "Authorization: Bearer " . getenv("KIT_KEY") . "\r\nContent-Type: application/json",
"content" => '{"pdf":"https://ejemplo.com/documento.pdf"}',
],
]));
$task = json_decode($res, true);body := bytes.NewBufferString(`{"pdf":"https://ejemplo.com/documento.pdf"}`)
req, _ := http.NewRequest("POST", "https://api.kit.forhosting.com/pdf/to-text", body)
req.Header.Set("Authorization", "Bearer "+os.Getenv("KIT_KEY"))
req.Header.Set("Content-Type", "application/json")
res, _ := http.DefaultClient.Do(req)リクエスト例
{
"pdf": "https://ejemplo.com/documento.pdf"
}レスポンス例
{
"task_id": "tsk_a1b2c3d4e5f6a1b2c3d4e5f6",
"type": "pdf.to_text",
"status": "queued",
"_links": {
"result": "/tasks/tsk_…/result"
}
}非同期APIです。task_idは即時に返ります。ポーリングは1秒あたり1リクエストまでです。
料金
単価はすべて公開しています。トークン換算や独自クレジットはありません。失敗したタスクは課金されません。
制限
max_mb | 25 |
max_pages | 200 |
エラー
| HTTP | コード | 意味 |
|---|---|---|
401 | unauthorized | APIキーが無効か、指定されていません。Authorizationヘッダーを確認してください。 |
402 | insufficient_balance | 残高が不足しています。チャージ後に再度お試しください。 |
404 | unknown_type | 指定されたタスクタイプは存在しません。タイプ名を確認してください。 |
429 | rate_limited | リクエストが多すぎます。しばらく待ってから再度お試しください。 |
413 | input_too_large | 入力データが上限を超えています。サイズを小さくして再度お試しください。 |