画像OCR(文字起こし) Image OCR
画像OCRは、写真やスクリーンショットに写った文字を読み取ってテキストにできる無料ツールです。日本語と英語に対応し、読み取り結果はその場で編集・コピー・保存できます。画像はブラウザの中だけで処理され、サーバーには送信されません。
読み取る言語
画像を選ぶ/ドラッグ&ドロップ
PNG・JPEG・WebP・BMP に対応/貼り付け(Ctrl+V)でも読み込めます
画像はブラウザの中だけで処理され、サーバーには送信されません
画像はブラウザの中だけで処理され、サーバーには送信されません
読み取り結果(そのまま編集できます)
読み取りは端末の中で行われます。ただし初回だけ、読み取りエンジンと言語データ(日本語は約15MB)を配信元からダウンロードします。通信量にご注意ください。2回目以降はブラウザのキャッシュが使われます。
使い方
- 「読み取る言語」を選びます。日本語の文章なら「日本語」、英数字が混ざるなら「日本語+英語」を選んでください。
- 画像を選ぶか、枠の上にドラッグ&ドロップします。クリップボードからの貼り付け(Ctrl+V)にも対応しています。
- 「文字を読み取る」を押すと処理が始まります。初回だけ読み取りエンジンと言語データのダウンロードが入るため時間がかかります。
- 結果はそのまま編集できます。「コピー」または「テキストで保存」で取り出してください。
きれいに読み取るコツ
OCRの精度は画像の状態でほぼ決まります。うまく読めないときは、次の点を見直すと改善することが多いです。
- 文字を大きく写します。文字の高さが20ピクセルを下回ると急に精度が落ちます。小さい画像は拡大してから読み込ませてください。
- 傾きを直します。斜めに撮った写真は、まっすぐに補正するだけで結果が大きく変わります。
- 背景をすっきりさせます。模様や写真の上に重なった文字、影が落ちた部分は苦手です。
- 必要な部分だけ切り抜きます。関係のない部分が入っていると、そこも読もうとして余計な文字が混ざります。
- 手書き文字は苦手です。このツールが得意なのは印刷された活字です。手書きの読み取り精度は期待しないでください。
- 縦書きは横書きより苦手です。縦書きの日本語は、行の区切りがずれることがあります。
しくみとプライバシー
このツールは、ブラウザの中で動くOCRエンジン(Tesseract)を使っています。読み取りはすべてご覧の端末の中で行われ、画像がサーバーへ送られることはありません。社内資料や個人情報を含む画像でも、画像そのものが外部に出ることはありません。
ただし、次の点はご承知おきください。
- 初回だけ通信が発生します。読み取りエンジン本体と、選んだ言語の学習済みデータを配信元から取得します。日本語データはおよそ15MBあり、モバイル回線では通信量にご注意ください。2回目以降はブラウザのキャッシュが使われます。
- ページを開いた時点ではダウンロードしません。「文字を読み取る」を押したときに初めて取得するため、読み取りを使わなければ通信は発生しません。
- 処理には端末の性能を使います。大きい画像や古い端末では時間がかかります。うまくいかないときは画像を小さめにしてお試しください。
関連ツール
注意事項
画像OCRの読み取り結果には誤りが含まれることがあります。数字や固有名詞は特に間違えやすいため、重要な用途では必ず原本と照合してください。読み取ったテキストの利用にあたっては、その画像や文章の著作権・利用条件にご注意ください。画像はブラウザの中だけで処理され、サーバーには送信されません。無料でご利用いただけます。
※このプログラムはPHP8.2.22にて作成、動作確認を行っております。
※ご利用下さっている皆様のご意見・ご要望(改善要望)をお寄せください。