画像OCR
写真や画面の文字をテキストにする手順と認識設定
画像OCRで、写真・スクリーンショット・スキャン画像の文字を編集できるテキストにします。TXTとMarkdownを選べます。抽出後は原画像と照合し、特に金額や固有名詞を確認してください。
料金: 無料のオプションがあります。Proオプションや無料枠を超える利用にはクレジットが必要になる場合があります。詳細は下のガイドをご覧ください。
画像から文字を抽出する手順
画像を1枚選ぶ
200 MB以下のJPG、PNG、WebP、HEIC、HEIF、AVIF、BMP、TIFFをドロップするか、画像をアップロードしてテキストを抽出を押します。別の画像ツールで使ったファイルはFilesから選べます。
出力を先に選ぶ
OCRパネルでTXTまたはMarkdownを選びます。TXTはプレーンテキスト、Markdownは文書構造を記法として残す出力です。抽出時に使う設定なので、開始前に決めてください。
言語ヒントを確認する
言語ヒントの初期値はAuto-detectです。最初の抽出で文字を読み違えた場合は、対象の言語を選んで再抽出できます。言語の指定は、認識エンジンの切り替えも兼ねています。
文字を抽出する
Extract textを押します。画像はプレビューに残り、その下の抽出テキストに結果と文字数が表示されます。
照合して保存する
名前、金額、日付、コードを原画像と照合します。コピーはクリップボードへ、ダウンロードはUTF-8の
ocr-result.txtまたはocr-result.mdへ保存します。
出力形式と言語ヒント
OCRパネルには2つの設定があり、どちらも元の画像を変更しません。
- TXT
- 初期設定のプレーンテキストです。認識した表は1行ずつ、セルの間をタブで区切るため、表計算ソフトへ貼り付けて列に分けられます。画像内の文字として書かれた
#hashtags、__init__、<div>などはそのまま残します。手紙、レシート、チャット画面、引用文に向いています。 - Markdown
- 見出しの
#、箇条書き、強調、表などをMarkdown記法で残します。文書や表の構造を引き継ぎたい場合に選びます。.mdはMarkdownを表示できるエディターで開いてください。通常のテキスト表示では記法がそのまま見えます。 - 言語ヒント:Auto-detect
- OCR専用モデルのGLM-OCRへ画像を送ります。言語と文字体系を自動で判断し、手動の言語ヒントは使いません。
- 言語ヒント:言語を指定
- 選択肢はEnglish、German、Spanish、French、Italian、Portuguese、Russian、Japanese、Chinese、Arabic、Hindiです。日本語はJapaneseを選びます。Google Geminiへ言語・文字体系・読む方向を伝え、中国語と日本語に共通する漢字や、右から左へ読むアラビア語などの判別を助けます。他の言語の文字も原文のまま抽出し、翻訳・要約・訂正は指示しません。
画像を読み取るサービス
ブラウザー内で認識する処理ではありません。当サイトのサーバーから画像全体を外部AIサービスへ送ります。Auto-detectではZ.aiのGLM-OCR、言語を指定した場合はGoogle Geminiを使います。Geminiの利用上限やレート制限に達した際は、同じ認識依頼をOpenRouter経由でGeminiへ送ります。旅券や銀行明細などを扱う際は、この送信先を確認してください。
Auto-detectと言語指定の切り替えは、同じエンジンの微調整ではなく、別のエンジンでの読み直しです。一方が読み違えた行を、もう一方で確認できます。ただし、どちらも誤認識する可能性があり、実行ごとに利用回数を消費します。
読み取りやすい画像を用意する
小さくぼけた文字は、抽出しても正しく読めるとは限りません。
必要な文字だけに絞る
メニュー、透かし、値札、背景の看板も読み取り対象です。画像の切り抜きで必要な範囲だけ残すと、不要な文字が混ざるのを避けられます。
横向きや傾きを直す
文字の行を正立・水平にすると読み取りやすくなります。ページが横向きになった写真や傾いた画像は、抽出前に画像の回転で整えます。
画面は直接キャプチャする
スクリーンショットなら文字が鮮明で明るさも均一です。モニターを撮影した写真には反射、モアレ、遠近によるゆがみが入り、文字や数字の読み違いにつながります。
複数ページはPDF OCRへ
このツールは1回につき画像1枚を読み取ります。スキャンがPDFになっている場合は、PDF OCRで全ページまたは指定範囲をまとめて処理できます。
形式・利用条件・保存期間
- 入力形式
- JPG、PNG、WebP、HEIC、HEIF、AVIF、BMP、TIFF
- 出力形式
- UTF-8のプレーンテキスト(.txt)またはMarkdown(.md)。クリップボードへのコピーにも対応
- アップロード上限
- 画像1枚あたり200 MB
- 1回の処理
- 画像1枚
- 処理
- 当サイトのサーバーからGLM-OCR(Z.ai)またはGoogle Geminiへ送信。処理時間の上限は30分で、自動再実行はしません
- 利用回数とクレジット
- 画像1枚で1回分を消費。無料枠を使い切ったゲストはログインが必要で、追加の画像1枚につき1クレジットを使います
- 透かし
- 追加しません
- 保存期間
- 当サイトに保存したアップロード・結果ファイルはゲスト48時間、無料アカウント30日で自動削除。有料プランでは長く保存できる場合があります
よくある質問
抽出した文章は翻訳されますか?
いいえ。画像に書かれた言語のまま返します。言語ヒントは、紛らわしい文字を読み取る手がかりです。同じ画像に含まれる別の言語も、そのまま抽出します。
文字や数字を読み違えるのはなぜですか?
小さい文字、ぼけ、弱いコントラスト、影、斜めからの撮影が原因になります。0とO、1とl、rnとmなどは紛らわしいため、コードや金額は原画像で確認してください。鮮明な画像に替える、文字だけ切り抜く、言語ヒントを切り替えて別のエンジンで読み直す方法があります。
TXTとMarkdownのどちらを選べばよいですか?
メール、入力フォーム、表計算へ貼り付けるならTXTです。表の行と列は改行とタブで区切ります。見出し、箇条書き、表の構造をノートアプリやWikiへ移したい場合はMarkdownを選びます。
画像は外部サービスへ送られますか?
はい。Auto-detectはZ.aiのGLM-OCR、言語指定はGoogle Geminiへ送ります。Geminiがレート制限を受けた場合はOpenRouterを経由します。当サイトに保存したアップロード・結果ファイルは、ゲスト48時間、無料アカウント30日で自動削除します。
文字を抽出できなかった場合は?
読める文字を得られなかった場合は、文字を抽出できなかった旨のエラーになります。文字が十分大きく鮮明か確認し、画像の切り抜きで無関係な範囲を除いてから再実行してください。