この記事に出てくる用語
- OCR(オーシーアール) … 画像や写真から文字を取り出してテキストにする技術。複合機やスマホの「文字読み取り機能」の正体
- AI-OCR … OCRに機械学習を組み合わせた業務用サービス。手書きや形の違う書類に強い
- 生成AI … ChatGPTやGeminiのように、文章の続きを予測して出力するAI。画像を渡すと中の文字も読める
- ハルシネーション … 生成AIが、事実と違う内容をもっともらしく出力してしまう現象
- クラウド/ローカル … クラウドは外部のサーバーへ送って処理する方式。ローカルは手元のパソコンや複合機の中だけで処理する方式
- サーチャブルPDF(透明テキスト付きPDF) … スキャン画像の上に、読み取った文字を見えない形で重ねたPDF。見た目は画像のまま検索とコピーができる
結論:AIは文字を「読んで」いない。文章を「推測して書き直して」いる
紙をパソコンの文字データにする方法は2つあります。
複合機やスマホに前から入っているOCRを使う方法(この記事では従来のOCRと呼びます)と、書類の写真を生成AIに渡す方法です。
かすれた字や手書きの書類では、生成AIのほうがきれいな文章を返すことがあります。
目が良いからではありません。
読めない部分を前後の文脈から補って、書き直しているからです。
結論:書類の性質で使い分ける
- 手書き・かすれ・崩れたレイアウト → 生成AI。文脈から補って読める
- 金額・口座番号・型番 → 従来のOCR+人の照合。生成AIの間違いは自然な文になり、見つけられない
- 毎月同じ形式を大量に → 従来のOCR。速く、結果が安定する
- 社外に出せない書類 → クラウドのAIに送らない。手元だけで処理が終わる方法を選ぶ
強みと弱点が同じ場所(推測)から出ています。
手元の機材で何ができるかは、後半の「明日、まず何を開くか」にまとめました。
従来のOCRは、1文字ずつ「形」を照合している
処理の流れはこうです(OCRエンジン開発元のメディアドライブ社の技術資料に沿っています)。
従来のOCRが文字を読む流れ
- 画像のどこが文章で、どこが表や図かを判定する
- 1行ずつ、さらに1文字ずつ切り出す
- 文字の特徴を数値にして、登録済みのパターンと照合する
- 単語辞書と突き合わせて直す(「束京」→「東京」)
基本は1文字ずつの形当てで、書類全体の意味は見ていません。
登録されたパターンに無い形は読めません。
国立国会図書館のOCR開発(NDLOCR)の公開情報に、その例があります。
市販のOCRは1870年代の文系書籍で認識精度が4割程度、その時代の資料を学習させた専用OCRでは9割以上と報告されています。
比較対象にはクラウド型の新しいOCRも含まれます。
学習していない字形は読めない、という限界は方式を問わず出ます。
代わりに、この方式には利点があります。
- 速い。処理が軽く、大量のページを短時間で流せる
- ローカルで動くタイプなら、ファイルを外部に送らずに済む
- 同じ入力には同じ結果が返る。昨日と今日で変わらない
- 失敗が見える。読めなかった箇所が「束京」のような不自然な文字列として現れる
最後の1つが、生成AIとのいちばん大きな違いになります。
生成AIは「ここに書かれているはずの文章」を予測して出力する
生成AIの本体は、文章の続きを予測する仕組みです。
画像を渡されたときも、1文字ずつ照合するのではなく、画像全体を手がかりに「書かれているはずの文章」を丸ごと作ります。
だから「請」の字がかすれていても、「◯求書」という並びと見た目から「請求書」と出力できます。
文脈の手がかりが多い文章ほど、従来のOCRより正確になりやすいのはこのためです。
同じ仕組みが、そのまま弱点になります。
- 読めなかった箇所も、推測で埋めた自然な文章として出てくる(ハルシネーション)
- 間違いが自然な日本語になる。 原本と突き合わせない限り見つかりません
- 確実に読めた文字と、推測で埋めた文字が、同じ顔で並ぶ
従来のOCRは読めないと壊れ、生成AIは読めなくても壊れません。
壊れないことは、正しいことではありません。
書類の性質で決める。どちらが有利かの判断基準
手書き・自由記述・かすれた書類 → 生成AI
手書きのメモ、アンケートの自由記述、かすれたFAXの文面。
文脈の手がかりが多い文章ほど、生成AIの補完が効きます。
数枚なら、生成AIに画像を渡すのが手早い方法です。
社外に出してよい書類かは、後の「AIに出してはいけない書類」で確認してください。
手書きに強いAI-OCRもありますが、各社の公開価格は月額4万円前後から、年額契約で36万円からで、法人向けの水準です。
数枚のために検討するものではありません。
金額・番号が主役の書類 → 従来のOCR+人の照合
金額、口座番号、電話番号、型番。
これらは前後から正解を推測できません。
「1,980」と「1,930」のどちらが正しいかは、文脈のどこにも書かれていないからです。
請求書の読み取りシステムを開発しているエンジニアの公開検証があります(請求書900件、2025年11月時点のモデル)。
画像だけを生成AIに渡す方式は、金額と数量が正しく取れた割合が約6割でした。
OCRで文字を起こしてからAIに渡し、合計の計算はプログラム側で行う構成では約8割です。
どの方式で読んでも、最後は人が数字を照合する前提になります。
だから、速くて結果の安定する従来のOCRを選ぶのが実務的です。
毎月同じ形式を大量に → 従来のOCR
読み取り位置を一度設定すれば、同じ精度で回り続けます。
生成AIは同じ書類でも実行のたびに出力が揺れることがあり、大量処理では確認の手間が積み上がります。
形式がばらばらの書類が少量 → 生成AI
取引先ごとに形の違う書類が数枚ずつなら、レイアウトの設定が要らない生成AIが手早い方法です。
数字の照合が必要なのは同じです。
表が入った書類 → どちらでも崩れる前提で
従来のOCRは列のずれ、生成AIは行と列の取り違えが起きます。
少量なら目視で直す前提で使い、大量なら表の構造認識を専門にした業務用サービスの領域に入ります。
要点:迷ったらこの2つを自問する
- その書類は、間違いに気づける読み方をするか。 文章は読めば分かる。数字は照合しないと分からない
- その書類は、社外のサーバーに送ってよいか。 次の見出しで説明します
AIに出してはいけない書類。「アップロード=社外に渡す」で考える
精度より先に確認することがあります。
クラウドの生成AIに書類の画像を渡すことは、そのファイルを社外のサーバーに送ることと同じです。
さらに、サービスによっては送った内容がAIの学習に使われます。
ChatGPTの場合、OpenAIが公開しているヘルプによると、個人向けプランでは入力内容をモデル改善に使う設定が初期状態で有効です。
設定でオフにできます。
法人向けプランやAPIでは初期状態で使われません。
プランによって扱いが違うので、書類を渡す前に自分のプランの設定を確認してください。
注意:クラウドのAIに出してはいけない書類
- 他人の個人情報が載っているもの … 顧客名簿、履歴書、マイナンバーの記載がある書類
- 守秘義務・秘密保持契約の対象になっているもの … 取引先との契約書、見積や請求のやりとり
- 社内のルールで持ち出しが禁止されているもの … 判断に迷う時点で出さない
線の引き方は「AIかどうか」ではありません。
「そのファイルが自分のパソコンの外に出るかどうか」です。
無料のオンラインOCRサイトにアップロードするのも、生成AIに渡すのと同じ側にあります。
パソコンの中だけで動くOCRなら、この問題は起きません。
会社の書類で迷ったときの順番はこうです。
①社内にAI利用のルールがあるかを確認する。
②無ければ、この書類を社外のサービスに送ってよいかを自分で判断できるかを考える。
③判断できないなら、ローカルで完結する方法を選ぶ。
便利さを比べるのは、その後です。
明日、まず何を開くか。手元にあるものでできること
どの方法でも、最初の一歩は同じです。
紙をスキャンするか、スマホで撮って、画像かPDFにします。
会社に複合機がある → スキャン設定で「OCR」か「サーチャブルPDF」を探す
事務所の複合機には、スキャン時の設定に「OCR」「サーチャブルPDF」「透明テキスト付きPDF」のいずれかがある機種があります。
これを有効にしてスキャンすると、見た目は普通のPDFのまま、読み取った文字が透明な層として埋め込まれます。
- うまくいったかの確認: できたPDFを開き、本文をマウスのドラッグで選択できれば読み取れています
- 設定が見当たらないときは、機種名+「サーチャブルPDF」で検索します。キヤノン・コニカミノルタ・シャープとも、標準で使える機種と、有料オプションが要る機種があります
- 本体のスキャン設定でOCRをかけるなら、処理は複合機の中で終わります。メーカーのクラウド連携に送る設定になっていないかだけ確認してください
Windows 11のパソコンがある → 標準の「Snipping Tool」で読み取る
Windows 11には「Snipping Tool(スニッピングツール)」が最初から入っていて、文字読み取りの機能が付いています。
Snipping Toolで文字を読み取る手順
- スキャンした画像やPDFをパソコンの画面に表示する
- スタートメニューから「Snipping Tool」を開き、「新規」を押して範囲をドラッグで囲む(Windowsキー+Shift+S でも同じ)
- 上のツールバーにある「テキストアクション」のボタンを押す
- 画像の中の文字が選択できるようになるので、コピーして貼り付ける
- 処理はパソコンの中だけで行われ、インターネットには送信されません
- 「テキストアクション」が見当たらないときは、Microsoft StoreでSnipping Toolを更新してください
- 読み取れるのは画面に映っている範囲だけです。複数ページのPDFは1画面ずつ繰り返します
- Windows 10にはこの機能がありません。 複合機の方法か、社外に出せる書類なら下のクラウドの方法を使います
スマホしかない → iPhoneは標準機能で足りる。Androidは「出せる書類」だけ
iPhone(XR・XS以降で、iOS 16以上)なら、撮った写真を開いて文字の部分を長押しすると、そのまま選択してコピーできます。
「テキスト認識表示」という標準機能で、処理は端末の中で終わります。
選択できないときは、設定 → 一般 → 言語と地域 の「テキスト認識表示」がオンか確認してください。
Androidの標準的な手段は「Googleレンズ」ですが、画像をGoogleのサーバーに送って処理します。
社外に出せない書類には使わないでください。
複合機・Snipping Tool・iPhoneはいずれも従来のOCRなので、手書きや崩れた字は苦手です。
クラウドに出せる書類なら → Googleドライブと生成AIが無料で使える
Googleドライブ(Googleアカウントがあれば無料)
画像かPDFをアップロードし、右クリック→「アプリで開く」→「Googleドキュメント」を選びます。
読み取られた文字が文書として開きます。
公式の条件でファイルは2MB以下、対応形式はPDF・JPEG・PNG・GIFです。
超えるときは解像度を下げるか、ページを分けます。
生成AI(ChatGPT・Gemini)
無料プランでも画像を渡して読ませられます。
ただし1日に渡せる枚数に上限があります。
上限に達したときは、何が止まっていて、いつ戻るのかが画面に書かれています。
読み分け方はAIが「制限に達しました」と出たときにあります。
Googleドライブも生成AIも、ファイルを外部のサーバーに送る方法です。
使う前に、前の見出しの線引きに戻って確認してください。
この記事の確認範囲
- 仕組みの説明と、第三者が公開した検証結果(国立国会図書館のOCR開発、請求書読み取りの公開検証)にもとづいています
- 同じ書類を各サービスに入れて結果を並べた比較実験ではありません。サービスごとの精度を数値で比べてもいません
- 機密の線引きは、各サービスの利用規約とプライバシーポリシーにもとづく説明です。規約は変わるので、使う前にご確認ください
まとめ
- 生成AIの精度の正体は文脈からの推測。読めない文字を補える強みと、間違いが自然な文になって隠れる弱点は表裏
- 文章は生成AI、数字は照合前提で従来のOCR、大量の定型書類も従来のOCR
- 精度の前に機密。ファイルがパソコンの外に出るかどうかで線を引く
- 入口は手元にあるものから。まず1枚読ませて、結果を原本と突き合わせてみる


コメント