OCR 文字認識
スキャンした書類や表、スクリーンショットの文字が正しく読めてこそ、その先の質問応答が成立します。版面解析、多言語認識、PDF の構造化出力と、PaddleOCR や HunyuanOCR の選び分けを扱います。
OCR はもう文字を読むだけではありません。見出しや表の境界を特定し、二段組では読む順番を決める必要があり、一歩ずれると下流の質問応答がもっともらしい嘘をつなぎ合わせます。PaddleOCR の PP-StructureV3 はレイアウトと表を、HunyuanOCR は約10億パラメータで街景や手書きを、DeepSeek-OCR はページ全体を視覚トークンに圧縮してコンテキストを節約します。