ToolNavs 便利なAIツールを発見
ツール投稿 ログイン

PaddleOCR

PaddleOCR の文字検出・認識、レイアウト解析、0.9B の文書モデルを分解し、多言語や複雑な版面から Markdown と JSON までの流れを紹介します。

PaddleOCR は PaddlePaddle ベースのオープンソース OCR・文書解析ツールキットです。PP-OCRv5 が文字検出と認識を、PP-StructureV3 がレイアウト、表、数式の解析を担います。0.9B の PaddleOCR-VL は湾曲や傾き、画面撮影のページに対応し、100 超の言語を扱いながら Markdown と JSON を出力するため、検索や抽出、ローカル運用にそのまま使えます。
AI の画像認識で文字を読み間違えるなら、まず写真・スクリーンショット・スキャン文書の3種類を見分けよう

AI の画像認識で文字を読み間違えるなら、まず写真・スクリーンショット・スキャン文書の3種類を見分けよう

AI の画像認識が文字を読み間違えるのは、多くの場合モデルが賢くないからではなく、入力する画像の種類に処理方法が合っていないからです。モデルを変える前に、まず画像を写真・スクリーンショット・スキャン文書の3種類に分け、それぞれに合った方法で処理しましょう。認識精度はすぐに大きく上がります。 ケース1...

Admin
3
PaddleOCR-VL-1.5 オープンソース解釈:0.9Bマルチモーダルモデルが文書の曲げや歪みを克服する方法

PaddleOCR-VL-1.5 オープンソース解釈:0.9Bマルチモーダルモデルが文書の曲げや歪みを克服する方法

1. 要旨 PaddleOCR-VL-1.5は、PaddlePaddleのオープンソース0.9Bパラメトリックドキュメントマルチモーダルモデルであり、レイアウトの位置付け、読み取り順からテキスト・表・数式などの構造化解析まで、実際の取得シナリオ(「曲げ、歪み、傾斜、スクリーン撮影、複雑な照明」など)...

Admin
249
PaddleOCR-VL (0.9B) リリース: NaViT×ERNIE 軽量マルチモーダルモデル、文書解析が複数のベンチマークでトップ

PaddleOCR-VL (0.9B) リリース: NaViT×ERNIE 軽量マルチモーダルモデル、文書解析が複数のベンチマークでトップ

2025年10月16日、PaddleOCRはマルチモーダル文書解析モデルPaddleOCR-VLのリリースを発表しました。これはバージョン3.3.0のコア機能としてリリースされました。約0.9Bサイズのこのモデルは、NaViTスタイルの動的解像度ビジュアルエンコーダーとERNIE-4.5-0.3B言...

Admin
258