MinerUは、この2年で文書解析の分野で避けて通れないオープンソースになりました。複雑なレイアウトのPDFをきれいなMarkdownやJSONに変換し、数式はLaTeX、表はHTMLに、スキャン文書は自動でOCRへ回す。大規模モデルの学習やRAGの知識ベースが最も必要とする高品質コーパスに、ちょうどはまる道具です。GitHubではすでに5万を超えるスターを集めていますが、スター数は注目度の指標にすぎません。導入する価値があるかは、以下の勘定が合うかどうかで判断してください。
公式リポジトリ情報
- プラットフォーム:GitHub
- 組織:opendatalab(上海人工智能実験室傘下のオープンソースコミュニティ)
- プロジェクト名:MinerU
成り立ちはInternLMの事前学習用データ処理パイプラインで、もともとは科学文献の記号や数式の変換トラブルを解くためのものでした。後に汎用の文書解析ツールとして独立しています。
強みはどこか
通常のPDF抽出ツールはテキストブロック単位で乱暴に切り分けるため、二段組みの論文は読み順が崩れ、数式は文字化けします。MinerUは版面解析モデルでまず構造を認識します。ヘッダー、フッター、ページ番号を取り除き、人間の読み順に並べ替え、見出し階層、段落、リストを保持します。技術路線は二つあり、pipeline路線は小さな専用モデルの連携で高速かつ制御しやすく、VLM路線は文書理解専用の視覚モデルでページ全体を読み、複雑な版面やページ跨ぎ表の精度が高くなります。出力はMarkdownのほか、座標付きの中間JSONもあり、二次開発に便利です。
導入コスト:軽くはない
インストール自体はpipのコマンド一回ですが、実際に動かすにはモデル重み一式のダウンロードが必要で、初回設定は初心者に優しくありません。pipeline路線はCPUだけでも動きますが遅く、数百ページのバッチ処理には忍耐が要ります。実用的な速度には8GB以上のVRAMを持つGPUが実質的な敷居で、VLM路線はさらに上を求めます。Windowsでは依存関係のトラブルがLinuxより多く、チーム導入ではDockerかLinuxサーバーが無難です。比べるとDoclingの導入は軽い一方、複雑な中国語版面と数式ではMinerUの方が向いています。
実際の落とし穴
第一に、ライセンスが変わっています。初期はAGPLv3でしたが、2026年の3.1.0版から、Apache 2.0を基にしたMinerUオープンソースライセンスに移行し、帰属表示の要求や商用利用の敷居条項が付きました。商用製品や対外サービスに組み込むチームは、「昔からのオープンソースだから自由に使える」という印象で済ませず、現行のライセンス文を法務に確認してください。バージョンごとにモデル重みの条件が異なることもあるため、ダウンロード時に個別確認が必要です。
第二に、精度には限界があります。スキャン品質の悪い文書、変則的な表、手書きは、VLM路線でも間違えます。しかも間違い方が「らしく」見えるため、RAGに入れる前は必ず抜き取り検査をし、全自動で信用しないことが前提です。
第三に、更新が速いこと。リリース頻度が高く、パラメータや出力構造が何度も変わっています。本番パイプラインでは、バージョン固定と回帰サンプルの用意が必須の作法です。
向く人、避けるべき人
論文、決算資料、説明書を大量に処理して大規模モデルに渡し、Python環境を維持できる人がチームにいるなら、MinerUは現在のオープンソースの第一候補です。たまにPDFを1、2本変換するだけの個人なら、公式のオンライン版や既成の変換ツールを使う方が割に合います。一度きりの変換のために導入環境を組むのは、時間の勘定が合いません。