MinerU는 최근 몇 년 문서 파싱 분야에서 빼놓을 수 없는 오픈소스가 됐습니다. 레이아웃이 복잡한 PDF를 깔끔한 Markdown이나 JSON으로 바꾸고, 수식은 LaTeX로, 표는 HTML로 변환하며, 스캔 문서는 자동으로 OCR로 넘깁니다. 대형 모델 학습과 RAG 지식 베이스가 가장 필요로 하는 고품질 말뭉치에 정확히 맞는 도구입니다. GitHub 스타는 이미 5만을 넘었지만, 스타 수는 관심도 지표일 뿐입니다. 배포할 가치가 있는지는 아래 계산이 맞는지를 봐야 합니다.
공식 저장소 정보
- 플랫폼: GitHub
- 조직: opendatalab(상하이 인공지능 연구소 산하 오픈소스 커뮤니티)
- 프로젝트명: MinerU
출발점은 InternLM의 사전 학습 데이터 처리 파이프라인으로, 원래는 과학 문헌의 기호와 수식 변환 문제를 풀기 위한 것이었고, 이후 범용 문서 파싱 도구로 독립했습니다.
강한 지점
일반 PDF 추출 도구는 텍스트 블록 단위로 억지로 쪼개어 2단 논문의 읽는 순서가 꼬이고 수식이 깨집니다. MinerU는 레이아웃 분석 모델로 먼저 구조를 인식합니다. 머리글, 바닥글, 페이지 번호를 제거하고 사람의 읽는 순서대로 재배열하며, 제목 단계, 단락, 목록을 보존합니다. 기술 노선은 두 가지입니다. pipeline 노선은 작은 전용 모델들의 연계로 빠르고 제어가 쉽고, VLM 노선은 문서 이해 전용 비전 모델로 페이지 전체를 읽어 복잡한 레이아웃과 페이지에 걸친 표에서 정확도가 높습니다. 출력은 Markdown 외에 좌표가 담긴 중간 JSON도 있어 2차 개발에 편리합니다.
배포 비용: 가볍지 않다
설치 자체는 pip 명령 한 번이지만, 실제로 돌리려면 모델 가중치 한 세트를 내려받아야 하고 첫 설정이 초보자에게 친절하지 않습니다. pipeline 노선은 CPU만으로도 돌아가지만 느려서 수백 페이지 일괄 처리에는 인내가 필요합니다. 쓸 만한 속도에는 8GB 이상 VRAM의 GPU가 실질적인 문턱이고, VLM 노선은 그 이상을 요구합니다. Windows에서는 의존성 문제가 Linux보다 많아, 팀 도입은 보통 Docker나 Linux 서버로 합니다. 비교하면 Docling의 배포가 더 가볍지만, 복잡한 중국어 레이아웃과 수식에서는 MinerU가 현재 더 맞습니다.
실제 함정
첫째, 라이선스가 바뀌었습니다. 초기에는 AGPLv3였지만 2026년 3.1.0 버전부터 Apache 2.0 기반의 MinerU 오픈소스 라이선스로 바뀌었고, 출처 표기 요구와 상업적 사용 문턱 조항이 붙었습니다. 상용 제품이나 외부 서비스에 넣을 팀은 '오래된 오픈소스라 자유롭게 써도 된다'는 인상에 기대지 말고 현재 라이선스 문안을 법무에 확인받아야 합니다. 버전마다 모델 가중치 조건이 다를 수 있으니 내려받을 때마다 개별 확인이 필요합니다.
둘째, 정확도에는 경계가 있습니다. 스캔 품질이 나쁜 문서, 괴상한 레이아웃의 표, 손글씨는 VLM 노선도 틀리며, 틀린 결과가 그럴듯하게 보입니다. RAG에 넣기 전에는 반드시 표본 검사를 해야 하고 전자동으로 믿어서는 안 됩니다.
셋째, 이터레이션이 빠릅니다. 릴리스가 잦고 파라미터와 출력 구조가 여러 번 바뀌었습니다. 운영 파이프라인에서는 버전 고정과 회귀 샘플 준비가 필수 규율입니다.
누가 도입하고 누가 피할까
논문, 재무 보고서, 설명서를 대량으로 처리해 대형 모델에 먹이고, Python 환경을 유지할 사람이 팀에 있다면 MinerU는 현재 오픈소스의 1군 선택지입니다. 가끔 PDF 한두 개만 바꾸는 개인이라면 공식 온라인 버전이나 기성 변환 도구가 더 낫습니다. 한 번의 변환을 위해 배포 환경을 구축하는 것은 시간 계산이 맞지 않습니다.