1. 초록
DeepSeek-OCR 2는 DeepSeek의 오픈소스 OCR/문서 이해 모델을 업그레이드한 버전으로, "DeepSeek-OCR 2: 시각적 인과 흐름"이라는 주제로 보다 인간 친화적인 시각적 코딩 방법을 강조하고, 복잡한 레이아웃(문서, 차트, 혼합 페이지 등)에 대해 더 강력한 구조화된 추출 및 이해 기능을 제공합니다. 공식 저장소와 모델 카드는 Transformers와 vLLM 두 가지 추론 경로를 제공하며, "문서 Markdown으로 변환하기", "이미지 OCR", "타겟 포지셔닝"과 같은 프롬프트 템플릿을 제공합니다.
2. 핵심 특징
- 시각적 인과 흐름 방향: 공식적으로는 보다 "인간화된" 시각 부호로 설명됩니다; 일부 해석에서는 이를 의미론적/타이포그래피 논리에 더 부합하는 시각적 토큰 조직으로 요약하기도 합니다(구체적인 알고리즘 세부사항은 저장소에 제공된 논문의 PDF를 읽는 것이 권장됩니다).
- 동적 해상도 및 토큰 예산: 동적 해상도가 지원되며, 기본 구성 예시는 768×768 + 1024×1024 블록 1블록의 여러 블록 조합으로, 고정된 시각적 토큰 예산(공식 예시 약 256토큰)에 해당합니다. 이는 속도, 비디오 메모리, 정확도 간의 균형을 이루기에 편리합니다.
- 문서용 구조화 출력: 내장 프롬프트 예시는 "문서를 마크다운으로 변환하기"를 지원하며, 이는 PDF/이미지 문서를 편집 가능한 텍스트와 가벼운 구조로 변환하는 데 적합합니다.
- 위치 지정 및 일반 이해: 프롬프트 예시는 참조 객체 찾기(rec)와 일반 설명을 포함하고 있어, 단순한 '단어 읽기'가 아니라 그래픽과 텍스트가 혼합된 상황에서 이해하고 검색하는 데도 활용될 수 있습니다.
3. 설치
- 환경 제안: 공식 테스트 환경은 CUDA 11.8 + PyTorch 2.6.0, Python 3.12.9입니다.
2. 트랜스포머 추론: Hugging Face에서 직접 deepseek-ai/DeepSeek-OCR-2 로드하고, bfloat16 추론과 함께 FlashAttention(예시 flash-attn==2.7.3)을 활성화하는 것을 권장합니다.
- vLLM 추론: 저장소는 이미지 스트리밍 출력, PDF 동시 처리, 벤치마크 배치 평가 스크립트 등 vLLM 관련 명령어와 스크립트를 제공합니다. 입출력 경로와 같은 매개변수는 구성 파일을 통해 수정해야 합니다.
4. 일반적인 사용 사례
- Document-to Markdown: 스캔된 사본, 논문, 매뉴얼 및 기타 사진/페이지, 2차 편집 및 검색을 위한 Markdown의 원클릭 내보내기.
- 복잡한 레이아웃 OCR: 전통적인 OCR이 혼란스러운 경우, 예를 들어 표, 혼합된 그래픽과 텍스트, 플로우차트 주석 등에서는 "레이아웃/접지가 있는" 프롬프트를 사용하여 보다 안정적인 구조를 얻으려 합니다.
- 도표 및 일러스트 분석: 문서 내 수치를 별도의 분석하여 지식 기반 구축과 보고서 자동화에 적합합니다.
- 목표 위치 지정 및 인용: 위치 표시 프롬프트를 사용하여 문서 검토, 데이터 주석, 자동 품질 검사를 위해 다이어그램 내 요소(라벨, 버튼, 영역 등)를 찾아야 합니다.
5. 생태와 경쟁 제품
- 생태학: 모델 가중치는 Hugging Face에 공개되며, 저장소는 추론 스크립트와 PDF 동시 처리 항목들을 제공하여 오프라인 파이프라인이나 서비스 지향 배포에 편리하게 접근할 수 있습니다.
- 경쟁 제품/참고문헌: Vary, GOT-OCR2.0, MinerU, PaddleOCR과 같은 프로젝트가 공식 인정 및 벤치마킹 링크에 등장하며, "속도, 레이아웃 복원, 오픈 소스 제어 가능성, 배포 비용" 측면에서 비교 객체로 활용할 수 있습니다.
- 선택 제안: "문서 구조화 출력(마크다운) + 동시 배치 처리(PDF) + 통합 다중 모달 프롬프트"에 주목하면 DeepSeek-OCR 2의 프로젝트 진입은 조립 라인에 더 가깝습니다. 전통적인 OCR 엔진과 규칙 후처리를 선호한다면, PaddleOCR/MinerU 같은 생태계가 더 성숙합니다.
6. 제한 및 주의사항
- 논문의 세부 사항을 확인해야 합니다: 데이터베이스는 논문의 PDF를 제공하지만, 모델 카드/README는 알고리즘의 세부 사항을 설명하는 데 더 제한적입니다. "시각적 인과 흐름/동적 조직"과 같은 핵심 메커니즘을 포함하며, 논문과 코드 구현을 참고하는 것이 권장됩니다.
- 비디오 메모리 및 처리량: 동적 해상도와 시각적 토큰 예산은 비디오 메모리 사용량과 속도에 직접적인 영향을 미치므로, 동시성 전에 소규모 배치 검증을 사용하는 것이 권장됩니다.
- 출력 품질 의존 프롬프트: 같은 문서에서 "Free OCR", "Markdown Conversion with Grounding", "Figure Parsing"은 서로 다른 세분화된 결과를 얻으며, 비즈니스에 맞는 프롬프트 템플릿과 평가 세트를 확립하는 것이 권장됩니다.
- 복잡한 문서는 여전히 교정이 필요합니다: 수학 공식, 극단적인 조판, 저화질 스캔의 경우에는 수동으로 확인하거나 2차 검증 과정을 도입하는 것이 여전히 권장됩니다.
7. 프로젝트 주소
https://github.com/deepseek-ai/DeepSeek-OCR-2
8. 자주 묻는 질문
Q: DeepSeek-OCR 2의 핵심 키워드는 무엇인가요? 시각 인과 흐름이 정확히 무엇을 의미하나요?
답변: 공식적으로는 보다 '인간적인' 시각 코딩 방향으로 설명됩니다; 보다 구체적인 메커니즘의 경우, 저장소 종이 PDF와 코드 구현이 우선입니다.
Q: DeepSeek-OCR 2는 이미지 문서를 어떻게 Markdown으로 변환하나요?
A: 프롬프트 예제 <image>\n<|grounding|>Convert the document to markdown.을 사용하고, 예시가 지정된 디렉터리에 출력하는 대로 model.infer(...)를 호출하세요.
Q: DeepSeek-OCR 2가 PDF 배치 실행을 지원하나요?
답변: 네. 저장소는 vLLM에 PDF 동시성 스크립트 항목과 구성 파일의 입출력 경로 등 매개변수를 수정할 수 있는 프롬프트를 제공합니다.
Q: DeepSeek-OCR 2의 오픈 소스 라이선스는 무엇인가요? 상업화가 가능할까요?
A: 저장소와 모델 카드는 Apache-2.0으로 표시되어 있습니다; 배포 방식과 의존성에 따라 라이선스 목록을 한 번 확인하는 것이 여전히 권장됩니다.
Q: 동적 해상도와 시각적 토큰 예산이 성능에 어떤 영향을 미치나요?
A: 해상도가 높거나 청킹이 많을수록 보통 복잡한 레이아웃에 더 적합하지만, 메모리 집약적이거나 느립니다; 최종 확정 전에 문서 유형 주변에 '속도-정밀도' 곡선 테스트를 하는 것이 권장됩니다.