돌아가기 AI는 오픈 소스입니다.
DeepSeek-OCR 2 출시: 시각적 인과 흐름이 문서 및 도표 인식을 더 '인간과 같이' 만듭니다

DeepSeek-OCR 2 출시: 시각적 인과 흐름이 문서 및 도표 인식을 더 '인간과 같이' 만듭니다

AI는 오픈 소스입니다. Admin 198 회 조회

1. 초록

DeepSeek-OCR 2는 DeepSeek의 오픈소스 OCR/문서 이해 모델을 업그레이드한 버전으로, "DeepSeek-OCR 2: 시각적 인과 흐름"이라는 주제로 보다 인간 친화적인 시각적 코딩 방법을 강조하고, 복잡한 레이아웃(문서, 차트, 혼합 페이지 등)에 대해 더 강력한 구조화된 추출 및 이해 기능을 제공합니다. 공식 저장소와 모델 카드는 Transformers와 vLLM 두 가지 추론 경로를 제공하며, "문서 Markdown으로 변환하기", "이미지 OCR", "타겟 포지셔닝"과 같은 프롬프트 템플릿을 제공합니다.

2. 핵심 특징

  1. 시각적 인과 흐름 방향: 공식적으로는 보다 "인간화된" 시각 부호로 설명됩니다; 일부 해석에서는 이를 의미론적/타이포그래피 논리에 더 부합하는 시각적 토큰 조직으로 요약하기도 합니다(구체적인 알고리즘 세부사항은 저장소에 제공된 논문의 PDF를 읽는 것이 권장됩니다).
  2. 동적 해상도 및 토큰 예산: 동적 해상도가 지원되며, 기본 구성 예시는 768×768 + 1024×1024 블록 1블록의 여러 블록 조합으로, 고정된 시각적 토큰 예산(공식 예시 약 256토큰)에 해당합니다. 이는 속도, 비디오 메모리, 정확도 간의 균형을 이루기에 편리합니다.
  3. 문서용 구조화 출력: 내장 프롬프트 예시는 "문서를 마크다운으로 변환하기"를 지원하며, 이는 PDF/이미지 문서를 편집 가능한 텍스트와 가벼운 구조로 변환하는 데 적합합니다.
  4. 위치 지정 및 일반 이해: 프롬프트 예시는 참조 객체 찾기(rec)와 일반 설명을 포함하고 있어, 단순한 '단어 읽기'가 아니라 그래픽과 텍스트가 혼합된 상황에서 이해하고 검색하는 데도 활용될 수 있습니다.

3. 설치

  1. 환경 제안: 공식 테스트 환경은 CUDA 11.8 + PyTorch 2.6.0, Python 3.12.9입니다.

2. 트랜스포머 추론: Hugging Face에서 직접 deepseek-ai/DeepSeek-OCR-2 로드하고, bfloat16 추론과 함께 FlashAttention(예시 flash-attn==2.7.3)을 활성화하는 것을 권장합니다.

  1. vLLM 추론: 저장소는 이미지 스트리밍 출력, PDF 동시 처리, 벤치마크 배치 평가 스크립트 등 vLLM 관련 명령어와 스크립트를 제공합니다. 입출력 경로와 같은 매개변수는 구성 파일을 통해 수정해야 합니다.

4. 일반적인 사용 사례

  1. Document-to Markdown: 스캔된 사본, 논문, 매뉴얼 및 기타 사진/페이지, 2차 편집 및 검색을 위한 Markdown의 원클릭 내보내기.
  2. 복잡한 레이아웃 OCR: 전통적인 OCR이 혼란스러운 경우, 예를 들어 표, 혼합된 그래픽과 텍스트, 플로우차트 주석 등에서는 "레이아웃/접지가 있는" 프롬프트를 사용하여 보다 안정적인 구조를 얻으려 합니다.
  3. 도표 및 일러스트 분석: 문서 내 수치를 별도의 분석하여 지식 기반 구축과 보고서 자동화에 적합합니다.
  4. 목표 위치 지정 및 인용: 위치 표시 프롬프트를 사용하여 문서 검토, 데이터 주석, 자동 품질 검사를 위해 다이어그램 내 요소(라벨, 버튼, 영역 등)를 찾아야 합니다.

5. 생태와 경쟁 제품

  1. 생태학: 모델 가중치는 Hugging Face에 공개되며, 저장소는 추론 스크립트와 PDF 동시 처리 항목들을 제공하여 오프라인 파이프라인이나 서비스 지향 배포에 편리하게 접근할 수 있습니다.
  2. 경쟁 제품/참고문헌: Vary, GOT-OCR2.0, MinerU, PaddleOCR과 같은 프로젝트가 공식 인정 및 벤치마킹 링크에 등장하며, "속도, 레이아웃 복원, 오픈 소스 제어 가능성, 배포 비용" 측면에서 비교 객체로 활용할 수 있습니다.
  3. 선택 제안: "문서 구조화 출력(마크다운) + 동시 배치 처리(PDF) + 통합 다중 모달 프롬프트"에 주목하면 DeepSeek-OCR 2의 프로젝트 진입은 조립 라인에 더 가깝습니다. 전통적인 OCR 엔진과 규칙 후처리를 선호한다면, PaddleOCR/MinerU 같은 생태계가 더 성숙합니다.

6. 제한 및 주의사항

  1. 논문의 세부 사항을 확인해야 합니다: 데이터베이스는 논문의 PDF를 제공하지만, 모델 카드/README는 알고리즘의 세부 사항을 설명하는 데 더 제한적입니다. "시각적 인과 흐름/동적 조직"과 같은 핵심 메커니즘을 포함하며, 논문과 코드 구현을 참고하는 것이 권장됩니다.
  2. 비디오 메모리 및 처리량: 동적 해상도와 시각적 토큰 예산은 비디오 메모리 사용량과 속도에 직접적인 영향을 미치므로, 동시성 전에 소규모 배치 검증을 사용하는 것이 권장됩니다.
  3. 출력 품질 의존 프롬프트: 같은 문서에서 "Free OCR", "Markdown Conversion with Grounding", "Figure Parsing"은 서로 다른 세분화된 결과를 얻으며, 비즈니스에 맞는 프롬프트 템플릿과 평가 세트를 확립하는 것이 권장됩니다.
  4. 복잡한 문서는 여전히 교정이 필요합니다: 수학 공식, 극단적인 조판, 저화질 스캔의 경우에는 수동으로 확인하거나 2차 검증 과정을 도입하는 것이 여전히 권장됩니다.

7. 프로젝트 주소

https://github.com/deepseek-ai/DeepSeek-OCR-2

8. 자주 묻는 질문

Q: DeepSeek-OCR 2의 핵심 키워드는 무엇인가요? 시각 인과 흐름이 정확히 무엇을 의미하나요?

답변: 공식적으로는 보다 '인간적인' 시각 코딩 방향으로 설명됩니다; 보다 구체적인 메커니즘의 경우, 저장소 종이 PDF와 코드 구현이 우선입니다.

Q: DeepSeek-OCR 2는 이미지 문서를 어떻게 Markdown으로 변환하나요?

A: 프롬프트 예제 <image>\n<|grounding|>Convert the document to markdown.을 사용하고, 예시가 지정된 디렉터리에 출력하는 대로 model.infer(...)를 호출하세요.

Q: DeepSeek-OCR 2가 PDF 배치 실행을 지원하나요?

답변: 네. 저장소는 vLLM에 PDF 동시성 스크립트 항목과 구성 파일의 입출력 경로 등 매개변수를 수정할 수 있는 프롬프트를 제공합니다.

Q: DeepSeek-OCR 2의 오픈 소스 라이선스는 무엇인가요? 상업화가 가능할까요?

A: 저장소와 모델 카드는 Apache-2.0으로 표시되어 있습니다; 배포 방식과 의존성에 따라 라이선스 목록을 한 번 확인하는 것이 여전히 권장됩니다.

Q: 동적 해상도와 시각적 토큰 예산이 성능에 어떤 영향을 미치나요?

A: 해상도가 높거나 청킹이 많을수록 보통 복잡한 레이아웃에 더 적합하지만, 메모리 집약적이거나 느립니다; 최종 확정 전에 문서 유형 주변에 '속도-정밀도' 곡선 테스트를 하는 것이 권장됩니다.

DeepSeek 오픈소스 DeepSeek-OCR 2 업그레이드: 시각적 인과 흐름이 문서 이해를 향상시킵니다 DeepSeek-OCR 2 출시: 복잡한 레이아웃에 대한 구조화된 추출 기능이 크게 향상되었습니다 DeepSeek-OCR 2 설명: 왜 시각적 인과 흐름이 인간의 시각 코딩과 더 비슷한가 DeepSeek-OCR 2는 문서 작성 지원을 Markdown으로 지원합니다: PDF 이미지를 한 번의 클릭으로 편집할 수 있습니다 DeepSeek-OCR 2, 동적 해상도 출시: 속도와 메모리 정확도의 균형 맞추기 DeepSeek-OCR 2는 256개의 비주얼 토큰 예산 예를 제시합니다: 처리량 증가의 비용은 얼마인가요? DeepSeek-OCR 2는 두 가지 추론 경로를 제공합니다: 트랜스포머와 vLLM: 더 유연한 배포 DeepSeek-OCR 2 vLLM 스크립트는 동시 PDF 처리를 지원합니다: 파이프라인 배치 OCR이 더 번거롭지 않습니다 DeepSeek-OCR 2는 위치 표시 추천을 추가합니다: 단어를 읽는 것뿐만 아니라 목표물을 찾는 기능도 포함됩니다 DeepSeek-OCR 2는 차트와 페이지를 섞어 조정합니다: 전통적인 OCR이 순서가 뒤섞인 문제점을 겨냥합니다 DeepSeek-OCR 2 모델 카드 발표 프롬프트 템플릿: 접지가 구조를 더 안정적으로 만듭니다 DeepSeek-OCR 2 엔지니어링 하이라이트: 완전한 이미지 스트리밍 출력 및 배치 평가 스크립트 DeepSeek-OCR 2 설치 환경 노출: CUDA 11.8 + PyTorch 2.6.0이 권장 조합입니다 DeepSeek-OCR 2는 FlashAttention: 추론 속도를 높이되, 호환 시 주의를 권장합니다 DeepSeek-OCR 2는 bfloat16을 이용해 추론합니다: 비디오 메모리 압력은 떨어지지만 얼마나 효과적인지요 DeepSeek-OCR 2, 스캔 파일을 마크다운으로 변환하다: 지식 기반 구축 효율성 향상 DeepSeek-OCR 2 복합 표 OCR: 구조화된 출력이 후처리를 줄일 수 있을까? DeepSeek-OCR 2 플로우차트 및 주석 분석: 문서 이해가 텍스트에서 레이아웃으로 이동하다 DeepSeek-OCR 2 도형 분리 파싱: 보고 자동화를 위한 새로운 진입점 DeepSeek-OCR 2 타겟팅 및 인용: 문서 검토와 품질 검사가 더 통제 가능해졌습니다 DeepSeek-OCR 2 오픈 소스 Apache-2.0: 상업적 준수는 여전히 라이선스 목록이 필요합니다 DeepSeek-OCR 2 논문 PDF는 저장소와 함께 제공됩니다: 알고리즘 세부 사항은 코드에 따라 달라집니다 DeepSeek-OCR 2 알고리즘의 논란: README 제한 설명과 재현 가능한 세부 정보 공백 DeepSeek-OCR 2 동적 다이싱 768x768+1024x1024: 잘못된 구성이 뒤집힐까요? DeepSeek-OCR 2 프롬프트가 출력 품질을 결정합니다: Free OCR과 접지의 차이점은 무엇인가요? DeepSeek-OCR 2 출력물은 여전히 교정이 필요합니다: 극단적인 공식 조판, 저화질 스캔은 어렵습니다 DeepSeek-OCR 2 처리량 평가 가이드: 소규모 배치로 PDF를 업로드하는 것이 동시성 측면에서 더 안정적입니다 DeepSeek-OCR 2는 오프라인 파이프라인에 적합합니다: 구조화된 Markdown + 배치 처리 통합 DeepSeek-OCR 2 서비스 기반 배포의 핵심 사항: 경로 설정과 권한 격리를 무시하지 마세요 DeepSeek-OCR 2 vs. 패들OCR: 규칙 엔진의 성숙도와 구조화 능력 면에서 누가 더 강한가? DeepSeek-OCR 2 vs. MinerU: 오픈 소스 제어 가능 및 배포 비용 선택 방법 DeepSeek-OCR 2 벤치마크 GOT-OCR2.0과 Vary: 레이아웃 복원 경로의 차이점은 어디인가요? DeepSeek-OCR 2 생태계 인벤토리: 얼굴 무게 감기 + GitHub 스크립트 신속 구현 DeepSeek-OCR 2 프롬프트 예시 공개: 문서를 마크다운으로 변환하는 방법 DeepSeek-OCR 2 Transformers와 함께하는 deepseek-ai/DeepSeek-OCR-2 로딩: 시작하기가 더 쉽습니다 DeepSeek-OCR 2 vLLM 동시 PDF: 구성 파일의 입력 및 출력 경로를 변경하는 방법 DeepSeek-OCR 2 이미지 스트리밍 출력: 실시간 OCR이 인터랙티브 제품을 위한 의미 DeepSeek-OCR 2 구조적 추출 타겟팅 혼합: 문서 RAG 데이터 정리가 더 가볍습니다 DeepSeek-OCR 2 위치 측정 기능 추천: 더 효율적인 데이터 주석 및 자동 품질 검사 DeepSeek-OCR 2 시각적 토큰 예산 관리 가능: 비용 곡선 그리기 방법 DeepSeek-OCR 2가 시각적 코딩을 인간적으로 다룬다: 복잡한 타이포그래피 이해가 왜 중요한가 DeepSeek-OCR 2는 OCR을 문서 이해로 전환합니다: 인식부터 구조화된 업그레이드 지점까지. DeepSeek-OCR 2 실습 권장: 프롬프트 템플릿과 평가 세트를 수정하여 드리프트를 방지하세요 DeepSeek-OCR 2 위험 경고: 동시 실패 재시도는 먼저 로그 시스템과 결합해야 합니다 DeepSeek-OCR 2 배포 비용: 메모리 대역폭과 처리량 추정 방법 DeepSeek-OCR 2에 적용 가능한 시나리오 목록: 종이 사양과 스캔된 사본을 편집 가능한 텍스트로 변환 DeepSeek-OCR 2 차트 해석 기능: 지식 기반 및 보고서 생성의 핵심 부분 DeepSeek-OCR 2 오픈 소스 업데이트 뒤에 있는 문서의 구조화된 출력물이 새로운 전장이 되다 DeepSeek-OCR 2부터 시작하세요: 세 가지 프롬프트가 OCR 마크다운과 위치 선정을 다룹니다 DeepSeek-OCR 2 전체 분석: 시각적 인과 흐름 동적 해상도 엔지니어링 스크립트와 한계

추천 도구

더보기