ToolNavs 유용한 AI 도구 찾기
도구 제출 로그인

OCR 텍스트 인식

스캔 문서와 표, 스크린샷의 글자가 제대로 읽혀야 그다음 질의응답도 성립합니다. 레이아웃 분석, 다국어 인식, PDF 구조화 출력과 PaddleOCR·HunyuanOCR 선택 기준을 다룹니다.

OCR은 이제 글자 인식에 그치지 않습니다. 제목과 표의 경계를 찾고, 2단 문서는 읽는 순서를 정해야 하며, 한 단계만 어긋나도 하류의 질의응답이 그럴듯한 거짓말을 이어 붙입니다. PaddleOCR의 PP-StructureV3는 레이아웃과 표를, HunyuanOCR은 약 10억 개 매개변수로 거리 풍경과 필기체를, DeepSeek-OCR은 페이지 전체를 시각 토큰으로 압축해 컨텍스트를 아낍니다.