멀티모달 모델
이미지·표·음성·영상을 한 번에 다루는 모델이 어떻게 작동하고, 스크린샷 오류 찾기·문서 이해·시각 질의응답에서 실제로 무엇에 쓰이는지 뜯어본다.
멀티모달 모델은 하나의 추론 과정에서 텍스트·이미지·음성·영상을 함께 다루며 그림이나 음성을 억지로 글자로 바꿔 분석하지 않는다. 여러 출처를 연결해 스크린샷 오류 찾기, 표 인식, 계약서 이해, 상품 이미지 분석에 강하고 VLM은 그중 '시각+언어'에 집중한 분류다. 복잡한 도표 추론, 긴 영상 타임라인, 정확한 숫자가 필요한 경우는 사람의 검토가 여전히 필요하다는 한계가 있다.