ToolNavs 유용한 AI 도구 찾기
도구 제출 로그인
돌아가기 AI 정보
Qwen 3.8-옴니-플래시 출시: 풀 모달 AI가 오디오 및 비디오 작업을 직접 실행하기 시작했습니다

Qwen 3.8-옴니-플래시 출시: 풀 모달 AI가 오디오 및 비디오 작업을 직접 실행하기 시작했습니다

AI 정보 Admin 6 회 조회

Qwen은 Qwen 3.8-Omni-Flash를 출시하며, 에이전트 기능을 중심으로 구축된 최초의 풀 모달 모델로 정의했습니다. 이 모델은 텍스트, 이미지, 오디오, 비디오뿐만 아니라 이해, 추론, 계획, 도구 호출을 하나의 워크플로우로 통합하여 오디오 및 비디오 AI를 '콘텐츠 이해'에서 '작업 완료'로 발전시키는 것을 목표로 합니다.

영상 이해부터 작업 실행까지

과거에는 풀 모달 모델이 주로 인식, Q&A, 요약에 집중했으나, Qwen 3.8-Omni-Flash는 실행에 초점을 옮겼습니다. 공식 시나리오에는 자동 비디오 로깅, 짧은 영상 번역, 영화 요약 생성, 그리고 긴 영상을 다단계 처리하는 지속적인 도구 호출 등이 있습니다.

알리바바 클라우드 문서에 따르면 이 모델은 함수 호출, 웹 검색, 기본 추론 모드를 지원하며, 입력은 텍스트, 이미지, 오디오, 비디오를 포함하고 출력은 텍스트로 처리됩니다. 개발자에게 이는 오디오와 비디오 콘텐츠가 별도의 자료 첨부파일이 아닌 에이전트의 작업 컨텍스트로 직접 기능할 수 있음을 의미합니다.

100만 토큰은 단순히 '더 많이 포장'된 것이 아닙니다.

Qwen3.8-Omni-Flash는 100만 토큰 컨텍스트를 제공합니다. 더 중요한 변화는 "프록시 뷰잉"입니다: 긴 영상의 경우, 모델은 먼저 대략적인 탐색을 수행한 후, 전체 구간을 처음부터 끝까지 처리하는 대신 신중하게 검토해야 할 구간을 적극적으로 식별할 수 있습니다.

Qwen이 발표한 OmniVideoBench 데이터에 따르면, 이 방법은 정확도를 높이면서도 토큰 소비를 크게 줄인다고 합니다. 공식 보고서는 또한 WildClawBench-MM, UniClawBench 및 기타 프록시 테스트에서 이전 세대에 비해 상당한 개선을 이루어 오디오 및 비디오 기능이 Gemini 3.8 Flash에 근접하지만, 이 결과는 여전히 주로 제조사 테스트에 기반한 것이라고 밝혔습니다.

비용이 하락하고 있으며, 플러그인들이 생태계를 채우기 시작했습니다

가격이 순위보다 구현에 더 큰 영향을 미칠 수 있습니다. Qwen은 Qwen 3.5-Omni-Plus와 비교했을 때, Qwen 3.8-Omni-Flash가 비디오 입력 비용을 크게 줄여 회의 분석, 장기 영상 검색, 지속적인 오디오-비디오 에이전트가 데모에서 고빈도 통화로 전환하기 쉽게 만든다고 밝혔습니다.

오픈소스 Qwen-MM-플러그인은 이제 비디오-노트, 장기 비디오 메모리, 비디오 편집, 옴니 스킬 크리에이터를 포함하며, Claude Code, Codex, Gemini CLI, OpenClaw, Qwen Code 같은 에이전트 하네스를 지원합니다. Qwen-Live 하네스는 실시간 오디오-비디오 상호작용과 작업 오케스트레이션을 계속 목표로 하고 있습니다.

Qwen3.8-Omni-Flash가 진정으로 주목받아야 할 것은 "또 다른 강력한 멀티모달 모델"이 아니라, 오디오-비디오 이해를 지속 가능한 상담원 통화로 전환하는 능력입니다. 다음 경쟁은 누가 더 정확하게 볼 수 있는지, 누가 더 길고 복잡한 실제 작업을 더 낮은 비용으로 완수할 수 있는지에서 비롯될 가능성이 큽니다.

추천 도구

더보기