ToolNavs 유용한 AI 도구 찾기
도구 제출 로그인
돌아가기 AI 정보
Gemini, 지능형 영상 이해 출시: 장기 영상 분석에 더 이상 프레임 단위 분석이 필요하지 않습니다

Gemini, 지능형 영상 이해 출시: 장기 영상 분석에 더 이상 프레임 단위 분석이 필요하지 않습니다

AI 정보 Admin 5 회 조회

2026년 9월 1일, 구글 딥마인드는 공식 블로그를 통해 제미니의 지능형 에뮬레이터형 비디오 이해 기능을 발표했으며, 첫 번째 배포는 제미니 3.7 플래시, 3.6 플래시, 3.5 플래시-라이트를 포함했습니다. 이 변화는 단순히 "모델이 비디오를 볼 수 있다"는 것뿐만 아니라, 고정된 프레임 속도로 무관한 많은 이미지를 맥락에 입력할 필요가 없다는 점입니다.

"몇 프레임만 더 보는" 것이 아니라, 어디를 먼저 볼지 결정하는 것이 중요합니다

전통적인 비디오 분석은 보통 고정된 속도로 프레임을 추출하는 반면, Gemini API의 정적 처리 기본값은 초당 1프레임입니다. 긴 튜토리얼, 강의, 또는 수시간의 녹화를 할 때는 많은 토큰을 소모하거나 샘플링 밀도가 낮아 짧은 동작을 놓치게 됩니다.

새로운 기능은 추론과 네이티브 비디오 도구를 결합합니다. 모델은 문제 주변의 클립을 동적으로 검색, 스캔, 재생하며, 시각적 요소, 오디오, 전사된 텍스트 중에서 원하는 신호를 선택합니다. 1초 이내에 발생하는 변화를 찾아내면 지역 샘플링 속도를 향상시킬 수 있습니다; 핵심 문장을 검색할 때는 전체 클립을 단락별로 읽을 필요가 없습니다. 이것이 AI 에이전트와 고정 워크플로우의 차이이기도 합니다: 모델은 다음에 어떤 도구를 호출할지 결정하기 시작합니다.

"최대 88%까지 토큰 절약"은 고정 할인으로 간주될 수 없습니다

구글의 표준 비디오 분석 벤치마크에 따르면, 활성화 후 토큰 소비는 최대 88% 감소하고, 분석 비용은 최대 66%, 정확도는 최대 7% 향상됩니다. 이 모든 수치는 "대부분" 조건을 포함하며, 특정 모델, 영상 길이, 문제 유형에서 나오고 모든 비즈니스에 직접 적용할 수는 없습니다. 더 신뢰할 수 있는 방법은 자체 비디오 및 쿼리 컬렉션을 A/B 테스트에 사용하고, 토큰, 지연, 리콜, 위치 오류(mislocation)를 기록하는 것입니다.

공식적으로 Gemini 3.7 Flash는 테스트 모델에서 정확도와 비용 면에서 더 나은 조합을 제공합니다; 짧은 영상이나 대략적인 요약만 필요한 작업은 같은 이점을 제공하지 못할 수 있습니다. 장점은 신속한 대응, 이상 탐지, 정밀한 집계, 그리고 시간 간 탐색에 더 있을 가능성이 큽니다. 관련 능력 경계는 사이트의 "Multimodal Model Practical Use Summary"를 참조해 주시기 바랍니다.

개발자는 로그인 전에 네 번의 검사를 수행해야 합니다

이 기능은 동영상과 유튜브 동영상 업로드를 지원하며, Google AI Studio의 Gemini API와 Gemini Enterprise Agent Platform을 포함한 진입 지점을 제공합니다. 비디오 처리 모드를 agentic으로 설정하면 활성화됩니다; 추가 기능 요금은 부과되지 않지만 일반 API 토큰으로 계속 부과됩니다.

출시 전에 비즈니스가 단순한 요약 대신 세부 사항에 집중해야 하는지 확인하고; 답변에 수동 검토 시간을 포함해야 하는지; 오디오, 자막, 시각 자료가 충돌할 때 어떤 규칙을 사용해야 하는지; 배치 작업에 비용 및 지속 시간 상한이 있는지 여부. 구글은 Gemini 앱과 YouTube의 Ask YouTube에 기능을 도입할 계획입니다; 현재 API 가용성이 모든 터미널이 이미 운영 중인 것과 동일하게 적용되지는 않습니다.

추천 도구

더보기