텐센트 훈위안은 이미지 편집을 위한 네이티브 멀티모달 모델인 HunyuanImage 3.0-Instruct를 출시했습니다. 공식 도입부는 80B 매개변수와 약 13B 활성화 매개변수를 가진 하이브리드 전문가(MoE) 아키텍처를 채택하여, 사용자 이미지와 지침을 받은 후 먼저 이해하고 추론한 후 결과를 생성하며, 명령어 정렬과 편집 안정성 향상을 강조합니다.
능력 수준에서 모델은 "정밀 편집"과 "다중 이미지 융합"에 중점을 두며, 추가, 삭제, 수정, 스타일 변환, 오래된 사진 복원, 여러 사진에서 캐릭터나 요소 추출을 지원하여 통합된 장면을 합성하고, 비목표 영역을 파괴하지 않도록 지원합니다. 제품 측면에서는 이모티콘, 소셜 공유, 전자상거래 포스터, 가상 캐릭터 공동 제작과 같은 응용 분야에서도 관련 기능이 사용됩니다. 온라인 경험 포털은 PC에서 이용 가능하다고 표시되어 있습니다.
성능 측면에서 공식 및 관련 소개문에서는 이미지 품질과 정렬 성능이 선도적인 폐쇄 소스 모델과 비교할 수 있다고 하지만, 서로 다른 작업 및 데이터 분배에 따른 제3자 독립 비교 결과는 더 많은 공개 평가가 뒷받침되어야 합니다. 이미지 편집 및 블렌딩 기능을 사용할 때는 여전히 개인정보 보호와 저작권 준수, 초상화 및 텍스트 내용의 우연한 변경, 생성된 결과물의 일관성 불확실성에 대한 우려가 존재합니다.
자주 묻는 질문
Q: HunyuanImage 3.0-Instruct는 어떤 종류의 모델인가요?
답변: 텐센트 훈위안이 출시한 이미지 투 이미지 및 이미지 편집 모델로, 입력 이미지를 생성하기 전에 이해하고 이성을 이해하는 능력을 강조합니다.
Q: 텐센트 훈위안 이미지 3.0은 이미지 생성을 위해 어떤 편집 작업을 지원하나요?
A: 일반적인 작업으로는 요소 추가, 객체 삭제, 스타일 변경, 오래된 사진 복원, 문자 및 텍스트 내용 수정 등이 있으며, 편집되지 않은 영역을 최대한 안정적으로 유지하려고 노력합니다.
Q: HunyuanImage 3.0-Instruct의 다중 이미지 융합 기능은 무엇인가요?
A: 여러 이미지에서 인물이나 요소를 추출해 합성하여 일관된 단체 사진이나 새로운 장면 그림을 생성할 수 있습니다.
Q: HunyuanImage 3.0-Instruct의 매개변수 규모와 아키텍처는 무엇인가요?
답변: 공개 정보에 따르면 80B 매개변수 MoE 아키텍처이며, 효과와 효율성을 고려하기 위해 추론 중에 약 13B 매개변수가 활성화됩니다.
Q: Mixed Image 3.0을 사용해 이미지를 생성할 때의 위험은 무엇인가요?
답변: 개인정보 보호와 저작권 허가, 초상화와 텍스트를 실수로 변경할 가능성, 그리고 일관되지 않은 편집 경계와 세부 사항으로 인한 재작업 비용에 주의를 기울여야 합니다.