OpenAI 개발자 문서의 "이미지 생성" 페이지는 이미지 생성 및 편집 기능에 대한 중앙 집중식 설명을 제공합니다: 개발자는 이미지 API를 통해 직접 변형을 생성, 편집 또는 생성할 수 있습니다(변형은 DALL· E 2 지원), "image_generation"는 Responses API의 내장 도구로도 사용되어 다중 라운드 대화 반복 재구조화와 보다 유연한 입력 방식(이미지 입력으로 파일 ID 지원)을 지원합니다. 문서는 또한 gpt-image-1.5가 현재 주요 GPT 이미지 시리즈 모델임을 나타내며 모델 비교를 제공하며, DALL· E 2와 DALL· E 3는 폐기된 것으로 표시되었으며 2026년 5월 12일에 지원 종료가 예정되어 있습니다.
출력 제어 측면에서 문서에는 크기, 품질, 형식, 압축, 배경 투명도와 같은 조절 가능한 매개변수가 나열되어 있으며, 모델이 자동으로 선택되도록 자동 옵션을 제공합니다. 기본 출력은 base64 인코딩된 이미지 데이터이며; 형식은 png, jpeg, webp이며, 일반적으로 지연 시간 감소에 더 적합합니다. 투명 배경은 투명으로 설정해야 하며, PNG와 WebP에서만 중간 또는 고품질로 제공됩니다. 비용과 지연 시간은 생성에 필요한 토큰 수에 비례합니다: 더 큰 크기와 높은 품질은 출력 토큰을 크게 증가시키고; 스트리밍 생성에 partial_images를 사용하면 "부분 이미지"마다 추가 요금이 부과됩니다. 문서는 또한 일부 조직이 GPT 이미지 모델을 사용하기 전에 API 조직 검증을 완료해야 할 수도 있음을 시사합니다.
자주 묻는
질문: 이 "이미지 생성" 문서의 주요 내용은 무엇인가요?
A: 이 문서는 OpenAI API를 이용해 이미지를 생성하고 편집하는 방법을 설명하며, Image API와 Responses API의 적용 가능한 시나리오와 기능을 비교합니다.
Q: 이미지 생성에 우선적으로 권장되는 모델은 무엇인가요?
답변: 문서에서는 GPT 이미지 시리즈 사용을 권장하며, gpt-image-1.5를 더 높은 품질로 강조하고, gpt-image-1-mini를 더 저렴한 옵션으로 강조합니다.
Q:달· E 2/3은 계속 사용할 수 있으며 언제 중단될 예정인가요?
답변: 문서에는 DALL· E 2와 DALL· E 3는 지원 종료 예정이며, 2026년 5월 12일에 지원이 종료될 예정입니다.
Q: 투명한 배경 이미지를 어떻게 생성하고 어떤 포맷을 지원하나요?
A: 배경을 투명으로 설정하세요; Transparent는 PNG와 WebP만 지원하며, 중간 화질에서 고화질 설정이 일반적으로 더 안정적입니다.
Q: 이미지 생성 비용에 영향을 미치는 주요 요인은 무엇인가요?
답변: 수수료는 토큰과 관련이 있으며, 크기가 크고 품질이 높을수록 비용이 더 높습니다. 편집이나 하이파이 입력을 사용하면 입력 토큰이 증가하고, partial_images 추가 출력 토큰 수수료도 발생합니다.