서론
알리바바가 Qwen Cloud를 통해 Qwen-Image 3.0 Pro를 출시하며, 3세대 이미지 모델을 API 워크플로 형태로 국제 개발자에게 공개했습니다.
이번 출시의 핵심은 단순히 아름다운 이미지 한 장을 생성하는 것이 아니라, 실제 업무에 활용할 수 있는 이미지를 생산하는 데 있습니다. 핵심 개선 사항은 다음과 같습니다:
- 프롬프트 입력 최대 4.5K 토큰 지원
- 신문, 스토리보드, 메뉴, 시험지, 중첩 인터페이스 등 고밀도 레이아웃 지원
- 텍스트 렌더링 최소 약 10픽셀까지 지원
- 12개 언어 및 20여 가지 폰트 렌더링 기본 지원
- 피부, 모발, 소재 및 미세 텍스처의 사실적인 표현 강화
- 단일 모델에서 텍스트-이미지 생성과 이미지 편집 동시 지원
- Qwen Cloud에서 1K 출력 이미지 API 가격 최저 0.04달러
AIBase는 또한 더 낮은 가격의 Standard 버전을 보도했습니다. 본 문서에서 확인한 Qwen Cloud 공개 모델 페이지에는 Pro 모델과 그 가격이 명확히 표시되어 있습니다. 다만 Standard 버전의 국제 모델 페이지와 전체 요금표는 동일한 공개 문서에서 별도로 확인할 수 없었습니다.

이 모델은 또한 Text-to-Image Arena 순위표에 진입했습니다. 2026년 8월 4일 기준으로 Arena는 qwen-image-3.0-pro를 초기 점수 기준 선두권 독점 이미지 모델 중 하나로 등재했습니다. 해당 스냅샷에서 이 모델은 중국 개발 모델 중 가장 높은 순위를 기록했지만, 실시간 전체 순위표에서는 전체 모델 중 2위를 차지하지는 못했습니다.
Qwen-Image 3.0 Pro 및 Standard, API 동시 출시
AIBase에 따르면 알리바바는 두 가지 버전을 출시했습니다:
| 모델 | 포지셔닝 | 보도된 시작 가격 |
|---|---|---|
| Qwen-Image 3.0 Pro | 더 높은 품질의 플래그십 버전 | 이미지당 0.04달러 |
| Qwen-Image 3.0 Standard | 더 낮은 비용의 범용 버전 | 이미지당 0.03달러 |
Qwen Cloud 공식 Pro 모델 페이지에는 현재 더 상세한 국제 가격이 나와 있습니다:
| Qwen-Image 3.0 Pro 항목 | 공식 Qwen Cloud 가격 |
|---|---|
| 1K 이미지 입력 | 장당 0.003달러 |
| 2K 이미지 입력 | 장당 0.003달러 |
| 1K 이미지 출력 | 장당 0.04달러 |
| 2K 이미지 출력 | 장당 0.075달러 |
즉, 널리 보도된 "이미지당 0.04달러"는 Pro 버전의 1K 출력 시작 가격을 의미합니다. 2K 출력 가격은 더 높습니다.
가격 페이지는 수시로 변경될 수 있으므로, 프로덕션 환경 애플리케이션은 미디어에서 보도된 가격을 장기 예산에 하드코딩하기보다는 현재 Qwen Cloud 또는 Alibaba Cloud Bailian의 최신 요금표를 읽어야 합니다.
핵심 목표: 유용하고 정보 밀도가 높은 이미지 생성
알리바바는 Qwen-Image 3.0의 테마를 두 글자로 요약합니다: 진짜(真實).
이 회사는 이 철학을 세 가지 차원으로 나눕니다:
- 내용이 풍부하다
- 디테일이 사실적이다
- 지식이 깊다
이 세 가지 차원은 Qwen-Image 3.0이 단순한 예술 이미지 생성이 아닌 생산성 시나리오를 지향하는 이유를 설명합니다.
풍부한 내용: 프롬프트 최대 4.5K 토큰 지원
Qwen-Image 3.0은 최대 약 4.5K 토큰의 지시 입력을 지원합니다.
더 큰 프롬프트 예산은 사용자가 단일 요청에서 여러 블록, 레이블, 캐릭터, 수식, 레이아웃 규칙, 비주얼 스타일 및 계층 요구 사항을 지정할 수 있게 해줍니다.
알리바바의 공식 예시는 다음과 같습니다:
- 9가지 서로 다른 교육 및 전문 정보 그래픽으로 구성된 3×3 그리드
- 텍스트가 빽빽한 신문 스타일 레이아웃
- 완전한 스토리보드
- 시험지
- 서로 중첩된 인터페이스
- 수학 차트 및 수식
- 차트, 레이블, 일러스트레이션이 포함된 지식 카드
공식 데모 중 하나는 약 3.7K 토큰의 프롬프트를 사용하여 9개의 독립적인 정보 패널이 포함된 단일 3×3 이미지를 생성했습니다. 각 패널에는 고유한 주제, 레이아웃, 텍스트, 차트 및 비주얼 언어가 있습니다.
수평 및 수직 복잡성
알리바바는 두 가지 형태의 복잡성을 설명합니다.
수평적 복잡성은 여러 병렬 요소를 동일한 캔버스에 배치하면서 서로 간섭하지 않도록 하는 것을 의미합니다.
예시는 다음과 같습니다:
- 9개의 인포그래픽 패널
- 여러 카테고리가 포함된 메뉴
- 멀티 컷 스토리보드
- 비교 차트
- 여러 모듈이 포함된 지식 포스터
수직적 복잡성은 중첩된 시각적 관계를 이해하는 것을 의미합니다.
공식 예시 중 하나는 다음 인터페이스를 서로 중첩했습니다:
VS Code 인터페이스
└── Qwen 채팅 인터페이스
└── 위챗 인터페이스
└── 핸드드립 커피 포스터
모델은 프롬프트에 설명된 계층 관계를 따르면서 각 인터페이스의 식별 가능한 구조를 보존해야 합니다.
이러한 생성 방식은 이미지가 전통적인 일러스트레이션보다 설계 문서에 가까울 때 특히 유용합니다.
사실적인 디테일: 작은 글꼴 텍스트와 생생한 질감
두 번째 핵심은 렌더링 정밀도입니다.
알리바바에 따르면 Qwen-Image 3.0은 데모에서 약 10픽셀 크기의 선명하고 읽을 수 있는 텍스트를 생성할 수 있습니다.
공식 예시는 다음과 같습니다:
- 텍스트가 빽빽한 신문 콘텐츠
- LaTeX 수식이 포함된 학술 페이지
- 위첨자 및 아래첨자
- 그리스 문자
- 정리 번호
- 손글씨 주석
- 교육 차트의 정밀한 레이블
이 회사는 또한 물리적 디테일 개선을 강조합니다:
- 피부 모공
- 개별 모발
- 직물 텍스처
- 천연 소재
- 미세한 표면 손상
- 먹물 그라데이션
편집 데모에서 이 모델은 손상된 전통 회화의 누락된 부분을 복원하면서 원래의 붓 터치와 구도를 보존하려고 시도했습니다.
"10픽셀 텍스트"는 절대적 보장이 아님
10픽셀 수치는 알리바바의 제품 데모에서 비롯된 것입니다. 모든 언어, 폰트, 레이아웃 및 생성 시나리오에서 10픽셀 텍스트가 항상 정확하다는 의미로 해석되어서는 안 됩니다.
프로덕션 환경에서 텍스트는 여전히 다음 사항을 확인해야 합니다:
- 철자
- 누락된 문자
- 구두점
- 줄바꿈
- 폰트 일관성
- 수식 정확성
- 브랜드 이름 정확성
중요한 법률, 의료, 금융 또는 제품 텍스트는 수동으로 확인해야 하며, 생성 후 일반 디자인 도구를 사용하여 추가하는 것이 더 안전할 수 있습니다.
깊은 지식: 12개 언어,
인터페이스 및 세계 맥락
알리바바는 이 모델이 12개 언어와 20개 이상의 폰트 렌더링을 기본 지원한다고 밝혔습니다.
공식 출시 예시에는 일본어, 한국어, 스페인어, 중국어 및 영어 콘텐츠가 포함됩니다.
이 모델은 또한 다음을 포함한 일반적인 시각 시스템을 재현하는 것을 목표로 합니다:
- 웹페이지
- 소프트웨어 인터페이스
- 채팅 창
- 게임
- 라이브 방송
- 교육 차트
- 과학 그래픽
이는 단순히 비주얼 스타일을 맞추는 것만을 의미하지 않습니다. 모델은 그리는 대상의 의도된 구조를 이해해야 합니다.
예를 들어, 날씨 패널에는 식별 가능한 날짜, 장소, 아이콘, 온도 및 예보 계층이 포함되어야 합니다. 코드 편집기는 합리적인 위치에 패널, 탭, 줄 번호, 코드 영역 및 도구 모음을 갖추어야 합니다.
알리바바의 출시 기사는 또한 생성 프로세스를 외부 지식 검색에 연결하는 워크플로를 설명합니다. 모델이 모든 API 호출에서 실시간 지식을 보유한다고 가정해서는 안 됩니다. 현재 정보는 주변 제품 또는 에이전트 워크플로가 검색 또는 검색 기능을 실제로 활성화하는지 여부에 따라 달라집니다.
생성 및 편집에 동일한 모델 사용
가장 실용적인 변화 중 하나는 qwen-image-3.0-pro 모델에 생성 및 편집 기능을 결합한 것입니다.
알리바바 클라우드 공식 API 문서에 따르면 동일한 모델이 다음을 지원합니다:
-
텍스트-이미지 생성
-
이미지 투 이미지 변환
-
참조 이미지 1~3장을 사용한 이미지 편집
이를 통해 첫 생성 시 모델을 선택하고 이후 수정 시 다른 모델을 다시 선택해야 하는 필요성이 줄어듭니다.
일반적인 작업 흐름은 다음과 같습니다:
- 상세한 프롬프트를 사용하여 첫 번째 이미지를 생성합니다.
- 결과물을 입력 이미지로 사용합니다.
- 모델에게 선택한 내용을 변경하도록 요청합니다.
- 피사체, 구도 또는 스타일의 나머지 부분을 유지합니다.
- 필요 시 여러 대안을 생성합니다.
편집 작업에는 다음이 포함될 수 있습니다:
- 의상 변경
- 배경 교체
- 객체 추가 또는 제거
- 여러 이미지의 시각적 요소 결합
- 텍스트 수정
- 손상된 콘텐츠 복구
- 스타일 전이
- 배경을 교체하면서 피사체 유지
모델은 이미지 편집 요청 시 참조 이미지 1~3장을 허용합니다.
공식 API 제한 사항 및 출력 형식
阿里云百炼의 현재 Qwen Image 3.0 API 참조에는 qwen-image-3.0-pro에 대해 다음 사양이 나열되어 있습니다:
| API 속성 | 현재 문서 값 |
|---|---|
| 생성 모드 | 텍스트-이미지 및 이미지-이미지/편집 |
| 참조 이미지 | 이미지 편집 시 1~3장 |
| 입력 이미지 형식 | JPG, JPEG, PNG, BMP, TIFF, WEBP, GIF |
| 권장 입력 크기 | 가로/세로 384~2048픽셀 |
| 최대 입력 파일 크기 | 이미지당 10MB |
| 출력 픽셀 범위 | 총 해상도 512×512~2048×2048 |
| 출력 형식 | PNG |
| 요청당 이미지 수 | 1~6 |
| API 참조의 프롬프트 언어 | 중국어 및 영어 |
| 결과 URL 보존 시간 | 24시간 |
| Qwen Cloud에 표시된 국제 속도 제한 | 분당 1회 요청 |
더 넓은 제품 출시 노트에 따르면 렌더링된 이미지에는 12개 언어가 포함될 수 있습니다. 이는 API 문서에서 긍정 프롬프트가 중국어와 영어를 지원한다는 설명과 차이가 있습니다.
즉:
- 지침 언어는 중국어 또는 영어 문서를 지원합니다.
- 생성된 이미지에는 더 다양한 언어의 텍스트가 포함될 수 있습니다.
cURL을 사용하여 Qwen-Image 3.0 Pro 호출
阿里巴巴의 현재 국제 API 예시는 DashScope 다중 모달 생성 엔드포인트를 사용합니다.
curl --location \
'https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/api/v1/services/aigc/multimodal-generation/generation' \
--header 'Content-Type: application/json' \
--header "Authorization: Bearer $DASHSCOPE_API_KEY" \
--data '{
"model": "qwen-image-3.0-pro",
"input": {
"messages": [
{
"role": "user",
"content": [
{
"text": "Create a clean bilingual product poster for a reusable water bottle. Use a structured editorial layout, realistic product lighting, an English headline, a Chinese subtitle, three feature callouts, and a small specifications table."
}
]
}
]
},
"parameters": {
"prompt_extend": true,
"n": 1,
"size": "1024*1024",
"watermark": false
}
}'
{WorkspaceId}를 API 키와 연결된 작업 공간 ID로 교체하십시오.
阿里云은 중국 및 싱가포르 배포 리전에 대해 별도의 API 키와 엔드포인트를 사용합니다. 키와 엔드포인트는 리전 간에 혼용할 수 없습니다.
Python SDK로 이미지 편집
공식 SDK는 MultiModalConversation을 사용하여 Qwen-Image 3.0 Pro를 호출합니다.
import os
from dashscope import MultiModalConversation
response = MultiModalConversation.call(
api_key=os.environ["DASHSCOPE_API_KEY"],
model="qwen-image-3.0-pro",
messages=[
{
"role": "user",
"content": [
{
"image": ""
},
{
"text": (
"Keep the product shape, label, and camera angle unchanged. "
"Replace the plain background with a premium dark studio scene, "
"add a soft rim light, and place three concise English feature "
"labels on the right side."
)
},
],
}
],
prompt_extend=True,
n=1,
)
if response.status_code == 200:
image_url = response.output.choices[0].message.content[0]["image"]
print(image_url)
else:
raise RuntimeError(f"{response.code}: {response.message}")
생성된 URL은 임시적입니다. 阿里云은 결과 링크가 24시간 동안만 유지된다고 밝히므로, 애플리케이션은 승인된 출력을 적시에 자체 저장소에 다운로드해야 합니다.
Arena 성능: 강력한 성과지만 순위는 맥락적으로 이해해야 함
AIBase 헤드라인은 Qwen-Image 3.0 Pro가 중국 모델 중 1위, 주류 모델 중 2위를 차지했다고 보도했습니다.
첫 번째 부분은 본 문서에서 검토한 Arena 실시간 스냅샷과 일치합니다: Qwen-Image 3.0 Pro는 전체 텍스트-이미지 차트에서 가장 높은 순위의 중국 개발 모델입니다.
두 번째 부분은 2026년 8월 4일 실시간 순위표에서 뒷받침되지 않았습니다.
몇 분 만에 쇼케이스 사이트를 만들고 리드를 늘리세요
아이디어를 한 문장으로 입력하면 We0 AI가 쇼케이스 사이트, 페이지, CMS를 생성하고 출시 후 고객과 트래픽 확보를 돕습니다.
무료 등록을 위한 하나의 완전한 프로젝트 생성
하나의 완전한 생성 흐름을 시도하고 첫 번째 프로젝트 초안을 빠르게 보는 데 가장 적합합니다.
Arena 표시:
- 모델:
qwen-image-3.0-pro - 개발자: 阿里巴巴
- 점수: 1263 ±
11
- 상태:
초기 평가 결과
- 현재 표시 순위: 5위
- 순위 구간: 4~9위
- 공개 투표 수: 2,801
해당 점수는 여러 경쟁 시스템과 유사하며, 신뢰 구간이 겹칩니다. '초기 평가' 라벨은 더 많은 투표가 수집됨에 따라 순위가 변동될 수 있음을 의미합니다.
Arena는 사용자 선호도 비교를 기반으로 하며, 모든 운영 요구사항을 완전히 측정하는 지표는 아닙니다.
이는 다음 측면에서의 우수성을 증명하지 못합니다:
- 텍스트 정확성
- 제품 일관성
- 이미지 편집 충실도
- 지연 시간
- API 안정성
- 안전 관련 동작
- 적격 소재당 비용
- 상업적 라이선스 적용 가능성
팀은 자체 프롬프트와 수용 기준을 기반으로 모델을 테스트해야 합니다.
이 모델이 가장 적합한 시나리오
이미지에 시각적 요소와 텍스트 구조가 동시에 포함될 때, Qwen-Image 3.0의 기능 세트가 특히 유용합니다.
스토리보드 및 숏폼 드라마 기획
긴 프롬프트 하나로 스토리보드 내 여러 컷, 캐릭터, 카메라 앵글, 대사 메모, 장면 전환을 설명할 수 있습니다.
교육 및 지식 기반 그래픽
이 모델은 다음 작업을 위한 초안 작성에 사용할 수 있습니다:
- 강의 다이어그램
- 수식표
- 과학 포스터
- 지식 카드
- 시험지 레이아웃
- 주석이 포함된 일러스트레이션
모든 사실과 수식은 반드시 전문가의 검토가 필요합니다.
이커머스 및 광고
잠재적 활용 분야는 다음과 같습니다:
- 제품 포스터
- 다국어 마케팅 변형
- 메뉴판
- 제품 설명 이미지
- 프로모션 배너
- 소셜 미디어 레이아웃
제품이나 주체가 여러 변형에서 일관된 식별 가능성을 유지해야 하는 경우, 참조 이미지 편집 기능이 매우 유용합니다.
인터페이스 및 제품 컨셉 초안
이 모델은 다음 작업을 위한 초안을 작성할 수 있습니다:
- 웹 페이지
- 앱 인터페이스
- 라이브 커머스 방송 화면
- 게임 UI
- 중첩형 UI 컨셉
이러한 이미지는 시각적 컨셉 초안이며, 바로 배포 가능한 프론트엔드 코드는 아닙니다.
신문, 보고서 및 고밀도 편집 레이아웃
더 큰 프롬프트 용량과 작은 글자 크기 렌더링 능력 덕분에 이 모델은 복잡한 편집 디자인 탐구에 적합합니다.
최종 게시 시 텍스트 정확성에 대한 엄격한 요구가 있다면, 여전히 레이아웃 소프트웨어에서 텍스트를 교체하거나 검증해야 합니다.
실용적인 프롬프트 권장 사항
4.5K 글자 제한이 모든 프롬프트를 4.5K로 채워야 한다는 의미는 아닙니다.
긴 프롬프트는 구조가 명확할 때 가장 좋은 결과를 얻습니다.
- 캔버스 정의
다음을 명확히 지정하세요:
- 가로세로 비율
- 해상도 목표
- 가로/세로 방향
- 섹션 수
- 읽기 순서
- 내용과 스타일을 분리하여 설명
정보 내용을 먼저 설명하고, 그다음 시각적 표현 방식을 설명하세요.
내용:
- 메인 타이틀
- 제품 이점 3가지
- 사양표
- 바닥글 고지 사항
스타일:
- 미니멀 편집 디자인
- 진한 남색 배경
- 흰색 산세리프 폰트
- 부드러운 스튜디오 조명
- 텍스트를 특정 영역에 배정
모델에게 무작위 문구 목록을 주는 것을 피하세요.
각 텍스트 블록이 어떤 위치에 속하는지 설명해야 합니다.
- 정확한 문구 표기
이미지에 표시되어야 할 텍스트는 따옴표로 표시하세요.
생성된 철자는 여전히 검증해야 합니다.
- 요소 간의 계층 관계 설명
중첩형 또는 다중 패널 디자인의 경우, 어떤 요소가 어떤 요소를 포함하는지 설명하세요.
- 정체성이 중요한 작업에는 참조 이미지 사용
특정 제품, 인물, 패키지 또는 사물이 중요한 경우, 텍스트 설명만으로 생성하는 것보다 참조 이미지 기반 편집이 더 신뢰할 수 있습니다.
- 여러 개의 후보 생성
이 API는 호출당 최대 6개의 출력 이미지를 지원합니다. 비교 없이 단일 프롬프트를 반복 수정하는 것보다 여러 대안을 생성하는 것이 더 효율적입니다.
현재 제한 사항 및 출시 관련 참고 사항
공식 문서는 아직 보완 중
이번 리뷰에서 검토한 Alibaba Cloud API 페이지는 처음에 한정 미리보기로 표시되었으며, 8월 5일 보도에 따르면 이 모델은 Qwen 플랫폼을 통해 더 넓게 공개되었습니다.
따라서 문서, 접근 요구 사항, 요율 제한 및 모델 별칭은 빠르게 변경될 수 있습니다.
Pro 버전과 Standard 버전의 문서 가시성 차이
공개된 Qwen Cloud 페이지에는 Qwen-Image 3.0 Pro가 명확하게 문서화되어 있습니다. AIBase는 Standard 버전 가격이 이미지당 0.03달러라고 보도했지만, 이번 리뷰에서는 해당하는 공개 국제 버전 모델 페이지를 찾을 수 없었습니다.
이 모델은 독점 모델
Arena 실시간 목록은 Qwen-Image 3.0 Pro를 독점 모델로 표시합니다. 3.0 버전에 대한 공식 오픈소스 가중치 공개는 확인되지 않았습니다.
텍스트는 여전히 수동 교정 필요
이 모델의 텍스트 렌더링 능력은 큰 개선이지만, 완벽한 타이포그래피나 사실적 정확성을 보장하지는 않습니다.
이미지 URL은 유효 기간이 있음
API로 생성된 이미지 URL의 유효 기간은 24시간입니다. 필요한 파일은 즉시 저장하시기 바랍니다.
상업적 사용 전 관련 정책 검토 필요
생성 자산을 배포하기 전에 다음을 검토하세요:
- Qwen Cloud 서비스 약관
- 지식 재산권
- 상표 사용
- 참조 이미지의 권리
- 개인정보 및 초상권
- 지역 AI 콘텐츠 규정
- 필요한 고지 또는 워터마크 요구 사항
자주 묻는 질문
Qwen-Image 3.0 Pro란 무엇인가요?
Qwen-Image 3.0 Pro는 알리바바의 플래그십 3세대 이미지 생성 및 편집 모델입니다. 텍스트 기반 이미지 생성, 최대 3장의 참조 이미지를 사용한 편집, 긴 프롬프트, 다국어 텍스트 렌더링 및 고밀도 시각적 레이아웃을 지원합니다.
Qwen-Image 3.0 Pro의 비용은 얼마인가요?
Qwen Cloud는 현재 1K 출력 기준 이미지당 0.04달러, 2K 출력 기준 이미지당 0.075달러로 책정하고 있습니다. 1K 및 2K 워크플로 모두 입력 이미지당 0.003달러로 책정되어 있습니다.
Qwen-Image 3.0 Standard 버전 모델이 있나요?
AIBase는 Standard 버전이 이미지당 0.03달러부터 시작하는 가격으로 출시되었다고 보도했습니다. 본 문서 작성 시점에는 전체 공식 가격표가 포함된 공개 국제 버전 모델 페이지를 찾을 수 없었으므로, 예산을 책정하기 전에 개발자는 현재 Qwen Cloud 콘솔을 확인해야 합니다.
Qwen-Image 3.0의 프롬프트는 얼마나 길 수 있나요?
알리바바는 이 모델이 최대 약 4.5K 토큰의 입력을 지원한다고 밝혔습니다. 더 큰 제한은 스토리보드, 신문, 교육 그래픽, 중첩 인터페이스 및 기타 정보 밀도가 높은 이미지의 요구를 충족하기 위한 것입니다.
Qwen-Image 3.0은 기존 이미지를 편집할 수 있나요?
네. 동일한 qwen-image-3.0-pro API 모델은 1~3장의 참조 이미지와 텍스트 명령을 사용한 이미지 간 변환 및 편집 요청을 지원합니다.
Qwen-Image 3.0은 작은 텍스트를 정확하게 렌더링할 수 있나요?
알리바바의 데모는 약 10픽셀의 읽을 수 있는 텍스트와 복잡한 LaTeX 페이지를 보여줍니다. 결과는 여전히 다양하므로 중요한 철자, 수식, 가격, 법적 내용 및 브랜드 이름은 수동 검증이 필요합니다.
Qwen-Image 3.0은 오픈소스인가요?
Qwen-Image 3.0 Pro에 대한 오픈소스 가중치 공개는 확인되지 않았습니다.
본 문서에서 검토한 공식 출처입니다. Arena는 현재 이 모델을 독점 모델로 표시하고 있습니다.
Qwen-Image 3.0 Pro는 Arena에서 어떤 순위인가요?
2026년 8월 4일 Text-to-Image Arena 스냅샷에서 중국 개발 모델 중 최고 순위를 기록했으며, 초기 전체 순위 5위, 순위 구간 4~9위로 표시되었습니다. 새로운 투표와 모델이 추가됨에 따라 Arena 순위는 변동됩니다.
관련 도구
- Qwen Cloud: 모델 테스트, API 액세스, 현재 가격 확인을 위한 알리바바 클라우드의 국제 모델 플랫폼입니다.
- Qwen-Image 3.0 Pro: 기능, 요율 제한, 가격 및 cURL 예시가 포함된 공식 모델 페이지입니다.
- Alibaba Cloud Bailian: Qwen 및 타사 모델을 배포하고 호출하기 위한 알리바바 클라우드 관리 플랫폼입니다.
- DashScope Python SDK: 알리바바 클라우드 Qwen API 예시에서 사용되는 공식 Python 패키지입니다.
- [Text-to-Image
Arena](https://arena.ai/leaderboard/text-to-image): 이미지 생성 모델을 비교하기 위한 실시간 선호도 리더보드입니다.
- Qwen Studio: Qwen의 공식 사용자 대상 플랫폼으로, 지원되는 모델 기능을 체험해 볼 수 있습니다.
관련 링크
- Qwen-Image 3.0 공식 출시 기사: 알리바바 클라우드가 제공하는 풍부한 콘텐츠, 사실적인 디테일, 심층 지식에 대한 상세 소개.
- Qwen Cloud의 Qwen-Image 3.0 Pro: 현재 국제 모델 개요, 가격, 속도 제한 및 API 요청 예시.
- Qwen 이미지 생성 및 편집 3.0 API 참조: 공식 요청 매개변수, 엔드포인트, 코드 예시, 지원되는 이미지 형식 및 응답 모드.
- 알리바바 클라우드 멀티모달 모델 발표: Qwen-Image 3.0 및 Qwen-Audio 3.0 시리즈에 대한 공식 요약.
- Text-to-Image Arena 리더보드: 모델의 초기 순위를 검증하기 위한 실시간 순위.
- Arena 리더보드 변경 로그: Qwen-Image 3.0 Pro가 리더보드에 추가된 시점을 보여주는 공식 기록.
요약
Qwen-Image 3.0 Pro는 시각적 품질과 밀도 높은 정보를 결합한 이미지 작업에 특화되어 있습니다. 4.5K 토큰 프롬프트 용량, 작은 텍스트 렌더링, 다국어 출력, 중첩된 인터페이스 이해, 사실적인 디테일은 스토리보드, 포스터, 교육용 다이어그램, 인터페이스 및 편집 타이포그래피에 특히 적합합니다.
동일한 API 모델이 생성과 편집을 모두 지원하며, 1~3장의 참조 이미지를 사용할 수 있습니다. Qwen Cloud는 현재 Pro 출력 가격을 1K 이미지 기준 0.04달러부터, 2K 출력은 0.075달러로 책정하고 있습니다.
이 모델은 실시간 Text-to-Image Arena에서 강력한 성능을 보여주지만, 현재 리더보드는 소스 제목에서 주장하는 전체 2위 순위를 지원하지 않습니다. 표시된 위치는 5위이며, 초기 점수와 중첩된 순위 구간이 함께 표시됩니다.
주요 발전은 단순히 더 아름다운 이미지를 생성하는 것이 아니라, 상대적으로 낮은 이미지당 API 비용으로 더 길고 구조화된 지침을 편집 가능한 시각적 자산으로 변환할 수 있다는 점입니다.



