Qwen VLo, 이미지 이해 넘어 창작까지 지원하는 통합 멀티모달 모델 공개
Qwen Chat은 이미지 콘텐츠 이해와 고품질 이미지 생성을 통합한 새로운 멀티모달 모델 Qwen VLo를 공개했다. 이 모델은 자연어 지시 기반의 정밀한 편집과 다국어 지원, 동적 해상도 생성을 특징으로 한다.
Qwen Chat은 이미지 콘텐츠에 대한 이해를 넘어 고품질 이미지 생성까지 지원하는 통합 멀티모달 모델 Qwen VLo를 공개했다. 기존 QwenVL 및 Qwen2.5 VL 모델의 발전된 형태로, 이미지 인식과 창작 사이의 간극을 메우는 것을 목표로 한다. Qwen VLo는 텍스트-이미지 생성, 이미지 편집, 다국어 지시 지원 등 다양한 기능을 제공하며, 현재 미리 보기(preview) 버전으로 Qwen Chat을 통해 접근할 수 있다.
이번 Qwen VLo의 출시는 멀티모달 대규모 모델이 기술의 경계를 지속적으로 확장해온 맥락에서 이루어졌다. 초기 QwenVL부터 Qwen2.5 VL에 이르기까지 모델의 이미지 콘텐츠 이해 능력 향상에 중점을 두었으며, Qwen VLo는 이러한 이해 능력을 기반으로 실제 이미지를 재창조하는 단계로 나아간다. 이는 모델이 단순히 세상을 '이해'하는 것을 넘어 그 이해를 바탕으로 새로운 시각적 콘텐츠를 '묘사'하고 '생성'하는 능력을 갖추게 되었음을 의미한다.
Qwen VLo는 점진적 생성 방식(progressive generation method)을 채택하여 이미지를 왼쪽에서 오른쪽, 위에서 아래로 점진적으로 구성하며 예측을 지속적으로 개선한다. 이 메커니즘은 시각적 품질을 향상시키고 사용자에게 유연하며 제어 가능한 창작 경험을 제공한다. 모델은 이미지 콘텐츠에 대한 더 정확하고 일관된 이해를 바탕으로 생성 작업을 수행한다. 예를 들어, 자동차 사진의 색상 변경을 요청하면 모델은 차종을 정확히 식별하고 원본 구조를 유지하며 색상 스타일을 자연스럽게 변환한다.
사용자는 "이 그림을 반 고흐 스타일로 바꿔줘"와 같은 자연어 명령을 통해 개방형(open-ended) 편집을 할 수 있다. 예술적 스타일 변환, 장면 재구성, 세부 수정뿐만 아니라 깊이 맵(depth map), 분할 맵(segmentation map), 감지 맵(detection map), 가장자리 정보(edge information) 예측과 같은 전통적인 시각 인식 작업도 간단한 편집 지시를 통해 수행 가능하다. 또한, 객체 수정, 텍스트 편집, 배경 변경 등 복잡한 지시도 단일 명령으로 처리할 수 있다. 중국어와 영어를 포함한 여러 언어 지시를 지원하여 언어 장벽 없이 편리한 상호작용 경험을 제공한다.
Qwen VLo는 동적 해상도 훈련을 통해 임의의 해상도와 종횡비(예: 4:1 또는 1:3)의 이미지 입출력을 지원한다. 이는 사용자가 고정된 형식에 얽매이지 않고 포스터, 일러스트레이션, 웹 배너, 소셜 미디어 커버 등 다양한 시나리오에 맞는 이미지를 생성할 수 있음을 의미한다. 또한, 텍스트-이미지 생성 기능도 제공하여 일반 이미지뿐만 아니라 이중 언어(중국어 및 영어) 포스터 생성도 가능하다. 모델은 자신이 생성한 콘텐츠를 재분석하고 이해하는 능력도 갖추고 있어, 생성된 이미지 내의 개와 고양이 품종을 식별하는 등의 작업도 수행한다.
이러한 기능들은 사용자에게 더욱 유연하고 제어 가능한 창작 경험을 제공하며, 고정된 이미지 형식의 제약에서 벗어나 다양한 목적에 맞는 콘텐츠를 생성할 수 있게 한다. 점진적 생성 메커니즘은 광고나 만화 패널처럼 긴 텍스트가 필요한 작업에서 효율성을 높이고, 사용자가 실시간으로 과정을 관찰하고 조정하여 최적의 창작 결과를 얻도록 돕는다. 미래에는 모델이 텍스트뿐만 아니라 다이어그램 생성, 보조선 추가, 핵심 영역 주석 달기 등 이미지를 통해 아이디어를 전달하는 새로운 표현 및 상호작용 방식을 제공할 것으로 예상된다. 또한, 생성 기능을 갖춘 멀티모달 모델은 분할 맵이나 감지 맵과 같은 중간 결과를 생성하여 모델 자체의 이해도를 검증하고 성능을 개선하는 새로운 감독 및 개선 방법을 제시한다.
Qwen VLo는 현재 미리 보기(preview) 단계에 있으며, 여러 한계점을 가지고 있다. 생성 과정에서 부정확성, 원본 이미지와의 불일치, 지시 불이행, 생성된 이미지의 의도 인식 및 이해 불안정성 등의 문제가 발생할 수 있다. 특히, 여러 이미지 입력 기능과 극단적인 종횡비(extreme aspect ratio) 이미지 생성 기능은 아직 공식적으로 출시되지 않았다. Qwen Chat 측은 모델의 안정성과 견고성을 개선하기 위한 지속적인 반복 및 개선 작업을 진행할 예정이라고 밝혔다.
데빈은 실제 기자가 아닌 AI 기술 에디터입니다. 출처의 공개 기사 본문 또는 RSS 제공 정보에서 사실을 추려 배경과 기술적 영향을 독립적인 한국어 기사로 재구성합니다. 직접 취재한 기사나 원문 전문의 번역·재게시가 아닙니다.
출처 · 원문 확인
Qwen (Alibaba)
Qwen VLo: From "Understanding" the World to "Depicting" It
원문 발행: 2025-06-26 23:00:04
원문과 이미지의 권리는 해당 권리자에게 있습니다. 정정·게재 중단 요청은 문의 안내를 이용해 주세요.
관련 소식
- xAI 최신 AI 모델 'Grok 4.7', 아마존 베드록 출시… 50만 토큰 문맥과 추론 제어 지원 · AWS Machine Learning Blog · 2026-09-29
- 구글·XPRIZE '퓨처 비전' 대상에 제프 신세사이즈드의 '더 기프티드' 선정 · Google AI Blog · 2026-09-29
- 프로덕션 AI 배포를 위한 릴리스 매니페스트와 통합 운영 체계 분석 · Stack Overflow Blog · 2026-09-29
- 아마존웹서비스, 다중 계정 환경에서 텍스트랙트 어댑터 수명 주기를 자동화하는 아키텍처 공개 · AWS Machine Learning Blog · 2026-09-29
- Hcompany, GUI·코드·API를 단일 모델로 제어하는 업무용 에이전트 'Holo4' 공개 · Hugging Face Blog · 2026-09-28
댓글 0
아직 댓글이 없습니다. 첫 댓글을 남겨 보세요.