Qwen3 모델군 공개: 하이브리드 사고 모드와 확장된 다국어 지원으로 성능 향상
Qwen3 모델군이 공개되었다. 이 모델군은 하이브리드 사고 모드와 119개 언어 지원을 특징으로 하며, MoE 및 밀집 모델을 포함한 다양한 크기의 모델이 Apache 2.0 라이선스로 오픈 소스화되었다.
Qwen 개발팀은 대규모 언어 모델(LLM) Qwen 제품군의 최신 버전인 Qwen3를 공개했다. Qwen3는 플래그십 모델인 Qwen3-235B-A22B를 포함하여 다양한 크기의 모델을 제공하며, 코딩, 수학, 일반 능력 등 여러 벤치마크에서 경쟁 모델 대비 우수한 성능을 보인다. 특히, 소형 MoE 모델인 Qwen3-30B-A3B는 활성화된 매개변수가 10배 많은 QwQ-32B를 능가하며, Qwen3-4B와 같은 소형 모델도 Qwen2.5-72B-Instruct와 유사한 성능을 발휘한다. Qwen3 모델군은 하이브리드 사고 모드와 광범위한 다국어 지원을 핵심 기능으로 도입했다.
Qwen3 모델군의 출시는 대규모 기반 모델의 연구 및 개발을 촉진하는 것을 목표로 한다. Qwen3는 총 2350억 개의 매개변수와 220억 개의 활성화된 매개변수를 가진 대형 MoE 모델인 Qwen3-235B-A22B와 총 300억 개의 매개변수와 30억 개의 활성화된 매개변수를 가진 소형 MoE 모델인 Qwen3-30B-A3B를 오픈 소스화했다. 이와 함께 Qwen3-32B, Qwen3-14B, Qwen3-8B, Qwen3-4B, Qwen3-1.7B, Qwen3-0.6B 등 6개의 밀집(dense) 모델도 Apache 2.0 라이선스 하에 공개되었다. 이러한 모델들은 Hugging Face, ModelScope, Kaggle과 같은 플랫폼에서 사용할 수 있다.
Qwen3 모델은 문제 해결을 위한 하이브리드 접근 방식을 도입하여 두 가지 사고 모드를 지원한다. '사고 모드(Thinking Mode)'는 모델이 최종 답변을 제공하기 전에 단계별로 추론하는 데 시간을 할애하여 복잡한 문제에 적합하다. 반면, '비사고 모드(Non-Thinking Mode)'는 즉각적인 응답을 제공하여 속도가 중요한 간단한 질문에 유용하다. 이 유연성을 통해 사용자는 작업에 따라 모델의 '사고' 수준을 제어할 수 있으며, 계산 추론 예산에 비례하여 성능이 향상된다. 또한, Qwen3 모델은 119개 언어 및 방언을 지원하여 광범위한 다국어 기능을 제공한다. 여기에는 영어, 프랑스어, 독일어, 스페인어와 같은 인도유럽어족, 중국어(간체, 번체, 광둥어)와 같은 중국-티베트어족, 아랍어, 히브리어와 같은 아프리카-아시아어족, 인도네시아어, 말레이어와 같은 오스트로네시아어족, 타밀어, 텔루구어와 같은 드라비다어족, 튀르키예어, 카자흐어와 같은 튀르크어족, 태국어, 라오어와 같은 타이-카다이어족, 핀란드어, 에스토니아어와 같은 우랄어족, 베트남어, 크메르어와 같은 오스트로아시아어족, 그리고 일본어, 한국어, 조지아어 등이 포함된다.
Qwen3의 사전 학습 데이터셋은 Qwen2.5의 18조 토큰 대비 약 두 배인 36조 토큰으로 크게 확장되었다. 이 데이터는 웹뿐만 아니라 PDF와 유사한 문서에서 Qwen2.5-VL을 사용하여 텍스트를 추출하고 Qwen2.5로 품질을 개선하여 수집되었다. 수학 및 코드 데이터 양을 늘리기 위해 Qwen2.5-Math 및 Qwen2.5-Coder를 사용하여 교과서, 질문-답변 쌍, 코드 스니펫과 같은 합성 데이터를 생성했다. 사전 학습은 세 단계로 진행되었다. 첫 번째 단계(S1)에서는 30조 개 이상의 토큰으로 4K 토큰의 컨텍스트 길이로 모델을 사전 학습하여 기본적인 언어 능력과 일반 지식을 부여했다. 두 번째 단계(S2)에서는 STEM, 코딩, 추론 작업과 같은 지식 집약적 데이터의 비율을 높여 데이터셋을 개선하고 5조 개의 토큰을 추가로 학습했다. 마지막 단계에서는 고품질의 장문 컨텍스트 데이터를 사용하여 컨텍스트 길이를 32K 토큰으로 확장했다.
모델 아키텍처의 발전, 학습 데이터 증가, 효과적인 학습 방법 덕분에 Qwen3 밀집 기본 모델의 전반적인 성능은 더 많은 매개변수를 가진 Qwen2.5 기본 모델과 동등하다. 예를 들어, Qwen3-1.7B/4B/8B/14B/32B-Base는 각각 Qwen2.5-3B/7B/14B/32B/72B-Base와 동일한 성능을 보인다. 특히 STEM, 코딩, 추론 분야에서는 Qwen3 밀집 기본 모델이 더 큰 Qwen2.5 모델보다 우수한 성능을 발휘한다. Qwen3 MoE 기본 모델은 활성화된 매개변수의 10%만을 사용하여 Qwen2.5 밀집 기본 모델과 유사한 성능을 달성하여 학습 및 추론 비용을 크게 절감한다. 하이브리드 모델 개발을 위한 후속 학습은 (1) 장문 연쇄 사고(CoT) 콜드 스타트, (2) 추론 기반 강화 학습(RL), (3) 사고 모드 융합, (4) 일반 RL의 4단계 파이프라인으로 구현되었다.
개발자는 Hugging Face, ModelScope, Kaggle에서 Qwen3 모델을 활용할 수 있으며, 배포를 위해서는 SGLang 및 vLLM 프레임워크를 권장한다. 로컬 사용을 위해서는 Ollama, LMStudio, MLX, llama.cpp, KTransformers와 같은 도구가 권장된다. Qwen3는 코딩 및 에이전트 기능에 최적화되었으며, MCP(Multi-task Code Generation and Planning) 지원도 강화되었다. Qwen-Agent를 사용하면 도구 호출 템플릿과 파서를 내부에 캡슐화하여 코딩 복잡성을 줄일 수 있다. `enable_thinking` 인수를 `True` 또는 `False`로 설정하여 사고 모드를 제어할 수 있으며, 다중 턴 대화에서는 `/think` 및 `/no_think` 태그를 사용자 프롬프트나 시스템 메시지에 추가하여 동적으로 모드를 전환할 수 있다.
Qwen3는 인공 일반 지능(AGI) 및 인공 초지능(ASI)을 향한 중요한 이정표로 평가된다. 사전 학습 및 강화 학습(RL)의 확장을 통해 더 높은 수준의 지능을 달성했으며, 사고 및 비사고 모드를 통합하여 사용자가 사고 예산을 유연하게 제어할 수 있도록 했다. 향후 Qwen 개발팀은 모델 아키텍처 및 학습 방법론을 개선하여 데이터 확장, 모델 크기 증가, 컨텍스트 길이 연장, 양식(modality) 확장, 장기 추론을 위한 환경 피드백 기반 RL 발전 등 여러 차원에서 모델을 향상시킬 계획이다. 이는 모델 학습 중심 시대에서 에이전트 학습 중심 시대로의 전환을 의미한다.
데빈은 실제 기자가 아닌 AI 기술 에디터입니다. 출처의 공개 기사 본문 또는 RSS 제공 정보에서 사실을 추려 배경과 기술적 영향을 독립적인 한국어 기사로 재구성합니다. 직접 취재한 기사나 원문 전문의 번역·재게시가 아닙니다.
출처 · 원문 확인
Qwen (Alibaba)
Qwen3: Think Deeper, Act Faster
원문 발행: 2025-04-29 05:00:00
원문과 이미지의 권리는 해당 권리자에게 있습니다. 정정·게재 중단 요청은 문의 안내를 이용해 주세요.
관련 소식
- xAI 최신 AI 모델 'Grok 4.7', 아마존 베드록 출시… 50만 토큰 문맥과 추론 제어 지원 · AWS Machine Learning Blog · 2026-09-29
- 구글·XPRIZE '퓨처 비전' 대상에 제프 신세사이즈드의 '더 기프티드' 선정 · Google AI Blog · 2026-09-29
- 프로덕션 AI 배포를 위한 릴리스 매니페스트와 통합 운영 체계 분석 · Stack Overflow Blog · 2026-09-29
- 아마존웹서비스, 다중 계정 환경에서 텍스트랙트 어댑터 수명 주기를 자동화하는 아키텍처 공개 · AWS Machine Learning Blog · 2026-09-29
- Hcompany, GUI·코드·API를 단일 모델로 제어하는 업무용 에이전트 'Holo4' 공개 · Hugging Face Blog · 2026-09-28
댓글 0
아직 댓글이 없습니다. 첫 댓글을 남겨 보세요.