AI · Data
Qwen : Qwen3-VL부터 Coder, Omni, Image까지 정리하기
Qwen3-VL, Qwen3-Coder, Qwen-Image, Omni부터 Qwen3.5와 최신 Qwen3.8까지. 복잡해진 Qwen 모델 패밀리와 모델 선택 기준을 한 번에 정리합니다.
Qwen이란?
Qwen(通义千问)은 Alibaba의 Qwen Team이 개발하는 foundation model family입니다.
초기의 Qwen은 text 중심 LLM이었지만 세대가 발전하면서 다음과 같이 영역이 확장됐습니다.
- General-purpose LLM
- Reasoning
- Coding
- Vision-Language
- Image generation / editing
- Audio / Speech
- Omni-modal interaction
- Embedding / Reranking
- Agent / Tool use
따라서 지금의 Qwen은 하나의 모델이라기보다는 여러 modality와 workload를 포괄하는 AI model ecosystem으로 보는 편이 정확합니다.
1. 먼저 보는 Qwen 전체 지도
큰 흐름만 정리하면 다음과 같습니다.
| Family | 주요 역할 | 대표 모델 |
|---|---|---|
| Qwen / Qwen2 | 초기 General LLM | Qwen, Qwen1.5, Qwen2 |
| Qwen2.5 | General LLM | Qwen2.5 |
| Qwen2.5-Coder | Coding | Qwen2.5-Coder |
| Qwen2.5-Math | Mathematics | Qwen2.5-Math |
| QwQ | Reasoning | QwQ-32B |
| Qwen2-VL | Vision-Language | Qwen2-VL |
| Qwen2.5-VL | Vision-Language / Visual Agent | 3B, 7B, 72B |
| Qwen2-Audio | Audio understanding | Qwen2-Audio |
| Qwen2.5-Omni | Text + Image + Audio + Video + Speech | Qwen2.5-Omni |
| Qwen3 | General + Reasoning | Dense / MoE |
| Qwen3-Coder | Agentic Coding | 480B-A35B 등 |
| Qwen3-VL | Vision-Language / Visual Agent | 2B ~ 235B MoE |
| Qwen3 Embedding | Embedding | Qwen3-Embedding |
| Qwen3 Reranker | Reranking | Qwen3-Reranker |
| Qwen3-ASR | Speech Recognition | 0.6B, 1.7B |
| Qwen-Image | Image generation/editing | 20B |
| Qwen3.5 | Native multimodal foundation model | 0.8B ~ 397B MoE |
| Qwen3.6 / 3.7 | 이후 generation | hosted/open variants |
| Qwen3.8 | 최신 generation | 27B, 2.4T-A95B 등 |
| Qwen3.8-Flash-Next | Qwen4 architecture preview | MoE |
중요한 점은 Qwen3, Qwen3-VL, Qwen3-Coder가 단순히 parameter size만 다른 동일 모델이 아니라는 것입니다.
각각 목적과 architecture, training strategy가 다릅니다.
2. Qwen3 — Text LLM에서 Reasoning Model로
2025년 4월 공개된 Qwen3는 Qwen family에서 꽤 중요한 전환점입니다.
Qwen3의 특징 중 하나는 thinking과 non-thinking을 하나의 모델에서 다룰 수 있도록 설계했다는 점입니다.
어려운 reasoning 문제에서는 더 많은 computation을 사용하고, 단순한 질문에서는 빠르게 답하는 형태입니다.
Qwen Team은 Qwen3 pre-training에 약 36 trillion tokens, 119개 언어 및 방언을 사용했다고 밝혔습니다. 이는 약 18T tokens였던 Qwen2.5보다 크게 증가한 규모입니다.
Qwen3 Dense Models
대표적으로 다음 크기의 dense model들이 공개됐습니다.
- Qwen3-0.6B
- Qwen3-1.7B
- Qwen3-4B
- Qwen3-8B
- Qwen3-14B
- Qwen3-32B
작은 모델은 local inference나 edge deployment에 적합하고, 14B/32B 정도부터는 비교적 강한 general reasoning과 coding 성능을 기대할 수 있습니다.
Qwen3 MoE Models
Qwen3에서는 Mixture-of-Experts도 중요한 역할을 합니다.
대표 모델은 다음과 같습니다.
- Qwen3-30B-A3B
- Qwen3-235B-A22B
30B-A3B라는 이름이 처음에는 조금 이상하게 보일 수 있습니다.
30B는 전체 parameter 규모이고, A3B는 inference 시 token마다 약 3B parameter가 활성화된다는 의미입니다.
즉,
전체 모델의 capacity는 크게 가져가면서 실제 inference computation은 줄인다.
는 것이 MoE의 핵심입니다.
235B-A22B 역시 같은 방식으로 이해하면 됩니다.
3. Qwen3-VL — 이미지 보는 모델을 넘어 Visual Agent로
개인적으로 Qwen ecosystem을 볼 때 가장 흥미로운 family 중 하나가 Qwen3-VL입니다.
VL은 Vision-Language를 의미합니다.
하지만 단순히 “사진을 넣으면 설명해주는 모델”이라고 이해하면 기능을 상당히 축소해서 보는 셈입니다.
Qwen3-VL은 image understanding뿐 아니라 video understanding, spatial reasoning, visual grounding, GUI interaction, visual coding 같은 영역을 함께 겨냥합니다. 공식 model card에서는 PC/mobile GUI를 인식하고 tool을 호출하는 Visual Agent, 그리고 screenshot이나 video로부터 HTML/CSS/JS 등을 생성하는 Visual Coding capability도 주요 기능으로 소개합니다.
Qwen3-VL 모델 종류
주요 official model은 다음과 같이 구성됩니다.
Dense
- Qwen3-VL-2B-Instruct
- Qwen3-VL-2B-Thinking
- Qwen3-VL-4B-Instruct
- Qwen3-VL-4B-Thinking
- Qwen3-VL-8B-Instruct
- Qwen3-VL-8B-Thinking
- Qwen3-VL-32B-Instruct
- Qwen3-VL-32B-Thinking
MoE
- Qwen3-VL-30B-A3B-Instruct
- Qwen3-VL-30B-A3B-Thinking
- Qwen3-VL-235B-A22B-Instruct
- Qwen3-VL-235B-A22B-Thinking
그리고 deployment를 위해 일부 모델에는 FP8, GGUF 등의 variant도 제공됩니다.
여기서 중요한 suffix가 두 개 있습니다.
Instruct vs Thinking
Instruct는 일반적인 instruction following에 적합합니다.
빠른 VQA, OCR, document extraction, image description, UI understanding 같은 작업이라면 보통 Instruct 모델이 자연스러운 선택입니다.
반면 Thinking은 시각 정보에 reasoning이 많이 필요한 문제를 겨냥합니다.
예를 들어 복잡한 diagram을 분석하거나 여러 visual clue를 조합해야 하는 문제라면 Thinking variant가 더 잘 맞습니다.
4. Qwen2.5-VL → Qwen3-VL에서 무엇이 달라졌나
Qwen3-VL을 이해하려면 Qwen2.5-VL도 살펴볼 필요가 있습니다.
Qwen2.5-VL은 다음 세 가지 주요 크기로 공개됐습니다.
- Qwen2.5-VL-3B
- Qwen2.5-VL-7B
- Qwen2.5-VL-72B
Base와 Instruct 모델이 제공됐고, document/chart understanding, visual localization, structured output, long-video understanding 그리고 computer/phone use를 포함한 visual agent capability를 강조했습니다.
Qwen3-VL에서는 여기에서 더 발전해 architecture 자체가 개선됐습니다.
대표적으로:
- enhanced multimodal RoPE
- DeepStack
- improved spatial-temporal modeling
- text timestamp 기반 video alignment
- Dense + MoE architecture
- Instruct + Thinking variants
등이 들어갑니다.
특히 context 측면도 상당히 커졌습니다.
Qwen3-VL-30B-A3B의 경우 native 256K context를 지원하고, YaRN을 이용하면 최대 1M까지 확장할 수 있다고 Qwen Team은 설명합니다.
그래서 Qwen3-VL은 OCR model이나 image captioning model이라기보다는,
“vision이 추가된 agent-capable LLM”
에 더 가깝습니다.
5. Qwen3-Coder — 코드 생성보다 Agentic Coding
Coding 전용 family도 따로 존재합니다.
Qwen3-Coder의 대표적인 flagship model은:
Qwen3-Coder-480B-A35B-Instruct
입니다.
전체 480B parameter의 MoE 모델이지만 실제 활성 parameter는 35B입니다.
Qwen Team에 따르면 native context는 256K, extrapolation을 이용하면 1M tokens까지 확장할 수 있습니다. Pre-training에는 7.5T tokens가 사용됐으며 그중 code 비율은 약 70%입니다.
그런데 Qwen3-Coder에서 더 중요한 단어는 Coding보다 오히려 Agentic입니다.
단순히,
“이 Python 함수를 작성해줘.”
에서 끝나는 것이 아니라,
- repository 탐색
- 여러 파일 수정
- tool invocation
- browser interaction
- test 실행
- long-horizon coding task
같은 실제 software engineering workflow를 겨냥합니다.
이를 위해 Qwen은 Qwen Code라는 CLI coding agent도 함께 제공하고 있습니다.
즉 관계를 단순화하면:
Qwen3-Coder = Model
Qwen Code = Coding Agent / CLI
라고 이해하면 편합니다.
6. Qwen2.5-Coder와 Qwen2.5-Math
Qwen3 이전에도 domain-specific model은 존재했습니다.
대표적인 것이:
Qwen2.5-Coder
Software development에 특화된 model family입니다.
code generation뿐 아니라 code reasoning, code fixing 등의 작업을 겨냥합니다.
Qwen2.5-Math
수학 reasoning에 특화된 모델입니다.
General-purpose model을 무조건 크게 만드는 대신 특정 domain의 data와 training recipe를 이용해 specialization한 사례입니다.
흥미로운 점은 이 specialized model들이 다음 세대의 training에도 활용됐다는 것입니다.
Qwen Team은 Qwen3 training 과정에서 Qwen2.5-Math와 Qwen2.5-Coder를 이용해 math/code synthetic data를 생성했다고 설명합니다.
즉 이전 세대의 specialized model이 다음 세대 general model의 teacher/data generator 역할까지 한 셈입니다.
7. QwQ — Qwen의 Reasoning 실험
Qwen ecosystem에서 빼놓기 쉬운 모델이 QwQ입니다.
대표 모델은:
QwQ-32B
입니다.
QwQ는 reasoning에 초점을 둔 모델로, Qwen3가 등장하기 전 Qwen의 reasoning direction을 보여준 모델이라고 볼 수 있습니다.
이후 Qwen3에서는 reasoning capability가 general model 자체에 더 깊게 통합됐습니다.
실제로 Qwen Team은 Qwen3-30B-A3B가 훨씬 적은 active parameters를 사용하면서도 QwQ-32B를 능가한다고 발표했습니다.
따라서 계보를 단순화하면,
QwQ → Qwen3 Thinking → 이후 native reasoning models
정도의 흐름으로 볼 수 있습니다.
8. Qwen2.5-Omni — 보고, 듣고, 말하는 모델
Vision 다음에는 Audio가 있습니다.
그리고 둘을 합치면 Omni가 등장합니다.
Qwen2.5-Omni는 text뿐 아니라:
- text
- image
- audio
- video
를 입력으로 처리하고,
- text
- natural speech
를 출력할 수 있는 end-to-end multimodal model입니다.
Architecture도 재미있습니다.
Qwen에서는 이를 Thinker-Talker architecture라고 부릅니다.
Thinker
Text, image, audio, video 등의 입력을 이해하고 high-level representation과 text를 생성합니다.
Talker
Thinker의 결과를 받아 streaming 방식으로 speech를 생성합니다.
사람으로 비유하면 꽤 직관적입니다.
Thinker = brain
Talker = mouth
이 구조 덕분에 text response뿐 아니라 real-time voice interaction까지 하나의 model architecture 안에서 처리할 수 있습니다.
9. Qwen-Image — LLM family가 이미지 생성까지
Qwen에는 image generation model도 있습니다.
대표적으로 Qwen-Image가 있습니다.
Qwen-Image는 20B MMDiT image foundation model이며 text-to-image뿐 아니라 image editing도 주요 목표로 합니다.
특히 Qwen Team이 강조한 부분은 text rendering입니다.
Image generation model을 사용해본 사람이라면 이미지 속 글자가 이상하게 생성되는 문제를 한 번쯤 경험했을 겁니다.
Qwen-Image는 이런 문제를 줄이는 데 상당한 초점을 맞췄으며,
- alphabetic text
- Chinese characters
- multi-line text
- paragraph-level layout
- image editing
등을 주요 capability로 내세웁니다.
따라서 Qwen-Image는 Qwen3-VL과 역할이 완전히 다릅니다.
Qwen3-VL → 이미지를 이해한다.
Qwen-Image → 이미지를 만든다/수정한다.
이 차이를 기억하면 모델 선택이 쉬워집니다.
10. Qwen3-ASR — 음성을 Text로
Speech recognition을 위한 모델도 별도로 존재합니다.
2026년 현재 official Qwen repository에는 다음과 같은 Qwen3 ASR 계열이 공개돼 있습니다.
- Qwen3-ASR-0.6B
- Qwen3-ASR-1.7B
- Qwen3-ForcedAligner-0.6B
ASR은 Automatic Speech Recognition입니다.
즉,
Audio → Text
가 핵심입니다.
Omni가 여러 modality를 하나의 interactive model에서 처리하는 방향이라면, ASR은 speech recognition이라는 명확한 task에 최적화된 model이라고 보면 됩니다.
11. Embedding과 Reranker도 있다
Qwen을 chatbot으로만 생각하면 놓치기 쉬운 영역입니다.
RAG system을 구축할 때 LLM만큼 중요한 것이 embedding과 reranking입니다.
Qwen ecosystem에도 이를 위한 별도 모델들이 있습니다.
Qwen3-Embedding
Document와 query를 vector representation으로 변환합니다.
대표적인 사용처는:
- Semantic Search
- RAG
- Document Retrieval
- Recommendation
- Clustering
등입니다.
Qwen3-Reranker
Initial retrieval 결과를 다시 평가해서 relevance 순서를 조정합니다.
전형적인 RAG pipeline으로 표현하면:
Query
→ Qwen3-Embedding
→ Vector DB Search
→ Top-K Documents
→ Qwen3-Reranker
→ Best Context
→ Qwen LLM
과 같은 구조를 만들 수 있습니다.
즉 Qwen ecosystem만으로 generation 이전의 retrieval stack까지 상당 부분 구성할 수 있습니다.
12. 그리고 Qwen3.5 — VL이라는 구분이 흐려지기 시작했다
여기서부터 Qwen의 방향이 조금 더 재미있어집니다.
2026년 2월 Qwen Team은 Qwen3.5를 공개했습니다.
첫 open-weight flagship은:
Qwen3.5-397B-A17B
였습니다.
397B parameter의 MoE지만 token당 약 17B parameter가 활성화됩니다.
하지만 parameter보다 중요한 변화가 있습니다.
Qwen3.5는 처음부터 native vision-language model로 설계됐습니다.
즉 Qwen3와 Qwen3-VL처럼 text model과 VL model을 명확하게 나누는 구조에서,
foundation model 자체가 text + image + video를 이해하는 방향
으로 이동한 것입니다.
Qwen3.5의 official open model lineup에는 대표적으로 다음이 있습니다.
Dense
- Qwen3.5-0.8B
- Qwen3.5-2B
- Qwen3.5-4B
- Qwen3.5-9B
- Qwen3.5-27B
MoE
- Qwen3.5-35B-A3B
- Qwen3.5-122B-A10B
- Qwen3.5-397B-A17B
일부 모델에는 Base, FP8, GPTQ-Int4 등의 deployment/training variant도 제공됩니다.
Qwen3.5에서는 Gated DeltaNet과 Gated Attention을 결합한 hybrid architecture가 사용됩니다.
Qwen Team은 이를 통해 long context 처리 비용을 낮추면서 multimodal capability를 foundation model에 직접 통합했습니다.
이 변화는 꽤 중요합니다.
앞으로는
“Text 모델을 쓸까, VL 모델을 쓸까?”
보다,
“하나의 native multimodal foundation model을 어떤 크기로 쓸까?”
가 더 중요한 선택지가 될 가능성이 있기 때문입니다.
13. Qwen3.6 / Qwen3.7 그리고 빠른 iteration
Qwen의 최근 release cadence를 보면 세대 번호가 상당히 빠르게 올라가고 있습니다.
Qwen Code의 공식 provider documentation에서도 현재 다음과 같은 hosted model들을 확인할 수 있습니다.
- qwen3.5-plus
- qwen3.6-plus
- qwen3.7-plus
- qwen3-coder-plus
- qwen3-coder-next
- qwen3-max
등입니다.
여기서 주의할 점이 있습니다.
Open-weight model family와 Alibaba Cloud에서 제공하는 hosted/API model lineup은 항상 1:1로 일치하지 않습니다.
따라서 production에서 Qwen을 선택할 때는:
- Open-weight checkpoint가 필요한지
- API model을 사용할 것인지
- Local/self-hosted inference가 필요한지
를 먼저 결정하는 편이 좋습니다.
14. Qwen3.8 — 그리고 Qwen4로 가는 길
2026년 8월 기준 최신 흐름에는 Qwen3.8이 있습니다.
Official Qwen Hugging Face repository에서는 현재 다음과 같은 모델들을 확인할 수 있습니다.
- Qwen3.8-27B
- Qwen3.8-2.4T-A95B
- Qwen3.8-Flash-Next
그리고 2026년 8월 26일 공개된 Qwen3.8-Flash-Next가 특히 흥미롭습니다.
Qwen Team은 이 모델을 단순한 Qwen3.8 variant가 아니라 Qwen4에 사용될 architecture를 미리 공개하는 모델로 설명합니다.
Qwen3-Next가 이후 Qwen3.5 architecture의 preview 역할을 했던 것과 비슷합니다.
Qwen3.8-Flash-Next에서는 크게 네 가지 변화가 들어갔습니다.
1. Qwen Sparse Attention
Gated DeltaNet과 Qwen Sparse Attention(QSA)을 결합합니다.
Long context 전체에 full attention을 적용하는 대신 중요한 context를 효율적으로 선택해 computation을 줄이는 방향입니다.
2. Gated Residual
Residual stream을 여러 branch로 확장하고 dynamic gate를 통해 information flow를 조절합니다.
3. N-gram Embedding
Local context 기반 lookup을 추가해 상대적으로 작은 computation 증가로 model capacity를 확장합니다.
4. Muon Optimizer
Training optimization 측면에서도 Muon을 중심으로 새로운 scaling strategy가 적용됐습니다.
Qwen3.8-Flash-Next의 main model은 125B parameters이며 추가적인 51B N-gram embeddings를 사용하고, token당 약 6B parameters가 활성화됩니다.
Native context는 262,144 tokens, YaRN을 이용하면 1M tokens까지 확장 가능합니다.
결국 Qwen의 최근 방향은 단순히 모델을 더 크게 만드는 것이 아니라,
“어떻게 더 적은 active computation으로 더 큰 model capacity와 long context를 확보할 것인가?”
에 상당히 집중돼 있습니다.
15. 그래서 어떤 Qwen을 선택해야 할까?
모델이 너무 많으니 실제 개발에서는 목적부터 정하는 편이 빠릅니다.
| 하고 싶은 일 | 우선 살펴볼 모델 |
|---|---|
| 일반 Chat / LLM | Qwen3 / Qwen3.5+ |
| Local lightweight LLM | Qwen3 small Dense / Qwen3.5 0.8B~9B |
| 복잡한 Reasoning | Qwen3 Thinking 계열 / 최신 Qwen3.x |
| Image Understanding | Qwen3-VL |
| OCR / Document AI | Qwen3-VL |
| Video Understanding | Qwen3-VL / Qwen3.5+ |
| GUI / Visual Agent | Qwen3-VL |
| Coding | Qwen3-Coder |
| Coding Agent | Qwen3-Coder + Qwen Code |
| Image Generation | Qwen-Image |
| Image Editing | Qwen-Image |
| Speech Recognition | Qwen3-ASR |
| Real-time Audio/Video Interaction | Qwen2.5-Omni 계열 |
| Embedding / RAG Retrieval | Qwen3-Embedding |
| Search Reranking | Qwen3-Reranker |
| 최신 multimodal foundation model | Qwen3.5+ |
| Architecture 연구 | Qwen3.8-Flash-Next |
16. Qwen 모델 이름 읽는 법
마지막으로 모델 이름을 읽는 방법을 정리해 보겠습니다.
예를 들어:
Qwen3-VL-235B-A22B-Thinking
을 보겠습니다.
Qwen3
Generation입니다.
VL
Vision-Language model이라는 뜻입니다.
235B
전체 parameter가 약 235 billion이라는 의미입니다.
A22B
MoE에서 inference 시 약 22B parameters가 active하다는 의미입니다.
Thinking
Reasoning-enhanced variant입니다.
따라서 이름만 보고도,
“Qwen 3세대 Vision-Language 모델이고, 235B 규모의 MoE이며 약 22B가 활성화되고, reasoning에 특화된 버전”
이라는 것을 알 수 있습니다.
반대로:
Qwen3-VL-8B-Instruct
라면 dense 8B급 VL instruction model,
Qwen3-Coder-480B-A35B-Instruct
라면 480B total / 35B active의 agentic coding MoE,
Qwen3.5-35B-A3B
라면 Qwen3.5 native multimodal generation의 35B total / 3B active MoE라고 읽으면 됩니다.
마치며
Qwen의 발전 과정을 따라가다 보면 흥미로운 패턴이 하나 보입니다.
처음에는 기능별로 모델이 분리됐습니다.
Qwen → Qwen-Coder → Qwen-VL → Qwen-Audio → Qwen-Omni
그런데 최근에는 이 경계가 다시 합쳐지고 있습니다.
Qwen3에서는 reasoning이 general model 안으로 들어왔고, Qwen3.5에서는 vision까지 foundation model 자체에 통합되기 시작했습니다. 동시에 Qwen3-Coder나 Qwen-Image처럼 전문성이 중요한 영역에서는 specialized model을 계속 발전시키고 있습니다.
그리고 Qwen3.8-Flash-Next에서는 Qwen4를 향해 sparse attention, gated residual, n-gram embedding 같은 새로운 architecture까지 실험하고 있습니다.
그래서 지금의 Qwen을 단순히 “Alibaba에서 만든 LLM”이라고 설명하기에는 조금 부족합니다.
오히려,
Language + Reasoning + Vision + Audio + Image Generation + Coding + Retrieval + Agent
를 하나의 ecosystem 안에서 해결하려는 foundation model platform에 가까워지고 있습니다.
특히 self-hosted AI나 open-weight model을 활용하는 개발자라면 Qwen3-VL, Qwen3-Coder 그리고 Qwen3.5 이후의 native multimodal architecture는 계속 지켜볼 가치가 있습니다.
Qwen3-VL을 처음 봤다면 모델 이름이 너무 많다고 느낄 수 있습니다.
하지만 결국 선택 기준은 생각보다 단순합니다.
무엇을 입력하고(Input), 무엇을 시키고(Task), 무엇을 출력할 것인가(Output).
이 세 가지를 먼저 정하면 수많은 Qwen 모델 중 어떤 모델을 사용해야 할지도 자연스럽게 좁혀집니다.
Tags