Qwen3.8-Flash-Next 공개: 활성 6B로 Qwen4 아키텍처 미리보기
알리바바 Qwen 팀이 차기 Qwen4 아키텍처를 엿볼 수 있는 프리뷰 모델 Qwen3.8-Flash-Next를 공개했다. 180B 규모 중 토큰당 6B만 활성화하는 MoE 구조로 비용 효율을 극대화했다.
알리바바 Qwen 팀이 차기 Qwen4 아키텍처를 엿볼 수 있는 프리뷰 모델 Qwen3.8-Flash-Next를 공개했다. 180B 규모 중 토큰당 6B만 활성화하는 MoE 구조로 비용 효율을 극대화했다.
핵심 요약
알리바바 Qwen 팀이 2026년 8월 26일, Hugging Face에 공식 모델 카드와 기술 리포트를 함께 게재하며 새 모델 Qwen3.8-Flash-Next를 공개했다. 이 모델은 차기 Qwen4 아키텍처를 미리 엿볼 수 있는 '프리뷰' 성격으로 소개됐다는 점에서 주목받는다. 디스크 상 총 파라미터는 약 180B(BF16)에 달하지만, 토큰당 실제 활성화되는 파라미터는 6B에 불과해 대형 모델급 성능을 훨씬 낮은 연산 비용으로 구현하려는 시도로 읽힌다.
주요 기능·스펙
아키텍처: 6B 활성 파라미터의 MoE 구조
모델은 Mixture-of-Experts(MoE) 구조를 채택했다. 125B 규모의 메인 모델에 51B 규모의 N-gram 임베딩 파라미터, 4B 규모의 multi-token prediction 모듈이 더해져 디스크 상 총 파라미터는 약 180B(BF16)이지만, 실제 토큰당 활성화되는 파라미터는 6B 수준에 그친다.
기술 리포트는 이번 릴리스의 핵심 아키텍처 변화로 4가지를 꼽는다. Gated DeltaNet과 Qwen Sparse Attention을 결합한 하이브리드 어텐션, Gated Residual, N-gram Embedding, 그리고 Muon 옵티마이저다.
벤치마크와 가격
공식 모델 카드에 따르면 SWE-bench Pro 62.5, GPQA Diamond 91.7, LiveCodeBench v6 91.9, AndroidWorld 84.5, CoWorkBench 73.9, JobBench 55.7의 점수를 기록했다. 이 벤치마크들에서 Qwen3.8-27B, Qwen3.7-Plus, DeepSeek-V4-Flash-0731, Claude Opus 4.6(Max) 등이 비교 대상에 함께 포함됐다. 다만 이들 모델 대비 구체적인 상대 우위 수치는 공개 자료에 명시되지 않았다.
가격은 입력 100만 토큰당 $0.16, 출력 100만 토큰당 $0.47로 책정됐다. 이는 알리바바 자체 플래그십 모델 대비 입력·출력 모두 약 12분의 1 수준이다. Qwen 팀은 학습 비용 역시 Qwen3.7-Plus 대비 약 9분의 1 수준이라고 밝혔다.
사용성 분석
Qwen3.8-Flash-Next는 코딩과 도구 사용(tool use) 중심의 에이전틱 워크로드를 겨냥해 설계됐다. 장문 컨텍스트가 필요한 에이전틱 작업에서 추론 비용을 낮추는 데 초점을 맞춘 만큼, 반복적인 코드 생성·디버깅·툴 호출이 많은 개발 워크플로우에 적합할 것으로 보인다. NVIDIA도 자사 기술 블로그를 통해 GB300 NVL72 시스템에서 이 모델을 에이전틱 코딩 용도로 실험하는 방법을 소개하며 생태계 편입 가능성을 보여줬다.
로컬 구동도 가능하다. Hugging Face에서 가중치를 내려받을 수 있고, GGUF 양자화 버전은 약 75GB RAM으로 구동 가능하다고 보도됐다. 다만 180B급 모델을 로컬에서 다루려면 여전히 상당한 하드웨어 투자가 필요하다.
장단점
장점은 명확하다. 토큰당 6B 활성 파라미터로 대규모 모델급 성능을 시도하면서도 입력·출력 가격을 플래그십 대비 12분의 1 수준까지 낮췄고, 학습 비용도 9분의 1로 줄였다. 하이브리드 어텐션과 N-gram Embedding 등 새 아키텍처 요소를 실제 제품에 조기 적용한 점도 눈에 띈다.
한계도 뚜렷하다. 벤치마크에서 경쟁 모델과 나란히 언급됐을 뿐, 구체적인 상대 비교 수치는 공개되지 않아 실제 우열은 확인하기 어렵다. 라이선스도 Apache 2.0이 아닌 별도 조건이 붙어 있어 채택 전 검토가 필요하다.
전망
Qwen 팀은 이 모델을 Qwen4로 가는 프리뷰로 명시했다. 하이브리드 어텐션, Gated Residual, N-gram Embedding, Muon 옵티마이저라는 4가지 요소가 실제로 차기 플래그십에 그대로 이어질지, 아니면 일부만 채택될지는 아직 확인되지 않았다.
라이선스 이슈는 실제 채택 확산에 변수가 될 전망이다. Qwen Community License 1.0은 상업적 이용과 파생물 판매를 허용하지만, Model-as-a-Service나 AI 업무보조 비즈니스가 일정 매출·MAU 임계값을 넘으면 알리바바와 별도 계약이 필요하다. 같은 Qwen 계열의 다른 모델들이 Apache 2.0으로 공개된 것과 대조적이어서, 대규모 서비스 사업자의 도입 판단에 영향을 줄 수 있다.
결론
Qwen3.8-Flash-Next는 6B 활성 파라미터로 저비용·고효율 에이전틱 엔진을 지향하는 실험적 프리뷰 모델이다. 벤치마크 상 절대적 우위는 아직 검증되지 않았지만, 코딩·툴 사용 워크로드에서 비용 대비 효율을 중시하는 개발자라면 관심을 가져볼 만하다. 다만 라이선스 조건은 상용 서비스 적용 전 반드시 확인해야 한다.
장점
- 토큰당 6B 활성 파라미터로 대규모 모델급 성능을 시도하면서도 연산 비용을 크게 낮췄다
- 입력·출력 가격이 플래그십 대비 약 12분의 1 수준으로 비용 효율이 뛰어나다
- 하이브리드 어텐션, N-gram Embedding 등 차세대 아키텍처 요소를 조기에 실제 모델에 적용했다
- GGUF 양자화로 약 75GB RAM에서 로컬 구동이 가능해 접근성이 있다
- NVIDIA 등 하드웨어·생태계 파트너의 조기 관심을 이끌어냈다
단점/한계
- 벤치마크에서 경쟁 모델과 비교 대상에 포함됐을 뿐 구체적인 상대 우위 수치는 공개되지 않아 실제 성능 우열을 판단하기 어렵다
- Apache 2.0이 아닌 Qwen Community License 1.0이 적용돼, 일정 매출·MAU를 넘는 MaaS·AI 업무보조 사업자는 별도 계약이 필요하다
- 180B급 모델은 GGUF 양자화를 거쳐도 최소 75GB RAM이 필요해 개인 사용자의 로컬 구동 문턱은 여전히 높다
- '프리뷰' 성격의 모델로, 실제 Qwen4 정식 아키텍처와 얼마나 일치할지는 아직 확정되지 않았다
참고 자료
댓글0개
주요 기능/특징
1. MoE 아키텍처: 125B 메인 모델 + 51B N-gram 임베딩 + 4B multi-token prediction, 디스크 총합 약 180B(BF16), 토큰당 활성 파라미터 6B 2. 4대 아키텍처 혁신: Gated DeltaNet + Qwen Sparse Attention 하이브리드 어텐션, Gated Residual, N-gram Embedding, Muon 옵티마이저 3. 벤치마크: SWE-bench Pro 62.5, GPQA Diamond 91.7, LiveCodeBench v6 91.9, AndroidWorld 84.5, CoWorkBench 73.9, JobBench 55.7 (Qwen3.8-27B, Qwen3.7-Plus, DeepSeek-V4-Flash-0731, Claude Opus 4.6(Max) 등과 비교 대상 포함, 상대 수치는 미공개) 4. 가격: 입력 $0.16/100만 토큰, 출력 $0.47/100만 토큰 (알리바바 플래그십 대비 약 12분의 1) 5. 학습 비용: Qwen3.7-Plus 대비 약 9분의 1 수준 6. 라이선스: Apache 2.0이 아닌 Qwen Community License 1.0 (상업 이용 허용, 일정 매출·MAU 초과 시 별도 계약 필요) 7. 로컬 구동: Hugging Face 가중치 공개, GGUF 양자화 시 약 75GB RAM으로 구동 가능 8. NVIDIA GB300 NVL72 시스템에서 에이전틱 코딩 실험 사례 공개
핵심 인사이트
- 토큰당 활성 파라미터가 6B에 불과해 180B급 디스크 용량 대비 연산 비용을 크게 낮췄다
- 하이브리드 어텐션, Gated Residual, N-gram Embedding, Muon 옵티마이저 등 4가지 요소가 Qwen4 아키텍처의 방향성을 시사한다
- 벤치마크에서 Qwen3.8-27B, Qwen3.7-Plus, DeepSeek-V4-Flash-0731, Claude Opus 4.6(Max)과 비교 대상에 포함됐으나 구체적 상대 수치는 공개되지 않았다
- 입력·출력 가격이 알리바바 자체 플래그십 대비 약 12분의 1 수준으로 책정돼 비용 효율을 전면에 내세웠다
- 학습 비용도 Qwen3.7-Plus 대비 약 9분의 1로 줄었다고 Qwen 팀이 밝혔다
- Apache 2.0이 아닌 별도의 Qwen Community License 1.0이 적용돼, 대규모 MaaS·AI 업무보조 사업자는 별도 상업 계약이 필요할 수 있다
- GGUF 양자화 버전은 약 75GB RAM으로 로컬 구동이 가능하다고 보도됐다
- NVIDIA가 GB300 NVL72 시스템에서의 에이전틱 코딩 실험을 기술 블로그로 다루며 생태계 편입 가능성을 보여줬다
이 리뷰가 유용했나요?
공유하기
관련 AI 리뷰
DeepSeek, 주말 API 피크 요금 전격 폐지... 도입 8일 만
DeepSeek가 8월 23일부터 API 주말 사용량 전체를 저가 오프피크 요금으로 통일했다. 8월 16일 피크제 도입 8일 만의 조정으로, 개발자 비용 부담이 줄었다.
DeepSeek-V4-Flash-Vision-Exp 공개: 자체 벤치마크로 Opus 4.8과 경합
DeepSeek가 2026년 8월 21일 실험적 비전 모델 DeepSeek-V4-Flash-Vision-Exp를 공개했다. 자체 벤치마크에서 Anthropic Opus 4.8과 경합하는 결과를 발표했으나 제3자 검증은 없다.
Z.ai GLM-5.3 출시: 743B 베이스 유지, 코딩 벤치마크 대폭 향상
Z.ai가 GLM-5.3을 발표했다. GLM-5.2와 동일한 743B 베이스 모델을 재사용하고 대규모 포스트 트레이닝만으로 코딩·사이버보안 벤치마크를 크게 끌어올렸다. 가중치는 약 2주 후 공개 예정이다.
xAI Grok 4.6 출시: 에이전틱 코딩 강화, 자기검증으로 신뢰성 개선
xAI가 8월 12일 Grok 4.6을 출시했다. 장시간 에이전틱 코딩과 자기검증에 초점을 맞춰 DeepSWE·APEX-Agents 점수가 크게 올랐다. 컨텍스트는 경쟁 모델보다 좁다.
