Qwen3.8: 새로운 기능, 실행 방법 및 대안 (2026)

Alibaba의 Qwen 팀은 훨씬 더 거대한 Qwen3.8-2.4T-A95B가 출시된 지 이틀 뒤인 2026년 8월 14일에 Qwen3.8-27B를 출시했습니다. 이번 출시 노트는 단 한 문장으로 구성되어 있지만, 두 번 읽어볼 만한 가치가 있습니다.
"Qwen3.8은 최초로 Qwen-Max급 모델을 오픈 릴리스로 제공합니다."
이는 크기가 아닌 등급(tier)에 대한 주장입니다. 이제 오픈 가중치 모델이 기존의 호스팅형 플래그십 모델이 차지하던 자리에 위치하게 되었음을 의미합니다.
이것이 여러분의 워크로드에도 적용될지는 별개의 문제이며, 공개된 자료는 이에 대해 부분적인 답만 제공할 뿐입니다. 이 글의 나머지 부분에서는 어떤 부분이 그러한지 자세히 살펴보겠습니다.
이 글에서는 출시된 모델의 스펙과 두 공식 문서 간에 서로 일치하지 않는 부분을 다룹니다. 그런 다음 벤치마크 표가 실제로 무엇을 측정하는지 살펴봅니다. 마지막으로, 분석 작업을 외부로 유출하지 않고 자체 기기에서 처리하고자 하는 분들을 위해 모델을 로컬에서 실행하는 방법을 설명합니다.
Qwen3.8의 실제 정체
공식 README에 따르면, 이 모델 제품군은 "Qwen3.5의 아키텍처 기반" 위에 구축되었으며 "코딩, 전문 업무, 연구 및 장기 에이전트 작업 전반"에서 성능 향상을 제공한다고 설명합니다.
다단계 작업을 수행하는 모든 이들에게 중요한 문장은 바로 다음 문장입니다. Qwen3.8은 "복잡하고 다단계로 이루어진 작업을 더 높은 신뢰성으로 끝까지 완수하도록 설계되었습니다."
27B 모델은 대부분의 사람들이 로컬에서 실행할 모델입니다. 해당 모델 카드에 명시된 구체적인 사양은 다음과 같습니다. 27B 매개변수(parameters), 64개 레이어, 숨겨진 차원(hidden dimension) 5120, 그리고 Gated DeltaNet과 Gated Attention 블록의 하이브리드 레이아웃입니다.
컨텍스트 길이는 기본적으로 262,144 토큰이며, 최대 1,000,000 토큰까지 확장 가능합니다. 모델 카드에 기록된 라이선스는 apache-2.0입니다.
두 가지 출시 항목을 명확히 구분할 필요가 있습니다. 2.4T-A95B 혼합 전문가(MoE) 모델은 2026-08-12에 출시되었고, 27B 밀집(dense) 모델은 이어서 2026-08-14에 출시되었습니다. 자체 호스팅이 현실적으로 가능한 것은 두 번째 모델뿐입니다.
| 항목 | Qwen3.8-27B |
|---|---|
| 출시일 | 2026-08-14 |
| 매개변수 | 27B dense |
| 레이어 수 | 64 |
| 컨텍스트 | 기본 262,144, 최대 1,000,000까지 확장 가능 |
| 라이선스 | apache-2.0 |
| 입력 지원 | 텍스트, 이미지, 비디오 |
두 공식 문서 간에 서로 일치하지 않는 부분
이 부분은 거의 아무도 언급하지 않는 내용이지만, 여러분이 자신 있게 주장할 수 있는 범위를 바꾸어 놓습니다.
GitHub README에서는 멀티모달 아키텍처를 Qwen3.8의 기반이 되는 세대인 Qwen3.5의 특징으로 설명하고 있습니다. 이 페이지만 읽는다면 27B 모델이 텍스트 전용 모델이라고 결론을 내리게 될 것입니다.
하지만 모델 카드는 다르게 설명하고 있으며, 매우 구체적입니다. Qwen3.8-27B는 "유연한 사고 제어 기능을 갖추고 이미지와 비디오를 이해하는 네이티브 비전-언어 모델"이라고 명시되어 있습니다.
두 공식 소스가 충돌할 때는 더 구체적인 소스가 우선합니다. 모델 카드는 바로 이 체크포인트를 설명하고 있으므로, 멀티모달 기능은 실제로 존재합니다. 저장소(repo)를 대충 훑어보면 정반대로 이해하기 쉬우므로, 이러한 불일치가 존재한다는 점을 알아두는 것이 좋습니다.
벤치마크 표가 측정하는 것과 누락된 것
모델 카드에는 Qwen3.6-27B, Qwen3.7-Plus, Muse Glimmer-30B, Opus4.6 Max와의 비교 결과가 공개되어 있습니다. 에이전트 관련 지표 중 일부는 비약적인 상승을 보여줍니다.
| 벤치마크 | Qwen3.8-27B | Qwen3.6-27B |
|---|---|---|
| OSWorld-Verified (컴퓨터 사용) | 84.3 | 63.9 |
| WebArena-Verified (브라우저 사용) | 64.8 | 48.8 |
| AndroidWorld (모바일 사용) | 81.9 | 70.3 |
| SWE-bench Pro (코딩) | 61.7 | — |
| MathVision (코드 인터프리터 포함) | 94.6 | 90.3 |
| Vision2Web (시각적 웹 개발) | 62.9 | 45.0 |
이제 솔직하게 해석해 보겠습니다. 이 표가 다루는 영역은 컴퓨터 사용, 브라우저 사용, 모바일 사용, 코딩, 시각적 수학, 그리고 웹 개발입니다.
스프레드시트를 읽거나, 두 개의 내보낸 데이터를 대조하거나, 표 형식의 데이터로 보고서를 작성하는 작업에 대한 벤치마크는 여기에 없습니다. OSWorld 점수가 높다는 것은 모델이 데스크톱을 잘 제어할 수 있음을 의미할 뿐, 매출 대조 작업을 정확하게 수행할 수 있다는 뜻은 아닙니다.
오픈 소스 출시 소식을 추적하는 독자분들을 위해 짚고 넘어갈 만한 세부 사항이 하나 있습니다. Muse Glimmer-30B가 이 표에 비교 대상으로 등장하는데, 불과 나흘 전에 발표된 자체 출시 표에서는 Qwen3.6-27B와 비교되었습니다. Muse Glimmer에 관한 저희 글에서 언급했듯이, 해당 모델은 출시 당시 이미 비교 대상군보다 한 세대 뒤처져 있었습니다. 이 표는 그 이야기의 나머지 절반을 보여줍니다.
실행 방법
README의 뉴스 항목에 따르면, 가중치는 Hugging Face Hub와 ModelScope에 업로드되어 있습니다. 단일 기기에서 실행하기에는 27B 밀집(dense) 형태가 가장 실용적인 선택입니다.
메모리 계획은 컨텍스트 한계치보다는 매개변수 수를 기준으로 세우는 것이 좋습니다. 262,144 토큰 창을 사용할 수 있지만, 이를 가득 채우려면 대부분의 로컬 환경에서는 감당하기 힘든 수준의 메모리가 소모됩니다.
처음에는 짧은 컨텍스트와 실제 파일로 시작해 보세요. 내보낸 파일 하나를 로드하고 이미 답을 알고 있는 질문을 하나 던진 뒤, 더 긴 작업을 신뢰하기 전에 먼저 그 답변을 확인해 보십시오.
표 형식의 데이터를 다룰 때 이러한 검증 단계는 필수적입니다. 모델이 스프레드시트를 유창하게 설명하면서도 합계가 있는 열을 잘못 읽을 수 있습니다. 유창하게 틀린 답변은 뻔히 보이는 오답보다 잡아내기가 훨씬 더 어렵습니다.
100만 토큰 창이 필요하다면, 이를 별도의 하드웨어 예산이 필요한 독립적인 과제로 취급하십시오. 두 구성은 실제 작동 방식이 매우 다르며, 한쪽을 벤치마킹하는 것이 다른 쪽의 성능을 거의 대변해 주지 못합니다.
기본 추론 노력(reasoning effort) 설정부터 변경하기
첫인상을 좌우할 설정이 여기 있으며, 이는 모델 카드의 자체 챗 템플릿에서도 확인할 수 있습니다.
템플릿은 reasoning_effort를 기본적으로 xhigh로 설정하며, 그 외에 medium과 low 값을 허용합니다. 생각(thinking) 기능 자체를 끌 수도 있습니다.
기본값이 xhigh로 설정되어 있으면 모델이 굳이 깊이 생각할 필요가 없는 질문에도 오랫동안 고민하게 됩니다. 작은 CSV 파일에서 한 줄짜리 데이터를 조회하는 작업의 경우, 모델이 신중하다기보다는 느리다고 느껴질 것입니다.
따라서 가장 먼저 조정해야 할 것은 프롬프트가 아닙니다. 일상적인 질문에 대해서는 노력을 medium이나 low로 낮추고, 출시 노트에서 실제로 강조하는 다단계 작업에만 xhigh를 아껴두십시오.
데이터 워크플로우에서의 활용 방안
직접 호스팅하는 오픈 가중치 모델은 데이터가 기기를 절대 벗어나지 않는다는 한 가지 확실한 문제를 해결해 줍니다. 규제를 받거나 민감한 파일의 경우 이것이 핵심 논거이며, 호스팅 서비스가 제공하는 그 어떤 편리함도 이를 대체할 수 없습니다.
이 선택의 다른 모든 요소는 트레이드오프(절충)입니다. 단 하나의 보장을 얻는 대가로 하드웨어 관리, 업데이트, 양자화 결정 등의 부담을 떠안게 됩니다.
하지만 이 모델이 해결해 주지 못하는 것은 모델 주변의 모든 작업입니다. 열 프로파일링, 두 개의 내보낸 데이터 병합, 이름이 바뀐 필드 감지, 차트 렌더링, 문서 작성 등은 모두 별개의 작업입니다.
이러한 공백을 메우기 위해 프로토콜과 도구 레이어가 존재합니다. MCP란 무엇인가에 대한 설명글에서는 모델과 도구를 연결하는 표준을 다룹니다. 데이터 커넥터 페이지에서는 파일 우선 파이프라인이 입력값으로 무엇을 요구하는지 보여줍니다.
대안
로컬 및 오픈 소스 환경이 필수 조건이라면, 현재 동일한 크기 등급에서 고려할 수 있는 두 가지 후보는 Qwen3.8-27B와 Muse Glimmer-30B입니다. 두 모델 모두 가중치를 공개하고 있으며 단일 기기에서 실행할 수 있습니다.
모델 엔드포인트가 아니라 파일로부터 완성된 결과물을 얻는 것이 목적이라면, 도구의 형태가 달라져야 합니다. Powerdrill Bloom은 스프레드시트를 가져와 열을 프로파일링하고 차트, 보고서 또는 프레젠테이션 덱을 결과물로 돌려줍니다.
Qwen 측과는 가격 비교를 할 수 없습니다. 이 모델에 대한 공식 Qwen 가격 페이지를 찾을 수 없었기 때문에 본 기사에서는 어떠한 수치도 인용하지 않았습니다.
실제 해결해야 할 과제가 보고서로 변환해야 하는 파일이라면, 해당 파일로 Powerdrill Bloom을 직접 사용해 보세요. 또한 구독 내보내기 데이터를 MRR 및 ARR 보고서로 변환하는 방법에 대한 가이드와 CSV AI 비서 페이지도 참고해 보시기 바랍니다.
결론
Qwen3.8-27B는 기본 262,144 토큰 컨텍스트, apache-2.0 라이선스 가중치, 그리고 문서화된 이미지 및 비디오 입력을 지원하는 27B 밀집(dense) 모델입니다. Qwen3.6-27B 대비 에이전트 성능의 도약은 상당한 수준입니다.
다만 두 가지 주의할 점이 있습니다. 저장소와 모델 카드가 멀티모달 지원 여부에 대해 서로 다르게 설명하고 있으며, 공개된 벤치마크는 표 형식의 데이터 분석보다는 데스크톱, 브라우저, 코딩, 시각적 작업에 치중되어 있습니다.
모델을 평가하기 전에 reasoning_effort를 먼저 설정하십시오. 기본값은 xhigh이며, 이 기본값은 대부분의 질문이 요구하는 것보다 더 많은 생각을 하게 만듭니다.
자주 묻는 질문
Qwen3.8은 언제 출시되었나요?
README의 뉴스 항목에 따르면 Qwen3.8-27B는 2026-08-14에, Qwen3.8-2.4T-A95B는 2026-08-12에 각각 Hugging Face Hub와 ModelScope에 등록되었습니다.
Qwen3.8-27B는 멀티모달을 지원하나요?
네, 모델 카드에 따르면 이미지와 비디오를 이해하는 네이티브 비전-언어 모델로 설명되어 있습니다. 단, GitHub README에서는 멀티모달 아키텍처를 Qwen3.5의 특징으로 설명하고 있으니 주의하시기 바랍니다.
어떤 컨텍스트 길이를 지원하나요?
모델 카드에는 기본 262,144 토큰, 최대 1,000,000 토큰까지 확장 가능하다고 명시되어 있습니다. 최대치에 가까운 토큰을 처리하려면 일반적인 로컬 환경을 훨씬 뛰어넘는 메모리가 필요합니다.
간단한 질문인데도 왜 느리게 느껴지나요?
챗 템플릿이 reasoning_effort를 기본적으로 xhigh로 설정하기 때문입니다. 일상적인 조회 작업에는 이를 medium이나 low로 낮추고, 진정한 다단계 작업에만 xhigh를 사용하십시오.
벤치마크 결과에 스프레드시트 작업에 대한 내용도 있나요?
아니요. 공개된 표는 컴퓨터 사용, 브라우저 사용, 모바일 사용, 코딩, 시각적 수학, 웹 개발만을 다루고 있으며, 표 형식 데이터 분석이나 보고서 생성에 대한 벤치마크는 포함되어 있지 않습니다.