Qwen3.8: Có gì mới, Cách chạy và Các giải pháp thay thế (2026)

Đội ngũ Qwen của Alibaba đã phát hành Qwen3.8-27B vào ngày 14 tháng 8 năm 2026, hai ngày sau khi phiên bản Qwen3.8-2.4T-A95B lớn hơn nhiều ra mắt. Bản ghi chú phát hành chỉ dài đúng một câu và rất đáng để đọc lại lần thứ hai.
"Lần đầu tiên, Qwen3.8 mang một mô hình thuộc phân khúc Qwen-Max đến với phiên bản phát hành mở."
Đó là một tuyên bố về phân khúc đẳng cấp, chứ không phải về kích thước. Nó khẳng định rằng các trọng số mở giờ đây đã đạt đến vị trí vốn từng thuộc về mô hình flagship được lưu trữ (hosted flagship).
Liệu điều đó có đúng với khối lượng công việc của bạn hay không lại là một câu hỏi khác, và những bằng chứng được công bố chỉ trả lời được một phần. Phần còn lại của bài viết này sẽ phân tích cụ thể những phần đó.
Bài viết này sẽ đề cập đến những gì đã được phát hành và những điểm bất đồng giữa hai tài liệu chính thức. Sau đó, chúng ta sẽ xem xét bảng điểm chuẩn (benchmark) thực sự đo lường những gì. Cuối cùng, bài viết sẽ hướng dẫn cách chạy mô hình cục bộ, nếu bạn muốn quá trình phân tích diễn ra hoàn toàn trên máy của mình.
Qwen3.8 thực chất là gì
Tài liệu README chính thức mô tả dòng mô hình này được xây dựng "trên nền tảng kiến trúc của Qwen3.5," mang lại những cải tiến "trong lập trình, công việc chuyên môn, nghiên cứu và các tác vụ agent đa bước dài hạn (long-horizon agentic tasks)."
Câu văn quan trọng đối với bất kỳ ai thực hiện các công việc đa bước chính là câu tiếp theo. Qwen3.8 "được thiết kế để thực hiện các tác vụ phức tạp, đa bước cho đến khi hoàn thành với độ tin cậy cao hơn."
Mô hình 27B là phiên bản mà hầu hết mọi người sẽ chạy cục bộ. Model card của nó cung cấp các thông số cụ thể: 27B tham số, 64 lớp, chiều ẩn (hidden dimension) 5120, và cấu trúc lai giữa các khối Gated DeltaNet và Gated Attention.
Chiều dài ngữ cảnh (context length) là 262,144 token gốc và có thể mở rộng lên tới 1,000,000. Giấy phép được ghi nhận trên model card là apache-2.0.
Cần phân biệt rõ hai phiên bản phát hành này. Mô hình mixture-of-experts 2.4T-A95B ra mắt vào ngày 12-08-2026, và mô hình dense 27B theo sau vào ngày 14-08-2026. Chỉ có phiên bản thứ hai là khả thi để tự vận hành (self-host).
| Thông tin | Qwen3.8-27B |
|---|---|
| Ngày phát hành | 2026-08-14 |
| Tham số | 27B dense |
| Số lớp | 64 |
| Ngữ cảnh | 262,144 gốc, có thể mở rộng lên 1,000,000 |
| Giấy phép | apache-2.0 |
| Đầu vào | Văn bản, hình ảnh, video |
Điểm bất đồng giữa hai tài liệu chính thức
Đây là phần hầu như không ai báo cáo, và nó thay đổi những gì bạn có thể khẳng định một cách chắc chắn.
Tài liệu README trên GitHub quy kiến trúc đa phương thức (multimodal) cho Qwen3.5, thế hệ mà Qwen3.8 được xây dựng dựa trên. Nếu chỉ đọc trang đó, bạn sẽ kết luận rằng mô hình 27B chỉ hỗ trợ văn bản.
Nhưng model card lại nói khác, và rất cụ thể. Qwen3.8-27B là "một mô hình ngôn ngữ-thị giác gốc (native vision-language model) có khả năng hiểu hình ảnh và video, với khả năng kiểm soát tư duy linh hoạt."
Khi hai nguồn chính thức mâu thuẫn nhau, nguồn nào cụ thể hơn sẽ thắng. Model card đang mô tả chính xác checkpoint này, vì vậy khả năng đa phương thức là có thật. Việc biết đến sự khác biệt này là rất quan trọng, bởi vì nếu chỉ lướt nhanh qua kho lưu trữ (repo), bạn sẽ thấy điều ngược lại.
Bảng điểm chuẩn đo lường những gì, và bỏ qua những gì
Model card công bố một so sánh với Qwen3.6-27B, Qwen3.7-Plus, Muse Glimmer-30B, và Opus4.6 Max. Một số điểm số về khả năng agentic có những bước nhảy vọt lớn.
| Điểm chuẩn (Benchmark) | Qwen3.8-27B | Qwen3.6-27B |
|---|---|---|
| OSWorld-Verified (sử dụng máy tính) | 84.3 | 63.9 |
| WebArena-Verified (sử dụng trình duyệt) | 64.8 | 48.8 |
| AndroidWorld (sử dụng di động) | 81.9 | 70.3 |
| SWE-bench Pro (lập trình) | 61.7 | — |
| MathVision (với trình thông dịch mã) | 94.6 | 90.3 |
| Vision2Web (phát triển web trực quan) | 62.9 | 45.0 |
Bây giờ là một cách nhìn nhận thực tế. Sử dụng máy tính, sử dụng trình duyệt, sử dụng di động, lập trình, toán học trực quan và phát triển web là những gì bảng này bao gồm.
Không hề có điểm chuẩn nào ở đây cho việc đọc bảng tính, đối chiếu hai tệp xuất dữ liệu, hoặc tạo báo cáo từ dữ liệu dạng bảng. Điểm số OSWorld mạnh mẽ cho thấy mô hình có thể điều khiển máy tính để bàn. Nhưng chúng không đảm bảo rằng nó sẽ thực hiện đúng việc đối chiếu doanh thu của bạn.
Một chi tiết đáng lưu ý cho những độc giả theo dõi các bản phát hành mở. Muse Glimmer-30B xuất hiện trong bảng này như một điểm so sánh, và bảng ra mắt của chính nó bốn ngày trước đó đã so sánh với Qwen3.6-27B. Bài viết của chúng tôi về Muse Glimmer đã lưu ý rằng nhóm đối thủ cùng phân khúc của nó đã đi sau một thế hệ ngay khi ra mắt. Bảng này chính là nửa còn lại của câu chuyện đó.
Cách chạy mô hình
Các trọng số (weights) đã có trên Hugging Face Hub và ModelScope, theo tin tức trong README. Cấu hình dense 27B là lựa chọn thực tế nhất cho một máy đơn lẻ.
Hãy lập kế hoạch bộ nhớ dựa trên số lượng tham số thay vì mức trần ngữ cảnh. Cửa sổ 262,144 token luôn có sẵn, nhưng việc lấp đầy nó sẽ tiêu tốn lượng bộ nhớ mà hầu hết các cấu hình cục bộ không có sẵn.
Hãy bắt đầu với một ngữ cảnh ngắn và một tệp thực tế. Tải một tệp xuất dữ liệu lên, hỏi một câu hỏi mà bạn đã biết câu trả lời, và kiểm tra kết quả trước khi tin tưởng vào bất kỳ điều gì dài hơn.
Bước xác minh đó là bắt buộc đối với công việc xử lý dữ liệu dạng bảng. Một mô hình có thể mô tả một bảng tính một cách trôi chảy nhưng vẫn đọc sai cột chứa tổng số. Những câu trả lời sai một cách trôi chảy thường khó phát hiện hơn những lỗi sai rõ ràng.
Nếu bạn cần cửa sổ một triệu token, hãy coi đó là một bài toán riêng biệt với ngân sách phần cứng riêng. Hai cấu hình này hoạt động rất khác nhau trong thực tế, và việc đánh giá hiệu năng của cấu hình này không nói lên được nhiều điều về cấu hình kia.
Thay đổi mức độ nỗ lực suy luận mặc định trước tiên
Đây là thiết lập sẽ định hình ấn tượng đầu tiên của bạn, và nó có thể nhìn thấy ngay trong chat template của chính model card.
Template này phân giải reasoning_effort thành mặc định là xhigh, với medium và low là các giá trị được chấp nhận khác. Tính năng suy nghĩ (thinking) cũng có thể được tắt đi.
Mức mặc định xhigh có nghĩa là mô hình sẽ suy nghĩ rất lâu về những câu hỏi không cần thiết. Đối với một truy vấn một dòng trên một tệp CSV nhỏ, điều đó sẽ khiến mô hình có vẻ chậm chạp hơn là cẩn thận.
Vì vậy, điều đầu tiên cần tinh chỉnh không phải là prompt. Hãy giảm mức độ nỗ lực xuống medium hoặc low cho các câu hỏi thông thường, và chỉ dành riêng xhigh cho các tác vụ đa bước phức tạp mà bản ghi chú phát hành thực sự hướng tới.
Vị trí của mô hình này trong quy trình xử lý dữ liệu
Một mô hình trọng số mở (open-weight) mà bạn tự vận hành sẽ giải quyết được một vấn đề cụ thể: dữ liệu không bao giờ rời khỏi máy của bạn. Đối với các tệp dữ liệu nhạy cảm hoặc bị kiểm soát nghiêm ngặt, đó là lý do cốt lõi, và không một sự tiện lợi nào từ dịch vụ lưu trữ đám mây có thể thay thế được điều đó.
Mọi khía cạnh khác của lựa chọn này đều là sự đánh đổi. Bạn phải tự lo phần cứng, cập nhật và các quyết định lượng tử hóa (quantisation) để đổi lấy một sự đảm bảo duy nhất đó.
Những gì nó không giải quyết được là mọi thứ xung quanh mô hình. Việc phân tích lược đồ cột (column profiling), liên kết hai tệp xuất dữ liệu, phát hiện một trường bị đổi tên, vẽ biểu đồ và tạo tài liệu đều là những công việc riêng biệt.
Khoảng cách đó là lý do tại sao các lớp giao thức và công cụ tồn tại. Bài giải thích của chúng tôi về MCP là gì đề cập đến tiêu chuẩn kết nối các mô hình với các công cụ. Trang data connectors cho thấy những gì một đường ống dẫn dữ liệu ưu tiên tệp (file-first pipeline) mong đợi dưới dạng đầu vào.
Các giải pháp thay thế
Nếu yêu cầu là cục bộ và mở, Qwen3.8-27B và Muse Glimmer-30B là hai ứng cử viên hiện tại trong cùng phân khúc kích thước. Cả hai đều công bố trọng số và đều chạy được trên một máy đơn lẻ.
Nếu yêu cầu là một sản phẩm hoàn chỉnh từ một tệp dữ liệu thay vì một endpoint mô hình, thì hình thái của công cụ sẽ khác. Powerdrill Bloom tiếp nhận bảng tính, phân tích các cột và trả về biểu đồ, báo cáo hoặc slide trình bày (deck).
Không có sự so sánh giá cả nào được thực hiện về phía Qwen. Không thể truy cập trang giá chính thức nào của Qwen cho mô hình này, vì vậy bài viết này không trích dẫn số liệu nào.
Nếu tác vụ thực tế của bạn là một tệp cần chuyển đổi thành báo cáo, hãy thử trực tiếp Powerdrill Bloom. Xem thêm hướng dẫn của chúng tôi về cách chuyển đổi tệp xuất đăng ký thành báo cáo MRR và ARR và trang CSV AI assistant.
Kết luận
Qwen3.8-27B là một mô hình dense 27B với ngữ cảnh gốc 262,144 token, trọng số apache-2.0, và khả năng đầu vào hình ảnh cũng như video đã được ghi nhận. Những bước nhảy vọt về khả năng agentic so với Qwen3.6-27B là rất đáng kể.
Có hai lưu ý đi kèm với nó. Kho lưu trữ (repo) và model card không thống nhất về tính đa phương thức, và các điểm chuẩn được công bố chỉ bao gồm các tác vụ trên máy tính để bàn, trình duyệt, lập trình và thị giác chứ không phải công việc xử lý dữ liệu dạng bảng.
Hãy thiết lập reasoning_effort trước khi bạn đánh giá nó. Mức mặc định là xhigh, và mức mặc định này đang thực hiện nhiều suy nghĩ hơn mức cần thiết của hầu hết các câu hỏi.
Câu hỏi thường gặp
Qwen3.8 được phát hành khi nào?
Các mục tin tức trong README ghi nhận Qwen3.8-27B vào ngày 2026-08-14 và Qwen3.8-2.4T-A95B vào ngày 2026-08-12, cả hai đều có trên Hugging Face Hub và ModelScope.
Qwen3.8-27B có phải là mô hình đa phương thức không?
Có, theo model card của nó, mô tả đây là một mô hình ngôn ngữ-thị giác gốc có khả năng hiểu hình ảnh và video. Lưu ý rằng tài liệu README trên GitHub quy kiến trúc đa phương thức cho Qwen3.5.
Nó hỗ trợ chiều dài ngữ cảnh bao nhiêu?
Model card ghi nhận 262,144 token gốc, có thể mở rộng lên tới 1,000,000. Việc chạy gần với con số giới hạn trên đòi hỏi lượng bộ nhớ vượt xa cấu hình cục bộ thông thường.
Tại sao nó có cảm giác chậm chạp đối với các câu hỏi đơn giản?
Chat template mặc định đặt reasoning_effort thành xhigh. Hãy hạ nó xuống medium hoặc low cho các truy vấn thông thường và giữ xhigh cho các tác vụ thực sự đa bước.
Các điểm chuẩn có nói lên điều gì về công việc xử lý bảng tính không?
Không. Bảng công bố bao gồm việc sử dụng máy tính, sử dụng trình duyệt, sử dụng di động, lập trình, toán học trực quan và phát triển web, không có điểm chuẩn nào cho việc phân tích dữ liệu dạng bảng hoặc tạo báo cáo.