Qwen3.8:新功能、如何运行及替代方案 (2026)

阿里巴巴的 Qwen 团队于 2026 年 8 月 14 日发布了 Qwen3.8-27B,这距离体量大得多的 Qwen3.8-2.4T-A95B 发布仅过去了两天。其发布说明只有一句话,但值得读上两遍。
“Qwen3.8 首次将 Qwen-Max 级别的模型开源发布。”
这一声明针对的是模型级别,而非模型大小。它意味着现在的开源权重已经达到了此前托管旗舰版模型的水平。
这是否适用于您的工作负载则是另一个问题,而目前公布的证据只能部分回答这个问题。本文接下来的内容将探讨具体涉及哪些部分。
本文将介绍此次发布的内容以及两份官方文档存在分歧的地方。接着,我们将分析基准测试表实际衡量了什么。最后,如果您希望在自己的机器上进行分析,本文还将介绍如何在本地运行该模型。
Qwen3.8 究竟是什么
官方 README 将该系列描述为构建在“Qwen3.5 的架构基础之上”,并在“编程、专业工作、研究和长程智能体(agentic)任务中”带来了提升。
对于任何需要执行多步骤工作的人来说,下一句话至关重要。Qwen3.8“旨在以更高的可靠性,将复杂的、多步骤的任务执行到底”。
27B 模型是大多数人会在本地运行的版本。其 model card 给出了具体的数据:27B 参数、64 层、隐藏维度 5120,以及 Gated DeltaNet 和 Gated Attention 块的混合布局。
上下文长度原生支持 262,144 个 token,并可扩展至 1,000,000。model card 上记录的许可证为 apache-2.0。
这两次发布值得理清。2.4T-A95B 混合专家(MoE)模型于 2026-08-12 推出,随后 27B 稠密(dense)模型于 2026-08-14 发布。只有后者对于个人自行托管来说是切合实际的。
| 指标/信息 | Qwen3.8-27B |
|---|---|
| 发布时间 | 2026-08-14 |
| 参数量 | 27B 稠密 |
| 层数 | 64 |
| 上下文 | 原生 262,144,可扩展至 1,000,000 |
| 许可证 | apache-2.0 |
| 输入 | 文本、图像、视频 |
两份官方文档存在分歧的地方
这是几乎没有人报道的部分,但它会改变您能放心做出的断言。
GitHub README 将多模态架构归功于 Qwen3.5(即 Qwen3.8 所基于的那一代)。如果只看那个页面,您会得出 27B 模型仅支持文本的结论。
但 model card 却给出了不同的说法,而且非常具体。Qwen3.8-27B 是“一个原生的视觉-语言模型,能够理解图像和视频,并具有灵活的思考控制能力”。
当两个官方来源发生冲突时,更具体的那个胜出。model card 描述的正是这个具体的 checkpoint,因此多模态能力是真实存在的。了解这一差异是有价值的,因为粗略浏览一下仓库可能会让您得出相反的结论。
基准测试表衡量了什么,又遗漏了什么
model card 公布了与 Qwen3.6-27B、Qwen3.7-Plus、Muse Glimmer-30B 和 Opus4.6 Max 的对比。其中一些智能体(agentic)指标出现了大幅跃升。
| 基准测试 | Qwen3.8-27B | Qwen3.6-27B |
|---|---|---|
| OSWorld-Verified (电脑操作) | 84.3 | 63.9 |
| WebArena-Verified (浏览器操作) | 64.8 | 48.8 |
| AndroidWorld (手机操作) | 81.9 | 70.3 |
| SWE-bench Pro (编程) | 61.7 | — |
| MathVision (含代码解释器) | 94.6 | 90.3 |
| Vision2Web (视觉网页开发) | 62.9 | 45.0 |
坦白地说,这张表格涵盖的是电脑操作、浏览器操作、手机操作、编程、视觉数学和网页开发。
这里没有任何关于读取电子表格、对账两个导出文件或根据表格数据生成报告的基准测试。 强劲的 OSWorld 数据只能说明该模型可以操作桌面,但并不能保证它能正确完成您的收入对账。
对于关注开源发布动态的读者,有一个细节值得注意。Muse Glimmer-30B 作为对比点出现在此表中,而它自己在四天前发布时的对比表则是与 Qwen3.6-27B 进行比较。我们在关于 Muse Glimmer 的文章中曾指出,其同类对比组在发布时就已经落后了一代。而这张表则印证了故事的另一半。
如何运行它
根据 README 的新闻条目,权重已托管在 Hugging Face Hub 和 ModelScope 上。对于单台机器来说,27B 稠密结构是切实可行的选择。
请根据参数量而非上下文上限来规划您的内存/显存。虽然可以使用 262,144 token 的窗口,但填满它所需的内存/显存是大多数本地配置所无法承受的。
建议先从短上下文和真实文件开始。加载一个导出文件,问一个您已经知道答案的问题,在信任更长的内容之前先核对一下答案。
对于表格处理工作,这一验证步骤是必不可少的。模型可以流畅地描述一个电子表格,但仍可能看错哪一列是总计。流畅的错误答案比显而易见的错误更难被发现。
如果您需要百万级 token 的窗口,请将其视为一项需要独立硬件预算的任务。这两种配置在实际运行中的表现大相径庭,对其中一种进行基准测试并不能代表另一种。
首先更改默认的推理强度(reasoning effort)
以下设置将决定您的第一印象,它在 model card 自身的对话模板中清晰可见。
模板默认将 reasoning_effort 解析为 xhigh,其他可接受的值包括 medium 和 low。也可以关闭思考功能。
默认设为 xhigh 意味着模型会对不需要深思熟虑的问题进行冗长的思考。对于在小型 CSV 中进行单行查找这样的任务,这会让人觉得模型很慢,而不是严谨。
因此,首先要调整的不是提示词。对于常规问题,请将推理强度降至 medium 或 low,并将 xhigh 留给发布说明中真正针对的多步骤任务。
这在数据工作流中的定位
自行托管的开源权重模型解决了一个特定的问题,即数据永远不会离开您的机器。对于受监管或敏感的文件,这就是核心论点,任何托管服务的便利性都无法替代这一点。
这一选择的其他所有方面都是一种权衡。您需要承担硬件、更新和量化决策的成本,以换取这唯一的保证。
它无法解决的是模型之外的一切工作。列属性分析(column profiling)、合并两个导出文件、捕获重命名的字段、渲染图表以及生成文档,这些都是独立的工作。
这种差距正是协议层和工具层存在的原因。我们关于 什么是 MCP 的解析文章介绍了连接模型与工具的标准。数据连接器页面展示了以文件为核心的流水线所期望的输入。
替代方案
如果需求是本地且开源,Qwen3.8-27B 和 Muse Glimmer-30B 是目前同等尺寸级别中的两个候选模型。两者都公布了权重,且都能在单台机器上运行。
If the requirement is a finished artifact from a file rather than a model endpoint, the shape of the tool is different. Powerdrill Bloom takes the spreadsheet, profiles the columns, and returns the chart, the report, or the deck.
在 Qwen 方面无法进行价格对比。由于无法访问该模型的官方 Qwen 价格页面,因此本文未引用任何数据。
如果您的实际任务是将文件转化为报告,可以尝试直接使用 Powerdrill Bloom 处理。另请参阅我们的指南:如何将订阅导出数据转化为 MRR 和 ARR 报告,以及 CSV AI 助手页面。
结论
Qwen3.8-27B 是一个 27B 稠密模型,具有 262,144 token 的原生上下文,采用 apache-2.0 权重,并记录支持图像和视频输入。相比 Qwen3.6-27B,其在智能体(agentic)能力上的提升是巨大的。
伴随它而来的是两个注意事项:仓库和 model card 在多模态支持上存在分歧;此外,已公布的基准测试涵盖的是桌面、浏览器、编程和视觉任务,而非表格处理工作。
在对它做出评价之前,请先设置 reasoning_effort。默认值为 xhigh,而这一默认设置进行的思考超出了大多数问题所需的范畴。
常见问题解答
Qwen3.8 是何时发布的?
README 的新闻条目记录了 Qwen3.8-27B 于 2026-08-14 发布,Qwen3.8-2.4T-A95B 于 2026-08-12 发布,两者均已上架 Hugging Face Hub 和 ModelScope。
Qwen3.8-27B 是多模态的吗?
是的,根据其 model card 的描述,它是一个原生的视觉-语言模型,能够理解图像和视频。需要注意的是,GitHub README 将多模态架构归功于 Qwen3.5。
它支持多大的上下文长度?
model card 指出其原生支持 262,144 token,可扩展至 1,000,000。在接近上限的数值下运行所需的内存/显存远超典型的本地配置。
为什么在回答简单问题时感觉它很慢?
对话模板默认将 reasoning_effort 设为 xhigh。对于常规查找,请将其降低到 medium 或 low,并将 xhigh 留给真正需要多步骤的任务。
基准测试是否有提及电子表格处理工作?
没有。公布的表格涵盖了电脑操作、浏览器操作、手机操作、编程、视觉数学和网页开发,不包含针对表格分析或报告生成的基准测试。