Super Sale WeekClaude Skills — 20% OFF
News

Qwen3.8:新功能、如何运行及替代方案 (2026)

Powerdrill Team·
Qwen3.8:新功能、如何运行及替代方案 (2026)

阿里巴巴的 Qwen 团队于 2026 年 8 月 14 日发布了 Qwen3.8-27B,这距离体量大得多的 Qwen3.8-2.4T-A95B 发布仅过去了两天。其发布说明只有一句话,但值得读上两遍。

“Qwen3.8 首次将 Qwen-Max 级别的模型开源发布。”

这一声明针对的是模型级别,而非模型大小。它意味着现在的开源权重已经达到了此前托管旗舰版模型的水平。

这是否适用于您的工作负载则是另一个问题,而目前公布的证据只能部分回答这个问题。本文接下来的内容将探讨具体涉及哪些部分。

本文将介绍此次发布的内容以及两份官方文档存在分歧的地方。接着,我们将分析基准测试表实际衡量了什么。最后,如果您希望在自己的机器上进行分析,本文还将介绍如何在本地运行该模型。

Qwen3.8 究竟是什么

官方 README 将该系列描述为构建在“Qwen3.5 的架构基础之上”,并在“编程、专业工作、研究和长程智能体(agentic)任务中”带来了提升。

对于任何需要执行多步骤工作的人来说,下一句话至关重要。Qwen3.8“旨在以更高的可靠性,将复杂的、多步骤的任务执行到底”。

27B 模型是大多数人会在本地运行的版本。其 model card 给出了具体的数据:27B 参数、64 层、隐藏维度 5120,以及 Gated DeltaNet 和 Gated Attention 块的混合布局。

上下文长度原生支持 262,144 个 token,并可扩展至 1,000,000。model card 上记录的许可证为 apache-2.0

这两次发布值得理清。2.4T-A95B 混合专家(MoE)模型于 2026-08-12 推出,随后 27B 稠密(dense)模型于 2026-08-14 发布。只有后者对于个人自行托管来说是切合实际的。

指标/信息 Qwen3.8-27B
发布时间 2026-08-14
参数量 27B 稠密
层数 64
上下文 原生 262,144,可扩展至 1,000,000
许可证 apache-2.0
输入 文本、图像、视频

两份官方文档存在分歧的地方

这是几乎没有人报道的部分,但它会改变您能放心做出的断言。

GitHub README 将多模态架构归功于 Qwen3.5(即 Qwen3.8 所基于的那一代)。如果只看那个页面,您会得出 27B 模型仅支持文本的结论。

但 model card 却给出了不同的说法,而且非常具体。Qwen3.8-27B 是“一个原生的视觉-语言模型,能够理解图像和视频,并具有灵活的思考控制能力”。

当两个官方来源发生冲突时,更具体的那个胜出。model card 描述的正是这个具体的 checkpoint,因此多模态能力是真实存在的。了解这一差异是有价值的,因为粗略浏览一下仓库可能会让您得出相反的结论。

基准测试表衡量了什么,又遗漏了什么

model card 公布了与 Qwen3.6-27B、Qwen3.7-Plus、Muse Glimmer-30B 和 Opus4.6 Max 的对比。其中一些智能体(agentic)指标出现了大幅跃升。

基准测试 Qwen3.8-27B Qwen3.6-27B
OSWorld-Verified (电脑操作) 84.3 63.9
WebArena-Verified (浏览器操作) 64.8 48.8
AndroidWorld (手机操作) 81.9 70.3
SWE-bench Pro (编程) 61.7
MathVision (含代码解释器) 94.6 90.3
Vision2Web (视觉网页开发) 62.9 45.0

坦白地说,这张表格涵盖的是电脑操作、浏览器操作、手机操作、编程、视觉数学和网页开发。

这里没有任何关于读取电子表格、对账两个导出文件或根据表格数据生成报告的基准测试。 强劲的 OSWorld 数据只能说明该模型可以操作桌面,但并不能保证它能正确完成您的收入对账。

对于关注开源发布动态的读者,有一个细节值得注意。Muse Glimmer-30B 作为对比点出现在此表中,而它自己在四天前发布时的对比表则是与 Qwen3.6-27B 进行比较。我们在关于 Muse Glimmer 的文章中曾指出,其同类对比组在发布时就已经落后了一代。而这张表则印证了故事的另一半。

如何运行它

根据 README 的新闻条目,权重已托管在 Hugging Face Hub 和 ModelScope 上。对于单台机器来说,27B 稠密结构是切实可行的选择。

请根据参数量而非上下文上限来规划您的内存/显存。虽然可以使用 262,144 token 的窗口,但填满它所需的内存/显存是大多数本地配置所无法承受的。

建议先从短上下文和真实文件开始。加载一个导出文件,问一个您已经知道答案的问题,在信任更长的内容之前先核对一下答案。

对于表格处理工作,这一验证步骤是必不可少的。模型可以流畅地描述一个电子表格,但仍可能看错哪一列是总计。流畅的错误答案比显而易见的错误更难被发现。

如果您需要百万级 token 的窗口,请将其视为一项需要独立硬件预算的任务。这两种配置在实际运行中的表现大相径庭,对其中一种进行基准测试并不能代表另一种。

首先更改默认的推理强度(reasoning effort)

以下设置将决定您的第一印象,它在 model card 自身的对话模板中清晰可见。

模板默认将 reasoning_effort 解析为 xhigh,其他可接受的值包括 mediumlow。也可以关闭思考功能。

默认设为 xhigh 意味着模型会对不需要深思熟虑的问题进行冗长的思考。对于在小型 CSV 中进行单行查找这样的任务,这会让人觉得模型很慢,而不是严谨。

因此,首先要调整的不是提示词。对于常规问题,请将推理强度降至 mediumlow,并将 xhigh 留给发布说明中真正针对的多步骤任务。

这在数据工作流中的定位

自行托管的开源权重模型解决了一个特定的问题,即数据永远不会离开您的机器。对于受监管或敏感的文件,这就是核心论点,任何托管服务的便利性都无法替代这一点。

这一选择的其他所有方面都是一种权衡。您需要承担硬件、更新和量化决策的成本,以换取这唯一的保证。

它无法解决的是模型之外的一切工作。列属性分析(column profiling)、合并两个导出文件、捕获重命名的字段、渲染图表以及生成文档,这些都是独立的工作。

这种差距正是协议层和工具层存在的原因。我们关于 什么是 MCP 的解析文章介绍了连接模型与工具的标准。数据连接器页面展示了以文件为核心的流水线所期望的输入。

替代方案

如果需求是本地且开源,Qwen3.8-27B 和 Muse Glimmer-30B 是目前同等尺寸级别中的两个候选模型。两者都公布了权重,且都能在单台机器上运行。

If the requirement is a finished artifact from a file rather than a model endpoint, the shape of the tool is different. Powerdrill Bloom takes the spreadsheet, profiles the columns, and returns the chart, the report, or the deck.

在 Qwen 方面无法进行价格对比。由于无法访问该模型的官方 Qwen 价格页面,因此本文未引用任何数据。

如果您的实际任务是将文件转化为报告,可以尝试直接使用 Powerdrill Bloom 处理。另请参阅我们的指南:如何将订阅导出数据转化为 MRR 和 ARR 报告,以及 CSV AI 助手页面。

结论

Qwen3.8-27B 是一个 27B 稠密模型,具有 262,144 token 的原生上下文,采用 apache-2.0 权重,并记录支持图像和视频输入。相比 Qwen3.6-27B,其在智能体(agentic)能力上的提升是巨大的。

伴随它而来的是两个注意事项:仓库和 model card 在多模态支持上存在分歧;此外,已公布的基准测试涵盖的是桌面、浏览器、编程和视觉任务,而非表格处理工作。

在对它做出评价之前,请先设置 reasoning_effort。默认值为 xhigh,而这一默认设置进行的思考超出了大多数问题所需的范畴。

常见问题解答

Qwen3.8 是何时发布的?

README 的新闻条目记录了 Qwen3.8-27B 于 2026-08-14 发布,Qwen3.8-2.4T-A95B 于 2026-08-12 发布,两者均已上架 Hugging Face Hub 和 ModelScope。

Qwen3.8-27B 是多模态的吗?

是的,根据其 model card 的描述,它是一个原生的视觉-语言模型,能够理解图像和视频。需要注意的是,GitHub README 将多模态架构归功于 Qwen3.5。

它支持多大的上下文长度?

model card 指出其原生支持 262,144 token,可扩展至 1,000,000。在接近上限的数值下运行所需的内存/显存远超典型的本地配置。

为什么在回答简单问题时感觉它很慢?

对话模板默认将 reasoning_effort 设为 xhigh。对于常规查找,请将其降低到 mediumlow,并将 xhigh 留给真正需要多步骤的任务。

基准测试是否有提及电子表格处理工作?

没有。公布的表格涵盖了电脑操作、浏览器操作、手机操作、编程、视觉数学和网页开发,不包含针对表格分析或报告生成的基准测试。