Super Sale WeekClaude Skills — 20% OFF
News

Qwen3.8:新功能、如何執行與替代方案 (2026)

Powerdrill Team·
Qwen3.8:新功能、如何執行與替代方案 (2026)

阿里巴巴的 Qwen 團隊於 2026 年 8 月 14 日發布了 Qwen3.8-27B,這是在體量大得多的 Qwen3.8-2.4T-A95B 發布兩天之後。這份版本說明只有一句話,但值得讀上兩遍。

「Qwen3.8 首次將 Qwen-Max 級別的模型進行開源釋出。」

這項聲明指的是級別,而非尺寸。它意味著現在開源的權重已經達到了過去託管旗艦模型的水準。

這是否適用於您的工作負載則是另一個問題,而目前公布的證據只能提供部分解答。本文接下來將探討具體涉及哪些部分。

本文將介紹這次發布的內容,以及兩份官方文件存在分歧之處。接著,我們將探討基準測試表實際測量的指標。最後,如果您希望將分析保留在自己的機器上,本文也會介紹如何在本地運行該模型。

Qwen3.8 究竟是什麼

The 官方 README 將該系列描述為建立在「Qwen3.5 的架構基礎之上」,並在「程式碼編寫、專業工作、研究以及長流程代理任務(agentic tasks)方面」帶來了提升。

對於任何進行多步驟工作的人來說,下一句話才是關鍵。Qwen3.8「旨在以更高的可靠性,引導複雜的多步驟任務順利完成」。

27B 模型是大多數人會在本地運行的版本。其模型卡(model card)給出了具體數據:27B 參數、64 層、隱藏維度 5120,以及 Gated DeltaNet 與 Gated Attention 區塊的混合布局。

上下文長度是原生為 262,144 個 token,並可擴充至 1,000,000。模型卡上記錄的授權條款為 apache-2.0

這兩次發布的內容值得釐清。2.4T-A95B 混合專家模型於 2026-08-12 推出,而 27B 稠密模型則緊隨其後於 2026-08-14 發布。只有後者對於自行託管來說才是切合實際的。

項目 Qwen3.8-27B
發布日期 2026-08-14
參數 27B 稠密
層數 64
上下文 262,144 原生,可擴充至 1,000,000
授權條款 apache-2.0
輸入 文字、圖片、影片

兩份官方文件存在分歧之處

這是幾乎沒有人報導的部分,而它會改變您能安全聲稱的內容。

GitHub README 將多模態架構歸功於 Qwen3.5(即 Qwen3.8 所基於的世代)。如果只讀該頁面,您會得出 27B 模型僅支援文字的結論。

但模型卡卻給出了不同的說法,而且非常具體。Qwen3.8-27B 是一款「原生視覺語言模型,能理解圖片與影片,並具備靈活的思考控制能力」。

當兩個官方來源發生衝突時,應以更具體的那一個為準。模型卡描述的是這個特定的檢查點(checkpoint),因此其多模態能力是真實存在的。了解這一差異非常重要,因為快速瀏覽一下儲存庫可能會讓您得出相反的結論。

基準測試表測量了什麼,又遺漏了什麼

模型卡公布了與 Qwen3.6-27B、Qwen3.7-Plus、Muse Glimmer-30B 以及 Opus4.6 Max 的對比。其中一些代理(agentic)指標出現了大幅躍升。

基準測試 Qwen3.8-27B Qwen3.6-27B
OSWorld-Verified (電腦操作) 84.3 63.9
WebArena-Verified (瀏覽器操作) 64.8 48.8
AndroidWorld (行動裝置操作) 81.9 70.3
SWE-bench Pro (程式碼編寫) 61.7
MathVision (含程式碼解釋器) 94.6 90.3
Vision2Web (視覺化網頁開發) 62.9 45.0

現在來做個客觀的解讀。這張表格涵蓋了電腦操作、瀏覽器操作、行動裝置操作、程式碼編寫、視覺化數學以及網頁開發。

這裡沒有針對讀取試算表、比對兩份匯出資料,或根據表格資料生成報表的基準測試。 優秀的 OSWorld 數據只能說明該模型可以操作桌面系統,但並不代表它能幫您正確完成營收對帳。

對於關注開源釋出的讀者,有一個細節值得注意。Muse Glimmer-30B 作為對比點出現在這張表中,而它在四天前發布時的對比表格則是與 Qwen3.6-27B 進行比較。我們在關於 Muse Glimmer 的文章中曾指出,它在推出時所對比的同類產品就已經落後了一代。而這張表格則印證了故事的另一半。

如何運行

根據 README 的新聞條目,權重已託管在 Hugging Face Hub 和 ModelScope 上。對於單一機器來說,27B 稠密規格是切合實際的選擇。

請根據參數數量而非上下文上限來規劃您的記憶體。雖然可以使用 262,144 個 token 的視窗,但填滿它所消耗的記憶體是大多數本地配置所無法承受的。

建議先從較短的上下文和真實檔案開始。載入一份匯出檔案,問一個您已經知道答案的問題,並在信任更長的內容之前先驗證該答案。

對於表格工作而言,驗證步驟是必不可少的。模型可以流暢地描述試算表,但仍可能看錯哪一欄是總計。流暢的錯誤答案比顯而易見的錯誤更難被察覺。

如果您需要百萬 token 的視窗,請將其視為一項獨立的工作,並編列專屬的硬體預算。這兩種設定在實際運行中的表現截然不同,對其中一種進行基準測試並不能代表另一種的表現。

首先調整預設的推理強度

以下是會影響您第一印象的設定,這在模型卡本身的對話範本中也可以看到。

該範本將 reasoning_effort 預設解析為 xhigh,其他可接受的值為 mediumlow。思考功能也可以關閉。

預設為 xhigh 意味著模型會對不需要深思熟慮的問題進行冗長的思考。對於小型 CSV 的單行查詢,這會讓人覺得模型很慢,而不是嚴謹。

因此,首先要調整的不是提示詞。對於常規問題,請將強度降低到 mediumlow,並將 xhigh 留給版本說明中真正提及的多步驟工作。

這在資料工作流程中的定位

自行託管的開源權重模型解決了一個特定問題,即資料永遠不會離開您的機器。對於受監管或敏感的檔案,這就是核心論點,任何託管服務帶來的便利性都無法取代這一點。

選擇此方案的其他一切都是一種權衡。您需要承擔硬體、更新和量化決策的成本,以換取這唯一的保證。

它無法解決的是圍繞模型周邊的所有工作。欄位分析、合併兩份匯出資料、捕捉重新命名的欄位、轉譯圖表以及生成文件,這些都是獨立的工作。

這種落差正是協定與工具層存在的原因。我們關於 什麼是 MCP 的說明文章介紹了連接模型與工具的標準。資料連接器頁面則展示了以檔案為核心的管道所期望的輸入內容。

替代方案

如果需求是本地且開源,Qwen3.8-27B 和 Muse Glimmer-30B 是目前同等大小級別中的兩個候選模型。兩者都公布了權重,且都能在單一機器上運行。

如果需求是直接從檔案生成最終產出物,而非僅僅是模型端點,那麼工具的形式會有所不同。Powerdrill Bloom 可以接收試算表、分析欄位,並返回圖表、報表或簡報。

在 Qwen 方面無法進行價格對比。由於無法訪問該模型的官方 Qwen 定價頁面,因此本文未引用任何數據。

如果您的實際任務是需要將檔案轉化為報表,請直接嘗試使用 Powerdrill Bloom。另請參閱我們的指南:如何將訂閱匯出資料轉換為 MRR 和 ARR 報表,以及 CSV AI 助理頁面。

結論

Qwen3.8-27B 是一款 27B 稠密模型,具有 262,144 個 token 的原生上下文、apache-2.0 權重,並支援文件記載的圖片與影片輸入。其在代理能力上相較於 Qwen3.6-27B 有著實質性的飛躍。

伴隨而來的有兩個注意事項。儲存庫與模型卡在多模態支援上存在分歧,且公布的基準測試涵蓋的是桌面、瀏覽器、程式碼編寫和視覺任務,而非表格工作。

在對其做出評價之前,請先設定 reasoning_effort。預設值為 xhigh,而該預設值進行的思考超出了大多數問題所需。

常見問題

Qwen3.8 是何時發布的?

README 的新聞條目記錄了 Qwen3.8-27B 於 2026-08-14 發布,Qwen3.8-2.4T-A95B 於 2026-08-12 發布,兩者均已上架 Hugging Face Hub 和 ModelScope。

Is Qwen3.8-27B multimodal?

是的,根據其模型卡,它被描述為一款能理解圖片與影片的原生視覺語言模型。請注意,GitHub README 將多模態架構歸功於 Qwen3.5。

它支援多長的上下文長度?

模型卡指出原生支援 262,144 個 token,並可擴充至 1,000,000。在接近上限的數值下運行,所需的記憶體遠遠超出了典型的本地配置。

為什麼在處理簡單問題時會覺得它很慢?

對話範本將 reasoning_effort 預設為 xhigh。對於常規查詢,請將其降低至 mediumlow,並將 xhigh 留給真正需要多步驟的任務。

基準測試有提到關於試算表工作的內容嗎?

沒有。公布的表格涵蓋了電腦操作、瀏覽器操作、行動裝置操作、程式碼編寫、視覺化數學以及網頁開發,並未包含表格分析或報表生成的基準測試。