Super Sale WeekClaude Skills — 20% OFF
News

Qwen3.8: 新機能、実行方法、および代替候補 (2026)

Powerdrill Team·
Qwen3.8: 新機能、実行方法、および代替候補 (2026)

AlibabaのQwenチームは、はるかに大規模なQwen3.8-2.4T-A95Bのリリースから2日後の2026年8月14日に、Qwen3.8-27Bをリリースしました。そのリリースノートはわずか1文ですが、2回読む価値があります。

「Qwen3.8は、初めてQwen-Maxクラスのモデルをオープンリリースとして提供します。」

これはサイズではなく、ティア(階層)に関する主張です。かつてホスト型のフラッグシップモデルが位置していた場所に、現在はオープンウェイトモデルが位置していることを意味しています。

それがあなたのワークロードにも当てはまるかどうかは別問題であり、公開されているエビデンスはその一部しか明らかにしていません。本記事の残りの部分では、どの部分が当てはまるのかについて解説します。

本記事では、何がリリースされたのか、そして2つの公式ドキュメントで意見が食い違っている部分について説明します。次に、ベンチマーク表が実際に何を測定しているのかを見ていきます。最後に、分析を自身のローカルマシン内にとどめたい場合に向けて、モデルをローカルで実行する方法を解説します。

Qwen3.8の正体

The official READMEでは、このファミリーは「Qwen3.5のアーキテクチャ基盤」の上に構築されており、「コーディング、専門業務、研究、および長期的なエージェントタスク全体」で向上をもたらすと説明されています。

複数ステップの作業を行うすべての人にとって重要なのは、その次の1文です。Qwen3.8は「複雑で複数ステップに及ぶタスクを、より高い信頼性で完了まで遂行できるように設計されています。」

27Bモデルは、ほとんどの人がローカルで実行することになるモデルです。そのmodel cardには、27Bパラメータ、64レイヤー、隠れ次元5120、そしてGated DeltaNetとGated Attentionブロックのハイブリッドレイアウトという具体的な数値が示されています。

コンテキスト長はネイティブで262,144トークン、最大1,000,000トークンまで拡張可能です。モデルカードに記録されているライセンスはapache-2.0です。

2つのリリース情報を整理しておく価値があります。2.4T-A95Bのmixture-of-expertsモデルは2026-08-12に登場し、27Bのdenseモデルが2026-08-14に続きました。セルフホストが現実的なのは後者のみです。

項目 Qwen3.8-27B
リリース日 2026-08-14
パラメータ数 27B dense
レイヤー数 64
コンテキスト ネイティブ262,144、1,000,000まで拡張可能
ライセンス apache-2.0
入力 テキスト、画像、動画

2つの公式ドキュメントで意見が食い違っている部分

これはほとんど誰も報告していない部分であり、あなたが自信を持って主張できる内容を左右します。

GitHubのREADMEでは、マルチモーダルアーキテクチャはQwen3.8のベースとなっている世代であるQwen3.5によるものとされています。そのページだけを読むと、27Bモデルはテキスト専用であると結論付けてしまうでしょう。

しかし、モデルカードには異なる具体的な記述があります。Qwen3.8-27Bは「画像と動画を理解し、柔軟な思考制御を備えたネイティブのビジョン言語モデル」であるとされています。

2つの公式ソースが衝突する場合、より具体的な記述がある方が優先されます。モデルカードはこの正確なチェックポイントについて説明しているため、マルチモーダル機能は本物です。リポジトリを軽く流し読みするだけでは逆の結論に至ってしまうため、この不一致が存在することを知おく価値はあります。

ベンチマーク表が測定しているもの、そして除外されているもの

モデルカードには、Qwen3.6-27B、Qwen3.7-Plus、Muse Glimmer-30B、およびOpus4.6 Maxとの比較が掲載されています。エージェント関連の数値の一部は大幅に跳ね上がっています。

ベンチマーク Qwen3.8-27B Qwen3.6-27B
OSWorld-Verified (PC操作) 84.3 63.9
WebArena-Verified (ブラウザ操作) 64.8 48.8
AndroidWorld (モバイル操作) 81.9 70.3
SWE-bench Pro (コーディング) 61.7
MathVision (コードインタープリターあり) 94.6 90.3
Vision2Web (ビジュアルWeb開発) 62.9 45.0

ここで、率直な読み解きをしてみましょう。この表がカバーしているのは、PC操作、ブラウザ操作、モバイル操作、コーディング、ビジュアル数学、そしてWeb開発です。

スプレッドシートの読み取り、2つのエクスポートデータの照合、または表形式データからのレポート作成に関するベンチマークはここにはありません。 OSWorldの優れた数値は、モデルがデスクトップを操作できることを示していますが、収益の照合を正しく行えるかどうかを示しているわけではありません。

オープンリリースを追っている読者のために、注目すべき詳細が1つあります。Muse Glimmer-30Bが比較対象としてこの表に登場していますが、その4日前に公開された同モデルのローンチ時の表ではQwen3.6-27Bと比較されていました。Muse Glimmerに関する当社の記事では、ローンチ時点でその比較対象グループがすでに1世代遅れていたことを指摘しました。この表は、その話のもう半分の真実を示しています。

実行方法

READMEのニュース項目によると、ウェイトはHugging Face HubとModelScopeで公開されています。1台のマシンで実行する場合、27Bのdenseモデルが現実的な選択肢となります。

コンテキストの上限ではなく、パラメータ数に基づいてメモリを計画してください。262,144トークンのウィンドウが利用可能ですが、これを満たすには、ほとんどのローカル環境では余裕のないほどのメモリが必要になります。

まずは短いコンテキストと実際のファイルから始めてください。エクスポートしたデータを1つ読み込み、すでに答えがわかっている質問を1つ投げ、より長いコンテキストを信頼する前にその回答を確認します。

表形式の作業において、この検証ステップは必須です。モデルはスプレッドシートについて流暢に説明できても、どの列に合計値が入っているかを見誤ることがあります。流暢な誤答は、明らかな誤答よりも見破るのが困難です。

100万トークンのウィンドウが必要な場合は、独自のハードウェア予算を伴う別の課題として扱ってください。これら2つの構成は実際には大きく異なる挙動を示すため、一方のベンチマークを行っても、もう一方についてはほとんど何もわかりません。

最初にデフォルトの推論負荷を変更する

以下は、あなたの第一印象を左右する設定であり、モデルカード独自のチャットテンプレートで確認できます。

テンプレートでは、reasoning_effortデフォルトでxhighに設定されており、他にmediumlowを指定できます。思考プロセスをオフにすることも可能です。

デフォルトがxhighであるということは、モデルがそれを必要としない質問に対しても長々と熟考することを意味します。小さなCSVに対する1行のルックアップの場合、それは「慎重」というよりも「遅い」と感じられるでしょう。

したがって、最初に調整すべきなのはプロンプトではありません。日常的な質問に対しては負荷をmediumまたはlowに下げ、リリースノートが実際に焦点を当てている複数ステップの作業のためにxhighをとっておきましょう。

データワークフローにおける位置づけ

自身でホストするオープンウェイトモデルは、データがマシンから決して出ないという、1つの特定の課題を解決します。規制対象のファイルや機密ファイルにとって、これこそが最大の論点であり、ホスト型サービスのいかなる利便性もこれに代わることはできません。

この選択におけるそれ以外のすべてはトレードオフです。その1つの保証と引き換えに、ハードウェア、アップデート、および量子化の決定を自ら引き受けることになります。

解決できないのは、モデルの周辺にあるすべての作業です。列のプロファイリング、2つのエクスポートデータの結合、名前が変更されたフィールドの検出、チャートのレンダリング、ドキュメントの作成などは、それぞれ別の作業となります。

そのギャップを埋めるために、プロトコル層やツール層が存在します。当社のMCPとは何かに関する解説記事では、モデルとツールを接続する標準規格について説明しています。データコネクタのページでは、ファイルファーストのパイプラインが入力として何を期待しているかを示しています。

代替案

要件がローカルかつオープンである場合、同じサイズクラスにおける現在の候補はQwen3.8-27BとMuse Glimmer-30Bの2つです。どちらもウェイトを公開しており、1台のマシンで動作します。

要件がモデルのエンドポイントではなく、ファイルから完成した成果物を得ることであれば、ツールの形態は異なります。Powerdrill Bloomはスプレッドシートを取り込み、列をプロファイリングし、チャート、レポート、またはスライド資料を返します。

Qwen側と比較できる価格情報はありません。このモデルに関する公式のQwen価格ページにアクセスできなかったため、本記事では数値を引用していません。

実際のタスクが、レポートに変換する必要のあるファイルである場合は、直接Powerdrill Bloomをお試しください。また、サブスクリプションのエクスポートデータをMRRおよびARRレポートに変換する方法に関するガイドや、CSV AIアシスタントのページもご覧ください。

結論

Qwen3.8-27Bは、ネイティブで262,144トークンのコンテキスト、apache-2.0ライセンスのウェイト、およびドキュメント化された画像および動画入力を備えた27Bのdenseモデルです。Qwen3.6-27Bからのエージェント機能の向上は目覚ましいものがあります。

これには2つの注意点が伴います。リポジトリとモデルカードでマルチモーダル機能に関する見解が一致していないこと、そして公開されているベンチマークが表形式の作業ではなく、デスクトップ、ブラウザ、コーディング、およびビジュアルタスクをカバーしていることです。

評価する前にreasoning_effortを設定してください。デフォルトはxhighですが、このデフォルト設定はほとんどの質問が必要とする以上の思考を行っています。

よくある質問

Qwen3.8はいつリリースされましたか?

READMEのニュース項目によると、Qwen3.8-27Bは2026-08-14に、Qwen3.8-2.4T-A95Bは2026-08-12に、それぞれHugging Face HubとModelScopeでリリースされたことが記録されています。

Qwen3.8-27Bはマルチモーダルですか?

はい、モデルカードによると、画像と動画を理解するネイティブのビジョン言語モデルであると説明されています。ただし、GitHubのREADMEではマルチモーダルアーキテクチャがQwen3.5によるものとされている点に注意してください。

サポートされているコンテキスト長はどのくらいですか?

モデルカードには、ネイティブで262,144トークン、最大1,000,000トークンまで拡張可能と記載されています。上限に近い数値で実行するには、一般的なローカル環境をはるかに超えるメモリが必要になります。

簡単な質問に対して遅く感じるのはなぜですか?

チャットテンプレートでは、reasoning_effortがデフォルトでxhighに設定されています。日常的なルックアップに対してはmediumまたはlowに下げ、本当に複数ステップが必要なタスクのためにxhighをとっておいてください。

ベンチマークはスプレッドシートの作業について何か示していますか?

いいえ。公開されている表は、PC操作、ブラウザ操作、モバイル操作、コーディング、ビジュアル数学、およびWeb開発をカバーしており、表形式の分析やレポート作成に関するベンチマークはありません。