Qwen(通義千問、つういせんもん)は、中国Alibaba Cloudが開発・公開しているオープンモデルです。2026年8月時点の最新は「Qwen 3.8」(2026年8月12日にQwen3.8-2.4T-A95B、8月14日にQwen3.8-27Bがオープンウェイト公開)(出典: https://github.com/QwenLM/Qwen3.8 )で、2.4兆パラメータのMoEモデルから単一GPUで動作する27Bモデルまで、世界トップクラスの性能を持つラインナップが揃っています。
「ローカルで動かせる高性能なモデルが欲しいけれど、LlamaやGemmaでは物足りない」と感じている方にこそ、Qwenは検証する価値があります。Apache 2.0ライセンスで配布されているモデルもあり、商用利用の制約も最小限です。
本記事ではローカルで実用的に使えるQwen 3.5・3.6・3.8を中心に、Qwenの基本、性能、Ollamaを使った最短実行手順、GemmaやLlamaとの比較、活用例までを一気に解説します。2026年8月にオープンウェイト公開された最新のQwen 3.8の動向も取り上げます。
Qwenとは?Alibabaが開発したオープンモデルファミリー
通義千問(Qwen)の概要
Qwenは、Alibaba CloudのAI研究部門が開発しているモデルファミリーの総称です。2023年の初代Qwenから、Qwen 2、Qwen 2.5、Qwen 3、Qwen 3.5、Qwen 3.6、そして2026年8月にオープンウェイト公開されたQwen 3.8まで、驚異的なスピードで進化を続けています。
中国製モデルというと「中国語専用」というイメージを持たれがちですが、Qwenは201言語をサポートし、日本語性能でも他のオープンモデルに引けを取りません。最大262Kトークンの長大なコンテキストにも対応しています。
Qwenファミリーの派生モデル
Qwenには汎用モデル以外にも、用途特化の派生モデルが多数あります。
- Qwen-Coder: コード生成・補完に特化
- Qwen-Math: 数学的推論に特化
- Qwen-VL: 画像理解(マルチモーダル)
- Qwen-Audio / Qwen-TTS: 音声入出力
- Qwen-Omni: テキスト・画像・音声統合
思考モード(Thinking Mode)の搭載
Qwen 3以降の大きな特徴が、複雑な推論に強い「Thinking Mode」と高速応答の「Non-Thinking Mode」を切り替えられる点です。OpenAIのo1やDeepSeek-R1と同様の推論モードを、オープンモデルで自由に試せます。
Qwenのバージョン進化|最新は3.8(オープンウェイト公開済)
Qwen 3|2025年4月の実績モデル
2025年4月にリリースされたQwen 3は、初めて思考モードを搭載した世代です。0.6B〜32BのDense型と、30B-A3B・235B-A22BのMoE(混合エキスパート)型をラインナップ。今でも安定して動く定番モデルです。
Qwen 3.5|2026年3月、長文・多言語が大幅強化
2026年2月16日に397B-A17B(active 17B)が先行公開され、3月2日までに0.8B〜397Bの全サイズが順次リリースされたQwen 3.5は、全サイズで262,144トークンのネイティブコンテキストを持ち、YaRNにより1,010,000トークンまで拡張可能・201言語対応を実現し、日本語の回答品質も大きく向上しました。ノートPCから本格GPUまで幅広く対応できます。
Qwen 3.6|2026年4月、オープンウェイト最新(3.8登場前)
2026年4月のQwen 3.6シリーズは、35B-A3B(4月16日)と27B Dense(4月22日)がオープンウェイトで提供されています。Qwen3.6-27Bは397BのMoEモデルを上回るエージェントコーディング性能を示すなど、サイズの割に強力です。
Qwen 3.8|2026年8月、2.4兆パラメータのフラッグシップがオープンウェイト公開
2026年8月、Alibabaはフラッグシップ「Qwen 3.8」シリーズをオープンウェイトで公開しました。2026年8月12日に大規模MoEモデル「Qwen3.8-2.4T-A95B」(総パラメータ2.4兆 / アクティブ95B)、2026年8月14日に軽量Denseモデル「Qwen3.8-27B」がそれぞれHugging FaceおよびModelScopeで公開されています(出典: https://github.com/QwenLM/Qwen3.8 )(出典: https://huggingface.co/Qwen/Qwen3.8-2.4T-A95B )(出典: https://huggingface.co/Qwen/Qwen3.8-27B )。Ollamaでも「qwen3.8:27b」として提供されています(出典: https://ollama.com/library/qwen3.8 )。
現時点で判明している情報は以下のとおりです。
| 項目 | 内容 |
|---|---|
| モデル名 | Qwen3.8-2.4T-A95B / Qwen3.8-27B |
| パラメータ数 | 2.4T total / 95B active(MoE)、27B(Dense) |
| 提供形態 | オープンウェイト(Hugging Face / ModelScope)、Ollama(qwen3.8:27b) |
| ライセンス | Qwen3.8-27B: apache-2.0 / Qwen3.8-2.4T-A95B: qwen3.8-max ライセンス |
| ベンチマーク(抜粋) | Terminal-Bench 86.6、SWE-bench Pro 67.7 ほか |
Qwen 3.8は2026年8月時点でAlibabaの最新フラッグシップであり、プレビュー段階ではなく正式にオープンウェイトが公開済みです。2.4Tモデルは大規模MoEながらアクティブ95Bで推論コストを抑え、27Bモデルは単一GPUでも動作可能なサイズで高いエージェント・コーディング性能を示しています。
ローカル運用ならどれを選ぶ?
オープンウェイトが必要なローカル運用では、安定動作のQwen 3.5、バランスの良いQwen 3.6、そして2026年8月時点で最新のQwen 3.8-27Bが現実的な選択肢です。API経由ではなくローカルで最先端性能を試せるのが3.8世代の大きな進化です。
Qwen 3.5〜3.8の性能|オープン・APIモデル最上位クラス
ベンチマークでの位置付け
Qwen3-235B-A22BやQwen3.5-397Bは、コーディング能力(LiveCodeBench)や数学(AIME 2024)、汎用推論(MMLU)など主要ベンチマークでGPT-4oやGemini 2.5 Proに迫る、もしくは凌駕するスコアを記録しています。
中規模のQwen3.6-27Bですら、Llama 3.3 70BやGemma 3 27Bを上回るベンチ結果を出しており、家庭用GPU環境でクラウド級の性能を引き出せます。Qwen 3.8ではTerminal-Bench 86.6、SWE-bench Pro 67.7などエージェント・コーディング系でさらに高いスコアが報告されています(出典: https://github.com/QwenLM/Qwen3.8 )。
コード生成・数学・推論に強い
Qwenシリーズは伝統的にコード生成と数学に強く、専用派生モデル「Qwen2.5-Coder」「Qwen2.5-Math」も公開されています。エンジニア向けのアシスタント用途では、第一の選択肢になり得る性能です。
日本語応答品質
Qwen 3.5 / 3.6 の14B以上では、日本語の自然さがChatGPT 3.5を上回るレベルに到達しています。社内チャットボットや日本語ドキュメント要約など、実務に投入できる品質です。
Qwenで何ができる?代表的な活用シーン
1. ローカル動作の高性能チャットボット
クラウドAPIに頼らず、社内サーバーで動かせる高性能チャットボットの構築に最適です。Qwen3.5-14BやQwen3.6-27B、Qwen3.8-27Bあたりが性能とハードウェア要件のバランスが良く、おすすめの選択肢です。
2. コーディングアシスタント
VS Codeの「Continue.dev」と組み合わせれば、ローカル版GitHub Copilotとして動作します。Qwen2.5-Coderの32BモデルはGPT-4o相当のコード生成品質があり、機密コードを扱う案件で重宝されています。
3. 多言語翻訳・ローカライズ
201言語に対応するため、翻訳タスクや多言語ローカライズの一次出力を自動化できます。中国市場向け展開がある企業では、Qwenは特に有力な選択肢になります。
4. RAGの推論エンジン
LangChainやLlamaIndexを使ったRAGシステムの中核モデルとして、Qwenは安定したパフォーマンスを発揮します。262,144トークンの長文コンテキストを扱えるため、大規模文書の質問応答にも対応します。
5. エージェントワークフローの自動化
Qwen 3以降はTool Useやfunction callingに対応しているため、AutoGenやLangGraphと組み合わせてエージェントを構築可能です。社内SaaSの自動操作や定型業務の自動化に組み込めます。
6. ファインチューニングによる業界特化
オープンウェイトのため、Hugging FaceのPEFT(LoRA)でファインチューニングが容易です。医療・法務・製造などの業界特化モデルを自社で構築する案件で活用されています。
7. マルチモーダルなコンテンツ理解
Qwen-VLを使えば、画像の内容説明やOCRが行えます。Qwen-Audio・Qwen-TTSと組み合わせれば、音声入出力対応のAIアシスタントも構築可能です。
Qwenを試す3つの方法
方法1: ブラウザで即試す(Qwen Chat)
一番手軽なのは公式のWebアプリ「Qwen Chat」(chat.qwen.ai)です。アカウント登録なしでも基本のチャット機能が使え、最新モデルを無料で体感できます。
方法2: ローカルで動かす(Ollama)
開発機やオンプレで動かしたいならOllamaが最短ルートです。詳細手順は次章で解説します。
方法3: クラウドAPIで使う(Alibaba Cloud DashScope)
最新モデルをクラウドで試したい場合や、自前GPUを持たずに本番運用したい場合は、Alibaba CloudのDashScope経由でAPI利用するほか、Hugging FaceやModelScopeからオープンウェイトを取得してセルフホストする方法もあります。Qwen 3.8はオープンウェイトのため、APIに加えてローカル/自社クラウドでの運用も選択できます。
Qwenの始め方|Ollamaを使う最短手順
1. Ollamaをインストール
公式サイトからOllamaのインストーラーを取得し、各OS(macOS / Windows / Linux)に合わせて導入します。インストール後はollamaコマンドが使えるようになります。
2. Qwenのモデルをダウンロード
ターミナルで以下のコマンドを実行すれば、Qwen3-8Bが即座に動きます。Qwen 3.5や3.6、3.8を試したい場合はタグを変更してください。
# Qwen 3 (定番)
ollama run qwen3:8b
# Qwen 3.5 (2026年3月版)
ollama run qwen3.5:9b
# Qwen 3.6 (2026年4月)
ollama run qwen3.6:27b
# Qwen 3.8 (2026年8月最新)
ollama run qwen3.8:27b
3. Pythonから呼び出す
OllamaはHTTPサーバーとして起動するため、Pythonからは以下のように利用できます。
import requests
res = requests.post('http://localhost:11434/api/generate', json={
'model': 'qwen3.5:9b',
'prompt': 'データエンジニアの定義を300字で'
})
print(res.json()['response'])
OpenAI互換APIにも対応しているため、ChatGPT用に書いたコードがほぼそのまま動きます。
4. LM Studioで対話的に使う
GUIで使いたい場合はLM Studioが便利です。検索バーで「qwen」と入力するだけでモデル一覧が表示され、ワンクリックでダウンロード・対話できます。
Qwen・Llama・Gemmaを比較する
ライセンスの自由度
| モデル | ライセンス | 商用利用 | 制約 |
|---|---|---|---|
| Qwen 3.5 / 3.6 / 3.8-27B | Apache 2.0 | 可 | 最も自由 |
| Qwen3.8-2.4T-A95B | qwen3.8-max | 可(条件付き) | 要ライセンス確認 |
| Llama 3.3 | Llama 3 Community License | 可 | MAU 7億超で制限 |
| Gemma 3 | Gemma Terms | 可 | 禁止用途あり |
Apache 2.0は最も制約の少ないライセンスで、Qwenの27B以下のモデルは商用化・改変・再配布が自由です。Qwen3.8-2.4T-A95Bはqwen3.8-maxライセンスが適用されます(出典: https://huggingface.co/Qwen/Qwen3.8-2.4T-A95B )。Llamaはサービス規模の制限があり、Gemmaは禁止用途が明文化されています。利用時はHugging Faceのモデルカードで正確なライセンスを確認してください。
性能とハードウェア要件
汎用ベンチマークでは、同サイズ帯ではQwen 3.5 / 3.6 / 3.8 > Gemma 3 > Llama 3.3 の順で性能が高い傾向があります。ただし、用途や言語によってベストモデルが変わるため、最終判断は実際に試した結果を基準にするのが確実です。
中国製モデルへの考慮
Qwenは中国Alibabaが開発しているため、企業によっては「中国製AIの利用方針」と照らし合わせる必要があります。完全オンプレで運用すれば外部通信は発生しませんが、組織のセキュリティポリシーを事前に確認しましょう。
Qwenを使うときの注意点
モデルサイズと性能のトレードオフ
Qwen3.5-397BやQwen3.8-2.4T-A95Bは強力ですが、本格的なGPU環境(A100 80GB×複数枚など)が必要です。コストとパフォーマンスのバランスを取るなら、Qwen3.5-14BやQwen3.6-27B、Qwen3.8-27Bが現実的な選択肢になります。
ハルシネーション対策
高性能なQwenでも、もっともらしい誤情報を生成することがあります。重要な業務に組み込む場合は、RAGで根拠文書を参照させたり、人間によるレビュー工程を必ず挟みましょう。
中国製AIに関する組織方針
業種や顧客との契約によっては、中国製AIの利用が制限される場合があります。利用前に法務・情報セキュリティ部門と相談し、自社の方針と整合性を確認することが大切です。
バージョン進化が速い点に注意
Qwenは数ヶ月単位で新バージョンが出ます。本番運用ではバージョンを固定し、評価指標を定めてから移行する運用が安全です。2026年8月時点で最新はQwen 3.8です。
最新動向|Qwen 3.8とエージェント時代
Qwen 3.8の位置付け
2026年8月にオープンウェイト公開されたQwen 3.8は、Alibabaの最新フラッグシップです。MoEの大規模モデル(2.4T-A95B)と単一GPUで動作する27Bモデルを両輪とし、エージェントワークフローや長時間の自律実行に最適化されています(出典: https://github.com/QwenLM/Qwen3.8 )。
ベンチマーク結果
Qwen 3.8はTerminal-Benchで86.6、SWE-bench Proで67.7など、エージェント・コーディング系ベンチマークで最上位クラスのスコアを記録しています(出典: https://github.com/QwenLM/Qwen3.8 )。詳細なモデルカードと評価結果はGitHubおよびHugging Faceで公開されています。
オープンウェイトで何が変わる?
Qwen 3.8はHugging Face(出典: https://huggingface.co/Qwen/Qwen3.8-2.4T-A95B )(出典: https://huggingface.co/Qwen/Qwen3.8-27B )、ModelScope、Ollama(出典: https://ollama.com/library/qwen3.8 )でオープンウェイトとして取得できるため、API限定だった従来のフラッグシップとは異なり、完全オンプレでのエージェント構築やファインチューニングが可能です。Qwen3.8-27BはApache 2.0、Qwen3.8-2.4T-A95Bはqwen3.8-maxライセンスで提供されています。
ライセンス・商用利用の可否
Qwenシリーズの多くはApache 2.0ライセンスで公開されており、商用利用・改変・再配布がロイヤリティなしで認められています。Qwen3シリーズ(0.6B〜235B-A22B)やQwen3.8-27BはApache 2.0です(出典: https://huggingface.co/Qwen/Qwen3.8-27B )。一方、Qwen3.8-2.4T-A95Bはqwen3.8-maxライセンスが適用されます(出典: https://huggingface.co/Qwen/Qwen3.8-2.4T-A95B )。実務で使う際は、利用するモデルの正確なパラメータサイズとライセンス条文をHugging Faceのモデルカードで必ず確認することをおすすめします。
日本語性能の実力(他モデルとの比較)
Qwenは中国語・英語に加えて多言語対応が強化されており、日本語でも実用レベルの応答品質を持つとされています。ローカルLLMとして比較した場合、OllamaやLM Studioで動かせる同規模帯のモデル(Llama系・Gemma系)と比べても、Qwenは指示追従性・要約の正確さでバランスが良いという評価が多く、特にコーディング用途に特化した「Qwen-Coder」はエージェント型コーディングのベンチマークでClaude Sonnet系に匹敵する性能を示したとの報告もあります。ただし日本語特有の敬語・専門用語の扱いはモデルサイズや量子化の程度によって差が出るため、実際の用途に近いプロンプトで事前に品質を確認するのが確実です。
派生モデル(Qwen-Coder・Qwen-VLなど)の使い分け
Qwenファミリーは用途別に複数の派生モデルが用意されています。汎用チャット・推論用途には標準のQwenシリーズ、コーディング特化タスクにはコード生成・エージェント型コーディングに強い「Qwen-Coder」(大規模MoE版は7.5兆トークン規模で学習、うち70%がコードデータ)、画像・図表を含むマルチモーダルなやり取りには「Qwen-VL」(3B・7B・32B・72Bなどのバリエーションがあり、72B以外はApache 2.0)を使い分けます。ローカル環境のスペックが限られる場合は、まず軽量なQwen-VL 7B等で用途適合性を確認してから、必要に応じて大きいモデルへ切り替えるのが無駄のない進め方です。
必要PCスペックと量子化(GGUF)の選び方
ローカルでQwenを動かす場合、モデルサイズとVRAM/RAMの目安は、7B級(量子化Q4)でVRAM 6〜8GB程度、14B級で12〜16GB程度、32B級で24GB以上が現実的なラインです。GPUのVRAMが足りない場合はCPU・RAMにオフロードすることも可能ですが、生成速度は大きく低下します。量子化形式はGGUF(Ollama・LM Studioで標準サポート)が扱いやすく、精度と軽量さのバランスが良い「Q4_K_M」がまず試す量子化レベルとしておすすめです。精度を重視する場合はQ5・Q6、速度・省メモリを優先する場合はQ4以下を検討します。
APIで使う方法(DashScope)
ローカル実行の代わりに、Alibaba Cloudが提供する「DashScope(Qwen API Platform/Model Studio)」経由でクラウドAPIとしてQwenを利用することもできます。新規アカウントには入力・出力それぞれ100万トークン相当の無料枠が90日間付与されるため、まず無料枠で性能を検証してから本番導入を検討する使い方が可能です。DashScope以外にも、OpenRouterなどのサードパーティ経由でQwenモデルを呼び出す方法や、Ollama・vLLM等でセルフホストする方法があり、レイテンシ・コスト・データの取り扱いポリシーに応じて使い分けるのが実践的です。
まとめ|ローカルで動かせる最高峰のオープンモデル Qwen を試そう
Qwenは、Apache 2.0という最も自由なライセンスで配布されながら、世界トップクラスの性能を持つオープンモデルです。コード生成・数学・推論・多言語対応の総合力では、現時点で他のオープンモデルを上回る場面が多くあります。
ローカル運用なら、安定のQwen 3.5、バランスの良いQwen 3.6、そして2026年8月時点で最新のQwen 3.8(27BはApache 2.0、2.4T-A95Bはqwen3.8-maxライセンス)が現実解です。いずれもオープンウェイトで提供されているため、用途とハードウェアに合わせて柔軟に選べます。
まずはQwen Chatでブラウザから手応えを確かめ、必要に応じてOllamaでローカル運用へ、さらにAPIやセルフホストで本番利用へとステップアップしていく進め方がおすすめです。
参考文献
本記事の執筆にあたり、以下の一次ソース・解説記事を参考にしました(2026年8月時点)。最新の仕様や料金は必ず公式サイトで確認してください。
- Qwen 公式(Alibaba Cloud)
- Qwen GitHub
- Qwen3.8 GitHub(出典: 2.4T-A95B / 27B 公開日・ベンチマーク)
- Hugging Face: Qwen3.8-2.4T-A95B(qwen3.8-maxライセンス)
- Hugging Face: Qwen3.8-27B(apache-2.0)
- Ollama: qwen3.8:27b
- Qwen Chat(公式Webアプリ)
- Qwen Hugging Face コレクション
- Alibaba Cloud Qwen ソリューションページ
- Artificial Analysis|DeepSeek/Qwen 比較ベンチマーク
- AI Market|Qwen 3 解説(日本語)



コメント
コメント一覧 (1件)
[…] 中国発LLM全体の流れを知りたい方は、QwenとはやDeepSeekとはも併せてご覧ください。 […]