Qwen 3.5のIQは?
Qwen 3.5はMensa Norway IQテストで115、Intelligence Indexでトップ10。全ベンチマークを分析し、Alibabaのモデルをユニークにするものを説明します。
Qwen 3.5:Alibabaの万能な挑戦者
Qwen 3.5はAlibabaのDAMO Academyの旗艦モデルで、中国で最大かつ最も資金力のあるAI研究ラボの一つです。2026年初頭にリリースされ、Mensa Norway IQテストで115、Artificial Analysis Intelligence Index v4.1でトップ10に入ります。これはDeepSeek V4 Pro(111)より上でKimi K3(118)と競争的ですが、フロンティアモデル(Claude ~130、Gemini 141、GPT-5.5 ~145、Grok-4.20 145)より下です。
Qwen 3.5をユニークにするのはその多能性です。DeepSeek(コスト重視)、Kimi(コンテキスト長重視)、Grok(raw IQ重視)とは異なり、Qwen 3.5は幅広いタスクで優れる万能モデルを目指しています。強力な多言語サポート(27+言語)、優れたマルチモーダル能力(テキスト、画像、音声、動画)、競争力のある価格を持ち — AIモデルのスイスアーミーナイフです。
Qwen 3.5はオールラウンダーです:一つのことで絶対に最高ではないかもしれないが、ほぼすべてにおいて非常に良いモデル。多様なワークロードに単一モデルを必要とする組織 — カスタマーサービス、コンテンツ生成、コード分析、翻訳、視覚理解 — に、Qwen 3.5は能力、多能性、価値の魅力的な組み合わせを提供します。
主要スコア:
- Artificial Analysis Intelligence Index:トップ10(スコア~45-46)
- Mensa Norway IQ(TrackingAI):115(平均以上)
- AI IQ複合(VexoWire):~115推定
- GDPval-AA v2:トップ10
- Humanity's Last Exam:トップ10
- ハルシネーション率:低-中
- コスト:0.55/1.50 per 1Mトークン(非常に手頃)
- マルチモーダル:テキスト、画像、音声、動画
- 言語:27+言語サポート
1. 多能性の優位性
Qwen 3.5は、AIの未来が最も賢いことではなく最も多能的であることにあるというAlibabaの賭けを表します。他のラボが特定の次元 — IQ、コスト、コンテキスト、個性 — を最適化する一方、Alibabaはすべてにおいて競争力のあるモデルを構築しました。
プロフィールを考えてみてください:
- IQ:115(平均以上、他の中国モデルと競争的)
- コスト:0.55/1.50 per 1Mトークン(最安値クラス)
- マルチモーダル:テキスト、画像、音声、動画(完全マルチモーダル)
- 言語:27+言語(クラス最高の多言語)
- コンテキスト:256Kトークン(立派だがKimiレベルではない)
- オープンソース:ローカルデプロイ用のweights
単一の属性がクラス最高ではありませんが、組み合わせは無類です。DeepSeekはより安いがマルチモーダルがない。Kimiはより多くのコンテキストがあるがより少ない言語。Geminiはより賢いがより高い。Claudeはより有能だがクローズドソース。Qwen 3.5は針の穴を通ります — あなたが必要とする唯一のモデルになるのに十分なほどすべてにおいて良い。
この多能性は以下に特に魅力的です:
- 多様なワークロードのエンタープライズデプロイ
- 多くの言語を必要とする国際アプリ
- テキスト、画像、音声を組み合わせるマルチモーダルアプリ
- 品質を必要としつつコスト意識の高い組織
- オープンソースweightsによる自己ホストデプロイ
2. ベンチマークの詳細
Mensa Norway IQテスト:115(平均以上)
36の視覚パターン認識問題で構成。Qwen 3.5は115を獲得 — 人間平均100を上回り、「平均以上」範囲に位置。DeepSeek V4 Pro(111)より高く、Kimi K3(118)よりわずかに低く、フロンティアモデル(Claude ~130、Gemini 141、GPT-5.5 ~145、Grok-4.20 145)より下。
IQ 115は、Qwen 3.5が人間の約84%より賢い — 人間の知能の上位16%を意味します。人なら強い大学生や有能なプロフェッショナルに相当。天才ではないが、確かに聡明で有能。
Artificial Analysis Intelligence Index:トップ10
Intelligence IndexでQwen 3.5は推定スコア~45-46で世界トップ10。Gemini 3.1 Pro(46.5)、Kimi K3(~45-47)、DeepSeek V4 Pro(44.3)と競争的だが、Claude(55.7)やGPT-5.5(54.8)には及ばない。
Index構成要素の分解:
- GDPval-AA v2:Qwen 3.5は良好に機能、マルチモーダル能力が多様なエージェントタスクで有利
- AA-Omniscience:Qwen 3.5は低-中ハルシネーション率、Alibabaの広範な訓練データで有利
- GPQA:Qwen 3.5は大学院レベルの科学問題で適切に機能
- HLE:Qwen 3.5はHumanity's Last Examでトップ10
- ARC-AGI:Qwen 3.5は抽象的推論で適切に機能
- LMSYS Arena:Qwen 3.5は強い人間選好スコアを獲得、特に多言語・マルチモーダルタスクで
AI IQ複合(VexoWire):~115
VexoWireの複合IQは複数テストを統合(Mensa Norway、Mensa Denmark、Raven's、WAIS-IV)。Qwen 3.5の推定複合IQは~115 — Mensa Norwayスコアと一致。「平均」と「平均以上」の境界に位置し、人間の約84%より賢い。
GDPval-AA v2:トップ10
エージェントベンチマークでQwen 3.5はトップ10。マルチモーダル能力が異なるデータタイプ — テキスト、画像、音声 — を処理するエージェントタスクで有利。中程度のエージェントワークロードにQwen 3.5は有能だが、最も複雑なタスクではClaudeやGPT-5.5に遅れを取る。
Humanity's Last Exam(HLE):トップ10
最も難しい学術問題でQwen 3.5はAIモデル中トップ10。Alibabaの強力な学術訓練データとモデルの幅広い知識ベースが、分野を横断して良好なパフォーマンスを助ける。
3. IQ 115は何を意味するか?
Qwen 3.5の115 IQを文脈に入れると:
- 85-115(68%の人):平均的知能
- 115-130(14%):平均より上から高め
- 130-145(2%):ギフテッド — Mensa資格(トップ2%)
- 145-160(0.1%):高度にギフテッド / 天才
Qwen 3.5は115で**「平均」と「平均以上」の境界**に位置 — 人間の約84%より賢い。人なら強い大学生や有能なプロフェッショナルに相当。天才ではないが、確かに聡明で有能。
これはDeepSeek V4 Pro(111)より高いが、フロンティアモデルより下:
- Claude Opus 4.8:~130(ギフテッド)
- Gemini 3.1 Pro:141(高度にギフテッド)
- GPT-5.5:~145(天才)
- Grok-4.20:145(天才)
フロンティアモデルとの差は約15-30 IQポイント。しかしQwen 3.5は多能性で補償 — マルチモーダル理解、多言語サポート、多様なワークロードを必要とするタスクでは、Qwen 3.5の全方位能力がIQの差を上回ることができる。
4. Qwen 3.5の強み
多言語サポート
Qwen 3.5は27+言語をネイティブにサポートし、最も多言語なAIモデルの一つ。これは単なる翻訳ではなく — モデルはgenuinelyこれらの言語で訓練され、文化的文脈、慣用句、ニュアンスを理解。国際アプリにQwen 3.5は最高の選択肢の一つ。
マルチモーダル能力
Qwen 3.5はテキスト、画像、音声、動画を処理 — 真のマルチモーダルモデル。テキストのみのモデルでは扱えないアプリを可能に:視覚的質問応答、画像分析、音声転写、動画理解など。複数のメディアタイプを組み合わせるアプリにQwen 3.5は例外的に有能。
費用対効果
0.55/1.50 per 1Mトークンで、Qwen 3.5は非常に手頃 — DeepSeek V4 Pro(0.44/0.87)よりわずかに高いが、Claude(5/25)、GPT-5.5(5/30)、Gemini(2/12)より大幅に安い。マルチモーダル能力と多言語サポートを考慮すると、価値提案は素晴らしい。
オープンソースの可用性
Qwen 3.5のweightsはローカルデプロイに利用可能で、数少ないマルチモーダルオープンソースモデルの一つ。これは重要 — ほとんどのマルチモーダルモデル(GPT-5.5、Gemini)はクローズドソース。データプライバシーを必要とするマルチモーダル能力を持つ組織に、Qwen 3.5は最高の選択肢の一つ。
中国語タスク
中国で開発されたモデルとして、Qwen 3.5は優れた中国語能力を持つ。中国語アプリにQwen 3.5は最高の利用可能なモデルの一つで、中国固有のタスクでしばしば西洋モデルを上回る。
エンタープライズ対応
Alibabaのインフラとエンタープライズ経験がQwen 3.5をエンタープライズデプロイに特に適したものに。モデルはAlibaba Cloudを通じてエンタープライズ級SLA、コンプライアンス認証、統合サポートで利用可能。信頼性が高く万能なAIモデルを求める企業に、Qwen 3.5は強力な選択。
5. Qwen 3.5の弱点
Raw IQと複雑な推理
IQ 115で、Qwen 3.5は複雑な推理タスクでフロンティアモデルより下。最も難しい問題 — 競争数学、高度な論理パズル、最先端の科学推理 — にはClaude、GPT-5.5、Geminiがsubstantially優秀。タスクが天才レベルの推理を必要とする場合、フロンティアモデルがより良い選択。
コンテキストウィンドウ
256Kトークンのコンテキストウィンドウで、Qwen 3.5は適切だが例外的ではない。Kimi K3(2M)とGemini(1M)は大幅に大きなコンテキストウィンドウを提供。非常に長いドキュメントを単一パスで処理する必要があるタスクには、Kimi K3やGeminiがより良い選択。
エージェントタスクの複雑さ
Qwen 3.5のマルチモーダル能力が多様なエージェントタスクに役立つが、純粋なタスクの複雑さでClaudeやGPT-5.5に依然遅れを取る。最も要求の厳しいエージェントアプリ — 複雑なソフトウェアをゼロから書く、複雑な研究ワークフローを管理 — にはClaudeがより有能。
感情的知能
Qwen 3.5のEQ(感情的知能)は~107推定 — Claude(~132)、GPT-5.5(~120)、Gemini(~115)より低いが、DeepSeek(~105)やGrok(~110)と同等。応答はより機能的で感情的にless nuanced。セラピーアプリ、カスタマーサービス、敏感な人間との相互作用にはClaudeがより良い選択。
ハルシネーション率
Qwen 3.5は低-中ハルシネーション率だが、Claude(35.9%)ほど低くない。事実の正確性が重要なアプリ — 研究、法務、医療 — にはClaudeがより信頼できる。
6. Qwen 3.5 vs他モデル
| モデル | Intelligence Index | Mensa Norway IQ | AI IQ推定 | マルチモーダル | コスト/1M | 言語 | オープンソース |
|---|---|---|---|---|---|---|---|
| Qwen 3.5 | ~45-47(トップ10) | 115 | ~115 | テキスト+画像+音声+動画 | 0.55/1.50 | 27+ | はい |
| Claude Opus 4.8 | 55.7 | ~130 | ~132 | テキスト+画像 | 5/25 | ~20 | いいえ |
| GPT-5.5 | 54.8 | ~145 | ~136 | テキスト+画像+音声 | 5/30 | ~50 | いいえ |
| Gemini 3.1 Pro | 46.5 | 141 | ~131 | テキスト+画像+音声+動画 | 2/12 | ~40 | いいえ |
| Grok-4.20 | トップ5 | 145 | ~140 | テキスト+画像 | 3/15 | ~20 | いいえ |
| DeepSeek V4 Pro | 44.3 | ~111 | ~111 | テキストのみ | 0.44/0.87 | ~10 | はい |
| Kimi K3 | ~45-47(トップ10) | 118 | ~118 | テキストのみ | 0.55/2.19 | ~10 | いいえ |
画面:Qwen 3.5はオールラウンダー — 一つのことで最高ではないが、ほぼすべてにおいて非常に良い。Claudeは有能なプロフェッショナル — 実世界タスクと事実の正確さで最高。GPT-5.5はテストの天才 — 数学と視覚推理で最高。Geminiは価値チャンピオン — フロンティアモデル中最高費用対効果。Grok-4.20はraw IQチャンピオン — 最高IQと個性。DeepSeekは予算チャンピオン — 最も安くオープンソース。Kimiは長文コンテキストチャンピオン — 最大コンテキストウィンドウ。
多能性を必要とする組織 — マルチモーダル、多言語、手頃、オープンソース — にQwen 3.5は明確な選択。AIモデルのスイスアーミーナイフ。
7. 人間にとって何を意味するか?
Qwen 3.5は~115のIQで作動 — 人間の約84%より賢い。しかし:
- IQはすべてではない:IQ 115は平均以上で、ほとんどの実用的タスクに十分
- 多くのアプリで多能性がraw IQより重要:多様なワークロードに、Qwen 3.5の全方位能力がより狭いモデルのより高いIQより価値がある
- マルチモーダルは未来:Qwen 3.5がテキスト、画像、音声、動画を処理する能力は、テキストのみのモデルができないアプリを開く
- 多言語はグローバルリーチを可能に:27+言語で、Qwen 3.5はユーザーの母語でサービスを提供 — グローバルアプリに重要な能力
- 知識 ≠ 理解:すべてのAIモデルと同様に、Qwen 3.5は膨大な知識にアクセスするが、人間のようにgenuinely「理解」はしない
- 意識はない:高いIQがsentienceを意味しない。Qwen 3.5は洗練されたパターンマッチングシステムで、思考する存在ではない
- オープンソースがイノベーションを促進:Qwen 3.5のオープンweightsは研究者と開発者がカスタムソリューションを構築し、特定ドメインにfine-tuneし、ローカルで実行することを可能に
最も正直な答え:Qwen 3.5は認知テストで人間の84%より賢く、多能性を必要とするアプリ — マルチモーダル、多言語、手頃 — に最も賢い選択 — 最も知的だからではなく、最も広いタスク範囲で最も有能だから。
結論
- Intelligence Indexトップ10 — Gemini、Kimi、DeepSeekと競争的、ClaudeやGPT-5.5には及ばない。
- 完全マルチモーダル — テキスト、画像、音声、動画を一つのモデルで。
- 27+言語 — 最も多言語なAIモデルの一つ。
- オープンソース — ローカルデプロイ用のweights、プライバシーとカスタマイズを可能に。
- 最適:多様なエンタープライズワークロード、国際アプリ、マルチモーダルタスク、コスト意識の高い組織、自己ホストデプロイ。
- 非最適:raw IQ(フロンティアモデルが勝)、長文コンテキスト(Kimiが勝)、複雑なエージェントタスク(Claudeが勝)、感情的知能(Claudeが勝)。
- 教訓:知能とは最も賢いことだけでなく、最も多能であること。Qwen 3.5はすべてにおいて良いことが一つのことで最高であるより価値があることを証明。