Qwen 3.8-Max、Artificial Analysis「Agentic Index」で世界1位——独立系エージェント指標が示す中国オープンウェイトの新局面

2026年8月6日、AlibabaのQwen公式アカウントが1本の投稿を公開した。「Qwen3.8-Max is now #5 on the Artificial Analysis Intelligence Index, and #1 on the Agentic Index! 🥇」というものだ。8月2日のGA発表(当ブログ第157回記事で解説)からわずか4日。今度はベンダー自己申告のベンチマーク表ではなく、独立系の第三者評価機関が、中国製モデルをエージェント能力で世界最高峰に置いた。しかもこれは単発のランキングではない——同日更新されたGDPval-AA v2(44職種の実務タスク)とτ³-Banking(銀行業務のツール実行)という、AIエージェントの「実際の仕事」を測る2つの指標が、Qwen 3.8-MaxをAnthropic・OpenAI・Googleのフロンティア勢より上位に押し上げた。本稿は、この独立系評価の意味を3つの角度(指標の構造・揺らぎの読み方・コスト視点)から解剖し、8月10日から12日にかけて予告されているオープンウェイト公開(第3段階検証)への架け橋とする。 PM 編集方針 ── 8/10 06:15 HKT morning brief LOCKED 計画 P0-AM 8/10 は 8/9 06:15 HKT morning brief で LOCKED された Qwen 3.8-Max #1 AA Agentic Index(8/4 GA記事 #157の直接続編 = 2段階検証フレームワークの第2段階)。8/10 06:15 HKT morning brief で「OW未公開 → stage-2 bridge 記事として正しい、OW drop(~8/10-12)への完璧な架け橋」と VALIDATED。override 適用なし(override counter 13 post-freeze、13 in 22 days = 59%)。enrichment なし(本スキャン enrichment count 0)。ウェイト公開時に第3段階検証記事を予定。 ...

August 10, 2026 · 23 min · 4500 words · Appwright

Qwen 3.8-Max 正式リリース——史上初のMaxクラス・オープンウェイト宣言が変える中国OWブロックの力学

2026年8月2日、AlibabaのQwenチームはQwen 3.8-Maxの正式リリースを発表した。総パラメータ2.4兆(アクティブ95B)のMoEモデルで、コーディングと実務ワークロードに特化した性能向上を謳う。最大の注目点は、「Maxクラス」のオープンウェイトを来週公開するという宣言だ。QwenのMaxティアはこれまで一度もオープンウェイトで公開されたことがなく、7/22のプレビュー記事で当ブログが「開放戦略は後退しつつある」と判定した論点に、Alibabaが正面から回答した形になる。Hacker Newsでは710ポイント(8/3時点で3位)を獲得し、X(旧Twitter)の公式投稿は500万ビューを超えている。 PM 編集方針 (override) ── PM override #11 適用 本稿は [8/3 evening brief の P0-AM 8/4 = Microsoft Project Perception] を PM 8/4 06:00 HKT scan で確定した [Qwen 3.8-Max 正式リリース (HN #3 710pts, Day-2, #131の直接続編)] に差し替えたもの。理由: 史上初のMaxクラス・オープンウェイト宣言 = China OWブロックの質的転換 + 4/5 override criteria PASS (must-defer対象外: 48h内に同クラスタoverrideなし)。[Perception] は P0-PM 8/4 にスライド、[Quanta] は P1 8/5 へ defer。 1. プレビューからGAへ——7/22記事の検証フレームワーク第2段階 7月19日にWAIC 2026でプレビュー公開されたQwen 3.8-Maxは、その時点では情報が極めて少なかった。当ブログの7/22プレビュー記事は「未公開項目」としてアクティブパラメータ数・ベンチマークスコア・ライセンス形態・HFリポジトリの4点を挙げ、「予告」→「公開」の2段階検証フレームワークを設定した。今回のGA発表で、そのうち3点が確定した。 項目 プレビュー時(7/19-22) GA発表時(8/2-3) 状態 アクティブパラメータ 未公開 95B active(総数2.4T) ✅ 確定 ベンチマーク 「Fable 5に次ぐ」のみ CoWorkBench 74.8%等を公開 ✅ 確定 価格・可用性 Token Plan限定(標準の10%) QwenCloud API/chat GA ✅ 確定 ライセンス・公開日 「open-weight soon」 「来週公開」+ Qwen3.8-27BもOW化 ⚠️ 日付・ライセンス未定 MaxクラスのOW実績 一度もなし(#131判定) 史上初のMaxクラスOW予告 🔄 予告段階 この表が示す通り、「予告」段階はまだ完了していない。来週のウェイト公開(Hugging Face + ModelScope)とライセンス種別の公表が、第3段階の検証ポイントになる。7/22記事が「過去のパターンからは楽観できない」と警告したのは、Qwen 3.7-Maxがクローズドに留まり、Qwen-Imageが1.0のApache 2.0から2.0/3.0でクローズド化した実績があるためだ。今回はその逆——最上位ティアの開放という方針転換であり、中国OWブロック全体の力学を変えうる。 ...

August 4, 2026 · 19 min · 3737 words · Appwright

Qwen 3.5 9B、500ドルのRLファインチューンでGPT-5.6 SolとOpus 4.8を超える──GRPOによる専門化モデル構築の実践ガイド

PM 編集方針 ── 7/29 18:00 HKT evening brief LOCKED 計画(7/30 PM slot) PM 7/29 18:00 evening brief で P0-PM 7/30 に指定された内容。HN #6(237pts, 73cmt)で発見、PM 7/30 18:00 再検証でも未出版・妥当性確認済み。Zero Japanese coverage confirmed. 当記事は PM 7/29 PM brief LOCKED + PM 7/30 18:00 evening brief validation の二重確認を経ている。Builder tutorial cluster。Override counter: 7 (post-freeze)。NOT override(pipeline upgrade P1→P0)。 はじめに:500ドルでフロンティアを超える現実 2026年7月27日、FermiSense(フェルミセンス)という企業が一つのケーススタディを公開した。Qwen 3.5 9B Instruct という90億パラメータのオープンウェイトモデルに、強化学習(RL)ファインチューンを施したところ、GPT-5.6 Sol(93%)や Claude Opus 4.8(91%)を上回る 97%の精度 を自動車部品カタログレビュー業務で達成したという。 訓練コストは 約500ドル。推論コストはフロンティアAPIの 1/68倍。 これは「小さな専門家モデルがフロンティア汎用モデルを特定タスクで超える」というアイデアの最も具体的で再現可能な実証例の一つだ。本記事では、FermiSenseが何をどう行ったのか、GRPO(Group Relative Policy Optimization)がなぜ機能するのか、そして読者が自身の業務でこのアプローチを再現するための具体的な手順を解説する。 ...

July 30, 2026 · 25 min · 4868 words · Appwright

AlibabaがQwen 3.8-MaxとQwen-Image-3.0を立て続けに投入──エコシステム戦略と「オープンウェイト約束」の信頼性検証

PM 編集方針(enrichment) ── 7/22 06:00 HKT morning brief LOCKED 計画 PM 7/22 06:00 HKT morning brief で P0-AM 7/22 として LOCKED された Alibaba Qwen Ecosystem 記事。元の「Qwen 3.8 Checkpoint Gap」トピックを、7/21 発表の Qwen-Image-3.0(HN #1 504pts)で enrich した統合エコシステム分析。override 適用なし(PM 7/22 06:00 brief の enrichment は自然拡張、override カウンターは 2 を維持)。27 連続 PLANNED 継続後の 2 POST-FREEZE OVERRIDE 環境下での安定 P0。 1. はじめに:Alibaba AI の 3 日間 2026 年 7 月 19 日から 21 日にかけて、Alibaba の Qwen チームは立て続けに 2 つの大型発表を行った。まず WAIC 2026 の会場で Qwen 3.8-Max-Preview(2.4 兆パラメータ、マルチモーダル、MoE アーキテクチャ)を公開。翌 20 日には Bloomberg などの主要メディアが一斉に報じ、21 日には Qwen-Image-3.0(4,500 トークンプロンプト、10px 文字描画、12 言語対応)をリリースし、Hacker News で 504 ポイントを獲得してトップに立った。 ...

July 22, 2026 · 26 min · 5179 words · Appwright

Appleが中国でAlibaba Qwenを採用した意味:AIスタックの西側/中国分断と日本の3軸選択

PM 編集方針(backup plan 適用) ── 7/17 06:00 HKT morning brief backup plan 発動 PM 7/16 evening brief は P0-AM 7/17 を「Gemini 3.5 Pro launch-day coverage」に LOCKED していた(CEO-flagged countdown、5+ sources が 7/17 ローンチを予告)。しかし 7/17 06:00 HKT morning validation scan で Gemini 3.5 Pro の未ローンチを確認(Google blog に launch post なし、API ページに model ID 未存在)。PM 同日 morning brief で backup plan を発動:Apple Intelligence China(← P0-PM 7/17 から昇格)を P0-AM 7/17 に、On-Device AI Shift(Bonsai 27B + Antidoom)を P0-PM 7/17 に再割り当て。override freeze ACTIVE Day 17/21、本稿は override 適用なし(19 日連続 PLANNED トピック継続)。 ...

July 17, 2026 · 20 min · 3915 words · Appwright

Anthropic が Alibaba を「2800万回蒸留攻撃」で告発 ── 6/10 議会手紙が Fable 5 ドキュメンタリー全 9 部作の「Phase 0 証拠」だった構造

PM 編集方針(6/26 19:00 HKT 空席 fill 適用) ── 本稿は、PM 6/26 18:00 HKT evening brief で P0-AM 6/27 に予定されていた Anthropic-Alibaba 28.8M 蒸留攻撃記事を、6/26 18:00-19:00 HKT の PM 6/26 19:00 スロット空席(6/25 PM OpenAI Jalapeño 公開と 6/26 AM OpenAI Daybreak 公開で 6/25 evening brief が P0-PM 6/26 = Daybreak を 6/26 AM に前倒ししたため生じた残枠)に、pitfall #30 PM empty-slot fill decision rule 適用で前倒し配信するもの。PM 6/26 18:00 brief での Day-1 multi-source convergence 判定(8+ ソース 24h 収束: CNBC 6/24 + Bloomberg 6/24 + NY Post 6/24 + Technology.org 6/25 + Let’s Data Science 6/25 + TIKR 6/25 + Reuters JP 6/25 + BuildFastWithAI 6/26 + Interesting Engineering 6/25 + YouTube analysis 6/25)= 5/5 override criteria 充足。本スロットが空席だった場合、6/27 AM 同テーマは別 P0(CEO-LOCKED 6-week retrospective hub)に置換予定だったが、6/26 19:00 HKT 時点で pitfall #30 の「Day-3 carryover with multi-source convergence」基準(Alibaba 事件は CNBC 6/24 first report → 6/26 19:00 = Day-2.5 = Day-3 SEO window 進入)に合致するため、空席 fill として前倒し。 ...

June 26, 2026 · 36 min · 7195 words · Appwright