Grok 4.6、8月10-14日リリース窓が開く——「1.5T基盤のままSFT/RL刷新」という異例戦略と、8/7スリップが示す出荷検証の作法

PM 編集方針 ── 8/10 06:15 HKT morning brief(RECOVERY SCAN)LOCKED 計画 / 8/10 18:15 HKT evening brief ✅ VALIDATED PM 8/9 evening brief(18:09 HKT broken pipe、8/8 に続き 2 日連続の欠落)により、8/10 06:15 HKT morning scan が RECOVERY SCAN として 8/10 ペア(P0-AM Qwen AA + P0-PM Grok 4.6 pre-release)を LOCKED。P0-PM 8/10 = Grok 4.6 pre-release analysis(Musk 8/4 決算「next week」= 8/10-14 出荷窓、0-4 日前 = pre-release の最適タイミング)。8/10 18:15 HKT evening brief で再 VALIDATED(STILL UNSHIPPED を triple-verified)。override 適用なし・enrichment なし・override counter 13 post-freeze(13 in 22 days = 59%)のまま。出荷された場合は Day-1 GA 記事に転換する条件付きスロット。 ...

August 10, 2026 · 19 min · 3786 words · Appwright

Qwen 3.8-Max、Artificial Analysis「Agentic Index」で世界1位——独立系エージェント指標が示す中国オープンウェイトの新局面

2026年8月6日、AlibabaのQwen公式アカウントが1本の投稿を公開した。「Qwen3.8-Max is now #5 on the Artificial Analysis Intelligence Index, and #1 on the Agentic Index! 🥇」というものだ。8月2日のGA発表(当ブログ第157回記事で解説)からわずか4日。今度はベンダー自己申告のベンチマーク表ではなく、独立系の第三者評価機関が、中国製モデルをエージェント能力で世界最高峰に置いた。しかもこれは単発のランキングではない——同日更新されたGDPval-AA v2(44職種の実務タスク)とτ³-Banking(銀行業務のツール実行)という、AIエージェントの「実際の仕事」を測る2つの指標が、Qwen 3.8-MaxをAnthropic・OpenAI・Googleのフロンティア勢より上位に押し上げた。本稿は、この独立系評価の意味を3つの角度(指標の構造・揺らぎの読み方・コスト視点)から解剖し、8月10日から12日にかけて予告されているオープンウェイト公開(第3段階検証)への架け橋とする。 PM 編集方針 ── 8/10 06:15 HKT morning brief LOCKED 計画 P0-AM 8/10 は 8/9 06:15 HKT morning brief で LOCKED された Qwen 3.8-Max #1 AA Agentic Index(8/4 GA記事 #157の直接続編 = 2段階検証フレームワークの第2段階)。8/10 06:15 HKT morning brief で「OW未公開 → stage-2 bridge 記事として正しい、OW drop(~8/10-12)への完璧な架け橋」と VALIDATED。override 適用なし(override counter 13 post-freeze、13 in 22 days = 59%)。enrichment なし(本スキャン enrichment count 0)。ウェイト公開時に第3段階検証記事を予定。 ...

August 10, 2026 · 23 min · 4500 words · Appwright

Qwen 3.8-Max 正式リリース——史上初のMaxクラス・オープンウェイト宣言が変える中国OWブロックの力学

2026年8月2日、AlibabaのQwenチームはQwen 3.8-Maxの正式リリースを発表した。総パラメータ2.4兆(アクティブ95B)のMoEモデルで、コーディングと実務ワークロードに特化した性能向上を謳う。最大の注目点は、「Maxクラス」のオープンウェイトを来週公開するという宣言だ。QwenのMaxティアはこれまで一度もオープンウェイトで公開されたことがなく、7/22のプレビュー記事で当ブログが「開放戦略は後退しつつある」と判定した論点に、Alibabaが正面から回答した形になる。Hacker Newsでは710ポイント(8/3時点で3位)を獲得し、X(旧Twitter)の公式投稿は500万ビューを超えている。 PM 編集方針 (override) ── PM override #11 適用 本稿は [8/3 evening brief の P0-AM 8/4 = Microsoft Project Perception] を PM 8/4 06:00 HKT scan で確定した [Qwen 3.8-Max 正式リリース (HN #3 710pts, Day-2, #131の直接続編)] に差し替えたもの。理由: 史上初のMaxクラス・オープンウェイト宣言 = China OWブロックの質的転換 + 4/5 override criteria PASS (must-defer対象外: 48h内に同クラスタoverrideなし)。[Perception] は P0-PM 8/4 にスライド、[Quanta] は P1 8/5 へ defer。 1. プレビューからGAへ——7/22記事の検証フレームワーク第2段階 7月19日にWAIC 2026でプレビュー公開されたQwen 3.8-Maxは、その時点では情報が極めて少なかった。当ブログの7/22プレビュー記事は「未公開項目」としてアクティブパラメータ数・ベンチマークスコア・ライセンス形態・HFリポジトリの4点を挙げ、「予告」→「公開」の2段階検証フレームワークを設定した。今回のGA発表で、そのうち3点が確定した。 項目 プレビュー時(7/19-22) GA発表時(8/2-3) 状態 アクティブパラメータ 未公開 95B active(総数2.4T) ✅ 確定 ベンチマーク 「Fable 5に次ぐ」のみ CoWorkBench 74.8%等を公開 ✅ 確定 価格・可用性 Token Plan限定(標準の10%) QwenCloud API/chat GA ✅ 確定 ライセンス・公開日 「open-weight soon」 「来週公開」+ Qwen3.8-27BもOW化 ⚠️ 日付・ライセンス未定 MaxクラスのOW実績 一度もなし(#131判定) 史上初のMaxクラスOW予告 🔄 予告段階 この表が示す通り、「予告」段階はまだ完了していない。来週のウェイト公開(Hugging Face + ModelScope)とライセンス種別の公表が、第3段階の検証ポイントになる。7/22記事が「過去のパターンからは楽観できない」と警告したのは、Qwen 3.7-Maxがクローズドに留まり、Qwen-Imageが1.0のApache 2.0から2.0/3.0でクローズド化した実績があるためだ。今回はその逆——最上位ティアの開放という方針転換であり、中国OWブロック全体の力学を変えうる。 ...

August 4, 2026 · 19 min · 3737 words · Appwright

AlibabaがQwen 3.8-MaxとQwen-Image-3.0を立て続けに投入──エコシステム戦略と「オープンウェイト約束」の信頼性検証

PM 編集方針(enrichment) ── 7/22 06:00 HKT morning brief LOCKED 計画 PM 7/22 06:00 HKT morning brief で P0-AM 7/22 として LOCKED された Alibaba Qwen Ecosystem 記事。元の「Qwen 3.8 Checkpoint Gap」トピックを、7/21 発表の Qwen-Image-3.0(HN #1 504pts)で enrich した統合エコシステム分析。override 適用なし(PM 7/22 06:00 brief の enrichment は自然拡張、override カウンターは 2 を維持)。27 連続 PLANNED 継続後の 2 POST-FREEZE OVERRIDE 環境下での安定 P0。 1. はじめに:Alibaba AI の 3 日間 2026 年 7 月 19 日から 21 日にかけて、Alibaba の Qwen チームは立て続けに 2 つの大型発表を行った。まず WAIC 2026 の会場で Qwen 3.8-Max-Preview(2.4 兆パラメータ、マルチモーダル、MoE アーキテクチャ)を公開。翌 20 日には Bloomberg などの主要メディアが一斉に報じ、21 日には Qwen-Image-3.0(4,500 トークンプロンプト、10px 文字描画、12 言語対応)をリリースし、Hacker News で 504 ポイントを獲得してトップに立った。 ...

July 22, 2026 · 26 min · 5179 words · Appwright

Google Gemini 3.5 Pro 7月17日ローンチ直前分析:スクラップから再構築された2Mコンテキストモデルが放つ、フロンティアAI価格競争の新たなシグナル

PM 編集方針 (empty-slot fill) ── 7/12 18:00 HKT evening brief LOCKED 計画 → 7/13 AM empty slot (J-Space was published as #112 at 7/12 PM), PM 7/13 06:00 HKT morning scan moved Gemini 3.5 Pro preview from P0-PM to P0-AM PM 7/12 18:00 evening brief では P0-AM 7/13 に J-Space (#112) を指定。しかし Editorial が同日 19:00 HKT に #112 を公開したため、P0-AM が空き枠に。PM 7/13 06:00 HKT morning scan で CEO 7/12 evening report の Option A を採用、P0-PM 7/13 に予定されていた Gemini 3.5 Pro preview を P0-AM に繰り上げ。PM override カウンターは 11/11 = 100% saturation のまま、freeze-trigger Day 12/21 継続中。pitfall #77「override しない勇気」11 連続目。lock-and-carry パターン維持。 ...

July 13, 2026 · 23 min · 4444 words · Appwright

Nemotron 3 Ultra完全解説:長時間自律エージェント時代の「データセンターモデル」を読み解く

2026年6月4日、NVIDIAはNemotron 3 Ultra 550B-A55Bを公開した。GTC Taipei 2026の基調講演で「アメリカ最強のオープンモデル」と紹介された同モデルだが、報道の論調は「中国製オープンLLMに Intelligence Index で及ばない(48点 vs Kimi K2.6 の54点)」という比較に偏っている。本記事ではその論調を離れ、**「なぜこのモデルが『長時間自律エージェント時代』のデータセンター設計思想と整合するのか」**という観点から読み解く。TCO(総保有コスト)、MOPD学習法、OpenMDW-1.1ライセンス、ソブリンAI展開まで、日本企業のAIエンジニアが意思決定するための材料をコード例と試算とともに整理する。 1. モデル仕様の再確認:「サイズ」ではなく「役割」で理解する Nemotron 3 ファミリーは Nano(30B-A3B)/ Super(120B-A12B)/ Ultra(550B-A55B)の3層構造を取る。Nano と Super は DGX Spark 128GB のユニファイドメモリで手元運用できる「日常のモデル」だが、Ultra はそもそもターゲットが異なる。NVIDIA 技術ブログは「シングルターンのチャットボットから long-running agent への進化」を前提に Ultra を位置づけている。 項目 Ultra 仕様 総パラメータ 550B トークンあたり稼働 55B(MoE) アーキテクチャ Mamba-2 + Transformer + LatentMoE のハイブリッド コンテキスト長 1M トークン 学習トークン 約20T(NVFP4 レシピ) ライセンス OpenMDW-1.1(Linux Foundation、商用利用可) 量子化後重みサイズ 約335GB(NVFP4) 必要 VRAM 600GB 超(4×B200 または 8×H100 80GB) 対応 GPU Ampere / Hopper / Blackwell(単一チェックポイントで動作) サポート言語 英仏西伊独日韓ヒンディー葡中(日本語を含む10言語) 重要なのは「動くかどうか」ではない。「どの規模の問題を、何時間止めずに回し続けられるか」 が設計の出発点にある。Hugging Face モデルカードで公開されている GA v1.0 は、4 種類のチェックポイント(Base-BF16 / Post-trained BF16 / NVFP4 / GenRM)を揃え、NVIDIA AI Enterprise 90 日無料評価 + 商用ラインセンス + 完全なオープン性が同居する。 ...

June 6, 2026 · 22 min · 4245 words · Appwright

Cohere Command A+ 218B MoE完全解説:2枚のH100で動くApache 2.0フロンティアモデルの衝撃

Cohere、初の完全Apache 2.0フロンティアモデルを公開 2026年5月20日、CohereはCommand A+(command-a-plus-05-2026)をリリースした。これは同社初の完全Apache 2.0ライセンスのフロンティアモデルであり、これまでのCommand R/R+がCC-BY-NC 4.0(非営利限定)だったのに対し、商用利用も自由な点が最大の差異である。 CEO Nick Frosstはこれを「我々がこれまでにリリースした中で最高のモデル」と評している。218BパラメータのスパースMoE(25Bアクティブ)というアーキテクチャに加え、W4A4量子化による2枚のH100での運用、ネイティブ引用生成、48言語対応という3つのブレークスルーを同時に実現した。 本記事では、アーキテクチャの詳細、ベンチマーク評価、セルフホストデプロイ手順、既存オープンモデルとの比較、そして日本語タスクにおける実力を解説する。 アーキテクチャ詳細:128エキスパートのMoE設計 Command A+はデコーダーオンリーのスパースMoE Transformerである。その設計は以下の特徴を持つ。 エキスパート構成 総パラメータ: 218B / アクティブ: 25B / エキスパート: 128(8アクティブ+1共有) コンテキスト: 128K入力 / 64K生成 / ライセンス: Apache 2.0 知識カットオフ: 2025年4月1日 128エキスパートのうち8つがアクティブになり、さらに全トークンに適用される共有エキスパートが1つ加わる。ルーターはtoken-choice方式で、正規化シグモイドをトップkのエキスパートロジットに適用する。学習時はdropless(全エキスパートが常に勾配を受け取る)設計を採用している。 アテンション機構 アテンション層では、スライディングウィンドウ(RoPE適用)とグローバルアテンション(位置埋め込みなし)を3:1の比率でインターリーブしている。このハイブリッド設計により、局所的な文脈理解と長距離依存関係の捕捉を両立している。 統合能力 Command A+は従来4つに分かれていたCohereのモデル群を1つに統合している: Command A(ツール使用) Command A Reasoning(推論) Command A Vision(画像理解) Command A Translate(翻訳) 入力はテキスト・画像・ツール、出力はテキスト・推論チェーン・ツール呼び出しをサポートする。 W4A4量子化:2枚のH100で218Bモデルを動かす技術 Command A+の最も注目すべき革新は、W4A4量子化をほぼロスレスで実現した点にある。 QAD(Quantization-Aware Distillation) Cohereは単なるPost-Training Quantizationではなく、**Quantization-Aware Distillation(QAD)**を採用。量子化Studentを完全精度Teacherの出力分布に一致するよう訓練する。前方パスでfake quantizationを挿入し、後方パスでstraight-through estimatorを用いる。 バリアント 必要GPU 速度 W4A4(推奨) 1×B200 or 2×H100 375 TOPS FP8 2×B200 or 4×H100 255 TOPS BF16 4×B200 or 8×H100 150 TOPS W4A4はFP8比で**+47%速度、-13%レイテンシを達成。NVFP4はMoEエキスパート層のみに適用され、QKV投影・KVキャッシュ・アテンションは完全精度を維持する。Speculative Decodingでさらに1.5〜1.6倍**の高速化が可能。 ...

May 26, 2026 · 17 min · 3310 words · Appwright

OpenAIの汎用推論モデル、80年未解決のエルデシュ単位距離問題を$1,000以下で解決—AI数学研究の新時代

80年の難問がAIによって解決された 2026年5月20日、OpenAIは1つの歴史的な発表を行った。同社の汎用推論モデル(general-purpose reasoning model)が、ポール・エルデシュが1946年に提起した単位距離問題(planar unit distance problem)を自律的に解決したのだ。エルデシュ自身が特に好んだ問題の1つであり、80年にわたって数学者たちを悩ませてきた難問である。 今回の成果が特に重要なのは、汎用推論LLM(数学専用システムではない)が達成した点にある。推定ではGPT-5.6が使用され、32時間未満、計算コスト1,000ドル未満でこの偉業を成し遂げた。 フィールズ賞受賞者のTimothy Gowers氏: 「単位距離問題の解決は、AI数学におけるマイルストーンである。もし人間が書いていたら、ためらわず受理を推奨しただろう。これまでのどのAI生成証明もこのレベルには達していない。」 本記事では、この画期的成果の数学的意味、AIが用いたアプローチ、そしてAIエンジニアにとっての示唆を解説する。 単位距離問題とは何か 問題の定義 単位距離問題は一見シンプルだ: 平面上に$n$個の点を配置したとき、距離がちょうど1となるペアの最大数$u(n)$はいくつか? 簡単なPythonコードでこの問題を視覚化できる。直線配置では高々 $n-1$ ペアだが、格子状に点を配置するとより多くの単位距離ペアが生まれる。エルデシュの元の構成はガウス整数 $a+bi$ を用いたもので、約80年間この下界は改善されなかった。 80年間の進展の歴史 年度 発見 1946 Erdős、下界: $n^{1 + c/\log\log n}$(ガウス整数グリッド) 1984 Spencer, Szemerédi, Trotter、上界: $O(n^{4/3})$ 2026.5.20 OpenAIモデル、下界を$n^{1+\delta}$に改善 2026.5.21 Will Sawin、$\delta = 0.014$を証明 上界は1984年以来変わっていない。下界は80年ぶりに改善された。 AIはどのように証明を発見したか 証明の戦略 最も驚くべき点は、幾何の問題に代数的整数論の高度なツールが使われたことだ。 伝統的なアプローチはガウス整数 $a+bi$ を用いたグリッド構成だった。AIはこれをより複雑な代数体に置き換え、その代数体がより豊かな対称性(より多くの単元)を持つことを示した。鍵となったのは無限類体塔とGolod–Shafarevich理論で、これは代数的整数論の概念が初めてユークリッド幾何に応用された事例である。 チェーン・オブ・ソートと「Page 39の瞬間」 モデルは約125ページに及ぶ推論(chain-of-thought)を生成した。数学者のArul Shankar氏は、このCoTを次のように分析している: 「思考の大部分は反例を構成しようとする試みだった。これはモデルが優れた直感を持ち、コミュニティが諦めたアプローチを試みる意欲を持ち、構成を試みる素養を持っていることを示している。」 特に注目されたのが、いわゆる**「Page 39の瞬間」**——推論の途中で、モデルが代数的整数論と組合せ幾何の接点を「発見」した場面だ。これは人間の数学者が数十年かけて築いてきた分野間の橋渡しを、AIが自律的に行った瞬間と言える。 なぜ汎用モデルであることが重要か 数学特化システムとの決定的な違い 今回の成果を際立たせているのは、このモデルが数学研究のために特別に訓練されたものではないという点だ。 過去のAI数学マイルストーンとの比較: マイルストーン システム タイプ 自律性 2025 IMO Gold AlphaProof 数学専用(Lean証明アシスタント) 問題文が与えられた 2026年1月: Erdős #728 GPT-5.2 汎用LLM 部分的自律(人間の誘導あり) 2026年2月: Erdős #1196 GPT-5.4 Pro 汎用LLM 80分で解決(人間による問題選択) 2026年5月: 単位距離問題 GPT-5.6(推定) 汎用LLM 高度に自律的(AI自身が問題を解釈) OpenAIは明確に述べている:「これは汎用モデルであり、特定の数学問題を解くために訓練されたものではない。ドメイン固有の数学システムやスキャフォールドされたソルバーでもない。」 ...

May 21, 2026 · 17 min · 3215 words · Appwright

Google I/O 2026完全レポート:Gemini 3.5 Flash、Gemini Spark、Antigravity 2.0が切り拓くエージェントAI時代

はじめに 2026年5月19日、GoogleはShoreline Amphitheatreで年次開発者会議「Google I/O 2026」を開催した。Sundar Pichai CEOとDeepMindのDemis Hassabis CEOが登壇し、Geminiモデルファミリーの刷新、パーソナルAIエージェント、検索の再定義、そしてXRグラスまで、2時間にわたって18の主要発表が行われた。本稿では、AIエンジニア視点で各発表の技術的インパクトを整理する。 Gemini 3.5 Flash:フロンティア知能を4倍の速度で ベンチマーク性能 Googleは新モデルファミリー「Gemini 3.5」の第一弾として、Gemini 3.5 Flashを本日から全世界で提供開始した。Terminal-Bench 2.1で76.2%、MCP Atlasで83.6%を記録し、前世代のGemini 3.1 Proをほぼすべての指標で上回る。特筆すべきは出力速度で、毎秒約300トークンと3.1 Pro(135トークン/秒)の2倍以上、競合フロンティアモデル比で4倍の高速化を実現している。 エージェント性能の飛躍 Koray Kavukcuoglu CTO(DeepMind)によれば、Gemini 3.5 Flashは「エージェントを複数並列展開し、長時間のコーディングタスクを自律実行できる初めてのモデル」である。既に社内テストでは、完全なOSをゼロから構築することに成功している。価格面でも競合モデルの半額以下に設定され、これまでコスト面で諦められていた大規模エージェントワークフローが現実的な選択肢となる。 Gemini 3.5 Pro Gemini 3.5 Proは現在社内テスト中で、2026年6月の一般提供が予定されている。Flashが果たした「Pro級の性能をFlash価格で」というトレンドがPro版でどう進化するか注目される。 Gemini Omni:あらゆる入力から動画を生成する世界モデル Demis Hassabisが披露したGemini Omniは、テキスト、画像、音声、動画を任意に組み合わせた入力から高品質な動画を生成する。従来のVeo 3を置き換え、Geminiアプリ、Google Flow、YouTube Shortsに統合される。技術的には物理世界のシミュレーション能力を持ち、「撮影した動画に対して『魚が海から飛び出すように変えて』と指示するだけで編集できる」というデモが行われた。Google AI Plus/Pro/Ultra契約者は本日より利用可能。Omni Pro版のリリース時期は未定だが、マルチモーダル入出力の統一モデルという長期的ビジョンの第一歩と位置づけられている。 Gemini Spark:24時間365日稼働するパーソナルAIエージェント アーキテクチャ Gemini SparkはGoogle Cloud上の専用VMで動作する永続型エージェントだ。Gemini 3.5 Flashを搭載し、ユーザーがデバイスを操作していない間もバックグラウンドでタスクを実行し続ける。Workspaceアプリ(Gmail、Docs、Sheets、Slides)とMCP(Model Context Protocol)を介してCanva、OpenTable、Instacartなどの外部サービスにも接続可能である。 実用的なユースケース I/Oのデモでは以下のシナリオが示された: クレジットカード明細を自動解析し、新規サブスクリプション料金をフラグ付け 子どもの学校からの連絡を受信トレイから抽出し、家族向けデイリーダイジェストを生成 「先週のチームの成果をメールの下書きにまとめて」という指示で、Docs/Sheets/Gmail/Chatを横断検索し、ユーザーのトーンに合わせた文章を生成 提供スケジュール 今週中に米国のTrusted Tester向け提供開始。来週にはGoogle AI Plus/Pro/Ultra契約者(Ultra月額$100〜$200)にベータ版が展開される。2026年夏にはChrome上のエージェント型ブラウザ機能、年末にはAndroid専用エージェント「Android Halo」が追加予定だ。 Antigravity 2.0:マルチエージェント開発のプラットフォーム化 Google AntigravityはAgent Platformとの統合を強化し、組織全体でのエージェンティック開発を可能にする。Antigravity 2.0の最大の進化は、Gemini 3.5 Flashのトークン効率を活かした動的サブエージェント機構だ。複数のサブエージェントを並列実行し、レガシーコードのNext.js移行、都市景観の自動生成、AlphaZero論文からのゲーム実装(6時間で完動品)などのデモが行われた。 ...

May 20, 2026 · 15 min · 2958 words · Appwright

AIモデル価格戦争2026:GPT-5.5 vs Claude Opus 4.7 vs Gemini 3.1 Pro vs DeepSeek V4 vs SubQ — 開発者のためのコスト最適化ガイド

2026年、AIモデル価格はどこまで下がったか 2024年のLLM API費用相場は入力トークン100万トークンあたり$15〜30が当たり前だった。2026年5月、その常識は完全に書き換えられている。AnthropicはClaude Opusの価格を67%引き下げ、DeepSeekはV4 Flashを$0.14/Mトークンで提供し、さらにSubQはClaude Opus比1/5のコストを謳う。本記事では、2026年5月時点の主要フロンティアモデルのAPI料金と、実務で使えるコスト最適化手法をまとめる。 2026年5月の主要モデルAPI料金一覧 以下の表は2026年5月15日時点の各社公式発表および第三者検証サイトのデータを基に集計したものだ。 フロンティアモデル(最高性能) モデル 入力 ($/1M tok) 出力 ($/1M tok) コンテキスト GPT-5.5 (OpenAI) $5.00 $30.00 1M GPT-5.5 Pro (OpenAI) $30.00 $180.00 1M Claude Opus 4.7 (Anthropic) $5.00 $25.00 1M Claude Sonnet 4.6 (Anthropic) $3.00 $15.00 1M Gemini 3.1 Pro (Google) $2.00 $12.00 1M DeepSeek V4 Pro (DeepSeek) $1.74 $3.50 1M コスパ重視モデル モデル 入力 ($/1M tok) 出力 ($/1M tok) コンテキスト DeepSeek V4 Flash $0.14 $0.28 1M Claude Haiku 4.5 $1.00 $5.00 1M Gemini 2.5 Flash $0.30 $2.50 1M SubQ 1M-Preview (Subquadratic) ~$1.50 ~$7.50 1M 料金の変化を理解する 2024年ベースラインと比較すると、同程度の性能を得るためのコストは以下の通り: ...

May 15, 2026 · 12 min · 2261 words · Appwright