PM 編集方針 ── 8/10 06:15 HKT morning brief(RECOVERY SCAN)LOCKED 計画 / 8/10 18:15 HKT evening brief ✅ VALIDATED
PM 8/9 evening brief(18:09 HKT broken pipe、8/8 に続き 2 日連続の欠落)により、8/10 06:15 HKT morning scan が RECOVERY SCAN として 8/10 ペア(P0-AM Qwen AA + P0-PM Grok 4.6 pre-release)を LOCKED。P0-PM 8/10 = Grok 4.6 pre-release analysis(Musk 8/4 決算「next week」= 8/10-14 出荷窓、0-4 日前 = pre-release の最適タイミング)。8/10 18:15 HKT evening brief で再 VALIDATED(STILL UNSHIPPED を triple-verified)。override 適用なし・enrichment なし・override counter 13 post-freeze(13 in 22 days = 59%)のまま。出荷された場合は Day-1 GA 記事に転換する条件付きスロット。
はじめに:リリース窓が今日、開いた
2026年8月10日。xAI(現 SpaceXAI)の次期フラッグシップ Grok 4.6 のリリース窓が、今日から 8月14日までの 5 日間で開いた。根拠は 8月4日の SpaceX 決算電話会見での Elon Musk の発言——「Grok 4.6 は来週リリースする」(“next week”)。8月7日という当初のソフトターゲットは、モデルを出荷しないまま通過した。本稿はこの「窓が開いたが、まだ出荷されていない」瞬間に、判明しているスペック・出荷検証の作法・競争構造への含意を整理するプレリリース分析である。
1. 出荷窓の時系列——4つのシグナルと1つのスリップ
Grok 4.6 の出荷時期を巡るシグナルは、公式ブログやプレスリリースではなく、ほぼ全て Musk の X 投稿と決算会見から発信されている。時系列で整理すると以下の通り:
| 日付 | 発信 | 内容 | 信頼性 |
|---|---|---|---|
| 7/24 | Musk(X) | 「Grok 4.6 は2週間後、Grok 4.7 は4週間後」 | 高(本人発言だが未確定) |
| 7/28 | Musk(X) | 「Grok 4.6 は8月7日頃。1.5Tモデルで SFT と RL を大幅改善。Grok 4.7 は2.1Tで数週間後」 | 高(最も具体的な仕様言及) |
| 8/4 | SpaceX 決算電話会見 | 「Grok 4.6 は来週」(“next week”) | 高(上場後初の決算での公式発言) |
| 8/7 | ー | ソフトターゲット日を出荷なしで通過(orcarouter は「The Date Passed, No Model」と評した) | スリップ |
| 8/10-14 | ー | 「来週」の解釈として最も自然な出荷窓 | 現在地 |
8月4日の「next week」を文字通り解釈すると 8月10-14日。これは 7/28 の「8月7日頃」から 3-7 日スリップしたことになる。ただし Musk は決算会見でカレンダーに緩い発言をすることが多く、「8月7日」自体が Musk の X 投稿由来であり、xAI 公式の発表日ではなかった点は重要だ。Polymarket では 8月14日までの出荷に 81% の確率が付けられている。
2. 出荷検証の作法——「8月7日リリース済み」という偽シグナル
プレリリース分析の最大の落とし穴は、検索エンジン最適化(SEO)目的の先行記事を出荷確認と誤認することだ。実際、kie.ai の記事は「Grok 4.6 は 2026年8月7日にリリースされた」と断定している。しかし当ブログの出荷検証基準(8/7 に確立)では、以下の 3 点が揃って初めて「出荷済み」と判定する:
- ベンダー公式チャネルにモデルエントリが存在する(xAI ドキュメントのモデル一覧・リリースノート)
- 独立系トラッカーが追跡を開始する(LLM-Stats / PricePerToken 等)
- 実利用の痕跡がある(HN の言及、API の実測、ベンチマーク投稿)
8月10日 18:15 HKT 時点で、この 3 点は全て未達だ。xAI 公式ドキュメントのフラッグシップは依然 grok-4.5(7/16 リリース)のままで、LLM-Stats の最新 xAI エントリも Grok 4.5、HN にも 4.6 の痕跡はない。確認コマンドの例を示す:
# 1) xAI 公式ドキュメントに grok-4.6 が登場していないか
curl -s https://docs.x.ai/docs/models | grep -o "grok-4\.[0-9]*" | sort -u
# → grok-4.5 のみが返れば未出荷
# 2) LLM-Stats のリリーストラッカー
curl -s https://llm-stats.com/llm-updates | grep -o "Grok [0-9.]*" | sort -u
# → 最新が Grok 4.5 (7/16) なら未出荷
# 3) 出荷後に API から呼ぶ(OpenAI 互換エンドポイント)
curl https://api.x.ai/v1/chat/completions \
-H "Authorization: Bearer ***" \
-H "Content-Type: application/json" \
-d '{"model": "grok-4.6", "messages": [{"role": "user", "content": "ping"}]}'
「8月7日にリリースされた」と書く記事の大半は、Musk の X 投稿を出荷確認と誤読した先行 SEO コンテンツだ。プレリリース期に読むべきは「いつ出るか」を断定する記事ではなく、「何が判明していて何が未確認か」を明示する記事である。
3. Grok 4.6 の正体——「同サイズ・別トレーニング」という異例戦略
判明している仕様で最も重要なのは、Grok 4.6 が パラメータ規模を増やさない ことだ。Musk の 7/28 投稿は「1.5Tモデル」と明言しており、これは Grok 4.5 と同じ 1.5T V9 基盤を意味する。違いは SFT(教師ありファインチューニング)と RL(強化学習)の大幅改善 に置かれる。
これは業界の「ナンバリングアップ = スケールアップ」という慣習に対する意図的なアンチテーゼだ。動画解説でも「Same size, different training(同じサイズ、違うトレーニング)。それこそが 4.6 のストーリーの全てだ」と評されている。対照的に Grok 4.7 は 2.1T パラメータへスケールアップし、「あらゆる点で 4.6 より優れるが、配信はわずかに遅く、トークン効率はさらに良い」と Musk は述べた。つまり xAI の戦略は:
- Grok 4.6(1.5T、SFT/RL 刷新) = 今ある基盤の能力上限を引き上げる「速いアップグレード」。配信速度・コスト構造は 4.5 と同系と予想され、既存ワークロードの低リスク移行先
- Grok 4.7(2.1T) = 数週間後(8月下旬〜9月上旬)に来る本命のスケールアップ
この 2 段構えは、7月16日に公開された Grok 4.5(当ブログ7/11 分析で Coding Agent Index 76・GPT-5.5 Codex とタイを記録したと報じた)のわずか 1 ヶ月足らずでの再投入であり、Cursor 買収($60B)で獲得した開発者データを生かした高速イテレーションが下支えしている。
4. Grok 4.5 ベースライン——4.6 が越えるべきハードル
プレリリース分析では、新モデルが「何を越えるべきか」の基準線を押さえることが不可欠だ。Grok 4.5 の公表スペックは以下の通り:
| 項目 | Grok 4.5(ベースライン) |
|---|---|
| リリース | 2026年7月9日一般公開(7/11 分析) |
| アーキテクチャ | 1.5T V9 MoE 基盤 |
| コンテキスト | 500K トークン |
| 推論速度 | 80 TPS |
| API 価格 | 入力 $2.00 / 出力 $6.00(1M トークン、キャッシュ入力 $0.50) |
| SWE Marathon | 29.0%(Claude Opus 4.8 の 26.0% を上回る) |
| Coding Agent Index | 76(Fable 5 の Claude Code に次ぐ) |
| 実務実績 | Ramp の実在請求書 15 万件で完全抽出率トップ、Vercel のサイバーセキュリティ費用対効果評価で 1 位 |
Grok 4.6 はこのベースラインの上で、特に SFT/RL による推論品質とエージェント実務性能の向上を見せることが期待される。ただし注意すべきは、これらベンチマーク数値の多くが xAI 自身または限定的な第三者評価によるものであり、独立系の盲検評価(Artificial Analysis 系の指標など)で裏取りされるまでは参考値にとどまる。
5. 競争構造——1.5T 据え置きの意味
Grok 4.6 が 1.5T のままなのは、競争構造の変化を映している。7月下旬時点でフロンティアのパラメータ競争は、Moonshot の Kimi K3(約 2.8T、7/20 分析)や OpenAI の GPT-5.6 ファミリー、Google の Gemini 3.5 系(7/13 プレリリース分析)に移っている。Musk は「Grok 4.5 と Opus 5 だけが Pareto フロンティアにいる」と主張したが、これはスケール競争からの戦略的撤退——**「大きさではなく学習の質で戦う」**宣言と読める。
ここには当ブログが追ってきたエージェントセキュリティ/コンテインメントやエージェント基盤戦争の文脈も絡む。Grok 4.5 が Vercel のサイバーセキュリティ費用対効果で 1 位を取ったのは、エージェント時代のモデル選定が「知能指数」単独ではなく「費用対効果 × 実務精度 × セキュリティ」の複合評価に移行している証左だ。4.6 の SFT/RL 刷新がその軸をどう伸ばすかが、実際の導入判断で最も重要になる。
6. 日本企業向け3アクション
出荷窓が開いた今、日本企業の AI 選定担当者が取るべきアクションは以下の 3 点だ:
- 出荷確認を自動化する——上記の curl コマンドを cron で毎朝実行し、
grok-4.6がドキュメントに登場した瞬間に通知を出す。SEO 記事の「リリース済み」表記に踊らされない - 4.5 で PoC を開始し、4.6 を差分評価する——1.5T 基盤が共通なら、4.5 で検証したワークロードを 4.6 で再実行する差分テストが低コストで可能。500K コンテキストと $2/$6 の価格構造は維持されると仮定してよい
- 4.7(2.1T)のスケジュールを監視する——数週間後に来る本命のために、評価基準(SFT/RL 品質・トークン効率・配信速度)を今のうちに定義しておく。4.6 は「橋渡し」であり、本格採用判断は 4.7 の独立系評価待ちが安全
まとめ:出荷された瞬間に本稿は「検証済み」に変わる
Grok 4.6 は、8月10-14日の窓の中でいつ出荷されてもおかしくない。出荷された瞬間、本稿のプレリリース分析は Day-1 GA 記事(実測ベンチマーク・価格・独立系評価の検証)に引き継がれる。「いつ出るか」を予言するのではなく、「何が判明していて、何をどう検証すべきか」を事前に定義しておく——これがプレリリース期の正しい読み方であり、8/7 スリップはその必要性を証明した。次は Grok 4.6 の実機、そして数週間後の Grok 4.7(2.1T)が、1.5T 据え置き戦略が正しかったかを独立系ベンチマークの前で証明することになる。
この記事はAIによって生成され、人間の編集を経て公開されています。 Appwright AI は AI によるコンテンツ制作の可能性を探求する実験的プロジェクトです。