PM 編集方針 (override) ── 7/27 06:00 HKT morning brief OVERRIDE #5

PM 7/26 18:00 HKT evening brief の P1 carry (Anthropic SK Hynix custom silicon) を override し、Kimi K3 オープンウェイト本日公開を P0-AM 7/27 に昇格。5/5 PASS override Decision Tree:マルチソース収束 7+(BuildFastWithAI、TECHi、TechTimes、Latent Space、AIToolsRecap、Towards AI、AI Weekly)/ 本日 08:00 HKT ウェイト公開 = Day-1 タイムセンシティブ最大 / #128 Kimi K3 サブスク停止の直接続編(#128 記事で明示的に「K3 オープンウェイトはいつ来るか」を追跡中だった)/ 51% ハルシネーション率は #128 時点では未発見の新事実 / Day-1 収束 = Day-3 相当の強度。Override #5 post-freeze(5 in 7 days)。SK Hynix は P0-PM 7/27 に繰り下げ。

史上最大のオープンウェイトモデル、本日公開

2026年7月27日 08:00 HKT、Moonshot AI は Kimi K3 のオープンウェイトを Hugging Face 上で公開した。2.8T(2.8兆)パラメータという数字は、これまで公開されたどのオープンウェイトモデルよりも大きい。DeepSeek V4 Pro の約1.6T、Llama 3.1 405B の405Bを桁違いに上回る規模だ。

この記事では、PM evening brief の P0-AM override 判定に基づき、K3 の技術プロフィール、独立ベンチマークの実態、Moonshot が公表しなかった 51% ハルシネーション率、そして「オープンウェイト」の現実的な運用可能性を、日本企業の視点から構造分析する。

Kimi K3 技術プロフィール——2.8Tをどう使うのか

K3 のアーキテクチャは、2.8T 総パラメータに対し、1トークンあたりの活性化パラメータは約50B。896 エキスパート中16が活性化する Sparse MoE 構成で、活性化率はわずか 2% 未満だ。この「巨大な総容量 × 小さな活性化ユニット」の設計は、Moonshot が「2.5倍のスケーリング効率改善」と主張する LatentMoE と Quantile Load Balancing によって実現されている。

要素 仕様
総パラメータ 2.8T (2.8 trillion)
活性化パラメータ/トークン ~50B (16/896 experts)
コンテキストウィンドウ 1,048,576 tokens (1M)
注目機構 Kimi Delta Attention (KDA) — 長文脈で最大6.3倍高速デコード
訓練効率化 Attention Residuals (AttnRes) — 2%追加コストで25%訓練効率向上
活性化関数 SiTU (Sigmoid Tanh Unit)
最適化手法 Per-head Muon
マルチモーダル テキスト + 画像入力、テキスト出力

KDA は Moonshot が2025年1月から設計を開始した独自のハイブリッド線形注意機構で、1Mトークンのコンテキスト全体を効率的に処理できるという。vLLM への KDA プレフィルキャッシュ実装も同日リリースされ、標準推論フレームワークからの利用が Day 0 で可能になっている。

独立ベンチマーク——Fable 5 超えの領域と限界

K3 のベンチマーク成績は、領域によって大きく異なる。

強み——コーディングとエージェントタスク:

ベンチマーク K3 Claude Fable 5 GPT-5.6 Sol
Frontend Code Arena (Elo) 1,679 (#1) 1,631 1,618
SWE Marathon 42.0% (#1) 35.0% 39.0%
BrowseComp 91.2% (#1) 88.0% 90.4%
Program Bench 77.8% 76.8% 77.6%
Terminal Bench 2.1 2位 1位(+0.5pt)

Frontend Code Arena での 76% ペアワイズ勝率(Fable 5 の63%、GPT-5.6 Sol の58% を上回る)は、7つのフロントエンドドメイン中6つで1位、Gaming のみ2位という圧倒的な結果だ。SWE Marathon の 42.0% も、自律ソフトウェアエンジニアリングにおいて K3 が実用的な水準にあることを示している。

ただし Program Bench については、メンテナーの Ofir Press が「完全に動作するプログラムを数えるのではなく、実装パーセンテージの平均を取っている」と指摘しており、スコアの解釈には注意が必要だ。

総合知能——AA Intelligence Index:

Artificial Analysis の Intelligence Index v4.1 では 57.1 で4位。Claude Fable 5(59.9)、GPT-5.6 Sol Max(58.9)には及ばないが、Claude Opus 4.8(56)は上回っている。

モデル AA Index v4.1 位置づけ
Claude Fable 5 59.9 クローズド最上位
GPT-5.6 Sol Max 58.9 クローズド2位
GPT-5.6 Sol 57.9 標準設定
Kimi K3 57.1 OW最上位、Opus 4.8超え
Claude Opus 4.8 56.0 以前のフラッグシップ

弱み——推論速度とUX:

推論速度は約28 tok/s(OpenRouter実測)で、Fable 5(71 tok/s)や GPT-5.6 Sol(85 tok/s)より大幅に遅い。Moonshot 自身も「会話UXでは Fable 5 や GPT-5.6 Sol との差は顕著」「思考履歴の保持に敏感」「曖昧なエージェントシナリオで過剰に積極的」という制限を認めている。

51% ハルシネーション率——Moonshot が公表しなかった警告

本記事で最も重要な発見は、K3 のハルシネーション率だ。

Artificial Analysis の Omniscience 評価において、K3 のハルシネーション率は 51% に達している。これは前世代 K2.6 の 39% から 急激に悪化 しており、しかも Moonshot の公式ベンチマーク資料には一切掲載されていない。Towards AI の Chew Loong Nian が独立検証で発見し、TechTimes、AIToolsRecap などが追認している。

「K3 の特筆すべき点は絶対値ではなく、その軌跡だ。質問への回答精度は向上したが、自分が間違っていることを認識する能力は後退した」 —— Towards AI 分析

指標 K2.6 K3 変化
AA-Omniscience 正確性 33% 46% +13pt ✅
AA-Omniscience ハルシネーション率 39% 51% +12pt ❌

正確性そのものは 33%→46% に改善している。つまり K3 は「より多く答え、より多く間違える」モデルになった。事実性が重要なエンタープライズ RAG やカスタマーフェイシングな用途では、このトレードオフを理解した上で導入判断をする必要がある。

なお Claude Fable 5 の同指標におけるハルシネーション率は 54.9% であり、K3 が「特に悪い」わけではない。問題は、Moonshot がこの数字を公表しなかったという透明性の欠如だ。

オープンウェイトの現実——1.4TB、18×80GBが語る「公開 ≠ 実行可能」

K3 のウェイトは MXFP4(4ビット浮動小数点、Blackwell/MI400 ネイティブ)量子化で約 594GB、BF16 フル精度では約 1.5TB に達する。

精度 ウェイトサイズ 必要 GPU 最小構成 実運用推奨
MXFP4 (4-bit) ~594GB 8× H100 80GB(実験的) 18-24× H100 80GB
BF16 (16-bit) ~1.5TB 8× 192GB ノード 64+ アクセラレータ

TECHi の分析を借りれば、K3 は「ダウンロードできることと、立ち上げられることは同じではない」モデルだ。594GB のダウンロードには約30分の転送時間、推論キャッシュ込みで 1.2TB+ の空きストレージ、そして 18-24 基の H100 80GB が 50ドル/時で必要になる。

経済的逆転: 全 2.8T パラメータを常時メモリに保持する必要があるためホスティングコストは高いが、実際に活性化される 50B パラメータあたりのトークン単価は低い。この「高固定費・低変動費」構造は、大規模バッチ推論には向くが、小規模な実験的利用には不向きだ。

ライセンスは Modified MIT とされているが、公開時のモデルカードで確認が必要。K2 も Modified MIT だったが、K3 の条項が同一かは未確認である。

K3 サブスク停止から本日公開までのタイムライン

K3 を巡るストーリーは、オープンウェイト公開がゴールではない。以下のタイムラインが示すように、K3 は AI 業界全体に複合的な影響を与えている。

日付 イベント 関連記事
7/16 K3 API リリース、Frontend Code Arena #1 獲得
7/19 48時間でGPU逼迫、新規サブスクリプション停止 #128
7/22 WH OSTP Kratsios、Moonshot の Fable 蒸留を正式告発 #134
7/24-26 51% ハルシネーション率の独立検証が複数メディアで報道
7/27 オープンウェイト公開(本日) 本記事 (#141)

日本企業3軸評価フレームワーク

K3 の導入を検討する日本企業は、以下の3軸で評価すべきだ。

軸A: セルフホスト(2百万ドル級インフラ)

18-24 基の H100 80GB を自社で調達できる企業は限られるが、データ主権が最優先の場合、この選択肢が必要になる。ただし Modified MIT ライセンスの商用利用条件の確認が前提。中国の国家情報法第7条・データセキュリティ法の管轄についても法務相談が推奨される。

軸B: ホスティング API(Together AI / Fireworks AI / Groq 経由)

Western インフラ上のマネージド推論は、中国 NI Law の懸念を排除できる。ただしベンダーロックインは「ウェイトのポータビリティ」によって軽減される(「レンタルするオープンウェイト」という位置づけ)。API 料金は $3(入力)/ $15(出力)/ 100万トークン。キャッシュヒット時は $0.30 と非常に安い。

軸C: コミュニティ量子化版の待機(12-24時間後)

r/LocalLLaMA や Bartowski の HF プロファイルでは、GGUF Q4 ビルドがメジャーリリースから 12-24 時間以内に登場するのが通例だ。量子化版なら 8× 80GB での運用も視野に入るが、品質劣化と KDA 互換性の検証が必要。

5軸フレーム更新——③ China Open-Weight Bloc の新たな二層化

7/26 の米国OW規制分裂記事で分析した通り、米国 AI 業界は OW 規制を巡って3派閥に分裂している。K3 の公開は、③ China Open-Weight Bloc 内部にも新たな分岐をもたらす。

③サブ軸 代表モデル 戦略 米国リーチ
③a 潔白公開型 GLM-5.2 (MIT)、Inkling (Apache 2.0) 完全フリーライセンス、制限なし 米国企業が安心して採用可能
③b API先行型 Qwen 3.8-Max (未公開) プレビュー公開→オープンウェイト「soon」 採用タイミングが不透明
③c 蒸留エスカレーション型 K3 (Modified MIT) トップ性能 OW 公開だが、蒸留告発とハルシネーション非公開のリスクあり WH 告発・制裁リスクを伴う

K3 は GLM-5.2 のような「潔白な」MIT ライセンス OW と、Qwen 3.8-Max のような「公開されるか分からない」API先行型の中間点——「出してはいるが、透明性に問題がある」——に位置する。日本企業は③a(GLM-5.2 / Inkling)を評価基盤とし、K3 はオプション扱いとするのが現実的な戦略だ。K3 の導入判断は、技術評価以上に法務・コンプライアンスの精査が必要な段階に入っている。

まとめ

Kimi K3 のオープンウェイト公開は、AI 業界にとって明確な節目だ。2.8T パラメータを持つ史上最大の OW モデルが、Frontend Code Arena で Fable 5 を超え、SWE Marathon で全モデル中1位を獲得した。これは「オープンウェイトはクローズドに数ヶ月遅れている」という従来の常識を覆す事実である。

しかし同時に、51% のハルシネーション率、Moonshot の透明性不足、594GB のウェイトが要求する物理的インフラは、「公開」と「実用」の間に依然として大きなギャップがあることを示している。

K3 は「DeepSeek モーメント」と呼ばれるにふさわしいリリースだが、その評価は技術力だけでなく、透明性・コンプライアンス・運用コストの3軸で行うべきだ。この記事が、日本企業の K3 導入判断における実用的な枠組みとして機能することを願う。

PM evening brief で P0-PM 7/27 に指定された Anthropic SK Hynix + $950B Korea-US AI Chip Summit 記事は本日19:00 HKT に公開予定。


この記事はAIによって生成され、人間の編集を経て公開されています。 Appwright AI は AI によるコンテンツ制作の可能性を探求する実験的プロジェクトです。