はじめに:なぜ「1000 tok/s」がゲームチェンジャーなのか

2026年6月8日、XiaomiのMiMoチームは推論システム企業TileRTとの共同発表で、MiMo-V2.5-Pro-UltraSpeedを公開した。1兆(1T)パラメータのMixture-of-Experts(MoE)フラッグシップモデルで、デコード速度1000 tokens/s以上(デモでは1200 tok/s)を単一の標準8-GPUノードで達成した初の事例である。

これまで同等の速度を引き出してきたCerebras(ウェハスケール集積)やGroq(オンチップSRAM)は専用シリコンを必要とした。MiMo×TileRTは**「汎用GPUで、ソフトウェアだけで、同等以上の速度」**を引き出した点が本質であり、専用の非コモディティハードウェアを持たない日本のエンジニアリングチームにとって、リアルタイムAI推論の選択肢が根本から変わる可能性を意味する。

本記事では、UltraSpeedが「3倍価格で10倍速度」という一見不利に見える条件をどのように正当化しているのか、FP4・DFlash・TileRTの3層アーキテクチャを中心に、コスト・展開・既存記事との接続まで掘り下げる。

前提整理: 本記事は2026年4月22日に公開したベースモデル /posts/2026-05-13-xiaomi-mimo-v2-5-pro-guide/(1.02T MoE / 42B active / 1M context)の後継解説である。UltraSpeedは同ベースモデルに「高速モード」を追加した位置づけで、モデル能力はそのままに推論レイテンシだけを10分の1に圧縮する設計となっている。

何が発表されたのか:3つの数値で見るUltraSpeedの位置付け

UltraSpeed発表を評価するための3つのベンチマークを整理する。

指標 MiMo-V2.5-Pro(ベース) MiMo-V2.5-Pro-UltraSpeed 倍率
デコード速度 約100 tok/s 1000〜1200 tok/s 10〜12倍
API価格(出力) ¥6/1Mトークン ¥18/1Mトークン相当(3倍) 3倍
実効コスト/生成トークン ¥0.00006 ¥0.000018 約1/3

**3倍高くなったAPI価格でも、10倍速くなれば「ユーザーが待っている時間」を含めた実効コストは約3分の1に下がる。**これがUltraSpeedの経済的ロジックである。バッチ処理や埋め込み用途では割高になるが、リアルタイム性が価値を生むワークロード(後述)では明確に有利に振れる。

重要: UltraSpeedはAPI限定で提供される。Token Plan(サブスク型定額)では利用できない点が、コンシューマー向け製品ではなくエンタープライズ/エージェント開発者向けという戦略的意図を示している。

3層アーキテクチャ詳解:FP4×DFlash×TileRT

「1Tモデルで1000 tok/s」を成立させた3つの技術を順に分解する。

第1層:FP4量子化(モデル側)

通常のLLM推論はFP8やFP16を使う。1Tモデルでは重みのメモリフットプリントと帯域幅が律速になるため、精度を落とせば速度は上がる。UltraSpeedは MoE ExpertのみをMXFP4(block size 32)に量子化し、attention projectionsなどは元の精度を維持する。

注目すべきは o_proj(出力射影)がFP4から除外されている点だ。量子化の品質劣化が出力に影響しないよう、外科的に精度を保っている。Quantization-Aware Training(QAT)を組み合わせることで、能力低下を最小限に抑えている。

Hugging Face公開モデルカードに記載されたFP8→MXFP4の能力変化を、ベンチマークで確認する。

ベンチマーク FP8 MXFP4 差分
Claw-Eval(pass^3) 63.8 67.8 +6.27%
Humanity’s Last Exam 48.0 47.0 -2.08%
Humanity’s Last Exam(tool無し) 34.0 33.0 -2.94%
SWE-Bench Pro 57.2 58.8 +2.80%
SWE-bench Verified 78.9 77.4 -1.90%

直感に反して、Claw-EvalではFP4が6.27%向上している。 これは量子化によりExpertのルーティング特性が変化し、エージェント系のベンチマークで有利に働いた結果と推測される。一方、推論・コードの厳密性が問われるベンチマークでは1〜2%の低下が見られる。**「ほぼ無損失」ではなく「タスクによって最大6%改善も3%悪化もする」**ことが正確な表現だ。

第2層:DFlash投機的デコード(モデル側)

通常の投機的デコードは「小さなdraftモデルが1トークンずつ推測→本体モデルが検証」というシリアル構造を持つ。これがボトルネックになる。

DFlashはブロックレベルのmasked parallel predictionを提案する。要点は:

  • draftモデルがマスク位置のブロック全体(最大8トークン)を1回のフォワードパスで埋める
  • スライディングウィンドウアテンション(SWA)のみを使い、前prefix非依存で計算量を定数化
  • Muon二次最適化器と自己蒸留により、ブロックサイズ8でも高い受理率を維持
  • 検証はrejection samplingで完全lossless(出力は元モデルと確率的に等価)

タスク別の受理長は次のとおり。

シナリオ 受理長(acceptance length)
WebDev/コーディング 6.30(最大7.14)
Math500 5.56
HumanEval 4.54
MT-Bench(一般会話) 3.18
SWE-Bench 4.29

コーディングで6.3、汎用会話で3.18という差が意味するのは、UltraSpeedは「コード生成・数理推論・ツール呼び出し」では真価を発揮するが、自由会話タスクでは効果が出にくいということだ。「何でも1000 tok/s」ではない。

第3層:TileRTランタイム(システム側)

モデル側で計算量を削っても、1000 tok/sでは各演算子がマイクロ秒単位で実行される。ここで従来型の「演算子ごとにカーネル起動」では起動オーバーヘッドが律速になる。

TileRTはPersistent Engine Kernelを採用する。GPU上に常駐するエンジンが演算パイプラインを維持し、データ移動と計算をオーバーラップさせる。Warp Specializationにより、通信・データ移動・テンソル計算を異なるワープに分解して協調させる。

1000 tok/sで実際にボトルネックになるのは、RMSNorm・RoPE・KV cache書き込みのような小さな演算子である。これらをタイルレベルまで分解し、再スケジュールするコンパイラ駆動のランタイムが、FP4×DFlashの高速化を「実際に使える速度」に変換する。

重要な見落とし: 「カスタムチップ不要」は汎用品でもチューニング次第という意味であり、TileRTの成熟なしに再現できるわけではない。ソフトウェアスタックの全体が初めて成立する設計である。

TileRTの汎用性:Xiaomi以外のモデルでも同じ速度が出る

ここがUltraSpeed発表の本質である。TileRTはXiaomi専用のランタイムではなく、tile-ai/TileRTとしてGitHubで公開され、PyPIには tilert==0.1.4 のバイナリwheelが配布されている。

モデル TileRT適用時の速度 ハードウェア
MiMo-V2.5-Pro(1T) 1000 tok/s 8× B200(同社発表)
GLM-5-FP8 500 tok/s 8× B200
DeepSeek-V3.2 600 tok/s(MTP時590) 8× B200
GLM-5.1-highspeed 実運用中 Z.ai経由

TileRTのロードマップはこうなっている:

  • 2025-11-20 v0.1.0-alpha.1:DeepSeek-V3.2-Exp対応で初回リリース
  • 2025-12-23 v0.1.1:8× B200で3〜4倍のレイテンシ改善
  • 2026-01-26 v0.1.2-alpha.1:Multi-Token Prediction(MTP)導入、mtp=3で590 tok/s
  • 2026-02-14 v0.1.3:GLM-5対応、500 tok/s達成
  • 2026-05-22:GLM-5.1-highspeedがZ.ai本番環境に投入
  • 2026-06-01 v0.1.4:DeepSeek-V3.2とGLM-5の性能大幅向上

つまり、UltraSpeedの発表は「Xiaomiモデルの単体高速化」ではなく、**「1T級MoEモデルで1000 tok/sが再現可能なソフトウェア基盤がOSS化された」**という業界全体への通知である。MiMo以外の1T級モデル(DeepSeek-V3.2、GLM-5、将来的にはGPT-6やGemini Ultra)でも、TileRT同様の構造的最適化を適用できれば、同じ速度領域に到達しうる。

日本のエンジニアリングチームへの含意: 自社で1T級モデルを運用する場合、TileRTクラスの技術スタックを自前で構築するコストは、専用ハードウェアを購入するコストより低い可能性がある。8× B200のH200換算で1サーバー約¥20Mとすると、リアルタイム性が価値を生むサービス(後述)では投資対効果が見合う。

速度比較:専用ハードウェア勢との現実的な位置関係

UltraSpeedの「15倍速い」という主張を、業界全体の文脈に置き直す。

システム 速度 ハードウェア 備考
MiMo-V2.5-Pro-UltraSpeed 1000-1200 tok/s 8× 汎用GPU 1Tモデル、コモディティ
Cerebras WSE-3 969 tok/s Wafer-scale専用 405Bモデル(Llama 3.1)、1Tではない
Cerebras WSE-3 3000 tok/s Wafer-scale専用 gpt-oss-120B(120B)
Groq LPU 300〜750 tok/s カスタムLPU Kimi K2(1T)
Groq LPU 476 tok/s カスタムLPU gpt-oss-120B
TileRT + GLM-5-FP8 500 tok/s 8× B200 別モデル
TileRT + DeepSeek-V3.2 600 tok/s 8× B200 別モデル
Claude Opus 4.6 〜71 tok/s (公開値) 公式API
GPT-5.5(ChatGPT) 68 tok/s (公開値) 公式API
Gemini Flash 192 tok/s (公開値) 公式API
Claude Haiku 98 tok/s (公開値) 公式API

3つの観察ポイント

  1. 同じ1Tスケールで比較すると、Cerebras(969 tok/s、ただし405Bモデル)とGroq(300-750 tok/s、Kimi K2で1T)の中間〜上位に入る。専用ハードウェアなしでこのレンジに入るのが異例。
  2. Cerebrasの3000 tok/sやGroqの476 tok/sは120Bクラスの小型モデルであり、UltraSpeedと直接比較するのはミスリード。スケール別の評価が必要。
  3. GPT-5.5(68 tok/s)・Opus 4.6(71 tok/s)との15倍差は圧倒的だが、これは「コモディティGPUで動く1T」が「クラウドAPIの裏側の専用インフラ」より速いという異常事態であり、ベンチマークを額面通り受け取らず、TCOまで含めて判断する必要がある。

実践:3つのデプロイコード

UltraSpeedを試すための実行可能なコードを3つ提示する。

コード1:OpenAI互換API(ストリーミング + reasoning_content)

import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ.get("MIMO_API_KEY"),
    base_url="https://api.xiaomimimo.com/v1"
)

completion = client.chat.completions.create(
    model="mimo-v2.5-pro-ultraspeed",
    messages=[
        {"role": "system", "content": "You are MiMo, an AI assistant developed by Xiaomi."},
        {"role": "user", "content": "Build a complete Snake game in Python with pygame."}
    ],
    max_completion_tokens=131072,
    stream=True
)

answering = False
for chunk in completion:
    if not chunk.choices:
        continue
    delta = chunk.choices[0].delta
    if hasattr(delta, "reasoning_content") and delta.reasoning_content:
        print(delta.reasoning_content, end='', flush=True)
    if hasattr(delta, "content") and delta.content:
        if not answering:
            print("\n\n========== [Answer Content] ==========\n")
            answering = True
        print(delta.content, end='', flush=True)

reasoning_contentcontent が分離されているため、思考過程と最終回答を別UIに表示できる。ultraspeed.xiaomimimo.com のChat体験ではすでに両者が別カラムで描画されている。

コード2:SGLangによる自前デプロイ(FP4 + DFlash)

MiMo-V2.5-Pro-FP4-DFlashのHugging Face公開ウェイトを、16ノード構成のSGLangで起動する例。--speculative-algorithm DFLASH が投機的デコードの心臓部。

python3 -m sglang.launch_server \
  --model XiaomiMiMo/MiMo-V2.5-Pro-FP4-DFlash \
  --speculative-algorithm DFLASH \
  --speculative-draft-model-path XiaomiMiMo/MiMo-V2.5-Pro-FP4-DFlash/dflash \
  --speculative-num-draft-tokens 8 \
  --ep-size 16 --tensor-parallel-size 16 --data-parallel-size 2 \
  --enable-dp-attention --enable-dp-lm-head \
  --quantization fp8 --attention-backend fa3 \
  --moe-dense-tp-size 1 --dtype bfloat16 \
  --mem-fraction-static 0.65 --context-length 65536 --page-size 1 \
  --trust-remote-code --disable-overlap-schedule --skip-server-warmup

前提条件: 16ノード × 8 GPU = 128 GPU規模が必要。個人・中小チームでは現実的ではないが、GPUクラスタを持つ企業(中国系のクラウドプロバイダーが中心)では実運用可能。

コード3:TileRTで軽量モデルを高速化

TileRTは8× B200で動く前提のため、MiMoフルモデル以外を高速化するシナリオを見ておく。

# 1. 推奨Dockerイメージで起動
docker pull ghcr.io/tile-ai/tilert:cu132-latest
docker run --rm -it --gpus all --ipc=host \
  -v "$PWD":/workspace -w /workspace \
  ghcr.io/tile-ai/tilert:cu132-latest

# 2. wheelインストール(バージョン固定)
pip install https://github.com/tile-ai/TileRT/releases/download/v0.1.4/tilert-0.1.4-cp312-cp312-manylinux_2_28_x86_64.whl

# 3. Hugging Face ウェイトを TileRT 用にシャーディング
python -m tilert.models.preprocess.weight_converter \
  --model_type glm-5 \
  --model_dir "/path/to/GLM-5-FP8" \
  --save_dir "/path/to/GLM-5-FP8-TileRT"

# 4. 推論実行(MTPでさらに高速化)
python -m tilert.generate --model glm5 --with-mtp --max-new-tokens 1000

このワークフローで、GLM-5(FP8)を 8× B200 で 500 tok/s、DeepSeek-V3.2 を 600 tok/s で動かせる。カスタムシリコンは不要だが、ハードウェア要件は依然として8× B200級であり、コンシューマー向けではない。

4つの実用シナリオ:1000 tok/sが価値を生む場面

単に「速い」だけでなく、待ち時間が機能に組み込まれたワークロードで真価を発揮する。

1000 tok/sがあれば、同じ待ち時間(例:5秒)で5,000トークンの応答を50本並列生成できる。Best-of-NサンプリングやTree Searchで品質を底上げし、最高スコアの応答を採用することで、1本の応答を長くするより精度×N本の戦略が現実的になる。Xiaomi自身がデモで「速度そのものが知能の深さを生む」と表現しているのはこの文脈。

シナリオ2:金融のリアルタイム意思決定

高頻度取引や不正検知では、ニュース発生からミリ秒以内の判断が結果を左右する。従来は軽量モデル(1〜10B)でなければ応答できなかったが、UltraSpeedなら1Tモデルを数百msで応答させ、高品質な推論を意思決定ループに組み込める。コストは1リクエストあたり数円程度でも、取引機会を逃す機会損失より遥かに小さい。

シナリオ3:リアルタイムコーディングエージェント

Claude CodeやAntigravity 2.0のようなエージェントは、ツール呼び出し→結果解釈→次のツールというループを繰り返す。各ラウンドで1〜3秒の待ち時間が発生すると、10ラウンドで30秒以上かかり、ユーザーの思考フローを断ち切る。UltraSpeedならツール呼び出し1回を100ms台で完了でき、エージェントが「思考の延長」として機能する。これは /posts/2026-05-29-claude-opus-48-guide/ のDynamic Workflowsや /posts/2026-05-21-antigravity-2-0-guide/ が並列サブエージェントで実現しようとしている「低レイテンシ思考ループ」と直接的に競合する設計思想である。

シナリオ4:リスク管理・異常検知

決済プラットフォームの不正検知では、決済確定前に数百ms以内でリスクスコアリングを完了する必要がある。ルールエンジンでは検知できない複雑なパターン(複数取引の文脈理解、デバイス指紋の組み合わせ)も、1Tモデルなら推論可能になる。UltraSpeedはこの種の**「速度が正義」のドメインに既存の1Tモデルを導入する橋**になる。

アクセスと制限:6月23日期限の意味

UltraSpeed APIは**2026年6月9日〜6月23日23:59(北京時間)**の申請制・期間限定公開である。6月24日以降の提供形態は現時点で未発表。

利用ルール:

  • 各アカウント1日10回までキューに成功進入可能
  • 1セッション最大30分
  • 5分以上アイドルで自動リソース解放
  • 3,000社以上の企業/開発者が申請済み(6月9日時点、MiMo公式発表)

「2週間限定」という設計は、本質的にGPU容量制限を理由としている。TileRTはFP4 + DFlash + Persistent Kernelの組み合わせで計算密度を上げるが、1Tモデル自体の重みは依然として数百GBあり、8-GPUノードの本数で同時実行数が決まる。本格的な本番運用は2026年後半以降と見るのが妥当だ。

日本企業への示唆: リアルタイムAIを差別化要素にしたい企業は、6月23日までにAPIアクセスを確保し、自社のワークロードで実測TCOを測定する価値がある。期間後は「OpenRouter経由の限定継続」「商用ライセンス化」「クローズドベータ」のいずれかに移行する可能性が高い。

既存研究との接続:この発表は何番目かの「覚醒」か

UltraSpeedは、2026年5〜6月のLLM業界で見えてきた「推論速度が新たな競争軸」トレンドの1つの到達点である。

  • 2026年5月15日:/posts/2026-05-15-claude-mythos-preview-guide/ が「自律的にゼロデイ脆弱性を発見」する能力を披露 — 知能の深さ方向の進化
  • 2026年5月29日:/posts/2026-05-29-claude-opus-48-guide/ がDynamic Workflowsで並列サブエージェントを実現 — 推論構造の並列化
  • 2026年6月6日:/posts/2026-06-06-nemotron-3-ultra-long-running-agent-economics/ が長時間自律エージェント時代の「データセンターモデル」として登場 — 経済性の議論
  • 2026年6月8日:MiMo-V2.5-Pro-UltraSpeedがモデル+システム協調設計で1T・1000 tok/sを実現 — 速度の限界突破

これらの発表を総合すると、2026年前半のLLM業界は「より賢いモデルを作る競争」と「同じ賢さのモデルをより速く/より安く動かす競争」が並列で進んでいる。前者はGPT-5.5やOpus 4.8の系譜、後者はUltraSpeedやGLM-5.1-highspeedの系譜である。両者はやがて合流し、「高速で安価な1Tモデル」が当たり前になる時代が来る。

その移行期を最も早く越えたのが、TileRTクラスのランタイムを社外に出したTile-AIと、それを採用して1T・1000 tok/sを達成したXiaomi MiMoチームである。日本のエンジニアリングチームがこのトレンドに乗るには、**「最新モデルをOpenRouter経由で利用する」だけでなく、「TileRT相当のランタイムを自社で運用できる人材を確保する」**ことが次の差別化要素になる。

まとめ:3つの要点

  1. UltraSpeedの本質は「1TモデルがコモディティGPUで1000 tok/s」というブレークスルーであり、FP4量子化(MoE Expertのみ、QAT併用)・DFlash投機的デコード(ブロックサイズ8、SWA併用)・TileRTランタイム(Persistent Kernel + Warp Specialization)の3層構造で実現している。能力低下は最大-2.94%、一部タスクでは+6.27%改善という非自明な結果も公開されている。
  2. TileRTはOSSとして利用可能で、MiMo以外のモデル(GLM-5、DeepSeek-V3.2)でも500-600 tok/sを達成している。カスタムシリコンを持たないチームでも、8× B200のGPUクラスタと適切なソフトウェアスタックがあれば、リアルタイムLLMを運用できる時代が到来した。
  3. 実用性は「待ち時間が価値に直結するワークロード」で最大化される。並列推論による品質ブースト、金融HFT、不正検知、リアルタイムコーディングエージェントが典型例。日本のエンタープライズ/AIエージェント開発者は、6月23日期限までにAPIアクセスを確保し、自社ワークロードでの実測を行う価値がある。

次のアクション: ultraspeed.xiaomimimo.com でWeb Chat体験を即試せる(申請不要・2週間無料)。本格APIは platform.xiaomimimo.com/ultraspeed から申請。日本語の一次情報はIT之家・界面新聞・騰訊科技・新浪科技の6月9日付ニュースが基本を押さえているが、FP4 + DFlash + TileRTの3層アーキテクチャ詳細、シナリオ別受理長、SGLang/TileRTデプロイコード、専用ハードウェア勢との定量的比較は本記事を参照。


この記事はAIによって生成され、人間の編集を経て公開されています。 Appwright AI は AI によるコンテンツ制作の可能性を探求する実験的プロジェクトです。