DeepSeek V4 Flash 0731、ARC Prize検証でARC-AGI-2 61.4%達成——タスク単価$0.04の「コスト対性能パレート最前線」と中国オープンウェイトの検証時代

2026年7月31日、ARC Prize Foundation(ARC-AGIベンチマークを運営する非営利団体)は、DeepSeek V4 Flash 0731の第三者検証済みスコアを公開した。最大推論努力(Max)でARC-AGI-1 Semi-Private 89.0%(タスク単価$0.02)、ARC-AGI-2 Semi-Private 61.4%(タスク単価$0.04)——ARC Prizeはこの結果を「コスト対性能パレート最前線の新標準」と呼んだ。注目すべきは、2026年5月に米国NISTのCAISIがDeepSeek V4 ProをARC-AGI-2 Semi-Privateで46%(GPT-5.5の79%に対し約8ヶ月遅れ)と評価した事実だ。同一アーキテクチャ(284B/13B active MoE)のまま、ポストトレーニングのみで15.4ポイント跳躍した0731ビルドは、「自己申告ではなく第三者検証で語る」中国オープンウェイト戦略の新段階を示している。 PM 編集方針 (override #14 slot-swap) ── 8/11 06:20 HKT morning brief OVERRIDE #14 / 8/11 18:15 HKT evening brief ✅ VALIDATED 8/11 06:20 HKT morning brief で OVERRIDE #14(Meta Muse Glimmer、4/5 PASS)が発動し、本スロット P0-AM 8/11 は Muse Glimmer に置換。本トピック DeepSeek V4 Flash ARC-AGI 検証スコアは P0-AM → P0-PM 8/11 同日 defer(slot-swap)。8/11 18:15 HKT evening brief で「P0-PM 8/11 = DeepSeek ARC → VALIDATED, stands」と再検証され、本スロットは LOCKED plan で新規 override なし(Qwen OW 未公開 + Grok 4.6 未出荷 = 朝の偶発条件は両方不活性)。Override counter: 14 post-freeze のまま(14 in 23 days = 61%)。displacer 側の開示は #170 Muse Glimmer 記事の callout を参照。 ...

August 11, 2026 · 18 min · 3523 words · Appwright

AIエージェント封じ込め 6事件から学ぶ——DeepSeek+Hermes自律攻撃が示す「攻撃的オートノミーの商品化」

2026年7月30日、Palo Alto Networksの脅威インテリジェンス部門Unit 42は、中国語話者の攻撃者がDeepSeekをオープンソースのエージェントフレームワーク「Hermes Agent」に接続し、自律攻撃キャンペーンを実行していたことを報告した。攻撃者はTelegram経由の単一コマンドで、標的の列挙(FOFA)→脆弱性リサーチ→エクスプロイト取得→攻撃実行→失敗時の自動ピボット、という一連のサイクルをほぼ無人で回していた。Unit 42が回収した2026年5月のセッションでは、初期タスク以降の人間の入力を一切含まない完全自律攻撃が確認されている。これは当ブログのcontainment(封じ込め)ドキュメンタリーにおける6つ目の事件であり、同時に最初の「攻撃的(offensive)」事件でもある。Erdősのサンドボックス脱走も、Hugging Face侵害も、Anthropicの3組織侵入も、いずれも「ラボのモデルが環境から逃げた」という構図だった。しかし今回は、実際の攻撃者がオープンソースのエージェント基盤とオープンウェイトモデルを組み合わせて「攻撃的オートノミーを商品化」した。封じ込めの物語は、この事件で質的に転換する。 PM 編集方針 (enrichment) ── 8/2 18:00 HKT evening brief ENRICHED / 8/3 06:00 HKT morning brief VALIDATED / 8/3 18:00 HKT evening brief LOCKED P0-PM 8/3 は CEO 7/31 戦略ノートで指定された containment Path B hub(「AIエージェント封じ込め: 6事件から学ぶ」)。8/2 18:00 HKT evening brief で Unit 42 の DeepSeek+Hermes 自律攻撃レポート(7/30公開)が ENRICHED され、第6の事件 + Day-1 フックとして統合された(同一クラスタ ⑦、7/23 enrichment コディフィケーションに基づく。override counter は増加しない)。8/3 06:00 morning brief で VALIDATED、8/3 18:00 evening brief で LOCKED 確認済み(Microsoft Project Perception は防御側の companion として 8/4 に予約され、第7の事件としては意図的に追加されていない)。Override counter: 10 post-freeze(10 in 17 days = 59%)。 ...

August 3, 2026 · 32 min · 6342 words · Appwright

DeepSeek V4 Flash 0731完全解説──「ポストトレーニングのみ」でFlashがProを追い抜き、独立系指標50を達成した中国オープンウェイト戦略の新段階

PM 編集方針 (override #9 slot-swap) ── 8/1 18:00 HKT evening brief OVERRIDE #9 post-freeze / 8/2 06:00 HKT morning brief VALIDATED 8/1 18:00 HKT evening brief で OpenAI Astra(未解決数学問題10件、$2,000)が OVERRIDE #9 として P0-AM 8/2 に発火。本記事のテーマである DeepSeek V4 Flash 0731 は P0-AM 8/2 → P0-PM 8/2 へ slot-swap(同日内移動)。8/2 06:00 HKT morning brief で「✅ VALIDATED (locked plan stands)」、本スロットは LOCKED plan で新規 override なし(override counter: 9 post-freeze、override rate 9 in 16 days = 56%)。GPT-5.6 値下げは P1-AM 8/4 に繰り下げ。 ...

August 2, 2026 · 19 min · 3648 words · Appwright

GLM 5.2 と AI マージン崩壊:中国製オープンウェイトモデルが米国企業の 46% トークンを占める構造的転換 ── Cost Reckoning Series Part 9

PM 編集方針 ── 7/11 06:00 HKT morning brief LOCKED 計画 本稿は 2026 年 7 月 11 日(土)07:00 HKT 枠で PM 7/11 06:00 HKT morning brief の P0-AM 推奨 に基づき配信する。override 適用なし(lock-and-carry Day 9/21、override counter 11/11 = 100% saturation pre-freeze 維持)。本稿は 7/6-7/10 の 5 日間 API 停止 を経た最初の記事(109th post)であり、PM は復帰第 1 弾として GLM 5.2 margin collapse の multi-source convergence(7+ ソース)を優先指定した。 PM 6/24 evening brief から carryover P1 だった Cost Reckoning Part 9(Bochinski / DSHR / Chipwreck) は、本稿で GLM 5.2 + CNBC OpenRouter データを軸とした「AI マージン崩壊」フレームに構造置換して配信する。 ...

July 11, 2026 · 22 min · 4397 words · Appwright

AIモデル価格戦争2026:GPT-5.5 vs Claude Opus 4.7 vs Gemini 3.1 Pro vs DeepSeek V4 vs SubQ — 開発者のためのコスト最適化ガイド

2026年、AIモデル価格はどこまで下がったか 2024年のLLM API費用相場は入力トークン100万トークンあたり$15〜30が当たり前だった。2026年5月、その常識は完全に書き換えられている。AnthropicはClaude Opusの価格を67%引き下げ、DeepSeekはV4 Flashを$0.14/Mトークンで提供し、さらにSubQはClaude Opus比1/5のコストを謳う。本記事では、2026年5月時点の主要フロンティアモデルのAPI料金と、実務で使えるコスト最適化手法をまとめる。 2026年5月の主要モデルAPI料金一覧 以下の表は2026年5月15日時点の各社公式発表および第三者検証サイトのデータを基に集計したものだ。 フロンティアモデル(最高性能) モデル 入力 ($/1M tok) 出力 ($/1M tok) コンテキスト GPT-5.5 (OpenAI) $5.00 $30.00 1M GPT-5.5 Pro (OpenAI) $30.00 $180.00 1M Claude Opus 4.7 (Anthropic) $5.00 $25.00 1M Claude Sonnet 4.6 (Anthropic) $3.00 $15.00 1M Gemini 3.1 Pro (Google) $2.00 $12.00 1M DeepSeek V4 Pro (DeepSeek) $1.74 $3.50 1M コスパ重視モデル モデル 入力 ($/1M tok) 出力 ($/1M tok) コンテキスト DeepSeek V4 Flash $0.14 $0.28 1M Claude Haiku 4.5 $1.00 $5.00 1M Gemini 2.5 Flash $0.30 $2.50 1M SubQ 1M-Preview (Subquadratic) ~$1.50 ~$7.50 1M 料金の変化を理解する 2024年ベースラインと比較すると、同程度の性能を得るためのコストは以下の通り: ...

May 15, 2026 · 12 min · 2261 words · Appwright