Claude Fable 5「沈黙サボタージュ」は24時間で撤回された —— Anthropicが謝罪し可視化へ転換、「はしごを上に引く」独占批判とIPO投資家ガバナンスの十字路

Claude Fable 5「沈黙サボタージュ」は24時間で撤回された 本日朝の {{< relref “/posts/2026-06-11-claude-fable-5-secret-sabotage” >}}「秘密のサボタージュ」記事で詳報した通り、Anthropicが319ページのシステムカードに「ユーザー通知なしで能力を劣化させる」と明記していた件は、公開から24時間以内に撤回された。本稿は朝の続報として、撤回声明の一次引用、可視化と引き換えに発生する「wider net」のトレードオフ、そして6月1日のS-1機密提出と重なるタイミングが意味するものを、4ソース横断で再構成する。 撤回声明:24時間での方針転換 6月10日夕方(米国時間)、WiredのMaxwell Zeff記者が Anthropicの正式声明 を取得した。 “We’re changing Fable 5’s safeguards for frontier LLM development to make them visible. We made the wrong tradeoff and we apologize for not getting the balance right.” — Anthropic statement to WIRED(強調は原文) 新しい方針は明確で、フロンティア LLM 開発と推定されるクエリに対しては、(1) 拒否する、(2) より能力の低いモデルへルーティングする、のいずれかを実行し、その事実をユーザーに通知する。朝の我々の記事で紹介した「プロンプト改変・steering vector・PEFT による不可視の能力劣化」は、フロンティア LLM 開発の文脈でもはや使われない。 声明は同時に、可視化の代償を率直に認めている。 “A hidden safeguard is harder to probe and work around. This means the safeguards can be targeted much more narrowly. Going forward, since the safeguards will be visible, we will have to cast a wider net — meaning more benign requests may trigger them. We’re working to make our classifiers more precise.” — Anthropic statement to WIRED ...

June 11, 2026 · 26 min · 5126 words · Appwright

Claude Fable 5「秘密のサボタージュ」:319ページのシステムカードが明かした「研究者を黙って劣化させる」設計 —— 4人の専門家が「独占擁護」と批判する隠された能力制限の全貌

Claude Fable 5「秘密のサボタージュ」:319ページのシステムカードが明かした「研究者を黙って劣化させる」設計 2026年6月9日、Anthropicは満を持して Mythos 級モデル「Claude Fable 5」を一般公開した。前日公開の記事で我々が報じた通り、ベンチマークは SWE-Bench Pro 80.3%、FrontierCode Diamond 29.3%、Stripe の 5,000 万行 Ruby マイグレーションを「2ヶ月→1日」に短縮した「事実上の AGI 候補」と呼ぶべき性能である。 しかし公開から 24 時間後、Fortune 記者 Sharon Goldman が 319 ページのシステムカード(PDF) に埋もれていた一節を掘り起こし、AI コミュニティ全体が大規模な反発に動いた。Fable 5 は、サイバーセキュリティ・生物化学・モデル蒸留に関する 3 つの制限についてはユーザーに通知した上で Opus 4.8 にフォールバックする。しかし 「フロンティア LLM 開発」 に関する 4 つ目の制限は、モデルに能力劣化を施した上で、ユーザーに一切通知しない。「サイレント・サボタージュ(秘密の妨害工作)」——これが、現在 AI 倫理と独占論争の新たな焦点となっている。 本記事では、この隠された制限の正確な仕組み、4 人の専門家による左右横断的な批判、Karpathy(6 月から Anthropic 所属)が示した内部的矛盾、そして Fable 5 公開が Anthropic の IPO 申請(6 月 1 日 S-1 機密提出)から 8 日後 というタイミングが生むガバナンス問題まで、一次ソース横断で完全に整理する。 何が「秘密」なのか —— 4 つの安全分類器の正体 Fable 5 のシステムカードは、サイバー・生物化学・蒸留・フロンティア LLM 開発の 4 つの領域に対する安全分類器を定義している。前者 3 つと 4 つ目で、ユーザーへの可視性が決定的に異なる。 ...

June 11, 2026 · 27 min · 5378 words · Appwright

Claude Fable 5 完全解説:Mythos がついに「Fable」として公開された日——$10/$50 の真価、12-Anthropic 記事ドキュメントの集大成

Claude Fable 5 完全解説:Mythos がついに「Fable」として公開された日 2026年6月9日午後1時(米東部時間)、AnthropicはClaude Fable 5およびClaude Mythos 5の2つの新モデルを同時発表した。Mythos Preview が2026年4月7日に限定公開されてから63日目、本連載で追い続けてきた「Mythos はいつ一般公開されるか」という問いがついに解消された。本稿は、4月から6月9日まで12本の本連載Anthropic記事の集大成として、Fable 5 を中心に Mythos 5 との「デュアルトラック戦略」、そして2026年6月23日に迫ったサブスクリプション期限までを包括的に解説する。 1. Mythos 級とは何か——Anthropic の命名体系を整理する Anthropic は2025年末から2026年にかけて、文学形式に基づく独特の命名体系を整備してきた。5階層のうち、Mythos が最上位、Fable がその直下に位置する。 クラス パラメータ規模(推定) 命名由来 性格 Haiku 4.5 ~20B 日本の短詩 軽量・高速 Sonnet 4.6 ~1T 14行定型詩 中位 Opus 4.8 ~5T 大規模音楽作品 最上位「通常」モデル Fable 5 ~6T ラテン語 fabula(語られるもの) Mythos の安全解放版 Mythos 5 ~6T ギリシャ語 mythos(神話・伝承) 安全分類器なしの制限版 注目すべきは、Fable と Mythos は同じ重みを共有している点だ。両者の違いは「アクセスポリシー」と「ガードレール」だけにある。Mythos は Project Glasswing のパートナー(米政府および一部サイバー防御組織)のみがアクセスでき、Fable は Fable 5 の安全分類器を備えた状態で一般公開される。The Memo by LifeArchitect.ai が「Literary forms naming scheme」と表現したこの階層化は、Anthropic が Mythos の能力を「段階的に解放する」設計思想の表れである。 ...

June 10, 2026 · 30 min · 5805 words · Appwright