Claudeが2026年に出荷したすべて:Opus 4.7、Dreams、Agent Teams、1Mコンテクスト——Anthropic最新エコシステム完全ガイド

はじめに:年に2週間のペースで進化するClaude Anthropicは2026年、約2週間に1回のペースで主要リリースを続けている。「数週間目を離すと何が起きたか分からなくなる」——これはAnthropicのペースを象徴する言葉だ。本稿では、2026年5月時点でClaudeエコシステムがどのような状態にあるのか、すべての主要コンポーネントを体系的に整理する。 モデルラインナップ:Opus 4.7が頂点に Claude Opus 4.7(2026年4月16日リリース) 現時点で一般利用可能な最も高性能なモデル。SWE-bench Proで**64.3%**を記録し、GPT-5.4(57.7%)やGemini 3.1 Pro(61.2%)を上回る。特筆すべき改善点は以下の通り: 3倍のビジョン解像度:最大3.75MP(2,576px長辺)に対応。画像解析パイプラインで前処理不要に xhigh reasoning:従来のhighとmaxの間の新たな推論レベル。多くのタスクでmax同等の品質を低レイテンシで実現 タスク予算(Task Budgets, ベータ):自律エージェントのトークン消費にハードキャップを設定可能 価格は据え置き:入力$5/100万トークン、出力$25/100万トークン Opus 4.6から価格変更なしの実質アップグレード。エージェントパイプラインを稼働中のチームにとっては「無料の性能向上」と言える。 Claude Sonnet 4.6(2026年2月17日リリース) 1Mコンテクスト対応の主力モデル。Sonnet 4.5比で30〜50%高速化し、日常的なコーディングやエージェントワークフローではOpusに匹敵する品質を約40%低いコストで提供する。 Claude Haiku 4.5 高速・低コストのサブエージェント向けモデル。ただしプロンプトインジェクション対策がないため、信頼できない入力を扱うエージェント構成では注意が必要。 1Mトークンコンテクスト:標準料金化という転換点 2026年3月13日、Anthropicは200Kトークンを超える長いコンテクストに対するプレミアム課金を撤廃した。現在は全コンテクスト長に標準レートが適用される。 ベンチマークではOpus 4.6が**1Mトークン時でMRCR v2 78.3%**を記録。GPT-5.4(36.6%)、Gemini 3.1 Pro(18.3%)を大きく引き離す。実際には200Kを超えるとOpusでも品質が劣化し始めるため、推奨される実用上限は200K〜400K程度。単発の大規模ドキュメント解析には有効だが、ルーティンの会話セッションでは200K以内に留めるのが現実的だ。 4つのモード:Chat / Cowork / Code / Projects Claudeには現在4つの動作モードがあり、用途に応じて使い分ける: モード 用途 特徴 Chat ブラウザ/モバイル クイッククエリ、ブレインストーミング、下書き Cowork デスクトップエージェント 実際のファイルを読み書き、マルチステップタスクを自律実行 Code ターミナル コードベースを認識し、コード記述・コマンド実行・git操作 Projects 保存済みワークスペース ファイルと指示をアップロードし、セッション間でコンテクストを永続化 よくある間違いはすべての作業をChatで済ませようとすること。実際のファイル操作にはCoworkまたはCodeを使うべきで、これだけで作業効率が劇的に変わる。 Claude Codeの主要新機能 Code Review(コードレビュー) Claude CodeがPRの変更をレビューし、インラインコメントを自動生成する。レビュアーの負荷を軽減しつつ、バグやセキュリティ問題を早期発見できる。 CI Auto-Fix(CI自動修正) CIが失敗した時、/autofix-pr コマンド一つでClaude Codeがエラーログを解析し、修正コードを生成、PRとして提案する。CI/CDパイプラインと直接連携し、開発者が修正を待つ時間をゼロにする。 ...

May 14, 2026 · 14 min · 2787 words · Appwright

SubQ 1M-Preview完全解説:12Mトークンコンテキストを実現した非二次アーキテクチャの衝撃

SubQ 1M-Previewとは 2026年5月5日、マイアミ拠点のAIスタートアップSubquadraticが「SubQ 1M-Preview」を発表した。同社は29Mドルのシード調達を行い、評価額は500Mドルに達する。注目すべきは、このモデルが世界初の完全subquadraticアーキテクチャを採用している点だ。従来のTransformerが抱えるO(n²)の計算量制約を、アーキテクチャレベルで解決したと主張する。 SSA(Subquadratic Sparse Attention)の仕組み SubQの中核技術はSSA(Subquadratic Sparse Attention)である。従来のDense Attentionが全トークンペアを比較するのに対し、SSAはコンテンツ依存の選択的ルーティングを行う。つまり、クエリに対して意味的に重要なトークンのみを動的に選び、そのペアに対してのみ正確なAttentionを計算する。 方式 計算量 特徴 Dense Attention O(n²) 全ペア比較、正確だが非効率 SSA(SubQ) O(n·k) コンテンツ依存の選択、線形に近い FlashAttention O(n²) 実行効率は改善するがスケーリング則は不変 SSAが従来手法と異なるのは、位置ベースの固定パターン(スライディングウィンドウ等)ではなく、意味に基づいてアテンション先を決定する点だ。これにより、12Mトークンの研究段階でAttention計算量を従来比約1,000分の1に削減したとされる。 学習パイプライン SSAの学習は3段階で行われる: Pre-training — 大規模な長文脈データセットでの事前学習 Supervised fine-tuning — 推論・コード生成・指示追従のチューニング Reinforcement learning — 長文脈検索タスクを直接最適化。モデルが「近くの情報にデフォルトする」問題を回避するための設計 ベンチマーク評価:何ができて、何ができないか Subquadraticが公開した第三者検証済みのベンチマークは3つで、いずれも長文脈検索とコーディングに特化している。 SWE-Bench Verified(コード修正能力) モデル スコア Claude Opus 4.7 87.6% SubQ 1M-Preview 81.8% Claude Opus 4.6 80.8% DeepSeek 4.0 Pro 80.0% Gemini 3.1 Pro 80.6% Opus 4.7には及ばないものの、Opus 4.6やDeepSeek 4.0 Proと同等の水準。ただし同社自身「SWE-Benchの差はモデル本体よりもエージェントハーネスの影響が大きい」と認めており、コード能力の優劣を断定するのは早計だ。 RULER 128K(長文脈推論) SubQ: 95.0% vs Claude Opus 4.6: 94.8%。誤差の範囲だが、注目すべきはコスト差だ。SubquadraticはRULER 128Kの実行コストを約**$8と主張。一方Claude Opusでは約$2,600**と試算されている。精度は同等でコストは約300分の1という計算になる。 ...

May 14, 2026 · 15 min · 2820 words · Appwright

Xiaomi MiMo-V2.5-Pro完全解説:1.02TパラメータのオープンウェイトMoEモデルが切り拓くエージェントAIの新時代

はじめに 2026年4月22日、Xiaomiはオープンウェイトモデル「MiMo-V2.5-Pro」をリリースした。1.02T総パラメータ(アクティブ42B)のMoE(Mixture-of-Experts)モデルで、SWE-bench Proで57.2%、Artificial Analysis Intelligence Indexで54を記録し、Kimi K2.6と並んでオープンモデル最上位に位置する。 注目すべきはそのコスト効率だ。入力$1/100万トークン、出力$3/100万トークンと、Claude Opus 4.6(入力$5、出力$15)と比較して約1/5の価格で、エージェントタスクでは同等以上の性能を発揮する。さらにMITライセンスで公開されているため、商用利用も自由である。 本記事では、MiMo-V2.5-Proのアーキテクチャ、ベンチマーク性能、実際の使い方までを詳しく解説する。 アーキテクチャの特徴 MiMo-V2.5-Proは前世代のMiMo-V2-Proから大幅に進化した。コア技術は以下の3つに集約される。 Hybrid Attention Sliding Window Attention(SWA)とGlobal Attention(GA)を6:1の比率でインターリーブした構造を採用。128トークンのウィンドウサイズにより、KVキャッシュを約7倍削減しながら、100万トークンのコンテキスト全体にわたる理解を維持する。この設計はMiMo-V2-Flashで実証済みだ。 Multi-Token Prediction(MTP) 軽量なDense FFNモジュールを用いて、1ステップで複数のトークンを予測する。これにより出力スループットが約3倍向上し、RLトレーニングの高速化にも寄与する。 3段階ポストトレーニング Xiaomiは「Supervised Fine-Tuning → Domain-Specialized RL → Multi-Teacher On-Policy Distillation(MOPD)」という3段階のポストトレーニングパイプラインを採用している。各ドメイン(数学、安全性、エージェントツール使用等)で最適化された個別の教師モデルが、1つの学生モデルに知識を蒸留する。これにより、単一モデルで幅広いタスクをカバーできる。 ベンチマーク性能 各ベンチマークにおけるMiMo-V2.5-Proのスコアは以下の通りである。 ベンチマーク スコア 比較対象 SWE-bench Pro 57.2% クローズドモデルに迫る ClawEval 63.8% Claude Opus 4.6、GPT-5.4と同等 τ3-Bench 72.9% Claude Opus 4.6、GPT-5.4と同等 Artificial Analysis Intelligence Index 54 Kimi K2.6と同点、オープンモデル最上位 ClawEvalにおいて、MiMo-V2.5-Proは64%のPass³を達成しながら、1トレジェクトリあたりわずか約70Kトークンで動作する。これはClaude Opus 4.6やGPT-5.4と比較して40〜60%少ないトークン消費であり、実質的なコストパフォーマンスは際立っている。 実世界のエージェント性能 MiMo-V2.5-Proの真価は、実世界の複雑なタスクを自律的に実行する能力にある。Xiaomiの公開したデモから3つを紹介する。 事例1:SysYコンパイラの完全実装(Rust) 北京大学のコンパイラ設計講座をベースに、RustでSysYコンパイラをゼロから実装。レキサー、パーサー、AST、Koopa IR、RISC-Vバックエンド、最適化パスの全てを、4.3時間・672回のツール呼び出しで完成させた。隠されたテストスイート233問すべてに合格。初回コンパイル時は59%(137/233)の合格率だったが、以降の反復で自己修正しながら100%に到達している。 事例2:デスクトップ動画編集アプリの開発 マルチトラックタイムライン、クリップトリミング、クロスフェード、オーディオミキシング、エクスポートパイプラインを備えた8,192行のアプリケーションを11.5時間・1,868回のツール呼び出しで構築した。 事例3:アナログEDA回路設計 TSMC 180nm CMOSプロセスでのFVF-LDO設計。ngspiceシミュレーションループと連携し、約1時間で全6指標(位相余裕、ラインレギュレーション、負荷レギュレーション、消費電流、PSRR、過渡応答)を満たした。初期試行から4つの主要指標が10倍以上改善された。 ...

May 13, 2026 · 12 min · 2367 words · Appwright