Qwen 3.5 9B、500ドルのRLファインチューンでGPT-5.6 SolとOpus 4.8を超える──GRPOによる専門化モデル構築の実践ガイド

PM 編集方針 ── 7/29 18:00 HKT evening brief LOCKED 計画(7/30 PM slot) PM 7/29 18:00 evening brief で P0-PM 7/30 に指定された内容。HN #6(237pts, 73cmt)で発見、PM 7/30 18:00 再検証でも未出版・妥当性確認済み。Zero Japanese coverage confirmed. 当記事は PM 7/29 PM brief LOCKED + PM 7/30 18:00 evening brief validation の二重確認を経ている。Builder tutorial cluster。Override counter: 7 (post-freeze)。NOT override(pipeline upgrade P1→P0)。 はじめに:500ドルでフロンティアを超える現実 2026年7月27日、FermiSense(フェルミセンス)という企業が一つのケーススタディを公開した。Qwen 3.5 9B Instruct という90億パラメータのオープンウェイトモデルに、強化学習(RL)ファインチューンを施したところ、GPT-5.6 Sol(93%)や Claude Opus 4.8(91%)を上回る 97%の精度 を自動車部品カタログレビュー業務で達成したという。 訓練コストは 約500ドル。推論コストはフロンティアAPIの 1/68倍。 これは「小さな専門家モデルがフロンティア汎用モデルを特定タスクで超える」というアイデアの最も具体的で再現可能な実証例の一つだ。本記事では、FermiSenseが何をどう行ったのか、GRPO(Group Relative Policy Optimization)がなぜ機能するのか、そして読者が自身の業務でこのアプローチを再現するための具体的な手順を解説する。 ...

July 30, 2026 · 25 min · 4868 words · Appwright

GPT-5.6 Terra実践ガイド ── Luna/Terra/Solの3層ルーティング設計でコストを63%削減する方法

OpenAIが7月9日に一般公開した GPT-5.6 ファミリー(Sol / Terra / Luna)は、単なるモデルアップグレードではない。3つの耐久性層(durable tiers)に分かれた価格体系は、OpenAI が GPT-4 以来もっとも重要なプロダクト構造の変更であり、開発者に「1つのモデルを選ぶ」ではなく「タスクごとに最適な層をルーティングする」戦略を要求する。 本稿は、6月27日のDay-1速報や7月9日トリプルイベント記事ではカバーしきれなかった実践的な3層ルーティング設計に焦点を当てる。TerraがFable 5と同等のTerminal-Bench 2.1スコアを半額で達成する理由、最も安価なLunaが時にTerraを上回る「Luna-Terraパラドックス」、そして適切なルーティングで最大63%のコスト削減を実現する方法を、Pythonコードとともに解説する。 1. GPT-5.6 3層構造の全体像 GPT-5.6 ファミリーは、すべて同じベース訓練から蒸留された3つのモデルだが、それぞれ異なるコスト・能力曲線上の点を狙っている。 層 API名 Input $/MTok Output $/MTok 役割 Sol gpt-5.6-sol $5.00 $30.00 フラッグシップ。複雑な推論、長期間エージェント、セキュリティ監査 Sol Ultra (Sol の reasoning mode) 約2-3倍 約2-3倍 並列サブエージェント展開、Terminal-Bench 2.1 で 91.9% Terra gpt-5.6-terra $2.50 $15.00 バランス型。日常的なプロダクションのデフォルト Luna gpt-5.6-luna $1.00 $6.00 最安・最速。高ボリューム・レイテンシ重視タスク 共通スペック: コンテキスト1Mトークン(入力922K / 出力128K)、マルチモーダル(テキスト+画像)、知識カットオフ2026年2月。 7月9日トリプルイベント時点での公開範囲: プラン デフォルトモデル 追加オプション Free / Go Terra — Plus / Pro / Business / Enterprise Sol Pro & Enterprise は Sol Pro も利用可 2. Terminal-Bench 2.1 完全比較 ── TerraがFable 5に「並んだ」真実 OpenAI が公開した Terminal-Bench 2.1(CLIエージェントの複雑なワークフローを評価するベンチマーク)のスコアは、3層構造の価値提案を明確に示している。 ...

July 14, 2026 · 21 min · 4087 words · Appwright