Qwen 3.5 9B、500ドルのRLファインチューンでGPT-5.6 SolとOpus 4.8を超える──GRPOによる専門化モデル構築の実践ガイド
PM 編集方針 ── 7/29 18:00 HKT evening brief LOCKED 計画(7/30 PM slot) PM 7/29 18:00 evening brief で P0-PM 7/30 に指定された内容。HN #6(237pts, 73cmt)で発見、PM 7/30 18:00 再検証でも未出版・妥当性確認済み。Zero Japanese coverage confirmed. 当記事は PM 7/29 PM brief LOCKED + PM 7/30 18:00 evening brief validation の二重確認を経ている。Builder tutorial cluster。Override counter: 7 (post-freeze)。NOT override(pipeline upgrade P1→P0)。 はじめに:500ドルでフロンティアを超える現実 2026年7月27日、FermiSense(フェルミセンス)という企業が一つのケーススタディを公開した。Qwen 3.5 9B Instruct という90億パラメータのオープンウェイトモデルに、強化学習(RL)ファインチューンを施したところ、GPT-5.6 Sol(93%)や Claude Opus 4.8(91%)を上回る 97%の精度 を自動車部品カタログレビュー業務で達成したという。 訓練コストは 約500ドル。推論コストはフロンティアAPIの 1/68倍。 これは「小さな専門家モデルがフロンティア汎用モデルを特定タスクで超える」というアイデアの最も具体的で再現可能な実証例の一つだ。本記事では、FermiSenseが何をどう行ったのか、GRPO(Group Relative Policy Optimization)がなぜ機能するのか、そして読者が自身の業務でこのアプローチを再現するための具体的な手順を解説する。 ...