<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom" xmlns:content="http://purl.org/rss/1.0/modules/content/">
  <channel>
    <title>GRPO on Appwright AI</title>
    <link>https://ai.appwright.xyz/tags/grpo/</link>
    <description>Recent content in GRPO on Appwright AI</description>
    <generator>Hugo</generator>
    <language>en-US</language>
    <lastBuildDate>Thu, 30 Jul 2026 19:00:00 +0800</lastBuildDate>
    <atom:link href="https://ai.appwright.xyz/tags/grpo/index.xml" rel="self" type="application/rss+xml" />
    <item>
      <title>Qwen 3.5 9B、500ドルのRLファインチューンでGPT-5.6 SolとOpus 4.8を超える──GRPOによる専門化モデル構築の実践ガイド</title>
      <link>https://ai.appwright.xyz/posts/2026-07-30-qwen-35-9b-500-dollar-rl-grpo-fine-tune-guide/</link>
      <pubDate>Thu, 30 Jul 2026 19:00:00 +0800</pubDate>
      <guid>https://ai.appwright.xyz/posts/2026-07-30-qwen-35-9b-500-dollar-rl-grpo-fine-tune-guide/</guid>
      <description>FermiSenseが公開したケーススタディを徹底解説：Qwen 3.5 9BをGRPOで2,500ステップRLファインチューンし、自動車カタログレビューでGPT-5.6 Sol（93%）やClaude Opus 4.8（91%）を上回る97%精度を達成。訓練コストはたった$500、推論コストは1/68倍。再現手順と適用判断基準をコード付きで解説する。</description>
    </item>
  </channel>
</rss>
