NeonとCastformは4Bパラメータモデルの事後学習でGPT-5.6 Solの検索精度を上回ったと発表した。AIエージェントの反復検索によるトークン爆発と膨大なAPIコストが実務導入の障害となっていた。合成データと強化学習を組み合わせた小型オープンモデルの特化手法がもたらすインパクトを分析する。
エージェント型検索のコスト破壊と主要モデル比較
データベース企業のNeonとPost-training基盤を提供するCastformは、オープンソースの小型言語モデル「Qwen3.5-4B」に特定の事後学習(Post-training)を施すことで、OpenAIの最新フラッグシップモデル「GPT-5.6 Sol」を超える検索精度を達成したと公表しました。
今回の検証における最大の衝撃は、精度向上と同時に達成された圧巻のコストパフォーマンスです。推論1回あたりのコストは0.000929ドル(約0.14円)にとどまり、GPT-5.6 Solの0.087338ドル(約13円)と比較して約99%の削減、すなわち約100分の1の低価格化を実現しました。
下表は、NeonおよびCastformが公表した公式検証データに基づく主要モデルの比較です。
| モデル名 | パラメータ数 | 平均評価報酬 (Mean Eval Reward) | 1回あたり推論コスト (USD) | コスト削減率 (対GPT-5.6 Sol) |
|---|---|---|---|---|
| Castform最適化モデル (Qwen3.5-4Bベース) | 40億 (4B) | 1.447 | $0.000929 | -98.9% (約1/94) |
| OpenAI GPT-5.6 Sol | 非公開 (巨大) | 1.369 | $0.087338 | 基準 |
| OpenAI GPT-5.4 | 非公開 (巨大) | 1.377 | 非公開 | – |
| 未学習 Qwen3.5-4B (ベースライン) | 40億 (4B) | 0.382 | – | – |
未学習のQwen3.5-4Bにおける評価値はわずか0.382でした。しかし、強化学習を用いた事後学習を適用することで評価値は1.447まで急上昇し、巨大なプロプライエタリモデルを凌駕する結果となりました。この結果は、特定のビジネス用途において汎用巨大モデルにAPI従量課金で依存し続ける従来の設計思想を根底から覆すものです。
Qwen3.5-4BがGPT-5.6 Solを超えた技術的メカニズム
小型オープンモデルが数百〜数千億パラメータクラスの巨大モデルを上回る検索精度を発揮できた背景には、単なるファインチューニングにとどまらない「3つの技術的特異点」が存在します。
Agentic Search(エージェント型検索)を阻んでいたトークン壁の突破
従来のRAG(検索拡張生成)と異なり、AIエージェントが自律的に検索クエリの生成、結果の検証、不足情報の再検索を繰り返す「Agentic Search(エージェント型検索)」では、1回のリクエストで消費されるトークン量が爆発的に増加します。
GPT-5.6 Solのような最先端モデル(Frontier Model)をAgentic Searchのエンジンとして採用した場合、1ターンあたりの処理時間が10秒を超え、マルチターン全体のコストが1リクエストあたり数円〜数十円に達することが珍しくありません。この構造的課題が、企業におけるAIエージェントの実務導入を阻む巨大な壁となっていました。
VRAM消費量が数十GB以下に収まるSLM(スモール言語モデル)を採用することで、単一のGPUインスタンス上で並列推論を回し、トークン単価を大幅に抑制することが可能になります。
合成データ自動生成と強化学習(RL)による事後学習パイプライン
今回の成果を支えた核心手法は、人手によるアノテーション作業を排除した完全自動化データパイプラインと強化学習(Reinforcement Learning)の融合です。
Castformのプラットフォームは、企業内の社内規定や文書データから「質問と正しい検索結果」のペアデータ(Synthetic Data)を自動生成しました。ベースモデルであるQwen3.5-4Bに対してこの合成データを用いた強化学習(Post-training)を実施し、モデルの出力空間を「検索タスクの最適化」へ集中的に絞り込みました。
近年のDeepSeek-R1が示した推論時計算量スケーリングの仕組みと同様に、事前学習(Pre-training)で獲得した知識を拡大するのではなく、事後学習(Post-training)によって特定のタスク実行軌跡(Trajectory)に対する報酬を高める手法が、小型モデルの潜在能力を極限まで引き出しています。
サーバーレスPostgres(Neon)による動的インフラの統合
強化学習プロセスでは、学習環境(Environment)としてのデータベースに対して急激かつ大量のクエリが発生します。エージェントが生成した数千パターンの検索アクションを同時並行で評価し、即座にフィードバック報酬を返還する必要があるためです。
この計算負荷のスパイクに対応するため、Databricks傘下のNeonが提供するサーバーレスPostgresアーキテクチャが採用されました。ベクトル検索とリレーショナルデータを扱うデータベース基盤が、学習時の極小負荷からピーク負荷までコンピュートリソースをミリ秒単位で動的スケーリングさせることで、インフラ側のボトルネックを解消しています。
特定用途化におけるトレードオフとTCOの課題
1/100のコストで巨大モデルを超える成果が報告された一方で、技術責任者はこのアプローチが抱えるトレードオフと運用上の課題を冷静に評価する必要があります。
汎用能力の著しい低下と「過学習」のリスク
業界紙『RuntimeWire』等の第三者分析が指摘するように、今回のQwen3.5-4B特化モデルは「特定ドキュメント群に対する検索・抽出タスク」へ完全にチューニングされています。
プログラミングコードの生成、複雑な数理パズルの解法、あるいは文脈が曖昧な自由対話といった汎用タスクにおいては、依然としてGPT-5.6 Solや従来の推論モデルが優位性を保持しています。モデルの専門化(Specialization)は汎用性(Generalization)とのトレードオフであり、一台のモデルで全社業務をカバーする運用には適しません。
TCO(総所有コスト)におけるPost-training費用の評価
推論単価が1/100(1回あたり約0.14円)になったとしても、企業が支払う総所有コスト(TCO)が即座に1/100になるわけではありません。TCOを試算する際は、以下のコスト要素を加算する必要があります。
- 合成データ生成に使用した上位モデルのAPI利用料
- 強化学習(RL)を回すために投入したGPUコンピュート費用
- 社内文書が更新された際に実行する「再学習パイプライン」の維持コスト
- 独自モデルをホスティングするインフラの固定費用(サーバーレスまたは常時稼働GPU)
月間の検索リクエスト数が数十万〜数百万件を超える大規模プロダクション環境であって初めて、初期の事後学習費用を相殺するROI(投資対効果)が成立します。
テストプロトコルの透明性と検証可能性
NeonおよびCastformによる公式リリースでは平均評価値「1.447」が強調されていますが、ベンチマークに使用された完全なプロンプトセットや評価スクリプトの詳細プロトコルは全面公開されていません。
自社の固有ドキュメント構造(複雑なPDF、表組み、専門用語)において同様の再現性が得られるかどうかは、社内POC(概念実証)を通じて個別に検証することが不可欠です。
技術責任者が追うべき評価指標と導入プロトコル
本事例の成果を自社のAIインフラ戦略に落とし込む際、事業責任者や技術責任者は抽象的な期待感ではなく、具体的な定量KPIを設定してGO/NO-GO判定を行う必要があります。
自社のナレッジベース構築においてチェックすべき具体的な検証手順と指標は以下の通りです。
-
自社データにおける「平均評価報酬(Mean Evaluation Reward)」の計測
- 社内規程や製品マニュアルから生成したテストセットにおいて、特化型SLMの評価スコアが汎用フロントエンドモデル(GPT-5.6 Sol等)のスコアを上回るか。
-
エージェント反復実行時の「1リクエストあたりトークンコスト」と「レイテンシ」
- エージェントが平均3〜5回の検索ループを回した際の総コストが0.001ドル以下、かつ応答遅延時間が2秒以内に収まるか。
-
損益分岐点(Break-even Point)となる月間リクエスト数の算出
- 独自SLMの事後学習費用(仮に50万円〜100万円とした場合)が、API従量課金の削減額によって何ヶ月で回収できるか。
汎用巨大LLM依存からの脱却と自律型SLMの垂直統合
NeonとCastformによる最新の成果は、企業向けAI活用における「巨大モデル一強時代」の終焉と、特定タスク特化型SLMへの原点回帰を強く示唆しています。
今後は、高度な意図解釈や初期ルーティングのみを汎用LLM(GPT-5.6 Sol等)に委ね、実際のデータ検索や反復処理は自社ナレッジで強化学習されたオープンソースのSLM(Qwen3.5-4B等)へオフロードする「ハイブリッド構成」がエンタープライズアーキテクチャの標準となるでしょう。
大規模言語モデル(LLM)の実装戦略を見直し、単なるAPI連携から「合成データ生成×強化学習による自社専用モデルの内製化」へ足場を移すことが、AIエージェント時代のコスト競争力を左右する鍵となります。
出典: GIGAZINE
出典: Neon Official Blog
出典: RuntimeWire