開発者のNiko1221氏が2026年10月、1250億パラメータのMoEモデル「Qwen3.8-Flash-Next」をVRAM 12GBの民生用GPU上で秒速94トークンで実行する専用推論エンジン「Strata」を公開しました。機密データを扱う国内の製造業や金融機関において、数百万円規模の専用サーバーを導入せず既存のGeForce RTX 5070搭載PC資産を活用した閉域AI運用を検証する契機となります。
民生用GPUにおける125Bモデルの実行環境と性能ベンチマーク
アリババグループ(Alibaba Group)のQwen Teamは2026年8月26日、次世代アーキテクチャを見据えたオープンウェイトモデル「Qwen3.8-Flash-Next」を公開しました。本モデルは125B(1250億)パラメータのMixture of Experts(MoE)構造を持ち、約51BのN-gram埋め込みテーブルを含めるとシステム全体で約176B〜180B規模に達します。トークンごとのアクティブパラメータは6Bに抑えられており、ネイティブ256Kトークンのコンテキスト長に対応しています。
従来、この規模のモデルを実用的な速度でローカル推論させるには、データセンター向けのエンタープライズGPUが複数枚必要でした。しかし、オープンソース推論エンジン「Strata」の登場により、民生用ゲーミングPCでの高速動作が実証されています。StrataはWindowsおよびLinux向けに開発され、ローカルホスト上でOpenAIおよびAnthropic互換のAPIエンドポイントを提供します。
実測ベンチマークでは、エヌビディア(NVIDIA)のGeForce RTX 5070やアドバンスト・マイクロ・デバイセズ(AMD)のRadeon RX 9070 XTを搭載した環境で、実用速度を上回るスループットを記録しています。
| GPU構成 | システムRAM | 量子化形式 | 生成速度 |
|---|---|---|---|
| RTX 4090 (24GB) | 64GB | IQ2_XS (2ビット) | 140 tokens/sec |
| RTX 5070 (12GB) | 64GB | Q2_0 (2ビット) | 94 tokens/sec |
| RTX 5070 (12GB) | 64GB | IQ3_S (3ビット) | 53 tokens/sec |
| RX 9070 XT (16GB) | 47GB | Q2_0 (2ビット) | 60 tokens/sec |
上記のように、VRAM容量が12GBの環境であっても、2ビット量子化で秒速94トークン、3ビット量子化で秒速53トークンの処理性能を達成しています。また、RAM容量が32GBに制限される環境向けには、コーディング用途以外の専門家層を削減した「GSQ-RCO Coder」モデルの選択肢も用意されています。
参考記事: Instella-MoEの仕組みと技術的特異点|脱CUDAを実現するAMDのAI推論インフラ戦略
ハイブリッドメモリ階層化と投機的デコードによる高速化の構造
Strataが民生用ハードウェアで高いスループットを達成した背景には、メモリ階層の分離管理と投機的デコードの組み合わせがあります。
メインRAMとVRAMを連携させるMoEオフロード設計
従来のオフロード手法では、GPUのVRAM不足時にレイヤー全体をシステムRAMへ退避させるため、PCIeバスの帯域幅が深刻なボトルネックとなっていました。Strataはこの問題を解決するため、MoEモデル全体をシステムRAM(64GB推奨)に常駐させ、呼び出し頻度の高い特定のエキスパート(専門家ネットワーク)のみをVRAM(12GB以上)へ選択的にキャッシュ配置する仕組みを採用しています。
Qwen3.8-Flash-Nextは総パラメータ125Bのうち、1トークン処理時に稼働するアクティブパラメータが6Bと疎結合に設計されています。Strataはこの疎構造を利用し、PCIe経由のデータ転送量を最小限に抑えながら計算パイプラインを維持します。
GSQ-RCO量子化と軽量モデルによる投機的デコード
量子化手法には、オーストリア科学技術研究所(ISTA)のDeep Algorithms and Systems Lab(ISTA-DASLab)が開発した技術が用いられています。リーマン多様体上の制約最適化(RCO)とガンベル・ソフトマックス量子化(GSQ)を組み合わせることで、極限まで圧縮された派生モデル群(IQ2_XS、IQ3_Sなど)のロードを可能にしました。
さらに推論パイプラインには投機的デコードが組み込まれています。軽量なドラフトモデルが先行して連続トークン候補を高速予測し、メインの125Bモデルがバッチで並列検証する処理形態を取ります。これにより、メモリ帯域幅に依存する自己回帰生成のデコード遅延を相殺しています。
極低ビット化が招く出力品質の劣化と生成ループ
高速化の一方で、極端な量子化に伴う精度低下が明確な課題として確認されています。特に2ビットクラスの超低ビット量子化(IQ2_XSなど)を適用した場合、長文推論や数学的計算においてトークン確率分布の崩壊が見られます。
実証テストでは、円周率の桁出力を指示した際に同一トークンを無制限に出力し続ける生成ループに陥る現象が報告されています。量子化によって各専門家層の重み表現が粗くなった結果、アテンション機構が文脈に応じた適切な確率分布を維持できなくなる点が要因です。実務導入においては、生成速度だけでなくタスクごとの精度検証が不可欠です。
参考記事: AI推論インフラとは?CTOが知るべきアーキテクチャ設計とROI最大化戦略
国内エンタープライズにおけるエッジ推論の導入障壁と実務選択肢
Strataが示したアーキテクチャは、国内企業のAIインフラ戦略に直接的な選択肢をもたらします。
クラウド型APIの利用が制限される製造業の設計図面解析や金融機関の顧客データ処理において、専用AIサーバーの導入はハードウェア調達費が大きなハードルでした。しかし、VRAM 12GB〜16GBクラスのコンシューマー向けGPUと64GBのシステムRAMを搭載したワークステーションであれば、1台あたり数十万円の投資で100B超のモデル環境を構築できます。
ただし、業務への直接適用には運用上の制約が存在します。
1つ目は、推論精度と量子化ビット数のトレードオフです。コード生成などの構文的パターンが明確な用途では、専門特化した軽量版(GSQ-RCO Coder等)が機能します。一方で、法的文書の読解や論理的整合性が求められるタスクに2ビット量子化モデルを投入することは、ハルシネーションやループ発生のリスクから推奨されません。業務用途では、最低でも3ビット(IQ3_S)以上の精度を維持できるRAM容量の確保が前提条件となります。
2つ目は、コンシューマー向けハードウェアにおける排熱と長時間の安定稼働です。ワークステーション環境での常時推論はメモリコントローラーやPCIeインターフェースに高い負荷をかけ続けるため、ECCメモリ非対応環境でのビット反転エラーや熱ダウングレードへの対策を設計に組み込む必要があります。
技術責任者が検証すべき評価プロセス
大規模モデルをローカルで動かす技術が確立された現在、技術責任者には単なる「動作確認」を超えた評価体制の構築が求められます。
- 対象業務における精度許容値の測定
まずは自社のドメインデータを用い、2ビットおよび3ビット量子化モデルが業務要件を満たす出力精度を維持できるかスコアリングします。特に数値計算や要約タスクにおけるループ発生頻度の計測を優先してください。
- 既存ハードウェア資産のスペック監査
社内の開発機や設計用ワークステーションを対象に、PCIe 4.0/5.0の帯域幅、空きRAMスロット、搭載GPUのVRAM容量を棚卸しします。RAMを64GB以上に増設するだけで、125BクラスのMoE推論基盤として転用できる機材を特定します。
- 閉域APIゲートウェイとしてのプロトタイプ構築
Strataが提供するローカル互換APIを社内ネットワークに限定公開し、機密情報を外部送信しない検証環境を構築します。クラウドAPIとの応答速度や運用コストの差分を定量化し、オンプレミスとクラウドのハイブリッド運用基準を定義してください。
出典: GIGAZINE
出典: GitHub Niko1221/Strata
出典: Qwen Blog
出典: Hugging Face Qwen3.8-Flash-Next
