Experiment公開済みFeatured

Qwen3.8-Flash-Next Q4は4枚GPUで実用速度に届くか

103.69 GiBのUD-Q4_K_XLを3枚のRTX 3090と1枚のRTX 4090へ配置し、64 GBと128 GBのホストRAM差、反復benchmark、API応答を検証しました。

Tested question
Qwen3.8-Flash-Next UD-Q4_K_XLを異種4枚GPUへ配置したとき、ホストRAM不足を回避してAPI readyへ到達し、どの程度の単発性能を得られるか。
Exact tools
  • llama.cpp PR #27742 build 10656 commit 035e22731a7fd70b9854b3a2d64ec68e9b1a45d3
  • CUDA 12.6
  • llama-bench
  • llama-server OpenAI-compatible API
  • ASUS TUF B450-PLUS GAMING
  • AMD Ryzen 5 3500
  • RTX 3090 24GB ×3 at 300 W
  • RTX 4090 24GB ×1 at 350 W
  • 128 GB host RAM
Exact models
  • Qwen3.8-Flash-Next-UD-Q4_K_XL revision 8bdc666649440e9bdc97e16f3f75782c98478ff5
Validation method
64 GBと128 GBのホストRAM条件でloadとswap安全性を確認し、128 GB条件ではPP512、PP4096、TG256を各5回測定しました。さらに634 prompt token、256 generation tokenの非cache API requestを5回実行しました。
Result
64 GBでは約595 MiBのswap増加で安全停止しAPI readyへ届きませんでした。128 GBではloadとAPI応答に成功し、5回中央値はPP512 198.365 tok/s、PP4096 204.511 tok/s、TG256 36.996 tok/s、API TTFT 4.505秒、server decode 36.177 tok/s、E2E 11.553秒でした。
Limitations
  • 検証時点では未mergeのllama.cpp PRを使用しており、通常の公式release条件ではありません。
  • 4K context、1 slot、特定のGPU順序と電力制限による単一hostの結果です。
  • Vision、tool calling、long context、MTP、品質、並列serveはこの性能試験では検証していません。
  • benchmarkとAPI映像は保存metrics・logからの再構成で、元のsetupを連続録画したものではありません。

RAM容量がload可否を反転させた

モデル本体は約103.69 GiBです。GPUへ49/49 layersをoffloadしてもCPU側bufferが残るため、64 GBのホストRAM条件ではswap増加を検知して停止しました。ホストRAMを128 GBへ増やすと、同じQ4 artifactがAPI readyへ到達し、実際に応答を返しました。

反復値はモデル品質やエージェント全体の完了時間ではなく、このdeploymentにおけるprompt processing、token generation、uncached API transportの性能です。異種GPU構成や狭いPCIe幅を含む環境で動いた事実と、他環境でも同じ速度になるという主張は分けています。