Qwen3.8-Flash-Next Q4は4枚GPUで実用速度に届くか
103.69 GiBのUD-Q4_K_XLを3枚のRTX 3090と1枚のRTX 4090へ配置し、64 GBと128 GBのホストRAM差、反復benchmark、API応答を検証しました。
- Tested question
- Qwen3.8-Flash-Next UD-Q4_K_XLを異種4枚GPUへ配置したとき、ホストRAM不足を回避してAPI readyへ到達し、どの程度の単発性能を得られるか。
- Exact tools
- llama.cpp PR #27742 build 10656 commit 035e22731a7fd70b9854b3a2d64ec68e9b1a45d3
- CUDA 12.6
- llama-bench
- llama-server OpenAI-compatible API
- ASUS TUF B450-PLUS GAMING
- AMD Ryzen 5 3500
- RTX 3090 24GB ×3 at 300 W
- RTX 4090 24GB ×1 at 350 W
- 128 GB host RAM
- Exact models
- Qwen3.8-Flash-Next-UD-Q4_K_XL revision 8bdc666649440e9bdc97e16f3f75782c98478ff5
- Validation method
- 64 GBと128 GBのホストRAM条件でloadとswap安全性を確認し、128 GB条件ではPP512、PP4096、TG256を各5回測定しました。さらに634 prompt token、256 generation tokenの非cache API requestを5回実行しました。
- Result
- 64 GBでは約595 MiBのswap増加で安全停止しAPI readyへ届きませんでした。128 GBではloadとAPI応答に成功し、5回中央値はPP512 198.365 tok/s、PP4096 204.511 tok/s、TG256 36.996 tok/s、API TTFT 4.505秒、server decode 36.177 tok/s、E2E 11.553秒でした。
- Limitations
- 検証時点では未mergeのllama.cpp PRを使用しており、通常の公式release条件ではありません。
- 4K context、1 slot、特定のGPU順序と電力制限による単一hostの結果です。
- Vision、tool calling、long context、MTP、品質、並列serveはこの性能試験では検証していません。
- benchmarkとAPI映像は保存metrics・logからの再構成で、元のsetupを連続録画したものではありません。
Evidence (3)
Artifacts (0)
公開リンクはありません。
RAM容量がload可否を反転させた
モデル本体は約103.69 GiBです。GPUへ49/49 layersをoffloadしてもCPU側bufferが残るため、64 GBのホストRAM条件ではswap増加を検知して停止しました。ホストRAMを128 GBへ増やすと、同じQ4 artifactがAPI readyへ到達し、実際に応答を返しました。
反復値はモデル品質やエージェント全体の完了時間ではなく、このdeploymentにおけるprompt processing、token generation、uncached API transportの性能です。異種GPU構成や狭いPCIe幅を含む環境で動いた事実と、他環境でも同じ速度になるという主張は分けています。