環境
- Ryzen 5 5600 + DDR4 128G
- RADEON RX9060XT/16GB
- モデルはQwen3.8-Flash-NextのIQ3_XSS版
- 64k Context
インストール
- Strata公式
- ROCm(HIP)に対応済み
- メインメモリは最低64G欲しい
git clone https://github.com/Niko1221/Strata.git
cd Strata
START-HERE.bat
venvの作成からGPU検出まで自動的にやってくれて、あとは聞かれたことに答えるだけだしスペックから提示される推奨値が概ねまともなのでインストール自体は非常に簡単。
RADEONだからという理由でハマるところも特になかった。
実際に走らせてみた
日本のバブル経済について日本語5000文字程度で分析してください。
[strata] done: 22490 tokens in 604 s (37.4 tok/s) (stop, cancel=False), expert cache 85.8% hit
YouTube向けにずんだもんを使った動画を作るにあたって、動画作成初心者のためのステップバイステップの解説をして。
[strata] done: 21225 tokens in 643 s (33.3 tok/s) (stop, cancel=False), expert cache 86.1% hit
雑感
現行でまともにAI可能なPCとしてはほぼ最低スペックだけど、これで30t/s以上という実用的な速度が出ているのは割と凄いのでは?
とはいえ公式のベンチ結果だと5060Tiで50t/sくらい出るらしいのでやっぱ遅いな。うちのマシンはGPU以前に本体スペックが弱いのでそれが足引っ張ってるのかもしれんけど。
正直なことを言うと、この手の枠組みを汎用化してllama.cpp本体に入れてくれよ、とは思う。