ROCm対応torchのレポジトリの場所
前回のやつにも追記した件。
ちょっと細かい経緯とか全然知らないんだけど、ROCmのNightlyの置き場がv2とwhl-multi-archがあって、なんか最新のビルドは後者にしか置かれてないっぽい感じ。
ComfyUI公式とかググって出てくる巷の情報とかだとv2が勧められてるんだけど、本当に最新が欲しいなら
pip install torch[device-gfx1200] torchvision[device-gfx1200] torchaudio --index-url https://rocm.nightlies.amd.com/whl-multi-arch/
↑こうしないといけない気がする……。ごそっと入れ替えたい時は--force-reinstallしてね。
相変わらずROCm界隈の激動が早すぎるッピ!
Gemma4のQATバージョンが出てた
QATってのはめちゃんこ雑に言うと「16bitでリリースしてもどうせみんな4bit量子化の劣化した状態で使うんだから、じゃあ学習段階から4bit量子化を前提にした方が劣化は抑えられるんじゃね」みたいなやつ、らしい。
具体的にはモデルサイズはK4_K_Mより若干小さくなってるのに、公称では従来の6bit相当くらいの劣化具合まで改善した、らしい。
んでさ。
Ollamaなんかで公式採用されてる従来のGemma4-26B-A4BのK4_K_Mって、微妙に大きくてVRAM16Gに乗らなかったんだよね。物理的にはVRAM18Gくらい必要そうな絶妙にイヤなサイズだった。
これに対して26B-A4B-QATはq8_0で64Kコンテキスト時に占有量14GというVRAM16Gにジャストフィットのサイズ感で大変よろしい。本当にQAT4bitが従来の6bit相当の性能出てるのかは正直分からんのだけど、公式でVRAM16Gにフィットしてきてくれたことの方が大きい。
Copilotの値上げ、RADEONのVRAM16Gモデルの値崩れ、OllamaのROCm7.x正式対応、ときてGoogleがわざわざVRAM16G民を狙ったモデルを出してくるの、このグラボを買ってこのモデルをローカルで走らせろとお膳立てされてるのかとすら思う。
なおUnslothの旧IQ4_XSと比べて新しいQAT版がどのくらい賢いかはマジでよくわかんない。3bitや2bitまで下げると目に見えて頭悪くなるんだけど、4bitは元々それなりに賢かったので……
使ってみた
UnslothがQAT版を更に最適化したと称するバージョンを出してるのでそっちを入れてみた。
ollama run hf.co/unsloth/gemma-4-26B-A4B-it-qat-GGUF:UD-Q4_K_XL --verbose
ベンチのやり方とか知らないので前回と同じことを聞いてみる。
>>> こんにちは、意気込みをどうぞ。
...snip...
total duration: 24.3761878s
load duration: 365.1757ms
prompt eval count: 24 token(s)
prompt eval duration: 160.026ms
prompt eval rate: 149.98 tokens/s
eval count: 964 token(s)
eval duration: 23.847788s
eval rate: 40.42 tokens/s
>>> YouTube向けにずんだもんを使った動画を作るにあたって、動画作成初心者のためのステップバイステップの解説をして。
total duration: 55.5537316s
load duration: 362.3513ms
prompt eval count: 294 token(s)
prompt eval duration: 521.09ms
prompt eval rate: 564.20 tokens/s
eval count: 1933 token(s)
eval duration: 54.617273s
eval rate: 35.39 tokens/s
正直元々そんなに不満はなかったけど、前回より15%くらい早くなったかな?
ollama ps
NAME ID SIZE PROCESSOR CONTEXT UNTIL
hf.co/unsloth/gemma-4-26B-A4B-it-qat-GGUF:UD-Q4_K_XL ec94fe5da7eb 14 GB 100% GPU 65536 2 minutes from now
64kコンテキストで100% GPU。128kまで上げると50%50%になっちゃう(けど履歴が溜まるまでは別にそんなに遅くはならない)
総評
ワイは自分でコード書いてAIにレビューさせるスタイルでやってるんだけど、Copilotくん爆裂値上げで補完以外あんま使いたくない昨今、コードレビューはしばらくこの子に任せてみようと思う。
てかいい感じのvscode拡張ないっすかね。今はOpenCodeをターミナルで使ってるけどなんかワイのスタイルに合ってない気がする。