2
0

Delete article

Deleted articles cannot be recovered.

Draft of this article would be also deleted.

Are you sure you want to delete this article?

話題のRADEON RX 9060 XT 16Gを買ったのでAIを色々弄ったメモ(2)

2
Posted at

ROCm対応torchのレポジトリの場所

前回のやつにも追記した件。
ちょっと細かい経緯とか全然知らないんだけど、ROCmのNightlyの置き場v2whl-multi-archがあって、なんか最新のビルドは後者にしか置かれてないっぽい感じ。
ComfyUI公式とかググって出てくる巷の情報とかだとv2が勧められてるんだけど、本当に最新が欲しいなら

pip install torch[device-gfx1200] torchvision[device-gfx1200] torchaudio --index-url https://rocm.nightlies.amd.com/whl-multi-arch/

↑こうしないといけない気がする……。ごそっと入れ替えたい時は--force-reinstallしてね。
相変わらずROCm界隈の激動が早すぎるッピ!

Gemma4のQATバージョンが出てた

QATってのはめちゃんこ雑に言うと「16bitでリリースしてもどうせみんな4bit量子化の劣化した状態で使うんだから、じゃあ学習段階から4bit量子化を前提にした方が劣化は抑えられるんじゃね」みたいなやつ、らしい。
具体的にはモデルサイズはK4_K_Mより若干小さくなってるのに、公称では従来の6bit相当くらいの劣化具合まで改善した、らしい。
んでさ。
Ollamaなんかで公式採用されてる従来のGemma4-26B-A4BのK4_K_Mって、微妙に大きくてVRAM16Gに乗らなかったんだよね。物理的にはVRAM18Gくらい必要そうな絶妙にイヤなサイズだった。
これに対して26B-A4B-QATはq8_0で64Kコンテキスト時に占有量14GというVRAM16Gにジャストフィットのサイズ感で大変よろしい。本当にQAT4bitが従来の6bit相当の性能出てるのかは正直分からんのだけど、公式でVRAM16Gにフィットしてきてくれたことの方が大きい。
Copilotの値上げ、RADEONのVRAM16Gモデルの値崩れ、OllamaのROCm7.x正式対応、ときてGoogleがわざわざVRAM16G民を狙ったモデルを出してくるの、このグラボを買ってこのモデルをローカルで走らせろとお膳立てされてるのかとすら思う。
なおUnslothの旧IQ4_XSと比べて新しいQAT版がどのくらい賢いかはマジでよくわかんない。3bitや2bitまで下げると目に見えて頭悪くなるんだけど、4bitは元々それなりに賢かったので……

使ってみた

UnslothがQAT版を更に最適化したと称するバージョンを出してるのでそっちを入れてみた。

ollama run hf.co/unsloth/gemma-4-26B-A4B-it-qat-GGUF:UD-Q4_K_XL --verbose

ベンチのやり方とか知らないので前回と同じことを聞いてみる。

>>> こんにちは、意気込みをどうぞ。
...snip...
total duration:       24.3761878s
load duration:        365.1757ms
prompt eval count:    24 token(s)
prompt eval duration: 160.026ms
prompt eval rate:     149.98 tokens/s
eval count:           964 token(s)
eval duration:        23.847788s
eval rate:            40.42 tokens/s

>>> YouTube向けにずんだもんを使った動画を作るにあたって、動画作成初心者のためのステップバイステップの解説をして。
total duration:       55.5537316s
load duration:        362.3513ms
prompt eval count:    294 token(s)
prompt eval duration: 521.09ms
prompt eval rate:     564.20 tokens/s
eval count:           1933 token(s)
eval duration:        54.617273s
eval rate:            35.39 tokens/s

正直元々そんなに不満はなかったけど、前回より15%くらい早くなったかな?

ollama ps
NAME                                                    ID              SIZE     PROCESSOR    CONTEXT    UNTIL          
hf.co/unsloth/gemma-4-26B-A4B-it-qat-GGUF:UD-Q4_K_XL    ec94fe5da7eb    14 GB    100% GPU     65536      2 minutes from now

64kコンテキストで100% GPU。128kまで上げると50%50%になっちゃう(けど履歴が溜まるまでは別にそんなに遅くはならない)

総評

ワイは自分でコード書いてAIにレビューさせるスタイルでやってるんだけど、Copilotくん爆裂値上げで補完以外あんま使いたくない昨今、コードレビューはしばらくこの子に任せてみようと思う。
てかいい感じのvscode拡張ないっすかね。今はOpenCodeをターミナルで使ってるけどなんかワイのスタイルに合ってない気がする。

2
0
0

Register as a new user and use Qiita more conveniently

  1. You get articles that match your needs
  2. You can efficiently read back useful information
  3. You can use dark theme
What you can do with signing up
2
0

Delete article

Deleted articles cannot be recovered.

Draft of this article would be also deleted.

Are you sure you want to delete this article?