普通のパソコンでAIを動かすのは、意外とハードルが高い。たいていはGPU(計算が得意な高価な部品)や、PyTorchなどの大きな準備がいるからだ。そこへ「GPUもいらない、Pythonもいらない」と言い切る小さな道具が現れた。名前はRai。計算の中身まで全部をRust(プログラミング言語の一つ)で手書きし、外部の大きな部品を一つも借りない。
ひとことで言うと、Raiは「普通のパソコンのCPU(頭脳にあたる計算部品)だけでAIの言語モデルを動かす、小さくて中身を読める実行エンジン」だ。
目次
- なぜ普通のパソコンでAIは重いのか
- Raiのやり方は「全部自分で書く」
- どこまで動く?試すには
なぜ普通のパソコンでAIは重いのか 🧩
AIの言語モデルの正体は、巨大なかけ算の固まりだ。このかけ算を速くこなすため、多くのツールはGPUや、PyTorchなどの既製の部品を何層も重ねる。
便利だが代償もある。インストールが重く、動かすまでの準備が長い。中で何が起きているかは、部品が多すぎて追いにくい。
CPUだけで動かす工夫は前からある。有名なのはllama.cppだ。ただ、それも外部の計算ライブラリを少し借りている。
Raiのやり方は「全部自分で書く」🦀
Raiが珍しいのは、その外部部品すらやめた点だ。かけ算を速くする計算を、作者がRustで一つずつ手書きしている。使うのはパソコンに元から入っている計算機能(AVX2)だけ。
よくある方法: モデル → 大きな部品を何個も用意 → やっと動く
Rai: モデル → Rai 1本だけ → そのまま動く
矢印は準備の手間、箱は必要なソフトを表す。Raiは途中の「何個もの部品」を自分で書いて1本にまとめた。だからインストールが軽く、プログラム全体を自分の目で確かめられる。
モデルは4ビットに圧縮して動かす。これは重み(モデル内部の数値)を粗くまるめて軽くするやり方で、量子化と呼ぶ。その分わずかに賢さは落ちる。作者は「元より精度が13〜30%落ちる場面がある」と正直に書いている。この誠実さは、ソフトの信頼感として大きいと私は思う。
どこまで動く?試すには ⚡
動かせるモデルは幅広い。LlamaやQwen、Gemmaなど、名の知れたものが並ぶ。
速さは正直だ。小さなTinyLlama(11億パラメータ)なら、4コアの普通のノートで1秒あたり約22トークン(語のかけら)。読むのに困らない速さだ。70億パラメータ級の大きめモデルは毎秒3トークンほどで、ぐっと遅くなる。
実務の目で見ると、Raiの売りは速さではない。そこはllama.cppの方が成熟している。Raiの価値は、部品の少なさと中身の読みやすさだ。外部につながないパソコンや、安全性を厳しく見る現場では、全部を読み切れることが効いてくる。
試すにはコマンドを少し打つ。Rust(1.87以降)を入れてから、こう動かす。
# ビルドする
cargo build --workspace --release --locked
# モデルをRai用に変換して、文章を生成する
rai convert /path/to/Qwen2.5-0.5B-Instruct -o qwen.raimodel
rai run qwen.raimodel --prompt "こんにちは" --max-tokens 64
注意点もある。速いのはIntelやAMDのパソコン向けで、Mac(Apple Silicon)では遅い道に落ちる。2026年10月2日にHacker Newsで共有されたばかりの、まだ若い道具でもある。
今日覚えること
- RaiはGPUもPythonも使わず、CPUだけでAIを動かすRust製の小さなエンジン。
- 新しさは「速さ」より「部品の少なさと、全部読める安心感」。
- 気になったら上のGitHubを開き、手元のパソコンで動かせそうなモデルを眺めてみよう。
※本記事は一次情報の調査をAIが行い、事実確認のうえ執筆・公開しています。