2026年の9月は、Claude Mythos5.1/Fable 5.1やGPT-6-Astraの登場でクラウド型AIの状況も目が離せませんが、自分のPCや社内サーバーで動かせるローカルLLMも新しいモデルが次々と登場しています。
2026年春の記事では、「ローカルLLMは普通のPCでも動く。ただし、“動く”ことと“実用になる”ことは別」と紹介しました。
それから数か月。Qwen、DeepSeek、GLM、Kimiなどから新モデルが登場し、状況はさらに面白くなっています。
20〜30B級の高性能モデルが個人のPCでも現実的になってきた一方、数百Bから数兆パラメータという巨大なオープンモデルも増えました。
「オープンモデルだから自分のPCで動かせる」とは限らないのが、2026年秋のローカルLLM事情です。
2026年秋の新しいモデルを見てみる
最近の代表的なモデルを並べると、規模の違いがよくわかります。
| モデル | 規模 | 一般的なPCでの扱いやすさ |
|---|---|---|
| Qwen3.8-27B | 27B | ○ |
| DeepSeek-V4-Flash | 284B / 13B active | △〜× |
| GLM-5.3-Flash | 320B / 18B active | △〜× |
| Kimi K3 | 2.8T | × |
Qwen3.8-27Bは、画像にも対応した27Bモデルです。OllamaではQ4_K_M量子化版が約18GBで配布されており、256Kコンテキストにも対応しています。24GBクラスのGPUなら、十分に試せる大きさです。
DeepSeek-V4-Flashは284B、GLM-5.3-Flashは320B。どちらもMoE(Mixture of Experts)を採用し、1回の処理で使われるパラメータ数はそれぞれ13B、18Bに抑えられています。
Kimi K3になると2.8T、つまり2兆8000億パラメータです。896のExpertから16を使う巨大なMoEモデルで、1Mトークンのコンテキストと画像・動画入力にも対応しています。
同じ「オープンモデル」でも、必要なハードウェアはまったく違います。
「13B activeなら軽い」は要注意
MoEモデルで少しややこしいのが、「active parameter」という数字です。
DeepSeek-V4-Flashは284Bのモデルですが、1回の処理で使うのは13B程度です。
では13Bモデルと同じように12GB程度のGPUで動くのかというと、そうではありません。
計算に使うのが一部でも、モデル全体の重みはどこかに保持する必要があります。GPUだけでなくCPU側のメモリへ逃がす方法もありますが、速度との交換になります。
モデルを選ぶときは、active parameterだけでなく総パラメータ数と実際の量子化モデルのサイズも確認したほうが安全です。
普通のPCなら20〜30B級が面白い
個人のデスクトップPCで使うなら、2026年秋でも数B〜30B前後が扱いやすい範囲です。
Q4前後の量子化を前提に、ざっくり分けると次のようになります。
| VRAM | 使いやすいモデルの目安 | 用途 |
|---|---|---|
| 8GB前後 | 3B〜8B級 | お試し、要約、文章生成 |
| 12GB | 7B〜14B級 | 軽いRAG、文章生成、コード支援 |
| 16GB | 12B〜20B級 | 業務検証、RAG、コード支援 |
| 24GB | 20B〜30B級 | Qwen3.8-27B級 |
| 32GB以上 | 30B級を余裕を持って利用 | 長文、画像、重めの処理 |
これはあくまで目安です。
モデル本体以外にもコンテキストを処理するためのメモリが必要なので、「18GBのモデルなら24GB VRAMで6GB余る」と単純には計算できません。
特に長い文書を扱う場合は、モデルサイズだけでなくコンテキスト長にも注意が必要です。
では、どのGPUを買えばいい?
24GBのGPUと言われても、製品によって価格はかなり違います。
2026年9月7日時点の国内価格を調べてみました。
| GPU | VRAM | 価格の目安 | ローカルLLM用途 |
|---|---|---|---|
| RTX 5070 | 12GB | 約14〜16万円 | 小〜中型モデル向け |
| RTX 5070 Ti | 16GB | 約22〜24万円 | バランス型 |
| RTX 3090 | 24GB | 中古 約20万円〜 | VRAM重視なら有力 |
| Radeon RX 7900 XTX | 24GB | 約23〜27万円 | 新品24GBが魅力 |
| RTX 5090 | 32GB | 約91万円〜100万円超 | 強力だが高価 |
RTX 5070は12GB、5070 Tiは16GBです。
ここで面白いのがRTX 3090です。
2020年登場の旧世代GPUですが、VRAMは24GB。2026年9月現在、中古品なら20万円前後から見つかります。
同じ20万円台でも、次のような違いがあります。
- RTX 5070 Ti:16GB
- 中古RTX 3090:24GB
ゲーム性能や消費電力、新品保証を重視するなら5070 Tiのほうが選びやすいでしょう。
ローカルLLMで「少しでも大きなモデルをGPUに載せたい」なら、RTX 3090は今でも候補に残ります。
新しいGPUほどローカルLLM向き、とは限りません。
新品24GBならRadeonもある
中古GPUは避けたいが24GB欲しい、という場合はRadeon RX 7900 XTXも候補になります。
2026年9月時点では、24GBモデルが23〜27万円程度で確認できます。
Ollamaやllama.cppなどを中心に使うなら、AMD GPUでもローカルLLMを動かせます。
ただしAI関連のツールやサンプルにはCUDA前提のものも多いため、「いろいろなAIソフトを試したい」「環境構築で苦労したくない」ならNVIDIAのほうが無難です。
RTX 5090は32GB。ただし約100万円
RTX 5090は32GBのGDDR7を搭載しています。
24GBでは窮屈だったモデルも扱いやすくなりますが、2026年9月現在の国内価格は安い製品でも約91万円。100万円を超える製品もあります。
ここまで来ると、「ローカルLLMを使えばクラウドAIより安い」と単純には言えません。
GPUだけで90万円以上。さらにCPU、メモリ、電源、冷却なども必要です。
ローカルLLM専用にPCを新調するなら、APIやGPUクラウドを必要なときだけ使った場合の費用とも比べておいたほうがよいでしょう。
MacはVRAMではなく統合メモリを見る
Apple Silicon搭載Macでは、CPUとGPUが同じ統合メモリを使います。
そのためWindows PCの「VRAM 24GB」とは考え方が少し違います。
Qwen3.8-27Bの量子化版は約18GBなので、32GBのMacでも試す余地はあります。ただしOSやほかのアプリ、コンテキスト処理も同じメモリを使います。
20〜30B級を日常的に使うなら、64GB以上あるとかなり楽になります。
「ローカル」の規模も広がっている
Kimi K3のようなモデルまで「ローカルLLM」と一括りにすると、話が噛み合わなくなります。
現在は、おおよそ3段階に分けて考えるとわかりやすいでしょう。
個人PC
OllamaやLM Studioで数B〜30B前後の量子化モデルを動かします。
社内GPUサーバー
複数ユーザー向けにGPUサーバーを用意し、API経由で利用します。
データセンター級セルフホスト
数百B〜数T規模のモデルを複数GPUで動かします。
DeepSeek-V4-Flash、GLM-5.3-Flash、Kimi K3のようなモデルは、重みが公開されていても「普通のPCで気軽に動かすモデル」ではありません。
オープンウェイトとパーソナルローカルは、分けて考えたほうがよさそうです。
2026年秋なら、まずどこから始める?
これからローカルLLMを試すなら、まず用途から考えてみましょう。
文章生成や要約、軽いRAGなら12〜16GBクラスでも十分試せます。
コード生成や複雑な処理でもう少し大きなモデルを使いたいなら、24GBクラスが面白くなります。Qwen3.8-27Bのようなモデルが、ちょうどこの範囲に入ってきました。
そして数百B以上のモデルが必要なら、PCへ巨大なGPUを追加していくより、社内サーバーやクラウドを検討したほうが現実的かもしれません。
2026年秋のローカルLLMは、「最大のモデルを動かせるか」を競う世界ではなくなりつつあります。
使いたいモデルが無理なく収まるハードウェアを選ぶ。
結局これが、一番長く使える選び方です。
弊社では、ローカルLLMの導入可否検討や、社内文書検索・RAG環境の構築について、お客様の用途や予算に合わせたご相談を承っています。
