SERIES — 計算資源 #14

128GBと192GB Unified Memory、
動かせるLLMはどう変わる?【2026年】

公開: 2026.10.08 | 更新: 2026.10.08 広告・PR

128GBから192GBへの増量は単なるメモリの上位互換ではなく、大容量LLMをどの量子化精度で保持できるかという選択肢を変える。

128GBと192GB Unified Memoryアーキテクチャと大規模LLM
※画像はイメージです。実際の製品・チップ構造とは異なる場合があります。
計算資源シリーズ(第14回)

スペック表の数値比較にとどまらず、「計算資源をどう持ち、何に使い、どのような価値へ変換するか」を用途から考えるシリーズです。第14回は、128GBと192GBのUnified Memoryで、実行できるローカルLLMの選択肢がどう変わるのかを考えます。メモリ容量、量子化方式、モデルの収容可能性、推論速度を分けて整理し、192GBへの追加投資が必要になる条件を明らかにします。

計算資源シリーズ一覧を見る →

ローカルLLMを実行するためのPCを選ぶとき、メモリ容量は重要な要素です。しかし、「メモリが大きければ大きいほど推論が速くなる」わけではありません。

2026年秋、AMD Ryzen AI Max+ PRO 495を搭載し、最大192GBのUnified Memoryを備えたミニPC(GMKtec EVO-X5 Proなど)が登場したことで、「128GBと192GBで何が違うのか」「自分の用途に192GBは必要なのか」という判断が浮上しました。

128GBから192GBへの増量は、単なる容量の拡大にとどまりません。大容量LLMをどの量子化精度でメモリ内に保持できるかという、ローカルAIの選択肢そのものを変える可能性があります。

この記事では、実測レビューではなく、公開されている公式モデル容量・ハードウェア仕様・既知の動作条件をもとに、128GBと192GBの境界を論理的に整理します。

※本記事は2026年10月8日時点の公開仕様・モデル配布情報に基づく技術比較です。同一条件での128GB機・192GB機の実機ベンチマーク測定は含みません。必要メモリ量はコンテキスト長、ランタイム、OS設定によって変動します。

結論:192GBの価値は速度よりも「扱えるモデルの選択肢」

128GBと192GBの違いを考えるうえで、最初に押さえたいポイントは次の3点です。

  1. 70B級のQ4量子化モデルが中心なら、128GBでも十分な場合が多い
  2. 120B級で量子化精度を上げたい場合や、200B級以上のモデルを扱う場合、192GBの価値が高くなる
  3. 300B〜320B級のモデルも量子化によっては実行候補になる。ただし128GBでの動作例もあり、192GBでなければ不可能というわけではない

特に注目したいのが、Qwen3-235B-A22BのQ4_K_Mです。

公開されている公式GGUFファイルは合計約142GBです。これは128GBという物理メモリ容量自体を超える一方、192GB環境ではモデルの重みをメモリ内に保持する余地が生まれます。

もちろん、ファイルサイズが収まるだけで快適に動作するとは限りません。OS、実行ランタイム、KVキャッシュ、GPUメモリ割り当てなども考慮する必要があります。

コアメッセージ

192GBは、128GBで十分な処理を速くするためのものではなく、128GBでは制約が大きかった処理の選択肢を広げるための容量です。

1. 128GBと192GBでは、何が違うのか

ここでは代表例として、AMD Ryzen AI Max+ 395搭載の128GB PCと、Ryzen AI Max+ PRO 495搭載の192GB PCを比較します。

項目 128GBクラス 192GBクラス
代表CPU Ryzen AI Max+ 395 Ryzen AI Max+ PRO 495
メモリ容量 128GB 192GB (+50%)
メモリ規格 LPDDR5X-8000 LPDDR5X-8533
メモリ帯域の目安 約256GB/s 約273GB/s (+6.6%)
内蔵GPU Radeon 8060S Radeon 8065S
GPU用メモリの設定例 最大96GB級 (VGM) 最大160GB (EVO-X5 Pro公称)
主な価値 70B級などの実用的なローカルLLM より大きなモデル・量子化形式への対応余地

重要なのは、メモリ容量が50%増えても、帯域の増加は約6.6%にとどまるという点です。

さらに、この比較ではCPUやGPUの世代・動作条件も異なります。そのため、性能差のすべてをメモリ容量の違いとして説明することはできません。

容量の増加と、計算速度の向上は明確に分けて考える必要があります。

2. Unified Memoryの192GBを、そのままGPUが使えるわけではない

Unified Memoryは、CPUと内蔵GPUが物理的なメモリプールを共有する仕組みです。

専用グラフィックボードに搭載されているGDDRメモリとは異なり、システム全体で利用するRAMとVRAMの境界を柔軟に設定できます。

例えばGMKtec EVO-X5 Proは192GBのUnified Memoryを搭載し、メーカーはBIOS等の設定で最大160GBをグラフィックスメモリ(VGM)として動的に割り当てられるとしています。

しかし、これは「あらゆるLLMの160GB分の重みが、必ず高速にGPU実行できること」を保証する数値ではありません。

実際には、次のメモリ消費要素を考慮する必要があります。

  • OSと常駐ソフトウェア:Windows 11環境では数GB〜十数GBのRAMを消費
  • LLMを実行するランタイム:Ollama、llama.cpp、vLLM等のプロセス作業領域
  • モデルの重み:量子化された重みテンソルそのもの
  • KVキャッシュ:会話のコンテキスト長(文脈)に比例して動的に肥大化
  • GPU処理用の一時領域:アテンション計算や中間バッファ
  • ほかのバックグラウンドアプリケーション:エディタ、ブラウザ、開発環境など

また、GPUに割り当てる設定と、推論実行時にGPUがアクセスできる共有メモリの仕組みは、OS・ドライバー・実行ランタイムによって挙動が異なります。

したがって、「192GB搭載=160GBのモデルなら必ず完全GPU実行できる」と断定しないことが極めて重要です。

3. モデル別に見る、128GBと192GBの境界

実際のモデルを例に、128GB環境と192GB環境での収容可能性を比較します。

※以下は、公開モデルのサイズとメモリ仕様から整理した論理的な判断表です。同一条件での実機ベンチマーク測定結果ではありません。

モデル・構成 128GB環境 192GB環境 出典・確認状況
Llama 3.3 70B
Q4系 (約40〜43GB)
有力な選択肢
容量面で収容可能
容量面で余裕が増加
長大コンテキスト対応
公式配布GGUF確認済
gpt-oss-120b
公式MXFP4 (約80GB要件)
有力な選択肢
80GBメモリで実行可能
余裕を確保しやすい
作業領域・KV拡張余地
OpenAI公式発表基準
Qwen3-235B-A22B
Q4_K_M (約142GB)
重みだけで物理容量を超過
低ビット化・別方式の検討が必要
全体を保持できる有力候補
※GPU全体配置は要検証
Qwen公式配布GGUF確認済
GLM-5.3-Flash (320B MoE)
3-bit UD-IQ3_XXS (約120GB)
条件付きで実行候補
Unslothが128GB環境での手順を公開。量子化・コンテキスト設定によっては追加メモリが必要
より余裕を確保しやすい
実行制約を緩和
Unsloth公開ガイド確認済
さらに大型のモデル
Dense 300B超など
量子化・オフロードに依存 量子化・オフロードに依存 実測未確認・要検証

この表で極めて重要なのは、「動く」「GPU全体に置ける」「快適に使える」の3つは全く異なるということです。

モデルが物理メモリに収まることは推論成立の第一段階にすぎません。利用予定のモデルが決まっている場合は、GGUFファイルサイズ、推奨RAM/VRAM、使用する推論ランタイム、コンテキスト長を事前に確認してください。

4. Qwen3-235B-A22B:192GBを考える明確な理由

128GBと192GBの境界を最もわかりやすく示す具体例が、Qwen3-235B-A22Bです。

このモデルは、総計235Bパラメータを持ちながら、一度のトークン生成で22BのExpertが活性化するMoE(Mixture of Experts)構成を採用しています。

MoEでは、トークンごとに一部のExpertが選択されるため、総パラメータ数がそのまま毎回の計算量になるわけではありません。一方、選択されるExpertは入力によって変わります。そのため、大きな重み全体へ高速にアクセスできるメモリ構成が、実用的な推論を行ううえで重要になります。

Qwen公式のGGUF配布において、Q4_K_M量子化モデルのファイルサイズは合計約142GBです。

128GB環境での状況

モデル重み単体(約142GB)が搭載物理メモリ(128GB)を超えるため、通常の方法では全体をメモリ内に保持できません。さらに低ビットな量子化(IQ3/IQ2等)や、ストレージへのページングを伴う低速な回避策を強いられます。

192GB環境での状況

192GBのシステムメモリがあれば、約142GBの重みを物理メモリ内に収容する余地が生まれます。最大160GBのグラフィックスメモリ割り当て設定と組み合わせることで、ローカル実行の有力候補になります。

ただし、192GB環境であっても、KVキャッシュの長さやランタイムの一時領域によっては160GBの設定上限に迫るため、「GPU全体への配置は要検証」です。

192GBの真の価値は、「235Bなら必ず高速に動く」ことではありません。128GBでは物理容量の壁でそもそも土俵に上がれなかった量子化モデルを、ローカル実行の候補として検討できる点にあります。

5. メーカー公称「最大320B」は何を意味するのか

GMKtecはEVO-X5 Proについて、「適切なモデル、ソフトウェア、量子化、システム設定を用いることで、最大320BパラメータのLLMを完全オフラインで実行できる」と案内しています。

ここで誤解してはならないのは、「320Bというパラメータ数」がそのまま必要メモリ容量を表すわけではないということです。

代表的な320B級モデルに、GLM-5.3-Flashがあります。このモデルは総計320Bのパラメータを持ちますが、活性化するのは18BのMoEアーキテクチャです。

AI最適化ツールを提供するUnslothは、GLM-5.3-Flashについて低ビット量子化を公開しており、例えばUD-IQ3_XXSの配布サイズは約120GBです。

UnslothはGLM-5.3-Flashの3-bit量子化モデルについて、128GB環境での実行手順を公開しています。一方、公開されているメモリ要件には128〜150GBという幅があり、量子化形式、コンテキスト長、実行環境によって必要量が変わります。

そのため、128GB環境で実行できる場合があることと、128GBあれば余裕をもって運用できることは、同じ意味ではありません。

192GBの価値は、こうしたメモリ制約を緩和し、より柔軟な実行条件を選べる点にもあります。

  • 128GB環境:約120GBのモデルを展開すると残余メモリがわずかとなり、オフロード設定やOSのメモリ管理が極めてシビアになります。
  • 192GB環境:192GBの搭載容量と約120GBのモデルファイルサイズを比較すると、数値上は約72GBの差があります。ただし、実際に利用できる余裕は、OS、KVキャッシュ、ランタイムの作業領域などを差し引いたものになります。

なお、GMKtecが公称する320B動作テストで実際に使用されたモデルや実行設定がGLM-5.3-Flashと同一であるかは、公式資料からは未確認です。

「最大320B対応」という宣伝文句を見るときは、「何のモデルを、どの量子化方式で、どの程度の速度で動かしたのか」を必ず確認しましょう。

6. 192GBになっても推論速度が1.5倍になるわけではない

ローカルLLMの推論性能は、メモリ容量だけで決まるものではありません。主に以下の要素が複雑に影響します。

  • モデルのアーキテクチャ(Dense型かMoE型か、アテンション構造)
  • 量子化方式(4bit、3bit、FP8、重みの精度)
  • メモリ帯域幅(毎秒何GBのデータをプロセッサへ転送できるか)
  • GPU / NPU / CPUの演算性能(計算ユニット数、クロック)
  • 推論ランタイムの最適化(llama.cpp、vLLM、ROCm、DirectML等の対応度)
  • コンテキスト長(プロンプトと生成トークンの合計長)
  • GPUへのオフロード比率(全層GPUか、一部CPU混在か)

今回の代表比較において、メモリ帯域幅は256GB/s(128GB機)から273GB/s(192GB機)への増加であり、向上率は約6.6%にすぎません。

したがって、どちらのPCでも余裕をもって収まる同じモデル(例: Llama 3.3 70B)を動かす場合、メモリ容量が1.5倍になったからといって速度が1.5倍になることはありません。

一方、128GB機ではモデルの重みや作業領域が物理メモリに収まり切らず、ストレージへのページングなどが発生する場合があります。192GB機で必要なデータを物理メモリ内に保持できれば、こうした制約を緩和できる可能性があります。ただし、Unified MemoryではCPUとGPUが同じ物理メモリプールを共有します。そのため、専用GPUのVRAM不足をシステムRAMで補う構成と、同じ仕組みとして説明することはできません。実際の性能は、CPU・GPUの処理分担、ランタイム、ドライバーの実装によって異なります。

※なお、同一条件での実機トークン生成速度(tok/s)は現時点で公的実測が未確認のため、本記事では推測の数値を断定的に記載していません。

7. 128GBで十分な人と、192GBを検討する人

以上の技術的根拠をもとに、128GBで十分なユーザーと、192GBへの投資を検討すべきユーザーの境界を整理します。

128GBが向いている人

  • 70B級のQ4モデルを中心に実用運用したい人:Llama 3.3 70BやQwen 72Bなどの実用モデルは、128GB環境で十分に動作します。
  • 小型〜中型LLMを複数試したい人:8B〜32B級のモデルを並行稼働させたり、ローカルAIエージェント、RAGシステムを構築したりする場合、128GBで不足することはほとんどありません。
  • 費用対効果を最優先したい人:現在使いたいモデルが128GB環境に収まっているなら、192GBを購入する経済的合理性は低くなります。

判断基準:今使いたいモデルが128GBで快適に動作しているなら、無理に192GBへ投資する必要はありません。

192GBを検討する人

  • 200B級以上のモデルをローカルで扱いたい人:Qwen3-235B-A22BのQ4_K_M(約142GB)のように、128GBの物理限界を超えるモデルをローカル検証したい研究者・開発者。
  • モデルの重み+長大コンテキストを丸ごと保持したい人:120B級モデルで数万トークン以上のKVキャッシュを展開し、長大なドキュメント分析を行う用途。
  • メモリ容量そのものが作業のボトルネックになっている人:オフロードや低ビット量子化による精度劣化をできる限り避けたい環境。

価格差をどう考えるか

192GBクラスのミニPC(EVO-X5 Pro等)は、2026年10月時点の市場において100万円級の高額なプレミアム製品です。

128GBクラスのPCとの価格差には、単なるRAMモジュール64GB分のコストだけでなく、法人向けPROプロセッサ(Ryzen AI Max+ PRO 495)の採用、セキュリティ機能、筐体設計、限定的な流通コストなどが含まれています。

そのため、単純に「64GB増やすためにいくら払うか」と考えるのは適切ではありません。

重要なのは、「128GBでは成立しなかった研究や業務が、192GBを導入することで成立するようになるか」という判断です。その業務的・研究的価値が価格差に見合うのであれば投資対象になります。逆に、利用モデルがすでに128GBに収まるなら、差額を別の計算資源やクラウドGPUに振り分ける方が合理的です。

まとめ:容量の境界を見極めて投資を判断する

128GBと192GB Unified Memoryの本質的な違いは、推論速度の向上ではなく「物理メモリに収容できるモデルの選択肢」にあります。70B級なら128GBで成立し、Qwen 235Bなどの超大型MoEをQ4精度で狙う場合に初めて192GBの価値が際立ちます。

メーカー公称の最大パラメータ数だけで判断せず、自分が動かしたいモデルのファイルサイズ・量子化形式・実行ランタイムを確認したうえで、最適な計算環境を選択してください。

よくある質問

128GBあれば70BのローカルLLMは動きますか? +
モデルと量子化方式によりますが、70B級のQ4量子化モデルは128GB搭載PCで有力な選択肢です。実際の必要量はコンテキスト長やランタイムによって変わります。
192GBならQwen3-235Bを快適に動かせますか? +
Q4_K_Mの約142GBというモデルサイズは192GBの物理メモリ容量に収まります。ただし、GPUへの割り当て、KVキャッシュ、実装によって動作可否や速度が変わります。快適性は実測確認が必要です。
320BのLLMは192GBでしか動かせませんか? +
いいえ。モデルと量子化方式によっては128GB環境での実行例や手順もあります。320Bという総パラメータ数だけでは、必要メモリを判断できません。
Unified Memoryが多ければGPUは不要になりますか? +
いいえ。ローカルLLMのモデル保持には大容量Unified Memoryが役立つ場合がありますが、画像生成、リアルタイムCG、CUDA依存の制作環境などでは専用GPUが適していることがあります。
192GBを購入する前に何を確認すべきですか? +
利用したいモデルの正式名称、量子化ファイルサイズ、ランタイム対応、必要メモリ、推論速度、価格です。特に、メーカーの最大対応パラメータ数だけで判断しないことが重要です。

公式情報・参考資料

※本記事は2026年10月8日時点の公開仕様・モデル配布情報に基づく技術比較です。同一条件での実機速度ベンチマークは含みません。

この記事の編集・執筆

CORE SPEC編集部が、メーカー公式仕様、公開モデルの配布情報、技術ドキュメントを照合し、128GBと192GBの選択基準を整理しました。本記事には、同一条件での独自ベンチマーク測定は含まれません。

運営者情報・編集方針を見る
SERIES 計算資源シリーズ(全14回)
#01 RTX 5090とRTX PRO 6000を比較:32GB・2枚差し・96GB巨大空間 読む →

計算資源の「最上位対決」|民生用フラッグシップとプロ用ワークステーションの境界線

#02 GPUマイニングは終わったのか? 暗号資産と計算資源の現在地 読む →

計算資源の「価値・用途」|電力を計算を通じて価値へ変換する。主戦場がAIへ移った背景

#03 クラウドGPUとローカルPCはどっちが安い? 月40・120・240時間の損益分岐点 読む →

計算資源の「所有・利用」|必要なときだけ借りるか、自分の環境として持つか。利用時間・VRAM・総コストから判断する

#04 Mac StudioとRTX搭載BTOはどっちがローカルLLM向き? 読む →

計算資源の「メモリ構造」|100GB超の大容量ユニファイドメモリと、高帯域なGDDR7専用VRAM。「載る容量」と「動かす速度」を分けて考える

#05 RAM 128GBでVRAM不足は補える? オフロードの限界 読む →

計算資源の「境界線」|「入る」と「速い」の違い、PCIeボトルネックとオフロードの現実

#06 ローカルLLMはロマン枠なのか? ChatGPT時代にGPUを所有する意味 読む →

計算資源の「哲学と自由」|買っているのはAIではない、AIを動かす自由だ。所有コストと依存コストの比較

#07 画像生成から動画生成へ。制作フローで考えるRTX 5080・5090・RTX PRO 6000の選び方 読む →

計算資源の「制作フロー」|16GB・32GB・96GBで変わるのは「できること」より「制約の数」

#08 AI時代にGPUはなぜ高い? AI需要・HBM・半導体製造から価格高騰を読み解く 読む →

計算資源の「コスト構造」|HBM・パッケージング・半導体製造の逼迫から見るGPU高騰の本質

#09 7B・14B・32B・70B・120BにはVRAM何GB必要? モデルサイズ別早見表 読む →

計算資源の「モデル逆算」|7B〜120Bのモデル規模・量子化・KVキャッシュから必要なVRAM容量を逆算する

#10 RTX 5090・RTX PRO 6000に必要な電力と冷却とは? GPUだけでは「計算資源」は完成しない 読む →

計算資源の「持続性」|GPUを動かし続ける電力・冷却・筐体・設置環境を考える

#11 Radeonは生成AIに使える? CUDA vs ROCmと対応ソフトを用途別に解説 読む →

計算資源の「互換性とソフトウェア制約」|GPU性能の数字だけでなく、CUDAとROCm、PyTorch、ComfyUI、TouchDesignerの制作フロー全体からGPUの本当の選び方を整理する

#12 ローカルLLM用PCは水冷が必要? エアフロー・空冷・水冷の選び方 読む →

計算資源の「冷却選定」|ローカルLLM用PCを選ぶとき、ケース・エアフロー・空冷・水冷のどこを見るか

#13 大容量ユニファイドメモリPCを比較 読む →

計算資源の「共有メモリと購入判断」|Ryzen AI Max+ 395・Mac Studioなど、大容量ユニファイドメモリを使えるPCを用途別に比較する

#14 128GBと192GB Unified Memory、動かせるLLMはどう変わる? この記事

計算資源の「容量境界とモデル選択」|128GBと192GBで変わるLLMの収容可能性、量子化精度、推論速度、投資判断を整理する。

この記事をシェアする

𝕏 Xでシェア f Share ● LINE