💡 30秒で結論|M5 UltraはRTX 5090に迫った。しかし、同じ速さではない
・回答生成(Decode)はRTX 5090の約8割:Mac Studio M5 Ultraは、ローカルLLMの「回答を書き出す速度」でRTX 5090に近い水準(48 tok/s vs 59 tok/s)を示しました。逐次生成の体感速度ではハイエンドGPUに迫ります。
・入力読込(Prefill)と応答開始(TTFT)はRTX 5090が優勢:一方、プロンプト処理速度は1,701 tok/s対3,031 tok/s、最初のトークンが返るまでの時間(TTFT)は4.0秒対2.0秒と、Tensorコアを備えるRTX 5090が依然として大きく先行しています。
・「速さ」は条件次第で逆転する:速度を決めるのはGPU名だけではありません。モデルの規模、量子化形式、コンテキスト長、専用VRAMに収まるか、そして実行ランタイムの違いで結果は変わります。
2026年9月にMacStoriesが公開したQwen3.8 27Bのテストでは、RTX 5090搭載Windows PCが回答生成59 tok/s、Mac Studio M5 Ultraが48 tok/sを記録しました。M5 UltraはRTX 5090の約81%に相当する生成速度を記録しています。一方、入力処理速度は3,031対1,701 tok/s、最初のトークンが返るまでの時間は2.0秒対4.0秒でした(出典:MacStories)。
大切なのは「RTXより速い/遅い」と結論を急がないことです。速度を決めるのはGPU名だけではありません。モデルの大きさ、量子化、コンテキスト長、専用VRAMに収まるか、そして実行ソフトの違いで結果は変わります。
| 読者の条件・目的 | 最初に検討したい方向性 |
|---|---|
| 7B〜14Bなど、専用VRAMに収まるモデルを高速に扱いたい | RTX 5080/5090を含むCUDA環境を検討 |
| 27B〜32B級のモデルを快適に扱いたい | RTX 5090、24GBのRTX 5090 Laptop、M5 Ultraなどを条件付きで比較 |
| 70B級以上や長大なコンテキストをローカルで扱いたい | M5 Ultraの大容量統合メモリ、RTX PROの大容量VRAMを検討 |
| 複数ユーザーへAIを提供し、CUDA系の推論基盤を運用したい | RTX PROとLinux/CUDA対応ワークステーションを検討 |
| TouchDesigner・Houdini・Unreal Engineなども主力用途 | LLM速度とは別に、制作用途のOS・GPU・プラグイン適合を確認 |
※この表は購入機種の一律推奨ではありません。アプリケーション互換性、モデルの量子化、価格、運用体制によって最適解は変わります。アーキテクチャ全体の定性的な判断軸については「Mac Studio M5 UltraとRTX 5090搭載BTOの選択」も合わせてご参照ください。
- 1. なぜ「速さ」を分けて考える必要があるのか
- 2. 実測①|27BモデルではRTX 5090が速いが、M5 Ultraも近い
- 3. 実測②|64K〜256Kの長文でも、最適化したRTX 5090が先行
- 4. 実測③|RTX 5080・5090 Laptop・RTX PROはどれくらい速い?
- 5. 比較対象は全9構成|容量の違いを整理する
- 6. 16GB・24GB・32GB・48GB以上で「できること」はどう変わる?
- 7. AIエージェントでは「1人の速さ」より「仕事全体の所要時間」
- 8. RTX PRO 5000・5500・6000を選ぶ意味は何か
- 9. TouchDesigner・Houdini・Unreal Engineにも同じ結論を使えるか?
- 10. 価格を比較するなら「GPU単体」ではなく、動く環境の総額を見る
- 11. 用途別の最終判断|MacかRTXかではなく、仕事の条件から決める
- 12. 結論 / 次の判断 / よくある質問
なぜ「速さ」を分けて考える必要があるのか
ローカルLLMの速度には、異なる3つの側面があります。
一般に、バッチサイズが小さい(個人利用の)Decodeはメモリ帯域幅の影響を強く受け、Prefillは並列演算性能(Tensorコアやダイ規模)が重要になりやすい傾向があります。ただし、モデル構造・量子化・実装次第で挙動は異なり、帯域幅のスペック値だけからtok/sを単純計算することはできません。
実測①|27BモデルではRTX 5090が速いが、M5 Ultraも近い
MacStoriesの比較は、RTX 5090搭載Windows PCとM5 Ultra搭載Mac Studioに同じタスクとプロンプトを与えた実測です。両者のモデル系列は同じQwen3.8 27Bですが、MacはoMLX/MLX形式、WindowsはLM Studio/GGUF Q4_K_Mを利用しています。したがって、GPU単体を同一条件で測った純粋なベンチマークではなく、各プラットフォームの最適化を含めた現実のシステム間比較と受け取る必要があります。
約6,000トークン入力時の比較
| 指標 | RTX 5090搭載PC | M5 Ultra Mac Studio | 読み方・分析 |
|---|---|---|---|
| 回答生成速度(Decode) | 59.0 tok/s | 48.0 tok/s | RTX 5090が約23%高速(M5 Ultraは約81%に到達) |
| 入力処理速度(Prefill) | 3,031 tok/s | 1,701 tok/s | RTX 5090が約1.78倍高速(Tensorコアの強み) |
| 最初の応答まで(TTFT) | 2.0秒 | 4.0秒 | RTX 5090が半分の時間で応答を開始 |
| 回答完了までの総時間 | 5.5秒 | 8.4秒 | このテスト条件ではRTX 5090が短時間で完了 |
出典:MacStories「M5 Ultra Mac Studio Review」(2026年9月、第三者実測)。テスト入力は6,091トークン。Macは36コアCPU/80コアGPU/256GB統合メモリ構成。モデルの量子化とランタイムは異なり、測定は条件ごとに限定的な回数で行われています。
Qwen3.8 27B 回答生成速度(Decode)実測比較
※同一タスクにおける最適化システム間比較。入力6,091トークン条件。ランタイム・量子化形式の違いを含んだ現実的な運用環境の対比です。
ここから言えるのは、「M5 Ultraが5090と同じ速さになった」ということではありません。書き出し速度では大きく近づいたが、読み込みや応答開始まで含めると差はまだ明確にあるということです。AIエージェントで大量のコンテキストを何度も投入するワークフローでは、PrefillとTTFTの違いが見逃せません。
実測②|64K〜256Kの長文でも、最適化したRTX 5090が先行
長文の処理では、モデル本体だけでなく過去のトークンを保持するKVキャッシュにもメモリが必要になります。ここで32GB専用VRAMのRTX 5090と、大容量統合メモリを持つM5 Ultraの違いが表れます。
| コンテキスト長 | RTX 5090(32GB) | M5 Ultra(256GB) | 注意事項・測定条件 |
|---|---|---|---|
| 約64K(64,000トークン) | 49.6 tok/s | 38.9 tok/s | RTX 5090が高速 |
| 約128K(128,000トークン) | 40.4 tok/s | 32.4 tok/s | RTX 5090が高速 |
| 約256K(256,000トークン) | 30.0 tok/s | 24.3 tok/s | RTX 5090は8-bit KVキャッシュを使用 |
出典:MacStories。表は回答生成速度(Decode)であり、長文を読み込むTTFTの比較ではありません。256KのRTX 5090測定ではKVキャッシュの量子化設定を変更しています。
64K〜256K 長文コンテキストでの生成速度推移
ここは最も誤解されやすいポイントです。この測定において、256KでもM5 UltraがRTX 5090を追い抜いたわけではありません。 RTX 5090は8-bit KVキャッシュを用いることで、256Kの超長文でも30.0 tok/sを維持しています。
一方、別条件でモデルの一部をGPU専用メモリからシステムRAMへオフロードしたケースでは、生成速度は1.5 tok/sまで低下しました。これはRTX 5090の通常性能を表す値ではなく、専用VRAMの容量を超え、PCIeバス経由での転送が発生したときの物理的な限界例です(オフロードの速度低下の仕組みについては「RAM 128GBでVRAM不足は補えるか?」で詳しく解説しています)。
M5 Ultraの真の価値は、このテストで5090より速かったことではありません。大容量の統合メモリによって、キャッシュ圧縮やCPU側へのオフロードを心配することなく、超長文コンテキストを安定したオンメモリ速度(24.3 tok/s)で確実に処理しきれる堅牢性にあります。
実測③|RTX 5080・5090 Laptop・RTX PROはどれくらい速い?
次は、llama.cppの公開コミュニティベンチマークにあるLlama 2 7B Q4_0の結果です。比較条件はpp512 / tg128、Flash Attention無効。同じ測定企画の値ではありますが、測定者、PC本体、OS、ドライバ、ソフトウェア版は必ずしも統一されていないため、参考値として読み解きます。
| GPU / 環境 | 回答生成速度(Decode) | 公開測定の位置づけ・留意点 |
|---|---|---|
| GeForce RTX 5090 Desktop(32GB) | 290.02 tok/s | llama.cpp公開ベンチマーク実測 |
| RTX PRO 6000 Blackwell(96GB) | 274.20 tok/s | llama.cpp実測(※GPUエディション未特定) |
| GeForce RTX 5080 Desktop(16GB) | 181.99 tok/s | llama.cpp公開ベンチマーク実測 |
| RTX 6000 Ada Generation(48GB) | 176.07 tok/s | 前世代AdaワークステーションGPU実測 |
| GeForce RTX 5090 Laptop(24GB) | 156.49 tok/s | モバイルGPU実測(搭載機種・電力設定依存) |
出典:ggml-org / llama.cpp Discussion #15013。別投稿者による測定値を含むため、厳密な性能順位ではありません。RTX PRO 6000の測定エディションは特定できません。
llama.cpp #15013 NVIDIA GPU群の7B Decode参考比較
この7B測定が教えてくれるのは、比較できるのは「型番」ではなく、「モデル・量子化・ランタイム・測定方法までセットにした実行条件」だということです。
比較対象は全9構成|容量の違いを整理する
今回の調査対象である全9構成のメモリ仕様と、ローカルLLMにおける位置づけを整理します。
| ハードウェア構成 | GPUが扱うメモリの目安 | ローカルLLMにおける主な役割 |
|---|---|---|
| Mac Studio M5 Ultra | 96/256/512GB 統合メモリ | 大容量ローカルAIとMLX最適化環境 |
| GeForce RTX 5080 | 16GB GDDR7 専用VRAM | 小〜中規模LLM・高速推論・制作向けCUDA |
| GeForce RTX 5090 Desktop | 32GB GDDR7 専用VRAM | 最速クラスの推論速度を重視する上位構成 |
| GeForce RTX 5090 Laptop | 24GB GDDR7 専用VRAM | モバイル環境でのCUDA推論とリアルタイム制作 |
| RTX PRO 5000 Blackwell | 48GB GDDR7 ECC 専用VRAM | ECCメモリを備える業務向け中核GPU |
| RTX PRO 5000 Blackwell | 72GB GDDR7 ECC 専用VRAM | 70Bモデル収容と商用推論サーバー運用 |
| RTX PRO 5500 Blackwell | 84GB GDDR7 ECC(仕様暫定) | NVIDIA公式「Coming Soon」の比較候補 |
| RTX PRO 6000 Blackwell | 96GB GDDR7 ECC 専用VRAM | 最上位大容量CUDAワークステーション |
| RTX 6000 Ada Generation | 48GB GDDR6 ECC 専用VRAM | 前世代Ada世代の比較基準 |
出典:AppleおよびNVIDIA公式仕様。RTX PRO 5500は2026年10月11日時点でNVIDIA公式が「Coming Soon」と記載しており、仕様も予告なく変更される可能性があります。
重要:96GBの統合メモリは96GBの専用VRAMと同義ではありません。
MacはCPUとGPUが単一のメモリ空間を共有します。一方、RTX PROではGPUに専用の超高速GDDR7メモリが搭載されます。OSのメモリ占有、メモリ割り当て、CPU・GPU間データ転送、ソフトウェアの最適化条件が根本から異なります。
16GB・24GB・32GB・48GB以上で「できること」はどう変わる?
7B〜14B:速度と実行環境で選ぶ快適ゾーン
4-bit量子化された7Bや14B級のモデルでは、今回比較するほとんどの構成でGPUメモリ内への完全収容が可能です。専用VRAMが足りている場合、CUDAエコシステムとの互換性、実行速度、価格、PC本体の制作用途が選択理由になります。
このクラスでは、M5 Ultraの大容量メモリを持て余す場合もあります。ローカルLLMだけのために高額なM5 Ultraを導入する前に、より手頃な構成で目的を達成できるかを検討すべきです。
27B〜32B:16GBを超えると選択の境界が現れる
今回扱う27B級の一般的なQ4構成は、モデル重みだけで約16〜19GBに達し、これに加えてKVキャッシュやOSランタイム用の余裕も必要になります。16GBのRTX 5080単体ではGPUメモリ内に収めることが難しいケースが出てきます。
24GBを持つRTX 5090 Laptopや32GBのRTX 5090 Desktopは有力な候補になりますが、長文コンテキストを常に無制限に扱えるわけではありません。「モデル重みが収まるか」と「使いたいコンテキスト長で収まるか」は別の問いです。より低い量子化やオフロードで動かす場合も、速度や回答品質の変化を考慮する必要があります。
70B以上:専用VRAM容量か統合メモリ容量かの決断
70B級のQ4モデルでは、重みだけでおおむね40GB前後が必要になります。16GB・24GB・32GBのコンシューマ向けGeForce単体で重み全体を専用VRAMに収めるのは一般的なQ4条件では困難です。
選択肢は、RTX PRO 5000(48GB/72GB)、RTX PRO 6000(96GB)、あるいはM5 Ultraの大容量統合メモリ(96GB/256GB/512GB)に広がります。48GB構成では70B Q4でKVキャッシュの余力が小さくなる可能性がありますが、72GB以上では長文や高精度量子化の自由度が大きく向上します。
なお、70Bを動かすためにM5 Ultraの256GB構成が常に必須なわけではありません。 96GB構成でも量子化と使用条件次第で収容可能です。逆に256GB構成であっても、あらゆる巨大モデルを高速に動かせるとは限りません。
AIエージェントでは「1人の速さ」より「仕事全体の所要時間」
AIエージェントの運用は、1回質問して回答を生成して終わりではありません。ファイルを探索し、コードを読み込み、複数のサブエージェントに並列でタスクを割り振り、結果を統合します。
そこで問われるのは、単一セッションのDecode速度だけでなく、Prefill、TTFT、同時処理時の総スループット、コンテキスト保持、そして待機時間の総和です。
MacStoriesのM5 Ultra実測では、モデルと条件を限定した並列実行において、単独処理の合計66 tok/s程度に対し、3リクエスト同時実行では合計約81 tok/sというスループット向上が確認されました。ただし、個々のリクエスト自体の応答時間は並列化によって長くなる場合があります(出典:MacStories)。
デスクサイドで24時間AIエージェントを走らせる場合、消費電力と静音性も実用性を左右します。ITmedia等のレビューで確認されたMac Studioのシステム稼働電力は約100〜160W程度にとどまり、高負荷時でも静音性を維持しやすい傾向があります。一方、ハイエンドデスクトップGPU(RTX 5090のTGP 575W等)を搭載するPC環境では、相応の電源容量と排熱設計が必要になります。
RTX PRO 5000・5500・6000を選ぶ意味は何か
M5 Ultraが個人向けのローカルLLM環境として優れた選択肢であるとしても、業務におけるRTX PROの価値が損なわれるわけではありません。
今回、RTX PRO 6000 Blackwellでは7Bモデルの公開実測274.20 tok/sを確認できましたが、使用されたGPUエディションは特定できません。また、RTX PRO 5000や5500の同条件実測速度は未確認です。CORE SPECでは、実測根拠のない推論速度を帯域幅から推計してランキング化することはいたしません。
関連解説:RTX PROシリーズ総合ガイド / ワークステーション購入ガイド
TouchDesigner・Houdini・Unreal Engineにも同じ結論を使えるか?
使えません。少なくともそのまま適用してはいけません。
ローカルLLMの生成速度が近くても、TouchDesignerのリアルタイム描画、Houdiniのプロシージャルシミュレーション、Unreal Engineのリアルタイムレンダリング、外部映像I/O機器の低遅延接続は全く別の評価軸です。
OS対応、CUDAやOptiXへの依存度、GPUドライバの成熟度、サードパーティ製プラグイン、SDI/NDI映像伝送などの条件において、GeForce RTXやRTX PROを搭載したWindows/Linuxワークステーションの方が圧倒的に適しているケースが多々あります。
Macが一律に不利であると断定するのでも、LLMの速度が近いからクリエイティブ制作も同等だと誤認するのでもなく、実際に使用するソフトウェアと周辺機器の対応要件を個別に確認してください。
詳しくは「Mac Studio M5 Ultraはリアルタイム制作に向くか?」をご参照ください。
価格を比較するなら「GPU単体」ではなく、動く環境の総額を見る
Appleが公表しているM5 Ultra搭載Mac Studioの日本国内価格は949,800円(税込)からです。基本構成は30コアCPU/64コアGPU/96GB統合メモリ/1TB SSDとなります。上位の36コアCPU/80コアGPUや、256GB・512GB統合メモリはCTOオプションとして選択します(出典:Apple公式仕様)。
購入時の注意:
今回MacStoriesで参照された高性能実測は、80コアGPU/256GB統合メモリ構成(国内CTO価格約167万〜190万円規模、試用機カスタム2,173,800円)で行われています。最小949,800円の基本構成(64コアGPU)で同一のtok/sが得られると考えてはいけません。
RTX 5080や5090を検討する際も、GPU単体の価格だけでなく、マザーボード、大容量電源、水冷クーラー、高速SSD、PCケースを含めた完成品BTOとしての総額で比較する必要があります。RTX PROの場合はさらにECC、長期サポート、業務向け検証費用も加味されます。
また、出先へGPU環境を持ち出して制作・推論を行う必要がある読者には、24GB VRAMを備える「RTX 5090 Laptop」が有力な選択肢となります。さらに、リアルタイム制作用のRTX搭載機と、大規模LLM常時稼働用のMac Studioをネットワーク接続する「150万円予算のRTX+統合メモリ2台構成」というポートフォリオも実用的な解となります。
用途別の最終判断|MacかRTXかではなく、仕事の条件から決める
| あなたの主たる目的 | 判断の要点 | 次に読むべき判断記事 |
|---|---|---|
| 小〜中規模LLMの最高速応答を重視 | Prefill、Decode、TTFTを同一条件で比較 | MacとRTXのローカルLLM比較 → |
| VRAM不足によるオフロードを回避したい | モデル重みとKVキャッシュの所要量を見積もる | RAMとVRAMのオフロードの壁 → |
| 70B以上のモデルをローカルで動かしたい | 量子化形式、利用可能メモリ、MLX/CUDAを確認 | ユニファイドメモリPCガイド → |
| 研究・法人のAIサービング基盤を作りたい | ECC、Linux、ISV認証、保守体制まで含める | RTX PROシリーズガイド → |
| 現場・スタジオへGPU環境を持ち込みたい | RTX 5090 Laptopの24GB、電力設定、冷却を確認 | RTX 5090 DesktopとLaptop比較 → |
| 制作と大規模AIの両立を図りたい | ネットワーク接続を含む2台構成を検討 | RTX+統合メモリの2台構成 → |
まとめ:必要なのは「最速のGPU」ではなく「目的を最も早く終わらせる環境」
Mac Studio M5 Ultraは、ローカルLLMの回答生成速度においてRTX 5090に迫る優れた結果を示しました。しかし、RTX 5090が得意とする高速な入力処理やCUDAエコシステム、RTX PROが担う堅牢な業務用ワークステーション環境をすべて置き換えるものではありません。
専用VRAMに収まるモデルを最高速で処理するのか。70B級の巨大モデルを完全オンメモリで読み込むのか。長文コンテキストを安定保持するのか。複数ユーザーへAI基盤を提供するのか。あるいはTouchDesignerやUnreal Engineなどのリアルタイム制作も同じマシンで動かすのか。必要な答えは製品名ではなく、その条件の組み合わせから見つかります。
あなたの用途と予算から、最適な計算資源を絞り込む
CORE SPECのPCスペックアナライザーでは、動かしたいローカルLLMのモデル規模、コンテキスト長、リアルタイム制作ソフトの有無、予算条件から、NVIDIA RTX・Apple Silicon・Ryzen AI Maxのアーキテクチャ適合性を即座に判定できます。
よくある質問
Mac Studio M5 UltraはRTX 5080より速いですか? +
公開測定ではM5 Ultraが204.5 tok/s、RTX 5080が181.99 tok/sという7Bモデルの結果があります。ただし、別環境の測定のため直接的な勝敗は確定できません。27B級モデルではRTX 5080の16GB VRAMが制約になりやすく、オフロードが必要になる場合があります。一方、M5 Ultraは大容量ユニファイドメモリを利用できるため、モデルをメモリ内に収めやすい利点があります。具体的な速度差は同条件の実測で確認する必要があります。
RTX 5090は256KコンテキストでMacより遅くなりますか? +
今回のMacStories測定では、8-bit KVキャッシュを使用したRTX 5090が30.0 tok/s、M5 Ultraが24.3 tok/sで、RTX 5090の方が高速でした(Macが逆転したわけではありません)。ただし、別条件でCPU側システムRAMへのオフロードが発生したケースでは1.5 tok/sへと大きく低下しました。M5 Ultraの強みは、キャッシュ圧縮やオフロードを意識せずに256Kの超長文を安定した速度で処理できる堅牢性にあります。
70Bモデルを動かすならM5 Ultraの256GBが必須ですか? +
必須ではありません。モデルの量子化フォーマット、コンテキスト長、OS予約分を除いた利用可能メモリ次第で、96GB構成でも収容可能です。逆に256GB構成であっても、あらゆる巨大モデルを最高速で動かせるわけではありません。実効速度と品質は実際のモデルとワークロードで確認する必要があります。
RTX PRO 5000や5500の70B推論速度も比較できますか? +
今回参照した資料では同条件の公開実測が確認できなかったため、推定のtok/sは掲載していません。仕様と動作条件の比較にとどめています。なお、RTX PRO 5500は2026年10月11日時点でNVIDIA公式がComing Soonと記載している暫定仕様です。
RTX 5090 Laptopならデスクトップ5090と同じ速さですか? +
同じ型番名でもハードウェア仕様が根本的に異なります。Laptop版は24GB VRAM、CUDAコア数10,496基、帯域幅896 GB/s、TGP最大150Wであり、デスクトップ版(32GB、21,760基、1,792 GB/s、575W)と比較して7B実測で約1.85倍の速度差があります。電力設定・冷却・実装機種によっても実効性能が変わるため、同名を理由に同等とは判断できません。
- MacStories|M5 Ultra Mac Studio Review: The Dream Mac for Local AI Agents(Federico Viticci氏によるQwen3.8 27B実測、64K〜256K長文、並列実行測定)
- ITmedia PC USER|新型Mac mini/Mac Studioレビュー(本田雅一氏によるM5 Ultra実機でのLLaMA 7B Q4_0実測・消費電力傾向)
- ggml-org / llama.cpp Discussion #15013(コミュニティによるLlama 2 7B Q4_0公開ベンチマーク集計)
- Apple|Mac Studio技術仕様 / Apple|M5 Ultra製品発表
- NVIDIA|GeForce RTX 5080公式仕様 / NVIDIA|GeForce RTX 50 Laptop公式仕様 / NVIDIA|RTX PRO 5500公式仕様
掲載上の注記:本記事の比較には、同一タスクを異なるシステムで実施した実測、同じベンチマーク企画で別投稿者が報告した値、別媒体の参考値が含まれます。第三者の測定値を転載・再分析したものであり、CORE SPECによる実機検証ではありません。2026年10月11日時点の公開情報に基づきます。
