AIでYouTubeのナレーションを作るなら、これまでElevenLabsは有力な選択肢のひとつでした。
自然な音声生成だけでなく、Voice Clone、Voice Design、複数言語への対応など、「AIで声を作る」ための制作環境を早い段階から整えてきたサービスです。
そこへ2026年9月、Googleが新しい音声生成モデル Gemini 3.8 Flash TTS / Gemini 3.8 Flash-Lite TTS を正式提供しました。
今回のGeminiは、単に文章を読み上げるだけではありません。
声そのものを設計するVoice Design、自分の声などを再現するVoice Replication、感情や間、笑い、ため息といった演技のディレクション、長文や複数話者への対応まで踏み込んでいます。
つまり、Googleがかなり本格的にElevenLabsの領域へ入ってきたと考えられます。
では、これからAIナレーションを作るならGeminiとElevenLabsのどちらを選べばよいのでしょうか。
この記事では「どちらの音が良いか」という実測比較ではなく、2026年10月時点の公式仕様と制作フローの違いから、両者の選び方を整理します。
CORE SPECでは、YouTubeのナレーション制作に実際にElevenLabsを使用しています。一方、今回Gemini 3.8 TTSとの同一原稿・同一条件によるABテストは行っていません。
そのため、GeminiとElevenLabsについて「こちらの方が自然」「こちらの方が高音質」といった音質の優劣は判定しません。Gemini側はGoogleの公式情報、ElevenLabs側は公式情報とCORE SPECでの実利用をもとに、機能仕様・料金体系・制作フローの違いから両者の選び方を整理します。
Geminiは「Google/API環境で声を設計・生成する」、ElevenLabsは「音声専用環境で声を制作・運用する」と考えると分かりやすい
Gemini 3.8 TTSの登場によって、「AI音声ならまずElevenLabs」という状況は少し変わってきました。
Gemini 3.8 Flash TTSは、Voice DesignやVoice Replicationに対応し、自然言語で声や演技を指示できます。落ち着いたトーン、間、笑い声、ため息、話者ごとの演技といった「演出」をプロンプトから音声生成へ持ち込めます。
一方のElevenLabsも、最新のEleven v4世代で表現力、Voice Cloning、多言語対応を強化しています。両者の選び方を単純化すると、次のように整理できます。
| ユーザーのニーズ・制作スタイル | 向いている選択肢 |
|---|---|
| GeminiやGoogleの環境から音声生成まで一体化したい | Gemini 3.8 TTS |
| APIから大量の音声を低コスト・高スループットで生成したい | Gemini 3.8 Flash-Lite TTS |
| 音声専用UIで同じ声を継続管理し、YouTubeナレーションを運用したい | ElevenLabs |
| Voice Cloneや声のアセットを専用UIで一元管理したい | ElevenLabs |
| 自然言語プロンプトで細かく演技・演出をディレクションしたい | Gemini 3.8 TTS / ElevenLabs ともに候補 |
| 低レイテンシなTTSを音声エージェントへ組み込みたい | Gemini 3.8 Flash-Lite TTS / Eleven v4 Turbo が候補※音声-to-音声のリアルタイム対話ではGemini 3.8 Liveが別途用意されています。 |
| すでにElevenLabsの声や制作フローを構築済み | 無理に移行する必要はない |
重要なのは、Geminiが登場したからElevenLabsが不要になったわけではないことです。両者の機能が接近したことで、「どのサービスの音が一番きれいか」だけではなく、どの制作環境で声を管理するかが選択基準になりつつあります。
Gemini 3.8 TTSとElevenLabsの違い
機能だけを見ると、両者はかなり接近しています。まずは公式仕様をもとに主要な項目を一覧で整理します。
| 比較項目 | Gemini 3.8 TTS | ElevenLabs v4 |
|---|---|---|
| 主な位置付け | Geminiファミリーの音声生成モデル | 音声AI専用制作プラットフォーム |
| Voice Design | 対応(自然言語で声質を設計) | 対応(テキスト指示から声を作成) |
| Voice Replication / Clone | 対応(Voice Replication / 同意確認機能) | 対応(Instant / Professional Voice Cloning) |
| 演技・感情指示 | 自然言語プロンプト・style指示・音声イベント(<laugh>, <sigh>, <short pause>等) | Audio Tags・テキスト文脈・Stability / Similarity設定による発話制御 |
| 複数話者対応 | 対応(対話やナレーションの掛け合い) | 対応(ElevenCreative Studio(旧Projects)やマルチボイス生成) |
| 対応言語数 | Flash TTS: 130言語 / Flash-Lite: 101言語 | Eleven v4: 90言語以上 |
| 長文コンテンツ | 対応(長文・マルチターンの安定出力) | 対応(ElevenCreative Studio(旧Projects)等での長文制作ワークフロー) |
| リアルタイム向けモデル | Gemini 3.8 Flash-Lite TTS(高スループット・低遅延) | Eleven v4 Turbo(公称中央値レイテンシ約100ms) |
| 音声・アセット管理 | Google AI Studio / API経由 | ElevenLabs専用Webスタジオ環境 |
| 課金体系(2026年10月) | API従量課金中心(約$0.00225/10秒〜 ※2027年改定予定) | 月額プラン(Free / Starter / Creator / Proなど)+クレジット枠 |
| CORE SPEC実利用 | 未実測(公式仕様ベースで比較) | YouTube Shortsナレーションで実利用中 |
この表を見ると分かるように、「Voice CloneがあるからElevenLabs」「感情表現があるからElevenLabs」という単純な分類は難しくなっています。Geminiも、これまで音声AI専業サービスが担っていた領域へかなり踏み込んできました。
Gemini 3.8 TTSとは?
Googleは2026年9月22日、Gemini 3.8 Flash TTS と Gemini 3.8 Flash-Lite TTS を正式提供(GA)しました。
上位のGemini 3.8 Flash TTSは、Googleがクリエイティブ用途のフラッグシップTTSとして位置付けるモデルです。
- Voice Design(テキストプロンプトによる声質の新規作成)
- Voice Replication(参照音声からの話者再現と同意確認)
- 150以上のプリセット/カスタム音声を扱うExtended Voice Library
- 感情や話し方のスタイル指示
- 笑い、ため息、短い間などのインライン音声イベント
- 長文ナレーションの安定した発話
- 複数話者による対話
- 地域アクセントへの対応
- 130言語への対応
- SynthIDによる音声透かし付与
一方のGemini 3.8 Flash-Lite TTSは、品質だけを追求するのではなく、高スループット、低レイテンシ、低コストを重視したモデル(101言語対応)です。
Flash TTSは音声品質・演技表現・長文安定性を重視し、Flash-Liteは高スループット・低レイテンシ・コスト効率を重視する、と整理すると分かりやすいでしょう。
ElevenLabsとEleven v4 / v4 Turboとは?
ElevenLabsでは、最新TTSモデルのEleven v4 / Eleven v4 Turboを中心に、Voice Design、Voice Cloning、ElevenCreative Studioなどを組み合わせた音声制作環境を提供しています。
ElevenLabsのプラットフォームおよび最新モデルでは、従来から強みとしていたAI音声制作をさらに強化し、以下の機能を提供しています。
- 90以上の言語への対応
- Voice Design(テキストプロンプトによる新しい声の設計)
- Instant Voice Cloning(短時間の音声サンプルからの複製)
- Professional Voice Cloning(高品質な学習データによる高精度複製)
- 複数話者による掛け合い制作
- 豊かな感情表現と抑揚のコントロール
- 発音制御(発音辞書やスペル指定)
- ElevenCreative Studio(旧Projects)による長文コンテンツ・オーディオブック制作
Eleven v4 Turboはリアルタイム用途向けで、ElevenLabsは中央値約100msの推論レイテンシを公表しています。
ここで重要なのは、ElevenLabsが「TTSモデル単体」だけを提供しているわけではないことです。声を探す、作る、クローンする、発音を調整する、音声を生成する、といった一連の工程を、音声制作専用の環境として提供していることがElevenLabsの大きな特徴です。
違い1|「声を選ぶ」だけでなく「声そのものを設計する」
AI音声生成は長く、「用意された声から好みの声を選ぶ」という使い方が中心でした。
Gemini 3.8 TTSでは、この考え方がさらに一歩進みます。GoogleはVoice Designによって、声の特徴を自然言語から設計できる仕組みを用意しています。
つまり、
- 「30代くらいの落ち着いた声」
- 「技術解説に合う、知的だが硬すぎない声」
- 「テンポは少し速く、過度に感情的にならない」
といったように、声を探すのではなく声を設計する方向へ進んでいます。
ElevenLabsにもVoice Designがあり、同様にテキストから新しい声を作れます。ここでは、どちらか一方だけができるというより、AI音声サービス全体が「声を選ぶ」から「声を作る」段階へ移行していると捉えた方がよいでしょう。
違い2|Voice ReplicationとVoice Cloning
自分自身や許諾を得た話者の声をAI化したい場合、GeminiにもVoice Replicationが用意されました。
Geminiでは短い参照音声から話者の特徴を再現でき、Google AI Studioから録音または音声をアップロードして作成できます。またGoogleはVoice Replicationに同意確認の仕組みを導入しています。
一方ElevenLabsは、Voice Cloningを長く主要機能として提供してきました。現在は大きく、
- Instant Voice Cloning:短い音声ファイルから即座に声を生成する機能
- Professional Voice Cloning:数十分以上のクリアな学習音声から細部まで高精度に再現する機能
という選択肢があります。短い素材から素早く声を作る方法と、より高い再現性を求める方法を使い分けられるのが特徴です。
そのため、Voice Cloneという機能の有無だけなら、GeminiとElevenLabsの両方が選択肢になりました。差が出るのは、その声をどのように作り、管理し、継続的な制作へ組み込むかです。
REFERENCE GUIDE
Voice Cloneの元データとなる自分の声をきれいに録音するためのマイク選びや収録環境については、配信・録音用マイク選び方ガイド や マイクやオーディオIFを含む音声制作環境構築ガイド を参照してください。
違い3|声だけでなく「演技」を指示する
今回のGemini 3.8 TTSで特に注目したいのが、演技のディレクションです。Geminiでは、話す内容だけではなく、話し方をプロンプトで指示できます。
さらに、
<laugh>(笑い)<sigh>(ため息)<short pause>(短い間)
などのインライン音声イベントにも対応しています。これはTTSを「文章を音に変換する技術」ではなく、AIに演技をディレクションする制作工程へ変える機能です。
ElevenLabs v4も、Audio Tagsなどを使って感情や発話のニュアンスを制御できます。したがって、これからのAI音声生成では、「どの声を使うか」だけでなく、「その声にどう演技をさせるか」が重要になりそうです。
違い4|YouTube制作では「毎回同じ声を使えること」も重要
YouTubeナレーションでは、1本だけ自然な音声が作れればよいとは限りません。
チャンネルを継続して運営するなら、
- 同じ声を使い続けられる
- 発音を細かく調整できる
- 修正したい部分だけ作り直せる
- 複数の動画でトーンを揃えられる
- 制作フローへ組み込みやすい
といった運用面が重要になります。
CORE SPECのYouTube Shortsでも、現在ナレーション生成にはElevenLabsを使用しています。
CORE SPECのYouTube Shorts。ナレーション生成にはElevenLabsを使用しています。
今回Geminiとの同条件比較はしていないため、この動画を根拠に「ElevenLabsの方が優れている」とは判断しません。ただし、AI音声を一度試すのではなく、実際のコンテンツ制作工程へ組み込むという視点では、専用の音声制作環境を持つElevenLabsは現在も有力な選択肢です。
違い5|Geminiは低単価のAPI従量課金、ElevenLabsは月額プラン中心
料金体系は両サービスで大きく異なります(2026年10月5日確認情報)。
Gemini 3.8 TTSは基本的にAPI利用量を基準にした従量課金です。2026年10月時点では、Gemini 3.8 Flash TTSのStandard音声出力は、Googleの換算で約10秒あたり0.00225ドルです。Flash-Lite TTSでは約10秒あたり0.0015ドル。ただし、Googleは2027年1月1日から料金が改定されることをすでに公表しています。
| サービス・モデル | 2026年12月31日まで | 2027年1月1日以降 |
|---|---|---|
| Gemini 3.8 Flash TTS Standard | $9 / 1M audio tokens(約$0.00225 / 10秒) | $18 / 1M audio tokens(約$0.0045 / 10秒) |
| Gemini 3.8 Flash-Lite TTS Standard | $6 / 1M audio tokens(約$0.0015 / 10秒) | $12 / 1M audio tokens(約$0.003 / 10秒) |
※上記は音声出力の価格です。入力テキスト($0.50〜$1.00 / 1M text tokens)などの料金は別途発生する場合があります。
大量のナレーション生成やアプリへの組み込みを考える場合、このAPI単価はGeminiの大きな特徴になります。
一方のElevenLabsは、無料プランに加えて月額プランを中心とした料金体系です(2026年10月5日確認)。
- Free:$0
- Starter:$6 / 月
- Creator:$22 / 月
- Pro:$99 / 月
※料金・クレジット枠・キャンペーン内容は変更される可能性があります。契約時には必ず各サービスの公式ページで最新情報を確認してください。
単純なAPI単価だけを比較するとGeminiは非常に魅力的ですが、ここには注意が必要です。
YouTube制作者にとって重要なのは、「1分いくらで音声が生成できるか」だけではありません。声の管理、クローン、発音修正、再生成、制作UIなどを含め、音声制作全体にどれだけ手間がかかるかまで含めて考える必要があります。そのため、価格だけでどちらが安いとは決められません。
違い6|GeminiはGoogleのAI環境につながっている
Gemini 3.8 TTSのもう一つの特徴は、音声生成が単独サービスとして存在しているわけではないことです。
Google AI StudioやGemini APIだけでなく、GoogleはGemini Notebook、Google Vidsなどへの展開も進めています。これは今後かなり重要になる可能性があります。
- 文章を生成する
- 映像を作る
- ナレーションを作る
- 編集する
こうした工程がGoogleのAI環境の中でつながっていけば、TTS単体の性能とは別の競争力が生まれます。「音声生成サービスを選ぶ」というより、どのAI制作環境を使うかという選択になる可能性があります。
違い7|ElevenLabsは「音声を中心に制作する」ための専用環境
対するElevenLabsの強みは、音声がサービスの中心にあることです。Text to Speechだけでなく、
- Voice Design
- Voice Cloning
- Voice Library
- Dubbing
- Speech to Text
- Voice Changer
- Voice Agents
など、音声を中心とした機能が一つのサービスへ集約されています。
YouTubeナレーションを作るだけなら、ここまで多くの機能を使わない場合もあります。しかし、
- 「このチャンネルではこの声を使う」
- 「別のシリーズでは別の声を使う」
- 「将来は海外向けに吹き替える」
というように、声をコンテンツ資産として扱うなら、この専用性には意味があります。
CORE SPECが現在ElevenLabsを使っているのも、あくまで現在の制作フロー上でElevenLabsを採用しているという意味です。今回GeminiとのABテストを行った結果、ElevenLabsを選んだわけではありません。ここは明確に分けて考える必要があります。
結局、GeminiとElevenLabsはどちらを選べばよい?
現時点では、用途から判断するのが最も分かりやすいでしょう。
Gemini 3.8 TTSが向いている人
- Gemini APIをすでに利用している
- Google AI Studioを中心に制作している
- 大量の音声をAPIから低コストで生成したい
- 自然言語で細かく演技を指示したい
- 音声をアプリやAIエージェントへ組み込みたい
- GoogleのAI制作環境へ統合したい
ElevenLabsが向いている人
- YouTubeなどでAIナレーションを継続的に作りたい
- 音声専用UIで同じ声を複数コンテンツにわたって管理・運用したい
- Voice Cloneを積極的に使いたい
- 音声制作専用の洗練されたUIを使いたい
- ナレーションだけでなく吹き替え(Dubbing)などへ広げたい
- すでにElevenLabsで制作フローを構築している
そして、すでにElevenLabsで安定した制作フローができているなら、Geminiが登場したからといって、すぐに移行する必要はありません。
逆に、これから大量の音声生成を始める人や、Gemini APIを中心にAIサービスを構築する人にとっては、Gemini 3.8 TTSは無視できない存在です。
CORE SPECでは現在ElevenLabsを使用しています
CORE SPECのYouTube Shortsでは、現在ナレーション生成にElevenLabsを使用しています。
AI音声は「一番自然なサービス」を一度選べば終わり、ではありません。実際の制作では、
- 原稿を書く
- 音声を生成する
- 確認する
- 必要なら発音や間を修正する
- 動画編集ソフトへ渡す
- 次の動画でも同じ声を使う
という継続的な工程になります。その意味で、AI音声を選ぶときは「1回生成した声の品質」だけでなく、何本も作り続けられる制作環境かを見ることが重要です。
なお、生成した音声を動画編集ソフト(Premiere ProやDaVinci Resolve等)で快適に組み上げるハードウェア環境については、動画編集・映像制作向けPCの選び方 も合わせて参考にしてください。
ElevenLabsで声の制作・運用を始める
AIナレーション、Voice Design、Voice Cloningなどを利用できます。
まとめ|AI音声は「読み上げ」から「演出と運用」の時代へ
Gemini 3.8 TTSの登場は、AI音声生成における選択肢をかなり広げました。
- Voice Design
- Voice Replication
- 演技のディレクション
- 長文対応
- 複数話者対応
- 低コストなAPI
これまで音声AI専業サービスが先行してきた領域へ、Googleが本格的に入ってきています。
だからといって、ElevenLabsの意味がなくなったわけではありません。GeminiはGoogle/API環境で声を設計・生成し、ElevenLabsは音声制作専用環境で声を制作・運用します。
重要なのは、GeminiとElevenLabsのどちらの音が一番良いかだけではなく、Google/API環境で設計・生成するのか、音声専用環境で制作・運用するのかから選ぶことです。
AI音声は、「文章を読み上げてもらうツール」から、「声を設計・指示し、コンテンツとして運用する制作環境」へ変わり始めています。Gemini 3.8 TTSとElevenLabsの競争は、その変化を象徴しているのかもしれません。
ElevenLabsで声の制作・運用を始める
AIナレーション、Voice Design、Voice Cloningなどを利用できます。
よくある質問
Gemini 3.8 TTSとElevenLabsはどちらの音質が良い? +
この記事では同じ原稿・同じ条件による実測比較を行っていないため、音質の優劣は判断していません。両者とも表現力やVoice Design、Voice Clone系の機能を強化しており、用途や制作フローを含めて選ぶ必要があります。
Geminiでも自分の声を再現できる? +
Gemini 3.8 Flash TTSとFlash-Lite TTSはVoice Replicationに対応しています。Googleでは参照音声に加え、声の所有者による同意確認の仕組みも用意されています。
ElevenLabsはYouTubeのナレーションに使える? +
Starter以上の有料プランでは商用利用に対応しています。CORE SPECでもYouTube Shortsのナレーション生成にElevenLabsを使用しています。実際に利用する際は、契約プランと最新の利用規約を確認してください。
Geminiが出たならElevenLabsから乗り換えるべき? +
必ずしも乗り換える必要はありません。すでに声や制作フローをElevenLabsで構築している場合は、その運用資産も判断材料です。一方、Gemini APIとの統合、大量生成、GoogleのAI環境との連携を重視する場合はGemini 3.8 TTSを検討する価値があります。