Gemini 3.8 Flash TTSがすごい!Opus 5.5でナレーション動画を制作【実例・再現プロンプト付き】
このナレーション、人は録音していません。
落ち着いた解説、明るい電話応対、申し訳なさが伝わるお詫び、登場人物どうしの掛け合い。この記事で紹介する解説動画の声は、Gemini 3.8 Flash TTSで生成しました。さらに、Opus 5.5を使うClaude Codeに台本や映像、字幕を組み立ててもらい、約3分のナレーション付き動画に仕上げています。
注目したいのは、文章を読む声を、「選ぶ」「演出する」「文章から新しく作る」という3つの方法で調整できることです。商品の説明には信頼感のある声、研修には親しみやすい声、物語には役柄に合った声。伝えたい内容に合わせて、音声の表現を考えられます。
まずは実際の動画をご覧ください。後半では、Claude Codeで制作した「桃太郎」の動画と、解説動画の制作手順を1回の指示にまとめた再現用プロンプトも紹介します。
情報確認日:2026年9月26日。公式仕様と当社の制作記録に基づいています。提供状況・料金は変更される場合があります。
まず実例を見てください。Gemini 3.8 Flash TTSで声を付けた解説動画
この動画では、Gemini 3.8 Flash TTSの特徴を、実際に生成した声を聞きながら確かめられます。
「Gemini3.8FlashTTS解説_あなたのAI顧問版.mp4」/約2分58秒。制作:あなたのAI顧問株式会社。ナレーション・台詞の音声生成にGemini 3.8 Flash TTSを使用し、Claude Code/Opus 5.5を使って台本・映像・書き出しを制作した事例です。
聞き比べるなら、次の3か所に注目してください。
| 動画の位置 | 確かめられること | 注目してほしい点 |
|---|---|---|
| 00:23ごろ | 声を選べる | 解説や電話応対など、用途に合わせた声の使い分け |
| 00:46ごろ | 声を演出できる | 明るい応対、落ち着いた説明、お詫びの話し方の違い |
| 01:33ごろ | 声を作れる | 文章で設計した、研修講師風の声 |
制作では、ナレーター、電話応対、社長役、担当者役、研修講師風の声という5種類の声を使いました。このうち4種類は用意された声から選び、研修講師風の1種類は文章から新しく設計しています。人間が録音した声を複製する機能は、この解説動画では使っていません。
Gemini 3.8 Flash TTSとは?台本に声と演技を与えるAI
Gemini 3.8 Flash TTSは、文章から音声を生成するGoogleのモデルです。
TTSは「Text-to-Speech」の略で、日本語では音声合成、文章の読み上げなどと呼ばれます。Googleは2026年9月23日付の公式ブログで、Gemini 3.8 Flash TTSとGemini 3.8 Flash-Lite TTSを紹介しました。Flash TTSについては、次のように説明しています。
Built for deep creative direction and character design.
細かな演出指示やキャラクターの声づくりを重視したモデル、という意味です。声の高さや雰囲気だけでなく、せりふの感情、テンポ、間の取り方まで扱う方向へ進んでいます。Google公式発表
GoogleのGemini 3.8 TTS公式発表ページ。出典:Google公式ブログ。
ここで、今回の動画制作に登場する3つの役割を整理しておきましょう。
| 名前 | 今回担当したこと |
|---|---|
| Gemini 3.8 Flash TTS | 台本からナレーションや台詞の音声を生成する |
| Claude Opus 5.5 | Claude Codeで、構成・台本・実装の判断を進めるAIモデル |
| Claude Code | ファイルを作り、音声生成APIや描画・編集の処理を動かして、動画を完成させる作業環境 |
Gemini 3.8 Flash TTSが出力するのは音声です。今回の映像・字幕・BGMとの合成には、Claude Codeが作成・実行したコードを使っています。この組み合わせは当社の制作方法であり、「GeminiとOpusをつなぐ公式の動画制作サービス」が発表されたという話ではありません。Geminiのモデル仕様、Claude Code公式概要
すごいポイント1:目的に合う声を選べる。日本語の使い分けもできる
最初に試したいのは、同じ台本を複数の声で読み、用途に合う声を選ぶことです。
Googleの発表では、声のライブラリを従来の30種類から2,000種類以上へ広げたと紹介しています。一方、実際にAPIから取得できる一覧は、言語や取得条件によって確認する必要があります。Google公式発表
今回、当社が2026年9月26日にAPIで日本語の既成音声一覧を取得したところ、115種類を確認できました。これはその時点の当社による確認値です。「2,000種類すべてが日本語専用の声」という意味ではなく、公式発表のライブラリ全体の説明と、日本語で取得した一覧を分けて捉えると分かりやすくなります。
たくさんある声を片端から聞くより、まず「誰に、どんな印象で伝えたいか」を決めると選びやすくなります。例えば、次のような基準です。
- 操作説明なら、ゆっくり聞いても間延びせず、用語が聞き取りやすい声。
- 新入社員向け研修なら、質問しやすそうな親しみと、説明への信頼感がある声。
- 接客の教材なら、明るい案内と落ち着いたお詫びを、どちらも表現しやすい声。
これらは当社が提案する選び方です。最初の試聴では、挨拶だけでなく、実際に使う商品名・社名・数字を含む短い台本を読ませると、仕事で使うときの相性を判断できます。
なお、公式モデル一覧ではFlash TTSの対応言語を130言語、Flash-Lite TTSを101言語と整理しており、日本語も含まれます。対応言語数と声の種類数は別の指標です。外国語版の説明を作る場合も、翻訳の正確さと読み上げの自然さはそれぞれ確認しましょう。公式モデル一覧、音声の選択肢
すごいポイント2:同じ声でも、場面に合わせて演技を変えられる
声を選んだ後は、話し方の指示で、伝わる印象を調整できます。
解説動画の電話応対デモでは、同じ声に対して「明るく・はきはき」「落ち着いて・ていねい」「深くお詫び」と指示を変えています。同じ声の設定で、場面に合った演技を付ける制作例です。音量を上げ下げするだけでは表せない違いを、動画の00:46ごろから確かめてみてください。
読ませる文章と、話し方の指示を分ける
APIで使う場合は、読み上げる台本と演出指示を別の項目に入れます。
例えば、読み上げる文章を「お問い合わせありがとうございます。担当者におつなぎします」、演出を「明るく、はきはきと。相手を急かさない速さで」と分けるイメージです。3.8のTTSは指定された台本文を読む設計なので、本文に「明るく読んでください」と書き込むと、その指示自体が読み上げ対象になり得ます。公式の音声生成ガイド
今回の再現用プロンプトでは、Claude Codeにこの区別も実装してもらいます。利用者は「ここは安心してもらう説明」「ここは少し勢いを付ける」と場面の意図を伝え、コード側で適切な項目へ渡す形です。
笑い声や、短い間も台本に組み込める
公式ガイドには、笑い、ため息、息継ぎ、短い間などを指定するタグも用意されています。
例えば、短い間を置くタグは <short pause>、笑いを示すタグは <laugh> です。重要な説明の前で少し間を取ったり、物語の台詞に小さな笑いを添えたりする使い方が考えられます。日本語の台本でも、こうしたタグは英語で記述することが推奨されています。公式プロンプティングガイド
商品説明なら要点を聞き取りやすく、研修なら考える時間を取れるように、必要な箇所へ絞って演出を加えてみてください。
2人の掛け合いを、一つの音声として作れる
用意された声を使う場合は、1回のリクエストで最大2話者の会話を生成できます。
今回の解説動画でも、社長役と担当者役の2ターンの掛け合いを、1回のリクエストで生成しました。「疑問を持つ人」と「答える人」を分けると、説明動画に問いかけのリズムを作れます。
この最大2話者という条件は、既成音声を使う会話生成の仕様です。文章から作った声や複製した声を使う場合は、話者ごとに音声を生成して結合する必要があります。後ほど紹介する桃太郎も、複数の役の台詞を分けて作り、動画として組み立てています。音声生成の制約
すごいポイント3:文章から、用途に合った新しい声を作れる
既成の声でイメージが合わない場合は、Voice Designで声そのものを設計できます。
Voice Designは、「どんな人物らしい声か」を文章で指定し、新しい声を作る機能です。元になる人間の録音は必要ありません。公式資料では、年齢感、声質、アクセント、基本の話し方などを、明確な1〜2文で説明する方法が案内されています。Voice Design公式ガイド
今回の研修講師風の声は、次の内容で設計しました。
20代後半の女性の研修講師。明るく、はきはきとした声で、要点を分かりやすく、親しみやすく話す。標準的な東京の日本語。
当社の制作で使用した声の設計文です。実在する人物を指定したものではありません。
ここでは「女性の声」だけで終わらず、研修講師という役割、聞き取りやすさ、親しみやすさまで伝えています。欲しい声をうまく言語化するほど、生成後に「この用途に合うか」を判断しやすくなります。
作った声を、次の動画でも使える
設計した声は、識別用のvoice IDを保存して、後の音声生成で再利用できます。
例えば、毎月の社内研修で同じ講師風の声を使い、商品紹介では別のナレーターを使う、といった運用が考えられます。毎回の声質は同じIDで指定し、その回の落ち着きや明るさは演出指示で調整すると、役割を分けやすくなります。
保存できる声には、デザインした声と複製した声を合わせてプロジェクト当たり200声、保存期間1年という条件があります。シリーズ制作では、声の設定文と採用したID、確認日を制作記録として残すと、更新時にも対応しやすくなります。声の保存と再利用
Voice Designと、本人の声を複製する機能は別
文章から声を作るVoice Designに対し、Voice Replicationは録音を使って実在する話者の声を複製する機能です。
Voice Replicationには、同じ成人話者の10〜30秒の参照音声と、その本人が所定の文を読んだ同意音声が必要です。誰かの動画から声を抜き出して、自由に本人のように話させる使い方を前提にはできません。Voice Replicationの音声・同意要件
今回の解説動画のように、用途に合った架空の講師・ナレーターを作りたいなら、まずVoice Designから検討できます。本人の声を残したい目的がある場合に、複製の利用条件と同意の取得方法を確認する、という順序が分かりやすいでしょう。
FlashとFlash-Liteはどう違う?料金はどのくらい?
モデル選びは、求める表現と、生成する量から考えると整理できます。
| 比較する点 | Gemini 3.8 Flash TTS | Gemini 3.8 Flash-Lite TTS |
|---|---|---|
| 公式が重視する方向 | 音声の質、細かな演技、表現性 | 大量処理、低遅延、コスト効率 |
| 試す用途の例 | 解説動画、物語、感情のある台詞 | 定型案内、大量の読み上げ |
| Voice Design・声の複製 | 対応 | 対応 |
位置付けの出典:Flash TTS仕様、Flash-Lite TTS仕様。用途の例は、その位置付けに基づく当社の提案です。
今回のように、声の違いや演技自体を見せたい動画では、Flash TTSを試す理由があります。一方、同じ形式の案内を大量に作るなら、Flash-Liteでも必要な品質になるかを比べるとよいでしょう。どちらも、実際の台本で聞き比べることが大切です。
2026年末までは期間限定のAPI料金
以下は、通常のAPI利用に当たるStandard区分の、100万トークン当たりの米ドル単価です。トークンはAIが文章や音声を処理する単位で、日本語の1文字と同じではありません。
| モデル | 2026年12月31日まで:入力テキスト/出力音声 | 2027年1月1日以降:入力テキスト/出力音声 |
|---|---|---|
| Flash TTS | $0.50 / $9.00 | $1.00 / $18.00 |
| Flash-Lite TTS | $0.50 / $6.00 | $1.00 / $12.00 |
2026年9月26日に確認したGoogle公式料金表に基づきます。別の処理モードや関連機能の費用は含めていません。
料金の感覚をつかむため、Flash TTSで5分の音声を1回生成する場合を計算します。公式の換算は音声1秒当たり25トークンなので、音声出力分は次の計算です。
300秒 × 25トークン ÷ 100万 × $9 = $0.0675
これは、2026年末までのStandard料金で、生成し直しがない場合の音声出力分だけの目安です。入力テキスト、声の作成などの関連利用、Claude Codeの利用、画像制作、動画の書き出し・配信にかかる費用は別です。今回の2本の実際の請求額を示した数字ではありません。
無料枠も案内されていますが、利用量やリクエスト数の制限があります。試作は小さな台本から始め、量産前に利用するプロジェクトの上限と課金状況を確認してください。料金表、レート制限
Opus 5.5と組み合わせると、音声を「完成した動画」にできる
Claude Codeとの組み合わせでは、生成した音声を使って動画を仕上げる工程まで、まとめて進められます。
今回の解説動画は、この順番で制作した
制作の流れを分解すると、声と映像がどのようにつながるかが見えてきます。
- 公式情報から構成と台本を作る。 話す内容、画面に見せる文字、使う声を決めます。
- Gemini 3.8 Flash TTSで声を生成する。 セリフごとに声と演出を指定します。
- 生成された音声の長さを測る。 前後の無音を整え、字幕や場面の開始時刻を決めます。
- 画面と動きをコードで描く。 ロゴ、見出し、図形、字幕などをHTMLとCSSで配置します。
- 画面を撮影し、音声と合成する。 Playwrightで各時刻の画面を画像にし、FFmpegでMP4へ書き出します。
- 読み上げや表示を確認し、必要な部分を修正する。 修正した音声の長さにも、映像側を合わせます。
HTMLとCSSはWebページの見た目を作る技術、Playwrightはブラウザーを操作する道具、FFmpegは映像や音声を処理する道具です。これらの操作をClaude Codeに実装してもらい、録画済みの映像素材がなくても、文字や図形が動く説明動画を作っています。
今回の解説動画は8つのシーンで構成し、音声は40セグメントに分けました。うち1つは、2人の掛け合いをまとめた音声です。映像を先に固定するのではなく、できあがった声の実際の長さに、字幕と場面切替を合わせる設計にしています。
例えば、説明を少し丁寧な言い回しへ変えて音声が長くなった場合も、その長さを測り直して後続の映像へ反映できます。音声生成と動画制作をつなぐときには、こうした調整の仕組みが役立ちます。
読み間違いも、制作工程の中で確認する
固有名詞や英数字は、字幕用の表記と読み上げ用の表記を分けておくと扱いやすくなります。
今回も、画面には「Claude Opus 5.5」と表示しながら、読み上げ側にはカタカナ表記を渡すなどの工夫をしています。さらに、生成した音声を書き起こして台本と照合する検査を組み込み、保存された解説動画の検査レポートでは40件すべてに問題なしという判定が出ています。
これは別のAIによる照合結果です。公開する際は、人が商品名・数字・重要な説明を聞き、意図どおりに伝わるかも確かめましょう。音声が滑らかでも、社名の読み方や一つの数字が違えば、そのまま業務で使いにくくなるためです。
解説動画の制作をまとめて依頼する「1発再現プロンプト」
ここでは、今回の制作で得た手順や確認項目を、Claude Codeへの一度の指示にまとめたプロンプトを紹介します。
この「1発」は、一度の依頼で、調査・生成・検証・修正まで進めてもらうという意味です。元の動画が初回から無修正で完成したという意味でも、どの環境でも同じ音声・映像が出る保証でもありません。初回制作で分かった注意点を織り込んで、次の制作へ使える形にしたものです。
コピーする前に、自分の環境に合わせる
このプロンプトは、動画を書き出せる環境で動くClaude Code向けです。通常のチャット欄へ貼るだけで、手元のMP4が完成するものではありません。
| 必要なもの | 確認・変更する内容 |
|---|---|
| Claude CodeとOpus 5.5の利用環境 | 実際に使用するモデルと、ファイル・コマンドを扱える環境 |
| Gemini APIキー | 対象モデルの利用権限、必要な課金設定、利用上限 |
| Node.js 20.6以上、FFmpeg、Playwright | コードの実行、画面撮影、動画の書き出しに使用 |
| ブランド素材 | 自社名、サービス説明、ロゴ、画像、色、フォント、WebサイトURL |
| 入出力の保存先 | 原文にある当社のフォルダ構成を、自分の環境のパスへ変更 |
| BGM | 使用できる音源を指定。音源がない場合はBGMなしの条件で進める |
APIキーの値は記事や共有プロンプトへ書かず、自分の環境で安全に参照させます。原文には当社の資料・画像の場所が含まれているため、ファイルを持っていない箇所は、自社の情報や利用できる素材に置き換えてください。Gemini APIとClaude Codeなどの利用料金は、それぞれの契約・利用量に応じてかかります。
プロンプトは約1.5万字あります。声の選び方、音声と字幕の合わせ方、再試行の条件、書き出し後の確認まで含めているためです。本文は折り畳んでいます。「プロンプト全文を開く・閉じる」で内容を確認でき、閉じたままでも「全文をコピー」ボタンで原文をすべてコピーできます。貼り付けた後に、必要な前提を差し替えて使ってください。
14,846文字の原文を、そのまま掲載しています。
プロンプト全文を開く・閉じる(14,846文字)
「全文をコピー」で、枠内の原文をすべてコピーできます。枠内を選択してコピーすることもできます。貼り付けた後に、会社名・素材・保存先をご自身の環境に合わせて変更してください。
こんなこともできる。8役の声で作った「桃太郎」
同じ音声生成を物語へ応用すると、登場人物の声が入った絵本風アニメーションも作れます。
Claude Codeで制作した「桃太郎」/約3分31秒。語り・台詞を場面ごとに生成し、絵本風の映像、BGM、効果音と組み合わせた当社の制作例です。
登場する声は、語り手、おじいさん、おばあさん、桃太郎、犬、猿、雉、鬼の8役です。46行の語りと台詞を、12の場面に配置しています。聞く人が「今は誰が話しているか」を追えるよう、役ごとに声を分けています。
ここでは、8役を一度のAPI呼び出しで同時に生成しているわけではありません。1行ずつ、その役の声で生成した音声を、物語の順番に並べる方法です。TTSの1回の会話生成が最大2話者でも、制作側で音声を組み合わせると、登場人物の多い物語を作れます。
声に合わせて、映像やBGMも動かす
桃太郎の画面は、拡大しても形が崩れにくいSVGという図形表現などを使い、コードで描いています。
台詞が流れるときには音声の大きさに応じて口を動かし、BGMの音量を下げて声を聞き取りやすくする処理も入れています。口の動きは音量に合わせた表現で、発音一つひとつの口形を精密に再現したものではありません。
この動画の和楽器風BGMと効果音は、TTSとは別のコードで合成し、場面に合わせて配置しました。Gemini TTSが担う語り・台詞に、映像や音の演出を足して、物語として仕上げた例です。
この仕組みは、制作担当者が作る子ども向けの読み聞かせ教材や、キャラクターが案内する説明動画にも応用が考えられます。声の違いと台詞のタイミングに注目して、物語を楽しんでみてください。
まず使ってみるなら、短い音声から始めよう
自分で試す場合は、声だけを確認してから動画制作へ進むと、調整する対象を絞れます。
音声だけ試す入口はGoogle AI Studio
ブラウザーで音声を確認したい方は、Google AI Studioの音声生成画面が入口になります。
- 音声生成画面を開き、利用できるGemini 3.8 TTSモデルと声を確認します。
- 自分が内容を確かめられる短い台本を用意します。
- まず声を選んで聞き、次に話す速さや感情を調整します。
- 合う声がなければ、Voice Designで声の特徴を文章にします。
- 声と話し方が決まったら、動画や業務の制作工程につなぎます。
最初の台本には、日頃よく説明する内容を使うと判断しやすくなります。「この声ならお客様に案内しやすい」「この速さなら研修で聞き取れる」といった基準を持って試してみてください。機密情報や顧客情報を使う前には、利用するサービスのデータ条件を確認し、まず公開してよい内容で試します。Gemini APIの利用条件
長い台本は、場面に分けて扱う
長い動画を作るときは、音声を場面や段落ごとに分割すると、修正や確認を行いやすくなります。
Gemini APIのFlash TTSには、入力8,192トークン、音声出力16,384トークンという上限があります。Googleは長い音声での声の安定性を訴求していますが、「1回のAPI要求で何時間でも出せる」という仕様ではありません。Flash TTSのAPI上限
今回の解説動画も音声を分けて作り、同じナレーターの声を再利用しています。直したい一文だけ生成し直し、その後の字幕や場面を実尺へ合わせる方法なら、動画全体の作り直しを減らす設計にできます。
まとめ:まずは、いつも説明している内容に声を付けてみよう
Gemini 3.8 Flash TTSの魅力は、台本に合った声を選び、場面ごとの演技を付け、必要なら声そのものを文章から作れることです。
そこにOpus 5.5を使うClaude Codeを組み合わせると、声を生成する処理と、字幕・画面・書き出しをつなげられます。今回の解説動画と桃太郎は、その組み合わせを実際の成果物にした例です。まずは声を聞いて、自分の説明や教材に合うかを確かめてみてください。
仕事で試すなら、新入社員が繰り返し確認する手順、営業で何度も説明するサービス、接客で練習したい応対などが候補になります。短い動画を1本作り、聞き取りやすいか、理解に役立つか、内容を更新しやすいかを確認すると、継続して使う判断につながります。
あなたのAI顧問株式会社の「あなたのAI顧問」は、AI・DX領域のBPO × AI教育を組み合わせ、業務改善の実装と現場の自走を同時に支援する伴走型サービスです。業務の棚卸しと優先順位付けから、契約範囲内での実装、現場への教育・移管までをつなげ、社員が自ら改善を続けられる状態を目指します。
自社のどの説明・教育業務から始めるかを整理したい方は、AI化の優先順位について相談するからご相談ください。
WRITERライター紹介
黒山結音
あなたのAI顧問株式会社 代表取締役
「AIは現場で使えなきゃ意味がない」を掲げ、30社以上にAI顧問として導入から定着までサポート。OpenClaw・Claude・ChatGPTなどAIツールを実務でフル活用し、AI駆動経営を実践。本メディアでは、実際の現場で効果が出た事例や、AI初心者がつまずく「最初の一歩」を、専門用語を極力使わずに解説します。
OpenClaw / Claude Code / Codex / Cursor / Manus
