公開日: 最終更新:
公式ドキュメント・公式発表などの一次情報を確認したうえで、株式会社Nexaが執筆・更新しています。AIツールの仕様や料金は変わることがあるため、導入判断の前に各公式サイトの最新情報もご確認ください。運営会社について
Gemini 3.5 Transcribeは、85以上の言語に対応する業務向け音声文字起こしモデルです。
- 要点1: Live版と録音音声版をGemini APIでPublic Previewとして提供
- 要点2: 日本語に対応。カスタム語彙と話者分離は同時に指定できない
- 要点3: 公式料金の概算は録音音声で約0.005ドル/分
対象読者:会議、通話、現場報告の文字起こしを効率化したい企業担当者、Gemini APIを実装する開発者
今日やること:通常版とLive版の違い・料金・制限を確認し、Pythonの最小サンプルで音声1本を文字起こしする
Gemini 3.5 Transcribeは、Googleが2026年8月26日に発表した音声文字起こし専用モデルです。リアルタイム音声と録音済み音声の両方に対応し、Gemini APIなどでPublic Previewとして提供されています。
企業にとっての注目点は、音声を文字へ変換するだけではありません。「あー」「えー」といったフィラーや言い直しを整理し、数字や段落まで読みやすく整形できます。ただし、監査用の逐語録と閲覧用の議事録では必要な記録が異なるため、用途に合わせたモード選択が欠かせません。
本記事のコード・料金・機能の組み合わせ・時間上限は、Gemini Developer APIを対象にしています。Gemini Enterprise Agent Platformでは仕様が異なります。法人基盤の公式資料は録音音声の上限を15分とし、話者分離とカスタム語彙の併用例も掲載しています。以下の「併用不可」「最大1時間/30分」を法人基盤へそのまま適用せず、利用する基盤の資料を確認してください。
Gemini 3.5 Transcribeの発表内容
Gemini 3.5 Transcribeには、リアルタイム版と録音音声版があります。前者は会話中の字幕やオペレーター支援、後者は会議後の議事録や通話記録に向いています。
| 用途 | モデル | 主なAPI | 適する業務 |
|---|---|---|---|
| リアルタイム音声 | gemini-3.5-transcribe-live |
Live API | 即時字幕、電話応対支援 |
| 録音済み音声 | gemini-3.5-transcribe |
Interactions API | 会議、商談、インタビュー |
開発者はGoogle AI StudioのGemini APIから利用できます。法人向けにはGemini Enterprise Agent PlatformでもPublic Previewとして提供されています。正式提供ではないため、本番利用では仕様変更、サポート、SLAの条件を確認する必要があります。
Googleの2026年8月26日付公式発表は、外部評価サービスArtificial Analysisによる平均WER(単語誤り率)を紹介しています。測定値はストリーミングで4.0%、非ストリーミングで2.6%です。日本語だけを対象にした評価値ではありません。WERは低いほど誤りが少ない指標ですが、音質、言語、専門用語、話者数によって結果は変わります。自社音声での評価を省略できる数字ではありません。
図1: 録音版は記録用、Live版は即時字幕向けです。
Geminiアプリの文字起こしと何が違うのか
Gemini 3.5 Transcribeは、文字起こし専用のAPIモデルです。Geminiアプリで音声ファイルを添付して質問する操作と、同じ画面や契約で使うサービスとは限りません。APIでは開発者が音声の送信、出力保存、画面表示を組み立てます。
Googleは音声理解の公式ガイドで、要約や音声内容への質問を扱っています。一方、Transcribeは発話をテキストへ変換する用途が中心です。「議事録を作る」場合も、まず文字起こしを取得し、その後に決定事項や担当者を整理する工程を分けてください。
Gemini Developer APIとGemini Enterprise Agent Platformでも、モデルIDや呼び出し方法は異なります。本記事のコードはGemini Developer API向けです。法人基盤側の公式モデル資料を使う場合は、そのサンプルへ合わせます。APIのコードを基盤間でそのまま流用しないことが、接続時の混乱を防ぎます。
SMARTとVERBATIMは何が違うのか
新モデルは、用途の異なる2つの文字起こしモードを備えています。読みやすさを優先するか、発話の忠実な保存を優先するかで選びます。
SMARTは共有しやすい記録を作る
SMARTモードは、フィラー、どもり、自己訂正を整理します。句読点、大文字と小文字、段落、箇条書き、日付、通貨、数字も自動で整形します。
たとえば会議後に参加者へ共有する議事録では、読み返す必要のない言いよどみを除けます。一方、整形によって原音との差が生じるため、監査や厳密な発言確認の原本としては扱いに注意が必要です。
VERBATIMは発話を忠実に残す
VERBATIMモードは、フィラー、繰り返し、言い直しを含めて記録します。コンプライアンス確認、ユーザー調査、会話分析など、発話の過程自体が意味を持つ業務に適しています。
運用では、録音音声を原本として保持し、VERBATIMの出力を発話ベースの自動文字起こし、SMARTの出力を検索や共有に使う方法が考えられます。VERBATIMにも音声認識誤りはあり得るため、監査、契約、金額、固有名詞は原音と照合し、人が承認してください。両者を同じ「議事録」として上書きしない設計が必要です。
対応範囲は85以上の言語とロケールで、日本語ja-JPも含まれます。固有名詞や製品名はカスタム語彙へ最大1,000語登録できますが、Googleは通常100語以内で最良の結果になりやすいと案内しています。
Gemini 3.5 TranscribeをPythonで使う手順
ここでは、事前録音したMP3ファイルを通常版で文字起こしする最小構成を紹介します。Google公式ドキュメントでは、Python SDKとInteractions APIを使う方法が案内されています。Interactions APIは、音声入力と文字起こし設定をまとめてモデルへ送るAPIです。
手順1:Gemini APIキーを取得する
Google AI StudioでGemini APIキーを発行し、環境変数へ設定します。APIキーをソースコードへ直接書かず、環境変数やシークレット管理サービスで扱ってください。
export GEMINI_API_KEY="YOUR_API_KEY"
手順2:Python SDKをインストールする
Google公式のPython SDKであるgoogle-genaiをインストールします。
pip install -U google-genai
手順3:音声をアップロードして文字起こしする
次のコードでは、Files APIへ音声をアップロードし、返されたURIをgemini-3.5-transcribeへ渡します。genai.Client()は環境変数GEMINI_API_KEYを自動的に参照します。
from google import genaiclient = genai.Client()audio_file = client.files.upload(file="path/to/sample.mp3")interaction = client.interactions.create( model="gemini-3.5-transcribe", input=[ { "type": "audio", "uri": audio_file.uri, "mime_type": audio_file.mime_type, } ],)print(interaction.output_text)
数秒を超える音声は、Google公式ガイドに従い、Files APIへアップロードして返されたファイルURIをモデルへ渡します。Files APIは、音声などのメディアファイルを先に保管し、モデルから参照できるURIを発行する仕組みです。出力を保存する場合は、interaction.output_textをファイルやデータベースへ書き込みます。
日本語の文字起こし精度を上げる設定
デフォルトでは言語を自動検出しますが、音声が日本語だと分かっている場合はlanguage_codesにja-JPを指定します。社名、製品名、略語などにはcustom_vocabularyを指定できます。ただし話者分離や単語タイムスタンプとは併用できません。以下は語彙登録を使わず、日本語の話者分離を行う例です。
interaction = client.interactions.create( model="gemini-3.5-transcribe", input=[ { "type": "audio", "uri": audio_file.uri, "mime_type": audio_file.mime_type, } ], generation_config={ "transcription_config": { "language_codes": ["ja-JP"], "mode": { "type": "verbatim", "diarization_mode": "speaker", }, } },)print(interaction.output_text)
カスタム語彙は最大1,000語を指定できますが、Googleは通常100語までで最適な結果が得られると案内しています。日常語を大量に入れるのではなく、固有名詞や専門用語へ絞るのがポイントです。読みやすさを優先する場合はmodeを"smart"へ変更します。ただしSMARTモードは話者分離や単語単位タイムスタンプと併用できません。上の例は発話を保持し、話者を分けるVERBATIM設定です。掲載コードは公式サンプルに基づく設定例です。本記事で実音声を使ったAPI実行・精度測定は行っていません。
音割れや話者の声が重なる録音も精度低下の原因になります。マイクを話者に近づけ、過度なクリッピングを避け、可能なら会議ツール側で参加者の音声を明瞭に収録してください。
カスタム語彙・話者分離・タイムスタンプの選び方
最初に、専門語の認識を優先するか、誰がいつ話したかを優先するかを決めます。公式の機能制限表では、カスタム語彙と話者分離・単語タイムスタンプの併用を認めていません。全部を有効にする設定は、精度向上ではなくリクエストエラーにつながります。
| 必要な出力 | モード | カスタム語彙 | 話者分離・単語時刻 |
|---|---|---|---|
| 専門語を含む読みやすい報告 | SMART | 利用可 | 併用不可 |
| 専門語を含む発話ベースの記録 | VERBATIM | 利用可 | 語彙と併用不可 |
| 誰が話したかを確認する記録 | VERBATIM | 併用不可 | 話者分離を指定 |
| 原音の位置へ戻るための記録 | VERBATIM | 併用不可 | 単語時刻を指定 |
話者分離は声の違いをspk_1などの識別子へ割り当てる機能です。その識別子が実名を保証するわけではありません。出席者一覧との対応は人が確認します。タイムスタンプは音声内の位置を示しますが、有効化すると文字起こし精度が下がる場合もあります。まず必要な機能だけを選び、同じ音声で設定ごとの誤認識を比較してください。
図2: Developer APIではカスタム語彙と話者分離・単語時刻を併用できません。
話者ラベルと単語の時刻を取得するには
interaction.output_textは全文を取得するためのプロパティです。話者ラベルや単語の時刻も必要なら、公式の出力解析例に従い、steps配下のcontent.annotationsを確認します。種類がword_infoの注釈から、単語テキストと必要な情報を取り出します。
以下は、前節で取得したinteractionを解析する例です。単語時刻が必要なら、VERBATIMのmodeへ"timestamp_granularities": ["word"]を追加します。カスタム語彙は同時に指定しません。
for step in getattr(interaction, "steps", []) or []: for content in getattr(step, "content", []) or []: for annotation in getattr(content, "annotations", []) or []: if getattr(annotation, "type", None) == "word_info": print({ "text": getattr(annotation, "text", ""), "speaker": getattr(annotation, "speaker", None), "start": getattr(annotation, "start_offset", None), "end": getattr(annotation, "end_offset", None), })
未指定の機能に対応する値は得られない場合があります。保存先では未取得を空欄などで区別し、時刻や話者名を推測で埋めないようにします。発話とラベルを原音へ戻って確認できれば、議事録の確認作業を進めやすくなります。
対応する音声形式
公式ドキュメントで案内されている対応形式は、WAV、MP3、AIFF、AAC、OGG、FLAC、MPEG、M4A、L16、Opus、ALAW、MULAW、WebMです。APIではファイルに合ったMIMEタイプを指定します。
| ファイル形式 | MIMEタイプの例 |
|---|---|
| WAV | audio/wav |
| MP3 | audio/mp3 |
| M4A | audio/m4a |
| FLAC | audio/flac |
| OGG | audio/ogg |
| WebM | audio/webm |
拡張子とMIMEタイプが一致しないと、アップロード後の処理でエラーになる可能性があります。変換済みファイルを使う場合は、実際のコーデックとコンテナも確認してください。
料金と技術上の制限
Gemini Developer APIの公式料金表には無料枠と有料枠があります。2026年9月9日時点の有料枠の目安は、Live版が合計約0.009ドル/分、録音音声版が合計約0.005ドル/分です。
| モデル | 入力音声の目安 | 出力テキストの目安 | 合計概算 |
|---|---|---|---|
| Gemini 3.5 Transcribe Live | 0.005ドル/分 | 0.004ドル/分 | 約0.009ドル/分 |
| Gemini 3.5 Transcribe | 0.003ドル/分 | 0.002ドル/分 | 約0.005ドル/分 |
実際の請求額はトークン消費量で決まります。分単価は公式料金表のトークン換算を基にした概算であり、利用前に最新料金を確認してください。公式の分単価換算は、入力を音声1秒あたり25トークン、出力を1分あたり175テキストトークンとして計算したものです。無料枠もありますが、本番導入ではレート上限とデータ利用条件を含めて有料ティアを確認してください。
機能は自由に組み合わせられるわけではありません。録音音声の公式ガイドとLive版の公式ガイドによる、2026年9月9日時点の主な制限は次の通りです。
- Live APIの連続セッションは最大10分
- 録音音声は通常最大1時間
- 話者分離または単語タイムスタンプを使う場合は最大30分
- カスタム語彙は話者分離や単語タイムスタンプと併用不可。併用したリクエストは拒否される
- SMARTモードは話者分離や単語タイムスタンプと併用不可
- Live APIは話者分離と単語タイムスタンプに非対応
- 録音音声の話者分離は最大8話者で、3話者以上の割り当て精度は実験的
長い会議を話者別に処理する場合、単にファイルを送るだけでは上限を超える可能性があります。無音区間で分割し、前後の文脈や話者IDをどう引き継ぐかまで設計する必要があります。Live版を10分以上使うシステムでは、セッション再接続と出力の連結処理もあらかじめ実装します。
エラーが出るときに確認する順番
文字起こしに失敗した場合は、音声そのものを何度も再送する前に設定を確認します。以下は公式の制限に基づく確認順であり、各エラーの原因を必ず特定できるという意味ではありません。
- 呼び出し先を確認する:録音音声は
gemini-3.5-transcribe、リアルタイム音声はgemini-3.5-transcribe-liveを使います。 - 機能の組み合わせを減らす:カスタム語彙と話者分離・単語時刻を同時指定していないか確認します。
- 音声時間を確認する:通常は最大1時間、話者分離・単語時刻ありは最大30分です。
- ファイル形式を確認する:実ファイルの形式とMIMEタイプを一致させます。
- APIキーと利用枠を確認する:正しいプロジェクトを使っているか確認し、公式のレート制限ガイドから利用可能な枠を確認します。
最初は短い非機密の音声を、追加設定なしで送ります。成功後に日本語指定、語彙登録、または話者分離を一つずつ追加すると、どの設定で問題が出たかを絞れます。エラーログにはAPIキーや元音声を含めず、処理時刻、対象ファイルの管理番号、設定、返されたエラーを記録してください。
企業で使える3つの業務
導入効果を測りやすいのは、音声量と人手修正時間を把握できる業務です。全社導入より、代表的な音声を選んだ小規模な検証が適しています。
コールセンターのリアルタイム支援
Live APIで通話を即時に文字化し、オペレーター画面へ字幕を表示できます。製品名や専門語をカスタム語彙へ登録すると、認識候補へ反映できます。ただし、注文番号などの数字が正しくなる保証はないため、原音との照合が必要です。
ただし、Live API単体では話者分離ができません。顧客側と担当者側の音声チャネルを分けられる電話基盤なら、入力段階で識別する設計が必要です。
会議と商談の記録
録音音声版は、話者分離や単語単位のタイムスタンプを利用できます。逐語録の保存、読みやすい議事録の作成、決定事項の抽出を別工程に分けると、確認可能性を保ちやすくなります。
商談記録では、文字起こし結果をそのまま顧客管理システムへ確定登録しない方が安全です。担当者が固有名詞、金額、期限、合意事項を確認してから反映する承認工程を置きます。
現場作業と点検報告
製造、建設、保守の現場では、手が塞がった状態でも音声で報告できます。部品名、型番、施設名をカスタム語彙へ登録し、SMARTモードで箇条書きや数字を整形すれば、報告書作成の後処理を減らせます。
誤認識が安全判断へ影響する項目は、自動確定させない運用が前提です。型番、数量、異常値を原音と照合できる画面を用意します。
導入前に確認するデータ管理
企業利用では、精度より先にデータの扱いを決める必要があります。同じGemini APIでも、無料枠と有料サービスでは入力データの利用条件が異なります。2026年9月9日時点の条件はGemini API追加利用規約で確認できます。
Googleの追加利用規約では、無料サービスへ送信した入力と出力が製品改善などに利用され、人間のレビュアーが処理する場合があると説明されています。Googleは無料サービスへ機密情報、個人情報、非公開情報を送らないよう明記しています。
一方、有料サービスのプロンプト、音声ファイル、回答はGoogle製品の改善には利用されません。ただし、不正利用検知などのために一定期間ログが保持される場合があります。「学習に使われない」と「保存されない」は別の条件です。また、有料サービスへの該当は請求額の有無だけでなく、APIを利用するCloudプロジェクトの有効な課金アカウントで判断されます。録音音声を扱う企業は、次の項目を社内ルールへ落とし込む必要があります。
- 録音対象者への通知と同意
- 音声と文字起こしの保存期間
- 閲覧権限と監査ログ
- 原音を削除する条件
- 誤認識を人が確認する対象項目
- 処理地域、委託先、データ処理契約の確認
Public Previewを「安価だからすぐ全社標準にする」と判断するのは早計です。まず非機密データで評価し、法務、情報システム、業務部門が本番条件を合意してから対象を広げます。
AI音声活用の対象業務、データ管理、ツール選定を整理したい企業は、株式会社NexaのAI顧問へご相談ください。
今すぐ試すための3ステップ
PoC(概念実証)では、精度だけでなく修正時間と運用負荷を測ります。高いベンチマーク値でも、自社の音響環境や専門語で同じ結果になるとは限りません。
- 代表音声を10件選ぶ
- 静かな会議、雑音のある通話、複数話者、専門用語を含む音声を混ぜます。
- SMARTとVERBATIMを比較する
- 発話の欠落、数字、固有名詞、決定事項の再現性を確認します。
- 業務KPIを測る
- WER、修正時間、1時間当たり費用、確認漏れ、処理待ち時間を既存手段と比べます。
最終判断では、文字起こし精度が高いかだけでなく、人が確認すべき箇所を特定しやすいかを見ます。修正箇所が分散する仕組みより、低信頼部分を明示できる仕組みの方が運用しやすい場合があります。
図3: 同意、権限、原音照合、修正時間を小規模検証で確認します。
Gemini 3.5 Transcribeのよくある質問
Q. Gemini 3.5 Transcribeは日本語に対応していますか?
はい。公式ドキュメントの対応言語一覧には日本語ja-JPが掲載されています。ただし、日本語でも業界用語、固有名詞、方言、音響環境によって精度が変わるため、自社音声で評価してください。
Q. Gemini 3.5 Transcribeは無料で使えますか?
Gemini Developer APIの公式料金表には無料枠があります。ただし、無料サービスでは入力と出力が製品改善などに利用される場合があるため、機密情報や個人情報を含む音声は送らないでください。
Q. 会議の話者分離はできますか?
録音音声版では最大8話者の話者分離に対応します。3話者以上の割り当て精度は実験的です。Live APIは話者分離に対応していません。
Q. 機密情報を含む音声に利用できますか?
無料枠には送らないでください。有料サービスを検討する場合も、利用規約、データ処理条件、録音同意、保存期間、アクセス制御を確認し、組織の情報管理基準に適合させる必要があります。
Q. どの音声ファイル形式に対応していますか?
WAV、MP3、AIFF、AAC、OGG、FLAC、MPEG、M4A、L16、Opus、ALAW、MULAW、WebMに対応しています。APIへ送るときは、実際のファイル形式に合ったMIMEタイプを指定してください。
Q. 長時間の会議はそのまま文字起こしできますか?
通常の録音音声は最大1時間ですが、話者分離または単語単位タイムスタンプを有効にすると最大30分です。上限を超える場合は無音区間などで分割し、分割前後の文脈や話者IDをどう扱うか設計してください。
まとめ
Gemini 3.5 Transcribeは、リアルタイムと録音音声の文字起こしを提供し、日本語を含む85以上の言語に対応します。SMARTとVERBATIMを使い分けられるため、共有用の読みやすい記録と、人が原音を確認するための発話ベースの自動文字起こしを分離できます。
企業は、代表音声10件ほどのPoCから始めるのが現実的です。固有名詞と数字の精度、修正時間、費用、データ管理を測り、Public Previewの制限を踏まえて対象業務を広げてください。Geminiシリーズ全体のモデル選定は「Gemini 3とは?最新モデル・料金・使い方」でも整理しています。
AIの導入・活用にお悩みですか?
株式会社NexaのAI顧問は、ツール選定から小規模検証、データ管理、社内定着まで伴走します。音声AIをどの業務から試すべきか分からない段階でもご相談いただけます。
この記事で参照した外部情報
- Googleの2026年8月26日付公式発表blog.google
- 音声理解の公式ガイドai.google.dev
- Google公式ガイドai.google.dev
- 公式の機能制限表ai.google.dev
- 公式の出力解析例ai.google.dev
- Gemini Developer APIの公式料金表ai.google.dev
- Live版の公式ガイドai.google.dev
- 公式のレート制限ガイドai.google.dev
- Gemini API追加利用規約ai.google.dev
本文中でリンクしている外部ページの一覧です(自動生成)。最終確認日は本記事の最終更新日 2026-09-09 で、リンク先の内容はその後変わることがあります。





