Google、新しい音声認識モデル「Gemini 3.5 T...の画像はこちら >>

Gemini 3.5 Transcribe

Googleが、正確かつインテリジェントなリアルタイム文字起こしを実現するために設計された最新音声認識モデル「Gemini 3.5 Transcribe」を発表しています。

背景雑音、複雑な専門用語、発音の不明瞭さの修正に苦労する従来の音声認識モデルとは異なり、Gemini 3.5 Transcribeは生の音声を正確で洗練されたフォーマット済みのテキストに直接変換します。



Transcribe 3.5は、音声エージェント、リアルタイム字幕ツール、通話後分析パイプラインなど、開発者のワークフローにシームレスに統合できるように設計されています。

Gemini for macOSの Transcribe 3.5では、自然な話し言葉をきれいな書式のテキストに変換するだけでなく、画面上のコンテキストとシームレスに連携する音声コマンドも利用でき、複雑なワークフローを効率的に実行できます。

バックグラウンドで他の Gemini モデルを呼び出して処理を任せることで、ローカルファイルの要約、アプリ間でのテキストの再利用、カーソル位置への画像生成などを、音声だけで簡単に行うことができます。

編集部おすすめ