Alphabet Inc Class CGOOG
▲ ポジティブ技術関連度
Google unveils Gemini 3.5 Transcribe, a new speech-to-text model with superior accuracy, enhancing its AI product lineup.
Googleは、これまでで最も精度の高い音声認識モデル「Gemini 3.5 Transcribe」を発表しました。このモデルは、生の音声を直接、正確で洗練された整形済みテキストに変換します。開発者向けワークフロー向けに設計されており、音声エージェント、リアルタイムキャプション、通話後分析を可能にします。Live APIによるリアルタイムストリーミングと、Interactions APIによる録音済み音声に対応しています。85以上の言語をサポートし、最大3人の話者を識別でき、ストリーミング時のワードエラーレートは4%、非ストリーミング時は2.6%で、FLEURSベンチマークでOpenAIのGPT Live Transcribeを上回ります。このモデルは現在、開発者と企業向けにパブリックプレビューで利用可能で、一部の国ではmacOSおよびAndroid向けGeminiアプリでも利用でき、Chrome対応も近日中に予定されています。今回のリリースは、Googleが先にGemini 3.7 Flashを発表し、Geminiアプリのユーザー数が10億人を突破したことに続くものです。次期フロンティアモデルであるGemini 3.5 Proはまだリリースされていません。
Alphabet Inc Class CGoogle unveils Gemini 3.5 Transcribe, a new speech-to-text model with superior accuracy, enhancing its AI product lineup.