エージェント

NVIDIAがHugging FaceでMagpie TTSを拡張。12言語の声を自社環境で動かす選択肢

NVIDIAがHugging Faceの公式ブログで、Magpie TTS Multilingualによる多言語音声エージェント構築を発表しました。発表の軸は、12言語対応の声を自社環境で動かし、遅延と発音を細かく扱えることです。

コールセンターの卓上で、複数言語の電話がGPUサーバーへ流れ込み、AIオペレーターの口元から自然な音声が返る場面。待ち時間を示す小さな砂時計が軽くなっているのイラスト

電話口の小さな沈黙が勝負になる

NVIDIAの発表を、電話口の短い沈黙から考えると分かりやすいです。利用者が話し終えたあと、AIが少し遅れて話し出すだけで、会話は急に機械らしくなります。

Hugging Faceで公開されたNVIDIAの記事は、この沈黙を減らすためのTTS(文字を音声に変える技術)を扱っています。主役はMagpie TTS Multilingualです。

発表日は2026年8月10日です。NVIDIAは、低遅延、多言語、オープン重み、自社環境での運用をひとまとまりにして示しました。

一言でいえば、声のAIを「借りる機能」から「組み込む部品」へ近づける発表です

声のベルトコンベヤーを分けて持つ

音声AIは、ひとつの魔法の箱ではありません。声を聞き取り、文字にし、AIが返答を作り、最後に声へ戻す流れで動きます。

一体型API(ひとつの呼び出しで音声入力から音声出力まで行う仕組み)は便利です。ただし、どこで遅れているかを見分けにくく、業務用語や固有名詞に合わせた調整も難しくなります。

Magpie TTSが狙うのは、最後の声づくりを自分たちの持ち場にすることです。ASR(音声を文字にする技術)やLLM(文章を理解し生成するAI)と組み合わせ、必要な部品ごとに改善できます。

これはレストランの厨房に近いです。完成品を外から受け取るのではなく、火加減や盛り付けを自分たちで直せる形です。

12言語の声を同じ棚に置く

Magpie TTS Multilingualは、3億6400万パラメータのオープン重みモデルです。NVIDIAの記事では、対応言語が12言語と説明されています。

発表で示された言語は次の通りです。

・英語、スペイン語、フランス語、ドイツ語

・イタリア語、ベトナム語、北京語、ヒンディー語

・日本語、現代標準アラビア語、韓国語

・ブラジルポルトガル語です。今回の広がりとして、新たに現代標準アラビア語、韓国語、ブラジルポルトガル語が加わったとされています。各言語には、男性と女性の話者音声が含まれるとも説明されています。日本語の読者に近い変化もあります。ヒンディー語と日本語では、コードスイッチング(会話中に言語を切り替えること)の対応が広がりました。人名や製品名、英語混じりの専門用語を発音しやすくするためです。

一体型と分解型の流れを示す図解

速さの数字は体感に変わる

NVIDIAの性能資料では、TTFA(最初の音が届くまでの時間)が中心指標として出ています。これは、AIが考え終わってから声が鳴るまでの待ち時間に近い数字です。

オンプレミス測定では、B200で1ストリーム平均32.39ミリ秒です。64ストリームでは239.13ミリ秒、スループットは319.81倍と示されています。

H100では1ストリーム平均46.78ミリ秒、A100では79.37ミリ秒です。数値はNVIDIA TTS NIMの性能資料に基づき、平均は3回の試行から出されています。

この数字は、一般読者にも関係します。窓口AIや予約AIが返事をためるほど、人は相手を待っている感覚になります。速く最初の音が出るほど、会話は続けやすくなります。

料金より先に分かる提供範囲

発表から読める範囲を、提供条件としてまとめると次のようになります。価格や細かな利用条件は、発表に書かれていません。

項目内容
発表主体NVIDIA
公開場所Hugging Face公式ブログ
発表日2026年8月10日
対応言語12言語
料金発表に書かれていない
一般利用条件発表に書かれていない

NVIDIAは、試用先としてNVIDIA BuildとHugging Faceのデモを案内しています。運用向けにはNVIDIA NIM、調整や学習向けにはNeMo Speechを示しています。

ここでの主な相手は、音声エージェントを作る開発者や企業です。一般ユーザーが今日からアプリで使う新機能というより、これからの音声サービスの裏側に入る基盤です。

声のAIは業務の顔になる

NVIDIAは用途として、顧客サポート、医療アシスタント、企業向けコパイロット、翻訳システム、会話AIを挙げています。どれも、人が声で用件を伝え、AIが返す場面です。

声が自然でも、遅ければ不安になります。速くても、発音が崩れれば信頼しにくくなります。だからこそ、低遅延と発音調整はセットで効きます

今回の発表は、派手な新アプリの話ではありません。声のAIを本番の仕事場に置くため、企業が速度、言語、データの置き場所を握る話です。

AIエージェントは、画面の文章だけでなく、声で人とやり取りする存在へ近づいています。読者の前に現れる変化は、窓口や社内ヘルプの「少し待つ感じ」が減っていくところにあります。

出典
  • Hugging Face「Build Low-Latency Multilingual Voice Agents: Open Weights & Full Deployment Control with NVIDIA Magpie TTS」元記事へ
  • docs.nvidia.com「NVIDIA TTS NIM Performance documentation」元記事へ
  • build.nvidia.com「NVIDIA Nemotron Voice Agent Developer Example」元記事へ

最新のAIニュースを毎日追うなら

新モデル、料金、仕事への影響まで、働く人の目線で毎日1本にまとめています。