xAI は 9 月 18 日、音声認識 API「Grok Voice Transcribe 2.0」を公開しました。従来モデルからバッチ推論の $0.10/時、ストリーミング $0.20/時という料金は据え置き、xAI の内部評価で単語誤認率を 20.6% から 6.8% へ引き下げたとしています。Grok Voice 基盤モデル上で稼働し、Tesla 車両上の音声エージェントや大量のカスタマーサポート通話にも既に組み込まれていると説明されました。

主なポイント

  • xAI は同モデルを「1.0 比で約 2 倍の精度」と表現し、Artificial Analysis のリーダーボードでストリーミング精度 32 モデル中 1 位と主張
  • 数十言語に対応し、言語自動判定と録音途中の言語切り替えを 1 パスで追随できる
  • 話者ダイアライゼーション、タイムスタンプ、キーワード優先、リアルタイム中間結果を API で提供
  • 発表と同時に開発者向けドキュメントも更新され、既存の Grok Voice エコシステム(車載・IVR・音声エージェント)から段階的に切り替えが進む
  • xAI が音声関連機能を続けて出している流れの中で、Grok 本体のボイスモード(デスクトップ・モバイル)とは別の、開発者・企業向け音声認識モデルという位置付け

出典: Introducing Grok Voice Transcribe 2.0 — xAI