Alibaba の Qwen チームは 9 月 23 日、音声モデル群「Qwen-Audio-3.1」を公開しました。従来の ASR・TTS・Realtime を刷新し、話者分離や感情・環境音の同時認識を担う ASR-Next、音声・効果音・環境音を 1 パスで生成する TTS-Next を追加した 5 モデル構成です。あわせてラインナップ全体で API 価格を大幅に引き下げました。

主なポイント

  • 5 モデル構成: Qwen-Audio-3.1-ASR / ASR-Next / TTS / TTS-Next / Realtime
  • ASR-Next は複数話者のタイムスタンプ付き識別、感情・環境音・機械音の検出に対応
  • TTS-Next は言語モデルと拡散モデルを組み合わせ、音声と効果音・BGM を 1 パスで生成
  • Realtime は「聞きながら話す」同時対話と割り込み応答をサポート
  • API 価格は ASR で最大 95%、Realtime で約 85%、TTS で約 70% の値下げ
  • 従来モデル比の値下げ幅としては音声 AI 分野で 2026 年最大級

出典: Alibaba launches Qwen Audio 3.1 with new models and slashes AI audio prices by up to 95 percent