Hugging Face、多言語TTS評価表を公開
出典:Hugging Face
詳細を読む
Hugging Faceは2026年9月30日、多言語の音声合成と音声複製モデルを共通条件で比べる「Open TTS Leaderboard」を公開しました。明瞭度、生成速度、話者の類似度を客観指標で測り、投票収集にこれまで数週間かかった評価を数時間へ短縮して、公開モデルの追加と比較を容易にします。
従来のアリーナ型評価は、二つの生成音声を人が聞き比べ、投票から順位を算出します。しかし評価に時間がかかり、運営者が自ら配信環境を用意する公開モデルは掲載されにくく、9月30日時点である評価表の92モデル中、重みを公開したモデルは16件でした。
明瞭度は生成音声の文字起こしと入力文の単語・文字誤り率で測り、速度は一括推論の処理量と最初の音声が届くまでの時間で比べます。音声複製では、参照音声と生成音声の話者特徴の類似度を加え、品質、速度、モデル規模の均衡を可視化します。
利用者は言語を切り替え、英語だけでなく中国語、日本語、韓国語などの性能を個別に確認できます。音声複製の有無や配信性能も選択でき、同じ50件の英語入力と同一機器で最初の音声までの待ち時間を比較します。
客観指標は自然さや表現力、聞き手の好みを直接測らないため、人による評価を置き換えるものではありません。「Listen」画面では生成音声を試聴して投票でき、Hugging Faceは評価コードの公開も予定し、データセットや指標への意見を募ります。