Liquid AI、画像・音声対応のエッジ判断モデル公開
出典:Hugging Face
詳細を読む
Liquid AIは2026年10月7日、エッジ端末で高速な構造化判断を行うオープンウェイトの「d1-3B」と研究初期版「d1-omni-600M」をHugging Faceで公開しました。生成モデルのようにトークンを順次出すのではなく、1回の順伝播で回答する設計です。テキストに加えて画像や音声を扱い、応答速度と小さな実装規模の両立を狙います。
7種の公開データセットでは、d1-3Bの平均スコアは82.9で、比較表のDecider 4Bの81.1を上回りました。d1-omni-600Mも平均78.4となり、約4分の1のパラメーター数でDecider 2Bの77.1を超えたとしています。
NVIDIAとの評価で、d1-3BはJetson AGX Thor上で質問1件に16ミリ秒、AGX Orinで26ミリ秒、Orin Nanoで50ミリ秒でした。RTX 4090とAMD MI325Xでは10ミリ秒未満で、384ピクセル画像の処理も18ミリ秒未満です。
d1-3Bは30億パラメーターの視覚言語モデルを基盤とし、テキストと画像を入力できます。d1-omni-600Mは双方向エンコーダーに視覚・音声エンコーダーを加え、テキストと画像、またはテキストと音声を扱いますが、現時点では研究初期版です。
想定用途は、問い合わせの担当部署への振り分け、返金要否や緊急度の判定など、形式が決まった意思決定です。導入を検討する企業は高速性だけでなく、視覚・音声の公開ベンチマークが未掲載である点や、配布コードの実行にtrust_remote_code=Trueが必要な点も評価する必要があります。