Olmo-core 3、1兆超MoEの訓練基盤を公開
詳細を読む
Olmo開発チームは2026年10月1日、大規模な専門家混合モデルを効率よく訓練する公開基盤「Olmo-core 3」をリリースしました。専門家をGPU上に常駐させ、入力を必要な専門家へ送る設計と複数の並列化を組み合わせ、1兆パラメータ超へ拡張しながら通信・調整負荷を抑えます。次世代Olmoの訓練基盤として使い、研究者や開発者にもコードと技術判断を公開します。
専門家混合モデルは多数の専門家を持ちながら、入力ごとに一部だけを動かして計算を抑えます。ただし全モデルをGPUメモリに置いて更新し、クラスタ内で入力を適切な専門家へ送る必要があるため、規模が増すほど通信と調整の負荷が利点を削ります。
ある試験では専門家を8基から128基へ増やしつつ、各トークンで使うのは4基、稼働パラメータは約32億に保ちました。総容量を46億から470億パラメータへ広げても、処理速度の低下は5%未満でした。NVIDIA B300を8基使う予備試験では、470億パラメータのモデルがGPU当たり毎秒5万2,000トークンを処理し、旧基盤の1万9,400から約2.7倍になりました。
従来方式は小さな訓練単位ごとに重みを集めて再分散していましたが、新基盤は分散データ並列を使って専門家をGPUに常駐させ、必要なデータを送ります。専門家並列、パイプライン並列、分散オプティマイザーでモデルと訓練状態を分け、行単位の専門家並列、GPU上の経路制御、まとめた行列演算でデータ移動と細かな計算を効率化します。
4基のNVIDIA B300で低精度形式MXFP8を使うと、BF16比で処理速度が約21%上がり、最大稼働メモリは103GiBから95GiBへ減りました。512基では1.2兆パラメータの構成を測定し、GPU当たり最大858TFLOP/sを記録しましたが、これはランダムな経路選択によるシステム性能試験であり、学習済みモデルの品質評価ではありません。DeepEP v2を使った2.38兆パラメータの試験も短時間の容量確認で、完全な訓練ではありません。
技術報告は、経路の均等化指標が改善しても実際の負荷が偏る例や、通信と計算の重ね合わせが逆に遅くなった例も記録しています。Olmo-core 3は異なる機器への適応や経路制御の実験を含めて公開され、今後は専門家混合型となる次世代Olmoの土台に使われます。