Home
AIリーダーシップ
AI NEWS
AIツール
AI Trends
AI Native Lab
購読

シャオミ、ロボットなしで「人手」で集めたデータでロボットファンデーションモデル版を振る

팀제이커브
カテゴリー
Empty
シャオミがロボットアーム一台なしで収集した10万時間以上の実世界データで訓練したビジョン-言語-行動(VLA)ファンデーションモデル「Xiaomi-Robotics-1」を公開した。カメラ付きの携帯用ハンドヘルドグリッパーを人が直接操作してデータを集める方式で、高価なロボットテレオペレーションなしでも業界標準ベンチマーク5種で最上位性能を記録した。ロボット学習では、「より大きなモデル」よりも「より多くのデータ」が決定的であるという事実を実証した事例として評価される。
Xiaomiのアプローチは、データ収集段階でロボットを完全に排除したことが重要です。作業者たちがカメラ付きのポータブルグリッパーを持ってキッチン、オフィス、店舗、工場、屋外など1,700ヶ所以上の環境で直接物を集めて移す動作を遂行し、このように10万時間を超えるモーション記録が積まれた。膨大なデータにラベルを付ける作業は、AIモデルが動作区間別のテキスト記述を自動生成する方法で処理し、人が手作業でしたら不可能だった全体のデータセットラベリングを約2週間で終えた。
性能検証結果も明らかである。 RoboCasa365リーダーボードで、Xiaomi-Robotics-1は57.4点で2位のABot-M0.6(46.6点)を10点以上上回り、RoboDojoベンチマークでは2位比約58%高い平均スコアを記録した。特に新しい課題に適応させる実験で、課題当たり10時間以下のデモンストレーションデータだけで平均75%の作業成功率を達成したが、同じ条件で有力競合他社Physical Intelligenceのモデル(pi0.7)は40%にとどまった。ハンドヘルドグリッパデータで先に学習した後、車輪型、両腕型など実際のロボットに転移する構造も正常に動作した。
今回の発表が注目される背景には、ロボットAI業界の高質なボトルネックである「データ不足」問題がある。言語モデルはインターネットテキストという巨大な学習材料があるが、ロボットの物理操作データはロボットを直接動かして集めなければならず、コストと時間が膨大である。人が安価なハンドヘルド装備でデータを集めるシャオミの方式は、このボトルネックを迂回する現実的な解決策だ。行動ラベルなしで12万5,000時間映像で学習する中国BAAIの「Orca」のような代替案もあるが、シャオミはラベリング自体を自動化する別の道を選んだ。
スケーリング実験で得られた結論も示唆点が大きい。 Xiaomiは20億から100億のパラメータまでモデルサイズを変えながら実験したが、パラメータを増やすよりもデータを増やす方がはるかに大きな性能向上をもたらした。見知らぬ環境での成功率はデータが増えて約25%から75%まで走り、スケーリング曲線はまだ輻輳区間に到達しておらず、データをさらに注ぐと性能が上がる余地があることが分かった。
結局、Xiaomi-Robotics-1は、ロボットファンデーションモデル競争の勝負先がモデルアーキテクチャではなく、「誰が実世界のデータを安く迅速に大量確保するのか」に移動していることを示している。スマートフォンと家電で固められたハードウェア量産能力を持つシャオミが低コストのデータ収集パイプラインまで立証し、Physical Intelligence、FigureなどロボットAIリーダーとの競争構図にも変化が予想される。
AI Native 백과사전
「AI Native百科事典」を購読する
サイトを購読すると、新しい投稿などの最新のアップデートを通知やメールで最初に受け取ることができます。
Slashpageに参加して「AI Native百科事典」を購読してください!
購読
👍