ToolNavs 便利なAIツールを発見
ツール投稿 ログイン
戻るAI情報
Rho-1 全能モデル登場:19B パラメータ、一つのネットワークでテキスト・画像・動画・ロボット動作を担う

Rho-1 全能モデル登場:19B パラメータ、一つのネットワークでテキスト・画像・動画・ロボット動作を担う

AI情報 • Admin • • 7 回閲覧

Rho-1 は Reka AI が公開した研究プレビュー段階のモデルだ。2026 年 10 月 5 日、The Decoder がこの 19B パラメータの「全能」モデルを報じた。テキスト、画像、動画、ロボットの制御アクションを単一のニューラルネットワークの中で処理し生成する。外部のツール呼び出しはなく、タスクごとに別々の専用モデルへ振り分けることもない。すべてのモダリティは一つの共有コンテキストウィンドウに入れられ、同じトークンの流れとして計算される。

一つのネットワークで四つの仕事、難所は構造ではなくデータ

報道によれば、Rho-1 は連続動画をリアルタイムに生成でき、実行中に新しい指示を受けても再起動は不要で、カメラ画像を予測する同じ重みがロボットの動作を直接出力する。こうしたモデルの長年の難題はロボットデータの不足で、Reka の答えは逆ダイナミクスモデルを先に訓練し、普通のネット動画から制御信号を逆推定することで、大量の無注釈映像を訓練材料に変えることだった。モデル本体は 320 枚の H100 で約 3 か月訓練された。Reka の公式ロードマップに照らしてもこれは寄り道ではない。同社は Moonvalley と人材を統合して以来、単一アーキテクチャでシミュレーション、推論、動作予測をこなす「全能世界モデル」を推進しており、Rho-1 はその路線が初めて目に見える形になった実例だ。

今の主流のマルチモーダルとの違い

主流の視覚言語モデルは通常「入力は多種、出力は一種」だ。画像や動画を見て最後はテキストを返し、画像生成やロボット制御は別モデルを外付けするため、継ぎ目ごとに遅延と情報の損失が生じる。Rho-1 の賭けは、理解と生成を一つの共有表現に畳み込み、モデルが内部で「場面が次にどう変わるか」を先に予演してから動作を決めることにある。ロボット場面では計画と実行が 2 システムのリレーでなくなり、対話型メディアでは動画が生成の途中で新しい指示に応答できる。以前伝えた RobCo のロボット資金調達 は資本がロボットの本体を追う話だったが、Rho-1 のような仕事はもう一方の端、つまり本体同士で共有できるより汎用的な「脳」を補う。

格付けはまだ早い

現時点で Rho-1 について公開されている情報は、主に 1 媒体の報道とデモ動画にとどまる。評価データも重みも試用入口も公開されておらず、19B という規模自体、最先端のスコア競争を目指したものではない。その価値はむしろ路線の検証に近い。単一ネットワークが理解、生成、動作を同時に担えるのか、逆ダイナミクスというデータ路線が規模化できるのか。Reka が技術報告や再現可能なデモを出すまで、「使える全能モデル」まであとどれくらいかという判断は保留でよい。

おすすめツール

もっと見る