ToolNavs Outils IA à découvrir
Proposer Connexion
Retour à Informations sur l’IA
Rho-1, le modèle omni, débute : 19 milliards de paramètres, un seul réseau pour le texte, l'image, la vidéo et les robots

Rho-1, le modèle omni, débute : 19 milliards de paramètres, un seul réseau pour le texte, l'image, la vidéo et les robots

Informations sur l’IA • Admin • • 7 vues

Rho-1 est le nouveau modèle en avant-première de recherche de Reka AI. Le 5 octobre 2026, The Decoder a présenté ce modèle « omni » de 19 milliards de paramètres : texte, images, vidéo et actions de contrôle de robot sont traités et générés dans un seul réseau de neurones, sans appels d'outils externes et sans répartir les tâches entre modèles spécialisés. Toutes les modalités entrent dans une même fenêtre de contexte partagée et sont calculées comme un unique flux de tokens.

Un réseau pour quatre métiers — la difficulté est dans les données, pas dans la structure

Selon le reportage, Rho-1 génère de la vidéo continue en temps réel, accepte de nouvelles instructions en pleine exécution sans redémarrer, et les mêmes poids qui prédisent les images de caméra produisent directement les mouvements du robot. La rareté des données robotiques est l'obstacle classique de ce type de modèle ; la réponse de Reka consiste à entraîner d'abord un modèle de dynamique inverse qui déduit les signaux de commande à partir de vidéos ordinaires d'Internet, transformant d'énormes volumes d'images non annotées en matériau d'entraînement. Le modèle lui-même a été entraîné sur 320 GPU H100 pendant environ trois mois. Dans la feuille de route officielle de Reka, ce n'est pas un détour : depuis la fusion des talents avec Moonvalley, l'entreprise poursuit des « modèles de monde omni » dont l'architecture unique simule, raisonne et prédit les actions — Rho-1 en est la première incarnation visible.

Ce qui le distingue du multimodal dominant

Les modèles vision-langage courants fonctionnent en « entrées multiples, sortie unique » : ils regardent images et vidéos et répondent en texte, tandis que la génération d'images ou le contrôle de robot passent par d'autres modèles greffés, avec latence et perte d'information à chaque couture. Rho-1 parie sur le repli de la compréhension et de la génération dans une représentation partagée, où le modèle répète d'abord en interne l'évolution de la scène avant de décider de l'action. Pour la robotique, planification et exécution cessent d'être un relais entre deux systèmes ; pour les médias interactifs, la vidéo peut répondre à de nouvelles instructions pendant sa génération. Le financement du roboticien RobCo raconté ici montrait le capital courant après les corps de robots ; des travaux comme Rho-1 fournissent l'autre moitié — un « cerveau » partagé et plus général pour ces corps.

Trop tôt pour le classer

Les informations publiques sur Rho-1 se limitent pour l'essentiel à un reportage et une vidéo de démonstration : ni données de benchmark publiées, ni poids, ni accès d'essai, et ses 19 milliards de paramètres ne visent manifestement pas le haut des classements. Sa valeur tient plutôt à une validation d'itinéraire : un réseau unique peut-il porter à la fois compréhension, génération et action, et la voie des données par dynamique inverse peut-elle passer à l'échelle ? En attendant le rapport technique de Reka ou une démonstration reproductible, le jugement sur la distance qui le sépare d'un modèle omni utilisable peut attendre.

Outils Recommandés

Plus