1. Abstract
GELab-Zero est une solution d’agent GUI open source développée par StepFun, fournissant une pile complète d'« infrastructure modèle + ingénierie », principalement pour les opérations automatisées et l’interaction intelligente des applications mobiles Android. Le projet comprend un modèle d’agent GUI 4B pouvant s’exécuter localement, ainsi que le déploiement en un clic de scripts d’inférence et de gestion de périphérique, supportant la distribution multi-téléphones de tâches et l’enregistrement de pistes, et atteignant des taux de réussite élevés sur des benchmarks tels qu’AndroidWorld et AndroidDaily, ce qui convient aux chercheurs et aux entreprises pour mener des expériences d’agents mobiles et la vérification de prototypes.
2. Caractéristiques principales
- Modèle complet + Infra : En même temps, les services d’inférence open source, l’exécution d’agent et les outils de visualisation réduisent le seuil d’accès à l’ingénierie.
- Modèle local 4B : GELab-Zero-4B-preview prend en charge l’exécution sur des GPU grand public ou des processeurs haut de gamme, en tenant compte de la latence et de la confidentialité.
- Répartition multi-appareils et tâches : Prendre en charge plusieurs appareils Android pour exécuter des tâches en parallèle, enregistrer automatiquement les pistes d’interaction, et faciliter la reproduction et le débogage.
- Modes agents multiples : modes intégrés tels que les boucles ReAct, la collaboration multi-agents et les tâches planifiées, couvrant des processus complexes tels que la recommandation, la requête et l’ordre.
- Benchmarks et données publiques : Fournir des données de scénarios réels à AndroidDaily, et performer en avance ou près de SOTA dans plusieurs benchmarks GUI.
3. Installation
1. Préparer l’environnement : Il est recommandé d’utiliser Python 3.12+, et il est officiellement recommandé de créer un environnement virtuel gelab-zero via Miniforge.
- Cloner le dépôt et les dépendances :
git clone https://github.com/stepfun-ai/gelab-zero.git cd gelab-zero pip install -r requirements.txt
- Déploiement du LLM :
- utilisateurs individuels : installer Ollama, télécharger le
GELab-Zero-4B-previewdepuis Hugging Face, effectuerollama create gelab-zero-4b-preview -f Modelfilepour finaliser l’importation, et utiliser la quantification Q4/Q8 selon les besoins. - Utilisateurs avancés : Vous pouvez utiliser le vLLM pour déployer des services de stabilité à long terme par document.
- 4. Configurez les appareils Android : installez ADB, activez le mode développeur mobile et le débogage USB, et
adb devicesconfirmez que l’appareil est en ligne. - 5. Démarrage en un clic : exécutez le script de démarrage officiellement fourni dans l’entrepôt, connectez le service modèle et l’appareil, puis entrez l’inférence de bout en bout de l’agent GUI.
4. Cas d’usage typiques
- Automatisation des services de vie : opérations complètes telles que la réservation de taxi, la commande, l’achat de billets et la collecte de l’aide sociale dans des applications telles que la commande à emporter, les voyages, les réseaux sociaux et le paiement.
- Recherche de contenu et d’information : Recherchez le contenu par conditions dans Zhihu et l’application News et ouvrez la réponse ou la page spécifiée.
- Processus d’achat complexe : Filtrer les produits, ajouter aux favoris ou passer des commandes sur les plateformes de commerce électronique selon le montant, les spécifications, etc.
- Recherche de benchmark : Évaluer différentes politiques d’agent GUI et versions de modèles sur les tâches statiques/de bout en bout sur AndroidDaily.
5. Écologie et produits concurrents
- Composantes écologiques :
- Face d’étreinte/ModelScope fournit des poids officiels ;
- La communauté fournit la quantification GGUF (pratique pour les llama.cpp et les clients locaux de bureau) ;
- Soutien du jeu de données AndroidDaily et de la page web de benchmark open source.
- Comparaison des produits concurrents : Comparé aux modèles GUI tels que UI-TARS et GUI-Owl, GELab-Zero se caractérise par une pile d’ingénierie complète, une optimisation pour de réels scénarios Android et une rentabilité à l’échelle 4B ; L’effet spécifique doit encore être vérifié en combinaison avec son propre matériel et ses tâches.
6. Limitations et précautions
- Seuls les scénarios d’interface graphique Android doivent adapter les applications iOS et Web ou d’autres solutions sont nécessaires.
- Bien que le modèle 4B soit relativement léger, il nécessite néanmoins de bonnes capacités de calcul et de bonnes conditions de dissipation thermique pour une inférence multi-dispositif à long terme.
- Les opérations automatisées impliquent des informations sensibles telles que les comptes et les paiements, il est donc recommandé de les exécuter dans un compte test ou un environnement contrôlé, et de bien isoler les permissions et gérer les journaux.
- Le projet est encore en phase de mise à jour rapide, et l’interface ainsi que le script peuvent changer, vous devriez donc lire la documentation et les enregistrements de modifications les plus recents avant de mettre à jour.
7. Adresse
https://github.com/stepfun-ai/gelab-zero 8. FAQ
Q : GELab-Zero supporte-t-il un déploiement entièrement sur site et une exploitation hors ligne ?
R : Oui. L’inférence de modèle et le contrôle des dispositifs peuvent être effectués localement sans dépendre des services cloud, mais une puissance de calcul et un espace de stockage suffisants sont nécessaires localement.
Q : Quelles sont les exigences matérielles générales pour GELab-Zero-4B-preview ?
R : Il est généralement recommandé d’utiliser un GPU à carte unique ou un CPU haut de gamme avec 8 à 12 Go de VRAM, ce qui peut être constaté sur des appareils d’entrée de gamme à forte quantification de compression (comme le Q4), mais la qualité et la vitesse d’inférence seront réduites.
Q : J’ai déjà mon propre modèle multimodal/langage, puis-je me connecter directement à GELab-Zero ?
R : Oui. L’aperçu par défaut GELab-Zero-4B peut être remplacé tant que le service d’inférence conversationnelle est disponible via HTTP ou interfaces similaires et suit les formats de requête et de message convenus dans la documentation du projet.
Q : Le benchmark AndroidDaily peut-il être utilisé séparément pour l’évaluation des modèles ?
R : Oui. Le dépôt et le site officiel proposent deux méthodes d’évaluation, statique et de bout en bout, et peuvent télécharger indépendamment des données et des scripts pour mener des expériences comparatives sur leurs propres modèles d’agents GUI.