L’équipe Hunyuan de Tencent a officiellement publié le modèle expert OCR open-to-end HunyuanOCR, et est entrée en tête de la liste des tendances du modèle Hugging Face dès la première semaine, avec une augmentation rapide des stars et des téléchargements des plateformes associées. Le modèle utilise environ 1 milliard de paramètres, atteint ou est proche du niveau le plus récent sur plusieurs benchmarks publics OCR, et est simultanément lancé sur le site officiel du projet, les poids du modèle, la démonstration en ligne et le rapport technique complet, en mettant l’accent sur la combinaison de « haute précision et déploiement à faible coût ».
Basé sur l’architecture hybride multimodale, HunyuanOCR est composé d’un encodeur visuel et d’un modèle de langage léger, capable d’accomplir des tâches complexes telles que la détection et la reconnaissance de texte, l’analyse de documents, l’extraction d’informations, l’extraction de sous-titres vidéo et la traduction d’images en une seule connexion avant via des modules d’adaptation, et prend en charge des scénarios de mise en page multilingues et complexes. Dans le modèle ci-dessous du paramètre 3B, ce schéma met en avant l’équilibre entre puissance de calcul et efficacité, ce qui est pratique pour l’atterrissage dans le cloud et les dispositifs en périphérie.
Actuellement, HunyuanOCR a été publié sous forme open source sur plusieurs plateformes ouvertes, prenant en charge l’espace d’expérience en ligne, le code d’exemple d’inférence et les solutions de déploiement basées sur des cadres d’inférence haute performance, permettant aux développeurs d’intégrer rapidement dans des scénarios tels que la reconnaissance des tickets, la numérisation des contrats et des formulaires, la traduction localisée et la reconnaissance mobile du monde réel, offrant ainsi aux PME et aux développeurs individuels des capacités OCR multilingues plus accessibles.
FAQ
Q : Qu’est-ce que le HunyuanOCR ?
R : Il s’agit d’un modèle visuel OCR de bout en bout à 1 milliard de paramètres, lancé par Tencent Hunyuan, axé sur la reconnaissance de texte multilingue et la compréhension des documents, disponible en open source.
Q : Pourquoi est-on qualifié de « efficace et léger » ?
R : Comparé aux modèles multimodaux à plus grande échelle de paramètres, HunyuanOCR atteint un leader, voire proche, dans plusieurs benchmarks OCR avec seulement 1 milliard de paramètres, tout en réduisant significativement la demande en mémoire vidéo et en puissance de calcul.
Q : Quelles sont les façons de vivre l’expérience du HunyuanOCR aujourd’hui ?
R : Vous pouvez consulter l’introduction sur le site officiel du projet, télécharger les poids des modèles sur la plateforme open source, et télécharger directement des images pour tester l’effet de reconnaissance via l’espace de démonstration en ligne.
Q : Pour quels scénarios commerciaux convient-il principalement ?
R : Y compris la saisie de factures et de documents, l’analyse complexe de documents et de formulaires, la reconnaissance de texte Street View et de panneaux publicitaires, l’extraction de sous-titres vidéo et la traduction d’images multilingues, etc.
Q : Quels sont les points clés qui méritent d’être pris en compte dans le rapport technique ?
R : Le rapport se concentre sur la conception d’architecture de bout en bout, la composition des données d’entraînement et les stratégies de formation conjointes multitâches, ainsi que sur les résultats d’évaluation et les pratiques de déploiement sur plusieurs ensembles de données publics.