1. Résumé
DeepSeek-OCR 2 est une mise à niveau du modèle open source d’OCR/compréhension des documents de DeepSeek, avec pour thème « DeepSeek-OCR 2 : Flux causal visuel », mettant l’accent sur une méthode de codage visuel plus conviviale pour l’humain et offrant des capacités structurées d’extraction et de compréhension plus solides pour des mises en page complexes (documents, graphiques, pages mixtes, etc.). Le dépôt officiel et la carte modèle proposent deux chemins d’inférence, Transformers et vLLM, et fournissent des modèles d’invite tels que « convertir des documents en Markdown », « OCR d’image » et « positionnement de cible ».
2. Caractéristiques principales
- Direction du flux causal visuel : officiellement décrite comme un codage visuel plus « humanisé » ; Certaines interprétations résument cela comme une organisation visuelle de jetons plus conforme à la logique sémantique/typographique (des détails spécifiques de l’algorithme sont recommandés pour lire le PDF de l’article fourni avec le dépôt).
- Résolution dynamique et budget de jetons : La résolution dynamique est prise en charge, et l’exemple de configuration par défaut est une combinaison de plusieurs blocs de 768×768 + 1 bloc de 1024×1024, correspondant à un budget visuel fixe de jetons (l’exemple officiel est d’environ 256 jetons), ce qui est pratique pour faire des compromis entre vitesse, mémoire vidéo et précision.
- Sortie structurée pour les documents : L’exemple d’invite intégré prend en charge « Convertir le document en markdown », ce qui convient à la conversion de documents PDF/image en texte modifiable et en structure légère.
- Positionnement et compréhension générale : L’exemple de prompt contient la reconnaissance (localisation d’un objet de référence) et une description générale, ce qui signifie qu’il ne s’agit pas seulement de « lecture de mots », mais peut aussi être utilisé pour comprendre et récupérer dans des scénarios mixtes de graphiques et de textes.
3. Installation
- Suggestions d’environnement : L’environnement de test officiel est CUDA 11.8 + PyTorch 2.6.0, Python 3.12.9.
2. Inférence du transformateur : Chargez deepseek-ai/DeepSeek-OCR-2 directement depuis Hugging Face, et recommandez d’activer FlashAttention (l’exemple est flash-attn==2.7.3) avec inférence bfloat16.
- inférence vLLM : Le dépôt fournit des instructions et scripts liés aux vLLM, incluant la sortie en streaming d’images, le traitement concurrent PDF et les scripts d’évaluation par lots de benchmark. Des paramètres tels que les chemins d’entrée/sortie doivent être modifiés par fichier de configuration.
4. Cas d’usage typiques
- Document to Markdown : copies numérisées, documents, manuels et autres images/pages, exportation en un clic de Markdown pour une édition et récupération secondaires.
- OCR de mise en page complexe : Pour les scénarios où le OCR traditionnel est sujet au désordre, comme les tableaux, les graphiques et textes mixtes, et les annotations de diagrammes de flux, essayez d’utiliser des invites « avec mise en page/mise à la terre » pour obtenir une structure plus stable.
- Analyse de diagrammes et illustrations : analyse séparée des figures dans les documents, adaptée à la construction de bases de connaissances et à l’automatisation des rapports.
- Positionnement cible et citation : Utilisez des invites de positionnement pour trouver des éléments (comme une étiquette, un bouton ou une zone) dans le diagramme pour la revue des documents, l’annotation des données et l’inspection automatique de la qualité.
5. Écologie et produits concurrents
- Écologie : Les poids des modèles sont publiés sur Hugging Face, et le dépôt fournit des scripts d’inférence et des entrées de traitement concurrent PDF, ce qui est pratique pour accéder aux pipelines hors ligne ou au déploiement orienté services.
- Produits/références concurrents : Des projets tels que Vary, GOT-OCR2.0, MinerU et PaddleOCR apparaissent dans les liens officiels de réception et de benchmarking, qui peuvent être utilisés comme objets de comparaison dans les dimensions de « vitesse, restauration de la mise en page, contrôlabilité open source et coût de déploiement ».
- Suggestions de sélection : Si vous faites attention à « Document Structured Output (Markdown) + Simultan Batch Processing (PDF) + Unified Multimodal Prompt », l’entrée du projet DeepSeek-OCR 2 est plus proche de la chaîne d’assemblage. Si vous préférez les moteurs OCR traditionnels et le post-traitement des règles, des écosystèmes comme PaddleOCR/MinerU sont plus matures.
6. Limitations et précautions
- Les détails de l’article doivent être vérifiés : la base de données fournit un PDF de l’article, mais la carte modèle/README est plus restrictive dans la description des détails de l’algorithme. Il implique des mécanismes clés tels que le « flux causal visuel/organisation dynamique », et il est recommandé de se référer à l’article et à l’implémentation du code.
- Mémoire vidéo et débit : La résolution dynamique et le budget visuel des jetons affectent directement l’utilisation et la vitesse de la mémoire vidéo, il est donc recommandé d’utiliser une vérification en petits lots avant la concurrence.
- Prompts dépendants de la qualité de sortie : Pour le même document, « OCR gratuit », « Conversion de markdown avec mise à la terre » et « analyse de chiffres » obtiendront des résultats de granularité différente, et il est recommandé de solidifier le modèle de prompt et l’ensemble d’évaluation pour l’entreprise.
- Les documents complexes doivent encore être relus : pour les formules mathématiques, la composition extrême et les scans basse définition, il est toujours recommandé de vérifier manuellement ou d’introduire un processus de vérification secondaire.
7. Adresse du projet
https://github.com/deepseek-ai/DeepSeek-OCR-2
8. Questions fréquemment posées
Q : Quels sont les mots-clés clés de DeepSeek-OCR 2 ? Que signifie exactement le flux causal visuel ?
R : Officiellement, il est décrit comme une direction plus « humaine » du codage visuel ; Pour des mécanismes plus spécifiques, l’implémentation du PDF papier et du code du dépôt prévaudra.
Q : Comment DeepSeek-OCR 2 convertit-il les documents image en Markdown ?
R : Utilisez l’exemple de l’invite <image>\n<|grounding|>Convert the document to markdown. et appelez model.infer(...) car l’exemple est envoyé dans le répertoire spécifié.
Q : DeepSeek-OCR 2 supporte-t-il l’exécution par lots de PDF ?
R : Oui. Le dépôt fournit au vLLM une entrée de script de concurrence PDF et invite à modifier des paramètres tels que les chemins d’entrée/sortie dans le fichier de configuration.
Q : Quelle est la licence open source pour DeepSeek-OCR 2 ? Peut-on le commercialiser ?
R : Le dépôt et la carte modèle sont marqués comme Apache-2.0 ; Il est toujours recommandé de vérifier la liste des licences une fois en fonction de votre méthode de distribution et de vos dépendances.
Q : Comment la résolution dynamique et le budget visuel des jetons influencent-ils la performance ?
R : Une résolution plus élevée ou un segment plus élevé est généralement plus propice à des configurations complexes, mais elle est aussi plus gourmande en mémoire/plus lente ; Il est recommandé de réaliser un test de courbe « vitesse-précision » autour du type de document avant de finaliser.