Retour à L’IA est open source
DeepSeek-OCR 2 publié : Le flux causal visuel rend la reconnaissance de documents et de diagrammes plus « humaine »

DeepSeek-OCR 2 publié : Le flux causal visuel rend la reconnaissance de documents et de diagrammes plus « humaine »

L’IA est open source Admin 198 vues

1. Résumé

DeepSeek-OCR 2 est une mise à niveau du modèle open source d’OCR/compréhension des documents de DeepSeek, avec pour thème « DeepSeek-OCR 2 : Flux causal visuel », mettant l’accent sur une méthode de codage visuel plus conviviale pour l’humain et offrant des capacités structurées d’extraction et de compréhension plus solides pour des mises en page complexes (documents, graphiques, pages mixtes, etc.). Le dépôt officiel et la carte modèle proposent deux chemins d’inférence, Transformers et vLLM, et fournissent des modèles d’invite tels que « convertir des documents en Markdown », « OCR d’image » et « positionnement de cible ».

2. Caractéristiques principales

  1. Direction du flux causal visuel : officiellement décrite comme un codage visuel plus « humanisé » ; Certaines interprétations résument cela comme une organisation visuelle de jetons plus conforme à la logique sémantique/typographique (des détails spécifiques de l’algorithme sont recommandés pour lire le PDF de l’article fourni avec le dépôt).
  2. Résolution dynamique et budget de jetons : La résolution dynamique est prise en charge, et l’exemple de configuration par défaut est une combinaison de plusieurs blocs de 768×768 + 1 bloc de 1024×1024, correspondant à un budget visuel fixe de jetons (l’exemple officiel est d’environ 256 jetons), ce qui est pratique pour faire des compromis entre vitesse, mémoire vidéo et précision.
  3. Sortie structurée pour les documents : L’exemple d’invite intégré prend en charge « Convertir le document en markdown », ce qui convient à la conversion de documents PDF/image en texte modifiable et en structure légère.
  4. Positionnement et compréhension générale : L’exemple de prompt contient la reconnaissance (localisation d’un objet de référence) et une description générale, ce qui signifie qu’il ne s’agit pas seulement de « lecture de mots », mais peut aussi être utilisé pour comprendre et récupérer dans des scénarios mixtes de graphiques et de textes.

3. Installation

  1. Suggestions d’environnement : L’environnement de test officiel est CUDA 11.8 + PyTorch 2.6.0, Python 3.12.9.

2. Inférence du transformateur : Chargez deepseek-ai/DeepSeek-OCR-2 directement depuis Hugging Face, et recommandez d’activer FlashAttention (l’exemple est flash-attn==2.7.3) avec inférence bfloat16.

  1. inférence vLLM : Le dépôt fournit des instructions et scripts liés aux vLLM, incluant la sortie en streaming d’images, le traitement concurrent PDF et les scripts d’évaluation par lots de benchmark. Des paramètres tels que les chemins d’entrée/sortie doivent être modifiés par fichier de configuration.

4. Cas d’usage typiques

  1. Document to Markdown : copies numérisées, documents, manuels et autres images/pages, exportation en un clic de Markdown pour une édition et récupération secondaires.
  2. OCR de mise en page complexe : Pour les scénarios où le OCR traditionnel est sujet au désordre, comme les tableaux, les graphiques et textes mixtes, et les annotations de diagrammes de flux, essayez d’utiliser des invites « avec mise en page/mise à la terre » pour obtenir une structure plus stable.
  3. Analyse de diagrammes et illustrations : analyse séparée des figures dans les documents, adaptée à la construction de bases de connaissances et à l’automatisation des rapports.
  4. Positionnement cible et citation : Utilisez des invites de positionnement pour trouver des éléments (comme une étiquette, un bouton ou une zone) dans le diagramme pour la revue des documents, l’annotation des données et l’inspection automatique de la qualité.

5. Écologie et produits concurrents

  1. Écologie : Les poids des modèles sont publiés sur Hugging Face, et le dépôt fournit des scripts d’inférence et des entrées de traitement concurrent PDF, ce qui est pratique pour accéder aux pipelines hors ligne ou au déploiement orienté services.
  2. Produits/références concurrents : Des projets tels que Vary, GOT-OCR2.0, MinerU et PaddleOCR apparaissent dans les liens officiels de réception et de benchmarking, qui peuvent être utilisés comme objets de comparaison dans les dimensions de « vitesse, restauration de la mise en page, contrôlabilité open source et coût de déploiement ».
  3. Suggestions de sélection : Si vous faites attention à « Document Structured Output (Markdown) + Simultan Batch Processing (PDF) + Unified Multimodal Prompt », l’entrée du projet DeepSeek-OCR 2 est plus proche de la chaîne d’assemblage. Si vous préférez les moteurs OCR traditionnels et le post-traitement des règles, des écosystèmes comme PaddleOCR/MinerU sont plus matures.

6. Limitations et précautions

  1. Les détails de l’article doivent être vérifiés : la base de données fournit un PDF de l’article, mais la carte modèle/README est plus restrictive dans la description des détails de l’algorithme. Il implique des mécanismes clés tels que le « flux causal visuel/organisation dynamique », et il est recommandé de se référer à l’article et à l’implémentation du code.
  2. Mémoire vidéo et débit : La résolution dynamique et le budget visuel des jetons affectent directement l’utilisation et la vitesse de la mémoire vidéo, il est donc recommandé d’utiliser une vérification en petits lots avant la concurrence.
  3. Prompts dépendants de la qualité de sortie : Pour le même document, « OCR gratuit », « Conversion de markdown avec mise à la terre » et « analyse de chiffres » obtiendront des résultats de granularité différente, et il est recommandé de solidifier le modèle de prompt et l’ensemble d’évaluation pour l’entreprise.
  4. Les documents complexes doivent encore être relus : pour les formules mathématiques, la composition extrême et les scans basse définition, il est toujours recommandé de vérifier manuellement ou d’introduire un processus de vérification secondaire.

7. Adresse du projet

https://github.com/deepseek-ai/DeepSeek-OCR-2

8. Questions fréquemment posées

Q : Quels sont les mots-clés clés de DeepSeek-OCR 2 ? Que signifie exactement le flux causal visuel ?

R : Officiellement, il est décrit comme une direction plus « humaine » du codage visuel ; Pour des mécanismes plus spécifiques, l’implémentation du PDF papier et du code du dépôt prévaudra.

Q : Comment DeepSeek-OCR 2 convertit-il les documents image en Markdown ?

R : Utilisez l’exemple de l’invite <image>\n<|grounding|>Convert the document to markdown. et appelez model.infer(...) car l’exemple est envoyé dans le répertoire spécifié.

Q : DeepSeek-OCR 2 supporte-t-il l’exécution par lots de PDF ?

R : Oui. Le dépôt fournit au vLLM une entrée de script de concurrence PDF et invite à modifier des paramètres tels que les chemins d’entrée/sortie dans le fichier de configuration.

Q : Quelle est la licence open source pour DeepSeek-OCR 2 ? Peut-on le commercialiser ?

R : Le dépôt et la carte modèle sont marqués comme Apache-2.0 ; Il est toujours recommandé de vérifier la liste des licences une fois en fonction de votre méthode de distribution et de vos dépendances.

Q : Comment la résolution dynamique et le budget visuel des jetons influencent-ils la performance ?

R : Une résolution plus élevée ou un segment plus élevé est généralement plus propice à des configurations complexes, mais elle est aussi plus gourmande en mémoire/plus lente ; Il est recommandé de réaliser un test de courbe « vitesse-précision » autour du type de document avant de finaliser.

Mise à jour open source DeepSeek DeepSeek-OCR 2 : Visual Causal Flow améliore la compréhension documentaire Sortie de DeepSeek-OCR 2 : Les capacités d’extraction structurée pour des configurations complexes ont été grandement améliorées DeepSeek-OCR 2 Explication : Pourquoi le flux causal visuel ressemble davantage au codage visuel humain DeepSeek-OCR 2 prend en charge le transfert de document vers Markdown : les images PDF peuvent être modifiées en un seul clic DeepSeek-OCR 2 lance la résolution dynamique : comment équilibrer vitesse et précision mémoire DeepSeek-OCR 2 donne un exemple d’un budget de 256 jetons visuels : quel est le coût d’un débit accru ? DeepSeek-OCR 2 propose deux voies d’inférence : transformateurs et vLLM : déploiement plus flexible Les scripts vLLM DeepSeek-OCR 2 prennent en charge le traitement PDF simultané : l’OCR par lots de pipeline est plus simple DeepSeek-OCR 2 ajoute la recommandation d’invite de positionnement : non seulement lire les mots, mais aussi trouver des cibles DeepSeek-OCR 2 adapte les graphiques et les pages de mélange : les points sensibles de l’OCR traditionnel hors ordre sont ciblés Modèle d’annonce de carte modèle DeepSeek-OCR 2 : la mise à la terre rend la structure plus stable Points forts de l’ingénierie DeepSeek-OCR 2 : Sortie complète d’images et scripts d’évaluation batch Exposition à l’environnement d’installation DeepSeek-OCR 2 : CUDA 11.8 + PyTorch 2.6.0 est la combinaison recommandée DeepSeek-OCR 2 recommande d’activer FlashAttention : Accélérer l’inférence, mais soyez prudent lorsque vous êtes compatible DeepSeek-OCR 2 utilise bfloat16 pour raisonner : la pression de la mémoire vidéo diminue, mais quelle est l’efficacité DeepSeek-OCR 2 convertit les scans en markdown : comment l’efficacité de la construction de bases de connaissances s’améliore OCR complexe de table DeepSeek-OCR 2 : Une sortie structurée peut-elle réduire le post-traitement ? Analyse de l’organigramme et annotation DeepSeek-OCR 2 : la compréhension du document passe du texte à la mise en page Analyse syntaxique séparée de DeepSeek-OCR 2 : un nouveau point d’entrée pour l’automatisation des rapports Ciblage et citation de DeepSeek-OCR 2 : la revue des documents et l’inspection qualité sont plus contrôlables DeepSeek-OCR 2 Open Source Apache-2.0 : La conformité commerciale nécessite toujours une liste de licences Le PDF papier DeepSeek-OCR 2 est fourni avec le dépôt : les détails de l’algorithme sont soumis au code Controverse autour de l’algorithme DeepSeek-OCR 2 : description de la contrainte README et lacunes dans les détails reproductibles DeepSeek-OCR 2 découpage dynamique 768x768+1024x1024 : La mauvaise configuration va-t-elle se renverser ? L’invite DeepSeek-OCR 2 détermine la qualité de sortie : quelle est la différence entre l’OCR libre et la mise à la terre ? La sortie DeepSeek-OCR 2 doit encore être revue : la composition extrême des formules et le balayage basse définition est une difficulté Guide d’évaluation du débit DeepSeek-OCR 2 : L’envoi de PDF en petits lots est plus stable pour la concurrence DeepSeek-OCR 2 convient aux pipelines hors ligne : Markdown structuré + intégration du traitement batch Points clés du déploiement basé sur les services DeepSeek-OCR 2 : Ne pas négliger la configuration des chemins et l’isolement des permissions DeepSeek-OCR 2 vs. PaddleOCR : Qui est le plus fort en termes de maturité du moteur de règles et de capacité de structuration ? DeepSeek-OCR 2 vs. MinerU : comment choisir les coûts contrôlables en open source et de déploiement Benchmarks DeepSeek-OCR 2 GOT-OCR2.0 et Vary : Où se situe la différence dans la voie de restauration de la disposition ? Inventaire de l’écosystème DeepSeek-OCR 2 : Poids du visage en étreinte + script GitHub rapidement implémenté Exemple public de l’invite DeepSeek-OCR 2 : Comment utiliser Convertir le document en markdown DeepSeek-OCR 2 Chargement de deepseek-ai/DeepSeek-OCR-2 avec Transformers : Plus facile à démarrer PDF concurrent DeepSeek-OCR 2 vLLM : Comment changer le chemin d’entrée et de sortie du fichier de configuration Sortie en streaming d’images DeepSeek-OCR 2 : que signifie l’OCR en temps réel pour les produits interactifs Mélange ciblé par extraction structurée DeepSeek-OCR 2 : Le nettoyage des données RAG des documents est plus léger Recommandation de capacité de positionnement DeepSeek-OCR 2 : annotation de données plus efficace et inspection automatique de la qualité DeepSeek-OCR 2 Visual Token Budget Contrôlable : Comment tracer la courbe de coût DeepSeek-OCR 2 humanise le codage visuel : pourquoi comprendre la typographie complexe est important DeepSeek-OCR 2 transforme l’OCR en compréhension documentaire : de la reconnaissance aux points de mise à niveau structurés Recommandation pratique DeepSeek-OCR 2 : Corriger le modèle de prompt et l’ensemble d’évaluation pour éviter la dérive Avertissement de risque DeepSeek-OCR 2 : Les tentatives d’échec simultanées doivent d’abord être combinées avec le système de journal Coût de déploiement de DeepSeek-OCR 2 : comment estimer la bande passante mémoire et le débit Liste des scénarios applicables pour DeepSeek-OCR 2 : Convertir les spécifications papier et les copies numérisées en texte modifiable Capacité d’interprétation de cartes DeepSeek-OCR 2 : un élément clé de la base de connaissances et de la génération de rapports Derrière la mise à jour open source DeepSeek-OCR 2 : la production structurée de documents devient un nouveau champ de bataille Commencez avec DeepSeek-OCR 2 : trois prompts couvrent le Markdown OCR et le positionnement Analyse complète de DeepSeek-OCR 2 : Script d’ingénierie de la résolution dynamique du flux causal visuel et des limites

Outils Recommandés

Plus