1. Qu’est-ce que ChatRTX
? Pour faire simple, ChatRTX est une application de chat RAG native lancée par NVIDIA : construisez une base de données de vos documents, notes, images et autres contenus, et coopérez avec de grands modèles de langage pour récupérer et améliorer les réponses. Il est basé sur les microservices TensorRT-LLM et NIM et accéléré par les cartes graphiques RTX, fournissant des réponses plus rapides et plus privées, ce qui est plus contrôlable que le transfert de données vers le cloud.
- Discutez avec vos fichiers : Pointez TXT, PDF, DOC/DOCX et d’autres fichiers dans un dossier, et créez rapidement une bibliothèque pour les questions-réponses.
- Dialogue vocal : Reconnaissance vocale intégrée, appuyez sur le microphone pour parler directement afin de générer du texte, puis remettez-le au modèle pour les réponses.
- Récupération d’images : prise en charge de la recherche par contenu dans les albums locaux par texte ou par voix.
- Modèles et microservices : Téléchargeables pour utiliser plusieurs modèles NIM (tels que Llama 3.1 8B, etc.) et accélérer l’inférence sur RTX.
2. Qui a le plus besoin de ChatRTX
1. Des personnes et des équipes de contenu basées sur les connaissances
Si vous devez feuilleter un grand nombre de PDF et de Word chaque jour, ChatRTX peut transformer « la recherche de paragraphes, la localisation de sources et les résultats d’orthographe » en une conversation. Par exemple, mettez les rapports dans le même dossier et demandez « donnez l’évolution de la marge bénéficiaire brute de l’entreprise A au cours des trois dernières années et marquez le paragraphe source ».
2. Utilisateurs de la conformité des données dans l’entreprise
Lorsquevos documents ne peuvent pas être migrés vers le cloud en raison de restrictions de conformité, le RAG local est particulièrement adapté. ChatRTX laisse à la fois l’inférence et la récupération sur l’appareil, réduisant ainsi le risque de fuite de données.
3. Organisateur d’images et de données multimédias
Besoin de trouver rapidement des matériaux « avec des chats » et « d’extérieur » dans la pile d’images ? La recherche d’images peut filtrer directement les candidats, et peut également lancer une recherche vocale, ce qui est plus efficace.
3. Les fonctionnalités de ChatRTX
1. RAG vraiment « local »
Toutes les récupérations, intégrations et inférences sont effectuées sur Windows ; Avec l’accélération RTX, la latence des questions-réponses est faible et la confidentialité est contrôlable. Par rapport au cloud RAG, il ne repose pas sur les limites d’extranet et de compte.
2. Microservices NIM et optimisation RTX
: Prend en charge le téléchargement de microservices de modèle optimisés par RTX (tels que Llama 3.1 8B NIM, CLIP modèle de vision, etc.), et vous pouvez les basculer dans l’application après l’installation ; Le modèle par défaut est suffisamment stable pour les questions-réponses générales et la récupération.
3. Intégration de la voix et de l’image L’entrée
vocale est plus proche des scénarios d’utilisation naturels ; Le côté image peut rechercher l’album par sémantique, et la sélection/révision des images est beaucoup plus rapide que de les tourner une par une.
4. Charges
Version gratuite :
- Fonctions incluses : téléchargement gratuit du corps de l’application ; Q&A local sur le rag, saisie vocale, récupération d’images, téléchargement et accélération du modèle NIM.
- Restrictions d’utilisation : La fonction est positionnée comme une « démonstration technique », et les fonctionnalités seront ajustées avec l’itération de la version. Pour la première installation, vous devez télécharger plus de dépendances et de fichiers de modèle.
- Convient pour : les utilisateurs individuels, les pilotes d’équipe, l’exploration de la conformité locale.
Seuil matériel/système (égal au « coût caché ») :
- GPU : GeForce RTX série 30/40 (≥ 8 Go de VRAM) ou RTX 5090/5080 ; des spécifications supérieures (par exemple, 4080/4090 ou des cartes professionnelles supérieures) sont requises pour certains NIM.
- Système : Windows 11 (23H2/24H2), les exigences de version du pilote sont plus récentes.
- Espace disque : Il est recommandé de réserver environ 70 Go ; Selon le modèle choisi, le processus d’installation télécharge généralement environ 50 Go de ressources supplémentaires.
- Coût en temps : Les directives officielles donnent un intervalle d’installation d’environ 10 à 30 minutes (en fonction de la vitesse du réseau et de la charge du serveur).
Ma suggestion :
- Individuel/petite équipe : Utilisez le modèle par défaut pour exécuter d’abord le processus, confirmez l’effet RAG, puis envisagez de télécharger un modèle plus grand.
- Entreprises : utilisez ChatRTX comme un « prototype RAG local », utilisez-le pour vérifier la confidentialité et la latence, puis décidez d’utiliser ou non la même pile technologique pour passer à la production.
5. Compétences pratiques
1. Petite collection d’abord - puis grande base de données
Mettez les informations les plus fréquemment vérifiées dans un « dossier essence » séparé, construisez d’abord une petite base de données pour tester l’effet de récupération, confirmer la qualité du rappel, puis élargissez l’ensemble de la base de connaissances, ce qui peut réduire considérablement les vecteurs invalides et le temps d’attente.
2. Plus la question est précise, plus la réponse RAG
est bonne pour « vérifier les points plutôt que l’ensemble du livre ». Au lieu de demander « résumez l’intégralité du livre blanc », il est préférable de demander « énumérez les trois restrictions sur le produit A dans le chapitre 2 du livre blanc avec les numéros de page ». Le taux de réussite et la qualité des citations seront plus élevés.
3. Gérer les disques et les modèles La
désinstallation d’applications ne signifie pas la libération de l’occupation des modèles. Vous devez nettoyer séparément les dossiers liés au NIM. Avant de télécharger, vérifiez l’espace requis pour chaque modèle afin d’éviter d'"exploser à mi-chemin ».
6. Comparez des outils similaires
- Comparez n’importe quoiLLM/LM Studio (écosystème local) : ChatRTX est meilleur que l’accélération RTX et la chaîne d’optimisation officielle, et il peut être utilisé prêt à l’emploi ; AnythingLLM/LM Studio est plus adapté aux joueurs profonds en termes de sélection de modèles, de multiplateforme et de jouabilité.
- Comparez le RAG du cloud (comme les outils de base de connaissances en ligne) : le cloud est sans matériel et collaboratif, mais la confidentialité et la bande passante sont des points sensibles ; ChatRTX conserve les données locales, avec une faible latence et une confidentialité élevée.
- Par rapport au RAG auto-construit Ollama+ : le RAG auto-construit a la plus grande flexibilité, mais la configuration est complexe et facile à piétiner ; ChatRTX utilise une interface visuelle pour enchaîner la recherche, l’intégration et le raisonnement, ce qui convient mieux aux équipes qui ne veulent pas se lancer.
Dans l’ensemble, ChatRTX est le mieux adapté aux scénarios de récupération et d’écriture de connaissances locales axés sur la confidentialité et la faible latence : les chercheurs, les consultants, les étudiants en droit, en produits et en opérations peuvent en bénéficier immédiatement.
7. Résumé
ChatRTX est un outil d’IA qui connecte « les données locales → la base de connaissances du chat ». Il est a trouvé un équilibre entre
- la localisation et la conformité : essayer en priorité ;
- Travailleurs de documents lourds : utilisez d’abord le « Dossier Essence » pour tester la qualité du rappel ;
- Pour un modèle plus puissant : Téléchargez un NIM plus grand étape par étape, en faisant attention à la version du disque et du pilote.
- Enfin, rappel : il s’agit d’une application de démonstration technique de positionnement, et la version est en cours d’itération ; Avant de lancer des services clés, assurez-vous d’effectuer une série de tests de régression de « précision-latence-stabilité-occupation de l’espace ».
Foire aux questions Q :
ChatRTX doit-il être connecté à Internet et va-t-il télécharger des fichiers ?
R : La récupération et la génération de cœurs sont effectuées localement, et les données restent locales par défaut. Pendant la phase d’installation, les dépendances et les fichiers de modèle sont téléchargés à partir de sources officielles, vous n’avez donc pas besoin de télécharger vos documents sur le cloud.
Q : Mon ordinateur peut-il exécuter ChatRTX ?
R : Windows 11 avec des pilotes plus récents est requis ; Pour les cartes graphiques, la série RTX 30/40 (≥ 8 Go de VRAM) ou RTX 5080/5090 est recommandée. Si vous prévoyez d’utiliser des microservices NIM, les spécifications de la carte graphique sont plus exigeantes.
Q : Pourquoi la première installation est-elle si longue et l’espace si grand ?
R : Il est nécessaire de télécharger des ressources telles que des modèles et des moteurs d’accélération en une seule fois, donc la recommandation officielle est de réserver environ 70 Go d’espace, et le volume de téléchargement réel est d’environ 50 Go, ce qui prend généralement 10 à 30 minutes à installer (en fonction de la vitesse du réseau et de la charge d’image).
Q : Qu’en est-il du soutien chinois ? Pouvez-vous exprimer ?
A : Version facultative du modèle chinois pour le texte chinois Q&A ; La reconnaissance vocale est actuellement principalement en anglais, et certains modèles chinois ne fournissent pas de boutons de saisie vocale.
Q : Que dois-je faire si je ne trouve pas un paragraphe ?
R : Le RAG est meilleur pour les « problèmes spécifiques ». Essayez de réduire la portée (en spécifiant des chapitres/périodes/mots-clés), ou de reconstruire la bibliothèque vectorielle en mettant des informations très pertinentes dans un dossier séparé, et le taux de réussite sera considérablement amélioré.