Si le modèle n'appelle que l'outil en tant que sortie de texte après que l'agent Hermes soit connecté au vLLM, ce n'est généralement pas Hermes qui n'est pas connecté, mais qu 'il y a moins de paramètres d'appel d'outil lors du démarrage du service vLLM. Par défaut, Hermes utilise __ CODE_INLINE_1__, et le côté vLLM est explicitement ouvert. Vérifiez d'abord la commande de démarrage
vllm serve meta-llama/Llama-3.1-70B-Instruct \ --port 8000 \ --max-model-len 65536 \ --enable-auto-tool-choice \ --tool-call-parser hermes Différents modèles doivent sélectionner l'analyseur correspondant. Les modèles de classe Hermes / Qwen sont couramment utilisés dans hermes, Llama 3.x est couramment utilisé dans llama3_json, DeepSeek, Mistral et d'autres parseurs pris en charge par vLLM.
--max-model-len Si la mémoire visuelle est dépassée, le service a échoué à démarrer. Si le modèle lui-même prend en charge les appels d'outils, les modèles non pris en charge peuvent être très instables.
Synopsis : L'outil vLLM ne fonctionne pas, complétez d'abord - - enable-auto - tool-choice et - - tool-call - parser correct.
Adresse source ouverte officielle :
https://github.com/NousResearch/hermes-agent; portail de documentation officiel :https://hermes-agent.nousresearch.com/. @
Comment déterminer si c'est un vLLM ou un problème de modèle
Tout d'abord, utilisez le même modèle pour demander directement/v1/chat/completions, avec un schéma d'outil le plus simple, voyez s'il y a des appels d'outils structurés dans le retour. Si la couche API ne renvoie que du texte normal, le problème réside probablement dans les capacités de l'analyseur ou du modèle vLLM ; si la couche API est normale et que l'exception est dans Hermes, vérifiez le point d'extrémité personnalisé, le nom du modèle, la longueur du contexte et le journal d'Hermes.