Sécurité et alignement de l'IA
Trop peu de refus et l'incident arrive ; trop de refus et plus personne n'utilise le modèle. La vraie difficulté a toujours été l'emplacement de la ligne, pas l'existence de garde-fous : modèles de garde, revue en flux et coût du sur-refus.
Trop peu de refus provoquent des incidents, trop en chassent les utilisateurs : la difficulté des garde-fous est le dosage. Qwen3Guard porte son taux de sécurité sur WildJailbreak de 64,7 à 98,1 par renforcement sécuritaire, capacités générales préservées ; OpenAI a réduit d'environ soixante pour cent les réponses indésirables des conversations sensibles. Le contre-exemple existe : Goody-2 refuse même l'arithmétique — un modèle qui ne sait dire que non est tout aussi inutilisable.