Le 1er octobre 2026, Jack Brody, directeur des produits de Suno, entreprise d'IA musicale, a annoncé sur le blog officiel que Speech (bêta), un nouveau modèle audio de voix parlée, sortait d'un mois de tests en petit groupe et s'ouvrait désormais à tous les utilisateurs. Suno le présente comme « le premier modèle audio qui génère la voix et la musique ensemble, en une piste cohérente » (the first audio model that generates voice and music together as one cohesive track).
En une prise : la voix et la bande-son ne sont plus deux étapes séparées
Speech s'utilise très simplement : on saisit un texte dans Suno — une idée, un poème, ou n'importe quel texte déjà écrit — puis on décrit la voix et le style musical souhaités, et le modèle produit une voix parlée habillée d'une musique de fond originale, fusionnées en une seule piste audio unifiée.
Jusqu'ici, réaliser une « lecture habillée de musique » demandait généralement trois étapes : d'abord synthétiser une voix sèche, puis trouver une musique adaptée, enfin mixer et synchroniser. Speech comprime ces trois étapes en une seule génération — la voix et la musique grandissent ensemble dès le départ, ce qui devrait en théorie rendre la jointure plus naturelle, tout en épargnant la chasse aux musiques sous licence et le travail de mixage.
Du « chant » à la « parole » : Suno déploie une autre toile
Pour comprendre Speech, il faut le replacer dans la feuille de route produit de Suno cette année. L'entreprise a démarré avec la génération musicale par IA et a lancé en mars, avec le modèle v5.5, la fonction de clonage de voix Voices ; Speech étend son territoire du « chant » vers la « parole ». Brody écrit sur le blog que la musique reste le cœur de Suno, mais que la vision de l'entreprise s'étend désormais à d'autres formes d'expression humaine — il qualifie Speech d'« autre toile » (another canvas) pour les créations de la communauté.
Les exemples officiels sont très terre-à-terre : transformer le SMS d'un ami en « lecture dramatique follement surproduite », habiller un banal message vocal d'une « bande-son inutilement épique », sans oublier des usages plus pratiques — méditations guidées, lectures de poèmes, discours d'encouragement et histoires du soir pour enfants. Suno regroupe cette demande sous l'étiquette « creative entertainment » (divertissement créatif), qui définira selon elle la prochaine vague des technologies grand public.
Qui s'en emparera en premier
Deux publics devraient en profiter d'abord : les créateurs de podcasts et de contenus audio, qui devaient jusqu'ici sourcer séparément voix et musiques pour intros, transitions et outros, et peuvent désormais les produire d'un coup dans un seul modèle ; et les créateurs de vidéos courtes et de réseaux sociaux, pour qui les « lectures dramatiques » façon mème semblent nées pour se propager. À condition, bien sûr, d'une qualité de génération stable — et Suno elle-même a pris ses précautions sur le blog.
Trois choses que l'annonce officielle n'a pas précisées
Trois choses n'ont pas été abordées dans le billet officiel. D'abord, les tarifs et les formules : le billet ne dit pas dans quels abonnements Speech est disponible ni ce que les utilisateurs gratuits peuvent en faire. Ensuite, les plateformes : aucune distinction d'usage entre le web et le mobile. Enfin — et c'est le point le plus important pour un modèle vocal — le billet ne dit rien des politiques d'autorisation des voix et de modération des contenus : d'où viennent les voix générées, quelle voix peut être imitée, quelles limites d'usage s'appliquent — rien n'est mentionné, hormis une clause de non-responsabilité de la bêta plaisantant sur le fait que « les accents britanniques s'égarent parfois jusqu'en Australie avant de revenir ».
Ces blancs ne signifient pas forcément un problème — livrer d'abord la fonctionnalité en bêta et compléter les politiques ensuite est un rythme courant. Mais pour les créateurs qui comptent utiliser Speech dans de vraies productions, jeter un œil aux dernières notes de version et aux règles de la communauté avant de se lancer reste le choix le plus sûr.