Fish Audio S2 Pro

5 milliards de paramètres · qualité potentiellement intéressante, mais très lent (sur le 4090)

Vérification… Higgs / Qwen3 / Fish ne tournent jamais ensemble : en démarrer un arrête les autres. Environ 13x plus lent que Higgs : prévois plusieurs minutes pour un court texte.
Coller du texte
Fichier PDF / DOCX
0 caracteres
Toute la bibliothèque (15 voix) est partagée avec Higgs : écouter le casting ↗
🎭 Intonations [entre crochets] : ça marche, mais il faut choisir
Fish comprend des indications de jeu entre crochets, écrites dans le texte (« [whisper] », « [excited] », « [pitch up] »...). Les balises elles-mêmes s'écrivent en anglais, mais elles agissent aussi bien sur un texte français que sur un texte anglais (vérifié à ton oreille). Elles ne sont jamais lues à voix haute. Mais elles ne fonctionnent qu'avec la voix « default » : dès qu'une voix nommée de la bibliothèque est utilisée, le style de la voix clonée écrase les indications et elles n'ont plus aucun effet. C'est toi qui as détecté le problème à l'oreille, puis qui as insisté pour qu'on trouve la configuration qui marche.

Le compromis, sans détour :
· Voix nommée (une des 15) : timbre choisi et identique d'un chapitre à l'autre, mais indications inertes. Pour une narration longue.
· Voix « default » (à choisir dans le menu Voix nommée ci-dessus) : indications actives, mais le timbre est tiré au hasard à chaque génération (homme ou femme, imprévisible). Pour un plan court où l'intonation compte plus que le timbre.
On ne peut pas avoir les deux à la fois pour l'instant. Une piste existe pour lever ce compromis (fixer le timbre de la voix par défaut), à explorer si tu en as besoin.
Ce n'est pas un défaut de notre installation : trois tickets officiels de Fish Audio (#1031, #1162, #1280) décrivent exactement ce comportement, y compris le timbre aléatoire sans référence, et ont tous été fermés sans correctif. La documentation du modèle l'explique même à demi-mot : une voix de référence transmet le timbre, le style et les tendances émotionnelles — nos références lisent un texte neutre, elles imposent donc une lecture neutre.
🔬 La solution qui semble tenir : une voix qui garde son identité ET son émotion
Le principe trouvé par le 4090, en trois temps : on fait dire à Fish un seul enregistrement contenant plusieurs passages balisés (exalté, triste, chuchoté). À l'intérieur d'une même génération, la voix ne change pas et les balises agissent. On découpe ensuite cet enregistrement en morceaux, et chaque morceau devient une voix de référence : une même personne, disponible en plusieurs humeurs. C'est le mécanisme qui nous bloquait (une référence transmet le timbre et la tendance émotionnelle) retourné en fonctionnalité.
1. L'enregistrement source (anglais) : une seule voix, trois émotions enchaînées grâce aux balises
2. La même phrase française, lue avec chacune des trois humeurs extraites ci-dessus. La question pour ton oreille : est-ce la même personne dans les trois, avec trois états d'âme différents ?
Humeur exaltée
Humeur triste
Chuchotement
Mes mesures indépendantes vont dans le bon sens : même registre de voix dans les trois (182 à 199 Hz), avec un vrai dégradé de volume conforme aux émotions (l'exalté est le plus fort, le chuchoté le plus doux). Les écarts de volume n'ont pas été corrigés exprès : ils font partie de ce qu'il faut juger.
Rien n'est encore acquis ni documenté comme méthode : c'est ton verdict qui décidera.
Deux pistes explorées et écartées, pour mémoire : les balises sans voix de référence fonctionnent, mais le timbre est alors tiré au hasard à chaque génération. Et le paramètre « seed » ne fixe pas une voix : il ne sert qu'à reproduire à l'identique une génération déjà faite (même texte et mêmes réglages donnent le même fichier au bit près), ce qui est utile pour refaire exactement un passage, mais ne donne pas une identité de personnage : changer un seul mot du texte change la voix.
🎬 Test grandeur nature : ton scénario « Avec Jeff, à moto »
5 répliques seulement (pas les 63 du scénario), en zéro-shot : aucune voix de référence, un seed fixe par personnage. Les balises ne sont posées que sur les indications de jeu qui ont un équivalent connu (chuchoté, surpris) ; le reste du texte est laissé tel quel.
Le test qui compte : même seed, même Nydia, deux jeux différents
Seed 18342 — [whisper] : « Un autre soir, elle m'a dit... » (lecture à mi-voix)
Même seed 18342 — [surprised] : « Je sais pas si je peux... »
À juger : est-ce la même Nydia dans les deux ? Le chuchoté et le surpris sonnent-ils justes ?
Jeff (seed 42891, sans balise) : « T'as l'air d'une fille sérieuse même quand tu danses. »
Gisèle (seed 27650, sans balise) : « J'ai rendez-vous avec Jean-Paul ce soir... »
Jackson (seed 71204, sans balise) : « Le fric ou j'te flingue, poulet. »
Verdict entendu : l'émotion passe bien dans les deux extraits de Nydia, mais ce n'est pas tout à fait la même voix d'un extrait à l'autre — le seed seul ne suffit pas à garantir l'identité. Jeff, Gisèle et Jackson sonnent chacun distincts. Voir juste en dessous la suite construite pour Nydia.
⚖️ Deuxième chance pour Higgs : mêmes répliques, comparaison directe
Higgs avait déçu à l'oreille ce matin, mais sur une phrase neutre de test. Contrairement à Fish, ses balises survivent au clonage d'une voix (mesuré : la hauteur de voix varie bien plus fortement ici, 134 à 240 Hz, qu'avec Fish et une référence). Voici les deux mêmes répliques de Nydia, dites cette fois par Higgs avec ta voix « voix_rad » — à comparer directement avec les versions Fish juste au-dessus.
Le poème à mi-voix, <|style:whispering|>, voix_rad — comparer à « fish_scenario_sample_000_nydia » plus haut
« Je sais pas si je peux... », <|emotion:surprise|>, voix_rad — comparer à « fish_scenario_sample_021_nydia » plus haut
La question n'est plus « est-ce mesurable ? » (oui, nettement), mais « est-ce que ça sonne juste, sur une vraie réplique dramatique ? » — c'est à ton oreille de trancher, pas aux chiffres.
🎯 Nydia construite : identité stable, mais l'émotion ne suit pas
Correction après ton écoute : les 4 extraits ci-dessous ont bien une voix stable (mesuré : 138-152 Hz, contre 130-200 Hz avec le seed seul), mais l'émotion ne s'entend pas — tu l'as détecté tout de suite. Cause identifiée : une fois qu'une voix de référence est fournie à Fish, elle supprime totalement l'effet des balises, y compris en les rappliquant explicitement ou en poussant les réglages du moteur. Ce n'est pas réglable via cette API : c'est une limite du modèle, pas un défaut de notre construction.
Neutre
« Chuchoté » (l'effet ne s'entend pas)
« Exaltée » (l'effet ne s'entend pas)
« Surprise » (l'effet ne s'entend pas)
Où ça nous laisse avec Fish : soit une identité stable avec une émotion quasi nulle (ci-dessus), soit une émotion forte mais une identité qui varie (les 5 échantillons du scénario, plus haut sur cette page) — jamais les deux ensemble avec ce moteur. Une piste reste à explorer : le système de balises d'Higgs, structurellement différent, pourrait ne pas souffrir du même problème. Rien n'est lancé de ce côté sans validation.
✓ L'autre levier, compatible avec les voix nommées : le texte lui-même
Fish lit le sens de ce que tu écris et adapte son jeu tout seul. Les cinq extraits ci-dessous ne contiennent aucune balise : même voix nommée, seul le texte change. C'est donc la seule façon d'obtenir de l'expression en gardant un timbre stable. Écoute la différence de débit, de douceur et d'intonation, puis juge si ça te suffit pour tes narrations.
« La réunion commence à quinze heures dans la salle du fond. Les documents sont sur la table, à côté de la fenêtre. »
Témoin neutre · 5,9 s
« Quelle journée magnifique ! Je n'ai jamais été aussi heureuse, c'est merveilleux ! »
Joie · 4,4 s — le débit le plus rapide des cinq
« Elle est partie pour toujours. Je ne la reverrai plus jamais, et cela me brise le cœur. »
Tristesse · 5,7 s — la plus douce et la plus mélodique
« Il y a quelqu'un derrière la porte. Ne fais pas de bruit, surtout ne bouge pas. »
Peur · 4,7 s
« Ça suffit ! Je ne le tolérerai pas une seconde de plus, sortez immédiatement d'ici ! »
Colère · 5,2 s
Comment s'en servir : écris ta narration comme tu veux l'entendre. Le vocabulaire, la ponctuation, les exclamations et la longueur des phrases sont tes vrais leviers — pas des balises techniques.
Précision honnête : les cinq rendus sont mesurablement différents les uns des autres (débit de 4,4 à 5,9 s, volume variant de 25 %), mais ce n'est pas une échelle bien rangée autour du témoin neutre. Le moteur réagit au texte, il ne dose pas une « intensité d'émotion ». À ton oreille de dire si l'effet est suffisant.