Basiquement, c'est ce genre de chose que je cherches.
Dans les outils de TTS que j'ai regarde le probleme de base est qu'il n'y a pas de facon de mettre de l'emphase sur la voix genere.
Si j'ecris:
"Il y a deux facons de faire ca." ou "Il y a DEUX facons de faire ca."
C'est clairement different.
J'ai pas trouve un seul moteur de TTS qui sache rendre un truc comme ca. Le moteur de TTS de google est celui qui est tle plus proche ( https://cloud.google.com/text-to-speech ). Il supporte de prendre ce qu'il faut dire au format SSML. SSML permet d'exprimer de l'emphase, de fournir le texte a partir de phoneme, ce genre de chose. Il et supporte des chose comme les pause. Mais il ignore completement les markeurs d'emphase par exemple.
Amazon Polly a l'air un peu mieux. En particulier il permet d'exporter les metadonne pour synchroniser un avatar potentiellement.
Mais j'ai pas bien vu cmment faire la synchro avec l'avater bien encore.
Je me demandais si j'avais loupe un truc evident...