📚 Série · Les familles de modèles en IA

Modèles audio : de la voix au texte, et retour

Modèles audio : de la voix au texte, et retour

Cinquième famille du dossier sur IA : LLM, VLM, OCR... le panorama des familles de modèles : les modèles audio. Deux directions opposées, qui reposent souvent sur des architectures très différentes malgré un point commun : faire le pont entre la voix et le texte.

Speech-to-text : transformer la voix en texte

Whisper d’OpenAI reste la référence la plus connue. C’est un modèle transformer encodeur-décodeur, entraîné sur 680 000 heures de parole en supervision faible, capable de faire de la transcription, de la traduction voix vers texte, et de l’identification de langue sur une centaine de langues simultanément1. Il existe en plusieurs tailles (tiny à large), pour arbitrer entre vitesse et précision selon le contexte de déploiement1.

Le paysage 2026 s’est diversifié autour de plusieurs profils d’usage4 :

  • Whisper : le généraliste multilingue, solide mais pas le plus rapide.
  • NVIDIA Parakeet : optimisé pour la vitesse d’inférence en temps réel (jusqu’à 6,5 fois plus rapide que des modèles concurrents), via une architecture RNN-Transducer adaptée au streaming4.
  • Les modèles légers type Moonshine : pensés pour tourner sur smartphone ou objet connecté, hors-ligne, là où la connectivité ou la confidentialité posent problème4.

Text-to-speech : redonner une voix au texte

Dans l’autre sens, un modèle TTS transforme du texte en parole. Les modèles récents ne se contentent plus de “lire” un texte de façon monotone : ils ajustent la prosodie (rythme, intonation, pauses) en fonction du contexte émotionnel du contenu. Voxtral TTS de Mistral AI, lancé en mars 2026, illustre bien cette évolution : ce modèle de 4 milliards de paramètres interprète le contexte émotionnel pour ajuster automatiquement le ton, sans réglage manuel, un message de service client ne sonnant pas comme une annonce enthousiaste2.

Les architectures varient : certains modèles combinent génération auto-régressive et flow-matching2, d’autres s’appuient sur des architectures de type diffusion transformer pour un rendu naturel et une bonne similarité de voix sur des styles de parole variés3. Le contrôle fin de la prosodie va parfois jusqu’à accepter des instructions en langage naturel directement dans le texte à lire, comme “[chuchote]” ou “[excité et rapide]”, pour un contrôle expressif qui dépasse largement une simple liste de balises prédéfinies3.

flowchart LR
    A[Voix] --> B[Speech-to-text<br/>Whisper, Parakeet...]
    B --> C[Texte]
    C --> D[Text-to-speech<br/>Voxtral, Fish Audio...]
    D --> E[Voix générée,<br/>prosodie ajustée]

Pourquoi c’est directement pertinent pour mon projet

C’est la brique centrale de mon appli de contes narrés pour enfants : un SLM : les petits modèles de langage qui tournent sans le cloud génère l’histoire en local, puis un modèle TTS expressif lui donne une voix vivante, sans dépendre d’une connexion internet. Le choix du modèle TTS conditionne directement la qualité perçue par l’enfant : une voix plate casse l’immersion bien plus vite qu’un texte imparfait.

Les points d’attention

  • Le clonage vocal : plusieurs modèles TTS récents savent cloner une voix à partir d’un échantillon audio très court, ce qui pose des questions évidentes de consentement et d’usage abusif (deepfakes vocaux).
  • Le compromis vitesse/qualité : un modèle temps réel (type Parakeet) sacrifie un peu de précision pour la latence, pertinent pour du sous-titrage en direct mais moins pour une transcription qui doit être fidèle au mot près.
  • L’embarqué : pour un usage hors-ligne (comme mon appli Android), il faut arbitrer entre des modèles compacts, qui tournent sur le téléphone, et des modèles serveur plus qualitatifs mais qui nécessitent une connexion.

Sources

  1. End-to-End Transformer ASR (Whisper) - arXivarxiv.org
  2. Voxtral TTS : performances, architecture et cas d'usage - ethics-ai.frethics-ai.fr
  3. The Best Open-Source Text-to-Speech Models in 2026 - BentoMLbentoml.com
  4. Best open source speech-to-text (STT) model in 2026 - Northflanknorthflank.com

← Tous les articles