Transcription automatique d’un entretien de recherche, comparatif entre deux solutions de transcription automatique : Speechmatics et Whisper

Introduction

Cet article vise à comparer deux solutions de transcription automatique pour la transcription d’un entretien : Speechmatics et Whisper.

Dans le cadre de divers tests comparatifs réalisés sur ce blog, la solution de transcription automatique proposée par Speechmatics s’est régulièrement distinguée comme l’une des meilleures, notamment grâce à son faible taux d’erreurs. Ce faible taux facilite et accélère la correction manuelle par rapport à d’autres solutions de transcription automatique.

Selon cet article, Speechmatics, avec son modèle Ursa 2 (sorti fin 2024) atteint un taux d’erreurs de mots inférieur à 5 % pour le français. Au global et pour toutes les langues, le modèle mesurerait 42,4 % d’erreurs en moins par rapport à la transcription automatique Whisper.

Parallèlement à cela, la transcription automatique d’OpenAI, via l’outil open source Whisper, s’est largement popularisée en 2024 dans les universités et est de plus en plus utilisée pour transcrire des entretiens de recherche en sciences humaines et sociales.

Pour obtenir une transcription, en local, à partir du modèle Whisper, vous pouvez utiliser le logiciel open source gratuit noScribe (Mac ou PC) ou l’application payante Whisper Transcription (Mac uniquement).

Le but de ce comparatif est de mesurer l’efficacité du modèle de transcription automatique open source de Whisper par rapport au modèle propriétaire de Speechmatics. Ce benchmark se fera par le biais d’un test pratique.

illustration article transcriptionillustration article transcription

Transcription automatique entretien, évolution des technologies

Cela ne fait que quelques années que la transcription automatique est réellement performante pour transcrire des entretiens. Avant cela, la transcription automatique n’était vraiment efficace que pour des enregistrements de très bonne qualité, réalisés avec un microphone individuel pour chaque interlocuteur et enregistrés au niveau d’une table de mixage.

Désormais, les nouveaux modèles de transcription automatique parviennent à performer malgré des voix plus éloignées et du bruit de fond, ce qui élargit leurs possibilités d’utilisation.

Un entretien semi-directif est aussi plus difficile à transcrire pour des modèles de transcription automatique que par exemple un discours préparé à l’avance et lu lors d’une conférence. Le contenu d’un entretien exploratoire ou semi-directif est plus spontané, improvisé et a un flot de parole plus rapide.

Au niveau des techniques utilisées pour l’entraînement de ces modèles de transcription automatique, il semblerait que ces modèles soient entraînés sur des centaines de milliers d’heures d’enregistrements annotés manuellement dans plusieurs dizaines de langues.

Speechmatics indique aussi dans cet article que pour l’élaboration de leur modèle Ursa 2, ils ont constaté que même avec des centaines de milliers d’heures d’enregistrements annotés, leur modèle de transcription automatique n’arrivait pas à couvrir toutes les langues, accents et dialectes.

Le modèle a donc été dans un premier temps entrainé par lui-même sur une grande quantité d’enregistrements de toutes les langues non annotés et une fois cette étape réalisée le modèle a été encore plus performant lorsqu’il a été entrainé de manière dirigée sur des enregistrements annotés d’une seule langue spécifique.

En quelque sorte, le modèle a d’abord identifié par lui-même des structures communes entre toutes les langues et a ensuite été beaucoup plus rapide et performant dans l’apprentissage quand on lui a donné des informations formelles pour une langue en particulier.

transcription entretientranscription entretien

Méthodologie du test

Le test pratique pour la mesure de différence de performance entre Speechmatics et Whisper est réalisé dans le cadre de la transcription audio en texte de trois échantillons d’entretiens qualitatifs en français d’une durée de dix minutes chacun.

La transcription recherchée n’est pas une version verbatim (avec hésitations et répétitions), mais une transcription légèrement lissée, facilitant la lecture.

Deux critères sont mesurés :

  • Le temps nécessaire à la correction avec réécoute intégrale.
  • Le nombre de révisions apportées (insertions et suppressions).

Le temps de calcul pour la sortie du texte de chaque transcription automatique n’a pas été mesuré précisément. Il est de l’ordre de 10 % du temps de l’enregistrement pour Speechmatics (calcul par un serveur). Il est par contre beaucoup plus long, jusqu’à 50 % du temps de l’enregistrement, pour un calcul en local avec Whisper (rendu effectué avec Whisper Transcription avec le modèle Large v3 sur un Mac M1 Pro). Pour se rapprocher d’un temps de rendu d’environ 10 % du temps de l’enregistrement, il faut utiliser le modèle « Large v3 Turbo » de Whisper, qui est beaucoup plus rapide mais qui diminue un peu la précision du texte.

Échantillon 1 (10 minutes d’enregistrement)

📊 Tableau d'informationGlissez de gauche à droite ➔
CritèresSpeechmaticsWhisper
Temps de correction avec réécoute00:14:10 (850 s)0:12:44 (764 s) (-10 %)
Nombre de révisions252 révisions
(Insertions : 131, Suppressions : 121)
167 révisions (-34 %)
(Insertions : 95, Suppressions : 72)
Détail de la correctionFichier PDFFichier PDF
Source de l’enregistrementLien Canal-ULien Canal-U

Échantillon 2 (10 minutes d’enregistrement)

📊 Tableau d'informationGlissez de gauche à droite ➔
CritèresSpeechmaticsWhisper
Temps de correction avec réécoute0:13:30 (810 s)0:13:17 (797 s) (-1,6 %)
Nombre de révisions250 révisions
(Insertions : 123, Suppressions : 127)
178 révisions (-29 %)
(Insertions : 77, Suppressions : 101)
Détail de la correctionFichier PDFFichier PDF
Source de l’enregistrementLien Canal-ULien Canal-U

Échantillon 3 (10 minutes d’enregistrement)

📊 Tableau d'informationGlissez de gauche à droite ➔
CritèresSpeechmaticsWhisper
Temps de correction avec réécoute0:12:56 (776 s)0:12:23 (743 s) (-4,2 %)
Nombre de révisions233 révisions
(Insertions : 123, Suppressions : 110)
163 révisions (-30 %)
(Insertions : 72, Suppressions : 91)
Détail de la correctionFichier PDFFichier PDF
Source de l’enregistrementLien Canal-ULien Canal-U

illustration transcription automatique illustration transcription automatique

Transcription automatique entretien : ressenti à la correction

Speechmatics :

  • Les hésitations et répétitions sont systématiquement transcrites, nécessitant leur suppression manuelle pour fluidifier le texte et le rendre plus lisible, ce qui allonge un peu le temps de correction.
  • Le modèle semble avoir quelques problèmes de casse et rajoute des majuscules pour les mots composés reliés par des tirets.
  • Il y a quelques contresens et problèmes de grammaire, mais la transcription automatique reste précise.
  • La ponctuation semble assez naturelle et n’est pas trop dure à corriger.

Whisper :

  • La transcription est pré-lissée, ce qui élimine une partie des répétitions et réduit le temps de correction.
  • Il n’y a pas trop de contresens ni de problèmes de grammaire et de ponctuation, mais les erreurs peuvent être assez fantaisistes et nécessitent alors une vigilance accrue.
  • Une ou deux fois dans chaque échantillon, la transcription automatique semble halluciner et rajoute un bout de phrase qui n’est pas du tout prononcé.  

Moyenne des trois échantillons

📊 Tableau d'informationGlissez de gauche à droite ➔
CritèresSpeechmaticsWhisper
Temps de correction avec réécoute812 secondes768 secondes (-5,4 %)
Nombre de révisions245 révisions169 révisions (-31 %)

transcription automatique entretien comparaisontranscription automatique entretien comparaison

Conclusion

Pour ce test (sur trois échantillons d’entretiens de dix minutes chacun), la transcription automatique Whisper a toujours été plus rapide à corriger (5,4 % plus rapide en moyenne) et a toujours demandé moins de révisions (-31 % en moyenne). Pour le français et dans le cadre de la transcription d’un entretien qualitatif, c’est donc la transcription automatique de Whisper qui est la plus performante.

Les chiffres globaux annoncés par Speechmatics du taux d’erreur de mots le plus faible du marché et d’environ 42,4 % d’erreurs en moins par rapport à Whisper ne semblent donc pas se vérifier dans le cadre précis de ce test. Il faut toutefois rappeler que ces chiffres seraient susceptibles de varier fortement avec d’autres langues et pour d’autres types d’enregistrements (réunion, podcast, conférence…).

Whisper est donc une solution de transcription automatique particulièrement performante pour la transcription automatique d’entretiens de recherche. En outre, il s’agit d’un outil gratuit, ce qui lui confère un avantage supplémentaire.

Il faut toutefois rester vigilant à ne pas se fier à la transcription automatique de Whisper seule sans correction, car il semble que Whisper peut inventer des mots ou bouts de phrase qui n’ont pas du tout été prononcés, ce qui peut s’avérer très problématique pour l’analyse du contenu de l’entretien. Il est donc toujours conseillé de corriger la transcription de Whisper au travers d’une réécoute intégrale.


Mise à jour 2026 : Le Scribe Audio, l’Alternative à Whisper en Français 2x plus précise

Depuis la réalisation initiale de ce test entre Whisper et Speechmatics, la technologie de transcription automatique a franchi une nouvelle étape majeure grâce aux modèles multimodaux de nouvelle génération (Gemini 3.7 Flash).

En appliquant strictement la même méthodologie de test (les 3 mêmes échantillons d’entretiens de recherche Canal-U de 10 minutes chacun avec réécoute intégrale et comptage exact des révisions), nous avons comparé le service Le Scribe Audio aux principaux logiciels basés sur Whisper (comme noScribe et MacWhisper) et Speechmatics.

Tableau comparatif sur les 3 mêmes échantillons d'entretiens (Nombre de révisions)

📊 Tableau d'informationGlissez de gauche à droite ➔
Solution de transcriptionÉchantillon 1Échantillon 2Échantillon 3Moyenne globaleCoeff. de corrections vs Le Scribe
🥇 Le Scribe Audio (IA Gemini 3.7 Flash)92527272 révisions1,0x (Référence)
🥈 Gladia170157116147,7 révisions2,05x
🥉 noScribe (Whisper Large v3)158148143149,7 révisions2,08x
4. HappyScribe184149135156,0 révisions2,17x
5. TurboScribe166159145156,7 révisions2,18x
6. MacWhisper192199132174,3 révisions2,42x
7. Speechmatics235214228225,7 révisions3,13x

Pour une analyse encore plus détaillée avec graphiques et temps de latence, consultez notre grand comparatif IA : Gemini vs Mistral Voxtral vs Whisper ainsi que notre hub Comparatifs logiciels.

Pourquoi Le Scribe Audio est l'Alternative idéale à Whisper en français ?

  1. 2 fois moins d'erreurs et de révisions : Là où Whisper (noScribe) nécessite en moyenne 150 révisions par tranche de 10 minutes, Le Scribe Audio réduit ce chiffre à 72 révisions.
  2. Absence totale d'hallucinations : Contrairement à Whisper qui a tendance à inventer des bouts de phrases fantaisistes ou boucler sur des répétitions, l'intégration de Gemini 3.7 Flash sur Le Scribe Audio garantit une fidélité textuelle stricte sans invention de mots.
  3. Formatage automatique par locuteur & Export Word (.docx) : Le Scribe Audio sépare automatiquement les voix (Enquêteur :, Intervenant 1 :) pour un import immédiat dans NVivo, MAXQDA et Word (voir notre guide de transcription d'entretien qualitatif).
  4. Sécurité RGPD et Chiffrement AES-256 en France : Alors que les logiciels en ligne basés sur Whisper envoient souvent vos enregistrements sur des serveurs américains, Le Scribe Audio traite et chiffre vos données 100 % en France sur serveurs souverains OVHcloud.

Si vous recherchez une alternative à Whisper en français à la fois plus rapide à corriger, plus précise et totalement sécurisée pour vos travaux de recherche :

👉 Essayez gratuitement Le Scribe Audio avec 30 minutes offertes et testez la différence dès aujourd'hui !

N'hésitez pas à consulter nos tarifs de transcription audio ou nous contacter pour un devis sur mesure pour discuter de la transcription de vos entretiens et découvrir comment nous pouvons vous accompagner.

30 minutes de transcription offertes

Prêt à transcrire vos premiers enregistrements ?

Testez notre solution d'intelligence artificielle en quelques minutes ou demandez un devis personnalisé pour la prise en charge complète par nos rélecteurs professionnels.

Formulaire de Devis Sur-Mesure
Rapide (moins de 5 min)
Chiffrement AES-256 & RGPD
Export Word & Texte