Transcription de podcast en 2026 : outils, prix et méthode
Spotify, Apple Podcasts, Radio France, Descript, Happy Scribe et DokitScript comparés pour transcrire un podcast, prix relevés le 15 septembre 2026.
Spotify et Apple Podcasts affichent une transcription automatique pour une partie des émissions, Radio France transcrit ses programmes via Whisper depuis août 2025, et des outils comme Descript, Riverside, Happy Scribe, Ausha et DokitScript couvrent les podcasts multi-voix et l'export SRT, avec des prix relevés le 15 septembre 2026 allant de gratuit à quelques euros l'heure.
Un podcast transcrit devient un texte lisible, cherchable et réutilisable pour des sous-titres, un article de blog ou des extraits courts. Ce guide compare les transcriptions natives de Spotify, Apple Podcasts et Radio France avec les outils dédiés Descript, Riverside, Happy Scribe, Ausha, DokitScript (édité par la même société que Plumavia) et Whisper en local, sur les prix, les langues et la gestion des podcasts à plusieurs voix, à partir des pages officielles relevées le 15 septembre 2026.
Comment transcrire un podcast gratuitement ?
Trois méthodes gratuites existent : les plans d'essai des outils dédiés (60 minutes chez Descript, 10 minutes chez Happy Scribe, 5 minutes chez DokitScript, ce dernier édité par la même société que Plumavia), Whisper d'OpenAI en local sans limite de durée[5][7][8], et la transcription native de Spotify ou Apple Podcasts quand l'épisode y est publié[1][2].
Le plan gratuit de Descript autorise 60 minutes de média par mois avec 100 crédits IA à usage unique, ce qui suffit pour tester la transcription sur un ou deux épisodes courts avant de basculer sur un plan payant si le volume augmente[5]. Happy Scribe limite son essai à 10 minutes, ce qui couvre à peine l'introduction d'un épisode standard, mais permet de juger la qualité avant de payer[7]. DokitScript va plus loin sur la restriction : 5 minutes par mois, avec des extraits plafonnés à 120 secondes chacun, pensés pour un test ponctuel plutôt qu'un usage régulier[8]. Pour un podcasteur qui publie plusieurs épisodes par mois, aucune de ces trois offres gratuites ne suffit dans la durée.
L'option réellement illimitée reste Whisper d'OpenAI, exécuté en local sur son propre ordinateur : aucun plafond de minutes, aucun abonnement, mais une installation technique et un temps de traitement qui dépend du modèle choisi et de la présence ou non d'une carte graphique. La procédure complète, avec les commandes et le choix du modèle adapté au français, est détaillée dans le guide dédié (installer Whisper d'OpenAI gratuitement en local).
Le compromis entre les deux approches se joue sur le temps disponible plutôt que sur le budget. Un outil en ligne rend un résultat en quelques minutes, avec une interface de correction intégrée et, souvent, la détection des locuteurs en prime sur les offres payantes. Whisper en local demande d'installer un environnement, de choisir un modèle et d'attendre le traitement sans filet en cas d'erreur technique, mais ne pose ensuite aucune limite de volume ni de renouvellement mensuel, ce qui convient à un podcasteur qui archive un catalogue entier d'épisodes anciens plutôt qu'à celui qui veut publier une transcription le jour même de la mise en ligne.
Spotify et Apple Podcasts affichent-ils une transcription automatique ?
Spotify et Apple Podcasts génèrent tous les deux des transcriptions automatiques, mais ni l'une ni l'autre n'est garantie sur chaque épisode : Spotify réserve la fonction à des émissions éligibles et Apple Podcasts l'exclut au-delà de dix heures d'enregistrement. Aucune des deux plateformes ne remplace un outil dédié pour récupérer un fichier texte exploitable ailleurs.
Sur Spotify, la transcription apparaît dans l'écran de lecture en cours et sur la page de l'épisode dans l'application mobile d'écoute, mais la fonction n'est pas disponible pour tous les créateurs ni dans l'application mobile de publication[1]. Un créateur dont le show y est éligible peut consulter, télécharger et remplacer la transcription générée automatiquement depuis Spotify for Creators, activer ou désactiver l'affichage épisode par épisode, et même distribuer sa propre transcription vers d'autres plateformes via le flux RSS. Pour uploader une version personnalisée, le fichier doit être au format VTT ou SRT, horodaté, et ne pas dépasser 5 mégaoctets[1] ; attention, activer la génération automatique remplace ensuite la version manuellement importée.
Apple Podcasts fonctionne différemment : la transcription se génère automatiquement après la publication de l'épisode, généralement disponible dans les 24 heures suivant la mise en ligne, dans 11 langues incluant le français[2]. L'auditeur y accède depuis le coin inférieur gauche de l'écran de lecture, avec surlignage synchronisé mot à mot, à condition d'utiliser iOS 17.4 ou une version plus récente. Le créateur peut remplacer la version automatique par la sienne, via le flux RSS ou en important directement un fichier VTT ou SRT dans Apple Podcasts Connect, à condition qu'il soit propre (sans faute d'orthographe ni de ponctuation) et couvre l'intégralité de l'épisode ; au-delà de dix heures d'enregistrement, Apple ne génère pas de transcription automatique[2].
Ces deux transcriptions natives restent cependant enfermées dans leur propre application : ni Spotify ni Apple Podcasts ne proposent de les exporter directement vers un site externe sans passer par un téléchargement manuel du fichier VTT ou SRT. Un podcasteur qui veut republier le texte sur son propre site, pour le référencement ou l'accessibilité, doit donc récupérer ce fichier depuis l'interface créateur, le nettoyer, puis le republier lui-même, la question traitée plus loin dans ce guide.
Comment récupérer la transcription d'un podcast Radio France ou France Culture ?
Radio France transcrit ses programmes, dont ceux de France Culture, avec Whisper associé à une relecture humaine, et publie le résultat directement sur la page de chaque émission sur radiofrance.fr. La transcription se trouve en cliquant sur l'icône de guillemets, affichée une fois le lecteur audio lancé.
Ce chantier s'est déployé progressivement à partir d'expérimentations concluantes menées en 2024, avec une extension plus large à partir d'août 2025 et un objectif de couverture élargie d'ici la fin de la saison 2025[3]. Certains formats restent volontairement exclus de la transcription automatique : les journaux, les flashs d'information, les interviews matinales et les magazines d'actualité, précisément parce qu'une erreur de l'intelligence artificielle sur ce type de contenu pourrait propager une information fausse[3]. Radio France invite aussi les auditeurs à signaler des erreurs via un formulaire dédié, ce qui alimente l'amélioration continue du système. Pour un épisode de France Culture qui n'affiche pas encore cette icône, la seule option reste de passer le fichier audio téléchargé dans un outil tiers ou dans Whisper en local, la réécoute et la copie manuelle restant trop chronophage pour une heure d'entretien.
Cette approche mixte, une IA pour le premier jet et des humains pour la relecture avant publication, diffère de la plupart des outils commerciaux présentés dans ce guide, qui livrent un texte brut sans validation éditoriale intégrée. Elle explique aussi pourquoi la couverture reste partielle plutôt qu'immédiate sur l'ensemble du catalogue : chaque programme ajouté suppose une vérification avant sa mise en ligne publique, un choix assumé par Radio France plutôt qu'une limite technique de Whisper lui-même.
Quel outil choisir pour un podcast à plusieurs voix ?
Descript et Happy Scribe séparent automatiquement les intervenants sur un enregistrement à plusieurs voix, tandis que DokitScript, édité par la même société que Plumavia, réserve cette fonction à ses plans payants à partir de l'offre Pro. Cette détection des locuteurs, ou diarisation, évite de réattribuer manuellement chaque réplique après la transcription.
Descript détecte plus de huit locuteurs distincts et transcrit en 25 langues sur l'ensemble de ses formules payantes, y compris le plan Hobbyist le moins cher, ce qui en fait une option adaptée à une table ronde ou un débat à plusieurs invités[5]. Happy Scribe propose la même détection automatique des locuteurs sur son offre de transcription IA, avec un choix parmi plus de 150 langues au total[7]. Ausha, qui héberge des podcasts plutôt que de transcrire des fichiers isolés, s'appuie sur la technologie de la start-up française Gladia pour générer une transcription annoncée à 95 % de précision dans 99 langues, incluse pour tous les abonnements d'hébergement sans surcoût[4]. DokitScript ne propose la détection des locuteurs qu'à partir de son plan Pro à 14,99 dollars par mois, le plan gratuit et le plan Starter en étant dépourvus[8]. Whisper, en local, ne fait pas de diarisation nativement : il faut lui associer un outil complémentaire pour distinguer les voix, ce qui alourdit la procédure décrite dans le guide sur l'installation locale (installer Whisper d'OpenAI gratuitement en local).
Pour un podcast solo, cette distinction compte peu. Pour une émission à deux voix ou plus, en particulier avec des interruptions et des voix qui se chevauchent, la qualité de la diarisation change directement le temps de relecture après coup : un outil qui confond deux intervenants proches vocalement oblige à tout reprendre manuellement.
Aucun protocole de test comparatif indépendant et publié n'a été identifié à cette date pour noter précisément le taux d'erreur de diarisation de chaque outil sur un enregistrement en français à plusieurs voix. Ce guide s'en tient donc aux fonctionnalités annoncées par chaque éditeur plutôt qu'à un classement chiffré, et recommande de tester la fonction sur un court extrait représentatif du podcast concerné (avec chevauchements de parole, accents et bruit de fond réels) avant de s'engager sur un abonnement annuel.
Faut-il publier la transcription pour le référencement ?
Publier la transcription d'un épisode aide le référencement, car les moteurs de recherche indexent du texte et non un fichier audio : une transcription complète rend chaque mot prononcé cherchable et associable à une requête[9]. Elle profite aussi à l'accessibilité, pour les personnes sourdes ou malentendantes, et à ceux qui préfèrent lire plutôt qu'écouter.
Une transcription brute, sans titres ni relecture, apporte cependant un bénéfice limité : un mur de texte sans structure decourage la lecture et n'aide pas davantage un moteur de recherche à comprendre le sujet précis de l'épisode qu'un texte organisé en sections. Pour un site qui vise un trafic organique durable, il vaut mieux reprendre la transcription brute issue de l'outil de transcription, corriger les erreurs évidentes, découper le texte en intertitres qui reflètent les thèmes abordés, et n'en publier qu'une version nettoyée sur la page de l'épisode, plutôt que le fichier SRT complet avec ses horodatages. Ausha intègre directement la transcription générée à la page web de chaque émission hébergée, ce qui automatise cette étape de publication pour un créateur qui héberge déjà son podcast chez cet éditeur[4].
Au-delà du seul référencement, une transcription publiée sert aussi de matière première pour d'autres formats : un extrait cité dans un article de blog, une citation reprise sur les réseaux sociaux, ou un résumé automatique généré à partir du texte plutôt que réécouté à l'oreille. Cette réutilisation profite également aux personnes sourdes ou malentendantes, qui n'ont sinon accès qu'au résumé de l'épisode plutôt qu'à son contenu intégral, un argument d'accessibilité distinct du seul calcul de référencement mais qui pousse dans la même direction.
Combien coûte la transcription d'un épisode d'une heure ?
Le coût d'une heure de transcription va de gratuit, avec Whisper en local, à environ 12 euros à la demande chez Happy Scribe, en passant par des abonnements mensuels bien moins chers à l'heure une fois utilisés régulièrement. Le choix dépend surtout du nombre d'épisodes transcrits chaque mois, pas du tarif affiché sur la page d'accueil.
| Outil | Plan gratuit | Prix mensuel (annuel) | Minutes incluses | Coût approximatif à l'heure |
|---|---|---|---|---|
| Descript Hobbyist | 60 min/mois | 16 $ | 600 min (10 h) | environ 1,60 $ |
| Happy Scribe Pro | 10 min d'essai | 19 € | 600 min (10 h) | environ 1,90 € |
| Happy Scribe (à la demande) | 10 min d'essai | 0,20 €/min hors abonnement | selon usage | 12 € |
| Riverside Pro | 2 h une fois | 24 $ | 5 h/mois (transcriptions illimitées incluses) | environ 4,80 $ |
| DokitScript Pro | 5 min/mois | 14,99 $ | 360 min (6 h), fichiers de 35 min maximum | environ 2,50 $ |
Ces montants sont ceux affichés sur les pages tarifaires officielles le 15 septembre 2026[5][6][7][8] ; ils correspondent à un usage qui consomme l'intégralité du quota mensuel, ce qui n'est pas systématique. DokitScript, édité par la même société que Plumavia, limite chaque fichier à 35 minutes sur son plan Pro, ce qui oblige à découper un épisode d'une heure en deux imports séparés ; seul son plan Business à 79,99 dollars par mois accepte des fichiers allant jusqu'à cinq heures[8]. Riverside inclut la transcription dans un abonnement pensé d'abord pour l'enregistrement à distance, ce qui explique un tarif à l'heure plus élevé si l'objectif est seulement de transcrire un fichier déjà enregistré ailleurs ; ce comparatif détaille cette différence de logique face à un outil de montage classique (Descript face à Riverside pour l'enregistrement à distance).
Pour un podcasteur qui publie un seul épisode par mois, payer à la minute chez Happy Scribe revient souvent moins cher que de s'engager sur un abonnement annuel dont une partie du quota reste inutilisée. À l'inverse, une émission hebdomadaire ou bihebdomadaire amortit vite le coût fixe d'un abonnement Descript ou DokitScript, à condition de vérifier la limite de durée par fichier avant de signer, comme le montre le cas de DokitScript ci-dessus.
Un dernier point mérite d'être vérifié avant de choisir : l'engagement annuel réduit toujours le tarif mensuel affiché, mais bloque aussi le prix pendant douze mois pendant qu'un concurrent ajuste son offre. Un podcasteur qui débute avec un volume incertain d'un mois sur l'autre gagne à commencer sur une formule mensuelle ou un plan payé à l'usage, quitte à basculer vers un engagement annuel une fois le volume mensuel réel connu sur plusieurs épisodes.
Comment corriger et mettre en forme une transcription ?
Corriger une transcription consiste à comparer le texte généré à l'audio, reprendre les erreurs de reconnaissance, ajouter la ponctuation manquante et découper le résultat en paragraphes ou en intertitres avant publication. Les outils dédiés facilitent cette étape avec une lecture synchronisée, alors qu'un export SRT brut demande un logiciel de sous-titrage séparé.
Descript et Happy Scribe affichent le texte à côté d'un lecteur audio synchronisé : cliquer sur un mot déplace la lecture à l'endroit correspondant, ce qui accélère la vérification par rapport à une relecture à l'aveugle. Sur Spotify, la correction passe par le téléchargement du fichier VTT généré, une modification hors plateforme dans un éditeur de texte, puis un nouvel envoi ; il n'existe pas d'édition directe dans l'interface[1]. Sur Apple Podcasts, la logique est proche : le créateur télécharge la transcription automatique depuis Apple Podcasts Connect, corrige le fichier, puis le republie via son flux RSS pour qu'il remplace la version générée[2]. Pour un podcast à plusieurs voix mal séparées par l'outil de diarisation, la correction prend nettement plus de temps qu'un simple contrôle orthographique, ce qui renvoie au choix de l'outil abordé plus haut. Whisper en local, sorti brut sans interface de relecture synchronisée, demande en général le plus de travail de mise en forme après coup : le texte arrive sans ponctuation avancée ni découpage en locuteurs, ce qui convient à un usage d'archive interne mais rarement à une publication immédiate sur un site. Une fois le texte propre, il peut servir de base à un script court pour les réseaux sociaux, une méthode détaillée dans le guide dédié (écrire un script court à partir d'une transcription), ou nourrir directement la page de montage d'un épisode, qu'il s'agisse d'un logiciel gratuit (logiciels gratuits pour monter un podcast) ou d'un enregistrement à plusieurs voix à distance (logiciels d'enregistrement de podcast à distance).
Pour un créateur qui hésite encore sur l'outil de montage à associer à la transcription, le comparatif entre Descript et Opus Clip détaille l'étape suivante, celle du découpage en extraits courts (Descript face à Opus Clip pour découper un podcast en extraits courts), tandis que l'avis synthétisé sur Descript revient sur ses limites en français et ses alternatives (avis synthétisé sur Descript et ses alternatives). Le même texte transcrit, une fois nettoyé, sert aussi de matière première pour adapter un extrait de podcast en vidéo courte sur TikTok, une déclinaison qui pose ses propres questions de récupération et de droits (transcrire une vidéo TikTok en texte).
Sources Vérifiées le
- Comment améliorer le référencement de votre podcast : 5 stratégies éprouvées NootaConsulté le 15 septembre 2026