Plan de l'article
đĄ En rĂ©sumĂ© (TL;DR)
- Google a annoncé Gemini 3.5 Transcribe le 26 août 2026 pour la transcription en temps réel et des enregistrements.
- Le mode live utilise
gemini-3.5-transcribe-live; le traitement de fichiers utilisegemini-3.5-transcribeselon l'annonce officielle.- Le modÚle gÚre plus de 85 langues, le vocabulaire personnalisé, les horodatages et l'identification de plusieurs locuteurs sur les enregistrements.
- Une transcription propre n'est pas automatiquement un procĂšs-verbal exact : noms, nombres, dĂ©cisions et citations doivent ĂȘtre vĂ©rifiĂ©s.
- Avant d'envoyer une réunion, définissez consentement, durée de conservation, contrÎle d'accÚs et suppression des fichiers.
Gemini 3.5 Transcribe arrive au bon moment pour les créateurs, formateurs, centres de support et PME qui veulent convertir appels et réunions en données exploitables. Google ne le présente pas seulement comme un modÚle speech-to-text : il cherche aussi à nettoyer les hésitations, comprendre le vocabulaire spécialisé et structurer la sortie.
Ce guide explique comment choisir le bon mode, bùtir un pipeline de transcription et éviter les erreurs de confidentialité. Les noms d'API et les tarifs pouvant évoluer rapidement, vérifiez la documentation avant une intégration en production.
Que propose Gemini 3.5 Transcribe ?
L'annonce de Google distingue deux usages :
| Mode | ModÚle annoncé | Usage |
|---|---|---|
| Streaming temps réel | gemini-3.5-transcribe-live |
Agent vocal, sous-titres, dictée et interaction en direct |
| Audio préenregistré | gemini-3.5-transcribe |
Réunions, appels, podcasts, interviews et archives |
Les fonctions mises en avant incluent :
- nettoyage des hésitations et auto-corrections ;
- mise en forme du texte ;
- vocabulaire personnalisé ;
- détection automatique de plus de 85 langues ;
- changement de langue dans un mĂȘme flux ;
- identification des locuteurs pour l'audio enregistré ;
- horodatage au niveau des mots ;
- appels de fonctions dans certains environnements.
Google annonce une latence inférieure à une seconde pour le streaming et présente des mesures de taux d'erreur favorables. Ces chiffres ne remplacent pas un test sur vos accents, microphones, bruits et termes métiers.
Quel mode choisir ?
Temps réel
Choisissez le streaming pour :
- sous-titrer un événement ;
- alimenter un agent vocal ;
- prendre des notes pendant un appel ;
- détecter rapidement une intention ;
- déclencher une action pendant la conversation.
Le temps réel ajoute des contraintes de réseau, d'interruption, de latence et de consentement immédiat.
Fichier enregistré
Choisissez le traitement différé pour :
- transcrire une vidéo YouTube ;
- créer un compte rendu de réunion ;
- indexer une bibliothĂšque audio ;
- analyser des appels de support ;
- générer sous-titres et chapitres.
Ce mode permet de normaliser le son et de vérifier le résultat avant publication.
Préparer l'audio pour améliorer la transcription
Un modÚle performant ne récupÚre pas parfaitement une voix couverte par la musique ou un micro saturé.
Avant l'envoi :
- conservez le fichier original ;
- travaillez sur une copie ;
- utilisez un format et un encodage acceptés par l'API ;
- évitez de compresser plusieurs fois ;
- normalisez le niveau sans écraser les voix ;
- réduisez le bruit avec modération ;
- fournissez les termes techniques et noms propres attendus.
Pour inspecter ou convertir un fichier, vous pouvez utiliser FFmpeg aprÚs l'avoir installé avec notre guide FFmpeg pour Windows 11.
Exemple de conversion vers un WAV mono 16 kHz pour un pipeline qui le demande :
ffmpeg -i reunion.m4a -ac 1 -ar 16000 reunion.wav
Ne supposez pas que ce format est toujours optimal : respectez les formats documentés par l'API utilisée.
Concevoir une requĂȘte de transcription utile
Une bonne consigne précise le résultat attendu sans inventer de contenu :
Transcris fidÚlement cet enregistrement en français.
Identifie les locuteurs lorsqu'ils sont distinguables.
Conserve les nombres, dates, noms de produits et décisions.
N'invente aucun passage inaudible : marque-le [inaudible].
Retourne un JSON avec speaker, start, end et text.
Vocabulaire attendu : AngleFormation, n8n, Dolibarr, Node.js.
Séparez deux étapes :
- transcription fidĂšle ;
- résumé, décisions et tùches.
Demander simultanément une transcription courte et un résumé peut pousser le systÚme à reformuler ou supprimer des détails.
Architecture API recommandée
Upload sĂ©curisĂ© â validation du mĂ©dia â transcription
â contrĂŽle qualitĂ© â stockage du texte â rĂ©sumĂ©/tĂąches
â suppression planifiĂ©e de l'audio temporaire
ContrĂŽles avant envoi
- type MIME autorisé ;
- taille et durée maximales ;
- antivirus si le fichier vient d'un tiers ;
- espace client correctement identifié ;
- chiffrement pendant le transfert ;
- aucune clé API dans le navigateur.
La clé doit rester sur le serveur ou dans un gestionnaire de secrets. Une application web ne doit pas l'exposer dans son JavaScript public.
Exemple d'intégration avec n8n
Un workflow simple peut suivre cette structure :
Webhook â contrĂŽle fichier â stockage temporaire
â appel Gemini API â validation JSON
â compte rendu â approbation humaine â archivage
Ajoutez :
- limite de taille sur le webhook ;
- nom de fichier généré cÎté serveur ;
- délai maximal ;
- reprise contrÎlée ;
- statut
processing / reviewed / rejected; - suppression du média temporaire ;
- notification en cas d'échec.
Si une réunion contient des données sensibles, l'automatisation doit vérifier le consentement et la politique interne avant l'appel API.
Transformer une réunion en compte rendu
AprÚs validation de la transcription, demandez une structure séparée :
{
"resume": "",
"decisions": [],
"actions": [
{
"tache": "",
"responsable": "",
"echeance": null,
"source_timestamp": ""
}
],
"points_a_verifier": []
}
Le champ source_timestamp permet de revenir au passage audio. N'attribuez pas automatiquement une tĂąche Ă une personne si son nom ou son accord n'est pas explicite.
Mesurer la qualité sur du français réel
Créez un jeu de test représentant :
- français standard et accents régionaux ;
- français du Maroc et alternance français/arabe si pertinente ;
- bruit de salle ;
- téléphone compressé ;
- plusieurs intervenants ;
- nombres, emails et références ;
- jargon technique.
Mesurez :
- taux d'erreur de mots ;
- exactitude des noms propres ;
- exactitude des nombres ;
- attribution des locuteurs ;
- qualité des horodatages ;
- latence ;
- coût par heure ;
- temps de correction humaine.
Le meilleur modÚle est celui qui réduit le temps total jusqu'au texte validé.
Gemini 3.5 Transcribe ou Whisper ?
| CritĂšre | Gemini 3.5 Transcribe | Whisper et variantes locales |
|---|---|---|
| Déploiement | API gérée | Possible en local ou chez un fournisseur |
| Temps réel | API Live annoncée | Dépend de l'implémentation |
| Nettoyage intelligent | Fonction mise en avant | Souvent ajouté aprÚs transcription |
| Vocabulaire personnalisé | Fonction annoncée | Variable selon l'outil |
| ContrÎle des données | Dépend du service et du contrat | Plus fort en local si bien administré |
| Maintenance | Gérée par le fournisseur | ModÚle, GPU et pipeline à gérer |
Une API facilite le lancement. Un modĂšle local peut ĂȘtre prĂ©fĂ©rable pour des donnĂ©es strictement confidentielles ou un trĂšs grand volume stable. Comparez coĂ»t complet, qualitĂ© et obligations, pas seulement la gratuitĂ© apparente du logiciel.
Confidentialité et cadre juridique
Avant d'enregistrer une conversation :
- informez clairement les participants ;
- recueillez le consentement lorsque nécessaire ;
- définissez la finalité ;
- limitez les personnes ayant accĂšs ;
- fixez une durée de conservation ;
- évitez les données non nécessaires ;
- prévoyez la correction et la suppression ;
- vérifiez le contrat du fournisseur et la localisation applicable.
Les rÚgles dépendent du pays, du contexte professionnel et de la nature des données. Pour un usage sensible, faites valider le dispositif par un professionnel compétent.
FAQ Gemini 3.5 Transcribe
Gemini 3.5 Transcribe comprend-il le français ?
Google annonce plus de 85 langues et la détection de changements de langue. Testez néanmoins vos accents et votre vocabulaire avant production.
Peut-il identifier les personnes qui parlent ?
Le traitement préenregistré propose l'attribution de locuteurs, annoncée jusqu'à trois locuteurs avec un support expérimental au-delà . Il identifie des pistes de locuteurs, pas nécessairement leur identité civile.
Peut-il transcrire en direct ?
Oui, Google annonce un modÚle live via la Live API avec une latence inférieure à la seconde dans les conditions présentées.
La transcription supprime-t-elle les hésitations ?
Le modÚle propose une transcription intelligente qui peut nettoyer les hésitations et auto-corrections. Pour un verbatim juridique, demandez une fidélité stricte et vérifiez manuellement.
Peut-on l'utiliser pour créer des sous-titres YouTube ?
Oui, en récupérant texte et horodatages, puis en générant un fichier SRT ou VTT contrÎlé. Relisez noms propres, ponctuation et synchronisation avant publication.
Sources officielles consultées
- Google â PrĂ©sentation de Gemini 3.5 Transcribe
- Google AI â Documentation Live API
- Google AI â Documentation Gemini API
DerniÚre vérification des informations : 30 août 2026.