Aller au contenu principal
Accueil AngleFormation - Experts IA et Automatisation
Automatiser Votre Croissance
IA Agentique

Gemini 3.5 Transcribe : guide API audio et réunions

2026-08-31 Par Jallal Tahiri

💡 En rĂ©sumĂ© (TL;DR)

  • Google a annoncĂ© Gemini 3.5 Transcribe le 26 aoĂ»t 2026 pour la transcription en temps rĂ©el et des enregistrements.
  • Le mode live utilise gemini-3.5-transcribe-live ; le traitement de fichiers utilise gemini-3.5-transcribe selon l'annonce officielle.
  • Le modĂšle gĂšre plus de 85 langues, le vocabulaire personnalisĂ©, les horodatages et l'identification de plusieurs locuteurs sur les enregistrements.
  • Une transcription propre n'est pas automatiquement un procĂšs-verbal exact : noms, nombres, dĂ©cisions et citations doivent ĂȘtre vĂ©rifiĂ©s.
  • Avant d'envoyer une rĂ©union, dĂ©finissez consentement, durĂ©e de conservation, contrĂŽle d'accĂšs et suppression des fichiers.

Gemini 3.5 Transcribe arrive au bon moment pour les créateurs, formateurs, centres de support et PME qui veulent convertir appels et réunions en données exploitables. Google ne le présente pas seulement comme un modÚle speech-to-text : il cherche aussi à nettoyer les hésitations, comprendre le vocabulaire spécialisé et structurer la sortie.

Ce guide explique comment choisir le bon mode, bùtir un pipeline de transcription et éviter les erreurs de confidentialité. Les noms d'API et les tarifs pouvant évoluer rapidement, vérifiez la documentation avant une intégration en production.


Que propose Gemini 3.5 Transcribe ?

L'annonce de Google distingue deux usages :

Mode ModÚle annoncé Usage
Streaming temps réel gemini-3.5-transcribe-live Agent vocal, sous-titres, dictée et interaction en direct
Audio préenregistré gemini-3.5-transcribe Réunions, appels, podcasts, interviews et archives

Les fonctions mises en avant incluent :

  • nettoyage des hĂ©sitations et auto-corrections ;
  • mise en forme du texte ;
  • vocabulaire personnalisĂ© ;
  • dĂ©tection automatique de plus de 85 langues ;
  • changement de langue dans un mĂȘme flux ;
  • identification des locuteurs pour l'audio enregistrĂ© ;
  • horodatage au niveau des mots ;
  • appels de fonctions dans certains environnements.

Google annonce une latence inférieure à une seconde pour le streaming et présente des mesures de taux d'erreur favorables. Ces chiffres ne remplacent pas un test sur vos accents, microphones, bruits et termes métiers.

Quel mode choisir ?

Temps réel

Choisissez le streaming pour :

  • sous-titrer un Ă©vĂ©nement ;
  • alimenter un agent vocal ;
  • prendre des notes pendant un appel ;
  • dĂ©tecter rapidement une intention ;
  • dĂ©clencher une action pendant la conversation.

Le temps réel ajoute des contraintes de réseau, d'interruption, de latence et de consentement immédiat.

Fichier enregistré

Choisissez le traitement différé pour :

  • transcrire une vidĂ©o YouTube ;
  • crĂ©er un compte rendu de rĂ©union ;
  • indexer une bibliothĂšque audio ;
  • analyser des appels de support ;
  • gĂ©nĂ©rer sous-titres et chapitres.

Ce mode permet de normaliser le son et de vérifier le résultat avant publication.

Préparer l'audio pour améliorer la transcription

Un modÚle performant ne récupÚre pas parfaitement une voix couverte par la musique ou un micro saturé.

Avant l'envoi :

  1. conservez le fichier original ;
  2. travaillez sur une copie ;
  3. utilisez un format et un encodage acceptés par l'API ;
  4. évitez de compresser plusieurs fois ;
  5. normalisez le niveau sans écraser les voix ;
  6. réduisez le bruit avec modération ;
  7. fournissez les termes techniques et noms propres attendus.

Pour inspecter ou convertir un fichier, vous pouvez utiliser FFmpeg aprÚs l'avoir installé avec notre guide FFmpeg pour Windows 11.

Exemple de conversion vers un WAV mono 16 kHz pour un pipeline qui le demande :

ffmpeg -i reunion.m4a -ac 1 -ar 16000 reunion.wav

Ne supposez pas que ce format est toujours optimal : respectez les formats documentés par l'API utilisée.

Concevoir une requĂȘte de transcription utile

Une bonne consigne précise le résultat attendu sans inventer de contenu :

Transcris fidÚlement cet enregistrement en français.
Identifie les locuteurs lorsqu'ils sont distinguables.
Conserve les nombres, dates, noms de produits et décisions.
N'invente aucun passage inaudible : marque-le [inaudible].
Retourne un JSON avec speaker, start, end et text.
Vocabulaire attendu : AngleFormation, n8n, Dolibarr, Node.js.

Séparez deux étapes :

  1. transcription fidĂšle ;
  2. résumé, décisions et tùches.

Demander simultanément une transcription courte et un résumé peut pousser le systÚme à reformuler ou supprimer des détails.

Architecture API recommandée

Upload sĂ©curisĂ© → validation du mĂ©dia → transcription
→ contrĂŽle qualitĂ© → stockage du texte → rĂ©sumĂ©/tĂąches
→ suppression planifiĂ©e de l'audio temporaire

ContrĂŽles avant envoi

  • type MIME autorisĂ© ;
  • taille et durĂ©e maximales ;
  • antivirus si le fichier vient d'un tiers ;
  • espace client correctement identifiĂ© ;
  • chiffrement pendant le transfert ;
  • aucune clĂ© API dans le navigateur.

La clé doit rester sur le serveur ou dans un gestionnaire de secrets. Une application web ne doit pas l'exposer dans son JavaScript public.

Exemple d'intégration avec n8n

Un workflow simple peut suivre cette structure :

Webhook → contrîle fichier → stockage temporaire
→ appel Gemini API → validation JSON
→ compte rendu → approbation humaine → archivage

Ajoutez :

  • limite de taille sur le webhook ;
  • nom de fichier gĂ©nĂ©rĂ© cĂŽtĂ© serveur ;
  • dĂ©lai maximal ;
  • reprise contrĂŽlĂ©e ;
  • statut processing / reviewed / rejected ;
  • suppression du mĂ©dia temporaire ;
  • notification en cas d'Ă©chec.

Si une réunion contient des données sensibles, l'automatisation doit vérifier le consentement et la politique interne avant l'appel API.

Transformer une réunion en compte rendu

AprÚs validation de la transcription, demandez une structure séparée :

{
  "resume": "",
  "decisions": [],
  "actions": [
    {
      "tache": "",
      "responsable": "",
      "echeance": null,
      "source_timestamp": ""
    }
  ],
  "points_a_verifier": []
}

Le champ source_timestamp permet de revenir au passage audio. N'attribuez pas automatiquement une tĂąche Ă  une personne si son nom ou son accord n'est pas explicite.

Mesurer la qualité sur du français réel

Créez un jeu de test représentant :

  • français standard et accents rĂ©gionaux ;
  • français du Maroc et alternance français/arabe si pertinente ;
  • bruit de salle ;
  • tĂ©lĂ©phone compressĂ© ;
  • plusieurs intervenants ;
  • nombres, emails et rĂ©fĂ©rences ;
  • jargon technique.

Mesurez :

  • taux d'erreur de mots ;
  • exactitude des noms propres ;
  • exactitude des nombres ;
  • attribution des locuteurs ;
  • qualitĂ© des horodatages ;
  • latence ;
  • coĂ»t par heure ;
  • temps de correction humaine.

Le meilleur modÚle est celui qui réduit le temps total jusqu'au texte validé.

Gemini 3.5 Transcribe ou Whisper ?

CritĂšre Gemini 3.5 Transcribe Whisper et variantes locales
Déploiement API gérée Possible en local ou chez un fournisseur
Temps réel API Live annoncée Dépend de l'implémentation
Nettoyage intelligent Fonction mise en avant Souvent ajouté aprÚs transcription
Vocabulaire personnalisé Fonction annoncée Variable selon l'outil
ContrÎle des données Dépend du service et du contrat Plus fort en local si bien administré
Maintenance Gérée par le fournisseur ModÚle, GPU et pipeline à gérer

Une API facilite le lancement. Un modĂšle local peut ĂȘtre prĂ©fĂ©rable pour des donnĂ©es strictement confidentielles ou un trĂšs grand volume stable. Comparez coĂ»t complet, qualitĂ© et obligations, pas seulement la gratuitĂ© apparente du logiciel.

Confidentialité et cadre juridique

Avant d'enregistrer une conversation :

  • informez clairement les participants ;
  • recueillez le consentement lorsque nĂ©cessaire ;
  • dĂ©finissez la finalitĂ© ;
  • limitez les personnes ayant accĂšs ;
  • fixez une durĂ©e de conservation ;
  • Ă©vitez les donnĂ©es non nĂ©cessaires ;
  • prĂ©voyez la correction et la suppression ;
  • vĂ©rifiez le contrat du fournisseur et la localisation applicable.

Les rÚgles dépendent du pays, du contexte professionnel et de la nature des données. Pour un usage sensible, faites valider le dispositif par un professionnel compétent.

FAQ Gemini 3.5 Transcribe

Gemini 3.5 Transcribe comprend-il le français ?

Google annonce plus de 85 langues et la détection de changements de langue. Testez néanmoins vos accents et votre vocabulaire avant production.

Peut-il identifier les personnes qui parlent ?

Le traitement préenregistré propose l'attribution de locuteurs, annoncée jusqu'à trois locuteurs avec un support expérimental au-delà. Il identifie des pistes de locuteurs, pas nécessairement leur identité civile.

Peut-il transcrire en direct ?

Oui, Google annonce un modÚle live via la Live API avec une latence inférieure à la seconde dans les conditions présentées.

La transcription supprime-t-elle les hésitations ?

Le modÚle propose une transcription intelligente qui peut nettoyer les hésitations et auto-corrections. Pour un verbatim juridique, demandez une fidélité stricte et vérifiez manuellement.

Peut-on l'utiliser pour créer des sous-titres YouTube ?

Oui, en récupérant texte et horodatages, puis en générant un fichier SRT ou VTT contrÎlé. Relisez noms propres, ponctuation et synchronisation avant publication.

Sources officielles consultées

DerniÚre vérification des informations : 30 août 2026.

JT
Cet article d'ingénierie a été rédigé par Jallal TAHIRI, consultant expert en architectures cloud, IA agentique et automatisation des processus B2B pour PME.