← Tous les guidesActualité · 18 min · Publié le 5 septembre 2026

MAI-Transcribe-2 : faut-il l’utiliser pour vos réunions en français ?

Microsoft annonce une transcription à 0,10 $ par heure, 60 langues, diarisation et horodatage. Voici ce qui est confirmé, les limites de la préversion et un protocole de test pour les indépendants et TPE.

CIRédaction Cresora IAVeille mondiale · Méthode éditoriale vérifiableObjectif : décider en une heure de test si MAI-Transcribe-2 améliore réellement vos comptes rendus en français, sans exposer inutilement les voix ni confondre transcription et décision.Dossier : Déployer l’IA dans une petite activité →
Professionnelle vérifiant une transcription de réunion avec deux intervenants, des formes d’onde et une étape de validation humaine
Illustration originale Cresora IA.

Ce que Microsoft a réellement annoncé

Le 3 septembre 2026, Microsoft AI a présenté MAI-Transcribe-2, un nouveau modèle de reconnaissance vocale disponible en démonstration dans MAI Playground et annoncé dans Microsoft Foundry via Azure Speech. Il transforme un fichier audio en texte et ajoute plusieurs fonctions utiles au travail : séparation des intervenants, horodatage de chaque mot, détection automatique de la langue, biaisage par mots-clés et choix entre une transcription fidèle à l’oral ou nettoyée pour la lecture.

Microsoft annonce une prise en charge de 60 langues, dont le français, et un traitement d’une heure d’audio en environ dix secondes pour l’inférence du modèle. Ces chiffres décrivent la performance présentée par le fournisseur ; le temps réellement observé peut aussi dépendre du transfert du fichier, de la file d’attente, de la région Azure, du format et de l’intégration.

Fait : les fonctions et mesures sont publiées par Microsoft. Analyse Cresora : elles sont prometteuses pour préparer un compte rendu, mais ne prouvent pas encore la qualité sur votre vocabulaire ni la fiabilité d’un service en production.

Un prix très bas, mais seulement jusqu’à la fin de l’année

Le prix annoncé au lancement est de 0,10 dollar par heure d’audio. Microsoft précise qu’il s’agit d’une offre limitée jusqu’à la fin de 2026 et ne publie pas encore le tarif qui suivra. À ce prix temporaire, dix réunions d’une heure représentent un dollar de traitement brut, avant conversion monétaire, taxes éventuelles, stockage, transfert, développement et temps de contrôle.

Ne construisez donc pas un budget annuel en prolongeant mécaniquement ce tarif. Pour comparer avec un abonnement de prise de notes, calculez le coût du processus complet : capture autorisée, envoi, transcription, correction, résumé, archivage et suppression. Une API peu coûteuse peut rester moins rentable qu’un outil intégré si elle exige plusieurs heures de configuration ou de maintenance.

Ce que disent les scores — et ce qu’ils ne disent pas

Sur le benchmark public FLEURS, Microsoft publie un taux moyen d’erreur de mots de 5,2 % sur 60 langues et de 3,4 % sur les 25 langues les plus parlées. La page du modèle affiche aussi 2 % sur l’évaluation Artificial Analysis et compare vitesse et précision à plusieurs concurrents. Ces résultats sont utiles pour situer le modèle, mais ils restent agrégés et ne répondent pas à une question décisive : comprend-il votre réunion française réelle ?

Un mot erroné sur vingt peut être acceptable pour retrouver un passage, mais problématique si l’erreur touche une négation, un montant, un nom de client ou une date. Le taux moyen ne mesure pas non plus correctement l’attribution au bon intervenant, la ponctuation, la distinction entre décision et suggestion, ni le temps passé à corriger. Il faut mesurer ces éléments séparément.

France et Europe : vérifier la région avant de charger un fichier

Microsoft indique que les données Azure Speech restent stockées et traitées dans la région de la ressource. La documentation régionale consultée liste l’Europe du Nord pour les fonctions de parole fondées sur des grands modèles ; elle ne confirme pas MAI-Transcribe-2 dans France Central au moment de cette vérification. Créer une ressource Azure en France ne garantit donc pas que ce modèle précis y soit disponible.

Avant tout essai professionnel, ouvrez la documentation de la version et de la région choisies, puis vérifiez l’endpoint réellement appelé. Conservez une capture ou une note datée de la région, du modèle et des réglages. Pour un besoin de résidence stricte en France, considérez l’absence de disponibilité régionale explicite comme une limite, pas comme une formalité.

La préversion change la décision

La documentation Azure présente la famille MAI-Transcribe dans l’API LLM Speech comme une fonctionnalité en préversion publique, sans accord de niveau de service et déconseillée pour les charges de production. L’annonce du nouveau modèle est plus récente que certaines pages techniques : les listes de versions et limites peuvent donc évoluer ou rester temporairement décalées.

Pour une TPE, la conclusion est simple : utilisez d’abord MAI-Transcribe-2 pour un pilote réversible. Ne remplacez pas immédiatement une procédure obligatoire, un enregistrement réglementaire ou un service promis à un client. Prévoyez un retour aux notes manuelles ou à l’outil actuel tant que la version, la région, les quotas, le support et le prix stable ne sont pas documentés.

Diarisation, horodatage et mots-clés : les trois fonctions à tester

La diarisation attribue les segments à différents locuteurs. Elle peut accélérer la relecture d’un entretien ou d’une réunion, mais elle ne connaît pas automatiquement l’identité juridique des personnes : “intervenant 1” peut devenir “intervenant 2” après une coupure ou un chevauchement. N’utilisez pas cette attribution pour affecter une responsabilité sans écouter le passage.

L’horodatage mot à mot permet de revenir rapidement au son d’origine. C’est le meilleur garde-fou pour les montants, dates et décisions. Le biaisage par mots-clés sert à fournir les noms de produits, acronymes et termes métier difficiles ; préparez une courte liste, puis vérifiez qu’elle améliore le résultat sans forcer des mots absents. Testez enfin le style “verbatim” pour les audits et le style “clean” pour la lecture, sans confondre nettoyage et citation exacte.

La voix est une donnée personnelle

La CNIL rappelle que la voix peut identifier directement ou indirectement une personne. Une réunion contient aussi des noms, opinions, informations sur des clients, projets ou salariés. Le fait qu’un fichier devienne du texte ne fait pas disparaître ces données ; la transcription peut au contraire les rendre plus faciles à rechercher et à diffuser.

Définissez la finalité avant d’enregistrer, informez clairement les participants, prévoyez une solution sans enregistrement et limitez le contenu capté. N’utilisez pas un pilote pour une réunion médicale, juridique, RH, disciplinaire ou confidentielle sans cadre validé. Donnez accès uniquement aux personnes nécessaires et fixez la suppression de l’audio puis du brouillon une fois le compte rendu vérifié, selon vos obligations réelles.

  1. Expliquer pourquoi la réunion serait enregistrée
  2. Nommer l’outil, la région et les personnes ayant accès
  3. Prévoir une alternative pour les personnes concernées
  4. Limiter l’audio au passage utile
  5. Fixer et appliquer une durée de conservation

Un test français en dix extraits

Préparez dix extraits courts provenant de situations autorisées ou enregistrées spécialement pour le test. Mélangez conversation calme, bruit de fond, téléphone, deux personnes qui se coupent, accent régional, nom propre, adresse, montant, date et vocabulaire métier. Conservez une transcription de référence réalisée manuellement.

Envoyez exactement les mêmes fichiers au modèle, avec puis sans liste de mots-clés. Ne corrigez pas au fil de l’eau. Notez le nombre d’erreurs importantes, les mauvaises attributions de locuteur, le temps jusqu’au résultat, le temps de correction et le coût. Un essai spectaculaire ne compte pas davantage qu’un extrait difficile : utilisez une grille identique pour les dix.

  1. Deux voix distinctes sans chevauchement
  2. Deux voix qui parlent en même temps
  3. Français avec noms propres et acronymes métier
  4. Montants, dates et numéros
  5. Bruit de café, téléphone ou microphone moyen
  6. Passage français avec un terme anglais
  7. Question, hypothèse et décision dans le même échange

La grille de décision qui évite un faux gain

Fixez vos seuils avant de regarder le résultat. Par exemple : zéro erreur non détectée sur les montants et dates, attribution correcte de chaque décision, moins de cinq minutes de correction pour une heure d’audio et possibilité de retrouver chaque point important grâce à l’horodatage. Ajoutez un seuil de confidentialité : région acceptable, accès limité et suppression testée.

Comparez au processus actuel, pas à l’absence totale de compte rendu. Si une personne prend déjà des notes fiables en quinze minutes, une transcription exhaustive corrigée pendant vingt-cinq minutes est une régression. Mesurez aussi la valeur obtenue : décisions plus claires, actions attribuées et recherche plus rapide dans les échanges.

Cas pratique : une agence avec quatre réunions client par semaine

Une petite agence veut produire un compte rendu après quatre réunions hebdomadaires de quarante-cinq minutes. Elle commence par deux réunions internes simulées, puis une réunion client dont tous les participants ont été informés. Elle fournit quinze noms de produits et acronymes au biaisage, choisit une ressource dans une région européenne documentée et désactive tout partage inutile.

Après chaque transcription, la cheffe de projet écoute les passages associés aux décisions, dates et montants. Elle transforme ensuite le brouillon en cinq rubriques : décisions confirmées, actions, responsables, échéances et questions ouvertes. L’audio est supprimé après validation selon la règle interne ; le compte rendu final, et non la sortie brute, devient la référence du projet.

Le pilote est réussi seulement si le temps total diminue sans erreur d’engagement. Si la séparation des voix échoue fréquemment ou si le modèle confond les noms métier, l’agence conserve ses notes structurées et attend une version plus stable. Le faible prix de l’API ne justifie pas une baisse de fiabilité.

Checklist avant une utilisation régulière

Une décision raisonnable tient sur une page. Documentez le modèle exact, la date du test, la région, le tarif temporaire, les formats acceptés, les personnes autorisées et le responsable de validation. Ajoutez les seuils de qualité ainsi que la procédure en cas d’indisponibilité.

Répétez le test lors d’un changement de version, de région ou de prix. Une préversion peut s’améliorer, perdre une fonction ou modifier ses limites. Gardez vos fichiers de référence et votre grille hors de l’outil : ils vous permettront de comparer une mise à jour ou un autre fournisseur à conditions égales.

  1. Le français réel de l’équipe a été testé
  2. Noms, dates, montants et négations sont contrôlés
  3. La diarisation est vérifiée sur les chevauchements
  4. La région et la résidence des données sont documentées
  5. Les participants sont informés et une alternative existe
  6. Les accès et la suppression ont été testés
  7. Le coût après 2026 est marqué comme inconnu
  8. Un mode manuel reste disponible

Verdict : intéressant pour un pilote, trop tôt pour une dépendance critique

MAI-Transcribe-2 réunit des fonctions pertinentes pour le travail réel : français, séparation des voix, horodatage, vocabulaire métier et prix de lancement très bas. Pour un indépendant ou une petite équipe, il mérite un test si les réunions sont nombreuses et si la correction actuelle prend du temps.

Il ne faut toutefois pas confondre une annonce performante avec une procédure fiable. Le tarif est temporaire, le service est présenté dans un environnement de préversion et la disponibilité régionale doit être vérifiée modèle par modèle. Le bon prochain geste n’est pas une migration : c’est un test de dix extraits, avec données autorisées, critères écrits et retour manuel immédiat.

QUESTIONS FRÉQUENTES

Ce qu’il faut encore savoir

MAI-Transcribe-2 comprend-il le français ?

Microsoft inclut le français parmi les 60 langues annoncées. Testez néanmoins vos accents, noms propres, chiffres et termes métier : un score moyen multilingue ne garantit pas chaque situation.

Combien coûte une heure de transcription ?

Microsoft annonce 0,10 dollar par heure d’audio jusqu’à la fin de 2026. Le prix ultérieur n’est pas publié et les coûts Azure, de stockage, d’intégration et de contrôle peuvent s’ajouter.

Le modèle est-il disponible en France Central ?

La disponibilité de MAI-Transcribe-2 en France Central n’est pas confirmée dans les sources vérifiées pour cet article. L’Europe du Nord est documentée pour les fonctions concernées ; vérifiez la page régionale et votre ressource avant envoi.

La diarisation reconnaît-elle automatiquement les personnes ?

Elle sépare des locuteurs, mais son étiquette ne constitue pas une preuve d’identité. Vérifiez l’audio avant d’attribuer une décision, une citation ou une responsabilité.

Peut-on supprimer l’audio après transcription ?

Oui si aucune obligation ne nécessite sa conservation. Définissez la durée avant l’enregistrement, vérifiez la suppression et conservez uniquement ce qui reste nécessaire à la finalité annoncée.

Sources et vérification

Les liens ci-dessous permettent de contrôler les informations réglementaires et les données citées. Consultation : 5 septembre 2026.