Microsoft hat seine eigene KI-Modellfamilie MAI um drei Audiomodelle erweitert. Seit dem 1. Oktober 2026 gibt es mit MAI-Transcribe-2-Streaming ein Modell, das Sprache live in Text umwandelt, Für die umgekehrte Richtung, also Text zu Sprache, kommen MAI-Voice-2.1 und eine besonders schnelle Flash-Version dazu. Zielgruppe sind Entwickler, die Sprachassistenten, Untertitel oder Callcenter-Software bauen.

Für Nutzer in Deutschland ist vor allem interessant: Deutsch gehört bei allen drei Modellen zu den unterstützten Sprachen. Was die Modelle können und was sie kosten, haben wir zusammengefasst.

MAI-Transcribe-2-Streaming: Live-Transkription in 60 Sprachen

Das Transkriptionsmodell ist laut Microsoft das erste Streaming-Modell des Unternehmens. Es verarbeitet Audio, während gesprochen wird, statt erst nach dem Ende einer Aufnahme. Die wichtigsten Angaben des Herstellers:

  • 60 Sprachen, wobei die Sprache automatisch und fortlaufend erkannt wird. Wechselt ein Sprecher mitten im Gespräch etwa von Deutsch zu Englisch, muss niemand manuell umschalten.
  • Erste Zwischenergebnisse nach gut 100 Millisekunden. Das Modell zeigt also sehr früh eine vorläufige Fassung an und korrigiert sie, sobald mehr Kontext vorliegt.
  • Beim Benchmark-Anbieter Artificial Analysis liegt es nach Microsofts Angaben auf Platz eins, und zwar sowohl bei der Genauigkeit der endgültigen als auch der vorläufigen Transkripte.
  • Beim Live-Diktieren und Untertiteln sollen Wörter doppelt so schnell erscheinen wie beim nächstbesten Konkurrenten.

Es handelt sich um Herstellerangaben. Eine eigene Messung haben wir nicht durchgeführt.

MAI-Voice-2.1 und Flash: eine Stimme, 23 Sprachen

Die beiden Sprachausgabe-Modelle unterstützen 23 Sprachen in 26 regionalen Varianten. Microsoft hebt hervor, dass dieselbe Stimme in jeder dieser Sprachen mit natürlichem Akzent spricht. Im Blogbeitrag nennt das Unternehmen ausdrücklich Englisch, Mandarin und Deutsch als Beispiel für einen Sprachwechsel, bei dem der Sprecher erkennbar derselbe bleibt.

Neu ist das Klonen von Stimmen aus wenigen Sekunden Referenzaudio. Laut heise sind 5 bis 60 Sekunden nötig. Damit niemand fremde Stimmen nachbaut, verlangt Microsoft eine Prüfung und die Zustimmung der Person, deren Stimme geklont wird.

Die Flash-Variante ist auf Tempo ausgelegt: Sie soll 45 Sekunden Audio mit einer Ende-zu-Ende-Latenz von 150 Millisekunden erzeugen und rechnet laut Microsoft 55 Prozent schneller als MAI-Voice-2.1. Gedacht ist sie für Sprachassistenten, KI-Agenten und Callcenter, wo jede Verzögerung im Gespräch auffällt.

Microsofts neue MAI-Audiomodelle im Überblick
Grafik: dasTECHNO · Daten: Microsoft AI (01.10.2026)

Was kosten die Modelle in Euro?

Microsoft nennt Preise nur in US-Dollar. Wir haben sie zum EZB-Referenzkurs vom 1. Oktober 2026 (1 Euro = 1,1298 US-Dollar) umgerechnet. Die Euro-Werte sind ungefähre Nettobeträge, keine offiziellen Preise für Deutschland.

ModellPreis laut Microsoftca. in Euro
MAI-Transcribe-2-Streaming0,54 $ pro Audiostundeca. 0,48 €
MAI-Voice-2.122 $ pro 1 Mio. Zeichenca. 19,47 €
MAI-Voice-2.1-Flash15 $ pro 1 Mio. Zeichenca. 13,28 €

Der Transkriptionspreis ist ein Einführungspreis bis Ende 2026. Was danach gilt, hat Microsoft noch nicht gesagt. Die Flash-Variante soll laut Hersteller rund 60 Prozent günstiger sein als vergleichbare Modelle anderer Anbieter.

Wo sind die Modelle verfügbar?

Die drei Modelle richten sich an Entwickler und Unternehmen. Microsoft bietet sie über Microsoft Foundry, Azure Voice Live und das MAI Playground an, außerdem über die Plattformen OpenRouter und Vercel. Eine Anbindung an LiveKit soll folgen. Ob und wann die Modelle in Endkundenprodukte wie Copilot oder Teams einziehen, geht aus der Ankündigung nicht hervor.

Was bedeutet das?

Microsoft baut seine eigene Modellpalette Schritt für Schritt aus und wird damit unabhängiger von OpenAI. heise verweist auf frühere MAI-Veröffentlichungen wie MAI-Thinking-1 und MAI-Code-1.1-Flash. Eigene Bildmodelle nutzt Microsoft bereits im kostenlosen Bing Image Creator, wie unser Überblick über KI-Bildgeneratoren zeigt.

Für Unternehmen in Deutschland, die Sprachdialoge oder Protokolle automatisieren wollen, entsteht damit eine weitere Option neben bestehenden Sprach-APIs. Wer Kundengespräche transkribiert, muss allerdings weiterhin die DSGVO beachten, etwa bei der Einwilligung der Anrufer. Wie Microsoft generell mit KI-Agenten im Büroalltag plant, lesen Sie in unserem Artikel zum neuen Microsoft 365 Copilot.