Nowości
Microsoft udostępnia MAI-Transcribe-2, tańszy i szybszy niż konkurencja model do transkrypcji mowy

Microsoft AI wypuścił MAI-Transcribe-2, model rozpoznawania mowy obsługujący 60 języków, który firma reklamuje jako najdokładniejszy, najszybszy i najtańszy na rynku. Cena spadła o 72 procent względem poprzedniej wersji.
Spis treści
Microsoft AI ogłosił 3 września 2026 roku premierę MAI-Transcribe-2, nowej wersji własnego modelu do rozpoznawania mowy. Firma twierdzi, że model wyprzedza konkurencyjne rozwiązania OpenAI, Google i ElevenLabs zarówno pod względem dokładności, jak i szybkości przetwarzania, a jednocześnie kosztuje znacznie mniej niż poprzednia generacja.
To już trzecia odsłona modelu w niecałe pół roku. Microsoft wypuścił MAI-Transcribe-1 w kwietniu 2026 roku z obsługą 25 języków i ceną 0,36 dolara za godzinę nagrania. W czerwcu liczba obsługiwanych języków wzrosła do 43 w wersji MAI-Transcribe-1.5. Wrześniowa premiera MAI-Transcribe-2 dokłada kolejne 17 języków i jednocześnie obniża cenę niemal czterokrotnie.
Wyniki w benchmarkach
Microsoft opiera swoje twierdzenia o przewadze na dwóch niezależnych zestawieniach. W publicznym benchmarku FLEURS, który testuje transkrypcję w wielu językach, MAI-Transcribe-2 zajął pierwsze miejsce spośród 60 ocenianych języków ze średnim wskaźnikiem błędów słów na poziomie 5,2 procent. W rankingu Artificial Analysis, który wyznacza granicę opłacalności między dokładnością a opóźnieniem, model uplasował się na drugim miejscu pod względem wskaźnika błędów słów.
Pod względem szybkości Microsoft porównał swój model bezpośrednio z trzema głównymi konkurentami przy przetwarzaniu długich nagrań. MAI-Transcribe-2 ma przetwarzać materiał dziesięciokrotnie szybciej niż GPT-Transcribe OpenAI, siedmiokrotnie szybciej niż Scribe v2 od ElevenLabs oraz pięciokrotnie szybciej niż Gemini 3.5 Transcribe od Google.
Rachunek dla firm korzystających z transkrypcji na dużą skalę
Obniżka ceny ma bezpośrednie przełożenie na koszty przedsiębiorstw przetwarzających duże ilości nagrań. Firma korzystająca z transkrypcji na poziomie 100 tysięcy godzin audio rocznie zapłaci przy nowej stawce 10 tysięcy dolarów zamiast 36 tysięcy dolarów, jakie kosztowałoby to przy cenniku MAI-Transcribe-1. Taka skala zastosowań dotyczy między innymi centrów obsługi klienta, redakcji przetwarzających nagrania wideo czy firm oferujących automatyczne napisy.
Zastosowania i tryby pracy
Model dostępny jest przez Azure AI Foundry i według Microsoftu ma zasilać napisy do wideo, transkrypcję spotkań, narzędzia dostępności dla osób z niepełnosprawnościami, analizę rozmów w call center, procesy tworzenia treści oraz agentów głosowych. MAI-Transcribe-2 oferuje dwa tryby wyjścia: dosłowny, zachowujący wszystkie wtrącenia i powtórzenia mowy, oraz oczyszczony, który usuwa jąkanie i przejęzyczenia z finalnego tekstu.
Funkcja biasu słów kluczowych pozwala z góry wskazać modelowi terminy branżowe, nazwiska czy nazwy własne, które mają się często pojawiać w danym nagraniu, co ma poprawić rozpoznawanie specjalistycznego słownictwa medycznego, prawniczego czy technicznego.
Miejsce w wyścigu o rynek transkrypcji
Rynek modeli do rozpoznawania mowy stał się w 2026 roku areną intensywnej konkurencji cenowej i technologicznej pomiędzy największymi graczami branży AI. OpenAI, Google i ElevenLabs regularnie aktualizują własne modele transkrypcyjne, a Microsoft wpisuje tę premierę w szerszą strategię rozwoju własnych modeli MAI, budowanych wewnętrznie zamiast opierania się wyłącznie na technologii partnerów takich jak OpenAI.
Dla polskich firm korzystających z usług transkrypcji w chmurze, zwłaszcza tych przetwarzających nagrania w wielu językach, obniżka ceny i szersza lista obsługiwanych języków oznaczają realną możliwość redukcji kosztów operacyjnych bez utraty jakości rozpoznawania mowy.


