Technologia

10-osobowy zespół Microsoftu zbudował model rozpoznawania mowy tańszy i szybszy niż OpenAI i Google

Adrian Kessler

Model nosi nazwę MAI-Transcribe-2. Dział Microsoft AI, którym kieruje Mustafa Suleyman, udostępnił go 3 września w cenie 0,10 dolara za godzinę audio – obowiązującej do końca 2026 roku. Poprzednia wersja, MAI-Transcribe-1.5, kosztowała 0,36 dolara za godzinę. Ta 72-procentowa obniżka cen to nie efekt marketingowego zaokrąglenia. Centrum obsługi klienta przetwarzające 100 000 godzin audio rocznie płaciło za poprzedni model 36 000 dolarów; ten sam nakład pracy kosztuje teraz 10 000 dolarów.

Wyniki benchmarków sprawiają, że cena jest niezwykła. W wielojęzycznej ewaluacji FLEURS MAI-Transcribe-2 zajmuje pierwsze miejsce wśród 60 języków ze średnim współczynnikiem błędów słów na poziomie 5,2% – lepszym niż GPT-Transcribe od OpenAI, Gemini 3.5 Transcribe od Google, ElevenLabs Scribe v2 oraz Whisper V3-Large od Meta. Na liście rankingowej Artificial Analysis, która uwzględnia jednocześnie dokładność i opóźnienie, model plasuje się na drugim miejscu i wyznacza to, co badacze nazywają granicą Pareto – próg, po przekroczeniu którego nie można poprawić jednego wskaźnika bez pogorszenia drugiego. Model został wytrenowany, by znajdować się na efektywnej krawędzi tej granicy, a nie gonić za szczytem w żadnej pojedynczej tabeli.

Szybkość to drugie twierdzenie warte zbadania. Microsoft podaje, że MAI-Transcribe-2 przetwarza audio 10 razy szybciej niż GPT-Transcribe, 7 razy szybciej niż ElevenLabs Scribe v2 i 5 razy szybciej niż Gemini 3.5 Transcribe. W przypadku długich form audio – transkrypcji podcastów, zeznań sądowych, notatek klinicznych – ta różnica decyduje, czy proces trwa sekundy, czy minuty. Model obsługuje także diarizację mówców (identyfikację, kto kiedy mówił), znaczniki czasowe na poziomie słów, słowa kluczowe dla terminologii branżowej oraz obsługę przełączania kodów językowych w przypadku języków mieszających się w trakcie zdania, podając jako przetestowane przykłady konkretnie hinglish i spanglish.

Zespół, który go zbudował, jest godny uwagi w proporcji do tego, co zbudował. Microsoft opisuje podstawową grupę jako 10 osób, działających przy minimalnej biurokracji wewnętrznej i wspieranych przez większe zespoły zajmujące się pozyskiwaniem danych i zarządzaniem dostawcami. Wynikające z tego twierdzenie o wydajności GPU jest konkretne: MAI-Transcribe-2 działa przy połowie kosztów GPU w porównaniu z konkurencyjnymi modelami najnowszej generacji. Czy to utrzyma się pod obciążeniem korporacyjnym na dużą skalę, nie jest weryfikowalne na podstawie ogłoszenia, ale twierdzenie o architekturze jest na tyle precyzyjne, by je przetestować.

Model jest teraz dostępny na Microsoft Foundry, MAI Playground i Open Router – co oznacza, że dostęp nie wymaga umowy z Azure ani relacji korporacyjnej z Microsoftem. To szerokie rozpowszechnienie jest celowe. Dążenie Microsoft AI do bezpośrednich interfejsów API dla programistów jest częścią szerszego repositioningu po restrukturyzacji partnerstwa z OpenAI. Poprawki z października 2025 i kwietnia 2026 wyeliminowały wyłączne umowy i podział przychodów, które definiowały tę relację od 2019 roku. Microsoft ma teraz bezpośredni interes, by konkurować na poziomie modeli, a nie wyłącznie dystrybuować wyniki OpenAI.

Cena 0,10 dolara jest oznaczona jako ograniczona do końca 2026 roku. Standardowe ceny po tej dacie nie zostały ujawnione. Nabywcy oceniający MAI-Transcribe-2 pod kątem zastosowań produkcyjnych wyceniają produkt, którego kosztu nie znają na rok kalendarzowy 2027. To ryzyko, które warto wyraźnie nazwać, nawet jeśli obecna stawka czyni model atrakcyjnym w porównaniu ze wszystkimi widocznymi alternatywami.

Tagi: , , , , ,

Dyskusja

Jest 0 komentarzy.