Technologia

AI Alibaby, która czyta twój ekran, osiąga 92% na prawdziwych telefonach i działa na własnym sprzęcie

Susan Hill

Qwen-UI-Agent od Alibaby nie wymaga specjalnego dostępu do aplikacji. Czyta ekran, identyfikuje jego zawartość i klika, obsługując zadania od komunikacji po edycję dokumentów wyłącznie poprzez percepcję wzrokową. Wagi modelu – MAI-UI-2B i MAI-UI-8B – trafiły w tym tygodniu na Hugging Face, udostępniając system każdemu programiście z kartą graficzną.

Wyniki testów są konkretne. W MobileWorld, standardowej ewaluacji agentów mobilnych, Qwen-UI-Agent uzyskał 82,1%, pokonując GPT-5.6 o 12 punktów procentowych i Claude Opus 4.8 o 14,6 punktu. Różnica nie jest marginalna – porównywalne zachodnie systemy od miesięcy utknęły w przedziale 70–74% w tym samym teście. W testach na rzeczywistych urządzeniach – zadaniach wykonywanych na prawdziwych smartfonach z Androidem, a nie emulatorach – wynik wzrósł do 92,2%. W AndroidDaily, szerszej ewaluacji na realnych telefonach, model osiągnął 97,5%. W przypadku komputerów stacjonarnych, mierzonych za pomocą OSWorld-Verified, uzyskał 79,5%, wyprzedzając zarówno GPT-5.5, jak i Gemini 3.1 Pro.

Alibaba trenowała model na danych z ponad 100 prawdziwych urządzeń mobilnych, na których uruchomiono 150 różnych aplikacji, a następnie zbudowała własny benchmark – MobileWorld-Real – z ponad 400 zadaniami, aby zweryfikować wydajność poza laboratorium. Około 40% zadań na komputerach stacjonarnych obejmowało wsadowe operacje w wierszu poleceń wraz z kliknięciami wizualnymi – to celowy wybór projektowy odzwierciedlający rzeczywiste działanie komputerów, a nie inscenizację demonstracji.

Warstwa bezpieczeństwa jest wbudowana w przepływ pracy. Model odrzuca zadania, które oznacza jako nielegalne lub wysokiego ryzyka, i zatrzymuje się przy wrażliwych operacjach – płatnościach, usuwaniu danych, autoryzacjach prywatności – żądając wyraźnego potwierdzenia od użytkownika przed kontynuacją. System obsługuje sekwencje dłuższe niż 100 kroków, korzystając z uczenia przez wzmacnianie trenowanego w około 10 000 symulowanych środowisk jednocześnie.

Wyniki testów pozostawiają otwarte trudniejsze pytania. Qwen-UI-Agent był oceniany na ustrukturyzowanych zadaniach; rzeczywiste korzystanie z telefonu jest pełne przerw, zaśmiecone powiadomieniami i obejmuje aplikacje, które aktualizują swoje interfejsy bez ostrzeżenia. AI czytająca ekran rodzi też kwestię prywatności, której raport techniczny Alibaby nie porusza: model, który przetwarza każdy piksel twojego ekranu, ma dostęp do danych bankowych, prywatnych wiadomości i informacji, które większość użytkowników nigdy nie rozważała powierzyć zewnętrznemu systemowi. Brakuje wytycznych dotyczących tego, co dzieje się z tymi danymi we wdrożeniach stron trzecich.

Projekt jest hostowany na Tongyi-MAI/MAI-UI w GitHub; wagi modelu są teraz na Hugging Face. Nie ogłoszono jeszcze żadnego komercyjnego API ani ceny wdrożenia. Kolejnym testem dla Qwen-UI-Agent nie jest benchmark – to, czy programiści budujący na otwartych wagach będą w stanie w produkcji dorównać temu, co Alibaba odnotowała w laboratorium.

Tagi: , , , , ,

Dyskusja

Jest 0 komentarzy.