Naprawdę zdolny agent AI potrzebuje zarówno sprytu, jak i umiejętności podejmowania rzeczywistych działań.-Zdolność do podejmowania-musi dogłębnie zrozumieć, czego chce użytkownik, a następnie faktycznie wykonać zadanie. Tak Yuan Yuan, dziekan Instytutu Badawczego Alibaba, opisał idealną formę agentów AI podczas niedawnego seminarium na temat „Bezpieczeństwa i rozwoju zachowań agentów AI”.

Podkreśliła, że chociaż agenci sztucznej inteligencji wiążą się z ogromnymi obietnicami w zakresie przekształcania technologii sztucznej inteligencji w prawdziwe pieniądze i radykalnej poprawy komfortu użytkownika, ich wdrożenie nie powinno wywracać do góry nogami istniejących zasad, zarządzania ani ekosystemów biznesowych. Zamiast tego wszystko powinno odbywać się w bezpieczny i kontrolowany sposób, przy ścisłej współpracy w całej branży, aby zarówno producenci telefonów, jak i twórcy aplikacji mogli korzystać z zalet zaawansowanych modeli.
W zeszłym roku najważniejszym pytaniem na rynku było: „Czy sztuczna inteligencja naprawdę poradzi sobie z zadaniami za nas?” Widzieliśmy, jak wyłaniały się różne podejścia.
Niektóre produkty próbują „przejąć” działanie telefonu, rozumiejąc, co jest na ekranie i naśladując ludzkie dotknięcia i przesunięcia, np. montując filmy, rezerwując bilety lub zamawiając jedzenie w różnych aplikacjach. Zwykle są to tzwAgenci GUI(skrót od agentów graficznego interfejsu użytkownika).
Technicznie rzecz biorąc, działają one w ten sposób, że sztuczna inteligencja „widzi” ekran, analizuje go, a następnie symuluje kliknięcia i gesty. Ale to natychmiast rodzi kilka trudnych kwestii: kto daje na to pozwolenie? Kto jest odpowiedzialny, jeśli coś się popsuje? Do jakich usług może uzyskać dostęp? A kto to pilnuje?
Podczas seminarium eksperci zauważyli, że to-podejście oparte na ekranie ma naprawdę krótko-wartość-, ponieważ pozwala agentom AI przejść do codziennego użytku bez wymuszania dużych zmian w istniejących aplikacjach. Jednak na dłuższą metę ma wbudowane-ograniczenia dotyczące niezawodności, szybkości i możliwości zarządzania. Wielu postrzega to raczej jako tymczasowy pomost niż grę końcową.
Jiao Haitao, profesor na Chińskim Uniwersytecie Nauk Politycznych i Prawa, argumentował, że uprawnienia agentów AI powinny być przyznawane scena po scenie. Krytyczne działania wymagają drugiego potwierdzenia od użytkownika, a rzeczy obejmujące cechy osobiste, subiektywne decyzje lub interakcje społeczne nie powinny być w ogóle delegowane. Wskazał na wyzwania związane z-zasadami podwójnej autoryzacji-nie każdy scenariusz powinien opierać się na-wyłącznej platformie strony trzeciej-i zasugerował, aby branża współpracowała w drodze negocjacji i standardów, aby stopniowo rozwiązać ten problem.
Producenci telefonów aktywnie poszukują własnych ścieżek dla agentów AI.
Podczas niedawnej konferencji prasowej Jiang Yuchen, dyrektor ds. badań i rozwoju inteligentnych produktów w firmie ColorOS w OPPO, powiedział reporterom, że produkty takie jak telefon Doubao wywarły pozytywny wpływ na branżę i ekosystem, popychając rozwój sytuacji. Dała jednak jasno do zrozumienia: „To nie jest ostateczna forma telefonu ze sztuczną inteligencją-to w zasadzie sposób na obsługę starych interfejsów GUI”.
Dla OPPO wybór między podejściem w stylu GUI-nie wynika z ideologii,-jest to przede wszystkim problem inżynierii i skali. Jiang wyjaśnił, że coś takiego jak Doubao może sobie pozwolić na bardziej agresywne podejście jako prototyp inżynieryjny, ale duzi producenci telefonów mają do czynienia z ogromnymi bazami użytkowników. „Jeśli uruchomisz jakąś funkcję, a następnego dnia większość usług przestanie działać prawidłowo, jest to dla nas incydent związany z jakością,-nie możemy tego zaakceptować”. Przy tej skali możliwości każdego niestabilnego systemu-na poziomie systemu szybko ulegają zwiększeniu.
Jej zdaniem agenci-operacji ekranowej-są „na pewnym etapie pośrednim”. Główny nurt, który nas czeka, będzie bardziej skłaniał się kuWspółpraca A2A (agent-z-agentem)., gdzie agenci AI rozmawiają ze sobą bezpośrednio i współpracują.
Podkreśliła, że w tej ewolucji dla producentów telefonów naprawdę liczy się nie rozmiar modelu ani parametry,-ale głębokie,-terminowe zrozumienie użytkowników. „Nie uważamy, że duży model jest duszą telefonu” – powiedział Jiang. „Wierzymy, że «pamięć» to dusza. Gdy telefon naprawdę Cię zrozumie, naprawdę trudno będzie przełączyć się na coś innego”.
Na seminarium kilku ekspertów zgodziło się, że prawdziwym wyzwaniem dla agentów AI nie jest tylko pytanie „czy uda się wykonać zadanie?”-ale także określenie jasnych granic tego, co mogą zrobić i jak nimi zarządzają.
Yuan Yuan zauważył, że obecna fala GUI wywołała zdrowy „efekt suma”, wstrząsając i dodając energii całej branży. Nalegała jednak, aby chiński sektor sztucznej inteligencji nie utknął na ścieżce GUI. Zamiast tego korzystaj z niego, aby znaleźć lepsze trasy, które równoważą bezpieczeństwo i postęp. Jako dobry przykład podała podejście Apple: ustanawia ono współpracę opartą na otwartym interfejsie API-pomiędzy agentami i aplikacjami, wykorzystując jednocześnie świadomość ekranu, aby zachować nienaruszone granice bezpieczeństwa i precyzyjnie przekazywać intencje użytkownika do aplikacji, dzięki czemu mogą one mądrzej wykonywać polecenia.
Wang Yue, zastępca dyrektora Instytutu Systemów Informacyjnych na Wydziale Inżynierii Elektronicznej Uniwersytetu Tsinghua, postrzega agentów AI jako główny punkt zwrotny.-Systemy AI zaczynają bezpośrednio wchodzić w interakcję ze światem zewnętrznym. Nie tylko zmieni to sposób budowania systemów informatycznych; może również zmienić kształt operacji gospodarczych. Ostrzegł, że prawdziwie przełomowe innowacje grożą osłabieniem możliwości zarządzania systemem i podważeniem fundamentów zaufania, dlatego potrzebujemy lepszych mechanizmów autoryzacji oraz kontroli i równowagi A2A, aby ostatecznie przejść w kierunku systemów wiarygodności opartych na-rynku i konkurencji-.
Ogólnie rzecz biorąc, dyskusja zmienia się z tego, czy sztuczna inteligencja może działać na telefonach, na temat tego, jak robić to w sposób odpowiedzialny i zrównoważony,-a współpraca między agentami w stylu A2A- wydaje się obiecującym sposobem osiągnięcia tego celu bez psucia wszystkiego innego.
