Benjie Holson: Roboty już potrafią poskładać pranie
We wrześniu ubiegłego roku robotyk Benjie Holson opublikował na platformie Substack wpis zatytułowany „Humanoid Olympic Games” („Humanoidalne Igrzyska Olimpijskie”) – zestaw przeznaczonych dla humanoidalnych robotów testów o rosnącej trudności, których wykonanie badacz sam zaprezentował ubrany w srebrny kombinezon. Wyzwania, na przykład otwieranie drzwi gałką, zaczynały się od łatwych – przynajmniej dla człowieka – a kończyły na zasługujących na „złoty medal”, takich jak zapinanie guzików w męskiej koszuli i wieszanie jej na wieszaku oraz używanie klucza do otwarcia drzwi.
Celem Holsona było pokazanie, że trudne zadania wcale nie są tymi najbardziej efektownymi. W wielu konkursach rywalizują roboty uprawiające sporty i tańczące, Holson argumentował natomiast, że te, których naprawdę potrzebujemy, potrafią zrobić pranie i przygotować posiłek.
Sądził, że miną lata, zanim rywalizujące ze sobą maszyny pokonają te wyzwania. Tymczasem zaledwie kilka miesięcy później robot stworzony przez firmę Physical Intelligence z San Francisco wykonał 11 z 15 zadań – zdobywając medale od brązowego do złotego – m.in. umył okna, posmarował chleb masłem orzechowym oraz użył woreczka na psie odchody.
„Scientific American” rozmawiał z Holsonem (który zdążył już opublikować nową listę jeszcze trudniejszych zadań) o tym, dlaczego systemy oparte wyłącznie na analizie obrazu – czyli wykorzystujące kamery – przewyższyły jego oczekiwania oraz jak blisko ludziom do zbudowania naprawdę użytecznej maszyny.
Deni Ellis Béchard: Zaprojektowałeś te testy tak, aby były trudne. Czy zaskoczyło Cię, jak szybko roboty jej przeszły?
Benjie Holson: To nastąpiło o wiele szybciej, niż się spodziewałem. Kiedy wybierałem zadania, próbowałem je skalibrować tak, aby niektóre z poziomu brązowego medalu zostały wykonane w ciągu pierwszego lub drugiego miesiąca, zadania na srebrny i złoty medal w ciągu kolejnych sześciu miesięcy, a najtrudniejsze jednego lub półtora roku.
To, że roboty wykonały praktycznie prawie wszystkie w ciągu pierwszych trzech miesięcy, jest czymś niesamowitym.
Co umożliwiło taki postęp?
Wyszedłem z założenia, że roboty potrafią obecnie wykonać czynności wyglądające imponująco, ale nie są wszechstronne – systemy są oparte wyłącznie na analizie obrazu, nie mają zmysłu dotyku, są wyposażone w proste manipulatory, nie są szczególnie precyzyjne. To ogranicza zakres zadań. Próbowałem więc wymyślić testy, które wymagałyby wyjścia poza ten obszar. Okazało się, że bardzo nie doceniłem tego, co jest możliwe dla robotów wykorzystujących wyłącznie widzenie i proste manipulatory.
Od firmy Physical Intelligence dowiedziałem się, że ich roboty nie mają żadnych czujników siły. Wykonują wszystkie zadania, opierając się wyłącznie na analizie obrazu. Sądziłem, że włożenie klucza do zamka albo rozsmarowanie masła orzechowego będzie wymagało informacji o sile nacisku. Ale najwyraźniej wystarczy po prostu dostarczyć robotowi więcej nagrań wideo pokazujących te czynności – i to zadziała.
Jak dokładnie trenuje się robota do takich działań bez programowania go linijka po linijce?
Wszystko opiera się na uczeniu przez demonstrację. Ktoś zdalnie steruje robotem podczas wykonywania zadania setki razy, na tej podstawie trenuje się model, a potem robot potrafi wykonać to zadanie samodzielnie.
Czy faktycznie duże modele językowe (LLM) są bezużyteczne w robotyce, jak się zwykle uważa?
Kiedyś myślałem, że użyteczność dużych modeli językowych w robotyce jest dość wątpliwa. Problem, który potrafiły rozwiązywać dwa lub trzy lata temu, dotyczył planowania na wysokim poziomie – na przykład: „Jeśli chcę zaparzyć herbatę, jakie są kolejne kroki?”.
Ustalenie kolejności działań jest łatwe. Podniesienie dzbanka i napełnienie go wodą – już naprawdę trudne.
Zaczęliśmy jednak tworzyć modele łączące obraz i działanie, wykorzystując tę samą architekturę transformera, która jest stosowana w dużych modelach językowych. Transformery można wykorzystywać do tekstu jako wejścia i tekstu jako wyjścia oraz do obrazów jako wejścia i tekstu jako wyjścia – ale również do obrazów jako wejścia i działań robota jako wyjścia.
Ciekawe jest to, że zaczynają one od modeli wstępnie wytrenowanych na tekście, obrazach i być może nagraniach wideo. Zanim jeszcze rozpocznie się trening konkretnego zadania, model sztucznej inteligencji już rozumie, czym jest dzbanek, czym jest woda i że można chcieć napełnić dzbanek wodą. Dlatego uczenie się konkretnego zadania nie musi zaczynać od: „Pozwólcie mi zrozumieć, czym jest geometria”. Może się zacząć od: „Rozumiem, przemieszczamy dzbanki”. I to, że to działa, jest niesamowite.
Jak wymyśliłeś zadania do „olimpiady”?
Częściowo było to stawianie wyzwania, częściowo próba przewidywania przyszłości. Próbowałem pomyśleć o kolejnych rzeczach, których obecnie nie potrafimy robić, ale które wkrótce da się wykonać.
Ludzie do takich czynności, jak znalezienie kluczy w kieszeni, wykorzystują dotyk. Jak roboty radzą sobie bez niego?
To bardzo dobre pytanie, na które wciąż nie znamy odpowiedzi.
Technika dotykowa jest znacznie droższa, wrażliwa i dużo mniej rozwinięta w stosunku do kamer. Nad kamerami pracujemy od bardzo dawna.
Najważniejsze pytanie brzmi: czy kamery wystarczą? Zarówno Physical Intelligence, jak i Sunday Robotics [której robot wykonał zadanie na poziomie brązowego medalu polegające na zwijaniu pasujących do siebie skarpet] postawiły na rozwiązanie polegające na umieszczeniu kamery na nadgarstku, bardzo blisko palców. Dzięki temu robot niejako „widzi” siły poprzez obserwowanie, jak coś się odkształca. Kiedy robot chwyta jakiś przedmiot, widzi, jak uginają się gumowe elementy palców, jak odkształca się chwytany przedmiot, i na tej podstawie wnioskuje o działających siłach. Podczas rozsmarowywania masła orzechowego na chlebie robot obserwuje, jak ugina się nóż, jak zgniata pieczywo, i następnie na tej podstawie ocenia siły. Działa to znacznie lepiej, niż się spodziewałem.
A co z bezpieczeństwem?
Energia potrzebna do utrzymania równowagi jest często bardzo duża. Jeśli robot upada, musi bardzo szybko przyspieszyć nogę, aby zdążyć wysunąć ją przed siebie. Taki system wprowadza do otoczenia bardzo dużo energii – i właśnie to stanowi zagrożenie.
Jestem wielkim zwolennikiem robotów typu centaur – czyli takich, które mają mobilną podstawę na kołach, ramiona i głowę. Pod względem bezpieczeństwa to znacznie łatwiejsza droga do szybkiego osiągnięcia celu. Jeśli humanoidalny robot straci zasilanie, to się przewróci. Ogólny plan wydaje się polegać na stworzeniu robota tak wartościowego, że jako społeczeństwo opracujemy dla niego nową klasę bezpieczeństwa – podobnie jak to się stało w przypadku rowerów i samochodów. Są niebezpieczne, ale tak cenne, że akceptujemy związane z nimi ryzyko.
Czy te wyniki wpłynęły na twoje prognozy?
Kiedyś uważałem, że roboty domowe pojawią się najwcześniej za 15 lat. Teraz sądzę, że najwcześniej za sześć. Wcześniej uważałem, że wykonanie użytecznego zadania w przestrzeni przeznaczonej dla ludzi – nawet w formie demonstracji – jest odległą perspektywą.
Robotycy wielokrotnie przekonali się, że od „działa w laboratorium i mam nagranie wideo” do „produkt nadaje się do sprzedaży” jest daleka droga. Waymo jeździło po drogach już w 2009 roku; ja nie mogłem skorzystać z przejazdu do 2024 roku. Osiągnięcie wystarczającej niezawodności zajmuje dużo czasu.
Jaki jest obecnie największy problem?
Niezawodność i bezpieczeństwo. To, co pokazuje Physical Intelligence, jest imponujące, ale jeśli postawisz robota przy innym stole, z innym oświetleniem i użyjesz innej skarpetki, maszyna może już nie zadziałać. Każdy kolejny krok w kierunku większej uniwersalności wydaje się wymagać dziesięciokrotnie większej ilości danych i z dni ich zbierania robią się tygodnie lub miesiące.