Nvidia heeft vandaag samen met Carnegie Mellon University en UC Berkeley ENPIRE gepresenteerd, een nieuw systeem om robots op echte hardware te trainen. Het idee is simpel: robots moeten tijdens dat trainen veel meer zelf kunnen doen, zeggen de onderzoekers.
Met ENPIRE oefenen manipulatierobots niet alleen op echte hardware, ze sturen ook hun eigen trainingsaanpak bij terwijl het proces loopt. Dat maakt het interessant, want robottraining vraagt nu vaak nog veel handwerk. Iemand moet data verzamelen, de testopstelling na een mislukte poging weer klaarzetten, bepalen of een taak wel of niet is gelukt en daarna ook nog de software aanpassen. Daar gaat veel tijd in. Daarom valt deze ontwikkeling op.
ENPIRE biedt onder meer:
- Geautomatiseerde robottraining op echte hardware. De methode Embodied aNd Physical-world-aware agentIc Robot policy self-ImprovemEnt (ENPIRE) laat robots volgens de onderzoekers hun eigen prestaties verbeteren, zonder dat onderzoekers voortdurend elk stapje hoeven te begeleiden.
- Een aanpak in twee fasen. In de eerste fase helpt een mens nog een beetje mee, staat in de studie. Dan worden de basisvoorwaarden neergezet: veiligheidsgrenzen, automatische resets en een manier om te controleren of een poging geslaagd is. Daarna neemt de software het grootste deel van het werk over.
- Het zelf herschrijven van de trainingsaanpak. Volgens de paper leest ENPIRE onderzoekspapers, bedenkt het hypotheses, past het trainingscode aan en kiest het op basis van resultaten in de echte wereld tussen methoden als behavior cloning en reinforcement learning.
- Minder handmatig werk bij fijnere manipulatietaken. Dan gaat het om taken als objecten oppakken, pinnen in openingen steken, onderdelen sorteren of een kabelbinder doorknippen. Dat scheelt veel uitzoekwerk, omdat je normaal na elke poging moet nagaan wat er fout ging en hoe je daarna de beloningsfunctie of trainingsinstellingen moet aanpassen.
- Zelfgeschreven belonings- en evaluatiefuncties. In de paper staat dat ENPIRE die functies zelf schrijft. Daarvoor gebruikt het systeem maar een paar minuten aan voorbeeldvideo’s van geslaagde en mislukte pogingen. Bij pin insertion kijkt ENPIRE bijvoorbeeld naar de visuele uitlijning, de hoogte van de grijper en de geschatte kracht. Voor het sluiten van een kabelbinder gebruikt het volgens de onderzoekers twee camerahoeken en reageert het in minder dan 150 ms.
- Een parallelle robotvloot. De onderzoekers testten ENPIRE op acht robotstations. Elk station had een dual-arm YAM-robot, eigen hardware, een eigen computer en een eigen coderende agent. Die stations proberen tegelijk verschillende ideeën uit en delen succesvolle aanpakken via Git, zodat verbeteringen zich over de hele vloot verspreiden.
Volgens de paper leverde dat stevige resultaten op. De robotvloot haalde tot 99% succes bij taken als Push-T, het sorteren van pinnen in een bak en het doorknippen van een kabelbinder. De onderzoekers noemen daarnaast ook het installeren van een GPU op een moederbord. Bij pin insertion kwam ENPIRE volgens de paper zelfs sneller op 100% succes uit dan een vergelijkbare aanpak waarbij mensen nog actief in de lus zitten.
Het project bouwt voort op eerder werk van Nvidia, waaronder Eureka, een systeem dat automatisch beloningsfuncties voor robots schreef. Volgens Nvidia deed dat eerdere project het bij meer dan 80% van de taken beter dan varianten die door mensen waren geschreven, met in die gevallen verbeteringen van meer dan 50%.
Nvidia zegt ook dat ENPIRE binnenkort als open source beschikbaar komt. Daarmee wordt het systeem ook buiten Nvidia relevant voor onderzoekers en robotbouwers. Het project past bovendien in Nvidias bredere offensief in robotica, met onder meer Project GR00T, Jetson Thor en het Isaac GR00T-referentieplatform.
Bron: Nvidia, Carnegie Mellon University en UC Berkeley