Encord tränar robotar med förstapersonsvideo och hjärnvågor
Lager i San Leandro fångar avsikt misstag och överraskning när en arbetare plockar isär ett Jengatorn med tysk hjälm från Zander Labs, brist på data om händer i verkliga miljöer gör insamling till egen industri och den som säljer träningsmaterialet tjänar pengar innan robotarna gör det
Bilder
Tim Fernholz
techcrunch.com
I ett lager i San Leandro produceras en sorts träningsdata för robotik som inte finns fritt tillgänglig på nätet: en arbetares förstapersonsvideo, ihopkopplad med signaler från hans hjärna.
Enligt TechCrunch genomför Encord – mest känt för verktyg som hjälper företag att märka upp och utvärdera data för maskinseende – ett försök där en ”pilot” plockar isär ett Jengatorn medan han bär ett pannband som både spelar in vad han ser och mäter hjärnvågor. Utrustningen är byggd av Zander Labs, ett tyskt nystartat företag inom neurovetenskap. Tanken är att märka ut ögonblick av avsikt, överraskning eller misstag i samma stund som de sker, och sedan pröva om detta extra lager av märkning gör att kundernas robotmodeller lär sig hanteringsuppgifter bättre.
Försöket ska ses mot bakgrund av en bredare kapplöpning om data från den fysiska världen. Stora språkmodeller kunde tränas på enorma mängder text som skrapats från internet; robotinlärning saknar en motsvarande offentlig samling av händer som flyttar föremål i stökiga miljöer, med tillförlitlig ”facitdata” om vad som blev rätt och fel. Encords chef för robotinlärning, Vineeth Velmurugan, säger till TechCrunch att råmaterialet för att träna robotmodeller ”helt enkelt inte finns”, och uppskattar att det skulle krävas en datamängd många gånger större än hela Youtubes videobibliotek för att bryta flaskhalsen.
Bristen gör datainsamling till en egen bransch, snarare än en bieffekt av att produkter används. Företag med självkörande bilar byggde fordonsflottor för att samla egna sensordata, men den modellen är dyr och svår att kopiera för allmän hantering av föremål. Träning enbart på video är billigare men tappar detaljer som spelar roll när en robot ska greppa, hälla, stapla eller återhämta sig efter ett glapp. Encord samlar redan in ”egocentriskt” videomaterial från fabriker, och i anläggningen i San Leandro använder man också så kallade ledare–följare-riggar: två ihopkopplade robotarmar där den ena följer en mänskligt styrd tvilling, för att fånga demonstrationer av uppgifter som att hälla kaffe eller stapla spelmarker.
Märkning med hjärnvågor är ett försök att lägga till en dimension som saknas: inte bara vad människan gjorde, utan när människan märkte att något var på väg att gå fel. Lucas Gehrke, en neurovetare från Zander som övervakar arbetet, beskriver hjärnaktivitet under uppgifter som en ledtråd för modellbyggare om när mer beräkningskrävande metoder bör användas. Om sådana signaler kan göras tillförlitliga kan utvecklare markera de svåra delarna utan att i efterhand låta människor granska materialet, och avgöra var dyra ”höginsatsmodeller” är värda att köra.
TechCrunch beskriver arbetet som ett försök i liten skala: Encord planerar att bygga en första datamängd med hjärnvågsmärkning, testa den mot kundernas modeller och först därefter avgöra om metoden går att skala upp. I lagret är rekvisitan vardaglig – träklossar, muggar, spelmarker – men affärslogiken är enkel. Den som kan leverera den saknade datan för robotar får betalt långt innan robotarna själva kan börja bära sina kostnader.