Hannah Clark: Innovaatio on kumulatiivista – tällä tarkoitan sitä, että nykyiset tapamme ratkaista ongelmia eivät voisi olla tehokkaita ilman aiempia ratkaisujamme. Vaikka sanoja ”koulutusdata” käytetään nykyään yleensä tekoälyn kehittämisen yhteydessä, on hyvä muistaa, että käyttäjät ovat myös kuluttaneet ja säilyttäneet valtavia määriä koulutusdataa omaksuessaan vuosien varrella jokaisen käyttämänsä ohjelmiston. Kun siis keskitymme omien tekoälytuotteidemme käyttötapauksiin ja uusiin ominaisuuksiin, käyttäjät noudattavat erilaista käsikirjoitusta. He toimivat mieltymysten, tapojen ja ennen kaikkea odotusten pohjalta, jotka ovat muodostuneet siitä lähtien, kun he ensimmäisen kerran avasivat verkkoselaimen.
Vieraakseni saapuu tänään Dhruv Batra, Yutorin toinen perustaja ja päätiedemies. Kuten tulette kuulemaan, Dhruvin kokemus tekoälytutkimuksesta, -kehityksestä, -koulutuksesta ja johtamisesta ulottuu yli 20 vuoden ajalle. Kuten voitte kuvitella, hänellä on teknologiasta enemmän kiehtovia näkemyksiä kuin voisimme käsitellä yhdessä jaksossa. Kun kysyin Dhruvilta, mitä hän haluaisi erityisesti viestiä tuotejohtajille, hän vastasi epäröimättä. Hänen mukaansa tekoälyn kyvykkyydet ovat erittäin rosoisia. Seuraavaksi kuulette, mitä tämä tarkoittaa käyttäjillenne, organisaatiollenne ja tuotteen lähitulevaisuudelle. Aloitetaan.
Ai niin, keskustelemme tällaisista aiheista joka viikko, joten jos tämä kuulostaa kiinnostavalta, mikset tilaisi podcastia? Hyvä, aloitetaan.
Tervetuloa takaisin The Product Manager -podcastiin. Tänään vieraana on Dhruv Batra, joka on Yutorin toinen perustaja ja päätiedemies.
Dhruv, kiitos paljon, että liityit seuraamme tänään.
Dhruv Batra: Totta kai. Kiitos kutsusta, Hannah.
Hannah Clark: Aloitetaan hieman taustatiedoista. Voisitko kertoa taustastasi ja siitä, miten matkasi tekoälytutkimuksen parissa syväoppimisesta tämän päivän generatiiviseen vallankumoukseen on muovannut näkemystäsi siitä, missä tällä hetkellä olemme tämän teknologian kanssa?
Dhruv Batra: Olen tekoälytutkija. Olen työskennellyt alalla tähän mennessä lähes 20 vuotta. Nykyisessä keskustelussa tekoälytutkimuksen ajatellaan usein alkaneen vuoden 2022 ChatGPT-vallankumouksesta. Liityin alalle vuonna 2005, ennen syväoppimisen edellistä aikakautta. Suoritin tohtorintutkintoni CMU:ssa ja työskentelin koneoppimisen perusongelmien parissa soveltaen niitä konenäön ongelmiin, kuten kohteiden tunnistamiseen kuvista.
Vuosien varrella olen rakentanut keskustelubotteja sekä ensimmäisiä järjestelmiä, jotka pystyivät vastaamaan kuvia koskeviin kysymyksiin ja käymään kuvista keskustelua. Olin useita vuosia professori Georgia Techissä. Perustin syväoppimisen kurssin. Työskentelin myös kahdeksan vuotta Metalla. Olin siellä vanhempi johtaja ja johdin FAIR Embodied AI -yksikköä. FAIR on Metan perustavanlaatuisen tekoälytutkimuksen osasto.
Ruumiillistunut tekoäly tarkoittaa robotiikan ja älylasien tekoälyä. Yksi Metan tiimeistäni rakensi varhaisimman version kuvakysymyksiin vastaavasta mallista, joka toimitettiin monimuotoisena avustajana Ray-Ban Meta -aurinkolasien ensimmäiseen versioon. Muut tiimini rakensivat maailman nopeimman 3D-simulaattorin virtuaalirobottien kouluttamiseen simulaatiossa ennen niiden käyttöönottoa Boston Dynamicsin roboteissa.
Olen siis nähnyt kirjon konenäöstä keskustelubotteihin ja robotiikkaan. Olen yksinkertaisesti kiehtoutunut älykkyydestä ja älykkäiden järjestelmien rakentamisesta, ja se on johtanut minut nykyiseen tehtävääni Yutorilla.
Hannah Clark: Olet selvästi erittäin pätevä puhumaan tästä aiheesta, ja uskon, että me kaikki haluamme tietää siitä mahdollisimman paljon. Olen todella innoissani tämän päivän aiheesta, sillä tarkastelemme lähemmin odotusten ja todellisuuden välistä eroa tekoälyteknologian nykytilassa. Tähän aiheeseen perehtyminen vaatii mielestäni tietynlaista asiantuntemusta, jotta näihin mielessämme oleviin kysymyksiin voi vastata.
Tarkastelemme aihetta kolmesta näkökulmasta: käyttäjän, liiketoiminnan ja teknologian näkökulmasta. Aloitetaan käyttäjistä. Tekoälyn ympärillä on tällä hetkellä valtava hype, mutta käyttäjät voivat usein saada hyvinkin epäjohdonmukaisia tuloksia käyttämistään työkaluista ja käyttötapauksista riippuen.
Mikä mielestäsi aiheuttaa tällä hetkellä kuilun sen välillä, mitä käyttäjät odottavat tekoälyn tekevän ja mitä se todellisuudessa pystyy toimittamaan?
Dhruv Batra: Se on erinomainen kysymys. Se liittyy ongelmaan, joka on paitsi tuotteiden rakentamisen myös tekoälytutkimuksen ytimessä. Kyse on siitä, mitä kutsutaan älykkyyden rosoiseksi luonteeksi.
Näistä aiheista on olemassa kuuluisa XKCD-sarjakuva, jossa tuotepäällikköä muistuttava hahmo pyytää insinööriä muistuttavaa hahmoa rakentamaan sovelluksen. Hän sanoo: ”Voisitko rakentaa sovelluksen, joka kertoo aina kuvan ottamisen jälkeen, onko kuva otettu kansallispuistossa?” Insinööri vastaa, että se kuulostaa yksinkertaiselta GPS-pohjaiselta tietokantahaulta.
”Anna minulle muutama tunti, tämän pitäisi onnistua.” Sitten tuotepäällikkö sanoo: ”Kerro myös, jos kuvassa on lintu.” Insinööri vastaa: ”Tarvitsen tutkimusryhmän, 50 miljoonaa dollaria ja viisi vuotta, ja ehkä pystymme vastaamaan siihen kysymykseen.” Tämän tarinan konkreettinen esimerkki ei enää päde.
Konenäkö on kehittynyt niin paljon, että lintulajien tai koirien tunnistamista voidaan nykyään pitää ratkaistuna ongelmana. Mielestäni sarjakuvan tarkoitus on kuitenkin osoittaa, että triviaaleista ongelmista mahdottoman vaikeisiin ongelmiin on erittäin jyrkkiä siirtymiä. Ihmisten on vaikea käsitteellistää ja ennakoida tätä jyrkkyyttä.
Tämä koskee teknologioiden käyttäjien lisäksi myös teknologioiden ja tuotteiden rakentajia sekä tekoälytutkijoita. Tutkijoille muodostuu erilaisia mentaalisia malleja siitä, mitä koneet voivat ja eivät voi tehdä, kun he viettävät aikaa tämän teknologian rakentamisen parissa.
Nykymaailmassa vitsailemme esimerkiksi siitä, kuinka olemme rakentaneet keskustelubotteja, jotka pystyvät vastaamaan kansainvälisiin matematiikan olympiaditason kysymyksiin, mutta tekevät samanaikaisesti virheitä, kuten väittävät luvun 9,11 olevan suurempi kuin 9,9 – virhettä, jota yksikään ihminen ei tekisi. Tällaisia virheitä keskustelubotit kuitenkin tekevät.
Kun puhun ihmiselle, hän kertoo minulle käyneensä lukion, korkeakoulun tai yliopiston tai suorittaneensa tohtorintutkinnon. Odotan heiltä erilaisia asioita heidän asiantuntemuksensa mukaan. Jos joku kertoo olevansa kemian tohtori, en odota hänen tekevän virhettä, jossa hän väittää luvun 9,11 olevan suurempi kuin 9,9.
Odotan hänen olevan matemaattisesti lukutaitoinen ja yleisesti maailman tapahtumista perillä. Nämä odotukset eivät toimi tekoälyjärjestelmien kohdalla, koska emme voi luottaa samoihin jaettuihin oletuksiin. Tiettyjen tehtävien suorittaminen edellyttää kyseisiin tehtäviin kouluttamista.
Vaikka olemme viime vuosina rakentaneet yleiskäyttöisiä järjestelmiä, yleiskäyttöisyydellä tarkoitetaan hyvin erityistä asiaa. Tämä vaikeuttaa kuluttajien mentaalisten mallien muodostamista. Tästä syntyy turhauttava kokemus: käyttäjä saapuu tuotteeseen, jonka verkkosivustolla luvataan sen pystyvän moniin asioihin. Hän pyytää sitä tekemään jonkin sivustolla mainitun asian, ja ehkä se onnistuukin. Kun hän pyytää hieman muunneltua versiota samasta asiasta, järjestelmä ei enää pystykään siihen.
Hannah Clark: Aivan. Tämä on myös täysin uudenlaista kuluttajakäyttäytymistä. Olemme tottuneet ominaisuuksiin, jotka ovat hyvin tarkasti määriteltyjä, intuitiivisia ja helppokäyttöisiä. Ihmiset siis soveltavat aiempaa kokemustaan keskustelun käymisestä toisen ihmisen tai keskustelubotin kanssa ominaisuuteen, joka on suurelta osin määrittelemätön.
Emme vielä täysin ymmärrä eri osaamisalueiden rajoituksia. Kyseessä on hyvin monimutkainen teknologia, jonka käyttöä opettelemme kaikki yhdessä. Kun ajattelemme arkisia tehtäviä, joita tekoäly voisi automatisoida, kuten matkojen varaamista tai aikataulujen hallintaa, miksi tällaisten tehtävien ratkaiseminen on vaikeampaa kuin ihmiset olettavat?
Dhruv Batra: Käytän esimerkkinä Yutoria ja sitä, mitä rakennamme. Yutorilla kehitämme henkilökohtaisia avustajia, jotka voivat automatisoida verkossa tehtäviä arkisia työnkulkuja. Ensimmäinen tuotteemme on nimeltään Scouts. Se on joukko agentteja, jotka seuraavat puolestasi mitä tahansa verkossa. Meille oli erittäin tärkeää ilmaista selkeästi, että tuote seuraa tiettyä tietoa.
Siltä ei voi pyytää varaamaan tai ostamaan mitään. Se ei luo dioja, tee läksyjä eikä kirjoita koodia puolestasi. Se ei pysty kaikkeen, mitä selaimella voi tehdä. Se voi kuitenkin ilmoittaa kuluttajalle, kun tämän suosikkiartisti saapuu kaupunkiin.
Artisti voi ilmoittaa asiasta useilla eri verkkosivustoilla, joita käyttäjä muuten joutuisi tarkistamaan säännöllisesti. Käyttäjä voi pyytää agenttia tarkistamaan nämä sivustot tietyin väliajoin. Jos hän etsii varausta, joka edellyttää kevyen lomakkeen täyttämistä ja painikkeiden napsauttamista, agentti voi tehdä sen hänen puolestaan ja ilmoittaa, mitä tietoa löytyi.
Jos olen rekrytoija ja seuraan tiettyjen ihmisten muuttuvia työtehtäviä, voin pyytää ilmoittamaan, jos he kertovat muutoksesta X:ssä, LinkedInissä tai blogikirjoituksessaan.
Miksi tämä on vaikeaa? Ihmisille se vaikuttaa yksinkertaiselta: he avaavat selaimen, siirtyvät tietylle sivulle ja täyttävät tietyt tiedot. Pohjimmiltaan kyse on peräkkäisten päätösten tekemisestä. Olet tietyssä tilassa, esimerkiksi verkkosivulla, ja sinun on tehtävä useita toimia. Verkkosivustot on suunniteltu ihmisten käyttöön, ja HTML-koodin lukeminen on hyvin epäjohdonmukaista, koska painikkeet on eri sivustoilla merkitty eri tavoin.
Kyse on siis pohjimmiltaan havainto-ongelmasta. Sinun on napsautettava painiketta, minkä jälkeen tapahtuu jotakin. Ehkä vierität sivua ja täytät kentän, minkä jälkeen tapahtuu jotakin muuta. Jokainen matkan aikana tehty virhe kertautuu, ja aiemmat virheet johtavat myöhempiin epäonnistumisiin.
Tämä muistuttaa robotiikan ja itseohjautuvien ajoneuvojen teollisuuden kohtaamaa ongelmaa. Jos robotti tekee virheen, virheet kertautuvat. Jos poikkeat hieman kaistalta, et enää ole kaistan keskellä ja tarvitset korjausliikkeen.
Samoin rakennettavat selainautomaatioagentit voivat päätyä verkkosivun osaan, joka on jumittunut tai jossa niiden ei pitäisi olla. Tällöin ne eivät löydä oikeaa vastausta. Luonnossa toimittaessa agentin on opittava virheistä palautumista. Lisäksi on olemassa vain luku -tehtäviä ja kirjoitustehtäviä.
Jos täytät lomakkeen ja napsautat lähetyspainiketta, jotkin verkkosivustot eivät anna sinun palata täyttämään lomaketta uudelleen. Kyseessä on peruuttamaton virhe. Peruuttamattomiin virheisiin kouluttaminen on vaikeaa, joten todellisesta maailmasta on luotava jäljennöksiä. Robotiikan tutkijat ratkaisevat tätä rakentamalla maailmasta 3D-simulaattoreita, kouluttamalla virtuaalirobotteja simulaatiossa ja ottamalla ne sen jälkeen käyttöön todellisessa maailmassa.
Teemme samaa selainautomaatioagenteilla. Kun niiden on opittava täyttämään lomake, napsauttamaan lähetyspainiketta tai ostamaan jotain verkosta, virheet voivat olla peruuttamattomia. Siksi niitä on koulutettava simulaatiossa. Usein on myös vaikea tietää, mikä agentin matkan aikana tekemä asia vaikutti onnistumiseen tai epäonnistumiseen. Tätä kutsutaan ansion kohdistamisen ongelmaksi.
Hannah Clark: Ihmisinä olemme tässä vaiheessa hyvin harjaantuneita tekemään monia näistä toimenpiteistä. Tehtävä näyttää yksinkertaiselta, mutta teknisesti tarkasteltuna se on paljon monimutkaisempi. Tähän eivät edes sisälly mieltymykset: mihin aikaan haluat varauksen ja missä kohtaa ravintolaa haluat istua – baarissa vai muualla?
Dhruv Batra: Annan pienen esimerkin. Ihmiset tuntevat tietyt suunnittelumallit. Kun yrität varata pöytää tai aikaa verkkosivulla, päivämäärä tai kellonaika voi olla harmaana tai yliviivattu. Ymmärrät heti, ettei se ole saatavilla, vaikka sen yläpuolella tai vieressä ei lukisi sitä erikseen.
Ymmärrät tämän, koska olet nähnyt saman suunnittelumallin monilla verkkosivustoilla. Koneen on kuitenkin opittava, että harmaa teksti tarkoittaa jotakin, vaikka se olisi lukenut paljon kirjoja. Sen on oltava vuorovaikutuksessa verkkosivustojen kanssa.
Tämä on vain yksi esimerkki ihmisiä varten suunnitelluista malleista, jotka koneiden on omaksuttava. Painikkeen napsauttaminen ei välttämättä tee mitään, eikä sen tarkoitusta ole kuvattu tekstillä. Sinun vain täytyy tietää, mitä se tarkoittaa.
Hannah Clark: Tämä on erittäin kiinnostavaa. Se muistuttaa minua keskustelusta, jonka kävin aikoinaan Cord-yhtiön perustajan Nimrod Priellin kanssa. Puhuimme käyttäjäkäyttäytymisen kehittymisestä ja siitä, kuinka pienet muutokset siinä, miten ymmärrämme käyttöliittymäelementtejä sekä verkkosivustojen ja teknologian yleistä rakennetta ja suunnittelua, muodostavat kumuloituvan voimavaran, jota pidämme itsestäänselvyytenä.
Kyse on nykyään eräänlaisesta jaetusta kielestä, joka on syntynyt teknologian kehityksen aikana. Koneelle sitä on hyvin vaikea välittää. Haluaisin tarkastella hieman syvemmin myös kuluttajakäyttäytymistä. Mitä muutoksia siinä, miten ihmiset ovat vuorovaikutuksessa teknologian kanssa, tuotejohtajien pitäisi ennakoida lähitulevaisuudessa?
Dhruv Batra: Tekoälytuotteiden ilmestyminen kuluttajamarkkinoille on muuttanut ihmisten odotuksia. Nyt kasvaa lapsia, jotka odottavat voivansa puhua koneille.
Teknologisesti kehittyneisiin yhteiskuntiin sijoittuvissa tulevaisuusdraamoissa tai tieteistarinoissa lapset ihmettelevät usein, miksi vanhempi teknologia ei ymmärrä heitä. Miksi en voi puhua televisiolleni? Näemme saman odotusten muutoksen myös kuluttajakäyttäytymisessä. Ihmiset haluavat ilmaista itseään ja puhua koneelle.
Koneella pitäisi olla tiettyjä yleiskäyttöisiä kyvykkyyksiä. Sen pitäisi pystyä käymään johdonmukaista keskustelua ja ymmärtää käyttötapojani. Tämä motivoi myös työtämme ja visiotamme Yutorilla.
Näemme verkon viimeisten 30 vuoden kehityksen asteittaisina parannuksina ydinteknologiaan, joka yhdistää sisällön ja palvelut ihmisiin. Verkko on ensisijaisesti suunniteltu ihmisten käyttöön, koska ihmiset ovat tähän asti käyttäneet sitä silmillään. Nyt ihmiset odottavat voivansa kertoa koneelle, mitä he haluavat sen tekevän tietokoneella ja selaimessa.
Miksi minun pitäisi ihmisenä istua alas, napsauttaa painikkeita ja täyttää nimeni, osoitteeni ja luottokorttitietoni ostaakseni jotain tai hankkiakseni tietoa? Tämän pitäisi olla automatisoitavissa. Kuluttajien odotukset siirtyvät abstraktiotasolla ylöspäin: ihmiset puhuvat ohjelmistoille ja odottavat niiden automatisoivan arkensa tylsiä osia.
Tekoälystä tulee lähes tehtävälista supervoimilla. Mukaan tulee myös ennakoivuus. Emme halua selittää joka kerta, kuka olemme ja mitkä mieltymyksemme ovat. Kun järjestelmä ymmärtää muistia ja personointia, miksei se voisi toimia ennakoivasti? Jokainen saa ikään kuin avustajan, supertehokkaan työntekijän tai esikuntapäällikön.
Hannah Clark: Näkee, kuinka päivittäin käyttämämme teknologiat vahvistavat tätä kehitystä. Ajatellaan TikTokin Sinulle-sivua ja teknologiaa, joka oppii mieltymyksemme sekä sen, minkä kanssa todennäköisesti olemme vuorovaikutuksessa. Sovellamme samaa logiikkaa nykyiseen teknologiaan: tiedämme, että se tietää meistä ja mieltymyksistämme paljon.
Tämä johdattaa hyvin liiketoiminnan puolelle. Monet yritykset kiirehtivät markkinoille tekoälytuotteiden ja -ominaisuuksien kanssa ja lupaavat nopeasti mullistavia kyvykkyyksiä vaihtelevin tuloksin. Mitä suurimpia virheitä näet tuotetiimien tekevän tekoälyominaisuuksien määrittelyssä ja asemoinnissa?
Dhruv Batra: Tämä palautuu jälleen älykkyyden rosoiseen luonteeseen. On oltava erittäin varovainen. Tämä koskee kuluttajien lisäksi myös rakentajia. Taivasta ei saa luvata, koska sitä ei pysty toimittamaan ensimmäisenä päivänä. Samalla kuluttajien odotukset yleiskäyttöisyydestä kasvavat.
He ajattelevat, että jos ChatGPT vastaa mihin tahansa kysymykseen, myös sinun tuotteesi pitäisi pystyä tekemään mitä tahansa. Tästä syntyy ansa: tekstikentästä tehdään sisäänkäynti kaikkeen, eikä käyttäjälle kerrota mitään. Luvataan, että agentti pystyy kaikkeen.
Tämä turhauttaa käyttäjiä, koska he kohtaavat tyhjän kanvaasin. Mitä täällä voi kysyä? Jos odotuksia ei ole kalibroitu, käyttäjä pyytää asioita, joihin agentti ei pysty, ja turhautuu.
Siksi rajasimme ensimmäisen tuotteemme kyvykkyyden melko tarkasti. Scouts-agentit seuraavat puolestasi mitä tahansa verkossa. Ne eivät kirjaudu palveluihin eivätkä tee niissä muutoksia. Kyseessä on vain luku -muotoinen seurantatuote. Emme kuitenkaan sanoneet, että kyseessä on Amazon-hintaseuranta tai Ticketmaster-tapahtumaseuranta.
Kaikki verkossa saatavilla oleva digitaalinen tieto, jonka käyttäjä voisi saada selaimella auki, on agenttien seurattavissa. Ne lähettävät sähköpostin, kun pyydetty muutos tapahtuu. Käyttäjä kertoo luonnollisella kielellä, mitä seurataan ja kuinka usein.
Tämä oli meille tärkeää, koska kyseessä on vain luku -ominaisuus. Emme tee peruuttamattomia virheitä. Jos tekisimme ostoksen käyttäjän puolesta väärin, hän turhautuisi. Tässä on silti tiettyä yleiskäyttöisyyttä siinä, millaisia kyselyitä voi tehdä ja missä tietoa voi odottaa näkevänsä.
Sen jälkeen on edettävä luottamuksen portaikkoa. Aluksi toimitimme arvoa pyytämättä kirjautumistietoja tai luottokorttitietoja. Kun käyttäjä on nähnyt arvon, hän luonnollisesti odottaa enemmän. Jos seuraan kaupunkiin saapuvaa artistia, seuraava vaihe on lipun hankkiminen. Jos seuraan ravintolavarauksen saatavuutta, seuraava vaihe on varauksen tekeminen. Jos olen rekrytoija ja seuraan tietyn ehdokkaan liikkeitä, seuraava vaihe on yhteydenottosähköpostin luonnostelu.
Rakentajan näkökulmasta voin vain korostaa varovaisuutta: älykkyys on rosoista. Jotkin tehtävät pystyt ratkaisemaan ja joitakin et. Yleensä pystyt ratkaisemaan tehtäviä, joita voit harjoitella ja joissa virheet eivät ole liian kalliita. Siitä on rakennettava kyvykkyyksiä asteittain.
Hannah Clark: Tämä on viisasta. Ymmärrän, mitä tarkoitat käyttäjien turhauttamisella, kun rajoitukset ovat heidän näkökulmastaan epäselviä. He siirtyvät keskustelubottiin ja alkavat luonnostaan keskustella sen kanssa kuten elävän asiakaspalvelijan kanssa.
Dhruv Batra: Jos käyttäjät eivät löydä arvoa siitä, mitä lupasit tuotteen tekevän, heidän kokemuksensa jäävät heikoiksi ja he poistuvat. He eivät palaa.
Hannah Clark: Miten tuotejohtajien pitäisi rakentaa luottamusta kuluttajiin lupaamatta vielä valmiita tai toimitettavissa olevia kyvykkyyksiä?
Dhruv Batra: Ihmisten on nähtävä arvo ennen kuin he luovuttavat tunnistetietoja tai arkaluonteisia tietoja, kuten luottokorttitietoja. Jos pyydät kuluttajalta heti ensimmäiseksi pääsyn kalenteriin, sähköpostiin ja muihin kirjautumista vaativiin palveluihin ennen kuin hän on nähnyt, mihin tuote pystyy, kyseessä on erittäin riskialtis strategia.
Aloitimme siis ilman tunnistautumista, kirjoittamista tai maailman tilan muuttamista. Tuote vain lukee tietoa. Tällöin käyttäjä voi yrittää uudelleen, jos tekoäly tekee virheen. Vain luku -tuotteessa uudelleen yrittäminen on mahdollista, mutta kirjoittavassa tuotteessa peruuttamattomien virheiden jälkeen ei.
Hannah Clark: Tämä muistuttaa minua ystävästäni, joka muutti Brasiliasta Kanadaan. Hän ajatteli Kanadan olevan maailman turvallisin maa. Sitten hänen ensimmäisellä viikollaan hänen kadullaan tapahtui ryöstö, ja yhtäkkiä hän ajatteli, ettei missään ollut turvallista.
Dhruv Batra: Arvon saavuttamiseen kuluva aika.
Hannah Clark: Ilahduttamiseen kuluva aika ja arvon saavuttamiseen kuluva aika, mutta myös se, kuinka hauras alkuvaiheen luottamuksen rakentaminen voi olla, kun jokin rikkoo odotukset ja horjuttaa perustavaa luottamusta.
Siirrytään teknologian puolelle. Mitkä ongelmat ovat mielestäsi nykyään pitkälti ratkaistu? Mitkä ovat lähitulevaisuuden horisontissa ja mitkä tuntuvat pysyvän jatkuvasti muutaman vuoden päässä?
Dhruv Batra: Konkreettinen esimerkki on kuvista esitettyihin kysymyksiin vastaaminen. Olin viime viikolla ICCV-konferenssissa, eli kansainvälisessä konenäön konferenssissa. Saimme yhteistyökumppaneideni kanssa Mark Everingham -palkinnon työstä, jonka teimme vuosikymmen sitten.
Työmme nimi oli Visual Question Answering. Esittelimme yhteisölle aineiston, tehtävän, vertailukohdan ja menetelmiä ensimmäisen sukupolven agenttien rakentamiseen. Agentit pystyivät vastaamaan avoimiin kysymyksiin luonnollisista kuvista.
Kymmenen vuoden ajan seurasimme alan kehitystä järjestämällä vuosittaisia kilpailuja. Lopetimme kilpailun vuonna 2021, koska tuolloin saavutasimme luomassamme aineistossa ihmisen tason tarkkuuden.
Nykyään kuvista kysyttyihin kysymyksiin vastaaminen on siinä määrin ratkaistu ongelma kuin voimme mitata. Silti esimerkiksi esineiden laskeminen kuvista on edelleen avoin ongelma. Ota kuva, jossa on yli kymmenen ihmistä, lataa se suosikkikeskustelubottiisi ja kysy, kuinka monta henkilöä kuvassa on. Katso, millaisen vastauksen saat.
Myös 3D-tilan ymmärtäminen on avoin ongelma. Jos pöytä on kuvan takaosassa ja kirjahylly lähempänä kameraa, kysy niiden korkeutta. Keskustelubotit saattavat vastata pikselikorkeuksien perusteella ja väittää lähempänä olevan kohteen olevan korkeampi, koska ne eivät ymmärrä syvyyttä kolmiulotteisessa maailmassa.
Selainagenttien kohdalla on edelleen myös ajautumisen ongelma. Jos agentti seuraa uutisaihetta kuukausien ajan, se voi vähitellen alkaa seurata jotakin, joka poikkeaa alkuperäisestä pyynnöstä. Agenttien kouluttaminen kuukausia kestäviin tehtäviin sekä niiden palkitseminen pitkän aikavälin onnistumisista ja epäonnistumisista on edelleen vaikeaa.
Hannah Clark: Miten palautesilmukka suljetaan? Onko käyttäjien omaksuttava tiettyä käyttäytymistä, jotta nykyisin käyttämiämme malleja voidaan kouluttaa paremmin?
Dhruv Batra: Teemme sisäisesti arviointeja ja keräämme palautetta useilla abstraktiotasoilla. Selainautomaatioagenttien kohdalla voimme merkitä manuaalisesti esimerkiksi jokaisen napsautuksen: oliko se oikea toimenpide kyseisellä verkkosivulla vai ei? Se on kuitenkin liian matalan tason ja meluisa arviointitapa, sillä tehtävän voi usein suorittaa monella tavalla.
Kun tehtävä on valmis, sen lopputuloksena on usein työn todiste. Kuulostaa helpommalta todentaa, että agentti löysi ravintolasta kello 18.30 olevan varauksen, kuin ratkaista koko tehtävä napsauttamalla painikkeita, kirjoittamalla oikeat tiedot hakukenttiin ja navigoimalla oikealle verkkosivulle.
Rakennamme arvioinnit tämän perusteella. Lisäksi kuluttajille on palautemekanismeja. Kun agenttimme lähettävät sähköpostia, käyttäjä voi antaa peukku ylös- tai alaspäin.
Tämä liittyy personointiin. Kaikki vastaukset eivät ole oikeita tai vääriä; joskus kyse on mieltymyksistä. Jos seuraat uutisaihetta ja olet kyllästynyt tiettyyn näkökulmaan, haluat ehkä nähdä vähemmän sitä ja enemmän jotakin muuta. Ihannetapauksessa voit kertoa tämän luonnollisella kielellä. Siksi palautemekanismien on ymmärrettävä luonnollista kieltä ja muutettava agentin tulevaa toimintaa.
Hannah Clark: Käyttäjät tarkastelevat ChatGPT:n kaltaisten palvelujen tuotoksia usein sen perusteella, ovatko he tyytyväisiä palveluun, eivät niinkään teknologiaan. Jos esimerkiksi minä ja kollegani tuotamme viikon ateriasuunnitelmat, tuotoksemme voivat olla samat, mutta minä voin antaa peukun alas, koska suunnitelmassa ei ole oikeita makroravinteita. Kollegani taas antaa peukun ylös, koska järjestelmä teki täsmälleen sen, mitä hän pyysi.
Tässä on hienovarainen ero siinä, miten ymmärrämme oman roolimme palautteen antajina.
Dhruv Batra: Perinteiset A/B-testauksen käsitykset eivät aina toimi. Jos työnkulku pitää suorittaa tai jotakin ostaa, et voi tehdä samaa asiaa kahdesti. Lisäksi peukku ylös tai alas on usein liian karkea tapa ilmaista, mitä käyttäjä tarkoittaa.
Jos lähetät tekstivastauksia, käyttäjän pitäisi voida korostaa jotakin ja sanoa ”ei tätä” tai antaa toimituksellisempaa palautetta, kuten toiselle ihmiselle. Google-dokumentista ei anneta vain peukkua ylös tai alas.
Hannah Clark: Se olisi kamalaa. Peukku alas – mikä osa siitä sai peukun alas?
Dhruv Batra: Aivan. Se olisi kuin toimittaja sanoisi vain: ”Ei. Korjaa.” Mitä pitäisi korjata?
Hannah Clark: Koko työ uudelleen. Tällaisen palautteen pyytäminen on käyttäjältä paljon, jos hän vain haluaa tuotteen toimivan. Ihmisiä on vaikea saada vastaamaan edes kyselyihin, vaikka heille tarjottaisiin etukoodi tai muu kannustin.
Dhruv Batra: Palautteen on tuntuttava investoinnilta keskustelubotin personointiin käyttäjän tarpeisiin. Käyttäjä ei voi olla laadunvarmistusinsinöörisi eikä kertoa kaikkea, mikä tuotteessa on vialla. Hänen pitäisi kokea, että kyseessä on hänen oma avustajansa ja että palaute tekee siitä paremman sekä sovittaa sen hänen mieltymyksiinsä.
Hannah Clark: Olen itse kärsivällisempi mallia kohtaan, jos se yrittää aktiivisesti oppia mieltymykseni. Kun kielimalli esittää heti tarkentavia kysymyksiä, se vahvistaa käsitystä siitä, että minun on oltava paljon täsmällisempi saadakseni haluamani tuotoksen.
Dhruv Batra: Tässä palaamme jälleen luottamuksen portaikkoon. Jos käyttäjän ensimmäinen kokemus tuotteesta on 20 kysymyksen kyselylomake, hän ei pääse nopeasti näkemään, mihin tuote pystyy. Ensin on annettava käyttäjälle arvoa, minkä jälkeen kysymyksiä ja mieltymyksiä voidaan lisätä.
Hannah Clark: Miksi juuri nyt? Miksi perustit Yutorin nyt, ja mikä nykyisessä toimintaympäristössä tekee tämän mahdolliseksi, vaikka olet ollut alalla pitkään?
Dhruv Batra: Tämä on ainutlaatuinen hetki tietynlaisten tekoälytuotteiden rakentamiseen. En usko, että nyt on oikea aika perustaa kuluttajille suunnattua tai rakenteistamatonta robotiikkayritystä, koska ratkaistavat ongelmat ovat edelleen vuosikymmenten päässä.
Ohjelmiston ja tekoälyn kehityssyklit ovat paljon lyhyempiä kuin laitteiston ja tekoälyn. Olemme vihdoin tilanteessa, jossa tekoälyjärjestelmät voivat keskustella ihmisten kanssa, niillä on laaja ymmärrys maailmasta ja ne pystyvät ylläpitämään keskustelua.
Havaintojärjestelmät ovat kehittyneet ainakin verkossa. Voimme ottaa verkkosivusta kuvakaappauksen ja ymmärtää, miten sivu on rakennettu ja mitä painikkeet tekevät. Lisäksi avoimen lähdekoodin malleja on julkaistu viime vuosina, mikä mahdollistaa pienempien toimijoiden aloittamisen.
Aiemmin selainautomaatio- tai selainagenttiyrityksen olisi pitänyt aloittaa kieli- ja näkö-kielimallien esikoulutuksesta. Nykyään aloitamme avoimen lähdekoodin malleista ja jälkikoulutamme niitä selainautomaatioon: painikkeiden napsauttamiseen, lomakkeiden täyttämiseen ja muuhun vastaavaan.
On mahdotonta, että robotit saapuvat koteihimme ennen kuin digitaaliset avustajat saapuvat tietokoneillemme. Digitaaliset avustajat tulevat ensin, koska digitaalinen maailma liikkuu nopeammin. Kehityssyklit ovat nopeampia ja suuri osa älykkäiden järjestelmien rakentamisen perustasta on muuttunut hyödykkeeksi. Siksi voimme keskittyä viimeisen vaiheen ongelmiin.
Hannah Clark: Tämä on ollut erittäin kiehtova keskustelu. Voisimme jatkaa paljon syvemmälle. Mistä ihmiset voivat seurata työtäsi verkossa?
Dhruv Batra: Olen henkilökohtaisesti tavoitettavissa osoitteessa dhruvbatra.com. Työni löytyy osoitteesta yutori.com, ja tuotteemme nimi on Scouts. Se on saatavilla osoitteessa scouts.yutori.com.
Hannah Clark: Hienoa. Kiitos paljon, että liityit seuraani, Dhruv.
Dhruv Batra: Kiitos kutsusta. Tämä oli hienoa.
Hannah Clark: Seuraavaksi The Product Manager -podcastissa: Tuotejohtaminen tekoälyn aikakaudella tarkoittaa monien tuttujen ongelmien ratkaisemista täysin eri tavoin. Kehitysprosesseista jakelutaktiikoihin lähes jokainen vuosi sitten toiminut toimintamalli on jo vanhentunut – minkä Webflow’n tuotepäällikkö Rachel Wolan näkee sekä haasteena että uskomattomana mahdollisuutena.
Saat vastaukset ja kaipaamasi selkeyden aiheista, kuten vastauskoneoptimoinnista, itse rakentamisen ja ostamisen vertailusta sekä oikeasta tavasta astua tekoälymarkkinoille. Tilaa nyt, jotta et jää jaksosta paitsi.




