AI kan lösa matematikproblem på olympiadnivå … och ändå misslyckas med grundläggande aritmetik. Så vad beror det på? Enligt Dhruv Batra ligger svaret i intelligensens ”taggighet” – hur AI kan vara enastående inom vissa områden samtidigt som den fullständigt bryter samman inom andra. Dhruv, medgrundare och chefsforskare på Yutori, ansluter sig till Hannah Clark för att reda ut den kognitiva dissonans som användare känner när en modell imponerar ena stunden och gör dem besvikna i nästa.
De utforskar hur användarnas förväntningar – formade av årtionden av intuitiva gränssnittsmönster och mänskliga samtal – ofta krockar med AI-systemens underliggande begränsningar. Från webbläsarbaserade agenter och automatisering till långsiktiga återkopplingsloopar och förtroendeskapande ger det här samtalet en ärlig bild av vad dagens AI faktiskt kan göra (och var den fortfarande bluffar). Om du bygger med AI eller försöker avgöra vad som är möjligt kommer det här avsnittet att kalibrera om dina förväntningar – på ett bra sätt.
Det här får du lära dig
- Varför AI-förmågor är taggiga – och varför det är viktigare än någonsin
- Hur användarnas förväntningar formas av åratal av interaktion med ”gammal” teknik
- Varför förtroende, avgränsning och användarfeedback är avgörande i AI-produktdesign
- Vilka typer av uppgifter AI kan hantera på ett tillförlitligt sätt nu – och vad som fortfarande ligger långt bort
- Hur du avgränsar AI-funktioner utan att fastna i fällan med att den ska ”göra vad som helst”
Viktigaste insikterna
- Taggig intelligens är verklig: AI kan vara briljant på vissa uppgifter och obegripligt dålig på andra. Att avgränsa din produkt innebär att förstå – och tydligt kommunicera – var den taggiga gränsen går.
- Bygg förtroende stegvis: Be om mindre från början. Leverera ett avgränsat värde först. Ta sedan trappan av förtroende i takt med att användarna ser resultaten.
- Designa för felåterställning: Alla misstag går inte att återhämta sig från – särskilt inte vid automatisering. Börja med skrivskyddade uppgifter innan du försöker ”skriva” till omvärlden.
- Se upp för textrutefällan: Att ge användarna en tom prompt och säga ”Fråga mig vad som helst” låter häftigt. Det är också en säker väg till frustration om modellen inte kan leverera.
- Feedback är inte kvalitetssäkring: Förvänta dig inte att användarna ska felsöka ditt system. Men skapa sätt för dem att forma och anpassa det.
Kapitel
- [00:00] Användare som träningsdata
- [01:27] Dhruvs AI-resa
- [03:08] Taggig intelligens förklarad
- [08:14] Varför ”enkla” uppgifter får AI att fallera
- [14:15] Förändrat användarbeteende
- [17:59] Vanliga produktmisstag
- [24:21] Vad AI kan (och inte kan) göra
- [29:07] Feedback, förtroende och anpassning
- [36:07] Varför tiden är inne för Yutori
Möt vår gäst

Dhruv Batra är medgrundare och chefsforskare på Yutori och tar med sig djup expertis från sina tidigare roller som senior chef för förkroppsligad AI på Metas FAIR-labb och som biträdande professor vid Georgia Tech. Hans forskning utforskar den artificiella intelligensens frontlinjer – från maskininlärning, datorseende, robotik och språk – och nu leder han Yutoris uppdrag att bygga nästa generations AI-agenter som självständigt kan förstå, agera och navigera i komplexa miljöer.
Resurser från det här avsnittet:
- Prenumerera på nyhetsbrevet från The CPO Club
- Kontakta Dhruv på LinkedIn
- Besök Dhruvs webbplats och Yutori
Relaterade artiklar och poddar:
Hannah Clark: Innovation är kumulativ – och med det menar jag att de sätt vi löser problem på nu inte skulle kunna vara effektiva om det inte vore för de sätt vi löste dem på tidigare. Och även om orden ”träningsdata” numera vanligtvis används i samband med AI-utveckling, är det värt att komma ihåg att användare också är konsumenter av och lagrar enorma mängder träningsdata från åratal av att upptäcka och ta till sig varje programvara de någonsin har använt. Så medan vi är upptagna med att överdrivet fokusera på användningsområden och nya funktioner för våra egna AI-produkter, följer användarna ett annat manus. De agerar utifrån preferenser, vanor och, framför allt, förväntningar som de har fått sedan första gången de öppnade en webbläsare.
Min gäst i dag är Dhruv Batra, medgrundare och chefsforskare på Yutori. Som du snart kommer att höra sträcker sig Dhruvs erfarenhet av AI-forskning, utveckling, träning och ledarskap över mer än 20 år. Så som du kan föreställa dig har han mer fascinerande insikter om tekniken än vad vi rimligen skulle kunna täcka i ett enda avsnitt. Med det i åtanke frågade jag Dhruv vad han helst ville förmedla till produktledare, och han tvekade inte. Han sade att AI-förmågor är extremt ojämna. Och du kommer snart att höra exakt vad det innebär för dina användare, din organisation och produktens närmaste framtid. Då sätter vi igång.
Förresten har vi sådana här samtal varje vecka, så om det här låter intressant för dig, varför inte prenumerera? Okej, då sätter vi igång.
Välkommen tillbaka till podden Produktchefen. I dag har jag med mig Dhruv Batra, som är medgrundare och chefsforskare på Yutori.
Dhruv, tack så mycket för att du ville vara med i dag.
Dhruv Batra: Självklart. Tack för att du bjöd in mig, Hannah.
Hannah Clark: Vi börjar med lite bakgrund. Kan du berätta lite om din bakgrund och hur din resa genom AI-forskningen, från djupinlärning till dagens generativa revolution, har format ditt perspektiv på var vi befinner oss med den här tekniken?
Dhruv Batra: Jag är AI-forskare och har varit verksam inom området i nästan 20 år. I dagens samtal verkar AI-forskning börja med ChatGPT-revolutionen 2022. Jag började inom området 2005, före den senaste epoken av djupinlärning. Jag tog min doktorsexamen vid CMU, där jag arbetade med grundläggande maskininlärningsproblem tillämpade på datorseende, som att upptäcka objekt i bilder.
Under årens lopp har jag byggt chattrobotar och de första systemen som kunde svara på frågor om bilder och föra en dialog om bilder. Jag var professor vid Georgia Tech i många år. Jag skapade kursen i djupinlärning. Jag tillbringade också åtta år på Meta. Jag var senior director och ledde FAIR Embodied AI. FAIR är Metas avdelning för grundläggande AI-forskning.
Embodied AI är AI för robotteknik och smarta glasögon. Ett av mina team på Meta byggde den tidigaste versionen av en modell för bildfrågor och svar som lanserades som en multimodal assistent i den första versionen av Ray-Ban Meta-solglasögonen. Andra team byggde världens snabbaste 3D-simulator för att träna virtuella robotar i simulering innan vi använde dem på roboten från Boston Dynamics.
Jag har på sätt och vis sett hela spektrumet – från datorseende och chattrobotar till robotteknik – och jag fascineras helt enkelt av intelligens och av att bygga intelligenta system. Det är det som har lett mig till Yutori.
Hannah Clark: Du är uppenbarligen mycket kvalificerad att prata om det här ämnet, vilket jag tror att vi alla vill veta så mycket som möjligt om. Jag ser verkligen fram emot dagens ämne, eftersom vi ska titta närmare på förväntningar kontra verklighet när det gäller AI-teknikens tillstånd just nu. Jag tycker att man behöver en viss uppsättning kvalifikationer för att verkligen kunna tala om det här ämnet och besvara några av de frågor som vi alla går och funderar på.
Vi ska titta på det från tre vinklar: användarsidan, företagssidan och tekniksidan av AI. Om vi börjar med användarsidan befinner vi oss uppenbarligen mitt i en enorm hypecykel kring AI, men användare kan ofta uppleva mycket inkonsekventa resultat beroende på vilka verktyg och användningsområden de arbetar med.
Vad tror du orsakar gapet mellan vad människor på användarsidan förväntar sig att AI ska kunna göra och vad den faktiskt kan leverera just nu?
Dhruv Batra: Jag tycker att det är en mycket bra fråga. Den berör ett problem som ligger i centrum för inte bara produktbyggande utan även AI-forskning, och det handlar om det som ofta kallas intelligensens ojämna natur.
Som med många av de här ämnena finns det en berömd XKCD-serie där en person som liknar en produktchef ber en person som liknar en ingenjör: ”Kan du bygga en app åt mig? Varje gång någon användare tar en bild vill jag veta om bilden är tagen i en nationalpark.” Ingenjören svarar: ”Visst, det låter som en enkel GPS-baserad sökning i en databas. Ge mig några timmar, det borde gå.” Sedan kommer nästa mening från produktchefen: ”Säg till om bilden föreställer en bräda.” Ingenjören svarar: ”Jag behöver ett forskarlag, 50 miljoner dollar och fem år, och då kanske vi kan besvara den frågan.” Det specifika exemplet i berättelsen är inte längre giltigt.
Datorseendet har gjort tillräckliga framsteg för att vi nu betraktar identifiering av fågel- eller hundarter som ett löst problem. Men jag tror att poängen är att illustrera att det finns extremt skarpa övergångar från triviala problem till omöjligt svåra problem. Den skärpan är svår för människor att föreställa sig och förutse.
Det gäller inte bara användare av teknik. Det gäller också teknikutvecklare, produktbyggare och AI-forskare. Det är egentligen inte meriterna som spelar roll, utan när man ägnar tid åt att bygga den här tekniken utvecklar olika forskare mentala modeller av vad maskiner kan och inte kan göra.
I dagens värld skämtar vi till exempel om att vi har byggt chattrobotar som kan svara på internationella matematikfrågor på avancerad nivå, samtidigt som de gör misstag som att säga att 9,11 är större än 9,9 – något ingen människa skulle göra. Men det är helt enkelt den typ av misstag som chattrobotar gör. Så var lämnar det oss?
För det första: varför händer det? Det händer av flera olika skäl. Vi bygger intelligenta system som befinner sig på en annan punkt i intelligenslandskapet, och människor närmar sig intelligenta system med sin mänskliga förståelse från umgänget med andra människor.
När jag talar med en person berättar de kanske att de har gått gymnasiet, högskolan eller universitetet, eller att de har en doktorsexamen inom olika delar av sitt expertområde. Jag förväntar mig olika saker av dem. När någon säger att de har en doktorsexamen i kemi förväntar jag mig inte att de ska göra ett misstag av typen att 9,11 är större än 9,9.
Jag förväntar mig bara att de ska kunna matematik på en grundläggande nivå, vara allmänt informerade om världen och så vidare. De förväntningarna bryter samman när vi arbetar med AI-system, eftersom vi inte kan förlita oss på samma gemensamma antaganden. Prestanda i vissa uppgifter kräver träning för just de uppgifterna.
Och även om vi har byggt system för allmänna ändamål under de senaste åren finns det en mycket specifik sak vi menar när vi säger generalitet. Det gör det mycket svårt för konsumenter att bygga mentala modeller. Därför uppstår en frustrerande upplevelse där människor kommer till en produkt.
Det står att den kan göra många saker. Du ber den göra den sak som listas på tillverkarens webbplats, och kanske gör den det. Sedan ber du den göra en liten variation av samma sak, och då kan den inte. Det kan bli en frustrerande upplevelse.
Hannah Clark: Absolut. Ja. Det här är också ett helt nytt konsumentbeteende. Vi är vana vid funktioner som är mycket specifika, intuitiva och enkla att använda. Därför hämtar människor sina befintliga erfarenheter av att interagera med chatt eller med en annan människa och tillämpar de förväntningarna på en funktion som i stort sett är odefinierad.
Vi förstår inte riktigt begränsningarna inom olika, om man så vill, kompetensområden. Det är alltså mycket komplex teknik som vi alla håller på att lära oss använda tillsammans. När vi tänker på vardagliga uppgifter som AI skulle kunna automatisera, som att boka resor och hantera scheman, vad gör sådana uppgifter svårare att lösa än människor antar?
Dhruv Batra: Jag använder Yutori och det vi bygger som exempel. På Yutori bygger vi personliga assistenter som kan automatisera vardagliga arbetsflöden på webben. Vår första produkt heter Scouts. Det är ett team av agenter som övervakar vad som helst på webben åt dig. Det var mycket viktigt för oss att tydligt ange förväntningen att produkten övervakar information.
Du kan inte be den boka något eller köpa något åt dig. Den skapar inte presentationer åt dig. Den gör inte dina läxor. Den skriver inte kod åt dig. Det är inte allt du kan göra i en webbläsare, men den kan låta en enskild konsument få veta när favoritartisten kommer till stan.
Artisten kanske annonserar det på flera olika webbplatser. Jag kanske besöker de webbplatserna med viss regelbundenhet. Jag vill bara att du kontrollerar dem med den frekvensen. Kanske letar jag efter en bokning som kräver att man fyller i ett enkelt formulär i en webbläsare och klickar på knappar. Jag skulle vilja att agenten gjorde det åt mig och sedan berättade vilken information som finns tillgänglig.
Kanske är jag rekryterare och följer förändrade roller för en viss grupp människor. Om de meddelar det på X, LinkedIn eller i ett blogginlägg vill jag veta när det händer. Varför är det här svårt? Det verkar trivialt. Människor sätter sig ner, öppnar webbläsaren, går till en viss sida och fyller i vissa saker.
I grunden är problemen svåra eftersom de är så kallade problem med sekventiellt beslutsfattande. Du befinner dig i ett visst tillstånd, kanske på en webbsida. Du måste utföra flera olika handlingar. Webbplatser är utformade för människor. HTML-koden är mycket inkonsekvent när det gäller hur knappar annoteras eller etiketteras på olika webbplatser.
I grunden är detta därför ett perceptionsproblem. Du måste klicka på en knapp, sedan händer något. Du kanske rullar på sidan och fyller i något, och då händer något. Varje misstag du gör på vägen skapar en kedjereaktion, där tidigare misstag leder till senare misslyckanden.
Det liknar den typ av problem som robotteknik och självkörningsindustrin har hanterat. Vi insåg att om robotar gör ett misstag kommer misstagen att förstärka varandra. Om du avviker lite från ett körfält befinner du dig inte längre mitt i körfältet. Då behöver du göra en korrigerande manöver.
På samma sätt gäller för webbläsarautomatiseringsagenter att om du hamnar på en del av en webbsida som har hängt sig eller där du inte ska vara, kommer du inte att hitta rätt svar. Du måste lära dig felåterställning när du arbetar ute i verkligheten. Det finns också skrivskyddade uppgifter och skrivuppgifter.
Om du fyller i ett formulär och klickar på Skicka låter vissa webbplatser dig inte gå tillbaka och fylla i det igen. Det innebär att du har gjort ett oåterkalleligt misstag. Det är svårt att träna för oåterkalleliga misstag, och därför måste man skapa kopior av den verkliga världen. Det är vad robotforskare gör när de skapar 3D-simulatorer av världen, nästan som ett virtuellt spel, tränar virtuella robotar i simulering och sedan placerar dem i den verkliga världen.
Det gör vi också med webbläsarautomatiseringsagenter. När vi måste träna dem att fylla i ett formulär och klicka på Skicka, eller kanske köpa något på webben, kommer misstagen att vara oåterkalleliga om de görs. Därför måste man träna i simulering. Det är några av orsakerna till att problemen är svåra, och det är ofta svårt att veta vilken del av agentens agerande som bidrog till framgången eller misslyckandet. Det kallas problemet med kredittilldelning.
Hannah Clark: Som människor är vi vid det här laget väl tränade på att utföra vissa av de här procedurerna. Det verkar vara en enkel uppgift, men tekniskt sett är den mycket mer komplex. Det tar inte ens hänsyn till sådant som preferenser. Vilken tid? Var på restaurangen vill du sitta – vid baren?
Det finns alla möjliga andra aspekter som jag kan föreställa mig är nästan omöjliga att hantera ur ett kodningsperspektiv.
Dhruv Batra: Jag kan ge ett litet exempel som förmedlar detta. Människor är vana vid vissa designmönster. När du går till en webbsida och försöker boka en reservation eller en tid finns det till exempel ett vanligt designmönster: om ett datum eller en tidslucka är gråmarkerad eller överstruken förstår du att den inte är tillgänglig, även om det inte står någon text ovanför eller bredvid som säger att platsen är upptagen.
Du förstår det eftersom du har mött det designmönstret på webbplatser och i olika texter. Hur förstår maskiner det? De kan ha läst många böcker, men de måste interagera med webbplatser för att förstå att grå text betyder något.
Det är bara ett exempel på de designmönster som är avsedda för människor och som maskiner måste ta till sig. Att ett klick på en knapp inte kommer att göra något, trots att det inte finns någon text som beskriver knappens syfte. Du måste helt enkelt veta vad det betyder.
Hannah Clark: Det här är så intressant. Det påminner mig om ett samtal jag hade för länge sedan med Nimrod Priell, grundare av Cord.
När vi talade om hur användarbeteendet utvecklas och hur de gradvisa förändringarna i vår förståelse av UX-element samt webbplatsers och tekniks allmänna layout och design under åren utgör en kumulativ tillgång som vi alla tar för given. Det här är något som är mycket svårt för oss att förmedla.
Det är nästan ett gemensamt språk vid det här laget, som vi har utvecklat under många år av teknisk utveckling. Det är mycket svårt att kommunicera till en maskin. Jag tycker därför att det här är ett fascinerande område och vill gå lite djupare in på konsumentbeteendet också. Som en fortsättning på några av de beteenden och mönster som vi har internaliserat över tid.
Det här är en pågående process. Vilka förändringar i hur människor interagerar med teknik bör produktledare förbereda sig på inom den närmaste framtiden?
Dhruv Batra: Framväxten av AI-produkter på konsumentmarknaden har definitivt förändrat människors förväntningar. Det finns nu barn som växer upp och helt enkelt kommer att förvänta sig att kunna prata med maskiner.
Det finns alltid något framtidsdrama eller någon science fiction-berättelse där barn som växer upp i tekniskt avancerade civilisationer exponeras för äldre teknik och undrar: ”Varför kan jag inte prata med min tv? Varför förstår den mig inte?” Jag tror att vi ser samma förändring i förväntningar inom konsumentbeteendet. Man känner att man borde kunna uttrycka sig och prata med maskinen. Den borde ha vissa allmänna förmågor. Den borde kunna föra en sammanhängande dialog. Den borde förstå mina användningsmönster, och det är ungefär det som motiverade vårt arbete och vår vision på Yutori.
Vi ser webbens utveckling under de senaste 30 åren som gradvisa framsteg kring en grundläggande teknik för att koppla innehåll och tjänster till människor. Webben har främst utformats för mänsklig konsumtion, eftersom det hittills har varit människors ögon på webben. Nu förväntar sig människor att kunna säga åt maskiner vad de vill att maskinen ska göra på datorn och i webbläsaren.
Varför ska jag som person behöva sätta mig ner, klicka på knappar och fylla i mitt namn, min adress och mina kortuppgifter för att köpa något eller få fram information? Det borde gå att automatisera, och jag tror att det är det vi ser. Det här är en förändring i konsumentbeteendet. Idén att jag ska ha 30 flikar öppna för att söka efter en enda produkt. Läsa 20 olika recensioner. Människor vill bara kunna fråga ett system för djupgående research eller ett övervakningssystem: ”Kan du meddela mig när det här händer?”
Nästa steg är: om du har berättat för mig att min favoritartist kommer till stan och uppträder på fredag, varför köper du inte biljetterna åt mig medan jag sitter och arbetar mig igenom formulär och annat? Jag tror att förändringen i konsumenternas förväntningar innebär att de rör sig uppåt i abstraktionsnivå: de pratar med programvara och förväntar sig att programvaran ska automatisera de vardagliga delarna av livet. Det blir nästan som en att-göra-lista med superkrafter, och jag tror att det kommer att finnas en idé om proaktivitet.
Vi vill inte sätta oss ner och förklara varje gång: ”Det här är vem jag är, det här är mina preferenser.” Det finns en idé om minne. När du väl förstår minne och personalisering, varför gör du då inte något proaktivt? Varför måste jag sätta mig ner och säga saker? Det blir nästan som att alla får en assistent, en superkraftig medarbetare eller en stabschef.
Hannah Clark: Man kan också se hur en del av den teknik vi använder varje dag bidrar till det. Tänk på sidan ”För dig” på TikTok och hur tekniken lär sig dina preferenser, lär sig vad du sannolikt kommer att interagera med och engagera dig i. Vi tillämpar samma logik på den teknik vi använder nu, eftersom vi vet att den känner till mycket om oss, våra preferenser och våra vanor.
Det är intressant hur vårt tekniska landskap tränar några av de här förväntningarna. Jag tycker att det är viktiga samband att följa när man försöker förutse vad konsumenterna kommer att förvänta sig, vilket leder oss in på företagssidan.
Just nu ser vi många företag som skyndar ut på marknaden med AI-produkter och AI-funktioner. De lovar mycket snabbt omvälvande förmågor, med varierande framgång. Vilka är enligt dig de största misstagen produktteam gör när de avgränsar och positionerar sina AI-funktioner?
Dhruv Batra: Jag tror att det återigen handlar om intelligensens ojämna natur. Man måste vara extremt försiktig. Det påverkar inte bara konsumenterna utan även utvecklarna. Man måste vara mycket försiktig så att man inte lovar allt, eftersom man inte kommer att kunna leverera det från dag ett. Samtidigt ökar konsumenternas förväntningar på generalitet.
De förväntar sig att du ska kunna göra mer än mycket smala tillämpningar, eftersom ChatGPT kan svara på alla frågor. Då uppstår fällan att använda en textruta som ingång till vad som helst utan att berätta något för användaren. Man lovar hela världen.
”Min agent kan göra vad som helst” leder till frustration, eftersom användarna först och främst ställs inför en tom duk. Vad kan jag fråga om här? Om mina förväntningar inte är rätt kalibrerade kommer jag att be om saker som agenten inte kan göra, och då blir jag frustrerad.
Därför valde vi för vår första produkt en ganska snäv förmåga. Scouts är agenter som övervakar vad som helst på webben åt dig. De loggar inte in på tjänster och utför inga skrivåtgärder där. Det är en skrivskyddad övervakningsprodukt. Vi sade dock inte att det här var prisövervakning på Amazon eller evenemangsövervakning på Ticketmaster.
All digital information som finns på webben och som du skulle kunna komma åt genom att öppna en webbläsare kan agenterna hitta åt dig, och du får ett e-postmeddelande när det händer. Skriv bara på naturligt språk vad du vill övervaka och med vilken frekvens. Anledningen var att det var mycket viktigt för oss att leverera den här förmågan.
Det är en skrivskyddad förmåga. Vi fattar inte oåterkalleliga beslut åt dig. Om vi fattade ett köpbeslut för din räkning och köpte fel sak skulle du bli frustrerad. Samtidigt finns det en viss generalitet i vilka frågor du kan ställa och var du kan förvänta dig att informationen ska dyka upp.
Därifrån måste man klättra uppför förtroendetrappan. Till en början levererade vi värde utan att be om inloggningar eller kortuppgifter. När användarna har sett värdet kommer de naturligt att förvänta sig att produkten kan göra mer. Om jag följer en artist som kommer till stan är nästa steg: ”Skaffa en biljett åt mig.”
Om jag följer tillgängligheten för en restaurangbokning är nästa steg att göra bokningen. Om jag är rekryterare och följer en viss kandidats rörelser är nästa steg att utforma ett kontaktmejl. Ur en utvecklares perspektiv är jag nybörjare. Jag är AI-forskare och känner inte att jag är i en position att ge råd.
Jag kan bara peka på den försiktighetsprincip vi följer: intelligensen är ojämn. Vissa uppgifter kommer du att kunna lösa och andra inte. Vanligtvis är de uppgifter du kan lösa sådana där du har möjlighet att öva. Därför måste uppgifterna vara sådana att misstagen inte blir alltför kostsamma, och sedan bygger du vidare stegvis.
Hannah Clark: Det här är mycket kloka ord. Jag ser ofta vad du menar när det gäller att frustrera användare med begränsningar som är otydliga i användarupplevelsen. De går in i en chattrobot och interagerar naturligt med den på samma sätt som de skulle göra med en mänsklig agent.
Det kan leda till mycket frustration. Det finns en kostnads- och nyttoanalys i att inte begränsa vad som är möjligt och i att ta risken att konsumenterna lämnar tjänsten med mindre förtroende för tekniken i allmänhet.
Dhruv Batra: Om de inte hittar värde i det du sade att du kunde göra får de en dålig upplevelse och lämnar tjänsten. De kommer inte tillbaka.
Hannah Clark: Okej. Låt oss gå lite djupare in på det. Jag tror att förtroende är en central orsak till att människor lämnar just i det kritiska ögonblicket. Hur bör produktledare tänka kring att bygga förtroende hos konsumenter utan att lova förmågor som ännu inte är färdiga eller som de inte kan leverera?
Dhruv Batra: Jag tror att det går tillbaka till den föregående frågan. Människor måste se värde innan de lämnar över inloggningsuppgifter eller känslig information som kortuppgifter. Om du ber konsumenterna att redan i första steget ge dig tillgång till kalendern, e-postinkorgen eller andra konton innan de ens har sett vad produkten kan göra, är det en extremt riskabel strategi.
Det kanske gör att du blir viral i sociala medier, men sätt dig in i användarens situation. Vill jag verkligen lämna över min arbetsmejl med känslig dokumentation eller mitt kreditkort utan att veta vad du kan eller inte kan leverera?
Därför började vi utan autentisering, utan skrivåtgärder och utan att förändra världens tillstånd. Till en början handlade det bara om att läsa. Det innebär att AI:n inte lovar hundraprocentig träffsäkerhet, vilket betyder att du kan försöka igen om den har gjort ett misstag.
Det går att försöka igen i en skrivskyddad produkt. Det går inte i en skrivande produkt där misstagen är oåterkalleliga. Det är sådant vi tar hänsyn till när vi klättrar uppför förtroendetrappan med våra användare.
Hannah Clark: Jag kommer att tänka på ett helt annat exempel, men jag tycker att det illustrerar en liknande poäng.
Jag hade en vän som flyttade till Kanada från Brasilien. Hon trodde att Kanada var världens säkraste land och att allt var säkert överallt. Under hennes första vecka i Kanada skedde ett rån på hennes gata, och plötsligt tyckte hon att allt var osäkert. Det är samma idé om tid till värde och tid till glädje, men också om hur skör och problemfylld den första perioden av förtroendeskapande kan vara när något bryter mot ens förväntningar och rubbar det grundläggande förtroendet.
Så jag vill gå vidare till tekniksidan. Ur ditt perspektiv som AI-forskare, vilka problem skulle du säga i stort sett är lösta i dag? Och vilka ligger, även om det är ett laddat uttryck, nära till hands? Vad känns som att det verkligen ligger nära i tid jämfört med sådant som ständigt tycks ligga några år bort?
Dhruv Batra: Det konkreta exempel jag tänker använda här gäller att svara på frågor om bilder. Anledningen till att det ligger nära till hands är att jag förra veckan var på konferensen ICCV, International Conference on Computer Vision.
Mina samarbetspartner och jag tog emot ett så kallat Mark Everingham-pris för arbete vi gjorde för ett årtionde sedan. Arbetet kallades Visual Question Answering. Vi introducerade ett dataset, en uppgift, ett riktmärke och metoder för att bygga den första generationen agenter som kunde svara på öppna frågor om naturliga bilder.
Under de senaste tio åren har vi hjälpt forskarsamhället att följa utvecklingen genom att organisera årliga tävlingar. Vi slutade organisera tävlingen 2021 eftersom metoderna i början, när vi startade 2015, var otroligt dåliga. Som du kan föreställa dig var uppgiften att svara på frågor om bilder mycket svår.
År 2021 hade vi i princip nått mänsklig träffsäkerhet på det dataset vi hade skapat. Vi hade nått den nivå av överensstämmelse som människor hade när de besvarade frågorna, och därför slutade vi organisera tävlingen. Jag har nämnt att det är en intressant utveckling: under loppet av tio år ledde jag ett team på FAIR som byggde moderna metoder som lanserades på Ray-Ban Meta-solglasögon, där du kan aktivera en assistent och säga: ”Hej Meta, ta en bild. Berätta mer om det här monumentet.”
Det problemet är en avslutad cirkel från tio år tidigare. När vi började fanns det många helt öppna problem. Att svara på frågor som krävde att man läste text i verkligheten var hopplöst. Om du frågade vad det stod på skylten körde de flesta metoder inte optisk teckenigenkänning och kunde därför inte läsa texten.
Metoderna fick i stället svara utifrån förkunskaper: Vad brukar skyltar säga? De säger ”stopp” eller ”kör”. Därför gissade systemen bara det vanligaste. Vi upptäckte att detta var ett vanligt problem och att de flesta modeller för bildfrågor dominerades av språkliga förkunskaper. Om du tog en bild av bananer och frågade vilken färg bananerna hade skulle modellen sannolikt svara gult, eftersom de flesta bananer i världen är gula.
Den vet det från träningsdatasetet. Den kan egentligen inte se särskilt bra. Man kan tänka på det som att den kisar mot bilden. Om bilden föreställer en grön banan säger den att bananen är gul, eftersom de flesta bananer är gula. Vi utvidgade frågesvarandet till dialog med chattrobotar, och kärnreferens var ett extremt svårt problem.
Om du frågar om det finns en person i bilden och får svaret ja, och sedan frågar vad personen gör, måste systemet förstå att ”personen” hänvisar till den visuella entitet vi just talade om. Det var ett svårt problem. Modellen var redan förvirrad och visste inte vad ”han” eller ”de” hänvisade till.
I dag betraktas de problemen som lösta. Så långt vi kan mäta är de inte längre öppna forskningsproblem. Men vissa problem är fortfarande helt öppna. Att räkna objekt i bilder är fortfarande ett öppet problem. Ta en bild där det finns fler än tio personer i en folkmassa och ladda upp den till din favoritchattrobot. Fråga hur många personer det finns i bilden och se vilket svar du får. Det är fortfarande en öppen forskningsfråga.
Att fråga om tredimensionell rumsförståelse är ett annat exempel. Ta en bild där det står ett bord längst bort och kanske en bokhylla närmare kameran. Fråga om bordets och bokhyllans höjd. De flesta chattrobotar kommer att svara utifrån höjden i pixlar. Det som verkar närmast kameran sägs vara högre, eftersom systemen inte förstår djup och att saker långt bort faktiskt kan vara högre än saker närmare kameran i en tredimensionell värld.
Det är fortfarande öppna frågor. När det gäller AI och byggandet av agenter, exempelvis webbagenter, finns det fortfarande något som kallas glidning över tid. Våra övervakningsagenter körs i månader och övervakar vissa ämnen.
Du kanske ber dem följa ett visst nyhetsämne under flera månader. Det som kan hända är att agenterna långsamt börjar följa något som avviker från din ursprungliga begäran, eftersom ingen har byggt agenter som körs i flera månader åt gången och sedan kan tilldela ansvar och belöna dem för framgångar eller misslyckanden över så långa tidsperioder.
Hannah Clark: Det här är mycket intressant. Jag hade inte tänkt på vilka kriterier vi använder för att avgöra om en agent har gjort något korrekt. När man får ett korrekt resultat går man vanligtvis vidare med sitt liv. Man säger inte nödvändigtvis ”bra jobbat” eller ger detaljer om vad den gjorde rätt eller fel.
Det här är intressant när det gäller återkopplingsloopar för tekniken. Finns det något användarbeteende vi borde ta till oss för att bättre träna modellerna vi är beroende av? Eller är det här något som skulle kunna bli ett helt eget program? Hur sluter vi återkopplingsloopen?
Dhruv Batra: Internt gör vi utvärderingar och samlar in återkoppling på flera abstraktionsnivåer. För webbläsarautomatiseringsagenter måste vi manuellt annotera varje klick. Var det rätt sak att göra på webbsidan eller var det fel? Det är naturligtvis en för låg nivå och för brusigt.
Ibland kan en uppgift utföras på flera sätt. Ibland skriver man kanske in ett objekt i ett sökfält på en webbsida. Ibland klickar man direkt på en flik för att gå till informationskällan. Det är för låg nivå och för brusigt. Men efter att en uppgift är klar – om du exempelvis frågar om en restaurang har en bokning klockan 18.30 och agenten klickar sig igenom flera knappar, hittar restaurangen och svarar ja eller nej – finns det ett arbetsbevis i slutet av förloppet.
I många av dessa uppgifter finns det ett gap mellan att generera och verifiera. Det är enklare att verifiera ett arbetsbevis än att lösa själva uppgiften, eftersom lösningen kräver många knapptryckningar, rätt text i rätt sökfält och rätt plats på webbplatsen.
Om agenten däremot återkommer och säger att den har hittat en bokning klockan 18.30 finns det en skärmbild av en webbsida. Vi kan läsa sidan och se om agenten hade rätt. Därför bygger vi utvärderingar utifrån det. Det finns också återkopplingsmekanismer riktade till konsumenter. Varje gång våra agenter skickar ett e-postmeddelande kan användaren ge tummen upp eller tummen ner.
Det kopplas naturligt till personalisering. Ibland finns det inget rätt eller fel svar, utan bara preferenser. Om du följer en viss nyhet och är trött på den riktning nyheten tar skulle du, om du pratade med en människa, säga att du vill se mindre av det ena och mer av det andra.
Helst ska du kunna säga det på naturligt språk eftersom det är bekvämt. Därför måste man bygga in återkopplingsmekanismer som tar emot naturlig språkåterkoppling och ändrar agentens framtida agerande.
Hannah Clark: Det här är så intressant. Jag tänker också på hur människor brukar betrakta resultat från något som ChatGPT genom frågan om vi är nöjda med tjänsten, snarare än om vi är nöjda ur ett tekniskt perspektiv.
Om jag till exempel sitter bredvid en kollega och vi båda skapar veckoplaner för matlagning. Jag skapar en plan och kollegan skapar en plan, och det är samma plan, men jag tycker inte att den har rätt makronutrienter för det jag försökte uppnå. Ur ett tjänsteperspektiv blir det en tumme ner.
Personen bredvid mig säger däremot: ”Den gjorde exakt vad jag bad om. Resultatet är tekniskt korrekt utifrån specifikationerna i prompten.” Det blir en tumme upp. Det låter förvirrande, och det finns en verklig nyans i hur vi förstår vår roll som givare av återkoppling till maskinerna.
Det är ett helt eget dataset som kan vara svårt att arbeta med.
Dhruv Batra: De traditionella idéerna om A/B-testning bryter samman i många fall. När man bygger en funktion delar man vanligtvis upp användarna i två grupper och visar den ena gruppen ett svar eller en strategi. Ibland visar man parallella svar för samma användare och ber dem välja ett.
Det fungerar inte när du måste utföra ett arbetsflöde, köpa något eller göra något, eftersom du inte kommer att göra samma sak två gånger. Användaren blir frustrerad. Dessutom är tummen upp och tummen ner ibland alldeles för grova för att användaren verkligen ska kunna förmedla vad han eller hon försöker säga.
Om du skickar textbaserade svar bör du ibland låta användaren markera något och säga ”inte det” eller ge mer redaktionell återkoppling, som man skulle göra till en annan människa. Om du granskade någons Google-dokument skulle du inte bara ge en tumme upp eller tumme ner.
Hannah Clark: Det vore hemskt. En tumme ner – vilken del är det som får tummen ner?
Dhruv Batra: Precis. Det är som att gå till en redaktör och bara få höra: ”Nej, gör om.” Gör om vad?
Hannah Clark: Gör om alltihop. Det är mycket att begära. Även om vi hade möjligheten att gå in i ett resultat från en språkmodell och ge den den typen av kritisk återkoppling kräver det mycket av en användare som bara vill att det ska fungera.
Det är redan tillräckligt svårt att få människor att svara på enkäter, även när de får en hänvisningskod eller någon bonus. Det blir en mycket svår samförfattande uppgift att be människor hjälpa till att samförfatta. Det jag tar med mig är att vi verkligen behöver förvänta oss mycket mindre av dig.
Dhruv Batra: Jag tror att de måste känna att återkopplingen är en investering i personaliseringen av chattroboten mot något de vill kunna göra. Användaren kan inte vara din kvalitetssäkringsingenjör. De kan inte berätta allt som är fel med produkten. Men de kan få upplevelsen att detta är min assistent och att all återkoppling jag ger assistenten gör den bättre och anpassar den till mina preferenser. Det känns som rätt relation och engagemangsmekanism för att de ska vilja lägga ner tid.
Hannah Clark: Jag håller med. Jag har mycket större tålamod med en modell som tydligare försöker lära sig mina preferenser.
När man gör en fråga i någon form av språkmodell och den direkt ställer följdfrågor för att förfina resultatet, även om frågorna verkar lite triviala, förstärker det för mig uppfattningen att allt jag berättar måste vara mycket mer specifikt än jag tror för att jag ska få det resultat jag vill ha.
Det förbereder mig på att bli besviken om jag inte riktigt träffar rätt. Det är viktigt att tänka på när man utvecklar funktioner som kräver någon form av givande och tagande från användaren för att få det resultat vi vill ha.
Dhruv Batra: Här återgår vi till att klättra uppför förtroendetrappan.
Om det allra första du gör när en användare försöker uppleva produkten är att ge dem ett frågeformulär med 20 frågor, försöker de bara nå glädjen och snabbt skapa en modell av vad du kan göra. Sedan kan de iterera därifrån. Det kan alltså inte vara det första du överöser användaren med, men när de ser ett värde kan du lägga till frågor och preferenser.
Hannah Clark: Varför nu? Varför startade du Yutori just nu? Varför är det här rätt tid att starta projektet, och vad är fundamentalt annorlunda i landskapet som gör detta möjligt nu jämfört med tidigare?
Dhruv Batra: Jag är naturligtvis mottaglig för efterklokhet, men jag upplever att det här är en unik tid för att bygga vissa typer av AI-drivna produkter som vi inte kunde bygga tidigare. Jag arbetade med robotteknik när jag kunde ha startat ett robotikföretag, och det råder ingen brist på sådana företag.
Jag tror inte att det här är rätt tid att starta ett konsumentinriktat eller ostrukturerat robotikföretag, eftersom problemen som ska lösas fortfarande ligger flera årtionden framåt i tiden. Många glömmer att DARPA 2004 organiserade DARPA Grand Challenge och bad universitet bygga autonoma självkörande bilar som kunde köra från punkt A till punkt B i en öken.
2004 var första gången tävlingen organiserades. Ingen bil gick i mål. Jag var på CMU 2005. CMU kom längst, och 2005 var året då flera universitetsteam gick i mål. Under andra halvan av 2000-talet gick flera Stanfordforskare till Google. Projektet blev först Google X och senare Waymo.
Det var först 2023 eller 2024 som vi fick konsumentinriktade appar där man i San Francisco kan beställa en Waymo till dörren eller till vissa upphämtningsplatser. Tänk på resan från 2004 eller 2005, den första forskningsdemonstrationen, till en konsumentprodukt som finns tillgänglig åtminstone i vissa geografiska områden. Den har fortfarande inte lanserats överallt.
En fullständig lansering ligger kanske ytterligare ett årtionde framåt. Det är utmaningen med hårdvara plus AI. Utvecklingscyklerna för programvara plus AI är mycket kortare. Vi har äntligen kommit till en punkt där AI-system kan prata med människor, har bred kunskap om världen och kan föra dialoger.
Perceptionssystemen har mognat, åtminstone på webben. Vi kan ta en skärmbild av webben och förstå hur webbplatser är uppbyggda och vilka knappar som gör vad. Det finns en bred förståelse för sunt förnuft. Slutligen har modeller med öppen källkod släppts under de senaste åren, vilket gör att mindre aktörer som vi åtminstone kan komma igång.
För några år sedan hade vi behövt börja från förträning om vi skulle bygga ett företag för webbläsarautomatisering eller webbagenter. Förträning av språkmodeller och vision-språkmodeller är ett helt annat företag med helt andra kapital-, beräknings- och datakrav.
I dag eftertränar vi modeller. Det innebär att vi börjar med modeller med öppen källkod och tränar dem vidare för webbläsarautomatisering, knapptryckningar, formulär och så vidare. Det hade inte varit möjligt för några år sedan. Samtidigt är detta inte ett problem med långa iterationscykler som fortfarande ligger mer än ett årtionde bort.
Jag tänker så här: det finns ingen möjlig värld där robotar har flyttat in i våra hem medan vi fortfarande sitter vid våra bärbara datorer och skriver våra namn i webbläsarfält. Digitala assistenter kommer före fysiska assistenter, eftersom den digitala världen rör sig snabbare.
Bitarnas värld har snabbare iterationscykler, och mycket av det underliggande material som vi kan utveckla de här intelligenta systemen på har blivit standardiserat. Därför kan vi fokusera på problemen i det sista steget.
Hannah Clark: Det var ett mycket elegant svar. Jag uppskattar också användningen av ordet substrat. Det här har varit ett oerhört fascinerande samtal. Jag känner att vi kunde ha gått mycket djupare, och jag är säker på att många gärna skulle göra det. Var kan man följa ditt arbete på nätet?
Dhruv Batra: Jag finns personligen på dhruvbatra.com. Det är min webbsida. Mitt arbete finns på yutori.com och vår produkt heter Scouts. Den finns på scouts.yutori.com.
Hannah Clark: Fantastiskt. Tack så mycket för att du ville vara med, Dhruv. Jag uppskattar verkligen det här.
Dhruv Batra: Tack för att du bjöd in mig. Det här var fantastiskt.
Hannah Clark: Nästa gång i podden Produktchefen. Att leda produktarbete i AI-åldern innebär att lösa många av samma problem på helt andra sätt. Från utvecklingsprocesser till distributionsstrategier är nästan varje spelplan som fungerade för ett år sedan redan föråldrad – något som Webflows produktchef Rachel Wolan ser både som en utmaning och en fantastisk möjlighet.
Du får svaren och den tydlighet du har väntat på kring ämnen som optimering för svarsmotorer, bygga kontra köpa och rätt sätt att ta sig in på AI-marknaden. Prenumerera nu så att du inte missar det.
