Det må tekniskt sett vara Skyttens säsong, men Tvillingarna tar över.
Den 6 december meddelade Google DeepMind lanseringen av sin inbyggda multimodala AI-modell och konkurrent till GPT-4, Gemini.
I ett blogginlägg som förebådade Geminis ankomst beskrev Google DeepMinds vd och medgrundare Demis Hassabis den senaste utvecklingen som ”den mest kapabla och generella modellen vi någonsin har byggt”. Ryktena om att produktserien skulle kunna vara en seriös kandidat för artificiell generell intelligens (AGI) tilltar, och Geminis inverkan märks redan i det stenhårda landskapet för AI-företag.
Men hur kommer den att påverka digitala produkter under det kommande året? Här är vad du behöver veta – det goda, det dåliga och det potentiellt fula.
Vad är Gemini?
Gemini är inte bara en produkt utan tre: en familj av stora multimodala modeller (LMM) som efterträder Google DeepMinds neurala nätverk LaMDA och PaLM 2. De tre produkterna är:
- Gemini Ultra: Den kraftfullaste modellen, som ska släppas till utvecklare i början av 2024. Ultra lovar förmågan att ”förstå”, generera och kombinera i princip ett stort antal olika indata, inklusive ljud, video, text, kod och bilder, med hastigheter som imponerande nog ligger nära realtid.
- Gemini Pro: Konsumentmodellen som för närvarande är tillgänglig för utvecklare. Användare i länder där Bard är tillgängligt har kunnat interagera med Gemini Pro sedan den tillkännagavs den 6 december.
- Gemini Nano: Den kompakta modellen som är utformad för att driva mobilapplikationer. Gemini Nano har, precis som Gemini Ultra, ännu inte släppts och Google har ännu inte redogjort för dess prestandaspecifikationer.
Have an account? Log In
Vad är multimodal AI?
Multimodal AI är artificiell intelligens som kan behandla flera datatyper genom att använda flera algoritmer för intelligensbearbetning. En text-till-bild-AI-modell som Midjourney betraktas till exempel som multimodal AI.
Även om många LMM redan har översvämmat marknaden skiljer sig Gemini från andra stora multimodala språkmodeller genom att den är utformad för att ”förstå” många typer av indata (text, video, ljud, kod och bilder) på ett sätt som efterliknar mänsklig förståelse och kreativitet.
Det goda: Potentialen hos multimodal AI-teknik
Det har inte ens gått ett helt kalenderår sedan ChatGPT:s text-till-text-generering tog över allmänhetens föreställningsvärld, men Gemini markerar början på en ny era där multimodal funktionalitet snart kommer att vara en grundförutsättning för AI-drivna produkter.
Ken Hubbell, vd för AI-plattformen Soffos.ai, ser en enorm potential för tekniken under det nya året.
”Vi har börjat fundera på saker som realtidsanalys av det du ser visuellt”, säger Hubbell. ”Så jag ser nya produkter, som glasögon som kan ta emot en videoström, nu kunna ta emot videoströmmen och generera resultat (i realtid).”
Även om detta kommer att ge produktteam en flexibilitetsnivå som aldrig tidigare varit möjlig, kommer det också ofrånkomligen att leda till att produkter som har byggts för att utöka funktionaliteten hos plattformar som GPT-4 för att möjliggöra liknande funktioner snabbt blir föråldrade – och alla dessa produkter är själva bara några månader gamla.
”De här produkterna kommer snart antingen att vara irrelevanta eller behöva göras om helt för att införliva allt det nya som har tillkommit och som de tidigare ’hackade’ sig runt”, säger Hubbell.
De här produkterna kommer snart antingen att vara irrelevanta eller behöva göras om helt för att införliva det som de tidigare ’hackade’ sig runt.
KEN HUBBELL, VD, SOFFOS.AI
Hubbell medger att många företag kommer att förlora stort på investeringarna de har lagt i dessa nu föråldrade kringlösningar, men han säger att detta faktiskt är goda nyheter i förklädnad.
”När Alexa kom hittade många människor sätt att göra saker som själva Alexa-produkten inte kunde göra – jag var en av dem”, skrattar Hubbell och påpekar att teamet på Amazon snabbt snappade upp de funktioner som externa utvecklare byggde och integrerade dem i Alexa-plattformen.
”Det ställde till det för oss som var utvecklare, men å andra sidan förbättrade det serversystemet så mycket att vi nu kunde fokusera på saker som vi inte behövde hacka oss runt – och vi kunde faktiskt skapa den slutprodukt som vi verkligen ville ha.”
Det dåliga: Det tidiga mottagandet av Gemini

Även om denna nya era av mycket kapabla multimodala AI-system låter revolutionerande har det tidiga mottagandet av Gemini Pro varit allmänt nedslående. Under veckan efter tillkännagivandet av produktlanseringen började LinkedIn- och X-flöden överallt fyllas med missnöjda omdömen från användare som hade experimenterat med Gemini Pro.
Problemet? Gemini verkar vara … ganska korkad.
Artiklar på TechCrunch och av flera Medium-författare uppmärksammade inlägg från användare på sociala medier som visade skärmbilder av hur Gemini misslyckades med att besvara frågor korrekt.
Men som Hubbell förklarar gör plattformen precis det som vem som helst borde ha förväntat sig att den skulle göra.
”Att uppfostra en AI liknar faktiskt mycket att uppfostra ett barn”, säger Hubbell, som (innan du frågar) också är pappa. Han påpekar att LM-system bara kan lära sig en begränsad mängd under de tidiga träningsfaserna, som äger rum i en sluten miljö med ett mycket litet urval av användare. ”När den släpps ut i verkligheten är det där den verkliga tillväxten sker.”
När den släpps ut i verkligheten är det där den verkliga tillväxten sker.
KEN HUBBELL, VD, SOFFOS.AI
Det fula: Frågan om etik
I sitt lanseringsmaterial har Google varit mycket öppen med löftena om att ha utvecklat Gemini på ett ”ansvarsfullt” sätt.
Detta löfte har, helt rimligt, fått några kritiker att skruva på sig.
En artikel av ZDNET påpekar att Google valde att utelämna modellkort för Gemini-produkterna. Dessa beskriver bland annat de potentiellt skadliga konsekvenserna av ett neuralt nätverk. Detta är särskilt oroande med tanke på att ett team på Google faktiskt uppfann modellkort från början.
Det väcker också frågan: när en produkt har tränats på en i grunden partisk datamängd, vem avgör då hur ”ansvar” ska se ut?
I en artikel som publicerades i maj på Mind Foundry-bloggen förklarar Frankie Garcia, Google DeepMinds nya chef för operativ AI-etik och säkerhet samt tidigare produktchef för AI-styrning på Mind Foundry, vad som gör en maskininlärningsmodell tillförlitlig.
”När beslut har en materiell inverkan på enskilda personers och befolkningsgruppers liv kan betydelsen av modellens tillförlitlighet och ansvar inte överskattas”, skriver Garcia i artikeln, som är medförfattad av professor Brent Mittelstadt vid University of Oxfords Internet Institute.
Artikeln hävdar att det finns tre centrala områden för tillförlitlighet inom maskininlärning:
- Partiskhet och rättvisa: Användningen av flera grupper av ”rättvisemått”, som författarna medger ofta motverkar varandra, för att säkerställa att modellen agerar rättvist.
- Tolkningsbarhet och förklarbarhet: Detta beskriver i vilken utsträckning en mänsklig användare kan förstå den logik och process som AI-modellen har använt för att komma fram till sitt resultat.
- Dataförskjutning och modellens skörhet: Detta beskriver hur förändringar från den ursprungliga träningsdatamängden, till följd av mönster i användarens indata och andra faktorer, kan påverka modellens resultat negativt.
Vi kan dra slutsatsen att Google håller noggrann uppsikt över dessa faktorer för att säkerställa att Gemini-produktfamiljen förblir ”under kontroll”. Om vi får se ett liknande engagemang från konkurrenter som konkurrerar om marknadsandelar återstår att se.
More Articles
Hur står sig Gemini jämfört med ChatGPT?
När det gäller råprestanda har Google lämnat några storslagna löften om vad utvecklare kan förvänta sig. Här är prestandamätvärdena för Gemini Ultra och Gemini Pro jämfört med ChatGPT, enligt Google.
Prestandajämförelser: GPT-4 jämfört med Gemini Ultra och Gemini Pro
En fullständig lista över de rapporterade prestandajämförelserna för Gemini Ultra och Gemini Pro jämfört med GPT-4. Prestandajämförelser för Gemini Nano har ännu inte offentliggjorts.
En ny säsong eller en ny era?
Även om lanseringen av Gemini kanske bara är den senaste akten i den pågående sagan om snabb AI-innovation, känns denna annorlunda.
Även om den utökade funktionaliteten hos Geminis särskilda form av multimodala funktioner uppenbarligen innebär en nästan obegränsad möjlighet för produktutveckling (inklusive att skriva användarberättelser!), är dess främsta bidrag den milstolpe inom AI-innovation som den representerar.
Kommer Gemini att leda oss till en verklig modell av AGI innan 2024 är slut? Det kan vara skrivet i stjärnorna.
Glöm inte att prenumerera på vårt nyhetsbrev för fler insikter, guider och resurser om produktledning som har skapats för dig av branschledare och experter.


