Mitä Google Gemini merkitsee tuotetiimeille vuonna 2026

By Hannah Clark

Google DeepMindin hartaasti odotettu GPT-4:n kilpailija on syntynyt – ja siihen kohdistuu jo valtava paine ryömiä, kävellä ja juosta tekoälyn ylivallan tavoittelussa. Tässä kerrotaan, mitä Geminin ilmaantuminen merkitsee tuotekehitykselle tulevana vuonna.

Teknisesti nyt saattaa olla Jousimiehen kausi, mutta Kaksoset ovat ottamassa vallan.

Google DeepMind ilmoitti 6. joulukuuta uuden natiivisti multimodaalisen tekoälymallinsa ja GPT-4:n kilpailijan, Geminin, julkaisusta.

Geminin saapumista juhlistavassa blogikirjoituksessa Google DeepMindin toimitusjohtaja ja toinen perustaja Demis Hassabis kuvaili uusinta kehitystyötä ”kyvykkäimmäksi ja yleiskäyttöisimmäksi malliksi, jonka olemme koskaan rakentaneet”. Huhut siitä, että tuotesarja voisi olla vakavasti otettava ehdokas yleiseen tekoälyyn (AGI), ovat voimistuneet, ja Geminin vaikutus näkyy jo armottoman kilpailun tekoälyliiketoiminnan kentällä.

Mutta miten se vaikuttaa digitaalisiin tuotteisiin tulevana vuonna? Tässä ovat tärkeimmät asiat, jotka sinun on tiedettävä – hyvät, huonot ja mahdollisesti rumat.

Mikä Gemini on?

Gemini ei ole vain yksi tuote, vaan kolme: suurten multimodaalisten mallien (LMM) perhe, joka seuraa Google DeepMindin LaMDA- ja PaLM 2 -neuroverkkoja. Kolme tuotetta ovat:

  • Gemini Ultra: Tehokkain malli, joka on määrä julkaista kehittäjille vuoden 2024 alussa. Ultra lupaa kyvyn ”ymmärtää”, tuottaa ja yhdistellä virtuaalisesti monenlaisia syötteitä, kuten ääntä, videota, tekstiä, koodia ja kuvia, vaikuttavan lähellä reaaliaikaa olevilla nopeuksilla.
  • Gemini Pro: Kuluttajatason malli, joka on tällä hetkellä kehittäjien saatavilla. Niissä maissa, joissa Bard on saatavilla, käyttäjät ovat voineet olla vuorovaikutuksessa Gemini Pron kanssa siitä lähtien, kun se julkistettiin 6. joulukuuta.
  • Gemini Nano: Kompakti malli, joka on suunniteltu mobiilisovellusten käyttövoimaksi. Gemini Nanoa ei Gemini Ultran tavoin ole vielä julkaistu, eikä Google ole vielä ilmoittanut sen suorituskykyä koskevia tietoja.
Get Free Access to the Product Vault
We’ve collected the goods — AI prompts, exclusive deals, and a library of resources for product leaders. Unlock your account for access.
Get Free Access

Have an account? Log In

Mitä multimodaalinen tekoäly on?

Multimodaalinen tekoäly on tekoälyä, joka pystyy käsittelemään useita tietotyyppejä useiden älykkyyden käsittelyalgoritmien avulla. Esimerkiksi tekstistä kuvaksi -tekoälymallia, kuten Midjourneyta, pidetään multimodaalisena tekoälynä.

Vaikka monet LMM:t ovat jo tulvineet markkinoille, Geminin erottaa muista suurista multimodaalisista kielimalleista se, että se on suunniteltu ”ymmärtämään” useita syötteitä (tekstiä, videota, ääntä, koodia ja kuvia) tavalla, joka jäljittelee ihmisen ymmärrystä ja luovuutta. 

Hyvä puoli: multimodaalisen tekoälyteknologian mahdollisuudet

ChatGPT:n tekstistä tekstiksi -generoinnin vallattua yleisen mielikuvituksen ei ole kulunut edes kokonaista kalenterivuotta, kun Gemini merkitsee uuden aikakauden alkua: multimodaalisesta toiminnallisuudesta tulee pian tekoälypohjaisten tuotteiden perusvaatimus.

Ken Hubbell, tekoälyalusta Soffos.ai:n toimitusjohtaja, näkee teknologialla valtavat mahdollisuudet tulevana vuonna.

”Olemme alkaneet ajatella esimerkiksi reaaliaikaista analyysiä siitä, mitä näet visuaalisesti”, Hubbell sanoo. ”Näen siis uusia tuotteita, kuten laseja, jotka voivat vastaanottaa videokuvaa ja nyt myös käsitellä videokuvaa sekä tuottaa tuloksia (reaaliajassa).”

Vaikka tämä antaa tuotetiimeille ennen näkemättömän joustavuuden tason, se johtaa väistämättä myös niiden tuotteiden ennenaikaiseen vanhentumiseen, jotka on rakennettu laajentamaan GPT-4:n kaltaisten alustojen toiminnallisuutta ja mahdollistamaan Geminin kaltaiset toiminnot – ja kaikki nämä tuotteet ovat itsekin vasta muutaman kuukauden ikäisiä.

”(Nämä tuotteet) muuttuvat pian joko merkityksettömiksi tai ne on suunniteltava kokonaan uudelleen, jotta niihin voidaan sisällyttää kaikki uusi, jonka ympärille ne aiemmin ’hakkeroivat’ kiertoratkaisunsa”, Hubbell sanoo.

(Nämä tuotteet) muuttuvat pian joko merkityksettömiksi tai ne on suunniteltava kokonaan uudelleen, jotta niihin voidaan sisällyttää asiat, joiden ympärille ne aiemmin ’hakkeroivat’ kiertoratkaisunsa.

KEN HUBBELL, TOIMITUSJOHTAJA, SOFFOS.AI

Vaikka Hubbell myöntää, että monet yritykset tulevat kärsimään tappioita investoinneista, joita ne ovat tehneet näihin nyt vanhentuneisiin kiertoratkaisuihin, hänen mukaansa tämä on itse asiassa hyvä asia valepuvussa.

”Kun Alexa julkaistiin, monet ihmiset etsivät tapoja tehdä asioita, joihin Alexa-tuote itsessään ei pystynyt – minä olin yksi heistä”, Hubbell naurahtaa ja huomauttaa, että Amazonin tiimi huomasi nopeasti ominaisuudet, joita ulkopuoliset kehittäjät rakensivat, ja integroi ne Alexa-alustaan.

”Se tavallaan hankaloitti meidän kehittäjien asemaa, mutta toisaalta se paransi taustajärjestelmää niin paljon, että pystyimme nyt keskittymään asioihin, joiden ympärille meidän ei tarvinnut rakentaa kiertoratkaisuja – ja pystyimme todella tekemään lopullisen tuotteen, jonka halusimme.”

Huono puoli: Geminin varhainen vastaanotto

Käyttäjät ovat olleet kärsimättömiä Geminin varhaisen suorituskyvyn suhteen.
Käyttäjät ovat olleet kärsimättömiä Geminin varhaisen suorituskyvyn suhteen.

Vaikka tämä erittäin kyvykkään multimodaalisen tekoälyn uusi aikakausi kuulostaa vallankumoukselliselta, Gemini Pron varhainen vastaanotto on ollut laajalti pettymys. Tuotteen julkaisua seuranneen viikon aikana LinkedInin ja X:n syötteet kaikkialla alkoivat täyttyä tyytymättömien käyttäjien arvioista, joita olivat kirjoittaneet Gemini Prota kokeilleet käyttäjät.

Ongelma? Gemini vaikuttaa olevan… hieman tyhmä.

TechCrunchin artikkelit ja useiden Medium-kirjoittajien tekstit nostivat esiin sosiaalisen median käyttäjien julkaisuja, joissa oli kuvakaappauksia siitä, kuinka Gemini ei onnistunut vastaamaan kysymyksiin oikein.

Mutta kuten Hubbell selittää, alusta tekee juuri sitä, mitä kenen tahansa olisi pitänyt odottaa sen tekevän.

”Tekoälyn kasvattaminen muistuttaa itse asiassa paljon lapsen kasvattamista”, sanoo Hubbell, joka (ennen kuin kysytte) on myös isä. Hän huomauttaa, että kielimallit voivat oppia vain rajallisesti koulutuksen alkuvaiheissa, jotka tapahtuvat suljetussa ympäristössä ja hyvin pienen käyttäjäotoksen avulla. ”Kun se päästetään vapaaksi maailmaan, varsinainen kasvu tapahtuu siellä.”

Kun se päästetään vapaaksi maailmaan, varsinainen kasvu tapahtuu siellä.

KEN HUBBELL, CEO, SOFFOS.AI

More Articles

Ruma puoli: Eettinen kysymys

Google on julkaisumateriaaleissaan luvannut hyvin avoimesti kehittäneensä Geminin ”vastuullisesti”.

Tämä lupaus on ymmärrettävästi saanut muutamat kriitikot tuntemaan olonsa vaivaantuneeksi.

ZDNETin artikkelissa huomautetaan, että Google päätti jättää Gemini-tuotteiden mallikortit julkaisematta. Mallikorteissa kuvataan muun muassa neuroverkon mahdollisesti haitallisia seurauksia. Tämä on erityisen huolestuttavaa, kun otetaan huomioon, että Googlen tiimi keksi mallikortit alun perin.

Se herättää myös kysymyksen: kun tuote on koulutettu luonnostaan puolueellisella aineistolla, kuka päättää, miltä ”vastuullisuus” näyttää?

Toukokuussa Mind Foundryn blogissa julkaistussa artikkelissa Frankie Garcia, Google DeepMindin uusi operatiivisen tekoälyn etiikan ja turvallisuuden johtaja sekä entinen Mind Foundryn tekoälyn hallintatuotepäällikkö, selittää, mikä tekee koneoppimismallista luotettavan.

”Kun päätöksillä on merkittävä vaikutus yksilöiden ja väestöryhmien elämään, mallin luotettavuuden ja vastuullisuuden merkitystä ei voi liioitella”, Garcia kirjoittaa artikkelissa, jonka hän on laatinut yhdessä Oxfordin yliopiston Internet-instituutin professori Brent Mittelstadtin kanssa.

Artikkelissa todetaan, että koneoppimisen luotettavuudessa on kolme keskeistä osa-aluetta:

  • Puolueellisuus ja oikeudenmukaisuus: Useiden ”oikeudenmukaisuusmittareiden” käyttö mallin oikeudenmukaisen toiminnan varmistamiseksi. Kirjoittajat myöntävät, että mittarit ovat usein ristiriidassa keskenään.
  • Tulkittavuus ja selitettävyys: Tämä kuvaa sitä, missä määrin ihminen pystyy ymmärtämään logiikan ja prosessin, jota tekoälymalli on käyttänyt tuloksensa saavuttamiseen.
  • Datan muuttuminen ja mallin hauraus: Tämä kuvaa sitä, kuinka käyttäjien syötteiden ja muiden tekijöiden vuoksi alkuperäiseen koulutusaineistoon tehdyt muutokset voivat vaikuttaa kielteisesti mallin tuloksiin.

Voimme päätellä, että Google seuraa näitä tekijöitä tarkasti varmistaakseen, että Gemini-tuoteperhe pysyy ”hallinnassa”. Jää nähtäväksi, näemmekö vastaavaa sitoutumista markkinaosuudesta kilpailevilta kilpailijoilta.

Miten Gemini pärjää verrattuna ChatGPT:hen?

Google on luvannut kehittäjille paljon raakaan suorituskykyyn liittyen. Tässä ovat Googlen mukaan Gemini Ultran ja Gemini Pron suorituskyvyn vertailuarvot verrattuna ChatGPT:hen.

Suorituskykyvertailut: GPT-4 vs Gemini Ultra ja Gemini Pro

Täydellinen luettelo Gemini Ultran ja Gemini Pron ilmoitetuista suorituskykyvertailuista GPT-4:ään verrattuna. Gemini Nanosta ei ole vielä julkaistu suorituskykyvertailuja.

 

Uusi kausi vai uusi aikakausi?

Vaikka Geminin julkaisu saattaa olla vain uusin luku nopeasti etenevän tekoälyinnovaatioiden jatkuvan tarinan sarjassa, tämä tuntuu erilaiselta. 

Vaikka Geminin erityisten monimuoto-ominaisuuksien laajentuneet toiminnallisuudet tarjoavat ilmeisen rajattoman mahdollisuuden tuotekehitykseen (myös käyttäjätarinoiden kirjoittamiseen!), sen merkittävin panos on tekoälyinnovaatioiden virstanpylväs, jota se edustaa.

Johdattaako Gemini meidät todelliseen AGI-malliin ennen vuoden 2024 loppua? Se saattaa olla kirjoitettu tähtiin.

Muista tilata uutiskirjeemme, joka tarjoaa sinulle toimialan johtajien ja asiantuntijoiden laatimia tuotehallinnan näkemyksiä, oppaita ja resursseja.

Hannah Clark
Hannah Clark is the Editor of The CPO Club. Following six years of experience in the tech industry, she pivoted into the content space where she's had the pleasure of working with some of the most brilliant voices in the product world. Driven by insatiable curiosity and a love of bringing people together, her mission is to foster a fun, vibrant, and inspiring community of product people. Interested in being reviewed? Find out more here.
Follow the author:

You may also like