Teknisesti nyt saattaa olla Jousimiehen kausi, mutta Kaksoset ovat ottamassa vallan.
Google DeepMind ilmoitti 6. joulukuuta uuden natiivisti multimodaalisen tekoälymallinsa ja GPT-4:n kilpailijan, Geminin, julkaisusta.
Geminin saapumista juhlistavassa blogikirjoituksessa Google DeepMindin toimitusjohtaja ja toinen perustaja Demis Hassabis kuvaili uusinta kehitystyötä ”kyvykkäimmäksi ja yleiskäyttöisimmäksi malliksi, jonka olemme koskaan rakentaneet”. Huhut siitä, että tuotesarja voisi olla vakavasti otettava ehdokas yleiseen tekoälyyn (AGI), ovat voimistuneet, ja Geminin vaikutus näkyy jo armottoman kilpailun tekoälyliiketoiminnan kentällä.
Mutta miten se vaikuttaa digitaalisiin tuotteisiin tulevana vuonna? Tässä ovat tärkeimmät asiat, jotka sinun on tiedettävä – hyvät, huonot ja mahdollisesti rumat.
Mikä Gemini on?
Gemini ei ole vain yksi tuote, vaan kolme: suurten multimodaalisten mallien (LMM) perhe, joka seuraa Google DeepMindin LaMDA- ja PaLM 2 -neuroverkkoja. Kolme tuotetta ovat:
- Gemini Ultra: Tehokkain malli, joka on määrä julkaista kehittäjille vuoden 2024 alussa. Ultra lupaa kyvyn ”ymmärtää”, tuottaa ja yhdistellä virtuaalisesti monenlaisia syötteitä, kuten ääntä, videota, tekstiä, koodia ja kuvia, vaikuttavan lähellä reaaliaikaa olevilla nopeuksilla.
- Gemini Pro: Kuluttajatason malli, joka on tällä hetkellä kehittäjien saatavilla. Niissä maissa, joissa Bard on saatavilla, käyttäjät ovat voineet olla vuorovaikutuksessa Gemini Pron kanssa siitä lähtien, kun se julkistettiin 6. joulukuuta.
- Gemini Nano: Kompakti malli, joka on suunniteltu mobiilisovellusten käyttövoimaksi. Gemini Nanoa ei Gemini Ultran tavoin ole vielä julkaistu, eikä Google ole vielä ilmoittanut sen suorituskykyä koskevia tietoja.
Have an account? Log In
Mitä multimodaalinen tekoäly on?
Multimodaalinen tekoäly on tekoälyä, joka pystyy käsittelemään useita tietotyyppejä useiden älykkyyden käsittelyalgoritmien avulla. Esimerkiksi tekstistä kuvaksi -tekoälymallia, kuten Midjourneyta, pidetään multimodaalisena tekoälynä.
Vaikka monet LMM:t ovat jo tulvineet markkinoille, Geminin erottaa muista suurista multimodaalisista kielimalleista se, että se on suunniteltu ”ymmärtämään” useita syötteitä (tekstiä, videota, ääntä, koodia ja kuvia) tavalla, joka jäljittelee ihmisen ymmärrystä ja luovuutta.
Hyvä puoli: multimodaalisen tekoälyteknologian mahdollisuudet
ChatGPT:n tekstistä tekstiksi -generoinnin vallattua yleisen mielikuvituksen ei ole kulunut edes kokonaista kalenterivuotta, kun Gemini merkitsee uuden aikakauden alkua: multimodaalisesta toiminnallisuudesta tulee pian tekoälypohjaisten tuotteiden perusvaatimus.
Ken Hubbell, tekoälyalusta Soffos.ai:n toimitusjohtaja, näkee teknologialla valtavat mahdollisuudet tulevana vuonna.
”Olemme alkaneet ajatella esimerkiksi reaaliaikaista analyysiä siitä, mitä näet visuaalisesti”, Hubbell sanoo. ”Näen siis uusia tuotteita, kuten laseja, jotka voivat vastaanottaa videokuvaa ja nyt myös käsitellä videokuvaa sekä tuottaa tuloksia (reaaliajassa).”
Vaikka tämä antaa tuotetiimeille ennen näkemättömän joustavuuden tason, se johtaa väistämättä myös niiden tuotteiden ennenaikaiseen vanhentumiseen, jotka on rakennettu laajentamaan GPT-4:n kaltaisten alustojen toiminnallisuutta ja mahdollistamaan Geminin kaltaiset toiminnot – ja kaikki nämä tuotteet ovat itsekin vasta muutaman kuukauden ikäisiä.
”(Nämä tuotteet) muuttuvat pian joko merkityksettömiksi tai ne on suunniteltava kokonaan uudelleen, jotta niihin voidaan sisällyttää kaikki uusi, jonka ympärille ne aiemmin ’hakkeroivat’ kiertoratkaisunsa”, Hubbell sanoo.
(Nämä tuotteet) muuttuvat pian joko merkityksettömiksi tai ne on suunniteltava kokonaan uudelleen, jotta niihin voidaan sisällyttää asiat, joiden ympärille ne aiemmin ’hakkeroivat’ kiertoratkaisunsa.
KEN HUBBELL, TOIMITUSJOHTAJA, SOFFOS.AI
Vaikka Hubbell myöntää, että monet yritykset tulevat kärsimään tappioita investoinneista, joita ne ovat tehneet näihin nyt vanhentuneisiin kiertoratkaisuihin, hänen mukaansa tämä on itse asiassa hyvä asia valepuvussa.
”Kun Alexa julkaistiin, monet ihmiset etsivät tapoja tehdä asioita, joihin Alexa-tuote itsessään ei pystynyt – minä olin yksi heistä”, Hubbell naurahtaa ja huomauttaa, että Amazonin tiimi huomasi nopeasti ominaisuudet, joita ulkopuoliset kehittäjät rakensivat, ja integroi ne Alexa-alustaan.
”Se tavallaan hankaloitti meidän kehittäjien asemaa, mutta toisaalta se paransi taustajärjestelmää niin paljon, että pystyimme nyt keskittymään asioihin, joiden ympärille meidän ei tarvinnut rakentaa kiertoratkaisuja – ja pystyimme todella tekemään lopullisen tuotteen, jonka halusimme.”
Huono puoli: Geminin varhainen vastaanotto

Vaikka tämä erittäin kyvykkään multimodaalisen tekoälyn uusi aikakausi kuulostaa vallankumoukselliselta, Gemini Pron varhainen vastaanotto on ollut laajalti pettymys. Tuotteen julkaisua seuranneen viikon aikana LinkedInin ja X:n syötteet kaikkialla alkoivat täyttyä tyytymättömien käyttäjien arvioista, joita olivat kirjoittaneet Gemini Prota kokeilleet käyttäjät.
Ongelma? Gemini vaikuttaa olevan… hieman tyhmä.
TechCrunchin artikkelit ja useiden Medium-kirjoittajien tekstit nostivat esiin sosiaalisen median käyttäjien julkaisuja, joissa oli kuvakaappauksia siitä, kuinka Gemini ei onnistunut vastaamaan kysymyksiin oikein.
Mutta kuten Hubbell selittää, alusta tekee juuri sitä, mitä kenen tahansa olisi pitänyt odottaa sen tekevän.
”Tekoälyn kasvattaminen muistuttaa itse asiassa paljon lapsen kasvattamista”, sanoo Hubbell, joka (ennen kuin kysytte) on myös isä. Hän huomauttaa, että kielimallit voivat oppia vain rajallisesti koulutuksen alkuvaiheissa, jotka tapahtuvat suljetussa ympäristössä ja hyvin pienen käyttäjäotoksen avulla. ”Kun se päästetään vapaaksi maailmaan, varsinainen kasvu tapahtuu siellä.”
Kun se päästetään vapaaksi maailmaan, varsinainen kasvu tapahtuu siellä.
KEN HUBBELL, CEO, SOFFOS.AI
More Articles
Ruma puoli: Eettinen kysymys
Google on julkaisumateriaaleissaan luvannut hyvin avoimesti kehittäneensä Geminin ”vastuullisesti”.
Tämä lupaus on ymmärrettävästi saanut muutamat kriitikot tuntemaan olonsa vaivaantuneeksi.
ZDNETin artikkelissa huomautetaan, että Google päätti jättää Gemini-tuotteiden mallikortit julkaisematta. Mallikorteissa kuvataan muun muassa neuroverkon mahdollisesti haitallisia seurauksia. Tämä on erityisen huolestuttavaa, kun otetaan huomioon, että Googlen tiimi keksi mallikortit alun perin.
Se herättää myös kysymyksen: kun tuote on koulutettu luonnostaan puolueellisella aineistolla, kuka päättää, miltä ”vastuullisuus” näyttää?
Toukokuussa Mind Foundryn blogissa julkaistussa artikkelissa Frankie Garcia, Google DeepMindin uusi operatiivisen tekoälyn etiikan ja turvallisuuden johtaja sekä entinen Mind Foundryn tekoälyn hallintatuotepäällikkö, selittää, mikä tekee koneoppimismallista luotettavan.
”Kun päätöksillä on merkittävä vaikutus yksilöiden ja väestöryhmien elämään, mallin luotettavuuden ja vastuullisuuden merkitystä ei voi liioitella”, Garcia kirjoittaa artikkelissa, jonka hän on laatinut yhdessä Oxfordin yliopiston Internet-instituutin professori Brent Mittelstadtin kanssa.
Artikkelissa todetaan, että koneoppimisen luotettavuudessa on kolme keskeistä osa-aluetta:
- Puolueellisuus ja oikeudenmukaisuus: Useiden ”oikeudenmukaisuusmittareiden” käyttö mallin oikeudenmukaisen toiminnan varmistamiseksi. Kirjoittajat myöntävät, että mittarit ovat usein ristiriidassa keskenään.
- Tulkittavuus ja selitettävyys: Tämä kuvaa sitä, missä määrin ihminen pystyy ymmärtämään logiikan ja prosessin, jota tekoälymalli on käyttänyt tuloksensa saavuttamiseen.
- Datan muuttuminen ja mallin hauraus: Tämä kuvaa sitä, kuinka käyttäjien syötteiden ja muiden tekijöiden vuoksi alkuperäiseen koulutusaineistoon tehdyt muutokset voivat vaikuttaa kielteisesti mallin tuloksiin.
Voimme päätellä, että Google seuraa näitä tekijöitä tarkasti varmistaakseen, että Gemini-tuoteperhe pysyy ”hallinnassa”. Jää nähtäväksi, näemmekö vastaavaa sitoutumista markkinaosuudesta kilpailevilta kilpailijoilta.
Miten Gemini pärjää verrattuna ChatGPT:hen?
Google on luvannut kehittäjille paljon raakaan suorituskykyyn liittyen. Tässä ovat Googlen mukaan Gemini Ultran ja Gemini Pron suorituskyvyn vertailuarvot verrattuna ChatGPT:hen.
Suorituskykyvertailut: GPT-4 vs Gemini Ultra ja Gemini Pro
Täydellinen luettelo Gemini Ultran ja Gemini Pron ilmoitetuista suorituskykyvertailuista GPT-4:ään verrattuna. Gemini Nanosta ei ole vielä julkaistu suorituskykyvertailuja.
Uusi kausi vai uusi aikakausi?
Vaikka Geminin julkaisu saattaa olla vain uusin luku nopeasti etenevän tekoälyinnovaatioiden jatkuvan tarinan sarjassa, tämä tuntuu erilaiselta.
Vaikka Geminin erityisten monimuoto-ominaisuuksien laajentuneet toiminnallisuudet tarjoavat ilmeisen rajattoman mahdollisuuden tuotekehitykseen (myös käyttäjätarinoiden kirjoittamiseen!), sen merkittävin panos on tekoälyinnovaatioiden virstanpylväs, jota se edustaa.
Johdattaako Gemini meidät todelliseen AGI-malliin ennen vuoden 2024 loppua? Se saattaa olla kirjoitettu tähtiin.



