Skip to main content

C'est peut-être techniquement la saison du Sagittaire, mais c'est le Gémeaux qui prend le dessus.

Le 6 décembre, Google DeepMind a annoncé le lancement de son modèle d’IA nativement multimodal et concurrent de GPT-4, Gemini.

Dans un article de blog annonçant l’arrivée de Gemini, le PDG et cofondateur de Google DeepMind, Demis Hassabis, a salué ce dernier développement comme étant « le modèle le plus polyvalent et général que nous ayons jamais conçu. » Attisant les rumeurs selon lesquelles cette série de produits pourrait être un sérieux candidat à l’intelligence artificielle générale (AGI), l’impact de Gemini se fait déjà sentir sur le marché impitoyable de l’intelligence artificielle.

Mais qu’en est-il de son impact sur les produits digitaux dans l’année à venir ? Voici ce que vous devez savoir — le bon, le mauvais, et le potentiellement pire.

Qu’est-ce que Gemini ?

Gemini n’est pas simplement un produit, mais trois ; une famille de grands modèles multimodaux (LMM) succédant aux réseaux neuronaux LaMDA et PaLM 2 de Google DeepMind. Les trois produits sont :

Vous voulez plus de The CPO Club ?

Inscrivez-vous gratuitement pour terminer la lecture de cet article :

This field is for validation purposes and should be left unchanged.
Name*
This field is hidden when viewing the form
This field is hidden when viewing the form
This field is hidden when viewing the form
By submitting, you agree to receive our newsletter and occasional emails related to The CPO Club. You can unsubscribe at any time. For details, review our Privacy Policy.
  • Gemini Ultra : Le modèle le plus puissant, dont la sortie pour les développeurs est prévue début 2024. Ultra promet la capacité de « comprendre », générer et combiner pratiquement tout type d’entrée incluant l’audio, la vidéo, le texte, le code et les images, le tout à des vitesses proches du temps réel.
  • Gemini Pro : Le modèle destiné aux consommateurs actuellement disponible pour les développeurs. Les utilisateurs des pays où Bard est disponible peuvent interagir avec Gemini Pro depuis son annonce le 6 décembre.
  • Gemini Nano : Le modèle compact conçu pour alimenter les applications mobiles. Gemini Nano, tout comme Gemini Ultra, n’est pas encore sorti et Google n’a pas encore précisé ses caractéristiques de performance.
Nous avons rassemblé l’essentiel — prompts IA, offres exclusives, et une bibliothèque de ressources pour les responsables produit. Déverrouillez votre compte pour y accéder.

Nous avons rassemblé l’essentiel — prompts IA, offres exclusives, et une bibliothèque de ressources pour les responsables produit. Déverrouillez votre compte pour y accéder.

This field is for validation purposes and should be left unchanged.
Name*
This field is hidden when viewing the form
This field is hidden when viewing the form
This field is hidden when viewing the form
By submitting, you agree to receive our newsletter and occasional emails related to The CPO Club. You can unsubscribe at any time. For details, review our Privacy Policy.

Qu’est-ce que l’IA multimodale ?

L’IA multimodale est une intelligence artificielle capable de traiter plusieurs types de données en utilisant divers algorithmes de traitement de l’intelligence. Par exemple, un modèle IA de génération image à partir de texte comme Midjourney est considéré comme une IA multimodale.

Alors que de nombreux LMM ont déjà inondé le marché, ce qui distingue Gemini des autres grands modèles multimodaux est qu’il est conçu pour « comprendre » de nombreuses entrées (texte, vidéo, audio, code, images) d’une façon qui imite la compréhension et la créativité humaine. 

Le bon : le potentiel de la technologie IA multimodale

Moins d’un an après que la génération texte-à-texte de ChatGPT ait captivé l’imagination du grand public, Gemini marque une nouvelle ère où la fonctionnalité multimodale va rapidement devenir un standard minimum pour les produits alimentés par l’IA.

Ken Hubbell, PDG de la plateforme IA Soffos.ai, entrevoit un potentiel énorme pour la technologie dans la nouvelle année.

« Nous avons commencé à réfléchir à des choses comme l’analyse en temps réel de ce que vous voyez visuellement », explique Hubbell. « Donc, je vois de nouveaux produits, comme des lunettes capables de capter un flux vidéo, désormais en mesure de traiter ce flux vidéo et de générer des résultats (en temps réel). »

Si cela permettra aux équipes produit un niveau de flexibilité inédit jusqu’ici, cela conduira aussi inévitablement à l’obsolescence rapide des produits développés pour étendre les fonctionnalités de plateformes comme GPT-4 afin de proposer des fonctions similaires à Gemini — produits qui n’ont d’ailleurs que quelques mois d’existence.

« (Ces produits) deviendront bientôt soit obsolètes, soit devront être complètement repensés pour intégrer toutes les nouveautés qui sont arrivées, là où ils ‘bricolaient’ auparavant », explique Hubbell.

(Ces produits) deviendront bientôt soit obsolètes, soit devront être complètement repensés pour intégrer les éléments qu’ils ‘bricolaient’ précédemment.

KEN HUBBELL, CEO, SOFFOS.AI

Bien que Hubbell admette que de nombreuses entreprises vont perdre les investissements consacrés à ces solutions de contournement désormais obsolètes, il affirme qu’il s’agit en réalité d’une bonne nouvelle déguisée.

« Lorsque Alexa est sortie, beaucoup de gens ont trouvé des moyens de faire des choses impossibles avec le produit lui-même — j’étais l’une de ces personnes », plaisante Hubbell, notant que l’équipe d’Amazon avait rapidement intégré les fonctionnalités développées par des personnes extérieures à leur propre plateforme Alexa.

« Ça a un peu desservi ceux d’entre nous qui étaient développeurs, mais d’un autre côté, cela a tellement amélioré le back-end que nous avons pu nous concentrer sur des aspects pour lesquels il n’était plus nécessaire de bricoler — et nous pouvions réellement développer le produit final que nous voulions. »

Le mauvais : premiers retours sur Gemini

Les utilisateurs se sont montrés impatients face aux premières performances de Gemini.
Les utilisateurs se sont montrés impatients face aux premières performances de Gemini.

Alors que cette nouvelle ère de l’IA multimodale très performante semble révolutionnaire, la première réception de Gemini Pro s’est révélée largement décevante. Durant la semaine qui a suivi l’annonce du lancement du produit, les fils d’actualité LinkedIn et X se sont rapidement remplis de critiques d’utilisateurs mécontents ayant expérimenté Gemini Pro.

Le problème ? Gemini semble être… plutôt bête.

Des articles sur TechCrunch et de nombreux auteurs sur Medium ont souligné des publications d’utilisateurs sur les réseaux sociaux présentant des captures d’écran où Gemini échoue à répondre correctement aux questions.

Mais comme l’explique Hubbell, la plateforme fait exactement ce qu’on aurait dû s’attendre à ce qu’elle fasse.

« Élever une IA, c’est en réalité très similaire à élever un enfant », déclare Hubbell, qui (avant que vous ne posiez la question) est aussi père de famille. Il fait remarquer que les modèles de langage ne peuvent apprendre que dans une certaine mesure durant les premières phases d’entraînement, qui se déroulent dans un environnement fermé avec un très petit échantillon d’utilisateurs. « C’est une fois libérée dans la nature que la véritable croissance commence. »

C’est une fois libérée dans la nature que la véritable croissance commence.

KEN HUBBELL, CEO, SOFFOS.AI

L’aspect problématique : la question de l’éthique

Dans leurs documents de lancement, Google s’est montré très transparent en promettant avoir développé Gemini « de façon responsable ».

Cette promesse a, de manière compréhensible, mis certains critiques mal à l’aise.

Un article de ZDNET relève que Google a choisi de ne pas publier de « cartes de modèle » pour les produits Gemini, alors que ces documents exposent notamment les résultats potentiellement dangereux d’un réseau de neurones. Cela est d’autant plus préoccupant qu’une équipe de Google est justement à l’origine des « cartes de modèle ».

La question se pose alors : avec un produit entraîné sur un jeu de données fondamentalement biaisé, qui décide de ce à quoi ressemble la « responsabilité » ?

Dans un article publié en mai sur le blog de Mind Foundry, Frankie Garcia, nouvelle responsable de l’éthique opérationnelle et de la sécurité de l’IA chez Google DeepMind et ancienne responsable de la gouvernance de l’IA chez Mind Foundry, explique ce qui rend un modèle d’apprentissage automatique digne de confiance.

« Lorsque des décisions ont un impact matériel sur la vie d’individus et de populations, l’importance de la fiabilité et de la responsabilité d’un modèle ne doit absolument pas être sous-estimée », écrit Garcia dans un article co-écrit avec le Professeur Brent Mittelstadt de l’Internet Institute de l’Université d’Oxford.

L’article soutient qu’il existe trois domaines clés de fiabilité pour l’apprentissage automatique :

  • Biais et équité : L’utilisation de plusieurs groupes « d’indicateurs d’équité », qui, reconnaissent les auteurs, ont souvent des effets contradictoires, afin de s’assurer que le modèle agit équitablement.
  • Interprétabilité et explicabilité : Cela décrit dans quelle mesure un utilisateur humain peut comprendre la logique et le raisonnement utilisés par le modèle d’IA pour arriver à sa réponse.
  • Variation des données et fragilité du modèle : Cela décrit la façon dont des changements par rapport au jeu de données d’entraînement initial, dus à des motifs issus des entrées des utilisateurs ou d’autres facteurs, peuvent influencer négativement les sorties du modèle.

On peut en déduire que Google surveille de près ces facteurs afin de s’assurer que la famille de produits Gemini reste « sous contrôle ». Il reste à voir si les concurrents en quête de parts de marché feront preuve d’une implication similaire.

Comment Gemini se compare-t-il à ChatGPT ?

En termes de performances pures, Google a fait des promesses ambitieuses sur ce à quoi les développeurs peuvent s’attendre. Voici les références de performance pour Gemini Ultra et Gemini Pro face à ChatGPT, selon Google.

<!-- wp:acf/accordion { "name":"acf/accordion", "data": { "title": "Références de performance : GPT-4 vs Gemini Ultra & Gemini Pro", "_title": "field_accordion_title", "description": "Liste complète des références de performance rapportées pour Gemini Ultra et Gemini Pro par rapport à GPT-4. Les références de performance pour Gemini Nano n'ont pas encore été rendues publiques.\r\n\r\n ", "_description": "field_accordion_description", "cta": "", "_cta": "field_accordion_cta", "heading_tag": "h3", "_heading_tag": "field_accordion_heading_tag", "add_faq_schema": "0", "_add_faq_schema": "field_accordion_add_faq_schema", "accordion_0_row_header": "Général", "_accordion_0_row_header": "field_row_header", "accordion_0_row_content": "rnrnReprésentation MMLU : Questions sur 57 sujets, incluant les STEM et les sciences humaines.rn
    rn t
  • rn
      rn t
    • GPT-4 : 86,4 % (5-shot)
    • rn
    rn
  • rn
rn rn
    rn t
  • rn
      rn t
    • Gemini Ultra : 90 % (CoT@32*)
    • rn
    rn
  • rn
rn rn
    rn t
  • rn
      rn t
    • Gemini Pro : 79,1 % (CoT@32*)
    • rn
    rn
  • rn
rnrnrnrnrnrnrnrnrnBig-Bench Hard : Ensemble diversifié de tâches complexes nécessitant un raisonnement à plusieurs étapesrn
    rn t
  • rn
      rn t
    • GPT-4 : 83,1 % (3-shot, API)
    • rn
    rn
  • rn
rn rn
    rn t
  • rn
      rn t
    • Gemini Ultra : 83,6 % (3-shot)
    • rn
    rn
  • rn
rn rn
    rn t
  • rn
      rn t
    • Gemini Pro : 75 % (3-shot)
    • rn
    rn
  • rn
rnrnrnrnrnrnrnDROP : Compréhension de lecture (Score F1)rn
    rn t
  • rn
      rn t
    • GPT-4 : 80,9 % (3-shot)
    • rn
    rn
  • rn
rn rn
    rn t
  • rn
      rn t
    • Gemini Ultra : 82,4 % (Nombre de tentatives variable)
    • rn
    rn
  • rn
rn rn
    rn t
  • rn
      rn t
    • Gemini Pro : 74,1 (Score F1)
    • rn
    rn
  • rn
rnrnrnrnrnrnrnHellaSwag : Raisonnement de bon sens pour les tâches du quotidienrn
    rn t
  • rn
      rn t
    • GPT-4 : 95,3 % (10-shot)
    • rn
    rn
  • rn
rn rn
    rn t
  • rn
      rn t
    • Gemini Ultra : 87,8 % (10-shot)
    • rn
    rn
  • rn
rn rn
    rn t
  • rn
      rn t
    • Gemini Pro : 84,7 % (10-shot)
    • rn
    rn
  • rn
rnrnrnrnrnrnrnGSM8K : Manipulations arithmétiques de base (y compris problèmes de niveau primaire)rn
    rn t
  • rn
      rn t
    • GPT-4 : 92 % (5-shot CoT)
    • rn
    rn
  • rn
rn rn
    rn t
  • rn
      rn t
    • Gemini Ultra : 94,4 % (maj1@32)
    • rn
    rn
  • rn
rn rn
    rn t
  • rn
      rn t
    • Gemini Pro : 86,5 % (maj1@32)
    • rn
    rn
  • rn
rnrnrnrnrnrnrnMATH : Problèmes mathématiques complexes (algèbre, géométrie, précalcul, et autres)rn
    rn t
  • rn
      rn t
    • GPT-4 : 52,9 % (4-shot, API)
    • rn
    rn
  • rn
rn rn
    rn t
  • rn
      rn t
    • Gemini Ultra : 53,2 % (4-shot)
    • rn
    rn
  • rn
rn rn
    rn t
  • rn
      rn t
    • Gemini Pro : 32,6 % *4-shot)
    • rn
    rn
  • rn
rnrnrnrnrnrnrnHumanEval : Génération de code Pythonrn
    rn t
  • rn
      rn t
    • GPT-4 : 67 % (0-shot, rapporté)
    • rn
    rn
  • rn
rn rn
    rn t
  • rn
      rn t
    • Gemini Ultra : 74,4 % (0-shot, IT)
    • rn
    rn
  • rn
rn rn
    rn t
  • rn
      rn t
    • Gemini Pro : 67,7 % (0-shot, IT)
    • rn
    rn
  • rn
rnrnrnrnrnrnrnNatural2Code : Génération de code Python.rn
    rn t
  • rn
      rn t
    • GPT-4 : 73,9 % (0-shot, API)
    • rn
    rn
  • rn
rn rn
    rn t
  • rn
      rn t
    • Gemini Ultra : 74,9 % (0-shot)
    • rn
    rn
  • rn
rn rn
    rn t
  • rn
      rn t
    • Gemini Pro : 69,6 % (0-shot)
    • rn
    rn
  • rn
rnrnrnrnrn
Hannah Clark

Hannah Clark est la rédactrice en chef du CPO Club. Après six ans d’expérience dans l’industrie technologique, elle s’est tournée vers le marketing de contenu. Elle a passé une grande partie de la dernière décennie à travailler dans des agences marketing et à proposer des services indépendants de développement de marques et de contenu. Aujourd’hui, elle est éditrice numérique et a le privilège de collaborer avec certaines des voix les plus brillantes du monde des produits. Animée par une curiosité insatiable et le désir de rassembler les gens, sa mission est de promouvoir une communauté dynamique et inspirante autour du produit.













Vous souhaitez être évalué ? En savoir plus ici.