00:00Google met à jour son modèle d'image, Nano Banana passe à la version 2.1.
00:04Une nouvelle version qui va remplacer Nano Banana 2 sur Gemini ou encore Google Flow
00:09et qui sera aussi disponible via l'API de Gemini.
00:13Donc pour y avoir accès via Google Gemini, c'est très très simple,
00:16il suffira de créer une image, ça sera automatiquement ce nouveau modèle qui sera utilisé.
00:20La même chose en se rendant sur Google Flow.
00:23Alors, ce nouveau modèle, on nous annonce une légère évolution
00:27par rapport au précédent Google Nano Banana 2.
00:30Que ça soit dans le texte ou image, ou dans l'utilisation de référence,
00:33ou dans ses capacités d'édition, on voit à chaque fois sur les différentes catégories
00:38une légère amélioration, même si ce n'est pas un grand bond en avant.
00:42Du coup, j'ai voulu voir un petit peu ce qui changeait de mon côté.
00:45Une des premières bonnes nouvelles, c'est dans sa capacité d'édition à travers la même conversation.
00:50Par exemple ici avec Google Flow, où on est passé d'une image,
00:53ici la voiture jaune dans un ciel bleu,
00:55avec la modification de la voiture en rouge,
00:58le changement du ciel pour que ça soit la nuit,
01:01l'ajout d'une caravane à la voiture,
01:02on voit qu'à chaque fois, on a la même cohérence
01:06et la qualité qui a été préservée à travers les différents designs.
01:09Ensuite, j'ai continué l'exercice en voulant ajouter ici
01:13une image référence extérieure, donc celle du chien,
01:16en indiquant que celui-ci sort la tête de la fenêtre.
01:19Là par contre, le résultat est un petit peu moins bien,
01:21malgré le fait que le prompt a été compris, perd tout de suite en réalisme.
01:26D'ailleurs, si on va en détail dans la documentation,
01:28les nouveautés qui sont mises en avance,
01:29c'est une qualité visuelle et un réalisme améliorée
01:32pour les sorties, que ce soit en 1K jusqu'à la 4K,
01:35une correction des artefacts,
01:36une amélioration du rang du texte,
01:38surtout sur la mise en page d'infographie,
01:40la fusion jusqu'à 14 images références,
01:42donc 4 personnages et 10 objets,
01:44un ancrage à la recherche web et aux images de Google
01:47et un niveau de réflexion configurable,
01:50donc minimum, médium et par défaut.
01:52On va voir tout de suite maintenant avec des tests comparatifs.
01:55Et pour ça, je suis passé par la plateforme Xfield
01:57qui permet d'avoir les deux modèles en API.
01:59Donc tout d'abord, texte ou vidéo avec des prompts construits.
02:02Exemple ici, avec un Jack Russell faisant du scooter.
02:05Ici, donc, on est bien sur la version 2.1.
02:08Comparatif avec le même prompt sur la version 2.0.
02:12On voit qu'on a une qualité d'image similaire,
02:16mais peut-être une meilleure compréhension
02:17dans le sens où, là, on n'a pas le sentiment
02:20que le scooter est en mouvement,
02:22malgré que l'arrière-plan est en flou.
02:24Et ici, la scène donne plus de cohérence.
02:26A noter aussi, la lumière sur le poil du Jack Russell,
02:29c'est un léger détail,
02:30mais une image qui semble un tout petit peu supérieure.
02:32J'ai voulu essayer aussi avec d'autres styles
02:34et surtout en ajoutant du texte,
02:36puisque c'était une fonctionnalité qui était mise en avant.
02:39Donc ici, on est sur 2.1.
02:41Avec un étudiant qui doit copier au tableau,
02:44je n'utiliserai pas l'IA dans un style animé.
02:47La scène me convient, sauf la place du tableau, bien sûr,
02:50puisqu'elle a été mise au milieu de la classe.
02:52A noter qu'avec Nano Banana 2,
02:54on avait quelque chose qui était très bien aussi,
02:57et peut-être même ici,
02:58plus exploitable par rapport aux 2.1.
03:01Ici, sur un style Claymation en 2.1,
03:03avec un inspecteur qui interroge un serveur en fin de service.
03:07Là, le détail qui me dérange un petit peu,
03:09c'est l'inscription du café qui a été mal réalisée en arrière-plan.
03:13Par contre, les détails de la scène derrière,
03:14on voit bien les tasses en fin de journée,
03:16le menu, la buée de fin de soirée avec l'éclairage,
03:19ce n'est pas trop mal.
03:20Mais encore une fois, ici, sur du 2.0,
03:23on ne voit vraiment pas trop la différence.
03:25Et même ici, il a bien réussi à mettre le café,
03:28même si au-dessus, c'est illisible.
03:30Pareil, en termes de détails d'arrière-plan, aucun souci.
03:33Ça se vaut.
03:34Pour du photoréalisme,
03:35ici, on est sur Nano Banana 2.
03:38Et là, je voulais que le personnage principal
03:39boit un matcha et qu'à côté,
03:42il y ait un journal qui dit
03:44« L'automne sera doux ».
03:45Le problème, c'est qu'ici, on a un manque de cohérence,
03:48puisqu'on ne sait pas où le banc commence et fini,
03:51ou alors c'est une table.
03:52Pas terrible.
03:53À noter qu'à chaque fois,
03:54je fais seulement une seule génération.
03:55Et ça, c'est sur Nano Banana 2.1,
03:58où aussi, le matcha latte est beaucoup plus respecté.
04:02Bon, après, sur la lumière,
04:03c'est quasiment pareil.
04:05Par contre, sur la mise en scène,
04:06il a bien réussi à mettre le journal à côté.
04:08Par contre, autant sur Nano Banana 2,
04:10j'avais « Le Monde » qui était indiqué.
04:12Ici, j'ai une marque de journal
04:14que je n'arrive pas à déchiffrer.
04:16Le titre est bien présent.
04:17Et c'est celui-ci qui était bien indiqué dans mon prompt.
04:20Donc, texte ou image,
04:22on peut dire une très, très légère évolution,
04:24pas une révolution.
04:26Par contre, il est annoncé que normalement,
04:27il est meilleur sur les images références.
04:31On a tenté, avec un prompt simple
04:32et une image référence d'une fiche personnage,
04:35donc la mienne,
04:35d'indiquer « Il boit un café sur le VioPort à midi ».
04:39En termes de visage sur les modèles de Google,
04:41on a toujours un petit souci.
04:43On a toujours ces petits détails qui s'ajoutent.
04:45Donc là, par exemple, si on zoom,
04:46« Terrasse synaptotique notre d'arbre »,
04:50il s'est embrouillé à vouloir en faire trop.
04:52Le même prompt, cette fois-ci, avec 2.1.
04:55Et là, j'ai été agréablement surpris.
04:57Même si encore, on n'a pas un visage référence qui est à 100%,
05:00la composition est beaucoup plus agréable,
05:02avec une mise en scène et puis une lumière de midi
05:05qui fait beaucoup plus naturel.
05:06Donc ici, avantage à 2.1.
05:08Et je n'ai pas pu me retenir comme on est sur de l'image référence
05:10de comparé aussi avec GPT 2.5.
05:13Ici, j'ai pris le modèle API Sunburst.
05:15Là, c'est vrai qu'en termes de référence visage,
05:18il est meilleur que les modèles Google.
05:19Et pareil en termes de texte,
05:21même si ici derrière, ça fait un petit peu IA,
05:23je n'ai pas de faute.
05:24Et donc pour de l'IA, j'ai un résultat quand même satisfaisant.
05:27Alors ensuite, on nous dit que le modèle est quand même plus intelligent
05:30et il arrive à comprendre mieux les consignes.
05:32Donc ici, je l'ai testé dans une mise en situation,
05:34celle de la réalisation de la miniature de cette vidéo.
05:37En commençant déjà par le modèle 2.0.
05:40Donc le prompt dans une miniature YouTube,
05:43au milieu, on voit le personnage,
05:44remplace la tête du personnage de l'image 1.
05:47Pour la référence, c'est David Goudeneuve.
05:48Avec ma fiche caractère.
05:50Je ne veux pas qu'il change le costume.
05:51Par contre, il change la tête du personnage
05:53pour mettre celle du numéro 2.
05:55En essayant de garder l'expression du personnage 1
05:57et en lui faisant tenir une banane dans chaque main
06:00avec le titre au-dessus, Nano Banana 2.1.
06:03On voit qu'avec Nano Banana 2,
06:05la consigne de garder le costume n'a pas été trop respectée.
06:08Pareil, les bananes, pas trop sexy.
06:11La tête du personnage qui garde l'expression, ça va encore.
06:13Par contre, avec Nano Banana 2.1,
06:16on est un petit peu mieux.
06:17C'est-à-dire qu'on a bien le costume qui a été respecté.
06:20Et même en termes de composition, c'est beaucoup plus sympa.
06:22Sur la tête, on a un peu un mix entre les deux têtes.
06:25Et je refais le test avec GPT Image 2.5, Sunburst.
06:29Et je trouve que c'est le résultat le plus original
06:31et la composition la plus réussie.
06:34D'ailleurs, je pense que je mettrai les deux miniatures en A-B testing.
06:37Et je pense que c'est celle-ci qui va ressortir sur le long terme.
06:40Ce modèle 2.1, il va être intéressant dans l'utilisation
06:43des autres outils de Google comme YouTube.
06:45Où on voit, on a une nouveauté maintenant,
06:47c'est demander à Studio ici.
06:49Et par exemple, on peut demander de créer notre miniature
06:52pour notre vidéo YouTube directement depuis la plateforme.
06:56Donc en utilisant Studio, tu demandes
06:58« Génère une miniature pour ma dernière vidéo longue ».
07:00Et ce que je trouve intéressant, c'est qu'on va avoir YouTube
07:03qui va analyser notre dernière vidéo
07:04et qui va directement nous proposer une miniature
07:07en tenant compte de la composition de la vidéo.
07:09Donc généralement, reprendre notre tête en image référence
07:13et le sujet de la vidéo pour nous proposer quelque chose,
07:15ça permet d'avoir des propositions toutes prêtes.
07:18Alors, ça ne vaut pas encore une miniature
07:19qu'on a travaillée de notre côté.
07:21Mais franchement, il y a une évolution.
07:22Donc bon, ma tête n'est pas parfaite.
07:24Mais il a compris le sujet de ma dernière vidéo.
07:26Il m'a marqué un titre.
07:27Il m'a mis les logos.
07:28Il m'a mis le personnage principal et moi
07:30qui explique comment j'ai créé une vidéo sur les backrooms.
07:33Donc voilà, pas encore parfait.
07:34Mais à noter que ça commence vraiment à s'améliorer
07:36du côté de Google et de YouTube.
07:38Et que bientôt, peut-être, on aura la possibilité
07:41de générer des miniatures de très bonne qualité
07:44en automatique depuis notre compte YouTube.
07:46Retour sur nos tests pour tester le maximum d'entrées.
07:49Donc ici, avec les 14 entrées,
07:5113 objets plus ma fiche personnage
07:53pour les mettre en scène dans une composition originale.
07:56Donc les 14 objets sont là.
07:58Après, la composition, j'ai une tête un petit peu bizarre, je trouve.
08:01Plus le fait d'avoir les tableaux à côté.
08:03Là, on est sur Nano Banana 2.
08:05Ça, c'est le résultat que j'ai eu avec GPT Image 2.5 Sunburst
08:09où la tête n'a pas du tout été prise en compte.
08:11Mais la composition, on voit encore que le modèle est très très fort.
08:15Et sachant que lui, il peut aller au-delà de 14 images.
08:17Et 2.1, encore une fois, le personnage n'est pas ressemblant à 100%.
08:21Mais pour le coup, ici, la composition est beaucoup plus naturelle.
08:25Vraiment pas trop mal.
08:26Et dernier exemple, là où Google annonce vraiment un gap,
08:29c'était sur tout ce qui était génération d'infographie.
08:31Donc Nano Banana 2, ici, sur l'infographie sur la révolution française,
08:36on voit qu'il nous mélange le français et l'anglais,
08:38qu'on a quelque chose qui n'est pas terrible.
08:40Ça, c'est la version faite avec GPT Image 2.5 Sunburst.
08:43Très très complet, beaucoup de texte.
08:45Peut-être un petit peu chargé, mais au moins tout est là.
08:47Et ça, c'est la version Nano Banana 2.1.
08:50Et pour le coup, je trouve vraiment pas mal.
08:52En termes de composition, en termes de lecture,
08:54tout est en français parfaitement.
08:56On n'a pas du mélange français-anglais.
08:58On a une logique qui est beaucoup plus claire.
09:00Donc vraiment à tester sur des infographies.
09:02Je pense que c'est là que le modèle va prendre tout son sens
09:05et sera le meilleur.
09:06Voilà pour cette petite mise à jour.
09:08C'est un petit peu comme ce qu'on a eu avec le modèle vidéo OmniFlash 1.1.
09:12On est vraiment sur du léger ajustement.
09:15En attendant, je pense, les grosses annonces de Google
09:18et notamment Gemini 4 Argon,
09:20qui devraient arriver prochainement accompagnés de belles promesses.
09:24Merci d'avoir suivi cette vidéo.
09:25C'était Marco.
09:26Je te dis à très bientôt sur le Labo des Réseaux pour d'autres tutos.