Google développe une gamme Gemini plus spécialisée pour les agents IA utilisés en production. Gemini 3.5 Flash est l’option la plus performante pour le code, le raisonnement et les workflows agentiques de longue durée. Gemini 3.1 Flash-Lite vise les tâches à grand volume pour lesquelles la latence et le coût sont prioritaires. Gemini 3.5 Flash Cyber est un modèle de cybersécurité conçu pour détecter et corriger les vulnérabilités, mais son accès est initialement limité aux gouvernements et aux partenaires de confiance par l’intermédiaire de CodeMender.
La stratégie Gemini de Google consiste de moins en moins à trouver un modèle unique capable de tout faire. Elle vise désormais à attribuer à chaque charge de travail le meilleur équilibre entre intelligence, rapidité, coût et niveau de risque. Cette évolution est importante pour les entreprises qui développent des agents IA en production, car un même système peut devoir résoudre un problème complexe, appeler plusieurs outils, traiter des milliers de demandes répétitives et manipuler du code sensible sur le plan de la sécurité.
La gamme Gemini actuelle reflète cette réalité. Gemini 3.5 Flash cible les workflows agentiques et les tâches de programmation exigeantes. Gemini 3.1 Flash-Lite traite les opérations plus légères à grande échelle. Gemini 3.5 Flash Cyber se concentre sur un besoin plus précis mais essentiel : aider les équipes de sécurité à détecter, valider et corriger plus efficacement les vulnérabilités logicielles.
Il ne s’agit donc pas seulement de modèles plus rapides. Google propose une architecture de production plus claire, dans laquelle les développeurs peuvent orienter chaque tâche vers le modèle approprié au lieu de payer le prix d’un modèle avancé pour chaque requête.
D’abord, une correction concernant l’annonce devenue virale
La publication diffusée sur les réseaux contient deux erreurs de dénomination. Google n’a officiellement annoncé aucun modèle nommé Gemini 3.6 Flash dans les sources consultées pour cet article. Le modèle stable destiné à la production est Gemini 3.5 Flash. Le modèle à faible coût est Gemini 3.1 Flash-Lite et non Gemini 3.5 Flash-Lite.
| Nom indiqué dans la publication | Nom officiel du modèle Google | Statut |
|---|---|---|
| Gemini 3.6 Flash | Gemini 3.5 Flash | Disponible de manière générale et stable |
| Gemini 3.5 Flash-Lite | Gemini 3.1 Flash-Lite | Disponible de manière générale et stable |
| Gemini 3.5 Flash Cyber | Gemini 3.5 Flash Cyber | Programme pilote à accès limité via CodeMender |
Le message général reste néanmoins pertinent : Google offre davantage de possibilités aux développeurs qui souhaitent créer des agents de production plus rapides, plus économiques et plus fiables. Les détails sont toutefois essentiels lorsqu’une équipe choisit une API, estime ses coûts ou prépare une migration.
Gemini 3.5 Flash : le modèle principal pour les agents de production avancés
Gemini 3.5 Flash est le modèle Flash stable le plus performant de Google pour l’exécution agentique prolongée, le développement logiciel et les tâches de longue durée. Il est conçu pour les workflows dans lesquels le modèle doit faire davantage que répondre à une seule instruction. Il peut planifier, appeler des outils, analyser leurs résultats, réviser son approche et poursuivre le travail sur plusieurs étapes.
Programmation agentique et exécution en plusieurs étapes
Gemini 3.5 Flash est conçu pour les boucles de développement rapides, le déploiement de sous-agents et les tâches qui obligent le modèle à conserver une direction cohérente au cours d’une longue suite d’actions.
Prise en charge du texte, des images, de la vidéo, de l’audio et des PDF
Le modèle accepte plusieurs formats d’entrée et produit du texte, ce qui le rend adapté aux agents devant interpréter des documents, des captures d’écran, des enregistrements ou des fichiers de projet hétérogènes.
Appel de fonctions, exécution de code, recherche ancrée et utilisation d’un ordinateur
Google indique que le modèle prend en charge les sorties structurées, la recherche dans les fichiers, le contexte d’URL, l’exécution de code, l’appel de fonctions et l’ancrage dans les résultats de recherche. L’utilisation d’un ordinateur est également proposée en aperçu pour les agents qui interagissent avec des interfaces web, mobiles ou de bureau.
Une fenêtre d’entrée d’un million de tokens
Le modèle prend en charge jusqu’à 1 048 576 tokens en entrée et 65 536 tokens en sortie. Les développeurs peuvent ainsi lui fournir de vastes bases de code, de longs documents ou un contexte de travail important lorsque la tâche l’exige.
Les usages les plus adaptés à Gemini 3.5 Flash
Gemini 3.5 Flash est particulièrement pertinent lorsque le coût d’une réponse insuffisante est supérieur au coût d’une inférence plus importante. Il peut notamment convenir aux agents de programmation complexes, aux assistants de recherche, aux workflows d’entreprise en plusieurs étapes, à l’analyse de nombreux documents, aux systèmes d’assistance utilisant des outils et aux applications qui doivent raisonner à partir de plusieurs sources avant d’agir.
Gemini 3.5 Flash n’est pas l’option Flash la moins chère. Google affiche actuellement, pour l’utilisation standard et payante de l’API, un tarif de 1,50 $ par million de tokens en entrée et de 9 $ par million de tokens en sortie, y compris les tokens de raisonnement. Flash-Lite peut être nettement plus économique pour les tâches simples et répétitives.
Gemini 3.1 Flash-Lite : rapidité et maîtrise des coûts à grande échelle
Gemini 3.1 Flash-Lite est le modèle de production destiné aux tâches très fréquentes pour lesquelles une faible latence et un coût prévisible constituent les principales priorités. Il n’a pas vocation à remplacer les capacités de raisonnement plus poussées de Gemini 3.5 Flash. Son objectif est de rendre les charges de travail IA à grand volume économiquement viables.
Google présente ce modèle comme adapté aux workflows agentiques à grande échelle, à la traduction, à l’extraction simple de données et aux traitements légers. Il accepte les mêmes grandes catégories d’entrées que Gemini 3.5 Flash, notamment le texte, les images, la vidéo, l’audio et les PDF, avec une fenêtre d’entrée d’un million de tokens et une limite de sortie de 65 536 tokens.
| Avantage de Flash-Lite | Pourquoi est-ce important |
|---|---|
| Coût d’API inférieur | Google affiche un tarif de 0,25 $ par million de tokens en entrée et de 1,50 $ par million de tokens en sortie pour l’utilisation standard payante. |
| Vitesse de sortie élevée | Google annonce environ 363 tokens générés par seconde dans son évaluation publiée. |
| Entrées multimodales | Les applications peuvent traiter du texte, des images, de la vidéo, de l’audio et des PDF sans transférer chaque tâche vers un modèle plus puissant. |
| Prise en charge des outils de production | Le modèle prend en charge l’appel de fonctions, les sorties structurées, l’exécution de code, la recherche dans les fichiers, le contexte d’URL et l’ancrage dans les résultats de recherche. |
| Identifiant de modèle stable | Les développeurs peuvent utiliser gemini-3.1-flash-lite à la place du modèle d’aperçu désormais abandonné. |
Cas d’usage pertinents pour Flash-Lite
Flash-Lite est un choix solide pour les pipelines de traduction, la modération, la classification, la création de métadonnées, l’orientation des tickets, les résumés courts, l’extraction structurée, les appels d’outils répétitifs et les fonctionnalités destinées aux clients pour lesquelles la rapidité de réponse est essentielle. Il peut également servir de modèle de première étape afin de filtrer ou de préparer les informations avant de transmettre uniquement les cas difficiles à Gemini 3.5 Flash.
Gemini 3.5 Flash Cyber : un modèle spécialisé dans la défense logicielle
Gemini 3.5 Flash Cyber est la véritable nouveauté de cette annonce. Google DeepMind le décrit comme un modèle léger de cybersécurité basé sur Gemini 3.5 Flash et spécialement ajusté pour détecter, valider et corriger rapidement et efficacement les vulnérabilités logicielles.
Le modèle est conçu pour fonctionner au sein de CodeMender, l’agent de sécurité du code développé par Google. Au lieu de s’appuyer sur un seul appel coûteux à un modèle, CodeMender peut invoquer Flash Cyber à plusieurs reprises afin d’explorer davantage de chemins d’exécution, de valider les découvertes et de produire un rapport consolidé. Cette architecture est particulièrement utile pour la recherche de vulnérabilités, car des failles importantes peuvent être dissimulées dans des espaces d’exécution extrêmement vastes.
Détecter et valider les vulnérabilités
Flash Cyber est optimisé pour analyser les bases de code, explorer les chemins d’exécution et repérer des faiblesses de sécurité que les modèles généralistes pourraient ne pas détecter.
Aider à créer des correctifs et pas seulement des rapports
Le modèle doit aider les équipes de défense à passer de la découverte à la validation puis à la correction, afin de réduire le délai entre l’identification d’un problème et sa résolution.
Un accès limité en raison du caractère à double usage de la cybersécurité
Google prévoit un premier programme pilote destiné aux gouvernements et aux partenaires de confiance via CodeMender. Au lancement, le modèle ne sera pas proposé comme un modèle public de l’API Gemini accessible sans restriction.
Ce que suggèrent les premiers résultats de Google
Google indique que Flash Cyber a surpassé ses principaux modèles Flash lors de ses évaluations internes de sécurité et a découvert davantage de vulnérabilités uniques confirmées au cours de tests réalisés sur le moteur JavaScript V8. L’entreprise précise également que le modèle est déjà utilisé pour aider à identifier et corriger des problèmes dans plusieurs bases de code internes, notamment Chrome, Android, Cloud, Ads et YouTube.
Ces résultats sont communiqués par le fournisseur et devront donc être validés de manière indépendante. Cette annonce montre néanmoins que le développement des modèles d’IA évolue vers des systèmes spécialisés combinant un modèle de fondation généraliste, un entraînement adapté à un domaine, des outils, des contrôles de sécurité et des restrictions de déploiement.
Comparaison de Gemini 3.5 Flash, 3.1 Flash-Lite et 3.5 Flash Cyber
| Modèle | Particulièrement adapté à | Disponibilité | Principal compromis |
|---|---|---|---|
| Gemini 3.5 Flash | Agents complexes, programmation, raisonnement et workflows de longue durée | Version stable dans l’API Gemini, Google AI Studio et d’autres plateformes Google | Coût plus élevé que Flash-Lite |
| Gemini 3.1 Flash-Lite | Tâches légères à grand volume, traduction et traitement simple des données | Version stable dans l’API Gemini et Google AI Studio | Moins adapté aux tâches de raisonnement les plus difficiles |
| Gemini 3.5 Flash Cyber | Détection, validation et correction des vulnérabilités par l’intermédiaire de CodeMender | Programme pilote limité aux gouvernements et aux partenaires de confiance | Accès volontairement restreint et absence de disponibilité générale |
Ce que cela signifie pour l’architecture des agents IA en production
La leçon principale est qu’un agent en production ne doit pas envoyer automatiquement chaque tâche au modèle le plus performant. Un système bien conçu peut orienter les requêtes vers différents modèles afin de maîtriser les coûts et la fiabilité.
Utilisez Gemini 3.1 Flash-Lite pour la classification, l’extraction, la traduction, l’orientation et les autres opérations répétitives à grand volume.
Transférez les cas difficiles à Gemini 3.5 Flash lorsqu’un raisonnement plus profond, une utilisation complexe des outils ou une exécution de longue durée sont nécessaires.
Conservez les tâches de sécurité très spécialisées et sensibles dans des systèmes contrôlés comme CodeMender avec Flash Cyber.
Mesurez le coût total de la tâche, le taux d’échec, la latence et le temps de vérification humaine au lieu de comparer uniquement les prix des modèles.
Cette méthode peut rendre un agent plus rapide et moins coûteux tout en réservant les modèles plus puissants aux parties du workflow pour lesquelles leur raisonnement supplémentaire apporte une véritable valeur.
Où ces modèles sont-ils disponibles
| Plateforme | Gemini 3.5 Flash | Gemini 3.1 Flash-Lite | Gemini 3.5 Flash Cyber |
|---|---|---|---|
| API Gemini | Disponible | Disponible | Pas disponible de manière générale |
| Google AI Studio | Disponible | Disponible | Pas disponible de manière générale |
| Application Gemini | Disponible | Principalement destiné aux développeurs et aux usages d’entreprise | Non disponible |
| CodeMender | Famille de modèles généralistes sous-jacente | Il ne s’agit pas du modèle de sécurité spécialisé | Accès pilote limité |
Ce que les développeurs doivent vérifier avant une migration
Ne migrez pas uniquement en fonction du nom du modèle
Les modèles Flash peuvent présenter des tarifs et des profils de raisonnement très différents. Testez le workflow complet avec des données réelles avant de remplacer un modèle déjà utilisé en production.
Comptabilisez les tokens de raisonnement et les boucles de l’agent
Le coût d’un agent comprend les raisonnements intermédiaires et les appels répétés au modèle. Un modèle qui semble économique par requête peut devenir coûteux lorsqu’un agent effectue de nombreuses boucles.
Mesurez le temps de correction
Une inférence moins chère ne génère aucune économie si le résultat exige davantage de vérification humaine, de nouvelles tentatives ou de corrections manuelles.
Vérifiez la prise en charge des outils
Gemini 3.1 Flash-Lite prend en charge de nombreux outils de production, mais pas l’utilisation d’un ordinateur. Les applications qui dépendent d’interactions avec une interface visuelle peuvent nécessiter Gemini 3.5 Flash.
Ne considérez pas Flash Cyber comme une API publique de sécurité offensive
Google le déploie progressivement dans un cadre contrôlé, car la détection avancée des vulnérabilités peut servir à des usages défensifs comme offensifs. Il ne faut donc pas supposer qu’il sera accessible au grand public.
L’essentiel à retenir
La gamme Gemini actuelle offre trois voies distinctes aux développeurs. Gemini 3.5 Flash apporte un raisonnement plus avancé et une exécution agentique renforcée aux applications de production exigeantes. Gemini 3.1 Flash-Lite offre la rapidité et la structure de coûts nécessaires aux traitements à grand volume. Gemini 3.5 Flash Cyber applique l’architecture Flash à la défense logicielle dans un environnement à accès restreint.
Le changement le plus important concerne l’architecture. L’avenir de l’IA en production ne reposera probablement pas sur un modèle unique chargé de toutes les requêtes. Il appartiendra à des systèmes capables d’orienter intelligemment le travail, de combiner des modèles généralistes et spécialisés, de contrôler l’accès aux outils et d’imposer une validation humaine lorsque les conséquences sont importantes.
Pour les développeurs, la bonne question n’est donc plus simplement de savoir quel modèle Gemini est le meilleur, mais quel modèle convient le mieux à chaque étape du workflow.
Questions fréquentes
Google a-t-il lancé Gemini 3.6 Flash
Aucune source officielle de Google consultée pour cet article ne mentionne un modèle Gemini 3.6 Flash. Le modèle Flash avancé et stable de Google est Gemini 3.5 Flash.
Existe-t-il un modèle Gemini 3.5 Flash-Lite
Le modèle stable à faible coût actuellement proposé par Google est Gemini 3.1 Flash-Lite. Il est optimisé pour les tâches légères à grand volume et pour réduire le coût de l’API.
Pour quels usages Gemini 3.5 Flash est-il le mieux adapté
Il convient particulièrement à la programmation complexe, à l’exécution agentique, à l’analyse multimodale, aux tâches nécessitant un long contexte et aux workflows qui utilisent plusieurs fois des outils ou exigent un raisonnement approfondi.
Quelle est la vitesse de Gemini 3.1 Flash-Lite
Google annonce environ 363 tokens générés par seconde dans son évaluation publiée. La vitesse réelle d’une application dépendra également de la taille de l’instruction, des paramètres de raisonnement, des outils utilisés, des conditions du réseau et de la conception de la charge de travail.
Les développeurs peuvent-ils accéder à Gemini 3.5 Flash Cyber depuis l’API publique
Pas au lancement. Google indique que le modèle sera proposé dans le cadre d’un programme pilote CodeMender limité aux gouvernements et aux partenaires de confiance, avec un élargissement progressif de l’accès.
Quel est le modèle le moins cher pour les charges de travail en production
Gemini 3.1 Flash-Lite est l’option la moins coûteuse parmi ces modèles. Le meilleur choix économique dépend néanmoins de la qualité des résultats, du nombre de nouvelles tentatives, de la consommation de tokens, des appels d’outils et du temps de vérification humaine.
Un agent IA doit-il utiliser un seul modèle Gemini
Pas nécessairement. De nombreux systèmes peuvent réduire leurs coûts en utilisant Flash-Lite pour les opérations courantes et en transférant uniquement les tâches complexes à Gemini 3.5 Flash.
Trouvez le bon modèle d’IA pour chaque tâche
Explorez AISetApp pour comparer les outils d’IA, comprendre leurs points forts et choisir la solution adaptée à votre workflow réel, à votre budget et à votre niveau de risque.
Explorer les outils d’IA- Google DeepMind : présentation de Gemini 3.5 Flash Cyber
- Google AI for Developers : documentation de Gemini 3.5 Flash
- Google AI for Developers : documentation de Gemini 3.1 Flash-Lite
- Google AI for Developers : tarifs de l’API Gemini
- Google : Gemini 3.1 Flash-Lite conçu pour l’intelligence à grande échelle
- Google AI for Developers : notes de mise à jour de l’API Gemini