Résumez cet article avec :
- Gemini 3.6 Flash : $1.50/$7.50 par million de tokens avec 17 % de tokens de sortie en moins — une intelligence proche du Pro au tarif Flash
- Flash-Lite : $0.30/$2.50 par million de tokens, le nouveau plancher tarifaire pour les sous-agents et la classification à haut volume
- Flash-Cyber : le premier LLM de Google spécialisé en cybersécurité, 55 vulnérabilités V8 réelles détectées (pilote CodeMender limité)
- Google a discrètement déprécié temperature, top_p et top_k sur les nouveaux modèles Gemini
- Les trois modèles sont accessibles via une API unifiée unique pour un routage hiérarchisé et optimisé en coûts
Gemini 3.6 Flash, Flash-Lite et Flash-Cyber constituent la gamme de modèles de Google pour juillet 2026, pensée pour le routage optimisé en coûts. Flash 3.6 est le cheval de bataille généraliste à $1.50/$7.50 par million de tokens, Flash-Lite est le palier économique à $0.30 pour les sous-agents, et Flash-Cyber est le premier LLM de Google spécialisé en sécurité pour détecter les vulnérabilités logicielles.
Le 21 juillet 2026, Google a lancé trois modèles Gemini simultanément : Gemini 3.6 Flash, Gemini 3.5 Flash-Lite et Gemini 3.5 Flash-Cyber. L'annonce a atteint 627 points et 502 commentaires sur HackerNews — non pas pour ses scores de benchmark bruts, mais parce qu'elle signale un virage stratégique.
Google optimise l'efficacité coût-par-tâche, et non plus seulement les scores d'intelligence. Gemini 3.6 Flash réduit les coûts en tokens de sortie de 17 % par rapport à son prédécesseur. Flash-Lite atteint un nouveau plancher de prix à $0.30 par million de tokens d'entrée. Flash-Cyber est le premier LLM de Google spécifiquement optimisé pour la cybersécurité, rivalisant avec Mythos d'Anthropic à une fraction du coût.
Et Google a déprécié temperature, top_p et top_k — ignorant silencieusement des paramètres d'échantillonnage sur lesquels les développeurs s'appuient depuis des années. Cet article détaille chaque modèle, les changements d'API, et ce que cela implique pour le routage en production.
Gemini 3.6 Flash : le nouveau cheval de bataille par défaut
Gemini 3.6 Flash est le nouveau modèle de palier Flash de Google, positionné comme le cheval de bataille par défaut pour les charges de production. Il égale l'intelligence de Gemini 3.5 Flash tout en réduisant coût et latence.
Spécifications clés :
- ID de modèle API :
gemini-3.6-flash - Fenêtre de contexte : 1 000 000 tokens
- Tarif : $1.50 par million de tokens d'entrée, $7.50 par million de tokens de sortie
- Efficacité des tokens de sortie : 17 % de tokens en moins que Gemini 3.5 Flash pour les mêmes tâches
- Disponibilité : AI Studio, Gemini API, application Gemini (dès le premier jour)
La réduction de 17 % des tokens de sortie compte plus qu'il n'y paraît. Pour les workflows agentiques qui génèrent de longues chaînes de raisonnement, cela se cumule sur des milliers d'itérations. Google rapporte jusqu'à 65 % de réduction de coût sur les tâches d'ingénierie à long horizon par rapport au modèle Flash précédent, car moins de tokens de sortie signifie un coût par tâche plus faible et une exécution plus rapide.
Les benchmarks montrent des scores de codage agentique supérieurs à ceux de 3.5 Flash, même si le modèle n'atteint pas les modèles de palier Pro ou frontière comme Claude Opus 5 ou GPT-5.6 Sol sur le raisonnement complexe. La proposition de valeur est claire : une intelligence proche du Pro au tarif du palier Flash.
Quand utiliser Gemini 3.6 Flash
- Charges de production à haut volume où le coût par tâche prime sur l'intelligence maximale
- Workflows agentiques comportant de nombreux appels LLM (chaque appel est moins cher grâce à une sortie de tokens plus faible)
- Applications nécessitant un contexte de 1M tokens à un prix compétitif
- Applications en temps réel où la latence compte (les modèles Flash sont plus rapides que Pro)
Gemini 3.5 Flash-Lite : le palier ultra-efficace
Gemini 3.5 Flash-Lite est le modèle le moins cher de la gamme Gemini, conçu pour le déploiement en sous-agent au sein de workflows multi-agents. Là où Gemini 3.6 Flash est le cheval de bataille principal, Flash-Lite gère des tâches ciblées et restreintes au sein d'un pipeline d'agents plus vaste.
Spécifications clés :
- ID de modèle API :
gemini-3.5-flash-lite - Tarif : $0.30 par million de tokens d'entrée, $2.50 par million de tokens de sortie
- Conçu pour : exécution de sous-agents, tâches ciblées, classification à haut volume
- Contexte : optimisé pour des contextes plus courts au sein des workflows d'agents
À $0.30/$2.50, Flash-Lite est l'un des LLM de qualité production les moins chers disponibles. Pour donner un ordre d'idée, un pipeline exécutant 10 000 appels de classification par jour avec 2k tokens d'entrée et 500 de sortie par appel coûte environ $0.75/jour sur Flash-Lite, contre $7.50/jour sur Gemini 3.6 Flash et $30/jour sur Claude Sonnet 4.6.
Le cas d'usage est précis : Flash-Lite n'est pas un modèle généraliste. Il est conçu pour des tâches ciblées au sein d'une architecture multi-agents — le sous-agent qui extrait des entités, classe une intention ou route une requête avant que l'agent principal ne prenne le relais. La documentation de Google le décrit comme « adapté aux sous-agents qui exécutent des tâches ciblées au sein de workflows multi-agents complexes ».
Gemini 3.5 Flash-Cyber : le premier LLM de cybersécurité de Google
Gemini 3.5 Flash-Cyber est la sortie la plus inédite — le premier LLM de Google spécifiquement optimisé pour la cybersécurité. Il est conçu pour détecter, valider et corriger les vulnérabilités logicielles, et Google affirme qu'il approche les performances du modèle Claude Mythos d'Anthropic, bien plus grand et bien plus cher.
Faits clés :
- ID de modèle API :
gemini-3.5-flash-cyber - 55 vulnérabilités V8 (moteur JavaScript de Chrome) confirmées détectées lors des tests
- Utilise un raisonnement explicite en chaîne de pensée pour l'analyse des vulnérabilités
- Entre dans le pilote CodeMender pour les gouvernements et partenaires de confiance (sortie initiale limitée)
- BenchLM suit le modèle mais l'a exclu des classements publics faute d'une couverture de benchmark non générée suffisante
Flash-Cyber illustre une tendance plus large : des LLM spécialisés par domaine qui surpassent les modèles généralistes sur des tâches spécifiques. Un modèle Flash optimisé pour la sécurité qui détecte de vraies vulnérabilités V8 a plus de valeur qu'un modèle frontière 5 % meilleur sur des benchmarks de raisonnement général mais dépourvu de capacités spécifiques à la sécurité.
La sortie limitée via le pilote CodeMender signifie que Flash-Cyber n'est pas encore accessible via un accès API standard. Google contrôle le déploiement initial en le réservant aux gouvernements et partenaires de confiance — un signe qu'ils considèrent les capacités de détection de vulnérabilités du modèle comme une technologie à double usage nécessitant un accès contrôlé.
Flash-Cyber vs modèles généralistes pour la sécurité
| Modèle | Vulns V8 trouvées | Prix ($/M sortie) | Disponibilité |
|---|---|---|---|
| Flash-Cyber | 55 confirmées | Tarif Flash | Pilote limité |
| Claude Mythos | Comparable | ~$50 (est.) | API disponible |
| GPT-5.6 Sol | Non spécialisé | $30.00 | API disponible |
| Gemini 3.6 Flash | Non spécialisé | $7.50 | API disponible |
L'avantage de Flash-Cyber est le coût par vulnérabilité trouvée, et non la capacité brute. Pour les équipes de sécurité qui lancent des milliers de scans sur des bases de code, payer au tarif Flash plutôt qu'au tarif Mythos représente une différence de budget significative.
Changements d'API : temperature, top_p et top_k dépréciés
Parallèlement au lancement des modèles, Google a déprécié trois paramètres d'échantillonnage sur les modèles Gemini : temperature, top_p et top_k. Le changement n'a pas été annoncé en fanfare — la documentation de Google indique désormais que ces paramètres sont dépréciés, et l'API les ignore silencieusement lorsqu'ils sont fournis.
Un fil HN à propos de cette dépréciation a atteint 99 points et 37 commentaires. Les développeurs ont exprimé leurs inquiétudes quant à la perte de contrôle sur l'aléa, la créativité et la diversité des sorties. La position de Google semble être que les nouveaux modèles Flash sont optimisés pour une sortie déterministe et centrée sur la tâche, et que les paramètres d'échantillonnage interfèrent avec cette optimisation.
Impact de la migration
Pour les développeurs qui utilisent temperature pour contrôler le style de sortie (temperature élevée pour l'écriture créative, faible pour la génération de code), la dépréciation implique :
- La sortie utilisera la stratégie d'échantillonnage par défaut de Google quelles que soient les valeurs passées
- Si vous avez besoin d'une sortie créative, il faudra peut-être contourner la contrainte par du prompt engineering
- Si vous avez besoin d'une sortie déterministe, c'est en fait un avantage — moins de configuration à gérer
- Les API multi-fournisseurs qui normalisent les paramètres devront gérer ce rejet silencieux
# Avant : temperature fonctionnait
response = client.generate_content(
model="gemini-3.5-flash",
contents="Écris une histoire créative",
generation_config={"temperature": 0.9, "top_p": 0.95}
)
# Après (3.6 Flash) : temperature silencieusement ignorée
response = client.generate_content(
model="gemini-3.6-flash",
contents="Écris une histoire créative",
generation_config={"temperature": 0.9, "top_p": 0.95}
# Paramètres acceptés mais SANS effet — Google les ignore
)
# Migration : utiliser le prompt engineering à la place
response = client.generate_content(
model="gemini-3.6-flash",
contents="Écris une histoire très créative et imaginative, avec des rebondissements inattendus et des images vives",
# Aucun paramètre d'échantillonnage — contrôle via le prompt
)
La leçon plus large porte sur la stabilité des API : quand un fournisseur déprécie des paramètres essentiels, les applications couplées à ce fournisseur cassent. Les API multi-fournisseurs absorbent ces changements — si Google déprécie temperature, vous pouvez router les tâches d'écriture créative vers Claude ou GPT, qui les prennent toujours en charge, sans réécrire votre application.
Comparaison des tarifs : où se situent les modèles Flash
| Modèle | Entrée ($/M) | Sortie ($/M) | Contexte | Idéal pour |
|---|---|---|---|---|
| Gemini 3.5 Flash-Lite | $0.30 | $2.50 | Court | Tâches de sous-agent |
| Gemini 3.6 Flash | $1.50 | $7.50 | 1M | Production générale |
| Gemini 3.1 Pro | $2.00 | $12.00 | 2M | Raisonnement complexe |
| Claude Haiku 4.5 | $1.00 | $5.00 | 200k | Classification rapide |
| Claude Sonnet 4.6 | $3.00 | $15.00 | 200k | Génération de code |
| Claude Opus 5 | $5.00 | $25.00 | 1M | Raisonnement frontière |
| GPT-5.6 Sol | $5.00 | $30.00 | 400k | Écosystème OpenAI |
Flash-Lite à $0.30/$2.50 est moins cher que Claude Haiku 4.5 ($1.00/$5.00) pour les tâches à haut volume et à contexte court. Gemini 3.6 Flash à $1.50/$7.50 est le point d'équilibre prix-performance pour les charges générales — moins cher que Sonnet 4.6 ($3.00/$15.00) et Gemini 3.1 Pro ($2.00/$12.00) tout en offrant une intelligence proche du Pro.
Pour un pipeline de production traitant 1M tokens d'entrée et 200k tokens de sortie par jour :
- Flash-Lite : $0.30 + $0.50 = $0.80/jour
- Gemini 3.6 Flash : $1.50 + $1.50 = $3.00/jour
- Claude Haiku 4.5 : $1.00 + $1.00 = $2.00/jour
- Claude Sonnet 4.6 : $3.00 + $3.00 = $6.00/jour
- Claude Opus 5 : $5.00 + $5.00 = $10.00/jour
L'écart de coût de 12,5× entre Flash-Lite et Opus 5 explique pourquoi le routage hiérarchisé est essentiel : router les 80 % de tâches qui n'exigent pas une qualité frontière vers les modèles de palier Flash.
Routage en production : quand utiliser Flash, Pro ou les concurrents
La sortie de trois modèles permet une architecture de routage hiérarchisée au sein du seul écosystème Google :
- Flash-Lite gère le triage : classification d'intention, extraction d'entités, décisions de routage ($0.30/$2.50)
- Flash 3.6 gère l'exécution : génération standard, complétion de code, étapes agentiques ($1.50/$7.50)
- Pro 3.1 gère la complexité : raisonnement multi-étapes, analyse complexe ($2.00/$12.00)
- Flash-Cyber gère la sécurité : scan de vulnérabilités, audit de code (sortie limitée)
Pour le routage multi-fournisseurs, la hiérarchie naturelle combine les modèles Flash de Google avec Claude et GPT :
- Palier triage : Flash-Lite ($0.30/$2.50) ou Claude Haiku 4.5 ($1.00/$5.00)
- Palier cheval de bataille : Gemini 3.6 Flash ($1.50/$7.50) ou Claude Sonnet 4.6 ($3.00/$15.00)
- Palier frontière : Claude Opus 5 ($5.00/$25.00) ou GPT-5.6 Sol ($5.00/$30.00)
- Palier sécurité : Flash-Cyber (lorsqu'il sera disponible) ou Claude Mythos
Les économies liées au routage sont significatives. Une répartition 80/20 entre Flash 3.6 et Opus 5 réduit les coûts de sortie d'environ 70 % par rapport à un usage exclusif d'Opus 5, avec une perte de qualité minime pour les 80 % de tâches qui n'exigent pas de raisonnement frontière.
Conclusion : points clés à retenir
La sortie de trois modèles par Google signale que le marché de l'IA passe d'un paradigme « un seul modèle par application » à un paradigme de routage hiérarchisé et optimisé en coûts.
- Gemini 3.6 Flash est le nouveau leader prix-performance : à $1.50/$7.50 avec 17 % de tokens de sortie en moins, c'est le modèle le moins cher offrant une intelligence proche du Pro pour les charges générales.
- Flash-Lite redéfinit le plancher tarifaire : à $0.30/$2.50, les tâches de sous-agent autrefois coûteuses sur n'importe quel modèle sont désormais quasi gratuites — permettant des architectures multi-agents à grande échelle.
- Flash-Cyber valide les LLM spécialisés par domaine : un modèle de palier Flash qui détecte 55 vraies vulnérabilités V8 montre que le réglage spécifique à une tâche l'emporte sur la taille brute du modèle.
- La dépréciation de paramètres est un risque fournisseur : Google dépréciant silencieusement temperature et top_k rappelle que la stabilité des API dépend de décisions fournisseur que vous ne contrôlez pas.
- Le routage multi-fournisseurs est la couverture : quand un fournisseur change son API ou ses prix, une couche d'API unifiée permet de changer de fournisseur sans réécrire le code.
- L'écart de coût de 12,5× impose le routage : avec Flash-Lite à $0.30 et Opus 5 à $25.00 par million de tokens de sortie, tout exécuter sur un seul modèle est l'erreur la plus coûteuse de l'infrastructure IA en 2026.
FAQ
Qu'est-ce que Gemini 3.6 Flash ?
Gemini 3.6 Flash est le modèle de palier Flash de Google sorti en juillet 2026, facturé $1.50/$7.50 par million de tokens d'entrée/sortie avec une fenêtre de contexte de 1M tokens. Il égale Gemini 3.5 Flash en intelligence tout en utilisant 17 % de tokens de sortie en moins, ce qui en fait le cheval de bataille par défaut de Google pour les charges de production sensibles aux coûts.
Combien coûte Gemini 3.6 Flash ?
Gemini 3.6 Flash coûte $1.50 par million de tokens d'entrée et $7.50 par million de tokens de sortie. Cela passe sous Claude Sonnet 4.6 ($3/$15) et Gemini 3.1 Pro ($2/$12) tout en offrant une intelligence proche du Pro, et la réduction de 17 % des tokens de sortie abaisse encore le coût réel par tâche.
Qu'est-ce que Gemini 3.5 Flash-Cyber ?
Flash-Cyber est le premier LLM de Google spécifiquement optimisé pour la cybersécurité. Il détecte, valide et corrige les vulnérabilités logicielles à l'aide d'un raisonnement explicite en chaîne de pensée, et a trouvé 55 vulnérabilités V8 confirmées lors des tests. Il est actuellement limité à un pilote CodeMender pour les gouvernements et partenaires de confiance.
Google a-t-il déprécié temperature dans l'API Gemini ?
Oui. Google a déprécié les paramètres d'échantillonnage temperature, top_p et top_k sur les nouveaux modèles Gemini. L'API les accepte toujours mais les ignore silencieusement, si bien que la sortie utilise la stratégie d'échantillonnage par défaut de Google quelles que soient les valeurs passées.
Gemini 3.6 Flash ou Flash-Lite : lequel choisir ?
Utilisez Gemini 3.6 Flash ($1.50/$7.50) comme cheval de bataille principal pour la génération générale et les étapes agentiques. Utilisez Flash-Lite ($0.30/$2.50) pour des tâches de sous-agent restreintes et à haut volume comme la classification, l'extraction d'entités ou le routage au sein d'un pipeline multi-agents plus vaste.
Comment accéder aux trois modèles Gemini via une seule API ?
Les trois sont disponibles via l'API Gemini de Google, et Flash 3.6 et Flash-Lite sont aussi accessibles via des passerelles unifiées comme Eden AI, aux côtés de Claude et GPT. Une API unifiée permet de router par palier de tâche et de changer de fournisseur sans réécrire le code lorsque les prix ou les paramètres changent.

.jpg)
.jpeg)
