Résumez cet article avec :
- Bonsai 27B représente un véritable changement de paradigme, et non une simple promesse marketing. Avec une taille de seulement 3,9 Go et 90 % des capacités du modèle d’origine conservées, il démontre qu’un modèle de 27 milliards de paramètres peut fonctionner sur un smartphone. Il s’agit du premier modèle à franchir ce seuil.
- La stratégie hybride combinant IA locale et cloud devient désormais viable. Il est possible de router 80 à 90 % des tâches vers des modèles embarqués ou locaux, sans coût d’API, et de réserver les API cloud aux 10 à 20 % des requêtes nécessitant les performances des modèles les plus avancés.
- Grâce au routage hybride, une réduction des coûts de 80 à 90 % est envisageable, sans compromettre la qualité des tâches de raisonnement complexes.
- La souveraineté des données devient une fonctionnalité native, et non une contrainte de conformité supplémentaire. L’inférence directement sur l’appareil élimine toute une catégorie de risques liés au transfert des données.
- La personnalisation et les mises à jour restent toutefois dépendantes du cloud. Les modèles embarqués sont statiques : leurs améliorations dépendent donc du fournisseur, ici PrismML.
Le 14 juillet 2026, PrismML a annoncé Bonsai 27B, le premier modèle de 27 milliards de paramètres capable de fonctionner sur un smartphone. Basé sur Qwen3.6 27B, il apporte aux appareils locaux des capacités de raisonnement en plusieurs étapes, d’appel d’outils, de workflows agentiques et de compréhension multimodale.
Avec une taille de seulement 3,9 Go, le modèle est suffisamment compact pour fonctionner sur un iPhone 17 Pro. La discussion sur Hacker News a atteint 462 votes positifs et 171 commentaires.
Il ne s’agit pas d’une simple sortie de modèle supplémentaire, mais d’un changement de paradigme dans la manière dont les calculs d’intelligence artificielle sont exécutés. Cet article analyse les spécifications techniques de Bonsai 27B, ses implications pour une stratégie hybride de fournisseurs d’IA et la manière dont les équipes doivent concevoir leurs architectures LLM combinant traitement local et cloud en 2026.
Bonsai 27B : spécifications techniques
Bonsai 27B de PrismML est disponible en deux variantes, toutes deux fondées sur la philosophie d’« Intelligence Density » de l’entreprise : maximiser les capacités du modèle pour chaque unité de mémoire, de puissance de calcul et d’énergie consommée.
Une version classique en 4 bits du même modèle de 27 milliards de paramètres occupe environ 18 Go, ce qui la rend trop volumineuse pour un smartphone et pour la plupart des ordinateurs portables. La représentation en 1 bit développée par PrismML réduit cette taille à 3,9 Go grâce à l’utilisation de poids binaires de bout en bout dans l’ensemble du réseau : embeddings, mécanismes d’attention, couches MLP et tête du modèle de langage. Aucun composant ne revient à une précision supérieure.
Performances sur les benchmarks
Sur une série de 15 benchmarks, évalués en mode raisonnement, la baisse de performance par rapport au modèle en précision complète reste remarquablement limitée.
Les résultats montrent que les capacités en mathématiques et en programmation conservent entre 92 et 96 % des performances du modèle en précision complète. Il s’agit précisément des compétences essentielles aux workflows agentiques.
Les performances liées à l’appel d’outils restent solides, avec 83 % des capacités conservées. La compréhension visuelle enregistre la baisse la plus importante, avec 82 % des performances préservées, ce qui s’explique par la compression en 4 bits de l’encodeur visuel.
Vitesse d’inférence
Bonsai 27B atteint un débit particulièrement élevé sur du matériel grand public.
Avec 163 tokens par seconde sur une RTX 5090, la version 1 bit de Bonsai 27B surpasse de nombreux endpoints d’API cloud en matière d’inférence locale, sans coût par token, sans latence réseau et sans transfert de données hors de la machine.
Le tournant de l’« Intelligence Density »
PrismML a introduit le concept d’« Intelligence Density », qui mesure les capacités d’un modèle par gigaoctet de mémoire utilisé. La version 1 bit de Bonsai 27B atteint un score de 0,53 unité d’intelligence par Go, soit plus de dix fois le niveau de référence en précision complète et environ 2,7 fois celui de la meilleure alternative classique en faible précision.
Cette densité est essentielle, car elle détermine où un modèle peut être exécuté, et pas seulement ce qu’il est capable de faire. Un modèle de 27 milliards de paramètres en précision complète nécessite 54 Go de mémoire. Une bonne version en 4 bits en demande 18 Go. La version 1 bit de Bonsai 27B n’en utilise que 3,9 Go.
La contrainte imposée par les smartphones est plus stricte qu’elle n’y paraît. Un iPhone doté de 12 Go de mémoire ne met qu’environ 6 Go à la disposition d’une application, une capacité qui doit également être partagée avec le cache KV et les activations du modèle. Avec ses 3,9 Go, Bonsai 27B est le premier modèle de cette catégorie à pouvoir fonctionner sur un smartphone tout en conservant suffisamment de mémoire pour l’inférence.
Comment choisir le bon niveau de calcul ?
Règle générale : utilisez par défaut le niveau le moins coûteux capable d’atteindre le niveau de qualité requis, puis basculez vers un niveau supérieur uniquement lorsqu’un critère n’est pas satisfait.
La stratégie hybride de fournisseurs d’IA
Les modèles embarqués comme Bonsai 27B ne remplacent pas les API de LLM cloud : ils les complètent. En 2026, les architectures d’IA les plus résilientes répartissent les tâches entre trois niveaux de calcul.
Niveau 1 : sur l’appareil - coût nul, latence minimale et confidentialité totale
Utilisez des modèles exécutés directement sur l’appareil pour :
- la classification et l’extraction d’entités ;
- les questions-réponses simples et les réponses de FAQ ;
- la synthèse de documents courts ;
- la complétion de code et les refactorisations simples ;
- le remplissage de formulaires et l’extraction de données depuis des documents.
Coût : 0 $ par inférence.
Latence : moins de 50 ms.
Confidentialité : les données ne quittent jamais l’appareil.
Niveau 2 : serveur local - faible coût, faible latence et traitement privé sur le réseau
Utilisez des serveurs GPU locaux pour :
- la génération et le débogage de code complexe ;
- la synthèse de documents longs de plus de 8 000 tokens ;
- le raisonnement en plusieurs étapes sans utilisation d’outils ;
- le traitement par lots de grands volumes de documents.
Coût : coût matériel amorti d’environ 0,001 à 0,01 $ par inférence.
Latence : entre 100 et 500 ms.
Confidentialité : les données restent sur votre réseau.
Niveau 3 : API cloud - coût variable, latence réseau et infrastructure gérée par le fournisseur
Utilisez des API de LLM cloud pour :
- le raisonnement de pointe et la planification complexe ;
- les tâches nécessitant un contexte très étendu de plus de 100 000 tokens ;
- les capacités spécialisées comme l’OCR, la transcription audio, la traduction ou la génération d’images ;
- les tâches nécessitant les fonctionnalités des modèles les plus récents ;
- les charges de travail exigeant des SLA fournisseurs et des certifications de conformité.
Coût : de 0,50 à plus de 15 $ par million de tokens.
Latence : entre 500 et 3 000 ms.
Confidentialité : les données sont transmises au fournisseur.
Mise en œuvre : logique de routage hybride
import requests
import json
# Route tasks based on complexity to minimize cost while maintaining quality
ROUTING_RULES = {
"classification": {"tier": "on_device", "model": "bonsai-27b-1bit"},
"summarization_short": {"tier": "on_device", "model": "bonsai-27b-1bit"},
"summarization_long": {"tier": "local_server", "model": "bonsai-27b-ternary"},
"code_generation_simple": {"tier": "on_device", "model": "bonsai-27b-1bit"},
"code_generation_complex": {"tier": "cloud", "model": "anthropic/claude-sonnet-4-6"},
"reasoning_complex": {"tier": "cloud", "model": "openai/gpt-5"},
"translation": {"tier": "cloud", "model": "edenai/deepseek-v3.2"},
"ocr": {"tier": "cloud", "model": "edenai/google-vision"},
"speech_to_text": {"tier": "cloud", "model": "edenai/assemblyai"},
}
def route_task(task_type, input_text, context_size=0):
"""Route a task to the appropriate compute tier."""
rule = ROUTING_RULES.get(task_type, {"tier": "cloud", "model": "openai/gpt-5"})
# Escalate to cloud if context exceeds on-device limits
if rule["tier"] == "on_device" and context_size > 50000:
rule = {"tier": "cloud", "model": "openai/gpt-5"}
if rule["tier"] == "on_device":
# Call local model (e.g., via MLX or llama.cpp)
return call_local_model(rule["model"], input_text)
elif rule["tier"] == "local_server":
# Call local vLLM server
return call_vllm(rule["model"], input_text)
else:
# Call cloud API via unified gateway
return call_edenai_api(rule["model"], input_text)
def call_edenai_api(model, text):
"""Call EdenAI unified API for cloud-tier tasks."""
response = requests.post(
"https://api.edenai.run/v1/llm/chat",
headers={"Authorization": f"Bearer {EDENAI_API_KEY}"},
json={"model": model, "messages": [{"role": "user", "content": text}]}
)
return response.json()
Impact sur les coûts : le calcul du modèle hybride
Prenons l’exemple d’une équipe qui traite 10 000 documents par jour, avec la répartition suivante : 70 % de tâches de classification, 20 % de résumés, 10 % de raisonnement complexe.
Prenons l’exemple d’une équipe qui traite 10 000 documents par jour, avec la répartition suivante :
- 70 % de tâches de classification ;
- 20 % de résumés ;
- 10 % de raisonnement complexe.
Sans approche hybride, si toutes les requêtes sont envoyées vers le cloud : 10 000 × 0,05 $ = 500 $ par jour. Le modèle hybride permet de réduire les coûts de 90 %, tout en conservant les modèles cloud les plus avancés pour les tâches de raisonnement complexe.
Souveraineté des données : l’avantage du traitement sur l’appareil
L’inférence sur l’appareil permet de conserver les données localement par défaut. Dans les secteurs réglementés, comme la santé, la finance ou le droit, cette approche élimine toute une catégorie de risques liés à la conformité :
- aucune donnée ne traverse les limites du réseau ;
- aucune politique de conservation des données d’un fournisseur ne doit être négociée ;
- aucun risque d’exposition des données pendant leur transfert ;
- la conformité au RGPD et à la HIPAA est simplifiée, puisque les données ne quittent jamais l’appareil.
Grâce à sa fenêtre de contexte de 262 000 tokens, Bonsai 27B peut traiter des documents volumineux directement sur l’appareil, une capacité qui était auparavant principalement accessible via des API cloud.
Limites et points de vigilance
- Le fine-tuning nécessite toujours des ressources cloud ou des serveurs GPU. Même si l’inférence sur l’appareil n’entraîne aucun coût d’API, la mise à jour ou le fine-tuning de Bonsai 27B nécessite une infrastructure GPU. Une fois déployés, les poids du modèle restent statiques.
- Les performances agentiques diminuent davantage que celles en mathématiques ou en programmation. En mode 1 bit, le score d’appel d’outils passe de 80,0 à 66,0, soit 83 % des performances conservées. Les workflows agentiques complexes en plusieurs étapes peuvent donc encore nécessiter des modèles cloud.
- La compréhension visuelle reste la capacité la plus faible. Avec un score de 59,6, contre 72,6 en précision complète, la version 1 bit de Bonsai 27B offre des performances suffisantes pour l’OCR basique et la compréhension de captures d’écran, mais reste moins adaptée au raisonnement visuel complexe.
- L’écosystème Apple est actuellement privilégié. Bonsai 27B fonctionne avec MLX sur les appareils Apple et avec CUDA sur les GPU NVIDIA. La prise en charge d’Android n’est pas encore disponible.
- Les mises à jour du modèle dépendent de PrismML. Contrairement aux modèles à poids ouverts que les équipes peuvent ajuster elles-mêmes, la méthode d’entraînement de Bonsai 27B est propriétaire. Les utilisateurs dépendent donc de PrismML pour les futures améliorations du modèle.
Conclusion
L’avenir des stratégies de fournisseurs d’IA ne repose pas sur une opposition entre cloud et traitement sur l’appareil, mais sur un routage hybride combinant les deux approches.
Bonsai 27B rend pour la première fois le traitement sur l’appareil réellement viable pour un modèle de 27 milliards de paramètres. En 2026, les équipes les mieux positionnées seront celles qui concevront leur architecture autour de trois niveaux complémentaires :
- le traitement sur l’appareil pour réduire les coûts et protéger les données ;
- les serveurs locaux pour maximiser le débit ;
- les API cloud pour accéder aux modèles les plus performants.
.png)



