Nouvelle fonctionnalité
Traitement de Texte
8 min de lecture

Optimisation de l'inférence Xiaomi MiMo v2.5 : comment le SWA hybride pousse l'efficacité LLM à ses limites

Xiaomi MiMo v2.5 Inference Optimization: How Hybrid SWA Pushes LLM Efficiency to Its Limits

Résumez cet article avec :

Résumé
  • MiMo v2.5 est un modèle MoE sparse de 310 milliards de paramètres (Mélange d'Experts, où seul un sous-ensemble de paramètres s'active par token) avec seulement 15B de paramètres actifs par token, entraîné sur 48 billions de tokens.
  • Son SWA Hybride (Attention à Fenêtre Glissante, où le modèle ne regarde qu'une fenêtre locale de tokens au lieu du contexte complet) réduit le stockage KV-cache à environ un septième de ce que nécessite l'attention complète.
  • L'architecture utilise un ratio de 5:1 de couches à fenêtre glissante par rapport aux couches d'attention globale, avec une taille de fenêtre de 128 tokens.
  • MiMo v2.5 atteint plus de 1 000 tokens par seconde en vitesse de sortie pour sa variante de 1T paramètres, une première pour des modèles de cette taille.
  • Pour les équipes de production, des modèles open-weight plus efficaces comme MiMo signifient des coûts par token plus bas en auto-hébergement et de meilleures options de routage via des passerelles multi-fournisseurs comme Eden AI.
Spécification MiMo v2.5 MiMo v2.5 Pro
Paramètres totaux 310B 310B
Paramètres actifs par token 15B 15B
Tokens d'entraînement 48T 48T
Architecture d'attention SWA Hybride (5:1) SWA Hybride (5:1)
Taille de fenêtre glissante 128 tokens 128 tokens
Réduction KV-cache ~6x vs attention complète ~6x vs attention complète
Type MoE Sparse (experts activés par token) Sparse

Le MiMo v2.5 de Xiaomi est un modèle sparse de Mélange d'Experts (MoE) de 310 milliards de paramètres qui utilise l'Attention à Fenêtre Glissante Hybride pour compresser le stockage KV-cache d'environ 6x par rapport aux modèles à attention complète. En alternant entre couches à fenêtre glissante locale et couches d'attention globale dans un ratio de 5:1, MiMo v2.5 maintient les performances sur contexte long tout en réduisant considérablement l'utilisation de mémoire et le coût d'inférence. Le résultat est un modèle open-weight qui fonctionne plus vite et moins cher que les modèles à attention complète de qualité similaire.

Qu'est-ce que l'Attention à Fenêtre Glissante Hybride ?

Les modèles Transformer standards utilisent l'attention complète. Chaque token regarde chaque autre token dans le contexte. Cela fonctionne bien pour la qualité mais crée un problème : la mémoire et le calcul augmentent comme le carré de la longueur du contexte. Un contexte de 128K tokens nécessite 16 milliards de calculs d'attention.

L'Attention à Fenêtre Glissante (SWA, Sliding Window Attention) résout ce problème en limitant la vue de chaque token à une fenêtre locale. Au lieu de voir les 128K tokens, chaque token ne voit que les W tokens les plus proches (où W est la taille de la fenêtre).

Cela réduit le calcul de O(n au carré) à O(n fois w), où n est la longueur du contexte et w la taille de la fenêtre.

Mais le SWA pur a une faiblesse : le modèle ne peut pas voir l'information en dehors de sa fenêtre. Pour les documents longs, cela signifie perdre le suivi des détails du début du texte.

L'approche hybride

Le SWA hybride combine le meilleur des deux mondes. La plupart des couches utilisent l'attention à fenêtre glissante (rapide, bon marché). Quelques couches clés utilisent l'attention complète (préserve l'information à longue portée). MiMo v2.5 utilise un ratio de 5:1 : pour chaque 5 couches à fenêtre glissante, il y a 1 couche d'attention complète.

La taille de la fenêtre glissante est de 128 tokens. C'est assez petit pour garder la mémoire basse mais assez grand pour capturer les motifs locaux dans le texte et le code.

Détails de l'architecture MiMo v2.5

Voici les spécifications clés de la famille de modèles MiMo v2.5 :

MoE Sparse : moins de paramètres actifs

MiMo v2.5 est un Mélange d'Experts sparse (MoE, une conception de modèle où chaque token n'active qu'un petit sous-ensemble du total des paramètres). Sur 310 milliards de paramètres totaux, seulement 15 milliards s'activent par token. Cela signifie que chaque passage forward ne calcule que 15B paramètres de mathématiques, même si le modèle a appris 310B paramètres de connaissance.

La combinaison de MoE sparse et SWA hybride donne à MiMo v2.5 deux niveaux d'efficacité :

  1. Le MoE sparse réduit le calcul par token (moins de paramètres actifs).
  2. Le SWA hybride réduit la mémoire d'attention (KV-cache plus petit).

Comment fonctionne la réduction du KV-cache

Le KV-cache (cache clé-valeur, la mémoire qui stocke les données d'attention des tokens précédents pour que le modèle ne les recalcule pas) est le principal goulot d'étranglement pour servir des LLM (grands modèles de langage, les modèles d'IA qui génèrent du texte) à grande échelle.

Chaque token dans la fenêtre de contexte a besoin d'une entrée KV. Pour un contexte de 128K, c'est 128 000 entrées par couche, par tête d'attention.

Avec l'attention complète, chaque couche stocke des entrées KV pour le contexte entier. Avec l'attention à fenêtre glissante, chaque couche ne stocke des entrées KV que pour les 128 derniers tokens. Le ratio hybride 5:1 signifie :

  • 5 couches sur 6 stockent 128 entrées KV (minuscule).
  • 1 couche sur 6 stocke les entrées KV du contexte complet.

Le calcul : si un modèle a 60 couches, 50 utilisent le SWA (128 entrées chacune) et 10 utilisent l'attention complète (128K entrées chacune). Le stockage total KV tombe à environ un septième d'un modèle à attention complète avec le même nombre de couches.

Biais d'attention sink apprenable

MiMo v2.5 ajoute une technique appelée biais d'attention sink apprenable. Les premiers tokens de tout contexte (souvent appelés "attention sinks") reçoivent un poids d'attention disproportionné dans les modèles Transformer. MiMo v2.5 apprend à préserver ces tokens sink même dans les couches à fenêtre glissante, ce qui aide à maintenir la qualité sur contexte long malgré la petite fenêtre.

Résultats de vitesse d'inférence

Xiaomi a publié un blog d'optimisation d'inférence complète le 30 mai 2026, détaillant comment ils ont poussé l'efficacité du SWA hybride à sa limite. Les résultats clés :

  • Plus de 1 000 tokens par seconde en vitesse de sortie pour la variante de 1T paramètres (en partenariat avec TileRT). C'est la première fois qu'un modèle de cette taille franchit la barre des 1 000 tokens/s.
  • Empreinte mémoire réduite signifie plus d'utilisateurs simultanés par GPU. Un serveur qui pouvait servir 10 utilisateurs avec un modèle à attention complète peut en servir environ 50-60 avec le SWA hybride de MiMo v2.5.
  • Temps jusqu'au premier token (TTFT) plus bas car la phase de prétraitement traite moins de données KV.

Ce que cela signifie pour les coûts d'API LLM

Une inférence plus efficace a des implications de coût directes pour les équipes qui font tourner ou consomment des API LLM :

L'auto-hébergement devient viable

Quand le KV-cache est 6x plus petit, vous avez besoin de 6x moins de mémoire GPU pour servir le même modèle. Un modèle qui nécessitait 4 GPU A100 avec attention complète pourrait tenir sur 1 A100 avec SWA hybride. Cela rend l'auto-hébergement de grands modèles open-weight pratique pour plus d'équipes.

Coûts par token plus bas

Les fournisseurs d'API qui servent des modèles efficaces peuvent facturer moins par token car leurs coûts d'infrastructure sont plus bas. Quand des modèles open-weight comme MiMo v2.5 deviennent disponibles via des passerelles API, ils créent une concurrence de prix qui pousse les coûts à la baisse dans tout le secteur.

Meilleures options de routage

Une passerelle multi-fournisseur comme Eden AI peut router les requêtes vers le modèle le plus rentable pour chaque tâche. Les modèles efficaces comme MiMo v2.5 sont des cibles idéales pour les requêtes simples à modérées où vous n'avez pas besoin de toute la puissance d'un modèle frontier. Réservez les modèles coûteux pour les problèmes les plus difficiles.

Voici comment appeler un modèle open-weight via Eden AI :

import requests
import os

headers = {
    "Authorization": "Bearer " + os.environ["EDENAI_API_KEY"],
    "Content-Type": "application/json"
}

response = requests.post(
    "https://api.edenai.run/v3/chat/completions",
    headers=headers,
    json={
        "model": "cloudflare/@cf/meta/llama-4-scout-17b-16e-instruct",
        "messages": [
            {"role": "user", "content": "Résumez ce résumé d'article de recherche."}
        ],
        "max_tokens": 200
    }
)
print(response.json())

Eden AI se connecte à de nombreux modèles open-weight via un seul endpoint. Vous obtenez les avantages d'efficacité sans gérer l'infrastructure vous-même.

SWA hybride vs autres techniques d'efficacité

Le SWA hybride est l'une des nombreuses techniques pour rendre l'inférence LLM moins chère. Voici comment il se compare :

Ces techniques ne sont pas mutuellement exclusives. MiMo v2.5 utilise à la fois le MoE sparse et le SWA hybride ensemble. Vous pourriez aussi appliquer la quantification en plus du SWA hybride pour des économies encore plus grandes.

Implications de production pour les équipes d'ingénierie

Si vous construisez des applications qui consomment des API LLM, la montée de modèles efficaces comme MiMo v2.5 change votre stratégie :

Échelonnez votre sélection de modèles

Toutes les requêtes n'ont pas besoin d'un modèle frontier. Utilisez des modèles open-weight efficaces pour :

  • Les tâches de résumation et de formatage.
  • Les Q&R simples sur des sujets connus.
  • La classification et l'extraction d'entités.
  • La traduction de textes courts.

Réservez les modèles frontier coûteux pour :

  • Le raisonnement complexe et les mathématiques.
  • La génération de code avec une logique complexe.
  • L'analyse de contexte long nécessitant une compréhension profonde.
  • L'écriture créative qui nécessite de la nuance.

Utilisez une passerelle multi-fournisseur

Gérer plusieurs fournisseurs de modèles signifie plusieurs clés API, comptes de facturation et formats de requête. Eden AI simplifie cela avec un seul endpoint qui se connecte à plus de 500 modèles. Vous pouvez router chaque requête vers le bon modèle en fonction de la complexité, du coût ou des exigences de latence.

Le système de fallback assure la fiabilité : si un fournisseur est en panne, votre requête se route automatiquement vers un secours.

Surveillez l'efficacité des tokens

Lors du choix entre modèles, regardez au-delà du prix par million de tokens. Considérez :

  • Tokens par tâche réussie : un modèle qui complète la tâche en moins de tokens peut être moins cher même à un prix par token plus élevé.
  • Utilisation de la fenêtre de contexte : les modèles efficaces vous permettent d'envoyer plus de contexte sans atteindre des falaises de coûts.
  • Latence : les modèles plus rapides réduisent le temps d'attente des utilisateurs et les coûts serveur pour les applications en temps réel.

Conclusion

Le MiMo v2.5 de Xiaomi démontre que l'efficacité de l'inférence est un problème d'ingénierie résoluble. L'Attention à Fenêtre Glissante Hybride, combinée au MoE sparse, réduit le stockage KV-cache de 6x et permet plus de 1 000 tokens par seconde en sortie pour des modèles massifs. Ces optimisations rendent les grands modèles open-weight pratiques pour l'utilisation en production.

Pour les équipes qui consomment des API LLM, la tendance vers des modèles efficaces signifie des coûts plus bas et plus d'options. Utilisez une passerelle multi-fournisseur comme Eden AI pour accéder à la fois aux modèles open-weight efficaces et aux modèles frontier via un seul endpoint. Routez chaque requête vers le modèle qui vous donne le meilleur équilibre entre qualité, vitesse et coût.

You can find them at Eden AI.

Login to the platform to test it yourself.

Articles associés sur le blog Eden AI

FAQ

Qu'est-ce que l'Attention à Fenêtre Glissante dans les LLM ?
L'Attention à Fenêtre Glissante (SWA) est une technique où chaque token dans un texte ne fait attention qu'aux W tokens les plus proches autour de lui, au lieu de chaque token dans le contexte complet. Cela réduit l'utilisation de mémoire et le coût de calcul. MiMo v2.5 utilise une fenêtre de 128 tokens.
Combien le SWA Hybride réduit-il la mémoire KV-cache ?
Le SWA hybride de MiMo v2.5 réduit le stockage KV-cache à environ un septième de ce qu'un modèle à attention complète nécessite. Avec un ratio 5:1 de couches à fenêtre glissante par rapport à l'attention complète, la plupart des couches ne stockent que 128 entrées KV au lieu de la longueur complète du contexte.
MiMo v2.5 est-il open source ?
Oui. MiMo v2.5 est un modèle open-weight disponible sur Hugging Face. Vous pouvez le télécharger, l'auto-héberger ou y accéder via des fournisseurs d'API. Les poids du modèle et les détails d'architecture sont publiquement disponibles.
Comment MiMo v2.5 se compare-t-il à Claude ou GPT en qualité ?
Sur les benchmarks de raisonnement pur, MiMo v2.5 Pro obtient des scores inférieurs à Claude Opus et GPT-5.6 Sol. Cependant, il est en avance sur l'efficacité des tokens (moins de tokens par tâche réussie). Pour les charges de travail sensibles au coût où un raisonnement de premier plan n'est pas requis, MiMo v2.5 offre une forte qualité à un coût plus bas.
Qu'est-ce que le MoE sparse et pourquoi est-ce important ?
Le Mélange d'Experts (MoE) sparse signifie que le modèle a de nombreux sous-réseaux experts mais n'en active que quelques-uns par token. MiMo v2.5 a 310B de paramètres totaux mais seulement 15B s'activent par token. Cela réduit le coût de calcul tout en gardant la connaissance totale du modèle grande.

Articles similaires

[AUTO-DRAFT] Yap, Whisper, and Cloud STT: Choosing a Voice Dictation Stack for macOS Apps (2026)
Nouvelle fonctionnalité
Vocale
Yap, Whisper et STT cloud : choisir sa pile de dictée vocale pour les applications macOS
8/6/2026
·
Written byTaha Zemmouri
Sécuriser les agents IA contre les attaques par injection de prompt via documents
Nouvelle fonctionnalité
Traitement de Texte
Sécuriser les agents IA contre les attaques par injection de prompt via documents
8/4/2026
·
Written byTaha Zemmouri
COMMENCEZ

Commencez à créer avec Eden AI

Une interface unique pour intégrer les meilleures technologies d’IA dans vos flux de travail.