Comparatifs d'IA
Tous
8 min de lecture

Kimi K3 vs Qwen 3.8-Max : benchmarks, prix et API

Résumez cet article avec :

Résumé

TL;DR

Kimi K3 vs Qwen 3.8-Max : Kimi K3 est actuellement le choix le plus fiable. Le modèle se classe n°1 sur Arena Frontend Code et n°4 dans l’Artificial Analysis Intelligence Index, avec un tarif de 3 $ par million de tokens en entrée et 15 $ en sortie, soit un coût 3 à 5 fois inférieur à celui des principaux modèles occidentaux.

Qwen 3.8-Max est une version preview lancée en juillet 2026, qui ne dispose pas encore de benchmarks indépendants, de fiche technique officielle ni de licence publiée. Aucun des deux modèles ne peut être auto-hébergé en dehors d’un environnement de type datacenter. L’accès par API constitue donc la solution la plus pratique pour utiliser Kimi K3 comme Qwen 3.8-Max.

En l’espace de dix jours en juillet 2026, deux laboratoires chinois ont lancé des modèles open-weight de niveau frontier : Kimi K3 de Moonshot AI, avec 2 800 milliards de paramètres, le 16 juillet, puis Qwen 3.8-Max d’Alibaba, un modèle multimodal de 2 400 milliards de paramètres, le 19 juillet lors de la World AI Conference à Shanghai.

Kimi K3 s’est immédiatement hissé à la première place du classement Arena Frontend Code, devant Claude Fable 5 et GPT-5.6 Sol. Qwen 3.8-Max a été présenté en version preview avec l’affirmation ambitieuse qu’il serait « seulement devancé par Fable 5 », mais sans tableau de benchmarks, sans model card et sans licence publiée.

Cet article compare les deux modèles selon leur architecture, leurs benchmarks, leur tarification et leur facilité d’utilisation en pratique. Il explique également comment les développeurs peuvent accéder à Kimi K3 et Qwen 3.8-Max via une API unifiée, aux côtés des principaux modèles occidentaux.

Kimi K3 : architecture et caractéristiques techniques

Kimi K3 est le modèle de langage phare de Moonshot AI, lancé le 16 juillet 2026. Il repose sur une architecture Mixture-of-Experts (MoE) comprenant 2 800 milliards de paramètres au total, mais n’active que 16 experts parmi 896 pour chaque token.

Ce niveau de parcimonie particulièrement élevé permet de maintenir le coût de calcul effectif bien en dessous de ce que pourrait laisser penser le nombre total de paramètres.

Spécification Kimi K3
Développeur Moonshot AI
Date de sortie 16 juillet 2026
Architecture Mixture-of-Experts (MoE)
Nombre total de paramètres Environ 2,8 billions
Experts actifs 16 sur 896
Fenêtre de contexte 1 000 000 de tokens
Types d’entrée Texte, image et vidéo
Raisonnement Toujours activé ; paramètre reasoning_effort, avec uniquement le niveau maximal disponible au lancement
Poids ouverts Publication prévue le 27 juillet 2026
Tarification de l’API 3 $ par million de tokens en entrée et 15 $ par million de tokens en sortie

Trois innovations architecturales expliquent l’amélioration annoncée de 2,5 fois de l’efficacité du passage à l’échelle par rapport à Kimi K2.

Kimi Delta Attention (KDA)

Kimi Delta Attention est un mécanisme hybride d’attention linéaire conçu pour maintenir une circulation efficace des informations sur de très longues séquences.

Moonshot annonce un décodage jusqu’à 6,3 fois plus rapide dans des contextes atteignant un million de tokens. Cette amélioration est particulièrement importante pour les charges de travail agentiques, dans lesquelles le modèle doit lire, analyser et parcourir à plusieurs reprises de vastes bases de code.

Attention Residuals (AttnRes)

Au lieu d’accumuler les représentations de manière uniforme, couche après couche, AttnRes récupère de façon sélective certaines représentations à différentes profondeurs du réseau.

Selon Moonshot, cette approche améliore l’efficacité de l’entraînement d’environ 25 %, avec un surcoût de calcul inférieur à 2 %. Moonshot avait publié cette technique en open source plus tôt en 2026.

Stable LatentMoE

Stable LatentMoE est le framework qui permet d’entraîner de manière stable l’architecture extrêmement parcimonieuse de Kimi K3, avec seulement 16 experts activés parmi 896.

Il vise à éviter les problèmes d’instabilité qui apparaissent généralement lorsqu’une architecture MoE atteint un niveau de parcimonie aussi élevé.

Une démonstration particulièrement marquante concerne l’optimisation par Kimi K3 de son propre kernel d’entraînement AttnRes à l’échelle de la production, sur un modèle comprenant 96 couches et une dimension de 8 192.

Après 15 heures d’itérations continues, Kimi K3 a conçu un nouvel algorithme de kernel en deux phases et réduit le temps total des passes avant et arrière de 283,6 ms à 114,4 ms.

Cette expérience illustre les capacités du modèle sur des tâches autonomes de longue durée et d’auto-amélioration, pour lesquelles la plupart des modèles cessent généralement de progresser après seulement quelques minutes.

Qwen 3.8-Max : ce que l’on sait et ce que l’on ignore encore

Alibaba a présenté Qwen3.8-Max-Preview le 19 juillet 2026, lors de la World AI Conference (WAIC) à Shanghai, soit trois jours après le lancement de Kimi K3. Le développeur Shuai Bai l’a décrit comme le premier modèle multimodal de l’équipe dépassant les 1 000 milliards de paramètres.

Spécification Qwen 3.8-Max (Preview)
Développeur Alibaba (équipe Qwen)
Date de sortie 19 juillet 2026 (version preview)
Architecture Mixture-of-Experts clairsemé (MoE)
Nombre total de paramètres Environ 2,4 billions
Paramètres actifs Non communiqué
Fenêtre de contexte 1 000 000 de tokens
Types d’entrée Texte, images, vidéo et documents
Compatibilité API Protocoles OpenAI et Anthropic
Poids ouverts Annoncés « prochainement », sans date ni licence précisées
Tarification 10 % du tarif standard pendant la preview, avec des crédits Token Plan

Ce qui est confirmé

Le modèle peut traiter du texte, des images, des vidéos et des documents. Il dispose également d’une fenêtre de contexte d’un million de tokens, héritée de Qwen 3.7-Max. Alibaba affirme que Qwen 3.8-Max surpasse Qwen 3.7-Max dans plusieurs domaines, notamment la programmation, le développement full-stack, l’analyse de données et les tâches bureautiques. Le modèle est déjà accessible via l’abonnement Token Plan d’Alibaba, Qoder et QoderWork.

Ce qui manque encore

À ce jour, Alibaba n’a publié aucun tableau de benchmarks, aucune model card, aucun fichier de licence et, surtout, aucun nombre de paramètres actifs.

L’affirmation selon laquelle Qwen 3.8-Max serait « seulement devancé par Fable 5 » repose donc entièrement sur les évaluations internes d’Alibaba. Aucun organisme tiers, comme Artificial Analysis ou LMArena, n’a encore évalué le modèle.

Le nombre de paramètres actifs est pourtant une donnée essentielle, car il détermine directement le coût d’inférence, la latence et la possibilité éventuelle d’auto-héberger le modèle. Sans cette information, toute estimation de coût reste spéculative.

Tarification du Token Plan en version preview

Offre Prix Crédits tous les 7 jours Cas d’usage
Lite 6 $ 2 500 Tester la version preview
Pro 68 $ 40 000 Exécuter simultanément 6 à 8 agents

Le Token Plan repose sur un système de crédits plutôt que sur une tarification précise par token, ce qui rend les coûts difficiles à anticiper, en particulier pour un modèle preview présenté comme étant en évolution continue.

Alibaba n’a publié aucun tarif API par token spécifique à Qwen 3.8-Max. Pour établir un budget réaliste, il est donc préférable de se baser sur le prix standard hors promotion, plutôt que sur le tarif promotionnel temporaire.

Benchmarks Kimi K3 vs Qwen 3.8-Max : quel modèle est le meilleur ?

Kimi K3 sur Arena et Artificial Analysis

Le principal résultat de Kimi K3 est sa première place sur le classement Frontend Code Arena avec 1 679 points, soit une progression de 17 places par rapport à Kimi K2.6, qui occupait la 18e position.

Ce classement repose sur 483 895 votes humains réalisés à l’aveugle sur de véritables tâches de développement frontend. Kimi K3 arrive en tête dans six des sept catégories frontend, et ne termine deuxième que dans la catégorie Gaming, toujours dominée par Fable 5.

Modèle Score Arena Frontend Code
Kimi K3 1 679
Claude Fable 5 1 631
GPT-5.6 Sol 1 618
GLM-5.2 1 587

Sur l’Artificial Analysis Intelligence Index, plus généraliste, Kimi K3 obtient un score de 57 et se classe 4e sur 189 modèles. Il se situe au même niveau que Claude Opus 4.8 et GPT-5.5, derrière Claude Fable 5 et GPT-5.6 Sol.

Aucun modèle open-weight n’avait jusqu’ici atteint un classement aussi élevé.

Cette performance doit toutefois être nuancée. AlphaSignal a testé Kimi K3 sur son propre benchmark de réparation de code avec agents, face à GPT-5.6 Sol, Fable 5, Grok 4.5, Opus 4.8, GLM-5.2 et Gemini 3.1 Pro.

Kimi K3 a terminé dernier parmi les sept modèles, avec 53 tentatives réussies sur 67, soit 79 %.

Cette différence s’explique par la nature des tests. Arena mesure les préférences humaines sur des interfaces générées, tandis que les benchmarks de réparation agentique évaluent la capacité d’un modèle à résoudre des bugs en plusieurs étapes à partir de véritables issues GitHub.

Les tests ne mesurent donc pas les mêmes compétences et peuvent produire des gagnants différents.

Qwen 3.8-Max : des affirmations encore non vérifiées

Qwen 3.8-Max ne dispose pour l’instant d’aucun benchmark indépendant. L’affirmation selon laquelle le modèle serait « seulement devancé par Fable 5 » provient directement d’Alibaba et n’est accompagnée d’aucune donnée permettant de la vérifier.

Sur Hacker News, plusieurs utilisateurs ont souligné la réputation de Qwen comme modèle particulièrement optimisé pour les benchmarks. Ils ont également critiqué une affirmation de classement du type « faites-nous confiance, il est numéro deux », alors qu’un tableau de résultats permettrait précisément de la confirmer.

Il est donc préférable de considérer ce classement comme un argument marketing tant qu’Artificial Analysis ou LMArena n’a pas évalué Qwen 3.8-Max.

Comparatif Kimi K3 vs Qwen 3.8-Max vs modèles frontier occidentaux

Dimension Kimi K3 Qwen 3.8-Max (Preview) Claude Fable 5 GPT-5.6 Sol
Nombre total de paramètres 2,8 T 2,4 T Fermé Fermé
Multimodalité Texte, image, vidéo Texte, image, vidéo, documents Texte, image Texte, image
Fenêtre de contexte 1 million de tokens 1 million de tokens 200 000 tokens 400 000 tokens
Arena Frontend Code N° 1 (1 679) Non évalué N° 2 (1 631) N° 3 (1 618)
Indice Artificial Analysis 57 (n° 4) Non évalué N° 1 N° 2
Poids ouverts 27 juillet 2026 Annoncés « prochainement » Non Non
Tarification de l’API 3 $/15 $ par million de tokens 10 % du tarif standard, sous forme de crédits 15 $/75 $ par million de tokens 10 $/40 $ par million de tokens
Auto-hébergement Théoriquement possible en datacenter Théoriquement possible en datacenter Non Non

Auto-hébergement : ce qu’il faut réellement savoir

Les deux modèles sont trop volumineux pour être auto-hébergés sur une station de travail. Avec une quantification en 4 bits :

  • Kimi K3, avec 2 800 milliards de paramètres : environ 1,4 To uniquement pour les poids
  • Qwen 3.8-Max, avec 2 400 milliards de paramètres : environ 1,2 To uniquement pour les poids

Une seule carte Nvidia H200 dispose de 141 Go de VRAM. Même un serveur équipé de huit cartes, soit 1 128 Go au total, ne peut charger aucun de ces deux modèles. Un auto-hébergement réaliste nécessite donc une infrastructure de niveau datacenter, avec une inférence distribuée sur plusieurs nœuds et du parallélisme de tenseurs entre des dizaines de GPU.

Pour la plupart des équipes, l’accès par API constitue la seule option viable.

C’est dans ce contexte que la distinction « open-weight » devient moins importante qu’elle ne le paraît. Le fait que les poids puissent être téléchargés ne signifie pas que vous pouvez réellement exécuter le modèle. Les critères les plus importants sont donc la disponibilité de l’API, la tarification et la possibilité d’intégrer plusieurs fournisseurs derrière une interface unique.

Accéder aux deux modèles via une API unifiée

Kimi K3 est disponible via l’API de Moonshot et OpenRouter. Qwen 3.8-Max est accessible à travers le Token Plan d’Alibaba.

Chaque solution possède son propre SDK, son propre système d’authentification, ses propres limites de débit et son propre modèle de facturation. Maintenir une intégration distincte pour chaque nouveau modèle frontier entraîne une véritable charge technique : formats d’erreurs différents, logiques de nouvelle tentative spécifiques et contraintes de capacité variables.

Kimi K3 a déjà rencontré des problèmes de capacité. Moonshot a suspendu les nouvelles inscriptions peu après son lancement en raison d’une forte hausse de la demande.

La page du modèle sur OpenRouter avertit également que la capacité du fournisseur en amont est actuellement limitée et que le modèle peut renvoyer fréquemment des erreurs 429.

Lorsqu’un fournisseur devient indisponible, une solution de fallback est indispensable.

Une passerelle API unifiée permet de résoudre ce problème. Eden AI donne accès à plus de 500 modèles provenant de plus de 24 fournisseurs, notamment Kimi K3 et les modèles Qwen, via un endpoint unique compatible avec l’API OpenAI.

Cela permet de :

  • Tester Kimi K3 et Qwen 3.8-Max en A/B sur les mêmes prompts, sans maintenir plusieurs clés API ou SDK
  • Acheminer les requêtes vers le modèle le plus performant selon le type de tâche, par exemple le code, le raisonnement ou le multimodal
  • Basculer automatiquement vers des fournisseurs occidentaux comme OpenAI, Anthropic ou Google lorsque les fournisseurs chinois rencontrent des problèmes de capacité
  • Suivre les coûts de tous les fournisseurs depuis un seul tableau de bord
  • Maintenir une seule intégration au lieu d’en gérer plusieurs

Exemple de code : appeler Kimi K3 et Qwen via Eden AI

import requests

EDENAI_API_KEY = "your_edenai_api_key"

def call_model(model, prompt):
    """Call any LLM through EdenAI's OpenAI-compatible v3 endpoint"""
    response = requests.post(
        "https://api.edenai.run/v3/chat/completions",
        headers={
            "Authorization": f"Bearer {EDENAI_API_KEY}",
            "Content-Type": "application/json",
        },
        json={
            "model": model,  # format: "provider/model"
            "messages": [{"role": "user", "content": prompt}],
            "temperature": 0.7,
            "max_tokens": 1000,
        },
    )
    response.raise_for_status()
    return response.json()

# Call Kimi K3
kimi_result = call_model("moonshot/kimi-k3", "Write a Python function to merge k sorted lists")

# Call Qwen 3.8-Max (when available through EdenAI)
qwen_result = call_model("alibaba/qwen3.8-max", "Write a Python function to merge k sorted lists")

# Compare outputs side by side without switching APIs
print("Kimi K3:", kimi_result["choices"][0]["message"]["content"])
print("Qwen 3.8:", qwen_result["choices"][0]["message"]["content"])

Fallback pattern: routing around capacity issues

import requests

EDENAI_API_KEY = "your_edenai_api_key"

def call_with_fallback(prompt, primary="moonshot/kimi-k3", fallback="openai/gpt-5.6-sol"):
    """Try primary model, fall back to a Western alternative on capacity errors"""
    headers = {
        "Authorization": f"Bearer {EDENAI_API_KEY}",
        "Content-Type": "application/json",
    }
    messages = [{"role": "user", "content": prompt}]
    try:
        response = requests.post(
            "https://api.edenai.run/v3/chat/completions",
            headers=headers,
            json={"model": primary, "messages": messages},
            timeout=30,
        )
        response.raise_for_status()  # 429/5xx capacity errors raise here
        return response.json()
    except requests.RequestException:
        # Fall back to the Western provider
        response = requests.post(
            "https://api.edenai.run/v3/chat/completions",
            headers=headers,
            json={"model": fallback, "messages": messages},
            timeout=30,
        )
        response.raise_for_status()
        return response.json()

Quand utiliser Kimi K3, Qwen 3.8-Max ou des modèles occidentaux ?

Cas d’usage Modèle recommandé Pourquoi
Génération de code frontend Kimi K3 Classé n° 1 sur Arena Frontend Code, avec un résultat confirmé par 483 000 votes humains
Raisonnement sur de longs contextes (1 million de tokens) Kimi K3 ou Qwen 3.8 Les deux prennent en charge une fenêtre de contexte de 1 million de tokens ; Kimi K3 dispose de résultats déjà démontrés
Traitement multimodal de documents Qwen 3.8-Max Compréhension native des documents combinant texte, images et vidéo
Production critique GPT-5.6 Sol ou Claude Fable 5 Fiabilité éprouvée et absence de contraintes de capacité
Tâches de programmation sensibles aux coûts Kimi K3 3 $/15 $ par million de tokens, soit une fraction du coût des modèles occidentaux de pointe
Workflows agentiques de réparation GPT-5.6 Sol ou Claude Fable 5 Kimi K3 a obtenu de moins bons résultats sur le débogage en plusieurs étapes, avec 79 %, contre des scores supérieurs pour les modèles occidentaux
Auto-hébergement, pour la recherche uniquement Kimi K3, après le 27 juillet Les poids ouverts permettent le fine-tuning, la distillation et la recherche

Cadre de décision

  1. Pour obtenir immédiatement des performances vérifiées : utilisez Kimi K3 via une API. Le modèle dispose de résultats indépendants sur Arena et Artificial Analysis. Qwen 3.8-Max repose encore sur des affirmations qui ne sont accompagnées d’aucune donnée indépendante.
  2. Pour le traitement multimodal de documents : attendez la publication des benchmarks de Qwen 3.8-Max. Sa compréhension native des documents pourrait constituer un avantage important si les performances annoncées sont confirmées.
  3. Pour une utilisation fiable en production : privilégiez les fournisseurs occidentaux comme solution principale et utilisez les modèles chinois comme alternatives moins coûteuses pour les tâches non critiques. Les problèmes de capacité de Kimi K3, notamment la suspension des inscriptions et les erreurs 429 sur OpenRouter, rendent son utilisation risquée comme fournisseur unique.
  4. Pour réduire les coûts : Kimi K3, facturé 3 $ par million de tokens en entrée et 15 $ en sortie, est nettement moins cher que Claude Fable 5, facturé 15 $ et 75 $, ou GPT-5.6 Sol, facturé 10 $ et 40 $. Vous pouvez acheminer les volumes importants et les tâches moins critiques vers Kimi K3, tout en réservant les modèles occidentaux aux cas d’usage à plus forte valeur.
  5. Pour utiliser des modèles open-weight dans le cadre de recherches : la publication des poids de Kimi K3 est prévue pour le 27 juillet 2026. Ceux de Qwen sont annoncés « prochainement », sans date précise.

Le contexte géopolitique

Le calendrier de ces lancements n’est pas anodin. Kimi K3 a été lancé le 16 juillet, puis Qwen 3.8-Max a été présenté le 19 juillet lors de la WAIC à Shanghai.

Selon l’analyse de Stratechery, cette dynamique montre que la stratégie chinoise autour des modèles open-weight porte ses fruits. Publier des modèles frontier avec des poids ouverts favorise leur adoption par les développeurs, tout en renforçant l’influence technologique des entreprises chinoises.

L’administration Trump chercherait parallèlement à relancer des mesures visant à limiter l’utilisation de modèles open source étrangers, ce qui pourrait compliquer leur accès pour les développeurs basés aux États-Unis.

Pour les développeurs, la conséquence pratique est claire : dépendre d’un seul fournisseur, qu’il soit chinois ou occidental, crée un risque géopolitique.

Une API unifiée couvrant les deux écosystèmes offre davantage de flexibilité. Si une juridiction restreint l’accès à certains modèles, le trafic peut être redirigé vers un autre fournisseur.

FAQs - Kimi K3 vs Qwen 3.8-Max

D’après les éléments disponibles actuellement, oui. Kimi K3 dispose de benchmarks indépendants, avec notamment une première place sur Arena Frontend Code et une quatrième position dans l’Artificial Analysis Intelligence Index. Qwen 3.8-Max est encore en version preview, sans scores tiers, model card ni licence. Son affirmation selon laquelle il serait « juste derrière Fable 5 » reste donc non vérifiée.

Kimi K3 est facturé 3 $ par million de tokens en entrée et 15 $ par million de tokens en sortie. Il est ainsi environ trois à cinq fois moins cher que les principaux modèles occidentaux : Claude Fable 5 coûte 15 $/75 $ et GPT-5.6 Sol 10 $/40 $ par million de tokens. Qwen 3.8-Max ne dispose d’aucun tarif public par token et est facturé au moyen de Token Plans basés sur des crédits.

Pas sur une station de travail classique. Avec une précision de 4 bits, Kimi K3 nécessite environ 1,4 To et Qwen 3.8-Max près de 1,2 To uniquement pour stocker leurs poids. Même un serveur équipé de huit GPU H200, totalisant 1 128 Go de VRAM, ne peut charger aucun des deux modèles. Un auto-hébergement réaliste nécessite donc une infrastructure datacenter multi-nœuds, ce qui fait de l’accès par API la seule option viable pour la plupart des équipes.

Moonshot a programmé la publication des poids open-weight de Kimi K3 pour le 27 juillet 2026, ce qui permettra le fine-tuning, la distillation et la recherche. Les poids de Qwen 3.8-Max ont été annoncés pour « bientôt », mais aucune date de sortie ni aucun fichier de licence n’ont été confirmés. Son statut open-weight n’est donc pas encore exploitable concrètement.

Kimi K3 s’est classé premier du leaderboard Frontend Code d’Arena avec 1 679 points issus de 483 895 votes humains à l’aveugle, devant Claude Fable 5 et GPT-5.6 Sol. Il a également obtenu un score de 57 dans l’Artificial Analysis Intelligence Index, se classant quatrième sur 189 modèles et atteignant le meilleur rang jamais obtenu par un modèle open-weight.

Cela dépend de la tâche. Kimi K3 est en tête pour la génération de code frontend, avec une première place sur Arena devant les deux autres modèles. Il a toutefois terminé dernier sur sept modèles dans le benchmark de réparation agentique d’AlphaSignal, en résolvant 79 % des problèmes, tandis que GPT-5.6 Sol et Claude Fable 5 ont obtenu de meilleurs résultats. Kimi K3 est donc mieux adapté à la génération d’interfaces, tandis que les modèles occidentaux restent plus performants pour le débogage en plusieurs étapes.

Non. Depuis sa preview du 19 juillet 2026, Qwen 3.8-Max ne dispose d’aucun tableau de benchmarks publié, d’aucune model card et d’aucun nombre déclaré de paramètres actifs. Son affirmation selon laquelle il serait « juste derrière Fable 5 » repose sur une évaluation interne d’Alibaba. Aucun organisme indépendant, comme Artificial Analysis ou LMArena, ne l’a encore évalué. Ce classement doit donc être considéré pour le moment comme une affirmation marketing.

Eden AI donne accès à Kimi K3 et aux modèles Qwen via un seul endpoint compatible OpenAI, aux côtés de plus de 500 modèles provenant de plus de 24 fournisseurs. Une seule intégration permet d’effectuer des tests A/B sur les mêmes prompts, de router le trafic selon le type de tâche, de basculer vers des fournisseurs occidentaux en cas de problème de capacité et de suivre les coûts dans un tableau de bord unique.

Articles similaires

Comparatifs d'IA
Vision
Qwen-Image-3.0 vs DALL-E et Stable Diffusion: Comparaison 2026
7/23/2026
·
Written bySamy Melaine
Comparatifs d'IA
Tous
DeerFlow vs plateformes commerciales d’agents IA : comparatif
7/21/2026
·
Written bySamy Melaine
COMMENCEZ

Commencez à créer avec Eden AI

Une interface unique pour intégrer les meilleures technologies d’IA dans vos flux de travail.