Résumez cet article avec :
- Inkling est le premier modèle open weight de Thinking Machines Lab : un modèle MoE de 975 milliards de paramètres, dont 41 milliards sont activés lors de l’inférence.
- Il obtient 97,1 % à AIME 2026, 87,2 % à GPQA Diamond et 46,0 % à HLE avec outils, ce qui le place parmi les meilleurs modèles open weight au monde.
- Inkling est publié sous licence Apache 2.0, autorisant son utilisation commerciale et son fine-tuning sans restrictions majeures.
- Le modèle permet de contrôler l’effort de raisonnement, afin d’ajuster la profondeur des réponses et la latence pour chaque requête.
- Inkling est disponible auprès de plusieurs fournisseurs d’hébergement et accessible via l’endpoint unifié d’Eden AI pour les usages en production.
Inkling est le premier modèle à poids ouverts de Thinking Machines Lab, l’entreprise d’intelligence artificielle fondée par Mira Murati. Il s’agit d’un modèle MoE de 975 milliards de paramètres, dont 41 milliards sont activés pour chaque requête. Publié sous licence Apache 2.0 en juillet 2026, il rivalise avec les modèles propriétaires de pointe sur les benchmarks de raisonnement, tout en restant entièrement ouvert à l’auto-hébergement et au fine-tuning.
Qu’est-ce qui différencie Inkling ?
La plupart des modèles à poids ouverts publiés en 2026 sont optimisés pour une seule catégorie de benchmarks. Inkling adopte une approche différente. Il vise des performances étendues sur les tâches de texte, de code, de traitement multimodal et d’audio, plutôt qu’une domination limitée à quelques classements.
Son architecture repose sur une conception Mixture-of-Experts, ou MoE. Sur les 975 milliards de paramètres que compte le modèle, seuls 41 milliards sont activés pour une entrée donnée. Cette approche permet de maintenir des coûts d’inférence maîtrisables, tout en conservant la capacité de connaissances d’un modèle beaucoup plus volumineux.
Effort de raisonnement contrôlable
Inkling intègre une fonctionnalité permettant de définir le niveau de « réflexion » que le modèle doit effectuer avant de répondre. Ce paramètre peut être configuré pour chaque requête, afin de trouver le bon équilibre entre rapidité de réponse et profondeur du raisonnement.
Pour une recherche simple, vous pouvez sélectionner un faible niveau d’effort. Pour des problèmes mathématiques complexes ou des analyses en plusieurs étapes, vous pouvez choisir un effort élevé. Ce fonctionnement est comparable au concept de « thinking budget » proposé par d’autres modèles de raisonnement, mais il est ici disponible dans un modèle à poids ouverts.
Performances d’Inkling sur les benchmarks
Les résultats d’Inkling sur les benchmarks le positionnent comme le modèle à poids ouverts d’origine américaine le plus performant en juillet 2026.
Sur la communauté Reddit r/LocalLLaMA, Inkling est considéré comme le principal modèle américain à poids ouverts. Il réduit ainsi l’écart avec les modèles ouverts chinois, qui dominaient cette catégorie au début de l’année 2026.
Ce que les poids ouverts changent pour votre stratégie d’IA
Les modèles à poids ouverts offrent trois possibilités qui ne sont pas disponibles avec les modèles propriétaires fermés :
- Auto-hébergement : vous pouvez exécuter Inkling sur votre propre infrastructure afin de conserver un contrôle total sur vos données. Aucun appel API ne quitte votre environnement.
- Fine-tuning : vous pouvez adapter le modèle à votre domaine spécifique, comme la santé, le droit ou la finance, sans transmettre vos données d’entraînement à un fournisseur tiers.
- Diversification des fournisseurs : vous pouvez accéder à Inkling auprès de plusieurs fournisseurs d’hébergement et ainsi éviter de dépendre d’un seul prestataire.
Pour les équipes qui utilisent déjà une stratégie d’IA multi-fournisseurs, Inkling apporte une nouvelle option à poids ouverts qui réduit la dépendance envers un fournisseur unique de modèles propriétaires. Si un fournisseur augmente ses tarifs ou modifie ses conditions, les charges de travail Inkling peuvent être transférées vers une infrastructure auto-hébergée.
Accéder à Inkling avec Eden AI
L’endpoint unifié d’Eden AI permet d’accéder à Inkling et à des modèles propriétaires depuis une seule et même API. Une API, ou interface de programmation d’application, permet à différents programmes de communiquer entre eux.
Vous pouvez ainsi comparer les réponses d’Inkling avec celles de Claude, GPT ou Gemini sans modifier votre code d’intégration.
Voici un exemple d’appel à Inkling avec Eden AI :
import requests
import os
headers = {
"Authorization": "Bearer " + os.environ["EDENAI_API_KEY"],
"Content-Type": "application/json"
}
payload = {
"model": "thinkingmachines/inkling",
"messages": [
{
"role": "user",
"content": "Explain the key differences between MoE and dense transformer architectures."
}
],
"max_tokens": 500
}
response = requests.post(
"https://api.edenai.run/v3/chat/completions",
headers=headers,
json=payload
)
print(response.json()["choices"][0]["message"]["content"])
Vous pouvez également ajouter des fournisseurs de secours afin de garantir une meilleure fiabilité :
payload_with_fallbacks = {
"model": "thinkingmachines/inkling",
"fallbacks": ["anthropic/claude-sonnet-5", "google/gemini-2.5-flash"],
"messages": [
{
"role": "user",
"content": "Your task here"
}
]
}
Configuration matérielle requise pour auto-héberger Inkling
L’exécution des 975 milliards de paramètres d’Inkling nécessite d’importantes ressources GPU. Un GPU, ou processeur graphique, est un composant matériel spécialisé dans les calculs parallèles.
La fiche technique du modèle indique que plusieurs GPU haut de gamme sont nécessaires. Toutefois, puisque seuls 41 milliards de paramètres sont activés pour chaque requête, la puissance de calcul réellement requise pour l’inférence se rapproche de celle d’un modèle dense de 40 milliards de paramètres.
Pour les équipes qui ne disposent pas de l’infrastructure nécessaire à l’auto-hébergement, les fournisseurs d’hébergement managé et l’endpoint d’Eden AI permettent d’utiliser le même modèle sans investissement matériel.
Conclusion
Inkling de Thinking Machines Lab représente une avancée importante dans la catégorie des modèles à poids ouverts. Grâce à ses performances compétitives sur les benchmarks, à sa licence Apache 2.0 et à son effort de raisonnement contrôlable, il offre aux développeurs une nouvelle solution pour mettre en place une stratégie d’IA multi-fournisseurs.
Eden AI permet d’accéder à Inkling ainsi qu’aux principaux modèles propriétaires depuis un endpoint unifié.
.png)


.png)
%20(1).png)