Workflow
IA Générative
8 min de lecture

Prompt caching : coûts de Claude, GPT et Gemini en 2026

Résumez cet article avec :

Résumé
  • Anthropic Claude facture l’écriture en cache à 1,25 fois le tarif de base, puis applique un tarif de 0,10 fois le prix standard, soit 90 % de réduction, pour chaque lecture depuis le cache. Seuil de rentabilité : 1,4 lecture par écriture.
  • OpenAI GPT met automatiquement les prompts en cache et accorde 50 % de réduction sur les tokens d’entrée mis en cache. Aucune configuration n’est nécessaire, mais vous disposez de moins de contrôle sur les éléments placés en cache.
  • Google Gemini propose la mise en cache du contexte avec une durée de vie minimale d’une heure et une réduction de 75 % sur les tokens mis en cache pour les prompts volumineux de 32 000 tokens ou plus.
  • Le seuil de rentabilité varie selon le fournisseur : Claude nécessite davantage de lectures du cache, mais offre la réduction la plus importante. GPT fonctionne automatiquement, avec une remise moins élevée.
  • Eden AI permet d’accéder aux trois fournisseurs depuis une seule API. Vous pouvez ainsi utiliser le prompt caching avec différents modèles sans modifier votre code.

Anthropic propose 90 % de réduction sur les lectures depuis le cache, avec une durée de vie de 5 minutes. OpenAI applique automatiquement une réduction de 50 %, tandis que Google offre 75 % de réduction, avec une durée minimale d’une heure. Pourtant, la plupart des équipes passent à côté de 70 à 90 % d’économies potentielles, car elles ne structurent pas leurs prompts pour tirer parti du cache.

Fournisseur Coût d’écriture dans le cache Coût de lecture du cache Durée de conservation minimale Seuil de rentabilité Économies maximales
Anthropic Claude 1,25× le tarif d’entrée de base 0,10× le tarif d’entrée de base 5 minutes 1,4 lecture par écriture Jusqu’à 90 % d’économie sur les tokens d’entrée
OpenAI GPT Gratuit et automatique 0,50× le tarif d’entrée de base Automatique 1 lecture, l’écriture étant gratuite Jusqu’à 50 % d’économie sur les tokens d’entrée
Google Gemini Frais de stockage 0,25× le tarif d’entrée de base 1 heure Dépend du volume Jusqu’à 75 % d’économie sur les tokens d’entrée

Qu’est-ce que le prompt caching ?

Chaque fois que vous envoyez une requête à un LLM, le fournisseur traite l’intégralité de votre prompt depuis le début. Si votre prompt contient un message système de 5 000 tokens qui ne change jamais, le modèle relit ces 5 000 tokens à chaque appel.

Le prompt caching, ou mise en cache des prompts, permet d’éviter ce retraitement. Le fournisseur stocke en mémoire la partie statique de votre prompt. Lors des appels suivants, il réutilise les tokens mis en cache au lieu de les traiter à nouveau.

Vous payez donc le plein tarif lors du premier appel, correspondant à l’écriture dans le cache, puis un tarif réduit pour chaque appel ultérieur utilisant le cache.

Comment chaque fournisseur met en œuvre le prompt caching

Anthropic Claude : configuration explicite et réduction maximale

Claude propose le système de mise en cache le plus explicite. Vous indiquez les parties du prompt à mettre en cache à l’aide de marqueurs cache_control. Les écritures dans le cache coûtent 1,25 fois le tarif d’entrée standard. Les lectures depuis le cache coûtent seulement 0,10 fois le tarif de base, soit une réduction de 90 %.

La durée de vie du cache, ou TTL (Time To Live), est de 5 minutes. Lorsque vous appelez Claude au moins une fois toutes les cinq minutes avec le même préfixe mis en cache, le cache reste actif. Le seuil de rentabilité est de 1,4 lecture par écriture : après 1,4 utilisation du cache, les économies générées dépassent le surcoût initial de l’écriture.

OpenAI GPT : mise en cache automatique et réduction modérée

OpenAI met automatiquement les prompts en cache lorsqu’il détecte des préfixes répétés. Vous n’avez pas besoin d’ajouter de marqueurs spécifiques. Les lectures depuis le cache coûtent 0,50 fois le tarif d’entrée standard, soit une réduction de 50 %. L’écriture n’entraîne aucun surcoût spécifique, car OpenAI gère automatiquement la mise en cache.

La contrepartie est que vous ne contrôlez ni précisément les éléments mis en cache ni leur durée de conservation. La politique d’expiration et de suppression du cache d’OpenAI n’est pas documentée publiquement. Pour obtenir des économies prévisibles, vous devez donc veiller à ce que vos prompts commencent par des préfixes identiques et cohérents.

Google Gemini : mise en cache du contexte pour les prompts volumineux

La mise en cache du contexte de Google Gemini cible principalement les prompts volumineux de 32 000 tokens ou plus. Vous créez un objet de contenu mis en cache via l’API, puis vous le référencez dans les appels suivants. Les tokens mis en cache coûtent 0,25 fois le tarif standard, soit une réduction de 75 %.

La durée minimale du cache est de 1 heure, et Google facture également des frais de stockage pour le contenu mis en cache. La mise en cache de Gemini est donc particulièrement adaptée aux charges de travail comprenant un contexte statique et volumineux, réutilisé pendant plusieurs heures ou plusieurs jours.

Calcul du seuil de rentabilité

Voici le calcul pour un prompt système de 10 000 tokens, appelé 100 fois par heure :

  • Claude permet d’économiser 84 %, grâce à sa réduction de 90 % sur les lectures depuis le cache.
  • OpenAI permet d’économiser 45 %, avec une mise en cache automatique mais une réduction moins importante.
  • Google permet d’économiser 73 %, ce qui convient particulièrement aux prompts volumineux conservés longtemps dans le cache.

Comment structurer vos prompts pour la mise en cache

Chaque fournisseur met en cache le préfixe du prompt. La partie mise en cache doit donc rester strictement identique entre les différents appels.

Structurez vos prompts de la manière suivante :

Préfixe statique mis en cache :

  • instructions système ;
  • personnalité ou rôle du modèle ;
  • règles de formatage ;
  • documents de référence.

Suffixe dynamique non mis en cache :

  • message de l’utilisateur ;
  • contexte actuel ;
  • variables propres à la requête.

Une mauvaise structure :

# BAD: variable content before static content breaks the cache
messages = [
    {"role": "user", "content": f"Today is {date}. {system_prompt}"},
]

Une bonne structure :

# GOOD: static prefix first, dynamic suffix last
messages = [
    {"role": "system", "content": system_prompt},  # This gets cached
    {"role": "user", "content": f"Today is {date}. Answer this question."},
]

Utiliser le prompt caching avec Eden AI

Eden AI transmet vos requêtes vers différents fournisseurs depuis un point d’accès API unique. La mise en cache fonctionne automatiquement avec OpenAI. Pour Claude, vous devez ajouter les marqueurs de contrôle du cache.

import os, urllib.request, json

headers = {
    "Authorization": "Bearer " + os.environ["EDENAI_API_KEY"],
    "Content-Type": "application/json"
}

# Claude with explicit cache control on the system prompt
payload = json.dumps({
    "model": "anthropic/claude-sonnet-4-6",
    "messages": [
        {
            "role": "system",
            "content": "Your 5000-token system prompt here...",
            "cache_control": {"type": "ephemeral"}
        },
        {
            "role": "user",
            "content": "Dynamic user question"
        }
    ],
    "max_tokens": 1000
}).encode()

req = urllib.request.Request(
    "https://api.edenai.run/v3/chat/completions",
    data=payload, headers=headers, method="POST"
)

with urllib.request.urlopen(req) as resp:
    result = json.loads(resp.read())
    # Check usage for cache hit/miss metrics
    usage = result.get("usage", {})
    print(f"Cache read tokens: {usage.get('prompt_cache_read_tokens', 0)}")
    print(f"Cache miss tokens: {usage.get('prompt_cache_miss_tokens', 0)}")

Cadre de décision : quelle stratégie de mise en cache choisir ?

Choisissez la mise en cache de Claude lorsque :

  • votre prompt système est stable et change moins d’une fois par jour ;
  • votre trafic atteint au moins deux appels toutes les cinq minutes, ce qui permet de maintenir le cache actif ;
  • vous recherchez les économies maximales, jusqu’à 90 %, et acceptez de structurer explicitement vos prompts.

Choisissez la mise en cache automatique d’OpenAI lorsque :

  • vous recherchez une solution sans configuration avec des économies automatiques ;
  • vos prompts comportent naturellement des préfixes cohérents ;
  • une réduction de 50 % est suffisante pour votre cas d’usage.

Choisissez la mise en cache du contexte de Gemini lorsque :

  • vos prompts contiennent 32 000 tokens ou plus, notamment pour traiter de grands documents de référence ;
  • vous réutilisez le même contexte pendant plusieurs heures ou plusieurs jours ;
  • une réduction de 75 % sur les prompts volumineux représente une économie significative.

Stratégie avancée de mise en cache multi-fournisseurs

Les équipes les plus avancées utilisent une stratégie de mise en cache différente pour chaque fournisseur et orientent les requêtes en fonction de la charge de travail.

  • Classification à haut volume : Claude avec un prompt système mis en cache, pour bénéficier de 90 % de réduction sur plus de 100 appels par minute.
  • IA conversationnelle : OpenAI avec mise en cache automatique, pour obtenir 50 % de réduction grâce à des préfixes de conversation cohérents.
  • Analyse de documents : Gemini avec mise en cache du contexte, pour profiter de 75 % de réduction sur des documents statiques et volumineux.

Eden AI vous permet de mettre en place ce routage depuis une seule API. Vous pouvez également configurer des modèles de secours afin que, si le cache du fournisseur principal n’est pas utilisé, la requête soit redirigée vers une solution alternative.

Conclusion

Le prompt caching est l’une des optimisations les plus rentables pour réduire le coût des API LLM en 2026. Claude propose 90 % de réduction sur les lectures depuis le cache, OpenAI applique automatiquement 50 % de réduction, et Gemini offre 75 % de réduction pour les prompts volumineux.

Pour maximiser vos économies, structurez vos prompts avec des préfixes statiques, suivez votre taux d’utilisation du cache et orientez chaque charge de travail vers le fournisseur offrant les conditions de mise en cache les plus avantageuses.

FAQ sur le prompt caching de Claude, GPT et Gemini

La mise en cache des prompts stocke la partie statique de votre prompt sur les serveurs du fournisseur. Lors des appels suivants, les tokens mis en cache sont réutilisés au lieu d’être traités à nouveau. Vous payez le prix complet une première fois, puis bénéficiez d’une réduction de 50 % à 90 % sur les requêtes suivantes qui utilisent le cache.

Anthropic Claude offre la réduction la plus importante, avec des lectures de cache facturées 90 % moins cher que les tokens d’entrée standards. Il nécessite toutefois des marqueurs de cache explicites et utilise une durée de vie de cinq minutes. OpenAI applique automatiquement une réduction de 50 % sans configuration. Google Gemini offre une réduction de 75 % pour les prompts de plus de 32 000 tokens.

L’écriture dans le cache de Claude coûte 1,25 fois le tarif standard des tokens d’entrée, tandis qu’une lecture du cache coûte 0,10 fois ce tarif. Le seuil de rentabilité est d’environ 1,4 lecture par écriture dans le cache. Après deux utilisations du cache, vous commencez déjà à économiser de l’argent. Après dix utilisations, l’économie atteint environ 85 % sur la partie mise en cache du prompt.

Non. OpenAI détecte automatiquement les préfixes de prompts répétés et les met en cache sans configuration supplémentaire. Vous n’avez pas besoin d’ajouter de marqueurs de cache. Veillez simplement à conserver un début de prompt cohérent afin d’améliorer le taux d’utilisation du cache.

Appelez les modèles compatibles via l’endpoint unifié d’ Eden AI . La mise en cache des prompts OpenAI fonctionne automatiquement. Pour Claude, ajoutez des marqueurs cache_control aux parties concernées de votre prompt système. Eden AI gère l’authentification, le routage et la facturation entre les différents fournisseurs.

COMMENCEZ

Commencez à créer avec Eden AI

Une interface unique pour intégrer les meilleures technologies d’IA dans vos flux de travail.