Résumez cet article avec :
- Apple SpeechAnalyzer traite l'audio sur l'appareil à coût zéro par appel, mais fonctionne uniquement sur le matériel Apple (iOS 26, macOS Tahoe)
- Les API STT cloud comme Deepgram à 0,26 $/heure et OpenAI Whisper à 0,36 $/heure fonctionnent sur toute plateforme avec accès internet
- La latence sur appareil est d'environ 100ms en temps réel; les API cloud varient de 500ms à 2 secondes selon le fournisseur
- Les cas sensibles à la vie privée (santé, juridique) bénéficient du traitement sur appareil car aucun audio ne quitte l'appareil
- Le routage multi-fournisseurs via Eden AI permet de combiner STT sur appareil et cloud pour un coût et une précision optimaux
L'API SpeechAnalyzer d'Apple, introduite dans iOS 26, offre une reconnaissance vocale sur appareil qui s'exécute entièrement sur le matériel de l'utilisateur. Elle ne coûte rien par appel, traite l'audio en environ 100ms, et n'envoie jamais de données à un serveur.
Les API de transcription vocale (STT, Speech-to-Text, la conversion de parole en texte) cloud comme Deepgram, OpenAI Whisper et AssemblyAI offrent un support multiplateforme plus large et des fonctionnalités avancées comme la diarisation (identifier qui a dit quoi dans un enregistrement). Cet article compare les deux approches pour vous aider à choisir.
Qu'est-ce qu'Apple SpeechAnalyzer?
SpeechAnalyzer est une nouvelle classe dans le framework Speech d'Apple. Il remplace l'ancien SFSpeechRecognizer avec une conception modulaire et asynchrone. Vous attachez des modules pour gérer des tâches spécifiques: transcription, identification du locuteur, ou analyse personnalisée.
La différence clé avec les API cloud est que SpeechAnalyzer fonctionne entièrement sur l'appareil. Apple fournit des modèles neuronaux entraînés dans iOS 26 et macOS Tahoe. Votre application télécharge ces modèles une fois (environ 100 Mo par langue) puis transcrit l'audio sans connexion réseau.
Plateformes prises en charge
- iOS 26 et versions ultérieures sur iPhone et iPad
- macOS Tahoe et versions ultérieures
- watchOS 12, avec une prise en charge limitée aux courts extraits audio
- visionOS 2, pour la transcription audio spatiale
Performances en matière de précision
Des benchmarks indépendants publiés en juillet 2026 indiquent que SpeechAnalyzer atteint un taux d’erreur de mots de 4,2 % sur des enregistrements vocaux standards en anglais. Le taux d’erreur de mots, ou WER, correspond au pourcentage de mots incorrectement transcrits. Ces performances sont compétitives par rapport à celles des solutions cloud.
API cloud de transcription audio : tarifs et fonctionnalités
Les API cloud de reconnaissance vocale facturent généralement leur utilisation à la minute ou à l’heure de contenu audio traité. Voici les tarifs des principaux fournisseurs en juillet 2026 :
- Deepgram Nova-3 : 0,0043 $ par minute en traitement par lots et 0,0077 $ par minute en streaming, soit environ 0,26 $ par heure pour le traitement par lots.
- API OpenAI Whisper : 0,006 $ par minute, soit environ 0,36 $ par heure. Vous pouvez également auto-héberger Whisper gratuitement si vous disposez d’une infrastructure GPU.
- AssemblyAI : 0,12 $ par heure en traitement par lots et 0,15 $ par heure en streaming. La diarisation des locuteurs et l’analyse des sentiments sont incluses sans coût supplémentaire.
- Google Cloud Speech-to-Text : 0,016 $ par minute pour le modèle standard et 0,024 $ par minute pour Chirp_2, soit environ 0,96 $ par heure avec Chirp_2.
- AWS Transcribe : 0,024 $ par minute, soit environ 1,44 $ par heure. Le service inclut un vocabulaire médical adapté aux cas d’usage dans le secteur de la santé.
Quand privilégier une API cloud
Une API cloud de reconnaissance vocale est particulièrement adaptée lorsque vous avez besoin de :
- Une compatibilité multiplateforme, notamment avec Android, le Web et les serveurs Linux
- La diarisation des locuteurs, afin d’identifier les différentes personnes qui participent à une conversation
- Du streaming en temps réel depuis des appareils non Apple
- Des fonctions avancées de post-traitement, comme l’analyse des sentiments, l’extraction de sujets ou la suppression des données personnelles
- Une couverture linguistique plus large que celle proposée par Apple, certains fournisseurs prenant en charge plus de 100 langues
Quand privilégier le traitement directement sur l’appareil
Apple SpeechAnalyzer constitue le meilleur choix pour les cas d’usage suivants :
- Applications nécessitant un haut niveau de confidentialité : applications de santé traitant des données de patients, transcription juridique de communications confidentielles ou toute application pour laquelle l’envoi de fichiers audio vers un serveur tiers présente un risque de conformité.
- Applications conçues pour fonctionner hors ligne : travail sur le terrain, aviation ou environnements disposant d’une connexion Internet limitée ou instable.
- Produits exclusivement destinés à l’écosystème Apple et sensibles aux coûts : si votre application fonctionne uniquement sur iOS ou macOS, la transcription ne génère aucun coût, quel que soit le volume traité.
- Cas d’usage nécessitant une faible latence : le sous-titrage en direct pendant les appels vidéo bénéficie d’un temps de traitement local d’environ 100 ms.
Combiner la transcription locale et les API cloud avec Eden AI
La plupart des applications réelles bénéficient d’une approche hybride. Utilisez SpeechAnalyzer pour les requêtes sensibles, les interactions rapides et les traitements effectués sur des appareils Apple. Orientez les demandes complexes, multilingues ou nécessitant des fonctionnalités avancées vers des fournisseurs cloud via Eden AI.
Eden AI regroupe plus de 15 fournisseurs de transcription audio derrière une seule API. Vous réalisez une seule intégration, puis vous dirigez chaque requête vers le fournisseur le plus adapté à votre cas d’usage.
Voici comment transcrire un fichier audio avec l’endpoint unifié d’Eden AI :
import requests
headers = {
"Authorization": "Bearer YOUR_EDENAI_API_KEY",
"Content-Type": "application/json"
}
# Transcribe audio through multiple providers for comparison
response = requests.post(
"https://api.edenai.run/v3/universal-ai",
headers=headers,
json={
"model": "audio/speech_to_text_async/deepgram",
"fallbacks": ["audio/speech_to_text_async/openai"],
"input": {
"file": "https://your-storage.com/audio.mp3",
"language": "en"
}
}
)
result = response.json()
print(result["job_id"]) # Poll for async results
Cette approche vous permet également de bénéficier de fallbacks automatiques. Si Deepgram devient indisponible, Eden AI peut relancer la requête avec OpenAI Whisper. Vous améliorez ainsi la fiabilité de votre application sans avoir à développer votre propre logique de nouvelle tentative.
Analyse des coûts pour 10 000 heures de transcription
Voici le coût du traitement de 10 000 heures de contenu audio selon les différentes approches :
Comment choisir la bonne approche de transcription audio
Conclusion
Apple SpeechAnalyzer modifie profondément le modèle économique de la transcription audio pour les applications exclusivement destinées à l’écosystème Apple. Son traitement local gratuit, associé à une précision compétitive, en fait le choix par défaut pour les applications iOS et macOS.
Les API cloud de transcription restent toutefois indispensables pour les besoins multiplateformes, les fonctionnalités avancées comme la diarisation des locuteurs et les applications qui doivent traiter des fichiers audio provenant de sources non Apple.
L’approche la plus efficace consiste à combiner les deux solutions. Traitez les fichiers audio provenant d’appareils Apple avec SpeechAnalyzer afin de renforcer la confidentialité et de réduire les coûts. Envoyez les autres requêtes via Eden AI pour accéder à plus de 15 fournisseurs de transcription, à des fallbacks automatiques et à un suivi unifié des coûts.

