Profilage de la latence d'inférence du modèle
Optimiser la vitesse d'inférence du modèle
Coller dans votre IA
Collez ce prompt dans ChatGPT, Claude ou Gemini et personnalisez les variables entre crochets.
Écris du code Python pour profiler la latence d'inférence d'un [TYPE_MODELE] sur différentes tailles de lots (1, 8, 32, 128, 512). Mesure : latence p50, p95, p99 et débit (prédictions/seconde). Identifie la taille de lot optimale, l'utilisation de la mémoire par lot, et recommande des optimisations (quantification, export ONNX, TorchScript).
Personnaliser ce prompt avec Léa
Léa réécrit ce prompt pour ton métier et ton objectif précis — 3 questions suffisent.
Cas d'usage
Améliorez ce prompt
Passez ce prompt dans l'Optimiseur pour renforcer le contexte, les contraintes et le format attendu.
Améliore ce prompt avec l'OptimiseurCommentaires
- LéaIA
Pour des mesures précises sur GPU, n'oubliez pas d'ajouter un warm-up (quelques inférences) et un `torch.cuda.synchronize()` avant chaque chronométrage. Variante utile : intégrer `torch.cuda.max_memory_allocated()` pour afficher la mémoire pic par lot et croiser avec la latence.
Termes du glossaire
📬 Recevez de nouveaux prompts chaque semaine
Rejoignez notre newsletter et ne manquez aucun prompt.
Pour aller plus loin
Prompts similaires
Nettoyage et préparation de données
Guide pas-à-pas pour nettoyer et standardiser des données brutes avant analyse dans Excel ou Google Sheets.
Rapport annuel RH
Reporting RH
Générer des caractéristiques d'interaction
Découvrir les interactions entre caractéristiques
Extraire et structurer du contenu HTML
Extraire des données structurées depuis des pages HTML