P

Scaling Laws : Définition et Exemples

Les scaling laws (lois d'échelle) sont des relations mathématiques qui décrivent comment les performances d'un modèle d'IA s'améliorent de manière prévisible lorsqu'on augmente la taille du modèle, la quantité de données d'entraînement ou la puissance de calcul utilisée.

Définition complète

Les scaling laws, ou lois d'échelle, constituent l'une des découvertes les plus fondamentales de la recherche moderne en intelligence artificielle. Formalisées notamment par les chercheurs d'OpenAI (Kaplan et al., 2020) puis affinées par l'équipe de DeepMind (Hoffmann et al., 2022 avec les travaux Chinchilla), ces lois établissent que les performances d'un modèle de langage suivent des courbes de puissance (power laws) prévisibles en fonction de trois variables clés : le nombre de paramètres du modèle, le volume de données d'entraînement et le budget de calcul (compute).

Concrètement, ces lois montrent que la perte (loss) d'un modèle — c'est-à-dire son taux d'erreur — diminue selon une fonction puissance lorsqu'on augmente l'une de ces trois variables, les deux autres restant constantes. Par exemple, doubler le nombre de paramètres d'un modèle ne double pas ses performances, mais les améliore selon un facteur prévisible et régulier. Cette relation suit une loi de puissance de la forme L = a × N^(-α), où L est la perte, N la variable d'échelle et α un exposant caractéristique.

L'impact pratique des scaling laws est considérable. Elles permettent aux laboratoires de recherche de prédire les performances d'un modèle avant même de l'entraîner, simplement en extrapolant à partir de modèles plus petits. C'est grâce à ces lois que des décisions d'investissement de plusieurs centaines de millions de dollars en infrastructure de calcul peuvent être prises avec une relative confiance. Les travaux Chinchilla ont notamment montré que de nombreux modèles étaient « sous-entraînés » par rapport à leur taille, et qu'un meilleur équilibre entre paramètres et données produisait des résultats supérieurs à moindre coût.

Plus récemment, la communauté distingue les scaling laws dites « pré-entraînement » (pre-training compute scaling) des scaling laws d'inférence (inference-time compute scaling ou test-time compute). Ces dernières, popularisées par des modèles comme o1 et o3 d'OpenAI, montrent qu'allouer davantage de calcul au moment de la génération de réponse — via des techniques de raisonnement étendu — peut également améliorer les performances de manière prévisible, ouvrant une nouvelle dimension d'optimisation.

Étymologie

Le terme « scaling laws » vient de la physique et des mathématiques, où les lois d'échelle décrivent comment un phénomène évolue lorsqu'on change l'échelle d'observation. En physique statistique, ces lois caractérisent les transitions de phase et les phénomènes critiques. Le terme a été adopté par la communauté IA à partir de 2020 pour décrire les régularités empiriques observées dans l'entraînement des grands modèles de langage.

Exemples concrets

Planification de l'entraînement d'un modèle

En me basant sur les scaling laws de Chinchilla, aide-moi à calculer le ratio optimal entre nombre de paramètres et tokens d'entraînement pour un budget de calcul de 10^24 FLOPs.

Comparaison de modèles de différentes tailles

Explique-moi pourquoi GPT-4 est plus performant que GPT-3 en termes de scaling laws. Quels facteurs d'échelle ont été augmentés et dans quelles proportions ?

Choix stratégique entre taille de modèle et temps d'inférence

Pour une tâche de raisonnement mathématique complexe, est-il préférable d'utiliser un modèle plus grand ou d'augmenter le compute d'inférence avec des techniques de chain-of-thought ? Analyse en termes de scaling laws.

Usage pratique

En prompt engineering, comprendre les scaling laws aide à choisir le bon modèle pour chaque tâche : un modèle plus grand n'est pas toujours nécessaire si la tâche est simple, mais les tâches complexes bénéficient significativement d'un modèle à plus grande échelle. Cela permet aussi de comprendre pourquoi les techniques de raisonnement étendu (chain-of-thought, réflexion) améliorent les résultats — elles exploitent les scaling laws d'inférence. Enfin, connaître ces lois permet d'anticiper les capacités futures des modèles et d'adapter ses stratégies de prompting en conséquence.

Concepts liés

Paramètres de modèleTokens d'entraînementCompute (FLOPs)Inference-Time ComputeLoss FunctionChinchilla Optimal

FAQ

Les scaling laws signifient-elles qu'un modèle plus gros est toujours meilleur ?
Pas nécessairement. Les scaling laws montrent que les performances s'améliorent avec la taille, mais avec des rendements décroissants. De plus, les travaux Chinchilla ont prouvé qu'un modèle plus petit mais mieux entraîné (avec plus de données) peut surpasser un modèle plus grand sous-entraîné. Le ratio optimal entre taille et données est crucial.
Les scaling laws ont-elles des limites ?
Oui, plusieurs limites sont identifiées. Premièrement, elles décrivent des tendances moyennes et ne prédisent pas les capacités émergentes spécifiques (comme la capacité de raisonner en plusieurs étapes). Deuxièmement, elles supposent un accès quasi illimité à des données de qualité, ce qui devient un goulot d'étranglement réel. Enfin, certains chercheurs estiment que les gains pourraient ralentir à mesure que les modèles approchent les limites des données humaines disponibles.
Quel est le lien entre scaling laws et le coût des modèles d'IA ?
Les scaling laws sont directement liées aux coûts car elles dictent le budget de calcul nécessaire pour atteindre un niveau de performance donné. Entraîner un modèle frontier coûte aujourd'hui plusieurs centaines de millions de dollars. Les scaling laws permettent aux laboratoires d'optimiser l'allocation de ces budgets en trouvant le point d'équilibre optimal entre taille du modèle, volume de données et durée d'entraînement.

Voir aussi

Comment utiliser ce prompt

  1. Copie le prompt avec le bouton ci-dessus.
  2. Colle-le dans ChatGPT, Claude ou ton assistant IA préféré.
  3. Remplace les variables entre crochets par tes informations, puis affine le résultat.

À propos de Prompt Guide

Prompt Guide est une bibliothèque gratuite de plus de 2500 prompts prêts à l'emploi pour ChatGPT, Claude et les autres IA, avec des guides pour apprendre à prompter et des outils pour créer et optimiser tes propres prompts.

Autres définitions

Recevez de nouveaux prompts chaque semaine

Rejoignez notre newsletter.