Les lois d’échelle de l’IA décrivent comment les performances d’un modèle s’améliorent (de manière prévisible) lorsque nous augmentons la quantité de données d’entraînement, la taille du modèle (en
Les lois d’échelle de l’IA décrivent comment les performances d’un modèle s’améliorent (de manière prévisible) lorsque nous augmentons la quantité de données d’entraînement, la taille du modèle (en termes de paramètres) ou la puissance de calcul totale utilisée (mesurée en FLOPS ou opérations en virgule flottante par seconde).
Les lois d’échelle sont des lois de puissance, ce qui signifie qu’à mesure que nous augmentons l’échelle, les performances augmentent proportionnellement.
Par exemple, lorsque nous augmentons la taille du modèle, nous devrions nous attendre à de meilleures performances ou à un taux d’erreur plus faible proportionnel à l’augmentation de la taille du modèle.
Lorsque nous représentons ces relations sur un graphique log-log (des graphiques où les deux axes sont logarithmiques au lieu d’être linéaires), ces lois de puissance apparaissent sous forme de lignes droites, et la pente représente la vitesse à laquelle chaque facteur évolue.
Ce type de représentation graphique aide les chercheurs à identifier la manière la plus efficace d’améliorer les performances, connue sous le nom de frontière optimale en calcul là où vous obtenez les meilleures performances pour une quantité de calcul donnée.
🎥 : Welch Labs