r/information.ia · u/information.ia ·

Dans les modèles linguistiques à grande échelle (LLM), le terme « grokking » désigne une phase au cours de laquelle un modèle acquiert une compréhension approfondie et générale d’une tâche après un

Dans les modèles linguistiques à grande échelle (LLM), le terme « grokking » désigne une phase au cours de laquelle un modèle acquiert une compréhension approfondie et générale d’une tâche après un entraînement prolongé.

Avant le grokking, un modèle peut donner de bons résultats sur des exemples d’entraînement, mais ne parvient pas à généraliser ; après le grokking, il commence à résoudre correctement de nouveaux cas grâce à davantage de données d’entraînement.

Dans les LLM, les signes d’une réelle compréhension comprennent des performances stables sur des données hors distribution, un raisonnement cohérent à travers des invites variées et une robustesse face à de petits changements dans la formulation. Cela contraste avec la mémorisation de modèles ou d’exemples spécifiques.

🎥 : Welch Labs