Après avoir dévoilé Grok 4.5 en juillet, l’entreprise a présenté, le 12 août, une version de son modèle baptisée Grok 4.6. Cette évolution vise à renforcer les capacités dites « agentiques » de l’IA. Au-delà de la simple réponse à une requête, le modèle doit être capable de suivre une mission sur la durée, d’analyser des informations complexes, de travailler sur une base de code ou encore de produire un livrable complet.
Le modèle est conçu pour rester opérationnel au cours de tâches comportant de nombreuses étapes, notamment dans la recherche, l’analyse de données, le développement informatique ou la production de documents. L’objectif est de limiter les ruptures de contexte et de donner la possibilité à l’IA de poursuivre une mission relativement longue sans devoir être constamment réorientée par l’utilisateur. Cette orientation apparaît également dans les outils proposés autour de Grok. xAI développe notamment Grok Build, un agent de programmation capable de fonctionner de manière interactive ou en arrière-plan, ainsi que des mécanismes destinés à orchestrer des tâches plus autonomes.
500 000 tokens de contexte
Sur le plan technique, Grok 4.6 dispose d’une fenêtre de contexte de 500 000 tokens, un volume particulièrement important pour traiter de longs documents, des bases de code conséquentes ou des historiques de travail complexes. Le modèle accepte des entrées textuelles et visuelles et produit des réponses textuelles. Son niveau de raisonnement peut également être configuré, avec plusieurs niveaux d’effort disponibles selon les besoins de l’application.
Pour positionner Grok 4.6 face aux modèles concurrents, SpaceXai s’appuie notamment sur l’Artificial Analysis Intelligence Index, un indicateur composite regroupant neuf benchmarks. Selon l’entreprise, Grok 4.6 atteint un score qui le place au niveau de GPT-5.6 Sol sur cet indice. Les résultats varient toutefois selon les tests, l’entreprise met notamment en avant ses performances dans le codage agentique, les tâches de connaissance et différents scénarios de travail complexes. D’après les données publiées par Artificial Analysis, Grok 4.6 obtient un score de 61 points sur cet indice. Ce résultat lui permet de dépasser certains modèles open weights populaires, tels que Kimi K3, et de se rapprocher de modèles de premier plan comme GPT-5.6 Sol Max. Claude Opus 5 et Fable 5 conservent néanmoins une avance sur plusieurs évaluations spécialisées.
Un entraînement renforcé
SpaceXai indique avoir consacré davantage de temps à l’entraînement de Grok 4.6 par rapport à Grok 4.5. L’entreprise a notamment utilisé des données générées et sélectionnées pour améliorer le raisonnement et les connaissances techniques, ainsi que des données liées à l’ingénierie. Le modèle a ensuite été affiné avec de l’apprentissage supervisé et de l’apprentissage par renforcement. Grok 4.6 est disponible via l’API de xAI sous le nom grok-4.6, avec sa fenêtre de contexte de 500 000 tokens et plusieurs niveaux d’effort de raisonnement. Le modèle est également proposé dans Cursor et Grok Build.