Recherche

Présentation de Grok 4.6

4 min de lecture

Aujourd'hui, nous lançons Grok 4.6 avec SpaceXAI.

Grok 4.6 s'appuie sur Grok 4.5, avec un accent particulier sur les agents de longue durée et les projets interactifs et visuels les plus ambitieux. Il gère des tâches complexes sur de nombreuses étapes, qu'il s'agisse de rechercher un sujet, d'analyser des informations, de travailler dans une base de code ou de transformer une idée en application aboutie ou en livrable.

Grok 4.6 atteint une intelligence de pointe sur plusieurs benchmarks de codage agentique et de travail intellectuel. Il égale GPT-5.6 Sol sur l'Artificial Analysis Intelligence Index, qui est un score composite de neuf benchmarks.

Résultats de Grok 4.6 aux benchmarks de codage et de travail intellectuel

Grok 4.6 est disponible dès aujourd'hui dans Cursor et Grok Build. Nous proposons deux fois plus d'utilisation incluse dans Cursor et Grok Build pendant la première semaine.

Entraînement de Grok 4.6

Grok 4.6 a fait l’objet d’un entraînement supplémentaire plus long que Grok 4.5, à partir de données générées par le modèle et sélectionnées pour le raisonnement et les concepts techniques avancés, de données d’ingénierie de haute qualité, ainsi que d’un optimiseur et d’une recette d’entraînement améliorés. Cela a permis d’établir une base plus solide pour les étapes de SFT et de RL qui ont suivi.

Nous avons ensuite utilisé Grok 4.5 pour régénérer les trajectoires de SFT pour différents niveaux d’effort de raisonnement, infrastructures d’agents et domaines tels que les disciplines STEM, l’ingénierie logicielle et le travail intellectuel. Nous avons écarté les traces problématiques à l’aide de vérifications fondées sur des modèles. Le checkpoint SFT obtenu affiche de solides performances et un comportement amélioré.

Grok 4.6 est entraîné sur un large éventail de tâches de RL agentique, notamment le travail intellectuel, le codage général et des environnements spécialisés pour l’optimisation de kernels, le développement web, la conception assistée par ordinateur et bien plus encore.

Transformer des idées ambitieuses en projets opérationnels

Nous avons testé Grok 4.6 sur des projets conçus pour mettre à l’épreuve son étendue de compétences et sa capacité à mener un travail sur de nombreuses étapes. Nous avons constaté que le modèle excelle particulièrement à transformer une idée de produit globale en une première version opérationnelle. Il peut explorer des domaines inconnus, structurer l’application, mettre en œuvre les interactions clés et continuer à affiner le résultat au fil de plusieurs cycles de retours.

Lors de trajectoires plus longues, nous avons également constaté davantage d’auto-tests et de vérifications, le modèle contrôlant son propre travail avant de passer à la suite.

Grok 4.6 produit de meilleures premières versions de projets visuels et interactifs que ce que nous observions habituellement avec Grok 4.5. À partir d’une idée de produit concrète, il est capable d’établir la structure et le langage visuel d’une application en un seul passage. Cela le rend particulièrement utile pour les projets où le chemin le plus rapide vers un bon résultat consiste à commencer par quelque chose de substantiel, puis à itérer dans la boucle.

Sécurité et capacités

Les garde-fous de Grok 4.6 ont été améliorés et calibrés en fonction des capacités du modèle.

Notre dispositif de sécurité est conçu pour maximiser l’utilité et la sécurité dans le cadre d’utilisations légitimes, afin que Grok 4.6 soit utile et sûr dans des domaines tels que la correction de vulnérabilités, l’accélération du cycle de conception technique et le renforcement de la recherche en IA.

Nos travaux d’évaluation des garde-fous reflètent les capacités étendues de Grok 4.6, avec notre suite de tests pré-déploiement la plus complète à ce jour pour évaluer les capacités et calibrer les garde-fous, ainsi que des tests approfondis réalisés par des tiers après le déploiement.

Premiers pas avec Grok 4.6

Grok 4.6 est disponible dès aujourd’hui dans Cursor et Grok Build. Il est également disponible via l’API SpaceXAI et par l’intermédiaire de partenaires, notamment OpenRouter, Vercel et Cloudflare.

Les tarifs commencent à 6 par million de tokens de sortie. Une variante rapide est disponible au double du prix.

Nous incluons une utilisation 2× dans Cursor et Grok Build pendant la première semaine.