fr.wedoany.com Rapport : Le 12 août, l'entreprise américaine d'intelligence artificielle SpaceXAI a dévoilé son nouveau modèle phare Grok 4.6, mettant l'accent sur l'amélioration des capacités des agents à long terme, du développement logiciel, du travail intellectuel et de la création d'applications interactives. Ce modèle est déjà disponible via Grok Build, Cursor et l'API SpaceXAI, et a été intégré aux plateformes partenaires telles qu'OpenRouter, Vercel et Cloudflare.

Grok 4.6 prend en charge les entrées texte et image, ainsi que les sorties texte, avec une fenêtre contextuelle de 500 000 jetons. Il peut appeler des fonctions, effectuer des recherches sur le Web et sur la plateforme X, exécuter des outils de code, et prend en charge les sorties structurées. Les développeurs peuvent invoquer le modèle via les API Responses et Chat Completions, avec quatre niveaux d'intensité de raisonnement — faible, moyen, élevé et très élevé — le mode de raisonnement élevé étant appliqué par défaut.
SpaceXAI indique que Grok 4.6 est principalement destiné aux tâches complexes nécessitant l'exécution continue de plusieurs étapes, notamment la recherche multi-sources, l'analyse d'informations, le traitement de grandes bases de code, le développement de prototypes logiciels et la génération de livrables professionnels. Par rapport à Grok 4.5, le nouveau modèle effectue davantage d'auto-tests et de vérifications des résultats dans les tâches longues, et renforce sa capacité à générer des versions initiales d'applications interactives à partir d'une conception produit.
En matière d'entraînement, Grok 4.6 a bénéficié d'un processus de formation complémentaire plus long que la génération précédente, avec des données incluant des données générées par le modèle pour le raisonnement et les concepts techniques avancés, ainsi que des données d'ingénierie. SpaceXAI a ensuite utilisé Grok 4.5 pour régénérer des trajectoires de supervision fine couvrant différents niveaux d'intensité de raisonnement, des cadres d'agents, ainsi que les domaines de la science, de l'ingénierie, des mathématiques et du développement logiciel, et a filtré les enregistrements d'entraînement problématiques via des contrôles du modèle. Le modèle a également suivi un apprentissage par renforcement sur des tâches d'agents telles que le travail intellectuel, la programmation générale, l'optimisation du noyau, le développement web et la conception assistée par ordinateur.
Selon les données publiées par SpaceXAI, Grok 4.6 a obtenu un score de 61 points à l'indice composite Artificial Analysis Intelligence Index, soit une amélioration de 5 points par rapport aux 56 points de Grok 4.5, à égalité avec GPT-5.6 Sol et à 1 point de moins que Claude Fable 5. Cet indice combine neuf tests couvrant la science, la programmation et les services financiers, mais les résultats reflètent principalement les performances du modèle dans des conditions spécifiques et ne peuvent pas être directement assimilés aux capacités dans tous les scénarios métier réels.
Dans les tests d'agents et de développement logiciel, Grok 4.6 a obtenu 69,9 % sur CursorBench 3.2, 65,9 % sur DeepSWE 1.1 et 61,3 % sur le test étendu FrontierCode 1.1. Son score APEX-Agents est de 57,5 %, supérieur aux 47,1 % de Grok 4.5 ; il a également obtenu 1577 points au test AA-Briefcase évaluant les capacités de travail intellectuel complexe, contre 1313 points pour la génération précédente.
Le prix de base de l'API standard de Grok 4.6 est de 2 dollars par million de jetons d'entrée, 0,5 dollar par million de jetons d'entrée en cache et 6 dollars par million de jetons de sortie. Lorsque le contexte d'entrée dépasse 200 000 jetons, l'entreprise applique un tarif plus élevé ; SpaceXAI propose également une version plus rapide, dont le prix est environ le double de la version standard. Grok Build et Cursor offrent un quota d'utilisation doublé pendant la première semaine suivant la sortie du modèle.
SpaceXAI affirme que le nouveau modèle a fait l'objet de la campagne de tests de capacités et de sécurité pré-déploiement la plus étendue jamais réalisée par l'entreprise, et que des tests post-déploiement et tiers se poursuivront. Toutefois, la plupart des données de performance publiées officiellement proviennent de tests internes de l'entreprise ou citent des résultats publics d'autres développeurs de modèles, et doivent encore être validées par des évaluations indépendantes et des déploiements réels en entreprise.





















