fr.wedoany.com Rapport : Le 3 août, Alibaba a officiellement lancé son nouveau modèle de fondation de nouvelle génération, Qwen3.8, avec un total de 2,4 billions de paramètres, offrant des améliorations significatives en programmation (Coding) et en travail professionnel (Cowork). Dans le classement Arena publié aujourd'hui par une tierce partie faisant autorité, le modèle Qwen d'Alibaba se classe juste derrière la série Claude d'Anthropic, avec des performances globales parmi les meilleures au monde dans le domaine des grands modèles. Actuellement, l'API de Qwen3.8 est disponible sur la plateforme Qianwen AI et a été intégrée au produit Agent « Qianwen Bureau » lancé simultanément par Alibaba aujourd'hui. Qwen3.8-Max devrait être open source la semaine prochaine, et Qwen3.8-27B sera également open source.
À partir d'aujourd'hui, les développeurs du monde entier peuvent accéder aux services API de Qwen3.8 via la plateforme Qianwen AI. En Chine, le prix est de 12 yuans par million de tokens en entrée et de 36 yuans en sortie, avec seulement 1,5 yuan en cas de hit de cache implicite, tandis que les prix internationaux en entrée et en sortie ne représentent que 40 % et 24 % de ceux d'Opus5, offrant une intelligence similaire à un meilleur rapport qualité-prix.

Cette annonce concerne Qwen3.8-Max, le modèle phare de la série Qianwen, le plus grand et le plus performant, qui prend en charge la compréhension visuelle avec une longueur de contexte allant jusqu'à 1 million de tokens. Sur le plan architectural, Qwen3.8 combine une optimisation conjointe de l'architecture MoE sparse et d'un mécanisme d'attention hybride, étendant pour la première fois le nombre total de paramètres du modèle Qianwen à 2,4 T, avec 95 B activés, ce qui améliore l'efficacité et la vitesse de raisonnement, tout en réalisant de nouvelles percées en termes de performances globales : dans les évaluations d'agents de programmation comme PaperBench, Qwen3.8-Max a considérablement progressé de 28,2 points par rapport à la génération précédente, atteignant un nouveau record de 93,0 points ; dans les évaluations d'agents généraux comme WideSearch et Agent's Last Exam, le nouveau modèle a obtenu respectivement 81,9 et 52,4 points, se positionnant à la pointe. Parallèlement, Qwen3.8 a obtenu 82,8 points dans l'évaluation de suivi d'instructions IF Bench et 92,6 points dans le raisonnement scientifique GPQA Diamond, se classant parmi les meilleurs dans une série de capacités générales ; dans l'évaluation de raisonnement visuel BabyVision, Qwen3.8-Max a obtenu 82,0 points sans outils, soit près de deux fois plus que certains modèles grand public, et dans l'évaluation OSWorld-Verified, qui mesure la capacité des agents à opérer sur ordinateur, Qwen3.8-Max se classe premier parmi les modèles grand public avec 86,1 points.
La capacité de programmation (Coding) est l'une des compétences clés des grands modèles de pointe, et Qwen3.8 réalise une nouvelle percée en programmation autonome. Dans le classement autoritaire CodeArena, Qwen3.8 se classe quatrième mondial. Il y a deux ans, les modèles de pointe pouvaient écrire des fonctions et compléter du code, devenant des assistants précieux pour les programmeurs. Aujourd'hui, Qwen3.8 peut partir d'un dossier vide et livrer de manière autonome un projet réel complet qui prendrait une dizaine de jours, sans aucune intervention humaine. Il suffit de dire « Crée un agent auto-évolutif Harness » pour que Qwen3.8, tel un ingénieur expérimenté, parte de zéro, construise de manière autonome un cadre d'ingénierie en boucle (Loop Engineering), orchestre des agents pour exécuter automatiquement les tâches, et les ingénieurs humains peuvent même soumettre de nouvelles exigences à Qwen3.8 via DingTalk. Après environ 16 jours de programmation autonome, Qwen3.8 a créé « oh-my-cli », un cadre d'agent auto-évolutif réellement fonctionnel de niveau Hermes Agent. Ce projet est désormais entièrement open source, et le processus complet est publiquement conservé dans un dépôt GitHub, accessible à tous.
Qwen3.8 peut assumer un large éventail de tâches professionnelles réelles (Cowork). Face à des tâches professionnelles, des critères d'évaluation et des besoins de calcul entièrement différents, Qwen3.8, grâce à une extension d'apprentissage par renforcement (RL) conjointe dans des environnements réels et avec des ressources de calcul, améliore les performances réelles de centaines de tâches professionnelles à haute valeur ajoutée et à haute fréquence, et peut livrer de manière fiable des résultats de niveau production dans les cadres d'agents grand public : une équipe d'assistants juridiques mettrait une semaine à annoter plus d'un millier de clauses pertinentes dans des centaines de documents juridiques, Qwen3.8 le fait en moins d'une heure ; une équipe d'analyse de données de basket-ball annoterait image par image plus de 160 heures de séquences de matchs, Qwen3.8 peut décomposer avec précision ces plus de 8 400 séquences offensives et défensives en quelques dizaines de minutes, et produire en une seule fois des profils tactiques de joueurs et des rapports d'entraîneurs ; une équipe de recherche financière, s'appuyant sur des années d'expertise professionnelle et collectant des changements complets et en temps réel sur les marchés de capitaux, pourrait réaliser une recherche de stratégie quantitative, Qwen3.8 mobilise de manière autonome des agents parallèles, travaille en continu pendant plusieurs heures et livre une stratégie complète de rotation ETF, tout en analysant en continu les backtests, en ajustant dynamiquement et en atteignant finalement une rentabilité à grande échelle.
Dans les tâches à long cycle, Qwen3.8 fait émerger des capacités de planification autonome au niveau système et d'apprentissage adaptatif en boucle fermée de bout en bout. Que ce soit dans la conception de puces numériques à haute précision et à fortes contraintes physiques, ou dans des opérations de simulation commerciale hautement dynamiques et concurrentielles, Qwen3.8 peut, grâce à une boucle fermée adaptative « exécution-retour d'information-itération », réaliser une reconstruction profonde des algorithmes et des stratégies sur des milliers de tours d'interactions à très longue portée.
Outre ses puissantes capacités textuelles et de raisonnement, Qwen3.8 repousse également les limites de la compréhension visuelle en IA. Dans le classement autoritaire Vision Arena, Qwen3.8-Max se classe deuxième mondial. Qwen3.8 peut non seulement lire un PDF de rapport financier de 200 pages et comprendre des vidéos longues de plus de 100 heures, mais aussi réinjecter ces connaissances et informations « vues » dans l'ensemble du flux de travail, aidant le modèle à réfléchir de manière plus complète. Dans la tâche à long terme « RecreationBench » construite par l'équipe Qianwen, le modèle, sans code source ni accès à Internet, ne comprend l'application que par des interactions et des retours d'information, mais peut recréer l'ensemble de l'application à partir de zéro. Cela montre que Qwen3.8 a déjà démontré des capacités d'agent multimodal hybride de niveau avancé, portant la programmation visuelle (Visual Coding) à de nouveaux sommets grâce à une boucle répétée de « programmation itérative - retour d'information interactif ».
Il est rapporté que le super-nœud Zhenwu M890 d'Alibaba a également été adapté avec succès à Qwen3.8, optimisant de bout en bout la puce, la plateforme cloud et le grand modèle Qianwen, améliorant considérablement l'efficacité d'inférence et réduisant les coûts, avec une amélioration de performance allant jusqu'à 1,5 fois dans les scénarios de raisonnement Agentic.










