Le chinois XPENG a publié la VLA 6.3.0 la semaine dernière, et sa division robotique a levé 900 millions de dollars

2026-08-31 11:32
Favoris

fr.wedoany.com Rapport : XPENG a, au cours de la semaine écoulée, successivement publié ses résultats du deuxième trimestre, le système de conduite intelligente VLA 2.0 version 6.3.0, ainsi que l'avancement de la levée de fonds pour son robot humanoïde IRON, ces trois actions étant toutes centrées sur l'IA physique. Les résultats correspondants ne sont pas encore entièrement comptabilisés dans les finances de la période, mais ils ouvrent une nouvelle phase de développement pour cette entreprise technologique en pleine expansion.

Selon le rapport financier, le chiffre d'affaires de XPENG au deuxième trimestre a atteint 2,91 milliards de dollars, en hausse de 8,0 % sur un an et de 51,5 % par rapport au trimestre précédent ; la marge brute globale s'établit à 20,7 %, contre 17,3 % en 2025 ; à titre de comparaison, la marge brute de Tesla est de 16,8 %. Cependant, la marge du secteur automobile a baissé à 12,1 %, contre 14 % en 2025, en partie en raison des coûts liés au lancement de nouveaux modèles. L'amélioration de la marge brute provient principalement des services, dont une grande partie des revenus est issue des services de recherche et développement technologique fournis au groupe Volkswagen. Cette structure de revenus rapproche XPENG, au niveau des bénéfices, d'une entreprise technologique plutôt que d'un simple constructeur automobile.

Les investissements technologiques affectent également les bénéfices de la période ; XPENG a enregistré une perte nette totale de 200 millions de dollars, principalement due à une augmentation de 35 % des dépenses de recherche et développement sur un an, ainsi qu'à la hausse des frais administratifs et de vente liés à l'expansion mondiale et au lancement de nouveaux modèles. L'événement de lancement de la L03 à Munich en juillet en est un exemple, de telles activités nécessitant des investissements considérables. Alors que plusieurs modèles montent en cadence de production et entrent en phase de livraison, ces investissements en R&D et en marketing se refléteront progressivement dans les opérations ultérieures.

Jeudi dernier, XPENG a publié la version VLA 2.0 6.3.0, la première mise à jour majeure du système depuis la sortie de VLA 2.0, qui sera déployée par OTA dans les semaines à venir. La mise à niveau d'un système de conduite intelligente doit concilier sécurité, fiabilité et rapidité de réaction, tout en fonctionnant sous des contraintes de latence, de puissance de calcul et de consommation énergétique ; si le nouveau logiciel ne peut pas fonctionner de manière fluide sur le matériel existant, la mise à niveau n'a pas de valeur pratique.

Capture d'écran de la publication de la version VLA 2.0 6.3.0 de XPENG.

Le modèle VLA 2.0 mis à jour introduit une dimension temporelle en plus de la perception spatiale, combinant les événements historiques de manière 4D pour prédire les évolutions futures. Cette capacité est soutenue par Infini-VLA, qui peut accéder à une chronologie historique infiniment longue lors de la prise de décision ; XPENG a constaté dans des scénarios de conduite réels que la mémoire historique ne dépasse généralement pas 30 secondes, et a donc fixé cette fenêtre de mémoire à 30 secondes.

Capture d'écran de la publication de la version VLA 2.0 6.3.0 de XPENG.

Le véhicule ne peut pas s'arrêter en cours de route pour traiter des informations ou planifier des actions ; la nouvelle mise à niveau adopte donc l'inférence en flux continu (Streaming Inference), permettant à la perception, à la réflexion et à la génération de jetons de trajectoire de s'effectuer simultanément et en continu. XPENG affirme que cette approche améliore la latence et la vitesse de réponse de 300 %.

La technologie X-Foresight (prédiction prospective), dévoilée par XPENG en juin, est désormais accessible au public. Ce système déduit la situation du trafic sur les 6 prochaines secondes à partir de données historiques, réalisant un raisonnement proactif ; sa capacité sous-jacente peut prendre en charge des prédictions allant jusqu'à 21 secondes, mais est limitée par défaut à 6 secondes pour économiser la puissance de calcul. Le mécanisme de correspondance de flux (Flow-Matching) mappe les données sur plusieurs trajectoires futures et sélectionne le résultat optimal par décision probabiliste. En combinant ces technologies, XPENG affirme que la sécurité est améliorée de 20 fois et que ce système de conduite intelligente de type humain possède des capacités « surpassant l'humain ».

XPENG utilise le même ensemble de matériel pour exploiter son service de Robotaxi de niveau L4, ayant déjà réalisé plus de 2 000 commandes pour des clients internes sur la voie publique. La réglementation chinoise sur la conduite intelligente est plus stricte que celle des États-Unis, mais une commercialisation plus large est attendue prochainement.

Capture d'écran de la publication de la version VLA 2.0 6.3.0 de XPENG.

Les capacités les plus complètes de VLA 2.0 sont réservées aux modèles équipés de plusieurs puces Turing développées en interne, mais les modèles à puce unique bénéficieront également des capacités VLA correspondantes. Passer de deux puces à une seule n'est pas simplement une réduction de moitié des capacités : XPENG simplifie les besoins de traitement grâce à HybridViT, préservant autant que possible les capacités sous-jacentes et minimisant les compromis de performance. Ces modifications impliquent des ajustements architecturaux de base, plutôt qu'une simple réduction des fonctionnalités.

Capture d'écran de la publication de la version VLA 2.0 6.3.0 de XPENG.

Master Agent utilise un modèle omni-modal (Omni multimodal model), transformant les interactions vocales en conversations de type humain ; XPENG affirme qu'il s'agit essentiellement de « transformer l'interaction vocale en un robot ». Le système traite la voix localement à l'aide de la puce Turing dédiée et comprend l'intention de l'utilisateur en fonction de l'environnement ; l'utilisateur n'a pas besoin d'utiliser de commandes prédéfinies, la conversation suffit pour identifier la destination et l'itinéraire. Le plan peut également être modifié à tout moment en cours de route ; si l'utilisateur souhaite se garer sur le côté, le système trouve lui-même un emplacement sûr, sans aucune manipulation de l'écran tactile. Dans la vidéo de démonstration, l'utilisateur, uniquement par la voix, a navigué vers un restaurant au nom difficile à prononcer en fonction du type de cuisine, et s'est arrêté devant un bâtiment noir dans le quartier. Presque toutes les fonctions du véhicule peuvent être contrôlées par la voix. Cette interaction se rapproche du système KITT de la série télévisée « K 2000 », différant considérablement des assistants vocaux courants ; l'effet réel reste à confirmer par l'expérience. XPENG considère le contrôle vocal comme une condition nécessaire pour le Robotaxi, estimant que les scénarios sans conducteur nécessitent ce niveau d'interaction pour garantir la sécurité des opérations ; la capacité de généralisation du modèle contribue également à une adaptation rapide lors de l'entrée sur de nouveaux marchés.

La répartition des tâches entre les multiples puces Turing est également devenue plus claire avec cette publication : la première puce est dédiée à la conduite intelligente, la deuxième étend les capacités, la troisième est spécialisée dans le contrôle vocal et les communications, et les modèles Robotaxi sont également équipés d'une quatrième puce comme redondance pour les scénarios sans conducteur. Chaque puce offre une puissance de calcul de 750 TOPS, dépassant la capacité de calcul totale du HW4 de Tesla.

L'expansion de la flotte a généré davantage de données d'entraînement, avec actuellement 110 millions de clips vidéo cumulés. La plateforme de simulation X-World (monde de simulation) génère quotidiennement un nombre de modèles de simulation en hausse de 290 % par rapport à juin. Grâce aux données réelles et simulées, la capacité du modèle à traiter les scénarios limites tels que les zones de chantier et les traversées en ferry a été renforcée.

En ce qui concerne le déploiement des versions, les modèles Ultra et Ultra SE recevront la nouvelle mise à jour VLA 2.0 en septembre ; la version Max, équipée d'une seule puce Turing, recevra la mise à jour VLA Lite le mois prochain ; les anciens modèles équipés de deux puces Orin de NVIDIA recevront une mise à niveau plus tard cette année. Aucune information n'a été communiquée pour les modèles équipés d'une seule puce Orin.

XPENG n'a pas adopté un modèle d'abonnement, mais propose les nouvelles capacités aux clients existants via OTA, déclarant « ne pas vouloir simplement réduire les paramètres du modèle, mais offrir à chacun une expérience plus cohérente ». Les fonctionnalités réellement fournies dépassent les engagements initiaux. En comparaison, certaines entreprises facturent des frais supplémentaires pour débloquer des fonctionnalités matérielles existantes, tandis que d'autres présentent un écart entre les promesses et les livraisons.

Les retours de plusieurs essais de conduite autour de VLA 2.0 montrent des performances de conduite de type humain impressionnantes et une vitesse d'apprentissage rapide du système. Si la version 6.3.0 tient ses promesses, l'avance de XPENG en matière de conduite intelligente se creusera davantage. Cette mise à niveau ne générera pas immédiatement de revenus ; mais la reconnaissance des nouvelles fonctionnalités par les utilisateurs après une expérience réelle devrait stimuler les ventes de véhicules, en particulier des modèles haut de gamme dotés des fonctionnalités les plus avancées, tout en créant des conditions favorables à l'exportation de technologies vers d'autres constructeurs.

XPENG offre à ses clients des capacités dépassant le niveau initialement prévu du matériel. Au-delà de la conduite intelligente, XPENG a également de nouvelles avancées dans le domaine de la robotique.

La division robotique de XPENG, Dogotix, a finalisé une levée de fonds de 900 millions de dollars, pour une valorisation de 6,3 milliards de dollars, ce que XPENG qualifie de « plus important tour de financement privé de l'histoire de l'industrie chinoise de l'IA incarnée ». Selon le plan, IRON sera déployé dans les magasins de XPENG en 2026 pour fournir un support commercial, et les livraisons aux clients externes des secteurs de la vente au détail et des services commenceront en 2027 ; la capacité de production de plusieurs milliers d'unités par mois sera étendue en fonction de la demande.

IRON est un robot à fort degré d'humanisation dans sa forme et son design, avec un accent de recherche mis sur l'interaction homme-machine ; cependant, les robots humanoïdes ne sont pas la forme idéale pour tous les scénarios industriels. Alibaba et Tencent sont déjà entrés en tant qu'investisseurs stratégiques, leurs systèmes de paiement Alipay et WeChat Pay couvrant une grande partie des transactions quotidiennes en Chine.

Après la levée de fonds indépendante, Dogotix reste sous le contrôle de XPENG, mais n'est plus une filiale à 100 %, ce qui implique des obligations de reporting supplémentaires et une transparence accrue sur les performances de l'activité robotique. XPENG indique que le revenu sur le cycle de vie de chaque robot, en termes de ventes et de mises à niveau, pourrait être supérieur à celui d'une voiture. Alors que les revenus des ventes commenceront à croître l'année prochaine, sa marge et sa rentabilité mériteront une attention particulière.

XPENG réutilise les mêmes infrastructures et systèmes logiciels entre ses différentes gammes de produits afin de répartir les coûts de R&D. L'entreprise compare ce système partagé à un iceberg : les 95 % invisibles sous la surface sont la partie partagée, tandis que les applications visibles au-dessus sont différentes.

Capture d'écran de la publication de la version VLA 2.0 6.3.0 de XPENG.

L'investissement de XPENG dans l'IA physique ne se limite pas aux annonces ci-dessus. La stratégie de l'entreprise consiste d'abord à résoudre les problèmes les plus difficiles, puis à traiter les problèmes relativement plus faciles, estimant qu'après avoir construit complètement le système de R&D en IA physique, plus les défis initiaux sont difficiles, plus les problèmes ultérieurs sont faciles à résoudre. Ne pas privilégier les « fruits à portée de main » rend difficile la production d'effets immédiats attendus par certains investisseurs à court terme ; dans un environnement concurrentiel chinois au rythme rapide, cet arbitrage n'est pas aisé.

XPENG répond aux « inconnues inconnues » par une itération rapide, c'est-à-dire les scénarios limites qui ne peuvent pas être raisonnablement anticipés lors de la phase de planification. L'entreprise affirme que seule la construction complète du système d'IA permet de résoudre continuellement ces problèmes lors des itérations rapides. Elle appelle ce cycle la « boucle vertueuse de l'IA » : de meilleures voitures génèrent plus de données, les données améliorent les logiciels, les logiciels stimulent les ventes de voitures, davantage de voitures couvrent davantage de scénarios limites, ce qui renforce le modèle et s'étend à d'autres gammes de produits.

Face aux exigences réglementaires prévisibles en matière de conduite intelligente, le système doit effectuer l'inférence localement, ce qui impose des exigences plus élevées en matière d'utilisation de la puissance de calcul des puces et d'efficacité des modèles. Certains concurrents compensent leurs lacunes en matière de puissance de calcul en ajoutant des capteurs, ou dépendent de centres de données centralisés, ces derniers étant soumis à des pressions en matière de confidentialité et de conformité. La voie consistant à exécuter efficacement des modèles d'IA localement permet à la puce Turing et aux applications d'IA de s'étendre à davantage de scénarios au-delà de l'IA physique.

Capture d'écran de la publication de la version VLA 2.0 6.3.0 de XPENG.

Lors du même événement, XPENG a également dévoilé XLLM (architecture de grand modèle de langage), qui permet à un grand modèle de langage (LLM) de fonctionner sur une seule puce Turing. XPENG affirme que son efficacité d'inférence est proche de celle de ChatGPT ; le système optimise « les grands modèles de langage actuellement courants » pour fonctionner localement avec un taux de génération de plus de 20 jetons par seconde. Bien que ce taux ne soit pas le plus élevé du secteur, l'avantage réside dans le fait que tout le traitement est concentré sur une seule puce, sans dépendre de centres de données à forte consommation énergétique. XLLM pourrait permettre aux capacités des grands modèles de langage de s'adapter à divers cas d'utilisation potentiels sous forme d'applications locales ; cette voie d'optimisation s'applique également aux centres de données d'IA, avec un potentiel de réduction significative de la consommation énergétique. La résolution prioritaire du problème de l'exécution locale de l'IA physique pour l'automobile ouvre de nouveaux espaces d'application pour cette technologie.

La stratégie consistant à s'attaquer d'abord aux points difficiles crée également de nouvelles sources de revenus, la part des revenus des services technologiques augmentant continuellement. Porsche collabore avec XPENG en Europe dans le cadre d'un pool d'émissions, considéré comme une nouvelle source de revenus potentielle. Avec l'approfondissement de la coopération technologique avec le groupe Volkswagen, le déploiement de VLA 2.0 sur les véhicules du groupe devrait s'étendre.

Les capacités de conduite intelligente et les ventes de véhicules électriques sont interdépendantes : les performances de conduite intelligente stimulent les ventes de véhicules, dont l'ampleur alimente en retour le développement de la plateforme de véhicules électriques, favorisant ainsi le processus d'électrification.

XPENG progresse vers son objectif de devenir le premier à satisfaire à la réglementation unifiée DCAS des Nations Unies et à réaliser une conduite intelligente mondiale. La diffusion de l'expérience de conduite intelligente devrait stimuler la considération des modèles XPENG par les clients, et d'autres constructeurs automobiles pourraient également acheter ces capacités, créant ainsi une double source de revenus : ventes de véhicules et services technologiques ; les capacités d'IA continuent d'évoluer grâce à davantage de données et peuvent être transférées à d'autres domaines. La période d'investissement actuelle de XPENG se trouve au point de bascule où la R&D à long terme se transforme en revenus provenant de multiples produits ; les ventes de véhicules, les services technologiques et l'activité robotique pourraient constituer ensemble les sources de revenus futures, avec une partie des bénéfices réinvestie dans le développement de nouvelles technologies.

Ce texte est rédigé, traduit et republié à partir des informations de l'Internet mondial et de partenaires stratégiques, uniquement pour la communication entre lecteurs. En cas d'infraction au droit d'auteur ou d'autres problèmes, veuillez nous en informer à temps pour la modification ou la suppression. La reproduction de cet article est strictement interdite sans autorisation formelle. Mail : news@wedoany.com

Produits Associés

Projet d’installation mécanique et électrique pour l’industrialisation de matériaux semiconducteurs composés haut de gamme et de puces - Wuhan Huakang Century Clean Technology Co., Ltd.
Tablette PC industrielle robuste 10 pouces Win10 Win11 Pro Intel N100 16+512 Go IP67 4G avec code-barres NFC RJ45 et station d'accueil - Highton Electronics Co., Ltd.
Lidar à aérosols portable LGJ-01 - Anhui Landun Photoelectron Co., Ltd.
Véhicule sans conducteur à caisse X3 Xinshiqi - Neolix Beijing Technology Co., Ltd.
Calibrateur de pression automatique intelligent ConST811A - Beijing ConST Instruments Technology Inc.
Fibre optique monomode à dispersion non décalée à bande passante étendue G.652.D - HONGAN GROUP CO. LTD
Réflectomètre optique dans le domaine temporel (OTDR) 6422 - Ceyear Technologies Co., Ltd.
Conduite automatique totale (FAO) - UniTTEC Co., Ltd.
Stockage intelligent - Jiangsu Zhongtian Technology Co., Ltd.
Radar multifonction de surveillance océanique et de détection basse altitude, mesure de l'environnement dynamique océanique à la frontière air-mer (Agent/Lancement exclusif) — Fiche technique disponible - Chengdu Dixin Technology Co., Ltd.
Produit de système de multiplexage par division de longueur d’onde (WDM) - SHENZHEN SDG INFORMATION CO., LTD.
Profilés d’armoire en T - Xinli Tongchuang Electronic Equipment Co., Ltd.