fr.wedoany.com Rapport : Le modèle de conduite autonome de bout en bout multimodal iDriveVLA, développé indépendamment par l’équipe du professeur Li Keqiang (dirigée par le professeur Li Shengbo et le chercheur assistant Guan Yang) de la Faculté des véhicules de l’Université Tsinghua, a obtenu la première place mondiale au classement international de référence NAVSIM pour la conduite autonome. Ce modèle a atteint un score de 94,85 points à l’indicateur composite clé PDMS, marquant une avancée importante dans le domaine des modèles de base de bout en bout, après que l’équipe a développé le premier système de conduite autonome de bout en bout entièrement intégré en Chine.

iDriveVLA est un modèle multimodal de bout en bout en une seule étape, qui apporte deux innovations clés pour relever le défi de la difficulté à concilier l’exhaustivité des trajectoires et la précision de la sélection dans les modèles de conduite autonome. Premièrement, une architecture de réseau neuronal à attention croisée découplée hiérarchiquement a été construite, comprenant des composants atomiques universels tels qu’un encodeur d’images, un décodeur de trajectoires multimodales et un décodeur d’évaluation et de sélection. Chaque composant est optimisé par combinaison en fonction de la sémantique de conduite macro et des scores de performance micro, associé à un mécanisme de filtrage probabiliste par porte pour les trajectoires de faible performance, améliorant ainsi la capacité de compréhension cognitive du modèle en matière de sécurité et de conformité de conduite. Deuxièmement, la plateforme d’entraînement adopte la méthode d’entraînement en deux étapes proposée par l’équipe, à savoir un pré-entraînement supervisé suivi d’un ajustement fin par apprentissage par renforcement : d’abord, la capacité de conduite de base du modèle est établie par imitation des trajectoires de conduite d’experts, puis trois technologies clés d’apprentissage par renforcement sont utilisées — BPO à gradient harmonieux résistant aux conflits de données multi-sources, fonction de perte mixte pondérée exponentielle Hybrid-Loss, et algorithme d’ajustement fin STAPO avec suppression de tokens fictifs — pour réaliser une génération hautement complète et une évaluation très précise des trajectoires multimodales dans les scénarios de trafic urbain. Ce résultat reflète la capacité d’innovation continue de l’équipe dans le domaine des modèles de base de conduite autonome intégrés véhicule-route-cloud, fournissant un support technique pour le développement de systèmes de conduite autonome à haute sécurité, haute fiabilité et haute généralisation.
Cette recherche a bénéficié du soutien du projet clé du Fonds national des sciences naturelles de Chine, du projet conjoint régional du Fonds des sciences naturelles de Pékin, et de la société Dongfeng Motor Group.
Le défi NAVSIM, co-initié par NVIDIA, l’Université Stanford, l’Université de Tübingen, le laboratoire d’intelligence artificielle de Shanghai et d’autres institutions, a été officiellement annoncé lors de la conférence de premier plan en intelligence artificielle CVPR en 2024. Il constitue une référence publique importante dans le domaine de la conduite autonome de bout en bout. Selon des statistiques non exhaustives, il a attiré plus de 143 équipes et 463 modèles participants, rassemblant des entreprises nationales et internationales renommées telles que NVIDIA, Bosch, Valeo.ai, Horizon Robotics, Xiaomi Auto, Changan Automobile, Huawei Yinwang, Qianli Technology, ainsi que des universités prestigieuses comme UCLA, l’Université de Toronto, l’École polytechnique fédérale de Lausanne, l’Université de Hong Kong et l’Université Fudan. Le défi utilise le Predictive Driver Model Score (PDMS) comme indicateur technique clé, évaluant la capacité de conduite autonome des modèles soumis en calculant de manière composite des indicateurs multidimensionnels tels que le risque de collision, la progression du trajet, la conformité et le confort dans un horizon temporel fixe.










