Le robot chinois UniX AI, en collaboration avec plusieurs universités, publie UniTac, permettant l’anticipation tactile
2026-07-20 11:47
Favoris

fr.wedoany.com Rapport : Le robot chinois UniX AI, en collaboration avec l’Université du Zhejiang, le MIT, l’Université d’Oxford, l’Université Yale et l’Université Jiao Tong de Shanghai, a dévoilé un nouveau résultat de recherche, UniTac, proposant une architecture de compréhension et de génération tactile inter-capteurs, intégrée à un modèle vision-langage-action, permettant au robot de prédire l’état tactile avant de toucher un objet. Ce travail a été accepté par ECCV 2026.

Au cours de l’année écoulée, les modèles de base incarnés ont connu un développement rapide, permettant aux robots d’effectuer des tâches de manipulation d’objets aux contours clairs. Cependant, face à des objets souples, fragiles ou dans des scénarios de contact dense, les robots, s’appuyant uniquement sur la vision, peinent à accomplir ces tâches. Par exemple, saisir un raisin sans l’écraser ou attraper un gobelet en papier sans le déformer nécessite une perception tactile semblable à celle des humains. Avec l’avancée des recherches, des équipes comme UniTouch et AnyTouch ont tenté d’unifier les représentations de différents capteurs tactiles, FuSe et Tactile-VLA ont intégré les informations tactiles dans des modèles de stratégie générale et VLA, tandis que TacImag explore la possibilité pour un robot d’« imaginer » le toucher uniquement à partir de la vision et de la proprioception. Cependant, ces méthodes restent confrontées à des défis tels que l’hétérogénéité des données des capteurs et la dispersion de la compréhension et de la génération tactile entre différents modèles.

UniTac apprend une représentation tactile unifiée à partir de données multi-capteurs à grande échelle, permettant au robot de prédire l’état tactile après contact d’un objet à partir d’informations visuelles, réalisant ainsi une « sensation avant le contact ». Prenant l’exemple de la saisie d’un gobelet en papier, le modèle VLA intégrant UniTac peut prédire la déformation du gobelet sous l’effet de la force, déterminant ainsi le point de contact et la force ; sans UniTac, le VLA écrase directement le gobelet. Les informations tactiles passent ainsi d’un retour après contact à une connaissance préalable avant contact.

L’interaction entre un robot et le monde physique nécessite trois niveaux d’ancrage : le modèle vision-langage associe des concepts abstraits à des objets réels, le modèle vision-langage-action relie la sémantique aux trajectoires d’action, tandis que le troisième niveau exige que le robot comprenne et prédise les conséquences physiques du processus de contact. Un modèle VLA entièrement basé sur la vision a tendance à appliquer la même stratégie à des objets d’apparence similaire, et lorsque le contact se produit, les corrections arrivent trop tard, les objets fragiles étant déjà déformés. UniTac déplace la prédiction de l’état tactile avant le premier contact, fournissant au VLA des informations préalables sur le processus de contact, rendant le premier contact plus sûr.

Le défi central traité par UniTac est l’unification inter-capteurs des données tactiles. Les capteurs tactiles visuels (tels que GelSight, DIGIT, Duragel) enregistrent la déformation du gel sous pression via une caméra, les images mélangeant des informations sur les propriétés de l’objet et la configuration du capteur. Le modèle doit distinguer les changements provenant de l’objet (dureté, rugosité, texture) de ceux provenant du capteur (éclairage, état du gel, disposition des marqueurs). Pour résoudre l’hétérogénéité des capteurs, UniTac décompose le toucher en deux parties : les propriétés physiques et la configuration du capteur. Le côté compréhension apprend simultanément la description des propriétés de l’objet et l’identification du capteur, forçant le modèle à distinguer la source du signal ; le côté génération intègre le jeton du capteur dans le processus de génération, évitant une génération tactile inconditionnelle. Les expériences finales montrent qu’UniTac obtient des résultats de pointe tant en compréhension qu’en génération : sur PHYSICLEAR-Test, UniTac-7B obtient un score de 66,51, surpassant les modèles de compréhension tactile comme Octopi et les modèles unifiés comme BLIP3o ; dans la tâche d’appariement propriété-objet, il obtient 64,61. Face à quatre types de capteurs (Digit, GelSight, GelSight Mini et Duragel), le SSIM moyen d’UniTac atteint 0,836 et le PSNR moyen 19,93.

UniTac a été développé sous la direction d’UniX AI. Cette entreprise a été fondée en avril 2024 à Suzhou par Yang Fengyu, docteur de l’Université Yale, et est une entreprise d’intelligence incarnée full-stack. Yang Fengyu est le premier co-auteur de l’article UniTac. Le co-premier auteur, Jiahang Tu, de l’Université du Zhejiang, travaille sur la vision par ordinateur et les modèles génératifs ; l’auteur correspondant, Hanbin Zhao, professeur assistant à l’Université du Zhejiang, mène des recherches de longue date sur l’apprentissage automatique et les modèles génératifs ; Zhi Tao d’UniX AI est responsable des algorithmes réels et de la mise en œuvre des systèmes. Les autres collaborateurs incluent Chenyang Ma de l’Université d’Oxford, Xihang Yu du MIT, Ziyao Zeng et Alex Wong de l’Université Yale, et Shaokai Wu de l’Université Jiao Tong de Shanghai. Les travaux précédents, tels que la collecte de données Touch and Go, l’unification des représentations multi-capteurs d’UniTouch, et l’alignement 3D vision-toucher de TaRF, ont tous progressé autour de la voie tactile. UniTac intègre la compréhension, la génération et le transfert inter-capteurs du toucher dans une architecture unifiée, et fournit des connaissances tactiles préalables au modèle VLA, promettant d’améliorer la souplesse et la sécurité des opérations robotiques dans des scénarios tels que les soins à domicile, l’assemblage de précision et les services.

Ce texte est rédigé, traduit et republié à partir des informations de l'Internet mondial et de partenaires stratégiques, uniquement pour la communication entre lecteurs. En cas d'infraction au droit d'auteur ou d'autres problèmes, veuillez nous en informer à temps pour la modification ou la suppression. La reproduction de cet article est strictement interdite sans autorisation formelle. Mail : news@wedoany.com