Tensormesh, une entreprise américaine d'infrastructure IA, s'associe à AMD pour étendre la mémoire GPU, réduisant la latence du premier token à 0,5 seconde
2026-07-24 15:26
Favoris

fr.wedoany.com Rapport : L'entreprise américaine d'infrastructure IA Tensormesh et AMD (Advanced Micro Devices) ont annoncé un partenariat visant à considérer la mémoire externe des accélérateurs comme une extension de la capacité GPU, afin d'aider les entreprises à servir davantage de modèles d'intelligence artificielle avec moins de GPU.

Annoncée le 23 juillet 2026, cette collaboration combine la solution de cache KV de Tensormesh, la gestion LMCache, la technologie GPU d'AMD et le composant de virtualisation AMD Live Context. La nouvelle architecture ne limite plus les données d'inférence actives à la mémoire à haute bande passante (HBM), mais permet au cache KV de déborder vers une structure hiérarchique couvrant la DRAM, le SSD et le stockage distant.

La capacité mémoire est devenue le goulot d'étranglement pratique de l'inférence des grands modèles de langage. Ajouter des GPU offre certes plus de HBM, mais augmente également les coûts d'accélération, la consommation d'énergie et les besoins en infrastructure. Créer des processeurs avec des pools mémoire plus grands côté matériel peut résoudre ce même goulot, mais aggrave la demande pour des composants mémoire déjà limités. Tensormesh et AMD proposent une alternative : et si les entreprises pouvaient mieux utiliser la mémoire déjà présente dans chaque nœud ?

Les données du cache KV deviennent la cible. Lors de l'inférence, les modèles Transformer stockent les données d'attention intermédiaires, évitant ainsi de recalculer l'intégralité du contexte de la conversation ou du document pour chaque token généré. Lorsque les invites sont longues, la concurrence élevée ou que plusieurs modèles partagent un cluster d'inférence, le cache devient volumineux. L'article de recherche vLLM, via PagedAttention, a poussé l'industrie à se concentrer sur une allocation plus efficace du cache KV, révélant l'impact de la gestion mémoire sur le débit d'inférence.

LMCache étend ce concept à plusieurs niveaux de mémoire. Selon Tensormesh, les blocs de cache déplacés hors de la HBM pour une virtualisation à court terme peuvent ensuite être réutilisés pour une correspondance de cache KV préfixe ou non préfixe. Déplacer les données vers un stockage plus lent augmente la capacité, mais éviter les recalculs est la clé pour que cette architecture puisse récupérer des performances.

Les tests ont utilisé un serveur Dell équipé de 8 accélérateurs AMD/ATI (MI355) GPU et du stockage Dell. Sur un ensemble de documents de 300 Go exécutant Kimi-K2.6, Tensormesh et AMD rapportent une latence du premier token réduite de 3,4 secondes à moins de 0,5 seconde, soit une amélioration de près de 7 fois. Ce résultat provient de la récupération des données KV mises en cache depuis la DRAM et le NFS, plutôt que d'un recalcul. À mesure que la charge de travail augmente, le débit de sortie reste d'environ 48 tokens par seconde ; en comparaison, le débit d'inférence non optimisé chute de près de 40 % sous la même charge. Selon les résultats rapportés, la densité de modèles sur le même matériel a également doublé.

Ces résultats sont publiés par les fournisseurs, et non par des tests de référence indépendants étendus. Les équipes d'entreprise doivent les reproduire avec leurs propres modèles, longueurs d'invite et profils de concurrence. MLCommons fournit le contexte nécessaire pour des tests d'inférence standardisés : les performances varient considérablement selon les modèles, les objectifs de latence, les configurations de serveur et les approches de charge de travail.

Doubler la densité de modèles signifie non seulement accueillir plus de modèles dans un seul rack, mais aussi potentiellement affecter l'économie des assistants internes, de la génération augmentée par récupération et des systèmes d'analyse documentaire en répartissant les coûts d'accélération sur davantage de charges de travail. Cet avantage potentiel est particulièrement important pour les entreprises traitant de grandes collections de documents, où les contextes répétés créent des opportunités de réutilisation du cache.

Cette approche comporte des compromis. La DRAM est plus lente que la HBM, tandis que le SSD et le stockage distant introduisent une latence supplémentaire et des risques de contention réseau. Une hiérarchisation efficace dépend de l'identification des données de cache à conserver près du GPU et de celles pouvant être déplacées sans affecter les objectifs de niveau de service ; le taux de succès du cache, la bande passante de stockage et le comportement d'orchestration peuvent être aussi importants que la capacité nominale.

Il est peu probable que la pression plus large s'atténue rapidement. Le Stanford Institute for Human-Centered AI (Stanford HAI) documente la demande croissante en calcul associée aux systèmes d'IA avancés, renforçant l'importance d'améliorer l'utilisation tout en déployant du matériel supplémentaire.

Avant ce partenariat, AMD Ventures avait participé au tour de financement de 20 millions de dollars de Tensormesh en mai 2026. Tensormesh et AMD présentent les résultats de performance cette semaine à l'AMD Advancing AI 2026, et le code open source de LMCache devrait être publié publiquement dans un mois. Cette publication pourrait élargir le champ des expériences de gestion de cache KV multicouche et donner aux équipes d'infrastructure une vision plus claire des performances de cette approche en dehors de l'environnement de test initial de Dell.

Ce texte est rédigé, traduit et republié à partir des informations de l'Internet mondial et de partenaires stratégiques, uniquement pour la communication entre lecteurs. En cas d'infraction au droit d'auteur ou d'autres problèmes, veuillez nous en informer à temps pour la modification ou la suppression. La reproduction de cet article est strictement interdite sans autorisation formelle. Mail : news@wedoany.com