fr.wedoany.com Rapport : Lors de la conférence WAIC 2026, PPIO, entreprise chinoise, a officiellement dévoilé son positionnement « Agentic Cloud » et un nouveau produit de passerelle de modèles intelligents, proposant de créer une « usine de jetons intelligents » adaptée à l’ère des agents. Alors que le marché mondial des agents d’IA devrait passer de 5,1 milliards de dollars en 2024 à 47,1 milliards de dollars en 2030, la demande de jetons pour les tâches des agents augmente de manière spectaculaire.

Yao Xin, cofondateur et PDG de PPIO, a souligné que les clients des jetons passent des humains aux agents, et que les fournisseurs de services cloud doivent proposer des « usines de jetons » à plus faible latence et à plus haut débit. Selon les données de China Insights Consultancy, bien que le coût d’inférence diminue de plus de 10 fois chaque année, le nombre de jetons consommés par une seule tâche d’agent est passé de quelques centaines à des dizaines de milliers, voire des centaines de milliers, ce qui fait que la pression globale sur les coûts augmente au lieu de diminuer. Par ailleurs, un seul modèle ne peut pas couvrir les besoins diversifiés des agents, et les exigences des agents en matière de latence et de stabilité sont bien plus élevées que celles des applications d’IA traditionnelles.
Le produit phare lancé par PPIO, la passerelle de modèles intelligents, adopte un mécanisme de « mélange de modèles » (Mixture of Models, MoM). Lors des étapes clés d’un agent, la passerelle distribue le problème à plusieurs modèles experts, génère une réponse par validation croisée, et évite ainsi les échecs de tâche dus à la spécialisation étroite d’un modèle. La passerelle dispose également de capacités d’ordonnancement intelligent et d’optimisation des coûts : elle achemine les tâches en fonction de leur type et contrôle les coûts grâce à des mécanismes tels que la compression du contexte redondant et les garde-fous budgétaires. Selon le test de référence approfondi DRACO, en fusionnant Mimo-V2.5-Pro, Kimi-K2.7 et GLM-5.2 pour une inférence hybride, PPIO peut améliorer les performances jusqu’à un niveau proche de celui de Claude Fable 5, avec une augmentation de 20 % de l’intelligence et une réduction des coûts de 50 % à 60 %. Le moteur d’accélération d’inférence développé en interne par PPIO est profondément optimisé pour les scénarios d’agents, offrant une amélioration des performances d’inférence pouvant atteindre 10 fois, et, associé à la technologie Prompt Cache, permet d’économiser jusqu’à 80 % du coût des jetons. PPIO a été sélectionné comme l’un des premiers « jalons de performance des services de jetons d’entreprise » par l’Académie chinoise des technologies de l’information et de la communication (China Academy of Information and Communications Technology), avec, dans les scénarios généraux, un TPS ≥ 55 requêtes/seconde, un TTFT ≤ 0,9 seconde et un taux de succès des appels ≥ 99,9 %.

En ce qui concerne l’environnement d’exécution des agents, PPIO a lancé un bac à sable pour agents, basé sur la technologie microVM, permettant un démarrage à froid en quelques millisecondes (<200 ms). Chaque tâche s’exécute dans un environnement de machine virtuelle indépendant, avec la possibilité de créer simultanément des dizaines de milliers de bacs à sable. Le mécanisme Auto Pause/Resume permet de réduire les coûts jusqu’à plus de 90 % par rapport aux produits similaires. Depuis son lancement lors de la WAIC de l’année dernière, ce bac à sable pour agents, le premier en Chine à être compatible avec l’interface E2B, a vu son volume d’activité multiplié par plus de 123. PPIO Agent Harness intègre des capacités telles que Browser Use, Computer Use, Code Interpreter et MCP Server, couvrant la chaîne complète des agents, de l’acquisition d’informations à l’exécution des opérations. La plateforme préinstalle plusieurs modèles d’agents prêts à l’emploi, tels que PPClaw et PPHermes, permettant aux développeurs de déployer en cloud en seulement 10 minutes, tout en prenant en charge l’hébergement continu 7j/7 et 24h/24 ainsi que la planification de tâches programmées.

En termes de données, en juin 2026, le volume quotidien moyen d’appels de jetons de PPIO a dépassé 1 200 milliards, se classant premier parmi les fournisseurs de services de cloud computing d’IA indépendants en Chine, avec une croissance de plus de 8 fois par rapport à la même période en 2025. Le chiffre d’affaires de l’entreprise est passé de 358,4 millions de yuans en 2023 à 770,3 millions de yuans en 2025, et le nombre de développeurs enregistrés dans le monde a dépassé 670 000. Le taux d’utilisation moyen des GPU de PPIO est resté supérieur à 75 % en 2025, bien au-dessus de la moyenne du secteur, qui se situe entre 40 % et 50 %. Yao Xin a expliqué que PPIO, grâce à la capacité de « lissage des pics et comblement des creux » de son réseau d’ordonnancement mondial, utilisant le décalage horaire entre l’Est et l’Ouest, parvient à porter le taux d’utilisation des GPU à 70 %-80 %. Actuellement, PPIO a déployé des clusters multiples distribués en Europe, en Amérique du Nord, en Amérique du Sud, en Asie du Sud-Est et dans d’autres régions, couvrant les six continents.

Yao Xin a indiqué que la limite supérieure de l’intelligence ne réside pas seulement à l’intérieur des modèles, mais que l’ingénierie des agents et la fusion de modèles en dehors des modèles peuvent également améliorer considérablement le niveau d’intelligence. PPIO s’engage à préparer en amont l’infrastructure sous-jacente pour l’essor de l’économie des agents, en rendant les jetons moins chers et le fonctionnement des agents plus stable.

Basée sur la couche Harness, la plateforme préinstalle des modèles d’agents prêts à l’emploi, tels que PPClaw et PPHermes. Les développeurs peuvent les déployer en cloud en une seule opération via la console, et les mettre en service en seulement 10 minutes. Après le déploiement, la plateforme prend en charge l’hébergement continu 7j/7 et 24h/24 ainsi que la planification de tâches programmées. Lorsqu’ils ne sont pas utilisés, la facturation peut être suspendue en une seule touche, et le système se réveille en quelques secondes lors de la reprise. La plateforme propose également des interfaces natives d’IA orientées agents, compatibles avec le protocole standard MCP, permettant aux agents d’appeler, via le langage naturel, des infrastructures telles que la puissance de calcul GPU et l’environnement de bac à sable. La plateforme est compatible avec les principaux frameworks d’agents, tels que LangChain, CrewAI et AutoGen.

Le réseau de calcul distribué et les nœuds de calcul à haute densité de PPIO fournissent le support sous-jacent à l’usine de jetons intelligents. Grâce aux différences de fuseaux horaires entre les régions et à la demande croisée de groupes de clients diversifiés, il alloue dynamiquement la puissance de calcul inutilisée dans le monde aux points de demande élevée, garantissant une utilisation efficace des ressources GPU. Cette capacité d’ordonnancement réduit directement le coût réel par jeton et constitue la garantie sous-jacente du modèle « magasin en façade, usine en arrière-plan » de PPIO.










