iFlytek dévoile Spark Token Factory
2026-07-23 16:33
Favoris

fr.wedoany.com Rapport : Le 19 juillet, iFlytek a officiellement lancé Spark Token Factory, une solution visant à aider les entreprises à améliorer l'efficacité et la gestion de l'utilisation des grands modèles de langage, et à construire une infrastructure de base pour les grands modèles de langage tournée vers l'avenir.

Le déploiement à grande échelle de l'IA en entreprise se heurte à une série de défis opérationnels et de gestion. La diversité des modèles ne cesse de croître, les coûts d'appel augmentent, les exigences de stabilité du système s'accroissent, tandis que les capacités de gestion multi-modèles, de contrôle des coûts, de gouvernance de la sécurité et de supervision opérationnelle restent sous-développées. Les entreprises doivent souvent intégrer plusieurs services de modèles simultanément pour prendre en charge différents scénarios métiers tels que les assistants de code, le service client intelligent, les questions-réponses, la génération de contenu et le traitement de documents. La complexité des tâches varie considérablement, mais dans la pratique, un modèle unique est souvent utilisé, ce qui entraîne une faible efficacité d'utilisation des ressources et une augmentation continue des coûts des tokens. L'exécution parallèle de plusieurs modèles impose également des exigences plus élevées en matière de stabilité du système, de gouvernance de la sécurité et de gestion opérationnelle. La construction de l'IA en entreprise passe progressivement de la « construction de capacités de modèles » à la « construction d'infrastructures d'IA », l'accent n'étant plus uniquement mis sur les capacités des modèles eux-mêmes, mais sur la manière d'intégrer réellement ces capacités dans les processus métiers pour assurer un fonctionnement stable, une gouvernance unifiée et une optimisation continue.

Spark Token Factory se positionne comme une plateforme de routage intelligent de modèles d'IA de niveau entreprise, offrant des capacités essentielles telles que l'intégration unifiée des modèles, le routage intelligent, l'optimisation des coûts des tokens et la gouvernance de la conformité et de la sécurité, formant ainsi une boucle complète couvrant « intégration - gouvernance - observation - exploitation ». Elle fournit aux entreprises un point d'entrée unifié pour les services de grands modèles, permettant une gestion, un contrôle et une traçabilité des ressources des grands modèles.

La fonction de routage intelligent évalue la complexité des tâches en fonction de multiples dimensions, notamment la longueur des prompts, les règles prédéfinies, les règles personnalisées, le nombre de tours de dialogue et l'affinité de session, et effectue une gestion hiérarchique intelligente des requêtes de L1 à L3. La plateforme prend en compte cinq facteurs (qualité, coût, latence, disponibilité et niveau de sécurité) pour sélectionner les ressources de modèle appropriées, en affectant les tâches simples à des modèles plus rentables et les tâches complexes à des modèles plus performants. La latence moyenne de décision peut être contrôlée en dessous de 100 millisecondes. Grâce à cette capacité de routage intelligent, la plateforme peut réduire efficacement la pression d'appel sur les grands modèles, libérant ainsi davantage de marges d'optimisation des coûts pour les entreprises.

Dans les scénarios de déploiement privé localisé, Spark Token Factory optimise de bout en bout les principaux modèles open source en fonction des caractéristiques matérielles d'Ascend. Côté mémoire vidéo, diverses techniques de compression de modèles et d'optimisation de la précision sont utilisées pour réduire l'occupation de la mémoire vidéo tout en maintenant une précision contrôlable. Côté calcul et communication, les opérateurs de calcul de base sont fusionnés et la communication multi-cartes est réorganisée pour permettre le chevauchement du calcul et de la communication. Côté cache et ordonnancement, une gestion distribuée du cache KV entre nœuds et un ordonnancement de stockage multi-niveaux sont mis en œuvre, avec l'introduction d'un routage de cache contextuel et de stratégies de réutilisation et de recomposition du contexte. Côté décodage, un mécanisme d'accélération du décodage parallèle adapté au matériel Ascend est introduit. Les données de test montrent que, dans des conditions matérielles identiques, l'efficacité d'inférence est améliorée d'environ 5 fois par rapport au framework open source vLLM-Ascend, et la latence du premier token est réduite de 30 % à 40 %.

En matière de sécurité, Spark Token Factory adopte une architecture de séparation des pouvoirs en trois parties : la gestion n'accède pas aux données, les opérations n'accèdent pas aux autorisations, et l'audit n'interfère pas avec les activités métiers. Ces trois parties sont indépendantes et se contrôlent mutuellement. La plateforme génère automatiquement des enregistrements d'audit de bout en bout infalsifiables pour toutes les opérations critiques, couvrant six catégories d'opérations (accès aux données, modification des autorisations, appel de modèles, exportation de données, etc.), répondant ainsi aux exigences de protection de la sécurité. La protection des informations sensibles couvre la vie privée et les données commerciales, avec un routage hiérarchique garantissant que les données sensibles ne sortent pas du domaine.

Spark Token Factory offre une capacité d'audit de bout en bout des journaux, enregistrant l'intégralité du processus, de l'entrée de la requête dans la plateforme jusqu'au retour final du résultat. Grâce au suivi des journaux, à l'enregistrement des décisions de routage, aux statistiques de consommation de tokens et à l'analyse de l'attribution des coûts, les entreprises peuvent connaître l'état de fonctionnement et la consommation de ressources de chaque appel de modèle. Associée à la gestion budgétaire, à l'analyse du retour sur investissement (ROI) et aux rapports visuels, la plateforme fournit un support de données pour l'optimisation opérationnelle et la planification des ressources futures. Le lancement de Spark Token Factory renforce encore la position d'iFlytek dans le domaine des infrastructures d'IA pour les entreprises et marque une nouvelle étape dans l'évolution des applications des grands modèles, passant de l'exploration ponctuelle à l'exploitation à grande échelle.

Ce texte est rédigé, traduit et republié à partir des informations de l'Internet mondial et de partenaires stratégiques, uniquement pour la communication entre lecteurs. En cas d'infraction au droit d'auteur ou d'autres problèmes, veuillez nous en informer à temps pour la modification ou la suppression. La reproduction de cet article est strictement interdite sans autorisation formelle. Mail : news@wedoany.com
Produits Associés