fr.wedoany.com Rapport : Le 13 août, OpenAI a commencé à proposer à un petit nombre de clients un aperçu du mode d'inférence à haute vitesse nommé Ultrafast, destiné à accélérer la vitesse de sortie du modèle phare GPT-5.6 Sol. Ce mode est actuellement en phase de test à petite échelle et n'est pas encore ouvert à tous les utilisateurs de ChatGPT ou de l'API.

Selon le rapport citant OpenAI, la vitesse de traitement d'Ultrafast peut atteindre jusqu'à 14 fois celle du mode standard, avec un débit de sortie maximal de 750 tokens par seconde. Son objectif principal est d'améliorer la vitesse de réponse des modèles complexes dans les scénarios métier en temps réel, sans avoir à basculer vers des modèles plus petits.
Il convient de préciser que les 750 tokens par seconde reflètent principalement le débit de sortie lors de la génération de texte par le modèle, et ne signifient pas que toutes les tâches, y compris l'inférence, les appels d'outils, le traitement de fichiers et la recherche en ligne, peuvent être réduites à un quatorzième de leur durée d'origine. La vitesse de bout en bout des différentes tâches reste influencée par l'intensité de l'inférence, la longueur du contexte et le temps d'exécution des outils.
TechCrunch indique que l'aperçu d'Ultrafast est soutenu par la collaboration entre OpenAI et l'entreprise de puces d'intelligence artificielle Cerebras. Les applications initiales incluent les flux de travail d'entreprise sensibles à la latence de réponse, tels que la réponse aux incidents de sécurité, le service client, l'analyse des marchés financiers et le commerce électronique. OpenAI prévoit d'élargir progressivement l'accès à mesure que la capacité de calcul augmente.
Les données officielles des modèles d'OpenAI montrent que GPT-5.6 Sol est le modèle phare de la série GPT-5.6, destiné au codage complexe, à la recherche, aux opérations informatiques et au travail professionnel. Ce modèle prend en charge une fenêtre de contexte de 1,05 million de tokens, une sortie maximale de 128 000 tokens, ainsi que des niveaux d'intensité d'inférence allant de none à max. Ultrafast n'est pas un nouveau modèle indépendant, mais un mode d'exécution visant à accélérer la vitesse du service d'inférence de GPT-5.6 Sol.
Au 14 août, la page du modèle GPT-5.6 Sol sur OpenAI Docs et le résumé des mises à jour officielles des produits du 10 au 14 août ne mentionnent pas encore le prix d'Ultrafast, les méthodes d'appel API, les niveaux de service, la couverture géographique ni la liste spécifique des accès ouverts.





















