Everpure accélère aussi le cache KV des modèles d’IA
FlashBlade//EXA atteint jusqu’à 85 736 tokens par seconde dans les tests de cache KV de MLPerf Storage v3.0. Le stockage intervient également pendant l’inférence. Lorsqu’un modèle doit récupérer les données de son cache KV, sa capacité à les lire rapidement peut influencer directement le rythme auquel les accélérateurs poursuivent la génération. Dans le benchmark MLPerf […]
L’article Everpure accélère aussi le cache KV des modèles d’IA est apparu en premier sur IA News.
