Les coûts laids, cachés et sous-estimés de la construction d'un système HPC sur site

En fonction de vos exigences HPC et organisationnelles actuelles et futures, chaque système offre des avantages et des limites qui doivent être définis et comparés. L'une des principales comparaisons entre les systèmes est généralement le coût total de possession (TCO). Comme je l'ai mentionné dans un article de blog précédent, Le TCO n'est pas vraiment adapté à la prise de décisions d'achat entre des alternatives fondamentalement différentes. Le TCO des systèmes HPC sur site est évoqué depuis plus de 30 ans, même par notre vice-président des ventes sur son blog «Le coût réel du calcul haute performance.» Pour les personnes qui envisagent d'acheter des systèmes HPC sur site, certaines dépenses cachées sont souvent négligées lors du calcul du TCO du système HPC sur site.
Dans cet article, j'ai l'intention de décomposer le TCO d'un système sur site et d'exposer certaines dépenses qui pourraient être négligées.
Un aperçu rapide du TCO
La définition générale du coût total de possession d'un système HPC sur site est que vous additionnez le montant de toutes les dépenses directes et indirectes liées à votre système potentiel. Les dépenses les plus évidentes sont le matériel, les logiciels, le personnel et l’électricité. Pour le matériel, vous avez besoin des éléments suivants : serveurs, câblage, commutateurs ToR, commutateurs d'agrégation, racks de serveurs, unités de distribution d'énergie, etc. Ensuite, vous devez acheter un logiciel qui coordonne la communication entre chaque nœud pour résoudre des problèmes complexes. De plus, vous devez acheter des licences pour les logiciels que vous envisagez d'utiliser. Une ressource qui peut être extrêmement variable et difficile à estimer est le personnel requis pour développer, déployer et maintenir le système HPC sur site. Enfin, les systèmes HPC sur site nécessitent beaucoup de capacités d'alimentation et de refroidissement : il est essentiel de calculer votre consommation d'énergie et son impact sur vos dépenses opérationnelles. Prenez la somme des dépenses pour les éléments ci-dessus et vous obtenez le TCO de base pour votre système HPC sur site ; Cependant, certains coûts cachés peuvent affecter considérablement le coût total de possession de votre système sur site.
Coûts cachés du monde réel
#1 Les installations hébergeant vos systèmes HPC ont des dépendances en matière de coûts qui vont plus loin qu'à première vue. S'assurer que votre installation dispose des dispositions de refroidissement et d'alimentation appropriées nécessaires pour prendre en charge le système actuel et son évolutivité potentielle peut permettre d'économiser beaucoup de dépenses à l'avenir. L’électricité représente une dépense importante et peut avoir un impact considérable sur vos dépenses d’exploitation globales. En fonction de l'emplacement et de l'utilisation du cluster, vos coûts d'alimentation peuvent varier considérablement. En raison de votre emplacement, vous pouvez également constater des prix de l'électricité très variables qui affecteront considérablement la façon dont vous exploitez votre système HPC afin de minimiser les dépenses. Dans certains cas, l’électricité peut représenter plus du tiers de vos dépenses d’exploitation. Les installations et l'énergie sont des éléments importants à prendre en compte lors du calcul de votre coût total de possession et, pour une grande installation, doivent être considérés comme une préoccupation majeure.
#2 Le personnel coûtera et variera plus que vous ne le pensez, et les performances et la disponibilité en pâtiront si elles sont négligées. L'une des dépenses les plus variables et les plus difficiles à définir est la dotation en personnel pour les systèmes HPC sur site. Il peut être très difficile de trouver, d'embaucher et de former de bons responsables des opérations et de l'informatique capables d'effectuer le développement, le déploiement et la maintenance d'un système HPC. La conception d'un système HPC nécessite des spécialistes coûteux pour adapter le matériel et les logiciels les mieux adaptés à vos besoins informatiques. L'achat du système à lui seul peut coûter jusqu'à 5 % du système HPC total et prend au moins 6 mois. Pendant ce temps, vous devez continuer à payer des spécialistes pour assembler le cluster sans recevoir de récompense pour le système HPC. Une fois déployés, les systèmes nécessitent un personnel informatique très spécifique pour assurer leur maintenance et leur fonctionnement. Ces employés nécessitent des compétences spécialisées pour tester et protéger la longévité et les performances de votre système HPC. Trouver les bons employés pour exécuter ces fonctions peut s'avérer fastidieux et coûteux, mais constitue une priorité lorsque l'on envisage de déployer un système HPC sur site.
#3 La sous-utilisation coûte plus que le temps d'inactivité, les frais généraux associés sont également substantiels. Un système HPC inactif réduit non seulement votre retour sur investissement, mais peut également avoir des impacts dévastateurs sur votre cycle de développement de produits. Les systèmes de sauvegarde peuvent être négligés car ils ne sont pas considérés comme des dépenses nécessaires pour disposer d'un système HPC opérationnel ; cependant, les conséquences de ne pas les avoir peuvent être désastreuses. Les générateurs, les interrupteurs, le gaz et la maintenance de votre système d'énergie de secours sont tous nécessaires pour garantir que vos systèmes sont protégés contre les pannes de courant. Comparable aux provisions d’énergie de secours, le matériel de secours est extrêmement important pour atténuer un système HPC inactif. Il est important d'avoir du matériel de rechange à portée de main en cas de problème ; sans matériel de sauvegarde, vous pouvez trouver votre système inactif pendant que la pièce est réparée ou achetée. Si vous ne parvenez pas à planifier, vous devriez planifier votre échec ; cela est particulièrement vrai pour l'exécution d'un système HPC sur site.
#4 Enfin, la technologie sur site est une bataille constante (et généralement perdue). Il s’agit du préjudice causé par la non-utilisation de la meilleure technologie et par le fait de devoir consacrer d’énormes efforts et capitaux pour suivre le rythme. Lorsque vous comparez les systèmes HPC, vous devez reconnaître les coûts et les récompenses, ainsi que leurs effets les uns sur les autres. Ne pas utiliser la meilleure technologie peut entraîner des dépenses liées à la perte des récompenses accordées par le meilleur système. Les dépenses liées à la non-utilisation de la meilleure solution HPC sont : perte de productivité, innovation manquée, délai de mise en œuvre plus long, coût de rafraîchissement de la technologie, gestion des risques informatiques et augmentation de la dette et de l'engagement informatique. La récompense perdue la plus préjudiciable est l’inefficacité du pipeline de recherche, qui crée une pléthore de dépenses liées à l’augmentation des délais de mise sur le marché, au retard dans l’innovation et à l’augmentation du temps d’inactivité des chercheurs. Le manque de technologie HPC peut entraîner des conséquences irréparables pour votre organisation, telles que l'incapacité de rechercher des problèmes plus importants et l'absence d'innovations qui peuvent rendre votre organisation non compétitive. Ces dépenses sont souvent difficiles à calculer car il faut évaluer dans quelle mesure votre équipe sera plus efficace avec une meilleure solution HPC, puis travailler à rebours pour calculer les dépenses corrélées à l'inefficacité.
En résumé, déterminer le véritable coût total de possession d'un système HPC sur site peut s'avérer très difficile si l'on considère tous les coûts cachés : personnel, installations, consommation d'énergie, dispositions de sauvegarde et récompenses perdues. Je soutiens que l'une des dépenses les plus importantes à prendre en compte lors de la comparaison des systèmes HPC est celle provoquée par les récompenses perdues ; cependant, ces derniers s’avèrent être les plus difficiles à calculer et à prévoir. Le sujet des comparaisons du TCO entre les systèmes HPC basés sur le cloud et sur site a été régulièrement abordé et n'est toujours pas clairement défini. Il s'agit d'une comparaison que nous travaillons à améliorer, donc si vous avez des commentaires ou des questions sur cet article de blog ou sur le TCO, nous serions ravis de connaître votre avis.
Sara Jeanes. (2017 juin 19). Coûts du cloud et du centre de données pour le calcul haute performance (HPC) : un exemple concret. Extrait de : https://www.internet2.edu/blogs/detail/14114
Tony Spagnuolo. (2015, janvier). Le coût réel du calcul haute performance. Récupéré de : https://rescale.com/blog/the-real-cost-of-high-performance-computing/
Wolfgang Gentzsch. (2016 mars 6). Une analyse du coût total pour les fabricants de ressources informatiques internes et de cloud computing. Récupéré de : https://community.theubercloud.com/wp-content/uploads/2016/04/TCO-Study-UberCloud.pdf