Die hässlichen, versteckten und unterschätzten Kosten beim Aufbau eines On-Premise-HPC-Systems

Abhängig von Ihren aktuellen und zukünftigen HPC- und Unternehmensanforderungen bietet jedes System Vorteile und Einschränkungen, die definiert und verglichen werden müssen. Ein Hauptvergleichskriterium zwischen Systemen sind in der Regel die Gesamtbetriebskosten (TCO). Wie ich bereits in einem früheren Blogbeitrag erwähnt habe, TCO ist nicht gerade geeignet, um Kaufentscheidungen zwischen grundsätzlich unterschiedlichen Alternativen zu treffenDie Gesamtbetriebskosten von On-Premise-HPC-Systemen werden seit über 30 Jahren diskutiert, sogar von unserem VP of Sales in seinem Blog „Die wahren Kosten des Hochleistungsrechnens.“ Wer den Kauf von HPC-Systemen vor Ort in Erwägung zieht, sollte sich darüber im Klaren sein, dass es einige versteckte Kosten gibt, die bei der Berechnung der Gesamtbetriebskosten eines HPC-Systems vor Ort oft übersehen werden.
In diesem Beitrag möchte ich die Gesamtbetriebskosten eines lokalen Systems aufschlüsseln und einige Ausgaben offenlegen, die möglicherweise übersehen werden.
Ein kurzer Überblick über die Gesamtbetriebskosten
Die Gesamtbetriebskosten eines lokalen HPC-Systems lassen sich allgemein als Summe aller direkten und indirekten Kosten für Ihr zukünftiges System definieren. Die offensichtlichsten Kosten sind Hardware, Software, Personal und Strom. Für die Hardware benötigen Sie Folgendes: Server, Verkabelung, ToR-Switches, Aggregations-Switches, Server-Racks, Stromverteiler usw. Außerdem benötigen Sie Software, die die Kommunikation zwischen den einzelnen Knoten koordiniert, um komplexe Probleme zu lösen. Zusätzlich müssen Sie Lizenzen für die Software erwerben, die Sie nutzen möchten. Eine Ressource, die extrem variabel und schwer abzuschätzen ist, ist der Personalbedarf für Entwicklung, Bereitstellung und Wartung des lokalen HPC-Systems. Schließlich benötigen lokale HPC-Systeme viel Strom und Kühlung: Es ist wichtig, Ihren Energieverbrauch und dessen Auswirkungen auf Ihre Betriebskosten zu berechnen. Die Summe der Kosten für die oben genannten Punkte ergibt die Gesamtbetriebskosten für Ihr lokales HPC-System. Es gibt jedoch einige versteckte Kosten, die die Gesamtbetriebskosten Ihres lokalen Systems stark beeinflussen können.
Reale, versteckte Kosten
#1 Die Einrichtungen, in denen Ihre HPC-Systeme gehostet werden, weisen Kostenabhängigkeiten auf, die weiter reichen, als auf den ersten BlickWenn Sie sicherstellen, dass Ihre Anlage über die erforderliche Kühlung und Stromversorgung verfügt, um das aktuelle System und seine potenzielle Skalierbarkeit zu unterstützen, können Sie langfristig eine Menge Kosten sparen. Strom ist ein großer Kostenfaktor und kann Ihre Gesamtbetriebskosten stark beeinflussen. Je nach Cluster-Standort und -Auslastung können Ihre Stromkosten stark variieren. Je nach Standort können auch die Strompreise sehr unterschiedlich sein, was sich stark darauf auswirkt, wie Sie Ihr HPC-System betreiben, um die Kosten zu minimieren. In manchen Fällen kann der Strom mehr als ein Drittel Ihrer Betriebskosten ausmachen. Anlagen und Energie sind wichtige Faktoren bei der Berechnung Ihrer Gesamtbetriebskosten und sollten bei großen Anlagen als vorrangiges Anliegen betrachtet werden.
#2 Die Personalkosten sind höher und variieren stärker als Sie denken. Bei Vernachlässigung leiden Leistung und Betriebszeit darunter. Einer der variabelsten und am schwersten zu definierenden Kostenfaktoren ist der Personalaufwand für HPC-Systeme vor Ort. Es kann sehr schwierig sein, gute Betriebs- und IT-Manager zu finden, einzustellen und zu schulen, die die Entwicklung, Bereitstellung und Wartung eines HPC-Systems durchführen können. Die Entwicklung eines HPC-Systems erfordert teure Spezialisten, um die beste Hard- und Software für Ihre Computeranforderungen zu finden. Allein die Beschaffung des Systems kann bis zu 5 % des gesamten HPC-Systems kosten und dauert mindestens 6 Monate. Während dieser Zeit müssen Sie weiterhin Spezialisten für die Zusammenstellung des Clusters bezahlen, erhalten aber keine Vergütung für das HPC-System. Nach der Bereitstellung erfordern die Systeme sehr spezielles IT-Personal, um Wartung und Betrieb sicherzustellen. Diese Mitarbeiter benötigen spezielle Fähigkeiten, um die Langlebigkeit und Leistung Ihres HPC-Systems zu testen und zu schützen. Die richtigen Mitarbeiter für diese Aufgaben zu finden, kann mühsam und kostspielig sein, ist aber eine Priorität, wenn Sie die Bereitstellung eines HPC-Systems vor Ort in Erwägung ziehen.
#3 Unterauslastung kostet mehr als nur Leerlaufzeit, auch der damit verbundene Aufwand ist erheblich. Ein ungenutztes HPC-System senkt nicht nur Ihren ROI, sondern kann auch verheerende Auswirkungen auf Ihren Produktentwicklungszyklus haben. Backup-Systeme werden oft übersehen, da sie nicht als notwendige Ausgaben für ein funktionierendes HPC-System gelten. Die Folgen des Fehlens können jedoch verheerend sein. Generatoren, Schalter, Gas und die Wartung Ihres Backup-Energiesystems sind notwendig, um sicherzustellen, dass Ihre Systeme vor Stromausfällen geschützt sind. Vergleichbar mit der Notstromversorgung ist Backup-Hardware äußerst wichtig, um die Ausfälle eines ungenutzten HPC-Systems zu minimieren. Es ist wichtig, Ersatzhardware für den Fall eines Problems zur Hand zu haben. Ohne Backup-Hardware kann Ihr System ungenutzt bleiben, während das Teil repariert oder gekauft wird. Wer nicht plant, sollte einen Ausfall planen; dies gilt insbesondere für den Betrieb eines HPC-Systems vor Ort.
#4 Schließlich ist die On-Premise-Technologie ein ständiger (und meist aussichtsloser) Kampf. Dieser Schaden entsteht, wenn nicht die beste Technologie genutzt wird und enorme Anstrengungen und Kapital aufgewendet werden müssen, um mit der Konkurrenz Schritt zu halten. Beim Vergleich von HPC-Systemen müssen Sie Kosten und Nutzen sowie deren gegenseitige Auswirkung berücksichtigen. Wenn nicht die beste Technologie genutzt wird, können Kosten entstehen, die dadurch entstehen, dass man auf die Vorteile des besten Systems verzichtet. Die damit verbundenen Kosten sind: Produktivitätsverlust, verpasste Innovationen, längere Zeit bis zur Lösungsfindung, Kosten für Technologieaktualisierungen, IT-Risikomanagement sowie höhere IT-Schulden und -Verpflichtungen. Der schädlichste entgangene Vorteil ist Ineffizienz in der Forschungspipeline, die eine Vielzahl von Kosten verursacht, die mit der Verlängerung der Markteinführungszeiten, Verzögerungen bei Innovationen und längeren Leerlaufzeiten der Forscher korrelieren. Das Fehlen von HPC-Technologie kann für Ihr Unternehmen irreparable Folgen haben, z. B. die Unfähigkeit, größere Probleme zu erforschen, und verpasste Innovationen, die Ihr Unternehmen wettbewerbsunfähig machen können. Diese Kosten sind oft schwer zu berechnen, da Sie beurteilen müssen, wie viel effizienter Ihr Team mit einer besseren HPC-Lösung arbeiten wird, und dann rückwärts arbeiten müssen, um die mit der Ineffizienz verbundenen Kosten zu berechnen.
Zusammenfassend lässt sich sagen, dass es sehr schwierig sein kann, die tatsächlichen Gesamtbetriebskosten eines lokalen HPC-Systems zu ermitteln, wenn man alle versteckten Kosten berücksichtigt: Personal, Einrichtungen, Stromverbrauch, Backup-Vorkehrungen und entgangene Prämien. Ich behaupte, dass die Kosten durch entgangene Prämien zu den wichtigsten Kostenfaktoren beim Vergleich von HPC-Systemen gehören; diese sind jedoch am schwierigsten zu berechnen und vorherzusagen. Der Vergleich der Gesamtbetriebskosten zwischen Cloud-fähigen und lokalen HPC-Systemen wurde regelmäßig diskutiert und ist noch immer nicht klar definiert. Wir arbeiten daran, diesen Vergleich zu verbessern. Wenn Sie also Kommentare oder Fragen zu diesem Blogbeitrag oder den Gesamtbetriebskosten haben, freuen wir uns über Ihre Meinung.
Sara Jeanes. (2017. Juni 19). Cloud- vs. Rechenzentrumskosten für High Performance Computing (HPC): Ein Beispiel aus der Praxis. Abgerufen von: https://www.internet2.edu/blogs/detail/14114
Tony Spagnuolo. (2015, Januar). Die wahren Kosten des Hochleistungsrechnens. Abgerufen von: https://rescale.com/blog/the-real-cost-of-high-performance-computing/
Wolfgang Gentzsch. (2016. März 6). Eine Gesamtkostenanalyse für Hersteller von Inhouse-Rechenressourcen und Cloud Computing. Abgerufen von: https://community.theubercloud.com/wp-content/uploads/2016/04/TCO-Study-UberCloud.pdf