,

Das Drehbuch für HPC in der Cloud wurde umgedreht

Geschäftskritische Systeme treiben Innovationen voran
Geschäftskritische Systeme treiben Innovationen voran

Cloud: Von der Geschäftskontinuität zum Wettbewerbsvorteil

IT-Experten auf der ganzen Welt verfolgen Cloud-First-Initiativen, beschleunigt durch beispiellose Veränderungen am Arbeitsplatz und Fortschritte bei Cloud-Technologien. Um die Migration noch dringlicher zu machen, erhöhen die Stakeholder auf Unternehmensseite die Nachfrage nach Kapazitäten und neuesten Technologien, um neue Anwendungsfälle zu ermöglichen. Mit dem Beschäftigungswachstum (Computer World) und Einstellung (Forbes) erlebt 2021 einen neuen Boom. Daher überrascht es nicht, dass viele Branchen mit spannenden Meilensteinen und ambitionierten Veröffentlichungsplänen werben. Von den tiefgreifenden technischen Innovationen im Land- und Flugverkehr bis hin zu den Rechenkapazitäten, die diese Innovationen vorantreiben, erleben wir einen spannenden Boom in Wissenschaft und industrieller Forschung und Entwicklung.
Da viele Unternehmen die Zukunft der Arbeit und Zusammenarbeit neu definieren, sind cloudbasierte Teams und Tools zunehmend die Grundlage für die Geschäftskontinuität. IT- und F&E-Teams, die High Performance Computing (HPC) zur Förderung von Produktinnovationen nutzen, gehen davon aus, dass in den nächsten fünf Jahren 73 % ihrer HPC-Workloads in der Cloud liegen werden.
In der Vergangenheit hielten Bedenken hinsichtlich Kosten, Sicherheit und spezialisierter Anwendungsfälle einige Unternehmen davon ab, den Schritt in die Cloud zu wagen oder Bereitstellungen auf isolierte Workloads oder einen hohen Rechenbedarf zu beschränken. Die Akzeptanz der Cloud kam jedoch schneller als erwartet: 2020 verzeichnete das HPC-Cloud-Segment ein „extrem hohes Wachstum“ von 78.8 % und übertraf damit die Erwartungen deutlich (Intersect360).
Um dieser wachsenden Nachfrage gerecht zu werden, drehen hochmoderne Cloud-HPC-Angebote wie Rescale auf Azure mit AMD EPYC™-Prozessoren den Spieß um und verwandeln diese ehemaligen Problempunkte in Differenzierungspunkte. 

Gängige Missverständnisse zum Thema Cloud-HPC aufklären

„Cloud HPC kann meinen speziellen Anwendungsfall nicht bewältigen.“ 

Cloud HPC hat eine lange Entwicklung hinter sich, seit die ersten Anwender vor fast einem Jahrzehnt begannen, mit der Ausführung von Batch-Workloads in der Cloud zu experimentieren. Mittlerweile hat die Cloud das moderne Unternehmen grundlegend verändert, wobei einige spezifische Workloads weiterhin vor Ort ausgeführt werden. Im Bereich der wissenschaftlichen und technischen Forschung und Entwicklung waren die Fähigkeit zur Massendatenverarbeitung und spezialisierte Simulationsmethoden wichtige Unterscheidungsmerkmale. Um ihren Wettbewerbsvorteil zu sichern, bauten viele führende Unternehmen spezialisierte Supercomputer, die speziell auf ihre Anwendungsfälle zugeschnitten waren.
Als Cloud Computing erstmals eingeführt wurde, konnten sich Ingenieure und IT-Experten nicht vorstellen, dass die Cloud jemals mit ihren eigenen Rechenzentren konkurrieren könnte, die speziell für Berechnungen zur Steigerung der Sicherheit von Fahrzeugen oder der Effizienz von Flugzeugen gebaut wurden. Während Cloud-Service-Anbieter darum wetteiferten, die für Enterprise-Resource-Planning-Anwendungen (ERP) erforderliche Skalierbarkeit bereitzustellen, stolperten neugierige HPC-Ingenieure beim Testen ihrer grundlegenden Batch-Workloads in der Cloud. Sie stießen auf Probleme bei der Ausführung von Aufgaben, die HPC-Cluster mit mehreren Knoten erforderten, wie z. B. numerische Strömungsmechanik und andere gängige Workloads aus der Luft- und Raumfahrt sowie der Automobilindustrie.
Unabhängig von der Cloud- oder lokalen Bereitstellung erfordert die Einrichtung eines Clusters für einen bestimmten Anwendungsfall Kenntnisse über Workload-Anforderungen, Hardwaretypen, Kenntnisse in Softwarelizenzierung und -installation sowie Kenntnisse der Befehlszeilen- und Nachrichtenübermittlungsschnittstellen. Darüber hinaus bietet die Cloud eine Vielzahl von Hardware-, Speicher-, Sicherheits- und Netzwerkarchitekturen, die für Laien eine Herausforderung darstellen können, da die Bereitstellung optimaler und sicherer Ressourcen in der Cloud oft überfordert ist. Darüber hinaus war die frühe Cloud-Infrastruktur nicht für die hohen Taktraten, Kernzahlen, Verbindungen und Speicheranforderungen vieler Workloads wie Computerchemie, Wettervorhersage und seismische Simulation ausgelegt.
Führende Cloud-Anbieter bieten heute ein umfassendes Arsenal an Hardwaretypen an, die speziell für unterschiedliche HPC-Workload-Anforderungen entwickelt wurden. Halbleiter- und Elektronikdesignfirmen verfügen oft über eine Vielzahl von Rechnertypen, um die verschiedenen Phasen der Designverifizierung abzudecken. Auch Life-Science-Unternehmen nutzen die Flexibilität und Auswahl der Cloud, um GPU- und CPU-Ressourcen zu skalieren und zu wechseln, um die Arzneimittelforschung mit Simulationen wie Molekulardynamik und Kristallisation durchzuführen.
Wir befinden uns in einer Phase der Cloud-Reife, in der HPC nicht nur für einzigartige Anwendungsfälle geeignet ist, sondern sogar neue ermöglicht. Neue Erkenntnisse und Innovationen entstehen durch Cloud-native Startups, die genau die Ressourcen bereitstellen können, die sie benötigen, und diese jederzeit anpassen können. Da die Rate neuer Hardware-Releases exponentiell steigt und Unternehmen neuere Hardware bevorzugen (Big Compute State of Cloud HPC-Bericht), erwarten wir, dass HPC-Praktiker aus allen Bereichen der Industrie für aufstrebende Anwendungsfälle wie maschinelles Lernen, generatives Design und digitale Zwillinge in die Cloud strömen.

„Cloud HPC ist nicht wirtschaftlich.“

Seit fast 30 Jahren ist die Top500 Liste hat die führenden Supercomputer verfolgt, und im Jahr 2021 Cloud-native Supercomputer zum ersten Mal auf der Liste Platzierung unter den besten 10 % der Systeme. Dieser entscheidende Meilenstein signalisiert, dass die Cloud-Performance bereit für die große Liga ist. Aber wie sieht es mit den Kosten aus?
Die Kosten des Cloud Computing sind für viele IT-Leiter ein Streitpunkt, die jedes Mal zusammenzucken, wenn sie Behauptungen über „grenzenlose Rechenleistung“ hören. HPC-Anwendungen sind ressourcenhungrig. Aus geschäftlicher Sicht gilt: Je mehr Daten verarbeitet werden, desto präziser ist das Modell und (wahrscheinlich) desto besser ist das fertige Produkt. Unternehmen hatten schon immer damit zu kämpfen, die Anforderungen der Geschäftsanwender mit den zugewiesenen F&E-Mitteln in Einklang zu bringen. Viele HPC-/IT-Administratoren, die für Entscheidungen zur HPC-Infrastruktur verantwortlich waren, verließen sich oft auf die Annahme, dass lokale Lösungen die Cloud hinsichtlich der Kosten pro Kernstunde übertreffen. Die moderne Wirtschaftlichkeit von Cloud-Hardware stellt gängige Kostenannahmen in Frage, und die Cloud-Anbieter haben ihren Gesamtsupport deutlich weiterentwickelt, was zu einer besseren Kosteneffizienz führt.
Wie wir in besprochen haben Der HPC-Käuferleitfaden, es gibt viele Überlegungen zur Berechnung der harten und weichen Kosten im Zusammenhang mit HPC-Operationen, aber um eine fokussierte Argumentation zu ermöglichen, können wir das Kosten-Leistungs-Verhältnis von Cloud- und On-Premise-Infrastruktur vergleichen.
Um die Wirtschaftlichkeit von Infrastrukturentscheidungen zu maximieren, bietet Rescale Unternehmen Zugriff auf umfassende und kontinuierliche Kosten-Leistungs-Daten. Diese Daten liefern einen Index, den Rescale Performance Index (RPI), der den Vergleich und die Auswahl aus dem stetig wachsenden Portfolio an Rechenhardwaretypen ermöglicht. Da viele Kunden von lokalen Systemen migrieren, verfügt Rescale auch über Benchmark-Daten aus diesen Implementierungen.
Was wir in einer Grafik mit Benchmarks für neue Hardware in der Cloud und im Rechenzentrum beobachten können, ist, dass der Leistungs-Kosten-Index (der „Wert“ in der Abbildung unten) neuer Cloud-Hardware schneller und häufiger steigt als bei einer voll ausgelasteten Rechenzentrumsinstallation. Durch die Möglichkeit, kontinuierlich zu optimieren oder auf leistungsfähigere Hardware umzusteigen, können Unternehmen 20 % ihrer Kosten für die Recheninfrastruktur einsparen (Intelligentes Computing für digitale Forschung und Entwicklung). Wenn wir uns speziell HPC-Hardware wie AMD-CPUs auf Azure ansehen, können wir einen positiven Trend beim RPI feststellen, was bedeutet, dass Anwender bei konstanten Kosten eine bessere Leistung erwarten können. Da die Cloud jedes Jahr Zugang zu höherer Leistung bei gleichen Kosten bietet, übertrifft die Gesamtleistung, die mit einem festen Budget in der Cloud erzielt wird, im Laufe der Zeit die Leistung eines festen lokalen Clusters bei gleichen Gesamtkosten.
Screen Shot 2021 08 05 bei 2.00.07 Uhr
Nach dem Vergleich der Hardware-Kosten im Detail können wir nun die weiteren Faktoren betrachten, die die HPC-Kosten in die Höhe treiben können, nämlich Lizenzierung und Personalkosten, die für die meisten Unternehmen die Hardwarekosten deutlich übersteigen. Angesichts der stark steigenden Nachfrage nach HPC-Expertise und des Fachkräftemangels dürfte die Realisierbarkeit von On-Premise-Implementierungen abnehmen, was die Gunst der Cloud-basierten Lösungen weiter erhöht.

„Cloud HPC ist nicht sicher.“ 

Nach einer augenbrauenhochziehenden Datenpunkt, der kürzlich von Gartner geteilt wurde„Bei IaaS-Workloads in öffentlichen Clouds wird es bis 60 2020 % weniger Sicherheitsvorfälle geben als bei herkömmlichen Rechenzentren. Und mindestens 95 % aller Sicherheitsfehler in der Cloud werden vom Kunden verursacht.“
Dies mag diejenigen überraschen, die glauben, die Cloud sei voller Schwachstellen. Die öffentliche Cloud hat in der Vergangenheit bei IT-Abteilungen von Unternehmen Besorgnis und Spekulationen ausgelöst, was häufig dazu führte, dass Cloud-HPC-Migrationen blockiert wurden, insbesondere bei Unternehmen, die bestimmte Datenschutzvorschriften oder Compliance-Standards einhalten müssen. Diese Bedenken beruhen auf einem rationalen Misstrauen gegenüber Infrastrukturen, die nicht physisch unter der Aufsicht der IT-Abteilung und unternehmensweiter Firewalls und Richtlinien stehen. Verständlicherweise beinhalten viele hochmoderne HPC-Workloads die Verarbeitung sensibler Daten und vertraulicher Informationen, die Compliance-Standards wie ITAR, FedRAMP und NIST unterliegen.
Cloud-Service-Provider arbeiten jedoch eifrig daran, diese Entwicklung zu ändern, und verfügen über die entsprechenden Richtlinien und Instrumente, um ihre Bemühungen wirksam unter Beweis zu stellen und das Vertrauen ihrer Kunden zu gewinnen. Rescale auf Azure mit AMD EPYC™-Prozessoren bietet eine Cloud-High-Performance-Computing-Lösung, die speziell auf Zuverlässigkeit, Compliance und Sicherheit im gesamten HPC-Stack ausgelegt ist. Azure erfüllt 90 Compliance-Zertifizierungen aus verschiedenen Branchen, Ländern und Regionen und bietet eine robuste internationale Grundlage, die speziell für die Remote-Zusammenarbeit konzipiert wurde. Weiter oben im Stack erzwingt die softwaredefinierte Sicherheit von Rescale eine ordnungsgemäße IP-Behandlung und bietet Verschlüsselung bei der Übertragung mit hochwertigem TLS sowie mehrschichtige Verschlüsselung im Ruhezustand mit 256-Bit-AES. Um die bestehenden Cloud-Sicherheitsstandards zu stärken, integriert Rescale zusätzliche Sicherheitsvorkehrungen, um sicherzustellen, dass Workflows von Anfang bis Ende sicher und konform mit SOC 2 Typ 2, CSA, ITAR, HIPAA, FedRAMP moderat und DSGVO sind.
Da die globale Belegschaft zunehmend verteilt, kollaborativ und interdependent ist, erwarten wir, dass HPC-Initiativen und -Teams die IT-Governance komplexer machen. Rescale freut sich, dass Kunden die Grenzen der Innovation über interne Abteilungen und Disziplinen hinweg sowie durch Partnerschaften wie Joint Ventures und Forschungskonsortien erweitern (Technologie gegen Covid). Zu diesem Zweck bietet Rescale Organisationen die Tools zur einfachen Verwaltung von Teams und zur sauberen Partitionierung von Daten, um neue Erkenntnisse zu gewinnen und eine nahtlose Zusammenarbeit zu ermöglichen, ohne sensible Daten zu gefährden.

Neuskalierung auf Azure mit AMD EPYC Prozessoren

Branchendaten deuten auf eine weiterhin rasante Verbreitung von Cloud-HPC hin. Die Partnerschaft zwischen Rescale und Azure mit AMD EPYC™-Prozessoren setzt sich weiterhin dafür ein, traditionelle Bedenken der Nutzer gegenüber Cloud-HPC durch innovative Technologien auszuräumen. Wer Missverständnisse über Cloud-HPC durch die Einführung ausräumt, profitiert von Vorteilen, die die bisherige Kritik und das wahrgenommene Risiko bei weitem überwiegen.
Rescale on Azure mit AMD EPYC™ Prozessoren ist die Cloud-HPC-Lösung, die auf Einfachheit ausgelegt ist und neue Maßstäbe in Skalierbarkeit und Leistung setzt. Für weitere Informationen oder Anfragen kontaktieren Sie uns bitte unter sales@rescale.com.
 
Dieser Blog wurde verfasst und überprüft von Garrett VanLee (Produktmarketing, Rescale), Andrew Jones (Corporate Azure Engineering & Produktplanung), Sean Kerr (Produktmarketing, AMD)

Autorin

  • Garrett VanLee

    Garrett VanLee ist Produktmarketing-Direktor bei Rescale und arbeitet eng mit Kunden an der Spitze der Innovation in verschiedenen Branchen zusammen. Er teilt gerne Kundenerfolgsgeschichten, Forschungsergebnisse und Best Practices von Rescale-Ingenieuren, Wissenschaftlern und IT-Experten, um andere Organisationen zu unterstützen. Garrett konzentriert sich derzeit auf die Konvergenz von Supercomputing, HPC und KI-Simulation Modelle und wie diese Trends Entdeckungen in Wissenschaft und Industrie vorantreiben.