Google a officiellement lancé son défi dans le domaine du cloud computing IaaS en ouvrant l'accès au service Google Compute Engine (GCE) au grand public. L'une des caractéristiques différenciatrices vantées par Google est la performance de son infrastructure réseau.
Nous avons décidé d'essayer le service pour voir à quoi ressemblaient les performances d'interconnexion dans le contexte du domaine d'application HPC. Nous nous sommes notamment intéressés à mesurer la latence entre deux machines dans un cluster MPI.
Notre test du moteur de calcul Google
Pour notre test, nous avons lancé deux instances, configuré un cluster OpenMPI, puis exécuté le test osu_latency à partir du Micro-benchmarks OSU suite de tests pour mesurer le temps nécessaire pour envoyer un message de 0 octet entre les nœuds de manière ping-pong. Les chiffres indiqués ci-dessous sont les chiffres de latence unidirectionnelle moyennés sur 3 essais. Une nouvelle paire de machines a été lancée pour chaque essai.
| Type d'instance | Essai n°1 | Essai n°2 | Essai n°3 | Normale |
|---|---|---|---|---|
| n1-standard-1 | 183.12 | 172.57 | 169.90 | 175.20 |
| n1-standard-2 | 192.27 | 202.51 | 196.20 | 196.99 |
| n1-standard-4 | 169.97 | 170.96 | 177.03 | 172.65 |
| n1-highcpu-2 | 176.34 | 210.81 | 192.04 | 193.06 |
| n1-highcpu-4 | 205.00 | 176.11 | 159.95 | 180.35 |
| n1-highmem-2 | 176.80 | 177.73 | 189.72 | 181.42 |
| n1-highmem-4 | 173.78 | 175.94 | 185.85 | 178.52 |
*tous les nombres de latence mesurés en microsecondes
Les chiffres de latence signalés sont à peu près les mêmes pour tous les types d'instances que nous avons testés. L'écart entre les tests est probablement dû à des conflits avec d'autres locataires sur la machine. L’analyse comparative des instances de calcul cloud est un problème notoirement délicat. À l’avenir, nous envisagerons d’exécuter un test plus exhaustif sur davantage d’instances et sur différentes périodes.
Comparaison des références
À titre de comparaison, nous constatons des latences comprises entre 70 et 90 microsecondes lors de l'exécution du même test avec des instances Amazon EC2. Il est important de souligner qu'il ne s'agit pas d'une véritable comparaison de pommes avec des pommes : Amazon propose des types d'instances de calcul de cluster spéciaux ainsi que des groupes de placement. Ce dernier permet une meilleure bande passante et des latences réduites entre les machines d'un même groupe. Les chiffres de latence du GCE semblent être plus proches de ceux d'Edward Walker. rapporté pour les instances de calcul non cluster sur EC2. Il semble probable que Google se concentre pour l’instant sur la charge de travail plus typique de l’hébergement de services Web et qu’il se concentrera éventuellement sur le réglage de son infrastructure pour d’autres domaines tels que le HPC. Pour le moment, il semble que GCE soit mieux adapté aux charges de travail de nature plus « embarrassante et parallèle ».
Il convient de noter que ces types de micro-benchmarks ne représentent pas nécessairement les performances qui seront observées lors de l'exécution d'applications du monde réel. Nous encourageons les utilisateurs à effectuer des tests au niveau macro, spécifiques aux applications, pour avoir une véritable idée des performances attendues. Il existe plusieurs façons d'atténuer les pénalités de latence :
- Pour certaines classes de problèmes de simulation, il peut être possible de décomposer les modèles en éléments distincts qui peuvent ensuite être évalués en parallèle. Un changement de mentalité est nécessaire avec l’avènement du cloud public. Plutôt que d'avoir un seul cluster sur site, il est possible de lancer de nombreux clusters plus petits pouvant fonctionner simultanément sur les éléments décomposés.
- Tirer parti des applications hybrides Open MP/MPI lorsque cela est possible. Réduire le volume de conversation entre les nœuds du cluster constitue une excellente approche pour éviter complètement les coûts de latence.
Nous sommes impatients de voir la course aux armements se poursuivre entre les différents fournisseurs de cloud et nous espérons que les performances HPC continueront de s'améliorer. A titre d'exemple, Microsoft a récemment annoncé un nouveau Offre HPC pour Azure qui promet une connectivité Infiniband entre les instances. Comme dans la plupart des cas, la concurrence entre les grands fournisseurs de cloud computing est très bénéfique pour le client final. À Redimensionner, nous sommes enthousiasmés par les opportunités qui nous permettront de continuer à offrir à nos clients les meilleures performances possibles.
Inscrivez-vous pour une démo
Apprenez-en davantage sur la façon dont Rescale transforme l’espace cloud HPC.
