Spot Instances Optimierungsleitfaden

Spot Instances Optimierungsleitfaden

Spot Instances (AWS), Spot VMs (Azure) und Spot/Preemptible VMs (GCP) sind Cloud-Ersatzkapazität, die mit 70 bis 90 Prozent Rabatt auf den On-Demand-Preis angeboten wird. Der Haken ist, dass der Cloud-Anbieter die Instanz mit nur 30 Sekunden Vorwarnung zurückfordern kann, wenn die Nachfrage nach der zugrunde liegenden Hardware steigt. Für Arbeitslasten, die Unterbrechung tolerieren — und nur für diese Arbeitslasten — ist Spot das bei weitem günstigste Compute in der Public Cloud.

Welche Arbeitslasten auf Spot gehören

Spot ist geeignet für Arbeitslasten, die statuslos, fehlertolerant und unterbrechbar sind:

  • Batch- und HPC-Jobs — Bild-Rendering, Video-Transcoding, Monte-Carlo-Simulationen. Fortschritt prüfpunktieren und auf einer Ersatzinstanz fortsetzen.
  • CI/CD-Runner — Job-Warteschlangen können auf eine Ersatzinstanz warten, ohne Release-Deadlines zu verpassen.
  • Statuslose Web-Tiers — hinter einem Load Balancer mit Auto-Scaling wird eine geräumte Instanz in Sekunden ersetzt.
  • Big-Data-Verarbeitung — Spark-, Hadoop- und Data-Warehouse-Cluster, die für Knotenverlust ausgelegt sind.
  • Dev- und Testumgebungen — Nicht-Produktionsarbeitslasten, bei denen eine 2-Minuten-Unterbrechung akzeptabel ist.

Spot ist nicht geeignet für statusbehaftete Datenbanken, Single-Instanz-Anwendungen ohne Replikat, interaktive Sitzungen mit Benutzern oder Batch-Jobs, die nicht geprüfpunktiert werden können.

Anbieter-Vergleich

ProviderMin eviction noticeMax lifetimeTypical discount
AWS Spot Instances2 minutesnone~70% off on-demand
Azure Spot VMs30 secondsnone~80% off (Linux)
GCP Spot VMs30 secondsnone~60-91% off
GCP Preemptible VMs (legacy)30 seconds24 hours max~60-80% off

GCP Spot VMs bieten den tiefsten Rabatt, und GCP sendet 30 Sekunden vor der Räumung ein Shutdown-Skript. AWS Spot bietet die sanfteste Benachrichtigung (2 Minuten), was Batch-Jobs Zeit zum Prüfpunktieren gibt.

Für Unterbrechung entwickeln

Die vier Muster, die Spot zuverlässig machen:

  1. Prüfpunkt und Fortsetzen — schreiben Sie alle paar Minuten Fortschritt in dauerhaften Speicher (S3, Cloud Storage) und starten Sie auf einer Ersatzinstanz vom letzten Prüfpunkt neu.
  2. Verteilte Arbeits-Warteschlange — verwenden Sie eine Warteschlange (SQS, Pub/Sub, Service Bus), um Arbeitseinheiten zu verteilen. Wenn eine Instanz geräumt wird, kehrt die Arbeitseinheit zur Warteschlange zurück, damit eine andere Instanz sie aufgreift.
  3. Multi-Instanz + Auto-Scaler — betreiben Sie mindestens 2 Spot-Instanzen hinter einem Load Balancer und konfigurieren Sie einen Auto-Scaler zum Starten eines Ersatzes, wenn eine geräumt wird.
  4. Spot + On-Demand-Mix — betreiben Sie 70 bis 90 Prozent der Kapazität auf Spot und den Rest auf On-Demand oder reserviert, sodass die Arbeitslast elegant degradiert statt vollständig zu stoppen, wenn Spot nicht verfügbar ist.

Spot Fleet und Capacity Rebalancing

AWS Spot Fleet und Azure Spot VM Scale Sets lassen Sie eine Zielkapazität über mehrere Instanztypen und Availability Zones hinweg anfordern, was die Wahrscheinlichkeit dramatically senkt, dass Ihre gesamte Spot-Kapazität auf einmal zurückgefordert wird. Konfigurieren Sie die Flotte so, dass sie 3 bis 5 Instanztypen über 2 bis 3 Zonen spannt, und die Wahrscheinlichkeit eines Totalverlusts fällt unter 1 Prozent pro Monat.

GCP hat kein direktes Spot Fleet-Äquivalent, aber MIG (Managed Instance Group) mit mehreren Instanzvorlagen und der proactiveRefresh-Einstellung erreicht einen ähnlichen Effekt.

Kostenverfolgung

Spot-Preise schwanken mit der Nachfrage, sodass eine Arbeitslast, die heute $0.029/Stunde kostet, nächste Woche $0.058/Stunde kosten könnte. Setzen Sie Billing-Alerts bei 110 Prozent des rollierenden 30-Tage-Durchschnitts und konfigurieren Sie Ihre Flotte so, dass sie automatisch auf On-Demand zurückfällt, wenn der Spot-Preis den On-Demand-Preis übersteigt — dann bietet Spot keine Ersparnis mehr und fügt nur Unterbrechungsrisiko hinzu.

Siehe den AWS vs Azure Compute-Vergleich für den Spot-Rabatt pro Instanz und den Reserved Instances-Leitfaden für die Commitment-Strategie, die auf den On-Demand-Anteil Ihrer gemischten Flotte angewendet werden soll.

Other languages