AI Eğitimi · Çıkarım · HPC · GPU

Gigabyte GPU ve AI Server Seçim Rehberi

Gigabyte GPU ve AI server seçimi, yalnız GPU modeline veya adedine indirgenemez. İş yükünün bellek ve iletişim profiliyle CPU, RAM, NVMe, ağ, güç, soğutma ve yazılım katmanını birlikte tasarlamak gerekir.

Nasıl çalışır?

Temel işleyiş

1

AI iş yükünü sınıflandırın

Eğitim, ince ayar, çıkarım, görselleştirme, render veya bilimsel hesaplama türünü; model, veri, hassasiyet ve hedef süreyle tanımlayın.

2

GPU bellek ihtiyacını ölçün

Modelin, batch boyutunun, eş zamanlı işlerin ve framework belleğinin tek GPU’ya mı yoksa birden fazla GPU’ya mı sığacağını pilotla doğrulayın.

3

Hızlandırıcı topolojisini seçin

PCIe kart, baseboard/HGX veya desteklenen diğer mimarileri; GPU arası bağlantı, paylaşım, servis kolaylığı ve yazılım desteğiyle karşılaştırın.

4

CPU, RAM ve veri yolunu dengeleyin

Veri hazırlama, ön işleme ve GPU besleme için işlemci çekirdeği, bellek kapasitesi, PCIe hatları ve NUMA yerleşimini birlikte planlayın.

5

Depolama ve küme ağını boyutlandırın

Yerel NVMe scratch alanı, veri seti deposu, checkpoint akışı ve sunucular arası trafiğin bant genişliği ile gecikme hedefini hesaplayın.

6

Güç, soğutma ve yazılımı doğrulayın

PDU, giriş gerilimi, ısı yükü, hava veya sıvı soğutma, sürücü, framework, container, işletim sistemi ve destek matrisi birlikte kontrol edilir.

AI eğitimi ile çıkarım arasındaki fark

Eğitim çoğunlukla yüksek GPU belleği, GPU arası hızlı iletişim ve uzun süreli tam yük ister. Çıkarımda ise gecikme, eş zamanlılık, model sıkıştırma, enerji ve ölçekleme yöntemi daha belirleyici olabilir. Aynı model adı, iki iş yükünde farklı sunucu gerektirebilir.

  • Eğitim için model ve optimizer belleği, batch boyutu ve checkpoint süresi
  • Çıkarım için istek/saniye, ilk token gecikmesi ve eş zamanlı kullanıcı
  • İnce ayar için kullanılan yöntem ve tam model belleği
  • Görüntü, video veya bilimsel hesaplama için veri giriş/çıkış profili
  • Tek sunucu mu, birden fazla düğüm mü ölçekleneceği

PCIe GPU ile HGX/baseboard farkı

PCIe GPU sistemleri farklı kart adedi ve genişleme seçenekleri sunabilir. HGX veya benzeri baseboard tabanlı platformlar ise belirli hızlandırıcıların yüksek bant genişlikli bağlantısını ve yoğun çoklu GPU iş yüklerini hedefler. Seçim yalnız GPU adedine göre yapılmaz.

  • Desteklenen tam GPU modeli, form faktörü ve güç sınırı
  • GPU arası bağlantı topolojisi ve uygulamanın iletişim yoğunluğu
  • Riser, slot aralığı, hava akışı ve kart servis erişimi
  • Sürücü, framework ve sertifikalı yazılım matrisi
  • Yükseltme esnekliği ile doğrulanmış platform bütünlüğü arasındaki denge

Kaç GPU gerekir?

GPU sayısı; modelin belleğe sığıp sığmaması, paralelleştirme verimi, veri miktarı, hedef süre ve yazılım lisanslama/orkestrasyon yapısıyla belirlenir. Sekiz GPU her iş yükünde dört GPU’nun iki katı hız sağlamaz.

  • Önce tek GPU bellek ve süre ölçümü yapılır.
  • İki veya dört GPU ölçeğinde iletişim ve veri besleme darboğazı ölçülür.
  • Sekiz GPU gereksinimi gerçek eğitim/çıkarım hedefiyle gerekçelendirilir.
  • Çoklu düğümde küme ağı ve toplu iletişim performansı ayrıca test edilir.
  • Boşta kalma ve iş paylaşımı için zamanlayıcı veya orkestrasyon planlanır.

CPU, RAM ve NVMe neden önemlidir?

GPU güçlü olsa bile veri hazırlama, sıkıştırma, decoding, ön işleme veya checkpoint akışı CPU, RAM ve depolamada tıkanabilir. Sunucu, yalnız hızlandırıcı kutusu olarak değil uçtan uca veri hattı olarak boyutlandırılmalıdır.

  • CPU çekirdeği ve saat profili, veri hazırlama ve uygulama süreçleriyle eşleştirilir.
  • RAM, veri önbelleği ve CPU-GPU besleme için yeterli kapasiteyle planlanır.
  • PCIe hatları GPU, NIC ve NVMe cihazları arasında paylaşılır.
  • Yerel NVMe alanı dataset cache, scratch ve checkpoint için ayrı hesaplanır.
  • NUMA ve GPU yakınlığı uygulama yerleşiminde dikkate alınır.

Ağ ve depolama nasıl planlanır?

Tek sunuculu sistemde bile veri setinin depodan GPU’ya yetişmesi gerekir. Çoklu düğümde ayrıca GPU kolektif iletişimi, paralel dosya sistemi veya nesne deposu ve yönetim ağı ayrı kapasite hedefleri taşır.

  • Dataset okuma ve checkpoint yazma bant genişliği ölçülür.
  • Sunucu içi yerel NVMe ile paylaşımlı depo rolleri ayrılır.
  • Küme ağı için bant genişliği kadar gecikme ve topoloji değerlendirilir.
  • Yönetim, depolama ve hesaplama trafiği mantıksal veya fiziksel olarak ayrılır.
  • Switch portu, transceiver, kablo ve NIC/OCP seçenekleri BOM’a dahil edilir.

Güç ve soğutma nasıl doğrulanır?

Yoğun GPU sistemleri yüksek elektrik ve ısı yükü oluşturabilir. Sunucunun güç kaynağı kapasitesi yeterli olsa bile tesis giriş gerilimi, PDU, priz, rack başına güç, hava akışı veya sıvı soğutma altyapısı yetersiz olabilir.

  • Sunucu, GPU ve CPU için üretici güç sınırları ayrı kontrol edilir.
  • Normal, tepe ve yedeklilik senaryoları PDU kapasitesiyle eşleştirilir.
  • Rack başına toplam ısı yükü ve fan basıncı hesaplanır.
  • Hava ve doğrudan sıvı soğutmalı varyantlar aynı altyapı kabul edilmez.
  • Teslimden önce rack, elektrik, ağ ve soğutma hazır olma kontrolü yapılır.

Gigabyte GPU server sınıfları nasıl kısa listeye alınır?

Canlı katalogdaki örnekler, GPU adedinden önce iş yükü ve platform tipine göre incelenmelidir. Kesin hızlandırıcı desteği tam model ve revizyonla doğrulanır.

SınıfUygun olabilecek senaryoCanlı katalogdan örnekler
Edge GPUKaynağa yakın görüntü işleme ve düşük gecikmeli çıkarımE263-S30-AAD1, E263-Z34-AAJ1
2U PCIe GPUKompakt AI geliştirme, çıkarım, render veya sınırlı GPU eğitimiG294-S42-AAP2, G294-Z21-AAP2
4U çoklu PCIe GPUDaha fazla hızlandırıcı ve genişleme isteyen AI/HPC işleriG494-SB4-AAP2
8U HGX sınıfıYoğun çoklu GPU eğitimi ve büyük ölçekli paralel hesaplamaG894-AD1-AAX5, G894-SD3-AAX7
Genel rack + GPUAz sayıda hızlandırıcıyla CPU ağırlıklı karma iş yüküModelin PCIe, güç, riser ve GPU QVL desteği ayrıca doğrulanır
Sık sorulan sorular

Konuyla ilgili net cevaplar

Gigabyte GPU server nedir?

Gigabyte GPU server, bir veya daha fazla hesaplama hızlandırıcısını CPU, bellek, depolama, ağ, güç ve soğutma altyapısıyla birleştiren kurumsal sunucu platformudur. AI, HPC, render ve veri analitiği gibi paralel iş yüklerinde kullanılır.

Gigabyte AI server ile GPU server aynı şey mi?

Terimler örtüşebilir; ancak AI server ifadesi eğitim ve çıkarım için GPU veya başka hızlandırıcılarla birlikte doğrulanmış tüm sistemi vurgular. Her GPU server her AI yazılımı veya hızlandırıcıyla otomatik olarak uyumlu değildir.

Yapay zekâ için kaç GPU gerekir?

Model boyutu, GPU belleği, eğitim/çıkarım türü, batch, hassasiyet, hedef süre ve paralelleştirme verimi bilinmeden sayı belirlenemez. Önce pilot ölçüm, sonra ölçek testi yapılmalıdır.

PCIe GPU server mı HGX server mı seçilmeli?

PCIe sistemler kart ve genişleme esnekliği sunabilir; HGX/baseboard platformlar yoğun çoklu GPU bağlantısı gerektiren iş yüklerini hedefler. Yazılım, iletişim, bütçe, güç ve soğutma koşulları birlikte değerlendirilir.

GPU serverda AMD EPYC mi Intel Xeon mu seçilmeli?

Seçim; desteklenen GPU topolojisi, PCIe kapasitesi, CPU ön işleme, bellek, uygulama sertifikasyonu, lisans ve platformun güncel QVL listesine göre yapılır. Marka adına göre evrensel bir kazanan yoktur.

GPU server için NVMe gerekli mi?

Her iş yükünde zorunlu değildir; ancak veri seti cache, scratch, checkpoint ve yüksek hızlı veri besleme gereken projelerde yerel NVMe önemli olabilir. Kapasite ve dayanıklılık iş akışıyla hesaplanmalıdır.

8 GPU server mevcut veri merkezine kurulabilir mi?

Rack derinliği, ağırlık, giriş gerilimi, PDU, güç, ısı yükü, hava veya sıvı soğutma, ağ ve servis alanı ölçülmeden karar verilemez. Tesis uygunluğu tekliften önce doğrulanmalıdır.

Gigabyte GPU server fiyatı nasıl belirlenir?

Fiyat; tam platform, GPU türü ve adedi, CPU, RAM, NVMe, NIC, riser, güç, soğutma, yazılım, garanti ve hizmet kapsamından oluşan BOM’a göre belirlenir. Stok ve tedarik teklif anında doğrulanır.

GPU server yatırımını pilot verisiyle boyutlandırın

Model, veri seti, eğitim veya çıkarım hedefi, GPU belleği, ağ, rack ve güç koşullarını tek teknik kapsamda toplayarak doğru platform kısa listesini oluşturun.