AI iş yükünü sınıflandırın
Eğitim, ince ayar, çıkarım, görselleştirme, render veya bilimsel hesaplama türünü; model, veri, hassasiyet ve hedef süreyle tanımlayın.
Gigabyte GPU ve AI server seçimi, yalnız GPU modeline veya adedine indirgenemez. İş yükünün bellek ve iletişim profiliyle CPU, RAM, NVMe, ağ, güç, soğutma ve yazılım katmanını birlikte tasarlamak gerekir.
Eğitim, ince ayar, çıkarım, görselleştirme, render veya bilimsel hesaplama türünü; model, veri, hassasiyet ve hedef süreyle tanımlayın.
Modelin, batch boyutunun, eş zamanlı işlerin ve framework belleğinin tek GPU’ya mı yoksa birden fazla GPU’ya mı sığacağını pilotla doğrulayın.
PCIe kart, baseboard/HGX veya desteklenen diğer mimarileri; GPU arası bağlantı, paylaşım, servis kolaylığı ve yazılım desteğiyle karşılaştırın.
Veri hazırlama, ön işleme ve GPU besleme için işlemci çekirdeği, bellek kapasitesi, PCIe hatları ve NUMA yerleşimini birlikte planlayın.
Yerel NVMe scratch alanı, veri seti deposu, checkpoint akışı ve sunucular arası trafiğin bant genişliği ile gecikme hedefini hesaplayın.
PDU, giriş gerilimi, ısı yükü, hava veya sıvı soğutma, sürücü, framework, container, işletim sistemi ve destek matrisi birlikte kontrol edilir.
Eğitim çoğunlukla yüksek GPU belleği, GPU arası hızlı iletişim ve uzun süreli tam yük ister. Çıkarımda ise gecikme, eş zamanlılık, model sıkıştırma, enerji ve ölçekleme yöntemi daha belirleyici olabilir. Aynı model adı, iki iş yükünde farklı sunucu gerektirebilir.
PCIe GPU sistemleri farklı kart adedi ve genişleme seçenekleri sunabilir. HGX veya benzeri baseboard tabanlı platformlar ise belirli hızlandırıcıların yüksek bant genişlikli bağlantısını ve yoğun çoklu GPU iş yüklerini hedefler. Seçim yalnız GPU adedine göre yapılmaz.
GPU sayısı; modelin belleğe sığıp sığmaması, paralelleştirme verimi, veri miktarı, hedef süre ve yazılım lisanslama/orkestrasyon yapısıyla belirlenir. Sekiz GPU her iş yükünde dört GPU’nun iki katı hız sağlamaz.
GPU güçlü olsa bile veri hazırlama, sıkıştırma, decoding, ön işleme veya checkpoint akışı CPU, RAM ve depolamada tıkanabilir. Sunucu, yalnız hızlandırıcı kutusu olarak değil uçtan uca veri hattı olarak boyutlandırılmalıdır.
Tek sunuculu sistemde bile veri setinin depodan GPU’ya yetişmesi gerekir. Çoklu düğümde ayrıca GPU kolektif iletişimi, paralel dosya sistemi veya nesne deposu ve yönetim ağı ayrı kapasite hedefleri taşır.
Yoğun GPU sistemleri yüksek elektrik ve ısı yükü oluşturabilir. Sunucunun güç kaynağı kapasitesi yeterli olsa bile tesis giriş gerilimi, PDU, priz, rack başına güç, hava akışı veya sıvı soğutma altyapısı yetersiz olabilir.
Canlı katalogdaki örnekler, GPU adedinden önce iş yükü ve platform tipine göre incelenmelidir. Kesin hızlandırıcı desteği tam model ve revizyonla doğrulanır.
| Sınıf | Uygun olabilecek senaryo | Canlı katalogdan örnekler |
|---|---|---|
| Edge GPU | Kaynağa yakın görüntü işleme ve düşük gecikmeli çıkarım | E263-S30-AAD1, E263-Z34-AAJ1 |
| 2U PCIe GPU | Kompakt AI geliştirme, çıkarım, render veya sınırlı GPU eğitimi | G294-S42-AAP2, G294-Z21-AAP2 |
| 4U çoklu PCIe GPU | Daha fazla hızlandırıcı ve genişleme isteyen AI/HPC işleri | G494-SB4-AAP2 |
| 8U HGX sınıfı | Yoğun çoklu GPU eğitimi ve büyük ölçekli paralel hesaplama | G894-AD1-AAX5, G894-SD3-AAX7 |
| Genel rack + GPU | Az sayıda hızlandırıcıyla CPU ağırlıklı karma iş yükü | Modelin PCIe, güç, riser ve GPU QVL desteği ayrıca doğrulanır |
Gigabyte GPU server, bir veya daha fazla hesaplama hızlandırıcısını CPU, bellek, depolama, ağ, güç ve soğutma altyapısıyla birleştiren kurumsal sunucu platformudur. AI, HPC, render ve veri analitiği gibi paralel iş yüklerinde kullanılır.
Terimler örtüşebilir; ancak AI server ifadesi eğitim ve çıkarım için GPU veya başka hızlandırıcılarla birlikte doğrulanmış tüm sistemi vurgular. Her GPU server her AI yazılımı veya hızlandırıcıyla otomatik olarak uyumlu değildir.
Model boyutu, GPU belleği, eğitim/çıkarım türü, batch, hassasiyet, hedef süre ve paralelleştirme verimi bilinmeden sayı belirlenemez. Önce pilot ölçüm, sonra ölçek testi yapılmalıdır.
PCIe sistemler kart ve genişleme esnekliği sunabilir; HGX/baseboard platformlar yoğun çoklu GPU bağlantısı gerektiren iş yüklerini hedefler. Yazılım, iletişim, bütçe, güç ve soğutma koşulları birlikte değerlendirilir.
Seçim; desteklenen GPU topolojisi, PCIe kapasitesi, CPU ön işleme, bellek, uygulama sertifikasyonu, lisans ve platformun güncel QVL listesine göre yapılır. Marka adına göre evrensel bir kazanan yoktur.
Her iş yükünde zorunlu değildir; ancak veri seti cache, scratch, checkpoint ve yüksek hızlı veri besleme gereken projelerde yerel NVMe önemli olabilir. Kapasite ve dayanıklılık iş akışıyla hesaplanmalıdır.
Rack derinliği, ağırlık, giriş gerilimi, PDU, güç, ısı yükü, hava veya sıvı soğutma, ağ ve servis alanı ölçülmeden karar verilemez. Tesis uygunluğu tekliften önce doğrulanmalıdır.
Fiyat; tam platform, GPU türü ve adedi, CPU, RAM, NVMe, NIC, riser, güç, soğutma, yazılım, garanti ve hizmet kapsamından oluşan BOM’a göre belirlenir. Stok ve tedarik teklif anında doğrulanır.
Model, veri seti, eğitim veya çıkarım hedefi, GPU belleği, ağ, rack ve güç koşullarını tek teknik kapsamda toplayarak doğru platform kısa listesini oluşturun.
Birincil ve resmî kaynaklar