KATEGORİ |

GPU Paylaşımı Nedir? Bir GPU Aynı Anda Birden Fazla Yapay Zeka Uygulamasına Verilebilir mi?

Yapay zeka (AI) dünyasına giriş yapan şirketlerin donanım yatırımlarını planlarken karşılaştıkları en büyük finansal ve mimari çelişki “Kapasite Uyuşmazlığı”dır. Şirketiniz piyasanın en güçlü kartlarından biri olan 80 GB bellekli bir NVIDIA H100 veya A100 sunucusu kiralar. Ancak yazılım ekibiniz, şirket içi belgeler üzerinde arama yapan 8 Milyar parametreli (Örn: Llama 3 8B) nispeten küçük bir model kullanır.

Sistem canlıya alındığında acı gerçek ortaya çıkar: Model, o devasa 80 GB belleğin (VRAM) sadece 16 GB’ını kullanmaktadır. Geriye kalan 64 GB kapasite, işlem gücü (Compute) ve milyarlarca transistör tamamen “Boşta (Idle)” yatmaktadır. Üstelik bu sunucuya ödediğiniz on binlerce dolar her ay kasanızdan çıkmaya devam eder.

Peki, tek bir fiziksel GPU’nun içindeki o muazzam gücü ve devasa boş alanı, şirketin diğer departmanlarına veya diğer yapay zeka uygulamalarına güvenli bir şekilde bölüştürebilir misiniz?

Cevap: Evet. Sektörel adıyla GPU Sharing (GPU Paylaşımı) ve Multi-Tenancy (Çoklu Kiracılık) adı verilen teknolojiler sayesinde, tek bir GPU’yu adeta küçük apartman dairelerine bölebilirsiniz. Bu rehberde, yapay zeka maliyetlerini yerle bir eden GPU paylaşımının yazılımsal (Time-Slicing) ve donanımsal (NVIDIA MIG) yöntemlerini detaylıca karşılaştırıyor, DALNET’in şirketlere sunduğu esnek bulut vizyonunu açıklıyoruz.

1. Yazılımsal Paylaşım: Time-Slicing (Zaman Dilimleme)

Bir GPU‘yu paylaşmanın en temel yolu yazılımsaldır. Standart bir Kubernetes ortamında veya Docker konteyner yapısında, aynı fiziksel GPU’ya birden fazla uygulamanın erişmesine izin verirsiniz.

Tıpkı bilgisayarınızdaki merkezi işlemcinin (CPU) aynı anda hem müzik çalıp hem de web tarayıcısını açık tutması gibi, GPU da “Zaman Dilimleme” (Time-Slicing) yapar. Milisaniyeler içinde A uygulamasının işini yapar, sonra hızla B uygulamasına geçer. Dışarıdan bakıldığında iki yapay zeka uygulaması da aynı anda çalışıyormuş gibi görünür.

  • Avantajları: Kurulumu çok kolaydır. Özellikle test ve geliştirme (Dev/Test) ortamlarında, mühendislerin aynı GPU üzerinde farklı kodları denemesi için mükemmel ve ucuz bir yoldur.
  • Handikapları (Neden Canlı Ortamda Kullanılmaz?): Bu yöntemde “İzolasyon” yoktur. Uygulamalar GPU’nun belleğini (VRAM) ortak kullanır. Eğer B uygulaması aniden devasa bir veri yüklemeye çalışıp tüm belleği doldurursa (Out of Memory – OOM), GPU çöker ve A uygulaması da (Müşteri hizmetleri botunuz) onunla birlikte kapanır. Ayrıca A uygulaması tüm işlem gücünü sömürürse, B uygulaması saatlerce donar (Gürültülü Komşu – Noisy Neighbor problemi).

İşte bu donma ve çökme riskleri nedeniyle, kritik canlı (Production) yapay zeka sistemlerinde yazılımsal paylaşım kullanılmaz.

2. Donanımsal Paylaşım: NVIDIA MIG (Multi-Instance GPU)

NVIDIA, yazılımsal paylaşımın yarattığı bu “İzolasyon ve Çökme” problemlerini çözmek için Ampere ve Hopper mimarilerinde (A100, H100, H200 vb.) oyunun kurallarını değiştiren bir teknoloji tanıttı: MIG (Multi-Instance GPU).

MIG, paylaşımı yazılımsal olarak değil, Fiziksel / Donanımsal düzeyde yapar.

  • Donanımsal İzolasyon Nasıl Çalışır? 80 GB bellekli tek bir fiziksel GPU’yu (Örn: H100), donanım seviyesinde 7 adet tamamen bağımsız ve küçük sanal GPU’ya bölebilirsiniz. (Örneğin her biri 10 GB belleğe ve belirli sayıda işlemci çekirdeğine sahip 7 küçük dilim – Slice).
  • Kusursuz Duvarlar: Bu 7 küçük GPU, işletim sistemine ve Kubernetes’e 7 ayrı fiziksel ekran kartıymış gibi görünür. Birinci dilimde çalışan Muhasebe AI modeli %100 yükte kilitlense, çökse veya hata verse bile; ikinci dilimde çalışan Pazarlama AI modeli bunu kesinlikle hissetmez (Fault Isolation). Kendi tahsis edilen donanım gücünde sarsılmaz bir performansla (QoS) çalışmaya devam eder.
  • Güvenlik ve Paylaşım: Bellek (VRAM) ve donanım yolları (Cache, Memory Controller) fiziksel olarak ayrıldığı için (Hardware-level isolation), bir model diğer modelin verisini asla okuyamaz.

Fractional GPU (Parçalanmış GPU) ile Maliyet Düşürme

MIG teknolojisi, şirketlerin “Parçalanmış GPU (Fractional GPU)” mantığıyla çalışmasını sağlar. Devasa bir LLM eğitmiyorsanız ve sadece birkaç küçük modeli (Örn: Sesli asistan, belge özetleme) aynı anda çalıştıracaksanız (Inference), tek bir H200 sunucusu kiralayıp içini MIG ile parçalara bölebilirsiniz. Böylece her proje için ayrı ayrı 7 farklı sunucu satın alma veya kiralama (Milyonlarca lira) masrafından kurtulursunuz.

Hangi Yöntemi Ne Zaman Seçmelisiniz?

Şirketinizin yapay zeka stratejisini kurgularken, GPU paylaşım modelini doğru seçmek başarının anahtarıdır:

  1. Eğitim (Training) Yapıyorsanız: Paylaşım yapmayın! Yapay zeka modelini sıfırdan eğitmek (Veya devasa Fine-tuning) tüm GPU gücünü sömürür. Burada GPU bütün (Dedicated) olarak kullanılmalıdır.
  2. Canlı (Production) Çıkarım (Inference) Yapıyorsanız: Şirketinizde çalışan farklı AI servisleri (Örn: Kod asistanı ve Chatbot) varsa, kesinlikle NVIDIA MIG kullanmalısınız. Modeller birbirini etkilemez ve kesintisiz (QoS) hizmet sunarsınız.
  3. Test ve Geliştirme (Dev/Test) Ortamıysa: Mühendislerinizin sadece kod denediği, çökmenin sorun olmadığı laboratuvar ortamlarında yazılımsal Time-Slicing kullanarak maksimum esneklik sağlarsınız.

DALNET GaaS ile Esnek ve Maliyet-Etkin AI Mimarileri

Küresel bulut sağlayıcıları genellikle “Ya hep ya hiç” mantığıyla çalışır ve size devasa GPU’ları astronomik fiyatlarla saatlik olarak satmaya çalışırlar. Atıl kapasitenin parasını cebinizden alırlar.

Türkiye’nin KVKK uyumlu kurumsal bulut merkezi DALNET, şirketlerin GPU maliyetlerini optimize etmesini sağlayan esnek bir GaaS (GPU as a Service) ve Kubernetes altyapısı sunar:

  • Sınırları Olmayan Özelleştirme: Kiraladığınız ayrılmış (Dedicated) NVIDIA donanımları üzerinde (Örn: H200 kümeleri), DALNET altyapısının esnekliği sayesinde MIG (Multi-Instance GPU) konfigürasyonlarını kendi projelerinize göre özgürce yapılandırabilirsiniz.
  • Maliyetleri Parçalayın: Farklı departmanlarınız için ayrı sunucular kiralamak yerine, DALNET’in yüksek performanslı izole ağında kiraladığınız tek bir devasa GPU’yu MIG ile parçalara bölerek tüm şirketinizin yapay zeka ihtiyaçlarını (Çoklu Kiracılık / Multi-Tenancy) tek bir sabit faturayla karşılarsınız.
  • Sürpriz Yok, Tam Güvenlik: KVKK yasalarına tam uyumlu Türkiye veri merkezlerimizde, donanımsal izolasyonla parçaladığınız GPU’larınızda şirket verileriniz (Örn: Şirket içi RAG sistemleri) asla dışarı sızmaz ve %100 güvende kalır.
İlgili İçerikler

Daha Fazla İçerik