Sayfa İçerikleri
ToggleYapay zeka modellerinin eğitilmesi ve canlı ortamlarda kullanılması, veri merkezi donanımlarına benzeri görülmemiş bir yük bindirmektedir. Şirketler yapay zeka projeleri için altyapı tasarlarken bütçelerinin neredeyse tamamını en güçlü Grafik İşlem Birimlerine (GPU) ayırma eğilimindedir. İşlemci (CPU) ve bellek (RAM) gibi diğer bileşenler de dikkatle seçilse de, çoğu zaman göz ardı edilen ve sistemin en büyük darboğazını yaratan bileşen ağ (Network) altyapısıdır.
Geleneksel web sunucularında veya sıradan veritabanı kümelerinde 10 Gbps (Gigabit per second) bant genişliğine sahip standart bir Ethernet bağlantısı fazlasıyla yeterli kabul edilir. Ancak yapay zeka iş yükleri (AI Workloads), veri paketlerinin ağ üzerinde nasıl hareket ettiğine dair tüm eski kuralları yeniden yazmıştır. Özellikle milyarlarca parametreye sahip Büyük Dil Modellerinin (LLM) eğitilmesi (Training) sürecinde, sunucular arasındaki veri trafiğinin hacmi ve hızı, doğrudan modelin eğitim süresini ve GPU’ların kullanım verimliliğini (Utilization) belirler.
Dünyanın en pahalı ve en hızlı GPU’larını satın alsanız bile, onları bağlayan ağ altyapısı yavaş veya gecikmeli (Latency) ise, bu devasa işlemciler saatlerce birbirlerinden veri gelmesini bekleyerek boşta (Idle) kalırlar. Şirketiniz, kapasitesini kullanamadığı donanımlara milyonlarca dolar harcamış olur.
Bu rehberde, yapay zeka iş yüklerinde ağ bant genişliğinin (Network Bandwidth) neden bu kadar kritik olduğunu, GPU’dan GPU’ya iletişimin (GPU-to-GPU Communication) doğasını ve RDMA gibi teknolojilerin bu iletişimdeki rolünü derinlemesine inceleyeceğiz. Ayrıca 10, 25, 100 ve 400 Gbps bağlantı hızlarının hangi yapay zeka senaryolarında gerekli olduğunu teknik bir perspektifle karşılaştıracağız.
Yapay Zeka Altyapılarında Ağ Trafiğinin Doğası
Yapay zeka sunucularının ağ ihtiyacını anlamak için, geleneksel sunucularla aralarındaki trafik yönü farkını kavramak gerekir.
Klasik web sitelerinde veya uygulamalarda trafiğin büyük bir kısmı Kuzey-Güney (North-South) trafiği olarak adlandırılır. Bu, dışarıdaki bir kullanıcının internet üzerinden veri merkezindeki sunucuya bağlanması (Kuzey’den Güney’e) ve sunucunun cevap vermesi (Güney’den Kuzey’e) anlamına gelir.
Yapay zeka model eğitimlerinde ise trafiğin neredeyse tamamı Doğu-Batı (East-West) trafiği şeklindedir. Yani dış dünyadan çok az istek gelir; asıl muazzam veri trafiği, aynı veri merkezi içindeki, hatta aynı kabindeki sunucuların birbirleri arasında gerçekleşir.
Dağıtık Eğitim (Distributed Training) Neden Devasa Bir Ağ İhtiyacı Doğurur?
Modern yapay zeka modelleri (örneğin 70 milyar parametreli bir Llama 3 modeli) tek bir GPU’nun, hatta sekiz GPU’lu tek bir fiziksel sunucunun belleğine (VRAM) sığmayacak kadar büyüktür. Bu modelleri eğitmek aylar sürebilir. Eğitim süresini kısaltmak için veri bilimciler Dağıtık Eğitim (Distributed Training) yöntemini kullanırlar.
Dağıtık eğitimde, devasa model matematiksel olarak parçalara bölünür ve onlarca, bazen yüzlerce farklı fiziksel sunucuya (Node) dağıtılır. Veri seti bu sunuculara paylaştırılır ve her sunucu kendi payına düşen veriyi hesaplamaya başlar.
Ancak her bir hesaplama döngüsünün (Epoch/Step) sonunda, bir GPU’nun elde ettiği matematiksel ağırlık (Weight) güncellemelerinin (Gradients) diğer tüm GPU’lara iletilmesi ve tüm ağın senkronize edilmesi gerekir. 64 adet GPU’nun saniyede binlerce kez kendi aralarında terabaytlarca matematiksel veriyi değiş tokuş yaptığını düşünün. Eğer bu veri senkronizasyonu milisaniyeler içinde gerçekleşmezse, hiçbir GPU bir sonraki hesaplama adımına geçemez. Ağ ne kadar yavaşsa, GPU’lar o kadar uzun süre bekler (Network Bottleneck).
GPU’dan GPU’ya İletişim: Geleneksel Ağların Çöküşü
Geleneksel ağ mimarilerinde (TCP/IP üzerinden standart Ethernet), bir sunucudaki uygulamanın diğer sunucuya veri gönderebilmesi için verinin uzun bir işletim sistemi (OS) yolculuğundan geçmesi gerekir.
Veri önce uygulamanın belleğinden işletim sisteminin belleğine (Kernel Buffer) kopyalanır. Oradan ağ kartına (NIC) iletilir. Karşı sunucuda da aynı işlem tersten yapılır. Bu kopyalama işlemleri işlemciyi (CPU) yorar ve veri transferine inanılmaz bir gecikme (Latency) ekler. Web sayfaları için bu gecikme önemsizdir ancak GPU senkronizasyonunda ölümcüldür.
RDMA (Remote Direct Memory Access) Mucizesi
Yapay zeka ağlarında bu işletim sistemi gecikmesini ortadan kaldırmak için RDMA (Uzaktan Doğrudan Bellek Erişimi) teknolojisi kullanılır.
RDMA, adından da anlaşılacağı gibi, bir sunucunun ağ kartının (NIC), hedef sunucunun CPU’sunu veya işletim sistemini tamamen bypass ederek (es geçerek) veriyi doğrudan diğer sunucunun belleğine (RAM veya doğrudan GPU VRAM’ine) yazmasını veya okumasını sağlar.
NVIDIA’nın GPUDirect RDMA teknolojisi bu kavramı bir adım öteye taşır. A sunucusundaki GPU1’in hesapladığı veri, hiçbir şekilde kendi CPU’suna veya RAM’ine uğramadan, doğrudan PCIe hattı üzerinden ağ kartına iletilir ve ağ üzerinden B sunucusundaki GPU2’nin VRAM’ine yazılır. Bu teknoloji gecikmeyi mikrosaniyelere indirir ve devasa bant genişliklerinin tam kapasiteyle kullanılmasını sağlar.
Bu RDMA trafiğini taşımak için veri merkezlerinde genellikle iki farklı fiziksel ağ teknolojisi tercih edilir:
- InfiniBand: Çok düşük gecikme ve kayıpsız veri aktarımı sunan, yapay zeka kümeleri (Cluster) için özel olarak tasarlanmış yüksek performanslı bir ağ mimarisidir.
- RoCE (RDMA over Converged Ethernet): RDMA teknolojisinin geleneksel Ethernet altyapısı üzerinde çalışmasını sağlayan bir protokoldür. InfiniBand kadar özel donanım gerektirmese de, yapılandırılması oldukça karmaşıktır.
10 / 25 / 100 / 400 Gbps: Hangi Hız Ne Zaman Gerekir?
Her yapay zeka projesi InfiniBand veya 400 Gbps bağlantı gerektirmez. Projenin türü (Eğitim vs. Çıkarım) ve kullanılan veri setinin büyüklüğü, ağ bant genişliği ihtiyacını doğrudan belirler. Şirketler altyapı yatırımı yaparken bütçelerini optimize etmek için bu eşikleri doğru tanımlamalıdır.
10 Gbps ve 25 Gbps: Çıkarım (Inference) ve Geliştirme Ortamları
Elinizde halihazırda eğitilmiş bir model var ve bunu kullanıcılara hizmet vermek (Inference) için canlıya aldıysanız, ağ gereksinimleriniz nispeten düşüktür.
Örneğin bir müşteri hizmetleri sohbet botu (Chatbot) tasarladınız. Kullanıcının gönderdiği birkaç kelimelik soru (Input) ağ üzerinden sunucuya gelir, GPU bu soruyu işler ve yine birkaç kelimelik bir cevap (Output) üretip ağ üzerinden geri gönderir. Burada taşınan verinin boyutu genellikle kilobaytlar seviyesindedir.
Bu tarz standart çıkarım senaryolarında, küçük modellerle yapılan deneylerde (PoC – Proof of Concept) ve veri bilimcilerin geliştirme (Development) ortamlarında 10 Gbps veya 25 Gbps bant genişliğine sahip standart bir Ethernet bağlantısı yeterlidir. Vektör veritabanından (RAG mimarisi için) çekilecek bağlam verisi de aynı sunucu içindeyse veya yakın bir depolama ünitesindeyse, bu hızlar sorun yaratmaz.
100 Gbps: Dağıtık Eğitim, İnce Ayar (Fine-Tuning) ve RAG
Projeniz standart bir sohbet botundan çıkıp, büyük veri kümelerini analiz eden bir sisteme dönüştüğünde ağ trafiği yoğunlaşır.
- Büyük Ölçekli İnce Ayar (Fine-Tuning): Kendi kurumsal verilerinizle (yüz binlerce PDF veya veritabanı kaydı) açık kaynaklı bir modele (örneğin Llama 3) ince ayar (Fine-tuning) yapıyorsanız ve bu işlem için birden fazla sunucu (Multi-Node) kullanıyorsanız, sunucular arası (Doğu-Batı) trafik artar. GPU’ların eğitim sürecinde ağırlıkları senkronize etmesi için yüksek hıza ihtiyaç vardır.
- Yoğun Veri Tüketen RAG Sistemleri: RAG (Bilgi Getirme Destekli Üretim) mimarilerinde model, kullanıcının sorusuna cevap vermeden önce vektör veritabanından gigabaytlarca referans belgeyi okumak zorundadır. Eğer vektör veritabanınız ve GPU sunucularınız farklı makinelerdeyse, bu verinin hızla aktarılması gerekir.
- Ağ Üzerinden Depolama (Network Storage): Eğitim veri setleriniz (Datasets) sunucunun kendi içindeki disklerde değil de ayrı bir NAS/SAN (Network Attached Storage) sisteminde duruyorsa, veriyi GPU’ya ulaştırmak için yüksek bir bant genişliğine ihtiyacınız vardır.
Bu senaryolar için veri merkezi standartlarında 100 Gbps ağ bağlantısı artık bir lüks değil, gerekliliktir. RDMA desteği (RoCE) ile yapılandırılmış 100 Gbps ağlar, GPU’ların veri bekleme sürelerini minimize eder.
400 Gbps ve Üzeri (InfiniBand/RoCEv2): Devasa LLM Eğitimi ve Superpod’lar
Ağ teknolojilerinin sınırlarının zorlandığı nokta, sıfırdan devasa Büyük Dil Modellerinin (LLM) eğitildiği veya on binlerce GPU’nun birbiriyle eşzamanlı çalıştığı senaryolardır.
Trilyonlarca parametresi olan bir modeli sıfırdan eğitmek (Pre-training) için, petabaytlarca (PB) verinin binlerce GPU’ya aynı anda ve sürekli olarak akması gerekir. Bu işlemde kullanılan Tensor Paralelizmi (Tensor Parallelism) veya Ardışık Düzen Paralelizmi (Pipeline Parallelism) gibi teknikler, bir GPU’daki matris çarpımının yarısının diğer GPU’da tamamlanmasını gerektirir. Bu durum, GPU’lar arasında saniyede terabaytlarca veri değişimine neden olur.
Bu seviyedeki projeler (örneğin OpenAI, Meta veya büyük ulusal yapay zeka projeleri), standart Ethernet mimarilerini tamamen terk eder. Sunucular arasındaki veri yolları, her biri 400 Gbps (veya 800 Gbps) kapasiteli çoklu ağ kartlarıyla (NIC) donatılır. İletişim, veri paketlerinin sırasının karışmasına veya kaybolmasına kesinlikle tahammülü olmayan, çok düşük gecikmeli InfiniBand anahtarları (Switch) üzerinden yürütülür. Bu devasa GPU kümelerine genellikle “Superpod” veya “Cluster” adı verilir ve ağ mimarisi, yapay zeka yatırımının en pahalı ve karmaşık bölümlerinden birini oluşturur.
Sonuç: Yatırım Öncesi Altyapı Dengesini Kurmak
Yapay zeka iş yüklerini çalıştıracak bir altyapı kiralarken veya satın alırken, odak noktasını sadece GPU modeline (örneğin H200 veya L40S) kaydırmak yaygın bir mühendislik hatasıdır.
Sisteminizdeki en pahalı bileşen olan GPU’nun tam kapasiteyle (Utilization) çalışması, ona veriyi ne kadar hızlı ulaştırabildiğinize bağlıdır. Eğer eğitim verileriniz uzak bir depolama ünitesindeyse ve sunucunuzun ağ kartı sadece 10 Gbps destekliyorsa, dünyanın en hızlı ekran kartı bile o 10 Gbps’lik borudan geçecek veriyi saatlerce boşta bekler.
Kurumsal yapay zeka dağıtımlarında;
- Tek bir sunucunun içindeki bileşenlerin iletişimi (PCIe hatları, NVMe diskler),
- Sunucuların kendi aralarındaki iletişim (East-West Traffic, RDMA, 100/400 Gbps),
- Uygulamanın dış dünyaya çıkışı (North-South Traffic, Çıkarım gecikmesi)
bir bütün olarak değerlendirilmeli ve darboğazlar önceden tespit edilmelidir. Güçlü bir yapay zeka altyapısı, GPU’nun saf gücü ile ağın veri taşıma yeteneğinin kusursuz bir uyum içinde çalıştığı heterojen bir ekosistemdir.
Kurumsal AI iş yükleriniz için RDMA destekli, yüksek hızlı ağ altyapısına sahip sunucu çözümlerini inceleyebilir; dağıtık eğitim ve Superpod senaryoları için GPU sunucu kiralama seçeneklerini değerlendirebilirsiniz.
Sık Sorulan Sorular
AI projelerinde network bandwidth neden bu kadar önemli?
Dağıtık eğitimde onlarca GPU sunucusu, gradyan güncellemelerini saniyede binlerce kez senkronize etmek zorundadır. Ağ yavaşsa GPU’lar veri bekleyerek boşta kalır ve donanım yatırımı israf edilir.
RDMA nedir ve neden AI ağlarında kullanılır?
RDMA (Remote Direct Memory Access), bir sunucunun ağ kartının hedef sunucunun CPU ve işletim sistemini bypass ederek veriyi doğrudan bellek veya GPU VRAM’ine yazmasını sağlar. Bu, gecikmeyi mikrosaniyelere indirir ve bant genişliğini tam kapasiteyle kullanmayı mümkün kılar.
InfiniBand ile RoCE arasındaki fark nedir?
InfiniBand, AI kümeleri için özel tasarlanmış, çok düşük gecikmeli ve kayıpsız bir ağ mimarisidir. RoCE ise RDMA’yı standart Ethernet üzerinde çalıştırır; daha ekonomiktir ancak yapılandırması karmaşıktır.
Hangi durumda 100 Gbps, hangi durumda 400 Gbps gerekir?
100 Gbps; çok sunuculu ince ayar, yoğun RAG ve ağ üzerinden depolama senaryoları için gereklidir. 400 Gbps ve üzeri (InfiniBand), trilyonlarca parametreli modellerin sıfırdan eğitildiği Superpod mimarilerinde zorunludur.
Kaynaklar
- NVIDIA Technical Documentation (GPUDirect RDMA, InfiniBand, NVLink)
- CNCF AI Infrastructure Whitepapers
- Intel / AMD Data Center Architecture Guidelines


