Sayfa İçerikleri
ToggleBu devasa rehberde, yapay zeka donanımları dünyasındaki en karmaşık sorunlardan birini çözüyoruz. Büyük dil modeli geliştirmek veya yerel ortamda çalıştırmak isteyen şirketlerin ve uzmanların karşılaştığı en büyük engel doğru donanımı seçmektir. Çoğu insan bir grafik işlemcisinin yalnızca işlem gücüne odaklanır. Oysa sahip olduğunuz video bellek miktarı yani VRAM kapasitesi hangi modellerle çalışabileceğinizi doğrudan ve kesin olarak belirler.
Sektörde dolaşan yirmi dört gigabayt bellek varsa yirmi dört milyar parametreli model kesin çalışır şeklindeki basit hesaplamalar tamamen yanlıştır. Model ağırlıkları, sıkıştırma seviyeleri, bağlam uzunluğu ve kullanılan yazılım çerçevesi gerçek donanım ihtiyacını kökünden değiştirir.
Bu devasa makalede farklı ekran kartlarının hangi boyuttaki yapay zeka modellerini çalıştırabileceğini detaylıca inceliyoruz. Hangi modellerde çıkarım yapabileceğinizi net bir şekilde listeliyoruz. Hangi donanımla ince ayar veya sıfırdan model eğitiminin mümkün olduğunu tüm şeffaflığıyla karşılaştırıyoruz. Ayrıca DALNET bulut altyapısının sunduğu kiralama çözümleriyle donanım krizini nasıl aşacağınızı adım adım anlatıyoruz.
GPU Seçerken Sadece VRAM Kapasitesine mi Bakılır
Hayır kesinlikle sadece VRAM kapasitesine bakılmaz. Bir büyük dil modeli için donanım seçerken çok boyutlu bir analiz yapmalısınız. Sadece belleğe odaklanmak projelerinizi yavaşlatır veya tamamen durdurur. Bir karar vermeden önce en az şu faktörleri mutlaka değerlendirmelisiniz.
Öncelikle donanımın VRAM kapasitesine bakmalısınız. Hemen ardından bellek bant genişliğini incelemelisiniz. Cihazın genel hesaplama performansını ölçmelisiniz. Çipin hangi hassasiyet formatlarını desteklediğini araştırmalısınız. Tensor çekirdeği kapasitesini gözden geçirmelisiniz. Donanımın sıkıştırma algoritmalarına verdiği desteği test etmelisiniz.
Buna ek olarak kartlar arasındaki bağlantı teknolojilerini kıyaslamalısınız. Birden fazla kartı aynı anda kullanma imkanınızı sorgulamalısınız. Sistemin çekeceği elektrik gücünü ve soğutma ihtiyacını hesaplamalısınız. Son olarak cihazın yatırım maliyetini tartmalısınız. Özellikle sadece model çalıştırma tarafında VRAM kapasitesi devasa modeller için ilk bakmanız gereken en kritik kriterdir. Ancak diğer maddeler hızınızı ve verimliliğinizi belirler.
Bir LLM Modelinin GPU Üzerinde Çalışması İçin Ne Kadar VRAM Gerekir
Bir modelin ihtiyaç duyduğu temel bellek miktarı kabaca model parametrelerinin sayısı ve kullanılan hassasiyet formatı ile doğrudan ilişkilidir. Bu hesaplamayı doğru yapmak donanım bütçenizi korur.
Yaklaşık olarak bir parametre başına gereken bellek miktarları şu şekildedir. Standart hassasiyet olan otuz iki bitlik formatta her parametre dört bayt yer kaplar. On altı bitlik formatlarda bu boyut iki bayta düşer. Sekiz bitlik sıkıştırma algoritmalarında boyut bir bayta iner. Dört bitlik aşırı sıkıştırma durumunda ise parametre başına sadece yarım bayt bellek harcarsınız.
Örneğin yedi milyar parametreli bir model çalıştıracağınızı düşünelim. On altı bitlik formatta bu model yaklaşık on dört gigabayt ağırlık belleğine ihtiyaç duyar. Sekiz bitlik sıkıştırma yaparsanız ihtiyaç yedi gigabayta düşer. Dört bitlik sıkıştırmada ise sadece üç buçuk gigabayt bellek tüketirsiniz.
Fakat bu verdiğimiz değerler yalnızca modelin kendi ağırlıklarını ifade eder. Gerçek bir kullanım senaryosunda geçici hafıza önbelleği, sistem çalışma yükü, bağlam uzunluğu ve diğer değişkenler için mutlaka ek bellek gerekir. Bu nedenle donanım seçerken yalnızca teorik minimum değere göre kesinlikle hareket etmemelisiniz. Daima bir güvenlik marjı bırakmalısınız.
GPU VRAM Kapasitesine Göre Hangi LLM Modelleri Çalıştırılabilir
Her donanım seviyesi farklı bir kullanım amacına hizmet eder. Bütçenize ve elinizdeki donanıma göre yapabileceğiniz işlerin sınırlarını bilmek zorundasınız. Gelin kapasitelere göre model sınırlarını tek tek inceleyelim.
8 GB VRAM ile Hangi LLM Modelleri Çalıştırılabilir
Sekiz gigabayt bellek sınıfına sahip cihazlar genellikle standart bilgisayarlarda bulunur. Bu cihazlar daha küçük ve yüksek oranda sıkıştırılmış modeller için uygundur.
Bu seviyede bir milyar ile üç milyar parametre arasındaki modelleri rahatça çalıştırırsınız. Ayrıca sıkıştırılmış bazı yedi milyar parametreli modelleri de sınırları zorlayarak açabilirsiniz. Bu donanımı genellikle yerel bir sohbet robotu kurmak için kullanırsınız. Kod tamamlama eklentilerini çalıştırırsınız. Basit metin üretimi görevlerini yerine getirirsiniz. Küçük yapay zeka uygulamaları geliştirirsiniz. Öğrenme ve test süreçlerini bu kartlarla yönetirsiniz.
Ancak sekiz gigabayt ile devasa modelleri kesinlikle çalıştıramazsınız. Uzun bağlam pencerelerini açamazsınız. Büyük toplu veri işleme görevlerini yapamazsınız. Modele kendi verinizle ince ayar çekemezsiniz. Sıfırdan büyük bir model eğitemezsiniz. Burada modeli sadece çalıştırmak ile onu sıfırdan eğitmek arasındaki o büyük farkı çok iyi anlamalısınız.
12 GB VRAM ile Hangi LLM Modelleri Çalıştırılabilir
On iki gigabayt sınıfı cihazlar küçük ve orta ölçekli sıkıştırılmış modeller için geliştiricilere çok daha fazla esneklik sağlar. Kapasite arttıkça kullanım alanınız doğal olarak genişler.
Bu seviyede üç milyar ile sekiz milyar parametre arasındaki modelleri hızlıca çalıştırırsınız. Ayrıca yüksek oranda sıkıştırılmış on milyar üstü bazı modelleri de sisteme yükleyebilirsiniz. Küçük boyutlu çok modlu görsel ve metin modellerini açabilirsiniz. Bu donanımla yerel bir yapay zeka asistanı kurarsınız. Kendi belgeleriniz üzerinde arama yapan sistemler geliştirirsiniz. Çeşitli akıllı ajan senaryolarını test edersiniz. Küçük ölçekli profesyonel çıkarım işlemleri yaparsınız.
16 GB VRAM ile Hangi LLM Modelleri Çalıştırılabilir
On altı gigabayt bellek seviyesi bireysel kullanıcılar ve bağımsız geliştiriciler için en kullanışlı eşiklerden biridir. Bu seviye ciddi projelerin ilk adımıdır.
Bu kapasiteyle yedi milyar ile on dört milyar parametre arasındaki modelleri harika bir hızla çalıştırırsınız. Ayrıca sıkıştırılmış çok daha büyük modelleri sisteme sığdırırsınız. Bazı orta boy çok modlu modelleri rahatça incelersiniz. Özellikle yedi milyar sınıfı modellerde yüksek hassasiyet oranlarını kullanırsınız. Modele verdiğiniz bağlam penceresini oldukça geniş tutarak uzun metinleri analiz edersiniz.
24 GB VRAM ile Hangi LLM Modelleri Çalıştırılabilir
Yirmi dört gigabayt bellek seviyesi yerel ortamda yapay zeka geliştiren uzmanlar için çok kritik bir eşiktir. Bu donanım seviyesi amatörlükten profesyonelliğe geçişi temsil eder.
Bu donanımlarla yedi, sekiz, on üç ve on dört milyar parametreli modelleri hiçbir sıkıştırma yapmadan doğrudan çalıştırırsınız. Ayrıca otuz milyar ve üzeri sıkıştırılmış modelleri mükemmel bir şekilde açırsınız. Çift kartlı sistemler kurarak yetmiş milyar parametreli devasa modelleri bile agresif sıkıştırma senaryolarıyla çalıştırabilirsiniz.
Yirmi dört gigabaytlık cihazları genellikle bağımsız yapay zeka geliştiricileri tercih eder. Yoğun metin üretimi yapan profesyoneller kullanır. Şirket içi belge arama sistemleri kuran mühendisler bu cihazlara yönelir. Kodlama asistanı geliştiren ekipler bu kartları satın alır. Ayrıca küçük ölçekli ince ayar operasyonları yapan veri bilimciler için bu seviye mükemmel bir başlangıç noktasıdır.
48 GB VRAM ile Hangi LLM Modelleri Çalıştırılabilir
Kırk sekiz gigabayt bellek seviyesi profesyonel iş yüklerine ve kurumsal çalışmalara çok daha geniş bir alan açar. Bu cihazlar genellikle sunucu odalarında barındırılır.
Bu devasa kapasiteyle on üç milyar ile otuz dört milyar parametre arasındaki modelleri kayıpsız formatlarda hızla çalıştırırsınız. Yetmiş milyar sınıfı modelleri ufak sıkıştırmalarla sisteme yüklersiniz. Çok daha büyük bağlam pencereleri açarak koca bir kitabı modele tek seferde okutursunuz. Ayrıca toplu veri işleme kapasitenizi inanılmaz derecede artırırsınız. Bu seviyedeki cihazları yalnızca model çalıştırmak için değil aynı zamanda son derece ciddi ince ayar projeleri için de güvenle kullanırsınız.
80 GB VRAM ile Hangi LLM Modelleri Çalıştırılabilir
Seksen gigabayt bellek seviyesi veri merkezlerinin ve devasa kurumsal laboratuvarların kalbini oluşturur. Bu cihazlar dünyanın en büyük modelleriyle çalışmanıza imkan tanır.
Bu kapasiteyle yüz milyar parametreli modellerde bile çıkarım yapabilirsiniz. Sıkıştırılmış çok daha büyük devasa modelleri sisteme yüklersiniz. Yüz binlerce kelimelik bağlam pencerelerini rahatça açarsınız. Devasa ince ayar projelerini çok hızlı bitirirsiniz. Birden fazla seksen gigabaytlık cihazı birbirine bağlayarak koca bir süper bilgisayar inşa edersiniz. Ancak unutmayın ki seksen gigabaytlık tek bir kart seksen milyar parametreli bir modeli tek başına çalıştıramayabilir. Hassasiyet oranlarını ve önbellek ihtiyaçlarını asla göz ardı etmemelisiniz.
GPU Seviyelerine Göre LLM Karşılaştırma Tablosu
Aşağıdaki tablo donanım kapasiteleri ile model boyutlarını hızlıca eşleştirmenize olanak tanır. Tablodaki verilerin sıkıştırma seviyelerine bağlam uzunluklarına ve kullanılan yazılımlara göre değişebileceğini mutlaka aklınızda bulundurun.
| GPU VRAM | Genel Uygun Model Sınıfı | En Uygun Kullanım Alanı |
| 8 GB | 1B – 7B Sıkıştırılmış Modeller | Deneme ve Küçük İşlemler |
| 12 GB | 3B – 8B Sıkıştırılmış Modeller | Yerel Yapay Zeka Asistanları |
| 16 GB | 7B – 14B Modeller | Standart Geliştirme Ortamı |
| 24 GB | 7B – 30B+ Sıkıştırılmış Modeller | Profesyonel Geliştirme |
| 48 GB | 13B – 70B Sıkıştırılmış Modeller | Profesyonel Kurumsal Kullanım |
| 80 GB+ | Devasa Çok Parametreli Modeller | İleri Düzey Kurumsal Eğitim |
Model Çalıştırmak ve Model Eğitmek Arasındaki Devasa Fark
Yapay zeka dünyasında en çok karıştırılan iki kavram model çalıştırmak yani çıkarım yapmak ile modeli eğitmektir. Bu iki süreç donanım gereksinimleri açısından birbirinden tamamen farklı dünyaları temsil eder. Çünkü bir modeli çalıştırabilmek o modeli kesinlikle eğitebileceğiniz anlamına gelmez.
Sisteme sadece bir soru sorup cevap aldığınız çıkarım aşamasında model yalnızca kendi ağırlıklarına ve çalışmak için ufak bir önbelleğe ihtiyaç duyar. Yani model dosyası on gigabayt ise on beş gigabaytlık bir donanım işinizi görür. Ancak modeli yeni bilgilerle sıfırdan eğittiğiniz süreçte işler inanılmaz derecede karmaşıklaşır.
Eğitim aşamasında sadece model ağırlıklarını değil milyonlarca hesaplama sonucunu geçici olarak bellekte tutmanız gerekir. Eğilimleri, optimizasyon verilerini, aktivasyon fonksiyonlarını ve eğitim yığınlarını aynı anda belleğe sığdırmak zorundasınız. Bu nedenle aynı model için eğitim gereksinimi çıkarım gereksiniminden dört ila on kat daha yüksek boyutlara ulaşır. On gigabaytlık bir modeli eğitmek için yüz gigabayttan fazla belleğe ihtiyaç duyarsınız.
Hangi GPU ile LLM İnce Ayar ve Eğitim Yapılabilir
İnce ayar işlemleri için tek bir donanım tablosu vermek imkansızdır. Çünkü kullanacağınız ince ayar yöntemine göre donanım ihtiyacınız devasa oranlarda değişir. Donanım seçmeden önce yönteminizi kesin olarak belirlemelisiniz.
LoRA İnce Ayar Yöntemi
LoRA yöntemi modelin tamamını eğitmek yerine küçük ve bağımsız uyarlayıcı dosyalar eğitir. Bu nedenle bellek gereksinimi oldukça düşüktür. Yirmi dört gigabaytlık standart bir donanım ile yedi milyar parametreli bir modelde LoRA ince ayarı yapabilirsiniz.
QLoRA İnce Ayar Yöntemi
QLoRA yöntemi modeli önce yüksek oranda sıkıştırır ve ardından LoRA adaptörlerini eğitir. Bu en az bellek tüketen ince ayar yöntemidir. Bu sayede on iki gigabaytlık veya on altı gigabaytlık cihazlarda bile küçük modellere kendi verilerinizi başarılı bir şekilde öğretebilirsiniz.
Tam İnce Ayar Yöntemi
Tam ince ayar yönteminde modelin içindeki milyarlarca parametre aynı anda eğitilir. Bu inanılmaz derecede yüksek bir donanım gücü gerektirir. Sadece yedi milyar parametreli bir modeli tam ince ayara sokmak için bile en az dört adet yirmi dört gigabaytlık donanımı birbirine bağlamanız veya devasa bir seksen gigabaytlık cihaz kiralamanız gerekir. Yetmiş milyar parametreli bir modeli tam eğitime sokmak için yüzlerce gigabayt belleğe sahip süper bilgisayar kümeleri inşa etmek zorundasınız.
7 Milyar Parametreli Modeller İçin GPU Gereksinimleri
Yedi milyar parametreli modeller geliştiricilerin en çok kullandığı ve test ettiği gruptur. Bu modellerin cihazlara göre davranışlarını çok iyi analiz etmelisiniz.
Sekiz gigabaytlık cihazlarda bu modelleri ancak çok yüksek oranda sıkıştırarak çalıştırırsınız. Performans fena değildir ancak uzun metinleri işleyemezsiniz. On iki gigabaytlık cihazlarda çok daha rahat bir nefes alırsınız. Modeli daha düşük sıkıştırmayla ve daha uzun metinlerle çalıştırırsınız. On altı gigabaytlık donanımlarda modelin kapasitesini sonuna kadar kullanırsınız. Kayıpsız formatları denerken geniş pencereler açarsınız. Yirmi dört gigabaytlık sistemlerde ise bu model boyutu için tam bir özgürlük yaşarsınız. Modeli hem kayıpsız çalıştırır hem de QLoRA ile başarılı bir şekilde ince ayar yaparsınız.
13 ve 14 Milyar Parametreli Modeller İçin GPU Gereksinimleri
On üç ve on dört milyar parametreli modeller mantıksal akıl yürütme ve kodlama gibi görevlerde çok daha başarılıdır. Ancak donanım ihtiyaçları doğal olarak daha yüksektir.
On altı gigabaytlık cihazlarda bu modelleri sadece sıkıştırılmış formatlarda çalıştırırsınız. Ancak bağlam pencereniz dar kalır. Yirmi dört gigabaytlık donanımlar bu modeller için en tatlı noktadır. Modelleri rahatça çalıştırır ve orta uzunluktaki metinleri işlersiniz. Kırk sekiz gigabaytlık cihazlarda ise bu modeller için tam bir oyun alanı kurarsınız. Devasa metinleri modele okutur ve karmaşık ince ayar projeleri geliştirirsiniz.
30 ve 34 Milyar Parametreli Modeller İçin GPU Gereksinimleri
Otuz milyar sınıfı modeller profesyonel düzeyde doğruluk ve mükemmel kod üretimi sunar. Ancak bu devleri standart donanımlarda çalıştırmak büyük bir ustalık ister.
Yirmi dört gigabaytlık sistemlerde bu modelleri çalıştırmak için çok agresif sıkıştırma algoritmaları kullanmanız gerekir. Modelin kalitesi biraz düşse de sistem çalışır. Kırk sekiz gigabaytlık cihazlarda bu modeller gerçek potansiyellerine ulaşır. Düşük sıkıştırma oranlarıyla mükemmel kalitede cevaplar alırsınız. Seksen gigabaytlık kurumsal cihazlarda ise bu modellerde hem kayıpsız çıkarım yapar hem de derinlemesine ince ayar süreçleri yürütürsünüz. Ayrıca birden fazla yirmi dört gigabaytlık kartı birbirine bağlayarak da bu devasa modelleri ekonomik bir şekilde çalıştırabilirsiniz.
70 Milyar Parametreli Modeller İçin GPU Gereksinimleri
Yetmiş milyar parametreli modeller yapay zeka dünyasının devasa krallarıdır. Karmaşık veri analizi, mükemmel dil bilgisi ve yüksek düzeyde mantıksal çıkarım yaparlar. Ancak bu kralları beslemek için devasa donanım çiftlikleri gerekir.
Yirmi dört gigabaytlık tek bir donanımda bu devleri çalıştırmanız neredeyse imkansızdır. Kırk sekiz gigabaytlık donanımlarda bile modeli çok agresif şekilde sıkıştırmak zorundasınız. Kalite kaybını göze alsanız da sistem inanılmaz derecede yavaş çalışır. Seksen gigabaytlık cihazlarda bile bu modeli tam performansla eğitmeniz zordur.
Bu devasa modeller için her zaman çoklu donanım mimarileri kurmalısınız. İki adet kırk sekiz gigabaytlık kartı veya iki adet seksen gigabaytlık kartı birbirine bağlamanız gerekir. Burada donanımların toplam kapasitesi kadar kartların kendi aralarında kurduğu köprünün yani veri yolunun hızı da çok kritiktir. Kartlar arası yavaş bir iletişim sistemin performansını tamamen çöpe atar.
Sıkıştırma Yani Quantization Nedir ve GPU İhtiyacını Nasıl Değiştirir
Sıkıştırma diğer adıyla Quantization modeli daha küçük bir alana sığdırmak için kullanılan matematiksel bir mucizedir. Modelin içindeki milyarlarca parametrenin hassasiyetini düşürerek inanılmaz bir alan tasarrufu sağlarsınız.
Modeller eğitim aşamasında genellikle otuz iki bit veya on altı bit formatında kaydedilir. Bir modeli sekiz bit formatına sıkıştırdığınızda donanım ihtiyacınızı yarı yarıya düşürürsünüz. Dört bit formatına sıkıştırdığınızda ise modeli orijinal boyutunun neredeyse beşte birine indirirsiniz. Üstelik bu sıkıştırma işlemleri modelin zeka seviyesinde çok az bir kayba neden olur.
Örnek bir hesaplama yapalım. Yetmiş milyar parametreli bir model on altı bit formatında çalışırken yaklaşık yüz kırk gigabayt bellek harcar. Aynı modeli sekiz bit formatına sıkıştırırsanız yetmiş gigabayt alan tüketir. Dört bit formatında ise model inanılmaz bir şekilde otuz beş gigabayta sığar. Ancak unutmayın bu değerler sadece ağırlık belleği içindir. Sistemin çalışması için her zaman ekstra belleğe ihtiyacınız olacaktır.
Bağlam Uzunluğu GPU Gereksinimini Nasıl Etkiler
Bağlam uzunluğu yani Context Length modeli beslediğiniz metnin büyüklüğüdür. Modele koca bir pdf dosyası okutup özetlemesini istediğinizde bağlam uzunluğunu inanılmaz derecede artırırsınız. Model bu uzun metni işlerken geçici hafızasında yani önbelleğinde muazzam miktarda veri depolar.
Örneğin sekiz milyar parametreli bir model sadece dört bin kelimelik bir metni işlerken oldukça az bellek harcar. Ancak aynı modele yüz yirmi sekiz bin kelimelik bir kitap okutursanız geçici hafıza ihtiyacı gigabaytlarca artar. Bazen modelin kendisi on gigabayt yer kaplarken oluşturduğu geçici hafıza on beş gigabayta ulaşabilir. Bu nedenle donanım seçerken modele sadece kaç parametreli olduğunu sormamalısınız. Modeli günlük hayatta kaç kelimelik metinlerle besleyeceğinizi de mutlaka hesaba katmalısınız.
Aynı Model Neden Farklı Kartlarda Farklı Performans Verir
Modelinizin kapasite sınırlarınıza sığması tek başına hızlı çalışacağı anlamına kesinlikle gelmez. Bir model on altı gigabaytlık iki farklı cihazda tamamen farklı tepki süreleri verebilir. Bu farkı yaratan çok önemli mimari detaylar vardır.
Öncelikle kartın bant genişliği muazzam bir fark yaratır. Bellekten işlemciye veri aktarım hızı ne kadar yüksekse model kelimeleri o kadar hızlı üretir. Cihazın saf hesaplama gücü ve yeni nesil tensör çekirdeklerinin sayısı performansı katlayarak artırır. Ayrıca kartın anakarta bağlandığı iletişim yollarının nesli de veri akışını ciddi şekilde hızlandırır veya yavaşlatır. Sisteminizde birden fazla kart varsa bu kartların birbirleriyle konuştukları özel veri yollarının hızı koca bir kümenin performansını doğrudan etkiler.
İhtiyacınıza Göre Doğru GPU Nasıl Seçilir
Piyasada çok fazla donanım seçeneği var ve her birinin odak noktası tamamen farklı. Yatırımınızı doğru yönlendirmek için öncelikle kendi kullanım senaryonuzu belirlemelisiniz.
Eğer sadece basit bir sohbet robotu çalıştıracaksanız ve uzun metinler yüklemeyecekseniz sekiz veya on iki gigabaytlık cihazlar işinizi fazlasıyla görür. Kodlama modelleri çalıştıracak ve yazılım asistanı geliştirecekseniz en az on altı gigabaytlık sistemlere yönelmelisiniz. Kurum içi belgelerinizi tarayan RAG tabanlı devasa bir araştırma sistemi kuracaksanız yirmi dört gigabaytlık cihazlar sizin için mükemmel bir başlangıç olacaktır.
Birden fazla akıllı ajanın aynı anda çalıştığı karmaşık orkestrasyonlar yapacaksanız kırk sekiz gigabaytlık profesyonel çözümleri değerlendirmelisiniz. Kendi verilerinizle QLoRA gibi yöntemlerle ince ayarlar yapacaksanız yirmi dört gigabaytlık donanımlarda bu süreci başarıyla atlatırsınız. Ancak milyarlarca parametreli yepyeni bir modeli sıfırdan eğitecekseniz seksen gigabaytlık cihazları devasa bir küme haline getirmeli veya DALNET altyapısından kurumsal bulut kiralama modelini tercih etmelisiniz.
Kendi Modelimi Eğitmek İçin Kaç GPU Gerekir
Bu soruyu cevaplarken modeli sıfırdan mı eğiteceğinizi yoksa mevcut bir modele ince ayar mı çekeceğinizi çok net bir şekilde ayırmalısınız.
Sıfırdan bir dil modeli inşa etmek ve ona milyarlarca kelime öğretmek insan üstü bir güç gerektirir. Sadece yedi milyar parametreli bir modeli bile sıfırdan eğitmek için aylarca çalışacak devasa donanım kümeleri kurmalısınız. İnce ayar işlemleri ise çok daha ekonomiktir. Mevcut zeki bir modele şirket kurallarınızı veya sektör dilinizi öğretmek için yirmi dört gigabaytlık bir veya iki cihaz size fazlasıyla yeter. Hatta tüketici sınıfı donanımlarda bile QLoRA yöntemiyle son derece başarılı ince ayar sonuçları alabilirsiniz.
GPU Sayısı Artınca VRAM Toplamı Otomatik Birleşir mi
Sektörde çok sık düşülen diğer bir yanılgı cihazların bellek kapasitelerinin pürüzsüzce birleşeceğine inanmaktır. Sisteminizde iki adet yirmi dört gigabaytlık cihaz olduğunda elinizde koca ve tek parça bir kırk sekiz gigabayt bellek olduğunu düşünmek yanlıştır.
Yazılımlar modeli iki cihaza dağıtırken model paralelliği veya boru hattı paralelliği gibi farklı stratejiler izler. Bu dağıtım işleminin kendisi bile ekstra bellek harcar. Modeller iki kart arasında veri aktarırken belirli bir yüzde kayıp yaşarsınız. Bu nedenle birden fazla cihaz kullanırken toplam kapasiteye değil aynı zamanda kullanılan yazılım çerçevesinin bu kapasiteyi ne kadar verimli yönetebildiğine dikkat etmelisiniz.
Kurumsal AI Altyapısı İçin NVIDIA mı Yoksa AMD mi Seçilmeli
Yapay zeka projeleri için donanım seçerken NVIDIA ve AMD markaları arasında büyük bir rekabet olduğunu göreceksiniz. Ancak kurumsal projelerde karar verirken sadece saf donanım gücüne bakmamalısınız. Yapay zeka dünyası donanım kadar yazılım ekosistemine de bağımlıdır.
NVIDIA yıllar içinde inşa ettiği CUDA ekosistemi sayesinde pazarın tartışmasız lideri konumundadır. Dünyadaki neredeyse tüm veri bilimciler CUDA diliyle kod yazar. En popüler yapay zeka kütüphaneleri her zaman ilk olarak NVIDIA cihazları için optimize edilir. Bir sorun yaşadığınızda internette anında binlerce çözüm bulursunuz.
AMD ise donanım kapasitesi olarak son derece güçlü cihazlar üretiyor. Kendi ROCm yazılım ekosistemini hızla geliştiriyorlar. Açık kaynak kodlu birçok araç yavaş yavaş AMD sistemlerine uyum sağlıyor. Ancak tam entegrasyon ve kusursuz kararlılık arıyorsanız AMD dünyasında bazı yazılımsal hatalarla veya uyumsuzluk sorunlarıyla karşılaşma ihtimaliniz hala mevcuttur. Kodlarınızı AMD ekosistemine uyarlamak aylar süren bir iş gücü kaybına neden olabilir. Bu nedenle kurumsal dünyada ve kesintisiz projelerde şirketler genellikle NVIDIA standartlarından şaşmazlar.
Sık Sorulan Sorular
8 GB ekran kartı ile LLM çalıştırabilir miyim?
Evet çalıştırabilirsiniz. Özellikle yüksek oranda sıkıştırılmış bir ile üç milyar parametre arasındaki küçük modelleri sorunsuz bir şekilde açarsınız. Basit metin üretimi ve öğrenme süreçleri için ideal bir başlangıç noktasıdır.
12 GB VRAM ile hangi yapay zeka modelleri çalışır?
Üç milyar ile sekiz milyar parametre arasındaki modelleri rahatça çalıştırırsınız. Kendi belgeleriniz üzerinde arama yapan RAG sistemleri kurabilir ve yerel yapay zeka asistanları geliştirebilirsiniz.
16 GB GPU ile hangi LLM’ler çalışır?
Yedi milyar ile on dört milyar parametreli modeller bu seviyede çok iyi performans gösterir. Daha geniş bağlam pencereleri açarak uzun metinleri işleyebilirsiniz. Kayıpsız formatlarda denemeler yapabilirsiniz.
24 GB VRAM ile 70B model çalıştırılır mı?
Bu kapasiteyle yetmiş milyar parametreli devasa bir modeli çalıştırmak oldukça zordur. Modeli çok agresif bir şekilde dört bitin altına sıkıştırmanız gerekir. Model açılsa bile oldukça yavaş çalışır ve cevap kalitesinde ciddi düşüşler yaşarsınız.
48 GB GPU ile hangi LLM çalışır?
On üç milyar ile otuz dört milyar parametre arasındaki modelleri kayıpsız ve çok hızlı çalıştırırsınız. Ayrıca sıkıştırılmış yetmiş milyar parametreli modelleri de makul bir performansla sisteminize yüklersiniz. Ciddi ince ayar projeleri için harika bir kapasitedir.
70B model için kaç GB VRAM gerekir?
Sekiz bit formatında sıkıştırılmış bir yetmiş milyar modeli rahatça çalıştırmak için en az yetmiş veya seksen gigabayt toplam belleğe ihtiyacınız vardır. Çift kırk sekiz veya çift seksen gigabaytlık çoklu sistemler en güvenilir çözümdür.
7B model için kaç GB VRAM gerekir?
Dört bit sıkıştırma yaparsanız modeli çalıştırmak için dört gigabayt yeterli olabilir. Ancak sağlıklı ve uzun metinli bir çıkarım performansı almak için sekiz ile on iki gigabayt arası bir bellek önermekteyiz.
LLM eğitmek için kaç GB VRAM gerekir?
Sıfırdan devasa bir dil modeli eğitmek yüzlerce gigabaytlık süper kümeler gerektirir. Ancak mevcut bir modele ince ayar yapacaksanız yirmi dört gigabaytlık bir cihazla bile LoRA yöntemi kullanarak son derece başarılı sonuçlar alabilirsiniz.
24 GB VRAM ile fine-tuning yapılır mı?
Evet kesinlikle yapılır. QLoRA ve LoRA gibi modern yöntemler sayesinde yedi milyar parametreli modellerde oldukça başarılı ince ayar operasyonlarını yirmi dört gigabaytlık sistemlerde kolayca yürütebilirsiniz.
QLoRA için kaç GB VRAM gerekir?
QLoRA yöntemi belleği inanılmaz derecede tasarruflu kullanır. Yedi milyar parametreli bir modelde QLoRA yapmak için on iki ile on altı gigabayt arası bir kapasite sizin için yeterli bir çalışma alanı sunar.
İki GPU’nun VRAM’i birleşir mi?
Donanımlarınızı aynı sisteme taktığınızda bellekler mucizevi bir şekilde ve kayıpsız olarak tek parça haline gelmez. Yazılımlarınızın modeli birden fazla cihaza nasıl böleceğini çok iyi ayarlamanız gerekir. Dağıtım işleminin kendisi de belirli bir bellek ve performans harcar.
LLM için NVIDIA mı AMD mi daha iyi?
Donanım gücü olarak her iki marka da devasa işler başarıyor. Ancak yapay zeka ekosisteminin temeli olan CUDA yazılımı NVIDIA’yı tartışmasız pazar lideri yapıyor. Kod uyumluluğu ve sıfır sorun istiyorsanız kurumsal projeler için NVIDIA hala ilk tercihiniz olmalıdır.
LLM çalıştırmak için en iyi GPU hangisi?
Fiyat ve performans dengesi açısından yirmi dört gigabaytlık cihazlar bireysel kullanıcılar için harikadır. Ancak profesyonel bir çıkarım sunucusu kuracaksanız kırk sekiz veya seksen gigabayt kapasiteli veri merkezi donanımlarına yönelmelisiniz.
LLM eğitmek için en iyi GPU hangisi?
Sıfırdan model eğitmek için H200 gibi seksen gigabaytın üzerinde devasa belleğe sahip ve yüksek bant genişliği sunan amiral gemisi kurumsal sunucu donanımlarından oluşan büyük kümeler kurgulamalısınız.
GPU belleği LLM performansını nasıl etkiler?
Yetersiz bellek modelinizin sürekli bilgisayarın yavaş olan ana belleğine başvurmasına neden olur. Bu durum hızınızı inanılmaz derecede düşürür. Yeterli bellek ise modelinizin tüm ağırlıklarını anında işleyerek kelime üretim hızınızı yani token hızınızı zirveye çıkarır.
Sonuç Hangi Ekran Kartını Satın Almalıyım veya Kiralamalıyım
Makalemizi tek bir kazanan donanım belirleyerek bitirmek imkansızdır. Doğru karar tamamen sizin projenizin büyüklüğüne ve bütçenize göre değişir. Hangi senaryoda hangi donanımı seçeceğinizi çok net bir şekilde özetleyelim.
Küçük bir bütçeyle yapay zeka dünyasını öğrenmek ve basit modelleri test etmek istiyorsanız sekiz gigabaytlık sistemlerle işe başlayın. Kendi yerel yapay zeka asistanınızı kurmak ve belgelerinizde arama yapmak için on iki veya on altı gigabaytlık donanımlara geçin. Bağımsız bir geliştiriciyseniz ve kendi küçük modellerinize ince ayarlar yapacaksanız yirmi dört gigabaytlık sistemler sizin için bir numaralı seçenek olacaktır.
Büyük kurumsal şirketlere çıkarım hizmetleri sunacaksanız ve devasa veri setleriyle ince ayar yapacaksanız kırk sekiz gigabaytlık profesyonel çözümleri kullanın. Yüz milyarlarca parametreli modelleri eğitecek devasa bir ar-ge departmanı yönetiyorsanız seksen gigabaytlık cihazları bir araya getiren süper kümeler kurmalısınız.
Ancak kurumsal şirketler olarak devasa donanımları satın almak yerine DALNET gibi güçlü altyapı sağlayıcılarından kiralama modelini tercih etmelisiniz. Böylece on binlerce dolarlık sermaye maliyetinden kurtulursunuz. Donanım arızalarını elektrik faturalarını ve soğutma dertlerini uzman mühendislerimize bırakırsınız. Siz sadece modellerinizi geliştirmeye ve şirketinizin vizyonunu büyütmeye odaklanırsınız.


