RTX 4080 Sistemine Tesla V100 Ekledi: 27B Yapay Zeka Modeli Çalıştırdı

Benzer yazılar
Etiketler
- #Yapay Zeka
- #RTX4080
- #TeslaV100
- #YapayZeka
- #VRAM
- #NVIDIA
- #YerelYapayZeka
- #llamaCpp
- #Donanım
Güncel oyunları yüksek grafik ayarlarında çalıştırabilen güçlü ekran kartları, büyük dil modelleri söz konusu olduğunda aynı ölçüde yeterli olmayabiliyor. Bunun en önemli nedenlerinden biri, yerel yapay zeka modellerinin ihtiyaç duyduğu yüksek video belleği kapasitesi.
RTX 4080 ekran kartına sahip bir donanım meraklısı da sistemindeki 16 GB VRAM’in çalıştırmak istediği büyük yapay zeka modelleri için sınırlayıcı olduğunu fark ederek sıra dışı bir çözüm geliştirdi. Kullanıcı, veri merkezleri için tasarlanan 16 GB HBM2 bellekli NVIDIA Tesla V100 hızlandırıcısını özel bir adaptör yardımıyla oyun bilgisayarına ekledi.
Ortaya çıkan sistem, RTX 4080 ve Tesla V100 üzerinde bulunan toplam 32 GB video belleğini kullanarak 27 milyar parametreli bir dil modelini yerel olarak çalıştırmayı başardı. Modifikasyonun ekran kartı ve adaptör dahil toplam maliyeti yaklaşık 200 sterlin, yani haberin yayımlandığı dönemde yaklaşık 266 dolar oldu.
RTX 4080 Büyük Dil Modelleri İçin Neden Yetersiz Kaldı?
RTX 4080, Ada Lovelace mimarisi ve 16 GB GDDR6X video belleğiyle yüksek performanslı bir oyun ekran kartı. Bununla birlikte yerel büyük dil modellerinde yalnızca işlem gücü değil, modelin ağırlıklarını ve bağlam verilerini bellekte tutabilecek kapasite de önem taşıyor.
Model boyutu büyüdükçe ihtiyaç duyulan VRAM miktarı da artıyor. Uzun bağlam pencereleri kullanıldığında, modelin önceki token’lara ait verileri sakladığı KV cache yapısı da ek bellek tüketiyor.
Bu nedenle 16 GB VRAM, küçük ve orta ölçekli modeller için yeterli olabilse de daha yüksek parametreli modellerin tamamen ekran kartına yüklenmesini zorlaştırabiliyor. Modelin bir kısmının sistem belleğine aktarılması mümkün olsa da CPU üzerinden yapılan bu işlem genellikle üretim hızını düşürüyor.
Sistemin sahibi Oscar Molnar, daha yüksek bellek kapasitesine sahip güncel bir ekran kartı satın almak yerine ikinci el veri merkezi donanımlarını değerlendirmeyi tercih etti.
Tesla V100 RTX 4080’in Yanına Eklendi
Bu projede Tesla V100, RTX 4080’in içine yerleştirilmedi veya RTX 4080 üzerinde fiziksel bir değişiklik yapılmadı. İki GPU, aynı masaüstü bilgisayar içerisinde ayrı hızlandırıcılar olarak birlikte kullanıldı.
Sistemdeki ekran kartları şu şekilde konumlandırıldı:
- RTX 4080: 16 GB GDDR6X VRAM ve Ada Lovelace mimarisi
- Tesla V100: 16 GB HBM2 VRAM ve Volta mimarisi
- Toplam: İki GPU üzerinde 32 GB video belleği
Ancak bu yapı, tek bir ekran kartında bulunan birleşik 32 GB VRAM ile aynı değil. Her ekran kartı yalnızca kendi fiziksel belleğine doğrudan erişebiliyor. Model katmanları, llama.cpp yazılımının tensor splitting özelliği kullanılarak iki GPU arasında paylaştırılıyor.
Veriler gerektiğinde PCIe bağlantısı üzerinden taşındığı için sistem, tek parça 32 GB belleğe sahip modern bir ekran kartı kadar verimli çalışmıyor. Buna rağmen modelin tamamının GPU belleğinde tutulabilmesi, CPU’ya aktarım yapılmasına kıyasla önemli bir performans avantajı sağlıyor.
Tesla V100 Masaüstü Bilgisayara Nasıl Bağlandı?
Projede kullanılan Tesla V100, standart PCIe kart biçimindeki model değil, SXM2 form faktörüne sahip 16 GB sürüm.
SXM2 modülleri masaüstü bilgisayarlara doğrudan takılmak için tasarlanmıyor. Bu hızlandırıcılar normalde NVIDIA DGX sistemleri ve kurumsal sunucu platformlarında özel bağlantı kartları üzerinde çalışıyor.
Tesla V100 SXM2 üzerinde:
- Standart PCIe bağlantı ucu
- Görüntü çıkışı
- Geleneksel ekran kartı güç bağlantısı
bulunmuyor.
Kullanıcı bu sorunu, yaklaşık 50 sterline satın aldığı resmî olmayan bir SXM2-PCIe adaptörüyle çözdü. Adaptörün bir tarafına Tesla V100 modülü, diğer tarafına ise masaüstü anakarta bağlanabilen PCIe bağlantısı yerleştiriliyor.
Tesla V100 ve adaptörün toplam maliyeti yaklaşık 200 sterline ulaştı. Bunun yaklaşık 150 sterlinini ikinci el Tesla V100, kalan bölümünü ise adaptör ve küçük bağlantı parçaları oluşturdu.
Tesla V100 Hâlâ Güçlü Teknik Özellikler Sunuyor
2017 yılında piyasaya çıkan Tesla V100 güncel bir ekran kartı değil. Buna rağmen yapay zeka ve yüksek başarımlı hesaplama için geliştirilen yapısı, kartı belirli yerel yapay zeka işlerinde hâlâ kullanılabilir hale getiriyor.
Kullanılan 16 GB Tesla V100 modelinin öne çıkan özellikleri arasında şunlar bulunuyor:
- 5.120 CUDA çekirdeği
- Volta GPU mimarisi
- 16 GB HBM2 bellek
- 4.096 bit bellek veri yolu
- 900 GB/s bellek bant genişliği
- Yapay zeka işlemleri için Tensor çekirdekleri
Yüksek bellek bant genişliği, büyük dil modeli çıkarımında önemli bir avantaj sağlayabiliyor. Çünkü model ağırlıklarının sürekli olarak GPU belleğinden okunması gerekiyor.
Bununla birlikte Tesla V100’ün eski bir mimari kullanması; yazılım, sürücü ve işletim sistemi uyumluluğunda önemli kısıtlamalar oluşturuyor. Kartı modern bir tüketici ekran kartıyla aynı bilgisayarda çalıştırmak, standart bir çift GPU kurulumundan daha fazla teknik bilgi gerektiriyor.
82 dB Gürültü Üreten Fan Yeniden Düzenlendi
Kurulumdaki en büyük sorunlardan biri, adaptörle birlikte gelen yüksek hızlı soğutma fanı oldu.
Tesla V100 SXM2, normal koşullarda güçlü hava akışına sahip sunucu kasalarında kullanılmak üzere tasarlanıyor. Masaüstü sistemde kullanılan adaptörün fanı ise sürekli maksimum hızda çalışarak yaklaşık 82 dB gürültü üretti.
Kullanıcı önce 9 voltluk bir pil kullanarak fan bağlantısının pin dizilimini test etti. Ancak nihai çözümde pil kullanılmadı. Fanın devir ve PWM kabloları, özel bir PH2.0-dönüştürücü kablo aracılığıyla anakart üzerindeki standart fan başlığına bağlandı.
Bu işlem sonrasında fan hızı yazılımla kontrol edilebilir hale geldi. Fan maksimum hızının yaklaşık yüzde 10’unda çalıştırılırken Tesla V100’ün tam yük altında 50°C seviyesinin altında kaldığı bildirildi.
Dolayısıyla kaynak metindeki “9V pil ile fan hızı düşürüldü” ifadesi tam olarak doğru değil. Pil yalnızca bağlantıları test etmek için kullanıldı; kalıcı fan kontrolü anakartın PWM başlığı üzerinden sağlandı.
İki Farklı NVIDIA Mimarisi Nasıl Birlikte Çalıştı?
RTX 4080, Ada Lovelace; Tesla V100 ise çok daha eski Volta mimarisini kullanıyor. Bu iki kartın aynı sürücü ve CUDA sürümü altında çalıştırılması projenin yazılım tarafındaki en önemli zorluklardan biri oldu.
Kullanıcı sistemi NixOS üzerinde çalıştırdı ve hem Ada hem de Volta mimarilerini destekleyen eski bir NVIDIA sürücü dalını kullandı. Ayrıca uyumluluk için daha eski bir Linux çekirdeği ve CUDA 12.2 paketleri tercih edildi.
Modelin iki GPU arasında paylaştırılması için llama.cpp yazılımının tensor splitting özelliğinden yararlanıldı. Model katmanları RTX 4080 ve Tesla V100 arasında eşit şekilde bölüştürüldü.
Sistemin Windows tarafında sorunsuz ve sürekli çalışmadığı, kullanıcının oyun oynamak istediğinde ana Windows kurulumuna; yerel yapay zeka çalıştırmak istediğinde ise harici NVMe sürücüde bulunan NixOS sistemine geçtiği belirtiliyor.
Bu ayrıntılar, projenin standart bir kullanıcı için tak-çalıştır çözüm olmadığını açıkça gösteriyor.
27B Dil Modelinde Saniyede 32 Token Performansı
Hazırlanan sistemde Qwen3.6-27B-MTP isimli, 27 milyar parametreli bir yapay zeka modeli çalıştırıldı.
Model, bellek tüketimini azaltmak amacıyla Q5_K_M seviyesinde kuantize edildi. Yaklaşık 19 GB büyüklüğündeki modelin tamamı iki GPU’nun belleğine yüklendi.
Test edilen yapılandırma şu değerleri içeriyordu:
- Model büyüklüğü: Yaklaşık 19 GB
- Parametre sayısı: 27 milyar
- Bağlam penceresi: 128 bin token
- GPU’ya aktarılan katman: 99, yani tüm katmanlar
- GPU dağılımı: RTX 4080 ve V100 arasında eşit
- Metin üretim hızı: Yaklaşık 32 token/s
- Prompt işleme hızı: Yaklaşık 133-160 token/s
Saniyede 32 token üretim hızı, sohbet, yazı oluşturma ve kodlama gibi etkileşimli kullanım senaryoları için yeterli kabul edilebilir. Ancak bu sonuçlar bağımsız bir laboratuvar testi değil, kullanıcının kendi sistemi üzerinde aldığı ölçümlerdir.
Performans; kullanılan model, kuantizasyon seviyesi, bağlam uzunluğu, prompt yapısı, yazılım sürümü ve GPU’lar arasındaki iş dağılımına göre değişebilir.
32 GB VRAM Gerçekten Birleşiyor mu?
Sistemin toplam 32 GB VRAM’e sahip olduğu doğru olsa da bu belleğin tek bir fiziksel havuz haline geldiğini söylemek yanıltıcı olur.
RTX 4080 üzerindeki 16 GB bellek ile Tesla V100 üzerindeki 16 GB bellek birbirinden bağımsız. llama.cpp, modelin belirli katmanlarını birinci karta, kalan bölümlerini ise ikinci karta yerleştiriyor.
Bir GPU’nun diğer GPU’daki verilere ihtiyaç duyması durumunda iletişim PCIe üzerinden gerçekleşiyor. Bu aktarım, GPU’nun kendi yerel belleğine erişmesinden daha yavaş.
Dolayısıyla sistemin avantajı, 32 GB belleğin tamamına tek bir GPU hızında erişmek değil; 19 GB büyüklüğündeki modelin CPU belleğine taşınmadan iki ekran kartı üzerinde tutulabilmesi.
Bu yöntem maliyet açısından avantajlı olsa da performans, gecikme ve uyumluluk bakımından tek kartlı profesyonel çözümlerin yerini tamamen tutmuyor.
Eski Sunucu GPU’ları Yerel Yapay Zeka İçin Mantıklı mı?
Tesla V100 gibi ikinci el veri merkezi hızlandırıcıları, yüksek VRAM kapasitesine düşük maliyetle ulaşmak isteyen deneyimli kullanıcılar için ilgi çekici olabilir.
Bu donanımların avantajları arasında yüksek bellek bant genişliği, HBM bellek ve CUDA desteği bulunuyor. Buna karşılık kullanıcıların göz önünde bulundurması gereken önemli dezavantajlar da var:
- Resmî olmayan adaptör gereksinimi
- Görüntü çıkışının bulunmaması
- Özel güç ve soğutma çözümleri
- Yüksek fan gürültüsü
- Eski sürücü kullanma zorunluluğu
- Güncel işletim sistemleriyle uyumluluk sorunları
- Birden fazla GPU arasında veri aktarım kaybı
- İkinci el donanımın kullanım geçmişinin bilinmemesi
Ayrıca yerel çalıştırılan yapay zeka modellerinde bulut hizmetlerine ait token ücreti bulunmasa da sistemin elektrik tüketimi, donanım maliyeti ve bakım ihtiyacı devam ediyor.
Bu nedenle söz konusu kurulum, hazır bir tüketici ürünü arayanlardan çok Linux, sürücü yapılandırması ve bilgisayar donanımı konusunda deneyimli kullanıcılar için uygun.
Sonuç: Düşük Maliyetle Yerel Yapay Zeka Deneyi
RTX 4080’in yanına Tesla V100 eklenerek hazırlanan sistem, eski veri merkezi donanımlarının yerel yapay zeka uygulamalarında hâlâ kullanılabileceğini gösteriyor.
Yaklaşık 200 sterlinlik ek maliyetle toplam video belleği 16 GB’tan 32 GB’a çıkarıldı. Bu kapasite, 19 GB büyüklüğündeki 27B dil modelinin tamamen GPU belleğinde çalıştırılmasına ve saniyede yaklaşık 32 token üretilmesine imkân tanıdı.
Bununla birlikte proje, Tesla V100’ün RTX 4080’e fiziksel olarak takıldığı veya iki kartın belleğinin tek bir 32 GB ekran kartına dönüştüğü anlamına gelmiyor. Model, llama.cpp kullanılarak iki farklı GPU arasında bölüştürülüyor.
Özel adaptör, fan modifikasyonu, eski NVIDIA sürücüsü ve NixOS yapılandırması gerektiren bu sistem herkes için uygulanabilir olmayabilir. Yine de çalışma, yüksek VRAM maliyetine karşı ikinci el sunucu donanımlarının yaratıcı bir alternatif oluşturabileceğini ortaya koyuyor.
Sıkça Sorulan Sorular
Tesla V100, RTX 4080’in içine mi takıldı?
Hayır. Tesla V100, RTX 4080 bulunan bilgisayara ikinci bir GPU olarak eklendi. İki kart aynı anakart üzerinde ayrı donanımlar olarak çalışıyor.
Sistem gerçekten 32 GB VRAM’e sahip mi?
Sistemde toplam 32 GB VRAM bulunuyor. Ancak bellek tek bir ortak havuz değil. RTX 4080 ve Tesla V100 üzerindeki 16 GB bellekler birbirinden bağımsız çalışıyor.
Kullanılan Tesla V100 kaç GB belleğe sahip?
Projede 16 GB HBM2 belleğe sahip Tesla V100 SXM2 kullanıldı. Tesla V100’ün 32 GB sürümü de bulunuyor ancak bu model daha pahalı.
27B yapay zeka modeli ne kadar hızlı çalıştı?
Kullanıcının testlerine göre model yaklaşık 32 token/s metin üretim ve 133-160 token/s prompt işleme hızına ulaştı.
Bu modifikasyon herkes tarafından yapılabilir mi?
Kurulum; özel adaptör, fan bağlantısı değişikliği, Linux yapılandırması ve eski NVIDIA sürücüleri gerektiriyor. Bu nedenle deneyimsiz kullanıcılar için önerilebilecek tak-çalıştır bir çözüm değil.
#RTX4080 #TeslaV100 #YapayZeka #VRAM #NVIDIA #YerelYapayZeka #llamaCpp #Donanım



