13 Eylül 2026, 19:23:25
Dolar 48,5250
Euro 56,3246
Altın 6.784,88
BİST 14.467,25
Adana Adıyaman Afyon Ağrı Aksaray Amasya Ankara Antalya Ardahan Artvin Aydın Balıkesir Bartın Batman Bayburt Bilecik Bingöl Bitlis Bolu Burdur Bursa Çanakkale Çankırı Çorum Denizli Diyarbakır Düzce Edirne Elazığ Erzincan Erzurum Eskişehir Gaziantep Giresun Gümüşhane Hakkari Hatay Iğdır Isparta İstanbul İzmir K.Maraş Karabük Karaman Kars Kastamonu Kayseri Kırıkkale Kırklareli Kırşehir Kilis Kocaeli Konya Kütahya Malatya Manisa Mardin Mersin Muğla Muş Nevşehir Niğde Ordu Osmaniye Rize Sakarya Samsun Siirt Sinop Sivas Şanlıurfa Şırnak Tekirdağ Tokat Trabzon Tunceli Uşak Van Yalova Yozgat Zonguldak
Mersin 32°C
Parçalı Bulutlu
Mersin
32°C
Parçalı Bulutlu
Pts 31°C
Sal 30°C
Çar 30°C
Per 29°C

Yapay zekada liderlik yarışı: Tablo bir haftada 3 kez değişti

Yapay zekada liderlik yarışı: Tablo bir haftada 3 kez değişti
10/09/2026 12:35
A+
A-

Artificial Analysis yetkilileri, v4.1.1, v4.2 ve v4.3 sürümlerinin daha geniş kapsamlı v5 güncellemesi öncesinde hızlandırılmış bir süreç olarak sunulduğunu bildirdi. Sektördeki hızlı ilerleme nedeniyle güncellemenin bekletilemediği ifade edildi.

Güncelleme sürecinin başında, GPT-6 Astra’nın kullanıma sunulduğu dönemde v4.1.1 sürümünde Astra 61 puan alırken Fable 5.1 modeli 66 puandaydı.

Dört gün sonra yayımlanan v4.2 sürümünde platform, içeriğe yeni değerlendirme kriterleri eklerken doyuma ulaşan GPQA Diamond testini çıkardı. Bu aşamada fark kapanarak Fable 5.1’in puanı 57’ye, Astra’nın puanı ise 55’e geldi.

Üç gün sonra yayımlanan v4.3 sürümünde Terminal-Bench ve AutomationBench-AA testlerinin sisteme entegre edilmesiyle iki model 53 puanda eşitlendi.

İki modelin aynı toplam puana ulaşması, performans ve maliyet tarafında ciddi farklılıklar barındırıyor.

Astra v4.3 maliyet karşılaştırmasına göre, 53 puanlık performans seviyesinde GPT-6 Astra görev başına ortalama 3,26 dolar maliyet çıkarırken, Claude Fable 5.1 için bu rakam 7,63 dolar seviyesinde gerçekleşti. Bu durum Astra’nın aynı performans seviyesinde görev başına yüzde 57 daha düşük maliyet sunduğunu gösterdi. Aradaki farkın temel nedeni olarak Astra’nın değerlendirme sürecinde daha az çıktı çipi kullanması gösterildi.

Test detaylarında ise Fable 5.1 modeli bilgi odaklı işlerde ve bilimsel hesaplamalarda öne çıkarken, Astra modeli terminal tabanlı yazılım işlerinde ve iş akışı otomasyonlarında daha yüksek başarı gösterdi.

Platform, modellerin ezber yapmasını önlemek amacıyla gizli test setlerinin ağırlığını artırdı. v4.1 sürümünde yüzde 20 olan gizli test oranı v4.2’de yüzde 40’a, v4.3’te ise yüzde 45’e yükseltildi.

Artificial Analysis, v5 sürümünde bu oranı daha da artırmayı hedefliyor.

v4.3 liderlik tablosunda Astra ve Fable 5.1’in ardından Claude Opus 5 modeli 51 puanla üçüncü sırada yer aldı.

Claude Fable 5 modeli 50, Muse Spark 1.3 modeli 48, GPT-5.6 Sol modeli ise 47 puan aldı. Açık kaynaklı modeller arasında GLM-5.3 Flash 42 puanla öne çıktı.

YORUMLAR

Henüz yorum yapılmamış. İlk yorumu yukarıdaki form aracılığıyla siz yapabilirsiniz.