Grok 4.6 Benchmark Testlerinde Zirveye Yaklaştı: GPT-5.6 Sol ile Aynı Seviyeye Geldi
SpaceXAI, uzun süren yapay zekâ görevlerine odaklanan Grok 4.6 modelini yayınladı ve yeni model bazı bağımsız performans testlerinde OpenAI’nin GPT-5.6 Sol modelini yakaladı. Grok 4.6, özellikle uzun süreli görevler, yazılım geliştirme, bilgi çalışmaları ve teknik akıl yürütme için model tarafından üretilen seçilmiş verilerle eğitildi. Model, yüksek performans iddiasının yanında düşük kullanım maliyetiyle geliştiricilere ve Cursor ile Grok Build kullanıcılarına sunuldu.
Grok 4.6 Uzun Süren Görevlerde Performansını Artırıyor
Grok 4.6’nın eğitim sürecinde uzun süre devam eden görevlerin yönetimine özel ağırlık verildi. SpaceXAI, modelin teknik kavramları anlama, mühendislik verilerini işleme, genel kodlama ile bilgi çalışmalarını yürütme becerilerini geliştirmek amacıyla geniş kapsamlı agentic RL görevlerinden yararlandı.
Modelin eğitiminde kullanılan yaklaşım, tek bir soruya yanıt üretmekten daha uzun süren iş akışlarına odaklanıyor. Grok 4.6, bir görevi birkaç adımda tamamlayan yapay zekâ ajanlarında karar verme, kod yazma, sonuçları değerlendirme ve sonraki işlemi belirleme gibi yetenekleri birlikte kullanacak şekilde geliştirildi.
SpaceXAI ayrıca yeni modelin görsel ile etkileşimli uygulama geliştirme süreçlerinde ilk denemelerde daha başarılı sonuçlar ürettiğini belirtiyor. Şirket, Grok 4.5’e kıyasla özellikle karmaşık görevlerde daha güçlü başlangıç sonuçları alınmasını hedefliyor.
Artificial Analysis tarafından hazırlanan Intelligence Index, dokuz farklı yapay zekâ benchmark sonucunu bir araya getirerek modellerin genel performansını karşılaştırıyor. Grok 4.6, söz konusu endekste GPT-5.6 Sol ile aynı seviyeye gelirken Claude Opus 5 ile Fable 5 Max modellerinin gerisinde kaldı.
GDPval-AA v2 testinde Grok 4.6, 1.753 Elo puanı elde ederek Claude Opus 5’in ardından ikinci sıraya yerleşti. Uzun süreli yapay zekâ destekli bilgi çalışmasını ölçen özel AA-Briefcase testinde ise model 1.577 Elo puanına ulaştı ve yine Claude Opus 5’in arkasında kaldı.
Bu sonuçlar Grok 4.6’nın yalnızca klasik soru-cevap performansına değil uzun soluklu görevlerdeki yeteneklerine de odaklandığını gösteriyor. Özellikle yazılım geliştirme, araştırma, doküman analizi ve çok adımlı iş akışlarında kullanılan modeller için bu tür benchmark sonuçları doğrudan pratik kullanım senaryolarıyla bağlantı taşıyor.
Grok 4.6’nın API fiyatlandırması, modelin performans kadar maliyet tarafında da rekabet etmesini hedefliyor. Standart sürümde 1 milyon giriş tokenı için 2 dolar, 1 milyon çıkış tokenı için 6 dolar ücret belirlenirken hızlı sürümde fiyatlar sırasıyla 4 dolar ile 12 dolar olarak açıklandı.
Modelin standart çalışma hızının saniyede 80 token seviyesinde olduğu belirtiliyor. SpaceXAI, ilk hafta boyunca Grok Build ile Cursor içerisinde Grok 4.6 kullananlara iki kat kullanım hakkı sağlayan sınırlı süreli bir kampanya da başlattı.
Geliştiriciler Grok 4.6’ya API üzerinden erişebilirken Cursor ile Grok Build kullanıcıları modeli doğrudan kullandıkları platformlar üzerinden deneyebiliyor. Böylece modelin yalnızca sohbet tabanlı kullanım yerine kodlama ve üretkenlik odaklı iş akışlarına daha hızlı şekilde yerleşmesi hedefleniyor.
Grok 4.6’nın öne çıkan tarafı, modelin tek seferlik yanıt üretmek yerine uzun süre devam eden görevlerde kullanılmak üzere eğitilmesi oldu. Yapay zekâ ajanları yazılım geliştirme, araştırma, veri analizi ve kurumsal bilgi çalışmaları gibi alanlarda daha fazla sorumluluk üstlendikçe modellerin yalnızca yanıt kalitesi değil görev boyunca tutarlı karar verebilmesi de önem kazanıyor.
Grok 4.6’nın GPT-5.6 Sol ile bazı testlerde aynı seviyeye ulaşması, frontier modeller arasındaki rekabetin artık yalnızca genel zekâ skorları üzerinden ilerlemediğini de gösteriyor. Model maliyeti, işlem hızı, uzun görevlerdeki başarı oranı ve geliştirici araçlarına entegrasyon gibi ölçütler önümüzdeki dönemde şirketlerin model tercihlerini belirleyen temel faktörler arasında yer alacak.
Tepkiniz Ne?
Beğen
0
Beğenme
0
Sevgi
0
Komik
0
Kızgın
0
Üzgün
0
Vay
0