xAI’ın yeni modeli Grok 4.7, bağımsız testlerde özellikle uzun süreli profesyonel görevler ve kodlama ajanı performansıyla öne çıktı. Ancak sonuçlar, yapay zekâ yarışındaki yeni soruyu da gündeme getiriyor: En yüksek performansa ulaşmak yeterli mi, yoksa bunu ne kadar verimli yaptığınız da artık en az performans kadar önemli mi?

Artificial Analysis tarafından yayımlanan bağımsız değerlendirmeye göre Grok 4.7, Intelligence Index’te 46 puana ulaşarak Grok 4.6’nın iki puan üzerine çıktı. Bu sonuç, xAI’ı yapay zekâ alanında en yüksek performans gösteren dört laboratuvar arasına taşıdı.

Modelin en dikkat çekici gelişimi ise klasik soru-cevap testlerinden çok, uzun süreli ve çok aşamalı görevlerde görüldü.

Profesyonel bilgi işlerinde belirgin ilerleme

Grok 4.7, gerçek hayattaki profesyonel çalışma süreçlerini ölçmek için kullanılan AA-Briefcase testinde 1.657 Elo puanına ulaştı. Bu, Grok 4.6’ya göre 111 puanlık artış anlamına geliyor.

AA-Briefcase; modelden yalnızca doğru cevap vermesini değil, bir profesyonel gibi araştırma yapmasını, analiz üretmesini ve istenen çıktıyı tamamlamasını bekliyor. Finansal analiz, hukuk, operasyon, sunum ve doküman hazırlama gibi saatler sürebilecek görevler bu değerlendirme kapsamına giriyor.

Grok 4.7, bu alanda Claude Opus 5 ve Claude Fable 5.1’in hemen arkasında konumlandı. GDPval-AA testinde de önceki sürümdeki 1.605 Elo puanını 1.695’e çıkardı.

Bu sonuçlar, yeni modelin yalnızca daha fazla bilgiye sahip olmadığını; uzun görevleri planlama, bağlamı koruma ve kullanılabilir iş çıktıları üretme yeteneğinin de geliştiğini gösteriyor.

Kodlama ajanında dokuz puanlık sıçrama

Grok 4.7’nin ikinci önemli gelişim alanı yazılım geliştirme oldu.

Grok Build ortamında çalışan Grok 4.7, Artificial Analysis Coding Agent Index’te 56 puan aldı. Grok 4.6’nın puanı 47 seviyesindeydi. Yeni model böylece dokuz puanlık artış göstererek GPT-5.6 Sol’u geride bıraktı ve kendi geliştirme ortamlarıyla test edilen modeller arasında dördüncü sıraya yerleşti.

Modelin üç temel kodlama testindeki sonuçları şöyle gelişti:

  • DeepSWE: yüzde 65’ten yüzde 73’e
  • Terminal-Bench 4.0: yüzde 18’den yüzde 33’e
  • SWE-Atlas-QnA: yüzde 58’den yüzde 63’e

Bu tablo, Grok 4.7’nin yalnızca kod yazmada değil; terminal kullanma, mevcut yazılım projelerini anlama, hata çözme ve çok aşamalı geliştirme görevlerini yürütme konusunda da ilerlediğini ortaya koyuyor.

Performans artışının bedeli: Çok daha fazla token

Test sonuçlarının en kritik bölümü ise verimlilik tarafında ortaya çıkıyor.

Grok 4.7, Intelligence Index kapsamındaki her görev için ortalama yaklaşık 81 bin çıktı tokeni kullandı. Grok 4.6’nın yüksek muhakeme sürümü aynı görevlerde yaklaşık 36–38 bin token tüketiyordu. GPT-6 Astra’nın tüketimi ise yaklaşık 27 bin token seviyesinde kaldı.

Başka bir ifadeyle Grok 4.7:

  • Grok 4.6’dan yaklaşık yüzde 125,
  • GPT-6 Astra’dan yaklaşık yüzde 196

daha fazla çıktı tokeni kullandı.

Bu fark, özellikle kurumsal ölçekte önem taşıyor. Daha fazla token; daha yüksek hesaplama ihtiyacı, daha uzun görev süresi ve toplam kullanım maliyetinin büyümesi anlamına gelebiliyor.

Modelin bir Intelligence Index görevini tamamlaması ortalama 7,1 dakika sürdü. Artificial Analysis, uzun istemlerde yaklaşık saniyede 188 token çıktı hızı ölçtü. Ancak model sayfasındaki standart ölçümlerde “high” sürüm için 54, “xhigh” sürüm için 39 token/saniye değerleri veriliyor. Ölçüm yöntemleri farklı olsa da yüksek muhakeme seviyesinin hız-verimlilik maliyeti açık biçimde görülüyor.

Her alanda aynı ölçüde ilerleme yok

Grok 4.7’nin genel puanı yükselse de gelişme bütün testlere eşit biçimde dağılmadı.

Model, Terminal-Bench 4.0’da 4,5 puan ve uzun doküman görevlerini ölçen GDP.pdf testinde 3 puan ilerledi. Buna karşılık AA-LCR testinde 3,7 puan, AutomationBench-AA testinde ise 1,1 puan geriledi.

Bu nedenle Grok 4.7’yi bütün alanlarda büyük bir sıçrama olarak tanımlamak doğru olmayabilir. İlerlemenin özellikle uzun süreli ajan görevleri, profesyonel bilgi işleri ve kodlama üzerinde yoğunlaştığı görülüyor.

Halüsinasyon oranında iyileşme

Yeni modelin halüsinasyon oranı da önceki sürüme göre düştü.

AA-Omniscience değerlendirmesinde Grok 4.6’nın yüzde 34 olan halüsinasyon oranı, Grok 4.7’de yüzde 29’a geriledi. Buna karşılık doğruluk oranı yüzde 48’den yüzde 47’ye düşerek genel olarak aynı seviyede kaldı.

Bu sonuç, modelin daha fazla soruya doğru cevap vermesinden çok, bilmediği konularda yanlış bilgi üretmekten bir ölçüde daha iyi kaçınmaya başladığını gösteriyor.

Fiyat değişmedi, görev başına maliyet arttı görsel

açıklama

Grok 4.7’nin liste fiyatı önceki sürümle aynı tutuldu:

  • Bir milyon giriş tokeni: 2 dolar
  • Bir milyon çıkış tokeni: 6 dolar
  • Bir milyon önbellek tokeni: 0,50 dolar

Model ayrıca 500 bin tokenlık bağlam penceresini koruyor. Artificial Analysis ölçümlerine göre Intelligence Index kapsamındaki ortalama görev maliyeti “high” sürümde 2,73 dolar, “xhigh” sürümde ise 3,74 dolar seviyesinde.

Dolayısıyla birim token fiyatının değişmemesi, gerçek kullanım maliyetinin de değişmediği anlamına gelmiyor. Model görev başına çok daha fazla token kullandığı için toplam maliyet artabiliyor.

AI Ekonomisi açısından ne anlama geliyor?

Grok 4.7 sonuçları, yapay zekâ sektöründeki rekabetin yön değiştirdiğini gösteriyor. Modeller artık yalnızca sorulara doğru cevap verme performansıyla değil; saatler süren görevleri yönetme, araç kullanma, kod üretme, doküman hazırlama ve kendi çalışmalarını kontrol etme yetenekleriyle yarışıyor.

Bu dönüşüm, “sohbet eden yapay zekâdan” “iş yapan yapay zekâ ajanına” geçişin hızlandığını gösteriyor.

Ancak Grok 4.7 aynı zamanda önemli bir ekonomik gerçeği de ortaya koyuyor: Daha yüksek zekâ puanı her zaman daha yüksek verimlilik anlamına gelmiyor. Kurumlar açısından doğru model seçimi yapılırken yalnızca benchmark sıralamasına değil;

  • görev başına toplam maliyete,
  • token tüketimine,
  • sonuç üretme süresine,
  • çıktı kalitesine,
  • hata ve halüsinasyon oranına

birlikte bakılması gerekiyor.

Grok 4.7, xAI’ın ajan tabanlı yapay zekâ yarışında güçlü biçimde ilerlediğini kanıtlıyor. Fakat modelin yüksek kaynak tüketimi, sektörün önündeki yeni rekabet alanını da belirginleştiriyor:

Geleceğin kazananı yalnızca en güçlü yapay zekâ modeli değil, aynı işi en az kaynakla güvenilir biçimde tamamlayabilen model olacak.