Yapay zekanın (YZ) gelişimiyle birlikte, yazı odaklı mesleklerin bu teknoloji tarafından tehdit altında olup olmadığı tartışmaları da giderek artıyor. Vulsar AI tarafından yayınlanan yeni bir yaratıcı yazarlık kıyaslaması, çeşitli büyük dil modellerinin (LLM) hem amatör hem de profesyonel insan yazarlara karşı performansını değerlendirdi. 475 farklı komut üzerinden yapılan testler, yalnızca en gelişmiş yapay zeka modellerinin, amatör düzeydeki insan yazarların performansını kıl payı geçebildiğini gösteriyor.
GPT 6 Astra Genel Klasman Lideri, Amatör İnsan Yazarları Biraz Geride Bıraktı
Vulsar AI tarafından gerçekleştirilen bu kıyaslama, LLM'lerin uzun biçimli metin üretme konusundaki yeteneklerini ölçmeyi amaçlıyor. Testlerde, genel okuyucu tercihlerini tahmin etmek için insan tercihi verileriyle ince ayarlanmış bir ödül modeli kullanıldı. Paylaşılan sonuçlara göre, GPT 6 Astra, %87.8'lik öngörülen kazanma oranıyla liderlik koltuğuna otururken, %86.6'lık bir oran elde eden insan yazarların (amatör düzeyde) biraz önüne geçti. Ancak, burada amatör ve profesyonel insan yazarlar arasındaki yetenek farkının da oldukça büyük olduğunu belirtmek gerekiyor.
Test sonuçları, GPT 6 Astra gibi en gelişmiş modellerin amatör yazarların performansını aşabildiğini gösterse de, profesyonel yazarların ayrı ayrı değerlendirildiğinde hala belirgin şekilde daha yüksek puanlar aldığı görülüyor. Üçüncü sırada, %77.6'lık bir öngörülen kazanma oranıyla OpenAI'nin GPT 5.6 Sol modeli yer alırken, Anthropic'in Claude Fable 5.1 modeli %70.3'lük bir oranla dördüncü sıraya yerleşti. Ancak, çok trilyon parametreli yapay zeka modellerinin ötesine geçildiğinde puanlarda büyük bir düşüş yaşanıyor.
Örneğin, Claude Opus 5, Kimi K3, Grok 4.6 gibi modeller %50-65 aralığında puanlar alırken, bu yüksek profilli modellerin de sınırlılıkları olduğunu gösteriyor. Daha az yoğun modellere geçildiğinde sonuçlar daha da kötüleşiyor. Popüler LLM'lerden Qwen3.8-27B %23.2, DeepSeek V4.1 Flash %19.8 ve Gemma 4 26B ise yalnızca %10.9 puan alarak listenin en altında yer aldı.
Jeton (token) üretimi açısından bakıldığında, insan yazarlar komut başına en yüksek çıktı olan 2.592 jetonu üretti. Bunu GPT 6 Astra 1.537 jetonla ve Claude Fable 5.1 ise 2.114 jetonla takip etti. Küçük modellerin önemli bir sınırlılığı ise, çok bölümlü komutlarda tutarlılığı kaybetme ve tekrarlayan ifadeler kullanma eğiliminde olmaları. Bu durum, insan yazarların bu konudaki üstünlüğünü bir kez daha ortaya koyuyor.
İnsan yazarlar sadece karmaşık hikayeleri sürdürmekle kalmıyor, aynı zamanda ani düşünme yetenekleri sayesinde stillerini ve çıktısını anında değiştirebiliyorlar. Peki, profesyonel yazarların başarabildiklerini neredeyse taklit edebilecek LLM'lerle ne zaman karşılaşacağız? Bu, elbette başka bir zamanın tartışması olacak.