- Claude Mythos 5, güvenlik denetimleri nedeniyle verilen iki haftalık kısa süreli hizmet dışı kalmasının ardından tekrar hizmete girdi.
- Model mimarisi, SWE-bench Pro'da %80.3'lük bir başarı oranıyla kodlama becerisinde önemli bir sıçrama göstermektedir.
- Yeni kalıcı bellek özellikleri, yapay zekanın standart bir sohbet robotu olmaktan ziyade uzun vadeli bir teknik işbirlikçi olarak hareket etmesine olanak tanıyor.
- Güvenlik protokolleri artık hassas sorgular için Claude Opus 4.8'e yönelik gelişmiş bir yedekleme mekanizması içermektedir.

Gelişmiş yapay zekâ alanında son zamanlarda, Anthropic'in en gelişmiş sistemlerinin ani dönüşüyle birlikte büyük dalgalanmalar yaşandı. Ulusal güvenlik gerekçeleriyle iki haftalık bir süre boyunca tamamen askıya alınan sistemler, Claude Mythos 5 modeli yeniden etkinleştirildi. Bu durum, "güvenilir ortaklar" olarak bilinen belirli bir kuruluş grubu için geçerlidir. Bu adım, bu modellerin gücünün muazzam olmasına rağmen, genel halk için uygulanmalarına ilişkin kısıtlamaların her zamankinden daha sıkı olduğunu göstermektedir.
Bu sürüm, basit bir sürüm güncellemesinden çok daha fazlası; uzmanların "sürekli teknik işbirlikçi" olarak adlandırdığı şeye doğru bir dönüşümü temsil ediyor. Uzun konuşmalarda sıklıkla konudan sapılan önceki sürümlerin aksine, Mythos mimarisi, odaklanmayı sürdürmek üzere tasarlanmıştır. Uzun süreler boyunca sorunsuz bir şekilde çalışabiliyor ve çok adımlı görevleri koordine edebiliyor. Karmaşık, haftalar süren projelerde işin yolunda gitmesini bekleyenler için adeta ezber bozan bir özellik.
Karşılaştırmalı Performans ve Kodlama Yeteneği
Somut rakamlara baktığımızda, özellikle yazılım mühendisliği alanında kaydedilen ilerleme oldukça dikkat çekici. Gerçek dünyadaki kodlama sorunlarını simüle eden en son SWE-bench Pro testlerinde, Claude Mythos 5 %80.3'lük bir puan elde etti.Önceki sürümü Claude Opus 4.8'i %69.2'de geride bırakarak, bu çift haneli liderlik, yapay zekanın birden fazla dosyayı yönetmesi ve yoğun, birbirine bağlı kod tabanlarında gezinmesi gerektiğinde en belirgin şekilde ortaya çıkıyor.
İlk gösterimler, sistemin tek bir dosya içinde dinamik grafikler ve hatta fizik ve mobil kamera mantığına sahip işlevsel platform oyunları içeren tüm web uygulamalarını oluşturabildiğini gösterdi. Sadece kod yazmakla kalmıyor; Sıkıcı hata ayıklama işinde mükemmeldir. Hataların temel nedenini belirleyerek ve en uygun maliyetli çözümü önererek. Geliştiriciler için bu, yapay zekanın nihayet sadece temel öneriler sunmak yerine, ağır işlerin bir kısmını üstlenebileceği anlamına geliyor.
Kalıcı Yapay Zeka Ajanlarının Yükselişi
Bu yeni sürümün en havalı özelliklerinden biri, otonom bir ajan gibi çalışabilme yeteneğidir. Her adımda bir komut beklemek yerine, Mitoloji geniş bir amaca hizmet edebilir.Mantıksal adımlara ayırın ve uygulamadan önce yapılandırılmış bir plan sunun. Bu, izole sorgulardan, sistemin projenin yönünü gözden geçirdiği ve koruduğu entegre iş akışlarına geçmekle ilgilidir.
Bu düzeydeki kalıcılık, modelin günler önce alınan teknik kararları hatırlayabileceği ve bunlarla çelişebilecek yeni istekleri işaretleyebileceği anlamına gelir. uzun oturumlar boyunca bağlamı korumakBu sayede, her yeni sohbet başlattığınızda tüm mantığı sıfırdan yeniden oluşturma zorunluluğundan kaçınmış olursunuz. İşin geçmişine gerçekten dikkat eden gerçek bir insan meslektaşla çalışıyormuş gibi hissedersiniz.
Güvenlik Katmanları ve Yedekleme Sistemleri
Elbette, büyük güç beraberinde çok fazla bürokrasi getirir. Anthropic, Mythos çekirdeğine ulaşmadan önce her bir sorguyu tarayan ve özellikle biyoloji, kimya ve gelişmiş yapay zeka geliştirme alanlarında riskli işaretler arayan bir dizi sınıflandırıcı entegre etmiştir. Bir sorgu çok hassas bulunursa veya farklı bir yaklaşım gerektiriyorsa, Sistem bir yedekleme mekanizması kullanıyor. Bu görevi Claude Opus 4.8 gibi biraz daha kısıtlı bir modele yönlendirmek.
Araştırmacılar arasında bu dahili filtrelerin zaman zaman yanlış pozitif sonuçlar üretebildiği ve bu durumun iş yapmaya çalışırken biraz can sıkıcı olabildiği yönünde bazı tartışmalar var. Bu sorunu çözmek için bir çaba gösteriliyor. Bu filtrelerin nasıl devreye girdiğine dair daha fazla şeffaflık Yaratıcı süreçte, bu güvenlik kontrollerini görünür kılmak, güven oluşturmaya yardımcı olur ve kullanıcıların belirli bir yanıtın neden değiştirildiğini veya yeniden yönlendirildiğini tam olarak bilmelerini sağlar.
Bu sistemlerin evrimi, teknik yetenek ve güvenlik önlemlerinin esasen aynı madalyonun iki yüzü olduğu bir geleceği vurgulamaktadır. Sektör, kendi mantığını planlayabilen, uygulayabilen ve hatırlayabilen modellere doğru ilerlerken, net iletişime ve güvenilir sonuçlara odaklanmak Başarı için birincil ölçüt haline geliyor. Erişim şu an için bir nebze ayrıcalıklı kalsa da, bu en yeni mimarinin belirlediği ölçütler, karmaşık problem çözme senaryolarında gerçek bir ortak olarak çalışan yapay zekaya doğru net bir yol gösteriyor.