Anthropic’in Claude yapay zeka modelinin belirli bir ikna yöntemi kullanılarak güvenlik filtrelerinin nasıl aşılabildiği ve erotik içerik üretmeye zorlandığı ortaya çıktı.
TechCrunch tarafından yapılan son testler, Anthropic’in Claude Opus 4.6 modelinin şirket tarafından konulan güvenlik filtrelerini kolayca atlayabildiğini ortaya koydu. Yapay zeka kullanıcı sözleşmelerine göre cinsel içerikli veya erotik rol yapma senaryoları kesinlikle yasak olmasına rağmen, yapılan doğrudan isteklerin tamamında Opus 4.6 kısıtlamaları ihlal ederek uygunsuz materyal üretti.
İngiltere’den bağımsız bir araştırmacı tarafından geliştirilen ve TechCrunch ile paylaşılan çok aşamalı bir ikna tekniği, modelin güvenlik mekanizmalarını devre dışı bırakmayı başardı. Yöntem, masum bir kurgusal rol yapma senaryosuyla başlayarak yapay zekayı erkek ve kadın karakterlere eşit davranmaya zorluyor. Ardından model, kadın karaktere karşı aşırı korumacı veya çifte standartlı davrandığı yönünde manipüle edilerek giderek daha grafik ve müstehcen içerikler üretmeye yönlendiriliyor.
Yapılan testlerde Opus 4.6’nın yanı sıra daha eski modeller olan Opus 3 ve Haiku 4.5’in de benzer bir açıktan etkilendiği doğrulandı. Daha güncel modeller olan Opus 4.7 ve Opus 5 ise bu yönteme karşı dirençli çıkarken, Anthropic eski modelleri API erişiminden kaldırmış değil. Şirket yetkilileri, cinsel veya romantik rol yapma vakalarının tüm konuşmaların yüzde 0.1’inden azını oluşturduğunu ve güvenlik önlemlerinin her yeni model lansmanıyla geliştirilmeye devam ettiğini belirtti.
İlgili yazılar: OpenAI’dan Siber Güvenlik Odaklı Yeni Yapay Zeka Güvenlik Önlemleri
Görsel ve haber kaynağı: TechCrunch AI
