OpenAI, Anthropic ve Google'da bulunan bir API açığı, araştırmacılara daha zayıf AI modellerinin daha güçlü modellerin mantığını çözmelerine olanak tanıdı. Bu açıklık, API çağrıları arasında gizli AI mantığının taşınmasına olanak tanıyan bir zayıflıktan kaynaklandı.
Araştırmacılar, bir oturumda oluşturulan bir bloğun başka bir oturumda yeniden oynatılabilmesini ve hatta aynı sağlayıcı ailesinden daha zayıf bir modele verilerek gizli içeriği ifşa etmesini gösterdi.
Stealing Reasoning Traces from Proprietary LLM APIs adlı makalede, dört farklı kötüye kullanım yolu gösterildi: model damıtma için özel mantık çalmak, diğer kullanıcıların yayınlanmış izlerinden özel verileri çıkarmak, güvenli görünür bir cevap ardında gizlenmiş zararlı içeriği ortaya çıkarmak ve şeffaf olmayan mantık blokları içinde.prompt enjeksiyonlarını gizlemek.
6.708 kamu ajanı traiectorysinde, araştırmacılar 315.320 düşünce bloğunu çözdü. Benchmark kaynaklarını hariç tuttuktan sonra, gerçek kullanıcı oturumlarından 704 ayrı gizlilik öğesini saydı, bunlar arasında 62 API anahtarı, 33 parola, 24 erişim jetonu ve yedi özel anahtar bulunuyordu.
Çapraz kullanıcı saldırısı, özel sohbetlere keyfi erişim sağlamadı. Bir şifrelenmiş mantık bloğunu, örneğin bir ajan günlüğünde yayınlanmış olanı, elde etmek ve aynı sağlayıcıdan uyumlu bir modele API erişimine sahip olmak gerekiyordu.
Araştırmacılar, bulgularını etkilenen model sağlayıcılarına, Microsoft ve Hugging Face'e bildirdi ve gösterilen saldırıların durdurulduğunu söyledi. Tekrarlanabilirlik beyanları, Ağustos 2026 itibarıyla ana çıkarma saldırısının artık tekrarlanamayacağını belirtti.
Rapor, vahşi ortamda kötüye kullanım belgelenmedi. Geliştiriciler, paylaşılan izlerden mantık bloklarını ve şeffaf olmayan mantık alanlarını çıkarmaya ve hatta görünür metin sanitize edilmiş olsa bile ham API transkriptlerini taahhüt etmemeye yönlendiriliyor.