Bir yapay zeka aracının kendi başına hareket etmesine izin vermeden önce dokuz koruma önlemini doğrulayın. İlk dördü, aracının gerçekleştirebileceği her eylemi bir risk derecesiyle eşleştirir; böylece geri alınamaz, hassas ve maliyetli olanlar her zaman bir kişi için duraklar. Sonraki beşi, bir filtre kandırıldığında aracıyı çevreleyen ortamı onaylar: benzersiz bir aracı kimliği, en az ayrıcalık ilkesine göre izinler, bir kum havuzu, sınırlı ağ çıkışı ve eylem düzeyinde denetim kayıtları. Eylem haritası neyin otomatikleştirilmesinin güvenli olduğunu söyler. Ortam ise asıl çizgiyi tutan şeydir, çünkü çoğu kontrol listesinin dayandığı içerik filtreleri, tam da önemli olduğu anda başarısız olan katmandır. Dokuzunu da evet ya da hayır soruları olarak yürütün ve eğer herhangi bir yanıt hayır ya da "emin değiliz" ise, aracı denetimsiz çalışmaya hazır değildir.
Bu, kurduğumuz bir aracının başka bir şirketin içinde kendi başına hareket etmesine izin vermeden önce yürüttüğümüz lansman öncesi denetimdir; teknik olmayan bir işletme sahibinin de kendi aracında ya da bir tedarikçinin aracında yürütebileceği şekilde yazılmıştır. Bunu sizin için yapmamızı tercih ederseniz, sorumlu yapay zeka yönetişimi ve riskini nasıl yürüttüğümüze bakın. Aşağıdaki her şey sizin kullanımınıza açıktır.
Bu kontrol listesini nasıl kullanmalıyım?
Onu bir felsefe gibi değil, bir uçuş öncesi kontrol gibi ele alın. Dağıtmak üzere olduğunuz aracıyı (ya da bir tedarikçinin size sattığı aracıyı) alın ve dokuz maddenin her birine kesin bir evet ya da hayır ile yanıt verin. "Çoğunlukla" bir hayırdır. Amaç, aracı gerçek bir şeye dokunmadan önce boşlukları ortaya çıkarmaktır.
Dokuz madde, farklı işler yapan iki gruba ayrılır:
- 1'den 4'e kadar olan maddeler (eylem haritası). Bunlar, aracının sormadan ne yapmasına izin verildiğine ve neyin bir insan için durması gerektiğine karar verir. Bu, risk konusunda bir muhakemedir ve çoğu kılavuzun ele aldığı kısımdır.
- 5'ten 9'a kadar olan maddeler (ortam). Bunlar, kendisine ne söylenmiş olursa olsun, aracının genel olarak neye ulaşabileceğini ve ne yapabileceğini sınırlandırır. Bu, çoğu kontrol listesinin atladığı kısımdır ve bir filtre kandırıldığında bir aracıyı dizginleyen kısımdır.
Her iki grup da önemlidir, ancak farklı şekilde başarısız olurlar. Eylem haritası doğru karar vermekle ilgilidir. Ortam ise yanlış bir karardan sağ çıkmakla ilgilidir. İkisine de ihtiyacınız var, çünkü hiçbir filtre her şeyi yakalayamaz: Anthropic'in üretim ortamındaki otomatik mod sınıflandırıcısı, var olanların en iyilerinden biri olmasına rağmen, meşru bir komutu neredeyse hiç engellemeyecek şekilde ayarlandığında bile aşırı hevesli aracı eylemlerinin yaklaşık yüzde 17'sini hâlâ kaçırır. Yüzde 17'lik bir kaçırma oranı, arkasında başka bir katman varken sorun değildir; aracı ile paranız arasındaki tek şey o olduğunda ise pervasızlıktır.
1'den 4'e kadar olan maddeler: her eylemi bir risk derecesiyle eşleştirdiniz mi?
Listelemediğiniz bir şeyi kapı arkasına alamazsınız. Aracının gerçekleştirebileceği her eylemi yazarak başlayın, sonra her birini derecelendirin. OpenAI'nin aracı kılavuzu en temiz derecelendirme yöntemini sunar: her eylemi dört faktör üzerinden düşük, orta veya yüksek olarak puanlayın.
| Faktör | Sorulacak soru | Yüksek risk sinyali |
|---|---|---|
| Yazma yetkisi | Yalnızca okuyor mu, yoksa bir şey mi değiştiriyor? | Yazıyor, gönderiyor veya siliyor |
| Geri alınabilirlik | Sonuç geri alınabilir mi? | Geri alınamaz |
| Hesap izinleri | Bunu yapmak için hangi erişime ihtiyacı var? | Yönetici, finansal veya müşteri verisi kapsamı |
| Finansal etki | Yanlış giderse neye mal olur? | Gerçek para ya da kaybedilen güven |
Koruma önlemi 1: Her eylemi listeleyip düşük, orta veya yüksek olarak derecelendirdiniz mi? Eğer listede kimsenin derecelendirmediği bir eylem varsa, sizi yaralayacak olan tam da odur. Derecelendirme, neredeyse her şeyi üç kovaya ayırır:
| Risk | Örnekler | Kural |
|---|---|---|
| Düşük (yalnızca okuma, geri alınabilir) | Bir siparişi sorgulamak, bir bileti özetlemek, bir yanıt taslağı hazırlamak | Çalışmasına izin verin. Kaydedin. Sonradan inceleyin. |
| Orta (yazar, ama kurtarılabilir) | Bir kaydı güncellemek, dahili bir not yayınlamak, bir taslak oluşturmak | Sıkı sınırlar içinde izin verin. Bir insanı uyarın. |
| Yüksek (geri alınamaz, hassas, maliyetli) | İade veya ödeme, kayıt silmek, erişim vermek, harici bir mesaj göndermek | Çalışmadan önce insan onayı isteyin. Her zaman. |
Koruma önlemi 2: Her yüksek riskli eylem, çalışmadan önce açık bir insan onayı için duraklıyor mu? En kötü sonuçları önleyen tek kural budur. OpenAI, insan onayını hak eden eylemler olarak tam da bunları adlandırır: siparişleri iptal etmek, büyük iadeleri yetkilendirmek ve ödeme yapmak. Buna silme işlemlerini, erişim verme işlemlerini ve binadan ayrılan her mesajı ekleyin. Bir iade aracısı istediği her siparişi okuyabilir, ancak bir kişi onaya tıklamadan küçük bir eşiğin üzerindeki parayı asla hareket ettirmemelidir.
Koruma önlemi 3: Onay kapısı, insanların hâlâ okuyacağı kadar nadir mi? Tuzak, aracıyı her şeyi soracak hale getirmektir. Bunu yaparsanız, daha güvenli bir sistem değil, daha kötü bir sistem kurmuş olursunuz. Anthropic, kullanıcıların izin istemlerinin yaklaşık yüzde 93'ünü onayladığını ölçtü; yani günde kırk kez devreye giren bir kapı bir tiyatrodur: insan görünüşte döngünün içindedir ama bakmayı bırakmıştır. Üç şeyi doğrulayın: aracı yalnızca gerçekten riskli eylemler için sorar, istem sonucu sade bir dille belirtir ("X hesabına 1.000 $ iade et") ve sessizlik varsayılan olarak "hayır" anlamına gelir, asla "evet" değil.
Koruma önlemi 4: Aracı sürekli başarısız olduğunda durup yardım istiyor mu? Yeniden denemelerde takılıp kalan kafası karışmış bir aracı, kendine özgü bir risktir. Bir başarısızlık eşiği belirleyin; böylece belirli sayıda başarısız denemeden sonra aracı debelenmek yerine durur ve durumu yukarıya iletir. OpenAI, insan müdahalesi için tam olarak iki tetikleyici sıralar: başarısızlık eşiklerinin aşılması ve yüksek riskli eylemler. Bunların ikisini de yeni karşıladınız.
5'ten 9'a kadar olan maddeler: onu çevreleyen ortamı doğruladınız mı?
İşte genel kontrol listelerinin atladığı kısım, ve asıl ağır işi yapan kısım da budur. 1'den 4'e kadar olan maddeler aracının doğru karar vereceğini varsayar. 5'ten 9'a kadar olan maddeler ise bazen vermeyeceğini varsayar ve bu olduğunda hasarı sınırlandırır.
Bu grubun önemli olmasının nedeni, aracı güvenliğinde en az ele alınan gerçektir: içerik filtreleri tam da zararlı talimat meşru göründüğünde başarısız olur. Anthropic, bir çalışanın oltalandığı bir test yürüttü; böylece kötü niyetli talimat, aracının hizmet etmek üzere kurulduğu güvenilir kullanıcıdan geldi. 25 yeniden deneme boyunca aracı 24 kez kimlik bilgisi hırsızlığını tamamladı, çünkü onların ifadesiyle, talimatı kullanıcı yazdığında bir sınıflandırıcının yakalayabileceği anormal bir şey yoktur. Onu güvenilir biçimde durduran tek şey ortamsaldı: aracının ağ çıkışını engellemek, böylece çalınan verinin gidecek bir yeri kalmadı. Filtreler niyeti tahmin eder. Ortam ise yeteneği ortadan kaldırır. Yetenek, gerçekten kontrol edebileceğiniz şeydir.
Koruma önlemi 5: Aracının paylaşılan bir yönetici anahtarı değil, kendi kimliği var mı? Her aracı benzersiz bir kimlik altında çalışmalıdır, asla paylaşılan bir kimlik bilgisiyle ve asla bir insanın yönetici girişiyle değil. Paylaşılan bir anahtar, hangi aracının ne yaptığını söyleyemeyeceğiniz anlamına gelir ve bir ihlal, o anahtarın ulaştığı her yere yayılır. Benzersiz bir kimlik ayrıca koruma önlemi 9'daki denetim kaydını anlamlı kılan şeydir.
Koruma önlemi 6: O kimlik en az ayrıcalık ilkesine göre kapsamlandırılmış mı? Aracı, işinin gerçekten ihtiyaç duyduğu en dar izin kümesini alır, daha fazlasını değil. İade veren bir destek aracısının ayrıca müşteri veritabanınızı dışa aktarabilmesi ya da bordroyu değiştirebilmesi gerekmez. Eğer kandırılırsa, hasar bir filtrenin numarayı yakalayıp yakalamadığıyla değil, ona verilenle sınırlı olur. İşe yarayan en az güçlü erişimi kullanın: yalnızca okuma, okuma yazmadan iyidir; ve silme yetkisi olmayan okuma yazma, tam erişimden iyidir.
Koruma önlemi 7: Aracı bir kum havuzunda mı çalışıyor? Aracı, elle kurulmuş bir şeyin değil, yerleşik ve savaşta sınanmış izolasyon üzerine kurulu (güvenilmeyen kodu çalıştırmak için kullanılan aynı konteynerler ve kum havuzları) yalıtılmış bir ortamın içinde çalışmalıdır. Anthropic'in belirttiği gibi, bu yapı taşları, kendiniz kuracağınız herhangi bir şeyden çok daha fazla düşmanca dikkat altında ayakta kalmıştır. Dizginlemeyi kullanıcıyla da eşleştirin: kod okuyup çalıştırabilen bir geliştirici ile bunu yapamayan bir destek temsilcisi aynı tehdit modeli değildir, ve araçlar ne kadar güçlüyse kutu o kadar sıkı olmalıdır.
Koruma önlemi 8: Aracının ağ çıkışı sınırlı ve yeteneğe göre kapsamlandırılmış mı? Yukarıdaki oltalama saldırısını durduran kontrol budur. Ancak basit bir "izin verilen alan adları" listesi tek başına yeterli değildir. Anthropic, saldırganların dosyaları, izin verilen bir alan adı üzerindeki kendi hesaplarına yönlendirerek o alan adı aracılığıyla sızdırdığını acı bir şekilde öğrendi; bu yüzden çıkış kurallarını, yalnızca ulaşabileceği adreslerin bir listesi olarak değil, yetenek izinleri (aracının ne yapmasına izin verildiği) olarak düşünün.
Koruma önlemi 9: Her eylem, denetim için eylem düzeyinde kaydediliyor mu? Göremediğiniz bir şeyi yönetemezsiniz. Aracının gerçekleştirdiği her eylem, özellikle yüksek riskli olanlar, ne olduğunu, neyin ya da kimin onu tetiklediğini ve neye dokunduğunu yeniden kurmaya yetecek kadar ayrıntıyla kaydedilmelidir. Eylem düzeyindeki kayıtlar, yavaş bir sorunu manşet olmadan önce yakalama biçiminizdir ve diğer sekiz koruma önlemini zaman içinde sıkılaştırma biçiminizdir.
Tamamlanmış kontrol listesi neye benzer?
İşte dokuzu, her biri doğrulayabileceğiniz bir evet ya da hayır olarak ifade edilmiş, tek bir yerde. Bir hayır, lansmandan önce kapatılması gereken bir boşluktur, bir dipnot değil.
| # | Koruma önlemi | Şu durumda lansman yapabilirsiniz |
|---|---|---|
| 1 | Eylem envanteri ve risk derecelendirmesi | Her eylem listelenmiş ve düşük, orta veya yüksek olarak derecelendirilmiştir |
| 2 | Yüksek riskli eylemlerde insan kapısı | Geri alınamaz veya maliyetli her eylem onay için duraklar |
| 3 | Nadir, sade dilli onaylar | Kapı yalnızca gerçek riskte devreye girer ve varsayılanı "hayır" olur |
| 4 | Başarısızlık eşiğiyle yukarı iletme | Aracı tekrarlanan başarısızlıklardan sonra durup yardım ister |
| 5 | Benzersiz aracı kimliği | Aracının kendi kimliği vardır, paylaşılan yönetici anahtarı yoktur |
| 6 | En az ayrıcalık ilkesine göre izinler | Yalnızca işinin gerektirdiğine ulaşabilir |
| 7 | Kum havuzu | Yerleşik ve yalıtılmış altyapıda çalışır |
| 8 | Sınırlı, yeteneğe göre kapsamlı çıkış | Ağ erişimi çitle çevrilmiştir, açık bir izin verilen alan adları listesi değildir |
| 9 | Eylem düzeyinde denetim kayıtları | Her eylem kaydedilir ve incelenebilir |
Şekle dikkat edin. İlk dördü risk hakkında verdiğiniz kararlardır; son beşi ise ortama inşa ettiğiniz kontrollerdir. İlk dördü kandırılabilir. Son beşinin işini yapmaktan vazgeçirilmesi mümkün değildir, ve model mükemmel olduğunda bile tartışmaya kapalı olmalarının nedeni budur.
Bu denetimi bir tedarikçinin aracına karşı nasıl yürütürüm?
Aynı dokuz soru bir başkasının aracında da aynı derecede işe yarar, ve dizginlenmiş bir ürünü kendinden emin bir demodan ayırmanın en hızlı yoludur. Bir demo, aracının iyi bir günde çalıştığını kanıtlar. Kontrol listesi ise kötü bir günde ne olacağını kanıtlar.
Tedarikçiden bunları sade bir dille yanıtlamasını isteyin:
- Eylemlerimden hangileri çalışmadan önce insan onayı gerektiriyor? Bunları adlandıramayan bir tedarikçi onları derecelendirmemiştir.
- Aracı en az ayrıcalık erişimine sahip kendi kimliğini mi alıyor, yoksa sistemlerime paylaşılan bir anahtar mı kullanıyor? İkinci yanıt bir tehlike işaretidir.
- Kum havuzunda mı çalışıyor ve ağda neye ulaşabiliyor? "İnternete ulaşabilir" bir yanıt değildir.
- Her eylem kaydediliyor mu ve o kayıtları görebiliyor muyum? Onu denetleyemiyorsanız, yönetemezsiniz.
- Aracı kandırılırsa hasar yarıçapı nedir? Dürüst yanıt, asla kandırılmayacağına dair bir söz değil, neye dokunabileceğinin bir listesidir.
Yanıtlar belirsizse ya da tamamen "model uslu davranır" üzerine kuruluysa, demo ne kadar iyi görünmüş olursa olsun, aracı dizginlenmemiştir. İyi bir tedarikçinin yanıtları hazır olacaktır, çünkü bunlar kendisine sorması gereken aynı sorulardır.
Bu neden şimdi önemli?
Çünkü bu denetimi geçen ekiplerle onu atlayan ekipler arasındaki fark, yakında rakamlarda görünmek üzere. Gartner, 2027 sonuna kadar aracılı yapay zeka projelerinin yüzde 40'ından fazlasının iptal edilmesini bekliyor; yetersiz risk kontrolleri de nedenler arasında sayılıyor. Ayrıca 2028'e kadar kurumsal üretken yapay zeka uygulamalarının yüzde 25'inin yılda en az beş küçük güvenlik olayı yaşayacağını öngörüyor; bu oran 2025'te yüzde 9'du. Koruma önlemleri bir yapılandırma ayarından, bütçesi olan bir kontrol katmanına geçiyor, ve yukarıdaki denetim bu değişimin doğru tarafında kalmanızı sağlayan şeydir.
İşin yüreklendirici yanı, bunların hiçbirinin egzotik olmamasıdır. Her eylemi bir risk derecesiyle eşleştirin ve geri alınamaz olanları kapı arkasına alın. Aracıya, bir kum havuzunda, ağ çitle çevrili ve her eylem kaydedilmiş olarak, ihtiyaç duyduğu en az erişimle kendi kimliğini verin. İnsan kapısını, insanların hâlâ okuyacağı kadar nadir tutun. Bunu yapın, ve filtrenizi atlatan bir saldırgan, kendisine asla verilmemiş bir yetenek duvarına yine de toslar.
Bu dokuz koruma önleminin ilk aracınız devreye girmeden önce sizin için kurulmasını, doğrulanmasını ve yürütülmesini istiyorsanız, başka şirketlerin yığınlarının içinde yaptığımız iş tam da budur. Aşağıdan ücretsiz bir danışma görüşmesi ayarlayın ve bu kontrol listesini aracınıza karşı birlikte yürütelim.
