किसी एआई एजेंट को अपने दम पर काम करने देने से पहले, नौ गार्डरेल की पुष्टि करें। पहले चार वह हर क्रिया जो एजेंट कर सकता है उसे एक जोखिम रेटिंग से जोड़ते हैं, ताकि जो अपरिवर्तनीय, संवेदनशील और महँगी हैं वे हमेशा किसी व्यक्ति के लिए रुकें। अगले पाँच उस पर्यावरण की पुष्टि करते हैं जो किसी फ़िल्टर के धोखा खाने पर एजेंट को रोके रखता है: एक अद्वितीय एजेंट पहचान, न्यूनतम-विशेषाधिकार अनुमतियाँ, एक सैंडबॉक्स, सीमित नेटवर्क बहिर्गमन, और क्रिया-स्तरीय ऑडिट लॉग। क्रिया मानचित्र आपको बताता है कि क्या स्वचालित करना सुरक्षित है। पर्यावरण वह है जो वास्तव में मोर्चा संभालता है, क्योंकि जिन कंटेंट फ़िल्टरों पर अधिकांश चेकलिस्ट टिकी रहती हैं, वे ठीक उसी परत हैं जो उस समय विफल होती है जब वह सबसे ज़्यादा मायने रखती है। सभी नौ को हाँ या ना वाले सवालों के रूप में चलाएँ, और यदि कोई उत्तर ना है या "हमें यक़ीन नहीं है," तो एजेंट बिना निगरानी के चलने के लिए तैयार नहीं है।

यह वही लॉन्च-पूर्व ऑडिट है जिसे हम किसी अन्य कंपनी के भीतर अपने बनाए एजेंट को अपने दम पर काम करने देने से पहले चलाते हैं, इस तरह लिखा गया है कि एक गैर-तकनीकी मालिक भी इसे चला सके, अपने एजेंट पर या किसी वेंडर के एजेंट पर। यदि आप चाहें कि हम यह आपके लिए करें, तो देखें कि हम ज़िम्मेदार एआई शासन और जोखिम को कैसे चलाते हैं। नीचे जो कुछ भी है वह आपके उपयोग के लिए है।

मुझे इस चेकलिस्ट का उपयोग कैसे करना चाहिए?

इसे एक प्री-फ़्लाइट जाँच की तरह लें, न कि एक दर्शन की तरह। वह एजेंट लें जिसे आप तैनात करने वाले हैं (या जिसे कोई वेंडर आपको बेच रहा है) और नौ सूत्रों में से हर एक का उत्तर एक पक्के हाँ या ना में दें। "ज़्यादातर" एक ना है। लक्ष्य यह है कि एजेंट के किसी वास्तविक चीज़ को छूने से पहले खामियों को उजागर कर लिया जाए।

ये नौ दो समूहों में बँटते हैं जो अलग-अलग काम करते हैं:

  • सूत्र 1 से 4 (क्रिया मानचित्र)। ये तय करते हैं कि एजेंट को बिना पूछे क्या करने की अनुमति है, और किसके लिए किसी इंसान के पास रुकना ज़रूरी है। यह जोखिम के बारे में निर्णय है, और यही वह हिस्सा है जिसे अधिकांश गाइड कवर करती हैं।
  • सूत्र 5 से 9 (पर्यावरण)। ये सीमित करते हैं कि एजेंट कुल मिलाकर किस तक पहुँच सकता है और क्या कर सकता है, चाहे उसे कुछ भी करने को कहा गया हो। यही वह हिस्सा है जिसे अधिकांश चेकलिस्ट छोड़ देती हैं, और यही वह हिस्सा है जो किसी फ़िल्टर के धोखा खाने पर एजेंट को रोके रखता है।

दोनों समूह मायने रखते हैं, लेकिन वे अलग-अलग तरीक़े से विफल होते हैं। क्रिया मानचित्र सही निर्णय लेने के बारे में है। पर्यावरण एक गलत निर्णय से बच निकलने के बारे में है। आपको दोनों चाहिए, क्योंकि कोई फ़िल्टर सब कुछ नहीं पकड़ता: Anthropic का प्रोडक्शन ऑटो-मोड क्लासिफ़ायर, जो मौजूद सबसे अच्छों में से एक है, फिर भी लगभग 17% अति-उत्साही एजेंट क्रियाओं को चूक जाता है, तब भी जब उसे लगभग कभी किसी वैध कमांड को न रोकने के लिए ट्यून किया गया हो। 17% की चूक दर ठीक है जब उसके पीछे एक और परत हो, और लापरवाह तब है जब वह एजेंट और आपके पैसे के बीच एकमात्र चीज़ हो।

सूत्र 1 से 4: क्या आपने हर क्रिया को एक जोखिम रेटिंग से जोड़ा है?

आप उसे गेट नहीं कर सकते जिसे आपने सूचीबद्ध नहीं किया है। एजेंट द्वारा की जा सकने वाली हर क्रिया को लिखने से शुरू करें, फिर हर एक को रेट करें। OpenAI का एजेंट गाइड सबसे साफ़ रेटिंग विधि देता है: हर क्रिया को चार कारकों पर निम्न, मध्यम या उच्च अंक दें।

कारकपूछेंउच्च-जोखिम संकेत
लिखने की पहुँचक्या यह केवल पढ़ता है, या कुछ बदलता है?यह लिखता है, भेजता है, या मिटाता है
उलटनीयताक्या परिणाम को पूर्ववत किया जा सकता है?इसे वापस नहीं लिया जा सकता
खाता अनुमतियाँइसे यह करने के लिए किस पहुँच की ज़रूरत है?एडमिन, वित्तीय, या ग्राहक-डेटा का दायरा
वित्तीय प्रभावयदि यह गलत हो जाए तो इसकी क्या क़ीमत है?असली पैसा, या खोया हुआ भरोसा

गार्डरेल 1: क्या आपने हर क्रिया को सूचीबद्ध किया है और उसे निम्न, मध्यम या उच्च रेट किया है? यदि सूची में कोई ऐसी क्रिया है जिसे किसी ने रेट नहीं किया, तो वही आपको नुकसान पहुँचाएगी। रेटिंग लगभग हर चीज़ को तीन भागों में बाँट देती है:

जोखिमउदाहरणनियम
निम्न (केवल-पढ़ने, उलटी जा सकने वाली)किसी ऑर्डर को देखना, किसी टिकट का सारांश बनाना, उत्तर का मसौदा बनानाइसे चलने दें। इसे लॉग करें। बाद में समीक्षा करें।
मध्यम (लिखता है, लेकिन ठीक किया जा सकता है)किसी रिकॉर्ड को अपडेट करना, एक आंतरिक नोट पोस्ट करना, एक मसौदा बनानासख़्त सीमाओं के भीतर अनुमति दें। किसी इंसान को सतर्क करें।
उच्च (अपरिवर्तनीय, संवेदनशील, महँगी)रिफंड या भुगतान, रिकॉर्ड मिटाना, पहुँच देना, कोई बाहरी संदेश भेजनाचलने से पहले मानव अनुमोदन की आवश्यकता हो। हमेशा।

गार्डरेल 2: क्या हर उच्च-जोखिम क्रिया चलने से पहले स्पष्ट मानव अनुमोदन के लिए रुकती है? यही एकमात्र नियम है जो सबसे बुरे परिणामों को रोकता है। OpenAI ठीक इन्हीं को उन क्रियाओं के रूप में बताता है जिनके लिए मानव स्वीकृति आवश्यक है: ऑर्डर रद्द करना, बड़े रिफंड को अधिकृत करना, और भुगतान करना। इनमें डिलीशन, पहुँच देना, और कोई भी संदेश जो इमारत से बाहर जाता है, जोड़ दें। एक रिफंड एजेंट चाहे जितने ऑर्डर पढ़ ले, लेकिन उसे किसी व्यक्ति के अनुमोदन पर क्लिक किए बिना एक छोटी सीमा से ऊपर कभी पैसा नहीं हिलाना चाहिए।

गार्डरेल 3: क्या अनुमोदन गेट इतना दुर्लभ है कि लोग अब भी उसे पढ़ें? जाल यह है कि एजेंट को हर चीज़ के बारे में पूछने को कहा जाए। ऐसा करें, और आपने एक बेहतर नहीं बल्कि एक बदतर प्रणाली बना ली है। Anthropic ने मापा कि उपयोगकर्ता लगभग 93% अनुमति संकेतों को मंज़ूर कर देते हैं, इसलिए एक गेट जो दिन में चालीस बार सक्रिय होता है वह दिखावा है: इंसान नाममात्र के लिए लूप में है पर उसने देखना बंद कर दिया है। तीन चीज़ों की पुष्टि करें: एजेंट केवल सच में जोखिम भरी क्रियाओं के लिए संकेत दे, संकेत परिणाम को सीधी भाषा में बताए ("खाता X को $1,000 रिफंड करें"), और चुप्पी का डिफ़ॉल्ट "ना" हो, कभी "हाँ" नहीं।

गार्डरेल 4: क्या एजेंट तब रुककर मदद माँगता है जब वह बार-बार विफल होता रहता है? एक भ्रमित एजेंट जो पुनः प्रयासों पर अटका रहता है, अपने आप में एक तरह का जोखिम है। एक विफलता सीमा निर्धारित करें, ताकि तय संख्या में विफल प्रयासों के बाद एजेंट छटपटाने के बजाय रुक जाए और मामला आगे बढ़ा दे। OpenAI मानव हस्तक्षेप के लिए ठीक दो ट्रिगर सूचीबद्ध करता है: विफलता सीमाओं से अधिक होना, और उच्च-जोखिम वाली क्रियाएँ। आपने अभी-अभी दोनों को कवर कर लिया।

सूत्र 5 से 9: क्या आपने उस पर्यावरण की पुष्टि की है जो इसे रोके रखता है?

यह वह हिस्सा है जिसे सामान्य चेकलिस्ट छोड़ देती हैं, और यही वह हिस्सा है जो भारी काम करता है। सूत्र 1 से 4 मानकर चलते हैं कि एजेंट सही निर्णय लेता है। सूत्र 5 से 9 मानते हैं कि वह कभी-कभी ऐसा नहीं करेगा, और जब ऐसा होता है तो नुकसान पर सीमा लगाते हैं।

इस समूह के मायने रखने का कारण एजेंट सुरक्षा का सबसे कम-कवर किया गया तथ्य है: कंटेंट फ़िल्टर ठीक तब विफल होते हैं जब हानिकारक निर्देश वैध दिखता है। Anthropic ने एक परीक्षण चलाया जहाँ एक कर्मचारी को फ़िश किया गया, इसलिए दुर्भावनापूर्ण निर्देश उसी भरोसेमंद उपयोगकर्ता से आया जिसकी सेवा के लिए एजेंट बनाया गया था। 25 पुनः प्रयासों में एजेंट ने 24 बार क्रेडेंशियल चोरी पूरी की, क्योंकि, उनके शब्दों में, जब उपयोगकर्ता निर्देश टाइप करता है तो किसी क्लासिफ़ायर के पकड़ने के लिए कुछ भी असामान्य नहीं होता। एकमात्र चीज़ जिसने इसे भरोसेमंद ढंग से रोका वह पर्यावरणीय थी: एजेंट के नेटवर्क बहिर्गमन को रोकना ताकि चुराए गए डेटा के पास जाने को कोई जगह न हो। फ़िल्टर इरादे का अनुमान लगाते हैं। पर्यावरण क्षमता को हटा देता है। क्षमता वही है जिसे आप वास्तव में नियंत्रित कर सकते हैं।

गार्डरेल 5: क्या एजेंट की अपनी पहचान है, न कि एक साझा एडमिन कुंजी? हर एजेंट को एक अद्वितीय पहचान के तहत चलना चाहिए, कभी किसी साझा क्रेडेंशियल के तहत नहीं और कभी किसी इंसान के एडमिन लॉगिन के तहत नहीं। एक साझा कुंजी का मतलब है कि आप बता नहीं सकते कि किस एजेंट ने क्या किया, और एक सेंध हर उस जगह फैल जाती है जहाँ वह कुंजी पहुँचती है। एक अद्वितीय पहचान ही गार्डरेल 9 में ऑडिट लॉग को सार्थक बनाती है।

गार्डरेल 6: क्या वह पहचान न्यूनतम विशेषाधिकार तक सीमित है? एजेंट को उसके काम के लिए वास्तव में ज़रूरी अनुमतियों का सबसे संकीर्ण समूह मिले, और इससे ज़्यादा कुछ नहीं। एक सपोर्ट एजेंट जो रिफंड जारी करता है, उसे आपके ग्राहक डेटाबेस को निर्यात करने या पेरोल बदलने में भी सक्षम नहीं होना चाहिए। यदि इसे धोखा दिया जाए, तो नुकसान इस बात से बँधा होता है कि इसे क्या दिया गया था, न कि इस बात से कि किसी फ़िल्टर ने धोखे को पकड़ा या नहीं। ऐसी सबसे कम-शक्तिशाली पहुँच का उपयोग करें जो काम करती हो: केवल-पढ़ने की पहुँच, पढ़ने-लिखने से बेहतर है, और बिना-डिलीट के पढ़ने-लिखने की पहुँच, पूर्ण पहुँच से बेहतर है।

गार्डरेल 7: क्या एजेंट एक सैंडबॉक्स में चलता है? एजेंट को एक अलग-थलग पर्यावरण के भीतर काम करना चाहिए जो स्थापित, खूब आज़माए गए आइसोलेशन (वही कंटेनर और सैंडबॉक्स जो अविश्वसनीय कोड चलाने के लिए उपयोग किए जाते हैं) पर बना हो, न कि किसी हाथ से गढ़ी चीज़ पर। जैसा कि Anthropic नोट करता है, उन बुनियादी ढाँचों ने उससे कहीं ज़्यादा प्रतिकूल जाँच झेली है जितनी आप ख़ुद बनाएँगे। नियंत्रण को उपयोगकर्ता से भी मिलाएँ: एक डेवलपर जो कोड पढ़ और चला सकता है और एक सपोर्ट प्रतिनिधि जो नहीं चला सकता, ये एक जैसे खतरे के मॉडल नहीं हैं, और उपकरण जितने ज़्यादा शक्तिशाली होंगे, बक्सा उतना ही सख़्त होना चाहिए।

गार्डरेल 8: क्या एजेंट का नेटवर्क बहिर्गमन सीमित है और क्षमता के अनुसार बँधा है? यही वह नियंत्रण है जिसने ऊपर वाले फ़िशिंग हमले को रोका। लेकिन एक साधारण "अनुमत डोमेन" सूची अपने आप में काफ़ी नहीं है। Anthropic ने मुश्किल तरीक़े से सीखा कि हमलावरों ने एक अनुमत डोमेन के ज़रिए फ़ाइलें बाहर भेज दीं, उन्हें उस पर अपने ही खाते की ओर मोड़कर, इसलिए बहिर्गमन नियमों को सिर्फ़ उन पतों की सूची के बजाय जिन तक एजेंट पहुँच सकता है, क्षमता-अनुदानों के रूप में सोचें (एजेंट को क्या करने की अनुमति है)।

गार्डरेल 9: क्या ऑडिट के लिए हर क्रिया को क्रिया स्तर पर लॉग किया जाता है? आप उसे शासित नहीं कर सकते जिसे आप देख नहीं सकते। एजेंट जो भी क्रिया करता है, ख़ासकर उच्च-जोखिम वाली, उसे इतने विवरण के साथ दर्ज किया जाना चाहिए कि यह फिर से बनाया जा सके कि क्या हुआ, किसने या किस चीज़ ने इसे ट्रिगर किया, और इसने क्या छुआ। क्रिया-स्तरीय लॉग ही वह तरीक़ा है जिससे आप किसी धीमी समस्या को सुर्खी बनने से पहले पकड़ लेते हैं, और जिससे आप समय के साथ बाकी आठ गार्डरेल को कसते हैं।

तैयार चेकलिस्ट कैसी दिखती है?

यहाँ सभी नौ एक ही जगह हैं, हर एक को एक हाँ या ना के रूप में लिखा गया है जिसे आप सत्यापित कर सकते हैं। एक ना लॉन्च से पहले बंद करने योग्य खामी है, न कि कोई पाद-टिप्पणी।

#गार्डरेलआप तब लॉन्च कर सकते हैं जब
1क्रिया सूची और जोखिम रेटिंगहर क्रिया सूचीबद्ध है और निम्न, मध्यम या उच्च रेट की गई है
2उच्च-जोखिम क्रियाओं पर मानव गेटहर अपरिवर्तनीय या महँगी क्रिया अनुमोदन के लिए रुकती है
3दुर्लभ, सीधी-भाषा वाले अनुमोदनगेट केवल असली जोखिम पर सक्रिय होता है और "ना" पर डिफ़ॉल्ट करता है
4विफलता-सीमा पर वृद्धिबार-बार विफलताओं के बाद एजेंट रुककर मदद माँगता है
5अद्वितीय एजेंट पहचानएजेंट की अपनी पहचान है, कोई साझा एडमिन कुंजी नहीं
6न्यूनतम-विशेषाधिकार अनुमतियाँयह केवल उसी तक पहुँच सकता है जिसकी उसके काम को ज़रूरत है
7सैंडबॉक्सयह स्थापित, अलग-थलग बुनियादी ढाँचे में चलता है
8सीमित, क्षमता-आधारित बहिर्गमननेटवर्क पहुँच घिरी हुई है, न कि एक खुली अनुमत-डोमेन सूची
9क्रिया-स्तरीय ऑडिट लॉगहर क्रिया दर्ज की गई है और समीक्षा योग्य है

आकार पर ग़ौर करें। पहले चार जोखिम के बारे में आपके लिए गए निर्णय हैं; अंतिम पाँच ऐसे नियंत्रण हैं जिन्हें आप पर्यावरण में बनाते हैं। पहले चार को धोखा दिया जा सकता है। अंतिम पाँच को उनका काम न करने के लिए बहलाया-फुसलाया नहीं जा सकता, इसीलिए वे तब भी ग़ैर-समझौतेबाज़ हैं जब मॉडल उत्कृष्ट हो।

मैं इस ऑडिट को किसी वेंडर के एजेंट के विरुद्ध कैसे चलाऊँ?

वही नौ सवाल किसी और के एजेंट पर भी उतने ही अच्छे काम करते हैं, और वे एक रोके हुए उत्पाद को एक आत्मविश्वासी डेमो से अलग बताने का सबसे तेज़ तरीक़ा हैं। एक डेमो साबित करता है कि एजेंट एक अच्छे दिन काम करता है। चेकलिस्ट साबित करती है कि एक बुरे दिन क्या होता है।

वेंडर से इनका उत्तर सीधी भाषा में देने को कहें:

  • मेरी कौन-सी क्रियाओं को चलने से पहले मानव अनुमोदन की ज़रूरत है? एक वेंडर जो उन्हें नाम नहीं दे सकता, उसने उन्हें रेट नहीं किया है।
  • क्या एजेंट को न्यूनतम-विशेषाधिकार पहुँच के साथ अपनी पहचान मिलती है, या यह मेरी प्रणालियों में एक साझा कुंजी का उपयोग करता है? दूसरा उत्तर एक चेतावनी का संकेत है।
  • क्या यह सैंडबॉक्स में है, और यह नेटवर्क पर किस तक पहुँच सकता है? "यह इंटरनेट तक पहुँच सकता है" कोई उत्तर नहीं है।
  • क्या हर क्रिया लॉग होती है, और क्या मैं वे लॉग देख सकता हूँ? यदि आप इसका ऑडिट नहीं कर सकते, तो आप इसे शासित नहीं कर सकते।
  • यदि एजेंट को धोखा दिया जाए तो ब्लास्ट रेडियस क्या है? ईमानदार उत्तर इस बात की सूची है कि यह क्या छू सकता है, न कि यह वादा कि ऐसा कभी नहीं होगा।

यदि उत्तर अस्पष्ट हैं, या पूरी तरह "मॉडल अच्छा व्यवहार करता है" पर टिके हैं, तो एजेंट रोका हुआ नहीं है, चाहे डेमो कितना भी अच्छा क्यों न दिखा हो। एक अच्छा वेंडर उत्तर तैयार रखेगा, क्योंकि ये वही सवाल हैं जो उन्हें ख़ुद से पूछ लेने चाहिए थे।

यह अभी क्यों मायने रखता है?

क्योंकि जो टीमें इस ऑडिट को पास करती हैं और जो इसे छोड़ देती हैं, उनके बीच का अंतर जल्द ही आँकड़ों में दिखने वाला है। Gartner का अनुमान है कि 2027 के अंत तक 40% से अधिक एजेंटिक एआई परियोजनाएँ रद्द हो जाएँगी, जिनके कारणों में अपर्याप्त जोखिम नियंत्रण का नाम है, और यह भविष्यवाणी करता है कि 2028 तक 25% एंटरप्राइज़ जेनरेटिव-एआई एप्लिकेशन हर साल कम से कम पाँच छोटी सुरक्षा घटनाएँ झेलेंगे, जो 2025 में 9% से बढ़कर है। गार्डरेल एक कॉन्फ़िग सेटिंग से एक बजट वाले नियंत्रण तल में बदल रहे हैं, और ऊपर वाला ऑडिट ही वह तरीक़ा है जिससे आप उस बदलाव की सही तरफ़ बने रहते हैं।

उत्साहजनक बात यह है कि इसमें से कुछ भी विदेशी या विचित्र नहीं है। हर क्रिया को एक जोखिम रेटिंग से जोड़ें और अपरिवर्तनीय क्रियाओं को गेट करें। एजेंट को उसकी अपनी पहचान दें, उसके काम के लिए सबसे कम पहुँच के साथ, एक सैंडबॉक्स में, नेटवर्क घिरा हुआ और हर क्रिया लॉग की हुई। मानव गेट को इतना दुर्लभ रखें कि लोग अब भी उसे पढ़ें। ऐसा करें, और एक हमलावर जो आपके फ़िल्टर से बच निकलता है, फिर भी क्षमता की एक दीवार से टकराता है जो उसे कभी दी ही नहीं गई थी।

यदि आप चाहते हैं कि ये नौ गार्डरेल आपके पहले एजेंट के लाइव होने से पहले आपके लिए बनाए, सत्यापित और चलाए जाएँ, तो ठीक यही वह काम है जो हम अन्य कंपनियों के स्टैक के भीतर करते हैं। नीचे एक मुफ़्त परामर्श बुक करें और हम मिलकर इस चेकलिस्ट को आपके एजेंट के विरुद्ध चलाएँगे।