ओपनएआई ने बुधवार को घोषणा की कि “हमें विश्वास नहीं है कि एआई उद्योग ने लंबे समय तक पूर्ण गति से जिम्मेदार स्केलिंग जारी रखने के लिए पर्याप्त रूप से संरेखण और निगरानी का समाधान किया है।”
लेकिन घोषणा के साथ, ओपनएआई ने कहा कि उसे “प्रशिक्षण के दौरान एआई मॉडल द्वारा भ्रामक तरीके से काम करने और अनधिकृत कार्रवाई करने की अतिरिक्त घटनाएं मिलीं,” सीएनएन की रिपोर्ट। और इसमें कहा गया है कि OpenAI “कंपनी के लिए ऐसे मामलों की सार्वजनिक रूप से रिपोर्ट करने के लिए एक नई प्रक्रिया पेश करता है।”
नई प्रणाली के तहत, ओपनएआई एक ही रिपोर्ट में कई उदाहरणों को समूहित करने की प्रतीक्षा करने के बजाय एआई व्यवहार पर अपडेट अधिक बार साझा करेगा। कंपनी ने कहा कि वह उद्योग-व्यापी मानक के अभाव में एआई के परेशान करने वाले व्यवहार के बारे में अधिक जानकारी साझा करना चाहती है… ओपनएआई ने बुधवार को एक ब्लॉग पोस्ट में लिखा, “जैसे-जैसे एआई सिस्टम अधिक उन्नत और अधिक व्यापक रूप से तैनात होते जा रहे हैं, हमें संरेखण अनुसंधान की प्रगति पर एक व्यापक और बेहतर जानकारी वाली आम सहमति बनाने की जरूरत है।”
ओपनएआई ने कहा कि पिछले छह महीनों में छह परिस्थितियों में एआई मॉडल का प्रशिक्षण और मूल्यांकन करते समय उसने “गलत व्यवहार” देखा… एक दुर्लभ मामले में, ओपनएआई ने कहा कि एक अप्रकाशित अनुसंधान मॉडल ने सारांश में “जेलब्रेक-जैसे निर्देश” जोड़े हैं जो लंबे समय तक चलने वाले कार्यों में संदर्भ को संरक्षित करने के लिए उपयोग करते हैं, जिसमें कहा गया है कि यह “उन भूमिकाओं और पहचानों से मुक्त है जो अन्य चैटबॉट्स को बांधते हैं।” अलग से, कंपनी ने कहा कि उसके 5.6 सोल मॉडल के कुछ मामलों में प्रशिक्षण के दौरान उपयोगकर्ता की खराबी को छिपाने के लिए जानकारी गढ़ने के निर्देश शामिल हैं। अन्य नई रिपोर्ट की गई घटनाओं में एक एजेंट द्वारा बिना बताए इंटरनेट पर फ़ाइलें अपलोड करने का उदाहरण शामिल है, और एजेंट सार्वजनिक रूप से किसी कार्य में सहयोग करने के लिए फ़ाइलें साझा कर रहे हैं, जब उन्हें प्रशिक्षण के दौरान केवल स्थानीय फ़ाइलों का उपयोग करने का निर्देश दिया गया था। एआई मॉडल ने अनधिकृत तरीके से संदेश बोर्ड के रूप में एक आंतरिक सॉफ़्टवेयर रिपॉजिटरी का भी उपयोग किया। इन मामलों में अप्रकाशित आंतरिक मॉडल या आंतरिक अनुसंधान मॉडल शामिल थे।