क्यों डोमेन उपयुक्त है
क्लासिकल रोबोटिक्स में अवस्था अनुमान (कलमन/पार्टिकल फिल्टर), नियंत्रण (LQR, MPC, PID) और, बढ़ती हुई रूप से, सुदृढीकरण सीखने को अलग-अलग मॉड्यूल के रूप में हल किया जाता है। सक्रिय अनुमान इसके बजाय तीनों को एक एकल जनरेटिव मॉडल के तहत अनुमानित बेयसियन अनुमान के रूप में देखता है, धारणा और सीखने के लिए वैरियेशनल फ्री एनर्जी को कम करता है और कार्रवाई चयन के लिए अपेक्षित फ्री एनर्जी - जो ज्ञानमीमांसी (जानकारी-प्राप्ति) और व्यावहारिक (लक्ष्य-संतुष्टि) मूल्य के बीच व्यापार करता है। लैनिलोज़ और सहयोगियों का तर्क है कि यह अवधारणात्मक एकीकरण रोबोटों को आदर्श परीक्षणbeds बनाता है: उन्हें अस्पष्ट सेंसर धाराओं से छिपे हुए चर (शरीर की संरचना, वस्तु अवस्थाओं, गतिशीलता) के बारे में विश्वास बनाए रखने और अपने मॉडल की अपेक्षित सीमा के भीतर अवलोकन रखने के लिए कार्य करना चाहिए। मिलिidge एट अल. द्वारा नियंत्रण-के-अनुमान साहित्य का विश्लेषण भी दर्शाता है कि कुछ मान्यताओं के तहत, सक्रिय अनुमान नीतियां मानक इष्टतम नियंत्रण या RL समाधानों में कम हो जाती हैं, जिससे यह स्पष्ट होता है कि मौजूदा नियंत्रकों को फ्री एनर्जी मिनिमाइजेशन के विशेष मामलों के रूप में पढ़ा जा सकता है।
अनुप्रयोग पैटर्न साहित्य में
रोबोटिक्स कार्यान्वयन में जेनरेटिव मॉडल आमतौर पर ज्ञात भौतिकी और किनेमेटिक्स के आसपास संरचित होते हैं, न कि सीखे गए एंड-टू-एंड के बजाय: मानवोइड बॉडी-पर्सेप्शन कार्य फॉरवर्ड किनेमेटिक्स और मल्टीमॉडल (विजुअल/प्रोप्रियोसेप्टिव) ऑब्जर्वेशन मॉडल को एन्कोड करता है, जबकि मैनिपुलेटर कंट्रोलर संयुक्त गतिशीलता, जड़ता और संपर्क बलों को एन्कोड करते हैं। अपेक्षित फ्री एनर्जी नीति चयन को चलाता है - पेज्जाटो, फेरेरी और हर्नांडेज़ के एडाप्टिव मैनिपुलेटर कंट्रोलर (IEEE रोबोटिक्स एंड ऑटोमेशन लेटर्स में प्रकाशित) ऑनलाइन गतिशील अनिश्चितता और सेंसर दोषों के लिए अनुकूलित होता है, और बायोउमी एट अल. का बॉल-बैलेंसिंग एजेंट अपेक्षित फ्री एनर्जी प्रेरित करता है जो वास्तव में खोजपूर्ण, जिज्ञासा-जैसे व्यवहार पैदा करता है। परिशुद्ध भारन - अनुमानित विश्वसनीयता के आधार पर संवेदी चैनलों या पूर्ववर्तियों में विश्वास को समायोजित करना - इस कार्य में बार-बार होता है, विशेष रूप से फेरेरी समूह की बीटा-रिसाइडुअल स्कीम का उपयोग दोषपूर्ण सेंसरों का पता लगाने और क्षतिपूर्ति करने के लिए किया जाता है। पदानुक्रमित बहु-स्तरीय आर्किटेक्चर अवधारणात्मक रूप से (जैसे, टास्क-स्पेस प्राथमिकताओं पर संयुक्त-स्पेस कार्यों) चर्चा किए जाते हैं लेकिन ठोस पदानुक्रमित कार्यान्वयन दुर्लभ हैं और ज्यादातर सिमुलेशन में सीमित हैं।
कुंजी परियोजनाएँ और उपकरण
pymdp रिपोर्ट का एक नामित सामान्य-उद्देश्यीय सॉफ़्टवेयर लाइब्रेरी है, एक ओपन-सोर्स पायथन पैकेज जो डिस्क्रीट-स्टेट (पीओएमडीपी) सक्रिय अनुमान के लिए पेश किया गया है, जिसे एक पब्लमेड-इंडेक्स्ड स्टेप-बाय-स्टेप ट्यूटोरियल के माध्यम से शुरू किया गया है। डेलफ्ट विश्वविद्यालय की प्रौद्योगिकी में रिकार्डो फेरेज़री का समूह सबसे लगातार मैनिपुलेटर-कंट्रोल बॉडी ऑफ वर्क का उत्पादन करता है - एडाप्टिव कंट्रोलर, एकीकृत स्टेट-एस् estimation/कंट्रोल/लर्निंग (आईसीआरए 2021), अनबायस्ड सक्रिय अनुमान के लिए क्लासिकल कंट्रोल (आईआरओएस 2022) और बीटा-रिसीड्युअल फॉल्ट टॉलरेंस - कोड जिसे उसके रिसर्च साइट पर संदर्भित किया गया है। पाब्लो लैनिलोस और सहयोगियों (टीयू म्यूनिक और जापान-आधारित भागीदारों) मानवोइड लाइन का नेतृत्व करते हैं: बॉडी धारणा और एक भौतिक मानवोइड पर पहुंच, और मिरर सेल्फ/ऑथर डिस्टिंक्श Combine सक्रिय अनुमान के साथ न्यूरल नेटवर्क फॉरवर्ड मॉडल। ब्रिस्टल रोबोटिक्स लैब और एक्टिव टच लेबोरेटरी बेयसियन एक्टिव-सेन्सिंग टैक्टाइल एक्सप्लोरेशन सिस्टम (फिंगरटिप एरेज़, विस्कर) में योगदान करते हैं जो सक्रिय अनुमान सिद्धांतों को हमेशा औपचारिक रूप से नहीं देते हुए, लेकिन उन्हें मूर्त रूप देते हैं, और वर्सेस एआई का ब्लॉग पोस्ट शुरुआती औद्योगिक रुचि को दर्शाता है, हालांकि यह स्पष्ट रूप से सहकर्मी-समीक्षित नहीं है।
खुले प्रश्न
रिपोर्ट पाँच असंभावित क्षेत्रों की पहचान करता है जिन्हें आगे के सबूतों की आवश्यकता है: अपेक्षित-मुक्त ऊर्जा मूल्यांकन का उच्च-आयामी, वास्तविक समय रोबोट में स्केलेबिलिटी (सिमुलेशन में केवल अब तक "स्केलिंग एक्टिव इंफरेंस" प्रीप्रिंट द्वारा संबोधित किया गया है); हाथ से तैयार भौतिकी के साथ सीखे गए घटकों को संतुलित करने वाला सिद्धांतपूर्ण जनरेटिव मॉडल विनिर्देश; क्लासिकल कंट्रोलर और डीप आरएल के खिलाफ हेड-टू-हेड बेंचमार्किंग के लिए, जिसके लिए कोई मानक बेंचमार्क सूट (जैसे म्यूजोको-शैली आरएल सूट) मौजूद नहीं है; वितरण में बदलाव के तहत सुरक्षा और मजबूती, जहां ज़ोरजी एट अल. की डीआर-फ्री फ्रेमवर्क (मुक्त ऊर्जा को अस्पष्ट मॉडल सेट पर कम करके मजबूत करना) प्रस्तावित है लेकिन अभी तक भौतिक रोबोट पर लागू नहीं किया गया है; और संस्थागत अपनाने के कारण, सक्रिय अनुमान उपकरण श्रृंखलाएं आरओएस या डीप-लर्निंग स्टैक की तुलना में बहुत कम परिपक्व हैं। रिपोर्ट स्पष्ट रूप से चेतावनी देती है कि कई दावे व्यवस्थित तुलना के बजाय गुणात्मक या प्रमाण-अवधारणा परिणामों पर आधारित हैं।
संदर्भ आधार
Christopher L. Buckley, Chang Sub Kim, Simon McGregor, Anil K. Seth (2017). क्रिया और धारणा के लिए मुक्त ऊर्जा सिद्धांत: एक गणितीय समीक्षा। जर्नल ऑफ मैथमेटिकल साइकोलॉजी। DOI: 10.1016/j.jmp.2017.09.004। Thomas Parr, Giovanni Pezzulo, Karl J. Friston (2022). सक्रिय अनुमान: मन, मस्तिष्क और व्यवहार में मुक्त ऊर्जा सिद्धांत। एमआईटी प्रेस। Giovanni Pezzulo, Francesco Rigoli, Karl J. Friston (2017). सक्रिय अनुमान, होमियोस्टैटिक विनियमन और अनुकूलनीय व्यवहार नियंत्रण। न्यूरोबायोलॉजी में प्रगति। DOI: 10.1016/j.pneurobio.2017.08.001। Pablo Lanillos, Cristian Meo, Corrado Pezzato, एट अल। (2021). रोबोटिक्स और कृत्रिम एजेंटों में सक्रिय अनुमान: सर्वेक्षण और चुनौतियाँ। arXiv। DOI: 10.48550/arXiv.2112.01871। Lancelot Da Costa, Thomas Parr, Noor Sajid, Sebastijan Veselic, Victorita Neacsu, Karl J. Friston (2020). अलग अवस्था स्थानों पर सक्रिय अनुमान: एक संश्लेषण। जर्नल ऑफ मैथमेटिकल साइकोलॉजी। DOI: 10.1016/j.jmp.2020.102447।