सौर पैनलों के लिए थर्मल इमेजिंग: कैसे SESPNet इन्फ्रारेड में हर हॉटस्पॉट को पकड़ता है
विषय-सूची
उत्पाद परिचय
एक सोलर फार्म में दसियों हज़ार से लेकर कई मिलियन मॉड्यूल हो सकते हैं। दिन-ब-दिन वे गर्मी, हवा, रेत, बारिश और बर्फ में बैठे रहते हैं, इसलिए इसमें कोई आश्चर्य नहीं कि उन्हें तरह-तरह की बीमारियाँ लग जाती हैं। सबसे आम, और सबसे खतरनाक भी, हॉटस्पॉट है।
हॉटस्पॉट मॉड्यूल पर एक छोटा सा हिस्सा होता है जो असामान्य रूप से गर्म चलता है। सबसे अच्छी स्थिति में यह आपके बिजली उत्पादन को कम करता है। सबसे बुरी स्थिति में यह बैकशीट को जला देता है और आग लगा देता है, जिससे पूरा प्लांट खतरे में पड़ जाता है। समस्या यह है कि मॉड्यूल किनारे से किनारे तक पैक होते हैं। हाथ से पकड़े जाने वाले उपकरण से एक-एक करके उनकी जाँच करने के लिए कर्मचारियों को भेजना धीमा है और चीज़ें छूट जाती हैं। इसलिए इन्फ्रारेड थर्मोग्राफी और डीप लर्निंग की जोड़ी को सुर्खियों में लाया गया है।
एक इन्फ्रारेड कैमरा मॉड्यूल पर इंगित करें, उसके तापमान फैलाव को हीट मैप के रूप में कैप्चर करें, फिर एक प्रशिक्षित तंत्रिका नेटवर्क को उस मैप को पढ़ने दें और चिह्नित करें कि यह कहाँ गर्म है और कितना गर्म है। यह सीधा लगता है। लेकिन इसे वास्तव में क्षेत्र में काम करवाना दूसरी कहानी है। इन्फ्रारेड छवियों में तीन अंतर्निहित खामियाँ होती हैं जो सामान्य एल्गोरिदम को लड़खड़ा देती हैं: कम रिज़ॉल्यूशन, बेहद अलग दोष आकार, और गंदी पृष्ठभूमि।
SESPNet (सिमेंटिक एन्हांसमेंट और स्केल परसेप्शन नेटवर्क) नामक एक नई विधि सीधे उन तीन खामियों पर जाती है। इसके आँकड़े ठोस हैं: 92.1% मीन औसत परिशुद्धता, 62.4 फ्रेम प्रति सेकंड, और यह इतना छोटा है कि हथेली के आकार के एम्बेडेड डिवाइस पर वास्तविक समय में चल सकता है। यह लेख बताता है कि यह एक नीरस ग्रे इन्फ्रारेड फ्रेम से हर हॉटस्पॉट कैसे निकालता है।
पहले, हॉटस्पॉट क्यों मायने रखते हैं। एक PV मॉड्यूल कई सेल होते हैं जो श्रृंखला में जुड़े होते हैं। यदि एक सेल छायांकन, माइक्रो-क्रैक या गंदगी के कारण आउटपुट खो देता है, तो यह करंट का योगदान देना बंद कर देता है और एक रेसिस्टर की तरह कार्य करना शुरू कर देता है, अन्य सेलों के करंट को गर्मी में बदल देता है और इसे अपने अंदर जला देता है। वह एक सेल पूरी स्ट्रिंग के लिए गर्मी का स्रोत बन जाता है, अपने पड़ोसियों से दसियों डिग्री अधिक गर्म चलता है। हल्के मामले स्ट्रिंग के आउटपुट को नीचे खींचते हैं। गंभीर मामले समय के साथ एनकैप्सुलेंट को पकाते हैं, बैकशीट को जलाते हैं, और यहाँ तक कि आग भी लगा सकते हैं। हॉटस्पॉट को जल्दी ढूंढना और उनसे तेज़ी से निपटना एक ऐसा काम है जिसे PV संचालन टाल नहीं सकते।

चित्र 1: छत पर लगे सोलर कलेक्टर मॉड्यूल, जो वर्षों से बाहरी वातावरण में हैं, जहां स्थानीय तापमान में वृद्धि से हॉटस्पॉट बनते हैं।

चित्र 2: पीवी मॉड्यूल दोषों के लिए इन्फ्रारेड थर्मल डिटेक्शन की पांच-चरणीय कार्यप्रणाली, तापमान कैप्चर करने से लेकर दोषपूर्ण पैनल की पहचान तक।
तकनीकी पैरामीटर
हॉटस्पॉट डिटेक्शन के लिए इन्फ्रारेड क्यों आवश्यक है
इस एल्गोरिदम को समझने के लिए, मूल बातों से शुरू करें: छिपे हुए पीवी दोषों के लिए दृश्य-प्रकाश कैमरा पर्याप्त क्यों नहीं है, और इन्फ्रारेड ही एकमात्र तरीका क्यों है।
दृश्य-प्रकाश इमेजिंग सिर्फ सामान्य फोटोग्राफी है। उच्च रिज़ॉल्यूशन, समृद्ध विवरण, सतह पर दरारें, खरोंच और गंदगी का पता लगाने के लिए अच्छा है, जो आप देख सकते हैं। लेकिन इसकी एक घातक सीमा है। यह केवल दिखावट पढ़ता है, तापमान नहीं। मॉड्यूल के अंदर एक माइक्रो-क्रैक या ठंडा सोल्डर जोड़ अक्सर शुरुआत में इसकी उपस्थिति नहीं बदलता है, फिर भी यह उस स्थान पर करंट को रोकता है और उसे गर्म करता है। दृश्य-प्रकाश कैमरे इन थर्मल दोषों के खिलाफ असहाय हैं, और रात में या कम रोशनी में वे बेकार हैं।
इन्फ्रारेड एक अलग रास्ता अपनाता है। परम शून्य से ऊपर कोई भी वस्तु इन्फ्रारेड विकिरण करती है, और जितनी गर्म होती है, विकिरण उतना ही मजबूत होता है। एक इन्फ्रारेड कैमरा उस विकिरण को कैप्चर करता है और अदृश्य तापमान वितरण को सीधे रंगीन या ग्रेस्केल हीट मैप पर चित्रित करता है। इसे बाहरी प्रकाश की आवश्यकता नहीं होती, इसलिए यह दिन या रात काम करता है। मॉड्यूल कहाँ गर्म है और कितना गर्म है, यह स्पष्ट रूप से दिखाई देता है। हॉटस्पॉट और टूटी ग्रिडलाइन जैसे गर्मी-जनित दोषों के लिए, इन्फ्रारेड प्राकृतिक समाधान है।
इसीलिए इन्फ्रारेड पीवी संयंत्रों में दोष पहचान की सटीकता और गति दोनों बढ़ाने का एक प्रमुख तरीका बन गया है। इन्फ्रारेड कैमरे वाला ड्रोन कुछ ही मिनटों में पूरे ऐरे को स्कैन कर सकता है, जो मैनुअल टीम की तुलना में दर्जनों गुना तेज है। लेकिन गर्मी देखने की यह क्षमता एक कीमत पर आती है: छवि गुणवत्ता दृश्य प्रकाश की तुलना में बहुत कम है।
पुरानी मैनुअल विधि में कर्मचारी उपकरण लेकर पैनल-दर-पैनल मापते हैं। यह धीमा है और अनुभव पर बहुत निर्भर करता है। जब मॉड्यूल घने और हजारों की संख्या में होते हैं, तो उन्हें एक-एक करके पढ़ना थकाऊ, त्रुटि-प्रवण और रात में लगभग असंभव है। ड्रोन-प्लस-इन्फ्रारेड संयोजन कैप्चर चरण को अधिकतम करता है, लेकिन यदि आप अभी भी उन हजारों छवियों को हाथ से पढ़ते हैं, तो बाधा मापने से देखने की ओर स्थानांतरित हो जाती है। लूप को बंद करने के लिए आपको छवियों को पढ़ने के लिए एक एल्गोरिदम की आवश्यकता है। यही डीप लर्निंग का संकेत है।

चित्र 3: एक विशिष्ट इन्फ्रारेड हीट मैप। क्षेत्र जितना गर्म होगा, उसका रंग उतना ही गर्म होगा, और अत्यधिक गर्म क्षेत्र एक नज़र में स्पष्ट दिखाई देता है। यह हॉटस्पॉट डिटेक्शन के लिए कच्चा माल है।

चित्र 4: दृश्य-प्रकाश और इन्फ्रारेड इमेजिंग के बीच कार्य का विभाजन। थर्मल दोषों के लिए, इन्फ्रारेड प्राकृतिक समाधान है।
इन्फ्रारेड दोष पहचान में तीन कठिन चुनौतियाँ
इन्फ्रारेड गर्मी देख सकता है, लेकिन यह पहचान एल्गोरिदम को तीन कठिन समस्याएँ देता है। ये तीन ही कारण हैं कि कई तैयार एल्गोरिदम PV इन्फ्रारेड कार्य पर विफल हो जाते हैं।
एक: कम कंट्रास्ट। इन्फ्रारेड फ्रेम समग्र रूप से सुस्त और ग्रे होते हैं। दोष और पृष्ठभूमि के बीच ग्रेस्केल अंतर शुरू में छोटा होता है, और उसके ऊपर इमेजिंग शोर दोषों को पृष्ठभूमि में निगल जाने देता है। एल्गोरिदम मुख्य विशेषताओं को पकड़ नहीं पाता, इसलिए सटीकता प्रभावित होती है।
दो: अत्यधिक परिवर्तनशील दोष आकार। एक ही इन्फ्रारेड फ्रेम के भीतर, हॉटस्पॉट आकार दसियों गुना भिन्न हो सकते हैं। कुछ एक पूरा बायपास किया गया स्ट्रिंग है जो बड़े क्षेत्र में चमकता है; अन्य सिर्फ एक कोशिका है जो एक कोने में थोड़ा गर्म होती है। एक निश्चित रिसेप्टिव फील्ड, वह सीमा जिसे नेटवर्क एक बार में स्पष्ट रूप से देख सकता है, ऐसे फैलाव के खिलाफ एक को खो देता है: बड़े लक्ष्य को पकड़ें और छोटे को खो दें, या इसके विपरीत।
तीन: छोटे लक्ष्य की जानकारी खो जाती है। यह सबसे पेचीदा है। तंत्रिका नेटवर्क परत दर परत डाउनसैंपल करते हैं, उच्च-स्तरीय अर्थ निकालने के लिए छवि को सिकोड़ते हैं। लेकिन छोटे हॉटस्पॉट जो शुरू में केवल दसियों पिक्सेल थे, सिकुड़ते समय चिकने हो जाते हैं, जब तक कि निर्णय लेने के समय लगभग कुछ भी नहीं बचता, और पहचान को बड़ा झटका लगता है।
इन तीनों को एक साथ रखें और यह स्पष्ट है: PV इन्फ्रारेड दोष पहचान कठिन है क्योंकि आपको एक साथ "स्पष्ट रूप से नहीं देख सकते, आकार हर जगह, आसानी से खो जाते हैं" से लड़ना पड़ता है। SESPNet के तीन मुख्य उन्नयन प्रत्येक इनमें से एक हड्डी को लक्षित करते हैं: एक पृष्ठभूमि को दबाने के लिए शब्दार्थ को बढ़ाता है, एक आकार संभालने के लिए पिरामिड बनाता है, एक छोटे लक्ष्यों को पुनर्प्राप्त करने के लिए चैनलों की रक्षा करता है।
तैयार डिटेक्टर क्यों नहीं पकड़ते? ऑब्जेक्ट डिटेक्शन तेजी से आगे बढ़ा है, और यह दो मार्गों में विभाजित है। एक दो-चरणीय है: पहले उम्मीदवार क्षेत्रों की मोटे तौर पर जांच करें, फिर प्रत्येक का ध्यानपूर्वक न्याय करें, उच्च सटीकता लेकिन धीमा। दूसरा एक-चरणीय है: एक नज़र में स्थान और वर्ग दोनों देता है, तेज़ और वास्तविक समय के लिए उपयुक्त। YOLO श्रृंखला एक-चरणीय प्रमुख है। लेकिन ये सामान्य एल्गोरिदम सामान्य दृश्य छवियों पर प्रशिक्षित होते हैं, और कम कंट्रास्ट, अत्यधिक परिवर्तनशील PV इन्फ्रारेड फ्रेम पर डाले जाने पर संघर्ष करते हैं। SESPNet के उन्नयन उन तीन अंतरालों को भरते हैं, जो इन्फ्रारेड दोषों के लिए विशेष रूप से बनाए गए हैं।

चित्र 5: इन्फ्रारेड दोष पहचान की तीन कठिन चुनौतियाँ: कम कंट्रास्ट, कई आकार, और छोटे लक्ष्य।

चित्र 6: एक मल्टी-रोटर ड्रोन जिसमें कैमरा लगा है, सरणी के ऊपर उड़कर थोक में इन्फ्रारेड छवियां ले रहा है, जो मिनटों में वह कवर कर लेता है जिसे एक क्रू को आधा दिन लगता।
तकनीकी लाभ
चाल एक: सिमेंटिक संवर्धन, पृष्ठभूमि से दोषों को बाहर तैराना
SESPNet अपने आधार मॉडल के रूप में YOLOv10 पर निर्मित है। YOLOv10 आज के सबसे लोकप्रिय रीयल-टाइम डिटेक्टरों में से एक है, जिसे मई 2024 में एक सिंघुआ टीम द्वारा जारी किया गया था, जो तेज़, सटीक और तैनाती-अनुकूल होने के लिए बनाया गया है। SESPNet इस पर तीन ऑपरेशन करता है, और पहला बैकबोन में एक सिमेंटिक इंफॉर्मेशन एन्हांसमेंट मॉड्यूल, SIEM, एम्बेड करता है।
यह जो समस्या हल करता है वह कम-कंट्रास्ट समस्या है। इन्फ्रारेड दोष छवियों में खराब कंट्रास्ट पृष्ठभूमि शोर को मॉडल द्वारा निकाले गए फीचर्स में हस्तक्षेप करने देता है, जिससे सटीकता प्रभावित होती है। SIEM एक साथ दो तरीकों से काम करता है। एक वैश्विक ध्यान शाखा पूरी छवि के समग्र अर्थ को लेती है, यह पता लगाती है कि पृष्ठभूमि क्या है और क्या किसी दोष को छिपा सकता है, ताकि अव्यवस्था का हस्तक्षेप कम हो जाए। एक स्थानीय ध्यान शाखा दोष के अपने विवरण और बनावट पर ध्यान केंद्रित करती है, जिससे इसकी फीचर अभिव्यक्ति तेज होती है।
प्रत्येक शाखा अपनी चीज़ देखती है, फिर वैश्विक और स्थानीय को भारित कर एक साथ जोड़ दिया जाता है। इसे ऐसे समझें जैसे पूरी छत की रूपरेखा देखने के लिए आंखें सिकोड़ना और अव्यवस्था को खारिज करना, फिर संदिग्ध पैच को घूरने के लिए झुकना। निकट और दूर का संयोजन, और दोष सुस्त पृष्ठभूमि से बाहर उठ जाता है। संयुक्त फीचर्स दोष का विवरण बनाए रखते हैं जबकि पृष्ठभूमि हस्तक्षेप को दबाते हैं, इसलिए फीचर अभिव्यक्ति स्पष्ट रूप से मजबूत होती है।
लाभ बाद में एब्लेशन अध्ययन में स्पष्ट रूप से दिखता है: अकेले SIEM जोड़ने से सभी तीन लक्ष्य वर्गों में औसत परिशुद्धता बढ़ती है, जटिल पृष्ठभूमि का प्रतिरोध करने में वास्तविक लाभ के साथ।
बैकबोन मॉडल का वह हिस्सा है जो पहले छवि को छूता है और आधार फीचर्स निकालता है। SIEM को यहां रखने का मतलब है स्रोत पर सफाई: कुछ भी आगे बढ़ाने से पहले, दोष के फीचर्स पहले से मजबूत हो जाते हैं और पृष्ठभूमि शोर पहले से दब जाता है। स्वच्छ स्रोत के साथ, बाद में स्केल हैंडलिंग और लक्ष्य स्थानीयकरण अव्यवस्था से भटक नहीं पाएंगे। इसलिए यह बैकबोन में बैठता है और कहीं और नहीं। प्रदूषण का जल्दी इलाज करें।

चित्र 7: SIEM सिमेंटिक-एन्हांसमेंट मॉड्यूल की दोहरी-शाखा संरचना। वैश्विक शाखा पृष्ठभूमि को दबाने के लिए बड़ी तस्वीर पढ़ती है, स्थानीय शाखा दोष को मजबूत करने के लिए विवरण देखती है, फिर दोनों को भारित और जोड़ा जाता है।

चित्र 8: एक छत पर पीवी सरणी। मॉड्यूल का घना क्षेत्र बिल्कुल वही गड़बड़ दृश्य है जो डिटेक्शन एल्गोरिदम को हस्तक्षेप खिलाता है।
चाल दो: पिरामिड पूलिंग, बड़े और छोटे हॉटस्पॉट दोनों फोकस में
दूसरा बदलाव YOLOv10 के मूल स्थानिक पिरामिड पूलिंग मॉड्यूल को स्पेस अटेंशन पिरामिड पूलिंग मॉड्यूल (SAPPM) से बदल देता है। यह विभिन्न पैमाने की समस्या को लक्षित करता है।
"पिरामिड पूलिंग" को एक ही फीचर मैप को एक साथ विभिन्न आकारों की कई विंडो से स्कैन करने के रूप में समझा जा सकता है। छोटी विंडो बारीक विवरण देखती हैं, जो छोटे हॉटस्पॉट के लिए अच्छी हैं; बड़ी विंडो व्यापक दृश्य देखती हैं, जो बड़े हॉटस्पॉट के लिए अच्छी हैं। अध्ययन कई पूलिंग विंडो को छोटे से बड़े तक समानांतर में चलाता है, इसलिए चाहे दोष कई पंक्तियों में फैला हो या सिर्फ हथेली के आकार का धब्बा हो, सही विंडो उसे पकड़ लेती है।
इसके अलावा, SAPPM स्थानिक अटेंशन की एक परत जोड़ता है। यह विभिन्न विंडो से आने वाली सुविधाओं को अलग-अलग भार देता है, ताकि वास्तव में महत्वपूर्ण पैमाने की जानकारी केंद्र में बनी रहे जबकि अप्रासंगिक को कम किया जाए, फिर इन बहु-पैमाने सुविधाओं को एक अधिक संपूर्ण फीचर मैप में जोड़ता है। संक्षेप में, पहला भाग "हर आकार को देखना" संभालता है, दूसरा भाग "जो देखा जाना चाहिए उसे उजागर करना" संभालता है। साथ में वे मॉडल की बहु-पैमाने लक्ष्यों की समझ को काफी बढ़ाते हैं।
यह सीधे पुरानी एक-को-खोकर-दूसरे-को-पाने की समस्या को कम करता है। एक निश्चित-अभिग्रहण-क्षेत्र नेटवर्क बड़े लक्ष्य पर ध्यान देते समय छोटे लक्ष्य को खो देता है; SAPPM के साथ, बड़े और छोटे हॉटस्पॉट दोनों एक ही पास में स्पष्ट रूप से देखे जा सकते हैं, चाहे आकार का अंतर कितना भी बड़ा हो।

चित्र 9: SAPPM बहु-पैमाने फीचर पिरामिड पूलिंग का एक रेखाचित्र, विभिन्न आकारों की विंडो के साथ समानांतर में स्कैन करना और फिर स्थानिक अटेंशन भार के साथ उन्हें जोड़ना।

चित्र 10: एक संयंत्र का हवाई दृश्य। ड्रोन अलग-अलग ऊंचाइयों से कैप्चर करते हैं, जिससे एक ही दोष छवि में और भी अधिक विविध पैमानों पर दिखाई देता है।
तीसरा कदम: चैनल अटेंशन, लगभग खोए हुए छोटे लक्ष्यों को वापस पकड़ना
तीसरा बदलाव नेक नेटवर्क में होता है, जो एक बहु-पैमाने चैनल अटेंशन तंत्र (MCI) बनाता है। यह सबसे पेचीदा समस्या, छोटे-लक्ष्य सूचना हानि को ठीक करता है।
पहले, चैनलों के बारे में एक शब्द। जब एक नेटवर्क एक छवि को संसाधित करता है, तो यह सुविधाओं को कई समानांतर चैनलों में विभाजित करता है, प्रत्येक छवि को एक अलग कोण से वर्णित करता है। छोटे-लक्ष्य सुविधाएं पहले से ही कमजोर होती हैं, इन चैनलों में बिखरी होती हैं, और यदि प्रत्येक चैनल केवल अपना ध्यान रखता है और कोई आदान-प्रदान नहीं होता है, तो जानकारी का वह बहुमूल्य अंश परत-दर-परत स्थानांतरण में आसानी से डूब जाता है।
MCI का दृष्टिकोण चैनलों के बीच परस्पर क्रिया बनाना है, उन्हें एक-दूसरे से बात करने देना है। जहां भी एक चैनल में छोटे लक्ष्य का निशान होता है, क्रॉस-चैनल सहयोग उसे बढ़ाता और संरक्षित करता है। यह छोटे पैमाने की फीचर जानकारी के निष्कर्षण को और मजबूत करता है, और वे छोटे हॉटस्पॉट जो डाउनसैंपलिंग में गायब होने वाले थे, वापस पकड़ लिए जाते हैं।
नेटवर्क में इन तीनों चरणों का स्थान भी जानबूझकर रखा गया है। SIEM बैकबोन स्रोत पर विशेषताओं को साफ करता है, SAPPM बैकबोन के अंत में बहु-पैमाने की जानकारी का सारांश देता है, और MCI उस गर्दन पर अंतिम पॉलिश करता है जो बैकबोन को डिटेक्शन हेड से जोड़ती है। आगे, बीच, पीछे—साथ मिलकर वे विशेषताओं को निकालने, सारांशित करने और आउटपुट करने की पूरी श्रृंखला को कवर करते हैं, और प्रत्येक चरण को इन्फ्रारेड दोष की एक विशेष समस्या के लिए लक्षित समाधान मिलता है।
तीनों चरणों की स्पष्ट भूमिकाएँ हैं: SIEM कंट्रास्ट संभालता है, SAPPM पैमाना संभालता है, MCI छोटे लक्ष्य संभालता है। वे अकेले नहीं लड़ते बल्कि बैटन पास करते हैं: पहले दोष को पृष्ठभूमि से बाहर उठाएँ, फिर सभी आकारों को कवर करें, फिर उस छोटे लक्ष्य को पकड़ें जो सबसे अधिक फिसलने की संभावना रखता है। इस संयोजन से, इन्फ्रारेड दोष पहचान की तीन सबसे कठिन हड्डियाँ एक-एक करके टूट जाती हैं।

चित्र 11: इन्फ्रारेड हॉटस्पॉट को पैमाने के अनुसार बड़े, मध्यम और छोटे में वर्गीकृत किया गया। आकार का अंतर बहुत बड़ा है, और सबसे छोटे हॉटस्पॉट सबसे आसानी से छूट जाते हैं।

चित्र 12: इन्फ्रारेड कैमरे द्वारा पकड़ा गया एक धुंधला लक्ष्य। लक्ष्य जितना छोटा और मंद होता है, प्रोसेसिंग में उसके चिकना हो जाने की संभावना उतनी ही अधिक होती है।
उत्पाद अनुप्रयोग
स्कोरकार्ड: 92.1% सटीकता, 62 फ्रेम प्रति सेकंड
तीनों चरणों का प्रभाव डेटा पर निर्भर करता है। शोधकर्ताओं ने अपना खुद का PV मॉड्यूल इन्फ्रारेड दोष डेटासेट बनाया, हॉटस्पॉट को छवि में उनके पिक्सेल आकार के अनुसार तीन वर्गों में लेबल किया: 64x64 पिक्सेल से अधिक बड़ा है, 32x32 और 64x64 के बीच मध्यम है, 32x32 से कम छोटा है। पहचान अच्छी है या नहीं, इसे वर्ग-दर-वर्ग, पैमाने-दर-पैमाने पढ़ना होगा।
सटीकता दो मेट्रिक्स पर निर्भर करती है। एक है रिकॉल, R, जो उत्तर देता है "जिन दोषों को पाया जाना चाहिए था, उनमें से कितने मिले।" दूसरा है माध्य औसत परिशुद्धता, PmA, जो वर्गों में पहचान परिशुद्धता का एक समग्र माप है, जो डिटेक्टर के लिए सबसे महत्वपूर्ण कुल स्कोर है। इसमें पहचान की गति जोड़ें, जो प्रति सेकंड संसाधित फ्रेम में मापी जाती है, और ये तीन संख्याएँ मिलकर एक एल्गोरिदम की पूरी कहानी बताती हैं।
मॉड्यूल-दर-मॉड्यूल एब्लेशन से शुरू करें। स्टॉक YOLOv10 को आधार रेखा के रूप में लेते हुए, इसकी माध्य औसत परिशुद्धता 89.8% है। केवल SIEM जोड़ें, 90.4% तक; केवल SAPPM, 90.5%; केवल MCI, 90.7%। हर कदम मदद करता है। तीनों को एक साथ रखें, पूरा SESPNet, और माध्य औसत परिशुद्धता 92.1% तक पहुँच जाती है। सबसे उल्लेखनीय छोटे लक्ष्य हैं: आधार रेखा की छोटी परिशुद्धता केवल 86.7% है, और तीनों के साथ यह 90.3% तक चढ़ जाती है, पूरे 3.6 अंक, जो छोटे लक्ष्यों को पुनर्प्राप्त करने में MCI के काम को साबित करता है।

चित्र 13: मॉड्यूल-दर-मॉड्यूल एब्लेशन। तीनों मॉड्यूल को एक साथ रखने पर, सबसे कठिन छोटे-लक्ष्य परिशुद्धता 86.7% से बढ़कर 90.3% हो जाती है।

चित्र 14: एक अंतहीन बड़ा ज़मीन पर लगा संयंत्र। इसके हज़ारों-हज़ारों मॉड्यूल ठीक वही हैं जिन्हें इस एल्गोरिदम को एक-एक करके जाँचना है।
आमने-सामने: एक मंच पर नौ एल्गोरिदम
सिर्फ़ खुद से तुलना करना काफ़ी नहीं है। अध्ययन SESPNet को आठ अन्य मुख्यधारा एल्गोरिदम के साथ एक ही मंच पर रखता है, उन्हें एक ही डेटासेट पर प्रशिक्षित करता है, और सटीकता और गति को साथ-साथ मापता है।
परिणाम अपने आप में बोलता है। क्लासिक दो-चरणीय एल्गोरिदम जैसे Faster R-CNN और Cascade R-CNN में सीमित फीचर निष्कर्षण होता है और वे धीमे चलते हैं, 86% से 88% माध्य औसत सटीकता पर पहुँचते हैं, जो उच्च वास्तविक समय प्रदर्शन की माँग करने वाले दृश्यों के लिए उपयुक्त नहीं हैं। SSD सबसे तेज़ है लेकिन इसकी सटीकता केवल 74.3% है, जो स्पष्ट रूप से कम है। YOLO श्रृंखला समग्र रूप से अधिक संतुलित है: YOLOv7 के 88.1% से, YOLOX, YOLOv8, YOLOv10 और YOLOv11 के माध्यम से, सटीकता 89% से 90% की सीमा तक बढ़ती है और गति लगभग पचास से साठ फ्रेम प्रति सेकंड होती है।
SESPNet उस वक्र को और ऊपर दाईं ओर धकेलता है: 92.1% माध्य औसत सटीकता, उपविजेता से लगभग 2 अंक अधिक, और 62.4 फ्रेम प्रति सेकंड, YOLO की तेज़ गति के साथ कदम मिलाते हुए। यह सटीकता बढ़ाने के लिए गति का त्याग नहीं करता; यह तेज़-और-सटीक का ऊपरी-दायाँ स्थान रखता है जिसे अन्य नहीं पहुँच सकते। यही इसका सबसे बड़ा मूल्य है। विशाल मॉड्यूल संख्या वाले दृश्य में जहाँ आप गश्त करते समय निर्णय लेते हैं, हर थोड़ी सी धीमी गति लागत है।
R = TP ÷ ( TP + FN ) · P = TP ÷ ( TP + FP )
वे दो पंक्तियाँ सटीकता मेट्रिक्स की आधार परिभाषाएँ हैं। R (रिकॉल) वास्तविक दोषों की पुनर्प्राप्ति का हिस्सा मापता है, P (प्रेसिजन) मापता है कि रिपोर्ट किए गए दोषों में से कितने वास्तविक हैं, और PmA कक्षाओं और प्रेसिजन स्तरों पर गणना किया गया कुल स्कोर है। तर्क जटिल नहीं है: जितना संभव हो उतना कम चूकें (उच्च रिकॉल) और जितना संभव हो उतना कम झूठा अलार्म (उच्च प्रेसिजन), दोनों सिरों को नियंत्रण में रखें, और आपके पास एक भरोसेमंद डिटेक्टर होगा।

चित्र 15: नौ एल्गोरिदम की सटीकता-गति तुलना। SESPNet 92.1% सटीकता और 62.4 FPS के साथ ऊपरी-दाएँ कोने में है।

चित्र 16: एक एम्बेडेड प्लेटफ़ॉर्म पर वास्तविक दुनिया का परीक्षण। सबसे सटीक SESPNet अभी भी 12.6 FPS पर स्थिर रहता है।
हथेली के आकार के बॉक्स में सिकुड़कर भी वास्तविक समय
प्रयोगशाला में अच्छा चलना इसका मतलब नहीं है कि यह क्षेत्र में उपयोग योग्य है। PV संयंत्र ज़्यादातर जंगल में होते हैं, जहाँ निरीक्षण उपकरणों में कंप्यूट और बिजली सीमित होती है। क्या एल्गोरिदम कम-शक्ति वाले छोटे बॉक्स में फिट हो सकता है और वास्तविक समय में चल सकता है, यह वास्तविक तैनाती के लिए अंतिम बाधा है।
शोधकर्ताओं ने इसे सत्यापित करने के लिए जेटसन नैनो नामक एक एम्बेडेड प्लेटफ़ॉर्म पर पोर्ट किया। इसका प्रोसेसर एक क्वाड-कोर ARM चिप है जिसमें एंट्री-लेवल 128-कोर GPU जुड़ा है, जो कंप्यूट और पावर दोनों में समर्पित कार्ड वाले लैब वर्कस्टेशन से काफी नीचे है। SESPNet को उसी इनपुट स्केल पर तैनात किया गया, फिर इस छोटे बोर्ड पर अन्य एल्गोरिदम के खिलाफ दौड़ाया गया।
परिणाम फिर से इसका संतुलन साबित करता है। क्लासिक टू-स्टेज एल्गोरिदम एम्बेडेड सेटिंग में अपना असली रंग दिखाते हैं: फास्टर R-CNN 1.9 फ्रेम प्रति सेकंड पर गिर जाता है, मुश्किल से रियल-टाइम; कैस्केड R-CNN केवल 3.7। YOLO श्रृंखला आम तौर पर ग्यारह या बारह फ्रेम के आसपास गिरती है, जबकि SESPNet शीर्ष 92.1% सटीकता बनाए रखते हुए 12.6 फ्रेम प्रति सेकंड रखता है, हल्के YOLO के साथ, थोड़ा आगे भी। कंप्यूट को कठोरता से कम किया गया, यह सटीक और स्थिर रहता है, यह दिखाता है कि डिज़ाइन संसाधन-सीमित दृश्यों के लिए कितना उपयुक्त है।
इसका मतलब है कि इस एल्गोरिदम से लैस एक ड्रोन या पोर्टेबल निरीक्षक को छवियों को धीरे-धीरे संसाधित करने के लिए क्लाउड पर वापस भेजने की आवश्यकता नहीं होगी। मौके पर, वास्तविक समय में, यह बता सकता है कि किस पैनल में हॉटस्पॉट है। निरीक्षण दक्षता और प्रतिक्रिया गति दोनों एक और कदम आगे बढ़ती हैं।
मौके पर निर्णय लेने का मूल्य एक चक्कर बचाने से अधिक है। कंप्यूट को किनारे पर रखने का मतलब है कि खराब सिग्नल वाले दूरस्थ संयंत्रों में भी निरीक्षण चल सकता है; संदिग्ध हॉटस्पॉट देखें और आप इसे मौके पर चिह्नित कर सकते हैं और पुष्टि करने के लिए तुरंत फिर से उड़ान भर सकते हैं, दूसरी उड़ान से पहले डेटा लौटने और मैन्युअल समीक्षा की प्रतीक्षा करने की आवश्यकता नहीं है। सैकड़ों मेगावाट में मापे जाने वाले और लाखों में गिने जाने वाले मॉड्यूल वाले बड़े संयंत्रों के लिए, यह साइट-पर रियल-टाइम क्षमता सीधे तय करती है कि पूर्ण निरीक्षण में घंटे लगते हैं या दिन।
समापन: हर ज़्यादा गर्म होने वाले पैनल के लिए छिपने की कोई जगह नहीं
पीछे मुड़कर देखें, तो SESPNet की चतुराई किसी जटिल संरचना को ढेर करने में नहीं है, बल्कि सही लक्षणों का इलाज करने में है। इन्फ्रारेड कंट्रास्ट कम है, इसलिए सिमेंटिक एन्हांसमेंट पृष्ठभूमि को दबाता है। दोष पैमाना गड़बड़ है, इसलिए पिरामिड पूलिंग सभी आकारों को कवर करती है। छोटे लक्ष्य आसानी से खो जाते हैं, इसलिए चैनल अटेंशन उन्हें वापस खींच लेता है। तीन कदम, प्रत्येक अपने कार्य के लिए, और बैटन पास करना।
जो अधिक दुर्लभ है वह यह है कि इसने सटीकता के लिए मॉडल को मोटा नहीं किया। कई एल्गोरिदम आँख बंद करके उच्च सटीकता का पीछा करते हैं, अंततः भारी हो जाते हैं, गति को धीमा कर देते हैं, और एम्बेडेड डिवाइस पर फिट भी नहीं हो पाते। SESPNet शीर्ष सटीकता बनाए रखते हुए अपनी गति बनाए रखता है, और यह कंप्यूट में भारी कटौती के परीक्षण में बच गया। सटीक, तेज़ और हल्का होने का यह संतुलन ठीक वही गुण है जिसे क्षेत्र सबसे अधिक महत्व देता है। कोई तकनीक अच्छी है या नहीं, यह इस बात पर निर्भर करता है कि क्या वह वास्तविक संयंत्र में वास्तविक काम कर सकती है।
92.1% औसत परिशुद्धता, 62.4 फ्रेम प्रति सेकंड, और इतना छोटा कि हथेली के आकार के बॉक्स में वास्तविक समय में चल सके। ये तीन संख्याएँ मिलकर एक ऐसे उपकरण का चित्र बनाती हैं जो वास्तव में पौधे तक जाकर काम कर सकता है। यह एक सुस्त भूरे रंग की इन्फ्रारेड छवि को, जो कभी मानव आँख के लिए भी कठिन थी, एक स्वास्थ्य रिपोर्ट में बदल देता है जहाँ दोष छिपने की जगह नहीं पाते।
जब इस तरह के एल्गोरिदम ले जाने वाला ड्रोन नीले सरणियों के खेत दर खेत उड़ान भरता है, तो हर चुपचाप गर्म होने वाला पैनल पहले ही क्षण में पिन कर दिया जाता है और निपटा दिया जाता है। छिपे हुए हॉटस्पॉट दिखाई देने लगते हैं, और प्रतीत होने वाले छोटे जोखिम समाप्त कर दिए जाते हैं। जो कायम रहता है वह वास्तव में एक ऐसा संयंत्र है जो सूर्य के प्रकाश को बिजली में बदलता है, लंबे समय तक, सुरक्षित और पूर्ण भार पर।
Ooitech का दृष्टिकोण
यहाँ जो बात हमें सबसे अधिक प्रभावित करती है वह यह है कि पता लगाना और निर्माण एक ही विश्वसनीयता सिक्के के दो पहलू हैं। क्षेत्र में चिह्नित एक हॉटस्पॉट अक्सर लाइन पर उत्पन्न माइक्रो-क्रैक या ठंडे सोल्डर जोड़ से जुड़ा होता है, यही कारण है कि मॉड्यूल उत्पादन लाइन पर स्ट्रिंगर वेल्डिंग, ले-अप संरेखण और लेमिनेशन नियंत्रण इतने महत्वपूर्ण हैं। इन चरणों को सही करें और आप शुरू में ही क्षेत्र में कम हॉटस्पॉट भेजते हैं। यदि आप देखना चाहते हैं कि वास्तविक मॉड्यूल लाइन कैसे बनाई और ट्यून की जाती है, तो Ooitech YouTube चैनल पर हमारे कारखाने के वॉकथ्रू (www.youtube.com/ooitech) देखने और सब्सक्राइब करने लायक हैं।