```html
``` Skip to contentMachine Learning की सबसे महत्वपूर्ण शक्ति उसके Algorithms हैं। Algorithm वह गणितीय (Mathematical) और तार्किक (Logical) प्रक्रिया होती है जो Computer को Data से सीखने, Patterns पहचानने और भविष्य के लिए Predictions या Decisions लेने में सहायता करती है।
जब किसी Machine Learning Model को Data दिया जाता है, तो केवल Data पर्याप्त नहीं होता। उस Data से सीखने के लिए Model को एक Algorithm की आवश्यकता होती है। यही Algorithm तय करता है कि Machine Data का विश्लेषण कैसे करेगी, किन Patterns को पहचानेगी और भविष्य में किस प्रकार का Prediction करेगी।
हर Machine Learning समस्या के लिए अलग-अलग Algorithms का उपयोग किया जाता है। उदाहरण के लिए, यदि किसी घर की कीमत का अनुमान लगाना हो, तो एक Algorithm उपयोगी हो सकता है, जबकि Email Spam Detection या Loan Approval जैसी समस्याओं के लिए दूसरा Algorithm अधिक उपयुक्त हो सकता है।
इस Lesson को पूरा करने के बाद आप:
Machine Learning Algorithm नियमों (Rules), गणितीय सूत्रों (Mathematical Models) और सांख्यिकीय (Statistical) तकनीकों का ऐसा समूह है जो Computer को Data से सीखने और भविष्य के लिए Predictions करने में सक्षम बनाता है।
Algorithm स्वयं निर्णय नहीं लेता, बल्कि उपलब्ध Data का विश्लेषण करके एक Model तैयार करता है। यही Model बाद में नए Data पर Predictions या Decisions देता है।
उदाहरण के लिए, यदि किसी Algorithm को हजारों घरों की कीमत, क्षेत्रफल और स्थान का Data दिया जाए, तो वह इन Patterns को सीखकर किसी नए घर की संभावित कीमत का अनुमान लगा सकता है।
Machine Learning Algorithms के बिना AI Systems केवल Data का संग्रह बनकर रह जाएंगे। Algorithms ही Data को उपयोगी जानकारी (Insights) में बदलते हैं और Computers को सीखने की क्षमता प्रदान करते हैं।
Healthcare, Banking, E-commerce, Education, Manufacturing और Cyber Security जैसी Industries प्रतिदिन लाखों Data Records का विश्लेषण करने के लिए Machine Learning Algorithms का उपयोग करती हैं।
Machine Learning में सैकड़ों Algorithms उपलब्ध हैं, लेकिन उन्हें मुख्य रूप से उनकी समस्या (Problem Type) के आधार पर वर्गीकृत किया जाता है।
Machine Learning में सबसे सामान्य दो प्रकार की समस्याएँ Regression और Classification होती हैं।
| Regression | Classification |
|---|---|
| Continuous Numerical Value की Prediction करता है। | Data को अलग-अलग Categories में वर्गीकृत करता है। |
| उदाहरण: House Price Prediction | उदाहरण: Spam Email Detection |
| Output एक Number होता है। | Output एक Category या Label होता है। |
| Linear Regression सबसे लोकप्रिय Algorithm है। | Decision Tree, Logistic Regression और SVM लोकप्रिय Algorithms हैं। |
Machine Learning Algorithm वह Mathematical Method है जो Computer को Data से सीखने, Patterns पहचानने और भविष्य के लिए Prediction या Decision लेने में सहायता करता है।
Google Search, YouTube Recommendations, Amazon Product Suggestions, Netflix Recommendations, ChatGPT और Self-Driving Cars जैसे आधुनिक AI Systems एक साथ कई Machine Learning Algorithms का उपयोग करते हैं। अलग-अलग Algorithms मिलकर अधिक Accurate और Intelligent Results प्रदान करते हैं।
Linear Regression Machine Learning का सबसे सरल और सबसे अधिक उपयोग किया जाने वाला Supervised Learning Algorithm है। इसका उपयोग उन समस्याओं में किया जाता है जहाँ हमें किसी Numerical Value की भविष्यवाणी (Prediction) करनी होती है।
यह Algorithm Input Variables और Output के बीच मौजूद संबंध (Relationship) को समझने का प्रयास करता है। यदि दोनों के बीच लगभग सीधा (Linear) संबंध हो, तो Linear Regression बहुत अच्छे परिणाम देता है।
उदाहरण के लिए, यदि किसी घर का Area, Bedrooms, Location और Age ज्ञात हो, तो Linear Regression इन जानकारियों के आधार पर उस घर की संभावित कीमत (House Price) का अनुमान लगा सकता है।
इस Lesson को पूरा करने के बाद आप:
Linear Regression एक Statistical और Machine Learning Algorithm है जो दो या अधिक Variables के बीच Linear Relationship खोजता है। यह पिछले Data से सीखकर भविष्य के लिए किसी Numerical Value की Prediction करता है।
उदाहरण के लिए, यदि पिछले कई वर्षों का House Price Data उपलब्ध हो, तो Algorithm यह सीख सकता है कि Area बढ़ने पर घर की कीमत कैसे बदलती है। इसके बाद किसी नए घर का Area देने पर वह उसकी संभावित कीमत का अनुमान लगा सकता है।
Linear Regression Data में मौजूद Relationship को एक सीधी रेखा (Best Fit Line) के रूप में प्रदर्शित करता है। यह ऐसी Line खोजने का प्रयास करता है जो अधिकांश Data Points के सबसे निकट हो।
जब नया Data Model को दिया जाता है, तो वही Best Fit Line उसके आधार पर नई Value की Prediction करती है।
सरल शब्दों में, Linear Regression यह सीखता है कि Input में होने वाले परिवर्तन का Output पर क्या प्रभाव पड़ता है।
मान लीजिए आपके पास 5,000 घरों का Data है, जिसमें निम्नलिखित जानकारी उपलब्ध है।
Linear Regression इन सभी Factors का विश्लेषण करता है और उनके बीच संबंध सीखता है। जब किसी नए घर की जानकारी दी जाती है, तो Model उसकी संभावित Market Price की Prediction करता है।
Linear Regression का उपयोग कई Industries में किया जाता है।
Linear Regression एक Supervised Machine Learning Algorithm है जो पिछले Data से सीखकर किसी Numerical Value जैसे House Price, Sales या Temperature की भविष्यवाणी करता है।
Linear Regression Machine Learning का सबसे पुराना और सबसे लोकप्रिय Algorithms में से एक है। आज भी Data Analysis, Business Forecasting, Finance, Economics और Research Projects में इसका व्यापक उपयोग किया जाता है क्योंकि यह सरल, तेज़ और आसानी से समझ में आने वाला Algorithm है।
Decision Tree Machine Learning का एक लोकप्रिय Supervised Learning Algorithm है, जिसका उपयोग Classification और Regression दोनों प्रकार की समस्याओं को हल करने के लिए किया जाता है। यह Algorithm इंसानों की निर्णय लेने की प्रक्रिया (Decision Making Process) की तरह काम करता है और प्रश्नों (Questions) की एक श्रृंखला के माध्यम से अंतिम निर्णय तक पहुँचता है।
Decision Tree का नाम इसलिए रखा गया है क्योंकि इसकी संरचना (Structure) एक पेड़ (Tree) की तरह दिखाई देती है। इसमें सबसे ऊपर Root Node होता है, उसके बाद कई Decision Nodes होते हैं और अंत में Leaf Nodes अंतिम परिणाम (Prediction) को दर्शाते हैं।
इस Algorithm की सबसे बड़ी विशेषता यह है कि इसे समझना और Visualize करना बहुत आसान होता है। यही कारण है कि Beginners के लिए यह सबसे लोकप्रिय Machine Learning Algorithms में से एक है।
इस Lesson को पूरा करने के बाद आप:
Decision Tree एक ऐसा Algorithm है जो Data को छोटे-छोटे प्रश्नों (Questions) में विभाजित करता है। प्रत्येक प्रश्न के उत्तर के आधार पर अगला निर्णय लिया जाता है और अंत में Model किसी Category या Numerical Value की Prediction करता है।
उदाहरण के लिए, यदि किसी Bank को यह तय करना हो कि किसी व्यक्ति को Loan देना चाहिए या नहीं, तो Decision Tree कई प्रश्न पूछ सकता है, जैसे Income कितनी है, Credit Score कैसा है, पहले Loan लिया है या नहीं और Monthly Income कितनी है। इन सभी उत्तरों के आधार पर अंतिम निर्णय लिया जाता है।
जैसे-जैसे Machine Data का विश्लेषण करती है, Tree की Branches बढ़ती जाती हैं और अंत में सही निर्णय तक पहुँचती हैं।
मान लीजिए किसी Bank को यह निर्णय लेना है कि किसी Customer को Loan दिया जाए या नहीं।
Decision Tree निम्नलिखित प्रश्न पूछ सकता है:
इन प्रश्नों के उत्तरों के आधार पर Decision Tree अंत में निर्णय देता है कि Loan Approve किया जाए या Reject।
| Linear Regression | Decision Tree |
|---|---|
| Numerical Value की Prediction करता है। | Classification और Regression दोनों कर सकता है। |
| Linear Relationship पर आधारित। | Questions और Decisions पर आधारित। |
| Best Fit Line का उपयोग करता है। | Tree Structure का उपयोग करता है। |
| House Price Prediction | Loan Approval, Disease Diagnosis |
Decision Tree एक Supervised Machine Learning Algorithm है जो Questions, Branches और Decisions की सहायता से Data का विश्लेषण करता है और अंत में सही Prediction या Decision देता है।
Decision Tree इतना सरल और प्रभावी Algorithm है कि इसे समझना नए Learners के लिए आसान होता है। इसी कारण कई Advanced Algorithms जैसे Random Forest और Gradient Boosting भी Decision Tree की अवधारणा (Concept) पर आधारित हैं और आधुनिक Artificial Intelligence Applications में व्यापक रूप से उपयोग किए जाते हैं।
अब तक आपने समझ लिया कि Machine Learning में Dataset को दो भागों में विभाजित किया जाता है—Training Dataset और Testing Dataset। लेकिन वास्तव में ये दोनों मिलकर कैसे काम करते हैं? किसी भी सफल Machine Learning Model के लिए Training और Testing दोनों चरण अत्यंत महत्वपूर्ण होते हैं।
Training चरण में Model Data से सीखता है, जबकि Testing चरण में यह जाँचा जाता है कि Model ने सही तरीके से सीखा है या नहीं। यदि Model केवल Training Data पर अच्छा प्रदर्शन करे और नए Data पर असफल हो जाए, तो उसे एक अच्छा Machine Learning Model नहीं माना जाता।
सबसे पहले Training Dataset को Machine Learning Algorithm के पास भेजा जाता है। इस Dataset में Input Data और उसके सही उत्तर (Labels) मौजूद होते हैं। Algorithm इन उदाहरणों से Patterns, Relationships और Rules सीखता है।
Training के दौरान Model बार-बार Data का विश्लेषण करता है और अपनी गलतियों को सुधारते हुए बेहतर Prediction करना सीखता है।
जब Model पूरी तरह Train हो जाता है, तब उसे Testing Dataset दिया जाता है। यह ऐसा Data होता है जिसे Model ने पहले कभी नहीं देखा होता।
यदि Model इस नए Data पर भी सही Predictions करता है, तो इसका अर्थ है कि उसने केवल Data को याद नहीं किया, बल्कि वास्तव में उससे सीख लिया है।
Machine Learning Projects में Dataset को कई अनुपातों (Ratios) में विभाजित किया जा सकता है। सबसे अधिक उपयोग होने वाले Split निम्नलिखित हैं।
| Training Data | Testing Data | Usage |
|---|---|---|
| 80% | 20% | सबसे अधिक उपयोग किया जाने वाला Split |
| 70% | 30% | छोटे एवं मध्यम Dataset के लिए |
| 90% | 10% | बहुत बड़े Dataset के लिए |
Split का चयन Dataset के आकार और Project की आवश्यकता पर निर्भर करता है।
मान लीजिए आपके पास 10,000 घरों का Data है।
यदि Model नए घरों की कीमत सही अनुमान लगाता है, तो उसे वास्तविक जीवन में उपयोग करने के लिए तैयार माना जाता है।
यदि उसी Data पर Testing की जाए जिस Data से Model ने सीखा है, तो Accuracy हमेशा बहुत अधिक दिखाई दे सकती है। लेकिन इसका अर्थ यह नहीं है कि Model वास्तव में अच्छा है।
Machine Learning का उद्देश्य नए और अनदेखे Data पर सही Prediction करना है। इसलिए Testing हमेशा अलग Dataset पर की जाती है।
Training Dataset Model को सिखाता है, जबकि Testing Dataset यह जाँचता है कि Model नए Data पर कितना सही Prediction करता है। दोनों मिलकर एक Reliable Machine Learning Model तैयार करते हैं।
दुनिया की लगभग सभी बड़ी AI Companies अपने Models की वास्तविक Performance को हमेशा ऐसे Data पर जाँचती हैं जिसे Model ने पहले कभी नहीं देखा होता। यही कारण है कि उनके AI Systems वास्तविक दुनिया में भी बेहतर Predictions करने में सक्षम होते हैं।
Machine Learning Model को Train करने के बाद सबसे महत्वपूर्ण चरण होता है उसकी Performance का Evaluation। केवल Model बनाना पर्याप्त नहीं होता, बल्कि यह जानना भी आवश्यक है कि वह नए Data पर कितनी सही Predictions करता है।
Model Evaluation की सहायता से Data Scientists यह निर्धारित करते हैं कि Model वास्तविक दुनिया (Real World) में उपयोग करने योग्य है या नहीं। यदि Model की Accuracy कम हो, तो उसे दोबारा Train किया जाता है या उसमें सुधार (Improvement) किया जाता है।
Accuracy यह बताती है कि Model द्वारा किए गए कुल Predictions में से कितने Predictions सही थे।
उदाहरण के लिए, यदि किसी Model ने 100 Predictions किए और उनमें से 95 सही निकले, तो उसकी Accuracy 95% होगी।
हालाँकि केवल Accuracy ही पर्याप्त नहीं होती। कुछ समस्याओं में अन्य Evaluation Metrics भी महत्वपूर्ण होती हैं।
Overfitting तब होता है जब Model Training Dataset को बहुत अधिक याद (Memorize) कर लेता है। ऐसे Model Training Data पर बहुत अच्छी Performance देते हैं, लेकिन नए Data पर सही Prediction नहीं कर पाते।
अर्थात Model सीखने के बजाय Data को याद कर लेता है।
Underfitting तब होता है जब Model पर्याप्त Learning नहीं कर पाता। ऐसे Model Training Dataset और Testing Dataset दोनों पर खराब Performance देते हैं क्योंकि उन्होंने Data के Patterns को सही प्रकार से नहीं सीखा होता।
कई बार केवल एक बार Training और Testing करना पर्याप्त नहीं होता। ऐसे मामलों में Cross Validation का उपयोग किया जाता है।
Cross Validation में Dataset को कई भागों में विभाजित किया जाता है और Model को कई बार अलग-अलग Data पर Train तथा Test किया जाता है। इससे Model की वास्तविक Performance का अधिक विश्वसनीय अनुमान प्राप्त होता है।
आज लगभग सभी आधुनिक AI Systems नियमित रूप से अपने Models का Evaluation करते हैं।
| Training Dataset | Testing Dataset |
|---|---|
| Model को सिखाने के लिए उपयोग किया जाता है। | Model की Performance जाँचने के लिए उपयोग किया जाता है। |
| Patterns और Relationships सीखता है। | नए Data पर Prediction की जाँच करता है। |
| आमतौर पर 70–80% Data। | आमतौर पर 20–30% Data। |
| Training के दौरान उपयोग होता है। | Training के बाद उपयोग होता है। |
Model Evaluation वह प्रक्रिया है जिसमें Machine Learning Model की Accuracy, Reliability और नए Data पर सही Prediction करने की क्षमता की जाँच की जाती है।
Google, Microsoft, Amazon, OpenAI और Meta जैसी कंपनियाँ अपने Machine Learning Models को नियमित रूप से नए Data पर Test और Evaluate करती हैं। यही कारण है कि समय के साथ उनके AI Systems अधिक Smart, Accurate और Reliable बनते जाते हैं।