एक प्रेडिक्टिव मॉडल बनाने वाले डेटा वैज्ञानिक के रूप में कार्य करें। मेरे pandas DataFrame `df` में गुम मान हैं। `df.isnull().sum()` का आउटपुट यहाँ है: `[[PASTE MISSING VALUE COUNTS]]` व्यावसायिक लक्ष्य `[[TARGET_VARIABLE]]` का पूर्वानुमान लगाना है। कॉलम नामों और लक्ष्य के आधार पर, एक विस्तृत इम्पुटेशन रणनीति प्रस्तावित करें। गुम मानों वाले प्रत्येक कॉलम के लिए, एक विधि (mean, median, mode, constant, या मॉडल-आधारित इम्पुटेशन) की सिफारिश करें और एक वाक्य में अपनी पसंद को न्यायसंगत ठहराएं। आउटपुट को एक JSON ऑब्जेक्ट के रूप में प्रारूपित करें जहाँ कीज़ कॉलम नाम हैं और वैल्यू एक और ऑब्जेक्ट हैं जिसमें "method" और "justification" शामिल हैं।
लिखें जो एक स्ट्रिंग लेता है और निम्नलिखित टेक्स्ट क्लीनिंग चरण करता है: 1. टेक्स्ट को लोअरकेस में परिवर्तित करता है। 2. सभी विराम चिह्नों को हटाता है। 3. संख्यात्मक अंकों को हटाता है। 4. सामान्य अंग्रेजी स्टॉप वर्ड्स को हटाता है। 5. Porter Stemmer का उपयोग करके शेष शब्दों को स्टेम करता है। फ़ंक्शन को क्लीन की गई स्ट्रिंग वापस करनी चाहिए।
एक मशीन लर्निंग मॉडल के लिए इंटरेक्शन फीचर्स बनाने के लिए Python कोड उत्पन्न करें। मेरे pandas DataFrame `df` में निम्नलिखित न्यूमेरिक फीचर्स हैं: `[[COLUMN_A, COLUMN_B, COLUMN_C]]`। सभी जोड़ीदार इंटरेक्शन फीचर्स (उदाहरण के लिए, A*B, A*C, B*C) बनाएं। इन नए फीचर्स को DataFrame में जोड़ें।
एक AutoML विशेषज्ञ के रूप में कार्य करें। मेरे पास फीचर्स `X` और एक बाइनरी लक्ष्य वेरिएबल `y` के साथ एक प्रीप्रोसेस्ड डेटासेट है। एक पूर्ण Python स्क्रिप्ट उत्पन्न करें जो तीन अलग-अलग बेसलाइन क्लासिफिकेशन मॉडलों को प्रशिक्षित और मूल्यांकन करती है: 1. Logistic Regression 2. Random Forest Classifier 3. Gradient Boosting Classifier (LightGBM का उपयोग करके) प्रत्येक मॉडल के लिए, स्क्रिप्ट को चाहिए: - 5-फोल्ड क्रॉस-वैलिडेशन का उपयोग करें। - माध्य Accuracy, Precision, Recall और F1-score की गणना करें और प्रिंट करें। - आसान तुलना के लिए परिणामों को एक pandas DataFrame में स्टोर करें।
y_test` (सही लेबल) और `y_pred_proba` (मेरे क्लासिफायर से पॉजिटिव क्लास के लिए अनुमानित संभावनाएं) का उपयोग करके, एक Python स्क्रिप्ट उत्पन्न करें: 1. AUC (Area Under the Curve) स्कोर की गणना करें। 2. ROC (Receiver Operating Characteristic) कर्व प्लॉट करें। 3. तुलना के लिए एक रैंडम क्लासिफायर का प्रतिनिधित्व करने वाली एक विकर्ण रेखा शामिल करें। 4. AUC स्कोर के साथ प्लॉट को लेबल करें।
मेरे पास `model` नामक एक प्रशिक्षित `RandomForestClassifier` मॉडल है। मेरे फीचर्स के नाम `[[LIST_OF_FEATURE_NAMES]]` हैं। मॉडल से फीचर इम्पोर्टेंस निकालने, उन्हें उनके नामों से मिलाने और शीर्ष 15 सबसे महत्वपूर्ण फीचर्स को दर्शाने वाला एक क्षैतिज बार प्लॉट बनाने के लिए Python कोड उत्पन्न करें।
नीचे एक Python स्क्रिप्ट है जो एक प्लॉट उत्पन्न करती है। स्क्रिप्ट के बाद, मैं प्लॉट का वर्णन करूँगा। आपका कार्य व्यावसायिक दर्शकों के लिए इस अंतर्दृष्टि की एक संक्षिप्त, एक-पैराग्राफ व्याख्या लिखना है। तकनीकी शब्दजाल से बचें। `[[PASTE PYTHON PLOT SCRIPT]]` प्लॉट एक बार चार्ट दिखाता है जहाँ 'टियर 1' सपोर्ट श्रेणी में ग्राहकों का औसत मासिक खर्च $150 है, जबकि 'टियर 3' श्रेणी में ग्राहकों का औसत खर्च $45 है। अब, व्यावसायिक सारांश लिखें।
34A/B टेस्ट परिणामों की रिपोर्ट करने वाला एक ईमेल ड्राफ्ट करें
एक डेटा विश्लेषक के रूप में कार्य करें। नए "वन-क्लिक चेकआउट" फीचर के लिए A/B टेस्ट के परिणामों की रिपोर्ट करने के लिए उत्पाद टीम को एक ईमेल ड्राफ्ट करें। प्रमुख निष्कर्ष: - कंट्रोल ग्रुप रूपांतरण दर: 3.5% - ट्रीटमेंट ग्रुप (फीचर के साथ) रूपांतरण दर: 4.8% - परिणाम 0.002 के p-value के साथ सांख्यिकीय रूप से महत्वपूर्ण है। - टेस्ट 14 दिनों तक चला जिसमें प्रत्येक ग्रुप में 50,000 उपयोगकर्ता थे। ईमेल को एक स्पष्ट विषय पंक्ति, परिणाम का संक्षिप्त सारांश, प्रमुख संख्याएं और फीचर को रोल आउट करने की सिफारिश के साथ संरचित करें।
मशीन लर्निंग में "ओवरफिटिंग" की अवधारणा को समझाएं जैसे आप एक बिक्री निदेशक को समझाएंगे। एक सादृश्य का उपयोग करें। स्पष्टीकरण को 150 शब्दों के भीतर रखें।
एक डेटा साइंस प्रोजेक्ट README फ़ाइल के लिए एक markdown टेम्पलेट उत्पन्न करें। टेम्पलेट में निम्नलिखित अनुभाग शामिल होने चाहिए: - प्रोजेक्ट शीर्षक (Project Title) - व्यावसायिक समस्या (Business Problem) - डेटा स्रोत (Data Source) - कार्यप्रणाली (डेटा क्लीनिंग, EDA, मॉडलिंग) (Methodology) - परिणाम (Results) - कोड कैसे चलाएं (निर्भरताएँ, निर्देश) (How to Run the Code) - प्रमुख संपर्क (Key Contacts)
एक Python स्क्रिप्ट स्निपेट उत्पन्न करें जो MLflow का उपयोग करके प्रयोग ट्रैकिंग को प्रदर्शित करता है। स्क्रिप्ट को चाहिए: 1. एक MLflow रन शुरू करें। 2. दो पैरामीटर लॉग करें: `learning_rate` और `n_estimators`। 3. तीन मेट्रिक्स लॉग करें: `accuracy`, `precision` और `recall`। 4. प्रशिक्षित मॉडल को एक आर्टिफैक्ट के रूप में लॉग करें। 5. रन समाप्त करें।
नामक एक CSV फ़ाइल अपलोड कर रहा हूँ। सबसे पहले, इसे एक pandas DataFrame में लोड करें और एक पूर्ण डेटा प्रोफाइल चलाएं। प्रत्येक कॉलम के लिए गुम मानों, डेटा प्रकारों और बुनियादी सांख्यिकी की पहचान करें। मुझे आउटपुट दिखाएं।" **प्रॉम्प्ट 2 (AI प्रतिक्रिया के बाद):** "धन्यवाद। उस प्रोफाइल के आधार पर, डेटा क्लीनिंग को संभालने के लिए एक Python स्क्रिप्ट उत्पन्न करें। गुम
47काउंटरफैक्चुअल के साथ मॉडल परिणामों की व्याख्या करें
) है जिसके लिए मॉडल ने टर्नओवर की उच्च संभावना (0.92) का पूर्वानुमान लगाया था। एक काउंटरफैक्चुअल स्पष्टीकरण का उपयोग करके इस पूर्वानुमान की व्याख्या करें। सादे अंग्रेजी में, इस ग्राहक के फीचर्स (उदाहरण के लिए,
टेबल है। क्वेरी को मासिक ग्राहक कोहोर्ट्स की रिटेंशन दर की गणना करनी चाहिए। एक ग्राहक का कोहोर्ट उनकी पहली खरीद का महीना है। किसी दिए गए महीने के लिए रिटेंशन उस महीने में खरीद करने वाले कोहोर्ट के ग्राहकों का प्रतिशत है। आउटपुट में तीन कॉलम होने चाहिए:
डेटा विज्ञान के लिए इन प्रॉम्प्ट का इस्तेमाल कैसे करें
चार कदम, करीब एक मिनट। ढाँचा प्रॉम्प्ट देता है, ब्यौरा आप देते हैं।
1
प्रॉम्प्ट चुनें
यहाँ हर प्रॉम्प्ट किसी खास काम के लिए लिखा गया है — “एक्सपर्ट की तरह काम करो” जैसा सामान्य टेम्पलेट नहीं। शीर्षक देखिए और जो आपके सामने के काम से मेल खाए, वही लीजिए।
2
कॉपी करके पेस्ट करें
कॉपी दबाइए और पूरा टेक्स्ट ChatGPT, Claude, Gemini या जिस असिस्टेंट का आप पहले से भुगतान करते हैं, उसमें पेस्ट कीजिए। यहाँ कुछ भी किसी एक मॉडल से बँधा नहीं है।
3
कोष्ठक भरें
भेजने से पहले हर [कोष्ठक वाले हिस्से] की जगह अपनी जानकारी डालिए। गुणवत्ता वहीं से आती है — ढाँचा प्रॉम्प्ट देता है, ब्यौरा आप।
4
स्रोत गाइड देखें
हर प्रॉम्प्ट के नीचे दिया “स्रोत” लिंक पूरा लेख खोलता है: प्रॉम्प्ट ऐसा क्यों बना है, किस पर परखा गया, और किन टूल्स के साथ चलता है।
अक्सर पूछे जाने वाले सवाल
असली काम में इनमें से कोई प्रॉम्प्ट पेस्ट करने से पहले जो सवाल उठते हैं।
क्या ये प्रॉम्प्ट मुफ़्त इस्तेमाल किए जा सकते हैं?
हाँ। इस पेज के सभी 50 प्रॉम्प्ट किसी भी एआई असिस्टेंट के साथ मुफ़्त कॉपी और इस्तेमाल किए जा सकते हैं, जिनमें ChatGPT, Claude और Gemini शामिल हैं। बस उनमें से किसी एक पर खाता चाहिए।
डेटा विज्ञान के लिए इन एआई प्रॉम्प्ट का इस्तेमाल कैसे करूँ?
कॉपी बटन से पूरा टेक्स्ट लीजिए, अपने एआई असिस्टेंट में पेस्ट कीजिए, और भेजने से पहले [आपका शहर] या [कंपनी का नाम] जैसे कोष्ठक वाले हिस्सों की जगह अपनी जानकारी डालिए।
ये प्रॉम्प्ट कहाँ से आते हैं?
हर प्रॉम्प्ट Zekai की एक परखी हुई गाइड से आता है। हर प्रॉम्प्ट के नीचे दिया “स्रोत” लिंक पूरे लेख पर ले जाता है, जो उसकी सोच और परखने का तरीका बताता है।
क्या मैं इन प्रॉम्प्ट को बदल सकता हूँ?
ज़रूर। हर प्रॉम्प्ट को शुरुआती ढाँचा मानिए: निर्देश कसिए, अपनी शर्तें जोड़िए, और जो संस्करण सबसे अच्छा नतीजा दे उसे रख लीजिए। कोष्ठक बताते हैं कि हमेशा क्या बदलना है।
दूसरे पेशों की प्रॉम्प्ट लाइब्रेरी
वही स्वरूप, दूसरा काम — डेटा विज्ञान के सबसे करीबी पेशों से शुरू करते हुए।