The short answer
डेटा वैज्ञानिकों के लिए सबसे अच्छे AI प्रॉम्प्ट कार्य, संदर्भ और वांछित आउटपुट प्रारूप को निर्दिष्ट करते हैं ताकि उपयोगी कोड और विश्लेषण उत्पन्न हो सके, न कि अस्पष्ट सलाह। प्रभावी प्रॉम्प्ट AI को व्यावसायिक संदर्भ, डेटा संरचना और डेटा क्लीनिंग, एक्सप्लोरेटरी डेटा एनालिसिस (EDA), फीचर इंजीनियरिंग और मॉडल इंटरप्रिटेशन जैसे कार्यों के लिए स्पष्ट निर्देश प्रदान करते हैं।
सिर्फ ‘इस डेटा का विश्लेषण करें’ जैसे सामान्य प्रॉम्प्ट समय बर्बाद करते हैं। एक डेटा वैज्ञानिक का मूल्य समस्या को तैयार करने और परिणामों को मान्य करने से आता है, लेकिन जनरेटिव AI बीच के यांत्रिक चरणों को नाटकीय रूप से तेज कर सकता है—बशर्ते आप उसे सही निर्देश दें। अस्पष्ट अनुरोध सामान्य, अक्सर गलत, कोड उत्पन्न करते हैं। विशिष्ट, संदर्भ-समृद्ध प्रॉम्प्ट कार्यात्मक स्क्रिप्ट, गहन विश्लेषण और स्पष्ट विज़ुअलाइज़ेशन उत्पन्न करते हैं।
यह मार्गदर्शिका डेटा साइंस वर्कफ़्लो द्वारा व्यवस्थित 50 फील्ड-टेस्टेड प्रॉम्प्ट प्रदान करती है। हमने इन्हें आपके विशिष्ट डेटासेट और समस्याओं के लिए कॉपी, पेस्ट और कस्टमाइज़ करने के लिए डिज़ाइन किया है। ZEKAI टूल और वर्कफ़्लो की स्वतंत्र रूप से समीक्षा करता है; हमारा लक्ष्य AI और डेटा साइंस क्षेत्र में काम करने वाले पेशेवरों के लिए व्यावहारिक संसाधन प्रदान करना है। ये प्रॉम्प्ट उन्नत कन्वर्सेशनल AI असिस्टेंट या डेटा एनालिसिस के लिए डिज़ाइन किए गए नोटबुक, जैसे Julius AI में सबसे अच्छा काम करते हैं, लेकिन इन्हें किसी भी शक्तिशाली लार्ज लैंग्वेज मॉडल (LLM) के लिए अनुकूलित किया जा सकता है।
1.1% की वृद्धि Source: stlouisfed.org
जनरेटिव AI से स्व-रिपोर्टेड समय की बचत कुल श्रम उत्पादकता में 1.1% की वृद्धि में बदल जाती है, जिसमें कंप्यूटर और गणित व्यवसायों के कर्मचारी सबसे अधिक समय की बचत की रिपोर्ट करते हैं।
सामान्य AI प्रॉम्प्ट डेटा वैज्ञानिकों के लिए क्यों विफल होते हैं
अधिकांश AI प्रॉम्प्ट गाइड एक एकल {variable} के साथ सरल टेम्पलेट प्रदान करते हैं। यह दृष्टिकोण डेटा साइंस में विफल रहता है क्योंकि संदर्भ कमांड जितना ही महत्वपूर्ण है। एक डेटा वैज्ञानिक के लिए एक प्रभावी प्रॉम्प्ट एक जूनियर विश्लेषक के लिए एक प्रोजेक्ट ब्रीफ की तरह कार्य करता है। इसमें शामिल होना चाहिए:
- भूमिका-निर्वाह: AI को एक विशिष्ट व्यक्तित्व के रूप में कार्य करने के लिए कहें (उदाहरण के लिए, “टाइम-सीरीज़ फोरकास्टिंग में विशेषज्ञता रखने वाले एक वरिष्ठ डेटा वैज्ञानिक के रूप में कार्य करें”)।
- संदर्भ: व्यावसायिक लक्ष्य समझाएं। क्या आप ग्राहक टर्नओवर कम करने, इन्वेंट्री का पूर्वानुमान लगाने या धोखाधड़ी का पता लगाने की कोशिश कर रहे हैं?
- डेटा स्कीमा: कॉलम नाम, डेटा प्रकार और उदाहरण मान प्रदान करें।
- स्पष्ट निर्देश: उठाए जाने वाले सटीक चरणों का विवरण दें (उदाहरण के लिए, “median का उपयोग करके ‘age’ कॉलम में गुम मानों को इम्पुट करें”)।
- आउटपुट प्रारूप: वांछित आउटपुट निर्दिष्ट करें: एक Python स्क्रिप्ट, एक pandas DataFrame, एक Matplotlib विज़ुअलाइज़ेशन, एक JSON ऑब्जेक्ट, या एक सादा-अंग्रेजी सारांश।
इस स्तर के विवरण के बिना, AI केवल अनुमान लगा रहा है। उसे नहीं पता कि user_id एक प्राइमरी की है, कि revenue सेंट में है, या कि डेटा तिरछा है। विशिष्टता एक काम करने वाली स्क्रिप्ट और एक निराशाजनक मतिभ्रम के बीच का अंतर है।
डेटा क्लीनिंग और प्रीप्रोसेसिंग के लिए प्रॉम्प्ट
डेटा तैयारी अक्सर किसी प्रोजेक्ट के अधिकांश समय का उपभोग करती है। ये प्रॉम्प्ट सामान्य डेटा गुणवत्ता समस्याओं की पहचान और सुधार को तेज करते हैं।
नामक एक pandas DataFrame प्रदान कर रहा हूँ। इसका स्कीमा इस प्रकार है:
एक प्रेडिक्टिव मॉडल बनाने वाले डेटा वैज्ञानिक के रूप में कार्य करें। मेरे pandas DataFrame `df` में गुम मान हैं। `df.isnull().sum()` का आउटपुट यहाँ है:
`[PASTE MISSING VALUE COUNTS]`
व्यावसायिक लक्ष्य `[TARGET_VARIABLE]` का पूर्वानुमान लगाना है। कॉलम नामों और लक्ष्य के आधार पर, एक विस्तृत इम्पुटेशन रणनीति प्रस्तावित करें। गुम मानों वाले प्रत्येक कॉलम के लिए, एक विधि (mean, median, mode, constant, या मॉडल-आधारित इम्पुटेशन) की सिफारिश करें और एक वाक्य में अपनी पसंद को न्यायसंगत ठहराएं।
आउटपुट को एक JSON ऑब्जेक्ट के रूप में प्रारूपित करें जहाँ कीज़ कॉलम नाम हैं और वैल्यू एक और ऑब्जेक्ट हैं जिसमें "method" और "justification" शामिल हैं।
के निम्नलिखित न्यूमेरिक कॉलम में आउटलायर की पहचान करने के लिए इंटरक्वारटाइल रेंज (IQR) विधि का उपयोग करती है:
है। निम्नलिखित कॉलमों को उनके डेटा प्रकारों को सही करने की आवश्यकता है:
-
में डुप्लिकेट रिकॉर्ड की पहचान करने के लिए Python कोड उत्पन्न करें। मैं कॉलमों के एक सबसेट के आधार पर डुप्लिकेट की जांच करना चाहता हूँ:
लिखें जो एक स्ट्रिंग लेता है और निम्नलिखित टेक्स्ट क्लीनिंग चरण करता है:
1. टेक्स्ट को लोअरकेस में परिवर्तित करता है।
2. सभी विराम चिह्नों को हटाता है।
3. संख्यात्मक अंकों को हटाता है।
4. सामान्य अंग्रेजी स्टॉप वर्ड्स को हटाता है।
5. Porter Stemmer का उपयोग करके शेष शब्दों को स्टेम करता है।
फ़ंक्शन को क्लीन की गई स्ट्रिंग वापस करनी चाहिए।
एक्सप्लोरेटरी डेटा एनालिसिस (EDA) के लिए प्रॉम्प्ट
एक बार जब डेटा साफ हो जाता है, तो EDA पैटर्न को उजागर करने, परिकल्पनाओं का परीक्षण करने और फीचर इंजीनियरिंग का मार्गदर्शन करने में मदद करता है।
Source: mckinsey.com
2024 की शुरुआत तक, 65% संगठनों ने जनरेटिव AI का नियमित रूप से उपयोग करने की सूचना दी, जो पिछले वर्ष से लगभग दोगुना है, जो प्रयोग से एकीकरण की ओर एक बड़े बदलाव का संकेत देता है।
का उपयोग करके, यूनिवेरिएट एनालिसिस के लिए Python प्लॉट का एक सेट उत्पन्न करें।
में न्यूमेरिक कॉलम के लिए Pearson कोरिलेशन मैट्रिक्स की गणना करने के लिए Python कोड उत्पन्न करें। कॉलम हैं:
में एक कैटेगोरिकल वेरिएबल और कई न्यूमेरिक वेरिएबल्स के बीच संबंध का पता लगाना चाहता हूँ। कैटेगोरिकल वेरिएबल
आवृत्ति पर रिकॉर्ड किया जाता है।
एक मौसमी डीकंपोज़िशन करने के लिए
कॉलम शामिल हैं।
एक Python स्क्रिप्ट उत्पन्न करें जो:
1.
का प्रतिनिधित्व करता है।
इन बिंदुओं को विश्व मानचित्र पर प्लॉट करने के लिए
फीचर इंजीनियरिंग के लिए प्रॉम्प्ट
सही फीचर्स बनाना अक्सर मॉडल प्रदर्शन की कुंजी होती है। AI फीचर विचारों को ब्रेनस्टॉर्म करने और लागू करने में मदद कर सकता है।
[TARGET_VARIABLE, e.g., 'ग्राहक आजीवन मूल्य']
नामक एक datetime कॉलम वाला एक pandas DataFrame
एक मशीन लर्निंग मॉडल के लिए इंटरेक्शन फीचर्स बनाने के लिए Python कोड उत्पन्न करें। मेरे pandas DataFrame `df` में निम्नलिखित न्यूमेरिक फीचर्स हैं: `[COLUMN_A, COLUMN_B, COLUMN_C]`। सभी जोड़ीदार इंटरेक्शन फीचर्स (उदाहरण के लिए, A*B, A*C, B*C) बनाएं। इन नए फीचर्स को DataFrame में जोड़ें।
में निम्नलिखित कैटेगोरिकल कॉलमों को वन-हॉट एन्कोड करने के लिए
को निम्नलिखित समूहों में बिन करके एक नया कॉलम
तिथि द्वारा अनुक्रमित है और इसमें एक लक्ष्य कॉलम
मॉडल चयन और निर्माण के लिए प्रॉम्प्ट
AI कई मॉडलों को प्रशिक्षित करने और मूल्यांकन करने के लिए बॉयलरप्लेट कोड लिख सकता है, जिससे आप परिणामों की व्याख्या करने पर ध्यान केंद्रित कर सकते हैं।
एक AutoML विशेषज्ञ के रूप में कार्य करें। मेरे पास फीचर्स `X` और एक बाइनरी लक्ष्य वेरिएबल `y` के साथ एक प्रीप्रोसेस्ड डेटासेट है। एक पूर्ण Python स्क्रिप्ट उत्पन्न करें जो तीन अलग-अलग बेसलाइन क्लासिफिकेशन मॉडलों को प्रशिक्षित और मूल्यांकन करती है:
1. Logistic Regression
2. Random Forest Classifier
3. Gradient Boosting Classifier (LightGBM का उपयोग करके)
प्रत्येक मॉडल के लिए, स्क्रिप्ट को चाहिए:
- 5-फोल्ड क्रॉस-वैलिडेशन का उपयोग करें।
- माध्य Accuracy, Precision, Recall और F1-score की गणना करें और प्रिंट करें।
- आसान तुलना के लिए परिणामों को एक pandas DataFrame में स्टोर करें।
के लिए हाइपरपैरामीटर ट्यूनिंग करने के लिए एक Python स्क्रिप्ट उत्पन्न करें।
मेरा फीचर मैट्रिक्स
फीचर्स हैं।
नेटवर्क आर्किटेक्चर होना चाहिए:
-
पाइपलाइन बनाती है। पाइपलाइन में निम्नलिखित चरण शामिल होने चाहिए:
1. median रणनीति के साथ
है जिसमें एक यूनिवेरिएट टाइम सीरीज़ शामिल है।
लाइब्रेरी का उपयोग करके एक Python स्क्रिप्ट उत्पन्न करें।
मान लें कि मेरे पास तीन कॉलम वाला एक pandas DataFrame
मॉडल मूल्यांकन और इंटरप्रिटेशन के लिए प्रॉम्प्ट
एक मॉडल बेकार है यदि आप उसके प्रदर्शन और पूर्वानुमानों की व्याख्या नहीं कर सकते।
में हैं। एक कन्फ्यूजन मैट्रिक्स की गणना और प्लॉट करने के लिए
y_test` (सही लेबल) और `y_pred_proba` (मेरे क्लासिफायर से पॉजिटिव क्लास के लिए अनुमानित संभावनाएं) का उपयोग करके, एक Python स्क्रिप्ट उत्पन्न करें:
1. AUC (Area Under the Curve) स्कोर की गणना करें।
2. ROC (Receiver Operating Characteristic) कर्व प्लॉट करें।
3. तुलना के लिए एक रैंडम क्लासिफायर का प्रतिनिधित्व करने वाली एक विकर्ण रेखा शामिल करें।
4. AUC स्कोर के साथ प्लॉट को लेबल करें।
नामक एक ट्री-आधारित मॉडल (जैसे LightGBM या XGBoost) को प्रशिक्षित किया है। मैं एक विशिष्ट इंस्टेंस
मेरे पास `model` नामक एक प्रशिक्षित `RandomForestClassifier` मॉडल है। मेरे फीचर्स के नाम `[LIST_OF_FEATURE_NAMES]` हैं। मॉडल से फीचर इम्पोर्टेंस निकालने, उन्हें उनके नामों से मिलाने और शीर्ष 15 सबसे महत्वपूर्ण फीचर्स को दर्शाने वाला एक क्षैतिज बार प्लॉट बनाने के लिए Python कोड उत्पन्न करें।
) पर फीचर इम्पोर्टेंस की गणना करने के लिए
हैं। मेरे मॉडल के लिए एक कैलिब्रेशन कर्व प्लॉट करने के लिए
परिणामों और रिपोर्टिंग की व्याख्या के लिए प्रॉम्प्ट
गैर-तकनीकी स्टेकहोल्डर्स को निष्कर्षों को संप्रेषित करना एक महत्वपूर्ण कौशल है। AI सारांश तैयार करने और व्यवसाय-अनुकूल विज़ुअलाइज़ेशन बनाने में मदद कर सकता है।
[TARGET_VARIABLE, e.g., 'कर्मचारी टर्नओवर']
नीचे एक Python स्क्रिप्ट है जो एक प्लॉट उत्पन्न करती है। स्क्रिप्ट के बाद, मैं प्लॉट का वर्णन करूँगा। आपका कार्य व्यावसायिक दर्शकों के लिए इस अंतर्दृष्टि की एक संक्षिप्त, एक-पैराग्राफ व्याख्या लिखना है। तकनीकी शब्दजाल से बचें।
`[PASTE PYTHON PLOT SCRIPT]`
प्लॉट एक बार चार्ट दिखाता है जहाँ 'टियर 1' सपोर्ट श्रेणी में ग्राहकों का औसत मासिक खर्च $150 है, जबकि 'टियर 3' श्रेणी में ग्राहकों का औसत खर्च $45 है।
अब, व्यावसायिक सारांश लिखें।
है जिसमें एक A/B टेस्ट के परिणाम हैं। इसमें
एक डेटा विश्लेषक के रूप में कार्य करें। नए "वन-क्लिक चेकआउट" फीचर के लिए A/B टेस्ट के परिणामों की रिपोर्ट करने के लिए उत्पाद टीम को एक ईमेल ड्राफ्ट करें।
प्रमुख निष्कर्ष:
- कंट्रोल ग्रुप रूपांतरण दर: 3.5%
- ट्रीटमेंट ग्रुप (फीचर के साथ) रूपांतरण दर: 4.8%
- परिणाम 0.002 के p-value के साथ सांख्यिकीय रूप से महत्वपूर्ण है।
- टेस्ट 14 दिनों तक चला जिसमें प्रत्येक ग्रुप में 50,000 उपयोगकर्ता थे।
ईमेल को एक स्पष्ट विषय पंक्ति, परिणाम का संक्षिप्त सारांश, प्रमुख संख्याएं और फीचर को रोल आउट करने की सिफारिश के साथ संरचित करें।
मशीन लर्निंग में "ओवरफिटिंग" की अवधारणा को समझाएं जैसे आप एक बिक्री निदेशक को समझाएंगे। एक सादृश्य का उपयोग करें। स्पष्टीकरण को 150 शब्दों के भीतर रखें।
एक डेटा साइंस प्रोजेक्ट README फ़ाइल के लिए एक markdown टेम्पलेट उत्पन्न करें। टेम्पलेट में निम्नलिखित अनुभाग शामिल होने चाहिए:
- प्रोजेक्ट शीर्षक (Project Title)
- व्यावसायिक समस्या (Business Problem)
- डेटा स्रोत (Data Source)
- कार्यप्रणाली (डेटा क्लीनिंग, EDA, मॉडलिंग) (Methodology)
- परिणाम (Results)
- कोड कैसे चलाएं (निर्भरताएँ, निर्देश) (How to Run the Code)
- प्रमुख संपर्क (Key Contacts)
MLOps और प्रोडक्शन के लिए प्रॉम्प्ट
AI मॉडलों को तैनात करने और मॉनिटर करने के लिए आवश्यक इंजीनियरिंग कार्यों में मदद कर सकता है। यहीं पर Azure Machine Learning जैसे प्लेटफॉर्म उत्कृष्ट प्रदर्शन करते हैं, लेकिन AI प्रॉम्प्ट कई घटकों को स्क्रिप्ट कर सकते हैं।
(प्रशिक्षित मॉडल फ़ाइल)
Dockerfile को चाहिए:
1.
) के लिए एक Python स्क्रिप्ट उत्पन्न करें। इसमें एक एंडपॉइंट
एक Python स्क्रिप्ट स्निपेट उत्पन्न करें जो MLflow का उपयोग करके प्रयोग ट्रैकिंग को प्रदर्शित करता है। स्क्रिप्ट को चाहिए:
1. एक MLflow रन शुरू करें।
2. दो पैरामीटर लॉग करें: `learning_rate` और `n_estimators`।
3. तीन मेट्रिक्स लॉग करें: `accuracy`, `precision` और `recall`।
4. प्रशिक्षित मॉडल को एक आर्टिफैक्ट के रूप में लॉग करें।
5. रन समाप्त करें।
ब्रांच पर प्रत्येक पुश पर चलती है। वर्कफ़्लो का नाम "CI Pipeline" होना चाहिए और निम्नलिखित कार्य करने चाहिए:
1. Python 3.9 सेट अप करें।
2.
def remove_outliers(df, column_name):
Q1 = df[column_name].quantile(0.25)
Q3 = df[column_name].quantile(0.75)
IQR = Q3 - Q1
lower_bound = Q1 - 1.5 * IQR
upper_bound = Q3 + 1.5 * IQR
return df[(df[column_name] >= lower_bound) & (df[column_name] <= upper_bound)]
में प्रोडक्शन डेटा का एक नया बैच है।
एक Python स्क्रिप्ट उत्पन्न करें जो
उन्नत और चेन्ड प्रॉम्प्ट
एक बहु-चरणीय वर्कफ़्लो को निष्पादित करने के लिए प्रॉम्प्ट को संयोजित करें। यहीं पर AI एक साधारण कोड जनरेटर से एक विश्लेषणात्मक भागीदार में बदल जाता है।
नामक एक CSV फ़ाइल अपलोड कर रहा हूँ। सबसे पहले, इसे एक pandas DataFrame में लोड करें और एक पूर्ण डेटा प्रोफाइल चलाएं। प्रत्येक कॉलम के लिए गुम मानों, डेटा प्रकारों और बुनियादी सांख्यिकी की पहचान करें। मुझे आउटपुट दिखाएं।"
**प्रॉम्प्ट 2 (AI प्रतिक्रिया के बाद):** "धन्यवाद। उस प्रोफाइल के आधार पर, डेटा क्लीनिंग को संभालने के लिए एक Python स्क्रिप्ट उत्पन्न करें। गुम
: integer, 40 के माध्य और 10 के मानक विचलन के आसपास सामान्य रूप से वितरित।
-
नामक एक Python क्लास में रीफैक्टर करें।
क्लास में होना चाहिए:
- एक
import pandas as pd
from sklearn.model_selection import train_test_split
from sklearn.ensemble import RandomForestClassifier
df = pd.read_csv('data.csv')
df = df.dropna()
X = df[['feature1', 'feature2']]
y = df['target']
X_train, X_test, y_train, y_test = train_test_split(X, y, test_size=0.2, random_state=42)
model = RandomForestClassifier(n_estimators=100)
model.fit(X_train, y_train)
print(model.score(X_test, y_test))
) है जिसके लिए मॉडल ने टर्नओवर की उच्च संभावना (0.92) का पूर्वानुमान लगाया था।
एक काउंटरफैक्चुअल स्पष्टीकरण का उपयोग करके इस पूर्वानुमान की व्याख्या करें। सादे अंग्रेजी में, इस ग्राहक के फीचर्स (उदाहरण के लिए,
टेबल है।
क्वेरी को मासिक ग्राहक कोहोर्ट्स की रिटेंशन दर की गणना करनी चाहिए। एक ग्राहक का कोहोर्ट उनकी पहली खरीद का महीना है। किसी दिए गए महीने के लिए रिटेंशन उस महीने में खरीद करने वाले कोहोर्ट के ग्राहकों का प्रतिशत है।
आउटपुट में तीन कॉलम होने चाहिए:
['date', 'region', 'sales', 'product_category']
) है जो pandas मेमोरी में फिट नहीं होगी। कार्य
आगे कहाँ जाएं
तीन रास्ते, जो आपने अभी पढ़ा उसके आधार पर चुने गए।
डेटा एनालिसिस के लिए एक अच्छा AI प्रॉम्प्ट कैसे लिखें?
ए: एक अच्छा प्रॉम्प्ट स्पष्ट संदर्भ प्रदान करता है। इसे AI को बताना चाहिए कि कौन सा व्यक्तित्व अपनाना है (उदाहरण के लिए, “एक डेटा विश्लेषक के रूप में कार्य करें”), व्यावसायिक लक्ष्य को परिभाषित करना चाहिए, डेटा स्कीमा (कॉलम नाम और प्रकार) प्रदान करना चाहिए, स्पष्ट चरण-दर-चरण निर्देश देना चाहिए, और आपको आवश्यक सटीक आउटपुट प्रारूप (उदाहरण के लिए, Python कोड, markdown टेबल, JSON) निर्दिष्ट करना चाहिए।
क्या ChatGPT का उपयोग डेटा साइंस के लिए किया जा सकता है?
ए: हाँ, ChatGPT और अन्य लार्ज लैंग्वेज मॉडल डेटा साइंस के लिए शक्तिशाली सहायक हैं। वे क्लीनिंग और एनालिसिस के लिए बॉयलरप्लेट कोड उत्पन्न करने, स्क्रिप्ट को डीबग करने, जटिल अवधारणाओं को समझाने, रिपोर्ट तैयार करने और Python और R जैसी भाषाओं के बीच कोड का अनुवाद करने में उत्कृष्ट हैं। हालांकि, वे ऐसे उपकरण हैं जिन्हें परिणामों की वैधता और सटीकता सुनिश्चित करने के लिए मानवीय निरीक्षण की आवश्यकता होती है।
डेटा क्लीनिंग के लिए सबसे अच्छे AI प्रॉम्प्ट कौन से हैं?
ए: डेटा क्लीनिंग के लिए सबसे अच्छे प्रॉम्प्ट अत्यधिक विशिष्ट होते हैं। “डेटा साफ करें” कहने के बजाय, ऐसे प्रॉम्प्ट का उपयोग करें: “median के साथ ‘age’ कॉलम में गुम मानों को इम्पुट करने के लिए एक Python स्क्रिप्ट उत्पन्न करें,” या ” ‘price’ कॉलम से मुद्रा प्रतीकों और अल्पविरामों को हटाने और इसे एक float में परिवर्तित करने के लिए कोड लिखें।”
AI एक्सप्लोरेटरी डेटा एनालिसिस (EDA) में कैसे मदद कर सकता है?
ए: AI विज़ुअलाइज़ेशन के लिए कोड उत्पन्न करके EDA को तेजी से तेज कर सकता है। आप इसे सभी न्यूमेरिक कॉलम के लिए हिस्टोग्राम का एक ग्रिड, संबंधों को पहचानने के लिए एक कोरिलेशन हीटमैप, या श्रेणियों में वितरण की तुलना करने के लिए बॉक्स प्लॉट बनाने के लिए कह सकते हैं। यह EDA के सबसे अधिक समय लेने वाले हिस्से को स्वचालित करता है, जिससे आप पैटर्न की व्याख्या करने पर ध्यान केंद्रित कर सकते हैं।
क्या AI डेटा वैज्ञानिकों की जगह लेगा?
ए: नहीं, AI से डेटा वैज्ञानिकों की जगह लेने की उम्मीद नहीं है, लेकिन यह भूमिका को बदल रहा है। AI बॉयलरप्लेट कोड लिखने और प्रारंभिक डेटा प्रोफाइलिंग जैसे दोहराए जाने वाले कार्यों को स्वचालित करता है, जिससे वैज्ञानिकों को उच्च-मूल्य वाले काम पर ध्यान केंद्रित करने की स्वतंत्रता मिलती है: समस्या निर्माण, प्रायोगिक डिजाइन, जटिल परिणामों की व्याख्या करना और स्टेकहोल्डर्स को अंतर्दृष्टि संप्रेषित करना। नौकरी अधिक रणनीतिक निरीक्षण और कम मैनुअल कोडिंग की ओर विकसित हो रही है।
आगे कहाँ जाएं
तीन रास्ते, जो आपने अभी पढ़ा उसके आधार पर चुने गए।
स्रोत (16)
- Goldman Sachs. (2023, April 5). *Generative AI could raise global GDP by 7%*.
- Goldman Sachs. (2024, May 13). *AI is showing “very positive” signs of eventually boosting GDP and productivity*.
- Goldman Sachs. (2025, August 13). *How Will AI Affect the Global Workforce?*.
- Goldman Sachs. (2025, July 3). *AI Agents to Boost Productivity and Size of Software Market*.
- Dataversity. (2024, May 1). *The Impact of Generative AI on Data Science*.
- Goldman Sachs. (2023, November 7). *AI may start to boost US GDP in 2027*.
- 365 Data Science. (2026, April 23). *Data Scientist Job Outlook 2026: Trends, Salaries, and Skills*.
- Pragmatic Institute. *AI Prompts for Data Scientists*.
- CASRAI. (2026, August 25). *Julius AI for Research Data: A Careful Guide*.
- McKinsey & Company. (2026, August 25). *The State of AI: Global Survey 2026*.
- McKinsey & Company. (2021, December 8). *Global survey: The state of AI in 2021*.
- Medium. (2024, July 17). *Top 20+ Generative AI Prompts for Data Scientists and Analysts*.
- McKinsey & Company. (2024, July 22). *What Businesses Can Learn from McKinsey’s 2024 Global Survey on AI Adoption*.
- Reddit. (2025, December 12). *Should I pursue Data Science in 2026, or is the field at risk because of AI?*.
- Federal Reserve Bank of St. Louis. (2025, February 27). *The Impact of Generative AI on Work Productivity*.
- McKinsey & Company. (2024, May 30). *The state of AI in early 2024: Gen AI adoption spikes and starts to generate value*.
Google में Zekai को सबसे पहले देखें
साप्ताहिक AI ब्रीफ़िंग आपके पेशे के लिए
हफ़्ते में एक ईमेल: AI के वे बदलाव जो सच में आपके पेशे को प्रभावित करते हैं — टूल्स, डील्स और आगे क्या करें।

