The short answer
Die besten KI-Prompts für Data Scientists spezifizieren die Aufgabe, den Kontext und das gewünschte Ausgabeformat, um nutzbaren Code und Analysen zu generieren, anstatt vager Ratschläge. Effektive Prompts versorgen die KI mit Geschäftskontext, Datenstruktur und expliziten Anweisungen für Aufgaben wie Datenbereinigung, explorative Datenanalyse, Feature Engineering und Modellinterpretation.
Generische Prompts wie „analysieren Sie diese Daten“ verschwenden Zeit. Der Wert eines Data Scientists liegt in der Problemformulierung und der Validierung der Ergebnisse, aber generative KI kann die mechanischen Schritte dazwischen dramatisch beschleunigen – wenn Sie ihr die richtigen Anweisungen geben. Vage Anfragen führen zu generischem, oft fehlerhaftem Code. Spezifische, kontextreiche Prompts erzeugen funktionale Skripte, aufschlussreiche Analysen und klare Visualisierungen.
Dieser Leitfaden bietet 50 praxiserprobte Prompts, die nach dem Data-Science-Workflow organisiert sind. Wir haben sie so konzipiert, dass Sie sie kopieren, einfügen und an Ihre spezifischen Datensätze und Probleme anpassen können. ZEKAI überprüft Tools und Workflows unabhängig; unser Ziel ist es, praktische Ressourcen für Berufstätige im Bereich KI und Data Science bereitzustellen. Diese Prompts funktionieren am besten in fortgeschrittenen konversationellen KI-Assistenten oder Notebooks, die für die Datenanalyse entwickelt wurden, wie Julius AI, können aber an jedes leistungsstarke Large Language Model (LLM) angepasst werden.
aggregierten Produktivität Source: stlouisfed.org
Selbstberichtete Zeiteinsparungen durch generative KI führen zu einem Anstieg der aggregierten Arbeitsproduktivität um 1,1 %, wobei Arbeitnehmer in Computer- und Mathematikberufen die höchsten Zeiteinsparungen melden.
Warum generische KI-Prompts für Data Scientists nicht funktionieren
Die meisten KI-Prompt-Leitfäden bieten einfache Vorlagen mit einer einzelnen {variable}. Dieser Ansatz scheitert in der Data Science, weil der Kontext ebenso wichtig ist wie der Befehl. Ein effektiver Prompt für einen Data Scientist wirkt wie ein Projektbriefing für einen Junior-Analysten. Er muss Folgendes enthalten:
- Rollenverteilung: Weisen Sie die KI an, als eine bestimmte Persona zu agieren (z.B. „Agieren Sie als Senior Data Scientist, spezialisiert auf Zeitreihenprognosen“).
- Kontext: Erklären Sie das Geschäftsziel. Versuchen Sie, die Kundenabwanderung zu reduzieren, den Lagerbestand zu prognostizieren oder Betrug zu erkennen?
- Datenschema: Geben Sie Spaltennamen, Datentypen und Beispielwerte an.
- Explizite Anweisungen: Beschreiben Sie die genauen Schritte (z.B. „fehlende Werte in der Spalte ‚age‘ mit dem Median imputieren“).
- Ausgabeformat: Geben Sie das gewünschte Ausgabeformat an: ein Python-Skript, ein pandas DataFrame, eine Matplotlib-Visualisierung, ein JSON-Objekt oder eine Zusammenfassung in einfachem Englisch.
Ohne dieses Detailniveau rät die KI nur. Sie weiß nicht, dass user_id ein Primärschlüssel ist, dass revenue in Cents angegeben ist oder dass die Daten schief sind. Spezifität ist der Unterschied zwischen einem funktionierenden Skript und einer frustrierenden Halluzination.
Prompts für Datenbereinigung & Vorverarbeitung
Die Datenaufbereitung nimmt oft den Großteil der Projektzeit in Anspruch. Diese Prompts beschleunigen die Identifizierung und Korrektur gängiger Datenqualitätsprobleme.
zur Verfügung. Sein Schema ist wie folgt:
enthält fehlende Werte. Hier ist die Ausgabe von
Generieren Sie ein Python-Skript, das die Interquartilsbereichs-Methode (IQR) verwendet, um Ausreißer in den folgenden numerischen Spalten eines pandas DataFrame `df` zu identifizieren: `[LIST_OF_NUMERIC_COLUMNS]`.
Das Skript sollte:
1. Q1, Q3 und IQR für jede angegebene Spalte berechnen.
2. Die oberen und unteren Grenzen definieren (Q1 - 1.5 * IQR, Q3 + 1.5 * IQR).
3. Ein neues DataFrame erstellen, das nur die Zeilen enthält, die Ausreißerwerte in einer der angegebenen Spalten aufweisen.
4. Die Form des ursprünglichen DataFrames und des Ausreißer-DataFrames ausgeben.
. Die Datentypen der folgenden Spalten müssen korrigiert werden:
-
zu identifizieren. Ich möchte Duplikate basierend auf einer Untermenge von Spalten überprüfen:
, die einen String entgegennimmt und die folgenden Textbereinigungsschritte durchführt:
1. Konvertiert den Text in Kleinbuchstaben.
2. Entfernt alle Satzzeichen.
3. Entfernt numerische Ziffern.
4. Entfernt gängige englische Stoppwörter.
5. Stemmt die verbleibenden Wörter mithilfe des Porter Stemmers.
Die Funktion sollte den bereinigten String zurückgeben. Fügen Sie Importe von
Prompts für die explorative Datenanalyse (EDA)
Sobald die Daten bereinigt sind, hilft die EDA, Muster aufzudecken, Hypothesen zu testen und das Feature Engineering zu leiten.
Source: mckinsey.com
Anfang 2024 gaben 65 % der Organisationen an, generative KI regelmäßig zu nutzen, was fast eine Verdoppelung gegenüber dem Vorjahr darstellt und einen großen Wandel von der Experimentierphase zur Integration signalisiert.
eine Reihe von Python-Plots für die univariate Analyse.
Für jede numerische Spalte in
.
Führen Sie dann Folgendes aus:
1. Erstellen Sie eine Heatmap der Korrelationsmatrix mit
untersuchen. Die kategoriale Variable ist
mit einem Datetime-Index und einer Spalte namens
.
Generieren Sie ein Python-Skript, das:
1. Diese beiden Spalten mit
mit Breiten- und Längengradspalten namens
Prompts für Feature Engineering
Die Erstellung der richtigen Features ist oft der Schlüssel zur Modellleistung. KI kann dabei helfen, Feature-Ideen zu entwickeln und umzusetzen.
. Ich erstelle ein Modell zur Vorhersage von
. Generieren Sie ein Python-Skript, das die folgenden neuen Features aus dieser Spalte erstellt:
- Jahr
- Monat
- Wochentag (als Zahl, 0=Montag)
- Tag des Jahres
- Woche des Jahres
- Ein binäres Flag
hat die folgenden numerischen Features:
verwendet, um die folgenden kategorialen Spalten in meinem DataFrame
darstellt. Generieren Sie Python-Code, um eine neue Spalte
ist nach Datum indiziert und hat eine Zielspalte
Prompts für Modellauswahl & -erstellung
KI kann den Boilerplate-Code für das Training und die Bewertung mehrerer Modelle schreiben, sodass Sie sich auf die Interpretation der Ergebnisse konzentrieren können.
Agieren Sie als AutoML-Spezialist. Ich habe einen vorverarbeiteten Datensatz mit Features `X` und einer binären Zielvariable `y`. Generieren Sie ein vollständiges Python-Skript, das drei verschiedene Basis-Klassifikationsmodelle trainiert und evaluiert:
1. Logistische Regression
2. Random Forest Classifier
3. Gradient Boosting Classifier (mit LightGBM)
Für jedes Modell sollte das Skript:
- 5-fache Kreuzvalidierung verwenden.
- Die mittlere Genauigkeit (Accuracy), Präzision (Precision), Recall und den F1-Score berechnen und ausgeben.
- Die Ergebnisse in einem pandas DataFrame zur einfachen Vergleichbarkeit speichern.
durchzuführen.
Meine Feature-Matrix ist
Features.
Die Netzwerkarchitektur sollte sein:
- Eingabeschicht mit
-Pipeline für einen Machine-Learning-Workflow erstellt. Die Pipeline sollte aus den folgenden Schritten bestehen:
1. Fehlende numerische Werte mit
, die eine univariate Zeitreihe enthält. Generieren Sie ein Python-Skript, das
-Bibliothek verwendet, um ein einfaches kollaboratives Filter-Empfehlungsmodell für Benutzer-Artikel zu erstellen.
Nehmen Sie an, ich habe ein pandas DataFrame
Prompts für Modellevaluierung & -interpretation
Ein Modell ist nutzlos, wenn Sie seine Leistung und Vorhersagen nicht erklären können.
, um eine Konfusionsmatrix zu berechnen und zu plotten. Der Plot sollte klar mit Achsentiteln ('Predicted Label', 'True Label') und den Klassennamen
Verwenden Sie `y_test` (wahre Labels) und `y_pred_proba` (vorhergesagte Wahrscheinlichkeiten für die positive Klasse aus meinem Klassifikator), um ein Python-Skript zu generieren, das:
1. Den AUC-Score (Area Under the Curve) berechnet.
2. Die ROC-Kurve (Receiver Operating Characteristic) plottet.
3. Eine diagonale Linie enthält, die einen zufälligen Klassifikator zum Vergleich darstellt.
4. Den Plot mit dem AUC-Score beschriftet.
trainiert. Ich möchte eine einzelne Vorhersage für eine spezifische Instanz
Ich habe ein trainiertes `RandomForestClassifier`-Modell namens `model`. Meine Features haben die Namen `[LIST_OF_FEATURE_NAMES]`. Generieren Sie Python-Code, um die Feature-Wichtigkeiten aus dem Modell zu extrahieren, sie mit ihren Namen abzugleichen und ein horizontales Balkendiagramm zu erstellen, das die Top 15 der wichtigsten Features zeigt.
sklearn.inspection.permutation_importance
und die vorhergesagten Wahrscheinlichkeiten
Prompts zur Erklärung von Ergebnissen & Berichterstattung
Die Kommunikation von Ergebnissen an nicht-technische Stakeholder ist eine entscheidende Fähigkeit. KI kann dabei helfen, Zusammenfassungen zu erstellen und geschäftsfreundliche Visualisierungen zu generieren.
[ZIELVARIABLE, z.B. 'Mitarbeiterfluktuation']
Unten ist ein Python-Skript, das einen Plot generiert. Nach dem Skript werde ich den Plot beschreiben. Ihre Aufgabe ist es, eine prägnante, einparagrafische Interpretation dieser Erkenntnis für ein Geschäftspublikum zu schreiben. Vermeiden Sie technischen Jargon.
`[PASTE PYTHON PLOT SCRIPT]`
Der Plot zeigt ein Balkendiagramm, in dem Kunden der Support-Kategorie „Tier 1“ durchschnittlich 150 $ pro Monat ausgeben, während Kunden der Kategorie „Tier 3“ durchschnittlich 45 $ ausgeben.
Schreiben Sie nun die geschäftliche Zusammenfassung.
mit den Ergebnissen eines A/B-Tests. Es enthält die Spalten
Agieren Sie als Datenanalyst. Entwerfen Sie eine E-Mail an das Produktteam, in der Sie die Ergebnisse eines A/B-Tests für die neue Funktion „One-Click Checkout“ berichten.
Wichtige Erkenntnisse:
- Konversionsrate der Kontrollgruppe: 3,5 %
- Konversionsrate der Behandlungsgruppe (mit Funktion): 4,8 %
- Das Ergebnis ist statistisch signifikant mit einem p-Wert von 0,002.
- Der Test lief 14 Tage lang mit 50.000 Benutzern in jeder Gruppe.
Strukturieren Sie die E-Mail mit einer klaren Betreffzeile, einer kurzen Zusammenfassung des Ergebnisses, den Schlüsselzahlen und einer Empfehlung zur Einführung der Funktion.
Erklären Sie das Konzept des „Overfittings“ im maschinellen Lernen, wie Sie es einem Vertriebsleiter erklären würden. Verwenden Sie eine Analogie. Halten Sie die Erklärung unter 150 Wörtern.
Generieren Sie eine Markdown-Vorlage für eine README-Datei eines Data-Science-Projekts. Die Vorlage sollte die folgenden Abschnitte enthalten:
- Projekttitel
- Geschäftsproblem
- Datenquelle
- Methodik (Datenbereinigung, EDA, Modellierung)
- Ergebnisse
- Code ausführen (Abhängigkeiten, Anweisungen)
- Wichtige Kontakte
Prompts für MLOps & Produktion
KI kann bei den technischen Aufgaben helfen, die für die Bereitstellung und Überwachung von Modellen erforderlich sind. Hier zeichnen sich Plattformen wie Azure Machine Learning aus, aber KI-Prompts können viele der Komponenten skripten.
(die trainierte Modelldatei)
Das Dockerfile sollte:
1. Von einem
haben, der POST-Anfragen mit einer JSON-Payload akzeptiert.
Das Skript muss:
1. Ein vortrainiertes scikit-learn-Modell aus einer Datei namens
Generieren Sie ein Python-Skript-Snippet, das zeigt, wie MLflow für das Experiment-Tracking verwendet wird. Das Skript sollte:
1. Einen MLflow-Run starten.
2. Zwei Parameter protokollieren: `learning_rate` und `n_estimators`.
3. Drei Metriken protokollieren: `accuracy`, `precision` und `recall`.
4. Das trainierte Modell selbst als Artefakt protokollieren.
5. Den Run beenden.
-Branch ausgeführt wird. Der Workflow sollte „CI Pipeline“ genannt werden und die folgenden Aufgaben ausführen:
1. Python 3.9 einrichten.
2. Abhängigkeiten aus
def remove_outliers(df, column_name):
Q1 = df[column_name].quantile(0.25)
Q3 = df[column_name].quantile(0.75)
IQR = Q3 - Q1
lower_bound = Q1 - 1.5 * IQR
upper_bound = Q3 + 1.5 * IQR
return df[(df[column_name] >= lower_bound) & (df[column_name] <= upper_bound)]
, und ich habe einen neuen Batch von Produktionsdaten in
Fortgeschrittene & verkettete Prompts
Kombinieren Sie Prompts, um einen mehrstufigen Workflow auszuführen. Hier wandelt sich KI von einem einfachen Codegenerator zu einem analytischen Partner.
hoch. Laden Sie sie zuerst in ein pandas DataFrame und führen Sie eine vollständige Datenprofilierung durch. Identifizieren Sie fehlende Werte, Datentypen und grundlegende Statistiken für jede Spalte. Zeigen Sie mir die Ausgabe.“
**Prompt 2 (nachdem die KI geantwortet hat):** „Vielen Dank. Basierend auf diesem Profil generieren Sie ein Python-Skript zur Datenbereinigung. Imputieren Sie fehlendes Alter mit dem Median. Löschen Sie Zeilen, in denen
: Integer, normalverteilt um einen Mittelwert von 40 mit einer Standardabweichung von 10.
-
-Methode, die Modell-Hyperparameter entgegennimmt.
- Eine
import pandas as pd
from sklearn.model_selection import train_test_split
from sklearn.ensemble import RandomForestClassifier
df = pd.read_csv('data.csv')
df = df.dropna()
X = df[['feature1', 'feature2']]
y = df['target']
X_train, X_test, y_train, y_test = train_test_split(X, y, test_size=0.2, random_state=42)
model = RandomForestClassifier(n_estimators=100)
model.fit(X_train, y_train)
print(model.score(X_test, y_test))
), für die das Modell eine hohe Abwanderungswahrscheinlichkeit (0,92) vorhersagte.
Erklären Sie diese Vorhersage mithilfe einer kontrafaktischen Erklärung. Beschreiben Sie in einfachem Deutsch die minimalen Änderungen an den Features dieses Kunden (z.B.
.
Die Abfrage sollte die Bindungsrate monatlicher Kundenkohorten berechnen. Die Kohorte eines Kunden ist der Monat seines ersten Kaufs. Die Bindung für einen bestimmten Monat ist der Prozentsatz der Kunden aus einer Kohorte, die in diesem Monat einen Kauf getätigt haben.
Die Ausgabe sollte drei Spalten haben:
['date', 'region', 'sales', 'product_category']
), die nicht in den pandas-Speicher passt. Die Aufgabe besteht darin, den Mittelwert von
Wie es weitergeht
Drei Wege, passend zu dem, was Sie gerade gelesen haben.
Wie schreibt man einen guten KI-Prompt für die Datenanalyse?
Ein guter Prompt liefert klaren Kontext. Er sollte der KI mitteilen, welche Persona sie annehmen soll (z.B. „agieren Sie als Datenanalyst“), das Geschäftsziel definieren, das Datenschema (Spaltennamen und -typen) bereitstellen, explizite Schritt-für-Schritt-Anweisungen geben und das genaue Ausgabeformat spezifizieren, das Sie benötigen (z.B. Python-Code, Markdown-Tabelle, JSON).
Kann ChatGPT für Data Science verwendet werden?
Ja, ChatGPT und andere große Sprachmodelle sind leistungsstarke Assistenten für Data Science. Sie eignen sich hervorragend zum Generieren von Boilerplate-Code für Bereinigung und Analyse, zum Debuggen von Skripten, zum Erklären komplexer Konzepte, zum Entwerfen von Berichten und zum Übersetzen von Code zwischen Sprachen wie Python und R. Sie sind jedoch Werkzeuge, die menschliche Aufsicht erfordern, um die Gültigkeit und Genauigkeit der Ergebnisse zu gewährleisten.
Was sind die besten KI-Prompts für die Datenbereinigung?
Die besten Prompts für die Datenbereinigung sind sehr spezifisch. Anstatt „bereinigen Sie die Daten“ verwenden Sie Prompts wie: „Generieren Sie ein Python-Skript, um fehlende Werte in der Spalte ‚age‘ mit dem Median zu imputieren“ oder „Schreiben Sie Code, um Währungssymbole und Kommas aus der Spalte ‚price‘ zu entfernen und sie in einen Float umzuwandeln.“
Wie kann KI bei der explorativen Datenanalyse (EDA) helfen?
KI kann die EDA erheblich beschleunigen, indem sie Code für Visualisierungen generiert. Sie können sie bitten, ein Raster von Histogrammen für alle numerischen Spalten, eine Korrelations-Heatmap zur Erkennung von Beziehungen oder Boxplots zum Vergleich von Verteilungen über Kategorien hinweg zu erstellen. Dies automatisiert den zeitaufwendigsten Teil der EDA, sodass Sie sich auf die Interpretation der Muster konzentrieren können.
Wird KI Data Scientists ersetzen?
Nein, es wird nicht erwartet, dass KI Data Scientists ersetzen wird, aber sie verändert die Rolle. KI automatisiert repetitive Aufgaben wie das Schreiben von Boilerplate-Code und die anfängliche Datenprofilierung, wodurch Wissenschaftler sich auf höherwertige Arbeiten konzentrieren können: Problemformulierung, experimentelles Design, Interpretation komplexer Ergebnisse und Kommunikation von Erkenntnissen an Stakeholder. Die Aufgabe entwickelt sich hin zu mehr strategischer Aufsicht und weniger manueller Codierung.
Wie es weitergeht
Drei Wege, passend zu dem, was Sie gerade gelesen haben.
Quellen (16)
- Goldman Sachs. (2023, April 5). *Generative AI could raise global GDP by 7%*.
- Goldman Sachs. (2024, May 13). *AI is showing „very positive“ signs of eventually boosting GDP and productivity*.
- Goldman Sachs. (2025, August 13). *How Will AI Affect the Global Workforce?*.
- Goldman Sachs. (2025, July 3). *AI Agents to Boost Productivity and Size of Software Market*.
- Dataversity. (2024, May 1). *The Impact of Generative AI on Data Science*.
- Goldman Sachs. (2023, November 7). *AI may start to boost US GDP in 2027*.
- 365 Data Science. (2026, April 23). *Data Scientist Job Outlook 2026: Trends, Salaries, and Skills*.
- Pragmatic Institute. *AI Prompts for Data Scientists*.
- CASRAI. (2026, August 25). *Julius AI for Research Data: A Careful Guide*.
- McKinsey & Company. (2026, August 25). *The State of AI: Global Survey 2026*.
- McKinsey & Company. (2021, December 8). *Global survey: The state of AI in 2021*.
- Medium. (2024, July 17). *Top 20+ Generative AI Prompts for Data Scientists and Analysts*.
- McKinsey & Company. (2024, July 22). *What Businesses Can Learn from McKinsey’s 2024 Global Survey on AI Adoption*.
- Reddit. (2025, December 12). *Should I pursue Data Science in 2026, or is the field at risk because of AI?*.
- Federal Reserve Bank of St. Louis. (2025, February 27). *The Impact of Generative AI on Work Productivity*.
- McKinsey & Company. (2024, May 30). *The state of AI in early 2024: Gen AI adoption spikes and starts to generate value*.
Zekai zuerst in Google sehen
Das wöchentliche KI-Briefing für Ihren Beruf
Eine E-Mail pro Woche: die KI-Änderungen, die Ihren Beruf wirklich betreffen — Tools, Deals und was zu tun ist.

