KI-Tools, bewertet für deinen Beruf
KI lernen in 30 Tagen

📈 Tech & Engineering

KI-Prompts für Datenwissenschaft

50 KI-Prompts zum Kopieren für datenwissenschaft, aus 1 getesteten Zekai-Guides. Kostenlos, ohne Anmeldung, und jeder verweist auf den Artikel, der ihn erklärt. Im Hub datenwissenschaft finden Sie die Tools, für die diese Prompts geschrieben sind.

  • 50Prompts
  • 1Quell-Guide
  • 100%kostenlos · ohne Anmeldung

Die 50 Prompts

Kopieren Sie einen davon direkt in ChatGPT, Claude oder Gemini und ersetzen Sie die Platzhalter in Klammern durch Ihre Angaben.

50 Prompts zum Kopieren
1Umfassendes Datenprofil
zur Verfügung. Sein Schema ist wie folgt:
2Imputationsplan für fehlende Werte
enthält fehlende Werte. Hier ist die Ausgabe von
3Skript zur Ausreißererkennung
Generieren Sie ein Python-Skript, das die Interquartilsbereichs-Methode (IQR) verwendet, um Ausreißer in den folgenden numerischen Spalten eines pandas DataFrame `df` zu identifizieren: `[[LIST_OF_NUMERIC_COLUMNS]]`. Das Skript sollte: 1. Q1, Q3 und IQR für jede angegebene Spalte berechnen. 2. Die oberen und unteren Grenzen definieren (Q1 - 1.5 * IQR, Q3 + 1.5 * IQR). 3. Ein neues DataFrame erstellen, das nur die Zeilen enthält, die Ausreißerwerte in einer der angegebenen Spalten aufweisen. 4. Die Form des ursprünglichen DataFrames und des Ausreißer-DataFrames ausgeben.
4Skript zur Datentypkonvertierung
. Die Datentypen der folgenden Spalten müssen korrigiert werden: -
5Identifizierung doppelter Datensätze
zu identifizieren. Ich möchte Duplikate basierend auf einer Untermenge von Spalten überprüfen:
6Funktion zur Textnormalisierung
, die einen String entgegennimmt und die folgenden Textbereinigungsschritte durchführt: 1. Konvertiert den Text in Kleinbuchstaben. 2. Entfernt alle Satzzeichen. 3. Entfernt numerische Ziffern. 4. Entfernt gängige englische Stoppwörter. 5. Stemmt die verbleibenden Wörter mithilfe des Porter Stemmers. Die Funktion sollte den bereinigten String zurückgeben. Fügen Sie Importe von
7Univariate Analyseplots generieren
eine Reihe von Python-Plots für die univariate Analyse. Für jede numerische Spalte in
8Korrelationsmatrix und Interpretation
. Führen Sie dann Folgendes aus: 1. Erstellen Sie eine Heatmap der Korrelationsmatrix mit
9Bivariate Analyse: Numerisch vs. Kategorial
untersuchen. Die kategoriale Variable ist
10Zeitreihenzerlegung
mit einem Datetime-Index und einer Spalte namens
11Kundensegmentierung mit K-Means
. Generieren Sie ein Python-Skript, das: 1. Diese beiden Spalten mit
12Geodatenvisualisierung
mit Breiten- und Längengradspalten namens
13Feature-Ideen brainstormen
. Ich erstelle ein Modell zur Vorhersage von
14Zeitbasierte Features erstellen
. Generieren Sie ein Python-Skript, das die folgenden neuen Features aus dieser Spalte erstellt: - Jahr - Monat - Wochentag (als Zahl, 0=Montag) - Tag des Jahres - Woche des Jahres - Ein binäres Flag
15Interaktions-Features generieren
hat die folgenden numerischen Features:
16One-Hot-Kodierung kategorialer Features
verwendet, um die folgenden kategorialen Spalten in meinem DataFrame
17Numerische Features binden
darstellt. Generieren Sie Python-Code, um eine neue Spalte
18Lag-Features für Zeitreihen erstellen
ist nach Datum indiziert und hat eine Zielspalte
19Basis-Klassifikationsmodelle vergleichen
Agieren Sie als AutoML-Spezialist. Ich habe einen vorverarbeiteten Datensatz mit Features `X` und einer binären Zielvariable `y`. Generieren Sie ein vollständiges Python-Skript, das drei verschiedene Basis-Klassifikationsmodelle trainiert und evaluiert: 1. Logistische Regression 2. Random Forest Classifier 3. Gradient Boosting Classifier (mit LightGBM) Für jedes Modell sollte das Skript: - 5-fache Kreuzvalidierung verwenden. - Die mittlere Genauigkeit (Accuracy), Präzision (Precision), Recall und den F1-Score berechnen und ausgeben. - Die Ergebnisse in einem pandas DataFrame zur einfachen Vergleichbarkeit speichern.
20Hyperparameter-Tuning mit Grid Search
durchzuführen. Meine Feature-Matrix ist
21Ein einfaches neuronales Netz mit Keras erstellen
Features. Die Netzwerkarchitektur sollte sein: - Eingabeschicht mit
22Eine Scikit-learn Pipeline einrichten
-Pipeline für einen Machine-Learning-Workflow erstellt. Die Pipeline sollte aus den folgenden Schritten bestehen: 1. Fehlende numerische Werte mit
23Ein Zeitreihenprognosemodell trainieren (ARIMA)
, die eine univariate Zeitreihe enthält. Generieren Sie ein Python-Skript, das
24Eine Empfehlungsmaschine mit Surprise erstellen
-Bibliothek verwendet, um ein einfaches kollaboratives Filter-Empfehlungsmodell für Benutzer-Artikel zu erstellen. Nehmen Sie an, ich habe ein pandas DataFrame
25Eine Konfusionsmatrix plotten
, um eine Konfusionsmatrix zu berechnen und zu plotten. Der Plot sollte klar mit Achsentiteln ('Predicted Label', 'True Label') und den Klassennamen
26ROC-Kurve plotten und AUC berechnen
Verwenden Sie `y_test` (wahre Labels) und `y_pred_proba` (vorhergesagte Wahrscheinlichkeiten für die positive Klasse aus meinem Klassifikator), um ein Python-Skript zu generieren, das: 1. Den AUC-Score (Area Under the Curve) berechnet. 2. Die ROC-Kurve (Receiver Operating Characteristic) plottet. 3. Eine diagonale Linie enthält, die einen zufälligen Klassifikator zum Vergleich darstellt. 4. Den Plot mit dem AUC-Score beschriftet.
27Eine Vorhersage mit SHAP erklären
trainiert. Ich möchte eine einzelne Vorhersage für eine spezifische Instanz
28Globale Feature-Wichtigkeit abrufen
Ich habe ein trainiertes `RandomForestClassifier`-Modell namens `model`. Meine Features haben die Namen `[[LIST_OF_FEATURE_NAMES]]`. Generieren Sie Python-Code, um die Feature-Wichtigkeiten aus dem Modell zu extrahieren, sie mit ihren Namen abzugleichen und ein horizontales Balkendiagramm zu erstellen, das die Top 15 der wichtigsten Features zeigt.
29Einen Permutations-Wichtigkeitstest durchführen
sklearn.inspection.permutation_importance
30Eine Kalibrierungskurve plotten
und die vorhergesagten Wahrscheinlichkeiten
31Modellleistung für Führungskräfte zusammenfassen
[[ZIELVARIABLE, z.B. 'Mitarbeiterfluktuation']]
32Eine wichtige Erkenntnis aus einem Plot beschreiben
Unten ist ein Python-Skript, das einen Plot generiert. Nach dem Skript werde ich den Plot beschreiben. Ihre Aufgabe ist es, eine prägnante, einparagrafische Interpretation dieser Erkenntnis für ein Geschäftspublikum zu schreiben. Vermeiden Sie technischen Jargon. `[[PASTE PYTHON PLOT SCRIPT]]` Der Plot zeigt ein Balkendiagramm, in dem Kunden der Support-Kategorie „Tier 1“ durchschnittlich 150 $ pro Monat ausgeben, während Kunden der Kategorie „Tier 3“ durchschnittlich 45 $ ausgeben. Schreiben Sie nun die geschäftliche Zusammenfassung.
33Eine geschäftsorientierte Visualisierung erstellen
mit den Ergebnissen eines A/B-Tests. Es enthält die Spalten
34Eine E-Mail zur Berichterstattung über A/B-Testergebnisse entwerfen
Agieren Sie als Datenanalyst. Entwerfen Sie eine E-Mail an das Produktteam, in der Sie die Ergebnisse eines A/B-Tests für die neue Funktion „One-Click Checkout“ berichten. Wichtige Erkenntnisse: - Konversionsrate der Kontrollgruppe: 3,5 % - Konversionsrate der Behandlungsgruppe (mit Funktion): 4,8 % - Das Ergebnis ist statistisch signifikant mit einem p-Wert von 0,002. - Der Test lief 14 Tage lang mit 50.000 Benutzern in jeder Gruppe. Strukturieren Sie die E-Mail mit einer klaren Betreffzeile, einer kurzen Zusammenfassung des Ergebnisses, den Schlüsselzahlen und einer Empfehlung zur Einführung der Funktion.
35Ein technisches Konzept einfach erklären
Erklären Sie das Konzept des „Overfittings“ im maschinellen Lernen, wie Sie es einem Vertriebsleiter erklären würden. Verwenden Sie eine Analogie. Halten Sie die Erklärung unter 150 Wörtern.
36Eine Projekt-README generieren
Generieren Sie eine Markdown-Vorlage für eine README-Datei eines Data-Science-Projekts. Die Vorlage sollte die folgenden Abschnitte enthalten: - Projekttitel - Geschäftsproblem - Datenquelle - Methodik (Datenbereinigung, EDA, Modellierung) - Ergebnisse - Code ausführen (Abhängigkeiten, Anweisungen) - Wichtige Kontakte
37Ein Dockerfile für eine Flask API schreiben
(die trainierte Modelldatei) Das Dockerfile sollte: 1. Von einem
38Einen einfachen Flask API-Endpunkt erstellen
haben, der POST-Anfragen mit einer JSON-Payload akzeptiert. Das Skript muss: 1. Ein vortrainiertes scikit-learn-Modell aus einer Datei namens
39Modellmetriken mit MLflow protokollieren
Generieren Sie ein Python-Skript-Snippet, das zeigt, wie MLflow für das Experiment-Tracking verwendet wird. Das Skript sollte: 1. Einen MLflow-Run starten. 2. Zwei Parameter protokollieren: `learning_rate` und `n_estimators`. 3. Drei Metriken protokollieren: `accuracy`, `precision` und `recall`. 4. Das trainierte Modell selbst als Artefakt protokollieren. 5. Den Run beenden.
40Einen GitHub Actions Workflow für CI schreiben
-Branch ausgeführt wird. Der Workflow sollte „CI Pipeline“ genannt werden und die folgenden Aufgaben ausführen: 1. Python 3.9 einrichten. 2. Abhängigkeiten aus
41Unit-Test für eine Datenbereinigungsfunktion
def remove_outliers(df, column_name): Q1 = df[[column_name]].quantile(0.25) Q3 = df[[column_name]].quantile(0.75) IQR = Q3 - Q1 lower_bound = Q1 - 1.5 * IQR upper_bound = Q3 + 1.5 * IQR return df[(df[[column_name]] >= lower_bound) & (df[[column_name]] <= upper_bound)]
42Daten-Drift überwachen
, und ich habe einen neuen Batch von Produktionsdaten in
43Verkettet: Vollständiger EDA-Bericht aus einer CSV
hoch. Laden Sie sie zuerst in ein pandas DataFrame und führen Sie eine vollständige Datenprofilierung durch. Identifizieren Sie fehlende Werte, Datentypen und grundlegende Statistiken für jede Spalte. Zeigen Sie mir die Ausgabe.“ **Prompt 2 (nachdem die KI geantwortet hat):** „Vielen Dank. Basierend auf diesem Profil generieren Sie ein Python-Skript zur Datenbereinigung. Imputieren Sie fehlendes Alter mit dem Median. Löschen Sie Zeilen, in denen
44Synthetische Daten generieren
: Integer, normalverteilt um einen Mittelwert von 40 mit einer Standardabweichung von 10. -
45Ein Jupyter Notebook in eine Klasse refaktorisieren
-Methode, die Modell-Hyperparameter entgegennimmt. - Eine
46Python-Skript in R konvertieren
import pandas as pd from sklearn.model_selection import train_test_split from sklearn.ensemble import RandomForestClassifier df = pd.read_csv('data.csv') df = df.dropna() X = df[[['feature1', 'feature2']]] y = df[['target']] X_train, X_test, y_train, y_test = train_test_split(X, y, test_size=0.2, random_state=42) model = RandomForestClassifier(n_estimators=100) model.fit(X_train, y_train) print(model.score(X_test, y_test))
47Modellergebnisse mit Kontrafakten erklären
), für die das Modell eine hohe Abwanderungswahrscheinlichkeit (0,92) vorhersagte. Erklären Sie diese Vorhersage mithilfe einer kontrafaktischen Erklärung. Beschreiben Sie in einfachem Deutsch die minimalen Änderungen an den Features dieses Kunden (z.B.
48SQL: Kohortenanalyse-Abfrage
. Die Abfrage sollte die Bindungsrate monatlicher Kundenkohorten berechnen. Die Kohorte eines Kunden ist der Monat seines ersten Kaufs. Die Bindung für einen bestimmten Monat ist der Prozentsatz der Kunden aus einer Kohorte, die in diesem Monat einen Kauf getätigt haben. Die Ausgabe sollte drei Spalten haben:
49Ein interaktives Dashboard mit Plotly erstellen
[['date', 'region', 'sales', 'product_category']]
50Ein Dask-Skript für eine große CSV-Datei schreiben
), die nicht in den pandas-Speicher passt. Die Aufgabe besteht darin, den Mittelwert von

So nutzen Sie diese Prompts für datenwissenschaft

Vier Schritte, etwa eine Minute. Der Prompt liefert die Struktur, Sie liefern die Details.

1

Prompt auswählen

Jeder Prompt hier wurde für eine konkrete Aufgabe geschrieben — keine generische „Handle als Experte“-Vorlage. Überfliegen Sie die Titel und nehmen Sie den, der zu Ihrer Aufgabe passt.

2

Kopieren und einfügen

Auf Kopieren klicken und alles in ChatGPT, Claude, Gemini oder den Assistenten einfügen, den Sie ohnehin bezahlen. Nichts hier ist an ein Modell gebunden.

3

Klammern ausfüllen

Ersetzen Sie jeden [Platzhalter in Klammern] durch Ihre eigenen Angaben, bevor Sie absenden. Daher kommt die Qualität: Der Prompt liefert die Struktur, Sie liefern die Details.

4

Quell-Guide prüfen

Der Link „Quelle“ unter jedem Prompt öffnet den vollständigen Artikel: warum der Prompt so gebaut ist, woran er getestet wurde und zu welchen Tools er passt.

Häufige Fragen

Die Fragen, die man sich stellt, bevor man so einen Prompt in echte Arbeit einfügt.

Sind diese KI-Prompts kostenlos nutzbar?

Ja. Alle 50 Prompts auf dieser Seite dürfen mit jedem KI-Assistenten frei kopiert und genutzt werden, auch mit ChatGPT, Claude und Gemini. Sie brauchen nur ein Konto bei einem dieser Tools.

Wie nutze ich diese KI-Prompts für datenwissenschaft?

Kopieren Sie den vollständigen Text über die Schaltfläche Kopieren, fügen Sie ihn in Ihren KI-Assistenten ein und ersetzen Sie jeden Platzhalter in Klammern — etwa [Ihre Stadt] oder [Firmenname] — durch Ihre eigenen Angaben.

Woher stammen diese Prompts?

Jeder Prompt stammt aus einem getesteten Zekai-Guide. Der Link „Quelle“ unter jedem Prompt führt zum vollständigen Artikel, der die Begründung und den Test erklärt.

Darf ich diese Prompts anpassen?

Unbedingt. Behandeln Sie jeden als Ausgangsstruktur: Anweisungen schärfen, eigene Vorgaben ergänzen und die Fassung behalten, die das beste Ergebnis liefert. Die Klammern markieren, was immer angepasst werden muss.

Prompt-Bibliotheken für andere Berufe

Gleiches Format, anderer Beruf — beginnend mit den nächstliegenden zu datenwissenschaft.

Zekai zuerst in Google sehen