Des outils IA notés pour votre métier
Apprendre l’IA en 30 jours

📈 Tech & ingénierie

Prompts IA pour Data Science

50 prompts IA à copier-coller pour data science, issus de 1 guides Zekai testés. Gratuit, sans inscription, et chacun renvoie à l’article qui l’explique. Consultez le hub data science pour les outils sur lesquels ces prompts sont conçus pour tourner.

  • 50prompts
  • 1guide source
  • 100%gratuit · sans inscription

Les 50 prompts

Copiez-en un directement dans ChatGPT, Claude ou Gemini, puis remplacez les éléments entre crochets par vos propres informations.

50 prompts à copier-coller
1Profil de données complet
Agissez comme un analyste de la qualité des données. Je vous fournis un DataFrame pandas nommé `df`. Son schéma est le suivant : `[[PASTE SCHEMA OR HEAD() OUTPUT HERE]]`. Votre tâche est d'effectuer un profilage complet des données. Pour chaque colonne, fournissez : 1. Le type de données. 2. Le nombre et le pourcentage de valeurs manquantes. 3. Le nombre de valeurs uniques (cardinalité). 4. Pour les colonnes numériques : la moyenne, la médiane, l'écart type, le minimum et le maximum. 5. Pour les colonnes catégorielles : une liste des valeurs uniques et leurs fréquences. 6. Identifiez toutes les colonnes qui semblent être mal typées (par exemple, les dates stockées comme des objets). Présentez la sortie sous forme de tableau markdown.
2Plan d'imputation des valeurs manquantes
contient des valeurs manquantes. Voici la sortie de
3Script de détection des valeurs aberrantes
Générez un script Python qui utilise la méthode de l'intervalle interquartile (IQR) pour identifier les valeurs aberrantes dans les colonnes numériques suivantes d'un DataFrame pandas `df` : `[[LIST_OF_NUMERIC_COLUMNS]]`. Le script doit : 1. Calculer Q1, Q3 et l'IQR pour chaque colonne spécifiée. 2. Définir les bornes supérieure et inférieure (Q1 - 1.5 * IQR, Q3 + 1.5 * IQR). 3. Créer un nouveau DataFrame contenant uniquement les lignes qui ont des valeurs aberrantes dans l'une des colonnes spécifiées. 4. Afficher la forme du DataFrame original et du DataFrame des valeurs aberrantes.
4Script de conversion de type de données
. Les colonnes suivantes nécessitent une correction de leur type de données : -
5Identification des enregistrements dupliqués
. Je souhaite vérifier les doublons en me basant sur un sous-ensemble de colonnes :
6Fonction de normalisation de texte
qui prend une chaîne de caractères et effectue les étapes de nettoyage de texte suivantes : 1. Convertit le texte en minuscules. 2. Supprime toute la ponctuation. 3. Supprime les chiffres numériques. 4. Supprime les mots vides (stop words) anglais courants. 5. Réduit les mots restants à leur racine (stemming) en utilisant le Porter Stemmer. La fonction doit renvoyer la chaîne nettoyée. Incluez les importations de
7Générer des graphiques d'analyse univariée
, générez un ensemble de graphiques Python pour l'analyse univariée. Pour chaque colonne numérique dans
8Matrice de corrélation et interprétation
Générez du code Python pour calculer la matrice de corrélation de Pearson pour les colonnes numériques de mon DataFrame pandas `df`. Les colonnes sont : `[[LIST_OF_NUMERIC_COLUMNS]]`. Ensuite, effectuez les opérations suivantes : 1. Créez une carte de chaleur (heatmap) de la matrice de corrélation en utilisant seaborn. Annotez les valeurs sur la carte de chaleur. 2. Identifiez et listez toutes les paires de variables avec un coefficient de corrélation supérieur à 0,7 ou inférieur à -0,7. 3. Pour les 3 paires les plus corrélées, proposez une hypothèse en une phrase expliquant pourquoi elles pourraient être corrélées.
9Analyse bivariée : Numérique vs. Catégorielle
. Pour chaque variable numérique, générez un diagramme en boîte qui compare sa distribution à travers les différentes catégories de
10Décomposition de séries temporelles
avec un index datetime et une colonne nommée
11Segmentation client avec K-Means
. Générez un script Python qui : 1. Standardise ces deux colonnes en utilisant
12Visualisation de données géospatiales
avec des colonnes de latitude et longitude nommées
13Brainstorming d'idées de fonctionnalités
[[TARGET_VARIABLE, par exemple, la 'valeur vie client']]
14Créer des fonctionnalités basées sur le temps
. Générez un script Python qui crée les nouvelles fonctionnalités suivantes à partir de cette colonne : - Année - Mois - Jour de la semaine (sous forme de nombre, 0=Lundi) - Jour de l'année - Semaine de l'année - Un indicateur binaire
15Générer des fonctionnalités d'interaction
a les fonctionnalités numériques suivantes :
16Encoder les fonctionnalités catégorielles en One-Hot
pour encoder en one-hot les colonnes catégorielles suivantes dans mon DataFrame
17Discrétiser les fonctionnalités numériques
. Générez du code Python pour créer une nouvelle colonne
18Créer des fonctionnalités de décalage pour les séries temporelles
est indexé par date et a une colonne cible
19Comparer les modèles de classification de base
Agissez comme un spécialiste AutoML. J'ai un ensemble de données prétraité avec des fonctionnalités `X` et une variable cible binaire `y`. Générez un script Python complet qui entraîne et évalue trois modèles de classification de base différents : 1. Régression logistique 2. Classifieur Random Forest 3. Classifieur Gradient Boosting (utilisant LightGBM) Pour chaque modèle, le script doit : - Utiliser une validation croisée à 5 plis. - Calculer et afficher la moyenne de l'Accuracy, de la Précision, du Rappel et du score F1. - Stocker les résultats dans un DataFrame pandas pour une comparaison facile.
20Optimisation des hyperparamètres avec recherche par grille
de scikit-learn. Ma matrice de fonctionnalités est
21Construire un réseau neuronal simple avec Keras
fonctionnalités. L'architecture du réseau doit être : - Couche d'entrée avec
22Mettre en place un pipeline Scikit-learn
pour un flux de travail d'apprentissage automatique. Le pipeline doit se composer des étapes suivantes : 1. Imputer les valeurs numériques manquantes en utilisant
23Entraîner un modèle de prévision de séries temporelles (ARIMA)
contenant une série temporelle univariée. Générez un script Python utilisant
24Construire un moteur de recommandation avec Surprise
pour construire un modèle simple de recommandation par filtrage collaboratif utilisateur-élément. Supposons que j'aie un DataFrame pandas
25Tracer une matrice de confusion
et les prédictions du modèle sont dans
26Tracer la courbe ROC et calculer l'AUC
En utilisant `y_test` (vraies étiquettes) et `y_pred_proba` (probabilités prédites pour la classe positive de mon classifieur), générez un script Python pour : 1. Calculer le score AUC (Area Under the Curve). 2. Tracer la courbe ROC (Receiver Operating Characteristic). 3. Inclure une ligne diagonale représentant un classifieur aléatoire pour comparaison. 4. Étiqueter le graphique avec le score AUC.
27Expliquer une prédiction avec SHAP
. Je souhaite expliquer une seule prédiction pour une instance spécifique
28Obtenir l'importance globale des fonctionnalités
J'ai un modèle `RandomForestClassifier` entraîné nommé `model`. Mes fonctionnalités ont les noms `[[LIST_OF_FEATURE_NAMES]]`. Générez du code Python pour extraire les importances des fonctionnalités du modèle, les associer à leurs noms, et créer un diagramme à barres horizontal montrant les 15 fonctionnalités les plus importantes.
29Effectuer un test d'importance par permutation
sklearn.inspection.permutation_importance
30Tracer une courbe de calibration
Je souhaite vérifier si les probabilités prédites de mon classifieur binaire sont bien calibrées. J'ai les vraies étiquettes `y_test` et les probabilités prédites `y_pred_proba`. Générez un script Python utilisant `sklearn.calibration.CalibrationDisplay` pour tracer une courbe de calibration pour mon modèle.
31Résumer la performance du modèle pour les dirigeants
[TARGET_VARIABLE, par exemple, le 'taux de désabonnement des employés']
32Décrire une information clé à partir d'un graphique
Ci-dessous se trouve un script Python qui génère un graphique. Après le script, je décrirai le graphique. Votre tâche est de rédiger une interprétation concise, en un paragraphe, de cette information pour un public métier. Évitez le jargon technique. `[[PASTE PYTHON PLOT SCRIPT]]` Le graphique montre un diagramme à barres où les clients de la catégorie de support 'Tier 1' ont une dépense mensuelle moyenne de 150 $, tandis que les clients de la catégorie 'Tier 3' ont une dépense moyenne de 45 $. Maintenant, rédigez le résumé métier.
33Créer une visualisation axée sur le métier
avec les résultats d'un test A/B. Il contient les colonnes
34Rédiger un e-mail de rapport des résultats de test A/B
Agissez comme un analyste de données. Rédigez un e-mail à l'équipe produit rapportant les résultats d'un test A/B pour la nouvelle fonctionnalité « Paiement en un clic ». Principales conclusions : - Taux de conversion du groupe de contrôle : 3,5 % - Taux de conversion du groupe de traitement (avec fonctionnalité) : 4,8 % - Le résultat est statistiquement significatif avec une valeur p de 0,002. - Le test a duré 14 jours avec 50 000 utilisateurs dans chaque groupe. Structurez l'e-mail avec un objet clair, un bref résumé du résultat, les chiffres clés et une recommandation de déployer la fonctionnalité.
35Expliquer simplement un concept technique
Expliquez le concept de « surapprentissage » (overfitting) en apprentissage automatique comme vous le feriez à un directeur commercial. Utilisez une analogie. Gardez l'explication sous 150 mots.
36Générer un fichier README de projet
Générez un modèle markdown pour un fichier README de projet de science des données. Le modèle doit inclure les sections suivantes : - Titre du projet - Problème métier - Source des données - Méthodologie (Nettoyage des données, EDA, Modélisation) - Résultats - Comment exécuter le code (Dépendances, Instructions) - Contacts clés
37Écrire un Dockerfile pour une API Flask
(le fichier du modèle entraîné) Le Dockerfile doit : 1. Partir d'une image de base
38Créer un point de terminaison d'API Flask simple
). Il doit avoir un point de terminaison
39Enregistrer les métriques du modèle avec MLflow
Générez un extrait de script Python qui démontre comment utiliser MLflow pour le suivi d'expériences. Le script doit : 1. Démarrer une exécution MLflow. 2. Enregistrer deux paramètres : `learning_rate` et `n_estimators`. 3. Enregistrer trois métriques : `accuracy`, `precision` et `recall`. 4. Enregistrer le modèle entraîné lui-même comme artefact. 5. Terminer l'exécution.
40Écrire un workflow GitHub Actions pour l'intégration continue
) qui s'exécute à chaque push sur la branche
41Test unitaire pour une fonction de nettoyage de données
def remove_outliers(df, column_name): Q1 = df[[column_name]].quantile(0.25) Q3 = df[[column_name]].quantile(0.75) IQR = Q3 - Q1 lower_bound = Q1 - 1.5 * IQR upper_bound = Q3 + 1.5 * IQR return df[(df[[column_name]] >= lower_bound) & (df[[column_name]] <= upper_bound)]
42Surveiller la dérive des données
, et j'ai un nouveau lot de données de production dans
43Chaîné : Rapport EDA complet à partir d'un CSV
. Tout d'abord, chargez-le dans un DataFrame pandas et exécutez un profilage complet des données. Identifiez les valeurs manquantes, les types de données et les statistiques de base pour chaque colonne. Montrez-moi la sortie. » **Prompt 2 (après la réponse de l'IA) :** « Merci. Sur la base de ce profil, générez un script Python pour gérer le nettoyage des données. Imputez les
44Générer des données synthétiques
: entier, distribué normalement autour d'une moyenne de 40 avec un écart type de 10. -
45Refactoriser un Jupyter Notebook en classe
. La classe doit avoir : - Une méthode
46Convertir un script Python en R
import pandas as pd from sklearn.model_selection import train_test_split from sklearn.ensemble import RandomForestClassifier df = pd.read_csv('data.csv') df = df.dropna() X = df[[['feature1', 'feature2']]] y = df[['target']] X_train, X_test, y_train, y_test = train_test_split(X, y, test_size=0.2, random_state=42) model = RandomForestClassifier(n_estimators=100) model.fit(X_train, y_train) print(model.score(X_test, y_test))
47Expliquer les résultats du modèle avec des contrefactuels
) pour laquelle le modèle a prédit une forte probabilité de désabonnement (0,92). Expliquez cette prédiction en utilisant une explication contrefactuelle. En langage clair, décrivez les changements minimaux apportés aux fonctionnalités de ce client (par exemple,
48SQL : Requête d'analyse de cohorte
. La requête doit calculer le taux de rétention des cohortes de clients mensuelles. La cohorte d'un client est le mois de son premier achat. La rétention pour un mois donné est le pourcentage de clients d'une cohorte qui ont effectué un achat ce mois-là. La sortie doit avoir trois colonnes :
49Créer un tableau de bord interactif avec Plotly
[['date', 'region', 'sales', 'product_category']]
50Écrire un script Dask pour un grand fichier CSV
) qui ne rentre pas dans la mémoire de pandas. La tâche consiste à calculer la moyenne de

Comment utiliser ces prompts pour data science

Quatre étapes, environ une minute. Le prompt apporte la structure, vous apportez les détails.

1

Choisissez le prompt

Chaque prompt a été écrit pour une tâche précise — pas un modèle générique du type « agis comme un expert ». Parcourez les titres et prenez celui qui correspond à votre tâche.

2

Copiez-collez-le

Cliquez sur Copier, puis collez le tout dans ChatGPT, Claude, Gemini ou l’assistant que vous payez déjà. Rien ici n’est lié à un seul modèle.

3

Remplissez les crochets

Remplacez chaque [Élément entre crochets] par vos propres informations avant d’envoyer. C’est de là que vient la qualité : le prompt apporte la structure, vous apportez les détails.

4

Consultez le guide source

Le lien « Source » sous chaque prompt ouvre l’article complet : pourquoi le prompt est construit ainsi, sur quoi il a été testé et avec quels outils il fonctionne.

Questions fréquentes

Les questions que l’on se pose avant de coller un de ces prompts dans un vrai dossier.

Ces prompts IA sont-ils gratuits ?

Oui. Les 50 prompts de cette page sont libres de copie et d’usage avec n’importe quel assistant IA, dont ChatGPT, Claude et Gemini. Il vous suffit d’un compte sur l’un de ces outils.

Comment utiliser ces prompts IA pour data science ?

Copiez le texte complet avec le bouton Copier, collez-le dans votre assistant IA, puis remplacez chaque élément entre crochets — comme [Votre ville] ou [Nom de l’entreprise] — par vos propres informations avant d’envoyer.

D’où viennent ces prompts ?

Chaque prompt est extrait d’un guide de prompts testé par Zekai. Le lien « Source » sous chaque prompt ouvre l’article complet, qui explique le raisonnement et la façon dont il a été testé.

Puis-je modifier ces prompts ?

Faites-le. Traitez chacun comme une structure de départ : resserrez les consignes, ajoutez vos contraintes et gardez la version qui donne le meilleur résultat. Les éléments entre crochets marquent ce qui doit toujours changer.

Bibliothèques de prompts pour d’autres métiers

Même format, autre métier — en commençant par les plus proches de data science.

Voir Zekai en premier dans Google