The short answer
Les meilleurs prompts IA pour les data scientists spécifient la tâche, le contexte et le format de sortie souhaité afin de générer du code et des analyses utilisables, et non des conseils vagues. Des prompts efficaces fournissent à l’IA le contexte métier, la structure des données et des instructions explicites pour des tâches telles que le nettoyage des données, l’analyse exploratoire des données, l’ingénierie des fonctionnalités et l’interprétation des modèles.
Les prompts génériques comme « analysez ces données » font perdre du temps. La valeur d’un data scientist réside dans la formulation d’un problème et la validation des résultats, mais l’IA générative peut considérablement accélérer les étapes mécaniques intermédiaires – si vous lui donnez les bonnes instructions. Les requêtes vagues produisent du code générique, souvent incorrect. Des prompts spécifiques et riches en contexte produisent des scripts fonctionnels, des analyses perspicaces et des visualisations claires.
Ce guide propose 50 prompts testés sur le terrain, organisés selon le flux de travail de la science des données. Nous les avons conçus pour être copiés, collés et personnalisés pour vos ensembles de données et problèmes spécifiques. ZEKAI examine les outils et les flux de travail de manière indépendante ; notre objectif est de fournir des ressources pratiques aux professionnels du domaine de l’IA et de la science des données. Ces prompts fonctionnent mieux dans les assistants IA conversationnels avancés ou les notebooks conçus pour l’analyse de données, tels que Julius AI, mais peuvent être adaptés à tout grand modèle linguistique (LLM) puissant.
% de la productivité globale Source: stlouisfed.org
Les gains de temps autodéclarés grâce à l’IA générative se traduisent par une augmentation de 1,1 % de la productivité globale du travail, les travailleurs des professions informatiques et mathématiques signalant les gains de temps les plus élevés.
Pourquoi les prompts IA génériques échouent pour les data scientists
La plupart des guides de prompts IA proposent des modèles simples avec une seule {variable}. Cette approche échoue en science des données car le contexte est aussi important que la commande. Un prompt efficace pour un data scientist agit comme un cahier des charges pour un analyste junior. Il doit inclure :
- Jeu de rôle : Demandez à l’IA d’agir comme une persona spécifique (par exemple, « Agissez comme un data scientist senior spécialisé dans la prévision de séries temporelles »).
- Contexte : Expliquez l’objectif métier. Cherchez-vous à réduire le taux de désabonnement des clients, à prévoir les stocks ou à détecter la fraude ?
- Schéma des données : Fournissez les noms de colonnes, les types de données et des exemples de valeurs.
- Instructions explicites : Détaillez les étapes exactes à suivre (par exemple, « imputer les valeurs manquantes dans la colonne ‘âge’ en utilisant la médiane »).
- Format de sortie : Spécifiez le format de sortie souhaité : un script Python, un DataFrame pandas, une visualisation Matplotlib, un objet JSON ou un résumé en langage clair.
Sans ce niveau de détail, l’IA ne fait que deviner. Elle ne sait pas que user_id est une clé primaire, que revenue est en cents, ou que les données sont asymétriques. La spécificité est la différence entre un script fonctionnel et une hallucination frustrante.
Prompts pour le nettoyage et le prétraitement des données
La préparation des données consomme souvent la majeure partie du temps d’un projet. Ces prompts accélèrent l’identification et la correction des problèmes courants de qualité des données.
Agissez comme un analyste de la qualité des données. Je vous fournis un DataFrame pandas nommé `df`. Son schéma est le suivant : `[PASTE SCHEMA OR HEAD() OUTPUT HERE]`.
Votre tâche est d'effectuer un profilage complet des données. Pour chaque colonne, fournissez :
1. Le type de données.
2. Le nombre et le pourcentage de valeurs manquantes.
3. Le nombre de valeurs uniques (cardinalité).
4. Pour les colonnes numériques : la moyenne, la médiane, l'écart type, le minimum et le maximum.
5. Pour les colonnes catégorielles : une liste des valeurs uniques et leurs fréquences.
6. Identifiez toutes les colonnes qui semblent être mal typées (par exemple, les dates stockées comme des objets).
Présentez la sortie sous forme de tableau markdown.
contient des valeurs manquantes. Voici la sortie de
Générez un script Python qui utilise la méthode de l'intervalle interquartile (IQR) pour identifier les valeurs aberrantes dans les colonnes numériques suivantes d'un DataFrame pandas `df` : `[LIST_OF_NUMERIC_COLUMNS]`.
Le script doit :
1. Calculer Q1, Q3 et l'IQR pour chaque colonne spécifiée.
2. Définir les bornes supérieure et inférieure (Q1 - 1.5 * IQR, Q3 + 1.5 * IQR).
3. Créer un nouveau DataFrame contenant uniquement les lignes qui ont des valeurs aberrantes dans l'une des colonnes spécifiées.
4. Afficher la forme du DataFrame original et du DataFrame des valeurs aberrantes.
. Les colonnes suivantes nécessitent une correction de leur type de données :
-
. Je souhaite vérifier les doublons en me basant sur un sous-ensemble de colonnes :
qui prend une chaîne de caractères et effectue les étapes de nettoyage de texte suivantes :
1. Convertit le texte en minuscules.
2. Supprime toute la ponctuation.
3. Supprime les chiffres numériques.
4. Supprime les mots vides (stop words) anglais courants.
5. Réduit les mots restants à leur racine (stemming) en utilisant le Porter Stemmer.
La fonction doit renvoyer la chaîne nettoyée. Incluez les importations de
Prompts pour l’analyse exploratoire des données (EDA)
Une fois les données nettoyées, l’EDA aide à découvrir des modèles, à tester des hypothèses et à guider l’ingénierie des fonctionnalités.
organisations Source: mckinsey.com
Début 2024, 65 % des organisations ont déclaré utiliser régulièrement l’IA générative, soit près du double par rapport à l’année précédente, signalant un changement majeur de l’expérimentation à l’intégration.
, générez un ensemble de graphiques Python pour l'analyse univariée.
Pour chaque colonne numérique dans
Générez du code Python pour calculer la matrice de corrélation de Pearson pour les colonnes numériques de mon DataFrame pandas `df`. Les colonnes sont : `[LIST_OF_NUMERIC_COLUMNS]`.
Ensuite, effectuez les opérations suivantes :
1. Créez une carte de chaleur (heatmap) de la matrice de corrélation en utilisant seaborn. Annotez les valeurs sur la carte de chaleur.
2. Identifiez et listez toutes les paires de variables avec un coefficient de corrélation supérieur à 0,7 ou inférieur à -0,7.
3. Pour les 3 paires les plus corrélées, proposez une hypothèse en une phrase expliquant pourquoi elles pourraient être corrélées.
.
Pour chaque variable numérique, générez un diagramme en boîte qui compare sa distribution à travers les différentes catégories de
avec un index datetime et une colonne nommée
.
Générez un script Python qui :
1. Standardise ces deux colonnes en utilisant
avec des colonnes de latitude et longitude nommées
Prompts pour l’ingénierie des fonctionnalités
La création des bonnes fonctionnalités est souvent la clé de la performance d’un modèle. L’IA peut aider à brainstormer et à implémenter des idées de fonctionnalités.
[TARGET_VARIABLE, par exemple, la 'valeur vie client']
. Générez un script Python qui crée les nouvelles fonctionnalités suivantes à partir de cette colonne :
- Année
- Mois
- Jour de la semaine (sous forme de nombre, 0=Lundi)
- Jour de l'année
- Semaine de l'année
- Un indicateur binaire
a les fonctionnalités numériques suivantes :
pour encoder en one-hot les colonnes catégorielles suivantes dans mon DataFrame
. Générez du code Python pour créer une nouvelle colonne
est indexé par date et a une colonne cible
Prompts pour la sélection et la construction de modèles
L’IA peut écrire le code passe-partout pour entraîner et évaluer plusieurs modèles, vous permettant de vous concentrer sur l’interprétation des résultats.
Agissez comme un spécialiste AutoML. J'ai un ensemble de données prétraité avec des fonctionnalités `X` et une variable cible binaire `y`. Générez un script Python complet qui entraîne et évalue trois modèles de classification de base différents :
1. Régression logistique
2. Classifieur Random Forest
3. Classifieur Gradient Boosting (utilisant LightGBM)
Pour chaque modèle, le script doit :
- Utiliser une validation croisée à 5 plis.
- Calculer et afficher la moyenne de l'Accuracy, de la Précision, du Rappel et du score F1.
- Stocker les résultats dans un DataFrame pandas pour une comparaison facile.
de scikit-learn.
Ma matrice de fonctionnalités est
fonctionnalités.
L'architecture du réseau doit être :
- Couche d'entrée avec
pour un flux de travail d'apprentissage automatique. Le pipeline doit se composer des étapes suivantes :
1. Imputer les valeurs numériques manquantes en utilisant
contenant une série temporelle univariée. Générez un script Python utilisant
pour construire un modèle simple de recommandation par filtrage collaboratif utilisateur-élément.
Supposons que j'aie un DataFrame pandas
Prompts pour l’évaluation et l’interprétation des modèles
Un modèle est inutile si vous ne pouvez pas expliquer ses performances et ses prédictions.
et les prédictions du modèle sont dans
En utilisant `y_test` (vraies étiquettes) et `y_pred_proba` (probabilités prédites pour la classe positive de mon classifieur), générez un script Python pour :
1. Calculer le score AUC (Area Under the Curve).
2. Tracer la courbe ROC (Receiver Operating Characteristic).
3. Inclure une ligne diagonale représentant un classifieur aléatoire pour comparaison.
4. Étiqueter le graphique avec le score AUC.
. Je souhaite expliquer une seule prédiction pour une instance spécifique
J'ai un modèle `RandomForestClassifier` entraîné nommé `model`. Mes fonctionnalités ont les noms `[LIST_OF_FEATURE_NAMES]`. Générez du code Python pour extraire les importances des fonctionnalités du modèle, les associer à leurs noms, et créer un diagramme à barres horizontal montrant les 15 fonctionnalités les plus importantes.
sklearn.inspection.permutation_importance
Je souhaite vérifier si les probabilités prédites de mon classifieur binaire sont bien calibrées. J'ai les vraies étiquettes `y_test` et les probabilités prédites `y_pred_proba`. Générez un script Python utilisant `sklearn.calibration.CalibrationDisplay` pour tracer une courbe de calibration pour mon modèle.
Prompts pour expliquer les résultats et le reporting
Communiquer les découvertes aux parties prenantes non techniques est une compétence essentielle. L’IA peut aider à rédiger des résumés et à créer des visualisations adaptées aux besoins métier.
[TARGET_VARIABLE, par exemple, le 'taux de désabonnement des employés']
Ci-dessous se trouve un script Python qui génère un graphique. Après le script, je décrirai le graphique. Votre tâche est de rédiger une interprétation concise, en un paragraphe, de cette information pour un public métier. Évitez le jargon technique.
`[PASTE PYTHON PLOT SCRIPT]`
Le graphique montre un diagramme à barres où les clients de la catégorie de support 'Tier 1' ont une dépense mensuelle moyenne de 150 $, tandis que les clients de la catégorie 'Tier 3' ont une dépense moyenne de 45 $.
Maintenant, rédigez le résumé métier.
avec les résultats d'un test A/B. Il contient les colonnes
Agissez comme un analyste de données. Rédigez un e-mail à l'équipe produit rapportant les résultats d'un test A/B pour la nouvelle fonctionnalité « Paiement en un clic ».
Principales conclusions :
- Taux de conversion du groupe de contrôle : 3,5 %
- Taux de conversion du groupe de traitement (avec fonctionnalité) : 4,8 %
- Le résultat est statistiquement significatif avec une valeur p de 0,002.
- Le test a duré 14 jours avec 50 000 utilisateurs dans chaque groupe.
Structurez l'e-mail avec un objet clair, un bref résumé du résultat, les chiffres clés et une recommandation de déployer la fonctionnalité.
Expliquez le concept de « surapprentissage » (overfitting) en apprentissage automatique comme vous le feriez à un directeur commercial. Utilisez une analogie. Gardez l'explication sous 150 mots.
Générez un modèle markdown pour un fichier README de projet de science des données. Le modèle doit inclure les sections suivantes :
- Titre du projet
- Problème métier
- Source des données
- Méthodologie (Nettoyage des données, EDA, Modélisation)
- Résultats
- Comment exécuter le code (Dépendances, Instructions)
- Contacts clés
Prompts pour le MLOps et la production
L’IA peut aider avec les tâches d’ingénierie nécessaires au déploiement et à la surveillance des modèles. C’est là que des plateformes comme Azure Machine Learning excellent, mais les prompts IA peuvent scripter de nombreux composants.
(le fichier du modèle entraîné)
Le Dockerfile doit :
1. Partir d'une image de base
). Il doit avoir un point de terminaison
Générez un extrait de script Python qui démontre comment utiliser MLflow pour le suivi d'expériences. Le script doit :
1. Démarrer une exécution MLflow.
2. Enregistrer deux paramètres : `learning_rate` et `n_estimators`.
3. Enregistrer trois métriques : `accuracy`, `precision` et `recall`.
4. Enregistrer le modèle entraîné lui-même comme artefact.
5. Terminer l'exécution.
) qui s'exécute à chaque push sur la branche
def remove_outliers(df, column_name):
Q1 = df[column_name].quantile(0.25)
Q3 = df[column_name].quantile(0.75)
IQR = Q3 - Q1
lower_bound = Q1 - 1.5 * IQR
upper_bound = Q3 + 1.5 * IQR
return df[(df[column_name] >= lower_bound) & (df[column_name] <= upper_bound)]
, et j'ai un nouveau lot de données de production dans
Prompts avancés et chaînés
Combinez les prompts pour exécuter un flux de travail en plusieurs étapes. C’est là que l’IA passe d’un simple générateur de code à un partenaire analytique.
. Tout d'abord, chargez-le dans un DataFrame pandas et exécutez un profilage complet des données. Identifiez les valeurs manquantes, les types de données et les statistiques de base pour chaque colonne. Montrez-moi la sortie. »
**Prompt 2 (après la réponse de l'IA) :** « Merci. Sur la base de ce profil, générez un script Python pour gérer le nettoyage des données. Imputez les
: entier, distribué normalement autour d'une moyenne de 40 avec un écart type de 10.
-
.
La classe doit avoir :
- Une méthode
import pandas as pd
from sklearn.model_selection import train_test_split
from sklearn.ensemble import RandomForestClassifier
df = pd.read_csv('data.csv')
df = df.dropna()
X = df[['feature1', 'feature2']]
y = df['target']
X_train, X_test, y_train, y_test = train_test_split(X, y, test_size=0.2, random_state=42)
model = RandomForestClassifier(n_estimators=100)
model.fit(X_train, y_train)
print(model.score(X_test, y_test))
) pour laquelle le modèle a prédit une forte probabilité de désabonnement (0,92).
Expliquez cette prédiction en utilisant une explication contrefactuelle. En langage clair, décrivez les changements minimaux apportés aux fonctionnalités de ce client (par exemple,
.
La requête doit calculer le taux de rétention des cohortes de clients mensuelles. La cohorte d'un client est le mois de son premier achat. La rétention pour un mois donné est le pourcentage de clients d'une cohorte qui ont effectué un achat ce mois-là.
La sortie doit avoir trois colonnes :
['date', 'region', 'sales', 'product_category']
) qui ne rentre pas dans la mémoire de pandas. La tâche consiste à calculer la moyenne de
Et ensuite
Trois pistes, choisies selon ce que vous venez de lire.
Comment rédiger un bon prompt IA pour l’analyse de données ?
R: Un bon prompt fournit un contexte clair. Il doit indiquer à l’IA la persona à adopter (par exemple, « agissez comme un analyste de données »), définir l’objectif métier, fournir le schéma des données (noms et types de colonnes), donner des instructions explicites étape par étape et spécifier le format de sortie exact dont vous avez besoin (par exemple, code Python, tableau markdown, JSON).
ChatGPT peut-il être utilisé pour la science des données ?
R: Oui, ChatGPT et d’autres grands modèles linguistiques sont de puissants assistants pour la science des données. Ils excellent dans la génération de code passe-partout pour le nettoyage et l’analyse, le débogage de scripts, l’explication de concepts complexes, la rédaction de rapports et la traduction de code entre des langages comme Python et R. Cependant, ce sont des outils qui nécessitent une supervision humaine pour garantir la validité et l’exactitude des résultats.
Quels sont les meilleurs prompts IA pour le nettoyage des données ?
R: Les meilleurs prompts pour le nettoyage des données sont très spécifiques. Au lieu de « nettoyer les données », utilisez des prompts comme : « Générez un script Python pour imputer les valeurs manquantes dans la colonne ‘âge’ avec la médiane », ou « Écrivez du code pour supprimer les symboles monétaires et les virgules de la colonne ‘prix’ et la convertir en flottant. »
Comment l’IA peut-elle aider à l’analyse exploratoire des données (EDA) ?
R: L’IA peut accélérer rapidement l’EDA en générant du code pour les visualisations. Vous pouvez lui demander de créer une grille d’histogrammes pour toutes les colonnes numériques, une carte de chaleur de corrélation pour repérer les relations, ou des diagrammes en boîte pour comparer les distributions entre les catégories. Cela automatise la partie la plus chronophage de l’EDA, vous permettant de vous concentrer sur l’interprétation des modèles.
L’IA remplacera-t-elle les data scientists ?
R: Non, l’IA ne devrait pas remplacer les data scientists, mais elle modifie le rôle. L’IA automatise les tâches répétitives comme l’écriture de code passe-partout et le profilage initial des données, libérant ainsi les scientifiques pour se concentrer sur des travaux à plus forte valeur ajoutée : la formulation de problèmes, la conception expérimentale, l’interprétation de résultats complexes et la communication d’informations aux parties prenantes. Le métier évolue vers une supervision plus stratégique et moins de codage manuel.
Et ensuite
Trois pistes, choisies selon ce que vous venez de lire.
Sources (16)
- Goldman Sachs. (2023, April 5). *Generative AI could raise global GDP by 7%*.
- Goldman Sachs. (2024, May 13). *AI is showing « very positive » signs of eventually boosting GDP and productivity*.
- Goldman Sachs. (2025, August 13). *How Will AI Affect the Global Workforce?*.
- Goldman Sachs. (2025, July 3). *AI Agents to Boost Productivity and Size of Software Market*.
- Dataversity. (2024, May 1). *The Impact of Generative AI on Data Science*.
- Goldman Sachs. (2023, November 7). *AI may start to boost US GDP in 2027*.
- 365 Data Science. (2026, April 23). *Data Scientist Job Outlook 2026: Trends, Salaries, and Skills*.
- Pragmatic Institute. *AI Prompts for Data Scientists*.
- CASRAI. (2026, August 25). *Julius AI for Research Data: A Careful Guide*.
- McKinsey & Company. (2026, August 25). *The State of AI: Global Survey 2026*.
- McKinsey & Company. (2021, December 8). *Global survey: The state of AI in 2021*.
- Medium. (2024, July 17). *Top 20+ Generative AI Prompts for Data Scientists and Analysts*.
- McKinsey & Company. (2024, July 22). *What Businesses Can Learn from McKinsey’s 2024 Global Survey on AI Adoption*.
- Reddit. (2025, December 12). *Should I pursue Data Science in 2026, or is the field at risk because of AI?*.
- Federal Reserve Bank of St. Louis. (2025, February 27). *The Impact of Generative AI on Work Productivity*.
- McKinsey & Company. (2024, May 30). *The state of AI in early 2024: Gen AI adoption spikes and starts to generate value*.
Voir Zekai en premier dans Google
Le briefing IA hebdo pour votre métier
Un e-mail par semaine : les changements IA qui touchent vraiment votre métier — outils, offres, et quoi en faire.

