Copiez-en un directement dans ChatGPT, Claude ou Gemini, puis remplacez les éléments entre crochets par vos propres informations.
50 prompts à copier-coller
1Profil de données complet
Agissez comme un analyste de la qualité des données. Je vous fournis un DataFrame pandas nommé `df`. Son schéma est le suivant : `[[PASTE SCHEMA OR HEAD() OUTPUT HERE]]`. Votre tâche est d'effectuer un profilage complet des données. Pour chaque colonne, fournissez : 1. Le type de données. 2. Le nombre et le pourcentage de valeurs manquantes. 3. Le nombre de valeurs uniques (cardinalité). 4. Pour les colonnes numériques : la moyenne, la médiane, l'écart type, le minimum et le maximum. 5. Pour les colonnes catégorielles : une liste des valeurs uniques et leurs fréquences. 6. Identifiez toutes les colonnes qui semblent être mal typées (par exemple, les dates stockées comme des objets). Présentez la sortie sous forme de tableau markdown.
Générez un script Python qui utilise la méthode de l'intervalle interquartile (IQR) pour identifier les valeurs aberrantes dans les colonnes numériques suivantes d'un DataFrame pandas `df` : `[[LIST_OF_NUMERIC_COLUMNS]]`. Le script doit : 1. Calculer Q1, Q3 et l'IQR pour chaque colonne spécifiée. 2. Définir les bornes supérieure et inférieure (Q1 - 1.5 * IQR, Q3 + 1.5 * IQR). 3. Créer un nouveau DataFrame contenant uniquement les lignes qui ont des valeurs aberrantes dans l'une des colonnes spécifiées. 4. Afficher la forme du DataFrame original et du DataFrame des valeurs aberrantes.
qui prend une chaîne de caractères et effectue les étapes de nettoyage de texte suivantes : 1. Convertit le texte en minuscules. 2. Supprime toute la ponctuation. 3. Supprime les chiffres numériques. 4. Supprime les mots vides (stop words) anglais courants. 5. Réduit les mots restants à leur racine (stemming) en utilisant le Porter Stemmer. La fonction doit renvoyer la chaîne nettoyée. Incluez les importations de
Générez du code Python pour calculer la matrice de corrélation de Pearson pour les colonnes numériques de mon DataFrame pandas `df`. Les colonnes sont : `[[LIST_OF_NUMERIC_COLUMNS]]`. Ensuite, effectuez les opérations suivantes : 1. Créez une carte de chaleur (heatmap) de la matrice de corrélation en utilisant seaborn. Annotez les valeurs sur la carte de chaleur. 2. Identifiez et listez toutes les paires de variables avec un coefficient de corrélation supérieur à 0,7 ou inférieur à -0,7. 3. Pour les 3 paires les plus corrélées, proposez une hypothèse en une phrase expliquant pourquoi elles pourraient être corrélées.
. Générez un script Python qui crée les nouvelles fonctionnalités suivantes à partir de cette colonne : - Année - Mois - Jour de la semaine (sous forme de nombre, 0=Lundi) - Jour de l'année - Semaine de l'année - Un indicateur binaire
Agissez comme un spécialiste AutoML. J'ai un ensemble de données prétraité avec des fonctionnalités `X` et une variable cible binaire `y`. Générez un script Python complet qui entraîne et évalue trois modèles de classification de base différents : 1. Régression logistique 2. Classifieur Random Forest 3. Classifieur Gradient Boosting (utilisant LightGBM) Pour chaque modèle, le script doit : - Utiliser une validation croisée à 5 plis. - Calculer et afficher la moyenne de l'Accuracy, de la Précision, du Rappel et du score F1. - Stocker les résultats dans un DataFrame pandas pour une comparaison facile.
pour un flux de travail d'apprentissage automatique. Le pipeline doit se composer des étapes suivantes : 1. Imputer les valeurs numériques manquantes en utilisant
En utilisant `y_test` (vraies étiquettes) et `y_pred_proba` (probabilités prédites pour la classe positive de mon classifieur), générez un script Python pour : 1. Calculer le score AUC (Area Under the Curve). 2. Tracer la courbe ROC (Receiver Operating Characteristic). 3. Inclure une ligne diagonale représentant un classifieur aléatoire pour comparaison. 4. Étiqueter le graphique avec le score AUC.
28Obtenir l'importance globale des fonctionnalités
J'ai un modèle `RandomForestClassifier` entraîné nommé `model`. Mes fonctionnalités ont les noms `[[LIST_OF_FEATURE_NAMES]]`. Générez du code Python pour extraire les importances des fonctionnalités du modèle, les associer à leurs noms, et créer un diagramme à barres horizontal montrant les 15 fonctionnalités les plus importantes.
Je souhaite vérifier si les probabilités prédites de mon classifieur binaire sont bien calibrées. J'ai les vraies étiquettes `y_test` et les probabilités prédites `y_pred_proba`. Générez un script Python utilisant `sklearn.calibration.CalibrationDisplay` pour tracer une courbe de calibration pour mon modèle.
32Décrire une information clé à partir d'un graphique
Ci-dessous se trouve un script Python qui génère un graphique. Après le script, je décrirai le graphique. Votre tâche est de rédiger une interprétation concise, en un paragraphe, de cette information pour un public métier. Évitez le jargon technique. `[[PASTE PYTHON PLOT SCRIPT]]` Le graphique montre un diagramme à barres où les clients de la catégorie de support 'Tier 1' ont une dépense mensuelle moyenne de 150 $, tandis que les clients de la catégorie 'Tier 3' ont une dépense moyenne de 45 $. Maintenant, rédigez le résumé métier.
34Rédiger un e-mail de rapport des résultats de test A/B
Agissez comme un analyste de données. Rédigez un e-mail à l'équipe produit rapportant les résultats d'un test A/B pour la nouvelle fonctionnalité « Paiement en un clic ». Principales conclusions : - Taux de conversion du groupe de contrôle : 3,5 % - Taux de conversion du groupe de traitement (avec fonctionnalité) : 4,8 % - Le résultat est statistiquement significatif avec une valeur p de 0,002. - Le test a duré 14 jours avec 50 000 utilisateurs dans chaque groupe. Structurez l'e-mail avec un objet clair, un bref résumé du résultat, les chiffres clés et une recommandation de déployer la fonctionnalité.
Expliquez le concept de « surapprentissage » (overfitting) en apprentissage automatique comme vous le feriez à un directeur commercial. Utilisez une analogie. Gardez l'explication sous 150 mots.
Générez un modèle markdown pour un fichier README de projet de science des données. Le modèle doit inclure les sections suivantes : - Titre du projet - Problème métier - Source des données - Méthodologie (Nettoyage des données, EDA, Modélisation) - Résultats - Comment exécuter le code (Dépendances, Instructions) - Contacts clés
Générez un extrait de script Python qui démontre comment utiliser MLflow pour le suivi d'expériences. Le script doit : 1. Démarrer une exécution MLflow. 2. Enregistrer deux paramètres : `learning_rate` et `n_estimators`. 3. Enregistrer trois métriques : `accuracy`, `precision` et `recall`. 4. Enregistrer le modèle entraîné lui-même comme artefact. 5. Terminer l'exécution.
. Tout d'abord, chargez-le dans un DataFrame pandas et exécutez un profilage complet des données. Identifiez les valeurs manquantes, les types de données et les statistiques de base pour chaque colonne. Montrez-moi la sortie. » **Prompt 2 (après la réponse de l'IA) :** « Merci. Sur la base de ce profil, générez un script Python pour gérer le nettoyage des données. Imputez les
47Expliquer les résultats du modèle avec des contrefactuels
) pour laquelle le modèle a prédit une forte probabilité de désabonnement (0,92). Expliquez cette prédiction en utilisant une explication contrefactuelle. En langage clair, décrivez les changements minimaux apportés aux fonctionnalités de ce client (par exemple,
. La requête doit calculer le taux de rétention des cohortes de clients mensuelles. La cohorte d'un client est le mois de son premier achat. La rétention pour un mois donné est le pourcentage de clients d'une cohorte qui ont effectué un achat ce mois-là. La sortie doit avoir trois colonnes :
Quatre étapes, environ une minute. Le prompt apporte la structure, vous apportez les détails.
1
Choisissez le prompt
Chaque prompt a été écrit pour une tâche précise — pas un modèle générique du type « agis comme un expert ». Parcourez les titres et prenez celui qui correspond à votre tâche.
2
Copiez-collez-le
Cliquez sur Copier, puis collez le tout dans ChatGPT, Claude, Gemini ou l’assistant que vous payez déjà. Rien ici n’est lié à un seul modèle.
3
Remplissez les crochets
Remplacez chaque [Élément entre crochets] par vos propres informations avant d’envoyer. C’est de là que vient la qualité : le prompt apporte la structure, vous apportez les détails.
4
Consultez le guide source
Le lien « Source » sous chaque prompt ouvre l’article complet : pourquoi le prompt est construit ainsi, sur quoi il a été testé et avec quels outils il fonctionne.
Questions fréquentes
Les questions que l’on se pose avant de coller un de ces prompts dans un vrai dossier.
Ces prompts IA sont-ils gratuits ?
Oui. Les 50 prompts de cette page sont libres de copie et d’usage avec n’importe quel assistant IA, dont ChatGPT, Claude et Gemini. Il vous suffit d’un compte sur l’un de ces outils.
Comment utiliser ces prompts IA pour data science ?
Copiez le texte complet avec le bouton Copier, collez-le dans votre assistant IA, puis remplacez chaque élément entre crochets — comme [Votre ville] ou [Nom de l’entreprise] — par vos propres informations avant d’envoyer.
D’où viennent ces prompts ?
Chaque prompt est extrait d’un guide de prompts testé par Zekai. Le lien « Source » sous chaque prompt ouvre l’article complet, qui explique le raisonnement et la façon dont il a été testé.
Puis-je modifier ces prompts ?
Faites-le. Traitez chacun comme une structure de départ : resserrez les consignes, ajoutez vos contraintes et gardez la version qui donne le meilleur résultat. Les éléments entre crochets marquent ce qui doit toujours changer.
Bibliothèques de prompts pour d’autres métiers
Même format, autre métier — en commençant par les plus proches de data science.