Herramientas de IA puntuadas para tu trabajo
Aprende IA en 30 días

📈 Tecnología e ingeniería

Prompts de IA para Ciencia de Datos

50 prompts de IA para copiar y pegar para ciencia de datos, extraídos de 1 guías Zekai probadas. Gratis, sin registro, y cada uno enlaza al artículo que lo explica. Consulta el hub ciencia de datos para ver las herramientas con las que están pensados estos prompts.

  • 50prompts
  • 1guía de origen
  • 100%gratis · sin registro

Los 50 prompts

Copia cualquiera directamente en ChatGPT, Claude o Gemini y cambia los marcadores entre corchetes por tus propios datos.

50 prompts para copiar
1Perfil Completo de Datos
Actúa como analista de calidad de datos. Le proporciono un DataFrame de pandas llamado `df`. Su esquema es el siguiente: `[[PEGAR ESQUEMA O SALIDA DE HEAD() AQUÍ]]`. Su tarea es realizar un perfilado completo de los datos. Para cada columna, proporcione: 1. Tipo de dato. 2. Número y porcentaje de valores faltantes. 3. Número de valores únicos (cardinalidad). 4. Para columnas numéricas: media, mediana, desviación estándar, mínimo y máximo. 5. Para columnas categóricas: una lista de valores únicos y sus frecuencias. 6. Identifique cualquier columna que parezca tener un tipo incorrecto (p. ej., fechas almacenadas como objetos). Presente la salida como una tabla markdown.
2Plan de Imputación de Valores Faltantes
tiene valores faltantes. Aquí está la salida de
3Script de Detección de Valores Atípicos
Genere un script de Python que utilice el método del Rango Intercuartílico (IQR) para identificar valores atípicos en las siguientes columnas numéricas de un DataFrame de pandas `df`: `[[LIST_OF_NUMERIC_COLUMNS]]`. El script debe: 1. Calcular Q1, Q3 e IQR para cada columna especificada. 2. Definir los límites superior e inferior (Q1 - 1.5 * IQR, Q3 + 1.5 * IQR). 3. Crear un nuevo DataFrame que contenga solo las filas que tienen valores atípicos en cualquiera de las columnas especificadas. 4. Imprimir la forma del DataFrame original y del DataFrame de valores atípicos.
4Script de Conversión de Tipos de Datos
. Las siguientes columnas necesitan que se corrijan sus tipos de datos: -
5Identificación de Registros Duplicados
. Quiero verificar duplicados basándome en un subconjunto de columnas:
6Función de Normalización de Texto
que tome una cadena de texto y realice los siguientes pasos de limpieza de texto: 1. Convierte el texto a minúsculas. 2. Elimina toda la puntuación. 3. Elimina los dígitos numéricos. 4. Elimina las palabras vacías (stop words) comunes en inglés. 5. Realiza el stemming de las palabras restantes usando el Porter Stemmer. La función debe devolver la cadena de texto limpia. Incluya importaciones de
7Generar Gráficos de Análisis Univariado
, genere un conjunto de gráficos de Python para análisis univariado. Para cada columna numérica en
8Matriz de Correlación e Interpretación
Genere código Python para calcular la matriz de correlación de Pearson para las columnas numéricas en mi DataFrame de pandas `df`. Las columnas son: `[[LIST_OF_NUMERIC_COLUMNS]]`. Luego, haga lo siguiente: 1. Cree un mapa de calor de la matriz de correlación usando seaborn. Anote los valores en el mapa de calor. 2. Identifique y liste todos los pares de variables con un coeficiente de correlación mayor que 0.7 o menor que -0.7. 3. Para los 3 pares más correlacionados, proporcione una hipótesis de una frase sobre por qué podrían estar correlacionados.
9Análisis Bivariado: Numérico vs. Categórico
. Para cada variable numérica, genere un diagrama de caja que compare su distribución entre las diferentes categorías de
10Descomposición de Series Temporales
con un índice datetime y una columna llamada
11Segmentación de Clientes con K-Means
. Genere un script de Python que: 1. Estandarice estas dos columnas usando
12Visualización de Datos Geoespaciales
con columnas de latitud y longitud llamadas
13Generar Ideas de Características
[[INDUSTRIA, p. ej., comercio electrónico]]
14Crear Características Basadas en el Tiempo
. Genere un script de Python que cree las siguientes nuevas características a partir de esta columna: - Año - Mes - Día de la semana (como número, 0=Lunes) - Día del año - Semana del año - Un indicador binario
15Generar Características de Interacción
tiene las siguientes características numéricas:
16Codificar Características Categóricas con One-Hot
para codificar con one-hot las siguientes columnas categóricas en mi DataFrame
17Agrupar Características Numéricas en Bins
. Genere código Python para crear una nueva columna
18Crear Características de Retraso para Series Temporales
está indexado por fecha y tiene una columna objetivo
19Comparar Modelos de Clasificación Base
Actúa como especialista en AutoML. Tengo un conjunto de datos preprocesado con características `X` y una variable objetivo binaria `y`. Genere un script de Python completo que entrene y evalúe tres modelos de clasificación base diferentes: 1. Regresión Logística 2. Clasificador Random Forest 3. Clasificador Gradient Boosting (usando LightGBM) Para cada modelo, el script debe: - Usar validación cruzada de 5 pliegues. - Calcular e imprimir la media de Exactitud, Precisión, Recall y F1-score. - Almacenar los resultados en un DataFrame de pandas para facilitar la comparación.
20Ajuste de Hiperparámetros con Búsqueda en Cuadrícula
de scikit-learn. Mi matriz de características es
21Construir una Red Neuronal Simple con Keras
características. La arquitectura de la red debe ser: - Capa de entrada con
22Configurar un Pipeline de Scikit-learn
para un flujo de trabajo de aprendizaje automático. El pipeline debe constar de los siguientes pasos: 1. Imputar valores numéricos faltantes usando
23Entrenar un Modelo de Pronóstico de Series Temporales (ARIMA)
que contiene una serie temporal univariada. Genere un script de Python usando
24Construir un Motor de Recomendación con Surprise
para construir un modelo simple de recomendación de filtrado colaborativo usuario-ítem. Asuma que tengo un DataFrame de pandas
25Graficar una Matriz de Confusión
y las predicciones del modelo están en
26Graficar Curva ROC y Calcular AUC
Usando `y_test` (etiquetas verdaderas) y `y_pred_proba` (probabilidades predichas para la clase positiva de mi clasificador), genere un script de Python para: 1. Calcular la puntuación AUC (Área Bajo la Curva). 2. Graficar la curva ROC (Receiver Operating Characteristic). 3. Incluir una línea diagonal que represente un clasificador aleatorio para comparación. 4. Etiquetar el gráfico con la puntuación AUC.
27Explicar una Predicción con SHAP
. Quiero explicar una única predicción para una instancia específica
28Obtener Importancia Global de Características
. Mis características tienen los nombres
29Realizar una Prueba de Importancia por Permutación
sklearn.inspection.permutation_importance
30Graficar una Curva de Calibración
Quiero verificar si las probabilidades predichas de mi clasificador binario están bien calibradas. Tengo las etiquetas verdaderas `y_test` y las probabilidades predichas `y_pred_proba`. Genere un script de Python usando `sklearn.calibration.CalibrationDisplay` para graficar una curva de calibración para mi modelo.
31Resumir el Rendimiento del Modelo para Ejecutivos
[[VARIABLE_OBJETIVO, p. ej., 'rotación de empleados']]
32Describir una Conclusión Clave de un Gráfico
A continuación se muestra un script de Python que genera un gráfico. Después del script, describiré el gráfico. Su tarea es escribir una interpretación concisa, de un párrafo, de esta conclusión para una audiencia de negocios. Evite la jerga técnica. `[[PASTE PYTHON PLOT SCRIPT]]` El gráfico muestra un diagrama de barras donde los clientes en la categoría de soporte 'Tier 1' tienen un gasto mensual promedio de $150, mientras que los clientes en la categoría 'Tier 3' tienen un gasto promedio de $45. Ahora, escriba el resumen de negocio.
33Crear una Visualización Orientada al Negocio
con los resultados de una prueba A/B. Tiene columnas
34Redactar un Correo Electrónico Informando Resultados de Prueba A/B
Actúa como analista de datos. Redacte un correo electrónico al equipo de producto informando los resultados de una prueba A/B para la nueva característica "Compra con Un Clic". Hallazgos clave: - Tasa de conversión del grupo de control: 3.5% - Tasa de conversión del grupo de tratamiento (con la característica): 4.8% - El resultado es estadísticamente significativo con un valor p de 0.002. - La prueba se ejecutó durante 14 días con 50,000 usuarios en cada grupo. Estructure el correo electrónico con un asunto claro, un breve resumen del resultado, los números clave y una recomendación para implementar la característica.
35Explicar un Concepto Técnico de Forma Sencilla
Explique el concepto de "sobreajuste" en aprendizaje automático como lo haría a un director de ventas. Use una analogía. Mantenga la explicación por debajo de las 150 palabras.
36Generar un README de Proyecto
Genere una plantilla markdown para un archivo README de un proyecto de ciencia de datos. La plantilla debe incluir las siguientes secciones: - Título del Proyecto - Problema de Negocio - Fuente de Datos - Metodología (Limpieza de Datos, EDA, Modelado) - Resultados - Cómo Ejecutar el Código (Dependencias, Instrucciones) - Contactos Clave
37Escribir un Dockerfile para una API Flask
(el archivo del modelo entrenado) El Dockerfile debe: 1. Comenzar desde una imagen base
38Crear un Endpoint Simple de API Flask
que acepte solicitudes POST con una carga JSON. El script debe: 1. Cargar un modelo scikit-learn preentrenado desde un archivo llamado
39Registrar Métricas del Modelo con MLflow
Genere un fragmento de script de Python que demuestre cómo usar MLflow para el seguimiento de experimentos. El script debe: 1. Iniciar una ejecución de MLflow. 2. Registrar dos parámetros: `learning_rate` y `n_estimators`. 3. Registrar tres métricas: `accuracy`, `precision` y `recall`. 4. Registrar el modelo entrenado como un artefacto. 5. Finalizar la ejecución.
40Escribir un Flujo de Trabajo de GitHub Actions para CI
) que se ejecute en cada push a la rama
41Prueba Unitaria para una Función de Limpieza de Datos
def remove_outliers(df, column_name): Q1 = df[[column_name]].quantile(0.25) Q3 = df[[column_name]].quantile(0.75) IQR = Q3 - Q1 lower_bound = Q1 - 1.5 * IQR upper_bound = Q3 + 1.5 * IQR return df[(df[[column_name]] >= lower_bound) & (df[[column_name]] <= upper_bound)]
42Monitorear la Deriva de Datos
, y tengo un nuevo lote de datos de producción en
43Encadenado: Informe Completo de EDA desde un CSV
. Primero, cárguelo en un DataFrame de pandas y ejecute un perfil completo de datos. Identifique valores faltantes, tipos de datos y estadísticas básicas para cada columna. Muéstreme la salida." **Prompt 2 (después de que la IA responda):** "Gracias. Basándose en ese perfil, genere un script de Python para manejar la limpieza de datos. Impute los valores faltantes de
44Generar Datos Sintéticos
: entero, distribuido normalmente alrededor de una media de 40 con una desviación estándar de 10. -
45Refactorizar un Jupyter Notebook en una Clase
que tome los hiperparámetros del modelo. - Un método
46Convertir Script de Python a R
import pandas as pd from sklearn.model_selection import train_test_split from sklearn.ensemble import RandomForestClassifier df = pd.read_csv('data.csv') df = df.dropna() X = df[[['feature1', 'feature2']]] y = df[['target']] X_train, X_test, y_train, y_test = train_test_split(X, y, test_size=0.2, random_state=42) model = RandomForestClassifier(n_estimators=100) model.fit(X_train, y_train) print(model.score(X_test, y_test))
47Explicar Resultados del Modelo con Contrafactuales
) y una instancia de cliente específica (
48SQL: Consulta de Análisis de Cohortes
. La consulta debe calcular la tasa de retención de cohortes mensuales de clientes. La cohorte de un cliente es el mes de su primera compra. La retención para un mes dado es el porcentaje de clientes de una cohorte que realizaron una compra en ese mes. La salida debe tener tres columnas:
49Crear un Dashboard Interactivo con Plotly
[['date', 'region', 'sales', 'product_category']]
50Escribir un script Dask para un CSV grande
) que no cabe en la memoria de pandas. La tarea es calcular la media de

Cómo usar estos prompts para ciencia de datos

Cuatro pasos, cerca de un minuto. El prompt aporta la estructura; tú aportas los detalles.

1

Elige el prompt

Cada prompt se escribió para una tarea concreta, no como plantilla genérica del tipo «actúa como un experto». Repasa los títulos y coge el que encaje con lo que tienes delante.

2

Cópialo y pégalo

Pulsa Copiar y pega todo en ChatGPT, Claude, Gemini o el asistente que ya pagues. Nada aquí depende de un solo modelo.

3

Rellena los corchetes

Sustituye cada [Marcador entre corchetes] por tus propios datos antes de enviarlo. De ahí sale la calidad: el prompt aporta la estructura, tú aportas los detalles.

4

Consulta la guía

El enlace «Origen» bajo cada prompt abre el artículo completo: por qué está construido así, contra qué se probó y con qué herramientas encaja.

Preguntas frecuentes

Las preguntas que surgen antes de pegar uno de estos prompts en un trabajo real.

¿Se pueden usar gratis estos prompts?

Sí. Los 50 prompts de esta página se pueden copiar y usar con cualquier asistente de IA, incluidos ChatGPT, Claude y Gemini. Solo necesitas una cuenta en una de esas herramientas.

¿Cómo uso estos prompts de IA para ciencia de datos?

Copia el texto completo con el botón Copiar, pégalo en tu asistente de IA y sustituye cada marcador entre corchetes —como [Tu ciudad] o [Nombre de la empresa]— por tus propios datos antes de enviarlo.

¿De dónde salen estos prompts?

Cada prompt procede de una guía probada de Zekai. El enlace «Origen» bajo cada prompt lleva al artículo completo, que explica el razonamiento y cómo se probó.

¿Puedo editar estos prompts?

Hazlo. Trata cada uno como una estructura de partida: aprieta las instrucciones, añade tus restricciones y quédate con la versión que te dé el mejor resultado. Los corchetes marcan lo que siempre hay que cambiar.

Bibliotecas de prompts para otras profesiones

Mismo formato, otra profesión, empezando por las más cercanas a ciencia de datos.

Ve Zekai primero en Google