The short answer
Los mejores prompts de IA para científicos de datos especifican la tarea, el contexto y el formato de salida deseado para generar código y análisis utilizables, no consejos vagos. Los prompts efectivos proporcionan a la IA el contexto de negocio, la estructura de los datos e instrucciones explícitas para tareas como la limpieza de datos, el análisis exploratorio de datos, la ingeniería de características y la interpretación de modelos.
Los prompts genéricos como «analiza estos datos» hacen perder el tiempo. El valor de un científico de datos reside en formular un problema y validar los resultados, pero la IA generativa puede acelerar drásticamente los pasos mecánicos intermedios, si se le dan las instrucciones correctas. Las solicitudes vagas producen código genérico, a menudo incorrecto. Los prompts específicos y ricos en contexto producen scripts funcionales, análisis perspicaces y visualizaciones claras.
Esta guía proporciona 50 prompts probados en campo, organizados según el flujo de trabajo de la ciencia de datos. Los diseñamos para ser copiados, pegados y personalizados para sus conjuntos de datos y problemas específicos. ZEKAI revisa herramientas y flujos de trabajo de forma independiente; nuestro objetivo es proporcionar recursos prácticos para profesionales en activo en el campo de la IA y la ciencia de datos. Estos prompts funcionan mejor en asistentes de IA conversacionales avanzados o notebooks diseñados para el análisis de datos, como Julius AI, pero pueden adaptarse a cualquier Modelo de Lenguaje Grande (LLM) potente.
en la Productividad Agregada Source: stlouisfed.org
El ahorro de tiempo autodeclarado gracias a la IA generativa se traduce en un aumento del 1.1% en la productividad laboral agregada, siendo los trabajadores de ocupaciones informáticas y matemáticas quienes reportan los mayores ahorros de tiempo.
Por qué los Prompts Genéricos de IA Fallan a los Científicos de Datos
La mayoría de las guías de prompts de IA ofrecen plantillas simples con una única {variable}. Este enfoque falla en la ciencia de datos porque el contexto es tan importante como el comando. Un prompt efectivo para un científico de datos actúa como un resumen de proyecto para un analista junior. Debe incluir:
- Juego de Roles: Indique a la IA que actúe como una persona específica (p. ej., «Actúa como un científico de datos senior especializado en pronóstico de series temporales»).
- Contexto: Explique el objetivo de negocio. ¿Está intentando reducir la rotación de clientes, pronosticar el inventario o detectar fraudes?
- Esquema de Datos: Proporcione nombres de columnas, tipos de datos y valores de ejemplo.
- Instrucciones Explícitas: Detalle los pasos exactos a seguir (p. ej., «imputar valores faltantes en la columna ‘edad’ usando la mediana»).
- Formato de Salida: Especifique el resultado deseado: un script de Python, un DataFrame de pandas, una visualización de Matplotlib, un objeto JSON o un resumen en lenguaje sencillo.
Sin este nivel de detalle, la IA solo está adivinando. No sabe que user_id es una clave primaria, que revenue está en centavos o que los datos están sesgados. La especificidad es la diferencia entre un script que funciona y una alucinación frustrante.
Prompts para Limpieza y Preprocesamiento de Datos
La preparación de datos a menudo consume la mayor parte del tiempo de un proyecto. Estos prompts aceleran la identificación y corrección de problemas comunes de calidad de datos.
Actúa como analista de calidad de datos. Le proporciono un DataFrame de pandas llamado `df`. Su esquema es el siguiente: `[PEGAR ESQUEMA O SALIDA DE HEAD() AQUÍ]`.
Su tarea es realizar un perfilado completo de los datos. Para cada columna, proporcione:
1. Tipo de dato.
2. Número y porcentaje de valores faltantes.
3. Número de valores únicos (cardinalidad).
4. Para columnas numéricas: media, mediana, desviación estándar, mínimo y máximo.
5. Para columnas categóricas: una lista de valores únicos y sus frecuencias.
6. Identifique cualquier columna que parezca tener un tipo incorrecto (p. ej., fechas almacenadas como objetos).
Presente la salida como una tabla markdown.
tiene valores faltantes. Aquí está la salida de
Genere un script de Python que utilice el método del Rango Intercuartílico (IQR) para identificar valores atípicos en las siguientes columnas numéricas de un DataFrame de pandas `df`: `[LIST_OF_NUMERIC_COLUMNS]`.
El script debe:
1. Calcular Q1, Q3 e IQR para cada columna especificada.
2. Definir los límites superior e inferior (Q1 - 1.5 * IQR, Q3 + 1.5 * IQR).
3. Crear un nuevo DataFrame que contenga solo las filas que tienen valores atípicos en cualquiera de las columnas especificadas.
4. Imprimir la forma del DataFrame original y del DataFrame de valores atípicos.
. Las siguientes columnas necesitan que se corrijan sus tipos de datos:
-
. Quiero verificar duplicados basándome en un subconjunto de columnas:
que tome una cadena de texto y realice los siguientes pasos de limpieza de texto:
1. Convierte el texto a minúsculas.
2. Elimina toda la puntuación.
3. Elimina los dígitos numéricos.
4. Elimina las palabras vacías (stop words) comunes en inglés.
5. Realiza el stemming de las palabras restantes usando el Porter Stemmer.
La función debe devolver la cadena de texto limpia. Incluya importaciones de
Prompts para Análisis Exploratorio de Datos (EDA)
Una vez que los datos están limpios, el EDA ayuda a descubrir patrones, probar hipótesis y guiar la ingeniería de características.
Organizaciones Source: mckinsey.com
A principios de 2024, el 65% de las organizaciones reportaron usar regularmente IA generativa, casi duplicando la cifra del año anterior, lo que señala un cambio importante de la experimentación a la integración.
, genere un conjunto de gráficos de Python para análisis univariado.
Para cada columna numérica en
Genere código Python para calcular la matriz de correlación de Pearson para las columnas numéricas en mi DataFrame de pandas `df`. Las columnas son: `[LIST_OF_NUMERIC_COLUMNS]`.
Luego, haga lo siguiente:
1. Cree un mapa de calor de la matriz de correlación usando seaborn. Anote los valores en el mapa de calor.
2. Identifique y liste todos los pares de variables con un coeficiente de correlación mayor que 0.7 o menor que -0.7.
3. Para los 3 pares más correlacionados, proporcione una hipótesis de una frase sobre por qué podrían estar correlacionados.
.
Para cada variable numérica, genere un diagrama de caja que compare su distribución entre las diferentes categorías de
con un índice datetime y una columna llamada
.
Genere un script de Python que:
1. Estandarice estas dos columnas usando
con columnas de latitud y longitud llamadas
Prompts para Ingeniería de Características
Crear las características adecuadas es a menudo la clave para el rendimiento del modelo. La IA puede ayudar a generar ideas e implementar características.
[INDUSTRIA, p. ej., comercio electrónico]
. Genere un script de Python que cree las siguientes nuevas características a partir de esta columna:
- Año
- Mes
- Día de la semana (como número, 0=Lunes)
- Día del año
- Semana del año
- Un indicador binario
tiene las siguientes características numéricas:
para codificar con one-hot las siguientes columnas categóricas en mi DataFrame
. Genere código Python para crear una nueva columna
está indexado por fecha y tiene una columna objetivo
Prompts para Selección y Construcción de Modelos
La IA puede escribir el código repetitivo para entrenar y evaluar múltiples modelos, permitiéndole centrarse en la interpretación de los resultados.
Actúa como especialista en AutoML. Tengo un conjunto de datos preprocesado con características `X` y una variable objetivo binaria `y`. Genere un script de Python completo que entrene y evalúe tres modelos de clasificación base diferentes:
1. Regresión Logística
2. Clasificador Random Forest
3. Clasificador Gradient Boosting (usando LightGBM)
Para cada modelo, el script debe:
- Usar validación cruzada de 5 pliegues.
- Calcular e imprimir la media de Exactitud, Precisión, Recall y F1-score.
- Almacenar los resultados en un DataFrame de pandas para facilitar la comparación.
de scikit-learn.
Mi matriz de características es
características.
La arquitectura de la red debe ser:
- Capa de entrada con
para un flujo de trabajo de aprendizaje automático. El pipeline debe constar de los siguientes pasos:
1. Imputar valores numéricos faltantes usando
que contiene una serie temporal univariada. Genere un script de Python usando
para construir un modelo simple de recomendación de filtrado colaborativo usuario-ítem.
Asuma que tengo un DataFrame de pandas
Prompts para Evaluación e Interpretación de Modelos
Un modelo es inútil si no se puede explicar su rendimiento y predicciones.
y las predicciones del modelo están en
Usando `y_test` (etiquetas verdaderas) y `y_pred_proba` (probabilidades predichas para la clase positiva de mi clasificador), genere un script de Python para:
1. Calcular la puntuación AUC (Área Bajo la Curva).
2. Graficar la curva ROC (Receiver Operating Characteristic).
3. Incluir una línea diagonal que represente un clasificador aleatorio para comparación.
4. Etiquetar el gráfico con la puntuación AUC.
. Quiero explicar una única predicción para una instancia específica
. Mis características tienen los nombres
sklearn.inspection.permutation_importance
Quiero verificar si las probabilidades predichas de mi clasificador binario están bien calibradas. Tengo las etiquetas verdaderas `y_test` y las probabilidades predichas `y_pred_proba`. Genere un script de Python usando `sklearn.calibration.CalibrationDisplay` para graficar una curva de calibración para mi modelo.
Prompts para Explicar Resultados e Informar
Comunicar los hallazgos a las partes interesadas no técnicas es una habilidad crítica. La IA puede ayudar a redactar resúmenes y crear visualizaciones amigables para el negocio.
[VARIABLE_OBJETIVO, p. ej., 'rotación de empleados']
A continuación se muestra un script de Python que genera un gráfico. Después del script, describiré el gráfico. Su tarea es escribir una interpretación concisa, de un párrafo, de esta conclusión para una audiencia de negocios. Evite la jerga técnica.
`[PASTE PYTHON PLOT SCRIPT]`
El gráfico muestra un diagrama de barras donde los clientes en la categoría de soporte 'Tier 1' tienen un gasto mensual promedio de $150, mientras que los clientes en la categoría 'Tier 3' tienen un gasto promedio de $45.
Ahora, escriba el resumen de negocio.
con los resultados de una prueba A/B. Tiene columnas
Actúa como analista de datos. Redacte un correo electrónico al equipo de producto informando los resultados de una prueba A/B para la nueva característica "Compra con Un Clic".
Hallazgos clave:
- Tasa de conversión del grupo de control: 3.5%
- Tasa de conversión del grupo de tratamiento (con la característica): 4.8%
- El resultado es estadísticamente significativo con un valor p de 0.002.
- La prueba se ejecutó durante 14 días con 50,000 usuarios en cada grupo.
Estructure el correo electrónico con un asunto claro, un breve resumen del resultado, los números clave y una recomendación para implementar la característica.
Explique el concepto de "sobreajuste" en aprendizaje automático como lo haría a un director de ventas. Use una analogía. Mantenga la explicación por debajo de las 150 palabras.
Genere una plantilla markdown para un archivo README de un proyecto de ciencia de datos. La plantilla debe incluir las siguientes secciones:
- Título del Proyecto
- Problema de Negocio
- Fuente de Datos
- Metodología (Limpieza de Datos, EDA, Modelado)
- Resultados
- Cómo Ejecutar el Código (Dependencias, Instrucciones)
- Contactos Clave
Prompts para MLOps y Producción
La IA puede ayudar con las tareas de ingeniería necesarias para desplegar y monitorear modelos. Aquí es donde plataformas como Azure Machine Learning sobresalen, pero los prompts de IA pueden programar muchos de los componentes.
(el archivo del modelo entrenado)
El Dockerfile debe:
1. Comenzar desde una imagen base
que acepte solicitudes POST con una carga JSON.
El script debe:
1. Cargar un modelo scikit-learn preentrenado desde un archivo llamado
Genere un fragmento de script de Python que demuestre cómo usar MLflow para el seguimiento de experimentos. El script debe:
1. Iniciar una ejecución de MLflow.
2. Registrar dos parámetros: `learning_rate` y `n_estimators`.
3. Registrar tres métricas: `accuracy`, `precision` y `recall`.
4. Registrar el modelo entrenado como un artefacto.
5. Finalizar la ejecución.
) que se ejecute en cada push a la rama
def remove_outliers(df, column_name):
Q1 = df[column_name].quantile(0.25)
Q3 = df[column_name].quantile(0.75)
IQR = Q3 - Q1
lower_bound = Q1 - 1.5 * IQR
upper_bound = Q3 + 1.5 * IQR
return df[(df[column_name] >= lower_bound) & (df[column_name] <= upper_bound)]
, y tengo un nuevo lote de datos de producción en
Prompts Avanzados y Encadenados
Combine prompts para ejecutar un flujo de trabajo de varios pasos. Aquí es donde la IA transiciona de un simple generador de código a un socio analítico.
. Primero, cárguelo en un DataFrame de pandas y ejecute un perfil completo de datos. Identifique valores faltantes, tipos de datos y estadísticas básicas para cada columna. Muéstreme la salida."
**Prompt 2 (después de que la IA responda):** "Gracias. Basándose en ese perfil, genere un script de Python para manejar la limpieza de datos. Impute los valores faltantes de
: entero, distribuido normalmente alrededor de una media de 40 con una desviación estándar de 10.
-
que tome los hiperparámetros del modelo.
- Un método
import pandas as pd
from sklearn.model_selection import train_test_split
from sklearn.ensemble import RandomForestClassifier
df = pd.read_csv('data.csv')
df = df.dropna()
X = df[['feature1', 'feature2']]
y = df['target']
X_train, X_test, y_train, y_test = train_test_split(X, y, test_size=0.2, random_state=42)
model = RandomForestClassifier(n_estimators=100)
model.fit(X_train, y_train)
print(model.score(X_test, y_test))
) y una instancia de cliente específica (
.
La consulta debe calcular la tasa de retención de cohortes mensuales de clientes. La cohorte de un cliente es el mes de su primera compra. La retención para un mes dado es el porcentaje de clientes de una cohorte que realizaron una compra en ese mes.
La salida debe tener tres columnas:
['date', 'region', 'sales', 'product_category']
) que no cabe en la memoria de pandas. La tarea es calcular la media de
Adónde ir ahora
Tres rutas, elegidas según lo que acabas de leer.
¿Cómo se escribe un buen prompt de IA para el análisis de datos?
R: Un buen prompt proporciona un contexto claro. Debe indicar a la IA qué persona adoptar (p. ej., «actúa como analista de datos»), definir el objetivo de negocio, proporcionar el esquema de datos (nombres y tipos de columnas), dar instrucciones explícitas paso a paso y especificar el formato de salida exacto que necesita (p. ej., código Python, tabla markdown, JSON).
¿Se puede usar ChatGPT para la ciencia de datos?
R: Sí, ChatGPT y otros modelos de lenguaje grandes son asistentes potentes para la ciencia de datos. Sobresalen en la generación de código repetitivo para limpieza y análisis, depuración de scripts, explicación de conceptos complejos, redacción de informes y traducción de código entre lenguajes como Python y R. Sin embargo, son herramientas que requieren supervisión humana para garantizar la validez y precisión de los resultados.
¿Cuáles son los mejores prompts de IA para la limpieza de datos?
R: Los mejores prompts para la limpieza de datos son muy específicos. En lugar de «limpiar los datos», use prompts como: «Genere un script de Python para imputar valores faltantes en la columna ‘edad’ con la mediana», o «Escriba código para eliminar símbolos de moneda y comas de la columna ‘precio’ y convertirla a un flotante».
¿Cómo puede ayudar la IA con el Análisis Exploratorio de Datos (EDA)?
R: La IA puede acelerar rápidamente el EDA generando código para visualizaciones. Puede pedirle que cree una cuadrícula de histogramas para todas las columnas numéricas, un mapa de calor de correlación para detectar relaciones, o diagramas de caja para comparar distribuciones entre categorías. Esto automatiza la parte más laboriosa del EDA, permitiéndole centrarse en la interpretación de los patrones.
¿Reemplazará la IA a los científicos de datos?
R: No, no se espera que la IA reemplace a los científicos de datos, pero está cambiando el rol. La IA automatiza tareas repetitivas como escribir código repetitivo y el perfilado inicial de datos, liberando a los científicos para que se centren en trabajos de mayor valor: formulación de problemas, diseño experimental, interpretación de resultados complejos y comunicación de insights a las partes interesadas. El trabajo está evolucionando hacia una supervisión más estratégica y menos codificación manual.
Adónde ir ahora
Tres rutas, elegidas según lo que acabas de leer.
Fuentes (16)
- Goldman Sachs. (2023, April 5). *Generative AI could raise global GDP by 7%*. https://www.goldmansachs.com/insights/articles/generative-ai-could-raise-global-gdp-by-7-percent
- Goldman Sachs. (2024, May 13). *AI is showing «very positive» signs of eventually boosting GDP and productivity*.
- Goldman Sachs. (2025, August 13). *How Will AI Affect the Global Workforce?*. https://www.goldmansachs.com/insights/articles/how-will-ai-affect-the-global-workforce
- Goldman Sachs. (2025, July 3). *AI Agents to Boost Productivity and Size of Software Market*. https://www.goldmansachs.com/insights/articles/ai-agents-to-boost-productivity-and-size-of-software-market
- Dataversity. (2024, May 1). *The Impact of Generative AI on Data Science*. https://www.dataversity.net/articles/the-impact-of-generative-ai-on-data-science/
- Goldman Sachs. (2023, November 7). *AI may start to boost US GDP in 2027*. https://www.goldmansachs.com/insights/articles/ai-may-start-to-boost-us-gdp-in-2027
- 365 Data Science. (2026, April 23). *Data Scientist Job Outlook 2026: Trends, Salaries, and Skills*. https://365datascience.com/career-advice/career-guides/data-scientist-job-outlook-2025/
- Pragmatic Institute. *AI Prompts for Data Scientists*. https://www.pragmaticinstitute.com/resources/articles/data/ai-prompts-for-data-scientists/
- CASRAI. (2026, August 25). *Julius AI for Research Data: A Careful Guide*. https://casrai.org/guides/julius-ai-for-research-data-analysis
- McKinsey & Company. (2026, August 25). *The State of AI: Global Survey 2026*. https://www.mckinsey.com/capabilities/quantumblack/our-insights/the-state-of-ai
- McKinsey & Company. (2021, December 8). *Global survey: The state of AI in 2021*.
- Medium. (2024, July 17). *Top 20+ Generative AI Prompts for Data Scientists and Analysts*. https://medium.com/@byanalytixlabs/top-20-generative-ai-prompts-for-data-scientists-and-analysts-79c5a691bb8d
- McKinsey & Company. (2024, July 22). *What Businesses Can Learn from McKinsey’s 2024 Global Survey on AI Adoption*. https://business.purdue.edu/daniels-insights/posts/2024/global-survey-on-ai-adoption.php
- Reddit. (2025, December 12). *Should I pursue Data Science in 2026, or is the field at risk because of AI?*. https://www.reddit.com/r/careerguidance/comments/1pklg0p/should_i_pursue_data_science_in_2026_or_is_the/
- Federal Reserve Bank of St. Louis. (2025, February 27). *The Impact of Generative AI on Work Productivity*. https://www.stlouisfed.org/on-the-economy/2025/feb/impact-generative-ai-work-productivity
- McKinsey & Company. (2024, May 30). *The state of AI in early 2024: Gen AI adoption spikes and starts to generate value*.
Ve Zekai primero en Google
El briefing semanal de IA para tu profesión
Un correo semanal: los cambios de IA que realmente afectan a tu profesión — herramientas, ofertas y qué hacer al respecto.

