Ferramentas de IA avaliadas para o seu trabalho
Aprenda IA em 30 dias

📈 Tecnologia e engenharia

Prompts de IA para Ciência de Dados

50 prompts de IA para copiar e colar para ciência de dados, extraídos de 1 guias Zekai testados. Grátis, sem cadastro, e cada um leva ao artigo que o explica. Veja o hub ciência de dados para as ferramentas com as quais estes prompts foram pensados.

  • 50prompts
  • 1guia de origem
  • 100%grátis · sem cadastro

Os 50 prompts

Copie qualquer um direto para o ChatGPT, Claude ou Gemini e troque os marcadores entre colchetes pelos seus próprios dados.

50 prompts para copiar
1Perfil Abrangente de Dados
[[COLE O ESQUEMA OU A SAÍDA DE HEAD() AQUI]]
2Plano de Imputação de Valores Ausentes
possui valores ausentes. Aqui está a saída de
3Script de Detecção de Outliers
Gere um script Python que utilize o método do Intervalo Interquartil (IQR) para identificar outliers nas seguintes colunas numéricas de um pandas DataFrame `df`: `[[LISTA_DE_COLUNAS_NUMÉRICAS]]`. O script deve: 1. Calcular Q1, Q3 e IQR para cada coluna especificada. 2. Definir os limites superior e inferior (Q1 - 1.5 * IQR, Q3 + 1.5 * IQR). 3. Criar um novo DataFrame contendo apenas as linhas que possuem valores atípicos em qualquer uma das colunas especificadas. 4. Imprimir o formato do DataFrame original e do DataFrame de outliers.
4Script de Conversão de Tipo de Dados
. As seguintes colunas precisam ter seus tipos de dados corrigidos: -
5Identificação de Registros Duplicados
. Quero verificar duplicatas com base em um subconjunto de colunas:
6Função de Normalização de Texto
que recebe uma string e executa as seguintes etapas de limpeza de texto: 1. Converte o texto para minúsculas. 2. Remove toda a pontuação. 3. Remove dígitos numéricos. 4. Remove palavras de parada comuns em inglês. 5. Realiza a lematização (stemming) das palavras restantes usando o Porter Stemmer. A função deve retornar a string limpa. Inclua importações de
7Gerar Gráficos de Análise Univariada
, gere um conjunto de gráficos Python para análise univariada. Para cada coluna numérica em
8Matriz de Correlação e Interpretação
Gere código Python para calcular a matriz de correlação de Pearson para as colunas numéricas no meu pandas DataFrame `df`. As colunas são: `[[LISTA_DE_COLUNAS_NUMÉRICAS]]`. Em seguida, faça o seguinte: 1. Crie um mapa de calor da matriz de correlação usando seaborn. Anote os valores no mapa de calor. 2. Identifique e liste todos os pares de variáveis com um coeficiente de correlação maior que 0.7 ou menor que -0.7. 3. Para os 3 pares mais correlacionados, forneça uma hipótese de uma frase sobre por que eles podem estar correlacionados.
9Análise Bivariada: Numérica vs. Categórica
. Para cada variável numérica, gere um box plot que compare sua distribuição entre as diferentes categorias de
10Decomposição de Séries Temporais
com um índice datetime e uma coluna chamada
11Segmentação de Clientes com K-Means
. Gere um script Python que: 1. Padronize essas duas colunas usando
12Visualização de Dados Geoespaciais
com colunas de latitude e longitude chamadas
13Brainstorm de Ideias de Features
. Estou construindo um modelo para prever
14Criar Features Baseadas em Tempo
. Gere um script Python que crie as seguintes novas features a partir desta coluna: - Ano - Mês - Dia da semana (como número, 0=Segunda-feira) - Dia do ano - Semana do ano - Uma flag binária
15Gerar Features de Interação
possui as seguintes features numéricas:
16Codificar Features Categóricas com One-Hot Encoding
para realizar one-hot encoding nas seguintes colunas categóricas do meu DataFrame
17Agrupar Features Numéricas em Bins
. Gere código Python para criar uma nova coluna
18Criar Features de Lag para Séries Temporais
é indexado por data e possui uma coluna alvo
19Comparar Modelos de Classificação Base
Atue como um especialista em AutoML. Tenho um conjunto de dados pré-processado com features `X` e uma variável alvo binária `y`. Gere um script Python completo que treine e avalie três modelos de classificação base diferentes: 1. Regressão Logística 2. Classificador Random Forest 3. Classificador Gradient Boosting (usando LightGBM) Para cada modelo, o script deve: - Usar validação cruzada de 5-folds. - Calcular e imprimir a Média de Acurácia, Precisão, Recall e F1-score. - Armazenar os resultados em um pandas DataFrame para fácil comparação.
20Ajuste de Hiperparâmetros com Grid Search
do scikit-learn. Minha matriz de features é
21Construir uma Rede Neural Simples com Keras
features. A arquitetura da rede deve ser: - Camada de entrada com
22Configurar um Pipeline Scikit-learn
para um fluxo de trabalho de machine learning. O pipeline deve consistir nas seguintes etapas: 1. Imputar valores numéricos ausentes usando
23Treinar um Modelo de Previsão de Séries Temporais (ARIMA)
contendo uma série temporal univariada. Gere um script Python usando
24Construir um Motor de Recomendação com Surprise
para construir um modelo simples de recomendação de filtragem colaborativa user-item. Assuma que tenho um pandas DataFrame
25Plotar uma Matriz de Confusão
para calcular e plotar uma matriz de confusão. O gráfico deve ser claramente rotulado com títulos de eixos ('Rótulo Predito', 'Rótulo Verdadeiro') e os nomes das classes
26Plotar Curva ROC e Calcular AUC
Usando `y_test` (rótulos verdadeiros) e `y_pred_proba` (probabilidades preditas para a classe positiva do meu classificador), gere um script Python para: 1. Calcular a pontuação AUC (Area Under the Curve). 2. Plotar a curva ROC (Receiver Operating Characteristic). 3. Incluir uma linha diagonal representando um classificador aleatório para comparação. 4. Rotular o gráfico com a pontuação AUC.
27Explicar uma Previsão com SHAP
. Quero explicar uma única previsão para uma instância específica
28Obter Importância Global das Features
Tenho um modelo `RandomForestClassifier` treinado chamado `model`. Minhas features têm os nomes `[[LISTA_DE_NOMES_DE_FEATURES]]`. Gere código Python para extrair as importâncias das features do modelo, combiná-las com seus nomes e criar um gráfico de barras horizontal mostrando as 15 features mais importantes.
29Realizar um Teste de Importância por Permutação
sklearn.inspection.permutation_importance
30Plotar uma Curva de Calibração
Quero verificar se as probabilidades preditas do meu classificador binário estão bem calibradas. Tenho os rótulos verdadeiros `y_test` e as probabilidades preditas `y_pred_proba`. Gere um script Python usando `sklearn.calibration.CalibrationDisplay` para plotar uma curva de calibração para o meu modelo.
31Resumir o Desempenho do Modelo para Executivos
[[VARIÁVEL_ALVO, por exemplo, 'rotatividade de funcionários']]
32Descrever um Insight Chave de um Gráfico
Abaixo está um script Python que gera um gráfico. Após o script, descreverei o gráfico. Sua tarefa é escrever uma interpretação concisa, em um parágrafo, deste insight para um público de negócios. Evite jargões técnicos. `[[COLE O SCRIPT PYTHON DO GRÁFICO]]` O gráfico mostra um gráfico de barras onde clientes na categoria de suporte 'Tier 1' têm um gasto médio mensal de $150, enquanto clientes na categoria 'Tier 3' têm um gasto médio de $45. Agora, escreva o resumo de negócios.
33Criar uma Visualização Focada em Negócios
com os resultados de um teste A/B. Ele possui colunas
34Rascunhar um E-mail Reportando Resultados de Teste A/B
Atue como um analista de dados. Rascunhe um e-mail para a equipe de produto reportando os resultados de um teste A/B para a nova feature "Checkout com Um Clique". Principais descobertas: - Taxa de conversão do grupo de controle: 3.5% - Taxa de conversão do grupo de tratamento (com feature): 4.8% - O resultado é estatisticamente significativo com um valor p de 0.002. - O teste durou 14 dias com 50.000 usuários em cada grupo. Estruture o e-mail com uma linha de assunto clara, um breve resumo do resultado, os números chave e uma recomendação para lançar a feature.
35Explicar um Conceito Técnico de Forma Simples
Explique o conceito de "overfitting" em machine learning como você faria para um diretor de vendas. Use uma analogia. Mantenha a explicação abaixo de 150 palavras.
36Gerar um README de Projeto
Gere um modelo markdown para um arquivo README de projeto de ciência de dados. O modelo deve incluir as seguintes seções: - Título do Projeto - Problema de Negócio - Fonte de Dados - Metodologia (Limpeza de Dados, EDA, Modelagem) - Resultados - Como Executar o Código (Dependências, Instruções) - Contatos Chave
37Escrever um Dockerfile para uma API Flask
(o arquivo do modelo treinado) O Dockerfile deve: 1. Começar de uma imagem base
38Criar um Endpoint Simples para API Flask
que aceita requisições POST com um payload JSON. O script deve: 1. Carregar um modelo scikit-learn pré-treinado de um arquivo chamado
39Registrar Métricas de Modelo com MLflow
Gere um trecho de script Python que demonstre como usar MLflow para rastreamento de experimentos. O script deve: 1. Iniciar uma execução do MLflow. 2. Registrar dois parâmetros: `learning_rate` e `n_estimators`. 3. Registrar três métricas: `accuracy`, `precision` e `recall`. 4. Registrar o próprio modelo treinado como um artefato. 5. Finalizar a execução.
40Escrever um Workflow de GitHub Actions para CI
) que é executado em cada push para a branch
41Teste Unitário para uma Função de Limpeza de Dados
def remove_outliers(df, column_name): Q1 = df[[column_name]].quantile(0.25) Q3 = df[[column_name]].quantile(0.75) IQR = Q3 - Q1 lower_bound = Q1 - 1.5 * IQR upper_bound = Q3 + 1.5 * IQR return df[(df[[column_name]] >= lower_bound) & (df[[column_name]] <= upper_bound)]
42Monitorar Desvio de Dados (Data Drift)
, e tenho um novo lote de dados de produção em
43Encadeado: Relatório Completo de EDA a Partir de um CSV
. Primeiro, carregue-o em um pandas DataFrame e execute um perfil completo dos dados. Identifique valores ausentes, tipos de dados e estatísticas básicas para cada coluna. Mostre-me a saída." **Prompt 2 (após a resposta da IA):** "Obrigado. Com base nesse perfil, gere um script Python para lidar com a limpeza dos dados. Impute
44Gerar Dados Sintéticos
: inteiro, normalmente distribuído em torno de uma média de 40 com um desvio padrão de 10. -
45Refatorar um Jupyter Notebook em uma Classe
import pandas as pd from sklearn.model_selection import train_test_split from sklearn.linear_model import LogisticRegression from sklearn.preprocessing import StandardScaler from sklearn.impute import SimpleImputer # Sample data generation (for demonstration) data = { 'age': [[25, 30, 45, 22, 50, 35, None, 28, 40, 60]], 'gender': [['M', 'F', 'M', 'F', 'M', 'F', 'F', 'M', 'F', 'M']], 'monthly_charges': [[50, 75, 60, 40, 80, 65, 55, 70, 90, 100]], 'churn': [[0, 1, 0, 0, 1, 0, 1, 0, 1, 0]] } df = pd.DataFrame(data) # Preprocessing steps # Impute missing age with median imputer = SimpleImputer(strategy='median') df[['age']] = imputer.fit_transform(df[[['age']]]) # One-hot encode gender df = pd.get_dummies(df, columns=[['gender']], drop_first=True) # Split data X = df[[['age', 'monthly_charges', 'gender_M']]] y = df[['churn']] X_train, X_test, y_train, y_test = train_test_split(X, y, test_size=0.2, random_state=42) # Scale features scaler = StandardScaler() X_train_scaled = scaler.fit_transform(X_train) X_test_scaled = scaler.transform(X_test) # Train model model = LogisticRegression(random_state=42) model.fit(X_train_scaled, y_train) # Evaluate print(f"Model accuracy: {model.score(X_test_scaled, y_test):.2f}")
46Converter Script Python para R
import pandas as pd from sklearn.model_selection import train_test_split from sklearn.ensemble import RandomForestClassifier df = pd.read_csv('data.csv') df = df.dropna() X = df[[['feature1', 'feature2']]] y = df[['target']] X_train, X_test, y_train, y_test = train_test_split(X, y, test_size=0.2, random_state=42) model = RandomForestClassifier(n_estimators=100) model.fit(X_train, y_train) print(model.score(X_test, y_test))
47Explicar Resultados do Modelo com Contrafactuais
) e uma instância de cliente específica (
48SQL: Consulta de Análise de Coorte
. A consulta deve calcular a taxa de retenção de coortes mensais de clientes. A coorte de um cliente é o mês de sua primeira compra. A retenção para um determinado mês é a porcentagem de clientes de uma coorte que fizeram uma compra naquele mês. A saída deve ter três colunas:
49Criar um Dashboard Interativo com Plotly
[['date', 'region', 'sales', 'product_category']]
50Escrever um Script Dask para um CSV Grande
) que não cabe na memória do pandas. A tarefa é calcular a média de

Como usar estes prompts para ciência de dados

Quatro passos, cerca de um minuto. O prompt dá a estrutura; você dá os detalhes.

1

Escolha o prompt

Cada prompt aqui foi escrito para uma tarefa específica — não um modelo genérico do tipo “aja como um especialista”. Passe os olhos pelos títulos e pegue o que corresponde ao seu trabalho.

2

Copie e cole

Clique em Copiar e cole tudo no ChatGPT, Claude, Gemini ou no assistente que você já paga. Nada aqui depende de um único modelo.

3

Preencha os colchetes

Troque cada [Marcador entre colchetes] pelos seus próprios dados antes de enviar. É daí que vem a qualidade: o prompt dá a estrutura, você dá os detalhes.

4

Confira o guia de origem

O link “Origem” sob cada prompt abre o artigo completo: por que o prompt é assim, contra o que foi testado e com quais ferramentas combina.

Perguntas frequentes

As perguntas que aparecem antes de colar um destes prompts em um trabalho de verdade.

Estes prompts de IA são gratuitos?

Sim. Os 50 prompts desta página podem ser copiados e usados com qualquer assistente de IA, incluindo ChatGPT, Claude e Gemini. Basta ter conta em uma dessas ferramentas.

Como uso estes prompts de IA para ciência de dados?

Copie o texto completo com o botão Copiar, cole no seu assistente de IA e troque cada marcador entre colchetes — como [Sua cidade] ou [Nome da empresa] — pelos seus próprios dados antes de enviar.

De onde vêm estes prompts?

Cada prompt vem de um guia testado da Zekai. O link “Origem” sob cada prompt leva ao artigo completo, que explica o raciocínio e como ele foi testado.

Posso editar estes prompts?

Pode e deve. Trate cada um como estrutura de partida: aperte as instruções, acrescente suas restrições e fique com a versão que dá o melhor resultado. Os colchetes marcam o que sempre precisa mudar.

Bibliotecas de prompts para outras profissões

Mesmo formato, outra profissão — começando pelas mais próximas de ciência de dados.

Veja o Zekai primeiro no Google