ИИ-инструменты с оценкой для вашей профессии
Освоить ИИ за 30 дней

📈 Технологии и инженерия

ИИ-промпты для профессии: Наука о данных

50 ИИ-промптов для копирования по направлению «наука о данных», собранных из 1 проверенных руководств Zekai. Бесплатно, без регистрации, и каждый ведёт к статье, которая его объясняет. Загляните в раздел наука о данных — там инструменты, под которые написаны эти промпты.

  • 50промптов
  • 1руководство-источник
  • 100%бесплатно · без регистрации

50 промптов

Скопируйте любой прямо в ChatGPT, Claude или Gemini, затем замените заполнители в скобках своими данными.

50 промптов для копирования
1Комплексный профиль данных
Действуй как аналитик качества данных. Я предоставляю тебе DataFrame pandas с именем `df`. Его схема следующая: `[[ВСТАВЬТЕ СХЕМУ ИЛИ ВЫВОД HEAD() СЮДА]]`. Твоя задача — выполнить комплексное профилирование данных. Для каждого столбца предоставь: 1. Тип данных. 2. Количество и процент пропущенных значений. 3. Количество уникальных значений (кардинальность). 4. Для числовых столбцов: среднее, медиана, стандартное отклонение, минимум и максимум. 5. Для категориальных столбцов: список уникальных значений и их частоты. 6. Определи любые столбцы, которые, по-видимому, имеют неправильный тип (например, даты, хранящиеся как объекты). Представь вывод в виде таблицы Markdown.
2План заполнения пропущенных значений
содержит пропущенные значения. Вот вывод
3Скрипт для обнаружения выбросов
Сгенерируй скрипт Python, который использует метод межквартильного диапазона (IQR) для выявления выбросов в следующих числовых столбцах DataFrame pandas `df`: `[[СПИСОК_ЧИСЛОВЫХ_СТОЛБЦОВ]]`. Скрипт должен: 1. Вычислить Q1, Q3 и IQR для каждого указанного столбца. 2. Определить верхнюю и нижнюю границы (Q1 - 1.5 * IQR, Q3 + 1.5 * IQR). 3. Создать новый DataFrame, содержащий только строки, в которых есть выбросы в любом из указанных столбцов. 4. Вывести форму исходного DataFrame и DataFrame с выбросами.
4Скрипт для преобразования типов данных
. Следующие столбцы нуждаются в исправлении типов данных: -
5Идентификация дублирующихся записей
. Я хочу проверить дубликаты на основе подмножества столбцов:
6Функция нормализации текста
, которая принимает строку и выполняет следующие шаги по очистке текста: 1. Преобразует текст в нижний регистр. 2. Удаляет все знаки препинания. 3. Удаляет числовые цифры. 4. Удаляет общие английские стоп-слова. 5. Проводит стемминг оставшихся слов с использованием стеммера Портера. Функция должна возвращать очищенную строку. Включи импорты из
7Генерация графиков одномерного анализа
, сгенерируй набор графиков Python для одномерного анализа. Для каждого числового столбца в
8Матрица корреляции и интерпретация
Сгенерируй код Python для вычисления матрицы корреляции Пирсона для числовых столбцов в моем DataFrame pandas `df`. Столбцы: `[[СПИСОК_ЧИСЛОВЫХ_СТОЛБЦОВ]]`. Затем выполни следующее: 1. Создай тепловую карту матрицы корреляции с использованием seaborn. Аннотируй значения на тепловой карте. 2. Определи и перечисли все пары переменных с коэффициентом корреляции больше 0.7 или меньше -0.7. 3. Для 3 наиболее коррелированных пар предоставь однопредложенческую гипотезу о том, почему они могут быть коррелированы.
9Двумерный анализ: числовые против категориальных
. Для каждой числовой переменной сгенерируй ящичную диаграмму, которая сравнивает ее распределение по различным категориям
10Декомпозиция временных рядов
с индексом datetime и столбцом с именем
11Сегментация клиентов с помощью K-Means
. Сгенерируй скрипт Python, который: 1. Стандартизирует эти два столбца с использованием
12Визуализация геопространственных данных
со столбцами широты и долготы с именами
13Мозговой штурм идей признаков
[[ОТРАСЛЬ, например, электронной коммерции]]
14Создание признаков на основе времени
. Сгенерируй скрипт Python, который создает следующие новые признаки из этого столбца: - Год - Месяц - День недели (как число, 0=понедельник) - День года - Неделя года - Бинарный флаг
15Генерация признаков взаимодействия
Сгенерируй код Python для создания признаков взаимодействия для модели машинного обучения. Мой DataFrame pandas `df` имеет следующие числовые признаки: `[[СТОЛБЕЦ_A, СТОЛБЕЦ_B, СТОЛБЕЦ_C]]`. Создай все попарные признаки взаимодействия (например, A*B, A*C, B*C). Добавь эти новые признаки в DataFrame.
16One-Hot кодирование категориальных признаков
для one-hot кодирования следующих категориальных столбцов в моем DataFrame
17Бинаризация числовых признаков
. Сгенерируй код Python для создания нового столбца
18Создание лаговых признаков для временных рядов
индексирован по дате и имеет целевой столбец
19Сравнение базовых моделей классификации
Действуй как специалист по AutoML. У меня есть предварительно обработанный набор данных с признаками `X` и бинарной целевой переменной `y`. Сгенерируй полный скрипт Python, который обучает и оценивает три различные базовые модели классификации: 1. Логистическая регрессия 2. Классификатор случайного леса 3. Классификатор градиентного бустинга (с использованием LightGBM) Для каждой модели скрипт должен: - Использовать 5-кратную перекрестную проверку. - Вычислить и вывести средние значения Accuracy, Precision, Recall и F1-score. - Сохранить результаты в DataFrame pandas для удобного сравнения.
20Настройка гиперпараметров с помощью Grid Search
из scikit-learn. Моя матрица признаков —
21Построение простой нейронной сети с Keras
признаков. Архитектура сети должна быть: - Входной слой с
22Настройка конвейера Scikit-learn
для рабочего процесса машинного обучения. Конвейер должен состоять из следующих шагов: 1. Заполнить пропущенные числовые значения с использованием
23Обучение модели прогнозирования временных рядов (ARIMA)
, содержащий одномерный временной ряд. Сгенерируй скрипт Python с использованием
24Построение рекомендательной системы с Surprise
для построения простой рекомендательной модели коллаборативной фильтрации пользователь-элемент. Предположим, у меня есть DataFrame pandas
25Построение матрицы ошибок
. Сгенерируй код Python с использованием
26Построение ROC-кривой и вычисление AUC
Используя `y_test` (истинные метки) и `y_pred_proba` (предсказанные вероятности для положительного класса из моего классификатора), сгенерируй скрипт Python, чтобы: 1. Вычислить оценку AUC (площадь под кривой). 2. Построить ROC-кривую (рабочая характеристика приемника). 3. Включить диагональную линию, представляющую случайный классификатор для сравнения. 4. Пометить график оценкой AUC.
27Объяснение прогноза с помощью SHAP
. Я хочу объяснить одно предсказание для конкретного экземпляра
28Получение глобальной важности признаков
У меня есть обученная модель `RandomForestClassifier` с именем `model`. Мои признаки имеют имена `[[СПИСОК_ИМЕН_ПРИЗНАКОВ]]`. Сгенерируй код Python для извлечения важности признаков из модели, сопоставления их с их именами и создания горизонтальной столбчатой диаграммы, показывающей 15 наиболее важных признаков.
29Выполнение теста важности признаков методом перестановок
sklearn.inspection.permutation_importance
30Построение калибровочной кривой
. Сгенерируй скрипт Python с использованием
31Сводка производительности модели для руководителей
[[ЦЕЛЕВАЯ_ПЕРЕМЕННАЯ, например, 'отток сотрудников']]
32Описание ключевого вывода из графика
Ниже приведен скрипт Python, который генерирует график. После скрипта я опишу график. Твоя задача — написать краткую, однопараграфную интерпретацию этого вывода для бизнес-аудитории. Избегай технического жаргона. `[[PASTE PYTHON PLOT SCRIPT]]` График показывает столбчатую диаграмму, где клиенты в категории поддержки «Уровень 1» имеют средние ежемесячные расходы в $150, в то время как клиенты в категории «Уровень 3» имеют средние расходы в $45. Теперь напиши бизнес-резюме.
33Создание бизнес-ориентированной визуализации
с результатами A/B-теста. Он имеет столбцы
34Составление электронного письма с отчетом о результатах A/B-теста
Действуй как аналитик данных. Составь электронное письмо для продуктовой команды с отчетом о результатах A/B-теста для новой функции «Оформление заказа в один клик». Основные выводы: - Коэффициент конверсии контрольной группы: 3.5% - Коэффициент конверсии тестовой группы (с функцией): 4.8% - Результат статистически значим с p-значением 0.002. - Тест проводился в течение 14 дней с 50 000 пользователей в каждой группе. Структурируй электронное письмо с четкой темой, кратким изложением результата, ключевыми цифрами и рекомендацией по внедрению функции.
35Простое объяснение технической концепции
Объясни концепцию «переобучения» в машинном обучении так, как если бы ты объяснял ее директору по продажам. Используй аналогию. Держи объяснение в пределах 150 слов.
36Генерация README проекта
Сгенерируй шаблон Markdown для файла README проекта по науке о данных. Шаблон должен включать следующие разделы: - Название проекта - Бизнес-проблема - Источник данных - Методология (очистка данных, EDA, моделирование) - Результаты - Как запустить код (зависимости, инструкции) - Ключевые контакты
37Написание Dockerfile для Flask API
(the trained model file) Dockerfile должен: 1. Начинаться с базового образа
38Создание простого эндпоинта Flask API
, который принимает POST-запросы с JSON-полезной нагрузкой. Скрипт должен: 1. Загрузить предварительно обученную модель scikit-learn из файла с именем
39Логирование метрик модели с помощью MLflow
Сгенерируй фрагмент скрипта Python, который демонстрирует, как использовать MLflow для отслеживания экспериментов. Скрипт должен: 1. Начать запуск MLflow. 2. Залогировать два параметра: `learning_rate` и `n_estimators`. 3. Залогировать три метрики: `accuracy`, `precision` и `recall`. 4. Залогировать саму обученную модель как артефакт. 5. Завершить запуск.
40Написание рабочего процесса GitHub Actions для CI
), который запускается при каждом push в ветку
41Модульный тест для функции очистки данных
def remove_outliers(df, column_name): Q1 = df[[column_name]].quantile(0.25) Q3 = df[[column_name]].quantile(0.75) IQR = Q3 - Q1 lower_bound = Q1 - 1.5 * IQR upper_bound = Q3 + 1.5 * IQR return df[(df[[column_name]] >= lower_bound) & (df[[column_name]] <= upper_bound)]
42Мониторинг дрейфа данных
, и у меня есть новая партия производственных данных в
43Цепочка: Полный отчет EDA из CSV
. Сначала загрузи его в DataFrame pandas и выполни полное профилирование данных. Определи пропущенные значения, типы данных и базовую статистику для каждого столбца. Покажи мне вывод." **Prompt 2 (after AI responds):** "Спасибо. Основываясь на этом профиле, сгенерируй скрипт Python для очистки данных. Заполни пропущенные значения
44Генерация синтетических данных
: целое число, нормально распределенное вокруг среднего значения 40 со стандартным отклонением 10. -
45Рефакторинг Jupyter Notebook в класс
# Placeholder for Jupyter Notebook code # import pandas as pd # from sklearn.model_selection import train_test_split # from sklearn.linear_model import LogisticRegression # from sklearn.preprocessing import StandardScaler # from sklearn.impute import SimpleImputer # # Load data # df = pd.read_csv('data.csv') # # Simple cleaning # imputer = SimpleImputer(strategy='median') # df[['age']] = imputer.fit_transform(df[[['age']]]) # df.dropna(subset=[['last_purchase_date']], inplace=True) # df[['total_spent']] = df[['total_spent']].replace({r'\$': '', r',': ''}, regex=True).astype(float) # # Feature engineering # df[['is_weekend']] = (pd.to_datetime(df[['order_date']]).dt.dayofweek >= 5).astype(int) # # Model training # X = df[[['age', 'total_spent', 'is_weekend']]] # y = df[['churn']] # X_train, X_test, y_train, y_test = train_test_split(X, y, test_size=0.2, random_state=42) # scaler = StandardScaler() # X_train_scaled = scaler.fit_transform(X_train) # X_test_scaled = scaler.transform(X_test) # model = LogisticRegression(random_state=42) # model.fit(X_train_scaled, y_train) # # Prediction # predictions = model.predict(X_test_scaled) # print(f"Model accuracy: {model.score(X_test_scaled, y_test)}")
46Преобразование скрипта Python в R
import pandas as pd from sklearn.model_selection import train_test_split from sklearn.ensemble import RandomForestClassifier df = pd.read_csv('data.csv') df = df.dropna() X = df[[['feature1', 'feature2']]] y = df[['target']] X_train, X_test, y_train, y_test = train_test_split(X, y, test_size=0.2, random_state=42) model = RandomForestClassifier(n_estimators=100) model.fit(X_train, y_train) print(model.score(X_test, y_test))
47Объяснение результатов модели с помощью контрфактов
), для которого модель предсказала высокую вероятность оттока (0.92). Объясни это предсказание с использованием контрфактического объяснения. Простым языком опиши минимальные изменения в признаках этого клиента (например,
48SQL: Запрос для когортного анализа
. Запрос должен вычислять коэффициент удержания ежемесячных когорт клиентов. Когорта клиента — это месяц его первой покупки. Удержание за данный месяц — это процент клиентов из когорты, совершивших покупку в этом месяце. Вывод должен иметь три столбца:
49Создание интерактивной панели с Plotly
[['date', 'region', 'sales', 'product_category']]
50Написание скрипта Dask для большого CSV-файла
), который не помещается в память pandas. Задача состоит в том, чтобы вычислить среднее значение

Как пользоваться промптами для профессии: наука о данных

Четыре шага, около минуты. Промпт даёт структуру, вы — детали.

1

Выберите промпт

Каждый промпт написан под конкретную задачу, а не как общий шаблон «действуй как эксперт». Просмотрите заголовки и возьмите тот, что совпадает с вашей задачей.

2

Скопируйте и вставьте

Нажмите «Копировать» и вставьте текст целиком в ChatGPT, Claude, Gemini или тот ассистент, за который вы уже платите. Здесь ничто не привязано к одной модели.

3

Заполните скобки

Перед отправкой замените каждый [Заполнитель в скобках] своими данными. Именно отсюда берётся качество: промпт даёт структуру, вы — детали.

4

Загляните в источник

Ссылка «Источник» под каждым промптом открывает полную статью: почему промпт устроен именно так, на чём его проверяли и с какими инструментами он сочетается.

Частые вопросы

Вопросы, которые возникают перед тем, как вставить такой промпт в настоящую работу.

Эти промпты можно использовать бесплатно?

Да. Все 50 промптов на этой странице можно копировать и использовать с любым ИИ-ассистентом, включая ChatGPT, Claude и Gemini. Нужен только аккаунт в одном из этих сервисов.

Как пользоваться этими промптами по направлению «наука о данных»?

Скопируйте текст кнопкой «Копировать», вставьте его в свой ИИ-ассистент и перед отправкой замените заполнители в скобках — например [Ваш город] или [Название компании] — своими данными.

Откуда взяты эти промпты?

Каждый промпт взят из проверенного руководства Zekai. Ссылка «Источник» под промптом ведёт к полной статье, где объяснены логика и способ проверки.

Можно ли править эти промпты?

Обязательно. Считайте каждый отправной структурой: уточните инструкции, добавьте свои ограничения и оставьте вариант, который даёт лучший результат. Скобки отмечают то, что нужно менять всегда.

Библиотеки промптов для других профессий

Тот же формат, другая работа — начиная с самых близких к направлению «наука о данных».

Zekai первым в Google