The short answer
Лучшие AI-подсказки для специалистов по данным точно определяют задачу, контекст и желаемый формат вывода для генерации пригодного к использованию кода и анализа, а не дают расплывчатые советы. Эффективные подсказки предоставляют ИИ бизнес-контекст, структуру данных и четкие инструкции для таких задач, как очистка данных, разведочный анализ данных (EDA), разработка признаков и интерпретация моделей.
Общие подсказки, такие как «проанализируйте эти данные», тратят время впустую. Ценность специалиста по данным заключается в формулировании проблемы и проверке результатов, но генеративный ИИ может значительно ускорить промежуточные механические шаги — если вы дадите ему правильные инструкции. Расплывчатые запросы приводят к созданию общего, часто некорректного кода. Конкретные, контекстно-обогащенные подсказки создают функциональные скрипты, глубокий анализ и четкие визуализации.
В этом руководстве представлено 50 проверенных на практике подсказок, организованных в соответствии с рабочим процессом в области науки о данных. Мы разработали их таким образом, чтобы их можно было копировать, вставлять и настраивать для ваших конкретных наборов данных и задач. ZEKAI независимо оценивает инструменты и рабочие процессы; наша цель — предоставить практические ресурсы для работающих профессионалов в области ИИ и науки о данных. Эти подсказки лучше всего работают в продвинутых разговорных AI-помощниках или блокнотах, предназначенных для анализа данных, таких как Julius AI, но могут быть адаптированы для любой мощной большой языковой модели (LLM).
Aggregate Productivity Source: stlouisfed.org
Самостоятельно заявленная экономия времени благодаря генеративному ИИ приводит к увеличению совокупной производительности труда на 1,1%, при этом работники в компьютерных и математических профессиях сообщают о наибольшей экономии времени.
Почему общие AI-подсказки неэффективны для специалистов по данным
Большинство руководств по AI-подсказкам предлагают простые шаблоны с одной {variable}. Этот подход не работает в науке о данных, потому что контекст так же важен, как и команда. Эффективная подсказка для специалиста по данным действует как техническое задание для младшего аналитика. Она должна включать:
- Ролевая игра: Скажите ИИ действовать как конкретная персона (например, «Действуй как старший специалист по данным, специализирующийся на прогнозировании временных рядов»).
- Контекст: Объясните бизнес-цель. Вы пытаетесь снизить отток клиентов, прогнозировать запасы или обнаруживать мошенничество?
- Схема данных: Предоставьте имена столбцов, типы данных и примеры значений.
- Четкие инструкции: Подробно опишите точные шаги (например, «заполнить пропущенные значения в столбце ‘age’ с использованием медианы»).
- Формат вывода: Укажите желаемый формат вывода: скрипт Python, DataFrame pandas, визуализация Matplotlib, объект JSON или краткое изложение на простом английском языке.
Без такого уровня детализации ИИ просто гадает. Он не знает, что user_id — это первичный ключ, что revenue указан в центах или что данные искажены. Специфичность — это разница между рабочим скриптом и разочаровывающей галлюцинацией.
Подсказки для очистки и предварительной обработки данных
Подготовка данных часто занимает большую часть времени проекта. Эти подсказки ускоряют выявление и исправление распространенных проблем с качеством данных.
Действуй как аналитик качества данных. Я предоставляю тебе DataFrame pandas с именем `df`. Его схема следующая: `[ВСТАВЬТЕ СХЕМУ ИЛИ ВЫВОД HEAD() СЮДА]`.
Твоя задача — выполнить комплексное профилирование данных. Для каждого столбца предоставь:
1. Тип данных.
2. Количество и процент пропущенных значений.
3. Количество уникальных значений (кардинальность).
4. Для числовых столбцов: среднее, медиана, стандартное отклонение, минимум и максимум.
5. Для категориальных столбцов: список уникальных значений и их частоты.
6. Определи любые столбцы, которые, по-видимому, имеют неправильный тип (например, даты, хранящиеся как объекты).
Представь вывод в виде таблицы Markdown.
содержит пропущенные значения. Вот вывод
Сгенерируй скрипт Python, который использует метод межквартильного диапазона (IQR) для выявления выбросов в следующих числовых столбцах DataFrame pandas `df`: `[СПИСОК_ЧИСЛОВЫХ_СТОЛБЦОВ]`.
Скрипт должен:
1. Вычислить Q1, Q3 и IQR для каждого указанного столбца.
2. Определить верхнюю и нижнюю границы (Q1 - 1.5 * IQR, Q3 + 1.5 * IQR).
3. Создать новый DataFrame, содержащий только строки, в которых есть выбросы в любом из указанных столбцов.
4. Вывести форму исходного DataFrame и DataFrame с выбросами.
. Следующие столбцы нуждаются в исправлении типов данных:
-
. Я хочу проверить дубликаты на основе подмножества столбцов:
, которая принимает строку и выполняет следующие шаги по очистке текста:
1. Преобразует текст в нижний регистр.
2. Удаляет все знаки препинания.
3. Удаляет числовые цифры.
4. Удаляет общие английские стоп-слова.
5. Проводит стемминг оставшихся слов с использованием стеммера Портера.
Функция должна возвращать очищенную строку. Включи импорты из
Подсказки для разведочного анализа данных (EDA)
После очистки данных EDA помогает выявить закономерности, проверить гипотезы и направить разработку признаков.
Source: mckinsey.com
По состоянию на начало 2024 года 65% организаций сообщили о регулярном использовании генеративного ИИ, что почти вдвое больше, чем в предыдущем году, что свидетельствует о значительном переходе от экспериментов к интеграции.
, сгенерируй набор графиков Python для одномерного анализа.
Для каждого числового столбца в
Сгенерируй код Python для вычисления матрицы корреляции Пирсона для числовых столбцов в моем DataFrame pandas `df`. Столбцы: `[СПИСОК_ЧИСЛОВЫХ_СТОЛБЦОВ]`.
Затем выполни следующее:
1. Создай тепловую карту матрицы корреляции с использованием seaborn. Аннотируй значения на тепловой карте.
2. Определи и перечисли все пары переменных с коэффициентом корреляции больше 0.7 или меньше -0.7.
3. Для 3 наиболее коррелированных пар предоставь однопредложенческую гипотезу о том, почему они могут быть коррелированы.
.
Для каждой числовой переменной сгенерируй ящичную диаграмму, которая сравнивает ее распределение по различным категориям
с индексом datetime и столбцом с именем
.
Сгенерируй скрипт Python, который:
1. Стандартизирует эти два столбца с использованием
со столбцами широты и долготы с именами
Подсказки для разработки признаков
Создание правильных признаков часто является ключом к производительности модели. ИИ может помочь в мозговом штурме и реализации идей признаков.
[ОТРАСЛЬ, например, электронной коммерции]
. Сгенерируй скрипт Python, который создает следующие новые признаки из этого столбца:
- Год
- Месяц
- День недели (как число, 0=понедельник)
- День года
- Неделя года
- Бинарный флаг
Сгенерируй код Python для создания признаков взаимодействия для модели машинного обучения. Мой DataFrame pandas `df` имеет следующие числовые признаки: `[СТОЛБЕЦ_A, СТОЛБЕЦ_B, СТОЛБЕЦ_C]`. Создай все попарные признаки взаимодействия (например, A*B, A*C, B*C). Добавь эти новые признаки в DataFrame.
для one-hot кодирования следующих категориальных столбцов в моем DataFrame
. Сгенерируй код Python для создания нового столбца
индексирован по дате и имеет целевой столбец
Подсказки для выбора и построения модели
ИИ может написать шаблонный код для обучения и оценки нескольких моделей, позволяя вам сосредоточиться на интерпретации результатов.
Действуй как специалист по AutoML. У меня есть предварительно обработанный набор данных с признаками `X` и бинарной целевой переменной `y`. Сгенерируй полный скрипт Python, который обучает и оценивает три различные базовые модели классификации:
1. Логистическая регрессия
2. Классификатор случайного леса
3. Классификатор градиентного бустинга (с использованием LightGBM)
Для каждой модели скрипт должен:
- Использовать 5-кратную перекрестную проверку.
- Вычислить и вывести средние значения Accuracy, Precision, Recall и F1-score.
- Сохранить результаты в DataFrame pandas для удобного сравнения.
из scikit-learn.
Моя матрица признаков —
признаков.
Архитектура сети должна быть:
- Входной слой с
для рабочего процесса машинного обучения. Конвейер должен состоять из следующих шагов:
1. Заполнить пропущенные числовые значения с использованием
, содержащий одномерный временной ряд. Сгенерируй скрипт Python с использованием
для построения простой рекомендательной модели коллаборативной фильтрации пользователь-элемент.
Предположим, у меня есть DataFrame pandas
Подсказки для оценки и интерпретации модели
Модель бесполезна, если вы не можете объяснить ее производительность и прогнозы.
. Сгенерируй код Python с использованием
Используя `y_test` (истинные метки) и `y_pred_proba` (предсказанные вероятности для положительного класса из моего классификатора), сгенерируй скрипт Python, чтобы:
1. Вычислить оценку AUC (площадь под кривой).
2. Построить ROC-кривую (рабочая характеристика приемника).
3. Включить диагональную линию, представляющую случайный классификатор для сравнения.
4. Пометить график оценкой AUC.
. Я хочу объяснить одно предсказание для конкретного экземпляра
У меня есть обученная модель `RandomForestClassifier` с именем `model`. Мои признаки имеют имена `[СПИСОК_ИМЕН_ПРИЗНАКОВ]`. Сгенерируй код Python для извлечения важности признаков из модели, сопоставления их с их именами и создания горизонтальной столбчатой диаграммы, показывающей 15 наиболее важных признаков.
sklearn.inspection.permutation_importance
. Сгенерируй скрипт Python с использованием
Подсказки для объяснения результатов и отчетности
Передача результатов нетехническим заинтересованным сторонам — это критически важный навык. ИИ может помочь в составлении резюме и создании удобных для бизнеса визуализаций.
[ЦЕЛЕВАЯ_ПЕРЕМЕННАЯ, например, 'отток сотрудников']
Ниже приведен скрипт Python, который генерирует график. После скрипта я опишу график. Твоя задача — написать краткую, однопараграфную интерпретацию этого вывода для бизнес-аудитории. Избегай технического жаргона.
`[PASTE PYTHON PLOT SCRIPT]`
График показывает столбчатую диаграмму, где клиенты в категории поддержки «Уровень 1» имеют средние ежемесячные расходы в $150, в то время как клиенты в категории «Уровень 3» имеют средние расходы в $45.
Теперь напиши бизнес-резюме.
с результатами A/B-теста. Он имеет столбцы
Действуй как аналитик данных. Составь электронное письмо для продуктовой команды с отчетом о результатах A/B-теста для новой функции «Оформление заказа в один клик».
Основные выводы:
- Коэффициент конверсии контрольной группы: 3.5%
- Коэффициент конверсии тестовой группы (с функцией): 4.8%
- Результат статистически значим с p-значением 0.002.
- Тест проводился в течение 14 дней с 50 000 пользователей в каждой группе.
Структурируй электронное письмо с четкой темой, кратким изложением результата, ключевыми цифрами и рекомендацией по внедрению функции.
Объясни концепцию «переобучения» в машинном обучении так, как если бы ты объяснял ее директору по продажам. Используй аналогию. Держи объяснение в пределах 150 слов.
Сгенерируй шаблон Markdown для файла README проекта по науке о данных. Шаблон должен включать следующие разделы:
- Название проекта
- Бизнес-проблема
- Источник данных
- Методология (очистка данных, EDA, моделирование)
- Результаты
- Как запустить код (зависимости, инструкции)
- Ключевые контакты
Подсказки для MLOps и продакшна
ИИ может помочь с инженерными задачами, необходимыми для развертывания и мониторинга моделей. Именно здесь преуспевают такие платформы, как Azure Machine Learning, но AI-подсказки могут скриптовать многие компоненты.
(the trained model file)
Dockerfile должен:
1. Начинаться с базового образа
, который принимает POST-запросы с JSON-полезной нагрузкой.
Скрипт должен:
1. Загрузить предварительно обученную модель scikit-learn из файла с именем
Сгенерируй фрагмент скрипта Python, который демонстрирует, как использовать MLflow для отслеживания экспериментов. Скрипт должен:
1. Начать запуск MLflow.
2. Залогировать два параметра: `learning_rate` и `n_estimators`.
3. Залогировать три метрики: `accuracy`, `precision` и `recall`.
4. Залогировать саму обученную модель как артефакт.
5. Завершить запуск.
), который запускается при каждом push в ветку
def remove_outliers(df, column_name):
Q1 = df[column_name].quantile(0.25)
Q3 = df[column_name].quantile(0.75)
IQR = Q3 - Q1
lower_bound = Q1 - 1.5 * IQR
upper_bound = Q3 + 1.5 * IQR
return df[(df[column_name] >= lower_bound) & (df[column_name] <= upper_bound)]
, и у меня есть новая партия производственных данных в
Продвинутые и цепочечные подсказки
Объединяйте подсказки для выполнения многошагового рабочего процесса. Именно здесь ИИ переходит от простого генератора кода к аналитическому партнеру.
. Сначала загрузи его в DataFrame pandas и выполни полное профилирование данных. Определи пропущенные значения, типы данных и базовую статистику для каждого столбца. Покажи мне вывод."
**Prompt 2 (after AI responds):** "Спасибо. Основываясь на этом профиле, сгенерируй скрипт Python для очистки данных. Заполни пропущенные значения
: целое число, нормально распределенное вокруг среднего значения 40 со стандартным отклонением 10.
-
# Placeholder for Jupyter Notebook code
# import pandas as pd
# from sklearn.model_selection import train_test_split
# from sklearn.linear_model import LogisticRegression
# from sklearn.preprocessing import StandardScaler
# from sklearn.impute import SimpleImputer
# # Load data
# df = pd.read_csv('data.csv')
# # Simple cleaning
# imputer = SimpleImputer(strategy='median')
# df['age'] = imputer.fit_transform(df[['age']])
# df.dropna(subset=['last_purchase_date'], inplace=True)
# df['total_spent'] = df['total_spent'].replace({r'\$': '', r',': ''}, regex=True).astype(float)
# # Feature engineering
# df['is_weekend'] = (pd.to_datetime(df['order_date']).dt.dayofweek >= 5).astype(int)
# # Model training
# X = df[['age', 'total_spent', 'is_weekend']]
# y = df['churn']
# X_train, X_test, y_train, y_test = train_test_split(X, y, test_size=0.2, random_state=42)
# scaler = StandardScaler()
# X_train_scaled = scaler.fit_transform(X_train)
# X_test_scaled = scaler.transform(X_test)
# model = LogisticRegression(random_state=42)
# model.fit(X_train_scaled, y_train)
# # Prediction
# predictions = model.predict(X_test_scaled)
# print(f"Model accuracy: {model.score(X_test_scaled, y_test)}")
import pandas as pd
from sklearn.model_selection import train_test_split
from sklearn.ensemble import RandomForestClassifier
df = pd.read_csv('data.csv')
df = df.dropna()
X = df[['feature1', 'feature2']]
y = df['target']
X_train, X_test, y_train, y_test = train_test_split(X, y, test_size=0.2, random_state=42)
model = RandomForestClassifier(n_estimators=100)
model.fit(X_train, y_train)
print(model.score(X_test, y_test))
), для которого модель предсказала высокую вероятность оттока (0.92).
Объясни это предсказание с использованием контрфактического объяснения. Простым языком опиши минимальные изменения в признаках этого клиента (например,
.
Запрос должен вычислять коэффициент удержания ежемесячных когорт клиентов. Когорта клиента — это месяц его первой покупки. Удержание за данный месяц — это процент клиентов из когорты, совершивших покупку в этом месяце.
Вывод должен иметь три столбца:
['date', 'region', 'sales', 'product_category']
), который не помещается в память pandas. Задача состоит в том, чтобы вычислить среднее значение
Что дальше
Три маршрута, подобранные на основе того, что вы только что прочли.
Как написать хорошую AI-подсказку для анализа данных?
О: Хорошая подсказка предоставляет четкий контекст. Она должна указывать ИИ, какую персону принять (например, «действуй как аналитик данных»), определять бизнес-цель, предоставлять схему данных (имена и типы столбцов), давать четкие пошаговые инструкции и указывать точный формат вывода, который вам нужен (например, код Python, таблица Markdown, JSON).
Можно ли использовать ChatGPT для науки о данных?
О: Да, ChatGPT и другие большие языковые модели являются мощными помощниками в науке о данных. Они превосходно генерируют шаблонный код для очистки и анализа, отлаживают скрипты, объясняют сложные концепции, составляют отчеты и переводят код между языками, такими как Python и R. Однако это инструменты, которые требуют человеческого контроля для обеспечения достоверности и точности результатов.
Какие AI-подсказки лучше всего подходят для очистки данных?
О: Лучшие подсказки для очистки данных очень специфичны. Вместо «очисти данные» используйте подсказки, такие как: «Сгенерируй скрипт Python для заполнения пропущенных значений в столбце ‘age’ медианой» или «Напиши код для удаления символов валюты и запятых из столбца ‘price’ и преобразования его в число с плавающей точкой».
Как ИИ может помочь с разведочным анализом данных (EDA)?
О: ИИ может значительно ускорить EDA, генерируя код для визуализаций. Вы можете попросить его создать сетку гистограмм для всех числовых столбцов, тепловую карту корреляции для выявления взаимосвязей или ящичные диаграммы для сравнения распределений по категориям. Это автоматизирует наиболее трудоемкую часть EDA, позволяя вам сосредоточиться на интерпретации закономерностей.
Заменит ли ИИ специалистов по данным?
О: Нет, не ожидается, что ИИ заменит специалистов по данным, но он меняет эту роль. ИИ автоматизирует повторяющиеся задачи, такие как написание шаблонного кода и первоначальное профилирование данных, освобождая специалистов для сосредоточения на более ценной работе: формулировании проблем, экспериментальном дизайне, интерпретации сложных результатов и передаче выводов заинтересованным сторонам. Работа развивается в сторону более стратегического надзора и меньшего ручного кодирования.
Что дальше
Три маршрута, подобранные на основе того, что вы только что прочли.
Источники (16)
- Goldman Sachs. (2023, April 5). *Generative AI could raise global GDP by 7%*. https://www.goldmansachs.com/insights/articles/generative-ai-could-raise-global-gdp-by-7-percent
- Goldman Sachs. (2024, May 13). *AI is showing «very positive» signs of eventually boosting GDP and productivity*.
- Goldman Sachs. (2025, August 13). *How Will AI Affect the Global Workforce?*. https://www.goldmansachs.com/insights/articles/how-will-ai-affect-the-global-workforce
- Goldman Sachs. (2025, July 3). *AI Agents to Boost Productivity and Size of Software Market*. https://www.goldmansachs.com/insights/articles/ai-agents-to-boost-productivity-and-size-of-software-market
- Dataversity. (2024, May 1). *The Impact of Generative AI on Data Science*. https://www.dataversity.net/articles/the-impact-of-generative-ai-on-data-science/
- Goldman Sachs. (2023, November 7). *AI may start to boost US GDP in 2027*. https://www.goldmansachs.com/insights/articles/ai-may-start-to-boost-us-gdp-in-2027
- 365 Data Science. (2026, April 23). *Data Scientist Job Outlook 2026: Trends, Salaries, and Skills*. https://365datascience.com/career-advice/career-guides/data-scientist-job-outlook-2025/
- Pragmatic Institute. *AI Prompts for Data Scientists*. https://www.pragmaticinstitute.com/resources/articles/data/ai-prompts-for-data-scientists/
- CASRAI. (2026, August 25). *Julius AI for Research Data: A Careful Guide*. https://casrai.org/guides/julius-ai-for-research-data-analysis
- McKinsey & Company. (2026, August 25). *The State of AI: Global Survey 2026*.
- McKinsey & Company. (2021, December 8). *Global survey: The state of AI in 2021*. https://www.mckinsey.com/capabilities/quantumblack/our-insights/global-survey-the-state-of-ai-in-2021
- Medium. (2024, July 17). *Top 20+ Generative AI Prompts for Data Scientists and Analysts*.
- McKinsey & Company. (2024, July 22). *What Businesses Can Learn from McKinsey’s 2024 Global Survey on AI Adoption*. https://business.purdue.edu/daniels-insights/posts/2024/global-survey-on-ai-adoption.php
- Reddit. (2025, December 12). *Should I pursue Data Science in 2026, or is the field at risk because of AI?*.
- Federal Reserve Bank of St. Louis. (2025, February 27). *The Impact of Generative AI on Work Productivity*. https://www.stlouisfed.org/on-the-economy/2025/feb/impact-generative-ai-work-productivity
- McKinsey & Company. (2024, May 30). *The state of AI in early 2024: Gen AI adoption spikes and starts to generate value*.
Zekai первым в Google
Еженедельный ИИ-дайджест для вашей профессии
Одно письмо в неделю: изменения в ИИ, которые действительно касаются вашей профессии — сервисы, скидки и что с этим делать.

