Открываю файл с данными за год. 87 тысяч строк. Excel умирает на фильтрах, Power Query крутит спиннер уже четвёртую минуту, а мне нужно понять, в каком месяце клиенты уходят чаще всего. Я делаю то, что делал последние три года — открываю второй экземпляр Excel и надеюсь, что на этот раз повезёт.
Не везёт.
Знакомо? Мне — очень. Именно поэтому я наконец сел и разобрался, как перейти с Excel на Python, используя ИИ-помощник как подстраховку. Спешу поделиться, что из этого вышло.
Почему Excel перестал справляться
Я работаю с данными с 2019 года. Не как программист — как аналитик, который умеет в формулы и сводные таблицы. Excel был моим основным инструментом. Настоящим, рабочим, не «показываю презентацию в понедельник и забываю».
Но потом объёмы выросли. Потом появились файлы, которые весят больше 500 мегабайт. Потом мне сказали: «Загрузи данные из API, смержи с таблицей, посчитай конверсию по когортам — к утру». А Excel не умеет в API. И когорты в нём — это больно.
Я попробовал Pandas. Полез в туториал, увидел строчки кода, закрыл и пошёл делать в Excel. Потом повторил. Потом ещё раз. Месяца два я так ходил по кругу.
А потом попробовал с ИИ-помощником.
Что изменил Copilot
GitHub Copilot подсказывает код. Это звучит просто, но эффект — другой. Ты не читаешь документацию, ты просто пишешь словами, что хочешь сделать, и получаешь работающий код.
Допустим, у меня задача: из CSV-файла выбрать строки, где выручка больше 10 000, сгруппировать по месяцу и посчитать среднее. В голове я формулирую это так: «прочитай файл data.csv, отфильтруй где revenue > 10000, сгруппируй по month, возьми mean по revenue». Copilot превращает это в рабочий код почти с первой попытки:
import pandas as pd
df = pd.read_csv('data.csv')
result = df[df['revenue'] > 10000].groupby('month')['revenue'].mean()
print(result)
Одной строкой. То, на что в Excel ушло бы полчаса с VLOOKUP и промежуточными вычислениями.
Конечно, с первого раза всё не бывает. Первые раз пять я получал ерунду — потому что писал слишком абстрактно. Работает правило: чем конкретнее описываешь данные и задачу, тем точнее подсказка. «Посчитай среднее» — неплохо. «Посчитай среднее выручки (колонка revenue) по месяцам для заказов дороже 10 000» — значительно лучше.
Что реально делает Python + Copilot быстрее
Сравню конкретно, потому что абстрактные «это ускоряет работу» — пустые слова.
Очистка данных. В Excel я делал это вручную: искал пустые ячейки, правил дубликаты, менял формат дат. На большом файле — это два часа. На Python: одна функция dropna(), одна fillna() с подходящим значением, парсинг даты через pd.to_datetime(). Код пишется за пять минут, выполняется за секунды. Повторяется — мгновенно.
Визуализация. Excel-графики хороши для отчётов, но не для исследования. В Python matplotlib и seaborn строят картинки за минуту. А если хочешь интерактивный график — Plotly. Передал данные, указал тип графика, сохранил HTML. Можно открыть в браузере, приблизить любой участок, посмотреть конкретные значения. Для анализа — не сравнить.
Повторяемость. Вот где Excel реально проигрывает. Сделал анализ в таблице, через месяц данные обновились — переделывай руками. Python-скрипт запускается одной командой. Заменил файл, выполнил код — получил новый результат. Это не мелочь, это разница между «тратить субботу на отчёт» и «тратить десять минут на запуск скрипта».
Где я споткнулся
Честно будет рассказать и о граблях.
Первая — попытался сразу перенести все свои задачи на Python. Это ошибка. Я сел делать в Pandas то, что быстрее делается в Excel: простой подсчёт, быстрая сортировка, визуальная проверка данных. Python хорош для объёмов и автоматизации. Для разовых простых задач — overkill.
Вторая — игнорировал ошибки. Copilot выдаёт код, который выглядит правильно, но падает на реальных данных. Пустые значения, неожиданные типы, кириллица в названиях колонок. Каждый раз приходилось разбираться, почему не работает. Это нормально, но поначалу раздражает.
Третья — не сохранял скрипты. Первые недели я писал код в блокноте Jupyter, закрывал, забывал. Потом та же задача — заново. Сейчас у меня есть папка scripts/ с файлами типа revenue_by_month.py, и это экономит мне нервы.
С чего начать, если ты тоже на Excel
Вот что я рекомендую, исходя из собственного опыта:
Начни с Jupyter Notebook. Это среда, где код выполняется построчно, можно посмотреть результат каждой операции. Установка через Anaconda — десять минут, полчаса максимум.
Освой три вещи: чтение файла (pd.read_csv), базовую фильтрацию (df[df['column'] > value]), группировку (df.groupby()). Этого хватит на 60 процентов задач аналитика.
Используй Copilot, но не слепо. Смотри, что он предлагает, читай код, задавай вопросы: «почему он написал именно так». Через пару недель начнёшь понимать логику Pandas — и подсказки станут точнее, потому что ты лучше формулируешь задачу.
Не бросай Excel. Используй его там, где он хорош: быстрые проверки, визуальная отчётность, разовые простые операции. Python — для масштаба и автоматизации.
Итого
За два месяца Python стал моим основным инструментом для задач, где Excel спотыкается. Copilot убрал порог входа — мне не нужно помнить синтаксис каждой функции. Я описываю задачу, получаю решение, разбираюсь в нём, адаптирую.
Excel я не удалил. Но открываю его теперь раз в неделю, а не каждый день. И это, наверное, главное, что стоит знать: переход не требует стать программистом. Требует сесть и попробовать — с нормальной поддержкой, а не с пустым редактором.
Если хочешь, чтобы я разобрал конкретную задачу из твоей работы — пиши в комментариях. Попробуем вместе.
