1. Главная
  2. Библиотека
  3. Анализ хозяйственной деятельности
  4. Вы аналитик данных в сети кафе-мороженых "Холодное насл...
Разбор задачи

Вы аналитик данных в сети кафе-мороженых "Холодное наслаждение". Компания имеет точки продаж в популярном приморском курортном городе. Руководство хочет более точно планировать закупки и распределение персонала, основываясь на прогнозах продаж. Имеющиеся

  • Предмет: Анализ хозяйственной деятельности
  • Автор: Кэмп
  • #Регрессионный анализ и корреляционный анализ
  • #Прикладная эконометрика
Вы аналитик данных в сети кафе-мороженых "Холодное наслаждение". Компания имеет точки продаж в популярном приморском курортном городе. Руководство хочет более точно планировать закупки и распределение персонала, основываясь на прогнозах продаж. Имеющиеся

Условие:

Вы аналитик данных в сети кафе-мороженых "Холодное наслаждение". Компания имеет точки продаж в популярном приморском курортном городе. Руководство хочет более точно планировать закупки и распределение персонала, основываясь на прогнозах продаж.

Имеющиеся данные представляют собой статистику продаж мороженого за последние несколько лет. Переменная x соответствует времени (в месяцах, но при сборе данных произошла ошибка - число в этом столбце означает смещение по времени относительно некоторой точки отсчета), а y — объему продаж в тысячах единиц.

Ваша задача — построить модель регрессии, которая сможет точно прогнозировать объем продаж мороженого в зависимости от времени.

Напишите функцию regression(train_file, submit_file, output_file), которая выполняет задачу регрессии (обучает модель и делает предсказания).

Параметры функции\ntrain_file (str): путь к CSV файлу с размеченными данными (обучающая выборка). В файле есть следующие колонки:\nid (int): идентификатор записи\nx (float): время в месяцах\ny (float): объем продаж в тысячах единиц\nsubmit_file (str): путь к CSV файлу с неразмеченными данными (тестовая выборка). В файле есть следующие колонки:\nid (int): идентификатор записи\nx (float): время в месяцах\noutput_file (str): путь к файлу, в который необходимо сохранить предсказания. Этот файл должен содержать колонки:\nid (int): идентификатор записи\ny (float): прогнозируемый объем продаж в тысячах единиц

Решение:

Шаг 1. Импорт библиотек. Для удобной работы с данными используются библиотеки pandas и numpy, для построения модели – scikit-learn. Применим Pipeline для объединения этапов подготовки данных и обучения модели. Так же воспользуемся классом PolynomialFeatures для генерации полиномиальных признаков, что позволяет учесть не‐линейную зависимость между временем (x) и объемом продаж (y). Для устойчивости к переобучению используем Ridge-регрессию.

Шаг 2. Загрузка обучающих данных. Читаем CSV-файл с данными, выделяем x в виде двумерной матрицы (так требуется scikit-learn) и y как вектор...

Внутри — полный разбор, аргументация, алгоритм решения, частые ошибки и как отвечать на каверзные вопросы препода, если спросит

Попробуй решить по шагам

Попробуй один шаг и продолжи в режиме обучения или посмотри готовое решение

Какой подход используется в данном решении для учета нелинейной зависимости между временем и объемом продаж?

Что нужно знать по теме:

Что нужно знать по теме

Алгоритм решения

Топ 3 ошибок

Что спросит препод

Выбери предмет