Киноиндустрия занимает важное место в мировой индустрии развлечений и продолжает активно развиваться. Успех фильмов формируется под влиянием различных факторов, таких как жанр, продолжительность, возрастная классификация, режиссёр, актёрский состав, а также отклик аудитории, выраженный через рейтинги и количество голосов. Анализ этих характеристик позволяет выявить закономерности, связанные с популярностью и оценкой фильмов зрителями.
Визуальное оформление
При офрмлении визуализаций я буду использовать фирменный стиль IMDb
Источник данных
Для анализа данных будет использован датасет, содержащий информацию о 5000 фильмах с наивысшими рейтингами на сайте IMDb, размещённый на платформе Kaggle
Перед началом анализа требуется провести дополнительную фильтрацию и сортировку данных с целью повышения их качества и удобства для последующей обработки. На данном этапе будут выявлены и устранены возможные пропуски, а также приведены к единому формату ключевые параметры датасета. Это позволит обеспечить корректность анализа и достоверность полученных результатов.
Были выявлены и удалены строки с аномальными значениями в признаке runtime, которые не соответствовали формату продолжительности фильма. Кроме того, признаки runtime и gross_earn были очищены от нечисловых символов и приведены к числовым типам данных, что позволяет использовать их в статистическом анализе и визуализациях.
Также была выполнена сортировка данных по убыванию рейтинга фильмов и переопределение индексов, что упростило дальнейшую работу с датасетом. В результате проведённых преобразований был получен очищенный и структурированный набор данных, пригодный для последующего разведочного анализа.
Неграфический и графический анализ количественных признаков
Сначала мы взяли столбец с доходами фильмов и сохранили его отдельно, чтобы с ним было удобнее работать. Потом посмотрели на максимальные и минимальные значения и заметили, что есть фильмы с доходом 0, поэтому мы их исключили, чтобы не искажать результаты.
Дальше мы посчитали средний доход и медиану, чтобы понять, какой доход типичен для фильма, и посмотрели на разные процентили — это помогает увидеть, как распределены доходы и где сосредоточено большинство фильмов.
В итоге, с помощью функции describe() мы получили сводную статистику: минимальные и максимальные доходы, среднее, стандартное отклонение и квартильные значения — то есть полный портрет распределения доходов фильмов.»
Если мы попробуем построиить диаграмму "ящик с усами" с помощью метода boxplot(). Мы увидим, диаграмма пустая. Это связано с наличием пропущенных значений по признаку. Очистим клонку от пустых значений с помощью dropna и попробуем заново построить "ящик с усами"
Попробуем построить гистограмму с помощью метода hist (), чтобы посмотреть на распределение признака.
Гистограмма показывает, достаточно большой размах в данных, что подтверждается и показателями описательной статистики (min и max). Ограничем графический анализ 10 процентилем снизу и 90 процентилем сверху, тем самым обработав часть выбросов, и заново построим гистограмму передав в нее параметр bins=20 для лучшей визуализации
Выводы
Размах значений оказался очень большим от 0 до 936 у.е
Нулевых значений не так много. Можно их исключить из анализа.
Если вы хотите знать, какой доход имеют большинство фильмов, вы можете посмотреть на медиану (50-й процентиль).
Если вам интересно, какой доход имеют самые успешные 10% фильмов, вы можете посмотреть на 90-й процентиль.
Пример
Представьте, что у вас есть 100 фильмов, и вы хотите понять, как распределены их доходы. Процентили помогут вам увидеть: 10% фильмов зарабатывают меньше 0.797. 25% фильмов зарабатывают меньше 7.0. 50% фильмов зарабатывают меньше 28.345. 75% фильмов зарабатывают меньше 63.04. 90% фильмов зарабатывают меньше 121.968
Ящик с усами не дает полного понятия о распределении признака поэтому использовали гистограмму, далее обработав часть выбросов и увелича кол-во интервалов можем лучше провести анализ распределения признака.
Неграфический и графический анализ категориальных признаков




