Исходный размер 840x1264

Анализ и визуализация данных для задачи скоринговой модели

Обложка: генерация при помощи Leonardo.ai

Рубрикатор

  1. Цель проекта
  2. Введение
  3. Библиотеки и загрузка данных
  4. Проверка на пустые значения и типы данных
  5. Обработка данных
  6. Гипотезы
  7. Изучение данных 7.1. Целевая переменная 7.1. Возраст 7.1. Образование 7.1. Corr 7.1. Доход
  8. Анализ важных атрибутов
  9. Заключение
  10. Блокнот с кодом
  11. Источники

Цель проекта:

Цель проекта — создать эффективную скоринговую модель для прогнозирования дефолтов среди вторичных клиентов банка. Для этого мы проанализируем множество переменных, характеризующих профиль заемщиков, используя данные из набора «[SF-DST] Credit Scoring» с платформы Kaggle.

Набор данных включает атрибуты, такие как уровень образования, пол, возраст, наличие автомобиля, количество отказов по прошлым заявкам и многие другие. Эти признаки помогут построить точную модель, предсказывающую вероятность дефолта.

Введение:

Были выбраны данные из набора «[SF-DST] Credit Scoring» на платформе Kaggle. Этот набор содержит разнообразные атрибуты заемщиков, такие как уровень образования, пол, возраст, наличие автомобиля, количество отказов по прошлым заявкам, доход, количество запросов в БКИ, и другие важные показатели.

Анализ этих данных представляет особую ценность, поскольку позволяет построить скоринговую модель, способную предсказать вероятность дефолта заемщиков. Это важно для банков, так как помогает им минимизировать риски, связанные с выдачей кредитов. Понимание факторов, влияющих на дефолт, может значительно улучшить процессы принятия решений и повысить финансовую стабильность банка.

В анализе данных использовались различные виды графиков: линейные графики, гистограммы, столбчатые диаграммы, сложенные графики, тепловая карта, boxplot

Описание полей:

client_id - идентификатор клиента education - уровень образования sex - пол заемщика age - возраст заемщика car - наличие автомобиля car_type - флаг иностранного автомобиля decline_app_cnt - количество отклоненных заявок в прошлом good_work - флаг наличия "хорошей" работы bki_request_cnt - количество запросов в БКИ home_address - категория домашнего адреса work_address - категория рабочего адреса income - доход заемщика foreign_passport - наличие заграничного паспорта sna - связь заемщика с клиентами банка first_time - возраст наличия информации о заемщике score_bki - скоринговый балл по данным БКИ region_rating - рейтинг региона app_date - дата подачи заявки default - флаг дефолта по кредиту

Библиотеки и загрузка данных

Исходный размер 753x207
Исходный размер 1695x468

Проверка на пустые значения и типы данных

Проверка на пустые значения необходима, в данном случае в колонке education отсутствует ряд данных.

Исходный размер 1045x397

В колонке education отсутствует ряд данных.

При этом можно заметить, что большинство колонок содержат типы данных int64.

Исходный размер 1178x505

Обработка данных

Рассчитаем в процентном соотношении количество пропусков: data['education'].isnull().sum() / data.shape[0]100

Разрыв в графе «Образование» составляет около 41,599%

Заменим их на самые часто встречаемые результаты в выборке: ed_mode = data['education'].mode()[0] data['education'] = data['education'].fillna(ed_mode)

Гипотезы

  1. Возраст Быстрый ответ «хороших» заемщиков больше по сравнению с «плохими» заемщиками (распределение возраста в зависимости от флага дефолта смещено вверх при default=0).

  2. Уровень образования зависит от возраста, что также влияет на погашение кредита. Люди с более высоким образованием чаще являются «хорошими» заемщиками.

  3. При good_work = 0 риск дефолта по кредиту увеличивается (флаг дефолта).

  4. Доход «хороших» заемщиков выше по сравнению с «плохими» заемщиками (распределение доходов в зависимости от флага дефолта смещено вверх при default=0).

  5. score_bki напрямую коррелирует с default: чем ниже score_bki, тем выше вероятность того, что клиент погасит кредит банку.

Изучение данных: целевая переменная

Исходный размер 1241x642

Превалирование платежеспособных клиентов: Большинство клиентов, 87.3%, не допускают дефолта. Это указывает на то, что большая часть заемщиков успешно обслуживает свои кредиты.

Риск дефолта: Около 12.7% клиентов допустили дефолт, что является значительным показателем, требующим внимания.

Изучение данных: возраст

Исходный размер 631x547

График плотности распределения возраста (Age) для двух групп заемщиков: тех, кто не имеет дефолта (default 0), и тех, кто имеет дефолт (default 1).

Кривые показывают, что заемщики без дефолта (default 0) имеют слегка смещенное распределение возраста в сторону более старших возрастов по сравнению с заемщиками с дефолтом (default 1). Это подтверждает гипотезу, что «хорошие» заемщики в среднем старше «плохих» заемщиков.

На графике плотности видно, что кривая для заемщиков без дефолта (default 0) имеет пик немного правее и выше по сравнению с кривой для заемщиков с дефолтом (default 1). Это также указывает на то, что возраст заемщиков без дефолта в среднем выше.

Исходный размер 1069x425
  1. Модальный возраст (наиболее часто встречающийся возраст):

Модальный возраст заемщиков без дефолта (default 0) составляет 31 год. Модальный возраст заемщиков с дефолтом (default 1) составляет 26 лет.

Это подтверждает, что среди заемщиков без дефолта чаще встречаются люди старше, чем среди заемщиков с дефолтом.

  1. Средний возраст:

Средний возраст заемщиков без дефолта (default 0) составляет 39.39 лет. Средний возраст заемщиков с дефолтом (default 1) составляет 38.53 года.

Эти данные показывают, что средний возраст заемщиков без дефолта немного выше среднего возраста заемщиков с дефолтом. В разделе "default" наблюдаются небольшие различия по возрасту, гипотеза подтверждается

Изучение данных: образование

Исходный размер 669x549

Анализ возрастного параметра к уровню образования.

Анализ и визуализация данных для задачи скоринговой модели
Проект создан 25.09.2024
Мы используем файлы cookies для улучшения работы сайта НИУ ВШЭ и большего удобства его использования. Более подробную...
Показать больше