Оценка точности и производительности моделей машинного обучения для прогнозирования оттока клиентов страховой компании
Проведено комплексное сравнительное исследование нескольких алгоритмов машинного обучения для задачи прогнозирования оттока клиентов страховой компании на данных открытого датасета. Уделено внимание как качественным метрикам точности моделей, так и вычислительной эффективности. Актуальность темы обусловлена высокой конкуренцией на страховом рынке и значительными затратами, связанными с потерей клиентов; своевременное выявление намерения клиента прекратить сотрудничество позволяет компании принять меры для его удержания. Цель исследования – оценить точность и производительность различных моделей машинного обучения, способных предсказать отток клиентов. В экспериментах использованы открытые данные о клиентах страховой компании (индустрия страхования жизни) с признаками, характеризующими их страховые случаи, исторические записи и факт оттока. Добавлен анализ факторов: исследованы корреляции между признаками и целевой переменной, выполнен факторный анализ и оценена важность признаков, влияющих на отток. По результатам, почти все модели продемонстрировали одинаково высокое качество прогноза благодаря наличию доминирующего фактора риска оттока, однако различались по производительности: логистическая регрессия и градиентный бустинг обучаются на порядок быстрее по сравнению с методом опорных векторов и случайным лесом, при значительно меньшем объеме памяти. Полученные результаты подтверждают, что современные ансамблевые алгоритмы способны обеспечить высокую точность прогнозирования оттока клиентов при разумных затратах ресурсов. Их использование целесообразно для страховых компаний с целью своевременного выявления клиентов группы риска, например, клиентов с крупными страховыми выплатами и принятия проактивных мер по удержанию таких клиентов. A comprehensive comparative study of several machine learning algorithms for predicting customer churn in an insurance company was conducted using data from an open dataset. Both predictive quality metrics and computational efficiency were examined. The topic is relevant due to intense competition in the insurance market and the substantial costs of losing customers; early detection of a customer’s intention to leave enables targeted retention actions. The aim of the study is to assess the accuracy and performance of different machine-learning models capable of predicting churn. The experiments used open data on insurance customers (life-insurance industry) containing features that describe claim events, historical records, and the churn outcome. We also added factor analysis: correlations between features and the target variable were investigated, factor analysis was performed, and feature importance related to churn was evaluated. The results show that most models achieved similarly high predictive quality due to the presence of a dominant churn-risk factor, but differed in performance: logistic regression and gradient boosting trained an order of magnitude faster than support vector machines and random forests while using substantially less memory. These findings confirm that modern ensemble algorithms can provide high-accuracy churn prediction at reasonable resource costs. Their use is advisable for insurers to promptly identify high-risk clients, such as those with large claims, and to take proactive measures to retain them.
Paper
The full text of this publication is not hosted on 44B due to licensing.
Read it at OpenAlex