赛题名:企业非法集资风险预测
背景:非法集资严重干扰了正常的经济、金融秩序,使参与者遭受经济损失,甚至生活陷入困境,极易引发社会不稳定和大量社会治安问题,甚至引发局部地区的社会动荡。如何根据大量的企业信息建立预测模型并判断企业是否存在非法集资风险,对监管部门、企业合作伙伴、投资者都具有一定的价值。
任务:利用机器学习、深度学习等方法训练一个预测模型,该模型可学习企业的相关信息,以预测企业是否存在非法集资风险。赛题的难点在于数据集包括大量的企业相关信息,如何从中提取有效的特征并进行风险预测成为本赛题的关键问题。
出题单位:中科大智慧城市研究院
数据集里提供了多个表格数据,
本 baseline 只基于基础表 base_info.csv 进行特征处理和建模
- 缺失值简单用中值填充处理
- 去掉冗余和无作用的特征
- 类别变量做了 label encoding 和 frequency encoding;
- 五折 LGB, eval_metric 采用 f1
成绩:线下 0.835, 线上 0.825 左右