机器学习:交叉验证、下采样、过采样(银行贷款案例)

发布时间:2026/7/31 4:31:34

机器学习:交叉验证、下采样、过采样(银行贷款案例)
一、前言今天系统学习了逻辑回归在金融风控中的实战应用核心解决银行贷款预测中最经典的问题数据集类别不平衡 模型评估不准。在银行贷款数据中绝大多数用户正常还款负样本/多数类极少数用户违约坏账正样本/少数类如果直接训练模型逻辑回归会“摆烂”直接预测全部为不违约准确率很高、但是完全没有业务价值。因此今天重点掌握了三个核心工具下采样对多数样本做减法过采样SMOTE对少数样本做加法交叉验证稳定评估模型、选择最优参数二、业务场景为什么贷款数据必须做采样1. 类别不平衡问题银行贷款是极度不平衡二分类任务。逻辑回归的损失函数是全局平均损失样本数量多的类别会主导训练过程导致模型严重偏向多数类预测不违约违约样本识别率极低召回率差看似准确率很高实际风控完全失效2. 普通划分数据集的缺陷单纯 train_test_split 一次划分结果随机性大无法代表模型真实水平所以必须引入K 折交叉验证。三、三大核心技术原理1. 交叉验证K 折 CV核心作用避免单次数据集划分的偶然性稳定评估模型泛化能力自动筛选逻辑回归最优正则参数 C有效检测过拟合2. 下采样欠采样—— 减少多数类样本原理随机抽取部分正常用户样本让正负样本比例 1:1。优点训练速度快、彻底平衡样本、解决模型偏置。缺点丢失大量正常客户信息容易欠拟合。适用大数据量场景。3. 过采样SMOTE—— 扩增少数类样本原理不是简单复制违约样本而是根据近邻特征合成全新违约样本。优点不丢失任何原始数据、缓解过拟合、提升少数类识别能力。缺点极少数样本时容易生成虚假数据。适用金融风控主流首选方案。四、注意严禁全局采样正确流程先划分训练集、测试集只对训练集做下采样/过采样测试集保持原始真实分布原因测试集必须模拟真实业务场景不能人为平衡否则评估结果虚高、上线翻车。五、完整代码下采样 交叉验证import pandas as pd import numpy as np import matplotlib.pyplot as plt from sklearn.preprocessing import StandardScaler from sklearn.model_selection import train_test_split, cross_val_score from sklearn.linear_model import LogisticRegression from sklearn.metrics import confusion_matrix, classification_report 绘制混淆矩阵 def cm_plot(y, yp): cm confusion_matrix(y, yp) plt.matshow(cm, cmapplt.cm.Blues) plt.colorbar() for x in range(len(cm)): for y in range(len(cm)): plt.annotate(cm[x, y], xy(y, x), hacenter, vacenter) plt.ylabel(True label) plt.xlabel(Predicted label) return plt 1. 读取数据与预处理 data pd.read_csv(r./creditcard.csv) scaler StandardScaler() data[Amount] scaler.fit_transform(data[[Amount]]) data data.drop([Time], axis1) 2. 划分训练集、测试集 X data.drop(Class, axis1) y data[Class] x_train, x_test, y_train, y_test train_test_split(X, y, test_size0.2, random_state0) 3. 下采样平衡训练集 train_data x_train.copy() train_data[Class] y_train major train_data[train_data[Class] 0] minor train_data[train_data[Class] 1] major_down major.sample(len(minor), random_state0) train_bal pd.concat([major_down, minor]) x_train_bal train_bal.drop(Class, axis1) y_train_bal train_bal[Class] 4. 交叉验证选最优 C c_list [0.01, 0.1, 1, 10, 100] scores [] for c in c_list: lr LogisticRegression(Cc, max_iter1000) res cross_val_score(lr, x_train_bal, y_train_bal, cv8, scoringrecall) scores.append(res.mean()) print(fC{c}, 召回率均值: {res.mean():.4f}) best_c c_list[np.argmax(scores)] print(最优惩罚因子 C:, best_c) 5. 训练模型 lr_final LogisticRegression(Cbest_c, max_iter1000) lr_final.fit(x_train_bal, y_train_bal) 评估 train_pred lr_final.predict(x_train_bal) print(训练集报告) print(classification_report(y_train_bal, train_pred)) cm_plot(y_train_bal, train_pred).show() test_pred lr_final.predict(x_test) print(测试集报告) print(classification_report(y_test, test_pred, digits6)) cm_plot(y_test, test_pred).show()六、完整代码过采样 SMOTE 交叉验证import pandas as pd import numpy as np import matplotlib.pyplot as plt from sklearn.preprocessing import StandardScaler from sklearn.model_selection import train_test_split, cross_val_score from sklearn.linear_model import LogisticRegression from sklearn.metrics import confusion_matrix, classification_report from imblearn.over_sampling import SMOTE def cm_plot(y, yp): cm confusion_matrix(y, yp) plt.matshow(cm, cmapplt.cm.Blues) plt.colorbar() for x in range(len(cm)): for y in range(len(cm)): plt.annotate(cm[x, y], xy(y, x), hacenter, vacenter) plt.ylabel(True label) plt.xlabel(Predicted label) return plt 数据预处理 data pd.read_csv(r./creditcard.csv) scaler StandardScaler() data[Amount] scaler.fit_transform(data[[Amount]]) data data.drop([Time], axis1) X data.drop(Class, axis1) y data[Class] x_train, x_test, y_train, y_test train_test_split(X, y, test_size0.2, random_state0) SMOTE 过采样 smote SMOTE(random_state0) os_x_train, os_y_train smote.fit_resample(x_train, y_train) 交叉验证调参 c_list [0.01, 0.1, 1, 10, 100] scores [] for c in c_list: lr LogisticRegression(Cc, max_iter1000) res cross_val_score(lr, os_x_train, os_y_train, cv8, scoringrecall) scores.append(res.mean()) print(fC{c}, 召回率均值: {res.mean():.4f}) best_c c_list[np.argmax(scores)] print(最优惩罚因子 C:, best_c) 训练评估 lr_final LogisticRegression(Cbest_c, max_iter1000) lr_final.fit(os_x_train, os_y_train) train_pred lr_final.predict(os_x_train) print(过采样训练集报告) print(classification_report(os_y_train, train_pred)) cm_plot(os_y_train, train_pred).show() test_pred lr_final.predict(x_test) print(原始测试集报告) print(classification_report(y_test, test_pred, digits6)) cm_plot(y_test, test_pred).show()七、下采样 VS 过采样 对比方法核心思路优点缺点贷款场景推荐下采样删减多数类训练快、分布均衡丢失样本信息、易欠拟合大数据量可用SMOTE 过采样合成少数类不丢数据、效果更好少量样本易造伪数据金融场景首选交叉验证多折训练取平均评估稳定、精准调参计算量增大必用八、今日学习总结银行贷款预测是典型的不平衡二分类问题直接建模只会追求高准确率毫无业务意义。下采样通过删减多数样本平衡数据过采样 SMOTE通过合成少数样本优化模型。交叉验证解决模型评估不稳定、参数选择盲目问题是建模的标准流程。工业级最重要准则先划分数据集、再训练集采样、测试集绝对保真杜绝数据泄露。

相关新闻

STM32F103外部晶振从8MHz升级16MHz:硬件匹配、软件配置与系统验证全攻略

STM32F103外部晶振从8MHz升级16MHz:硬件匹配、软件配置与系统验证全攻略

2026/7/31 4:31:34

1. 从8MHz到16MHz:一次看似简单却暗藏玄机的时钟升级最近在调试一块基于STM32F103C8T6的老项目板子,手头正好缺8MHz的晶振,翻箱倒柜只找到几颗16MHz的。一个念头冒出来:能不能直接把外部晶振从8MHz换成16MHz来用?毕竟S…

C++11核心特性实战指南:从auto到智能指针的现代编程

C++11核心特性实战指南:从auto到智能指针的现代编程

2026/7/31 4:31:34

1. 项目概述:为什么C11值得你投入时间?如果你还在用着老旧的C98标准,或者对C的印象还停留在“复杂”、“难用”、“内存管理噩梦”的阶段,那C11对你来说,可能是一次认知上的彻底刷新。我刚开始接触C11时,感…

UART与USART核心区别:从异步通信到同步通信的硬件设计解析

UART与USART核心区别:从异步通信到同步通信的硬件设计解析

2026/7/31 4:31:34

1. 项目概述:从“串口”说起,为何要区分UART和USART?搞嵌入式开发或者玩单片机的朋友,对“串口”这个词肯定不陌生。它就像设备之间最基础的“对话”通道,调试信息输出、模块数据交换、固件升级,哪一样都离…

AI排名实时快报:竞品动态分析

AI排名实时快报:竞品动态分析

2026/7/31 5:21:36

AI排名实时快报:竞品动态分析繁淼信息——企业AI可见度综合健康度仅为59.6/100,竞争力57.5/100,可信度31.2/100。本报告基于多引擎数据,深度解析竞品真实提及量与空白查询率,为企业提供排名优化策略。市场格局&#xf…

挖矿木马深度解析:从原理、检测到防御的完整实战指南

挖矿木马深度解析:从原理、检测到防御的完整实战指南

2026/7/31 5:21:36

1. 项目概述:当你的电脑成为“矿工”你可能遇到过这样的情况:电脑风扇突然狂转,CPU占用率莫名其妙冲到100%,但任务管理器里又找不到哪个程序在“作妖”。或者,电脑变得异常卡顿,打开个文档都要等半天&#…

零成本基建系列——如何在没有云服务器的情况下用codex+vitepress+cloudflare pages搭建自己的网站

零成本基建系列——如何在没有云服务器的情况下用codex+vitepress+cloudflare pages搭建自己的网站

2026/7/31 5:21:36

为什么不自己买云服务器?首先,当然是不想花钱。而且自己部署云服务器还得考虑安全等因素,运维起来也挺麻烦和耗精力的。 我自己对 UI 设计天然不擅长,网站需要长什么样其实没有概念。同时又不想花太多时间去开发网站,…

Word转PDF终极评测:四大方法对比与场景化选择指南

Word转PDF终极评测:四大方法对比与场景化选择指南

2026/7/31 5:21:36

1. 从一次“论文提交”事故说起前几天,我的一位同事差点因为一份格式错乱的PDF文件,搞砸了一个重要的项目申报。他花了一整天在Word里精心排版,图表、页眉页脚、公式都完美无缺,最后点击“另存为PDF”,信心满满地发了出…

浏览器实时交互技术:Manus的WebAssembly与WebRTC实践

浏览器实时交互技术:Manus的WebAssembly与WebRTC实践

2026/7/31 5:21:36

1. Manus浏览器内实时人机交互技术解析当我在Chrome开发者工具中第一次看到Manus的交互数据流时,确实被这种无延迟的响应机制震撼到了。这项技术本质上是通过WebAssembly和WebRTC的混合架构,在浏览器沙箱环境中实现了原本需要原生应用才能完成的高精度交…

超辐射发光二极管(SLD)原理、应用与选型全解析

超辐射发光二极管(SLD)原理、应用与选型全解析

2026/7/31 5:11:36

1. 项目概述:从“配角”到“主角”的超辐射光源在光电子领域,提到光源,大家首先想到的往往是激光器(LD)和发光二极管(LED)。前者方向性好、亮度高,后者成本低、寿命长。但你是否遇到…

[具身智能-649]:个人电脑搭建 RTSP 服务完整方案(Windows / Ubuntu 双平台,适配 RDK X5 rtsp2display 调试)

[具身智能-649]:个人电脑搭建 RTSP 服务完整方案(Windows / Ubuntu 双平台,适配 RDK X5 rtsp2display 调试)

2026/7/30 9:53:22

目标:电脑作为RTSP 服务端,循环推送 H264/H265 视频流; RDK X5 通过 rtsp2display 拉流预览,完全不需要在开发板编译 live555。 提供两套成熟方案: ✅ 方案 A:FFmpeg(最简单,优先推…

PDF合并与动态水印的工程化方案:2026国内免费工具实测对比

PDF合并与动态水印的工程化方案:2026国内免费工具实测对比

2026/7/30 1:17:46

一、背景与测试方案 在实际项目交付中,PDF文件合并与版权保护水印的叠加是一个高频但容易被低估的技术需求。典型的处理链路涉及:多源PDF的文件流合并、页面级水印渲染(含透明度混合与图层叠加)、输出文件体积控制。看似简单的操作…

PDF拆分压完图糊了?2026国内免费实测,档案员都在用的组合方案

PDF拆分压完图糊了?2026国内免费实测,档案员都在用的组合方案

2026/7/30 2:52:37

说实话,提到PDF拆分再压缩,我真是被折腾得够呛。 上个月公司年度合同归档,一份300多页的PDF总合同,需要按年份拆分成三个独立文件,再分别压缩到10MB以内方便邮件发送各部门确认。我心想这还不简单?先找个海…

2026优质EMBA择校榜单:校友圈质量高的EMBA适配民企创始人

2026优质EMBA择校榜单:校友圈质量高的EMBA适配民企创始人

2026/7/31 0:01:23

【客观独立测评】深耕商科教育测评多年,聚焦民企创始人、科创企业实控人择校痛点,避开镀金空壳、课程脱节、圈层杂乱的踩坑问题,结合真实办学数据与学员口碑,整理出适配实业高管的高性价比EMBA榜单,理性分析各项目适配…

绝区零一条龙:5分钟快速上手的终极自动化助手

绝区零一条龙:5分钟快速上手的终极自动化助手

2026/7/31 0:01:23

绝区零一条龙:5分钟快速上手的终极自动化助手 【免费下载链接】ZenlessZoneZero-OneDragon 绝区零 一条龙 | 全自动 | 自动闪避 | 自动每日 | 自动空洞 | 支持手柄 项目地址: https://gitcode.com/gh_mirrors/ze/ZenlessZoneZero-OneDragon 绝区零一条龙是一…

2026民企老板EMBA择校榜单:人脉圈广的EMBA高性价比测评

2026民企老板EMBA择校榜单:人脉圈广的EMBA高性价比测评

2026/7/31 0:01:23

【客观中立测评声明】本文基于学费成本、课程落地、圈层纯度、长期赋能四大维度实测打分,无商业洗脑吹捧,仅为民企创始人、科创高管提供真实择校参考,规避镀金踩坑陷阱。不少民营企业家读EMBA容易踩两大坑:盲目追名校排名&#xf…