逻辑回归是一种分类算法,尽管名字中有”回归”,但它主要用于解决二分类问题(也可以扩展到多分类)。
核心思想
- 将线性回归的输出值,通过一个Sigmoid函数映射到 (0, 1) 区间
- 输出值表示样本属于某一类别的概率
- 当概率 ≥ 0.5 时预测为正类,否则为负类
数学公式
z = w₁x₁ + w₂x₂ + ... + wₙxₙ + b (线性组合)
h(z) = 1 / (1 + e^(-z)) (Sigmoid函数)
P(y=1|x) = h(z) (输出概率)
| 要素 |
说明 |
| Sigmoid函数 |
将所有实数映射到 (0, 1),形成概率 |
| 决策边界 |
z = 0(即 h(z) = 0.5)时为分类分界线 |
| 损失函数 |
对数损失(Log Loss),不同于回归的 MSE |
2.为什么用逻辑回归而不是线性回归?
| 对比项 |
线性回归 |
逻辑回归 |
| 输出范围 |
(-∞, +∞) |
(0, 1) |
| 适用任务 |
回归预测 |
分类 |
| 损失函数 |
MSE |
对数损失 |
| 激活函数 |
无 |
Sigmoid |
3.应用场景
1. 二分类场景
| 领域 |
应用示例 |
说明 |
| 金融 |
信用评分、贷款违约预测 |
预测用户是否会违约 |
| 医疗 |
疾病诊断(患病/健康) |
基于症状、检查指标预测患病概率 |
| 营销 |
用户购买预测、客户流失预测 |
预测用户是否会购买产品或流失 |
| 风控 |
欺诈检测 |
识别交易是否为欺诈 |
| 广告 |
点击率预测(CTR) |
预测用户是否会点击广告 |
2. 扩展场景
- 多分类逻辑回归:使用 Softmax 函数扩展到多个类别
- 排序问题:结合 Pairwise、Listwise 方法用于信息检索、推荐系统
4.优缺点
| 优点 |
缺点 |
| 实现简单,计算效率高 |
对非线性问题拟合能力弱 |
| 输出具有概率意义,可解释性强 |
需要特征工程处理非线性关系 |
| 训练速度快,适合大规模数据 |
对异常值敏感 |
| 可作为基线模型 |
假设特征与log-odds呈线性关系 |