集成学习
- Bagging:独立的集成多个模型,每个模型有一定的差异,最终综合有差异的模型的结果,获得学习的最终的结果;
- Boosting(增强集成学习):集成多个模型,每个模型都在尝试增强(Boosting)整体的效果;
- Stacking(堆叠):集成 k 个模型,得到 k 个预测结果,将 k 个预测结果再传给一个新的算法,得到的结果为集成系统最终的预测结果;
什么是 Gradient Boosting
答:一种集成学习方法,由多个弱学习器串联,每个学习器的目标是拟合先前累加模型的损失函数的负梯度,使加上该弱学习器后的累积模型损失往负梯度的方向减少。
GDBT 的主要思想
答:是 Gradient Boosting 的一个具体实现,主要思想是通过迭代地拟合当前模型对残差进行优化,然后将新拟合的模型与之前的模型进行加权组合,逐步改进预测结果,对异常值具有一定的鲁棒性,并能够处理混合特征类型的数据。然而,GBDT 对于数据集中的噪声较敏感,容易导致过拟合
请设计一个实验
对比测试单一的决策树算法(LDA,LR)与基于决策树(LDA,LR)的 AdaBoosting、GDBT 算法在分类任务上的性能差异。实验中的数据集可以是坐标类的模拟数据,也可以是任何公开数据。
津哥给的第一题的答案
Gradient Boosting 是一种集成学习方法,通过设定损失函数并利用梯度下降法对当前累加模型进行调整,从而训练一个新的学习器来直接拟合梯度。
而 Gradient Boosting Decision Trees(GBDT)是 Gradient Boosting 的一种具体实现。
GBDT 的主要思想是通过迭代地拟合当前模型对残差进行优化,然后将新拟合的模型与之前的模型进行加权组合,逐步改进预测结果。
GBDT 能够通过多次迭代不断改进模型的性能,以减小残差并提高预测准确性。
它对异常值具有一定的鲁棒性,并能够处理混合特征类型的数据。然而,GBDT 对于数据集中的噪声较敏感,容易导致过拟合。