1 损失函数的理解与区分
如何理解并区分误差(error)/损失(loss)/成本(cost)/目标(objective)函数?
- 误差函数描述的是预测值与真实值的偏差:$y_{pred}-y_{true}$
- 损失函数是对预测误差的负面影响的量化,比如平方误差损失认为3个单位的误差会导致9个单位的负面影响;损失函数通常是针对单个样本的描述
- 损失函数是成本函数的一部分,成本函数通常是针对训练集的描述,既包含所有样本的损失,也包含针对模型复杂度的惩罚(正则项)
- 成本函数是
作者文章归档:王半仙
如何理解并区分误差(error)/损失(loss)/成本(cost)/目标(objective)函数?
常用特征处理:
更多时序类衍生特征可参考1_study/Python/Python 数据处理/tsfresh 时序特征聚合工具
其他特征处理技巧:
preprocessing.PolynomialFeatures)pandas.cut)前置知识:树算法族
核心思想:三个臭皮匠顶个诸葛亮
集成学习三步走
- 特征抽取
- 反复建模(弱学习器)
- 模型集成(强学习器)
最终的预测输出 = 若干个弱学习器的预测输出的平均
最终的预测输出 = 若干个弱学习器的预测输出的投票结果
- 常见的几种投票法
- 相对多数投票
决策树通过树结构存储判断流程和规则,实现复杂规则的有效记录
一般来说,树的非叶节点存储了判断逻辑,并通过树分支表达多个判断结果 通过自上而下的多层逻辑判断,最终在叶节点输出预测的分类结果
决策树示例:

ID3算法主要利用信息增益进行特征的选择,并通过递归方法构建特征
面对$N$个形式为$(x_i,y_i)$样本组成的样本集,线性回归就是为了寻找形式为$y_{N\times1}=X_{N \times d}\theta_{d\times 1}$的线性方程,使其能最大程度拟合样本,而第一步便是建立线性回归的损失函数/目标函数: $$Loss(\theta)= (y-X\theta)^T(y-X\theta) $$
其中$y$表示真实值,$X\theta$表示的预测值,所以损失函数$Loss(\theta)$表示的便是真实
大部分机器学习模型的构建都是寻找最小损失函数的过程,而梯度下降法(Gradient Descent)便是一种常见迭代优化算法,用于寻找损失最小的参数解。
以简单二次函数为例进行算法的简单说明,模型形式
坐标下降法(英语:coordinate descent)是一种非梯度优化算法。算法在每次迭代中,在当前点处沿一个坐标方向进行一维搜索以求得一个函数的局部极小值。在整个过程中循环使用不同的坐标方向。对于不可拆分的函数而言,算法可能无法在较小的迭代步数中求得最优解。

为了加速收敛,可以采用一个适当的坐标系,例如通过主成分分析获得一个坐标间尽可能不相互关联的新坐标系,即自适应坐标下降法。
支持向量机(support vector machine,简称为SVM)
SVM 算法图解:

SVM 借助核技巧将输入隐式映射到高维特征空间中,从而有效地进行非线性分类
常见的核函数:
| 核函数 | 表达式 | 备注 |
|---|---|---|
| Linear Kerne |