什么是决策树回归?——用逻辑推理代替复杂公式
决策树回归(Decision Tree Regression)是监督学习中一种经典的非线性回归模型,其核心思想是通过递归地划分特征空间,将连续型输出变量(目标变量)的预测转化为一系列简单的二元判断(如“面积 > 100?”、“层高 ≥ 2.8?”)。与线性回归强制拟合全局直线不同,决策树回归能够自适应地捕捉数据中的局部模式,尤其适用于特征与目标之间存在非线性关系、分段关系或交互效应的场景。
我们可以将其类比为一个“分步式问答系统”:面对一个待预测样本,模型不会一次性输出结果,而是像医生问诊一样,逐层提问关键问题,每一步根据特征值选择分支路径,最终到达某个叶子节点,该节点的平均目标值即为预测结果。这种结构天然具备可解释性——每一条预测路径都清晰可见,用户可以直观理解模型为何做出某一判断。
咖啡豆是阿拉比卡还是罗布斯塔?
→ 是阿拉比卡 → 2. 是否为单一产地?
→ 是单一产地 → 3. 烘焙度是浅焙还是中焙?
→ 浅焙 → 价格区间:¥45–¥55
→ 中焙 → 价格区间:¥38–¥48
→ 否 → 价格区间:¥28–¥35
正如您所见,决策树回归并非依赖一个全局公式(如 y = ax + b + cx²),而是构建一棵“逻辑树”,用一系列嵌套的 if-else 规则完成预测。这使得它在需要向业务方解释预测依据的场景中(如信贷风控、医疗辅助诊断、房价评估)具有不可替代的优势。
值得强调的是:决策树回归的目标函数是均方误差(MSE),每一步划分都力求使子节点内的目标值尽可能接近(即方差最小),从而提升预测精度。这一原则与分类树使用基尼指数或信息增益本质一致,只是评估指标从离散类别转向连续数值。