决策树学习
决策树学习是统计学、数据挖掘和机器学习中使用的一种预测建模方法。它使用决策树作为,从样本的观测数据(对应决策树的分支)推断出该样本的预测结果(对应决策树的叶节点)。 按预测结果的差异,决策树学习可细分两类。(1)分类树,其预测结果仅限于一组离散数值。树的每个分支对应一组由逻辑与连接的分类特征,而该分支上的叶节点对应由上述特征可以预测出的分类标签。(2)回归树,其预测结果为连续值(例如实数)。 在决策分析中,一棵可视的决策树可以向使用者形…
共 7 篇文章
决策树学习是统计学、数据挖掘和机器学习中使用的一种预测建模方法。它使用决策树作为,从样本的观测数据(对应决策树的分支)推断出该样本的预测结果(对应决策树的叶节点)。 按预测结果的差异,决策树学习可细分两类。(1)分类树,其预测结果仅限于一组离散数值。树的每个分支对应一组由逻辑与连接的分类特征,而该分支上的叶节点对应由上述特征可以预测出的分类标签。(2)回归树,其预测结果为连续值(例如实数)。 在决策分析中,一棵可视的决策树可以向使用者形…
ID3算法(Iterative Dichotomiser 3 迭代二叉树3代)是一个由Ross Quinlan发明的用于决策树的算法。 这个算法是建立在奥卡姆剃刀的基础上:越是小型的决策树越优于大的决策树(简单理论)。尽管如此,该算法也不是总是生成最小的树形结构。而是一个启发式算法。奥卡姆剃刀阐述了一个信息熵的概念: : I_{E}(i) = - \sum^{m}_{j=1} f (i,j) \log_{2} f (i, j). 这个I…
在機器學習中,隨機森林是一個包含多個決策樹的分類器,並且其輸出的類別是由個別樹輸出的類別的眾數而定。 這個術語是1995年由貝爾實驗室的所提出的隨機決策森林(random decision forests)而來的。这篇文章描述了一种结合随机节点优化和bagging,利用类CART过程构建不相关树的森林的方法。此外,本文还结合了一些已知的、新颖的、构成了现代随机森林实践的基础成分,特别是 使用out-of-bag误差来代替泛化误差 通过排…
剪枝()是机器学习与搜索算法当中通过移除决策树中分辨能力较弱的節點而减小决策树大小的方法。剪枝降低了模型的复杂度,因此能够降低过拟合风险,从而降低泛化误差。 在决策树算法中,决策树过大会有过拟合的风险,从而在新样本上的泛化性能很差;决策树过小则无法从样本空间中获取重要的结构化信息。然而,由于很难判断新增一个额外的分裂结点能否显著降低误差,人们很难判断何时停止决策树的生长是恰当的。该问题被称为。一个通用的策略是让决策树一直生长,直到每个叶…
梯度提升,亦稱作梯度增强,是一种用于回归和分类问题的机器学习技术。其产生的预测模型是弱预测模型的集成,如采用典型的决策树作为弱预测模型,这时则为梯度提升树(或)。像其他提升方法一样,它以分阶段的方式构建模型,但它通过允许对任意可微分损失函数进行优化作为对一般提升方法的推广。 梯度提升技術源自於於1997年時將提升方法用於优化算法的观察。随后於1999年時提出了显式回归梯度增强算法。Llew Mason、Jonathan Baxter、P…
决策论中 (如风险管理),决策树()由一个决策图和可能的结果(包括资源成本和风险)组成, 用来创建到达目标的规划。决策树建立并用来辅助决策,是一种特殊的树结构。决策树是一个利用像树一样的图形或决策模型的决策支持工具,包括随机事件结果,资源代价和实用性。它是一个算法显示的方法。决策树经常在运筹学中使用,特别是在决策分析中,它帮助确定一个能最可能达到目标的策略。如果在实际中,决策不得不在没有完备知识的情况下被在线采用,一个决策树应该平行概率…
C4.5算法是由开发的用于产生决策树的算法。该算法是对Ross Quinlan之前开发的ID3算法的一个扩展。C4.5算法产生的决策树可以被用作分类目的,因此该算法也可以用于统计分类。 C4.5算法与ID3算法一样使用了信息熵的概念,并和ID3一样通过学习数据来建立决策树。 在Springer LNCS于2008年发表的优秀论文中,该算法在前10大数据挖掘算法中排名第一,之后使得它变得非常受欢迎。 算法 C4.5跟ID3一样,使用信息熵…