决策树学习
决策树学习是统计学、数据挖掘和机器学习中使用的一种预测建模方法。它使用决策树作为,从样本的观测数据(对应决策树的分支)推断出该样本的预测结果(对应决策树的叶节点)。 按预测结果的差异,决策树学习可细分两类。(1)分类树,其预测结果仅限于一组离散数值。树的每个分支对应一组由逻辑与连接的分类特征,而该分支上的叶节点对应由上述特征可以预测出的分类标签。(2)回归树,其预测结果为连续值(例如实数)。 在决策分析中,一棵可视的决策树可以向使用者形…
共 23 篇文章
决策树学习是统计学、数据挖掘和机器学习中使用的一种预测建模方法。它使用决策树作为,从样本的观测数据(对应决策树的分支)推断出该样本的预测结果(对应决策树的叶节点)。 按预测结果的差异,决策树学习可细分两类。(1)分类树,其预测结果仅限于一组离散数值。树的每个分支对应一组由逻辑与连接的分类特征,而该分支上的叶节点对应由上述特征可以预测出的分类标签。(2)回归树,其预测结果为连续值(例如实数)。 在决策分析中,一棵可视的决策树可以向使用者形…
在模式识别领域中,最近鄰居法(KNN算法,又譯K-近邻算法)是一种用于分类和回归的無母數統計方法,由美国统计学家伊芙琳·费克斯和小約瑟夫·霍奇斯于1951年首次提出,后来由扩展。在这两种情况下,输入包含特徵空間中的k个最接近的训练样本。 : 在k-NN分类中,输出是一个分类族群。一个对象的分类是由其邻居的“多数表决”确定的,k个最近邻居(k为正整数,通常较小)中最常见的分类决定了赋予该对象的类别。若k = 1,则该对象的类别直接由最近的…
多层感知器(,缩写:MLP)是一种前向结构的人工神经网络,映射一组输入向量到一组输出向量。MLP可以被看作是一个有向图,由多个的节点层所组成,每一层都全连接到下一层。除了输入节点,每个节点都是一个带有非线性激活函数的神经元(或称处理单元)。一种被称为反向传播算法的监督学习方法常被用来训练MLP。多层感知器遵循人類神經系統原理,學習並進行數據預測。它首先學習,然後使用權重存儲數據,並使用算法來調整權重並減少訓練過程中的偏差,即實際值和預測…
ID3算法(Iterative Dichotomiser 3 迭代二叉树3代)是一个由Ross Quinlan发明的用于决策树的算法。 这个算法是建立在奥卡姆剃刀的基础上:越是小型的决策树越优于大的决策树(简单理论)。尽管如此,该算法也不是总是生成最小的树形结构。而是一个启发式算法。奥卡姆剃刀阐述了一个信息熵的概念: : I_{E}(i) = - \sum^{m}_{j=1} f (i,j) \log_{2} f (i, j). 这个I…
在機器學習中,隨機森林是一個包含多個決策樹的分類器,並且其輸出的類別是由個別樹輸出的類別的眾數而定。 這個術語是1995年由貝爾實驗室的所提出的隨機決策森林(random decision forests)而來的。这篇文章描述了一种结合随机节点优化和bagging,利用类CART过程构建不相关树的森林的方法。此外,本文还结合了一些已知的、新颖的、构成了现代随机森林实践的基础成分,特别是 使用out-of-bag误差来代替泛化误差 通过排…
,在机器学习中是一系列以假设特征之间强(朴素)独立下运用贝叶斯定理为基础的简单。 單純貝氏自1950年代已广泛研究,在1960年代初就以另外一个名称引入到文本信息检索界中,它在自动医疗诊断中也有应用。 單純貝氏分类器是高度可扩展的,因此需要数量与学习问题中的变量(特征/预测器)成线性关系的参数。最大似然训练可以通过评估一个封闭形式的表达式来完成,所有这些名称都参考了贝叶斯定理在该分类器的决策规则中的使用,但單純貝氏不(一定)用到贝叶斯方…
在機器學習領域,分類的目標是指將具有相似特徵的对象聚集。而一個線性分類器則透過特徵的線性組合來做出分類決定,以達到此種目的。对象的特征通常被描述为特征值,而在向量中则描述为特征向量。 定義 如果輸入的特徵向量是實數向量\vec x,則輸出的分數為: :y = f(\vec{w}\cdot\vec{x}) = f\left(\sum_j w_j x_j\right), 其中\vec w是一個權重向量,而f是一個函數,该函数可以通过预先定义…
二次分類器是在機器學習中,使用二次曲面來將物件或事件分成兩個或以上的分類。 它是线性分类器的一般化版本。 分類問題 統計分類考慮一個集合,每一個元素是一個對物件或事件觀察後所得的向量x,每一個都被分成y。 這個集合一般被稱為訓練資料。 問題是在於,要如何決定一個新的觀察項目其最好的類別應是哪一種。 對一個二次分類器,它假設其解會成二次關係,所以y是由以下來決定: : \mathbf{x^T A x} + \mathbf{b^T x} +…
在机器学习中,-{zh-cn:支持向量机; zh-tw:支援向量機; zh-hk:支援向量機;}- (-{zh-cn:台湾称支援向量機; zh-tw:中國大陸稱支持向量机}-,,常简称為SVM,又名支援向量网络,当数据未被标记或者仅一些数据被标记时,支援向量聚类经常在工业应用中用作分类步骤的预处理。 动机 将数据进行分类是机器学习中的一项常见任务。 假设某些给定的数据点各自属于两个类之一,而目标是确定新数据点将在哪个类中。对于支持向量机…
最邻近搜索(Nearest Neighbor Search, NNS)又称为“最近点搜索”(Closest point search),是一个在尺度空间中寻找最近点的优化问题。问题描述如下:在尺度空间M中给定一个点集S和一个目标点q ∈ M,在S中找到距离q最近的点。很多情况下,M为多维的欧几里得空间,距离由欧几里得距离或曼哈顿距离决定。 高德纳在《计算机程序设计艺术》(1973)一书的第三章中称之为邮局问题,即居民寻找离自己家最近的邮…
线性判别分析(,縮寫:LDA)是对费舍尔的线性鉴别方法的归纳,这种方法使用统计学,模式识别和机器学习方法,试图找到两类物体或事件的特征的一个线性组合,以能够特征化或区分它们。所得的组合可用来作为一个线性分类器,或者,更常见的是,为后续的分类做降维处理。 LDA与變異數分析(ANOVA)和迴归分析紧密相关,这两种分析方法也试图透过一些特征或测量值的线性组合来表示一个因变量。然而,變異數分析使用类别型的自变量和连续型的因变量,而判别分析則使…
相关向量机(Relevance vector machine,RVM)是使用贝叶斯推理得到回归和分类的简约解的机器学习技术。RVM的函数形式与支持向量机相同,但是可以提供概率分类。 其与带协方差函数的高斯过程等效。: :k(\mathbf{x},\mathbf{x'}) = \sum_{j=1}^N \frac{1}{\alpha_j} \phi(\mathbf{x},\mathbf{x}_j)\phi(\mathbf{x}',\mat…
梯度提升,亦稱作梯度增强,是一种用于回归和分类问题的机器学习技术。其产生的预测模型是弱预测模型的集成,如采用典型的决策树作为弱预测模型,这时则为梯度提升树(或)。像其他提升方法一样,它以分阶段的方式构建模型,但它通过允许对任意可微分损失函数进行优化作为对一般提升方法的推广。 梯度提升技術源自於於1997年時將提升方法用於优化算法的观察。随后於1999年時提出了显式回归梯度增强算法。Llew Mason、Jonathan Baxter、P…
在数学建模领域,径向基函数网络(Radial basis function network,縮寫 RBF network)是一种使用径向基函数作为激活函数的人工神经网络。径向基函数网络的输出是输入的径向基函数和神经元参数的线性组合。径向基函数网络具有多种用途,包括包括函数近似法、时间序列预测、分类和系统控制。他们最早由布魯姆赫德(Broomhead)和洛維(Lowe)在1988年建立。 径向基函数网络通常有三层:输入层、隐藏层和一个非线…
统计分类(英譯:Statistical classification)是机器学习非常重要的一个组成部分,它的目标是根据已知样本的某些特征,判断一个新的样本属于哪种已知的样本类。分类是监督学习的一个实例,根据已知训练集提供的样本,通过计算选择特征参数,建立判别函数以对样本进行的分类。与之相对的是無監督學習,例如聚类分析。 统计分类机器学习是一种利用统计方法和算法来从数据中学习分类规则的技术。分类是一种预测性分析,目的是将输入数据分配到预定…
基于案例的推理(又称:基于案例推论;英语:Case-based reasoning),以过去解决的类似问题的案例来寻求解决当前新问题的推论方法,常指用“类比推理”的方法进行机器学习解决问题的过程。 应用于:失败预测、失败分析、计划等领域,也在电子商务(售后服务)、个性化服务、重设计(管道、布线设计)中使用。
在机器学习中,多元分类是将实例分配到多个(多于两个)类别中的其中一个(将实例分配到两个类别中的其中一个被称为二分类)。 显然,分类算法可以分为二分类和多分类两种,而多分类算法可以通过将其转化为多个二分类来实现。 需要注意的是,多分类不应和多标签分类相混淆:多标签分类可以为每个实例预测多个标签,即同一个实例可以同时被分配到多个类别。 一般策略 这部分讨论将多分类问题转化为多个二分类问题的策略。 One-vs.-rest one-vs.-r…
AdaBoost為英文"Adaptive Boosting"(自适应增强)的缩写,是一种机器学习方法,由約阿夫·弗羅因德和羅伯特·沙皮爾提出。AdaBoost方法的自适应在于:前一个分类器分错的样本会被用来训练下一个分类器。AdaBoost方法对于噪声数据和异常数据很敏感。但在一些问题中,AdaBoost方法相对于大多数其它学习算法而言,不会很容易出现过拟合现象。AdaBoost方法中使用的分类器可能很弱(比如出现很大错误率),但只要它…
在统计学中,潜在类别模型(latent class model,LCM ),简称潜类模型,将一组观察到的(通常是离散的)多变量变量与一组潜变量联系起来 。LCM是一种潜变量模型 。因为潜在变量是离散的,所以它被称为潜类模型。类的特征在于条件概率模式,其指示变量对特定值的可能性。 潜在类别分析 (latent class analysis, LCA ),简称潜类分析,是结构方程建模的子集,用于在多变量分类数据中查找子类型。这些子类型称为“…
提升方法(Boosting)是一种机器学习中的集成学习元启发算法,主要用来减小監督式學習中偏差并且也减小方差,以及一系列将弱学习器转换为强学习器的机器学习算法。面對的问题是邁可·肯斯(Michael Kearns)和莱斯利·瓦利安特(Leslie Valiant)提出的:一組“弱学习者”的集合能否生成一个“强学习者”?弱学习者一般是指一个分类器,它的结果只比随机分类好一点点;强学习者指分类器的结果非常接近真值。 Robert Schap…