自动作文评分
自动作文评分(,缩写为AES)是运用统计方法、机器学习和自然语言处理技术预测作文分数的教育评价方法。 自动作文评分系统通常以人工评定的作文为训练或校准资料,从作文中提取语言特征或学习文本表示,再预测整体分数或若干写作分项的得分。在高风险考试中,自动评分也可与人工评分共同使用,而不由计算机单独决定考生成绩。后来的综述将佩奇开发的作文评分计划()列为早期自动作文评分系统。 2003年,《底特律自由新闻》报道,采用e-rater的Criter…
共 12 篇文章
自动作文评分(,缩写为AES)是运用统计方法、机器学习和自然语言处理技术预测作文分数的教育评价方法。 自动作文评分系统通常以人工评定的作文为训练或校准资料,从作文中提取语言特征或学习文本表示,再预测整体分数或若干写作分项的得分。在高风险考试中,自动评分也可与人工评分共同使用,而不由计算机单独决定考生成绩。后来的综述将佩奇开发的作文评分计划()列为早期自动作文评分系统。 2003年,《底特律自由新闻》报道,采用e-rater的Criter…
在模式识别领域中,最近鄰居法(KNN算法,又譯K-近邻算法)是一种用于分类和回归的無母數統計方法,由美国统计学家伊芙琳·费克斯和小約瑟夫·霍奇斯于1951年首次提出,后来由扩展。在这两种情况下,输入包含特徵空間中的k个最接近的训练样本。 : 在k-NN分类中,输出是一个分类族群。一个对象的分类是由其邻居的“多数表决”确定的,k个最近邻居(k为正整数,通常较小)中最常见的分类决定了赋予该对象的类别。若k = 1,则该对象的类别直接由最近的…
在信号检测理论中,接收者操作特征曲線,或者叫ROC曲线(),是一种坐標圖式的分析工具,用於选择最佳的信號偵測模型、捨棄次佳的模型或者在同一模型中設定最佳閾值。 在做決策時,ROC分析能不受成本/效益的影響,給出客觀中立的建議。 ROC曲线首先是由二战中的电子工程师和雷达工程师发明的,用来偵测战场上的敌军載具(飛機、船艦),也就是信号检测理论。之后很快就被引入了心理学来进行信号的知觉检测。數十年來,ROC分析被用於医学、无线电、生物學、犯…
,在机器学习中是一系列以假设特征之间强(朴素)独立下运用贝叶斯定理为基础的简单。 單純貝氏自1950年代已广泛研究,在1960年代初就以另外一个名称引入到文本信息检索界中,它在自动医疗诊断中也有应用。 單純貝氏分类器是高度可扩展的,因此需要数量与学习问题中的变量(特征/预测器)成线性关系的参数。最大似然训练可以通过评估一个封闭形式的表达式来完成,所有这些名称都参考了贝叶斯定理在该分类器的决策规则中的使用,但單純貝氏不(一定)用到贝叶斯方…
在机器学习中,-{zh-cn:支持向量机; zh-tw:支援向量機; zh-hk:支援向量機;}- (-{zh-cn:台湾称支援向量機; zh-tw:中國大陸稱支持向量机}-,,常简称為SVM,又名支援向量网络,当数据未被标记或者仅一些数据被标记时,支援向量聚类经常在工业应用中用作分类步骤的预处理。 动机 将数据进行分类是机器学习中的一项常见任务。 假设某些给定的数据点各自属于两个类之一,而目标是确定新数据点将在哪个类中。对于支持向量机…
在機器學習領域和統計分類問題中,混淆矩阵(')是可视化工具,特别用于监督学习,在无监督学习一般叫做匹配矩阵。矩阵的每一列代表一个类的实例预测,而每一行表示一个实际的类的实例。之所以如此命名,是因為通過這個矩陣可以方便地看出机器是否将两个不同的类混淆了(比如說把一個類錯當成了另一個)。 混淆矩阵(也稱誤差矩陣)是一種特殊的, 具有兩個維度的(實際和預測)列联表('),並且兩維度中都有著一樣的類別的集合。 示例 如果已經訓練好了一個系統用來…
线性判别分析(,縮寫:LDA)是对费舍尔的线性鉴别方法的归纳,这种方法使用统计学,模式识别和机器学习方法,试图找到两类物体或事件的特征的一个线性组合,以能够特征化或区分它们。所得的组合可用来作为一个线性分类器,或者,更常见的是,为后续的分类做降维处理。 LDA与變異數分析(ANOVA)和迴归分析紧密相关,这两种分析方法也试图透过一些特征或测量值的线性组合来表示一个因变量。然而,變異數分析使用类别型的自变量和连续型的因变量,而判别分析則使…
统计分类(英譯:Statistical classification)是机器学习非常重要的一个组成部分,它的目标是根据已知样本的某些特征,判断一个新的样本属于哪种已知的样本类。分类是监督学习的一个实例,根据已知训练集提供的样本,通过计算选择特征参数,建立判别函数以对样本进行的分类。与之相对的是無監督學習,例如聚类分析。 统计分类机器学习是一种利用统计方法和算法来从数据中学习分类规则的技术。分类是一种预测性分析,目的是将输入数据分配到预定…
在机器学习中,多元分类是将实例分配到多个(多于两个)类别中的其中一个(将实例分配到两个类别中的其中一个被称为二分类)。 显然,分类算法可以分为二分类和多分类两种,而多分类算法可以通过将其转化为多个二分类来实现。 需要注意的是,多分类不应和多标签分类相混淆:多标签分类可以为每个实例预测多个标签,即同一个实例可以同时被分配到多个类别。 一般策略 这部分讨论将多分类问题转化为多个二分类问题的策略。 One-vs.-rest one-vs.-r…
瓦普尼克-契尔沃年基斯维(Vapnik-Chervonenkis Dimension),简称VC维,由弗拉基米尔·瓦普尼克与阿列克谢·契尔沃年基斯提出。在VC理论中,VC维是对一个可学习分类函数空间的能力(复杂度,表示能力等)的衡量。它定义为算法能“打散”的点集的势的最大值。 直观地,一个分类模型的能力与其复杂程度相关。例如,考虑一个高次多项式的分类模型:若函数值大于0则分类为正,反之则分类为负。高次多项式能够“摆动”的范围很大,所以能…
决策边界或决策面(decision surface)是统计分类问题中的一个超曲面,把向量空间(作为特征空间)划分为两个集合,分别对应两个分类。 如果决策面是超平面,那么这个分类问题是线性的,分类是的。 神经网络与支持向量机 人工神经网络或感知器的反向传播算法,网络可学到的决策边界的类型由隐含层数决定。 如果没有隐含层,那么只能学习线性问题。如有一个隐含层,使用可学到Rn的紧子集的任何连续函数,因此可学到任意的分类边界。 支持向量机 能找…
贝叶斯错误率(Bayes error rate)是应用贝叶斯分类规则的分类器的错误率。贝叶斯分类规则的一个性质是:在最小化分类错误率上是最优的。所以在分类问题中,贝叶斯错误率是一个分类器对某个类别所能达到的最低的分类错误率。 错误测定 定义 :p_e = \sum_{i = 1}^M \int_{R_i}\left(\sum_{j = 1}^M \lambda_{ki}p(x|\omega_{k})P(\omega_{k})\, \ri…