标签:#机器学习

共 116 篇文章

稀疏字典學習

稀疏字典学习是一种表征学习方法,其目的在於找出一組基本元素讓輸入-{zh-cn:信号;zh-tw:訊號}-映射到這組基本元素時具有稀疏表达式。我們稱這些基本元素為“原子”,這些原子的組合則為“字典”。字典裡的“原子”並不需要滿足正交基這一特性,且往往它們會是過完備的生成集合。過多的原子除了可以讓我們在敘述一個訊號的時候可以由很多種表達式,同時也提升了整個表達式的稀疏性,讓我們可以以較簡單的表達式來詮釋訊號。 稀疏字典學習最主要應用在壓縮…

词袋模型

在自然語言處理和信息檢索裏,词袋模型()是一個簡化的表達模型。在此模型下,一段文本(比如一个句子或是一个文档)可以用一個装着这些词的袋子来表示,這種表示方式不考慮文法以及詞的順序。最近词袋模型也被應用在電腦視覺領域。 词袋模型被廣泛應用在文件分類,詞語出現的頻率可以用來當作訓練分類器的特徵。 關於「词袋」這個用字的由來可追溯到於1954年在《Distributional Structure》的文章。 範例 下列文件可用词袋表示: 以下是…

决策树剪枝

剪枝()是机器学习与搜索算法当中通过移除决策树中分辨能力较弱的節點而减小决策树大小的方法。剪枝降低了模型的复杂度,因此能够降低过拟合风险,从而降低泛化误差。 在决策树算法中,决策树过大会有过拟合的风险,从而在新样本上的泛化性能很差;决策树过小则无法从样本空间中获取重要的结构化信息。然而,由于很难判断新增一个额外的分裂结点能否显著降低误差,人们很难判断何时停止决策树的生长是恰当的。该问题被称为。一个通用的策略是让决策树一直生长,直到每个叶…

條件隨機域

条件随机场(conditional random field,簡稱 CRF),是一種鑑別式機率模型,是随机场的一种,常用於標注或分析序列資料,如自然語言文字或是生物序列。 如同马尔可夫随机场,條件隨機場為無向性之圖模型,圖中的頂點代表隨機變數,頂點間的連線代表隨機變數間的相依關係,在條件隨機場當中,隨機變數 Y 的分佈為條件機率,給定的觀察值則為隨機變數 X。原則上,條件隨機場的圖模型佈局是可以任意給定的,一般常用的佈局是鏈結式的架構,…

异常检测

在数据挖掘中,异常检测()对不符合预期模式或数据集中其他项目的项目、事件或观测值的识别。通常异常项目会转变成、结构缺陷、医疗问题、文本错误等类型的问题。异常也被称为离群值、新奇、噪声、偏差和例外。 特别是在检测滥用与网络入侵时,有趣性对象往往不是罕见对象,但却是超出预料的突发活动。这种模式不遵循通常统计定义中把异常点看作是罕见对象,于是许多异常检测方法(特别是无监督的方法)将对此类数据失效,除非进行了合适的聚集。相反,聚类分析算法可能可…

多臂赌博机

在概率论和机器学习中,多臂赌博机问题()有时称为K-或N-臂赌博机问题()',是一个必须在竞争(替代)之间分配一组固定的有限资源的问题。当每个选择的属性在分配时仅部分已知时,以最大化其预期收益的方式进行选择,并且随着时间的推移或通过向该选择分配资源可能会更好地被理解。这是一个经典的强化学习问题,体现了探索-利用权衡困境',并且是否继续使用当前机器或尝试不同的机器。多臂赌博机问题也属于随机调度的广义范畴。 在该问题中,每台机器根据该机器特…

探索-利用困境

探索-利用困境(exploration–exploitation dilemma),亦被称为探索-利用权衡(explore–exploit tradeoff),是决策过程中的一个核心概念,广泛存在于多个领域。它被描述为两种对立策略之间的平衡:利用(Exploitation)指根据对系统的当前认知(尽管这些认知可能是不完整或误导性的)选择已知最佳选项;而探索(Exploration)则指尝试新的选项,尽管会牺牲当前的利用机会,但可能在未来…

混合模型

在統計學中,混合模型(Mixture model)是用於表示母體中子母體的存在的機率模型,換句話說,混合模型表示了測量結果在母體中的機率分布,它是一個由數個子母體之機率分布組成的混合分布。混合模型不要求測量結果供關於各個子母體之機率分布的資訊即可計算測量結果在母體分布中的機率。 高斯混合模型(Gaussian Mixture Model) 對一維的隨機變數X的高斯分佈存在以下機率密度函數: F_X(x) = P_{X}(X \leq x…

注意力机制

注意力机制()是人工神经网络中一种模仿认知注意力的技术。这种机制可以增强神经网络输入数据中某些部分的权重,同时减弱其他部分的权重,以此将网络的关注点聚焦于数据中最重要的一小部分。数据中哪些部分比其他部分更重要取决于上下文。可以通过梯度下降法对注意力机制进行训练。 类似于注意力机制的架构最早于1990年代提出,当时提出的名称包括乘法模块(multiplicative module)、sigma pi单元、超网络(hypernetwork)…

经验风险最小化

经验风险最小化(,縮寫:ERM)是统计学习理论里的一项原则,该原则下有一系列学习算法 ,经验风险最小化用于为这些算法的性能提供理论上的界。核心思想是,人們无法确切知道算法在实际中的运行情况(真正的“风险”),是因为不知道算法将在其上运行的数据的真实分布,但借助经验风险最小化,可以在一组已知的训练数据(“经验”风险)上衡量其性能。 背景 以下情况是许多有监督学习问题的一般设置。存在两个空间,输入空间X和输出空间Y,目标是学习(拟合)一个函…

向量数据库

向量数据库(Vector database)、向量存储或向量搜索引擎是一种能够存储向量(固定长度的数值列表)及其他数据项的数据库。向量数据库通常实现一种或多种近似最近邻(Approximate Nearest Neighbor,ANN)算法,使用户可以使用查询向量搜索数据库,以检索最匹配的数据库记录。 向量是数据在高维空间中的数学表示。在这个空间中,每个维度对应数据的一个特征,维度的数量从几百到几万不等,具体取决于所表示数据的复杂性。向…

ONNX

ONNX()是一种针对机器学习所设计的开放式的文件格式,用于存储训练好的模型。它使得不同的人工智能框架(如Pytorch、MXNet)可以采用相同格式存储模型数据并交互。 ONNX的规范及代码主要由微软、亚马逊、Facebook和IBM等公司共同开发,以开放源代码的方式托管在Github上。 目前官方支持加载ONNX模型并进行推理的深度学习框架有: Caffe2、PyTorch、MXNet、ML.NET、TensorRT 和 Micro…

维数灾难

维数灾难(,又名维度的詛咒)是一个最早由美國應用數學家理查德·贝尔曼在考虑优化问题时首次提出来的术语,用来描述当(数学)空间维度增加时,分析和组织高维空间(通常有成百上千维),因体积指数增加而遇到各种问题场景。这样的难题在低维空间中不会遇到,如物理空间通常只用三维来建模。 举例来说,100个平均分布的点能把一个单位区间以每个点距离不超过0.01采样;而当维度增加到10后,如果以相邻点距离不超过0.01小方格采样一单位超正方体,则需要10…

混淆矩阵

在機器學習領域和統計分類問題中,混淆矩阵(')是可视化工具,特别用于监督学习,在无监督学习一般叫做匹配矩阵。矩阵的每一列代表一个类的实例预测,而每一行表示一个实际的类的实例。之所以如此命名,是因為通過這個矩陣可以方便地看出机器是否将两个不同的类混淆了(比如說把一個類錯當成了另一個)。 混淆矩阵(也稱誤差矩陣)是一種特殊的, 具有兩個維度的(實際和預測)列联表('),並且兩維度中都有著一樣的類別的集合。 示例 如果已經訓練好了一個系統用來…

表征学习

在机器学习中,特征学习(feature learning)或表征学习(representation learning)是学习一个特征的技术的集合:将原始数据转换成为能够被机器学习来有效开发的一种形式。它避免了手动提取特征的麻烦,允许计算机学习使用特征的同时,也学习如何提取特征:学习如何学习。 机器学习任务,例如分类问题,通常都要求输入在数学上或者在计算上都非常便于处理,在这样的前提下,特征学习就应运而生了。然而,现实世界中的数据,例如圖…

流形正则化

算法智能学习非常简单的决策边界(上图)。基于邻点很可能属于同一类的假设,决策边界应避开含大量未标记点的区域。这也就是一种半监督学习。]] 机器学习中,流形正则化(Manifold regularization)是一种利用数据集形状以约束应在数据集上被学习的函数的技术。在很多机器学习问题中,待学习数据不能涵盖整个输入空间。例如,人脸识别系统不需要分类所有图像,只需分类包含人脸的图像。流形学习技术假定相关数据子集来自流形,是一种具有有用属性…

绝艺

绝艺()是中国腾讯公司的AI Lab(腾讯人工智能实验室)开发的围棋和游戏人工智能。绝艺之名出自唐朝诗人杜牧的诗“绝艺如君天下少,闲人似我世间无”。围棋人工智能绝艺在2017年3月18-19日的第10届UEC杯世界電腦圍棋大會上夺得冠军,并在2017年3月26日的第5届电圣战上分先战胜了日本的一力辽七段。绝艺也开发了王者荣耀游戏版本。 绝艺围棋人工智能 绝艺人工智能的第一个版本于2016年3月4日完成。6月下旬突破业余6段,8月开始在腾…

對抗式機器學習

對抗式機器學習(Adversarial machine learning)是針對机器学习演算法的攻擊,以及針對這類攻擊的防範。2020年的一個問卷統計,實作机器学习的人認為需要針對工業應用的机器学习有進階防護。 機器學習技術大部份是設計來解決特定問題,其假設是訓練資料和測試資料是由相同統計分布下的資料所產生的(独立同分布,IID)。不過,在一些高風險的應用上,可能會違背上述的假設,使用者刻意的提供違背上述統計假設的假資料。 對抗式機器學…

约翰逊-林登斯特劳斯定理

约翰逊-林登斯特劳斯定理(),又称约翰逊-林登斯特劳斯引理(Johnson–Lindenstrauss lemma),是由和于1984年提出的一个关于降维的著名定理,在现代机器学习,尤其是压缩感知、降维、和等领域中有很重要的应用。 这个定理指出,一个高维空间中的点集,可以被线性地镶嵌到低维空间中,同时其空间结构只遭受比较小的形变。约翰逊-林登斯特劳斯定理的证明,还说明了如何用明确地求出这个变换,所用的算法只需要随机多项式时间。当然,降维…

超参数 (机器学习)

在机器学习中,超参数()是事先给定的,用来控制学习过程的参数。而其他参数(例如节点权重)的值是通过训练得出的。 超参数可分为模型超参数(Model Hyperparameters)和算法超参数(Algorithm Hyperparameters)。模型超参数主要用于模型选择,其无助于学习训练集特征;而算法超参数理论上对模型的性能没有影响,而会影响学习的速度和质量。一个典型的模型超参数是神经网络的拓扑结构及大小;而学习率和批量大小(Bat…