特徵提取
特征提取()在機器學習、模式识别和圖像處理中有很多的應用。特徵提取是從一個初始測量的資料集合中開始做,然後建構出富含資訊性而且不冗餘的導出值,稱為特徵值(feature)。它可以幫助接續的學習過程和歸納的步驟,在某些情況下可以讓人更容易對資料做出較好的詮釋。特徵提取是一個降低維度的步驟,初始的資料集合被降到更容易管理的族群(特徵)以便於學習,同時保持描述原始資料集的精準性與完整性。 當一個演算法的輸入資料太過於龐大冗餘以至於不便處理(如…
共 116 篇文章
特征提取()在機器學習、模式识别和圖像處理中有很多的應用。特徵提取是從一個初始測量的資料集合中開始做,然後建構出富含資訊性而且不冗餘的導出值,稱為特徵值(feature)。它可以幫助接續的學習過程和歸納的步驟,在某些情況下可以讓人更容易對資料做出較好的詮釋。特徵提取是一個降低維度的步驟,初始的資料集合被降到更容易管理的族群(特徵)以便於學習,同時保持描述原始資料集的精準性與完整性。 當一個演算法的輸入資料太過於龐大冗餘以至於不便處理(如…
相关向量机(Relevance vector machine,RVM)是使用贝叶斯推理得到回归和分类的简约解的机器学习技术。RVM的函数形式与支持向量机相同,但是可以提供概率分类。 其与带协方差函数的高斯过程等效。: :k(\mathbf{x},\mathbf{x'}) = \sum_{j=1}^N \frac{1}{\alpha_j} \phi(\mathbf{x},\mathbf{x}_j)\phi(\mathbf{x}',\mat…
在机器学习中,(高斯)径向基函数核(),或称为RBF核,是一种常用的核函数。它是支持向量机分类中最为常用的核函数。 关于两个样本x和x'的RBF核可表示为某个“输入空间”(input space)的特征向量,它的定义如下所示: :K(\mathbf{x}, \mathbf{x'}) = \exp\left(-\frac{||\mathbf{x} - \mathbf{x'}||_2^2}{2\sigma^2}\right) \textst…
人工神经网络(,ANNs)又称-{zh-cn:类神经网络;zh-tw:人工神經網絡}-,简称神经网络(neural network,NNs),在机器学习和认知科学领域,是一种模仿生物神经网络(动物的中樞神經系統,特别是大脑)的结构和功能的数学模型或计算模型,用于对函数进行估计或近似。神经网络由大量的人工神经元联结进行计算。大多数情况下人工神经网络能在外界信息的基础上改变内部结构,是一种自适应系统,通俗地讲就是具备学习功能。现代神经网络是…
统计学习理论(),一種機器學習的架構,根據統計學與泛函分析(Functional Analysis)而建立。統計學習理論基於資料(data),找出預測性函數,之後解決問題。支持向量机(Support Vector Machine)的理論基礎來自於統計學習理論。 形式定义 令X为所有可能的输入组成的向量空间, Y为所有可能的输出组成的向量空间。统计学习理论认为,积空间Z = X \times Y上存在某个未知的概率分布p(z) = p(\…
粒度運算()是一種新興的信息處理運算模型。它涉及到複雜信息實體(即信息粒,)的處理,包括數據的抽象化還有從信息推導知識的過程。一般來說,信息粒通常是數值層面上的實體集合,它們以相似性、功能的近似性、不可辨別性及一致性等指標來進行整合。 目前,粒度運算只有較多的理論觀點而尚未形成一套完整的方法。從理論觀點看,它提倡通過不同的解像度或尺度,對數據中出現的知識進行認知以及探索。在這個意義上來講,粒度運算包含了所有能夠在提取及表示知識或信息的尺…
瓦普尼克-澤范蘭傑斯理論(),又稱VC理论(VC theory)是一個於1960年代到1990年代由蘇聯數學家弗拉基米尔·瓦普尼克及亞歷克塞·澤范蘭傑斯建立的一套,使用统计的方法,因此有别于归纳学习等其它机器学习方法。 由这套理论所引出的支持向量机对机器学习的理论界以及各个应用领域都有极大的贡献。 主要概念 损失函数 期望风险, 经验风险, 结构风险 VC维 支持向量机 条件随机场 參考資料 參看 Richard M. Dudley, …
在概率论、統計學及機器學習中,概率图模型()是用圖論方法以表現數個獨立隨機變數之關聯的一種建模法。一个p个節點的图中,节点i对应一个隨機變數,记为X_i。概率图模型被广泛地应用于贝叶斯统计与机器学习中。 有向和无向概率图模型的定义 在一个无向概率图模型(Undirected Graphical Model)中,两个节点i和j之间没有边相连,当且仅当它们对应的随机变量X_i和X_j给定其它所有节点上的随机变量条件下条件独立。数学表述为: …
L_p-范数(英语:L_p-norm,亦称 \ell_p-范数、p-范数)是向量空间中的一组范数。L_p-范数与幂平均有一定的联系。它的定义如下: L_p(\vec x) = \lVert\vec x\rVert_{p} = \Bigl(\sum_{i = 1}^{n}|x_{i}|^{p}\Bigr)^{1 / p},\qquad\vec x = \{x_1, x_2, \ldots, x_n\},\,p\geqslant 1. p …
規則歸納(Rule Induction)是機器學習的一個重要分支,專注於從觀察數據中提取形式化規則。這些規則通常以「如果-那麼」(IF-THEN)的形式呈現,可用於分類、預測或描述數據中的模式。規則歸納在數據挖掘、知識發現和專家系統構建中有廣泛應用。與其他機器學習方法相比,規則歸納產生的模型具有更好的可解釋性,使人類能夠理解模型的決策過程。 范式: 一些主要的规则归纳范式是: 关联规则算法 决策规则算法 假设检验算法 粗糙集规则 算法 …
Deeplearning4j是为Java和Java虚拟机编写的开源深度学习库,是广泛支持各种深度学习算法的运算框架。Deeplearning4j可以实施的技术包括受限玻尔兹曼机、深度置信网络、深度自动编码器、堆叠式降噪自动编码器、循环神经张量网络,以及word2vec、doc2vec和GloVe。这些算法全部包括分布式并行版本,与Hadoop和Spark集成。Skymind是Deeplearning4j的商业支持机构。 简介 Deepl…
数据标注是指對數據加上一個或多個標籤的過程。例如,在未被標註的一張照片中,可以標註該圖片是馬還是牛,在一個未被標註的音訊中,可以標註它裡面說了哪些詞,或者是一段影片中的演員正在做了什麼動作、新聞文章的主題是什麼、一則推文在表達什麼樣的情緒、X光圖中某個點是否為腫瘤。 標記過程需要人類介入,即人為的給這些數據加上標籤。正因為這樣,获取被標註過的数据的成本比获取原始未標註的数据的成本高得多。 数据標籤的準確性直接影响监督学习的效果,因为监督…
部分可觀察馬可夫決策過程(Partially Observable Markov Decision Process,缩写:POMDP),是一種通用化的馬可夫決策過程。POMDP模擬代理人決策程序是假設系統動態由MDP決定,但是代理人無法直接觀察目前的狀態。相反的,它必須要根據模型的全域與部分區域觀察結果來推斷狀態的分佈。 因為POMDP架構的通用程度足以模擬不同的真實世界的連續過程,應用於機器人導航問題、機械維護和不定性規劃。架構最早由…
ELF OpenGo是Facebook AI Research團隊()所開發的電腦圍棋軟體及所釋出的資料。 簡介 ELF OpenGo是Facebook AI Research團隊()依照Google DeepMind在科學期刊《自然》上對於AlphaGo Zero所發表的論文《》與AlphaZero的論文《》所實做出的開源電腦圍棋程式,也就是不使用人類棋譜與累積的圍棋知識,僅實做圍棋規則,使用單一類神經網路從自我對弈中學習(不像Alp…
深度強化學習(英語:Deep reinforcement learning,簡稱 Deep RL 或 DRL)是機器學習的一個子領域,結合了強化學習和深度學習。強化學習探討如何在嘗試錯誤的過程中讓智慧型代理人學習做更好的決策。深度強化學習採用了深度學習的方法,讓智慧型代理人可以直接基於非結構化資料來做決策,而不需要人為設計的狀態空間。深度強化學習演算法可以讀取非常大的輸入資料(像是電玩畫面上的每個像素),來判斷哪個動作可以達到最好的目標…
學習自動機(learning automaton)是一種1970年代就開始研究的机器学习演算法。學習自動機是由對以往對環境的經驗來選擇目前的動作。若環境是随机性的,且使用了馬可夫決策過程,則這種學習自動機屬於强化学习的演算法。 歷史 學習自動機的研究可以追溯到蘇聯的在1960年代所做的研究。他和同事們發表了數篇論文,說明如何用矩陣來描述自動機功能。此外,Tsetlin也在研究合理及集体性的自动机行为,以及自动机游戏的。美國學者在1960…
机器学习中,超参数优化或整定(tuning)是为学习算法选择一组最佳超参数的问题。超参数是用于控制学习过程的参数。 超参数优化会找到能产生最优模型的超参数元组,在给定的独立数据上将预定义的损失函数最小化。目标函数获取超参数元组,返回相关损失。 方法 网格搜索 超参数优化的传统方法是网格搜索(grid search)或参数扫描(parameter sweep),即对学习算法超参数空间中人工指定的子集暴力搜索。网格搜索算法必须以某些性能指标…
流形假设认为,现实中的很多高维数据集实际上沿着高维空间内的低维潜流形分布。流形假设的结果是,很多最初看起来需要很多变量描述的数据集,实际上只需要较少变量,这好比底流形的局部坐标系。有人认为,这原理是机器学习算法通过考虑一些共有特征以有效描述高维数据集的基础。 流形假设与机器学习中非线性降维的有效性有关。流形雕刻、流形对齐、流形正则化等很多降维技术都假设数据位于低维子流形上。 流形假设的主要意义在于 机器学习模型只需要在潜输入空间(潜流形…
对联机是一类可以自动对对联的电脑程序的统称。 对联是一种汉语中的文学现象,由于统计机器学习的发展,使得电脑学习以前的对联,来对新对联成为可能。 其中最著名的对联机是微软亚洲研究院在互联网上发布的。 参考资料
统计分类(英譯:Statistical classification)是机器学习非常重要的一个组成部分,它的目标是根据已知样本的某些特征,判断一个新的样本属于哪种已知的样本类。分类是监督学习的一个实例,根据已知训练集提供的样本,通过计算选择特征参数,建立判别函数以对样本进行的分类。与之相对的是無監督學習,例如聚类分析。 统计分类机器学习是一种利用统计方法和算法来从数据中学习分类规则的技术。分类是一种预测性分析,目的是将输入数据分配到预定…