CGI (圍棋軟體)
CGI()是由國立交通大學資訊工程學系吳毅成教授所帶領的團隊所開發的圍棋軟體。 簡介 從2008年開始發展,一開始名稱為HappyGo,之後大幅改寫時改名為Amigo,但因Amigo與其他圍棋軟體名稱衝突,在後來改名時以實驗室的名字為基礎,改名為CGI並使用至今。 演進 HappyGo 2008年到2011年的版本,以作者王永樂的暱稱Happy為名,僅支援9x9的棋盤 改善蒙特卡洛树搜索(MCTS)內的快速走子() 支援分散式計算 CG…
共 116 篇文章
CGI()是由國立交通大學資訊工程學系吳毅成教授所帶領的團隊所開發的圍棋軟體。 簡介 從2008年開始發展,一開始名稱為HappyGo,之後大幅改寫時改名為Amigo,但因Amigo與其他圍棋軟體名稱衝突,在後來改名時以實驗室的名字為基礎,改名為CGI並使用至今。 演進 HappyGo 2008年到2011年的版本,以作者王永樂的暱稱Happy為名,僅支援9x9的棋盤 改善蒙特卡洛树搜索(MCTS)內的快速走子() 支援分散式計算 CG…
隐含狄利克雷分布(,简称LDA),是一种主题模型,它可以将文档集中每篇文档的主题按照概率分布的形式给出。同时它是一种无监督学习算法,在训练时不需要手工标注的训练集,需要的仅仅是文档集以及指定主题的数量k即可。此外LDA的另一个优点则是,对于每一个主题均可找出一些词语来描述它。 LDA首先由 David M. Blei、吴恩达和迈克尔·I·乔丹于2003年提出,目前在文本挖掘领域包括文本主题识别、文本分类以及文本相似度计算方面都有应用。 …
迁移学习()是属于机器学习的一种研究领域。它专注于存储已有问题的解决模型,并将其利用在其他不同但相关问题上。 比如说,用来辨识汽车的知识(或者是模型)也可以被用来提升识别卡车的能力。 历史 最早被引用的关于迁移学习的工作被认为属于。他在1993年制定了基于可辨识性的转移(DBT)算法。 1997年,机器学习期刊发表了一期专门讨论迁移学习的期刊,而到了1998年,该领域已经发展到包括多任务学习,以及对其理论基础的更深入完善的分析。1998…
在统计学当中,贝叶斯信息量准则(或者:Schwarz information criterion;缩写:BIC、SIC、SBC、SBIC)是在有限集合中进行模型选择的准则:BIC最低的模型是最好的。该准则部分基于似然函数并与赤池信息量准则(AIC)紧密相关。 該準則由數學家Gideon E. Schwarz於1978年提出,因使用英国统计学家托马斯·贝叶斯的贝叶斯推断而得名。 拟合模型时,增加参数可提高似然,但如此下去可能导致过拟合。B…
神经图灵机(,NTM)是图灵机的循环神经网络模型。该方法由Alex Graves等人于2014年发表。 NTM 将神经网络的模糊模式匹配功能与可编程计算机的算法能力相结合。 NTM 有一个与外部记忆资源耦合的神经网络控制器,并通过注意力机制与之交互。内存交互是端到端可微的,使得可以使用梯度下降法来优化它们。具有长短期记忆(LSTM) 网络控制器的 NTM可以仅从示例中推断出简单的算法,例如复制、排序和联想回忆。 是神经图灵机的产物,具有…
机器人学习()是机器人学和机器学习的交叉研究领域。较之其他机器学习算法的应用领域,机器人系统具有训练成本高、包括传感器在内的硬件限制、与外界进行物理交互、交互环境持续动态变化等难点,因而对机器人学习提出了特定的要求。 目前,对于机器人学习算法的涵盖范围,各研究组织没有统一界定,有的认为机器人学习旨在设计算法使得各类机器人本体实现“学习”。 研究方向 对于机器人学习,IEEE下属的机器人学习技术委员会总结的研究方向为: 强化学习 模型学习…
数据增强()是一种统计技术,允许从不完整数据中进行最大似然估计。数据增强在贝叶斯推断中有重要应用,并且在机器学习中广泛使用,通过训练模型使用已有数据的几个略微修改的副本在训练机器学习模型时减少過適。 图像分类中的数据增强 在20世纪90年代中期,当卷积神经网络变得更加复杂时,数据量不足成为一个问题,特别是考虑到需要留出一部分数据用于后续测试。为了解决这个问题,有研究提议使用仿射变换扰动现有数据,以创建带有相同标签的新示例。随后,2003…
微调(又称大模型微调,)是深度学习中迁移学习的一种方法,其中预训练模型的权重会在新数据上进行训练。微调可以在整个神经网络上执行,也可以仅在其部分层上执行,此时未进行微调的层会被“冻结”(在反向传播步骤中不更新)。模型还可以通过“适配器”进行增强,适配器的参数远少于原始模型,通过调整适配器的权重并保持模型的其余权重不变的方式,以参数有效的方式进行微调。 对于一些体系结构,比如卷积神经网络,通常会将较早的层(靠近输入层的层)冻结,因为它们捕…
在数据挖掘和统计学中,层次聚类()是一种旨在建立聚类的层次结构的聚类分析方法。层次聚类的策略通常有两种: 凝聚(Agglomerative clustering):一种自底向上方法,从小集群开始,逐渐将其合并,形成更大的集群; 分裂(Divisive clustering):一种自顶向下方法,从单个集群开始,递归地将其拆分成更小的集群。 凝聚和分离的操作通常用贪心算法实现,结果通常用展示。 标准的凝聚层次聚类(Hierarchical …
容错学习问题或是LWE问题(,)是一个机器学习领域中的怀疑难解问题。由Oded Regev在2005年提出,他因此赢得2018年哥德尔奖。这是一个极性学习问题的一般形式。Regev同时证明了LWE问题至少比几个最坏情况下的格问题要难。这个问题在最近被用作一种难度假设以创建后量子公钥密码系统,例如Peikert提出的容错环学习密钥交换。 简述 虽然来自机器学习领域,错误学习问题实际上是理论计算机科学中的计算复杂度问题。 一个简单易懂的例子…
基于人类反馈的强化学习(,简称),包括基于人类偏好的强化学习(),是一种直接根据人类反馈训练“奖励模型”的机器学习技术,并使用该模型作为强化学习中的奖励函数,再通过近端策略优化等算法以优化智能体(agent)策略。奖励模型在进行策略优化之前预先训练,以预测给定的输出是好(高奖励)还是坏(低奖励)。RLHF可以提高强化学习智能体的鲁棒性(robustness)和探索性(exploration),尤其适用于奖励函数稀疏或有噪声(不确定性)的…
基于流的生成模型()是机器学习中的一类生成模型,利用归一化流()显式建模概率分布。这是一种使用概率密度变量变换法将简单分布转换为复杂分布的统计方法。 直接建模似然函数具有很多优点。例如,可以直接计算得到负对数似然并将其作为损失函数最小化。此外,通过从初始分布中采样并应用流变换可以生成新的样本。 相比之下,变分自编码器、生成对抗网络等其他生成模型无法显式地表示似然函数。 方法 考虑随机变量z_1和z_0,其中z_0 = f^{-1}_1(…
半监督学习()是机器学习的一个分支,它在训练时使用了少量的有标签数据(Labeled data)和大量的无标签数据(Unlabeled data)。半监督学习介于无监督学习(训练数据全部无标签)和有监督学习(训练数据全部有标签)之间。半监督学习旨在缓解训练数据中有标签数据有限的问题。 无监督学习适用的的问题往往有着大量的无标签样本,同时获得有标签样本成本较高。部分其它机器学习分支有着相同动机,但是遵从不同的假设和方法,例如和弱监督学习。…
Minigo是一套電腦圍棋軟體。 簡介 Minigo是一套依照Google DeepMind在《自然》上對於AlphaGo Zero所發表的論文《》所實做出的開源電腦圍棋程式,也就是不使用人類棋譜與累積的圍棋知識,僅實做圍棋規則,使用單一類神經網路從自我對弈中學習(不像AlphaGo以人類角度思考,設計了Policy Network與Value Network)。 軟體是基於Brain Lee的MuGo繼續開發,使用Python與C++…
序列最小优化算法(, SMO)是一种用于解决支持向量机训练过程中所产生优化问题的算法。SMO由微软研究院的約翰·普拉特于1998年发明,目前被广泛使用于SVM的训练过程中,并在通行的SVM库LIBSVM中得到实现。1998年,SMO算法发表在SVM研究领域内引起了轰动,因为先前可用的SVM训练方法必须使用复杂的方法,并需要昂贵的第三方二次规划工具。而SMO算法较好地避免了这一问题。 问题定义 SMO算法主要用于解决支持向量机目标函数的最…
在机器学习中,提前停止(英语:early stopping)是一种在使用诸如梯度下降之类的迭代优化方法时,可对抗过拟合的正则化方法。这些迭代优化方法在每轮迭代过程中,都会使得模型更好地与训练集拟合。在某个時間點之前,更好地拟合训练集使得模型在训练集之外的数据上(驗證集)表现得更好;但在该時間點之后,更好地拟合训练集反而会增大泛化误差。提前停止规则给出停止迭代的条件,以便在模型开始过拟合之前停止迭代优化。提前停止规则已被用于多种机器学习方…
机器遗忘是人工智能与机器学习领域中一个旨在使模型“遗忘”特定训练数据或其影响的研究方向。该概念的提出源于隐私保护与数据合规的需求,特别是对“被遗忘权”在算法系统中的技术实现要求。机器遗忘的核心目标是在不重新训练整个模型的情况下,以较低的计算、时间或经济成本,使模型的行为尽可能接近从未使用某些数据进行训练的状态。 背景 机器学习模型的主要特征之一是通过对历史数据的训练,学习数据中的模式并进行预测。这一过程不可避免地会使模型“记住”部分训练…
MuZero是DeepMind 2019年發布的AI系統,可以在不被告知规则的情况下通過觀察大量遊戲和棋類比賽來掌握围棋、国际象棋、日本将棋和视频游戏的玩法和規則。 相關連結 AlphaZero DeepMind 無監督學習 參考資料 外部連結 [http://www.furidamu.org/blog/2020/05/02/opensource-muzero-implementations/ Open-Source MuZero Im…
联邦学习()是一种机器学习技术,具體來說就是人們在多个擁有本地数据样本的分散式边缘设备或服务器上训练算法。这种方法与传统的集中式机器学习技术有顯著不同,传统的集中式机器学习技术将所有的本地数据集上传到一个服务器上,而更经典的分散式方法则通常假设本地数据样本都是相同分布的。联合学习使多个參與者能够在不共享数据的情况下建立一个共同的、强大的机器学习模型,从而可以解决数据隐私、数据安全、数据访问权限和异构数据访问等关键问题。 联合平均(Fed…
Davis-Kahan定理()是随机矩阵分析中的一个重要的基础性定理。它的基本内容是,如果两个矩阵在某种合适的模之下相近,且有足够的特征裂隙,那么它们相应的特征向量子空间也相似。 定理内容 两个线性空间的夹角 考虑两个单位列正交矩阵 V,\hat{V}\in\mathbb{R}^{n\times d} (“单位列正交”意为:其满足 V^TV = \hat{V}^T\hat{V} = I_d) 之列向量分别张成的线性子空间,那么这两个子空…