标签:#数据挖掘

共 24 篇文章

加权相关网络分析

加权相关网络分析也称为加权基因共表达网络分析,是一种广泛使用的数据挖掘方法,它用两两变量间相关系数研究生物网络。它适用于高维度数据集,在基因組學领域应用的最为广泛。 此分析假定基因网络服从无尺度分布,定义基因共表达相关矩阵,计算生成邻接矩阵,然后计算各个节点的相异系数,建立分层聚类树。此树不同分支代表不同的基因模块,模块内基因有较高的共表达水平,从中可以鉴定出枢纽基因。可通过基因网络与表型之间联系,最终找到表型的靶点基因、基因网络。此分…

J.A.G. JAPAN

J.A.G. JAPAN株式会社(,)是總部位於日本東京都澀谷区澀谷的諮詢公司。 2010年11月,大濱﨑卓真創立公司前身J.A.G. JAPAN合同会社;2015年4月,改組為J.A.G. JAPAN株式会社。主要提供国政選舉及地方選舉的選舉諮詢,調查及分析選情,向政党、政治團体及政治人物提供面向政治人物的雲端名冊應用程式,並向主要傳媒提供選舉結果預測及分析文章等。另有使用地理資訊系統,提供可視化數據。 應對新型冠狀病毒感染症 201…

ROC曲线

在信号检测理论中,接收者操作特征曲線,或者叫ROC曲线(),是一种坐標圖式的分析工具,用於选择最佳的信號偵測模型、捨棄次佳的模型或者在同一模型中設定最佳閾值。 在做決策時,ROC分析能不受成本/效益的影響,給出客觀中立的建議。 ROC曲线首先是由二战中的电子工程师和雷达工程师发明的,用来偵测战场上的敌军載具(飛機、船艦),也就是信号检测理论。之后很快就被引入了心理学来进行信号的知觉检测。數十年來,ROC分析被用於医学、无线电、生物學、犯…

文本挖掘

文本挖掘(Text mining)有时也被称为文字探勘、文本数据挖掘等,大致相当于文字分析,一般指文本处理过程中产生高质量的信息。高质量的信息通常通过分类和预测来产生,如模式识别。文本挖掘通常涉及输入文本的处理过程(通常进行分析,同时加上一些衍生语言特征以及消除杂音,随后插入到数据库中) ,产生结构化数据,并最终评价和解释输出。'高品质'的文本挖掘通常是指某种组合的相关性,新颖性和趣味性。典型的文本挖掘方法包括文本分类,文本聚类,概念/…

聚类分析

聚类分析()亦称-{集群}-分析,是对于统计数据分析的一门技术,在许多领域受到广泛应用,包括机器学习,数据挖掘,模式识别,图像分析以及生物信息。聚类是把相似的对象通过静态分类的方法分成不同的组别或者更多的子集(subset),这样让在同一个子集中的成员对象都有相似的一些属性,常见的包括在坐标系中更加短的空间距离等。 一般把数据聚类归纳为一种非監督式學習。 定义 聚类(clustering)的概念不能精确定义,这也是为什么聚类算法众多的原…

DBSCAN

DBSCAN(),是1996年由、漢斯-彼得·克里戈爾、約爾格·桑德(Jörg Sander)及Xiaowei Xu提出的集群分析算法, 這個算法是以密度為本的:給定某空間裡的一個點集合,该算法能将附近的點分成一組(有很多相鄰點的點),並標記出位於低密度區域的局外點(最接近它的點也十分遠),DBSCAN是其中一個最常用的集群分析算法,也是其中一個科學文章中最常引用的。 在2014年,這個算法在領頭數據挖掘會議KDD上獲頒發了Test o…

文档分类

文档分类是图书馆学, 信息学和计算机科学中的一个问题。其任务是将一个文档分配到一个或者多个类别中。它可以是通过人工分类完成的,也可以是通过计算机算法实现的。多数通过人工的文档分类问题一直属于图书馆学的领域,而通过算法实现的文档分类问题则多属于信息学和计算机科学的领域。这些问题之间是有相同的部分的,所以有一些对文档分类的跨学科研究。 需要被分类的文档有可能是纯文本,图片,音乐等等。每一种文档都有其独特分类问题。根据特殊的文档做研究,文档分…

异常检测

在数据挖掘中,异常检测()对不符合预期模式或数据集中其他项目的项目、事件或观测值的识别。通常异常项目会转变成、结构缺陷、医疗问题、文本错误等类型的问题。异常也被称为离群值、新奇、噪声、偏差和例外。 特别是在检测滥用与网络入侵时,有趣性对象往往不是罕见对象,但却是超出预料的突发活动。这种模式不遵循通常统计定义中把异常点看作是罕见对象,于是许多异常检测方法(特别是无监督的方法)将对此类数据失效,除非进行了合适的聚集。相反,聚类分析算法可能可…

大數據

-{zh-tw:巨量資料;zh-hk:大數據;zh-cn:大数据;}-(;亦稱作-{zh-tw:大數據;zh-hk:巨量資料;zh-cn:巨量资料;}-),指的是傳統数据處理應用软件不足以處理的大或複雜的数据集的形容術語。 大数据也可以定義為来自各種來源的大量非結構化或結構化数据。從學術角度而言,大数据的出現促成廣泛主題的新穎研究。這也導致各種大数据統計方法的發展。大数据並沒有統計學的抽樣方法;它只是觀察和追踪發生的事情。因此,大数据通…

数据挖掘

数据挖掘()是一个跨学科的计算机科学分支。它是用人工智能、机器学习、统计学和数据库的交叉方法在相對較大型的数据集中发现模式的计算过程 #「一門從大量資料或資料庫中提取有用信息的科學」 儘管通常資料探勘應用於資料分析,但是像人工智能一樣,它也是一個具有豐富含義的詞彙,可用於不同的領域。 它与KDD(Knowledge discovery in databases)的关系是:KDD是从数据中辨别有效的、新颖的、潜在有用的、最终可理解的模式的…

最邻近搜索

最邻近搜索(Nearest Neighbor Search, NNS)又称为“最近点搜索”(Closest point search),是一个在尺度空间中寻找最近点的优化问题。问题描述如下:在尺度空间M中给定一个点集S和一个目标点q ∈ M,在S中找到距离q最近的点。很多情况下,M为多维的欧几里得空间,距离由欧几里得距离或曼哈顿距离决定。 高德纳在《计算机程序设计艺术》(1973)一书的第三章中称之为邮局问题,即居民寻找离自己家最近的邮…

書目探勘

書目探勘(bibliomining),就是將資料探勘技術運用於圖書館。它是資料探勘、書目計量學、統計學、報表工具的結合,以求從圖書館系統的大量資料中,粹取並了解讀者的行為模式,進而支援決策、改進服務。 起源 「書目探勘」(bibliomining)一詞是由學者Scott Nicholson提出,最早見於2003年Nicholson的“[https://web.archive.org/web/20100111070255/http://w…

分子挖掘

分子探勘(Molecule mining)為使用分子的数据挖掘。由於分子可由分子圖表示,這與圖形挖掘和結構化數據挖掘密切相關。主要問題是如何在區分數據實例時表示分子。其中一種方法是化學相似性度量,这在化學信息學領域具有悠久的傳統。 計算化學相似性的典型方法是使用化學指紋,但這会导致丟失有關分子拓撲的基礎信息。挖掘分子圖直接避免了這個問題。反向QSAR問題也適用於矢量映射問題。 編碼(分子i,分子j\neq i) 核心方法 邊緣化圖形核心…

层次聚类

在数据挖掘和统计学中,层次聚类()是一种旨在建立聚类的层次结构的聚类分析方法。层次聚类的策略通常有两种: 凝聚(Agglomerative clustering):一种自底向上方法,从小集群开始,逐渐将其合并,形成更大的集群; 分裂(Divisive clustering):一种自顶向下方法,从单个集群开始,递归地将其拆分成更小的集群。 凝聚和分离的操作通常用贪心算法实现,结果通常用展示。 标准的凝聚层次聚类(Hierarchical …

潜空间 (机器学习)

潜空间()也被称为潜特征空间或嵌入空间,是一组元素在流形内的嵌入,相似的元素在潜空间内的距离较小。潜空间中的位置由一组潜变量定义,这些潜变量产生于元素间的相似性。 大多数情况下,潜空间的维度都要设定得低于数据点特征空间的维度,意味着潜空间的构建实际上是降维,也可看作是数据压缩的一种形式。潜空间通常通过机器学习进行拟合,然后可被用作机器学习模型的特征空间,包括分类器等监督预测器。 对机器学习模型潜空间的解释是一个活跃的研究领域,但很难实现…

資料倉儲

在计算机领域,数据仓库(,也称为企业数据仓库)是用于和数据分析的系统,被认为是商业智能的核心组件。 数据仓库是来自一个或多个不同源的集成数据的中央存储库。数据仓库将当前和历史数据存储在一起,用于为整个企业的员工创建分析报告。 存储在仓库中的数据从(例如营销或销售)上傳。这些数据可能会通过一个ODS数据库,并且可能需要进行额外操作的数据清理使用分级、数据集成和访问层来存放其关键功能。分级层或分级数据库存储从每个不同的源数据系统中提取的原始…

線上分析處理

联机分析处理(),简称OLAP (),是计算机技术中快速解决(MDA)的一种方法。OLAP是更广泛的商业智能范畴的一部分,它还包括关系数据库、报告编写和数据挖掘。OLAP的典型应用包括销售、市场营销、管理报告、业务流程管理(BPM)、預算和、財務報表以及类似领域,新的应用正在出现,如农业。 OLAP工具让用户能够从多个角度交互地分析多维数据。OLAP由三个基本的分析操作组成:上卷(roll-up)、钻取(drill-down)、切片(s…

ETL

提取转换加载(,简称ETL),用來描述將資料從來源端經過抽取、轉换、載入至目的端的過程。ETL一詞較常用在資料倉儲,但其對象並不限於資料倉儲。 ETL與ELT ETL所描述的過程,一般常見的作法包含ETL或是ELT(Extract-Load-Transform),並且混合使用。通常愈大量的資料、複雜的轉換邏輯、目的端為較強運算能力的資料庫,愈偏向使用ELT,以便運用目的端資料庫的平行處理能力。 工具 ETL(或ELT)的流程可以用任何的…

特征 (机器学习)

在机器学习和模式识别中,特征是被观测对象的可测量性能或特性。在模式识别、分类和回归中,信息特征的选择、判别和独立特征的选择是有效算法的关键步骤。特征通常是数值型的,但可以使用结构特征(如字符串和图)。“特征”的概念与線性回歸等统计技术中使用的解释变量有关。 參考資料