数据科学
-{zh-cn:数据科学;zh-tw:資料科學}-()又称-{zh-cn:资料科学;zh-tw:數據科學}-,是一门利用数据(-{zh-cn:资料;zh-tw:數據}-)学习知识的學科,其目标是透过从数据中提取出有价值的部分来生产数据产品,学科范围涵盖了:数据取得、数据处理、数据分析等过程,举凡与數據有关的科学均属数据科学。 数据科学结合了诸多领域中的理论和技术,包括应用数学、统计、模式识别、机器学习、数据可视化、数据仓库以及高性能计算…
共 14 篇文章
-{zh-cn:数据科学;zh-tw:資料科學}-()又称-{zh-cn:资料科学;zh-tw:數據科學}-,是一门利用数据(-{zh-cn:资料;zh-tw:數據}-)学习知识的學科,其目标是透过从数据中提取出有价值的部分来生产数据产品,学科范围涵盖了:数据取得、数据处理、数据分析等过程,举凡与數據有关的科学均属数据科学。 数据科学结合了诸多领域中的理论和技术,包括应用数学、统计、模式识别、机器学习、数据可视化、数据仓库以及高性能计算…
J.A.G. JAPAN株式会社(,)是總部位於日本東京都澀谷区澀谷的諮詢公司。 2010年11月,大濱﨑卓真創立公司前身J.A.G. JAPAN合同会社;2015年4月,改組為J.A.G. JAPAN株式会社。主要提供国政選舉及地方選舉的選舉諮詢,調查及分析選情,向政党、政治團体及政治人物提供面向政治人物的雲端名冊應用程式,並向主要傳媒提供選舉結果預測及分析文章等。另有使用地理資訊系統,提供可視化數據。 應對新型冠狀病毒感染症 201…
目视检测是质量控制过程中的一种常用的无损检测方法。在維修設備时,利用視覺、聽覺、觸覺和嗅覺或任何非專業檢測設備。超聲波、X光、紅外線等檢查,通常不被視為目視檢查,因為這些檢查方法需要專門的設備,培訓和認證。 目视检测分为直接和間接两种,其區別是: 直接目視檢查:直接使用肉眼檢查,而無需中斷受測物和眼睛之間的路徑。 间接目視檢查:利用照相機等非專業檢測設備。
聚类分析()亦称-{集群}-分析,是对于统计数据分析的一门技术,在许多领域受到广泛应用,包括机器学习,数据挖掘,模式识别,图像分析以及生物信息。聚类是把相似的对象通过静态分类的方法分成不同的组别或者更多的子集(subset),这样让在同一个子集中的成员对象都有相似的一些属性,常见的包括在坐标系中更加短的空间距离等。 一般把数据聚类归纳为一种非監督式學習。 定义 聚类(clustering)的概念不能精确定义,这也是为什么聚类算法众多的原…
枢轴表()也翻译成透视表,是用来汇总其它表的数据。首先把源表分组(grouping),然后对各组内数据做汇总操作如排序、平均、累加、计数或字符串连接等。透视表用于数据处理,在数据可视化程序如电子表格或商业智能软件中常见。这种“枢轴”或者pivoting汇总表的概念得以命名。 举例: 一个平凡的例子:第一张表包含一列数,透视表仅含一行一列为源表该列的均值。 稍微复杂点的例子,源表有两列分别为性别与“身高”,每行给出一个人的性别与高度;透视…
,平均值為(1, 3),標準差在(0.878, 0.478)方向上為3、在其正交方向上為1的主成分分析。黑色的兩個向量是此分布的共變異數矩陣的特征向量,其長度為對應的特征值之平方根,並以分布的平均值為原點。]] 在多變量分析中,主成分分析(,縮寫:)是一種統計分析、簡化數據集的方法。它利用正交变换来对一系列可能相关的变量的观测值进行线性变换,从而投影为一系列线性不相关变量的值,这些不相关变量称为主成分(Principal Compone…
幽灵数据(), 是指从数据科学、统计学角度处理我们一般看不见的数据,量子成像或,“暗物质”或“暗能量”及其在计算机视觉领域中的新发现,甚至还包括与文物资料、经历等相关的认知数据。 在量子场论的术语中,(ghost)、幽灵场(ghost field)或规范幽灵(gauge ghost)是规范场论中的非物理状态。在局部场超过多个物理自由度的情况下,必须使幽灵保持理论的不变性。在数据科学、统计学、计算机等术语中,幽灵数据包括为数字幽灵(dig…
在统计学和图像处理中,通过建立近似函数尝试抓住数据中的主要模式,去除噪音、结构细节或瞬时现象,来平滑一个数据集。在平滑过程中,信号数据点被修改,由噪音产生的单独数据点被降低,低于毗邻数据点的点被提升,从而得到一个更平滑的信号。平滑可以两种重要形式用于数据分析:一、若平滑的假设是合理的,可以从数据中获得更多信息;二、提供灵活而且穩健的分析。有许多不同的算法可用于平滑。数据平滑通常通过最简单的密度估计或直方图完成。 线性平滑 在平滑值可写为…
期间,盟军情报部门用统计学方法准确地估计了德国坦克的生产数量,如豹式坦克。]] 在统计学理论的估计中,用不放回抽样来估计离散型均匀分布最大值问题中著名的德国坦克问题(),它因在第二次世界大战中用于估计德国坦克数量而得名。 这些分析说明了频率推断和贝叶斯推断之间的不同。 基于“单个”样本估计的样本总数各有不同,而在“多个”样本的基础上估计则是现实生活中一个很有意义的估计问题,它的答案很简单,但并不那么明显。 范例 假设某个情报人员已经发现…
数据分析是一種统计学常用方法,其主要特点是多维性和描述性。有些几何方法有助于揭示不同的数据之间存在的关系,并绘制出统计信息图,以更简洁的解释这些数据中包含的主要信息。其他一些用于收集数据,以便弄清哪些是同质的,从而更好地了解数据。 資料分析可以处理大量数据,并确定这些数据最有用的部分。本学科近年来的成功,很大程度上是因为制图技术的提高。这些图可以通过直接分析数据,来突出难以捕捉的关系;更重要的是,这些表达方法与基于现象分布的“先验”观念…
邻里成分分析()是一种监督式学习的方法,根据一种给定的距离度量算法对样本数据进行度量,然后对多元变量数据进行分类。在功能上其和k近邻算法的目的相同,直接利用随即近邻的概念确定与测试样本临近的有标签的训练样本。 定义 邻里成分分析是一种距离度量学习方法,其目的在于通过在训练集上学习得到一个线性空间转移矩阵,在新的转换空间中最大化平均留一(LOO)分类效果。该算法的关键是与空间转换矩阵相关的的一个正定矩阵A,该矩阵A可以通过定义A的一个可微…
在统计学中,自助法(Bootstrap Method,Bootstrapping,或自助抽樣法、拔靴法)是一种从给定训练集中有放回的均匀抽样,也就是说,每当选中一个样本,它等可能地被再次选中并被再次添加到训练集中。自助法由Bradley Efron于1979年在《Annals of Statistics》上發表。當樣本來自能以正态分布來描述的总体,其為正态分布;但當樣本來自的总體無法以正态分布來描述,則以漸進分析法、自助法等來分析。採用…
複迴歸分析,是以關係式表示目的變數和解釋變數之間的關係,然後用於預測的方法。它與主成分分析同為多變量分析。在有目的變數的情形下,使用複迴歸分析;在沒有目的變數的情形下,使用主成分分析。通常此種分析方法會藉助統計軟體計算。
Canoco(canonical community ordination)是生态学方面多元数据排序分析的一个商业软件。 版本历史 1985年:Canoco 1.0 1985年:Canoco 2.0 1990年:Canoco 3.0 1998年:Canoco 4.0 2002年:Canoco 4.5(2002年) 2012年:Canoco 5 参考文献 外部链接 [http://www.wageningenur.nl/en/show/C…