训练集、验证集和测试集
机器学习的普遍任务就是从数据中学习和构建模型(该过程称之为训练),并且能够在将来遇到的数据上进行预测。用于构建最终模型的数据集通常有多个;在构建模型的不同阶段,通常有三种数据集:训练集、验证集和测试集。 首先,模型在训练集(英语:training dataset)上进行拟合。对于监督式学习,训练集是由用来拟合参数(例如人工神经网络中神经元之间链接的权重)的样本组成的集合。在实践中,训练集通常是由输入向量(标量)和输出向量(标量)组成的数…
共 5 篇文章
机器学习的普遍任务就是从数据中学习和构建模型(该过程称之为训练),并且能够在将来遇到的数据上进行预测。用于构建最终模型的数据集通常有多个;在构建模型的不同阶段,通常有三种数据集:训练集、验证集和测试集。 首先,模型在训练集(英语:training dataset)上进行拟合。对于监督式学习,训练集是由用来拟合参数(例如人工神经网络中神经元之间链接的权重)的样本组成的集合。在实践中,训练集通常是由输入向量(标量)和输出向量(标量)组成的数…
BookCorpus (也称Toronto Book Corpus )是一个数据集,包含互联网上收集的约 11,000 本未出版书籍的文本。它是用于训练OpenAI的GPT初始版本的主要语料库,并用作包括谷歌的BERT在内的,其他早期大型语言模型的训练数据。 该数据集包含约 9.85 亿单词,涵盖了多种类型的书籍,包括浪漫小说、科幻小说和奇幻小说。 多伦多大学和麻省理工学院的研究人员在 2015 年的一篇题为“Aligning Book…
TIMIT(),是由德州仪器、麻省理工学院和SRI International合作构建的声学-音素连续语音语料库。 TIMIT数据集的语音采样频率为16kHz,一共包含6300个句子,由来自美国八个主要方言地区的630个人每人说出给定的10个句子,所有的句子都在音素级别(phone level)上进行了手动分割,标记。70%的说话人是男性;大多数说话者是成年白人。 外部連結 *
]] 安德森鸢尾花卉数据集(英文:'),也称鸢尾花卉数据集(英文:')或费雪鸢尾花卉数据集(英文:*'),是一种多重变量分析的数据集。它最初是埃德加·安德森从加拿大加斯帕半岛的鸢尾属花朵中提取的形態學变异数据,后由羅納德·費雪作为判別分析的一个例子,运用到统计学中。 其数据集包含了150个样本,都属于鸢尾属下的3个亚属,分别是山鸢尾、变色鸢尾和。每个样本都包含4项特征,即花萼和花瓣的长度和宽度,它们可用于样本的定量分析。基于这些特征,费…
開啟的Common Voice繁體中文首頁]] Common Voice是由Mozilla基金會所发起的群眾參與專案,旨在為語音辨識軟體建立自由資料庫。這項專案受到志工們的協助,以麥克風來進行錄音及分類他人所錄製的聲音。收集的句子及語音都將收錄至以CC0授權釋出至公有領域的資料庫當中。這項授權許可讓程式設計師們能不受限制或成本地將資料庫使用於語音辨識的應用程式當中。 宗旨 Common Voice旨在提供多樣化的語音樣本。根据Mozil…