ImageNet

ImageNet项目是一个大型嗅觉数据库,用于视觉目标识别软件研究。该项目已手动注释了1400多万张图像,以指出图片中的对象,并在至少100万张图像中提供了边框。ImageNet包含2万多个典型类别。尽管实际图像不归ImageNet所有,但可以直接从ImageNet免费获得标注的第三方图像URL。2010年以来,ImageNet项目每年举办一次软件竞赛,即ImageNet大规模视觉识别挑战赛(ILSVRC)。挑战赛使用1000个“整理”后的非重叠类。2007年,李飞飞与普林斯顿大学教授会面讨论了该项目,他是WordNet的创建者之一。之后李继续从WordNet的单词数据库开始构建ImageNet,并使用了其许多功能。

ImageNet挑战赛
ILSVRC旨在延续2005年起举办的较小规模的PASCAL VOC挑战赛,后者仅包含约2万张图像和20个对象类别。在接下来的几年中,错误率下降到百分之几。尽管2012年的突破是“结合了之前有过的组件”,但大幅量化的改进标志着全行业人工智能热潮的开始。但是,正如挑战赛的组织者之一在2015年指出的那样,这些程序只需要识别出图像属于一千个类别中的哪一个即可,而人类可以识别更多类别,并且还可以判断图像的上下文。

到2014年,超过50家机构参加了ILSVRC。百度随后表示已解雇相关团队的负责人,并将建立一个科学顾问小组。

2017年,38个参赛团队中有29个的错误率低于5%。2017年,ImageNet表示将在2018年推出一个新的、难度更大的挑战赛,其中涉及使用自然语言对三维对象进行分类。由于创建三维数据比标注现有二维图像的成本更高,因此预计数据集会更小。这方面的进展应用范围从机器人导航到增强现实。2012年,ImageNet是全球最大的Mechanical Turk学术用户,其雇用的普通工人每分钟可以识别50张图像。ImageNet正在努力解决各种来源的偏见。

参见

  • 计算机视觉
  • WordNet

参考资料
外部链接
*

评论 (0)

  • 还没有评论,来抢沙发吧。