卷积神经网络
卷积神经网络(,縮寫:CNN)是一种前馈神经网络,它的人工神经元可以响应一部分覆盖范围内的周围单元,对于大型图像处理有出色表现。 卷积神经网络由一个或多个卷积层和顶端的全连通层(对应经典的神经网络)组成,同时也包括关联权重和池化层(pooling layer)。这一结构使得卷积神经网络能够利用输入数据的二维结构。与其他深度学习结构相比,卷积神经网络在图像和语音识别方面能够给出更好的结果。这一模型也可以使用反向传播算法进行训练。相比较其他…
共 33 篇文章
卷积神经网络(,縮寫:CNN)是一种前馈神经网络,它的人工神经元可以响应一部分覆盖范围内的周围单元,对于大型图像处理有出色表现。 卷积神经网络由一个或多个卷积层和顶端的全连通层(对应经典的神经网络)组成,同时也包括关联权重和池化层(pooling layer)。这一结构使得卷积神经网络能够利用输入数据的二维结构。与其他深度学习结构相比,卷积神经网络在图像和语音识别方面能够给出更好的结果。这一模型也可以使用反向传播算法进行训练。相比较其他…
零样本学习(,简称:)是机器学习中的一种问题设定,指模型在没有目标类别或目标任务标注样本的情况下,对这些“未见”类别或任务作出预测。经典零样本学习通常以类别为单位划分训练和测试:训练集只包含“见过类”()的标注样本,测试阶段则要求模型识别训练时没有出现过的“未见类”()。为了实现这种迁移,模型通常需要借助类别属性、文本描述、词向量、知识图谱或其他语义表示,把训练类别和测试类别联系起来。 零样本学习与小样本学习、单一样本学习相近,但含义不…
单一样本学习(),又称单样本学习,是机器学习和人工智能中研究模型能否从极少标注数据中泛化的一类学习范式。其典型目标是在某个新类别、新概念或新任务只有一个带标注样本时,仍能对未见样本作出分类、识别、匹配或生成。单一样本学习通常不表示整个模型只用一个样本从头训练,而是表示模型在既有先验知识、预训练表征、迁移学习或元学习经验的帮助下,在目标类别只有一个样本时完成适应和判断。 }}
立普思是一家台灣機器視覺領域的整合系統供應商,提供 3D 影像視覺解決方案。主要業務為設計、定制和生產 3D 深度相機 ,開發 3D 視覺軟體與系統,以(Stereo)、結構光(Structured Light)及時間差(Time-of-Flight, ToF)技術為原理。 歷史 2013年,立普思由MIT計算機科學與人工智慧實驗室畢業生團隊成立,現任執行長劉凌偉為其中一員。 參考文獻
自监督学习(,缩写:)是机器学习中的一种学习范式,指模型在没有人工标注标签的情况下,从输入数据本身构造监督信号,并通过这种自动生成的任务学习可迁移的表示。自监督学习通常被视为无监督学习的一类,但训练过程又具有监督学习的形式。及模型会根据数据内部结构生成目标标签,例如预测被遮蔽的词、还原被遮挡的图像块、判断两个增强视图是否来自同一图像,或预测音频片段中被遮蔽的潜在表示。 自监督学习的目标通常不是直接完成预训练时设置的任务,而是借助这些任务…
人脸年龄估计或面部年龄估计是指利用人工智能,根据个人的面部特征来推测其年龄的技术。该技术通过计算机视觉方法,分析数百万已知年龄者的面部图像特征,并借助深度学习构建算法模型,从而对未知人员的年龄进行预测。这项技术的核心应用在于限制对特定年龄级别商品和服务的访问。具体实例包括:防止儿童接触互联网色情内容;在社交媒体账户注册时核实用户是否达到法定最低年龄;以及阻止成年人访问专为儿童设计的网站、在线聊天室或游戏。 该技术与臉部辨識系統有着本质区…
Inception是一系列用於計算機視覺的卷積神經網路(CNN),由Google研究人員於2014年以GoogLeNet之名提出(後更名為Inception v1)。該系列在歷史上具有重要意義,作為早期CNN之一,它將「莖部」(資料輸入)、「軀幹」(資料處理)與「頭部」(預測)分開,這種架構設計至今仍存在於所有現代CNN中。 版本歷史 Inception v1 2014年,Google的一支團隊開發了GoogLeNet架構,其中一個實作…
隐马尔可夫模型(;縮寫:),或稱作-{zh-cn:隐性马尔可夫模型;zh-tw:隱性馬可夫模型}-,是统计模型,用来描述一个含有隐含未知参数的马尔可夫过程。其难点是从可观察的参数中确定该过程的隐含参数。然后利用这些参数来作进一步的分析,例如模式识别。 在正常的马尔可夫模型中,状态对于观察者来说是直接可见的。这样状态的转换概率便是全部的参数。而在隐马尔可夫模型中,状态并不是直接可见的,但受状态影响的某些变量则是可见的。每一个状态在可能输出…
超二次曲面体(英文:Superquadric)是一类几何体,其表面方程由椭球体或其他二次曲面体方程演化而来。将椭球体表面方程中的指数由2更改为其他任意正实数,即得到超二次曲面体。 超二次曲面体可以表达圆角或近似方角的立方体、八面体、圆柱等诸多形状,是一种很好的计算机三维图形模型。
运动推断结构(SfM),又稱運動恢復結構,是一种摄影测量范围成像技术,用于估计二维图像序列中的三维结构,这些图像可能与局部运动信号相结合。它是在计算机视觉和视觉感知领域进行研究的。在生物视觉上,运动推断结指的是人类和其他生物能够从一个移动物体或场景中投射的二维(视网膜)运动场中恢复三维结构的现象。
在電腦視覺中,顯著性是一種圖像分割的模式,而顯著圖()是顯示每個像素獨特性的圖像。顯著圖的目標在於將一般圖像的表示簡化或是改變為更容易分析的樣式。舉例來說,某個像素在一張彩色圖中具有較高的灰階,其會在顯著圖中以較為明顯的方式被顯示出來。 視覺刺激的觀點上,如果某些特徵特別能夠被捕捉到注意力,這樣子的特性在心理學上被稱為顯著性()。 圖像顯著性 如前述,顯著性是圖像分割的一部分,圖像分割通常用於定位圖像中的物體和邊界(例:線條,曲線等)。…
结构光三维扫描仪()是一种设备,用于使用投射的光图案和摄像头系统测量物体的三维形状。 原理 将窄带的光投影到三维形状的表面上会产生一条照明线,该照明线从投影器的其他角度来看存在一定的变形,这种变形可用于表面形状(光覆盖的部分)的几何重建。 更快更通用的方法是一次投影由多个条纹或任意条纹组成的图案,因为这样可以同时采集多个样本。 从不同的角度观察,由于物体的表面形状,图案呈现出几何变形。 尽管结构化光投影可能存在很多变体,但是使用最广泛的…
心理视觉增强()或稱自适应增强()、明亮掩碼(),是一种由心理物理学启发的数字图像与数字视频处理技术,用于改善图像与视频的主观质量。 理论 根据心理物理学的韦伯定理,同一类刺激的最小可觉差与刺激的大小成比例。在图像与视频应用中,这一定理就体现为人对细节区域(比如,边缘)的相邻像素差异较为敏感,而对平滑区域差异则相对不敏感。因此可以对细节区域增加对比度,而对平滑区域减少对比度,从而在总的比特数量级不变的情况下,提高整体的主观质量。 在图像…
与理光THETA的产品]] 全景相机是一种成像视角可以覆盖整个球面或者至少可以覆盖水平面上环形视野的相机。目前常见于消費電子產品与部分科学领域,全景相机也被称作全向照相机(,词前缀“omni-”意为“全部”;此称谓常用于计算机图形领域),或360度相机()。 全景相机在需要广视野的场景非常重要,比如全景摄影与机器人学两个领域。 概述 的街景图的拍摄车,车顶支起了一个全景相机。]] 一台照相机的视场角通常从几度到最多180度不等。这意味着…
图像处理是指对图像进行分析、加工和处理,使其满足视觉、心理或其他要求的技术。随着人工智能与深度学习的发展,现代图像处理已广泛应用于医疗影像分析、自动驾驶、遥感测绘与工业检测等场景。 图像处理是信号处理在图像领域上的一个应用。目前大多数的图像均是以数字形式存储,因而图像处理很多情况下指数字图像处理。此外,基于光学理论的处理方法依然占有重要的地位。 图像处理是信号处理的子类,另外与计算机科学、人工智能等领域也有密切的关系。 传统的一维信号处…
Vicarious是一家總部位於加州舊金山灣區的人工智慧公司,該公司利用大腦的理論計算原理,試圖打造能夠像人類一样進行思考和学习的軟體。Vicarious將其技術描述為「一種即裝即用機器人解決方案整合器,利用人工智慧實現『對於傳統自動化技術而言過於複雜和多樣化的任務』的自動化」。Alphabet公司於2022年收購了該公司,但未透露收購價格。 創始人 该公司由D. Scott Phoenix和Dileep George博士于2010年创…
计算机视觉(Computer vision)是一门研究如何使机器“看”的科学,更进一步的说,就是指用摄像机和计算机代替人眼对目标进行识别、跟踪和测量等机器视觉,并进一步做图像处理,用计算机处理成为更适合人眼观察或传送给仪器检测的图像。 作为一門科学学科,计算机视觉研究相关的理论和技术,试图建立能够从图像或者多维数据中获取「信息」的人工智能系统。这里所指的信息指香农定义的,可以用来帮助做一个“决定”的信息。因为感知可以看作是从感官信号中提…
的一部分)早期的机器视觉系统Autovision II在一个展销会进行展示。三脚架上的相机向下对着一个浅色的桌子以将背光的照片展示在屏幕中,之后将进行连通区域提取。]] 机器视觉(,简称“”) 是指用于自动检测、分析的一种基于成像技术的方法,在工业自动化检测、过程控制和机器人引导等领域得到了广泛应用。机器视觉涵盖了多种技术、软件和硬件产品、集成系统、动作、方法和专业知识。机器视觉作为系统工程学科的一种,被认为不同于属于计算机科学的计算机…
联合相容分枝定界(,简称JCBB), 是计算机视觉和机器人研究中在同时定位与地图构建(SLAM)时经常使用的一种数据关联算法。 JCBB算法通过比较一对数据的联合相容性,可以比较成功的判别虚假的配对,因此在比较复杂的数据中可以比较能够体现出它的鲁棒性。 参考文献
哈尔特征()是用于物体识别的一种数字图像特征。它们因为与哈尔小波转换极为相似而得名,是第一种即时的人脸检测運算。 历史上,直接使用图像的强度(就是图像每一个像素点的RGB值)使得特征的计算强度很大。帕帕乔治奥等人提出可以使用基于哈尔小波的特征而不是图像强度。维奥拉和琼斯进而提出了哈尔特征。哈尔特征使用检测窗口中指定位置的相邻矩形,计算每一个矩形的像素和并取其差值。然后用这些差值来对图像的子区域进行分类。 例如,当前有一个人脸图像集合。通…