DuerOS
DuerOS,是百度旗下度秘事業部推出的對話式人工智能系統,面向智能家居等物联网上游厂商提供人工智能语音识别与交互解决方案。 搭載設備可讓用戶以自然語言對話的交互方式,實現影音娛樂、信息查詢、生活服務、出行路況、設備控制、情感交流、鏈接服務、日程管理等10大類目的250多項功能的操作。目前已與國內外多家企業達成戰略合作,在中國和美國約有千人規模的團隊在開發人工智能技術。作為一個開放的操作系统,同時發布開放平台,搭建語音AI生態體系,支持…
共 21 篇文章
DuerOS,是百度旗下度秘事業部推出的對話式人工智能系統,面向智能家居等物联网上游厂商提供人工智能语音识别与交互解决方案。 搭載設備可讓用戶以自然語言對話的交互方式,實現影音娛樂、信息查詢、生活服務、出行路況、設備控制、情感交流、鏈接服務、日程管理等10大類目的250多項功能的操作。目前已與國內外多家企業達成戰略合作,在中國和美國約有千人規模的團隊在開發人工智能技術。作為一個開放的操作系统,同時發布開放平台,搭建語音AI生態體系,支持…
*'(,語音解析及辨識介面)是一款內建在蘋果iOS系统中的人工智能助理軟體。此軟體使用自然語言處理技術,使用者可以使用自然的對話與手機進行互動,完成搜尋資料、查詢天氣、設定手機日曆、設定鬧鈴等許多服務。“Siri”一詞在挪威語中它的意思是「帶領你走向勝利的美麗女神」。 2019年8月底,蘋果公司因為允許第三方合約人,聆聽用戶無意的錄音(例如人类性行为的聲音)而道歉。然而,蘋果公司在10月底,繼續允許人檢閱用戶的錄音。 Siri公司建立於…
谱建模合成(Spectral modeling synthesis,SMS)是用于语音和其他信号的一种声学建模方法。 SMS将声波视作谐波部分和噪声部分的组合。谐波部分根据信号频谱中的峰值确定,通常由短时距傅里叶变换发现。去除频谱成分后剩下的信号(有时称为残余信号,residual)可模拟为通过了时变滤波器的加性高斯白噪声。则模型的输出是测得谐波成分的频率和电平,以及时变滤波器的系数。 直观地说,该模型可用于多种类型的音频信号。例如,语…
言语知觉的运动理论(Motor theory of speech perception),是一种认为人们通过辨认发音的声道姿势而非语言的发音习惯来理解话语的假说。它最初声称(言語感知)是通过一个人类天生特有的特殊模块完成的。虽然这个模块在近几年的理论中得到认证,。这导致了一次有关讲话声音如何与其声谱图的听音序列相对应的仔细检查。这才发现,连续辅音和元音彼此同时重叠(这种现象被称为协同发音)。这表明,言语不是听觉的“字母表”或“密码”,而…
人工智能检测软件旨在确定某些内容(文本、图像、视频或音频)是否是使用人工智能(AI)生成的。 截至2023年,这方面的典型案例有诸如GPTZero这样的软件,该软件声称可以检测文本是否是由人工智能生成,有时被大学和高校用于防范学生的学术抄袭。然而,关于这类软件是否可靠的争论不断,同时也存在对教育工作者可能误用AI检测软件担忧。 准确性问题 事实证明,多个人工智能检测工具在准确和全面检测生成的人工智能生成文本方面表现不可靠。在韦伯·伍尔夫…
基于变换器的双向编码器表示技术(,BERT)是用于自然语言处理(NLP)的预训练技术,由Google提出。2018年,雅各布·德夫林和同事创建并发布了BERT。Google正在利用BERT来更好地理解用户搜索语句的语义。2020年的一项文献调查得出结论:「在一年多一点的时间里,BERT已经成为NLP实验中无处不在的基线」,算上分析和改进模型的研究出版物超过150篇。 最初的英语BERT发布时提供两种类型的预训练模型以及英語維基百科语料,…
自然語言處理(,缩写作 *')是人工智慧和語言學領域的交叉學科,研究计算机处理、理解与生成人类语言的技術。此領域探討如何處理及運用自然語言;自然語言處理包括多方面和步骤,基本有认知、理解、生成等部分。 自然語言認知和理解是讓電腦把输入的語言变成结构化符号与语义关系,然后根据目的再處理。自然語言生成系統则是把計算機數據轉化為自然語言。 自然语言处理要研制表示语言能力和语言应用的模型, 建立计算框架来实现并完善语言模型,并根据语言模型设计各…
语音识别(speech recognition)技术,也被称为自动语音识别()、電腦語音識別()或是語音轉文本識別(')*,其目标是以電腦自動将人类的语音内容转换为相應的文字。与及说话人确认不同,后者尝试识别或确认发出语音的说话人而非其中所包含的词汇内容。 语音识别技术的应用包括语音拨号、语音导航、室内设备控制、语音文档检索、简单的听写数据录入等。语音识别技术与其他自然语言处理技术如机器翻译及语音合成技术相结合,可以构建出更加复杂的应用…
语音活性检测 (Voice activity detection,VAD), 也称为 speech activity detection or speech detection, 是一项用于语音处理的技术,目的是检测语音信号是否存在。 VAD技术主要用于语音编码和语音识别。它可以简化语音处理,也可用于在音频会话期间去除非语音片段:可以在IP电话应用中避免对静音数据包的编码和传输,节省计算时间和带宽。 VAD技术使得一些列基于语音的应用程…
TIMIT(),是由德州仪器、麻省理工学院和SRI International合作构建的声学-音素连续语音语料库。 TIMIT数据集的语音采样频率为16kHz,一共包含6300个句子,由来自美国八个主要方言地区的630个人每人说出给定的10个句子,所有的句子都在音素级别(phone level)上进行了手动分割,标记。70%的说话人是男性;大多数说话者是成年白人。 外部連結 *
語音輸入法是將使用者說出話語,透過語音識別的技術將所說的話轉換成文字輸入到數位裝置去,包括手機平板電腦和桌上型電腦或筆記型電腦等,有些裝置必須另外安裝相關的輸入裝置,才能使用語音輸入的功能。 語音輸入法的好處是使用者的只要說出聲音就可以轉換成文字輸入進去,但由於每個人說話的音調音量透氣聲聞皆不相同,而有可能會辨識到相近的聲音或是其他同音諧音字,而不符合使用者要表達的意思,而使用者需要再次的檢查與更正,而有些系統有學習的功能 他可以知道這…
模件音频识别框架(,MARF)是一个用JAVA写的采集声音/语音/语言/文本和自然语言处理(NLP)算法的研究平台。它被安排进一个模件和延伸性框架用来试图促进新的算法。MARF可在应用软件中用作库来使用或作为学习和扩展的原始资料。MARF提供了几种应用的例子来展示如何使用框架。同时MARF提供了详细的JAVA DOC格式使用手册和[http://marf.sourceforge.net/api-dev/ API 参考]。MARF 及其应…
小爱同学是小米科技于2017年7月26日发布的智慧型個人助理,適用於小米科技的智慧音響,手機,電視,手錶及手環等穿戴裝置,建構在小米水滴平台(现更名为小爱开放平台)數據庫上。可直接连接至米家物聯網系統。 当前小爱同学仅在中國大陆版MIUI及智能硬件上搭载,支持部分中国方言。 小爱同学也存在适用于非MIUI设备的版本,但功能上存在一定限制。 发展历史 2017年9月6日,小爱同学随着小米电视4A的发布亮相。 2017年7月,小米AI音箱发…
Otter.ai是一間總部設於加利福尼亞州洛思阿圖斯的科技公司,利用人工智能及机器学习研發語音轉文字及翻譯程式。其產品Otter為實時演講者提供字幕,並就演講內容生成書面抄本。 歷史 Otter.ai舊稱「AISense」,由兩名擁有多年人工智慧相關工作經驗的計算機科學工程師及Yun Fu於2016年創立。創辦該公司的想法來自梁松很難記住自己過往曾參與的眾多會議上所說的話,以及與人分享會議內容時所遇到的挑戰。後來,梁松成為公司的行政總裁…
小艺(中国大陆以外地区称Celia)是华为推出的内置于EMUI和HarmonyOS的人工智能虛擬助理。中国大陆版于2018年10月26日推出,而国际版于2020年4月推出。 历史 2018年10月26日,中国大陆版华为Mate 20系列发布,AI语音助手小艺亦同时发布。2019年,小艺发布新版本,官方称“由语音助手升级为智慧助手”。与过往版本不同的是,新版本的小艺可以连续执行多个任务。受中美贸易战影响,华为之后推出的智能手机不能搭载Go…
声学模型(Acoustic model)是语音识别系统中最为重要的部分之一,目前的主流系统多采用隐马尔科夫模型进行建模。 隐马尔可夫模型的概念是一个离散时域有限状态自动机,隐马尔可夫模型HMM是指这一马尔可夫模型的内部状态外界不可见,外界只能看到各个时刻的输出值。对语音识别系统,输出值通常就是从各个帧计算而得的声学特征。用HMM刻画语音信号需作出两个假设,一是内部状态的转移只与上一状态有关,另一是输出值只与当前状态(或当前的状态转移)有…
口语语料库为语言音频文件和文字副本的数据库。在里,口语语料库可用于创建声学模型,配合语音识别引擎使用。在语言学里,口语语料库可用于语音学、、方言学等方面的研究。 口语语料库主要分为朗读语料和自然口语两类。 参考文献 Edwards, Jane / Lampert, Martin (eds.) (1992): Talking Data – Transcription and Coding in Discourse Research. Hi…
语音文档检索是针对以声音形式存在的文档的信息检索。其基本定义为:是给定一个检索以及一定数量的语音文档,返回与检索需求关系最为接近的文档集合。从狭义上说,检索需求指的是一些检索词或短语,而相关性指的是语音内容与检索需求的关系。从广义上说,检索需求还包括说话人,说话风格等高层次的信息。 最基本的语音文档检索系统有以下三个主要任务: 对语音文档进行切析与识别,提取出语音中内容信息。 对于识别结果建立索引。 *根据用户的检索需求,返回语音文档。…
開啟的Common Voice繁體中文首頁]] Common Voice是由Mozilla基金會所发起的群眾參與專案,旨在為語音辨識軟體建立自由資料庫。這項專案受到志工們的協助,以麥克風來進行錄音及分類他人所錄製的聲音。收集的句子及語音都將收錄至以CC0授權釋出至公有領域的資料庫當中。這項授權許可讓程式設計師們能不受限制或成本地將資料庫使用於語音辨識的應用程式當中。 宗旨 Common Voice旨在提供多樣化的語音樣本。根据Mozil…
一個語音辨識系統主要分成訓練(training)和測試(testing)。訓練多半在實驗室把較為理想的訓練語料(training data)訓練成一個聲學模型(acoustic model),而在實際應用上,測試則不像訓練一樣是在一個理想的環境進行,因此造成與訓練出來的模型無法吻合的很好,導致辨識準確度下降。 也因為上述原因,在進行辨識前進行語音加強則成為一個很重要的步驟,也就是希望能夠在辨識前,盡量減少環境雜訊對語音信號的影響,進而提…