ATEN AI Voice優聲學
ATEN AI Voice 優聲學是宏正自動科技於2021年推出的人工智慧語音技術品牌,專注於開發多語系的文字轉語音(Text-to-Speech, TTS)解決方案,支援包括中文與台語等語言,並提供適用於雲端與地端環境的一站式語音合成系統。 發展歷程 宏正自動科技自2016年起關注AI相關技術的應用,並於2017年啟動語音技術研發。2021年正式推出品牌「ATEN AI Voice優聲學」,並對外發表語音合成技術。自2022年起,該技…
共 8 篇文章
ATEN AI Voice 優聲學是宏正自動科技於2021年推出的人工智慧語音技術品牌,專注於開發多語系的文字轉語音(Text-to-Speech, TTS)解決方案,支援包括中文與台語等語言,並提供適用於雲端與地端環境的一站式語音合成系統。 發展歷程 宏正自動科技自2016年起關注AI相關技術的應用,並於2017年啟動語音技術研發。2021年正式推出品牌「ATEN AI Voice優聲學」,並對外發表語音合成技術。自2022年起,該技…
頻譜差減法()是一種常見的語音增強與雜訊抑制方法,主要用於降低受加性雜訊污染之語音或音訊訊號中的背景雜訊。其基本概念是在頻域中估計雜訊頻譜,並從受雜訊污染的訊號頻譜中扣除該雜訊估計,以恢復乾淨訊號的幅度頻譜或功率頻譜。頻譜差減法因計算量低、結構簡單,常被用於語音通訊、語音辨識前處理、助聽器、即時音訊處理與數位訊號處理教學中。 頻譜差減法屬於頻譜幅度估計(spectral amplitude estimation)的一種基本方法。此類方法…
波束赋形(Beamforming)又叫波束成型、空域滤波,是一种使用传感器阵列定向发送和接收信号的信号处理技术。 波束赋形技术通过调整相位阵列的基本单元的参数,使得某些角度的信号获得相长干涉,而另一些角度的信号获得相消干涉。波束赋形既可以用于信号发射端,又可以用于信号接收端。 波束赋形技术 在发射端,波束赋形器控制每一个发射装置的相位和信号幅度,从而在发射出的信号波阵中获得需要相长和相消干涉模式。在接收端,不同接收器接收到的信号被以一种…
語音處理(),又稱語音訊號處理、人聲處理,是研究语音信号及其处理方法的学科。通常,这些信号是以数字形式进行处理的,因此语音处理可以被视为数字信号处理的一个特殊案例,专门应用于语音信号。语音处理涉及语音信号的获取、操控、存储、传输和输出等多个方面。不同的语音处理任务包括语音识别、语音合成、说话人分离、语音增强、说话人识别等。 語音的相關常識 一般聲音檔格式 取樣頻率:22050Hz 單聲道或雙聲道 每筆資料用8個bit來表示 電腦中沒有經…
语言技术是计算机程序或电子设备分析、生成文本(文字)和语音的過程,這一過程也是人們的研究對象。语言技术涉及语言学、计算机科学、计算语言学、自然语言处理等領域。 参考文献
語音增強()旨在透過各類音訊訊號處理演算法,提升語音訊號在各種聲學環境中的可懂度()與主觀音質()。常見的干擾包括背景噪音、混響、回音(echo)與通道失真等。語音增強技術已廣泛應用於行動通訊、VoIP、視訊會議系統、語音辨識、助聽器及人機互動等領域。 在實際應用中,語音增強演算法的設計面臨多重挑戰,例如環境噪音的不可預測性、多個說話者的干擾、處理延遲對即時通訊的影響,以及在行動裝置上對運算能力與功耗的限制。 噪音的類型與挑戰 語音增強…
; zh-hk:模擬訊號; zh-tw:類比訊號}-,蓝色表示脈衝編碼調變()在4位元下所得取样点;由于位元深度为4即解析度为16(24),每次取样的振幅便是16种可能值之一。]] 在數位音訊與脈衝編碼調變()中,音訊位元深度()是指每次取樣儲存着多少位元()的資訊,数值直接对应着每次取樣的解析度。比如,數位音樂光碟采用16位元儲存取樣,则每个取樣點可以儲存65,536(216)种可能振幅值之一;DVD-A與藍光光碟則最高可支援24位元…
TIMIT(),是由德州仪器、麻省理工学院和SRI International合作构建的声学-音素连续语音语料库。 TIMIT数据集的语音采样频率为16kHz,一共包含6300个句子,由来自美国八个主要方言地区的630个人每人说出给定的10个句子,所有的句子都在音素级别(phone level)上进行了手动分割,标记。70%的说话人是男性;大多数说话者是成年白人。 外部連結 *