啟汀技術(shù)部
大家可能手機上用到過訊飛輸入法,也知道訊飛輸入法的強大之處,作為專業(yè)的手機輸入法服務(wù)端,訊飛的輸入無疑是一個偉大的成就,就連去年的錘子手機也讓訊飛火了一把。現(xiàn)在我們就聊聊訊飛的語音識別技術(shù)吧。
什么是語音識別技術(shù)?
語音識別技術(shù),也被稱為自動語音識別AutomaticSpeechRecognition,(ASR),其目標(biāo)是將人類的語音中的詞匯內(nèi)容轉(zhuǎn)換為計算機可讀的輸入,例如按鍵、二進制編碼或者字符序列。與說話人識別及說話人確認(rèn)不同,后者嘗試識別或確認(rèn)發(fā)出語音的說話人而非其中所包含的詞匯內(nèi)容。
語音識別的原理:
語音識別系統(tǒng)本質(zhì)上是一種模式識別系統(tǒng),包括特征提取、模式匹配、參考模式庫等三個基本單元。未知語音經(jīng)過話筒變換成電信號后加在識別系統(tǒng)的輸入端,首先經(jīng)過預(yù)處理,再根據(jù)人的語音特點建立語音模型,對輸入的語音信號進行分析,并抽取所需的特征,在此基礎(chǔ)上建立語音識別所需的模板。而計算機在識別過程中要根據(jù)語音識別的模型,將計算機中存放的語音模板與輸入的語音信號的特征進行比較,根據(jù)一定的搜索和匹配策略,找出一系列最優(yōu)的與輸入語音匹配的模板。然后根據(jù)此模板的定義,通過查表就可以給出計算機的識別結(jié)果。顯然,這種最優(yōu)的結(jié)果與特征的選擇、語音模型的好壞、模板是否準(zhǔn)確都有直接的關(guān)系。
語音識別系統(tǒng)構(gòu)建過程整體上包括兩大部分:訓(xùn)練和識別。訓(xùn)練通常是離線完成的,對預(yù)先收集好的海量語音、語言數(shù)據(jù)庫進行信號處理和知識挖掘,獲取語音識別系統(tǒng)所需要的“聲學(xué)模型”和“語言模型”;而識別過程通常是在線完成的,對用戶實時的語音進行自動識別。識別過程通常又可以分為“前端”和“后端”兩大模塊:“前端”模塊主要的作用是進行端點檢測(去除多余的靜音和非說話聲)、降噪、特征提取等;“后端”模塊的作用是利用訓(xùn)練好的“聲學(xué)模型”和“語言模型”對用戶說話的特征向量進行統(tǒng)計模式識別(又稱“解碼”),得到其包含的文字信息,此外,后端模塊還存在一個“自適應(yīng)”的反饋模塊,可以對用戶的語音進行自學(xué)習(xí),從而對“聲學(xué)模型”和“語音模型”進行必要的“校正”,進一步提高識別的準(zhǔn)確率。
語音識別的應(yīng)用:
可以應(yīng)用的領(lǐng)域大致分為大五類:
辦公室或商務(wù)系統(tǒng)。典型的應(yīng)用包括:填寫數(shù)據(jù)表格、數(shù)據(jù)庫管理和控制、鍵盤功能增強等等。
制造業(yè):在質(zhì)量控制中,語音識別系統(tǒng)可以為制造過程提供一種“不用手”、“不用眼”的檢控(部件檢查)。
電信:相當(dāng)廣泛的一類應(yīng)用在撥號電話系統(tǒng)上都是可行的,包括話務(wù)員協(xié)助服務(wù)的自動化、國際國內(nèi)遠程電子商務(wù)、語音呼叫分配、語音撥號、分類訂貨。
醫(yī)療:這方面的主要應(yīng)用是由聲音來生成和編輯專業(yè)的醫(yī)療報告。
其他:包括由語音控制和操作的游戲和玩具、幫助殘疾人的語音識別系統(tǒng)、車輛行駛中一些非關(guān)鍵功能的語音控制,如車載交通路況控制系統(tǒng)、音響系統(tǒng)。
那么最接近我們生活的就是我們手機輸入法的語音輸入識別了,可以說訊飛的語音識別技術(shù)已經(jīng)達到了很牛叉的地步了,不僅支持普通話,英語。而且還支持我們中國的方言,所以,訊飛的技術(shù)對于中國語音的發(fā)展是起到了推動的作用。