日B视频 亚洲,啪啪啪网站一区二区,91色情精品久久,日日噜狠狠色综合久,超碰人妻少妇97在线,999青青视频,亚洲一区二卡,让本一区二区视频,日韩网站推荐

0
  • 聊天消息
  • 系統(tǒng)消息
  • 評論與回復(fù)
登錄后你可以
  • 下載海量資料
  • 學(xué)習(xí)在線課程
  • 觀看技術(shù)視頻
  • 寫文章/發(fā)帖/加入社區(qū)
會員中心
創(chuàng)作中心

完善資料讓更多小伙伴認(rèn)識你,還能領(lǐng)取20積分哦,立即完善>

3天內(nèi)不再提示

語音識別是如何識別出各地方言的

454398 ? 來源:ST社區(qū) ? 作者:ST社區(qū) ? 2022-12-20 18:08 ? 次閱讀
加入交流群
微信小助手二維碼

掃碼添加小助手

加入工程師交流群

來源:ST社區(qū)

語音對于人機(jī)交互的重要性毋庸置疑,無論是國內(nèi)外企業(yè),都在 語音識別 的速度、準(zhǔn)確度以及多語種方面持續(xù)創(chuàng)新,但是當(dāng)機(jī)器面對那些有 口音 的人來說,似乎就沒有那么靈敏了:不僅注意力會不集中,反應(yīng)遲鈍,甚至還會成為一個獨(dú)立的個體,不予任何回應(yīng)。如何解決口音識別問題,已成為智能語音下一階段的競爭焦點(diǎn),但這不僅僅是單純的增加語料庫就能提升的,好在已經(jīng)有少數(shù)公司,開始通過構(gòu)建新的語音模型,來解決口音問題。

自IBM的Shoebox與Worlds of Wonders的Julie Doll問世以來,語音識別技術(shù)已經(jīng)取得了長足進(jìn)步。甚至有報(bào)道稱,到2018年底,谷歌Google Assistant將支持超過30種語言。除此以外,高通已經(jīng)開發(fā)出了一款能夠識別單詞和短語的語音識別設(shè)備,準(zhǔn)確率高達(dá)95%。而微軟也不甘示弱,其呼叫中心解決方案(智能語音客服)比人工展開的呼叫服務(wù)更準(zhǔn)確,更高效。

但需要注意的是,盡管在機(jī)器學(xué)習(xí)的加持下,語音識別技術(shù)取得了巨大的進(jìn)步,但現(xiàn)在的語音識別系統(tǒng)還是不完美的。比如,不同地區(qū)的口音,讓這項(xiàng)技術(shù)擁有了很強(qiáng)的“地域歧視性”。通常情況下,口音對人類來說不是什么大問題,有時還會讓人感覺到一種異國風(fēng)情的魅力,但是對機(jī)器而言,這是一條難以跨越的鴻溝,可能是其發(fā)展過程中面臨的最大挑戰(zhàn)。

研究顯示口音是語音識別技術(shù)的挑戰(zhàn)之一

此前,華盛頓郵報(bào)與Globalme和Pulse Labs兩家語言研究公司合作,對搭載了語音識別技術(shù)的智能音箱設(shè)備的口音問題進(jìn)行了研究,研究范圍來自美國近20個城市、超過100名參與者發(fā)出的數(shù)千條語音命令,結(jié)果顯示,這些系統(tǒng)在理解來自不同地區(qū)的人的語言時存在顯著差異。

舉個例子,谷歌智能音箱Google Home識別西岸口音的準(zhǔn)確率比識別南方口音高3%;而亞馬遜語音助手Alexa識別中西部的口音的準(zhǔn)確率要比東岸口音低2%。但面臨最大問題的是持非本土口音的人:在一項(xiàng)研究中,通過對比Alexa識別的內(nèi)容與測試組的實(shí)際話語,結(jié)果顯示不準(zhǔn)確率可達(dá)30%。此外,面對以西班牙語和漢語作為第一語言的人所說的英文,不管是Google Home還是Amazon Echo,其識別率都是最低的,要知道,拉丁裔和華裔是美國的兩大移民族群。

雖然這項(xiàng)研究是非正式的,也存在一定的限制,但其結(jié)果還是表明口音仍是語音識別技術(shù)面臨的主要挑戰(zhàn)之一。對此,亞馬遜在一份聲明中稱,“隨著越來越多的擁有不同口音的人與Alexa進(jìn)行交流,Alexa的理解能力也會得到改善?!蓖瑫r,谷歌也表示,“在擴(kuò)大數(shù)據(jù)集的同時,我們也將繼續(xù)提高Google Home的語音識別能力?!?/p>

事實(shí)上,不只是Amazon Echo和Google Home,采用率更低一些的微軟Cortana和蘋果Siri也是如此,它們都需要及時提高自家的語音識別技術(shù),以便讓用戶感到滿意的同時,又能在全球范圍內(nèi)擴(kuò)大自己的影響力。

即使增加語料庫,也無法解決口音識別問題

隨著人工智能的發(fā)展,語音已經(jīng)成為了人與計(jì)算機(jī)交互的核心方式之一,所以即使理解上有極其微小的偏差,也可能意味著一個巨大的障礙。也就是說,這種語言差異可能會給那些現(xiàn)代科技的基礎(chǔ)系統(tǒng)帶來潛在的隱患,畢竟除了廚房和起居室,智能音箱在用戶的工作場所、學(xué)校、銀行、醫(yī)院以及酒店等地方也承擔(dān)著越來越重要的責(zé)任,除了控制設(shè)備還要傳遞信息,并完成一些預(yù)訂和購物工作等。

為了改善語音助手的口音識別情況,亞馬遜與谷歌等正在投入資源,用新的語言和口音訓(xùn)練測試系統(tǒng),包括創(chuàng)建游戲以鼓勵大家使用不同地區(qū)的 方言 進(jìn)行交談。而像IBM和微軟這樣的公司,都會通過Switchboard語料庫來降低語音助手的出錯率。但是事實(shí)證明,語料庫也無法徹底解決語音助手的口音識別問題。

對此,埃森哲全球責(zé)任AI監(jiān)理Rumman Chowdhury表示,“數(shù)據(jù)是混亂的,因?yàn)閿?shù)據(jù)反映了人性。這就是算法最擅長的:尋找人類的行為模式?!?/p>

算法的這一情況被稱為“算法偏差”,用于反應(yīng)機(jī)器學(xué)習(xí)模型對數(shù)據(jù)或設(shè)計(jì)產(chǎn)生的偏見程度。比如,現(xiàn)在有很多報(bào)告都顯示了面部識別技術(shù)的敏感性——尤其是亞馬遜AWS的圖像識別技術(shù)Rekognition——有很大的偏見傾向。此外,算法偏差還會出現(xiàn)在其他方面,像預(yù)測被告是否會在未來犯罪以及Google News等應(yīng)用背后的內(nèi)容推薦算法。

構(gòu)建語音識別模型,提升方言識別率

雖然已經(jīng)有不少巨頭針對算法偏見提出了解決方案,比如微軟、IBM、Facebook、高通和埃森哲等已經(jīng)開發(fā)出了自動化工具,用于檢測AI算法中的偏見,但很少有企業(yè)針對語音識別技術(shù)面臨的口音問題提出具體的解決方案。對此,Speechmatics和Nuance成為了少數(shù)者之一。

Speechmetrics是一家專門從事企業(yè)語音識別軟件的劍橋科技公司,12年前就開始展開一項(xiàng)雄心勃勃的計(jì)劃,旨在開發(fā)比市場上任何產(chǎn)品都更準(zhǔn)確,更全面的語言包。據(jù)了解,研究之初,該公司的主要工作是統(tǒng)計(jì)語言建模和循環(huán)神經(jīng)網(wǎng)絡(luò),并以此開發(fā)出了一種可以處理內(nèi)存輸出序列的機(jī)器學(xué)習(xí)模型。

2014年,Speechmetrics通過一個10億字節(jié)的語料庫加速了其統(tǒng)計(jì)語言建模的進(jìn)展,到2017年與卡塔爾計(jì)算研究所(QCRI)合作開發(fā)阿拉伯語言的文字轉(zhuǎn)換服務(wù),可以說,這是該公司取得的一個里程碑式的進(jìn)展。

而到了今年7月,該公司再次有所突破——成功研發(fā)了一款語音識別系統(tǒng)Global English,包括了全球40多個國家的數(shù)千小時的語音數(shù)據(jù)和數(shù)百億單詞,可支持“所有主要”英語口音的語音文本轉(zhuǎn)換。另外,這個系統(tǒng)是建立在Speechmatic的Automatic Linguist的基礎(chǔ)上,這是一個AI框架,通過利用已知語言中識別的模式來學(xué)習(xí)新語言的語言基礎(chǔ)。

而在特定的口音測試中,Global English的表現(xiàn)要優(yōu)于谷歌的Cloud Speech API以及IBM Cloud中的英語語言包中。Speechmatic聲稱,在高端領(lǐng)域,該系統(tǒng)的準(zhǔn)確率比其他產(chǎn)品還要高23%到55%。

但Speechmatics并不是唯一一家想要解決口音識別問題的公司。

總部位于馬薩諸塞州的Nuance表示,該公司正在采用多種方法確保其語音識別模型能夠以同樣的準(zhǔn)確率來識別大約80種語言。

舉個例子,在其英語語音識別模型中,該公司收集了20個特定方言區(qū)域的語音和文本數(shù)據(jù),包括每種方言的特有單詞及其發(fā)音。因此,Nuance的語音識別系統(tǒng)可以識別出單詞“Heathrow”的52種不同變體。

最近Nuance的語音識別系統(tǒng)也有了很大的提升。較新版本的Dragon是該公司發(fā)布的定制語音到文本軟件套件,所使用的機(jī)器學(xué)習(xí)模型,可根據(jù)用戶的口音在幾種不同的方言模型之間自動切換。另外,與沒有自動切換功能的舊版本相比,新版對帶有西班牙口音的英語識別的準(zhǔn)確率要高22.5%,對于美國南部的方言來說,準(zhǔn)確率要高16.5%,對于東南亞的英語口音的準(zhǔn)確率要高17.4%。

事實(shí)上,研究人員很早之前就發(fā)現(xiàn)了語音識別面臨的口音問題。對此,語言學(xué)家和AI工程師紛紛表示,非本地語言通常是很難進(jìn)行訓(xùn)練的,因?yàn)檎Z言之間的模式要一多種不同的方式進(jìn)行切換。同時,語境也很重要,即使是細(xì)微差別也會改變對話雙方的反應(yīng)。但可以肯定的是,缺乏多樣性的語音數(shù)據(jù)最終可能會無意中導(dǎo)致“地域歧視”的發(fā)生。也就是說,語料庫中語音樣本的數(shù)量和多樣性越高,得到的模型就越準(zhǔn)確——至少在理論上是這樣。

當(dāng)然,這也不僅僅是美國企業(yè)需要解決的問題。百度硅谷辦事處的高級研究員Gregory Diamos曾說,該公司面臨著自己的挑戰(zhàn),即開發(fā)一款可以理解許多中國地方方言的人工智能。此外,很多工程師也表示,口音對于致力于開發(fā)那種不僅可以回答問題,還能隨意進(jìn)行自然對話的軟件公司來說,是最嚴(yán)峻的挑戰(zhàn)之一。

審核編輯 黃昊宇

聲明:本文內(nèi)容及配圖由入駐作者撰寫或者入駐合作網(wǎng)站授權(quán)轉(zhuǎn)載。文章觀點(diǎn)僅代表作者本人,不代表電子發(fā)燒友網(wǎng)立場。文章及其配圖僅供工程師學(xué)習(xí)之用,如有內(nèi)容侵權(quán)或者其他違規(guī)問題,請聯(lián)系本站處理。 舉報(bào)投訴
  • 語音識別
    +關(guān)注

    關(guān)注

    39

    文章

    1825

    瀏覽量

    116267
收藏 人收藏
加入交流群
微信小助手二維碼

掃碼添加小助手

加入工程師交流群

    評論

    相關(guān)推薦
    熱點(diǎn)推薦

    語音識別ic芯片分類工作原理,語音識別芯片分類

    語音識別IC芯片,通俗講就是能讓機(jī)器“聽懂”人話的專用集成電路。與傳統(tǒng)的語音播放芯片不同,語音識別芯片最大優(yōu)勢在于具備
    的頭像 發(fā)表于 04-24 15:14 ?183次閱讀
    <b class='flag-5'>語音</b><b class='flag-5'>識別</b>ic芯片分類工作原理,<b class='flag-5'>語音</b><b class='flag-5'>識別</b>芯片分類

    語音識別芯片介紹,語音識別芯片工作原理解析

    在智能交互不斷深入的今天,語音識別芯片正成為眾多設(shè)備實(shí)現(xiàn)語音控制與AI對話的關(guān)鍵部件。語音芯片廣義上涵蓋語音播放、錄音及
    的頭像 發(fā)表于 04-01 16:26 ?263次閱讀

    語音識別芯片的功能與優(yōu)勢有哪些

    在智能語音交互快速發(fā)展的今天,語音識別芯片作為核心部件,正逐漸成為各類智能設(shè)備不可或缺的組成部分。一款優(yōu)秀的語音識別芯片,不僅決定了設(shè)備的智
    的頭像 發(fā)表于 03-30 15:31 ?191次閱讀

    瑞芯微(EASY EAI)RV1126B 語音識別

    1.語音識別簡介語音識別技術(shù),也被稱為自動語音識別(AutomaticSpeechRecogni
    的頭像 發(fā)表于 01-21 10:43 ?1058次閱讀
    瑞芯微(EASY EAI)RV1126B <b class='flag-5'>語音</b><b class='flag-5'>識別</b>

    語音識別IC分類,語音識別芯片的工作原理

    語音識別芯片,也叫語音識別集成電路,是一種集聲音存儲、播放、錄音及語音識別功能于一體的專用芯片。
    的頭像 發(fā)表于 01-14 15:22 ?435次閱讀
    <b class='flag-5'>語音</b><b class='flag-5'>識別</b>IC分類,<b class='flag-5'>語音</b><b class='flag-5'>識別</b>芯片的工作原理

    語音識別芯片有哪些(語音識別芯片AT680系列)

    在人工智能技術(shù)飛速發(fā)展的今天,語音識別芯片作為人機(jī)交互的重要橋梁,正逐漸成為各類智能設(shè)備不可或缺的核心部件。與傳統(tǒng)的語音芯片不同,語音識別
    的頭像 發(fā)表于 11-14 17:11 ?1576次閱讀

    什么是離線語音識別芯片(離線語音識別芯片有哪些優(yōu)點(diǎn))

    離線語音識別芯片,是一種集成了語音信號采集、前端處理和本地識別功能的專用集成電路,無須聯(lián)網(wǎng)也可以進(jìn)行語音控制。它內(nèi)設(shè)先進(jìn)的數(shù)字信號處理模塊及
    的頭像 發(fā)表于 10-31 15:27 ?712次閱讀

    如何選擇合適的語音識別芯片型號

    語音識別芯片(又稱語音識別IC)是現(xiàn)代智能設(shè)備的核心組件,與傳統(tǒng)語音芯片相比,其最大特點(diǎn)是能夠主動識別
    的頭像 發(fā)表于 10-30 16:32 ?765次閱讀

    PC識別出來的COM口如何更改名字?

    PC識別出來的串口名稱:USB串行設(shè)備(COM8),如何才能更改這個名字呢,比如USB_SERISL_CH40(COMX)
    發(fā)表于 09-25 07:39

    瑞芯微RK3576語音識別算法

    1.語音識別簡介語音識別技術(shù),也被稱為自動語音識別(AutomaticSpeechRecogni
    的頭像 發(fā)表于 08-15 15:13 ?2483次閱讀
    瑞芯微RK3576<b class='flag-5'>語音</b><b class='flag-5'>識別</b>算法

    語音識別---大家怎么看呢?

    語音識別是一門交叉學(xué)科。近二十年來,語音識別技術(shù)取得顯著進(jìn)步,開始從實(shí)驗(yàn)室走向市場。人們預(yù)計(jì),未來10年內(nèi),語音
    發(fā)表于 08-09 10:54

    EASY EAl Orin Nano(RK3576) whisper語音識別訓(xùn)練部署教程

    Whisper是OpenAI開源的,識別語音識別能力已達(dá)到人類水準(zhǔn)自動語音識別系統(tǒng)。Whisper作為一個通用的
    的頭像 發(fā)表于 07-17 14:55 ?2050次閱讀
    EASY EAl Orin Nano(RK3576) whisper<b class='flag-5'>語音</b><b class='flag-5'>識別</b>訓(xùn)練部署教程

    AT6802-超低功耗離線智能語音識別芯片

    AT6802超低功耗離線語音識別芯片以1mA工作電流實(shí)現(xiàn)98%識別率,支持方言和連續(xù)指令,數(shù)據(jù)本地加密處理,為智能家居、工業(yè)控制帶來安全流暢的交互革命
    的頭像 發(fā)表于 07-03 19:04 ?1836次閱讀

    語音識別芯片選型有哪些技術(shù)參數(shù)要注意

    性能參數(shù) 1. 識別準(zhǔn)確率 定義:芯片對語音指令的正確識別比例,通常以百分比表示(如 95% 以上)。 影響因素:環(huán)境噪聲、發(fā)音清晰度、方言適配性等。 應(yīng)用場景:智能家居、車載系統(tǒng)需≥
    的頭像 發(fā)表于 06-23 17:31 ?1099次閱讀
    <b class='flag-5'>語音</b><b class='flag-5'>識別</b>芯片選型有哪些技術(shù)參數(shù)要注意

    STM32N6570-DK 的STLINK口不能識別出STLINK,為什么?

    使用數(shù)據(jù)線連接STM32N6570-DK的CN6口和電腦,存在不能識別出STLINK的情況。這個板子集成的STLINK是連上數(shù)據(jù)線就能識別出STLINK,還是配置硬件才能識別出來?我電腦的stlink驅(qū)動和數(shù)據(jù)線應(yīng)該都沒有問題。
    發(fā)表于 06-16 07:14
    松潘县| 米泉市| 扶绥县| 海宁市| 双桥区| 丰原市| 鄄城县| 花莲县| 定兴县| 巴东县| 闸北区| 阜宁县| 拉孜县| 桓仁| 洪洞县| 天台县| 浮梁县| 滕州市| 石门县| 贵州省| 玛多县| 白银市| 泸西县| 公安县| 武清区| 颍上县| 竹山县| 沿河| 永川市| 逊克县| 于田县| 望都县| 博乐市| 盈江县| 深泽县| 中宁县| 上思县| 龙岩市| 比如县| 开原市| 百色市|