要問(wèn)智能手機(jī)上最雞肋的功能,小編第一個(gè)想到的是人工智能語(yǔ)音助手:幾乎不使用,扔掉又可惜。
為什么幾乎不用呢?且不說(shuō)別的,首先就因?yàn)檎Z(yǔ)音助手們不會(huì)像人一樣說(shuō)話。
每和它說(shuō)一句話,都要先說(shuō)“嘿,Siri”,或者“你好小藝”,或者“小愛(ài)同學(xué)”,或者……說(shuō)久了小編覺(jué)得自己都快成智障了……
這第一步就讓人望而卻步,所以,打入冷宮唄。
不過(guò),在11月19日舉行的小米開(kāi)發(fā)者大會(huì)上,小米小愛(ài)同學(xué)3.0的發(fā)布引起了小編的注意,因?yàn)樗幸粋€(gè)重要的更新:更自然的連續(xù)對(duì)話。
小愛(ài)同學(xué)也成了首個(gè)在手機(jī)上實(shí)現(xiàn)自然語(yǔ)言連續(xù)對(duì)話的AI助理。
最近,IT之家小編汐元更新了小愛(ài)同學(xué)3.0,體驗(yàn)了一下這個(gè)連續(xù)對(duì)話究竟是怎樣的。
一、小愛(ài)同學(xué)3.0連續(xù)對(duì)話的體驗(yàn)
汐元使用的是小米9 Pro 5G版,更新時(shí)只需要對(duì)小愛(ài)同學(xué)說(shuō)“現(xiàn)在升級(jí)”,她就能夠自動(dòng)升級(jí)到3.0版本了。
升級(jí)之后,連續(xù)對(duì)話功能不是默認(rèn)開(kāi)啟的,你需要在小愛(ài)同學(xué)的設(shè)置選項(xiàng)中手動(dòng)開(kāi)啟。
開(kāi)啟后,汐元嘗試和小愛(ài)同學(xué)進(jìn)行了一段對(duì)話:
在這之前,汐元還和舊版的小愛(ài)同學(xué)進(jìn)行了一段類似的對(duì)話:
對(duì)比上面兩個(gè)測(cè)試的視頻,很明顯,支持連續(xù)自然語(yǔ)言對(duì)話的小愛(ài)同學(xué)3.0比以前好用多了,體現(xiàn)在:
說(shuō)一次喚醒詞,就可以一直對(duì)話下去,不用反復(fù)喊“小愛(ài)同學(xué)”了;
在小愛(ài)同學(xué)話說(shuō)一半的時(shí)候,你可以打斷她,讓她執(zhí)行下一個(gè)指令;
當(dāng)然,目前在連續(xù)對(duì)話下,你和小愛(ài)同學(xué)閑聊,她仍然會(huì)回答一些不合邏輯的話:
但至少,現(xiàn)在和小愛(ài)同學(xué)說(shuō)話,在方式上很像和人交流了。
汐元覺(jué)得,這才是AI助手?jǐn)[脫“智障”標(biāo)簽的第一步。
別小看這第一步。“人機(jī)語(yǔ)音交互”的終極目標(biāo),不就是要像“人人語(yǔ)言交互”一樣嗎?
這么,這一小步背后,又是哪些技術(shù)在制程呢?連續(xù)對(duì)話功能,究竟是怎么實(shí)現(xiàn)的?
二、全雙工多輪交互技術(shù)到底是什么?
根據(jù)小米的介紹,他們采用的是全雙工多輪交互技術(shù)。這是個(gè)什么技術(shù)呢?
首先,全雙工的意思就是,在同一時(shí)間里,信號(hào)可以雙向傳輸,即A可以發(fā)消息給B,同時(shí)B也可以發(fā)消息給A。
也就是A和B都可以同時(shí)發(fā)送信息和接收信息。
同理,半雙工的意思就是在同一時(shí)間,信號(hào)只能單向傳輸,即要么A發(fā)消息給B,要么B發(fā)小給A。
這個(gè)差別就像是現(xiàn)實(shí)中雙行道和單行道的差別。
全雙工本身不是什么尖端的、困難的技術(shù),相反,很早就有了。它就是在芯片層面和外部之間采用發(fā)送線和接受線各自獨(dú)立的方法。
例如,電話就是典型的全雙工技術(shù),而電話已經(jīng)誕生100多年了。
只是,要在AI語(yǔ)音交互中加入全雙工技術(shù),這就有點(diǎn)困難了,畢竟,你要對(duì)話的不是真實(shí)的人啊。
三、插曲:常規(guī)情況下,語(yǔ)音助手是怎么識(shí)別人聲的
這里汐元要插一段,簡(jiǎn)單給大家說(shuō)一下通常AI進(jìn)行語(yǔ)音識(shí)別是怎么實(shí)現(xiàn)的。
例如,我在對(duì)語(yǔ)音助手說(shuō)“打開(kāi)IT之家”的時(shí)候,手機(jī)通過(guò)麥克風(fēng)接受到汐元的聲波模擬信號(hào),然后將模擬信號(hào)轉(zhuǎn)化為數(shù)字信號(hào)。
接著,系統(tǒng)會(huì)對(duì)數(shù)字信號(hào)進(jìn)行特征提取,提取時(shí)會(huì)將這段語(yǔ)音信息分成很多小塊,然后根據(jù)每個(gè)小塊的特征組成音素——“da kai ai ti zhi jia”,再將這些音素根據(jù)聲學(xué)特征進(jìn)行分類。
然后,系統(tǒng)會(huì)將這些因素和自己的語(yǔ)言庫(kù)進(jìn)行比對(duì),根據(jù)語(yǔ)言的規(guī)律,找出對(duì)應(yīng)的文字。
接著,系統(tǒng)還要根據(jù)文字進(jìn)行自然語(yǔ)言理解,去理解文本的含義,然后找到答案,最后去進(jìn)行自然語(yǔ)言的生成,輸出回答語(yǔ)音。這個(gè)過(guò)程中,需要強(qiáng)大的對(duì)話引擎參與。
目前對(duì)話引擎主要分為檢索模型和生成模型。
檢索模型,意思就是從知識(shí)庫(kù)中檢索最相近的問(wèn)題,然后找出對(duì)應(yīng)的答案。
▲圖片來(lái)源:微軟小冰技術(shù)講解PPT
生成模型,這個(gè)有些抽象,通俗說(shuō)就是根據(jù)神經(jīng)網(wǎng)絡(luò)訓(xùn)練的結(jié)果來(lái)給出答案。這個(gè)答案是AI自創(chuàng)的,不是檢索數(shù)據(jù)庫(kù)得到的。
所以,在算法不成熟的時(shí)候,AI的回答可能會(huì)有些不合邏輯。但這個(gè)更符合連續(xù)對(duì)話場(chǎng)景的需要。
小愛(ài)同學(xué)大部分時(shí)候采用的就是生成模型。
這相當(dāng)于AI助手完成一個(gè)語(yǔ)音識(shí)別并回答的過(guò)程,也可以理解為完成一個(gè)半雙工的過(guò)程。
四、全雙工交互的難點(diǎn)和解決方法
那么全雙工下有什么不同呢?
首先我們知道,對(duì)于AI助手而言,全雙工就是輸入、輸出可以同時(shí)進(jìn)行,這本身不是什么難點(diǎn),畢竟電話都能做到了。
難在哪里呢?難在你和AI交互的時(shí)候,一旦全雙工,會(huì)帶來(lái)整個(gè)系統(tǒng)性的問(wèn)題需要解決。
包括:
第一:怎么全面地降低功耗?
第二,連續(xù)對(duì)話是一個(gè)長(zhǎng)時(shí)間的過(guò)程,怎么消除噪聲干擾?這個(gè)噪聲包括雜音,還有你不是對(duì)AI說(shuō)地那些話。
第三,AI怎么理解、記住上下文語(yǔ)義,讓對(duì)話能夠繼續(xù)下去?
第四,AI在說(shuō)話時(shí),你也說(shuō)話了。AI怎么判斷你是不是要打斷他,也就是怎么避免被誤打斷。
還有一個(gè)比較遠(yuǎn),就是AI和你持續(xù)對(duì)話時(shí),能不能判斷什么時(shí)候沉默,什么時(shí)候打破沉默,要不要引出新話題?就是讓你覺(jué)得你說(shuō)話的對(duì)象不是死板、機(jī)械的。
能夠解決這些問(wèn)題,全雙工也就能普及了。
上面這些問(wèn)題,其實(shí)目前都沒(méi)有十全十美的解決方案,但已經(jīng)有可用的了。
具體看小愛(ài)同學(xué),怎么解決呢,
1、連續(xù)對(duì)話免喚醒
這個(gè)技術(shù)需要解決一系列問(wèn)題。
連續(xù)對(duì)話免喚醒,也就是只喚醒一次,就可以多輪對(duì)話?,F(xiàn)在你每說(shuō)完一個(gè)指令,AI不會(huì)歇著,而是隨時(shí)待命。那么問(wèn)題來(lái)了,首先怎么降低功耗呢?
有一個(gè)辦法是分級(jí)處理。比如說(shuō),我向小愛(ài)同學(xué)下達(dá)了一個(gè)指令,她響應(yīng)后,不會(huì)像以前那樣休息,而是繼續(xù)待命,等待再有人聲被檢測(cè)到。
等待的過(guò)程中,她不會(huì)做復(fù)雜地監(jiān)聽(tīng),而是第一級(jí)先簡(jiǎn)單處理噪音,再做二級(jí)高精度處理。等有人聲出現(xiàn),才會(huì)進(jìn)行聲紋識(shí)別等操作。也就是說(shuō),她是逐步提升計(jì)算性能的。
還有一點(diǎn),也有利于降低功耗,就是語(yǔ)義拒識(shí)的算法,這個(gè)不僅是去除噪聲,也可以檢測(cè)到環(huán)境中,包括人說(shuō)話中一些沒(méi)有語(yǔ)義意義的音頻片段(例如音樂(lè)聲、尖叫聲,說(shuō)話中的嗯啊口語(yǔ)等),然后將他們?nèi)コ?,這樣也可以節(jié)省后端處理的計(jì)算資源。
當(dāng)然,降低功耗也離不開(kāi)硬件層面的進(jìn)步,這是軟硬結(jié)合才能實(shí)現(xiàn)的效果。
然后就是,過(guò)去你在喚醒詞后面就是要對(duì)AI說(shuō)的,現(xiàn)在連續(xù)對(duì)話了,AI怎么知道你是對(duì)它說(shuō)話呢?
這里有一個(gè)過(guò)程叫語(yǔ)義選擇。通俗理解,就是當(dāng)AI收到人聲,進(jìn)入語(yǔ)義分析的環(huán)節(jié)時(shí),它會(huì)先看看這句話的意思是否跟我這個(gè)設(shè)備覆蓋的語(yǔ)義規(guī)模、意圖相吻合,從而判斷當(dāng)前人是不是跟設(shè)備說(shuō)話。
汐元也模擬了一段包含噪聲、不同說(shuō)話聲的測(cè)試場(chǎng)景:
小愛(ài)同學(xué)很穩(wěn)地過(guò)濾掉了背景的音樂(lè)噪聲,完全沒(méi)有受到干擾。
周圍的其他聲音中,汐元本人的說(shuō)話聲,小愛(ài)同學(xué)基本都能準(zhǔn)確識(shí)別出來(lái)。而另一臺(tái)手機(jī)播放的聲音,有時(shí)候會(huì)對(duì)交流造成打斷,有時(shí)候也能識(shí)別完整的語(yǔ)義,有時(shí)候則只能識(shí)別只言片語(yǔ),然后給出錯(cuò)誤的回答。
這說(shuō)明,小愛(ài)同學(xué)已經(jīng)具備在復(fù)雜環(huán)境中識(shí)別指令的技術(shù),但是,判斷的準(zhǔn)確性還不太完美。
目前還有一種多模態(tài)交互的技術(shù),就是除了語(yǔ)音之外,終端還會(huì)配合其他的傳感器,特別是視覺(jué)方面,這樣,AI就能更加精確地判斷用戶說(shuō)話地意圖了。
2、讓對(duì)話穩(wěn)定持續(xù)下去
在連續(xù)對(duì)話中,怎樣讓對(duì)話持續(xù)下去呢?
首先要讓對(duì)話顯得自然,不出錯(cuò)。我們?cè)诤驼Z(yǔ)音助手交流地時(shí)候,經(jīng)常會(huì)發(fā)現(xiàn),你說(shuō)話地時(shí)候,稍微停頓長(zhǎng)一些,AI的識(shí)別就停止了(以為你說(shuō)完了),然后給出一個(gè)錯(cuò)誤的回答。
這種情況,小愛(ài)同學(xué)的解決辦法是,在云端根據(jù)用戶說(shuō)話節(jié)奏和內(nèi)容,進(jìn)行動(dòng)態(tài)斷句,這可能需要一定時(shí)間的學(xué)習(xí)。
在回復(fù)時(shí),則可以適時(shí)的回復(fù)“嗯”等人類常用的接話話術(shù),這樣,系統(tǒng)就打破了對(duì)說(shuō)話規(guī)則的要求,用戶也可以按照自身的說(shuō)話習(xí)慣來(lái)進(jìn)行交流。
怎樣理解上下文呢?說(shuō)實(shí)話,這目前還是AI語(yǔ)音助手的一個(gè)難點(diǎn)。
這一點(diǎn)上,小愛(ài)同學(xué)的思路是,引入交互認(rèn)知智能的概念,簡(jiǎn)單說(shuō)就是她在分析語(yǔ)義的時(shí)候會(huì)思考,會(huì)解讀當(dāng)前所處的語(yǔ)境環(huán)境,并結(jié)合歷史任務(wù),判斷用戶的意圖到底是什么。
這其中,涉及一些專業(yè)的技術(shù),例如跨技能的上下文處理、多引擎(信息檢索、任務(wù))的融合、指代消解、知識(shí)推理等。
指代消解是這里一個(gè)很重要的技術(shù),大意就是能夠理解上下文代詞的意義。跨技能的上下文指代消解,就是在不同場(chǎng)景下也能判斷代詞。
例如汐元對(duì)小愛(ài)同學(xué)說(shuō):“今天上海天氣怎么樣?”然后又說(shuō)“導(dǎo)航去那里”,查天氣和導(dǎo)航是兩個(gè)不同的技能,小愛(ài)同學(xué)就能夠理解其中的代詞。
然后還有一點(diǎn),是防止誤打斷。這一點(diǎn),小愛(ài)同學(xué)也有對(duì)應(yīng)的技術(shù),可以在對(duì)話的過(guò)程中,實(shí)時(shí)判斷是否需要打斷,不容易出現(xiàn)誤打斷,同時(shí),對(duì)沒(méi)有語(yǔ)義的輸入,則不會(huì)打斷語(yǔ)音合成播放。
3、讓對(duì)話更有靈性
最后還有主動(dòng)交互的技術(shù),它可以智能判斷,甚至主動(dòng)打斷用戶的啰嗦的表述,當(dāng)對(duì)話陷入冷場(chǎng)時(shí),也可以主動(dòng)打破沉默僵局,實(shí)現(xiàn)流暢自然的用戶口語(yǔ)交流習(xí)慣。
這個(gè)技術(shù)暫時(shí)還沒(méi)有完全成熟的應(yīng)用,不過(guò)在不久的將來(lái),相信我們會(huì)看到更有靈性的AI助手。
總結(jié)
小愛(ài)同學(xué)3.0第一次將全雙工多輪對(duì)話的技術(shù)帶到了手機(jī)AI語(yǔ)音助手上,從而實(shí)現(xiàn)了連續(xù)對(duì)話的能力,正如汐元所說(shuō)的,這是手機(jī)AI助手真正可用的第一步。
不過(guò),汐元也了解到,這個(gè)技術(shù)此前在一些品牌的智能音箱產(chǎn)品上已經(jīng)使用了,這說(shuō)明,全雙工的語(yǔ)音識(shí)別,是一個(gè)趨勢(shì)。
當(dāng)然,全雙工的語(yǔ)音識(shí)別技術(shù)還沒(méi)那么成熟,也需要更長(zhǎng)時(shí)間的技術(shù)優(yōu)化,但好歹,它已經(jīng)讓我們看到了AI助手在未來(lái)的無(wú)限可能性。