一区二区三区三上|欧美在线视频五区|国产午夜无码在线观看视频|亚洲国产裸体网站|无码成年人影视|亚洲AV亚洲AV|成人开心激情五月|欧美性爱内射视频|超碰人人干人人上|一区二区无码三区亚洲人区久久精品

0
  • 聊天消息
  • 系統(tǒng)消息
  • 評論與回復(fù)
登錄后你可以
  • 下載海量資料
  • 學(xué)習(xí)在線課程
  • 觀看技術(shù)視頻
  • 寫文章/發(fā)帖/加入社區(qū)
會員中心
創(chuàng)作中心

完善資料讓更多小伙伴認(rèn)識你,還能領(lǐng)取20積分哦,立即完善>

3天內(nèi)不再提示

汽車AI語音交互 正在讓機器交互更接近真人交互

jf_f8pIz0xS ? 來源:智能相對論 ? 作者:胡楊 胡皓 ? 2020-07-25 12:03 ? 次閱讀
加入交流群
微信小助手二維碼

掃碼添加小助手

加入工程師交流群

現(xiàn)在,情況有了改善。當(dāng)用戶詢問車機“明天出門需要帶傘么?”,車機就會播報明天的天氣情況,如果需要再查詢其他時間或者城市的天氣,那么用戶不用重新喚醒,也不需要說出完整表達,只需要說“那大后天呢?”、“那杭州呢?”。在用戶和車機在自然連續(xù)對話的過程中,語義理解服務(wù)會記住會話的歷史,并結(jié)合歷史處理用戶的請求,通過這種方式,用戶的多次連續(xù)交互就可以形成一個會話流,與用戶的交互也更加自然。

自然連續(xù)對話,是車載語音交互從“人工智障”邁向“人工智能”的重要一步。不過斑馬網(wǎng)絡(luò)最近推出的斑馬智行VENUS系統(tǒng),打破了對用戶說話規(guī)則的要求,用戶可以按照自身的說話習(xí)慣來進行交流,交互過程更加人性化。這會不會是一個跨越?

從科幻到現(xiàn)實,語音交互一直在進化

提到智能語音交互,普羅大眾對于技術(shù)刷屏的記憶停留在2018年的Google開發(fā)者大會“Google I/O”開幕式上。當(dāng)Google Assistant以驚人的流利會話,打電話和店家溝通,預(yù)約理發(fā)店、餐廳,并用一句俏皮的“嗯哼”作為回應(yīng)時,觀眾給予了熱烈的掌聲。這是技術(shù)愿景美好、激勵人心的一面。

有趣的是,同年2月的美國第五十二屆超級碗的天價廣告上,亞馬遜賣力黑了自家的智能音箱和智能助手——Alexa。喚醒失誤、識別不準(zhǔn)、響應(yīng)困難等等用戶槽點,被廣告創(chuàng)意表現(xiàn)得淋漓盡致。這是技術(shù)的現(xiàn)實。

但不論是基于場景的未來暢想,還是對當(dāng)下缺陷的大膽自嘲,兩個科技巨頭都將業(yè)務(wù)重心的一角,押注在了語音交互賽道上。

亞馬遜首席技術(shù)官Werner Vogels斷言:未來,人和數(shù)字世界對的交互,一定是以“人”為核心,而不是機器驅(qū)動;我們終將構(gòu)建出更人性化的交互,讓人機互動更加融合。

在“以人為核心”、“更加融合”的人機交互中,語音交互(簡稱VUI)是核心。VUI允許更自由、高效的人機交互,其本質(zhì)上比任何其他形式的用戶界面都更“人性化”。斯坦福大學(xué)教授,Wired for Speech的合著者,克利福德·納斯寫道:“語音是人類交流的基本手段……。所有文化主要通過語音來說服,告知和建立關(guān)系?!?/p>

VUI允許用戶使用語音作為媒介與機器進行交互。從《2011太空漫游》中的HAL到《星球大戰(zhàn)》中的C-3PO,人們在科幻電影里暢想著能夠與機器自由溝通。事實上,早在1952年,貝爾實驗室的工程師就開發(fā)出了Audrey(奧黛麗):它可以識別數(shù)字0-9的發(fā)音。盡管奧黛麗能夠以超過90%的精度識別語音輸入,但其體積大,成本高昂,未曾步入大規(guī)模商業(yè)化的發(fā)展通道。

自此,人類開啟了長達半個多世紀(jì)的語音交互探索。1962年,IBM推出了第一臺真正意義上的是語音識別機器。工程師William Dersch開發(fā)出的Shoebox可以收聽操作員說出的數(shù)字和命令。例如“5+3+8+6+4-9,總和”,機器將打印出正確答案:17。

1970年,隱馬爾可夫模型(HMM)為語音識別的發(fā)展插上了算法的翅膀,讓語音識別從文字匹配進化到了可預(yù)測的高度。20世紀(jì)80年代,Covox,Dragon Systems,Speechworks相繼成立,推動了語音識別的商用化進程。

90年代,語音識別技術(shù)迎來了大規(guī)模商用和普及。1995年,Dragon發(fā)布了單詞聽寫級的語音識別軟件。這是人類歷史上首個面向廣大消費者的語音識別產(chǎn)品。僅一年之后,Charles Schawab(嘉信理財)和Nuance(紐昂斯)聯(lián)合推出了一套“語音股票經(jīng)紀(jì)人”系統(tǒng),可同時響應(yīng)360個客戶的股票詢價電話。1997年,如今隸屬Nuance旗下的聲龍系統(tǒng)(Dragon system)推出了“NaturallySpeaking”軟件,這是歷史上第一個可用的“連續(xù)語音”聽寫軟件。它標(biāo)志著單詞級不停頓語音交互的開始。

最近的20年,Google,Apple,Amazon先后推出了大眾耳熟能詳?shù)闹悄苷Z音助手,并通過智能手機、智能音箱等產(chǎn)品,來到普羅大眾身邊。據(jù)Juniper Research統(tǒng)計,截至2019年2月,全球使用中的語音助手達32.5億;預(yù)計到2023年,該數(shù)字將達到80億。

語音交互技術(shù)上的高山一:自然連續(xù)對話

隨著軟硬件的快速迭代,如今的ASR(語音識別)技術(shù)已近成熟,未來智能語音交互的核心競爭力在于在復(fù)雜場景下準(zhǔn)確理解用戶的意圖,并為其提供差異化服務(wù)。更加智能的自然連續(xù)對話能力,將讓語音交互系統(tǒng)更具人類的親和力特質(zhì)和邏輯思維能力,能帶給用戶更具情景化、更有溫度的用車體驗和服務(wù)潛力。

“智能相對論”認(rèn)為,自然連續(xù)對話是一個系統(tǒng)的工程,涉及到從車機端的聲學(xué)前端處理、語音喚醒、語音識別、語義理解、對話管理、自然語言生成、語音合成等核心交互技術(shù)。斑馬智行VENUS的AI語音得益于阿里達摩院的重磅加持以及科大訊飛、思必馳等合作伙伴的大力支持,極大提升了語音能力。斑馬基于AliOS系統(tǒng),可以更好地將語音核心技術(shù)能力與系統(tǒng)能力相結(jié)合,更大程度地發(fā)揮出語音核心技術(shù)的優(yōu)勢,將多種引擎的協(xié)作發(fā)揮到極致,達到“1+1》2”的效果。

語音交互技術(shù)上的高山二:個性化,即聲音克隆

如果說自然連續(xù)對話為更自由的交互和差異化服務(wù)提供可能,那語音定制化則將個性化、情感化的語音交互率先落地。

2017年9月,一家名為Lyrebird的加拿大初創(chuàng)公司在推特上發(fā)布了一段10秒的錄音。錄音是內(nèi)容AI模仿美國總統(tǒng)特朗普的話語。在此之前,Google旗下的DeepMind曾經(jīng)公布了一個用AI合成人聲的研究成果:WaveNet,達到以假亂真的地步。Adobe也發(fā)布過一款名為Project VoCo的原型軟件,在傾聽20分鐘音頻樣本之后可以進行模仿。而Lyrebird將音頻采樣的輸入時間縮短到了60秒。

如今,國內(nèi)智能網(wǎng)聯(lián)行業(yè)也首次迎來了語音定制——“聲音克隆”產(chǎn)品。斑馬智行VENUS系統(tǒng)“聲音克隆”操作流程非常簡單。用戶只需在斑馬智行APP錄制20句話即可合成私人語音包,一鍵發(fā)送至車機便可全局使用,無論是導(dǎo)航引導(dǎo)、天氣查詢,還是預(yù)訂餐廳,和你對話的都是你最想聽的聲音。

聲音是車載AI語音交互功能的“靈魂”,基于“聲音克隆”技術(shù),斑馬智行VENUS系統(tǒng)將為用戶提供“千人千聲”的定制化服務(wù),用戶可以“克隆”親人和愛人的聲音,讓陪伴更長久,讓駕駛更舒心。

據(jù)介紹,斑馬智行VENUS系統(tǒng)“聲音克隆”操作流程非常簡單。用戶只需在斑馬智行APP錄制20句話即可合成私人語音包,一鍵發(fā)送至車機便可全局使用,無論是導(dǎo)航引導(dǎo)、天氣查詢,還是預(yù)訂餐廳,和你對話的都是你最想聽的聲音。斑馬網(wǎng)絡(luò)AI語音相關(guān)負責(zé)人表示,斑馬智行VENUS系統(tǒng)能在錄制“傾聽”中“掌握”每個人說話時的字母、音位、單詞和語句的發(fā)音特點,通過深度學(xué)習(xí)技術(shù)推理并模仿聲音中的語音音色、語調(diào),“說”出全新的語句。

攀登技術(shù)高山,如何讓機器交互能夠更接近真人交互依然在等待更好答案

語音是人類最舒適,最直觀的交流方式之一。如今的智能語音交互產(chǎn)品,變得越來越像人一樣聰明且富有感情。它可以準(zhǔn)確理解信息輸入、高效處理并提供理想的信息輸出?!爸悄芟鄬φ摗闭J(rèn)為,在人工智能和5G迅速發(fā)展的背景下,語音平臺有機會成為物聯(lián)網(wǎng)時代下新的“操作系統(tǒng)”,連接全新的產(chǎn)業(yè)生態(tài),包括各類服務(wù)、應(yīng)用、硬件等。

在各類應(yīng)用場景中,除了智能家居,汽車產(chǎn)品對于語音交互的需求顯而易見。不論是點擊、滑動等觸摸交互方式,在車載環(huán)境下都存在安全隱患且并不高效,語音交互是天然適應(yīng)車載環(huán)境的交互方式。不過想要設(shè)計、開發(fā)、應(yīng)用一套成熟的車載語音交互系統(tǒng),要翻越重重高峰:行車噪音干擾如何處理、方言口音如何適配、自然的表達如何更好支持、系統(tǒng)的誤觸發(fā)如何控制在可用范圍。

而隨著用戶對汽車智能化要求的越來越高,更自然的交互成為語音交互的發(fā)展方向。如何讓機器交互能夠更接近真人交互?多模態(tài)融合理解、自然全雙工對話、自然語義理解成為了新的需要攀登的高峰。

斑馬智行的系統(tǒng)底層——AliOS,在傳統(tǒng)觸控、按鍵交互模式的基礎(chǔ)上,將語音交互能力、視覺交互能力以及場景信息在系統(tǒng)層進行融合互通,更大程度得發(fā)揮了各個交互能力的優(yōu)勢,使得多模態(tài)融合理解、融合交互以及更自然的全雙工對話、擁有更多信號輸入的自然語義理解成為可能。同時在各種交互能力融合后對上層應(yīng)用進行開放,使得最終呈現(xiàn)給用戶的交互更自然。

語音交互帶來的產(chǎn)業(yè)機遇方興未艾。如果說,未來的主流交互方式存在多樣的可能性,那更高率、更自然、更接近于人本能的方向一定是人機交互的未來。

聲明:本文內(nèi)容及配圖由入駐作者撰寫或者入駐合作網(wǎng)站授權(quán)轉(zhuǎn)載。文章觀點僅代表作者本人,不代表電子發(fā)燒友網(wǎng)立場。文章及其配圖僅供工程師學(xué)習(xí)之用,如有內(nèi)容侵權(quán)或者其他違規(guī)問題,請聯(lián)系本站處理。 舉報投訴
  • 人機交互
    +關(guān)注

    關(guān)注

    12

    文章

    1247

    瀏覽量

    56463
  • AI
    AI
    +關(guān)注

    關(guān)注

    88

    文章

    35164

    瀏覽量

    279990
收藏 人收藏
加入交流群
微信小助手二維碼

掃碼添加小助手

加入工程師交流群

    評論

    相關(guān)推薦
    熱點推薦

    普強智能語音技術(shù)重新定義車載交互邊界

    普強憑借自主研發(fā)的智能語音技術(shù),為某國內(nèi)頭部車企提供的語音前處理、喚醒詞、ASR、TTS等技術(shù)模塊,構(gòu)建覆蓋泰語、俄語、韓語、日語等多語種的語音交互解決方案,助力其海外車型實現(xiàn)無障礙人
    的頭像 發(fā)表于 07-11 14:00 ?341次閱讀

    思必馳天穹3.0交互自由隨心

    作為全屋智能語音交互系統(tǒng),天穹3.0基于思必馳中樞大模型構(gòu)建,融合了全鏈路語音交互技術(shù),采用“云端 + SDK”架構(gòu),云端有多個大模型協(xié)同運行,能夠高效解決全屋智控場景中的諸多問題,為
    的頭像 發(fā)表于 07-01 14:44 ?298次閱讀

    OBOO鷗柏丨AI數(shù)字人觸摸屏查詢觸控人臉識別語音交互一體機上市

    OBOO鷗柏丨AI數(shù)字人觸摸屏查詢觸控人臉識別語音交互一體機上市分析OBOO鷗柏品牌推出的AI數(shù)字人觸摸屏查詢觸控人臉識別語音
    的頭像 發(fā)表于 05-21 20:22 ?299次閱讀
    OBOO鷗柏丨<b class='flag-5'>AI</b>數(shù)字人觸摸屏查詢觸控人臉識別<b class='flag-5'>語音</b><b class='flag-5'>交互</b>一體機上市

    智能座艙:車載語音交互測試內(nèi)容

    隨著汽車智能化的飛速發(fā)展,車載語音交互系統(tǒng)已從早期的輔助功能逐漸演變?yōu)橹悄茏摰暮诵?b class='flag-5'>交互方式之一。駕駛者通過語音指令即可輕松完成導(dǎo)航設(shè)置、音
    的頭像 發(fā)表于 04-24 15:29 ?1059次閱讀
    智能座艙:車載<b class='flag-5'>語音</b><b class='flag-5'>交互</b>測試內(nèi)容

    90元打造小智AI腕表,語音交互超有趣!

    最近小智AI非?;穑@周給大家分享一個來自開源平臺的小智AI腕表項目。 項目作者@dotnfc,復(fù)刻成本90元左右,開源協(xié)議:MIT License 項目簡介 本項目分享了小智AI聊天機器
    發(fā)表于 04-16 14:26

    聲學(xué)技術(shù)如何重構(gòu)人機交互生態(tài)

    當(dāng)你的智能音箱能在嘈雜的客廳“聽懂”指令、AI 耳機能在地鐵的轟鳴聲中精準(zhǔn)捕捉你的語音、AI硬件能辨識自然界中的各類聲音事件、機器人能通過聲紋與笑聲識別情緒時,一場“聲音智能”的革命正
    的頭像 發(fā)表于 04-14 13:50 ?401次閱讀

    智能語音交互方案在客服領(lǐng)域的應(yīng)用

    在當(dāng)今數(shù)字化浪潮中,客服領(lǐng)域正經(jīng)歷著前所未有的變革,智能語音交互方案憑借其高效、便捷的特性,成為推動這一變革的核心力量。其中,語音識別模型優(yōu)化私部署方案與語音合成聲音定制方案作為兩大核
    的頭像 發(fā)表于 04-11 14:35 ?298次閱讀

    芯資訊|WT2605C藍牙語音芯片:AI對話大模型賦能的智能交互新引擎

    引言:AI技術(shù)驅(qū)動智能交互新趨勢在萬物互聯(lián)的智能時代,用戶對產(chǎn)品的交互體驗提出了更高要求——從“被動響應(yīng)”向“主動對話”升級。如何將AI大模型的強大語義理解與
    的頭像 發(fā)表于 04-09 08:35 ?458次閱讀
    芯資訊|WT2605C藍牙<b class='flag-5'>語音</b>芯片:<b class='flag-5'>AI</b>對話大模型賦能的智能<b class='flag-5'>交互</b>新引擎

    零知開源——ESP32語音交互系統(tǒng)(AI小智)開發(fā)教程

    一、功能介紹小智AI聊天機器人是一個基于嵌入式硬件與人工智能技術(shù)深度融合的智能交互系統(tǒng)。該項目以ESP32開發(fā)板為核心,結(jié)合語音喚醒、自然語言處理、音頻解碼播放及圖形化
    發(fā)表于 03-29 16:30

    零知開源——ESP32語音交互系統(tǒng)(AI小智)開發(fā)教程

    小智AI聊天機器人是一個基于嵌入式硬件與人工智能技術(shù)深度融合的智能交互系統(tǒng)。該項目以ESP32開發(fā)板為核心,結(jié)合語音喚醒、自然語言處理、音頻解碼播放及圖形化
    的頭像 發(fā)表于 03-29 15:33 ?7103次閱讀
    零知開源——ESP32<b class='flag-5'>語音</b><b class='flag-5'>交互</b>系統(tǒng)(<b class='flag-5'>AI</b>小智)開發(fā)教程

    ?多模態(tài)交互技術(shù)解析

    多模態(tài)交互 多模態(tài)交互( Multimodal Interaction )是指通過多種感官通道(如視覺、聽覺、觸覺等)或多種交互方式(如語音、手勢、觸控、眼動等)與計算機系統(tǒng)進行自然、
    的頭像 發(fā)表于 03-17 15:12 ?2054次閱讀

    WTV380-8S語音芯片:智能清潔設(shè)備的“語音助手”,小體積大能量,重塑人機交互體驗

    隨著智能家居的普及,掃地機器人、擦窗機器人、洗地機等清潔設(shè)備正從“功能型”向“智能交互型”躍遷。用戶不僅需要高效的清潔能力,期待直觀的語音
    的頭像 發(fā)表于 03-14 09:12 ?353次閱讀
    WTV380-8S<b class='flag-5'>語音</b>芯片:智能清潔設(shè)備的“<b class='flag-5'>語音</b>助手”,小體積大能量,重塑人機<b class='flag-5'>交互</b>體驗

    基于WTVxxx語音芯片的智能清潔機器人語音交互系統(tǒng)設(shè)計方案介紹

    ?一、產(chǎn)品概述與設(shè)計需求隨著智能家居設(shè)備的普及,擦窗機器人和掃地機器人逐漸成為家庭清潔的重要工具。為提升用戶體驗,語音交互功能成為產(chǎn)品差異化的關(guān)鍵需求。廣州唯創(chuàng)電子WTVxxx系列
    的頭像 發(fā)表于 03-06 08:27 ?357次閱讀
    基于WTVxxx<b class='flag-5'>語音</b>芯片的智能清潔<b class='flag-5'>機器人語音</b><b class='flag-5'>交互</b>系統(tǒng)設(shè)計方案介紹

    解鎖個性化語音交互新時代:九芯智能語音云平臺,創(chuàng)意聲音觸手可及!

    九芯智能語音云平臺提供全面高效安全的智能語音服務(wù),支持自定義語音內(nèi)容,簡化燒錄流程,依托AI技術(shù),助力各行業(yè)智能化升級,引領(lǐng)語音
    的頭像 發(fā)表于 01-02 16:51 ?898次閱讀
    解鎖個性化<b class='flag-5'>語音</b><b class='flag-5'>交互</b>新時代:九芯智能<b class='flag-5'>語音</b>云平臺,<b class='flag-5'>讓</b>創(chuàng)意聲音觸手可及!

    基于智能語音交互的智能呼叫中心工作機制

    作為實現(xiàn)智能呼叫中心的關(guān)鍵技術(shù)之一的智能語音交互技術(shù),它通過集成自然語言處理(NLP)、語音識別(ASR)和語音合成(TTS)等先進技術(shù),實現(xiàn)了與客戶的智能
    的頭像 發(fā)表于 12-03 16:44 ?713次閱讀
    基于智能<b class='flag-5'>語音</b><b class='flag-5'>交互</b>的智能呼叫中心工作機制