哦啦:纯语音体验,给用户最精准的反馈

科技 驱动中国 x 502 次阅读 0 条评论
分享 Q

哦啦:纯语音体验,给用户最精准的反馈

哦啦运营经理 赵子嵩

放开双手,用语言直接控制手机,是现在以及未来越来越多人看重的事。

哦啦语音助手(以下简称:哦啦)产品运营经理赵子嵩告诉1号机器人网记者:“哦啦意在对知识结构化,实现全文检索功能,语义上进行细分纬度的处理。达成精准的自然交流方式”。

1号机器人网记者:哦啦是什么时候成立的?为什么会选择做智能语音?

赵子嵩:哦啦不是一个独立的公司,而是公司内部的一个创业团队,团队成立的时间大概在2012年底到2013年初这个时间段,我们总公司名字叫做威盛电子。

哦啦属于威盛电子公司的创业团队,威盛发展语音是基于两点,之前公司核心技术是做显示驱动,在模式识别、图像识别技术上都有十多年的经验,语言处理和图音处理虽然在业务上看起来不同,但是其实二者之间有很大的共同性。

第二点在于智能链接未来的大趋势。以前是人操作设备,现在是发展设备来理解人,包括新的产业,像是智能家居、机器人、智能车载都是我们比较看好的方向。

1号机器人网记者:哦啦与出门问问业务是否相似?

赵子嵩:出门问问做微信、做2c,哦啦语音是独立app,主要展示我们技术上的特点,还有关于实际用户的诉求,还有一块是与2b,像是与机器人、智能硬件企业合作。

1号机器人网记者:今年有很多语音公司冒头,哦啦在语音方面有哪些特点?

赵子嵩:哦啦主要是在技术上达成一个智能的、自然的人机交互,通过语音与其他人工智能做一个集成,然后来做一个交互。我们希望达到自然语言交互,这样对用户来说学习成本几乎为零。

从技术角度来看,我们主要有三块。

第一块是交互处理,希望达成人类常用的交互方式,上下文相关的交互处理,准确而符合思维的精准反馈。

第二块是语义处理,准确理解用户的意图与参数,基于知识和用户习惯的理解,基于上下文的理解。

第三块是知识的积累,我们人除了交互外,还需要知识积累,我们需要关于常识性的、热点性的知识。知识库这块技术特点是,全文检索的结构化知识库,这种设置可以达到全文的检索匹配,相当于谷歌百度的网页式,又可以达成结构化数据库产品。

1号机器人网记者:自然语言与纯语音有什么差异?

赵子嵩:前面讲的一个技术方向,想达成语音到反馈,这样一个比较智能的自然语言的交互方式。但是这势必会存在问题,我需要解决人与人的基本处理方式,比如纠正处理、语音选择,我们想通过语音的方式达到这些功能,但是现在很多语音助手大多数通过touch的方式选择,它不是一种纯语音智能交互,而是通过客户端进行辅助。

纯语音特点还需要达到精准的回复,我们在语义处理上比较精细,比如预定一个提醒,会按照人与实际物进行切分保存,之后的查询会按照多个关键字进行复合查询,我们对语义已经进行维度化处理,比如语音上,对于上下文之前理解代词,不仅能知道习近平的夫人是谁?还能一并告诉彭丽媛的背景及其他信息。

所以我们想达成,知识上的结构化与全文检索,语义上是细分纬度的精准处理。基于这两方面达成,精准的自然交流方式。

1号机器人网记者:智能音箱是哦啦最新推出的产品吗?

赵子嵩:市场上有很多智能硬件,我们主要是用智能语义的方式应用在硬件上。

一般的智能音箱,屏幕很小,传统的语音助手会直接移植到音箱上,成为智能音箱,但是这种方式是不太好的,很多音箱没有ui。我们的纯语音与交互方案在音箱上就有很多特点。

我们这款智能音箱具体操作是从唤醒软件开始消回音,而且唤醒率很高,这是结合了软件加硬件的整体方案,语义方面又可以很精准、方便的进行语义交互,比如通过歌词点歌、通过歌星名字点歌、或者语音保存我的播放列表,也可以通过语音提高音量。

而且一般人与人交谈是会打断音箱接受语音信号,但是我们的打断是比较自然的,直接像与真人一样进行交流,而不像很多智能音箱需要app与触摸打断。

1号机器人网记者:哦啦语义有哪些特点?

赵子嵩:主要分几类,第一个是自动提问,一些中文语言没有确定性的翻译,比如明天去北京?这包涵许多可能,语音会反问,是要查酒店,问景点还是订票呢?如果订票,语音会继续追问订火车票还是飞机票,如果选择订飞机票,还会问是否需要订酒店或者设置安排提醒。

第二个是纠正,我打电话给张三,如果又想打给李四,纠正时候不用说完整的话,就能实现跨流程操作。你上一步问天气,突然又想看电影,你可以通过语音选择功能就能实现。比如附近有什么餐馆,出现搜索结果直接导航去某一家餐厅,导航应用直接就可以过去,全程不需要touch,也不需要手机辅助,它在车载等领域有很大的便利性。

第三个是历史信息,有进行上下文联想功能,比如提醒我明天上午与王先生有会议,查询明天早上有什么安排,方便达成用户的精准诉求。这种技术将会在移动端有很大的作用。

这些都是哦啦语音助手的例子,它在智能家居与可穿戴设备领域都可以进行场景类别的优化。

1号机器人网记者:这些功能的实现是基于哪些技术?

赵子嵩:两大块,一个是多轮的上下文的交互流程,其中的核心技术,是使用了compare编译语言,比如用户提出问题,需要判断是哪个领域,通过compare可以达成多个结果的快速选择,比如出现100个选择,全部展开是非常慢的过程,compare是一个比较快捷精准的选择,这样用户使用起来就不会觉得产品反应慢,用起来就会流畅有序。

第二点是全文检索的结构化知识库。在知识库被维度化处理后,知识不再是孤立存在,而是互相联系配合的特点,这样就能达成比较智能精准的语音服务。

1号机器人网记者:现在语音识别面临哪些问题?

赵子嵩:语音识别分成语音模型与语言模型,其中最大的问题在于短句上,比如“北京”与“背景”就不是很好识别,这很容易产生错误理解,大多数人会理解为北京,所以北京识别率比较高,但是对于需求是“背景”的人反馈到“北京”就是一个错误信息,因为短语没有很好的上下文联系,我们解决方式是基于比较好的语义理解的引擎,来把语言识别对比起来,再来解决这个问题。

1号机器人网记者:以您的视角,您认为当下众多语音公司可以排进前十名有哪些?

赵子嵩:目前我觉得语音公司有很多,但是其实也是分很多细分方向。有名气的例如科大讯飞、云知声、捷通华声,他们都希望把语音识别做成平台。

科大讯飞本来就很有品牌,也有教育市场,也得到政府支持,是语音界里“高大上”的企业,他们左边想走互联网产品,比如输入法,右边又是传统的语音公司与2b合作模式。

云知声与捷通华声都是2b端。出门问问比较特别,完全是2c模式,或许想打造自己的产品,它的方向是想占领语音的入口,但是目前用户粘性还得磨砺。思必驰也是在与其他硬件公司合作,平台也有,其他的语言公司就是主打一款产品,类似专做语音助手等。

综合觉得,语音识别目前来看还是科大讯飞比较好,语义理解上我认为我们是最好。

1号机器人网记者:哦啦未来三年发展规划?

赵子嵩:2015年优化交互系统,延续各大产品线,比如哦啦语音助手和做智能硬件的交互解决方案,现在我们已经为中兴手机提供了语音服务。除此之外,我们还想研究视觉交互,希望未来能够在多人情况下,判断语音是何人所有。

这种判断涉及两个问题,一个是在音色上需要了特征识别,第二是人与人说话是眼神相对的,这块与视觉交互有关系,还有人的面部表情也能反应说话的含义。

还有我们会对智能家居系统做初步实验,这块主要是针对智能家居的解决方案,2016年将会建立人工学习的交互系统。我们现在的上下文语音识别,是与别人合作的。现在很多问题都产生在语言识别上,如果这方面克服不了,识别就会遇到瓶颈。

第二个,基本视觉会完成,主动降噪技术会完善,也会做智能家居的展示厅。我们不会考虑自己做硬件,我们更愿意与硬件企业合作。

版权声明:本文由驱动中国整理发布,转载需注明出处与原文链接。如有疑问请联系 editor@qudong.com
本文价值 成为第一个评分的人
登录后为本文打分
网友评论0 条评论
正在回复 的评论取消
评论加载中…
🔐

登录后参与互动

评论、点赞均可赚积分
连续签到、邀请好友也有奖励 🎁

电脑端: 微信扫码登录 微信内: 一键登录

微信扫一扫

打开微信「扫一扫」,分享本文到朋友圈或好友