微信小程序实现语音识别转文字功能及遇到的坑


Posted in Javascript onAugust 02, 2019

最近为小程序增加语音识别转文字的功能,坑路不断,特此记录。

微信开发者工具

开发者工具上的录音文件与移动端格式不同,暂时只可在工具上进行播放调试,无法直接播放或者在客户端上播放

debug的时候发现,工具上录音的路径是http://tmp/xxx.mp3,客户端上录音是wxfile://xxx.mp3。 忽悠呢,不是格式不同,是映射路径不同。

其实做个兼容也不难,每次提示一行文字,很丑。

采样率与编码码率限制

每种采样率有对应的编码码率范围有效值,设置不合法的采样率或编码码率会导致录音失败。详细看这个
https://developers.weixin.qq.com/miniprogram/dev/api/media/recorder/RecorderManager.start.html

一开始没有留意,导致录音不成功。

试过几次后,采用这样的配置,感觉录音识别率和体积之间比较好平衡:

sampleRate: 16000, //采样率
numberOfChannels: 1, //录音通道数
encodeBitRate: 96000, //编码码率

单通道基本是必选的。因为asr只支持单通道。frameSize也是可以的,但是要考虑截断对识别的影响。暂时没有用上。

录音优化

因为可能误按,于是对小于500ms的录音直接忽略。
另外,松开录音按键后,再延迟一点时间才真正stop录音。

录音文件格式

微信录音文件支持mp3和aac。这2种格式文件都比较小,aac文件体积更小。这对上传来说是件好事情,速度更快。
但是对语音识别转文字就不友好了。因为百度、阿里云ASR、讯飞的语音转文字接口都不支持aac和mp3,通常要求是pcm或者wav格式。

如果微信录音能提供wav格式,那么就不用服务器做格式转换了,但是wav格式体积是mp3、aac的5到10倍,至少短期是没戏了,这也是很多人吐槽的地方。

服务器转换录音文件格式

可以用java第三方库转换,也可以用Process调用ffmpeg转换。要注意的是,根据识别API的要求来做转换。比如阿里云asr的要求是:

支持音频编码格式:pcm(无压缩的pcm文件或wav文件)、opus,16bit采样位数的单声道(mono);
支持音频采样率:8000Hz、16000Hz;

java ProcessBuilder要使用数组传参

转换音视频,习惯用ffmpeg。安装完ffmpeg之后,用java新建进程调用。

Process = new ProcessBuilder("ffmpeg -i in.mp3 out.wav").start();

一直提示CreateProcess error。 后来看文档才发现,要以数组的形式传入参数。

Process = new ProcessBuilder("ffmpeg", "-y", "-i", "in.mp3", "out.wav").start();

这样就启动成功了。

关于java启动进程,不是本文重点,以后再写篇文章总结。

阿里云asr sdk使用问题

这个问题困扰了一天时间,回想起来真是吐血。
问题表现是微信录制的语音很多都识别不了。
最初是直接把录音mp3文件转换为pcm文件,本地能播放,但是用阿里云asr sdk却识别不了。 一开始以为是文件编码问题。特意查了asr支持的文件格式,用ffprobe检查,potplayer看属性,都没有看出问题。
甚至把启动ffmpeg进程转换也改了,用了java的库去做,还是不行。
后来为了方便测试问题,用asr的restful接口测试录音文件,都能识别! 似乎是sdk的问题。于是打开官方文档例子对比。发现用的是sdk 2.x,老铁啊你复制粘贴过来的代码竟然少了!欲哭无泪。

// TODO 重要提示:这里是用读取本地文件的形式模拟实时获取语音流并发送的,因为read很快,所以这里需要sleep
// TODO 如果是真正的实时获取语音,则无需sleep, 如果是8k采样率语音,第二个参数改为8000
int deltaSleep = getSleepDelta(len, sampleRate);
Thread.sleep(deltaSleep);

也少了对sampleRate的设置。

阿里云asr token过期

因为用的是免费版asr,没有给福报厂充值,因此token一天失效,导致联调的时候突然报错。
最后实在受不了,写了个定时任务每小时更新token。
这,就是beggar VIP?

wx.uploadFile返回值

封装了一个接口parseResponse,统一解析查询结果(文本、语音)。发现奇怪的问题:

用文本查询的,可以正常解析结果用语音查询的,明明已经返回了结果,却解析不了!

只能console.log()打印出来对比

微信小程序实现语音识别转文字功能及遇到的坑

第一行是wx.request()发起文本查询。
第二行是wx.uploadFile()上传语音文件后直接语音转文字,并且查询。

wx.request返回值是json对象。
wx.uploadFile返回值是“字符串”!
wx.uploadFile返回值是“字符串”!
wx.uploadFile返回值是“字符串”!
重要的事情要说3遍。尽管Content-Type: "application/json; charset=utf8",但是微信根本不做转换!非常坑爹!

解决:对wx.uploadFile返回值进行JSON.parse(res.data),得到json对象。

更换appid和secret

因为正式小程序项目账号一直拖着没有申请,所以这段时间用的是我个人的appid和secret进行开发。
等正式账号准备好了,更新了小程序项目的appid,并且发出内部体验包。

此时已经深夜1点半,头脑有点发懵。只更新了小程序appid,竟然忘了更新服务器的appid和secret。。。
于是乎反复报错登录失败。
过了一会才反映过来,更新服务器的appi的secret,但是还是用户。才想起忘了还有storage缓存没有清除?,里面放着自定义的session。这下真机体验没问题了。
但是微信开发者工具又是登录失败。反复摸索后发现:更换小程序appid后,清除所有数据,关闭开发者工具,重新打开,这就正常了。应该是微信开发者工具的bug。

https://ycwu314.github.io/p/miniapp-speech-to-text-experience/

总结

以上所述是小编给大家介绍的微信小程序实现语音识别转文字功能及遇到的坑,希望对大家有所帮助,如果大家有任何疑问请给我留言,小编会及时回复大家的。在此也非常感谢大家对三水点靠木网站的支持!
如果你觉得本文对你有帮助,欢迎转载,烦请注明出处,谢谢!

Javascript 相关文章推荐
JS中获取数据库中的值的方法
Jul 14 Javascript
JS+CSS实现六级网站导航主菜单效果
Sep 28 Javascript
jQuery代码性能优化的10种方法
Jun 21 Javascript
浅谈javascript:两种注释,声明变量,定义函数
Sep 29 Javascript
JS返回只包含数字类型的数组实例分析
Dec 16 Javascript
分分钟玩转Vue.js组件(二)
Mar 01 Javascript
vue.js  父向子组件传参的实例代码
Oct 29 Javascript
JS验证输入的是否是数字及保留几位小数问题
May 09 Javascript
微信小程序地图(map)组件点击(tap)获取经纬度的方法
Jan 10 Javascript
vant自定义二级菜单操作
Nov 02 Javascript
vue项目中js-cookie的使用存储token操作
Nov 13 Javascript
vue使用过滤器格式化日期
Jan 20 Vue.js
jQuery pager.js 插件动态分页功能实例分析
Aug 02 #jQuery
vue单页应用的内存泄露定位和修复问题小结
Aug 02 #Javascript
vue回到顶部监听滚动事件详解
Aug 02 #Javascript
微信小程序npm引入vant-weapp的踩坑记录
Aug 01 #Javascript
vue3.0中的双向数据绑定方法及优缺点
Aug 01 #Javascript
微信小程序导入Vant报错VM292:1 thirdScriptError的解决方法
Aug 01 #Javascript
微信小程序使用Vant Weapp组件库的方法步骤
Aug 01 #Javascript
You might like
有关phpmailer的详细介绍及使用方法
2013/01/28 PHP
php使用date和strtotime函数输出指定日期的方法
2014/11/14 PHP
php上传中文文件名乱码问题处理方案
2015/02/03 PHP
JavaScript中的私有/静态属性介绍
2012/07/26 Javascript
Jquery创建一个层当鼠标移动到层上面不消失效果
2013/12/12 Javascript
原生javaScript做得动态表格(注释写的很清楚)
2013/12/29 Javascript
Javascript验证上传图片大小[前台处理]
2014/07/18 Javascript
最简单纯JavaScript实现Tab标签页切换的方式(推荐)
2016/07/25 Javascript
js 将图片连接转换成base64格式的简单实例
2016/08/10 Javascript
Node.js的基本知识简单汇总
2016/09/19 Javascript
针对后台列表table拖拽比较实用的jquery拖动排序
2016/10/10 Javascript
javascript创建对象的3种方法
2016/11/02 Javascript
基于JS设计12306登录页面
2016/12/28 Javascript
详解AngularJs HTTP响应拦截器实现登陆、权限校验
2017/04/11 Javascript
Node.js微信 access_token ( jsapi_ticket ) 存取与刷新的示例
2017/09/30 Javascript
Vue 中的compile操作方法
2018/02/26 Javascript
layer弹出层全屏及关闭方法
2018/08/17 Javascript
jQuery实现简单的Ajax调用功能示例
2019/02/15 jQuery
Node.js 多进程处理CPU密集任务的实现
2019/05/26 Javascript
vue实现图片上传预览功能
2019/12/23 Javascript
基于JS实现table导出Excel并保留样式
2020/05/19 Javascript
Node 使用express-http-proxy 做api网关的实现
2020/10/15 Javascript
Python3 操作符重载方法示例
2017/11/23 Python
无法使用pip命令安装python第三方库的原因及解决方法
2018/06/12 Python
Python中py文件转换成exe可执行文件的方法
2019/06/14 Python
pandas将多个dataframe以多个sheet的形式保存到一个excel文件中
2019/10/10 Python
Python数组拼接np.concatenate实现过程
2020/04/18 Python
Python同时处理多个异常的方法
2020/07/28 Python
关于Python3爬虫利器Appium的安装步骤
2020/07/29 Python
HTML5 Video/Audio播放本地文件示例介绍
2013/11/18 HTML / CSS
《新型玻璃》教学反思
2014/04/13 职场文书
2014年教师德育工作总结
2014/11/10 职场文书
2014年电工工作总结
2014/11/20 职场文书
2015年幼儿园元旦游艺活动策划书
2014/12/09 职场文书
幼儿园教师自我评价
2015/03/04 职场文书
python读取mat文件生成h5文件的实现
2022/07/15 Python