研究文章

基于 Whisper 语音控制系统优化的无人机控制应用

摘要

针对无人机语音控制存在原始Whisper模型端到端响应延迟超11秒、人机交互体验差的问题,本文开展低延迟无人机语音控制系统全链路优化研究。以降延迟、优交互为核心目标,从音频预处理、模型推理、人机交互三个维度搭建优化框架,引入语音活动检测消除无效录音等待时间,设计蓝牙耳机听觉反馈交互机制,结合KV缓存与模型量化技术加速模型推理,通过对照实验验证不同优化策略的差异。结果表明,全链路优化后系统端到端响应时间大幅降低,实现无人机语音控制秒级实时响应,完成视觉依赖到听觉主导的升级。

关键词

无人机控制;语音识别;Whisper模型;模型量化

参考

潘嘉琦, 曹科才, 丁嘉存, 等. 基于维纳滤波的无人机语音系统的设计与实现[J]. 计算机与数字工程, 2021, 49(10): 2161-2167.

李明, 赵雪, 陈锋. 轻量化目标检测模型算法综述[J]. 机电工程技术, 2025, 54(06): 84-95.

陈亮, 李静. 基于改进WebRTC 的实时语音活动检测算法[J]. 计算机工程, 2021, 47(3): 189-195.

郭子彦, 刘烃, 郑南宁. 深度神经网络模型量化与加速技术综述[J]. 自动化学报, 2022, 48(7): 1635-1656.

Vaswani A, Shazeer N, Parmar N, et al. Attention is all you need[C]//NeurIPS. Curran Associates Inc., 2017.表 2 不同量化精度下 Whisper 模型性能对比模型精度平均识别耗时(秒)识别准确率(%)相对加速比FP32(基线)10.03692.50%1FP160.63692.50%15.78INT83.20089.00%3.14

Refbacks

  • 当前没有refback。
版权所有(c)2026 喆 文, 石权 冯, 梦迪 黄, 小瑜 何
Creative Commons License
此作品已接受知识共享署名-非商业性使用 4.0国际许可协议的许可。