什么是 语音识别?
语音识别(Speech Recognition),又称自动语音识别(ASR)或语音转文本(STT),是把口语音频转换为文本假设的技术。系统根据音频信号估计词或 Token,并在明确的语言、领域、声学环境和误差指标下评测。
快速了解
| 全称 | 自动语音识别 |
|---|---|
| 创建时间 | 1952 年(贝尔实验室 Audrey 系统) |
工作原理
语音识别系统将音频波形映射为 Token,再形成文本。早期系统常组合声学特征、隐马尔可夫模型和语言模型;当前系统多使用神经编码器与解码器,包括 CTC、Transducer 和序列到序列设计。架构本身不能证明准确率,结果取决于语言、麦克风质量、噪声、说话人、口音、领域词汇、分段方式和参考转写规范。 应使用有代表性的音频和明确指标评测 ASR,例如词错误率(WER)、字符错误率(CER)或任务专用的人工修订率。除总体指标外,还应按语言、声学环境、说话人群体和领域报告错误切片。实时产品还需要测量首个部分结果时间、最终结果延迟、修订行为、成本、留存策略、访问控制,以及音频或转写文本是否离开设备。
主要特点
- 在明确的语言和转写政策下将音频信号映射为文本
- 可使用声学、语言、发音组件或端到端神经网络
- 准确率会随噪声、口音、麦克风、领域词汇和分段方式变化
- 需要有代表性的参考转写和明确的误差指标
- 可采用批处理或流式模式,两者的延迟与修订行为不同
- 录音和转写文本需要同意、留存和访问控制机制
常见用途
- 带错误修订流程的无障碍字幕
- 具备同意、说话人处理和留存控制的会议转写
- 对高影响动作进行二次确认的语音交互
- 通过隐私审查和领域评测的呼叫中心分析
- 受数据驻留和延迟约束的离线或端侧转写
示例
Loading code...常见问题
语音识别和声纹识别有什么区别?
语音识别将口语转换为文本(识别说了什么),而声纹识别根据声音特征识别说话人是谁。语音识别关注跨说话人的转录准确性,声纹识别用于生物特征认证和说话人身份识别。
应该如何比较不同语音识别系统?
应使用相同且已取得同意的音频 Fixture、参考转写政策、语言与口音切片、声学环境、Codec、硬件、并发和解码设置。除 WER 或 CER 外,还要报告 Partial 稳定性、最终定稿延迟、成本和人工修订量。某个公开数据集上的结果不能证明系统适合另一领域或实时产品。
哪些因素影响语音识别准确率?
准确率受语言和文字体系、声学环境、麦克风与编码、说话人差异、语速、多人重叠、领域词汇、分段、标点规则和参考转写政策影响。应把这些作为明确切片评测。降噪或更大模型可能改善某一场景,但必须在代表性音频上验证,不能仅凭经验假定。
语音识别可以实时进行吗?
可以。流式 ASR 会在音频到达时返回部分假设,并在稍后修订为最终文本。应评估端到端延迟、部分结果稳定性、最终定稿延迟、并发能力、网络中断和打断行为。本地模型能否实时运行取决于准确模型、语言、音频长度、量化方式、硬件、批量和解码设置。
如何选择云端和本地语音识别方案?
应按实际任务质量、语言支持、延迟、总成本、运维归属、数据驻留、留存政策和失败影响选择。托管服务可简化扩缩容和更新,但会引入供应商与数据处理依赖;本地部署可支持离线和数据控制,但需要硬件容量、安全修补、模型生命周期管理和监控。