大众财经网 9月23日消息,据科大讯飞官方发布,公司今日推出最新一代语音识别大模型Spark-ASR-2.0,在提升识别准确率与文本流畅度的同时,整体推理成本较上一代仅增加10%。
据科大讯飞介绍,Spark-ASR-2.0通过非自回归与LLM增强自回归协同、中英文混合文本与声学联合增强、动态上下文注入等关键技术,使整体语音识别效果大幅提升,尤其在通用识别(中英文混合、方言、专业术语)、复杂声学场景识别(高噪、小音量、快语速、儿童)、上下文识别和文本流畅规范性等方面改善明显,词错误率(WER)明显降低。
官方将这一代模型的变化概括为:过去的语音识别追求“一字不差地还原所说内容”,而Spark-ASR-2.0更进一步,让识别结果“流畅成文”——在提升准确率的同时,结合上下文逻辑与语境理解,精简冗余表达、精修各类细节,使文字更连贯、语义更清晰。在与当前业界最好水平的对比中,该模型在方言、高噪和小音量等复杂声学场景上拥有显著优势。
在落地节奏上,据IT之家了解,Spark-ASR-2.0将从9月24日开始逐步上线讯飞输入法,并通过讯飞开放平台提供API服务;此外还将陆续在讯飞AI眼镜、讯飞智能办公本、讯飞听见等更多产品业务上落地应用。这意味着普通用户最快明天就能在输入法中体验到新版语音识别效果。
在国产大模型加速渗透办公与终端设备的背景下,语音识别作为人机交互的基础能力,其准确率与成本直接决定了应用体验。科大讯飞此次在效果提升的同时将推理成本仅增10%作为卖点,反映出大模型竞争正从“堆参数”转向“比性价比”,对下游开发者和终端厂商而言是积极信号。
本文仅供信息参考,不构成任何投资建议。