SALMONN

4个月前发布

306

SALMONN插图

SALMONN

SALMONN是由清华大学电子工程系和字节跳动开发的大型语言模型（LLM），支持语音、音频事件和音乐输入。与仅支持语音或音频事件输入的模型不同，SALMONN可以感知和理解各种音频输入，从而获得多语言语音识别和翻译以及音频-语音共推理等新兴能力。这可以被视为给予LLM“听觉”和认知听觉能力，使SALMONN成为通向具有听觉能力的人工通用智能的一步。

需求人群：

“SALMONN可以应用于语音识别、语音翻译、音频处理等领域。”

使用场景示例：

输入：gunshots.wav，输出：…

输入：duck.wav，输出：…

输入：music.wav，输出：…

产品特色：

多语言语音识别

多语言语音翻译

音频-语音共推理

© 版权声明

文章版权归作者所有，未经允许请勿转载。

THE END

喜欢就支持一下吧

相关推荐