SALMONN

SALMONN插图

SALMONN

SALMONN是由清华大学电子工程系和字节跳动开发的大型语言模型(LLM),支持语音、音频事件和音乐输入。与仅支持语音或音频事件输入的模型不同,SALMONN可以感知和理解各种音频输入,从而获得多语言语音识别和翻译以及音频-语音共推理等新兴能力。这可以被视为给予LLM“听觉”和认知听觉能力,使SALMONN成为通向具有听觉能力的人工通用智能的一步。

需求人群:

“SALMONN可以应用于语音识别、语音翻译、音频处理等领域。”

使用场景示例:

输入:gunshots.wav,输出:…

输入:duck.wav,输出:…

输入:music.wav,输出:…

产品特色:

多语言语音识别

多语言语音翻译

音频-语音共推理

© 版权声明
THE END
喜欢就支持一下吧
点赞6 分享