前言
文章原创,出自 cv君,公众号:DeepAI 视界
gif 不能发出声音,大家脑补一下场景。算法找到视频中的打击乐器和钢琴正在发声
gif 不能发出声音,大家脑补一下场景。算法找到视频中的救护车正在滴度滴度~
视听分割是本周ECCV定会提出的全新任务,旨在:找出画面中哪个位置正在发出声音,这是一份多模态工作,结合了视觉和语音。
这有啥用?
直播推荐领域:我们直播的推荐系统,可能需要给正在表演才艺的cv君多一些推荐力度,而一直抱着琴不弹的,只在闲聊的、并且放着BGM的,我们需要识别出来现在有没有进行才艺表演。有的朋友就说啦!用语音识别,分类出在唱歌和不唱歌不就行了? 反问:如何用语音识别分类区分BGM和唱歌?————视听分割、