您好,非常感谢您的分享。我试图使用该方法筛选一个音频数据集中的中文内容,音频来自于自然场景,可能包含仅有环境声的片段。注意到您强调“传入的音频数据必须以话语为启点”,不知道该如何理解,请问是音频中不能包含背景声和空白阶段,只能包含语音吗?
您好,非常感谢您的分享。我试图使用该方法筛选一个音频数据集中的中文内容,音频来自于自然场景,可能包含仅有环境声的片段。注意到您强调“传入的音频数据必须以话语为启点”,不知道该如何理解,请问是音频中不能包含背景声和空白阶段,只能包含语音吗?