Vox-Profile是南加州大学和约翰霍普金斯大学联合开发的语音特征全面分析基准测试系统,能从语音中识别说话者的静态特征(如年龄、性别、口音)和动态特征(如情绪、语流)。研究团队使用15个以上的公开语音数据集和多种语音基础模型进行测试,发现在多数任务中参数量更大的模型表现更佳。该系统展示了三种主要应用:分析语音识别系统性能差异、评估语音生成系统质量,以及自动生成说话风格描述。人类评估结果表明,Vox-Profile生成的描述与人工标注相当,为语音技术研究提供了新的方向和工具。
至顶网 科技行者 2025-05-27 10:12:27