作者与机构:Yi-Jen Shih、Puyuan Peng、Abdelrahman Mohamed、David Harwath(UT Austin;FAIR, Meta Superintelligence Labs)
RetroThinker 把“回溯式思考”引入流式 SpeechLLM,在 Moshi 上通过三段式后训练实现不中断语音输出的前向自纠错,在 TTS-spoken GSM8K 上同延迟下取得 11 个百分点准确率提升,是推动语音大模型实时推理精度-延迟帕累托前沿的实用探索。
语音深度伪造检测(SDD)模型通常在多攻击数据集上以二分类(真实/伪造)目标联合训练,所有伪造攻击共享一个伪造标签,评估仅报告总体等错误率(EER)。这种聚合视角掩盖了不同攻击对模型学习和泛化的差异化影响:模型可能被某些攻击主导,导致在其他攻击上泛化不佳,而总体 EER 无法揭示攻击级不平衡。现有课程学习、持续学习和主动学习在 SDD 中主要关注分布偏移、合成语音质量或灾难性遗忘,而非攻击级主导问题。
在 ASVspoof 2019 LA 上,使用 RawNet2、AASIST 和 SSL 模型(SLS-XLSR)进行实验。标准多攻击训练下 VC 与 TTS 的 EER 已存在差异,样本平衡后仍不均衡:样本平衡训练下 RawNet2、AASIST 和 SSL 的总体 EER 分别为 5.45%、3.22% 和 0.70%。攻击级省略显示,移除 A1 和 A4 会导致跨模型显著退化:RawNet2 总体 EER 升至 23.98%(TTS 29.63%),AASIST 升至 18.36%(TTS 24.31%),SSL 升至 17.81%(TTS 23.22%),表明 A1 和 A4 为高影响攻击;而移除 A2 或 A3 时性能相对稳定。该现象在三种架构上一致。论文进一步在 ASVspoof 2019、2021、ASVspoof 5 和 Fake-or-Real 上验证所提课程学习策略,报告整体鲁棒性提升且攻击级不平衡降低(片段未展示完整结果)。
该工作首次系统刻画 SDD 中的攻击级学习偏差,定义高影响攻击并提出攻击感知课程学习,为更均衡、鲁棒的语音深度伪造检测训练提供了新视角。
该工作系统比较了类增量声音事件分类中的多种抗遗忘策略,指出遗忘集中于深层分类头,并发现“冻结特征提取器+动态头微调”在域内多标签音频标注中兼具低遗忘与高稳定性,为音频持续学习提供了实用基线。
该论文针对连续自回归 TTS 中 NVV 生成缺乏显式序列似然和人工偏好标注的问题,提出 LALM 自动偏好数据构建与 RSFT + Anchored Flow-DPO 两阶段优化框架,在 NVVSpeech Challenge Track 2 上稳定超越 VoxCPM2 基线,是偏好优化在表达性语音生成中的一次有效适配。
现有音频 In-Context Learning (ICL) 研究主要衡量 Task Recognition:演示仅提示模型调用预训练已有能力,而非 Task Learning(从演示中推断真正新的输入-标签映射)。音频信号缺乏显式单元边界、信息模式跨多个时间尺度,使得音频 Task Learning 比文本更具挑战。目前尚无专门隔离音频 Task Learning 的基准。
提出 AudioICL-Bench,一个诊断性基准,每个 episode 的规则独立重采样,使正确答案无法从预训练先验中获得,只能从演示中归纳。 - 共 9 个任务,沿两个正交轴组织: - Axis-C(上下文操作轴):C1 快速绑定、C2 归纳、C3 结构化组合。 - Axis-A(音频能力轴):A1 语音内容理解、A2 非语音声学模式理解、A3 时间结构。 - 设计原则:抗零样本(无演示时性能接近随机);主要使用人工任务以独立控制变量,辅以一个自然任务。 - 任务包括 AudioCount、AudioCountHard、AudioLength、AudioLengthHard、AudioOperator、AudioOperatorHard、AudioRemap、MorseCode、AnomalyDetect。 - 每个任务 300 个 episode,使用精确匹配准确率评估。
在 5 个 Large Audio Language Models (LALMs) 上评估: - 当感知任务较简单时,最强模型能轻松将任意声音绑定到新标签。 - 但在 时间测量(如 AudioLength 系列、MorseCode)和 多规则组合(如 AudioOperatorHard)上严重失败。 - 揭示两个主要能力边界:时间感知 与 多规则组合。
AudioICL-Bench 是首个专门隔离音频 Task Learning 的诊断基准,通过两轴分类法与每 episode 重采样规则,系统性地揭示了 LALM 在时间感知与多规则组合上的能力边界。
论文将多通道重放语音检测从静态跨环境泛化推进到无需回放历史数据的域增量持续学习,提出的 TSB 以每个环境一个轻量波束形成头实现结构抗遗忘,并在全环境顺序基准上揭示了顺序效应与算法选择同样关键。
<Speech-XXXX>。<ex-XXXX>;仅用于 cross-prompt 模块 conditioning,不传入 TSE 模块。<Speech-ForASR> 与 <ex-ForASR>,并配对正则化损失。标准 prompt 仍使用传统 SNR 损失。L_L1,R(s_n, ŝ_n) = ||s_n - ŝ_n||_1 + λ||y_n - ŝ_n||_1,其中 y_n = s_n + 10^{-α/20}(x - s_n),实验设 λ=1、α=5.0。L_SNR,R(s_n, ŝ_n) = -SNR(s_n, ŝ_n) - λ·SNR(y_n, ŝ_n)。<ex-KeepRev>,当包含该 prompt 时以带混响语音为目标,否则以去除晚期混响(RIR 前 50 ms)的目标语音为目标,实现保留/去除混响的控制。<Speech>、<SFX-mix>。<Speech-ForASR>、<SFX-mix>。<Speech> 配 SNR 损失,<Speech-ForASR> 配正则化损失),A4 在存在 <ex-ForASR> 时用式 3,否则用 SNR 损失。<Speech>、<SFX-mix>、<ex-ForASR>、<ex-KeepRev>,训练时独立以 50% 概率开关两个下游任务 prompt。-H 表示高质量增强输出,-A 表示 ASR 导向输出;-XD/-XR 表示不含/含 <ex-KeepRev>。D=64, K=4, S=1, H=4, G=8;cross-prompt 模块 (B,E,C)=(4,128,384),TSE 模块 (2,96,256);训练 150 epoch,每 epoch 2000 更新步,batch size 4,AdamW,学习率 warm-up 至 0.001(10k steps),验证损失 5 epoch 不改善则学习率减半并回退到当前最佳模型。提出一种简单有效的 prompt 扩展与 prompt-dependent loss 机制,使统一源分离模型能够按下游任务(如 ASR 或人耳聆听)动态切换输出特性,在保持通用增强质量的同时提升 ASR 鲁棒性。
该工作通过严格的控制消融证明“少即是多”:在流式 EOT 检测中,声学+韵律已足够甚至更优,文本语义并非必要,为轻量、低延迟对话系统设计提供了有力实证。
该工作将全双工对话评估扩展到法语真实口语场景,并揭示时序指标跨语言较稳健、内容评估对语言匹配敏感,同时指出指标优化与对话自然性之间存在取舍。
这是一篇面向跨文化理解的多语言视频语音转写实践与数据资源论文,验证了 WhisperX 零样本与少量微调在多语言 in-the-wild 视频上的可用性,并提供了可复现的低成本流程,但 20% 左右平均错误率仍说明完全自动化转写远未理想。
PAID 通过将冻结语音特征按强制对齐的英语音素跨度组织为音素条件化发音 token,在说话人无关的 L2 英语 L1 背景口音识别上取得当前评估系统中的最佳平均表现,说明“局部发音证据 + 目标音素身份”的表示结构比单一全局嵌入更有效。
Candor-LR 通过大规模真实二元视频会议对话数据和严格说话人划分的 AVSR 基准,揭示了脚本化 AVSR 到自然对话的泛化鸿沟,并证明视觉信息在真实对话与噪声鲁棒性中的关键作用。
该论文提出无需预训练 teacher 的 EMA 自蒸馏一致性轨迹学习框架,在相同 NCSN++ 骨干下以 2 步推理获得有竞争力的语音增强感知质量,并通过步数/调度扫描揭示了低步数几何调度偏感知、高步数均匀调度偏保真的权衡;其主要代价是 PESQ 仍低于直接优化可微 PESQ 的 teacher-based SBCTM。
该工作通过统一预处理 pipeline 与多条件基准,系统暴露了当前 AVSR 在广播域外的泛化鸿沟,并指出视觉编码与跨域鲁棒性仍是关键瓶颈。
该工作通过 MuNo-SP 表示和自动数据生成管线,将乐谱内容与演奏实现统一起来,为音频语言模型提供更细粒度、时间对齐的音乐理解监督,并发布了 MAESTROCaps 数据集。
本文首次在统一开源基座与严格流式条件下系统比较四类多说话人 ASR 架构,并通过 PI-DTW 对齐算法为流式 SOT 多说话人 ASR 的可扩展训练扫清关键障碍。
多语言/多口音 ASR 通常依赖大规模可学习卷积核,参数多且适配成本高;同时希望在不改变推理架构和算子的前提下提升识别性能。Orukeet 探索的是:能否把编码器中部分已学习的时间滤波核替换为固定的解析函数,并冻结这些替换项,仅训练剩余参数,从而获得更好的多语言识别效果。
所有对比使用相同音频与匹配的 NeMo 设置:NeMo greedy-batch TDT、ten-symbol limit、FP32 weights + BF16 CUDA autocast,并禁用 TF32。英语使用固定 text normalizer;其他语言保留变音符号,并使用语言特定数字归一化与 compound-boundary alignment。WER 统计 substitution、deletion 和 insertion。最终 checkpoint 选择使用 LibriSpeech test-other。
Orukeet 通过将一半时间卷积核替换为冻结的 Gabor 解析函数,在不改变推理架构与算子、仅增加极少量固定参数的前提下,显著提升多语言/多口音 ASR 性能,是一种简单有效的“结构化冻结 + 剩余微调”方案。
SCNet 通过低频子带条件先验和幅值加权抗缠绕相位损失,为 GAN 声码器引入了显式频域引导,在语音生成质量与推理效率之间取得了良好平衡。
本文针对 tight-boundary speaker diarization 伪标签中的 over-tightening 问题,从 pause filling、序列开头漏检和非因果模型协同训练三个角度提出简洁有效的改进,在 AMI 与 AliMeeting 上显著缩小与理想 tight 标签的差距,并提升下游多说话人 ASR。
SpeechAnnotator 以本地开源多智能体加有界复核循环为特色,为长时语音的多维细粒度标注提供了可扩展、可审计且成本可控的统一框架与评测基准。
[laughter])表示,缺乏对波形时间边界的细粒度监督。(c, ts, te) 标注,标注者间边界差异小于20ms。该工作将NVV理解从转写标签推进到波形级时间定位,通过统一分类体系、可扩展自动标注流水线、专家精修基准和轻量非自回归槽填充模型,为细粒度非语言发声 grounding 提供了数据、基准与建模的一体化方案。
在基于大语言模型的语音生成中,离散编解码表示虽然提供了稳定的预测范式,但其量化瓶颈会导致细粒度韵律、音色、发音和帧间连续性等信息缺失。连续表示(如 VAE 潜变量)虽能保留更丰富的声学细节,但作为自回归预测目标时,预测误差会沿生成链累积,引发潜变量漂移(latent drift),严重降低长文本生成的稳定性。传统 VAE 在欧几里得高斯空间中建模潜变量,范数与方向均携带信息,自回归预测时幅度和方向误差均会累积,导致长期生成退化。
本文提出 SphereVAE,一种超球面潜变量自编码器。其核心思想是将 VAE 的潜空间约束到单位超球面 (S^{d-1}) 上,并用 Power Spherical 分布建模后验。编码器输出被拆分为方向分支和浓度分支:方向分支经 L2 归一化形成均值方向 (\mu),浓度分支估计参数 (\kappa),二者定义超球面上的 Power Spherical 后验。通过 KL 散度将后验正则化到均匀超球面先验,使信息主要编码在方向变化中,潜变量范数固定,从而为自回归预测提供有界几何目标,减少范数漂移风险。该方法与现有改进生成器、对齐策略或扩散预测模块的工作正交,从表示先验层面缓解误差累积。
由于潜空间自由度降低,SphereVAE 在重建指标上不如标准 VAE。但集成到 VoxCPM 进行零样本 TTS 时,SphereVAE 在所有对比 VAE 变体中取得了最低的内容错误率,同时说话人相似度相当。在长文本生成任务中,SphereVAE 比 VAE、SemanticVAE 和 σ-VAE 更好地保持了说话人相似度,整体说话人一致性保持最优。结果表明,适当的潜空间几何约束能有效缓解语音生成中的自回归误差累积和漂移。
SphereVAE 通过将连续语音表示约束到单位超球面,以轻微牺牲重建质量为代价,显著提升了自回归语音生成的长程稳定性和鲁棒性,为连续表示建模提供了新的几何视角。
UniStream 通过解码端可复现的免标识多专家 RVQ 与仅训练期 OT-CFM 正则,在保持完全因果流式和实时推理的同时,显著提升 48kHz 全带语音、音乐和环境声音频编码质量,是一项面向统一流式音频传输的务实且有效的量化架构创新。
现有 text-aligned speech tokenization 方法虽能让语音 token 与 LLM token 空间对齐,但依赖 离线 ASR,导致两大问题:
论文提出 StreamAlign,一个支持流式 tokenization 与流式重建的 text-aligned speech tokenization 框架,面向实时语音–文本联合建模。
(w_m, q_m, d_m)。StreamAlign 通过「word-level ASR 引导 + character-level RNN-T 对齐 + LLM subword 聚合 + 主动词边界检测」,首次在保持识别精度的同时实现低延迟流式 text-aligned speech tokenization,并验证了其在实时语音–文本联合建模中的有效性。
这篇论文用 Berry 随机波猜想与 Weyl 特征值计数定律解释了“学习重新发现闭式对角正则器”的结构性原因:在截断噪声近似各向同性的模态逆问题中,最优对角 Tikhonov 形状就是由先验决定的闭式幂律,逐模式/逐房间学习很难稳健超越;学习的价值需要转向跨模式耦合等非对角结构。
Gander 通过“Cerebellum-Brain 分工协同 + Thinker-Talker 流式 token 化”的端到端设计,将实时全双工交互与长程智能体推理解耦又协同,是迈向自然全模态人机协作的重要一步。
s_p(x):原始音频上的被动检测分数;s_w(x):在 marked derivative 上的条件 keyed-probe 分数;s_r(x):来自 held-out reference pool 的 kNN(k=10)逆距离加权 bona fide votes;s_m(x):最近 bona fide 与 spoof 距离 margin;c_r(x)。f_pw = 0.5 s_p + 0.5 s_w,f_pwr = 0.5 f_pw + 0.5 s_r,f_pwrm = 0.25(s_p + s_w + s_r + s_m)。d = [|s_p - s_w|, |f_pw - s_r|]。s_rec(x) = σ(β0 + β_z^T z(x) + β_d^T d(x)),其中 z = [s_p, s_w, f_pw, s_r, s_m, c_r, f_pwr, f_pwrm]。这篇论文把语音深伪检测从‘只给一个分数’推进到‘分数 + 可审计证据记录’:通过 late calibration 在保持标量决策的同时暴露 passive、probe、retrieval、profile 四路证据及冲突坐标;虽未超过最强 passive WavLM 基线,但在可解释性、选择性复核和边界样本处理上提供了实用框架。
本文以一名职业打击乐手的四个月深度共同设计为方法,将“生产性不协和”从批判话语落地为可操作的设计实践,既贡献了基于神经网络的连续打击手势实时映射工具包与十轨专辑,也提炼出“knowing-when”这一隐性知识与“如何评估技术是否真正支持音乐实践”的开放之问。
通用音频表示需要在语音、音乐、环境声中同时保留声学细节,并组织可跨任务、跨域、跨下游模型容量迁移的高层概念。已有声学预训练(如 BEST-RQ、mel/chroma 重建、CTC ASR)能提供强声学与词汇基础,但没有显式围绕 scene、style、instrumentation 等全局概念组织表示。已有音频-语言对齐工作虽证明语言监督有效,但训练配方、数据混合和下游系统不一致,难以判断在匹配 continuation 中“正确音频-描述对应”本身带来多少增益,以及增益是否可直接从表示读出,还是主要由更强下游模型暴露。
论文通过严格匹配的对照实验证明,正确的音频-描述语义对齐能在冻结迁移设置下跨语音、音乐和环境声显著提升通用音频表示,且收益不能简单归因于增加一个对比目标。
该研究把 HRTF 个性化评估从“定位准不准”推进到“听者如何看、听、动”,用听觉引导视觉搜索和 VR 感觉运动指标揭示了消声条件下约 200 ms 的反应优势,提示空间音频个性化评价应纳入动作规划与生态任务表现。
全双工语音模型需要训练数据同时保留轮流发言、重叠、打断、反馈等交互时序信号,但真实双人对话通常以带噪单声道录音形式存在,且这些信号在说话人之间相互纠缠。另一方面,提示词生成的对话容易丢失真实交流中的时序与交互模式。
论文提出 ConversationalVoice,一个端到端数据流水线,将真实两人对话片段转化为三种互补的全双工训练数据产物:
三个阶段共享说话人身份与来源溯源,并输出成对、时间对齐的单说话人音轨、带说话人归属的转写、词级时间戳、音频标签与表达指令。其核心不是提出新的分离器、TTS 模型或说话人编码器,而是组合现有组件优势,构造面向真实对话的全双工语音训练数据。
ConversationalVoice 将真实双人对话转化为“分离—重建—扩展”三阶段互补的全双工语音训练数据,在保留源交互时序的同时提升语音质量与对话覆盖度,但尚未验证下游全双工模型训练收益。
该论文不以刷高闭集分类精度为目标,而是为水下船舶开放集重识别建立更诚实的跨航段评估协议,并用原始波形选择性核嵌入揭示公开数据上的真实难度与重复泄漏风险。
传统主动噪声控制(ANC)只最小化误差麦克风处的总扰动,不区分期望声与噪声。方向保持ANC(DP-ANC)要求衰减来自非期望方向的噪声,同时保留自然到达指定期望方向的声音。已有方法存在明显局限:解析SSANC需要针对每个新观测重复矩阵求解或优化;波束形成hear-through系统需要通过次级源路径估计并重建期望分量,可能引入算法延迟或改变双耳线索;选择性固定滤波ANC只能从预设计滤波器库中选择,不能为未见条件生成新滤波器;GFANC虽然可从参考信号估计控制滤波器,但主要面向降噪,缺少显式的期望信号保持项。因此,缺少一种无需预设计滤波器库、无需逐观测解析优化、无需重建期望信号,即可直接估计完整多通道控制滤波器组并显式平衡消噪与保持的方法。
摘要报告在超过3300个评估案例中,所选工作点实现平均22.8 dB降噪,期望信号失真为 -11.4 dB。验证使用Hearpiece入耳设备数据库的实测传递函数,进一步表明在实测声学配置下性能一致。论文还刻画消噪-保持前沿,并与解析SSANC等基线进行比较;仿真采用圆形阵列配置,并单独训练基于实测传递函数的模型。
该工作把方向保持ANC从逐观测解析优化或期望信号重建转向方向条件化的控制滤波器直接估计,以显式消噪-保持目标训练网络,在无需预设计滤波器库和重建期望信号的前提下实现可调的降噪与保持权衡,并在仿真和实测配置中验证了有效性。
SETEAB 通过深度子采样、SE-Res2Block、TEAB 和加权双向融合,在极低参数与 FLOPs 下实现了优于 TIM-Net/MS-SENet 的 SER 精度与跨语料泛化,是轻量语音情感识别中值得关注的精度-效率平衡方案。
该工作以"歌曲内匹配对照"的因果式实验设计,首次把跨语言歌唱差异从整体印象与符号记谱推进到可测量的音素局部声学效应,并用九语言 85.5% 的艺术家分组分类准确率验证了音系结构对歌唱方式的深层塑造。
总结生成失败: Expecting value: line 1 column 1 (char 0)
传统条件流匹配(CFM)在图像/语音恢复任务中使用显式时间坐标 t 作为生成轨迹的进度描述。然而,在恢复任务中,起始分布与目标分布存在样本相关的统计依赖(如噪声水平、退化程度不同),导致相同 t 可能对应不同的退化程度和距离目标分布的差异,时间条件不足以准确描述生成运输状态。
在语音增强和图像去噪任务上,系统性分析了判别式表征的潜在空间,发现其按退化严重度组织,并随生成过程沿目标流形轨迹移动。DFM 在这些任务上优于传统 CFM 和多种扩散/流匹配基线,并支持自适应推理(可根据样本复杂度调整计算量)。
本文提出以判别式潜在表征代替时间条件来引导流匹配模型的生成恢复,理论上揭示时间条件的歧义性,实验上验证了表征对恢复状态的编码能力,为生成恢复提供了新视角。
Brain2Speech-Net 是一种在低资源皮层内数据设置下,无需文本解码即可实现可懂、实时脑到语音合成的有效单阶段范式。
现有 LLM-over-voice 系统将对话上下文视为扁平、不断增长的序列,仅侧重语义内容的管理,而忽略语音特有的上下文信息,包括副语言线索(如语速、语调)和环境条件(如背景噪声、网络丢包)。这导致: 1. 响应风格与用户偏好不匹配(如语速不对齐); 2. 环境干扰引发交互质量问题(如丢包导致 VAD 误判端点,造成误中断); 3. 长时语音会话的累积成本呈平方增长,难以扩展。
论文提出 llmovoice,一个显式的语音上下文管理中间件,位于应用和 LLM 服务之间。核心设计包括: - 三层上下文抽象:语义内容(对话历史)、副语言状态(语速、语气)和环境状态(噪声、网络抖动/丢包)。 - VoicePage (vpage) 和 VoiceThread (vthread) 结构:将每个完整交互封装为 vpage,相关页面组成 vthread,以支持选择性检索和保留逻辑关系。 - 有界上下文构建:每轮回合根据当前输入、历史和运行时信号构造有界语音上下文,并通过成本感知的上下文投影器选择合适的历史表示。 - 编排循环:利用服务端 LLM 对语义、副语言和环境状态进行联合推理,生成运行时指令(如调整 VAD 阈值、响应语速),并最终将新交互写回线程结构。
在真实语音应用和基准测试中: - 语速对齐误差降低 52.4%; - 丢包场景下误中断率从 46.0% 降至 0.9%; - 网络导致的模型使用成本降低 79.2%; - 长会话中每轮成本最高降低 24.9 倍,同时保留 98.7% 的答案质量。
本文通过显式建模语音上下文并引入可扩展的编排机制,显著提升了 LLM 语音服务的交互质量和长会话经济性。
日语搜索查询的拼写纠正面临四个书写系统(拉丁/罗马字、平假名、片假名、汉字)共存的问题,每种脚本的错误模式不同(如flick键盘与QWERTY错误不同、汉字IME转换同音字错误)。此外,音乐实体名称常混合多种脚本,用户可能用不同于目录条目的脚本进行搜索,需要系统处理所有脚本且延迟要低。
通用扰动(删除、重复、换位、空格移除)。
训练数据脚本规范化:将混合脚本的目录标题按固定优先级(片假名>平假名>拉丁>汉字)规范化为单一脚本后再生成错误,使模型学习'纯脚本错误→纯脚本纠正'的一致映射,减少幻觉(实验表明无此步骤会降低EM/CER)。
紧凑的seq2seq架构:使用自定义byte-level BPE tokenizer(词表50,000,在音乐目录上训练),6层BART(3 enc+3 dec),隐藏维度768,推理延迟<4ms,在质量接近LLM的同时延迟低两个数量级。
论文通过脚本感知的数据增强和规范化,用小型BART模型实现了快速且准确的日语多脚本拼写纠正,展示了数据质量可以弥补模型规模。
GhostWord 提出了一种针对自动语音识别(ASR)系统的词级、时间局部化的后门攻击方法,旨在克服现有短语级后门攻击容易被简单预处理防御(如语音活动检测、标签频率统计)检测和缓解的缺陷。
GhostWord 通过词级、时间局部化的触发设计,显著提升了ASR后门攻击的隐蔽性和鲁棒性,揭示了现有防御在ASR场景下的局限性。
现有音频LLM基准(如Wang et al., 2024;Ao et al., 2024)只衡量理解与对话质量,未评估语音模型在心理健康场景下对脆弱用户的回应是否具有关系温暖(relational warmth)。语音界面被高风险人群(独居老人、急性困扰者)过度使用,而温暖缺失可能导致“温暖介导的伤害”(warmth-mediated harm),如过度依赖、拟社会依恋、替代人类求助等,此类失败模式在纯文本探针中不可见。
首次强制通过对比音频/文本模态、结合韵律分析与听者研究,揭示语音LLM在心理健康对话中可能产生温暖介导危害的系统性缺口为构建更安全的语音交互智能体提供重要审计视角。
现有口语对话模型(SDM)只生成语音无动作;共语动作生成模型仅从音频生成动作。级联方法需要先完成语音再运行动作模型,导致两次推理,无法联合优化。
Motion-Omni通过端到端联合训练和可扩展数据管道,实现了语音与全身动作的高质量同步生成,兼具实时性与低字错误率,是该领域的突破。
Omnimodal Large Language Models (Omni-LLMs) 在融合音频、视频和文本时,容易产生跨模态幻觉(cross-modal hallucinations),即一个模态的信息不恰当地影响了对另一个模态的预测。现有训练无关的 decoder 方法(如 AVCD)通过扰动调节模态影响,或(如 MAD)基于相关性加权,但都未显式评估联合(audio-visual)分支内部预测的兼容性。联合分支的差异可能代表破坏性干扰,也可能代表有用的互补性,因此需要同时评估差异的大小和是否可干预。
本文提出 Conflict-Aware Decoding (CAD),一个无需额外训练的解码框架,由两个阶段组成: 1. Potential Conflict Magnitude Estimation (PCME):使用无符号的得分 C 量化音频-视觉之间潜在冲突的大小,以及联合预测偏离相关性加权的单模态参考的程度。 2. Conflict Actionability Assessment (CAA):基于查询相关性和回答决定性,在任务空间上应用 Dempster-Shafer 可靠性折减,通过简单支持质量表示承诺支持和无知,判断是否应进行干预。 当识别出可行动的冲突时,CAD 选择性地将解码权重从联合分支重新分配给单模态分支,结合所有四个分支的 logits 生成最终输出。
在 CMM、AVHBench、WorldSense 和 VideoMME 基准上,使用 Qwen2.5-Omni-7B 和 OmniVinci 等 backbone 进行评测,CAD 持续优于 base decoder、AVCD 和 MAD。具体来说,在 Qwen2.5-Omni-7B 上,CMM 和 AVHBench 的总体准确率分别提升 14.1 和 8.0 个百分点;在 OmniVinci 上分别提升 4.1 和 6.9 个百分点。CAD 完全无需模型重新训练。
基于冲突感知的解码框架,能够有效区分有害干扰与有益互补,从而在多种 Omni-LLM 上显著抑制跨模态幻觉。
生成式语音增强(SE)中的自回归语音令牌模型虽然能利用学习到的干净语音先验生成自然语音,但可能产生幻觉内容,即生成的语音与输入观测不一致。确定性 SE 保留了与观测相关的证据,但往往残留噪声或局部失真。现有方法主要改进输入条件,但未显式调节解码过程,导致模型可能偏向先验而不是观测支持的假设。
本文提出一种证据锚定的生成式语音增强框架,将确定性估计视为不完美的观测耦合证据,而非最终结果。主要创新包括: - Whisper-guided DPRNN:使用冻结的 Whisper 编码器表示引导 DPRNN 增强主干,输出增强波形。 - 观测稳定化:将增强波形与原始观测混合后再进行令牌化,保留观测信息。 - Code-Space Grounding (CSG):利用有限标量量化(FSQ)令牌的分解码空间几何,根据候选令牌与证据令牌的汉明距离惩罚候选,从而在不强制硬匹配的情况下构造观测支持的锚定轨迹。 - SNR-Conditioned CSG (SNR-CSG):基于校准的残差 SNR 估计自适应选择话语级锚定强度,以匹配声学难度。 - Grounded Neighborhood Refinement with LLM ranking (GNR-LLM):在锚定历史条件下额外执行一次教师强制前向传播,将 LLM 的 top-K 候选与局部 FSQ 汉明邻域相交,选择概率最高的候选,从而在不引入额外可训练参数的情况下恢复局部生成灵活性并修正证据中的局部缺陷。
实验涵盖域内、受控 SNR 和 DNS 无混响条件,结果显示 SNR-CSG 提供了稳健的自动锚定,GNR-LLM 在低 SNR 下显著提升感知质量,且不损害内容保真度。
通过将确定性证据的码空间几何与自回归 LLM 解码相结合,实现了内容保真与自然度的良好平衡,是一种新颖且有效的低幻觉生成式语音增强方法。
原生 Omni 模型扩展 VLM 时,需要为每个新骨干网络引入专用音频编码器并进行昂贵的多模态重对齐训练,且训练可能削弱原有视觉、推理等能力;音频的时序稠密性和噪声特性也使其难以可靠整合。
提出 Training-Free Omni (TFO),一个即插即用框架,将任意冻结的 VLM 转换为以语音为中心的 Omni 模型,无需修改架构或训练。TFO 使用 Whisper 提取带时间戳且经过置信度过滤的转录文本,仅通过 VLM 的语言接口注入语音证据,完全保留视觉通路。可选地,TFO 使用 CosyVoice3 将文本回复合成语音,用于口语输出。
在 56 个基准和 21 种语言的系统性匹配比较中,TFO 在语音为中心的音频-视觉理解上与原生 Omni 模型竞争力相当;在所有模型设置下,音频-only 和跨语言语音理解平均显著提升;同时,TFO 保留了原始 VLM 更强的图像/视频理解、视觉接地、代码、数学推理和医学问答能力。但在非语音声学(音乐、环境音)等任务上受限于转录路由,性能有限。
TFO 证明了通过模块化的音频-语言路由,而非昂贵的骨干专属训练,即可获得强的语音为中心 Omni 理解能力。
现有音频语言模型基准主要评估识别、描述和问答能力,缺少对专家级分析性反馈(identification, diagnosis, correction)的评估。在声乐教学场景中,模型需要不仅能描述演唱质量,还要能指出具体问题并提供可落地的纠正建议,但现有基准均未覆盖这一点。
论文提出 VocalCoachBench,首个面向歌唱教学专家反馈的音频语言模型基准。核心设计包括: - 双子集结构:同歌曲子集(受控比较)和多样歌曲子集(丰富场景+片段级反馈); - 分层标注:18位专业声乐教练提供Top-3问题排名、自然语言教练评论、受控三元组排序及时间戳段反馈; - 混合评估:将开放性专家反馈拆分为确定性结构化任务(三元组排序、Top-3问题标签、片段级分类)和基于原子性主张的开放式诊断/纠正评估,以处理专家间部分对齐的问题。
12个近期音频语言模型结果显示:模型在比较演唱、识别宽泛问题域方面有基本能力,但细粒度问题标签识别(Top-3)低于标签先验基线,严格的诊断对齐率低于7%,表明模型在真正专家级反馈理解上存在显著不足。
VocalCoachBench 开创性地将音频语言模型评估从“描述音频”推向“提供专家级分析性反馈”,并为歌唱教学领域的可复现评估奠定了重要基准。
Start, Silence, Listen, Submit, Accept, Reject,形成串行决策过程:先判断语义完整性(Listen→Submit),再执行拒绝(Submit→Accept/Reject),从而解耦异构任务。pθ(St|A≤t, St−1),而非全历史 `S核心痛点:现有神经语音编解码器(如 XCodec)主要以压缩和感知重建为目标,采用残差矢量量化(RVQ)产生多流离散 token,但未考虑自回归语言模型的建模需求。导致生成的语音 token 序列缺乏时间一致性和可预测性,且其统计分布与文本 token 的 Zipf 分布存在显著偏差,加大了 LLM 在处理语音时的学习难度。此外,语音 token 的帧率远高于对应文本(如 XCodec 为 50 Hz),进一步阻碍跨模态对齐。
方法创新: - 提出 ARDDS 框架(Autoregressively Regularized training with Different Downsampling rates Strategy),显式地将自回归兼容性融入 codec 训练过程。 - 引入自回归正则化项:在 codec 训练时,通过辅助自回归解码器添加下一 token 预测目标,引导生成的 token 序列适应 LLM 的自回归学习范式。 - 提出异构下采样策略:对捕获语义信息的第一层 token 采用较低采样率,而对声学层保持较高采样率,从而将整体 token 速率降至 6.25 Hz,使语义 token 的时间粒度更接近文本 token,改善语音与文本模态的对齐。 - 该方法是模型无关的,可集成到多种现有 codec(如 Encodec、XCodec 等)中。
实验结果:论文在多个基准和多种代表性 codec 上进行了广泛实验,表明该方法能在不牺牲压缩质量的前提下,显著提升语音 token 的生成质量、统计特性以及下游 LLM 语音建模和生成任务的性能。由于输入内容截断,未提供具体数值细节。
一句话评价:本文创新地将语音 codec 的目标从“压缩”重构为“生成”,通过自回归正则化与异构降采样弥合了语音 token 与 LLM 之间的鸿沟,是面向语音语言模型的高质量 tokenizer 设计。
该文提出 DAS (Disentangled Acoustic-Semantic Fusion) 框架,用于缓解音义冲突,由三个模块组成: 1. 异构特征提取:分别用音频 tokenizer(如 EnCodec)提取低维声学表征,用预训练语义编码器提取高维语义表征。 2. 高能量嵌入选择:挑选最具区分性的嵌入,抑制无关信息。 3. Q-Former 组合模块:使用跨注意力机制动态融合两路特征,以适应冲突条件下选择可靠线索。
同时构建 TWIN-SER 基准:通过 LLM 辅助生成冲突话语,用 TTS 合成音频,经人工校验获得 378 个高质量多语言、多说话人冲突样本。
该工作首次系统研究音义冲突下的 SER,构建了专属基准并提出解耦融合框架,为鲁棒情感识别提供了新思路。
本文通过一个真实世界社区口述历史案例,实证检验了Whisper在代码切换环境下的效能,为遗产语言社区使用开源ASR提供了宝贵数据和经验。
传统的 Griffin-Lim 算法(GLA)及其低延迟变体在相位重建时需要高迭代次数或存在语音质量下降问题;基于神经网络的 vocoder(如 BigVGAN、Vocos)虽质量高但多为整句处理,算法延迟高(>32 ms),难以用于实时对话。现有低延迟方案(MelFlow 等)仅支持 Mel 系数且多为宽带语音,缺乏对幅度谱输入的适应性及全带支持。
提出 EffVOC,一种因果、低延迟(20 ms 算法延迟)的语音波形重建模型,支持多种输入(幅度谱或 Mel 系数)与带宽(宽带 16 kHz / 全带 48 kHz)。模型结构基于混合卷积-循环设计:2 层因果卷积 + 2 层 LSTM + 4 层转置卷积(每层后接残差块),并采用权重归一化。通过调整转置卷积的 stride 和 kernel 匹配不同采样率,在统一框架下实现了对两种输入表示的系统性比较。
EffVOC 以极低延迟实现了高质量、多表示的语音重建,为实时语音合成和编码提供了新的 SOTA 方案。
本文清晰揭示流式 ASR 中标签泄漏如何制造虚假 trade-off,并提供一套因果监督的实用训练配方,用一个统一小模型同时完成转写、端点检测与上下文感知。
音乐源分离(MSS)被用于音乐学研究(如测量微计时和动态),但评估指标 SDR 不反映感知时间位置(p-centre)相关的信号属性(如攻击和包络),导致分离结果可能损害 rhythm 研究中的测量有效性。
提出双族评估协议,同时使用开发者指标(BSS-Eval SDR、SI-SDR)和分析者指标(onset F-measure、动态描述子、标记精度),在 MUSDB18-HQ 基准上评估四代架构(Spleeter、HT-Demucs、BS-Roformer、SCNet-XL)。核心假设为:(A1) 每个模型对动态轮廓施加系统性偏差;(A2) 输入长度改变攻击渲染(注意力模型更敏感);(B3) SDR 排名与分析相关保真度排名不一致。
本文揭示了 SDR 无法作为节奏相关信号属性的代理指标,选择分离器和输入条件会显著影响下游分析,呼吁在节奏研究中报告并固定这些变量。
交互式语音代理对首个音频帧延迟(TTFA)和扩展成本要求极高。现有自回归TTS模型多采用复杂专用解码器,难以在标准LLM服务引擎(如vLLM)上高效运行,因为自定义操作破坏了连续批处理和PagedAttention机制,导致吞吐量大幅下降。
GEPARD是一个多语言、流式TTS模型,其核心原则是:计算骨干保持为标准全注意力Transformer,所有非标准组件移到prefill阶段或离线蒸馏进权重。具体创新包括: - vLLM原生架构:无自定义内核,兼容标准vLLM引擎,支持连续批处理和高吞吐。 - 声音克隆作为前缀:零样本声音克隆由Q-Former提取一次,不参与逐步解码。 - 短序列抗崩溃:通过文本重复增强解决解码器在1–2词输入上的死循环或跳词问题。 - CFG蒸馏:将两遍分类器无关引导(CFG)的收益通过DPO蒸馏进单遍模型,消除了推理时的双遍开销。 - GroupFSQ编解码器:使用NanoCodec的GroupFSQ方案替代RVQ,各通道独立,支持单步生成整帧音频码,避免深度transformer等垂直结构。
GEPARD证明了在不修改vLLM源码的前提下,标准LLM架构也能实现高吞吐的实时对话TTS,为TTS与LLM基础设施融合提供了系统级解决方案。
语音AI客户服务系统(如退款、账单争议等)是多轮、有状态、工具调用的,且能感知用户的口音、情绪、流利度等呈现线索。现有公平性和安全性评测主要覆盖ASR错误率差异、口语对话偏见或能力基准,缺乏以「服务会话」为单位的审计,忽略最终拒绝前可能出现的额外负担(如修复轮次、认证摩擦、升级延迟),也未区分不同架构(端到端S2S、级联ASR-LM-TTS、混合工具中介)。
本文提出验证门控审计框架,主要贡献包括: - 以服务会话(service episode)为分析单元,而非单句或转写; - 区分三种架构并给出各自的审计面和最小审计要求; - 定义7个验证门(场景锁定、事实不变性、人设可感知性、声学有效性、编解码规范化、伪影完整性、注解可靠性); - 提出6族指标(最终结果、修复轮次、认证摩擦、升级延迟、贬低分数、工具使用平权、声学适应)和声明边界矩阵。
框架通过证据链(claim template → locked scenario → stimulus → validation gates → audit runner → artifact gate → metric extractors → coding → paired analysis → public claim)管理推断有效性;未通过门控的实例仅可用于工程诊断,不能用于推断性声明。
论文属于方法论release,明确表示不包含生产系统结果,公开报告需满足验证协议。仅给出一个完全合成的退款争议审计实例作为演示,实证数据暂未公布。
该研究为语音AI客服公平性与安全审计提供了系统且严谨的方法论,强调“最终结果之前的过程负担”和架构特异性,填补了多轮工具型语音Agent在公平性评估上的空白。
大规模房间脉冲响应(RIR)数据因高采样率和长时长,存储开销巨大。现有低秩近似方法(如GLRAM)和截断/阈值策略难以兼顾高压缩比与声学关键特性保留;而直接使用面向通用音频的神经编解码器(如EnCodec)进行RIR压缩,因其训练目标不匹配RIR独有的结构特性,重建质量有限。
提出一种基于EnCodec骨架的神经RIR压缩方法,引入双层级联的结构感知约束: 1. RIR层级约束: - 能量衰减曲线(EDC)损失:基于Schroeder反向积分计算对数EDC,在有效衰减区间(-35 dB截止)内最小化参考与重建EDC的均方误差,保护全局混响衰减行为。 - 局部能量损失:通过50 ms非重叠窗口计算局部能量差,约束直接声、早期反射和晚期混响各阶段的时间能量分布。 - 此外沿用对抗训练(MS-STFTD、MPD、MSD)+特征匹配损失+量化损失,增强波形重建质量。 2. 混响语音层级约束: - 将干净语音分别与参考RIR和解码RIR卷积生成混响语音,在时域(MSE)和多尺度Mel谱域(L1+L2组合损失)上约束二者一致性,提升下游任务中混响语音感知保真度,并间接优化RIR编码。
模型采用单码本向量量化器,通过设置编码器下采样倍数(4,4,5,8)与码本大小,实现低比特率压缩。
在Motus真实RIR数据集(24 kHz)上,所提方法在仅375 bps的极低比特率下,取得最低的T60重建误差(相比音频导向编解码器基线),且重建RIR生成的混响语音ViSQOL得分最高(4.11),优于对比的音频编解码器。
该工作针对RIR特有结构设计多层级感知约束,证明了将声学先验注入神经编解码器可实现高质量低码率RIR压缩,对空间音频存储与实时渲染具有实用性。
一个免对齐、可扩展的统一扩散语音生成框架,通过大规模预训练与任务微调,在跨语言配音和全双工对话合成上实现接近人类的水平。
患有唇腭裂(CLP)的个体在自动语音识别(ASR)中面临显著挑战,因为病理语音数据有限,且语音特征在不同说话人和严重程度之间差异大。传统和预训练ASR系统在这些语音上性能差距大,且云服务在边缘场景可能不可用。
本文提出了一种严重程度感知的、可在边缘设备部署的ASR框架,基于Whisper-small进行微调。微调时混合不同比例的Normal、Mild、Moderate、Severe CLP语音,训练了NO、NOMI、NOMIMO、NOMIMOSE和CLP-only五种配置。模型在NVIDIA Jetson上进行FP16推理,评估识别性能、公平性和计算效率。
该工作证明了在ASR自适应中纳入严重程度多样性可以显著提升CLP语音识别效果,同时减少不同严重程度组间的性能差异,并在边缘设备上实现低延迟、无需互联网的语音交互。
传统音频深度伪造检测(ADD)通常将音频视为单一域整体,进行片段级二分类。但在真实世界中,伪造音频往往呈现混合真实性(mixed authenticity),即真实与伪造线索在同一音频中同时存在,可能跨越时间过渡、重叠声源或两者兼有。现有方法难以适应这种复杂场景:单域检测器在跨域输入时不可靠,固定流程的分离与检测步骤可能引入伪影,而直接用音频大语言模型(ALLM)作分类器又缺乏可解释性和对专家工具的利用。
在提出的基准上,ToolDF 在复合类型检测中取得最佳整体性能,宏 F1 比最强的单体基线提高 3.72 个百分点,比固定流水线提高 14.39 个百分点;同时提供了定位到时间区域和声源的可解释证据。
ToolDF 首个将工具集成推理与 ALLM 结合用于混合真实性音频伪造检测,通过动态调用专家工具实现精准且可解释的判决。
机构: Kyushu University, Fukuoka, Japan
该研究首次通过实测脉冲响应全面验证了紧框架心形麦克风阵列在宽带(50 Hz – 20 kHz)下的声源方向估计性能,证实了TF24和短间距配置的优势,为声学强度方向估计提供了高效且稳健的解决方案。
单通道源分离通常采用时频实数增益掩蔽,但该格式存在未明确声明的几何约束:给定一个时频点的混合值 x 与源值 s,实数增益 m 的输出只能位于直线 ℝx 上。因此该格式无法完全表示源,其固有残差由源与混合之间的角度决定,任何估计器(即使是最优的)也无法消除这一残差。现有被用作基准的 oracle 掩码,如理想比率掩码(IRM)和 oracle Wiener 滤波器,并不是该格式的真正最优解,它们比定类的真实天花板低数个 dB,因此无法作为该格式上界的可靠参考。
本文精确刻画了时频实数掩蔽的几何天花板,揭示出“离开该格式”与“最小化均方误差”之间的根本矛盾,为单通道分离提供严格的理论边界和实用的估计框架。
当前中文多方言语音处理缺乏统一、公共、可复现的评估平台,不同研究使用的方言集合、训练资源和评测集各不相同,导致难以公平比较。
本文发布了 ChinaVoices Challenge 2026 评测基准,覆盖 16 个中文方言类别,定义了两个共享相同音频的任务:多方言识别(Multi-dialect Identification)和多方言语音识别(Multi-dialect ASR)。数据分为 Reference Set(每方言约3小时)、Open Evaluation Set(约7小时)和 Hidden Evaluation Set(约10小时),共计约320小时,且三者说话人不相交,转写为人工校验。每个任务包含 restricted-data 与 open-data 两个赛道。基线基于 Qwen3-ASR-1.7B,通过 ms-swift 将方言标签与文本输出统一为条件生成目标;参赛系统则多采用方言判别声学表征、数据增强和辅助 CTC 目标等方法。
共有 28 支队伍提交,17 支提交系统报告,15 支通过合规审查。识别任务中所有合格系统均超过基线 ACC 53.62%,第一名 scy919 达到 ACC 83.19%;ASR 任务中 9/11 合格系统优于基线 CER 18.10%,第一名 TeleASR 将 CER 降至 11.08%。官方前三名在 Hidden Evaluation Set 上排名保持不变。
ChinaVoices Challenge 2026 为中文多方言识别与 ASR 建立了统一、可复现的评测基准,实验结果验证了当前系统在方言鉴别和转写方面的显著进展,同时也表明两者需要差异化的建模策略。
现有语音超分辨率(SR)方法存在以下关键问题: - 波形域方法难以建模长序列,且多为非因果结构,不支持流式推理。 - 频谱域方法(如梅尔谱或STFT谱)依赖声码器或显式相位预测,增加系统复杂度并阻碍端到端优化。 - 实际通信和交互场景要求零前视(zero-look-ahead)低延迟推理,但多数方法无法满足。
提出 StreamWSR——一种轻量级全因果波形域语音SR模型,核心创新包括: 1. 全因果架构:使用步进因果卷积、因果转置卷积和因果注意力,支持零前视流式推理。 2. 紧凑帧级表示:将输入波形降采样为帧级特征,降低建模复杂度,并通过残差连接恢复高频细节。 3. 因果长短期建模块:结合因果膨胀卷积(局部建模)和掩码多头自注意力(长程历史依赖),在因果约束下有效建模。 4. 无需声码器和显式相位预测:直接在波形域进行端到端生成,频谱监督仅用于训练,不增加推理成本。 5. 多分辨率频谱对抗训练:引入多分辨率MDCT判别器和频谱重建损失,提升感知质量和频谱保真度。
StreamWSR 以极低的计算开销实现轻量级流式波形域语音超分,兼顾性能与实时性,为通信场景提供了一种高效端到端方案。
表达性语音系统在合成前会决定如何表达一句话(情感、音高、能量、语速等),但这一决策通常隐藏在最终波形中。下游音频评分难以判断该决策是否真正基于源文本/源记录(source record),模型可能“因错误的原因而听起来正确”。现有评估缺少对合成前规划环节的可问责测量。
VoxReason 将合成前的语音规划建模为源引用语音规划(source-cited speaking plan)预测任务:给定源记录,系统输出带有证据引用的表达字段(情感、意图、韵律等),并由一个确定性验证器(deterministic verifier)检查:1) 引用合法性;2) slot 一致性;3) 不支持状态;4) schema 有效性;5) 单线索反事实局部性(one-cue counterfactual locality)。该方法无需听者,在波形生成之前即可评估源的使用。论文设计了受控 source-label 测试平台,固定文本,改变许可线索,检验规划是否真正跟随源记录而非记忆模板。
VoxReason 通过“源引用规划 + 确定性验证器 + 反事实局部性”在合成前无听者地测量语音规划对源记录的真正依赖,揭示了普通 slot accuracy 的虚假安全感,为表达性语音评估提供了新的可问责方向。
传统说话人属性ASR将语音识别和说话人日志分离,且现有端到端统一模型主要支持离线识别,难以满足实时语音助手和智能体的低延迟需求。流式ASR需要保留历史信息以维持说话人身份一致性,但此前方法多用于单说话人场景,多说话人流式识别仍需额外组件。
本文提出 VIBEVOICE-ASR-STREAMING,一种基于LLM的端到端流式说话人属性ASR方法。核心思路是将音频块与生成的说话人标注文本交错输入模型(格式为 [X1,Y1,X2,Y2,...]),并采用固定大小音频块(2.0s或2.9s)加0.5s lookahead,使模型能在语音到达时直接输出“谁说了什么”,无需独立日志模块。模型复用了VibeVoice的预训练双tokenizer(声学tokenizer和语义tokenizer),并基于Qwen2.5作为LLM骨干。训练时保留完整的历史上下文,说话人标签按首次出现顺序分配并在后续引用中复用。发布1.5B和7B模型权重及推理代码。
7B模型在五个评测集(AliMeeting, AISHELL-4, AMI-SDM, AMI-IHM, MLC-Challenge)上平均WER/CER最低;在13个评估设置中的12个取得最好或并列最好的说话人属性错误。相比Gemini 3.5 Transcribe Live、GPT Realtime Whisper、GPT Live Transcribe、ElevenLabs Scribe v2 Realtime等系统,识别错误率显著降低。
本文率先探索了基于LLM的流式说话人属性ASR,通过交错音频块与文本生成,实现了高准确率低延迟的实时多人对话转录,并开源权重与代码。
Existing public datasets rarely provide synchronized RF and acoustic measurements acquired at identical indoor positions with accurate ground-truth, which limits the development and benchmarking of multimodal indoor positioning algorithms.
This work presents ARFT (acoustic-radio fusion in Techtile), a synchronized multimodal dataset collected in the Techtile testbed. An ultrasonic speaker and an RF antenna are co-located on a rover, while 42 ceiling-mounted antennas capture RF CSI and 91 distributed microphones record ultrasonic chirps. The dataset spans 5011 spatial positions over a 5.57 m × 2.89 m area, with each cycle containing synchronized ground-truth position, acoustic waveform, and RF snapshot. The release includes acquisition scripts, parsing code, and a notebook-based analysis pipeline to support RF-only, acoustic-only, and joint positioning workflows.
The paper reports detailed acquisition settings and coverage statistics. A static acoustic positioning pipeline involving anchor selection, pulse-compression ranging, and least-squares localization is elaborated as a usage example. The dataset is designed to enable reproducible benchmarking, though specific positioning accuracy results are not presented in the excerpt.
ARFT provides a valuable synchronized RF-acoustic dataset for indoor positioning, facilitating research on multimodal fusion and distributed sensing.
VAANI噪声事件时间戳数据集填补了真实情境下自发多语言语音与噪声事件本身级时间标注的空白,为噪声鲁棒ASR、声音事件检测及语音增强提供了高匹配度的资源。
该研究精细刻画了耳塞骨导语音振动的频谱与空间结构,为耳塞硬件设计、传感器选型和信号处理算法提供了扎实的工程指导。
该论文针对现代文本到语音(TTS)基金会模型在微调过程中可能泄露私有语音数据的隐私风险,首次系统性地研究了针对微调TTS模型的黑盒成员推理攻击(MIA)。主要挑战有两方面: - 查询生成(Query Generation):TTS模型通过文本和参考语音双重条件生成语音,导致查询空间大且缺乏设计标准。 - 表征工程(Representation Engineering):语音具有多层级特征和时序可变性,单一低层声学表示(如Mel谱、MFCC)无法捕捉成员信号,且生成音频与目标音频长度不一,难以直接比较。
这是首个针对细粒度TTS模型的黑盒成员推理攻击系统,创新地对双条件查询和多层级语音表征进行联合设计,揭示了微调TTS模型存在严重的隐私泄露风险。
当前大型音频语言模型(LALMs)虽然能描述音频内容,但缺乏对事件发生时间的精确感知与定位能力。这一能力对于会议导航、音频取证、内容审核、音频编辑等实际应用至关重要。现有基准(如MMAU、MMAU-Pro、MMAR)主要评估整体理解与推理,未系统评估时间戳定位能力。已有的音频时间定位资源(如AudioTime、TACOS)局限于短音频片段,且未覆盖one-to-many(一对多)场景,也没有统一的LALM评估协议。
TAG-Bench提出了一个多粒度、源多样的时间音频定位基准,包含1,750个人工验证的查询-录音对,共149.5小时音频,划分为8个子集,覆盖单词、声学事件、声学描述、语义、模糊语义、情感以及长达20分钟的长音频。其中22.1%的查询具有多个真值时间区间(one-to-many),并引入了计数准确率(count-accuracy)诊断指标,以解耦“找到所有出现”与“精确定位边界”的评估。构建流程采用自动预标注(如PANNs、Whisper)与人工验证、质量控制相结合,确保标注质量。评估协议统一处理自由格式输出,报告解析失败率与MAE覆盖率,并将解析失败计入主要定位指标(mIoU、Recall、gIoU和计数),但不计入MAE。
研究评估了21个系统,包括通用音频LLM(如Audio Flamingo系列、Kimi-Audio、MiMo-Audio、Step-Audio等)、omni-modal系统(如Gemini-3.1-Pro)和时间感知专家模型(如LAT-Audio、TimeAudio)。结果显示: - 最佳模型仅达到31.2 mIoU,且是唯一在两个长音频子集上超过20 mIoU的系统,但在IoU≥0.7时召回率仅21.5%。 - 9/21个系统mIoU低于5,所有模型在one-to-many查询中严重低估事件出现次数,最高计数准确率仅13.2%。 - 实验揭示了精确边界定位、事件完整枚举和输出格式可靠性三者之间的分离。
TAG-Bench是首个系统性评估LALM时间音频定位能力的基准,暴露了现有模型在精确定位和完整枚举上的显著不足,为时间感知音频理解提供了关键诊断工具。
基准构造并非受控因子实验,跨子集的差异为描述性结果,不能推断查询抽象度或上下文长度的因果效应。
开放式助听器因物理通气孔导致声学泄漏,外部噪声会泄漏至耳道,严重降低传统双耳语音增强(BSE)的性能。此外,现有BSE多假设封闭式助听器,无法处理泄漏;而传统的主动噪声控制(ANC)+BSE方案需要将误差麦克风置于耳道深处,在实际佩戴中难以实现且不舒适。
提出 ABSE-NET,一个轻量级主动双耳语音增强框架,级联 BMVDR 波束成形器 与 轻量级神经网络(LNN): - BMVDR 负责粗粒度 BSE,保留空间线索; - LNN 作为后置滤波器,同时消除声学泄漏并补偿 BMVDR 引入的语音失真; - LNN 采用编码器-解码器结构,内部包含 频率-时间依赖学习(F-TDL)块 和 卷积注意力(ConvAtt)块,有效精炼潜在表示; - 无需耳内误差麦克风,训练阶段使用误差麦克风建模,推理时仅依赖外置麦克风信号。
实验验证了 ABSE-NET 相比现有最先进方法(SOTA)的优越性,尤其在计算效率方面表现突出。具体量化指标在截取内容中未完全展示。
ABSE-NET 首次实现了无需耳内麦克风的轻量级主动双耳语音增强,巧妙结合模型驱动与数据驱动方法,兼顾性能与部署可行性。
主流音频分类流程要么依赖紧凑的人工设计摘要,要么依赖如log-mel的固定时频前端进行深度建模。这些表示虽有效,但未显式暴露底层发声事件的物理动力学。不同声学事件(如风、蒸汽湍流、机械嗡鸣)可能频谱重叠,但激发、耗散、周期性、冲击性等物理机制迥异,需更丰富的描述符来区分。
提出MADS(Multi-view Acoustic Descriptor Set),一个19维物理信息描述符集,统一编码频谱、时间、机械和随机结构。它从四个互补视角建模音频: - 机械描述符:通过离散速度、加速度和有效质量,量化动能熵、能量相位相关、机械效率和机械不稳定性指数,刻画耦合、耗散和不稳定性。 - 频谱锚点:包括频谱锚I-III、耗散极限、共振扩展和峰值模式,概括粗糙频谱包络、主共振和有效带宽。 - 时间动力学:包含攻击梯度、阻尼系数、时间抖动和脉冲密度,描述起始行为、粗糙度和显著激发事件的密度。 - 随机性与一致性:熵流、冲击峰度、ZCR变异性、周期强度和PDE残差,量化有序性、不规则性、宽带性和周期性。
现有目标声音提取(TSE)系统通常基于固定的类标签进行条件化,无法处理环境声音固有的层次化本体结构。它们不能灵活地在一个模型中以不同粒度提取声音(例如从细粒度'猫'、'狗'到高层'动物')。
本文提出Ontology-based TSE,一种新的任务设定:单一模型在声音本体树的任意层级提取声音。具体包括: - 定义一个可学习的类别嵌入表,覆盖AudioSet派生本体中的所有节点; - 引入Cophenetic Correlation Coefficient (CPCC)损失,使嵌入空间中的成对距离与本体树中最短路径距离保持一致; - 探索多热(multi-hot)和全本体独热(full-ontology one-hot)等多种条件化策略,实现单次前向传播即可提取任意本体层级的声音。
在合成数据集(基于FSD50K、LibriSpeech、SynthSOD、MoisesDB)上评估,发现: - 使用CPCC正则化的多热条件化方法在Root、Intermediate、Leaves三个层级均取得最佳SI-SNR提升(Root: 6.43 dB, Interm: 6.66 dB, Leaves: 7.10 dB),优于无正则化基线和叶级提取+聚合方法。 - 全本体独热略逊于多热,但同样受益于CPCC。
首次将本体结构显式建模到TSE的嵌入空间中,用CPCC损失实现了层次感知的单次提取,为灵活的声音分离提供了新思路。
U-PAST以紧凑的Transformer-U-Net架构在复数频谱域实现了高效的全局建模,在多种失配条件下表现出色,是语音增强领域一个兼具性能与效率的创新方案。
论文针对基于码本的语音语言模型(如TTS)在采用强化学习(RL)优化主观感知奖励(如自然度、拟人风格、喜好度、唤醒度)时,容易产生与人类感知不一致的问题。具体表现为:学习到的感知预测器可能被利用其盲点,导致生成语音在客观指标上得分高,但实际听感差、转录不准确或不稳定。
该论文系统性地研究了码本语音语言模型中基于预测器的RL何时与人类感知对齐,提出了CER区域约束与诊断工具,并通过多层级证据揭示了主观奖励优化的局限性与适用条件。
CoJEPA通过巧妙结合对比学习和JEPA的互补优势,在不增加参数和去除EMA的前提下,实现了更稳定和更丰富的音乐表示学习。
现有生成音乐系统评估主要集中于输出质量(如FAD、KL、CLAP分数)和开放性(如MusGO框架),但缺乏从音乐家实际创作需求出发的系统性比较,尤其是在模型的可适配性、可用性和可控性方面。这导致音乐家难以在早期阶段选择合适的生成模型。
论文提出MusGU+(Music-Generative Usable+ AI),一个以音乐家为中心的评估框架,围绕三个核心维度: - Adaptability(适应性):模型是否能够通过个人数据进行训练或微调。 - Usability(可用性):模型能否集成到现实音乐工作流程中。 - Controllability(可控性):模型能否以音乐上有意义的方式进行控制。
该框架借鉴了MusGO的复合分级评估方法,但将重点转向音乐家的实际使用,并支持模型间的系统比较和早期发现。
论文对10个代表性生成音乐系统进行了评估,并开发了一个交互式发现工具(https://lauraibnz.github.io/MusGU-plus/),允许音乐家根据评估标准探索、比较和筛选模型。该工具旨在成为活的资源,支持社区持续更新和讨论。
MusGU+为生成音乐AI提供了首个以音乐家为中心的实用评估框架,弥补了开放性与传统质量评估之间的空白,促进了生成系统在实际创作中的知情采用。
传统的神经形态音频编码器(如 Lauscher)计算复杂、能耗高,难以在 FPGA 等数字硬件上高效实现;同时,编码器与下游 SNN 分类器往往独立优化,导致整体神经形态语音识别系统性能与能效不佳。
本文提出一种非学习的、高度可编程的 HLP(High-Level Programmable)耳蜗编码器,采用对数间隔的 Butterworth 带通滤波器组,经整流后输入 LIF 神经元生成脉冲。该编码器与后端 SNN 分类器进行联合优化,实现了端到端神经形态语音识别流水线。编码器可复用、跨任务泛化,且计算简单、易于 FPGA 实现。
该工作通过联合优化编码器与分类器,实现了高效、硬件友好的神经形态语音识别,并刷新了基准性能,为低功耗听觉处理提供了新思路。
LLM-based ASR系统在常规语音数据上表现优异,但在挑战性条件下(如代码切换、指令注入),语言先验可能覆盖声学证据,导致幻觉输出,例如意外翻译、指令执行、重复或灾难性删除。
提出Likelihood-Constrained Acoustic Reranking (LCAR),一种无需训练的解码方法。LCAR在每一步仅保留基础模型似然在贪婪token一定边际(δ nats)内的候选token,然后使用基于注意力池化的声学兼容性分数(通过现有LM头计算)对这些候选进行重排序。该方法无需额外训练、外部检测器、参考转录或辅助模型,δ=0时与贪婪解码完全一致。
在四个LLM-based ASR系统(Qwen3-ASR-1.7B, Qwen2-Audio-7B Base, Kimi-Audio-7B-Instruct, GLM-ASR-Nano-2512)上,使用人类审计的TTS和开源语音挑战套件进行评估。在δ=0.60时,LCAR移除了38.8%–57.1%的检测器识别的幻觉失败,同时在标准开源测试集上基本保持WER/CER。主要结果中,NetHIR在所有模型-套件对中均为正,范围从5.7到70.9个百分点。正常语音副作用极小,例如Qwen3的WER/CER变化为+0.002%/-0.034%。
LCAR是一种简单有效的训练无关解码策略,通过限制声学干预到模型支持的替代方案,显著缓解LLM-based ASR中的幻觉,同时维护正常语音识别性能。
流式语音增强(streaming speech enhancement)场景下,轻量级网络在训练时常采用相位感知的压缩 STFT 损失(phase-aware compressed STFT loss)。这种损失会引发“幅度-相位补偿效应”(magnitude-phase compensation effect):当相位预测不可靠时,网络倾向于压低对应频段的幅度,以减小损失值。这种现象导致中高频区域出现明显的能量衰减,损害语音的感知亮度。现有的解决方案(如额外添加幅度损失项)对全频带施加均匀权重,无法在噪声抑制与频谱保真之间取得理想平衡。
该论文通过设计频谱自适应损失函数和轻量级混合建模网络,有效缓解了流式语音增强中的中高频过衰减问题,为实时边缘部署提供了兼具性能与效率的解决方案。
传统射频接收机受限于热噪声灵敏度、Chu极限以及固定几何结构,无法满足6G网络对高精度感知和动态信道重构的需求。现有可移动天线(MA)和流体天线系统(FAS)虽提升了空间自由度,但仍依赖机械驱动或端口切换,且未突破电子前端的基本限制。
本文提出一种光学可移动里德堡原子量子接收机(Optically Movable RAQR),通过控制每个蒸气电池内的探测光和耦合光束的空间重叠位置,实现射频感测位置的动态重构,无需机械驱动。主要创新包括: - 等效基带模型:推导出闭式基带模型,将原子转换系数、光学转向相位和阵列响应显式分离,并验证了与Lindblad主方程数值解的一致性。 - 双信道整形机制:揭示了RF-光转换固有的波束模式整形与光学位移带来的每单元相位控制两种互补机制,可抑制用户间干扰。 - 优化框架:基于非凸和速率最大化问题,提出交替优化算法(解析梯度驱动),联合优化光学位置和本地振荡器设计。
仿真验证了所提模型的准确性,并展示了光学可移动性带来的显著性能增益,尤其在用户去相关方面优于固定位置架构。
该工作为未来无线网络提供了一种可编程、无机械移动的量子接收机新范式,融合了量子传感与无线通信。
深度伪造语音检测面临跨域泛化性能差的问题。尽管音频大语言模型(ALLM)展现出潜力,但连续音频嵌入与LLM语义空间之间的模态差距仍是关键且未充分探索的瓶颈。现有研究多将这一问题视为暴力参数优化,忽略了音频编码器的配置。
本文通过显式注入语言学知识驱动的声学文本特征,巧妙解决了LLM在深度伪造语音检测中的模态对齐问题,为泛化检测提供了新视角。
现代口语AI系统通常由语音增强(SE)、自动语音识别(ASR)和大语言模型(LLM)串联组成。SE作为预处理步骤,通常假设其不会对下游任务产生负面影响。然而,已有研究表明SE会引入ASR转录误差,但这些误差是否会传播到LLM的推理结果(如意图分类)尚不清楚。现有评估指标(如WER和音频质量指标)无法全面捕捉SE对LLM任务性能的影响。
本文提出输出分歧率(ODR),用于衡量相对于干净语音,语音增强导致LLM意图分类结果改变的比例。ODR定义为: [ \text{ODR}(C) = \frac{|{i: \hat{y}C^{(i)} \neq \hat{y}{clean}^{(i)}}|}{N} ] 其中(\hat{y}C^{(i)}) 是条件C下的预测意图,(\hat{y}{clean}^{(i)}) 是干净语音的预测意图,(N) 为有效样本数。
论文在SLURP数据集上构建了包含六种条件的基准(干净、噪声、MetricGAN+、回声模拟、回声+DTLN-AEC、去混响),使用Whisper large-v3和wav2vec2-large两个ASR模型,并用Gemini 2.5 Flash Lite进行77类意图分类。还定义了WER-ODR间隙(Gap)来度量LLM对转录误差的鲁棒性。
该论文首次系统地量化语音增强对LLM语音管道下游任务的影响,提出了新的评估指标ODR,并揭示感知质量与语义性能之间的脱节,对实际部署具有重要指导意义。
Tabla 打击乐转录(TST)对于分析印度斯坦音乐的节奏结构至关重要,但面临两个主要挑战:1)节奏组织复杂动态;2)强标注数据稀缺。现有方法严重依赖带有 onset 级标注的全监督学习,标注成本高昂且难以大规模扩展。
实验显示,与仅使用声学解码相比,ADRM 重打分带来了一致且显著的打击错误率降低,证实了在晶格重打分中融入符号节奏规律性的有效性。具体数值需参考论文完整内容。
本文是将弱监督序列学习与节奏语言模型成功应用于 Tabla 转录的开拓性工作,为打击乐转录的低成本标注和高质量识别提供了新思路。
现有生成音乐模型虽支持文本和音频条件控制,但缺乏对情感跟随性的系统评估。常用指标(如FAD、CLAP相似度)无法直接衡量生成音频是否符合目标情感。
提出统一评估流程:基于GTZAN全部1000首曲目,使用DashengLM提取语义描述,Music2Emotion提取效价-唤醒值及情感标签;构建融合描述与情感标签的文本提示;分别进行文本条件(Stable Audio Open, MusicGen, InspireMusic)和音频条件(MusicGen-melody, InspireMusic)生成;用Music2Emotion评估生成音频的效价-唤醒,通过MAE、欧氏距离和相关性对比源音频。
文本条件生成整体优于音频条件,MusicGen(文本)和InspireMusic(文本)表现最佳(VA距离约1.36),Stable Audio Open次之(1.714),音频条件均较差(MusicGen 1.804,InspireMusic 2.101)。效价保留优于唤醒;古典和乡村流派情感跟随较好,disco、metal、pop较差。
该论文首次系统比较了多种生成模型在情感跟随上的表现,揭示了文本条件提示的有效性及维度/流派差异,为情感可控生成评估提供了可复现的基线。
低资源自动语音识别(ASR)因标注语音稀缺,解码器可利用的监督证据不足,导致目标语言词汇、正字法、常用表达及语义连贯性估计不可靠。
提出 SAMA-ASR(Semantic-Aware Multimodal Adapter for ASR),一种轻量级解码器端适配器,通过交叉注意力将两类锚点融入解码过程: - 语义锚点:由辅助翻译文本(如中文)经 mBERT 编码得到,提供句子级语义上下文。 - 声学锚点:由冻结的 Whisper 编码器提取的语音嵌入,保证生成内容与语音信号一致,缓解语义锚点噪声。
推理时无需真实翻译,可由上游紧凑型 ST 模型(如 Whisper Small)自动生成语义锚点,保持模型轻量(244M 参数)。
一种基于多模态适配器的低资源 ASR 语义锚定机制,首次实现非 oracle 语义锚点自动生成,兼顾轻量性与有效性。
深度学习模型在医学声音诊断中虽具有强大的特征提取能力,但缺乏公平性和可解释性,且不同人群(年龄、性别、生活方式等)的差异会导致领域偏移,影响模型泛化。现有方法难以将属性先验信息嵌入潜变量并估计其概率分布。
本文提出 AGEDR(Attributes-based Gaussian Estimation for Disentangled Representation)框架,包含两个核心模块: 1. Attribute Mapping Embedding (AME):将标量属性(离散/连续)映射为高斯分布的潜变量(均值/方差),通过重参数化采样获得属性潜向量;并与 VAE 中对应部分通过 KL 散度对齐。 2. 解耦表征:将 VAE 潜变量划分为属性相关(z_alpha)和属性无关(z_beta)两部分,利用互信息 ELBO 最小化二者之间的依赖,实现解耦。
在分类任务中,使用编码器输出的均值参数作为分类器输入(而非带噪声的重参数化样本),减少随机性影响。损失函数综合了分类损失、VAE 重建损失、属性对齐 KL 损失和解耦互信息损失。
在 COUGHVID 咳嗽声音数据集(包含 34,434 条咳嗽音频及 7 个属性标注)上的实验表明,AGEDR 优于传统分类模型和现有解耦表征学习方法。消融实验进一步验证了方法的解耦能力和公平性,能减少属性相关的领域偏移和敏感信息。
一种通过属性高斯估计和互信息最小化实现医学声音诊断解耦表征的框架,兼顾性能与可解释性。
统一全类型音频深度伪造检测面临关键挑战:测试时音频类型未知(可能是语音、环境声、歌声或音乐),且需要输出单一的二分类真/假决策。传统的以语音为中心或类型相关的检测方法难以应对这种异构音频场景,因为它们依赖类型特定的假设或需要预先识别音频类型。
论文提出了一种双域自监督学习(SSL)融合方法,将异构音频映射到一个共享的二值真实性空间。核心检测器使用两个互补的SSL前端:EAT-large(提供广泛的声学和事件级表示)和wav2vec 2.0 XLS-R-300M(提供波形级、人声和语音敏感表示)。关键创新包括: - 层感知加权融合:利用可学习的权重融合来自两个模型多个Transformer层的隐藏状态,以捕捉不同抽象级别的伪造痕迹。 - token级融合:沿着时间/标记维度拼接两个流的融合token,形成一个统一的特征池,而无需强制帧级对齐,保留各自的前端结构和互补的时间证据。 - 多头注意力统计池化:使用多头注意力计算加权均值和标准差,生成话语级表示,有效汇总统一特征池。 - SwiGLU投影:在注意力聚合前使用轻量门控非线性层增强有效响应。 此外,论文提出了一种保守的语音细化策略,仅在辅助线索确定存在可识别语音时应用,而所有样本仍通过统一的类型无关核心检测器。
在AT-ADD Track 2评估集上,提交的系统实现了95.58%的Macro-F1分数,在挑战赛中排名第二。实验验证了双域融合和token级拼接的有效性。
这是首个面向全类型音频深度伪造检测的双域SSL融合方法,通过互补特征和统一决策空间显著提升了跨音频类型的泛化能力。
现有空中交通管制(ATC)决策支持工具独立处理语音、轨迹、天气等多模态数据流,缺乏对语音指令与飞行轨迹之间隐含语义关联的建模,限制了管制员情境感知能力的自动化支持。
提出V2TATC框架,将语音指令与被呼叫飞机的轨迹映射到同一潜在空间,实现双向查询。框架结合: - 基于Masked Autoencoder(MAE)的自监督轨迹编码器; - 冻结的大规模语音编码器(如Whisper/Wav2Vec 2.0); - 对比联合嵌入(类似CLIP); - 归一化流(Normalizing Flows)实现可逆映射,支持从语音生成轨迹或反之。
在旧金山湾区(含KSFO、KOAK、KSJC等机场)收集了配对语音-轨迹数据集,进行了跨模态检索、消融实验、潜在空间分析,并展示了短期轨迹预测和语音条件轨迹生成等下游任务的有效性。
V2TATC首次在嵌入层面将原始ATC语音与监视轨迹对齐,为构建生成式决策支持工具提供了新范式。
当前大型音频-语言模型(LALMs)在情感识别中倾向于依赖语义信息,忽视声学线索,尤其在声学情感与语义情感不一致(如讽刺、挖苦)时容易误解。现有研究主要关注单任务设置,缺乏对声学-语义不一致情况的研究,也缺乏缓解这种偏向的策略。
该研究系统揭示了LALMs在声学-语义不一致场景下的语义偏向,通过构建专门数据集和微调策略有效缓解了该问题,为多模态情感理解提供了重要诊断和改善方法。
该论文解决的是从模拟金属板混响器的单个脉冲响应(Impulse Response, IR)中恢复其六个物理参数(输出位置、尺寸、表面密度、张力等)的黑盒优化问题。直接应用现有方法(如牛顿法、梯度下降)面临不稳定性或可扩展性差的问题。
提出了一种两阶段进化搜索方法: - 阶段一:使用CMA-ES(协方差矩阵自适应进化策略)对七个原始物理参数(E, ρ, h, Ly, T0, xo, yo)进行搜索,采用幅度归一化后的L1 STFT幅度损失,能够准确恢复除表面密度μ以外的五个参数(xo, yo, Ly, T0/μ, D/μ)。 - 阶段二:由于阶段一的归一化丢失了μ的绝对幅度信息,利用μ与响应整体幅度单调相关的特性,通过50次迭代的三元搜索,在固定其他五个参数的情况下,最小化未归一化的损失,精确恢复μ。 此外,论文深入分析了损失函数选择的影响,发现log压缩严重损害恢复性能,因此选用未压缩的L1 STFT幅度损失,并验证了窗口大小等次要因素。
在50个验证IR上,两阶段方法取得了极高精度:49/50的样本在阶段二后NMSE显著降低,中位NMSE从阶段一后的1.91×10⁻³降至1.34×10⁻¹⁴,下降了约11个数量级;L1-STFT损失也下降4-5个数量级。消融实验表明,log压缩是性能退化的主要原因,而多尺度、谱收敛等组件影响较小。
该工作通过巧妙的两阶段进化搜索和细致的损失函数分析,在板混响参数估计上达到了近乎完美的精度,并揭示了log幅度压缩在频谱损失中的负面效应,为类似物理参数反演问题提供了有效范式。
本文提出了一种用于人工耳蜗(Cochlear Implant, CI)的低功耗端到端语音降噪脉冲神经网络(SNN)模型,称为 Spiking Deep ACE。该模型受 Deep ACE 架构启发,将语音增强与 CI 编码集成于一体,在保持竞争性性能的同时大幅降低能耗。
CI 用户在嘈杂环境中言语理解困难,传统信号处理算法在非平稳噪声下性能退化,而深度神经网络(DNN)虽然降噪效果好,但能耗高,不适合 CI 的低功耗处理器。
该工作首次将脉冲神经网络直接应用于人工耳蜗的端到端语音降噪任务,在保持与 DNN 相当性能的同时实现了超过 6 倍的能耗降低,为低功耗 CI 处理器提供了可行方案。
利用SSM连续时间建模与长记忆特性,实现调制和采样率不变的PDM语音处理架构,在极低计算开销下保持高性能,适合边缘设备。
音乐中的复杂混合声下分离单个乐器,对听障患者尤为困难。虽然空间分离已被证明能改善言语识别,但空间线索增强对音乐感知的潜在益处尚无系统探索。
该论文首创性地利用PCA增强HRTF空间线索并预测其在音乐场景分析中的掩蔽释放,为面向听障者的个性化空间音频增强提供了新的预测框架。
论文系统性探索了音频变换表示学习的设计空间,通过统一框架和受控实验揭示了不同目标的互补性,为处理感知音频表示提供了新方向。
现有音频-LLM评估常将波形提示与ASR转录进行比较,但混淆了两个因素:获取声学证据的必要性与调用生成式音频模型的必要。在已知封闭集任务中,生成式音频调用是否带来边际价值尚未明确。
本文提出受控的调用决策测试(Generative-Call Decision Test),将评估分解为:对每个样本,策略选择保留转录标签、使用编码器证据(CLAP、AST、WavLM)或调用生成式模型(Qwen2-Audio、Qwen2.5-Omni、MOSS-Audio)。通过剔除所有生成式动作的对照实验,量化生成调用的边际价值。关键设计包括:锁定行分割、匹配对照、配对置信区间、Holm校正及顺序成本核算。
该论文证明在已知封闭集任务中,生成式音频调用的边际价值有限,为音频-LLM评估提供了严格的调用边界审计方法。
当前语音大模型(Speech LLM)通常在生成答案之后才进行评分,但实际部署中,系统首先需要判断输入波形是否包含足够的语音证据来决定是否调用模型。许多不支持的输入(如静音、纯噪声、合成音调、来源不明的语音)可能被模型生成流畅但错误的回答,造成安全隐患。
提出 SURE-Challenge(Speech-Unsupported Rejection Evaluation Challenge),一个针对语音证据过滤的前置评估基准。该基准包含 SURE-Core(用于消融)和 SURE-Extended(用于持有测试)两种规模,基于 LibriSpeech 构建,覆盖转录和首词问答任务,并引入不支持的静音、有色噪声、合成音调和来源模糊的混合语音。提出一个廉价的固定前端规则:能量检测 + Whisper 置信度分数(平均最大 token 概率),并设置阈值 τ=0.70。该规则在多个语音/音频 LLM 上进行了回放验证。
在移除泄漏的 SURE-Extended 测试集(474 行)上,原始 Qwen2-Audio 仅拒绝 15/204 个不支持输入,而固定规则拒绝 196/204,且支持输入的准确率保持不变。该规则在六个后端(Qwen2-Audio、Qwen2.5-Omni、Qwen-Audio-Chat、Audio Flamingo Next、Audio Flamingo 3、MiniCPM-o)上实现了一致的拒绝率提升。外部检查显示,更严格的阈值会降低 Common Voice 的保留率,再生种子中的无速度 babble 产生 18/54 到 24/54 的拒绝。
SURE-Challenge 识别了仅在生成后评分所忽略的预生成错误模式,为语音 LLM 的部署提供了一种轻量级但有效的前置证据过滤方法。
传统建模主观测试中投票方差与MOS关系时,常使用缩放最大方差抛物线,但尺度因子小于0.25时,方差可能低于理论最小可接受值,违反基本限制。此外,传统方法无法充分描述真实投票行为的单峰性,且难以覆盖方差-均值空间中的合理区域。
在16个语音、图像和视频主观质量数据集上进行评估,拟合曲线与数据高度吻合。13个数据集无需额外处理即可满足UVR约束,其余3个数据集通过加权最小二乘微调后也符合要求。图2展示了方差最大(ITS2013)和最小(NISQA P501 MOS)的两个数据集,拟合曲线精确跟踪数据并始终保持在UVR内。
该研究提出了一种理论严谨且行为可解释的投票方差混合模型,为多媒体主观质量测试中的方差分析提供了新工具。
情感音频建模通常假设声学属性到情感反应的映射是可泛化的,但现有评估几乎都在训练语料库内进行。当模型在库外失败时,领域默认的解决方案是收集更多数据或采用更大的预训练模型,这隐含假设所有失败都是资源不足。作者指出并非如此,存在一种“信息受限”的失败——目标所需信息根本不在输入中,无论多少数据或模型体积都无法弥补。
本文系统地将同一映射推向四个应用必须跨越的边界:(1) 跨语料库(新录音材料),(2) 跨编辑音频(实际系统应用的合成修改),(3) 跨响应测量方式(用生理信号替代自我报告),(4) 跨个体听众。在每个边界,作者统一报告三个关键量:目标可达的上限(ceiling)、跨越边界后保留下来的性能比例、用目标侧观测数据买回损失的成本。研究使用了四个带评级的语料库(DEAM、PMEmo、Soundtracks、Emo-Soundscapes)和四种预训练音频表示(AST、MERT、Wav2Vec2、CLAP)来验证结论。
该研究通过严谨的多边界实验设计,将“模型不泛化”这一笼统问题拆解为“预算受限”与“信息受限”两种类型,并提供了测量购买回损失成本的方法,挑战了“更多数据或更大模型”的默认补救策略,是情感音频建模领域关于泛化诊断的重要参考。
振荡器同步(Oscillator Synchronization)是音乐合成中常用的声音合成技术,但在数字实现中,简单的硬相位重置会导致严重的混叠伪影(aliasing artifacts)。传统数字仿真需要大量过采样或低通滤波,计算开销高,且难以扩展到任意周期波形。
本文提出一种基于加性合成(Additive Synthesis)的通用无混叠振荡器同步方法。给定自由运行振荡器波形的有限傅里叶级数系数,通过推导的线性频谱重采样变换(Spectral-Resampling Transform),将系数映射为同步后波形的系数。该方法支持三种同步模式:硬同步(Hard Sync)、镜像同步(Mirrored Sync)和脉冲星同步(Pulsar Sync)。此外,为应对高计算复杂度,作者设计了HASY——一款65nm CMOS工艺的6mm²专用集成电路(ASIC),能够实时生成96kHz、24bit分辨率、最多512次谐波的无混叠同步波形,并在仅5个音频采样周期内完成频谱重采样变换。
由于提供的论文片段被截断,未包含完整实验数据。但摘要和引言表明,HASY已成功流片,能够高效实现所提出的频谱重采样与加性合成算法。
本文为振荡器同步提供了一种理论上完善且硬件可行的无混叠方案,通过加性合成和专用芯片实现了任意波形的实时同步。
传统电吉他拾音器感应所有琴弦且位置固定,输出单声道模拟信号,后期无法调整拾音位置。现有六弦拾音器仅单点感应且多模拟输出,集成复杂。
PolyMap是首个具备完整功能集的多弦多位置数字输出吉他拾音系统,将拾音位置决策移至后期,提供高分辨率弦振动捕捉。
现有口语对话评估常常允许模型基于文本转写(transcript)的捷径进行推理,而忽略了语音中重要的副语言信息(如韵律、情感、社交姿态等),导致模型并未真正对语音进行 grounding。当文本和音频信息不一致时,模型容易产生错误判断,即存在跨模态不一致(cross-modal disagreement)问题。
本文系统揭示并形式化了口语对话理解中基于文本的捷径失败模式,提出显式声学证据聚合(Audio Twin)作为可控制的接口来诊断和改善语音 grounding 推理。
在低资源语言场景中,语音数据收集困难,且缺乏转录文本。本文针对“视觉接地语音数据”(图像+外语语音描述),研究如何将英语书面词映射到外语(印地语)语音片段,以支持语言记录。
一种简洁而有效的跨语言词汇-语音映射方法,仅凭视觉接地即可实现无需转录的语音文档化。
AudioSpan是首个同时跨越音频时长和认知深度的综合基准,揭露了现有LALM在长音频理解中的真实短板,并为可扩展的高质量基准构建提供了新范式。
在强混响环境中,神经方向滤波(NDF)重建的虚拟方向麦克风(VDM)信号包含大量混响,导致空间线索难以分辨,限制了空间声音捕捉质量。传统级联方式(先去混响再方向滤波)因各阶段独立优化而无法达到全局最优。
本文提出神经去混响与方向滤波(NDDF)联合框架,直接重建去混响的VDM信号。主要创新点包括:1)将去混响与方向滤波统一为单个学习问题;2)实现判别式训练和GAN-based两种范式,使用SEANet生成器,支持信号估计和掩码估计两种模式;3)提出一种仅依赖输入输出信号的方向图估计方法,适用于信号映射式空间滤波。
实验表明,NDDF一致优于级联基线;在6阶心形方向图等高阶VDM目标上,GAN-based NDDF显著优于判别式变体。客观指标使用fwSDRseg和PESQ。
本文首次联合优化去混响和方向滤波,并借助GAN提升高阶方向图下的重建质量,是空间声音捕捉领域的一项前瞻性工作。
现有噪声鲁棒的音频-视觉语音识别(AVSR)方法主要依赖结构改动或额外微调,导致计算成本高、部署效率低。基于大语言模型(LLM)的 AVSR 系统虽然鲁棒性更强,但在噪声条件下仍可能因过度依赖音频模态而产生错误。论文提出使用对比解码(Contrastive Decoding, CD)作为无需训练的推理时策略,但固定对比强度 λ 存在本质缺陷:声学可靠性在 token 级动态变化,统一干预无法适应 SNR 波动,导致严重噪声下干预不足、干净条件下过度纠正,形成“噪声鲁棒性 vs 干净语音保持”的 trade-off。
论文提出注意力引导的可靠性缩放对比解码(Attention-Guided Reliability Scaling for Contrastive Decoding)。核心是在同一个 LLM-based AVSR 模型内部构造两个条件设置: - Expert:使用完整音频+视觉输入; - Amateur:仅使用音频输入(省略视频嵌入)。
有效对比强度定义为: λ_t^eff = w_t · λ,其中 w_t ∈ [0,1] 是 token 级动态权重。
w_t 由三个可靠性信号通过乘法融合得到,即 w_t = w_t^E · w_t^H · w_t^JS。乘法融合保证仅在所有信号都支持时才启用对比解码,行为保守:
相对音频能量(E_t):衡量当前 token 对音频区域的注意力占比,并使用当前句子的 running mean 进行自适应归一化。当音频注意力高于其均值时,通过 sigmoid 增加干预强度,抑制对可能被噪声破坏的音频线索的过度依赖。
音频熵(H_t):衡量音频区域注意力分布的离散度。低熵表示声学信号清晰,高熵表示噪声/不确定。每个注意力头独立计算熵并取平均,再用 log N_a 归一化到 [0,1],通过 sigmoid 在 0.5 处进行软门控。
Jensen-Shannon 散度(JS_t):衡量 Expert 与 Amateur 预测分布的差异。采用高斯滤波函数,仅在分歧处于“甜点”(informative disagreement)时增强干预;当 JS 接近 0(几乎一致)或接近 1(极端分歧)时抑制干预,以避免“rank distortion”——即 Amateur 分布塌缩导致 token 级偏移过大、破坏 Expert 概率结构的问题。
注意力权重提取遵循三点原则:使用当前正在生成的最后一个 token 的注意力,取自模型最后一个 Transformer 层,并在所有注意力头上平均。这使可靠性信号最能反映实际的跨模态交互。
这是一篇训练免费、无架构修改的推理时解码策略工作,用注意力动态和模型间分歧自适应缩放对比解码强度,为鲁棒 AVSR 提供了一种简洁而有效的方案。
本文揭示了合作行为下看似可靠的LLM在权威压力下会对无信息输入自信虚构,为医疗LLM可靠性审计提供了新范式。
VOICEMEM provides a practical, low-latency, and emotionally aware memory foundation for real-time spoken interaction, combining informational and emotional intelligence in a simple yet effective streaming architecture.
空中交通管制(ATC)程序通过飞行员与管制员之间的口语交流执行,其合规性评估需结合语音内容、角色、飞机身份、系统状态和时序,仅凭通话记录无法判断指令是否被遵守。现有方法未能完整覆盖观测落地(R1)、多源融合(R2)、时序与及时性推理(R3)以及有证据支持的判定(R4)这四项监控需求。
提出一个新颖的运行时验证框架,将口语无线电通话解析为与实体关联的事件,与监视和机载观测数据融合为带时间戳的轨迹,并将ICAO衍生的义务形式化为带显式时间界限的时序逻辑公式(基于LTLf和MTL),在轨迹上评估生成违反报告,包含被违反的义务和支持判定的观测证据。这是首个管制员和飞行员义务的时序逻辑形式化。
该研究首次将口语ATC程序监控转化为形式化、可执行且可解释的运行时验证框架,兼具理论严谨性和实际应用价值。
联邦学习(FL)在非独立同分布(non-IID)客户端数据分布下,全局模型容易产生偏差和次优性能。传统的聚合策略如FedAvg忽略了客户端之间的异构性,同时对抗性客户端可能破坏全局模型鲁棒性。个性化联邦学习在平衡全局协作与本地个性化方面存在挑战。
提出pFedMARL框架,采用多智能体强化学习(MARL)结合Twin Delayed Deep Deterministic Policy Gradient (TD3) 动态调整聚合策略。服务器端智能体调整客户端贡献权重以增强全局模型鲁棒性,客户端智能体平衡全局与局部更新以实现个性化模型,无需预训练。该方法同时处理非IID数据分布和对抗性客户端行为。
在音频频谱图变换器(AST)的半监督训练任务中,pFedMARL在多种non-IID场景(包括数量偏斜、标签偏斜和聚类偏斜)下,性能匹配或超越FedAvg、Ditto和本地训练方法,并在存在对抗性客户端时表现出更强的鲁棒性。实验结果表明pFedMARL能显著提升准确性、鲁棒性和公平性。
pFedMARL通过多智能体强化学习实现了联邦学习中的自适应聚合和个性化,有效解决了non-IID数据下的全局鲁棒性与局部个性化权衡问题。
本文首次系统地将知识蒸馏引入声学回声控制,为设计高能效且高性能的AEC模型提供了有效方案,具有工程实用价值。
传统的声学回声消除器(AEC)只针对固定的设备内回声路径,但在同一房间内多个免提终端共存时,通过通信服务器形成的终端间意外回声路径(如A2麦克风→服务器→A1扬声器→A2麦克风)难以控制,极易导致啸叫。手动静音管理不可靠,且在虚拟/元宇宙会议中耳机设备难以协调,问题更加突出。
提出基于声音对象识别的回声控制方法,不估计回声路径,而是识别声音对象(数十至数百毫秒的语音段),默认静音,仅在信号与近期观察到的对象不相同时允许传输/播放。通过阻断同一声音对象的重复播放,打破回声环路,可视为传统语音切换半双工向条件半双工的推广。系统包括三个模块:声音对象提取与缓冲、声音对象识别(如谱相似度)、播放控制(静音/增益控制)。
在双房间三终端场景下验证:无控制时啸叫明显(图d),有控制后啸叫被抑制(图f,h)。但识别误差导致误放行(K–M点)和过度静音(频谱稀疏),说明仅静音控制在双讲场景下不足,存在啸叫抑制与语音质量的权衡。
识别需低延迟、抗变形(混响、编解码、噪声抑制等)。可用的特征包括MFCC、音频指纹等。软增益或频选静音可减轻音质损失,但残余泄漏不能重新形成环路。部署可在终端或服务器端,部分部署可能导致过度静音。训练数据匮乏,需要联合覆盖网络变形和播放控制的基准。
将回声消除从路径估计转向对象身份识别,为复杂声学路径下的啸叫抑制提供了新思路,但距离实用仍需解决识别鲁棒性与语音质量的平衡。
现有神经声码器大多针对单声道音频设计,直接扩展到空间音频会忽略通道间线索(如ILD、IPD),导致空间质量下降。同时,空间音频渲染需要显式建模声源-听者相对位姿,并满足实时流式推理的低延迟要求。
提出 CSAVocoder,一个因果 GAN-based 空间音频声码器,主要创新包括: - Spatial Adaptor:融合多通道 mel 谱图与动态声源-听者位姿信息,包含 Mel Adaptor 和 Position Adaptor,前者捕获通道间关系,后者使用傅里叶特征编码和 FiLM 注入位姿条件。 - Spatial Consistency Discriminator (SCD):基于轴向注意力(时间维 + 通道维)的判别器,显式监督通道间空间线索。 - 严格因果、有状态生成器:使用 Causal Shuffle Upsample Block 和 StreamingResBlock(带状态缓存),支持块式流式推理,内存开销恒定。 - 统一架构:支持双耳(binaural)和一阶 Ambisonics(FOA)两种空间音频格式。
在大规模空间音频数据集上的实验表明,CSAVocoder 在保持有竞争力的音频质量和实时性能的同时,显著提升了空间保真度(如定位精度和听感偏好)。
CSAVocoder 是首个同时考虑空间一致性、位姿条件和实时流式推理的 GAN 空间声码器,为空间音频生成提供了高效且高质量的解决方案。
中文ASR系统在处理同音词时存在困难,因为相同或相似的发音对应不同的书面形式。而幽默谐音(HumourPhone)是说话者故意利用同音词进行的修辞性文字游戏,现有同音词感知方法主要处理普通同音词,对语音中的幽默谐音替换未充分探索。幽默谐音需要从音频中直接推断意图和语义转折,挑战性更大。
论文提出一个任务条件ASR适配框架,包含三个模块: 1. 谐音检测器:基于Jieba分词和词频信息,识别潜在的谐音跨度。 2. 基于情感检测的支路选择:利用GPT-5.5和幽默模式指南,判断输入音频属于普通谐音分支还是幽默谐音分支。 3. LLM提示构建器与语义选择器:针对不同分支设计提示,驱动语音LLM(如Qwen2.5)生成多个候选转录,并通过MacBERT语义选择器选择最佳结果,平衡纠正准确率与过度纠正风险。
此外,论文还构建了包含80个音频样本的HumourPhone数据集,并总结了六种幽默谐音模式,用于指导情感检测和提示构建。
在HumourPhone上,所提方法相比基线将识别目标幽默替换的召回率提升了超过5%,目标跨度字符错误率(T-CER)降低了4.35%。在普通同音词集(合并的AISHELL-3与CommonVoice中文)上,也取得了改进。此外,情感检测器在预测不同ASR输出的幽默性时准确率达到97.0%(Qwen3-ASR)和76.0%(Whisper-large-v3)。
该论文针对中文幽默谐音识别这一独特且困难的任务,提出了一种结合语音LLM和语义选择的任务条件适配器,显著提升了幽默谐音恢复性能,为谐音感知的ASR建模提供了新思路。
现有口语对话中的轮流说话(turn-taking)评估缺乏一致、基于语言学的协议,且手动标注的数据集通常只覆盖单一对话类型,导致不同系统之间难以比较。
提出了 TURNBENCH,一个多领域基准,包含: - 语料库:30小时双通道人工标注的双人对话(154个对话,106位配音演员,53对),覆盖六种对话类型(Casual, Task-Oriented, Instructional, Collaborative, Argumentative, Narrative),并使用三重标注,基于对话分析的17个细粒度标签,最终映射为7个规范类别(如 TURN, INTERRUPTION, BACKCHANNEL 等)。 - 评估协议:统一协议同时评估结束轮询检测(EOT)和打断检测(INT),提供标准化的评分窗口和真值定义。 - 系统基准:对14个不同类型的系统进行基准测试,包括规则型检测器、全双工模型、概念和编解码端到端系统、语音活动投影(VAP)等。
TURNBENCH 提供了首个多领域、语言学根植的轮流说话基准,为全双工对话系统评估建立了新的标准。
现实场景中,并发说话人数量未知,麦克风数量和几何形状可变,而现有深度神经网络方法通常假设其中一种条件固定,无法同时处理未知说话人数和可变麦克风数。输入输出维度固定与未知数目之间的矛盾是主要挑战。
在多个公共数据集上取得最先进性能,并且对真实录音信号展现出强泛化能力(具体数据在截取部分未给出)。
首次在单一 DNN 中同时解决未知说话人数和可变麦克风数量的语音分离问题,兼具灵活性和性能。
深度神经网络驱动的音频深度伪造检测系统在基准数据集上表现出色,但缺乏可解释性,难以向人类评估者提供可信任的推理依据。现有研究大多直接处理完整语音,未细致分析浊音和清音区域各自对检测的贡献。
本文首次系统性地探索将语音分解为浊音和清音成分用于合成语音(深度伪造)检测。使用pYIN算法估计帧级浊音标志,结合Web-RTC VAD获得语音活动掩码,从而分离出浊音成分(x_voi)和清音成分(x_unv)。采用基于图注意力的AASIST模型分别对完整音频、语音分段、浊音、清音四种输入进行训练,并通过逻辑回归分数级融合整合浊音与清音系统。
在MLAAD数据集上,清音系统取得最低的等错误率(EER=6.62%),显著优于完整音频基线(11.40%)和浊音系统(12.26%)。语音分段系统表现中等(10.10%)。将浊音与清音系统进行分数融合后,EER降至5.82%,相对完整音频基线降低49%,相对清音系统降低12%,证明两者具有互补性。清音系统对Bark、capacitron、fastpitch和overflow攻击效果良好,但对Tortoise-TTS攻击表现不佳。
该研究揭示了清音区域在音频深度伪造检测中的关键作用,并通过浊音/清音融合显著提升性能,为可解释的伪造检测提供了新视角和实用方法。
现有语音空间音频研究多聚焦于双耳/立体声渲染,缺乏基于场景的First-Order Ambisonics (FOA)表示;真实世界360°视频中语音主导场景的FOA重建因缺少配对数据和可靠视觉线索而受限。已有数据集多为双耳格式、规模小、或依赖模拟/几何标签,缺少与全景视频配对的真实FOA语音数据。
在YT-SPEECH上评估重建保真度(ℓ2, Lmag, LMRS)、空间误差(DOA azimuth/elevation/angular error)和语音质量,相比消融变体和先前方法(如SAG、Rana et al.)在重建保真度、空间准确性和感知语音质量上均有所提升。
本文首次提出视觉引导的真实360°语音场景FOA重建数据集与两阶段框架,以可解释的空间先验和置信门控机制有效提升空间音频重建质量。
ADEPS通过将物理模型嵌入扩散后验采样,首次实现了真正阵列无关的Ambisonics编码,兼具可解释性和灵活性。
医疗工作人员需要花费大量时间在临床记录上,传统的基于中间文本的摘要系统可能会丢失语音中的副语言信息,且处理流程较长。本文旨在实现端到端的语音到SOAP笔记生成,减轻医护人员负担。
本文提出了一种通过合成语音和数据增强统一医疗对话数据集的方法,成功实现了端到端的语音到 SOAP 生成,并验证了多种训练策略的有效性。
本文系统性地研究了NV生成中的偏好优化,提出了NV-CER指标和有效的DPO配置,为NV感知TTS的后训练提供了坚实且实用的指导。
现有情感语音合成(TTS)系统通常将情感建模为静态的离散标签或话语级嵌入,与人类情感随时间连续变化、上升、衰减和转移的动态特性不符。缺乏对话语内(intra-utterance)情感平滑转换的可控建模,尤其在讲故事、配音、有声书等应用中,突兀的情感切换会严重影响表现力与自然度。
提出 EmoTra-TTS,通过三个关键组件实现话语内平滑情感转换: 1. 多通道流混合数据合成:利用预训练零样本TTS的流解码器对说话人/情感嵌入与语言内容解耦的特性,共享LLM生成的同一语音token序列,在梅尔谱空间通过sigmoid交叉淡化混合初始情感与目标情感的音频,生成帧级对齐的合成情感转换数据,解决真实数据稀缺问题。 2. 双阶段VAD条件注入:在LLM阶段使用VAD token引导韵律规划;在流解码器阶段使用帧级VAD嵌入调制说话人路径,实现时间对齐的情感控制。 3. 方向-幅度解耦注入:通过LayerNorm + 固定缩放,将学习到的情感方向与受限的注入幅度分离,避免将预训练解码器推出其工作范围,减轻内容退化与表达力之间的权衡。
EmoTra-TTS 通过数据合成、双阶段VAD条件注入与解耦放大机制,在几乎不增加参数和延迟的情况下,实现了精细可控的话语内平滑情感转换,是该方向上的代表性工作。
现有音频-视觉语音增强(AVSE)评估协议多基于分离音频源的人工混合,且假设视频可靠,无法反映真实重叠语音和视觉退化条件下的性能。
该挑战填补了同时评估自然混合音频和不可靠视觉证据的基准空白,是 AVSE 领域首个系统研究视觉退化影响的可复现协议。
现有无监督语音识别(UASR)方法主要基于音素级建模,依赖昂贵的 G2P 转换器,且在音素边界模糊的语言(如普通话)中训练不稳定。词级替代方案则面临稀有词词汇量无限、泛化困难的问题。
本文提出 SylCipher,这是首个音节级无监督语音识别系统。SylCipher 通过掩码语言建模(MLM)框架,联合预测音节边界和离散语音单元,无需 G2P 和对抗训练,提升了训练稳定性。其核心设计包括: - 基于软池化的可微音节边界检测器,利用无监督音节探测器 Sylber 进行预训练; - 共享编码器处理语音和文本,通过矢量量化将语音转换为音节级离散单元; - 通过分布匹配(如低阶矩匹配)和掩码预测概率,对齐语音与文本的语义空间。
SylCipher 巧妙地选择音节作为中间表示,有效规避了 G2P 依赖和训练不稳定问题,为低资源语言无监督语音识别提供了新范式。
语音应用将口语查询通过ASR转录后再进行检索增强生成(RAG),ASR错误作为固定的上游约束进入管道。多跳RAG方法(如实体图链接和迭代改写)引入了新的错误传播点,但这些方法对带口音输入的鲁棒性尚未得到充分研究。
该论文系统揭示了多跳RAG如何放大上游ASR错误,并识别了查询实体损坏这一关键失败机制,为构建鲁棒的语音驱动RAG系统提供了重要见解。
传统MSASR采用级联流水线(说话人分离→语音分割→ASR),存在模块目标不匹配、误差传播严重、依赖复杂后处理等问题。半级联方法仍受前级模块输出限制,而现有端到端语音LLM方法(如SoulX-Transcriber、VibeVoice-ASR、MOSS-Transcribe-Diarize)在输入时长和复杂场景泛化上存在不足。
在多个多说话人测试集上,DiaScriber在DER、cpWER、tcpWER指标上显著优于VibeVoice-ASR和MOSS-Transcribe-Diarize,并在未见过场景上展现出更强的泛化能力。
DiaScriber通过精细的数据管道设计和三阶段训练策略,有效解决了多说话人ASR中的复杂场景挑战,是一项实用且鲁棒的端到端模型。
MRMAD是首个聚焦音频退化感知的多轮多音频基准,为构建鲁棒于真实声学条件的LALM提供了诊断基础。
级联式多说话人ASR(MT-ASR)系统虽然能利用基础模型,但其性能受限于源分离质量,分离不完美会导致说话人泄漏(speaker leakage),即一个说话人的语音残留在另一个说话人的流中,造成最终转录中的说话人归属错误。现有修正策略主要依赖重标注(re-labeling),但在严重泄漏时重标注具有歧义。
本文提出一种互补的基于修剪(pruning)的修正范式,利用预训练的说话人日志(diarization)模型作为验证器,检测每个分离音频流中干扰说话人的时间窗口,并基于三合一共识——时间包含、词汇交叉验证和时间对齐——来识别并修剪泄漏的单词。方法不试图重新标注,而是直接删除不可靠的转录片段,从而避免歧义。还探索了一种将日志头集成到MossFormer2分离模型中的多任务架构,以在信号层面抑制泄漏,但该架构对领域迁移敏感。
在LibriMix、LibriSpeechMix和AMI Meeting语料库上的实验表明,所提出的修正算法在不同重叠条件下持续降低cpWER,特别是在高泄漏子集上获得高达29%的相对cpWER降低。此外,联合模型的实验显示在域迁移下性能不稳定,说明信号级抑制仍具挑战性。
一种新颖的基于日志验证的剪枝策略,为级联MT-ASR中的说话人泄漏提供了一种直接有效的解决方案。
现有符号音乐处理主要基于 MIDI 格式,忽略了西方乐谱中丰富的表达文本(如速度、力度、连音、颤音等),导致下游建模任务无法利用这类关键的音乐表现信息。
本文提出 MusPyExpress,作为 MusPy 库的扩展,支持从 MusicXML 中提取表达文本并转换为离散张量数据,便于下游序列建模。具体贡献包括: - 在 MusPy 的 Annotation 基础上扩展了 28 种表达文本类型(如力度、速度标记、踏板、滑音等),并区分了瞬时标记与跨时值标记(spanner)。 - 利用 PDMX 数据集(超过 22 万首)验证了表达文本的丰富性,发现 95.33% 的文件包含表达文本,平均每首 20.1 个标记。 - 提出了三个基于表达文本的生成任务: 1. 联合音符-表达文本生成:同时建模音符和表达文本。 2. 表达文本条件音符生成:给定表达文本序列,生成匹配的音乐。 3. 表达文本标注:给定音符序列,自动添加合适的表达文本(类似 MIDI 到乐谱的渲染)。
MusPyExpress 填补了符号音乐处理中表达文本缺失的空白,为表达感知的音乐生成和标注提供了实用的工具和基线任务。
论文关注语音作为COPD低成本筛查信号的有效性问题。由于COPD与年龄强相关,且语音特征随年龄变化,传统分类结果可能仅反映了年龄差异而非病理信号。作者指出常见做法(仅移除年龄特征)不足以消除混淆,因为语音特征可能隐式编码年龄信息,机器学习模型可通过代理特征重建年龄驱动决策边界。现有数据集中的年龄不平衡、录音条件差异以及评估协议缺陷进一步加剧了该问题。
该论文严谨证明语音中存在非年龄的COPD声学信号,并方法论上揭示混淆协变量与评估协议的关键陷阱,对语音生物标志物研究具有重要警示意义。
当前的听觉大语言模型(Auditory LLMs)主要在高资源数据上训练和评估,对低资源场景(如儿童语音、方言、非主流语言、特定翻译方向、音频理解/推理)表现不佳。直接在小规模域内数据上进行微调容易过拟合且对分布偏移脆弱。
提出 Meta Speech In-Context Learning (MetaSICL),一种后训练方法,利用丰富的高资源语音数据(如英语ASR和语音翻译)构建ICL风格的训练片段,教会模型如何利用演示(demonstrations)进行推理时适应,而无需为每个低资源领域收集大量标注数据。MetaSICL不接触目标低资源域数据,但能显著提升模型在低资源任务上的表现。
MetaSICL是一种实用的后训练技术,通过构建推理时适应能力,将听觉LLM推广到低资源社区和语言,减少了为每个目标领域单独微调的需求。
现代生产 ASR 系统需要准确识别用户自定义短语(上下文词组),但现有方法在流式推理、高效批处理、个性化上下文列表和低开销方面存在不足。此外,用户提供的短语与模型输出在大小写上可能不一致,导致匹配失败。
TurboBias 2.0 提出了面向生产的 Transducer ASR 上下文偏置框架,主要包括: 1. 大小写不敏感的字词提升图:通过变体 BPE 表示和字符级合并弧,在不增加短语变体的情况下实现大小写不敏感的匹配,并利用累计势能函数分配分数,保证不同分割获得相同总提升。 2. 每流上下文偏置:在 GPU 批处理中,每个流使用独立的偏置图,通过合并多模型存储和偏移量管理,实现动态添加/移除短语列表,避免跨流干扰。 3. 流式解码支持:支持流式贪心搜索和 beam search,并保持低运行时开销。
在 Contextual Earnings-22 和内部医学领域测试集上,TurboBias 2.0 相比基线提升了上下文短语识别质量,同时保持了低延迟和高吞吐。实验分析了大小写不敏感图与大小写敏感/短语展开方案的效果差异,以及离线/流式解码模式、beam 大小、F-score 与延迟的折中。
TurboBias 2.0 是针对流式 Transducer ASR 的高效、可扩展上下文偏置方案,兼顾了大小写鲁棒性和个性化批处理需求,适合生产部署。
扩散模型在语音增强中性能优异,但需要多个反向扩散步骤反复评估大型神经网络,计算复杂度高,难以用于实时应用。
提出 SlimDiffuSE,一种基于 SGMSE+ 的可瘦身扩散模型。通过利用可瘦身神经网络(SNN),在推理过程中自适应调整网络宽度(利用因子 u),按扩散步骤动态分配计算资源。训练时采用多宽度优化策略,推理时通过贪心搜索优化每个步骤的宽度调度。在保持参数数量的同时,显著降低整体计算成本。
在 DNS 数据集上,预定义的混合复杂度配置显示,反向扩散早期(t 接近1)需要高容量模型,而后期(t 接近0)低容量模型即可满足需求。SlimDiffuSE 通过可瘦身网络实现类似配置,性能与完整模型相当,计算复杂度可降低高达 87.5%。
一种高效扩散语音增强方法,通过按步骤动态分配网络宽度,在不牺牲性能的前提下大幅降低计算负担。
μNet为嵌入式DSP提供了一种超低内存、低复杂度、低延迟且可量化部署的实用语音增强方案,在资源受限场景下具有很强应用价值。
传统基于图像源法(ISM)的合成RIR数据集无法充分捕捉真实声学条件,导致语音增强模型在真实环境中的泛化能力受限。
本文比较了ISM与高保真混合仿真的RIR数据集对DeepFilterNet3训练的影响。混合仿真结合波法和几何声学,在低频准确建模模态、衍射等,高频用GA,提高RIR的真实感。
训练于混合数据集(Hybrid)的DeepFilterNet3在所有配置下均获得客观指标提升(PESQ +0.166, SI-SDRi +0.110, STOI +0.013, SRMR +0.270),并在下游ASR上大幅降低词错误率(WER)。
研究表明提高合成RIR的整体真实感能有效改善语音增强模型在未知真实环境的泛化性能。
RBD-RLS通过块对角近似和正则化,在计算复杂度、收敛速度和数值稳定性之间取得了有效平衡,适合用于声学回声消除等长滤波器场景。
现有语音系统在特定领域(如电信客户服务)需要领域特定的语言覆盖。虽然存在如Common Voice等众包语音资源,但广泛领域且多为人类录音,缺乏针对孟加拉语电信客户服务的合成语音数据。
论文构建了一个10,000音频-文本对的合成孟加拉语语音数据集,总时长约26.82小时,采样率24kHz。使用OmniVoice TTS在语音克隆模式下生成,参考真实女性录音和转录。数据划分为训练/验证/测试(9000/500/500)。同时,提供原始文本和归一化转录字段。评估使用基于Whisper的ASR模型(从Tugstugi Whisper微调)进行自动可懂度检查,并辅以人工听力检查。
平均WER为2.54%,平均CER为0.59%,中位数WER和CER均为0.00%,表明合成语音与文本一致性较强。
该论文为孟加拉语电信客户服务领域提供了首个公开的合成语音数据集,并通过自动和人工评估验证了其质量,对领域相关ASR/TTS研究有重要价值。
深度神经网络在预测时往往过度自信,即使预测错误也会给出高置信度,导致用户难以判断何时可以信任模型的输出。现有的后验置信度估计方法(如 ConfidNet 使用 TCP 目标)存在目标值重叠问题:正确与错误预测的置信度目标难以区分,且靠近决策边界的错误预测与正确预测的置信度得分几乎一致。此外,由于基分类器准确率高,正确样本远多于错误样本,学习置信度目标面临严重的回归不平衡问题。
本文提出 TCP_α 置信度目标,在 TCP_n 的分母上增加一个仅对误分类样本生效的惩罚项。该惩罚项使得正确与错误预测的置信度目标完全分离,且分离间隔与类别数无关,并随惩罚参数 α 单调增大。作者提供了理论保证,证明 TCP_α 满足完全分离性。针对回归不平衡问题,系统研究了多种训练策略(如重加权、过采样、焦点损失等),并通过消融实验确定了最佳配置。整体采用后验置信度估计框架:冻结基分类器,仅训练轻量级置信度头,以 TCP_α 为回归目标。
在 Rāga 识别任务上,仅拒绝置信度最低的 8% 预测,基模型的 macro-F1 从 0.89 提升至 0.98。在帧级装饰音检测(ornamentation detection)任务上,使用相同配置也取得了显著增益。在域迁移场景下,仅用目标域 5% 的标注样本微调置信度头,即可有效恢复置信度得分的分离性。TCP_α 在失败预测指标(AUPR-Error、AUROC、FPR@95%TPR)上一致优于现有置信度目标。
TCP_α 通过引入边界控制的惩罚项,彻底解决了现有置信度目标对正确与错误预测重叠的问题,为 MIR 系统提供了一套可靠且可迁移的失败预测框架。
本文针对语音深度伪造(speech deepfake)溯源问题,指出现有方法(如基于MLP的独立属性提取器和决策树/逻辑回归后端分类器)存在结构碎片化、依赖事后解释(如SHAP)且解释与模型真实逻辑不一致、稳定性差等问题,亟需一种统一、高性能且内在可解释的端到端架构。
在ASVspoof2019-attr-17数据集上: - 7个概率属性提取器的平衡准确率均超过99%,EER从0.16%降至0.07%。 - 17类攻击分类的平衡准确率达99.64%,EER为0.11%。 - 优于早期的两阶段基线,且重要性分数与SHAP值一致,在不同batch size下结果稳定。
本文通过结构化的KAN网络和多任务概率属性学习,实现了语音深度伪造溯源的高精度与内在可解释性,是该领域兼具创新性与实用性的重要工作。
语音合成技术的进步使得深度伪造音频高度逼真,人类检测能力不足,尤其是在部分伪造(partial spoofing)场景下。以往研究多基于老旧合成器,且仅评估全伪造语音,对现代合成器和部分伪造的人类感知研究存在空白。
该研究揭示了现代语音合成和部分伪造对人类感知的严重挑战,强调需要程序性验证、溯源、水印和片段级检测等对策。
现有音频自监督学习方法依赖复杂的预训练流程,如重建解码器、声学 tokenizer、师生蒸馏(EMA 更新)、辅助正则化损失等,缺乏类似语言模型中简洁的因果预测范式。
本文提出 NAPE(Next-Audio-Patch-Embedding prediction),首次将因果 next-embedding 预测引入音频 SSL。核心做法: - 将 log-mel 频谱图划分为非重叠 patch 并嵌入为 1D 序列。 - 使用因果 Transformer 编码器,通过因果掩码只允许利用过去 patch 预测下一个 patch 的 embedding。 - 预测目标为 continuous embedding,损失为负余弦相似度,并采用 stop-gradient 作为唯一训练信号。 - 探索四种扫描顺序(raster、time-major、zigzag、diagonal),以适应音频的时间-频率结构。 - 设计极简,无需重建解码器、tokenizer、EMA 教师或辅助损失。
NAPE 以极简的因果下一 patch 预测范式,为音频自监督学习提供了高效且可扩展的新思路。
DAVSS 通过知识蒸馏将 Transformer 的性能优势迁移到高效的 SSM 上,并利用 SSM 的长序列处理能力实现更深层的音频-视觉联合建模,在显著减小模型规模的同时超越基线。
本研究通过构建Mizo语音语料库和引入形态学感知评估,证明了Whisper模型在低资源语言适应上的潜力,为低资源ASR提供了有效的方法和资源。
当前大型音频语言模型(audio-LLM)在韵律理解任务上表现不佳,但标准的行为评估(仅看最终答案正确率)无法区分失败的具体环节:是音频编码阶段丢失了韵律信息(F1),还是模型内部错误解释了韵律(F2),或是模型内部其实已经正确表征了韵律但未在输出中充分使用(F3)。这种歧义阻碍了有针对性的改进。
论文提出了一个阶段特定的探针阶梯(probe ladder),将失败模式映射到audio-LLM的处理阶段: - 音频路径探针(linear probing on encoder/projector)诊断感知失败(F1)。 - 层间logit lens读取残差流中的韵律类别,诊断内部解释(F2)。 - 行为读出比较文本无韵律基线、文本+韵律参考和音频条件下的最终答案,诊断决策使用(F3)。
论文进一步采用因果干预(方向注入、激活修补)验证潜在表征的因果作用,并用稀疏自编码器(SAE)+ 因果归因(AtP*)定位可恢复信号的特征子空间。
该论文系统性地定位了audio-LLM韵律失败的环节,提供了因果证据和可控干预方法,揭示了“听得到但用不上”的普遍瓶颈,对韵律敏感的多模态模型诊断与改进具有重要价值。
持续声学监测需要在低功耗、低延迟和部署简便性条件下实现始终在线的推理,传统CPU/GPU方案在能耗和时延上难以满足工业长期监测需求。
提出基于自动编码器的声学异常检测系统,在Intel Loihi 2神经形态处理器上完成归一化、推理、L1重建得分及阈值判定。模型采用全连接自动编码器结构,权重量化为8位整数,激活和累加器限制在24位范围,通过定点算术实现高效计算。特征提取(log-mel)在片外完成,片上处理保持低功耗。
在干净ToyADMOS ToyCar基准上,片上模型达到AUC 0.9959和pAUC 0.9785(FPR≤0.1);在DCASE 2026 Task 2 ToyCar噪声基准上,源域AUC 0.7990、目标域AUC 0.6466、pAUC 0.6426,均超过基线。功耗测试显示每样本动态能量仅0.0406–0.0426 mJ,比CPU和GPU低两个数量级,支持实时处理。
该研究验证了神经形态处理器在低功耗持续机器声学监测中的实用价值,为边缘端异常检测提供了高效能方案。
蝙蝠是生态系统健康的关键指示物种,但因其隐秘的夜行性生活,被动声学监测是必要手段。然而,回声定位叫声受行为、环境影响,种间重叠严重,自动识别困难。现有分类器多为封闭集,无法处理训练中未出现的物种;且数据长尾分布导致稀疏物种性能评估不稳定。
提出ChiroEcho框架,采用共享EfficientNet-B3声学编码器,联合物种和属级分类头。推理时,将属级预测与地理分布结合:当某属在预测地点仅有唯一物种时,可解析出训练中未见的物种。该方法将地理信息从约束预测转变为扩展有效分类法的工具,是开放世界生物声学分类的新范式。
基于涵盖35种欧洲蝙蝠的ChirosetEurope数据集,闭集分类评估验证了模型性能,并分析了稀疏物种性能评估的不稳定性。受控留出实验证明,结合属预测和位置信息可识别未参与训练的物种。操作覆盖率从73%提升至85%(覆盖41/48欧洲本土物种),为目前欧洲蝙蝠自动分类的最广覆盖。
本文通过粗粒度预测与外部地理约束的巧妙结合,突破了封闭集分类限制,为细粒度未见类的识别提供了通用原则。
传统多模态大语言模型(MLLM)的构建依赖多阶段 pipeline(跨模态对齐、监督微调 SFT、偏好优化),需要大量任务特定监督,且后训练阶段会使 LLM 原有的通用指令跟随能力逐渐退化。此外,每次更新 LLM 骨干都需要重新运行昂贵的后训练 pipeline。
本文提出 Instruction-Free Alignment-Only 训练框架,用于构建通用音频语言模型(LALM)。核心思想: - 完全冻结音频编码器和 LLM,仅训练一个轻量投影器(projector),将音频表示映射到 LLM 的输入嵌入空间。 - 去除所有任务指令(instruction-free),迫使投影器直接将音频表征与 LLM 的潜在语义空间对齐。 - 采用 Self-Generated Data Construction 机制:将音频对应的 caption 作为语义代理(semantic surrogate),利用冻结的 LLM 无条件生成自由形式的响应文本,作为训练目标。该过程完全自动,无需人工编写指令、任务模板或监督标注。
本文通过“仅对齐、无指令”的极简训练方式,证明了竞争性音频语言模型可以从完全冻结的编码器和 LLM 中涌现,将多模态扩展简化为了轻量投影器训练问题,具有极高的效率和泛化潜力。
当前助听器声学场景分析使用多个独立估计器(如场景分类、VAD、SNR估计等),计算复杂度高,且无法利用相关任务间的依赖信息,导致资源浪费和性能受限。
提出一种统一且可解释的声学场景表示:将混合频谱分解为语音、音乐和噪声的功率成分,通过低复杂度因果CRNN估计每个时频点的相对功率比例,再结合混合功率得到各成分的功率谱估计。该表示保留了频域和时域的细节,且无需完整源分离,支持多种下游任务(如VAD、SNR估计、场景分类)通过简单后处理获得。
在开发集上,整体水平误差(LE)为1.40 dB,Pearson相关系数(PCC)为0.891;在未见数据集(含HEAR-DS、TIMIT等)上为1.71 dB和0.875。以VAD为下游任务时,性能与SOTA估计器相当,但提供的场景描述更丰富。此外,模型在有噪声和音乐并存时能准确捕捉频率相关的功率分布。
该工作通过统一的功率分解框架替代多个独立估计器,兼顾计算效率和任务间依赖性,为助听器声学场景分析提供了新思路,具有实际应用潜力。
传统特征提取器(如MFCC)依赖乘法运算和FFT等复杂算子,计算开销大,难以部署在资源受限的TinyML平台上。虽然已有基于CNN的自适应特征提取器,但其需要大量训练且同样涉及乘法。
论文提出一种无乘法特征提取器 next iRDT (improved Reaction-Diffusion Transform),仅使用加法、减法、绝对值、移位等简单算术运算。其核心是1D Laplacian算子,通过延迟列表(chan)和滑动窗口(w, win_per_segm)生成2D频谱图。算法复杂度约为 O(5mN)(m为通道数,N为信号长度),相比MFCC低一个数量级以上,且易于硬件实现,占用极少的逻辑门资源。
在Google的12类KWS数据集上进行验证,使用DS_CNN和VRES分类器,iRDT与MFCC和基线[8]的自动编码器FE精度相当。在完整数据集上,iRDTv-B1版本配合VRES分类器达到94.7%的验证精度,优于基线MFCC的91.04%。特征提取时间比MFCC快约60倍,且硬件实现简单,适合超低功耗边缘设备。
一种极简、无乘法、超低复杂度的特征提取器,为TinyML上的关键词识别提供了高效方案。
多模态基础模型虽然能处理语音和面部情感识别,但内部机制不明,缺乏证据表明它们是通过共享的神经元还是各自独立的通路来实现情感识别。
提出在三个多模态基础模型(Gemma-4-12B-it, MiniCPM-o-4.5, Qwen2.5-Omni-7B)中识别情感敏感神经元(ESNs)的方法。将ESN分为声学ESN(A-ESN)和视觉ESN(V-ESN)。利用对比激活边际(ConAct)选择稀疏神经元,并通过去激活和引导两种干预验证其因果作用。进一步通过跨模态迁移实验检验声学和视觉ESN之间的功能共享。
该研究提供了跨模态情感功能单元的首个激活级分析,表明语音和面部情感识别在解码器层级部分收敛于稀疏的共享组件。
个体化 HRTF 测量成本高昂且难以大规模实施,通用 HRTF(如 KEMAR)会显著损害空间听觉,因此需要可靠的合成 HRTF 生成与验证方法。
数值上,合成 HRTF 的 ITD/ILD 偏差小于 KEMAR,但在低仰角区域存在较大谱失真,可能与缺少躯干几何有关。计算模型预测合成 HRTF 的定位误差介于测量 HRTF 与 KEMAR 之间。在 VR 定位任务中,合成 HRTF 在全部极性指标上与测量 HRTF 无显著差异,而 KEMAR 显著更差;行为误差主要集中在前-后中线上,而非数值预测的低仰角区域。空间释放掩蔽任务未表现出 HRTF 类型间的显著差异,表明功能性空间听觉得以保持。
该研究首次在大规模人群上综合数值、计算和行为方法,证明了合成 HRTF 在行为层面的有效性,为个性化空间音频的实用化提供了关键证据。
现有大型音频语言模型(LALMs)在标准化基准测试中表现优异,但在实际媒体工作流(如策展、归档索引、内容分发)中部署不足。音频章节化(audio chapterization)——将连续音频流分割为主题连贯的章节——是一项关键且具有商业价值的任务,其边界由主观编辑判断而非客观声学事件决定,要求模型在长音频上下文中进行顺序推理,并近似创作者标注的边界决策。现有基于ASR+文本LLM的级联方法仅适用于语音主导的内容,难以泛化到音乐、游戏、动态媒体等 heterogeneous 音频。
本文首次将强化学习(GRPO)与思维链推理结合用于音频章节化,显著提升了LALM在真实媒体任务中的对齐能力,并提供了完整的数据集与基准,是该领域的开创性工作。
I2S协议是设备内集成电路间传输实时数字音频的常用协议,但缺乏内置错误检测,传输故障(如时钟抖动、位滑动、字长错误)难以通过传统可视化方法识别。随着物联网音频(IoS)发展,数据量增大,低层传输错误检测变得至关重要。
提出一种基于Audification的声化设计,将I2S协议的三条信号线(SCK、WS、SD)映射为声音:过采样实现时间重缩放使信号进入可听范围,左右声道分别呈现结构信息(SCK+WS)与有效载荷(SD),以增强故障感知。通过生成模拟I2S信号,覆盖多种错误条件(抖动、位滑动、字长错误)和有效载荷类型,并提取音频特征进行聚类分析。
计算分析表明,过采样会引起特征值系统性变化,但并未显著改善错误类之间的可分离性;然而,联合表示(左右声道特征拼接)相比单独声道有适度且一致的改进,说明互补信息流的整合比单纯信号缩放更重要。研究为后续感知测试提供了特征空间可分离性的初步证据。
首次探索I2S传输故障的声化检测,虽未直接证明过采样的收益,但验证了多通道联合表示的潜在优势,为IoT设备故障检测提供了新思路。
将跨会话正对对比学习与变分正则化巧妙结合,在EEG语音解码中显著提升识别率,为多会话场景提供了新思路。
现有DNN双耳语音增强在降噪时可能扭曲双耳线索(ILD和IPD),而现有损失函数分别计算ILD和IPD误差,存在相位包裹问题,无法全面捕捉掩蔽引起的失真。
实验表明,与仅使用降噪损失和基线线索损失(ILD+IPD)相比,两种提出的损失都保持了较强的降噪性能(SI-SDR, MBSTOI),并降低了掩蔽引起的失真(L_BRE)。其中联合BC损失在ILD保留上也优于基线。
这是一项在DNN双耳语音增强中改进空间线索保留的创新损失设计,在降噪与空间感知之间实现了更好的平衡。
高保真 Ambisonic 编码需要密集、规则的麦克风阵列,但可穿戴或嵌入式设备通常只有少量、位置不规则且受边界条件约束的麦克风。这种稀疏阵列导致球谐域编码的逆问题病态化:伪逆滤波会放大噪声,而确定性神经网络可能过拟合特定阵列响应或平滑模糊高阶分量。
本文提出 DiffM2A,一种基于物理信息扩散的几何自适应条件框架,用于从拓扑可变的稀疏麦克风阵列中鲁棒地估计 Ambisonic 系数。核心创新包括: - GASHP 前端:构造边界感知的球谐转向函数,通过能量归一化模态投影将阵列观测映射到公共模态表示,避免显式伪逆计算。 - 双分支 EDM(Elucidated Diffusion Model):同时以原始麦克风谱和 GASHP 特征为条件,估计复数 Ambisonic 系数,将病态编码视为观测条件下的估计问题。 - 空间正则化损失:引入低阶声强一致性和高阶旋转等变性损失,增强通道间相位一致性和 SH 子空间的结构化变换。
在一阶和二阶 Ambisonic 编码任务中,使用模拟房间声学和真实 LOCATA 录音进行评测,DiffM2A 在信号保真度、频谱精度、空间相干性和双耳线索保持方面均优于传统和神经基线方法。额外的实验表明,在未见过的五麦克风布局和失配的开阵/刚球边界模型下,性能优势仍然保持。
本文通过物理信息扩散模型,为稀疏、变拓扑麦克风阵列提供了一种稳健的高阶 Ambisonic 编码新范式,有效解决了传统伪逆方法的噪声放大和神经网络的过拟合问题。
该工作通过文本可预测性引导的迭代精炼,有效实现语义语音标记的说话人归一化,同时保持生成质量。
现有语音检索系统依赖固定相似度匹配,无法适应用户的多样化意图(如按内容、说话人、风格、背景等),需要指令感知的检索框架。
INSPIRE填补了语音检索中指令感知研究的空白,为开发统一检索架构提供了重要基准和方向。
传统前馈主动噪声控制(ANC)技术对平稳噪声有效,但对高度非平稳的语音信号跟踪性能不足。标准FxLMS算法使用瞬时梯度,难以应对语音信号的剧烈变化;RLS和仿射投影方法虽利用历史数据,但计算成本高且可能不稳定。
提出基于语音时间序列预测的主动语音抑制方法(SP-FxLMS)。该方法利用神经网络预测未来参考和期望信号,并将预测信号与当前、过去信号结合用于控制滤波器更新。具体包括: - 扩展FxLMS,引入未来和过去信号的梯度计算,权重由遗忘因子控制。 - 提出可变遗忘因子,根据输入功率自适应调整权重。 - 使用简单MLP作为时间序列预测器,预测未来多个样本。 - 复杂度分析显示,所提算法在合理预测长度下计算开销可控。
在自由场环境中使用LibriSpeech语音数据进行了数值实验。结果表明: - 使用真实预测信号时,SP-FxLMS和利用过去信号的FxLMS P均优于标准FxLMS,平均NPR更低。 - 预测长度超过2个样本时,结合过去信号的优势明显;平均NPR随预测长度增加而下降,并在128样本左右收敛。 - 固定遗忘因子比可变遗忘因子表现更好,说明在有限预测长度下,引入遗忘因子的收益不大。 - 使用神经网络预测信号时,整体趋势与真实预测情况一致,验证了方法的可行性。
本文通过引入语音时间序列预测,显著提升了前馈ANC对非平稳语音的抑制性能,为主动语音抑制提供了新思路。
直接使用大型语言模型(LLM)对ASR的N-best列表进行重打分成本高昂,因为需要对每个假设进行自回归概率评估,增加延迟和部署复杂度。现有的生成式纠错(GER)或知识蒸馏(KD)方法需要额外训练,不适应无法重训练声学模型的部署场景。
提出缓存LLM概率检索(Cached LLM Probability Retrieval):离线阶段,本地教师LLM对ASR相关的上下文-目标词对打分并存储概率;在线阶段,通过查表、回退策略和选择性直接打分来利用这些概率。该方法无需训练,可与现有识别器无缝集成,无需修改声学模型。具体包括: - 缓存键为上下文token序列和目标token ID,存储对数概率; - 缺失键时采用短上下文回退(K→K/2→…→1); - 选择性策略在分数差小于阈值时允许在线调用LLM处理重要缺失; - 与检索n-gram特征融合,并使用插值权重。
缓存LLM概率检索是一种轻量级、无需训练的ASR适配方法,有效利用LLM语言先验,在众多场景中优于1-pass解码,且部署成本低。
CineDub 通过隐式耦合整体条件与课程学习,实现了无需复杂预处理的可扩展端到端多说话人视频配音与连贯声效生成。
本文研究中文象形文字(语素文字)中笔画数是否符合Zipf缩写定律,并从编码理论角度量化其压缩效率。
该研究将信息论编码界限引入语素文字书写系统,为理解书写系统的结构代价与压缩权衡提供了严谨的量化框架。
非洲象(Loxodonta africana)和亚洲象(Elephas maximus)分别被列为濒危和极度濒危物种,其种群数量下降主要由栖息地破坏和非法狩猎导致。自动化的象叫声分类有助于行为研究、种群分布监测和野生动物保护,但标注数据稀缺,尤其是亚呼叫类型(subcall)的标注需要结合行为背景(如现场观察或视频),导致标注成本极高,传统深度学习方法难以充分利用有限数据。
本文提出一种无参数(parameter-free)的近期质心分类(nearest-centroid classification)方法,用于大象叫声的小样本(few-shot)分类评估。核心思路是:不训练任何可学习参数,而是将每个类别表示为支持集(support set)嵌入向量的均值,查询样本在平方欧氏距离下分配至最近的类别质心。评估采用N-way k-shot的情景化(episodic)协议,并使用预训练的固定嵌入(Perch ver.1、Perch ver.2、HuBERT base layer 2)以及传统MFCC特征作为输入。该方法与全监督基线(逻辑回归、RNN、端到端模型)在相同交叉验证协议下进行比较,以确定在标注样本数量变化时,简单分类器与训练分类器的优劣拐点。此外,通过非参数自助法(bootstrap)对随机支持集导致的采样噪声进行量化,给出1%~99%百分位区间;并分析每类标注样本不均衡(即支持集不完整)的影响。
本文证明当标注样本极少且固定嵌入已包含类别区分特征时,无参数的最近质心分类器比有训练参数的分类器更优,为低资源生物声学分类提供了实用且可靠的基线。
当前音乐基础模型(Music Foundation Models)常作为冻结的音频特征提取器,但层选择(Layer Selection)仍依赖启发式方法:要么默认用最后一层,要么手动选择中间层,要么直接做多层融合。这种缺乏原则性的做法导致我们难以理解:为什么某些层的表示在下游任务上迁移得更好?表示质量如何随深度和预训练范式变化?
本文首次系统性地对 12 个音乐基础模型(覆盖掩码建模、自回归建模、对比学习三种预训练范式)进行逐层内在性质分析。作者提取隐藏表示后,从几何与谱属性(如内在维度、有效秩、各向异性、时间曲率)、增强条件判别性与不变性、以及音高移位等变性三个视角刻画表示质量。尤其重要的是,他们发现现有内在指标在调性任务(如调性估计、和弦识别)上全部失效,因此专门提出了一种音高移位等变性度量,能够跨模型家族一致地指示调性表示质量。
通过将无标签表示质量指标与 15 个下游任务上的逐层性能进行关联,发现内在维度、曲率和基于不变性的指标在流派分类、情感识别、自动标注和节拍跟踪等任务上能有效跟踪层质量,但相关性强度随任务和预训练范式变化。所有标准指标在调性任务上均失败,而提出的音高移位等变性度量填补了这一空白。此外,作者证明内在指标可以作为有效的无标签层选择代理,甚至无需训练即可减少穷举探测开销,同时在数据受限时匹配或优于可训练的多层融合方法。
该论文首次通过内在属性系统分析音乐基础模型的逐层表示,提出了一种无标签的层选择代理方法,并创新性地引入音高移位等变性解决了调性任务上的指标盲区,为冻结特征提取器的层选择提供了全新视角。
真实世界中的音频-视觉语音增强(AVSE)面临严峻挑战:现有方法在模拟数据集上表现优异,但直接应用于真实录音时性能大幅下降。真实场景中自然存在说话人重叠、声学干扰、房间混响以及视觉退化(如低分辨率、遮挡、缺帧、同步问题)等复杂因素,导致紧密耦合的音频-视觉分离系统不可靠。
提出一种解耦的分离-关联(separation-then-association)两阶段策略,将语音分离与说话人关联解耦: - 第一阶段(分离):使用纯音频模型 TF-GridNet 对混合信号进行多说话人分离,不依赖任何视觉信息,避免退化视觉特征干扰分离过程。 - 第二阶段(关联):利用预训练的音频-视觉对比模型(AV-CLIP)进行帧级跨模态相似度匹配,计算每个分离信号与目标说话人面部视频的对应关系,选择相似度最高的信号作为增强结果。
该方法的优势在于:(1) 分离与关联模块可独立训练,能充分利用大规模纯音频数据和有限的音视频数据;(2) 对比模型只需解决相对简单的说话人关联问题,而非更难的分离问题。
在 Real-World AVSE Challenge 数据集上的评估验证了所提方法的有效性(原文未给出具体数值指标,但表明该方法表现优异)。实验设置包括:使用 Libri2Mix 预训练分离模型并用挑战赛的 remix 数据微调;使用 LRS3 数据集训练 AV-CLIP,其中 WavLM-Large 和 3D-ResNet18 的特征提取器冻结,仅训练投影层和 Transformer 编码器。
一种务实且有效的解耦设计,通过“先分离后关联”规避了视觉退化对分离过程的干扰,为现实场景下的 AVSE 提供了一种可靠方案。
传统的音乐源分离系统通常只提取单一的音轨,无法区分多个歌手。在多歌手混合场景(如二重唱)中,人声在时间和频率上重叠,导致标准模型难以分离出特定歌手的声音。
提出了一种歌手感知(singer-informed)的语音源分离框架,利用目标歌手的简短注册录音来引导分离过程。具体包括: - 歌手嵌入模型:从注册音频中学习固定维度的歌手身份表示。 - 条件机制:通过特征拼接或特征级线性调制(FiLM)将歌手嵌入注入到分离模型中,使模型专注于目标歌手并抑制干扰。 - 数据集构建:基于DAMP-VSEP构建了二重唱数据集,通过质量过滤(DNSMOS)和非重叠注册片段选择,并合成了额外的二重唱训练数据。
该工作首次在多歌手混合中引入歌手注册信息,通过嵌入条件化实现了精准的目标人声提取,并提供了高质量的二重唱数据集。
从任意且可能不足或不完整的麦克风阵列测量中,将房间冲激响应(RIR)编码为高阶 Ambisonics(HOA)表示本质上是一个病态问题。对于空间捕获能力有限的阵列(例如不规则或稀疏阵列),经典线性方法(如最小二乘投影)因阵列孔径不足、空间混叠等问题,往往无法重建高阶空间细节,导致重建精度受限。
本文提出了一个基于扩散的生成框架,用于解决上述逆问题。其核心创新包括:
本文首次将设备无关的扩散生成先验与后验采样相结合,成功实现了任意麦克风阵列的高保真 HOA RIR 编码,为可扩展声学仿真和空间音频应用开辟了新路径。
当前实时 AI 即兴系统缺乏人类音乐家依赖的通信意识,大多将交互策略事后叠加到生成算法上,而非作为基础设计关注。缺乏形式化、机器可读的与音乐家的通信模型。
该工作为研究人类音乐家通信提供了实证资源,并可能启发将通信作为算法设计核心的生成式AI音乐伙伴。
当前音乐语料库研究多集中于和声或节奏等单一维度,且主要集中在英语流行音乐,对巴西流行音乐(MPB)的全面、多参数数据集极为缺乏。
本文构建了MPB Corpus,包含500首巴西流行音乐作品,覆盖旋律轮廓、旋律节奏、和声以及旋律-和声关系四个维度。为此提出了专门的分析模型(如Genera of Chord Types),并设计了可视化与统计摘要方法。该数据集是迄今最全面的巴西音乐计算音乐学数据集。
初步的探索性数据分析展示了数据集在揭示MPB风格特征和作曲家个人差异方面的潜力,并采用基于置换的统计检验验证了观察到的节奏差异的显著性。
本文为巴西流行音乐的系统性计算研究提供了首个多维度、大规模的数据集,是MPB音乐学量化研究的重要开创性工作。
传统语音语言模型多为轮次式(turn-based),缺乏实时交互能力(如用户打断)。端到端双工模型(S2S/S2T)虽降低延迟,但需联合优化ASR、打断处理与高质量语音合成,导致语音质量下降,且牺牲模块化与可调试性。
提出 VoiceChat-TTS,一个连续、可流式、低延迟的TTS模型,直接消费LLM文本token流,通过控制token支持显式打断,无文本时生成静音,实现全双工交互。 核心改进基于Audio Flamingo 3-Chat的流式语音解码器: - 音频编解码器:全因果卷积,22kHz波形,12.5Hz帧率(80ms/帧),31码本RVQ,支持流式推理。 - 文本Tokenizer:Nemotron Nano 2子词分词器,增加BOS和打断token,文本流领先音频流一个token。 - 字符感知子词编码器:处理LLM词表中罕见或未登录子词,提高泛化与发音准确性。 - 混合高斯估计头(MoGH):迭代解掩码RVQ token,避免31步自回归解码,4-8次迭代即可高保真重建。 - 音频提示条件:用3秒参考音频作为说话人提示,解决初始阶段说话人身份推断不足的问题。 - 边界嵌入与门控融合:为BOS/打断token加入可学习嵌入,并通过门控融合稳定数值,避免混合精度溢出。
论文称VoiceChat-TTS在语音质量上达到与强离线/流式基线竞争的水平,同时满足交互代理的延迟与打断处理需求。(截取部分未提供具体数值)
VoiceChat-TTS为交互代理提供了低延迟、可打断、连续语音合成的有效方案,兼顾高质量与模块化。
现有 SSL 前端用于音频深度伪造检测时,通常通过全局平均池化或注意力加权聚合帧级嵌入,丢弃时序信息。合成语音由 TTS/VC 生成,缺乏真实语音的生理约束(如呼吸、发音结构),因此其在 SSL 空间中的轨迹动态可能偏离真实语音。现有方法或依赖局部伪影(如 FGFM、BreathNet),或需要伪造语音监督(如 SLIM),尚未有方法显式建模整个话语轨迹的全局生理合理性。
提出两阶段检测框架:Stage 1(单类轨迹模型)仅用真实语音训练因果 LSTM 下一帧预测器,以预测误差作为异常分数;Stage 2 冻结 Stage 1 的 LSTM,提取隐藏状态训练 MLP 进行有监督分类。为隔离时间建模的贡献,设计了基于同样特征的静态基线(全局平均池化+质心距离),通过对比动态与静态方法验证轨迹动力学的有效性。
在 ASVspoof 2019/2021、Codecfake、In-the-Wild、MLAAD-EN 和 DE2024 上取得有竞争力或 SOTA 性能。ASVspoof 2021 上取得 0.75% EER 的最佳结果;DE2024 上仅用真实语音训练的 Stage 1 以 30.35% EER 超越相同骨干的有监督基线。在近域基准上,动态与静态性能相当;在跨域基准上,轨迹动态带来显著提升,验证了时间生理约束的检测价值。
通过因果 LSTM 建模真实语音轨迹,无需微调骨干网络或伪造语音监督,即实现强大的跨域音频深伪检测,为生理信号融入伪造检测提供了新思路。
流式自动语音识别(ASR)在域偏移的目标音频(如财务电话会议、国际英语、窄带客服对话)上性能不佳,而准备域内标记数据成本高,未标记音频丰富,需要半监督方法进行域适应。
提出StreamHear,一个三阶段半监督流水线: 1. 教师微调:在标记域内数据上微调离线transducer教师,使其适应目标域。 2. 伪标签生成:用微调后的教师对未标记音频贪心解码生成伪标签,可选的置信度过滤。 3. 学生微调:在标记数据和伪标签数据的混合上微调缓存感知的流式transducer学生。
此外,引入先验正则化的动态规划(DP)重对齐步骤,修复基于CTC分割的块级单词放置错误,利用ASR假设锚点重新分配单词到块。
与迭代伪标签方法不同,StreamHear每个阶段仅执行一次,无需辅助机制。
在四个数据集(Earnings-21, Earnings-22, SPGISpeech, BankCall)上,StreamHear始终优于监督学生微调,将单词错误率(WER)降低0.18到0.88个百分点(标记测试集),并在未标记集上降低0.44到1.85个百分点。与离线教师相比,StreamHear将测试集差距缩小到0.95pp以内,未标记集差距缩小到0.11pp以内,在Earnings-22未标记集上几乎匹配离线教师(9.56% vs 9.55%)。
StreamHear是一种简单高效的半监督流式ASR域适应方法,通过单个阶段的教师-学生伪标签传递,显著提升流式模型的目标域性能,无需复杂迭代或辅助模型。
论文还包含多项消融实验,验证对齐校正、伪标签池大小、上下文敏感性、不同延迟重训练以及流式学生架构的鲁棒性。
现有文本到语音生成(TTV)模型存在两大挑战:1) 生成语音的多样性不足,难以覆盖真实人类说话人和虚构角色(如怪物、机器人等);2) 缺乏鲁棒且灵活的语音编辑能力(如语音克隆、情感和语气修改)。
本文提出 VoiceDesigner,一个统一的文本到语音生成与编辑框架。主要创新包括: - 混合数据流水线:结合数字信号处理(DSP)技术和生成式语音模型,构建覆盖真实与虚构声音的多样化语音数据集,并生成编辑配对数据。 - 改进的扩散Transformer:基于MM-DiT架构,引入Token级AdaLN和3D旋转位置编码(3D-RoPE),以更好地协调指令、文本、音频参考等多种条件信号,支持生成、克隆和编辑的统一建模。 - 统一任务框架:在一个扩散模型中同时支持语音生成、语音克隆和语音编辑,降低训练和部署成本,并促进任务间知识迁移。
通过主观和客观评估,VoiceDesigner在语音描述和编辑指令的提示对齐方面优于现有SOTA TTV模型,同时保持有竞争力的感知质量和语音可用性。
VoiceDesigner通过统一扩散建模和混合数据增强,有效解决了TTV中声音多样性和编辑可控性问题,是面向创意场景的实用语音设计工具。
基于自监督学习(SSL)的语音表示在帕金森病(PD)检测中虽在单一语料库内表现优异,但模型可能利用数据集特定混杂因素(如语料库身份、说话人身份、录音条件等)而非真正的病理特征。此外,现有SSL模型几乎仅在健康语音上预训练,且以往评估仅对比健康对照,未检验模型是否对神经退行性疾病具有特异性。
提出五场景评估框架,逐步引入分布偏移(如重复录音、录音条件、语言、任务、病理变化),使用冻结SSL编码器 + 逻辑回归探针进行跨语料库、跨语言、跨任务评估。选取九个SSL骨干(涵盖容量、ASR微调、预训练语言三个维度),在三个语料库(西班牙语、德语、捷克语)上训练PD分类器,并迁移至独立的德语TREND队列(包含PD与痴呆症患者)。关键设计:在基准场景(REF)中按语料库、骨干、任务分别选定最优层,并在所有迁移实验中固定该层,确保差异源于分布偏移而非层选择。
该论文通过严谨的多场景迁移实验揭示了基于SSL的语音PD检测在跨语料库泛化中的关键缺陷,强调了病理特异性不足的根本问题,为临床可靠部署敲响警钟。
现有自动口语评估(ASA)系统多依赖大规模多模态语音大模型,计算开销大,且对声学与内容信息的贡献分析不足。部分系统虽避免使用LLM,但需复杂多模块流程和手动特征,可迁移性差。
提出CASA(Content-Acoustic Speaking Assessment)架构,采用双分支设计:声学分支使用冻结的Whisper-medium编码器(搭配LoRA适配),输出四个声学soft token和脱附的声学CEFR估计文本;内容分支使用冻结的Qwen3.5-2B LLM,处理ASR转录和任务提示,结合三个流畅度特征(时长、静默比、语速)。通过前向融合(无文本生成)和线性头预测分数。训练损失为均方误差加带容忍边界的辅助损失,显著降低计算量,仅3.13B参数。
在S&I测试集上,CASA取得RMSE 0.358,略优于SOTA(0.360),但推理参数约减半。通过消融分析,验证了声学与内容特征的互补性,并指出模型容量并非性能瓶颈。CASA-Crisper在低水平(A2)上改进明显,但高水平(C1)下降。
CASA以更小模型提供可解释的声学-内容分离,为通用ASA提供简洁高效的基线。
本文首次对印度22种语言进行自发语音检测和跨域合成语音泛化的系统研究,揭示了编码器表示与语言辨识度之间的权衡,并为真实场景下的deepfake检测器提供了数据选择指导。
连续流匹配(CFM)SE
首次在统一的实验设置下,使用多样化的侵入式和非侵入式指标,对这六种范式进行全面、公平的评估和交互分析。
提出了一种微调策略,在重建语音上添加辅助损失(包括频率域 Braun 损失、时域 L1、可微 PESQ 和 STOI 损失),以进一步提升模型性能。该微调仅更新 LM 参数,不需要更新预训练 codec 模型,保持了模型的高通用性。
在离散域模型中,使用直通估计器(STE)处理 token 估算,使辅助损失能够端到端传播。
该论文通过提出统一框架、首次公平比较和辅助损失微调策略,系统性地重新审视了基于 LM 的生成式语音增强在神经音频编解码器潜在空间中的设计,证明了连续特征和辅助损失的有效性,是该领域一项扎实而全面的贡献。
智能眼镜作为一种可穿戴设备,为日常 AI 辅助提供了自我中心(egocentric)的音频感知平台。然而,在真实世界条件下,其语音处理面临诸多挑战:动态声学环境、说话人重叠、以及佩戴者为中心的录音几何带来的空间模糊性。现有语料库和基准(如 AMI、ICSI、AISHELL-4、AliMeeting、NOTSOFAR-1)主要针对固定位置录音,无法反映可穿戴设备的变异性;而最近的智能眼镜基准(如 WearVox、CHiME-8 MMCSG)要么关注人机语音交互,要么仅推进说话人属性识别,均未统一评估转录和口语理解。此外,中文自我中心多说话人语音的公共基准覆盖仍然有限。
本文介绍了 IEEE SLT 2026 智能眼镜挑战赛(SmartGlasses Challenge),这是一个针对可穿戴设备的中文自我中心多说话人语音处理挑战赛。主要创新点包括:
论文仅摘要部分提供了初步发现: - 严重的说话人重叠仍是影响 TSA-ASR 性能的主要因素; - 在复杂 SLU 设置中,当前音频语言模型(ALM)在副语言声学理解方面仍面临困难。
具体结果将在比赛结束后公布于挑战赛官网。
本文通过引入智能眼镜挑战赛和配套数据集,为自我中心多说话人语音处理提供了统一的联合评估基准,揭示了该领域的关键瓶颈。
现有大规模ASR模型对普通话识别准确率较高,但对方言识别能力有限;直接进行方言适应虽能降低方言CER,却可能显著提高普通话CER,造成方言能力与普通话能力的权衡。
提出了一个三阶段适应框架:1) 持续预训练(CPT)适应大规模普通话语料;2) 方言监督微调(SFT)增加方言数据权重以降低方言CER;3) 在线自蒸馏(OPSD)作为最终精炼目标。OPSD通过让学生在自解码前缀上训练,同时冻结教师模型以参考转录作为特权上下文提供软token级目标,解决了自回归ASR中训练与测试不匹配的问题,并用蒸馏替代硬交叉熵更新,从而在提升方言识别同时保持普通话性能。
基于Qwen3-ASR-1.7B实例化,在公共和内部普通话语料及方言测试集上评估,OPSD在匹配的精炼数据与调度下,实现了方言CER下降且普通话CER不升,而继续教师强制微调则导致普通话CER上升。
通过在线自蒸馏的软目标与自身解码前缀训练,有效平衡了多方言ASR中的方言提升与普通话保持。
生成同时包含语音、音乐和音效的连贯音频场景是多模态生成领域的一大挑战。现有方法通常采用独立组件级联的流水线(如冻结文本编码器接音频解码器),导致跨模态优化受限,尤其语音可懂度较差。此外,许多任务统一模型虽然支持多种音频类型生成,但无法建模音频事件间的时间协同、能量平衡和声学一致性。
首个端到端训练的通用文本到音频场景生成框架,显著提升语音可懂度,兼顾多语言和可变长度生成,展示了LLM与流匹配结合在复杂音频生成中的潜力。
传统相对传递矩阵(ReTM)估计仅依赖协方差矩阵方法,在多源、多麦克风场景下精度有限,且未充分利用深度学习的建模能力。
本文提出三种监督学习框架用于ReTM估计: 1. SCoNet:基于STFT域的深度可分离卷积网络,沿时间和通道维度进行二维卷积。 2. FuSNet:基于时域的卷积滤波求和网络,使用可学习的1D卷积核直接建模ReTM的时域冲击响应。 3. LAeNet:基于LSTM的自编码器网络,利用共享双向LSTM逐频带处理STFT特征,并通过全连接网络估计ReTM系数。
训练采用时域SDR损失与频域RSE损失的加权联合优化。
在多种场景(不同噪声源、不同麦克风数量)下,相比协方差基线方法: - FuSNet在多数场景中取得最优的SDR、MSE等指标; - SCoNet和LAeNet性能与基线相当或更优; - FuSNet具有最低延迟和最少参数量。
首次将深度学习引入ReTM估计,显著提升多源多麦克风场景下的估计精度,并验证了其在语音增强中的有效性。
当前主流的TTS系统基于自回归(AR)编解码语言模型,存在三大结构性问题:1) 串行解码导致延迟随音频长度线性增长,且RVQ token网格本身无顺序结构,AR模型必须施加人为生成顺序;2) 暴露偏差与错误累积,采样错误会冻结在前缀中并传播,导致跳词和重复;3) 固定生成顺序阻碍双向细化,无法原生支持语音编辑等填充式操作。尽管已有NAR替代方案(如流匹配、掩码生成模型),但与通用语言模型的预训练配方和基础设施脱节,缺乏规模化验证。
本文提出 Luna-TTS Family——基于扩散语言模型的TTS家族,在1百万小时中、英、日、韩多语言语音上预训练。核心创新包括: 1. 完全非自回归的Luna-TTS:在完整RVQ token网格上采用无限制随机掩码扩散训练,通过基于置信度的迭代并行采样解码,固定步数生成整个网格,天然支持零样本语音克隆和语音编辑。 2. 流式块自回归的Luna-TTS Realtime:基于块扩散目标,在块间因果(支持KV缓存和增量传输,块大小1.28秒),块内并行去噪,实现流式生成,首次块延迟仅41.6ms,RTF达0.024。 3. 渐进式适配方法:从预训练的AR文本LLM(Qwen3-0.6B)出发,通过持续训练依次转换为双向注意力、块因果注意力,使两个变体共享同一tokenizer、数据管道和0.6B骨干,继承强大文本能力。 4. 情感与非语言发声控制:通过退火微调阶段引入对情感和NVV的显式控制,将话语塑造成连贯的声音表演。 5. RL后训练:将GRPO扩展到掩码扩散TTS,在实现的去噪轨迹上定义策略比率,优化内容正确性和说话人相似性的组相对奖励。
在Seed-TTS-Eval基准上,Luna-TTS在所有四项指标上均超越对比的开源和商业系统:测试中文CER 0.73、SIM 79.7,测试英文WER 1.49、SIM 76.8。在更难的真实场景CV3-Eval上,也取得最低的中英文错误率。在表达控制评估中,在大多数客观、基于模型和人工评分指标上达到最好结果(NVV和情感控制)。Luna-TTS Realtime在本地服务协议下,端到端RTF为0.0240,首个1.28秒音频块提交仅需41.6ms,实现超过40倍实时生成。
Luna-TTS Family是首个将大规模扩散预训练与流式块解码结合的生产级TTS系统,通过渐进式适配和RL后训练,在质量与效率上全面超越现有自回归基线。
低延迟、低计算量的语音增强对可穿戴设备至关重要,但严格的计算约束严重限制了设备端性能。知识增强(Knowledge Boosting)通过利用服务器端模型提升边缘模型性能,但现有方法在语音增强任务中的性能提升有限。
本文提出一个协作框架,包含三种关键技术: 1. 延迟服务器输出作为额外输入:将服务器端增强后的音频作为辅助参考输入,为边缘模型提供干净但延迟的先验信息。 2. 分层特征提升(Layerwise Feature Boosting):通过特征线性调制(FiLM)将服务器中间层表示迁移至边缘模型,在多个深度提供分层指导。 3. 协作多通道维纳滤波(Collaborative MCWF):融合服务器和边缘模型估计的加权协方差矩阵,利用服务器模型优越的空间选择性来稳定设备端波束形成器。
该框架保持服务器模型冻结,仅增加边缘端少量计算开销,实现高效协作。
在低信噪比和超过64ms通信延迟的挑战性条件下,实验证明该协作框架显著优于强边缘基线,大幅缩小了与服务器级性能的差距,同时边缘计算开销仅增加不到5%。
通过利用服务器中间表示和缓慢变化的空间统计信息,该工作有效突破了低计算边缘语音增强的性能瓶颈,为云边协同音频处理提供了新思路。
现有钢琴表演数据集几乎只包含专业演奏,缺乏覆盖从初学者到大师的完整技能谱系;且现有方法通常针对单一任务训练,无法跨任务或技能水平迁移。
提出 MAJEPPA,一个基于 JEPA 的自监督框架,用于学习统一的钢琴表演表示。它联合优化了三个目标: 1. 自回归下一 token 预测,用于生成不同技能水平的score-conditioned表演; 2. InfoNCE 对比损失,对齐抽象乐谱表示与表演表示; 3. 监督对比损失,进一步利用标注信息。
模型同时具备生成和理解表演的能力。同时构建了 MAJEPPA 数据集(约4000个标注录音,覆盖6个专家级别和6个录音场景),并提出了 EVPMR 评估基准(包括质量评估、比赛排名、错误和技术分类等下游任务)。
在 EVPMR 基准上,采用冻结表示和线性探针进行评估,模型在多个下游任务中优于各种基线。
MAJEPPA 首次将 JEPA 应用于联合符号钢琴表演生成与表示学习,填补了数据和方法空白,为钢琴表演空间提供了统一建模方案。
传统模块化方法在 turn state 预测上通常以 utterance 或固定 chunk 为单位,与连续帧级 turn state 估计不匹配,且依赖外部 ASR 模型,导致响应慢、系统复杂。
<|idle|>、<|noidle|>、<|incomplete|>、<|complete|>、<|backchannel|>,用于中断、说话完成、backchannel 检测。在中英双语 EasyTurn 测试集上评估,证明方法在准确检测 turn-taking 的同时保持低延迟。具体数字未在截取片段中给出。
X2-Turn 通过帧同步双头设计,在流式 ASR 中直接预测 turn state,实现了低延迟高准确率的对话交互控制。
MazzikaAI通过将实时演奏状态编译为文本提示,成功利用未微调的基础模型实现响应性阿拉伯马卡姆伴奏,展示了知识驱动方法在弥合非西方音乐传统与生成模型之间的潜力。
本文针对语音匿名化领域中隐私评估指标的选择问题,为使用最坏情况隐私披露(privacy-ZEBRA)作为评估指标进行辩护。论文指出当前主流使用的等错误率(EER)作为聚合指标,无法捕捉个体说话人的信息泄漏风险,尤其是在对数似然比(LLR)空间。作者从Shannon完美保密概念出发,解释了理想EER系统可能无法有效评估隐私保护的原因,并展示了基于排名的指标可被纳入完美保密框架,且其最优解与privacy-ZEBRA等价。此外,论文还分析了LLR估计方法对评估结果的影响,并通过模拟数据和VoicePrivacy Challenge数据进行了验证。
论文在模拟数据和VoicePrivacy Challenge(2024)数据上进行了演示,验证了上述理论分析和指标间的关系。但摘要中未给出具体数值结果。
本文为语音匿名化中的隐私评估指标选择提供了系统性理论梳理,强有力地支持了以最坏情况泄露(privacy-ZEBRA)作为核心评估标准。
在增强现实(AR)眼镜等可穿戴设备中,于嘈杂多说话人环境下准确提取目标说话人语音是关键技术挑战。单通道目标说话人提取(TSE)在混响环境中性能严重下降,而多麦克风(尤其双耳)配置可提供空间线索以提升分离效果。SPEAR 挑战数据集模拟了真实餐厅场景,包含强背景噪声和多个竞争说话人,使得双耳 TSE 任务极具挑战性。
提出 BiTSE 框架,基于 Binaural Complex Convolutional Transformer Network (BCCTN) 架构,并引入三项关键增强: 1. DoA 感知注意力机制:使用循环位置编码(cyclic positional encoding)将目标说话人的方向到达(DoA)轨迹转化为嵌入向量,通过全连接层和 PReLU 激活后,与编码器输出逐元素相乘,实现空间调制;随后由复数值多头自注意力模块处理,使模型能利用方位信息引导分离。 2. 说话人活动掩蔽(Speaker Activity Masking):利用语音活动检测(VAD)标签生成二进制掩码 V(t),在估计的幅度掩码(CRM)后应用,有效抑制非目标说话人的活跃片段,提升非语音区域的提取纯净度。 3. 两阶段损失优化策略:第一阶段采用 SNR 和分段 SNR(SegSNR)损失进行去噪预训练,建立稳健的语音重建能力;第二阶段加入 STOI 和 IPD 损失,以较小学习率微调,优化感知质量和空间一致性。最终损失为:L_stage1 = γ·LSegSNR,L_stage2 = γ·LSegSNR + α·LIPD + β·LSTOI。
在 SPEAR 挑战数据集(D2、D3、D4)上进行评估,BiTSE 与 BCCTN 变体及 MVDR 波束形成器对比,在信号保真度和感知质量上均取得一致性提升,验证了各创新组件的有效性。
BiTSE 通过有效融合空间方位(DoA)与时序活动(VAD)线索,并配合两阶段优化,为 AR 场景下的双耳目标说话人提取提供了一种高性能解决方案,显著优于传统方法。
生物声学录音常受环境噪声干扰,尤其当目标发声(如小鼠超声发声 USVs)较弱或被噪声覆盖时,分析十分困难。现有传统去噪方法(如谱减法、维纳滤波)假设噪声平稳,但自然环境中的噪声时变且频谱复杂,效果有限。深度学习方法虽在语音/音乐去噪中表现优秀,但需要大量干净的训练数据,而生物声学领域很难获取此类数据。
本文提出一种基于脊线(ridge)追踪的训练集合成与去噪方法,核心贡献如下: 1. 训练集合成(Training Set Synthesis):利用自动追踪的脊线(代表基频和谐波分量)合成配对(含噪-干净)训练数据,无需人工标注,脊线精度要求适中即可。 2. 脊线引导损失函数(Ridge-guided Loss):在时频域损失函数中对脊线区域赋予更高权重,使网络在去噪时更好保留发声细节。 3. 模型结构:采用 U-Net 架构预测复数比掩膜(complex ratio mask),在时频域进行去噪。
该方法适用于具有可追踪脊线的局部正弦型生物声学信号(如小鼠 USVs、狨猴发声、海豚哨声),不适用于宽带噪声类发声。
本文首次将脊线追踪用于生物声学训练集合成和损失函数加权,为缺乏干净训练数据的生物声学去噪提供了实用且可推广的深度学习方法。
该论文创新性地引入结构化音系表示(PhonoQ)提升音频-发音rtMRI语音分类,为跨模态语音理解与可解释建模提供了有效思路。
长语音分离通常采用“分割-分离-拼接”范式,但跨片段(cross-segment)的排列(permutation)对齐问题严重制约性能。现有方法如重叠匹配(overlap matching)仅保证局部连续性,全局聚类(global clustering)离线且易受VAD错误和残留干扰影响,静态缓存(static cache)无法适应动态变化,而动态缓存方法依赖神经网络预测分数,泛化性受限。
本文提出一种无训练的动态聚类方法,用于跨片段排列对齐。方法为每个说话人维护一个参考池(reference pool),通过当前片段嵌入与参考池的余弦相似度预测排列,并利用TopN更新策略保留最具代表性的嵌入(基于整体余弦相似度)。该方法无需VAD,通过质量分数抑制低质量嵌入,作为即插即用的后处理模块,兼容现有分离模型。
在密集和稀疏长语音场景下,该方法均优于现有基线,尤其在稀疏场景(长静默间隔)下提升显著。此外,方法对说话人数目估计误差具有鲁棒性。实验采用SI-SDR和逐段排列准确率评估。
本文提出了一种简单有效、无需训练的动态聚类排列对齐方法,显著提升了长语音分离中跨片段排列的鲁棒性和准确性,特别适合稀疏语音场景。
传统深度学习的 DoA 估计方法通常与训练时使用的麦克风阵列绑定,难以泛化到未见过的阵列。基于几何元数据(如麦克风坐标)的方法假设全向麦克风和自由场传播,无法建模实际设备中的频率相关指向性和散射效应。
提出一种基于阵列传递函数(ATF)的阵列无关 DoA 估计框架。该方法使用复值方向性 ATF 作为阵列描述符,通过两个独立的卷积编码器分别处理多通道频谱图和 ATF 元数据,再利用交叉注意力机制融合表征,最后输出多源笛卡尔向量形式的 DoA 估计。模型采用 CoordConv 替换标准卷积,并引入排列不变损失和 SinkPIT 近似进行训练。
在混响和扩散噪声环境下,分别进行了 2D 单源方位角估计和 3D 多源定位实验。结果表明,该方法能够泛化到未见过的阵列(包括手机样式阵列),性能下降不显著,且与 FCGA、MUSIC 等基线相比具有竞争力。在 2D 任务中,所提方法取得 F1@5°=0.75、LE=4.0°,而 FCGA 和 MUSIC 分别为 0.81/9.8° 和 0.97/1.5°。
利用 ATF 作为阵列条件信息,实现了对复杂阵列的泛化 DoA 估计,为实际设备中的阵列无关学习提供了新思路。
核心痛点:现有自动语言能力评估系统大多聚焦于单说话人录音的词汇、声学或发音特征,对多说话人和多语言场景关注不足。在访谈式评估中,目标受访者语音需从双人对话中提取,同时多语言使用(如代码混合)增加了分析难度。
方法创新:基于Whisper语音基础模型,构建了说话人角色日志(speaker-role diarization)和语言日志(language diarization)系统,自动提取受访者语音区域并识别语言使用。同时结合统计分析和预测模型,探究由日志导出的会话参与度和语言使用行为对语言熟练度评估的价值。
实验结果:语言适配的Whisper模型显著提升了低资源印度语言的语言日志性能;受访者语音比例和预期语言使用是熟练度评分的强预测因子;简单的日志特征在熟练度预测上与Whisper嵌入相当,结合两者效果最佳;且自动日志输出与手动标注在统计分析和预测性能上基本一致。
一句话评价:本文验证了说话人角色和语言日志在自动语言熟练度评估中的可行性与可解释性,为多语言老年人群体的规模化评估提供了新范式。
Many music datasets contain MIDI notes but lack reliable velocity labels, especially outside the piano domain. Velocity is a core component for expressive rendering, music generation, performance analysis, and data curation. However, most public MIDI files do not have human-performance velocities, and learning-based velocity estimation from audio works well almost entirely in the piano domain, largely because datasets like MAESTRO provide note-aligned velocity labels via sensor-equipped Disklavier pianos. For guitar, violin, and other instruments, public datasets provide audio and aligned notes but no velocity labels.
The paper studies label-scarce cross-instrument MIDI velocity estimation. The authors propose a framework that starts from a piano-trained velocity estimator (VeloEst) and adapts it to target instruments using real performance audio. Two adaptation strategies are investigated: differentiable synthesizers (Diff-Synth) and the proposed differentiable SoundFont proxies (Diff-SFProxy). Diff-Synth renders velocities into audio and minimizes a multi-scale spectral loss against real audio, but it suffers from residual timbral mismatch. Diff-SFProxy instead supervises velocity through note-wise, loudness-related acoustic parameters—pitch-conditioned harmonic energy (PHE) and onset-window spectral flux (OSF)—rather than waveform reconstruction. This design focuses gradients on velocity-dependent behavior, allows off-the-shelf SoundFonts to be plugged in, and avoids waveform details that are sensitive to recording and timbre mismatch. The proxy is implemented as an encoder-only Transformer that maps note sequences to per-note PHE/OSF targets, trained on SoundFont-rendered synthetic data.
Experiments are conducted on piano (MAESTRO) as the source domain and guitar (GAPS) as the main label-scarce target domain. The results show that Diff-SFProxy is effective for cross-instrument MIDI velocity estimation, while waveform-domain Diff-Synth degrades performance. Evaluation uses Bark-scale specific loudness (BSSL) and Bark-scale total loudness (BSTL) to assess whether predicted velocities reproduce the perceived loudness of the original recording, without relying on ground-truth velocity labels.
This paper presents a novel and effective approach for label-scarce cross-instrument MIDI velocity estimation via differentiable SoundFont proxies, avoiding timbral mismatch issues of waveform-based adaptation and enabling practical adaptation without ground-truth velocities on target instruments.
混合音乐生成器将自回归语言模型的长期规划与扩散/流式声学渲染器的保真度结合,但渲染器在训练时使用干净的目标码本token,部署时却面对不完美的语言模型预测,导致码本接口暴露偏差(codec-interface exposure bias)。均匀损坏不足以模拟真实错误分布,因为不同RVQ码本的预测难度不同,且错误token可能局部合理。
本文提出FullDiT,一个全上下文条件生成式声学DiT,用于从有缺陷的离散计划生成音乐。其核心设计包括: - 融合八路帧对齐RVQ码本流,并独立编码歌词与标题,在完整声学隐序列上应用非因果自注意力。 - 训练时采用错误匹配干扰条件(EMDC),将每个码本的替换率匹配到教师强制top-1错误率,并从余弦KNN邻域采样近miss token,同时保持声学目标不变。 - 推理时使用四路无分类器引导(4-CFG),独立缩放码本、歌词和标题的引导增量。
FullDiT通过全上下文生成式DiT和错误匹配的条件策略,有效缓解了混合音乐生成中的码本接口暴露偏差,显著提升渲染鲁棒性与生成质量。
大型音频语言模型(LALMs)在多语言语音任务上表现优异,但对其如何跨语言编码情感缺乏机制性理解。现有单语言神经可解释性研究发现,情感相关神经元在不同语言间泛化能力差,跨语言激活引导(activation steering)的泛化效果存在争议。
首次以神经元级因果方式揭示 LALMs 如何跨语言编码情感,为跨语言情感理解和低资源情感计算提供了新机制。
可控音乐检索旨在通过放大或抑制特定概念(如更环境、更少失真)来修改查询嵌入,同时保持原始语义。稀疏自编码器(SAE)提供了概念级控制,但关键问题是如何将自由文本概念映射到应编辑的稀疏特征上。现有方法如Discover-Then-Name(DTN)通过文本对齐选择神经元,但在多模态空间中,文本和音频嵌入存在模态差异,概念可能分布在多个特征上,导致选择的神经元与音频表达不一致。
将概念归属视为稀疏反演问题,而非文本侧神经元排序。提出Sparse Modality Inversion:给定概念文本嵌入,在SAE解码空间中优化稀疏编码,使解码表示重构概念方向,同时通过几何约束保持与音频流形一致。该方法无需训练,无需配对音频-文本监督,适用于任意开放式概念。
在JamendoMaxCaps数据集上训练BatchTopK SAE(m=4096,L0∈{5,10,20,50,100}),使用CLAP和MuQ音频编码器。实验表明概念通常对应多个特征的组合(神经元束),而非单一神经元。与DTN基线相比,该方法在概念放大和抑制任务中实现更强的编辑强度与内容保持性的权衡,更精确地恢复音频侧概念支持。
无需训练的多模态稀疏反演方法,有效解决了可控制音乐检索中的概念归属问题,提升了编辑的精度和可靠性。
音频生成系统通常将表示学习与分布建模视为独立模块,但实际上二者高度耦合。现有工作往往孤立地设计编码器/解码器(如 SoundStream、EnCodec)或生成模型(如 VALL-E、AudioLM),缺乏统一的评估与设计框架,导致难以在不同表示-模型组合之间进行理性比较和选择。
本文提出一个统一的视角,将音频生成建模分解为两个耦合决策:表示设计(离散、连续或混合 latent)和分布建模(如何分解依赖关系)。 - 表示设计四目标:表示负担、失真、经验可建模性、流式兼容性。强调这些目标构成 Pareto 问题,而非简单标量;离散/连续只是实现选择。 - 两个诊断维度:依赖范围(dependency horizon)和条件模糊性(conditional ambiguity)。用于细化“语义低熵、声学高熵”的常见直觉,指导建模策略:长依赖结构应使用全局建模,条件模糊的细节可委托给局部或迭代生成器。 - 原则性论断:重建质量不等于可建模性(Principle 1);应预测长程结构、生成模糊细节(Principle 2)。 - 示例分析:解释 RVQ 的残差顺序提供有序容量但非有序语义;AudioLM 的语义-声学级联仅为一种显式边界放置;自回归、迭代细化与混合模型的主要差异在于依赖范围与关键路径成本的权衡。
本文为综述/视角类论文,未提出新模型或实验数据,而是通过代表性系统(如 DAC、AudioLM、DiTAR、CALM 等)的案例说明框架的诊断能力,并强调经验可建模性必须基于具体任务、数据集、预算等条件进行测量。
这是首个从表示-模型联合设计角度系统化音频生成框架的视角论文,为后续音频生成系统提供评估与设计蓝图。
传统神经语音编码器(如 EnCodec、DAC)使用固定的残差矢量量化(RVQ)深度,对所有帧采用相同的量化层级,忽略了帧间量化难度的动态差异,导致部分帧浪费比特资源。现有自适应编码方法多为联合训练或仅关注名义码率,缺乏对冻结预训练编码器进行事后逐帧比特分配的系统方案,尤其无法严格满足实际序列化容器大小(而非理论平均码率)的约束。
提出 BAMU(Bitstream-Aware Marginal-Utility Allocation)框架,用于冻结预训练神经语音编码器的动态 RVQ 层分配。核心包括: - 率无关的边际效用预测:轻量级预测器基于冻结编码器的潜在表示,逐帧、逐层估计边际潜在失真降低量(MSE 减少),不依赖目标码率,可为多个操作码率复用。 - 比特流感知分配器:采用 Lagrangian 松弛与 GPU 批量 Viterbi 解码,在精确序列化大小预算下选择前缀有效的 RVQ 深度;考虑头部、RLE 深度图、字节填充等真实容器开销,确保解码安全。 - 前缀早退与动态比特流:通过前缀早退机制实现活动码本选择,仅执行所需 RVQ 层;动态比特流完整可解码,与冻结解码器兼容。
BAMU 通过在冻结预训练码码器上执行比特流感知的边际效用分配,实现了对显式容器预算的精确控制,带来一致的性能提升,是实际部署友好的动态 RVQ 编码新范式。
现有TTS系统在自然度和零样本声音克隆方面表现出色,但在词或音素级别的精细韵律控制上仍存在挑战。大多数系统将说话人身份、韵律和风格高度纠缠,控制信号通常仅能在句子或话语级别提供(如全局风格提示或指令),无法精确操控特定词语或音素的局部韵律特征(如音高、响度、时长)。这使得用户在实际应用中难以在保留目标音色的同时灵活调整局部表达。
CTRLSPEECH提出了一种粗到细的可控表达性语音合成框架。具体创新包括: - 架构:基于DiTAR(扩散Transformer自回归建模)作为骨干,结合全局说话人条件(说话人嵌入或提示语音)与音素对齐的韵律信号(音高、响度、时长),实现局部韵律控制同时保持音色。 - 粗到细控制:全局说话人嵌入作为粗粒度控制,音素级别的音高、响度、时长信号作为细粒度控制,支持用户对特定片段的精准调节。 - 迭代优化:支持用户通过调整控制信号逐步优化合成语音,提高实际应用中的灵活性。 - 连续表征:采用VAE将波形编码为连续潜在令牌,避免离散codec的信息损失,并在DiTAR的patch-wise框架中进行扩散建模。
模型在Emilia和GigaSpeech子集(约20,000小时英语语音)上进行预训练。评估显示,CTRLSPEECH在零样本TTS性能上具备竞争力,并显著提升了表达性属性的细粒度可控性。具体定量结果(如MOS、可控性指标)未在提供片段中详细列出,但实验证明了其有效性和实用性。
CTRLSPEECH通过粗到细的控制,在保留目标音色的同时实现了词/音素级别的韵律精细操控,为表达性语音合成提供了灵活实用的解决方案。
神经网络语音编解码器在语言模型时代面临一个基本矛盾:支持高保真重建的token不一定容易让自回归模型预测。现有RVQ多码本编解码器重建好但多流序列难以建模,而单码本编解码器需在语义和声学间权衡。重建驱动训练会分配容量给声学细节,直接量化SSL特征则缺乏重建细节。
ReLMCodec通过保留语义锚点、受控添加声学细节和训练后精化,成功协调了语音token的可预测性和重建质量,为低比特率单码本编解码器设立了新前沿。
印度拥有超过700种语言和数千种方言,但现有自动语音识别(ASR)系统仅覆盖少数高资源语言,绝大多数印度语言(尤其是低资源部落语言)没有可用的ASR系统,导致数字鸿沟和不平等。
提出三阶段训练框架:1) 在31,255小时未标记的VAANI语音上使用对比学习目标进行自监督预训练;2) 利用VAANI中11.85百万配对的音频-图像样本,引入音频-图像表示对齐阶段,使语音编码器学习语义更丰富的表示,特别提升低资源语言性能;3) 使用混合Token-and-Duration Transducer (TDT)和CTC解码器,在31,263小时标注多语言印度语音上端到端微调。模型基于FastConformer架构,覆盖65种印度语言和方言。
在Common Voice、FLEURS、IndicTTS、Kathbath、RESPIN、GramVaani、MUCS和VAANI八个基准上,与IndicConformer-600M-Multilingual、Sarvam Saaras v3和Gemini 3 Flash对比。SraVaani-1.0在多数语言-数据集组合上取得最低词错误率(WER),在高资源语言上与最佳系统相当,并且是唯一提供多种低资源和部落语言转录能力的开源模型。
SraVaani-1.0通过大规模自监督学习、多模态表示对齐和多语言监督微调,显著扩展了印度语言ASR的覆盖范围,对低资源语言具有重要价值。
本论文系统批判了'声纹(voiceprint)'这一比喻在科学上的误导性,认为将声音视为类似指纹的独特、稳定生物特征是一种谬误。作者回顾了声纹识别从二战时期贝尔实验室的保密研究到Kersta 1962年文章的历史发展,并综合了语音科学、法庭语音比对、自动说话人识别和语音深度伪造等领域的最新证据,指出语音特征由解剖、生理、语言背景、情绪、健康、年龄、社会语境及录音条件等多种因素动态塑造,并非固定不变的个体印记。论文强调,法庭语音证据应采用经过验证和校准的概率框架(如似然比)进行解释,以明确量化和传递变异、不确定性及替代解释,而不是基于声音唯一性的假设。
语音增强(SE)模型在未见过的噪声环境下常常出现过度抑制(over-suppression),即过度去除噪声的同时丢失了语音中的有效信息,导致可懂度和下游任务性能下降,甚至比未处理信号更差。
提出一种推理时重思-精炼校正模块(Rethink-and-Refine Correction Module),无需额外训练即可集成到任意现成SE模型。核心步骤: 1. ASR引导分段:利用ASR(如Whisper、Charsiu)将噪声和增强信号在词/音素级别对齐切分。 2. SA引导段级权重选择:对每个片段优化一个凸插值权重,在增强信号和原始噪声信号之间插值,以最大化复合目标(感知质量Q + 语音保持R)。 3. 调和策略:同时从噪声和增强信号分别得到分段视图,分别优化后选择得分更高者,并设置兜底机制保证不劣于原始信号。 该模块以SA模型(如SCOREQ)和ASR嵌入相似度作为指导,将权重作为推理时变量,实现了内容自适应的修正。
在URGENT 2024/2025、VCTK-DEMAND、MSP-PODCAST等多个数据集上,对CMGAN、SEMamba、SGMSE等先进SE模型进行测试,一致提升了PESQ、STOI等侵入式指标,降低了ASR词错误率(WER),并改善了语音特征保留。
一种新颖、即插即用的推理时修正框架,有效缓解SE模型的过度抑制问题,显著提升感知质量和下游任务表现。
连续隐变量自回归语音生成(Continuous-Latent Autoregressive Speech Generation)虽避免了离散编码的量化损失,能保留更丰富的声学信息,但其连续声学目标不提供显式的 token 级语义监督,导致自回归语言模型(LM)只能间接地从连续声学预测中学习语言结构,削弱了生成语音的内容保真度(表现为 WER/CER 偏高)。
本文提出 SemBridge,一个'仅训练时使用'的语义 token 锚定框架,用于连续隐变量自回归语音生成。核心创新包括: 1. 语义 token 锚定(Semantic Token Anchoring):在训练时用预训练 GLM-4 tokenizer 输出的离散语义 token ID 直接监督自回归 LM 的隐状态(在特定 Transformer 层),而推理时仍完全使用连续隐变量生成,不改变推理接口。 2. 语义对齐声学 VAE(Semantic-Aligned Acoustic VAE, SA-VAE):在 Stage I 训练时,将连续声学 patch 与来自同一语义 tokenizer 的 token 级 embedding 对齐,形成共享的语义参考空间;同时保留 token ID 作为 Stage II 的监督目标。 3. 两阶段训练:Stage I 训练 SA-VAE(重构损失 + 语义对齐损失);Stage II 冻结 SA-VAE 和语义 tokenizer,训练连续自回归生成器(原始生成损失 + 语义锚定损失)。
SemBridge 通过'训练时离散语义监督、推理时纯连续生成'的巧妙设计,显著提升了连续隐变量自回归语音生成的内容保真度,为这一类方法提供了通用且有效的语义监督范式。
现有可穿戴多模态学习方法难以同时满足任务分类、解耦表示学习、融合和生成建模的需求,尤其缺乏能够处理任意数量模态(omni-modal)的统一框架。
提出 OmniDecVAEs(Omni-modal Variational Decomposition Autoencoders),扩展 DecVAEs,通过模态条件的时间-频率潜子空间、多视图自监督分解损失和共享非对称自编码器架构,实现多模态融合、解耦表示和生成建模的统一。该模型使用共享编码器和解码器,无需逐模态专用模块,可扩展至数十种模态。
在包含多达 30 种模态的 HARWE 数据集上,OmniDecVAEs 在活动识别准确率上提升 1.01%,身份识别准确率提升 6.75%;重建误差(MAE)降低 76.84%,真实与合成数据分布相似度(MMD)提升 13.85%。模型参数仅 4.1M,具备实时推理能力。
该工作为智能可穿戴和临床医疗提供了一种轻量级、统一的全栈式表示学习框架,在可扩展性、解耦性和生成能力上均有显著优势。
传统AD诊断方法(如MRI、PET)侵入性强、成本高、依赖专业设备,难以大规模部署。现有LLM语音分析多依赖云服务,存在隐私泄露风险,不符合HIPAA等医疗合规要求,且难以在本地化临床环境中落地。
提出LSEAD框架,利用本地部署的开源LLM提取语音转录文本的高维语义嵌入,无需手工设计特征;通过PCA降维优化分类效率;全程不进行外部数据交换,确保隐私保护。在ADReSS20和ADReSSo2021基准上验证其泛化能力。
相比现有方法,LSEAD在AD分类准确率上提升约5%,尤其对早期阶段检测效果显著,证明了LLM嵌入的跨数据集有效性和鲁棒性。
LSEAD为AD筛查提供了一种隐私安全、成本低、可扩展的LLM语音分析方案,有望推动临床落地。
AI生成音乐在广播媒体中的普及引发透明度和公平补偿问题,但现有检测器在真实广播条件下可靠性不足。已有研究虽指出性能下降,但评估仅基于合成广播数据,缺乏真实广播场景的验证。
本文引入BAMM(Broadcast AI-Music Monitoring)数据集,包含40小时真实电视广播录音,其中AI生成音乐和人类创作音乐各约20小时。通过音频指纹技术将干净参考音轨与广播出现匹配,并经过多阶段过滤确保质量。数据集采集自全球4200多个电视频道,音频为单声道8kHz采样率,AAC-LC编码,体现工业监控的代理流特征。
论文比较了干净训练和广播训练的CNN模型,在三个难度递增的场景(干净前景音乐CFM、合成电视广播STB、真实电视广播RTB)下评估性能。同时提出一个集成检测器用于构建数据集,确保标签可靠性。
本研究首次在真实广播语料上系统评估AI音乐检测,指出当前CNN检测器在现实广播监控中的不足,并为领域提供了公开基准数据集和评估流程。
当前 AI 音乐检测系统大多采用二分类范式,只能判断整首歌曲是‘完全 AI 生成’还是‘完全人类制作’。然而,实际音乐制作中越来越多地采用混合工作流,即 AI 生成的鼓、贝斯或人声作为分轨(stem)与人类演奏的乐器混合在同一首歌中。二分类器无法处理这种部分 AI 的场景,且缺少对 AI 内容比例的量化度量。
该论文开创性地将 AI 音乐检测从二分类扩展为连续比例回归,提出了一套基于多轨数据集的受控混合数据构建方案,为检测混合音乐中的 AI 成分迈出了重要一步。
现有音频生成评估基准大多局限于单一领域(如TTS、TTM、TTA),无法满足混合音频场景(同时包含语音、音乐和音效)的评估需求。此外,现有基准缺乏细粒度控制信息,如说话人身份、时间戳等,限制了模型在声音克隆和时间条件生成等任务上的评测。
提出MMAG基准,首个面向混合音频生成的组合评估基准。MMAG包含约4,000个手动验证的音频片段,来自AudioCaps、VGGSound和MECAT测试集,通过多专家注释管道生成丰富字幕,涵盖语音转录、说话人属性、音乐信息、声音事件和时间关系。同时构建了专门子集:声音克隆子集(690对)和时间戳条件子集(1,800对)。此外,提出统一评估协议,从声学保真度、语音质量、语义一致性和时间控制四个维度进行全面评估。
对代理编排器(如AuDirector)、统一音视频生成模型(如MOVA、Ovi、UniAV-Gen等)和原生混合音频生成器(如Dasheng AudioGen)进行基准测试,发现现有模型在生成质量和可控性之间存在显著权衡,没有任何模型在所有评估维度上表现一致良好。引入语音提示会导致性能下降,而大多数模型对细粒度时间控制的处理能力有限。
MMAG为多控制混合音频生成提供了一个全面的基准和评估框架,揭示了当前模型在该任务上的主要挑战,是未来研究的重要参考。
现有神经音频编解码器(如SoundStream、Encodec、DAC等)不是幂等的:在解码-重编码循环中,平均至少有15%的令牌被重写,导致令牌漂移。反复循环后误差累积,损害语音的智能度和自然度,影响生成、编辑、存储或重传等下游任务。
LILAC(Lifting-Inspired Low-rate Audio Codec)是首个通过构造保证编解码器幂等性的神经语音编解码器。其核心思想是使用可逆分析变换将音频信号分解为保留坐标和丢弃坐标,只传输经有限标量量化(FSQ)的保留坐标。解码器利用上下文网络预测丢弃坐标,然后应用精确逆变换重建音频。由于量化是幂等的,且逆变换精确,重编码必然返回相同令牌流。 - 全卷积架构,24kHz采样率,帧率9.375Hz,比特率0.75kbit/s。 - 可逆1x1卷积(正交权重)和加法耦合块构成分析变换,无除法,避免浮点溢出。 - 使用4比特FSQ,80比特/帧,在[-1,1]范围内形成网格。 - 解码器中的填充网络预测被丢弃的坐标,且随机解码器(带辅助输入)也能保持幂等性。
LILAC在LibriSpeech测试集上达到UTMOS 4.14,在LibriTTS-R上达到4.24,与SOTA sub-1kbit/s编解码器相当。图1显示,在100次解码-重编码循环中,LILAC保持100%的令牌一致性,而其他编解码器(如WavTokenizer、SNAC、Mimi等)的令牌一致性急剧下降。种子方差实验显示稳定性能(UTMOS标准差约0.02)。
LILAC通过可逆变换和有限标量量化从原理上解决了神经音频编解码器的幂等性问题,同时保持了有竞争力的重建质量,为神经音频编解码器在迭代处理场景中的应用提供了新方案。
EG-VAE首次实现电吉他音色转移与去除的统一建模,通过音色掩蔽和两阶段训练有效解决了表征泄漏与泛化问题,是吉他音色建模领域的重要进展。
现有语音深度伪造检测(SDD)系统在常规基准上表现优异,但面临两个关键缺口:1) 数据集对情感表达性攻击覆盖不足,尤其是缺乏大规模、多样化的情感伪造数据;2) 对最新的大音频语言模型(LALM)攻击未纳入评估。现有情感伪造数据集(如EmoFake、EmoSpoof-TTS)规模小、攻击类型单一(仅VC或TTS),且主要基于ESD acted speech,缺乏自发性情感语音覆盖。
提出AffectDF,号称最全面的情感表达语音深度伪造检测基准: - 包含约260小时语音,21种攻击,覆盖5种情感状态(neutral、happiness、anger、sadness、surprise)。 - 攻击类型全面:TTS、VC、EVC(情感VC)、以及LALM-based EVC,同时涵盖acted(ESD)与spontaneous(MSP-Podcast)情感语音。 - 数据划分采用不重叠说话人和攻击系统,支持跨说话人和跨攻击泛化评估。 - 首次系统性地在情感表达攻击下评估SDD鲁棒性、跨域泛化、以及情感状态/攻击类型/acted vs spontaneous条件的影响。
AffectDF是首个系统评估情感表达攻击下语音深度伪造检测的全面基准,暴露了现有SDD系统在情感和韵律多样性下的根本缺陷。
The paper presents a novel and principled sequential formulation for automatic music mixing, achieving flexible and expressive mixing through latent flow matching and degradation-based data synthesis.
现有自动混音方法要么是黑盒直接预测音频,要么是参数估计但固定效果链,且缺乏对制作风格的控制。大部分方法将自动混音和风格控制分离,难以在保持高质量混音的同时进行灵活的风格编辑。
提出Diff2Mix,一个基于扩散模型和可微混音台的生成式自动混音系统。该系统提供两级用户控制:(1) 参考音频控制整体制作风格;(2) 可微混音台提供显式音频效果参数,实现可解释性和细粒度优化。核心组件包括:条件音频效果嵌入扩散模型(基于MEGAMI和EDM,采用分类器自由引导),以及音频效果参数解码器(直接参数估计或参数分布建模)。
通过客观和主观评估,验证了该系统在混音质量和风格控制方面的竞争力。
Diff2Mix将扩散模型与可微音频效果相结合,首次实现了在同一系统中同时具备高质量自动混音和显式风格控制的能力。
Diff-Symbo首次将LDM与自回归方法结合,有效解决了文本控制符号音乐生成中质量、多样性与时长之间的权衡问题。
该论文通过完整的、可复现的数据构建和模型适应流程,展示了希腊语RAG的可行性,并揭示了合成数据、翻译数据和评估基准中的关键陷阱,为低资源语言RAG提供了重要参考。
音乐协作智能体需要内部表示既能支持理解又能支持生成,同时保持人类在创作流程中的主导权。现有生成模型隐式编码音乐结构但无法清晰表述;描述(理解)与再现(生成)对表示的要求不同,传统方法将两者视为权衡关系。
提出层次化自监督世界模型(MIDI-RAE-JEPA-SON, MRJS),采用2.55M参数的Swin V2编码器,在MIDI钢琴卷帘图像上训练,使用JEPA风格目标:音高/时间平移等变性、掩码嵌入预测、分布正则化(SIGReg)及软因子分解损失,无需标签和音乐理论词汇。遵循表示自编码器(RAE)范式,将条件流匹配模型作为生成器,在像素空间从PCA降维的条件中生成音乐。同一编码器可同时用于感知(冻结嵌入)和生成(条件控制),并通过跨层级条件丢弃实现图形化提示(如掩码修复)而无需专门采样器。
冻结嵌入的探测显示:音乐属性可解码的层级与其时间尺度相关(短语边界在粗粒度层,音符密度和和声细节在细粒度层)。加入小型和弦监督头后,联合和弦恢复率从0.18提升至0.54,键检测(从未监督)从0.16提升至0.70。像素级F1达到0.996,CPU推理2.8秒,Apple MPS上0.6秒,支持实时交互演示。
该工作为音乐共创智能体提供了高效、可控且保留人类代理权的层次化表示学习与生成框架,验证了自监督世界模型在符号音乐领域的强大潜力。
该论文介绍了 QIANGDA,一个用于音频-视觉目标说话人提取(AV-TSE)的普通话基准测试,包含联合记录的真实双人混合语音和同步多视角视频。同时,作者从 VoxBlink2 中策划了 VOXBLINK2-AVSE 训练语料库,并开发了基于 AV-HuBERT 条件化的提取器。
现有 AV-TSE 评估多使用独立录制的语音合成混合物,无法模拟真实场景中的共享物理环境(如同时捕获的目标语音、干扰、混响和背景噪声)。此外,分隔器可能忽略视觉线索,导致多次查询都输出同一说话人的语音,即身份不忠实。
在 QIANGDA 完整清单上,最佳归档检查点获得: - 0.2261 CER - 82.22% 严格输出正确性 - 69.53% 双输出严格成功率
该工作通过构建真实场景基准和大型训练语料库,显著推进了身份忠实音频-视觉目标说话人提取的研究。
现有轻量级声学回声消除(AEC)系统常结合线性 AEC 与 Bark 域 DNN 抑制以降低计算开销,但在下采样压缩特征为紧凑瓶颈表示时,会削弱频率-时间建模能力,导致回声-语音判别性能下降。
提出 MSA-EchoLite,一种轻量级 Bark 域 AEC 框架,包含非对称双分支编码器(SFP 保留近端语音细节,RFP 建模麦克风-参考相关性)和回声感知频率-时间调制(EAM)模块。EAM 通过建模双分支麦克风与回声相关潜在特征之间的差异和相关性线索,丰富压缩瓶颈表示,并在 FT-LSTM 瓶颈的频率和时间建模阶段后嵌入。
MSA-EchoLite 通过回声感知调制在紧凑 Bark 域潜在表示中恢复关键交互线索,实现了轻量级 AEC 中性能与复杂度的最优平衡。
本文针对真实教室环境下的说话人验证问题,提出WavLM-TDNN模型和两阶段训练策略,显著提升了儿童和成人混合场景下的验证性能,为教育AI应用提供了有效方案。
多语言LLM-based ASR系统联合建模具有异质声学、音系和词汇特征的语言时,优化过程会产生梯度冲突,导致语言间性能权衡;实时系统在有限模型容量下进一步加剧该挑战。
提出LS-MOPD框架: - 语言专门化教师:基于DAPO算法分别对普通话、中文方言、英语等类别进行RL优化,构造专门化教师池; - 语言路由多教师蒸馏:学生生成on-policy轨迹,按输入语言选取top-K教师,以加权token级反向KL损失聚合监督; - 声学前缀配置:比较静态(共享冻结encoder-adaptor)与动态(独立优化)两种配置,分析教师-学生前缀一致性对蒸馏效果的影响。
在覆盖普通话、普通话次方言、粤语和英语的基准上,LS-MOPD显著优于RL基线,并一致超越最佳RL教师的经验性能包络,展现出超越所有教师的泛化潜力。梯度对齐与多教师互补性分析验证了方法有效性。
首个将多教师on-policy蒸馏引入ASR领域的系统性工作,通过语言专门化与路由蒸馏有效缓解跨语言优化冲突。
Reinforcement learning (RL) for flow-matching text-to-speech (TTS) is challenging because deterministic ODE sampling complicates trajectory-level policy-gradient methods. Existing approaches convert the ODE into an SDE or require per-step likelihood ratios, introducing stochastic noise and high computational overhead.
GROW (Group-Relative Advantage-Weighted On-Policy RL) directly applies signed group-relative advantage weighting to the standard flow-matching regression objective. For each prompt, it samples a group of on-policy utterances, normalizes intelligibility and speaker-similarity rewards within the group, and combines them into a signed advantage. A Wasserstein-2 velocity penalty anchors the model to a frozen pretrained reference. A group-mean baseline converts reward weighting into advantage weighting, and positive exponential weights are replaced by signed, group-normalized advantages for effective credit assignment.
On LibriSpeech test-clean and Seed-TTS EN/ZH, GROW reduces average WER from 2.016 to 1.558 (0.458 absolute reduction) and raises speaker similarity from 0.676 to 0.715 (0.039 absolute gain), while maintaining UTMOS. With 10-NFE training rollouts and 32-NFE evaluation, GROW achieves comparable performance to its 32-NFE setting while training 2.9× faster than 32-NFE DiTAR-GRPO. At matched training-rollout NFE, GROW trains about 1.1× faster than DiTAR-GRPO.
GROW is a concise, effective, and training-efficient on-policy RL method for AR-diffusion TTS that improves intelligibility and speaker similarity without stochastic ODE-to-SDE conversion.
音乐风格(如“摇摆”、“古典”、“情感”)通常难以用文字标签完全描述,而是隐含在具体的音乐示例中。现有的音乐生成模型大多依赖显式内容(如旋律、和弦、文本标签)进行控制,对隐式风格(如律动模式、力度变化)的建模和迁移能力有限。特别是从音频到符号(MIDI)的钢琴编曲任务,现有方法往往只提取旋律与和弦,难以捕捉原音频中丰富的表现性风格特征。
本文提出一种跨模态框架,利用Q-Former(Querying Transformer)桥接预训练的音频语言模型(Audio LM)与符号音乐语言模型(Symbolic LM),实现从音频示例中学习隐式风格并用于符号钢琴编曲。核心创新包括: - 跨模态风格表示:扩展BLIP-2中的Q-Former,通过交叉注意力从音频LM的隐藏状态中提取风格表示(Z),并与符号音乐对齐。 - 两阶段训练策略: 1. 阶段一(跨模态表示学习):使用对比学习(Audio-Symbolic Contrastive Learning)、匹配学习(Audio-Symbolic Matching)和音频驱动的符号生成(Audio-Grounded Symbolic Generation)三个目标,结合不同的自注意力掩码,使Q-Former学习与内容无关的风格表征。 2. 阶段二(生成建模):固定Q-Former,将其输出的风格表示作为条件,结合提供内容(旋律与和弦)的领唱谱(Lead Sheet),训练符号LM生成钢琴编曲。 - 数据配对:设计10秒音频与4小节MIDI的松散对齐(随机时间偏移与转调),迫使模型专注风格而非音符级转录。 - 无需重训大模型:通过Q-Former引导(Bootstrapping),在保持两个大模型冻结的情况下实现跨模态风格迁移,比传统隐变量解耦方法更具可扩展性。
实验表明,该方法在钢琴翻唱生成、风格迁移和音频到MIDI检索任务中均取得显著改进,相比现有音频到符号编曲方法(包括基于解耦的方法和标准语言模型方法),生成的编曲在风格对齐性和音乐质量上更优。具体定量数据在论文中给出(此处截断未完整展示)。
这是一篇将Q-Former成功应用于音乐跨模态风格学习与钢琴编曲生成的创新工作,为隐式风格建模提供了高效、可扩展的新范式。
当前零样本文本到语音(TTS)系统在真实世界应用中,通常需要高质量的说话人提示,且要么丢弃声学环境信息,要么将环境与说话人特征纠缠在一起,无法独立控制音色和声学环境。这限制了它们在多样化真实场景中的适用性,如AI有声书制作、ASR/ASV训练数据生成等需要显式环境控制的任务。
本文提出了扩展的DAIEN-TTS框架,一种环境感知的零样本TTS系统,通过解耦音频填充实现语音、背景噪声和混响的联合建模与独立控制。主要创新点包括: - 语音-环境分离(SES)模块:两阶段结构,将环境语音分解为语音、噪声(帧级mel谱)和混响(语句级嵌入)三个成分。 - 基于流匹配的F5-TTS基础:融合语音、噪声、混响信息,通过扩散Transformer进行环境感知生成。 - 跨说话人条件策略:在训练中抑制环境分支中的说话人信息泄漏。 - 三重无分类器引导(TCFG):推断时对语音、噪声和混响进行细粒度独立控制。 - 信噪比(SNR)适应策略:使合成语音与环境提示的SNR对齐。 - 模拟到真实的微调:先在模拟数据(干净语音+噪声+RIR)上训练,再在真实语音数据上微调,弥合域差距。
在模拟和真实测试集上,DAIEN-TTS生成的个性化环境语音具有: - 高自然度 - 强说话人相似性 - 忠实的噪声和混响再现 - 优于现有环境感知TTS的可控性
该工作通过解耦音频填充与环境建模,实现了真实世界环境下零样本TTS的独立控制,为该领域提供了新的思路和实用方案。
音频增强任务中,传统方法难以处理低比特率有损编码导致的非线性失真;现有基于神经网络的超分辨率模型(如AERO)虽然效果好,但计算复杂度高(训练和推理时GPU内存占用大、推理慢),且通常使用简单的重构损失(如STFT损失),与感知质量相关性有限。
本文通过轻量级状态空间模型和可微分感知损失,在音频带宽扩展和压缩音频增强任务中实现了高效且高质量的重建,为感知驱动的音频增强提供了新思路。
飞机舱内多音调噪声(如发动机噪声)的频率随发动机转速变化,且衬里温度变化会改变声学与结构路径,导致传统 SFANC(选择性固定滤波器主动噪声控制)性能下降。
提出温度感知选择性固定滤波器主动噪声控制(TP-SFANC)方法,利用轻量级一维卷积神经网络(1D CNN)进行多任务学习,同时处理参考信号和误差信号,动态预测噪声频率类别和温度类别,从而从预训练控制滤波器库中选择最优控制滤波器。该网络采用联合损失函数动态加权,兼顾频率分类与温度分类任务。
数值模拟表明,所提方法在不同频率和衬里温度条件下能有效衰减多音调噪声,鲁棒性优于传统 SFANC。
TP-SFANC 通过多任务学习将环境温度变化纳入控制滤波器选择,为飞机内饰噪声控制提供了一种自适应且计算高效的解决方案。
传统参数阵列(Parametric Array)定向扬声器体积大、功耗高,难以应用于消费电子(如手机、平板、笔记本)。已有的MEMS参数阵列方案(如Wygant等人用真空密封CMUTs,Ahn等人用PZT PMUTs)仍面临驱动电压高、尺寸大、制造均匀性差等挑战。
本文提出利用商用MEMS麦克风芯片,在非线性静电驱动下(pull-in和snap-back模式)作为空气耦合超声发射器。通过施加0-20V电压,使振膜在1.8μm间隙内全行程运动,产生大幅位移和超声压力。并首次构建了由28个MEMS麦克风芯片组成的阵列,在83kHz和93kHz驱动下,通过非线性声学效应产生10kHz的差频方向性声束。该方法避免了谐振效应,便于控制高声压。
本文首次展示了基于商用MEMS麦克风芯片的collapse-snapback模式阵列,为消费电子领域小型化、低功耗定向扬声器提供了新路径。
媒体制作(动画配音、有声剧、电影、广告、游戏、播客、短视频)常需要设计不存在参考录音的声音,并通过自然语言控制说话人风格、场景和音频效果。现有TTS系统主要支持零样本语音克隆,但指令型TTS很少,且通常只生成语音,无法同时生成环境音、音频效果,也难以在同一模型中同时保留零样本能力。此外,数据稀缺、任务兼容性(指令与零样本条件路径共享)、多音频模态(语音、环境音频、唱歌、音乐)的复杂性是三大挑战。
SwanTale是一个统一的多说话人语音与音频生成模型,兼顾指令和零样本任务,通过创新数据管道和模型设计在表达力和多模态生成上达到领先水平。
现有的音乐修复方法通常依赖成对的干净/失真训练数据和预定义的失真模型,无法处理实际中复杂、未知的效果链(如串并联效果链、历史录音等)。作者指出,失真过程可能非常复杂且难以模拟,导致监督系统在测试时遇到不匹配的效果链时性能下降。因此,需要一种能够在测试时自适应未知失真的通用修复框架。
本文提出 LOUDAR(Latent-space Optimization of Unknown Distortion for Audio Restoration),一种无监督的音乐修复方法。其核心创新包括: - 潜在空间操作:使用预训练的音频自编码器(AE)将波形映射到紧凑的潜在空间,在潜在空间中建模失真,从而压缩表示和失真模型。 - 潜在算子建模:将未知失真参数化为一个可学习的因果卷积网络(causal convolutional network),配合残差项以吸收无法表示的局部伪影。 - 扩散模型先验:使用无条件潜在扩散模型(LDM)作为干净音频先验,通过扩散后验采样(DPS)引导潜在估计朝向干净数据流形。 - EM风格交替推断:在逆向扩散轨迹上交替执行 E-step(估计干净潜在变量)、M-step(更新潜在算子参数和残差)和更新步骤,实现在线盲推断。
论文在歌声效果去除/修复和吉他失真去除两个任务上进行了评估。结果表明,LOUDAR 相比退化输入持续改善,并且与监督和无监督基线方法在波形域和潜在域上具有竞争力(具体数值未在片段中给出)。此外,作者还采用了客观和主观指标进行综合评估。
LOUDAR 为未知失真的音乐修复提供了一种通用、无监督的解决方案,通过潜在空间优化和扩散模型先验实现了灵活且稳健的修复。
多语言 ASR 中,声调语言(如中文)标注带声调元音,非声调语言(如英语)只标注基础元音,导致监督粒度不匹配。标准 softmax 要么将两者视为无关类别,减弱跨语言共享;要么合并声调,损失声调语言所需区分。
提出 Latent Softmax:将带声调元音视为子类,基础元音作为主类;当观测到基础元音标签时,将带声调元音子类视为隐变量并做边缘化。与 CTC 兼容,仅修改输出层概率计算,保留 CTC 目标形式不变。该机制使得非声调语言的基础元音监督隐式增强声调子类空间,同时不丢失声调区分。
在 AISHELL-1 中文和 LibriSpeech 英语的多语言实验中,相比于标准 softmax 多语言基线,Latent Softmax 将语音到音素(S2P)错误率降低:AISHELL-1 上 8.4%,LibriSpeech test-clean 上 17.5%,test-other 上 12.6%。改进后的语音到音素编码器在大语言模型音素到字素转换(LLM-P2G)和投影器接口上也获得一致的词错误率收益。在代码切换适配后,Latent Softmax 进一步将投影器混合错误率降低:ASRU2019 上 2.6%,CS-Dialogue 上 9.5%。
Latent Softmax 通过子类边缘化巧妙解决了声调/非声调语言联合训练中的监督粒度不匹配,兼顾跨语言共享与声调区分,是一种数据高效的 CTC 兼容方案。
传统情感语音合成(TTS)多依赖离散情感标签或基于平均标注的维度情感表示(如 arousal-valence),忽视了情感感知的个体差异与文化差异,导致合成语音的情感表达与听者感知不匹配。
提出一种个性化且文化自适应的情感TTS框架,通过交互式遗传算法(IGA)在低维 arousal–valence 空间中对每个听者的情感感知空间进行交互式优化,无需重新训练骨干TTS模型。框架包含:1) 基于IGA的情感偏好学习,迭代调整目标情感对应的A-V坐标;2) 情感控制器,将个性化A-V坐标映射为语音声学特征(通过SER模型提取的潜在情感特征),并联合音高和能量预测器实现细粒度情感表达。
在日语、中文和印尼语参与者上进行了跨文化评估,结果表明个性化与文化自适应相比使用平均A-V值的模型显著提升了情感表达与听者感知的对齐程度。
该工作首次将交互式遗传算法用于情感TTS的轻量级个性化适配,为超越“一刀切”式情感合成提供了有效方案。
该论文针对无人机听觉的极端低 SNR 噪声抑制问题,通过将源分离模型改造为噪声估计器,并引入无界 mask 缩放和残差校正,显著提升了开放域声音的恢复与分类性能,是迈向实际无人机搜救的重要一步。
现有基于 SSL 的语音深度伪造检测系统大多采用单遍固定深度的 backbone,难以在参数受限条件下高效地迭代细化潜在表示;同时,层次推理模型(HRM)的收益来源(循环迭代 vs 层次分解)尚未得到系统验证。
本文提出 REIMU 控制性研究框架,系统比较了标准单遍 backbone、权重共享循环(Looped)模型、同构 HRM 和异构 HRM 四种架构。重点提出异构 HRM:高层模块使用多头自注意力(MHSA)建模全局依赖,低层模块使用线性注意力(如 Gated DeltaNet-2、Raven)进行低成本局部更新,从而在减少 10.8% 下游参数的同时保持检测性能。
在 ASVspoof 2019 和 2021 评估集上,异构 HRM(H MHSA + L GDN2)取得了与匹配基线相当的等错误率(EER),同时下游参数更少。此外,研究还发现单纯的循环和层次分解并不必然带来提升,异构运算符分配才是更关键的性能因素。
REIMU 通过异构层次推理实现参数高效的语音深度伪造检测,为后续架构设计提供了重要参考。
提出首个针对 LM-based TTS 幻觉的解码时条件信息分析方法,并通过经验校准对比解码在无需训练的情况下显著降低幻觉,为语音生成中的解码策略提供了新方向。
针对DAFx 2026参数估计挑战赛Task B中的密集板混响冲激响应模态估计问题,传统峰值拾取方法因弱模态和重叠模态导致严重的模态数量欠估计(undercounting)。
提出一种计数优先(count-first) 的混合估计框架: 1. 带通模态计数预测:使用ExtraTrees回归器从372维响应描述符预测四个频带(20-200 Hz, 200-1000 Hz, 1-4 kHz, 4-10 kHz)的模态数量。 2. 密集模态初始化:基于预测计数在频带上放置密集线性频率网格,并根据能量衰减曲线启发式设置初始衰减率和增益。 3. 固定频率可微谐振器细化:利用可微二阶全极点谐振器库,通过梯度下降(Adam优化)在八倍约束范围内调整衰减率和增益,频率保持不变。
在两个合成验证集上,相对官方默认峰值拾取基线,局部挑战式错误率降低约66%。主要改进来自减少模态计数失配,而衰减率和增益的估计误差仍是主要误差来源。模型平均识别模态数从基线的约68个提升至数千个,归一化计数失配降至约5-6%。
这项工作有效解耦了模态密度估计与连续参数拟合,为密集模态估计提供了新的范式,但衰减和增益的估计精度仍有待提升。
从单个脉冲响应估计物理音频模型参数(Task A)具有挑战性,因为密集、重叠的共振模式使得传统模态分析和迭代优化方法效率低或成本高。
提出一种基于模拟训练的、非迭代的板混响参数估计器: - 从每个未归一化的脉冲响应提取 372 维特征(幅度、频谱、衰减描述符) - 使用归一化参数训练 ExtraTrees (ET) 和直方图梯度提升 (HGB) 回归器,并对两者进行集成 - 训练数据由 ModalPlate 模拟器生成,使用 1000 个合成样本 - 推理时仅需特征提取和一次回归,无需迭代优化或模拟器调用
一种高效、可复现的基于学习的板混响参数估计方法,以极低的推理成本超越了传统随机优化基线,但对输出位置的估计仍需改进。
婴幼儿在6-12个月期间会丧失对非母语音素对比的辨别能力(感知窄化),但其产生的学习目标(learning objective)仍不明确。现有自监督语音(SSL)模型虽然能重现母语优势,却未重现非母语辨别能力的下降。以往研究通常将训练目标视为固定背景,而非可操控变量,因此无法判断目标本身的作用。
本研究利用约7M参数的Transformer编码器,在严格保持编码器、数据、随机种子不变的前提下,仅改变训练目标(重建 vs. 预测),进行跨语言(英语/法语/普通话)、逐层(L1-L4)、十种子重复实验。创新点包括: - 将目标作为唯一操纵变量,分离目标与架构的影响; - 引入训练语言交叉设计,区分手臂固有难度与语言特化; - 以原始mel特征作为绝对参考(输入特征底限),衡量表征提升或退化; - 检验阅读语音与儿童导向语音的注册效应; - 量化种子预算对效应检测的影响; - 探索脑回路映射架构(DualCodeModel)及六种目标配置,寻找完整发展特征。
本研究通过严格控制的实验设计,证明学习目标(而非架构)是感知窄化形状表征变化的一阶决定因素。
工业场景中的异常声音检测(ASD)面临严重的背景噪声干扰问题。传统ASD系统在训练和测试时均受到噪声影响,难以准确检测机器故障。DCASE 2026 Challenge Task 2 引入了噪声感知异常声音检测(NA-ASD)任务,采用双麦克风设置(近麦克风靠近机器,远麦克风捕获噪声),旨在利用辅助噪声信息提升检测鲁棒性。
本文提出将噪声感知自监督学习(NA-SSL)框架应用于NA-ASD任务。NA-SSL模型基于冻结的预训练SSL模型(BEATs、EAT、Dasheng),在每一Transformer层后插入可训练的NA层。NA层通过交叉注意力机制,利用远麦克风的噪声表示来精细化近麦克风的噪声表示,实现条件去噪。训练时,模型通过蒸馏方法,以干净目标声音的表示为学习目标,使用MSE损失优化。作者模拟了双通道混响房间场景,使用FSD50K作为目标声音,WHAM!、DEMAND、QUT-NOISE作为噪声,生成训练数据。在ASD推理时,NA-SSL模型作为前端提取去噪表示,后端可采用频率保持聚合、BEAM或RDP等技术。
在DCASE 2026 Challenge Task 2开发集上,NA-SSL框架显著提升了三种基础SSL模型的性能,无论是否进行判别性微调。在官方挑战赛中,NA-BEATs系统以70.24%的官方得分大幅领先,第二名仅为65.46%,官方基线为59.80%。
本文创新性地将NA-SSL与双麦克风噪声感知任务结合,通过条件去噪机制显著提升了ASD在噪声环境下的性能,并在DCASE 2026挑战赛中取得第一名,验证了方法的有效性和实用性。
CLP(唇腭裂)语音因发音器官结构和功能障碍,存在高度异质性和声学可变性,导致传统ASR系统识别性能严重下降。现有Whisper微调方法在低资源、高异质的CLP数据上易过拟合,难以泛化到不同严重程度的语音。
提出Normal-Anchored First-Order Model-Agnostic Meta-Learning (NA-FOMAML) 框架,用于Whisper的CLP语音识别微调。核心思想是利用元学习中的内循环(support set)和外循环(query set)机制:内循环使用正常语音作为支持集,确保可靠的适应源;外循环使用不同严重程度的CLP语音(轻度、中度、重度)组合作为查询集,优化模型使其在适应后仍保持泛化能力。采用一阶MAML(FOMAML)避免二阶导数计算,降低计算成本。此外,探索了部分编码器微调策略(冻结编码器、全编码器、不同层段),并控制训练样本数量以保证公平比较。
提出了一种结合正常语音锚定的元学习方法,有效缓解了CLP语音识别中低资源和异质性问题,但重度语音识别仍具挑战。
本文聚焦于自回归(AR)语音/音频生成中的一个核心矛盾:如何同时实现高保真重建、低AR误差累积和低模型复杂度。高帧率或高维表示虽能保留更多信号细节,但容易在流式生成中产生分布漂移和误差累积;而低帧率、强压缩的表示虽简化了AR建模,却会丢失关键信息,限制重建质量上限。
作者提出了两个协同设计的组件: 1. Locodec(局部编码编解码器):一种重建优先的tokenizer,生成低帧率(8 Hz)、高维度(768维)的连续token。其潜在空间被设计为: - 围绕一个低维的“可插值核心流形”组织,提升高维空间的可插值性; - 鼓励原生高维坐标形成能量层级,提升每个token的可辨识性。 这使得高带宽连续token更容易被单token预测。
在8 Hz、768维token配置下,该设计在Seed-TTS-eval数据集上: - 保持重建质量; - 提升单token可预测性; - 达到有竞争力的WER(词错误率); - 在长句合成中保持稳定。
且无需外部SSL/ASR模型、无需预训练文本语言模型、无需后训练阶段。
通过联合设计表示空间的几何结构和AR生成框架的路径结构,本文在低帧率高维连续token上实现了高保真与长时稳定性的双赢。
边缘设备大多依赖固定推理算法,无法在设备端进行个性化学习。现有策略如云推理、设备端BP训练或专用硬件学习均存在高延迟、高功耗、隐私风险或仅支持单一学习场景等局限。实际部署需要统一支持多种学习场景(FSL、CL、ZSL、ICL)并适配多种感知模态(图像、音频、token),形成基础性挑战。
提出embedder-centric learning (ECL)框架:将每个学习场景解耦为共享的embedder网络(处理时序/原始数据,生成低维嵌入)和场景特定head(基于嵌入做预测)。该设计使知识存储紧凑、可重用,并能统一处理不同模态,在硬件上实现多种在线学习。基于自研Chameleon SoC进行验证。
本文通过ECL框架,在边缘设备上实现了对FSL、CL、ZSL和ICL的统一支持,兼顾低功耗与高精度,为智能边缘设备的通用在线学习提供了首创解决方案。
现有的ASR置信度估计方法(如CEMs)高度依赖模型内部表示(隐藏状态、注意力权重等),导致架构可移植性差;而传统的softmax置信度存在系统性过度自信和校准误差问题,尤其是在最大校准误差(MCE)方面表现不佳。
本文提出了Score-Rank Confidence Estimation Module (SR-CEM),一种轻量级、架构无关的置信度估计模块。SR-CEM仅利用beam search输出的token分数和排名构造特征,包括:token分数、token排名、前后文累计分数、top-K分数(token级),以及单词级对应的聚合特征。该方法避免了依赖内部表示,可适用于混合CTC/Attention、CTC-only、RNN-T等多种E2E架构。
在LibriSpeech和Common Voice等数据集上,SR-CEM在token级和词级置信度上均显著优于softmax置信度: - Token级:MCE从20.04%降至4.50%,ECE从1.75%降至0.30%(in-domain); - 词级:MCE从17.91%降至8.17%,ECE从1.67%降至0.35%; - 鲁棒性:在混合架构、transducer、荷兰语、噪声和会话语音条件下均表现稳定,尤其擅长降低MCE。
SR-CEM是一种高效、架构无关的置信度估计方法,显著提升校准效果,特别在降低最大校准误差方面具有突出优势。
现有波形扩散模型(如CNN U-Net和DiffWave)通常依赖深层网络和大量参数,计算开销大,缺乏紧凑高效的设计。
本文提出一种Dual-Path (DP)架构,在时频域中分别沿子带轴和帧轴进行维度自注意力,从而同时建模细粒度时间与频率依赖。基于该模块构建了DP-DiT和DP-U-Net两种轻量级扩散模型,支持类别标签和RMS信号作为条件,实现端到端波形生成。
在DCASE和FSD-Kaggle2018数据集上进行实验,DP系列模型在所有客观和主观指标上均优于现有基线。尤其值得关注的是,仅3M参数的变体即可匹敌超过50M参数模型的性能,展示了极高的参数效率。
本文通过精心设计的轻量级双路径注意力架构,实现了资源高效且高保真的Foley声音生成,为该领域提供了新的高效基线。
分布式多通道主动噪声控制(DMCANC)系统虽具可扩展性和灵活性,但现有实现大多采用零或随机初始化控制滤波器,导致自适应滤波器收敛缓慢,尤其在节点间声学路径异构且噪声时变的环境下,严重制约了全局控制效率和节点间协作效果。
本文提出一种基于模型无关元学习(MAML)的初始化框架,用于带间歇通信的分布式多通道ANC(IC-DMCANC)。方法通过聚合各节点主路径和次级路径的异质声学特征,在多个任务上训练MAML,学习一个可快速泛化的初始控制滤波器。训练后,该初始化被直接部署到各节点作为自适应滤波器初值,无需改动底层控制结构,即可显著加速在线收敛。
在六节点仿真环境中进行验证,对比集中式ANC、MGDFxLMS以及IC-DMCANC。实验涵盖音调噪声(315Hz+500Hz)、宽带噪声(200-800Hz)和真实压缩机噪声。结果表明,所提方法在所有噪声条件下均达到最快收敛速度,稳态降噪性能与其他方法相当,充分验证了MAML初始化的有效性。
将元学习初始化引入分布式ANC,开创性地解决了传统零/随机初始化收敛慢的问题,为大规模ANC系统提供了高效且兼容的加速方案。
政治语音深度伪造对选举公正构成严重威胁,尤其是在巴西。现有音频深度伪造检测器在基准测试(如ASVspoof)上表现优异,但在真实场景中性能大幅下降,且存在性别、年龄、口音等偏见。葡萄牙语资源稀缺,缺乏针对政治语音的领域特定基准。
提出了 ParlaSpoof-BR 数据集,基于巴西众议院真实录音,包含 40 位说话人(性别和地区均衡),覆盖 TTS、语音转换(VC)和部分操作(音频填充)三类攻击,并引入多种声学鲁棒性条件(增强、有损压缩、嘈杂噪声)。评估了三个 SOTA 检测器,并进行了系统性的偏见分析。
检测器在跨域泛化上表现不佳,方法学因素(合成模型选择、操作范围)对性能的影响大于人口统计学差异(性别、地区)。该数据集为研究政治语音深度伪造检测提供了领域特定基准。
首个面向巴西政治语音的深度伪造检测基准,揭示了现有检测器的泛化缺陷和偏见问题,对选举诚信有重要价值。
现有的音乐源分离(MSS)模型大多仅在录音室录音上训练,忽略了现场演出中至关重要的场地声学、扬声器系统响应和观众噪声,导致在真实现场录音上的泛化能力不足。
该论文提出两个新数据集来弥合这一差距: - CrowdioSet:包含4800条来自Freesound的真实环境音轨(氛围和事件),并通过HQ-SVC零样本歌声转换模型合成了与MUSDB18HQ和MOISESDB中所有人声轨同步的跟唱(sing-alongs)。 - PaRIRset:在40个专业音乐会场馆使用Zylia ZM-1阵列和beyerdynamic MM1参考麦克风测量了立体声脉冲响应(RIR),并通过多种数据增强策略(如极性/增益变化、跨场地混响拼接等)扩展至2200条立体声RIR。
此外,作者重新训练了开源的SCNet模型,在训练过程中在线混合观众噪声和RIR,使模型暴露于多样的现场条件。
实验表明: - 添加PaRIRset的RIR比仅使用语音增强任务中的真实RIR能更显著提升MSS模型性能。 - CrowdioSet能够有效去噪,并在客观(如SDR)和主观评估中均获得更优的分离质量。
该工作通过提供针对现场音乐场景的数据集与增强策略,为音乐源分离在真实演出环境中的应用奠定了重要基础。
Real-world social conversations are often multi-speaker and noisy, with utterances potentially directed to the assistant, to another speaker, or entirely irrelevant. Existing spoken dialog systems typically assume clean, dyadic interactions between a single user and an assistant, failing to handle ambiguous addressee and background noise.
This paper introduces Cocktail-Talker, a speech LLM framework that models the assistant's behavior using three action tokens: <|respond|>, <|listen|>, and <|ignore|>. It is trained via supervised fine-tuning (SFT) and reinforcement learning (specifically GRPO) to predict the appropriate action token and generate a spoken response only in <|respond|> mode. To generate training data, the authors develop Cocktail-DialogGen, an LLM-based simulation pipeline that uses Gemini 3 Pro to compose realistic multi-speaker dialog logs and Qwen3-TTS to synthesize speech, with a dialog assembler mixing audio and background noise at controlled SNRs.
The provided excerpt does not include the full experimental results section, but the framework is designed to improve turn-taking accuracy and selective participation in noisy multi-speaker environments. The paper likely validates Cocktail-Talker on simulated conversations generated by Cocktail-DialogGen, testing generalization to unseen environments (10 categories) and comparing against baselines.
This work makes a significant step toward spoken dialog systems that can selectively and naturally participate in complex social auditory scenes, addressing the under-explored 'speaking side' of multi-speaker conversation.
现有目标说话人提取(TSE)系统通常针对特定类型的辅助线索(如说话人注册、空间、视觉或文本)设计,架构与训练流程与线索设计紧密耦合,难以灵活扩展到新线索或多线索场景。此外,实际环境中线索可用性动态变化且可能不可靠,但现有框架缺乏对异质性线索组合与动态可用性的统一支持。
WeSep 提出一个模块化且线索可组合的统一框架,将 TSE 重新定义为异质性线索条件下的学习问题。其核心设计包括: - 解耦线索编码与分离网络:通过标准化接口连接线索前端(如说话人、空间、视觉、文本)与分离骨干(如 BSRNN、TF-GridNet、ConvTasNet 等),支持可配置的线索注入和灵活集成。 - 结构化的模态内线索建模:支持同一模态内多种特征类型(如频谱级、帧级、语句级说话人特征)的组合,实现互补条件。 - 可组合的多线索集成:多个线索可通过配置而非架构修改进行插拔式组合。 - 样本级异质性训练流水线:同一批次内不同样本可包含不同线索子集,统一优化框架下模拟动态线索可用性。
在 Libri2Mix-100 上使用 BSRNN 骨干评估说话人注册线索的不同特征表示: - 语句级说话人嵌入(Speaker Emb)SI-SDRi 为 13.17 dB; - 频谱级(USEF)和帧级(TF-Map + Contextual)分别达 15.91 和 16.07 dB; - 组合 USEF + Contextual 达到最佳 16.56 dB,准确率 98.05%。 因果模式下性能有所下降,但多特征组合仍优于单特征,且模型可导出 ONNX 用于低延迟部署。
WeSep 通过模块化解耦与统一异质线索训练,为 TSE 提供灵活、可组合且适应动态线索可用性的通用框架。
现有多领域音频生成模型通常针对单一类型声音(语音、音乐、音效)独立设计,无法直接生成包含多种声音成分并具有时间结构的复杂音频场景。传统多阶段流程(分别生成各成分后手动混音)耗时且难以保证整体一致性与成分间的精确控制。
该工作通过统一的非自回归生成框架,首次实现在单一模型中高效、高质量地生成包含语音、音效、音乐及复杂时间结构的音频场景,显著提升了多领域音频生成的一致性与可控性。
传统零样本文本到语音(TTS)克隆需要短音频作为参考,但当仅有人脸图像(如历史人物、游戏角色)时无法生成语音。现有Face-to-Speech(F2S)方法存在模式坍塌问题,且跨语言迁移尚未充分探索。
提出 Freeze-Align 框架: - 冻结SOTA语音生成器StyleTTS 2(教师),仅训练轻量级Face Adapter(MLP,约1.7M参数)将人脸特征映射到StyleTTS 2的风格空间。 - 对Face Encoder(InceptionResnetV1)的上层模块进行软调优(约18.3M参数),下层保持冻结。 - 设计混合损失(Hybrid Loss):包含监督对比损失(InfoNCE)实现身份判别、关系知识蒸馏(RKD)保持几何结构、方差正则化防止表示坍缩、以及辅助的人口统计损失(性别/年龄)。 - 推理时解耦音色和韵律,通过参数α和β实现身份-自然度权衡(公式6)。
基于冻结StyleTTS 2的轻量适配,首次实现从静态人脸图像生成自然、跨语言的语音,且通过解耦控制身份强度。
现有的翻唱歌曲生成(CSG)模型SongEcho依赖F0序列和有声/无声(V/UV)标签进行条件控制,但V/UV标签隐含的语言信息无法保证歌词准确性,导致音素错误率(PER)高达45.62%。
提出MPEcho框架,在SongEcho基础上引入两个关键模块: - 音素编码器:对音素序列进行编码,提供显式的音素级条件。 - 长度调节器(LR):根据音素时长序列扩展音素嵌入,实现精确的时间对齐。 此外,开发了Phonsa,一个基于Whisper的自动转录模型,专门针对歌唱语音进行高精度音素级标注,解决了高质量音频-音素对稀缺的问题。Phonsa采用分块自注意力机制和专门的边界/呼吸标记,优于传统Montreal Forced Aligner(MFA)基线。
MPEcho首次实现了端到端的旋律和音素感知的翻唱歌曲生成,通过引入歌唱语音合成(SVS)的先验知识,显著提升了歌词的准确性。
传统基于掩码的波束形成方法(如MVDR)通常对所有麦克风使用单一掩码来估计协方差矩阵。该方法在紧凑阵列中效果良好,但在空间分布麦克风阵列中,由于各通道信号功率、信噪比等差异显著,单一掩码无法充分利用空间多样性,导致性能下降。
本文提出一种多通道掩码波束形成框架,为每个麦克风独立估计掩码并分别进行预滤波,再用于协方差矩阵估计。具体包括三种掩码策略: - 参考掩码:使用参考麦克风的掩码应用于所有通道。 - 平均掩码:对所有麦克风掩码取平均。 - 多通道掩码:每个麦克风使用独立掩码。 此外,采用帧因果在线滑动窗口机制(短时P帧)以适应时变声学场景,并利用秩2协方差矩阵更新提高效率。
在模拟的紧凑阵列(CMA)和分布式麦克风场景中,分别测试了远距离噪声和近距离噪声条件: 1. 紧凑阵列:三种掩码策略性能相似,无明显差异。 2. 分布式麦克风:多通道掩码在近距离噪声场景下显著优于平均掩码,尤其在低输入SNR时优势更明显。 3. 鲁棒性:使用理想比率掩码(IRM)和DNN估计掩码均验证了多通道掩码的优越性,且DNN掩码下多通道方法仍保持增益。
本文证明了对分布式麦克风阵列采用每个通道独立掩码的多通道波束形成策略,能有效提升复杂声学环境中的语音增强性能,且具备在线处理能力。
传统递归期望最大化(REM)算法在说话人跟踪中依赖固定步长衰减策略,无法适应动态轨迹,导致跟踪精度受限。
提出深度展开递归EM网络(Unfolded CREM),将迭代步骤展开为可微层,并引入步长网络(Step Size Network),利用特征线性调制(FiLM)和位置编码(PE)基于时间上下文与收敛状态动态调整递归权重,实现自适应更新。
在单说话人混响跟踪任务中,所提方法均方根误差(RMSE)低于经典Cappé and Moulines REM(CREM)基线,证明其有效性和潜在优势。
基于深度展开的REM网络通过学习自适应步长显著提升移动说话人跟踪的精度与鲁棒性。
传统的ASR-LM级联(如Generative Error Correction, GER)在低词错误率(WER)场景下,LLM会过度纠正(over-correct),导致正确词被改写,错误率反而上升(例如金融新闻中高达64%的编辑有害)。现有适应方法(微调、LoRA、软提示)需要训练、不可审计、不可跨模型迁移。
提出Voice Memory,一种仅推理的适应方案。核心是listener-thinker架构: - Listener:冻结的校正器(frozen corrector)在推理时读取可读的文本记忆文件(memory.md),对每个话语决定是否执行纠正(act)或放弃(abstain)。 - Thinker:异步的、基于验证分数的优化器(score-gated optimizer)通过有界编辑(add/delete/replace)改进记忆文件,只接受严格提升保留集分数的编辑。 无需权重更新,记忆可审计(人类可读)、可跨校正器家族迁移、零参数增量。
一种轻量级、可审计、零训练的语音识别适应方法,通过文本记忆存储纠正策略,有效避免过度纠正,显著提升低错误率场景下的ASR表现。
Open Sound Control(OSC)是专业音频、现场演出和虚拟制作中实时参数控制的主要协议。大型语言模型(LLM)虽然可以生成看似合理的OSC命令,但存在地址幻觉、类型标签处理错误、同义改写失败等问题,这在演出关键场景中是不可接受的。
提出LLM4OSC架构,采用“先提议-再验证-后发送”流程: - 设备配置文件(Device Profile):人工审核的封闭设备配置文件,包含地址、类型标签、参数范围等,作为封闭世界。 - 意图JSON:LLM基于用户话语和配置文件提出结构化意图JSON,包括成功意图(含字段和参数)或拒绝意图(含原因)。 - Tier 3确定性执行引擎:对意图JSON进行验证、数值钳位、确定性编码和UDP发送,不使用机器学习模型,确保安全性。 - NL refine:对LLM提议进行后处理,包括标签/槽位填充、检索重写、检索门控等,可覆盖LLM错误。 - 检索门控:应用B0(基于规则检索+槽位填充)的策略,对超范围地址进行拒绝。 - 四个后端:B0(规则生产默认)、B1(Qwen2-0.5B零样本)、B2(B1+8样本)、B3(B1+LoRA),均经过refine和gate。
LLM4OSC通过确定性验证和符号化后处理,实现了基于LLM的安全OSC控制,证明了在小型封闭套件中策略(profile+refine+gate)可以主导权重(few-shot/LoRA),但LLM延迟仍高于规则后端。
扩大至100-500+分层案例和第二个设备;消融refine vs gate vs LoRA;错误发送感知训练;MCP服务器接口;多参数/捆绑模式v2。
现有立体声音乐源分离(MSS)模型在处理双耳音频时,会破坏空间质量,导致听众沉浸感下降。然而,评估双耳MSS输出的空间指标(如ΔITD、ΔILD、SRR)与人类感知的相关性尚未系统验证,尤其是ΔITD对噪声和分离伪影高度敏感,缺乏可靠性。
该研究系统验证了双耳音乐源分离评估指标与人类感知的相关性,揭示了现有ΔITD指标的脆弱性,并强调了开发鲁棒且可解释的空间指标的必要性。
现有公开的多模态语音数据集普遍存在规模小、仅覆盖单一疾病或状况、缺乏对教育、用药、共存疾病、情绪状态等关键混淆变量的记录,导致分析可靠性和可解释性受限。
提出CARE v1.0(Conversational Audio-visual Recordings of health Experiences),一个基于HEXI平台构建的精心策划的多模态英语数据集。包含612名个体(12种医疗状况+对照组)的4281个短视频片段(约143.5小时)。对每个片段提供预计算的多模态描述子(语音、面部活动、注视模式、身体动作),以及人口统计学信息和通过LLM(gpt-oss-120b)从叙述中自动提取的结构化元数据(用药、生活影响、情绪等)。
论文主要描述数据集构建,未提供具体实验结果,但预期该数据集可支持疾病检测、多模态行为建模、疾病轨迹研究等多种应用。
CARE v1.0是一个大规模、多条件、多模态且元数据丰富的医疗健康交流数据集,有望推动数字生物标志物研究。
抑郁症诊断主要依赖主观临床评估,缺乏客观生物标志物。本文旨在通过语音信号中的声道变量动力学特征,识别新的抑郁症生物标志物。
本文首次将声道变量动力学(LLE、CD、SE)应用于抑郁症语音生物标志物识别,在临床样本上验证了有效性,为客观抑郁症检测提供了新视角。
在声学场景分类中,当训练数据和测试数据来自不同设备时,存在域偏移问题,导致深度学习模型泛化性能下降。
本文系统比较了两种域适应方法(DANN和CDAN)在两种特征提取器(CNN和Transformer)下的效果。DANN通过对抗训练学习域不变特征,CDAN则进一步利用分类器预测与特征的联合分布对齐。研究揭示了域适应方法需根据特征表示类型进行定制。
基于DCASE 2020数据集,使用多个设备(A、B、C、S1、S2、S3)评估: - DANN对CNN和Transformer特征提取器均能提供稳定的域适应效果。 - CDAN仅在CNN特征提取器上有效,对Transformer效果不佳。
本文强调域适应方法的设计需考虑底层特征表示,为自适应声学场景分类提供了重要指导。
现有紧凑型VAD模型依赖于不可广泛支持的组件(如可学习滤波器组、循环层、非因果后处理),且参数量虽小但实际部署存在前端兼容性、架构约束、延迟和因果评估问题。
kiloVAD通过部署导向的设计和压缩方法,实现了因果、低延迟、超轻量的语音活动检测,在边缘部署中达到最优性能。
许多商业TTS系统发布合成模型和预设风格向量,但不提供将音频转换为风格向量的参考编码器,用户无法为自己的声音生成风格向量。
提出基于梯度反演的优化方法:保持TTS模型及其所有权重冻结,仅优化风格向量,目标是最小化合成语音与目标录音在WavLM-Large第4层时间池化统计量(均值与标准差)之间的均方误差。该方法不依赖转录文本、对齐、说话人验证模型或参考编码器,适用于任意目标录音。
在VCTK(110人)和Seed-TTS(44人)共计154个说话者上,ECAPA-TDNN相似度从0.132提升至0.413,ResNet相似度从0.099提升至0.401,所有说话者均有提升。在等错误率点上,53%的恢复声音被验证器接受为目标语音,而预设起点仅为1%。
一种无需训练、无需转录的未知风格向量恢复方法,显著提升语音克隆的相似度。
仅适用于具有明确风格向量的TTS模型(如SupertonicTTS),且优化过程需要一定计算资源(单说话者约0.49分钟)。
通用推理运行时(如 ONNX Runtime)在流式语音增强任务中存在过高的框架开销和部署复杂性,尤其是在低功耗 CPU 上难以满足实时性要求。传统方法要么牺牲模型质量(如 RNNoise),要么依赖特定硬件(如 GPU)。
通过模型专用化和精细的 int8 优化,在消费级 CPU 上实现了远超通用运行时的流式语音增强性能,同时保持跨平台输出一致性。
儿科哮喘在急诊科(ED)诊断困难,因为金标准肺功能测试不实用,且症状与其他呼吸道疾病重叠。已有音频研究多在受控环境,不适用于嘈杂、时间紧迫的急诊环境。
本文首次在真实急诊环境中,利用自监督学习(SSL)预训练语音模型(HuBERT, WavLM, Wav2Vec 2.0)从呼吸音中提取特征,并结合患者年龄和性别,使用传统机器学习分类器进行患者级别哮喘检测。采用分层组5折交叉验证和留一患者验证(LOPO)确保泛化性。
31名儿科患者(10哮喘,21非哮喘)的30秒呼吸音记录(6个胸位)。Wav2Vec 2.0结合直方图梯度提升(HistGB)表现最佳,准确率0.84,灵敏度0.80,特异度0.86,F1-score 0.76,且在两种验证策略下一致。
本研究证明预训练自监督音频表示在急诊场景下用于儿科哮喘检测的可行性,Wav2Vec 2.0模型表现突出,具有临床推广潜力。
结合图神经网络与预训练跨语言语音表示,在低资源场景下有效提升了 ALS 检测和进展预测性能。
标准CLAP模型独立编码音频和文本,无法适应查询依赖的任务(如音频问答、属性聚焦检索),生成的音频表示是静态且与查询无关的。
提出Text-Prompted CLAP (TP-CLAP),在CLAP基础上添加基于交叉注意力的融合模块,将文本提示注入音频特征。训练时使用音频多项选择(audio-MCQ)框架,通过对比学习对齐查询条件化的音频表示与正确答案的文本嵌入。同时保留标准CLAP损失和辅助损失以保持通用对齐能力。
TP-CLAP以轻量级扩展实现查询条件化音频表示,在提升查询依赖任务性能的同时不牺牲通用能力。
该工作首次提出针对执法记录仪音频的端到端模块化双路径会话智能框架,通过任务特定预处理和确定性融合有效应对噪声与重叠挑战。
音频-视觉声音源定位任务中,密集空间标注成本高昂,而现有大规模预训练检索模型(如PE-AV)虽然具有丰富的多模态语义,但其全局对齐的表示丢失了精细空间信息,无法直接用于定位。
提出LAIP(Localization via Audio-Informed Pooling)框架,核心是音频引导空间池化(AiSP)模块。该模块插入在帧编码器和视频编码器之间,利用帧对齐的音频嵌入查询中间层的视觉token,生成声音条件化的视觉表示,替代原有的全局池化。采用层级化设计,逐步降低空间分辨率,避免寄存器token干扰,并产生多尺度注意力图用于定位。
在AVSBench和AVATAR基准上达到当前最优(SOTA),在AVATAR上性能几乎翻倍。结果表明,无需从头训练定位模型,仅通过轻量级改造即可从检索模型中解锁空间接地能力。
本文证明大规模预训练检索模型中的中间视觉token蕴含可用的空间信息,通过音频引导池化即可高效实现弱监督声音源定位。
现有的对话语音合成(CSS)方法主要依赖文本和音频模态,忽略了用户面部表情这一重要的非语言情感线索。同时,缺乏大规模、高质量、同步视觉-语音的对话数据集,且现有视觉编码器难以捕捉对话中的细微面部表情。
广泛的主客观实验表明,FacialTalker在面部表情感知和语音合成质量上持续优于强基线(如Empatheia、EmpathyEar等),生成的语音更自然、更具表现力,且与对话上下文对齐。验证了训练策略和数据集的可靠性。
论文首次将面部表情作为显式模态融入CSS,通过高效的分词器和偏好优化策略,显著提升了对话语音合成的情感共鸣和自然度,并贡献了大规模多模态数据集。
本文通过系统分析揭示了 Vocos 相位建模瓶颈在于 1D 卷积缺乏时频局部结构的归纳偏置,并证明 2D 卷积能有效改进相位预测,为未来时频声码器设计提供了方向。
现有音频深伪检测系统在单一数据集上表现良好,但跨数据集泛化能力差。传统方法如数据增强、基于辅助标签(语言、编解码类型)的对抗训练、以及MoE(混合专家)模型,存在增强覆盖有限、辅助标签难以获取、模型复杂度高等问题。
提出一种数据集感知的框架,利用数据集身份作为自然可用的监督信号,无需额外元数据。两种策略:
模型以XLS-R为前端,ECAPA-TDNN为骨干,仅含315.4M参数,轻量高效。
遵循2025 Speech DeepFake Arena基准协议,在多个评估数据集上: - MT使平均EER相对降低13.14% - GRL使Pooled EER相对降低5.32%
展示了在异构数据集上提升整体检测性能的能力。
一种利用数据集身份标签的轻量级单模型框架,有效提升跨数据集泛化能力,避免了对辅助元数据的依赖。
现有语音合成系统在内容一致性、说话人相似度、韵律自然度、音频质量、可控性、多语言覆盖、效率和鲁棒性等方面难以同时达到生产级要求。
Qwen-Audio-3.0-TTS通过低帧率分词器和多阶段渐进训练,实现了自由可控、高鲁棒性的生产级语音合成,在多语言、多方言和恶劣声学条件下均表现出色。
传统自动均衡方法依赖手动定义目标曲线或参考录音,泛化能力有限,且对噪声和混响敏感。
提出数据驱动的盲均衡方法:利用预训练的CLAP模型提取语义嵌入(冻结),仅训练轻量级MLP头来预测对数梅尔频谱特征,进而推导逆滤波器。通过将退化过程(随机EQ、混响、加性噪声)作为训练数据增强,模型可估计干净信号的频谱形状,实现盲均衡。
在语音和音乐数据集上训练,客观指标验证有效性,主观测试表明性能与使用真实梅尔频谱的oracle相当,限制主要来自滤波阶段。
提出了一种基于语义嵌入的高效盲均衡方法,兼顾训练效率与泛化能力,在真实场景中有应用潜力。
语音转换技术被用于冒充目标说话人,威胁生物识别安全。现有源说话人恢复方法难以泛化到未见过的转换方法,且目标说话人特征掩盖了源说话人痕迹。
提出TRIDENT框架,采用三叉戟架构:主提取器用于恢复源说话人身份,第一辅助分支识别语音转换方法类别,第二辅助分支提取目标说话人潜表征。通过解耦转换方法和目标说话人特征,提升恢复准确性。
在7种最新语音转换方法上达到90.99%的源身份识别准确率,对电话信道、未见语言和自适应攻击具有鲁棒性。
TRIDENT通过多分支协同解耦,有效恢复转换语音中的源说话人身份,显著提升泛化能力和鲁棒性。
当前语音到IPA转录的Phonetic Foundation Models (PFMs) 依赖G2P标签,但G2P标签是音位层级的,忽略声学细节,导致对未见过的语音区分(如中文送气音、日语音节鼻音)表现差。
提出基于连续发音特征(AF)向量的分类方法:训练时联合预测IPA token和AF向量(24维),推理时通过计算AF向量与PanPhon模板的L1距离进行分类。同时探索了单帧和分段两种时间聚合方式。
一种利用连续发音特征替代离散IPA token进行零样本语音分类的有效方法。
音乐源分离(MSS)任务中,模型架构只是影响分离质量的因素之一,整个pipeline(数据准备、增强、损失函数、评估指标、推理策略等)的工程选择同样关键。现有开源框架多聚焦单一架构或特定设置,缺乏统一、可配置的训练与评估平台,导致实验迭代和消融研究效率低下。
MSST(Music-Source-Separation-Training)是一个统一的开源框架,支持多种现代模型家族(如Band-Split RoFormer、Mel-Band RoFormer、HTDemucs、SCNet等),通过YAML配置驱动实现模型、数据预处理、增强、损失函数、评估指标的快速切换。关键技术包括:滑动窗口推理与交叉淡入淡出、测试时增强(TTA)、模型集成、LoRA微调等,旨在提升分离质量和实验可重复性。
论文通过消融研究展示了所提技术(如TTA、模型集成、LoRA)对MSS性能的可靠改进,但具体量化结果(如SDR、SI-SNR等指标)未在摘要中给出。
MSST为音乐源分离提供了可复现、可配置的一站式训练与评估平台,显著降低了系统实验的门槛。
传统的基于镜像源方法(ISM)的房间冲击响应(RIR)模拟在反射阶数高、房间复杂时计算成本高。直接神经网络方法虽快但会丢失可解释的路径级结构。
PathRIR提出了一种巧妙的方法,在保留ISM物理可解释性的同时,通过智能剪枝和轻量补偿实现高效RIR模拟。
核心痛点:零样本文本转语音(ZS-TTS)在标准英语上接近人类水平,但复制地区口音(如新加坡英语Singlish)时表现不佳,口音趋近于通用英语。
方法创新: - 首次系统研究Singlish口音的零样本TTS微调。 - 微调两个先进ZS-TTS模型(Chatterbox和CosyVoice 3),使用来自IMDA National Speech Corpus的50个Singlish说话人数据。 - 提出适应(域内说话人)与一致性(域外说话人)的评估分割,区分说话人记忆与口音泛化。 - 采用客观指标UT-MOS、WER、SPK-SIM、ACC-SIM评估自然度、可懂度、说话人相似度和口音相似度。 - 提供可复现的数据预处理流程。
实验结果: - 微调后,Chatterbox和CosyVoice 3在域内和域外说话人上的口音相似度均提升。 - 生成分布向真实Singlish靠近,且增益在未见说话人上保持。
一句话评价:本文首次量化了ZS-TTS在Singlish口音上的不足,并通过微调有效改善了口音迁移能力。
LIWC(语言查询与词频统计)在抑郁相关语言分析中广泛应用于解释性分析,但其增量预测作用在现代多模态系统中尚不明确。性能变化可能源于参与者对齐的语言信息、通用特征结构或直接访问原始LIWC类别轴,需要区分这些归因。
提出控制替换协议,比较完整LIWC与三种折叠局部替代:(1)PCA旋转版本(移除类别坐标直接访问)、(2)参与者混洗版本(保持LIWC分布但打破参与者对齐)、(3)随机边际版本(保持特征分布)。在五个英中文抑郁语料库上进行参与者级别交叉验证,使用多种固定表示上下文(语音编码器、语义嵌入等)。
论文通过严格的控制替换实验,质疑了LIWC在抑郁分类中的增量预测价值,同时确认其作为可解释的心理语言学描述层的实用性。
现有语音同步研究主要聚焦于人类之间的二元对话,但人与数字代理的多方交互场景尚未充分探索,尤其是对儿童与成人混合群体的影响。
论文揭示了人类在多主体对话中优先与同类同步,而非与数字代理同步,且儿童对声学细节的同步敏感性低于成人。
现有语音对话模型评估指标(如ASR/TTS指标)无法捕捉交互层面的人际社交信号(如同理心、礼貌、支配性),缺乏对语音中人际立场的标准化评估工具。
提出StanceBench基准,针对对话语音中的人际立场评估: 1. 从Seamless Interaction数据集的Improvised子集定义9个立场维度(如温暖、同理心、礼貌等),每个维度通过正负两极的角色提示(role-prompt)进行弱监督标注。 2. 标准化单说话者和交互两种评估设置,要求法官模型根据音频直接评分。 3. 引入鲁棒性、偏见、立场可分离性等指标,系统评估法官模型表现。
首个针对语音交互中人际立场评估的标准化基准,揭示了不同法官模型在社交信号识别上的鲁棒性和偏差,为未来S2S模型评估提供重要参考。
现有基于LLM的语音系统大多只支持少数高资源语言(特别是英语),缺乏对低资源语言的支持,且多数不开放数据和模型,阻碍可重复性和透明度。
MEUSLI是首个开源的多语言投影器系列(Multilingual EU Speech LInear projector),连接预训练的Whisper编码器与开源多语言LLM(EuroLLM 1.7B/9B、Apertus-8B),通过轻量线性投影器实现端到端ASR。采用SLAM-ASR架构,仅训练投影器(+LoRA可选),不修改编码器和LLM。训练数据来自Common Voice 17.0、FLEURS、VoxPopuli,覆盖28种欧洲语言(7622小时),通过数据封顶(每语言每数据集100K样本)和迭代训练提升鲁棒性。支持通过持续学习(continual learning)扩展到训练中未见的语言。
MEUSLI提供了可扩展、开源的多语言语音理解基础,有力支持低资源语言和跨任务泛化。
语音深度伪造检测面临跨域泛化挑战:现有检测器针对已知合成器训练,但新合成器(不同声码器、TTS模型)产生新伪影,导致性能下降。传统经验风险最小化(ERM)训练的适配器难以泛化。
揭示了元学习通过重塑LoRA适配器的损失敏感几何结构来提升泛化能力,提供了一种描述性诊断工具。
现有语音隐私保护评估多依赖通用语音识别(ASR)和单词错误率(WER),但WER对所有词汇一视同仁,而实际敏感信息往往集中在特定类别(如数字)。数字信息(如电话号码、银行卡号)具有高利用价值、封闭词汇集和严格顺序约束,因此需要任务特定的评估。
本文提出一种任务特定评估框架,聚焦数字识别,并考虑知情攻击者(即攻击者完全了解混淆技术及其参数)。评估三种轻量级混淆方法:时域平滑、重采样和碎片重组(shredding)。使用两种攻击模型:通用ASR(微调Transformer)和数字专用DNN分类器。在AudioMNIST和Google Speech Commands(GSC)数据集上测试,并对数字序列进行拼接以模拟真实场景。提出数字识别错误率(DRER)作为新的评估指标,支持精确匹配和模糊匹配(Levenshtein距离≤2)。
本文首次在知情攻击者场景下系统评估了现有混淆技术对数字识别任务的鲁棒性,强调了任务特定评估的必要性。
通过异构量化和渐进式训练,成功将LLM-based ASR压缩至边缘CPU实时运行,兼顾速度与精度。
现有AI语音转换研究主要聚焦于自然人类语音,缺乏针对非自然/非人类发声(如怪物咆哮、机器人声音)的公开数据集和标准化基准,导致该领域研究进展缓慢且难以公平比较。
论文未给出具体数值结果,但提及提供了基线性能参考点以支持未来比较。
首个公开的面向非人类语音转换的设计发声数据集,填补了领域资源空白。
现有情感识别(ERC)模型过度依赖明显的多模态信号(如文本、面部表情、语音),忽略了情感状态在对话中的持续性和个性化演变。情感变化往往由潜在因素(性格、情绪、说话者特定倾向)驱动,且在不同说话者间存在差异。当信号存在噪声(如遮挡、俚语、麦克风噪声)时,模型表现脆弱。
在IEMOCAP数据集上,多模态设置下性能优于最新方法。模型轻量、端到端可训练。
通过显式建模说话者特定的情感先验和动态转移控制,显著提升了ERC在噪声环境下的鲁棒性和准确性。
传统蜂群强度监测依赖人工检查,耗时且干扰蜂群;使用音频IoT传感器时,传统时频特征对噪声敏感,且之前的方法丢弃了调制频谱中的时间动态信息。
该研究通过保留调制频谱时间维度的深度学习方法,显著提升了基于音频的蜂群强度远程监测的准确性和泛化能力。
本文提出了一个统一的全歌生成框架,通过层次自回归规划与流匹配渲染,在歌词到歌曲、纯音乐和翻唱任务上实现了可控、高保真的生成,达到了领先的竞争性能。
现有非线性自适应滤波算法大多只考虑输出噪声,忽略了输入噪声的存在(EIV模型)。BCKLMS算法虽能处理输入噪声,但存在两个主要限制:(1) 固定大小的字典无法充分捕捉输入信号特征;(2) 基于LMS的算法对输出信号中的非高斯噪声鲁棒性差。
本文提出随机傅里叶偏置补偿广义自适应滤波器(RFFBCGA)。在随机傅里叶特征(RFF)偏置补偿(BC)框架下,算法保持固定网络结构,通过BC项有效抑制输入噪声,同时RFF映射能更好表征输入信号。此外,利用广义自适应(GA)函数的灵活性,在不同噪声环境下增强算法鲁棒性。GA函数可退化为LMS、LMLS、MCC等常见代价函数。
在真实世界时间序列预测任务上的仿真表明,所提方法在非线性EIV模型下优于其他对比算法。同时还提供了均值和均方稳定性分析,并推导了两个简化推导过程的关键理论结果。
RFFBCGA算法通过结合RFF、BC和GA函数,同时解决了非线性EIV模型中的输入噪声和非高斯输出噪声问题,具有固定网络结构和高鲁棒性。
现有说话人匿名化方法主要针对单条孤立话语的声学特征进行保护,但现实中的语音交流往往包含多条话语,攻击者可通过聚合多个话语的声学、韵律和语言学线索来重构说话人身份,从而威胁隐私。
本文首次系统性地证明多话语、多模态攻击能有效利用匿名化语音中的残留说话人信息,显著降低隐私保护效果,为未来匿名化方法设计提供了重要挑战和评估标准。
当前体育场馆人群噪声测量主要依赖单点峰值 dB(A) 读数(如吉尼斯世界纪录),这种方法缺乏标准化,存在以下问题: - 未指定测量仪器、时间计权、测点数量,导致结果不可重复、不可跨场馆比较。 - 峰值读数易受瞬态声干扰,与感知响度不符(ISO 推荐使用快时间计权或等效连续声级)。 - 测点选择无依据,无法保证代表球场上的声环境。
提出一种可重复的跨场馆人群噪声测量框架: 1. 推荐方案:采用空间分布式测量(如声学相机),获取多个观众区域的声压级,从而计算具有代表性的“场馆人群声级”。 2. 最低报告基线:当无法分布测量时,采用单锚点测量(指向球场中央),确保捕获各观众区对场地的贡献。 3. 关键指标:建议使用快时间计权最大声级 L_AF,max 或等效连续声级 L_Aeq,而非峰值 dB(A)。
论文以实际足球比赛进球时刻为例,显示峰值读数比快时间计权最大值高 11.6 dB(121.7 vs 110.1 dB(A)),说明峰值读数的夸大性。同时指出吉尼斯纪录设备(Larson Davis 831)的过载点(143 dB(Z))接近所报告值,可能存在饱和问题。
本研究首次系统性地批判了现有单点峰值测量方法,并提出了一个兼顾跨场馆可比性与实际应用场景的标准化测量框架,为体育声学评估奠定了方法论基础。
现有大型音频语言模型(LALMs)在多选音频问答中常利用文本捷径(如语言先验、数据集伪影)而非真正依赖音频,导致在静音替换音频后仍能正确回答。DCASE 2026 Task 5 旨在构建一个严格依赖音频的评估基准(ADQA-Bench),推动模型真正的音频理解能力。
DCASE 2026 Task 5 提出了目前最大规模的音频依赖问答基准,通过严格过滤确保音频依赖性,但最优准确率仅58.33%,仍有巨大提升空间。
本文提出一种通过深度剪枝和渐进蒸馏从大TTS模型构建紧凑印地语TTS的实用方法,在有限数据下取得了接近教师质量的小模型。
多通道语音增强系统依赖固定麦克风阵列几何结构,难以泛化到不同设备;现有阵列无关方法虽能处理可变麦克风数量和排列,但未利用显式几何信息,导致性能低于固定阵列模型。
提出Geometry-Aware Dynamic Convolution (Geo-DConv) 框架,包含两个关键模块: 1. Fourier Positional Encoding:将麦克风相对坐标映射为高维特征。 2. Topology-Aware Coordinate Transformer (TACT):通过自注意力机制建模阵列拓扑,生成动态变换矩阵,从而调制固定卷积核的权重,使任意固定阵列模型能处理可变通道输入。
该模块作为通用适配器,可插入现有固定阵列模型(如BSRNN、SpatialNet)中,实现阵列不变性,并保持输出稳定性和置换等变性。
在真实录音数据集RealMAN(32通道,83.7小时语音)上进行训练和评估。将Geo-DConv集成到两个固定阵列模型后,在多种子阵列配置下,SDR、SI-SDR、PESQ、STOI、DNSMOS指标均优于原始阵列无关基线(FaSNet-TAC、USES2-comp)和固定阵列基线,验证了显式几何先验的有效性。
通过显式注入麦克风坐标信息并利用动态卷积,Geo-DConv有效解决了多通道语音增强中阵列几何适配问题,实现了在真实场景下的阵列不变性。
Yorùbá语言资源匮乏,现有神经TTS系统需要大量标注语音数据,而Yorùbá尚无公开可用的TTS系统。同时,Yorùbá个人姓名数据库增长迅速,手动录制音频不可扩展,需要自动化合成引擎。
通过50名听众的Mean Opinion Score(MOS)评估(详细结果见Section 6)。系统已部署在TTSYoruba.com及YorubaName.com,为近10,500个姓名条目生成音频。
该论文为低资源语言Yorùbá提供了一个完整、可部署、可复现的基于规则的语音合成系统,并在正字法上做出了创新性贡献。
电吉他单音高(pitch)可在多根弦的不同品上发出,人类听觉难以区分,现有系统依赖特殊硬件或离线处理。
首个纯浏览器端电吉他弦分类系统,通过精心设计的特征与对比训练,在无需额外硬件的情况下取得接近专业水平的识别率。
现有混音风格表示学习方法存在以下局限: - 多数方法要求固定长度或固定效果的FX链,缺乏灵活性。 - 需要可微效果实现,限制可用效果种类。 - 依赖稀缺的多轨干/湿配对数据,数据集规模小(如MUSDB18仅150首)。 - 部分方法(如LLM2Fx-Tools)冻结音频编码器,生成目标不优化表示。 - 推理时优化方法(如ST-ITO)速度慢(>1000秒/例)。
提出STEMFX框架,核心贡献如下: 1. 自回归FX链生成:将混音风格表示为变长、多效果的FX链,通过Transformer解码器自回归预测令牌化序列,支持任意效果顺序和链长。 2. BSFiLM编码器:基于频带分割(band-split)的多分支CNN,结合FiLM条件注入手工设计的混音特征(64维),捕获每轨频谱结构。 3. 分离-增强管道(Sep-Aug):对约105K首歌曲进行源分离得到伪干音,再用MultiAFx工具(85种效果)随机增强,构建大规模配对训练数据。 4. 端到端联合训练:编码器和解码器共同优化,生成目标反向传播至音频表示。
STEMFX通过自回归生成变长FX链并联合训练编码器,首次在105K歌曲规模上实现高效、灵活、可解释的混音风格表示学习。
钢琴协奏曲伴奏定制中,缺乏数字化符号乐谱,且不同音频(独奏、管弦乐、混合)之间存在频谱不匹配,导致传统对齐方法效果不佳。
提出 Dense-Sparse DTW(DS-DTW)算法,通过选择含有显著时间线索的音频帧(稀疏化序列)与密集序列对齐,忽略静音等不稳定区域,提高对齐鲁棒性。利用混合录音作为中介,实现无乐谱的伴奏自适应生成。
在自建的四首协奏曲乐章基准上,DS-DTW 相比标准 DTW、源分离和谱减法,在相同容差下错误率更低或相当,尤其在高时间尺度修改因子下优势明显。
DS-DTW 以简洁有效的稀疏化策略解决了频谱不匹配问题,为无乐谱伴奏生成提供了实用方案。
Cascaded architecture comprising: 1. Speaker Diarization: Local EEND-style with WavLM-Large + Conformer encoder, trained on multiple datasets. 2. Overlap Detection: Based on diarization output, identifies regions with multiple active speakers (max 2). 3. Target-Speaker Extraction (TSE): WeSep-based model with band-split RNN separator and ECAPA-TDNN speaker embeddings. Enrollment segments taken from nearest non-overlapped regions (≥5s, ≤20s). 4. Post-Processing: Dominant-speaker fallback: if cosine similarity between extracted signals >0.55, assign mixture to most similar speaker; other speaker drops that region. 5. ASR Backend: FireRedASR2-AED (1.18B parameters) using first microphone channel.
Total parameters: ~1.53B.
A well-engineered cascaded system that combines robust diarization, overlap-aware extraction, and post-processing to achieve competitive results, especially ranking 2nd on the more challenging Track 2.
X-Translator是一个开放、可复现的模块化级联S2ST系统,通过增量提交和说话人提示管理实现了实时、多说话人感知的语音翻译,为部署导向的S2ST研究提供了实用平台。
FlowSonic通过高阶数值积分与注意力缓存机制,实现了稳定、高保真的零样本真实音乐编辑,无需微调或配对数据。
临床笔记生成需要从医患对话中准确提取信息,避免幻觉,同时减少医生文书负担。传统方法依赖中间转录,而直接音频到SOAP笔记的系统需保持高可靠性。
该系统通过零样本筛选语音LLM、两阶段微调(SFT+DAPO RL)直接优化临床概念F1,在BeTraC挑战中赢得双赛道第一,并保持低幻觉率,证明任务指标优化与事实可靠性可兼得。
分布式多通道主动噪声控制(DMCANC)系统中,通信延迟会导致不稳定。现有ASSS-MGDFxLMS算法通过自动缩小步长来保证稳定性,但收敛速度显著减慢。
提出自适应动量增强ASSS-MGDFxLMS(AMAS-MGDFxLMS)算法。通过余弦相似度评估瞬时梯度与动量项的方向一致性,动态调整动量因子β_k(n)=min(β_0|ρ_k(n)|^p, β_0),当方向一致时增大动量以加速收敛,方向不一致时减小动量以保持稳定。额外计算开销仅约4L_w+2次乘法和6L_w-3次加法。
在通信延迟突变场景(10s、20s、30s变化)下,MGDFxLMS发散,ASSS-MGDFxLMS稳定但收敛慢,固定动量FMAS-MGDFxLMS可能不稳定,而AMAS-MGDFxLMS实现快速收敛并保持稳定,ANSE指标更优。
一种通过自适应动量机制有效加速通信延迟下DMCANC收敛的算法,兼具稳定性和快速性。
现有音频大语言模型(ALLM)大多依赖监督学习的音频编码器,受限于标注数据的质量和多样性,难以捕获超出预训练任务的声学信息。同时,多数模型使用简单适配器仅利用编码器最后一层表示,忽视了层次化表示;且缺乏对多模态上下文学习(MICL)的探索。
提出SALMONN-2,基于统一的自监督学习(SSL)音频编码器SPEAR、多层特征融合(MLF)适配器和显式的MICL训练。MLF适配器聚合所有编码器层的特征,更好地利用层次化表示;通过上下文偏置训练赋予ALLM多模态上下文学习能力。
在MMAU-Pro、MMAR、MMSU等基准测试中,SALMONN-2在相似规模开源模型中达到最优性能。仅用不到20K小时指令微调数据,性能超越多编码器设计。MICL能力需通过目标训练获得,而非自然涌现。
SALMONN-2验证了通用SSL音频表示作为ALLM有效基础的潜力,并通过层次特征融合与上下文学习显著提升性能。
语音健康评估模型缺乏可解释性,传统方法(如openSMILE)虽提取可解释的低级声学特征,但常与不可解释特征(如MFCCs)混合使用,且概念瓶颈模型存在任务特定捷径学习、缺乏灵活适应不同健康条件的问题。
提出基于音频语言模型(ALM)的语音概念瓶颈框架: 1. 解耦概念提取与下游分类:ALM作为独立概念提取器,通过微调临床语音质量数据(PVQD)学习临床语音质量(CVQ)概念,生成离散1-5序数评分,降低任务特定捷径风险。 2. 灵活概念适应:推理时可引入与微调不同的言语行为(SB)概念,灵活适应抑郁(行为变化)和构音障碍(运动控制障碍)等不同健康条件。 3. 增强可解释性:离散序数评分直观易懂,配合轻量级分类器(XGBoost)可直接应用SHAP等事后可解释性方法。
本文首次将音频语言模型用于概念瓶颈框架,实现灵活、可解释的语音健康评估,在抑郁与构音障碍任务上显著优于现有方法。
现有声音事件检测(SED)基准如DESED、UrbanSED等依赖合成声音场景或网络爬取音频,缺乏真实家庭环境的多样性(如设备、放置位置、背景噪声),且标注成本高、主观性强。
本文提出RealDESED基准,包含652名参与者在家中录制的5710段真实音频(15-35秒),涵盖15类常见家庭声音。特点: - 真实录音:非合成或网络爬取,反映真实设备、环境、事件共现。 - 多标注者标注:每段音频由多人独立标注,验证/测试集经审核保证质量。 - 丰富元数据:包括录制设备、放置方式、环境标签、场景描述。 - 强基线:基于ATST-F(预训练于AudioSet Strong)微调,测试集上PSDS1达0.731。
基线性能:macro-averaged PSDS1 = 0.731 on test set。探索了标注聚合、后处理、长序列推理及元数据影响。
RealDESED填补了真实家庭环境SED基准的空白,推动从研究到部署的桥梁。
现有的音频自监督学习(SSL)模型(如BEATs)在噪声环境下无法有效聚焦目标声音,导致下游任务性能显著下降。虽然语音领域已有噪声鲁棒SSL模型(如WavLM),但通用音频SSL尚未探索该方向。此外,由于音频下游任务多样,无法像说话人感知那样提供目标声音参考,而噪声参考更易获取。
提出了噪声感知音频SSL概念,并基于BEATs实现了NABEATs模型。NABEATs通过额外输入参考噪声信号,学习从带噪音频中估计干净的BEATs表示。设计了两种噪声感知(NA)层:基于交叉注意力(CA)和基于FiLM,分别称为NABEATs-CA和NABEATs-FiLM。同时引入DBEATs作为无参考的去噪基线。训练时冻结原始BEATs参数,仅训练插入的附加层,使用MSE损失进行知识蒸馏。
在FSD50K、US8K、SPCV2、CREMA-D、NSynth和Surge等六个下游任务上评估,模拟噪声条件(WHAM!、CHiME-3、MUSDB18)。NABEATs-CA显著优于原始BEATs和DBEATs,尤其在未见噪声类型上泛化能力更强。例如,在FSD50K上,NABEATs-CA在WHAM!噪声下mAP达45.80(原始BEATs仅35.28),且使用真实噪声时进一步提升至46.07。DCASE 2025 Task 2异常声音检测上也验证了有效性。
NABEATs通过噪声条件去噪机制有效提升了通用音频表示的噪声鲁棒性,在多种下游任务和噪声类型上均取得显著改进。
本文提出的伪标签蒸馏框架成功地将高昂的SSL模型性能转移到轻量级模型上,同时通过粗标签和数据增强实现超越,兼顾了效果与效率。
SongSQA首次将SQA从短片段扩展到完整歌曲,同时输出整体分数和段级质量曲线,有效解决了质量变化和非均匀感知问题。
跨语言自动说话人验证(X-lingual ASV)中,固定前端系统的分数可靠性会随语言匹配度、语音时长和分数来源而变化,传统全局校准无法适应不同条件下的可靠性差异。
提出AMECxSV框架,这是一个元数据驱动的嵌入融合校准后端,在元数据可用设定下工作。它融合多个固定前端系统的分数与元数据(语言匹配、时长可靠性特征),通过确定性特征扩展和MLP后端输出校准后的目标后验概率,并可选地基于后验置信度进行拒绝(AMEC-ABS)。元数据仅作为校准上下文,不直接作为说话人证据。
在TidyVoiceX-ASV开发协议衍生出的说话人互斥测试集上: - AMEC-FC(全覆盖率)将官方TidyVoice分数源的EER从3.15%降至2.42%,LI-MSV从0.64%降至0.43%。 - 双分数头(dual-score head)达到0.43%全覆盖率EER。 - 在0.79覆盖率下,AMEC-ABS达到0.03%接受试次EER。 - 通过分数仅、元数据置换、元数据仅等对照实验,验证了校准上下文解释的有效性。
AMECxSV通过元数据驱动的嵌入融合校准显著提升了跨语言说话人验证的可靠性,为多条件场景下的校准提供了轻量且有效的解决方案。
心音检测作为低成本心血管疾病筛查手段,其性能高度依赖音频预处理方式(前端)。此前研究多关注分类器本身,但忽略了输入表示(如频谱图计算方式)的影响。
固定一个紧凑的2D CNN,仅改变三种频谱图前端: 1. 标准对数梅尔频谱(log-mel); 2. 逐通道能量归一化(PCEN),自适应调整每个频率通道的增益; 3. 多分辨率对数梅尔频谱(multi-resolution),堆叠不同FFT窗口尺寸(256,512,1024)的三通道图像。 所有前端输出均标准化为零均值单位方差,训练策略(优化器、学习率、批次大小、epoch数)完全一致。
在PhysioNet 2016心音数据集(3240条录音,79.5%正常/20.5%异常)上: - 三种前端的敏感性均约0.95; - PCEN与多分辨率的官方修正准确率(MAcc)分别为0.915和0.916,优于基础log-mel的0.910; - 使用Grad-CAM发现模型主要关注低频(S1/S2心音区域)。
通过精心设计的控制实验,明确证明PCEN和多分辨率频谱图作为前端能小幅提升心音异常检测性能,且模型确实学到了生理相关特征。
首个完全开源、聚焦长视频的音视频大语言模型,通过大规模数据、三阶段训练和显式时间推理,显著提升了复杂现实场景下的联合理解与推理能力。
在二语口语自动评分系统中,基于端到端神经网络的模型(如BERT、wav2vec 2.0)容易学习到“捷径”特征(如语音时长、词数),导致模型过度依赖这些表面特征,而非真正的语言能力。这种依赖可被考生利用来不当提高分数,损害评估的构念效度。
本文提出一种秩相关惩罚(Rank Correlation Penalty)训练准则,通过在原始损失函数(MSE)上添加一个惩罚项,抑制模型预测分数与外部可计算代理特征(如词数、VAD时长)之间的Spearman秩相关。该惩罚作用于输出层,无需修改编码器或要求代理特征作为显式模型输入,因此适用于隐式编码的端到端系统。
实验在Speak & Improve 2025语料库上进行,使用ModernBERT文本评分器和wav2vec 2.0音频评分器,以词数和VAD时长作为代理特征。结果表明: - 原始模型与代理特征的相关性显著高于人类评分者的相关性,证实过度依赖。 - 引入惩罚后,相关性降低至接近人类水平(人类对齐模式),并可进一步压制至更低(恶意行为抑制模式),同时保持竞争性的评分性能。 - 惩罚主要影响目标代理特征,对无关特征影响较小,表明干预具有选择性。
本文提出了一种新颖的、模型无关的输出级别训练准则,有效控制端到端自动口语评分系统中的隐式捷径依赖,并提供了可解释的两种操作模式。
专业声优(voice actor)的语音克隆(voice clone)归因任务存在几何限制的识别底限(identification floor),即由于嵌入空间中声优语音高度密集(inter-speaker density高)且每个声优有多种风格(intra-speaker style range大),导致基于相似度阈值的归因方法不可靠:既可能冤枉非注册人(false accusation),也可能漏掉真正的克隆受害者(missed attribution)。即使采用校准、得分归一化、判别性重排序(LDA、WCCN、PLDA等)也无法消除该底限,根源在于嵌入几何本身。
本文揭示了专业声优语音克隆归因中嵌入几何导致的固有识别下限,证明了简单阈值方法不可靠,并提出了防御性设计建议(反欺骗、领域匹配编码器、逐说话人校准、弃权选项),对语音安全与公平性有重要启示。
动态时间规整(DTW)在处理长序列时具有二次时间和内存复杂度,难以在GPU等并行硬件上高效运行,限制了其在神经网络训练中的应用。
本文提出四种可并行化的对齐算法:非排序分段DTW(NSDTW)、弱排序分段DTW(WSDTW)、严格排序分段DTW(SSDTW)和并行化对角线DTW(ParDTW)。前三种通过将成本矩阵划分为矩形区域并并行处理来近似DTW,第四种则沿对角线处理成本矩阵实现精确DTW并行化。重点实现了WSDTW和ParDTW的GPU优化版本。
在音频-音频对齐任务上,ParDTW在长序列上相比现有方法将运行时间减少1.5到2个数量级,同时保持精确DTW对齐精度。WSDTW在近似精度和速度之间取得较好平衡。
ParDTW是目前最实用的并行化精确DTW替代方案,显著降低了长序列对齐的墙钟时间。
传统动态时间规整(DTW)算法在处理长序列时面临二次计算和内存开销,且其固有顺序性无法并行化,限制了大规模应用。
提出两种可并行化的全局对齐算法: - 弱有序分段DTW (WSDTW):将全局成本矩阵分解为多个子矩阵,对每个子矩阵独立执行子序列DTW,再通过分段级动态规划组合结果,保证弱时序一致性。 - 严格有序分段DTW (SSDTW):在WSDTW基础上增加分段级起始位置记录,确保对齐路径严格单调递增,但计算量更大。 两种算法均将大部分计算并行化,仅需少量线程间通信。
在Chopin Mazurka数据集上的音频对齐任务中: - WSDTW和SSDTW的对齐精度与标准DTW非常接近。 - 几乎所有计算均可并行化。 - 理论和实验均表明WSDTW是比SSDTW更优的选择(更少的计算、更简单的约束,且对齐效果不差)。
本文提出的分段DTW算法在保持对齐精度的同时,实现了DTW的高效并行化,为长序列全局对齐提供了实用替代方案。
动态时间规整(DTW)在音频对齐中广泛应用,但无法提供对齐路径的局部可靠性估计。现有方法(如Soft-DTW)主要处理不确定性,但未直接评估可靠性。
提出基于旁证的无监督可靠性度量:对DTW路径的局部块,使用FlexDTW(允许灵活边界条件)重新对齐,通过比较DTW与FlexDTW路径的一致性(基于欧氏距离阈值ε)计算可靠性分数。高一致性表明路径可靠(“强”路径),否则为不可靠。
在19个音频-音频对齐基准测试中(包含匹配与非匹配区域),该度量能有效区分可靠与不可靠区域,聚合AUROC达0.970(ε=10帧,约232ms)。
一种新颖、简单且有效的无监督DTW对齐可靠性估计方法,具有高准确率。
论文指出,基于机器学习的房间声学参数预测模型常报告高决定系数(R²>0.85),但这些高精度往往源于评估协议中的两种数据泄露:1)验证分割方式:行级随机分割使同一接收位置的不同测量出现在训练和测试集,导致条件插值而非空间预测;2)输入特征可用性:包含目标位置自身的脉冲响应等测量值,相当于提供了位置指纹,泄露了目标信息。
本文通过严谨的协议消融实验,揭示了房间声学参数预测中数据泄露的普遍性及影响,为可靠评估提供了方法论指导。
当前的TSE评估主要依赖模拟混合数据(如LibriMix、WSJ0-2Mix),无法真实反映实际对话中的自然重叠、混响、噪声、通道失配和对话动态等问题。
该挑战赛通过真实对话数据和多维度评估,为实际场景下的目标说话人提取提供了更全面的基准。
现有音乐生成模型大多基于自回归(AR)建模或级联多阶段流水线(如AR+扩散),导致生成效率低、长音频质量不一致,且难以在可控性、高保真度与长时长之间取得平衡。
WanSong v1.0通过纯扩散框架和双音轨建模,实现了高效、高保真、可控的长时长歌曲生成,是音乐生成领域的重要突破。
当前符号音乐表示学习缺乏层次化自监督方法,现有模型难以捕捉音乐的多尺度层次结构(如音符、乐句、乐段),且基于自然图像的SSL方法(如DINOv2)不适用于钢琴卷帘图(piano roll),因为其尺度变换会破坏音乐结构。
提出MIDI-RAE-JEPA,结合等变性目标(pitch和time shift)、LeJEPA框架和Swin Transformer V2编码器,学习符号音乐的层次化表示。主要贡献包括: - 等变性损失:使用delta-scaled目标距离,使嵌入距离与位移幅度成正比,防止坍缩。 - 软分解损失:在潜在空间中强制pitch和time方向几何正交。 - 分块SIGReg:减少显存占用并提高吞吐量。 - EMA教师+掩码嵌入预测器:提供稳定目标并促进上下文预测。 - 完整RAE流水线:编码器+冻结编码器解码器+条件流匹配生成模型,实现重建和生成。
MIDI-RAE-JEPA首次将层次化JEPA方法应用于符号音乐,通过等变性自监督学习获得语义丰富且可用于生成的表征。
Dialogs是俄语首个结合录音室质量、对话风格和情感标注的开源语料库,为对话TTS提供了重要资源,但说话人数据不均限制了单独使用效果。
本文展示了自监督表示与DTW结合在多维度发音评估上的潜力,尤其为低资源语言提供了无文本方案。
现有主动学习策略MFFT(Mismatch-First Farthest-Traversal)在低标注预算下表现不佳,主要因为:(1) 硬门控(hard gating)导致批次集中在高不匹配度的稠密区域,造成冗余;(2) 最远遍历(farthest traversal)倾向于选择离群点,对整体性能提升有限。两者均无法自动惩罚所选样本间的相似性。
提出MW-FL(Mismatch-Weighted Facility Location),将MFFT中的不匹配度(mismatch score)转化为非负权重,嵌入到设施位置(facility location)覆盖目标中。该目标函数具有次模性(submodularity),自动惩罚冗余选择,且无需额外超参数。通过软权重(soft weighting)替代硬门控,并采用覆盖导向的几何骨干(facility location)替代最远遍历。
在DESED和DataSED两个多标签数据集上,与6种基线(包括随机采样、FT、MF-FT、FL、MF-FL等)对比,MW-FL在两种数据集上均取得最优的AULC(Area Under Learning Curve)。实验表明:(1) 覆盖导向的骨干(facility location)是性能提升的关键;(2) 硬门控有害;(3) 软权重在覆盖骨干上进一步改善性能。
MW-FL通过软不匹配度加权的次模覆盖目标,有效解决了帧级音频分类中主动学习的冗余和离群点问题,无需额外超参数,显著优于现有方法。
核心痛点:生物声学帧级标注成本高,目标声音稀疏且类别长尾,主动学习需高效选择稀有、信息量大的片段。现有批量主动学习方法(如BADGE)使用k-means++或MCMC采样,缺乏理论保证,且帧级粒度不匹配导致信息被均匀平均稀释。
方法创新: 1. BADGE-Greedy-DPP:采用贪婪选择最大化正则化对数行列式(体积)目标,该目标是单调子模函数,贪婪算法保证至少(1-1/e)的最优性界。 2. 帧级伪梯度聚合:利用预测残差加权帧级伪梯度,使得不确定帧主导片段表示,减少置信帧的干扰,解决帧级粒度不匹配问题。
实验结果:在稀疏、不平衡的鬣狗叫声数据集(10个种类,最稀有类型<0.5%帧)上,BADGE-Greedy-DPP在总mAP和稀有类mAP上均优于随机、熵、最远遍历、分歧、MFFT、原始BADGE(k-means++和MCMC DPP)等基线,尤其在稀有类上优势明显。
一句话评价:通过理论保证的贪婪子模最大化和帧级残差加权,有效提升了长尾生物声学主动学习的效率。
大型音频语言模型(LALMs)作为语音评价裁判时,其高人类一致性可能源于协议层面的捷径(shortcuts),即模型利用协议提供的附加信息(如专家标签、参考标签、音频顺序)而非真正基于音频进行判断,导致评估结果失真。
该论文首次系统性地审计LALM裁判协议级捷径,揭示了聚合一致性可能高估裁判有效性,需对模型-协议对进行联合评估。
现有音乐可视化方法多依赖歌词或生成平面视频,缺乏沉浸感与情绪动态表达。
提出一种情绪感知的音乐驱动360°视频生成流水线: 1. MIR模块:提取节奏、四小节单元及Valence-Arousal情绪序列; 2. 情绪引导的关键帧生成:利用EmotiCrafter将VA值转换为情绪残差,通过SEGA框架对SDXL+360° LoRA进行细粒度语义控制,生成全景关键帧; 3. 360°视频生成:使用Wan-I2V和Wan-flf2v模型将关键帧动画化为动态片段与过渡片段,拼接为完整视频。
生成可直接在VR设备中观看的360°视频,场景随音乐情绪演变,结构对齐音乐节拍。定性比较优于From-Sound-To-Sight基线。
本文首次将音乐情绪轨迹与360°全景视频生成结合,为沉浸式音乐可视化提供了实用框架。
现有文本到音频(TTA)模型虽能生成高质量音频,但在多事件生成和时序遵循方面表现不佳,现有评估指标(如CLAPScore)仅关注全局相似性,缺乏对指令级正确性(事件完整性、时序顺序)的细粒度监督。
提出ALLM-Judged Preference Optimization (AJPO)框架: 1. 利用音频感知大语言模型(ALLM)作为细粒度裁判,评估生成音频中每个目标事件的存在性及事件间的时序顺序。 2. 在公开基准和人类验证上确认ALLM判断的可靠性后,将其反馈转化为偏好对(正确/错误),通过直接偏好优化(DPO)训练TTA模型。 3. 引入S3Bench,一个多事件叙事基准,专门评估时序指令遵循能力。
实验表明,AJPO在现有基准和S3Bench上提升了事件完整性、时序顺序和联合指令遵循准确率,同时保持音频质量。
通过将ALLM作为可扩展的指令级裁判并集成到偏好训练中,显著提升了TTA模型对复杂指令的遵循能力。
基于扩散的文本到音频生成模型(如AudioLDM)虽然生成质量高,但U-Net去噪骨干网络计算开销巨大,阻碍实际部署。
本文首次将滤波器剪枝应用于文本到音频扩散模型,在显著提升效率的同时保持生成质量。
无法获取全文内容,跳过总结。
无法获取全文内容,跳过总结。
无法获取全文内容,跳过总结。
无法获取全文内容,跳过总结。
无法获取全文内容,跳过总结。
无法获取全文内容,跳过总结。
无法获取全文内容,跳过总结。
无法获取全文内容,跳过总结。
一篇系统梳理机器人语音识别技术、模型、数据集、工具包及部署策略的全面综述,强调本地化与云端方案的权衡,为社交机器人研究者提供导航。
现代神经语音系统能生成高质量波形,但隐藏了物理发音状态;而生物力学声道模型能展示发音结构、接触行为等,但直接物理波形合成不如神经声码器鲁棒。
提出一个系统,结合时长保持的声学载体(提供听感波形)和修正的3D声道模型(提供同步的下颌、唇、舌、软腭、喉、口腔气流、鼻腔气流运动)。采用联合嵌入预测架构(JEPA)表示与强化学习/交叉熵方法(RL/CEM)轨迹选择循环,将发音动作与声学载体和物理合理性约束对齐。主要贡献包括:1) 载体语音和3D发音运动模拟的框架;2) 时长保持载体与修正的发音模型耦合;3) JEPA/RL对齐目标,结合ASR内容、潜在一致性、UTMOS质量和音色约束;4) 记录的最小对实验协议。
在24个最小对刺激上评估,载体获得:ASR精确恢复22/24词,平均WER 8.33%,CER 4.17%,UTMOS 3.174,平均JEPA得分0.864,平均音色保持得分0.947。实验结果显示了良好的可懂度和同步性。
该工作通过JEPA和强化学习对齐,成功将高保真声学载体与可解释、同步的3D声道运动相结合,为发音可视化和语音分析提供了实用方案。
现有音频自编码器(离散编解码器或连续VAE)难以同时满足三个要求:高保真重建、紧凑潜在表示(降低下游训练成本)和高吞吐量编码(避免成为训练瓶颈)。离散编解码器在通用音频和音乐上重建质量下降,连续VAE帧率高导致潜在序列长,且多针对单一领域。
Qwen-Audio-VAE通过联合优化重建质量、紧凑性和编码速度,为通用音频生成提供了一种高效、高保真的连续潜在表示。
歌唱语音分离(SVS)模型受限于有限标注数据(约35小时),而语音增强(SE)模型拥有大规模数据集(如URGENT 700小时)。
本文提出将SVS视为从SE到SVS的域适应问题,探索两种微调策略: - 全微调:更新所有参数,适应SVS但导致SE性能灾难性遗忘。 - LoRA微调:参数高效微调,仅增加6-12%参数,保留SE能力。 采用判别式模型(BSRNN)和生成式模型(SGM)进行实验。
通过域适应将预训练语音增强模型迁移到歌唱语音分离,在数据稀缺场景下显著优于从头训练。
传统低速率采样直接对波形进行点采样,主要依赖带宽、稀疏性或固定信号级结构,忽略了语音信号中与重建相关的内容级频谱-时间结构(如局部频谱包络、谐波模式、发声状态等),导致在有限观测预算下丢失重要重建信息。
提出语义采样(Semantic Sampling)方法,通过可学习观测前端(Learnable Observation Front End)生成有限维观测,而非直接子采样波形点。前端由三部分组成: 1. 语义特征滤波器组(Semantic Feature Filterbank):将输入波形映射到多个声学响应通道。 2. 约束语义观测矩阵(Constrained Semantic Observation Matrix):在幅度约束符号结构下,将多个响应通道组合成少量观测通道。 3. 低速率读出模块(Low-rate Readout Module):通过时间积分将观测响应转换为有限维样本。
该设计使采样过程结构化且可适应声学数据与重建目标,观测值来自学习到的声学响应而非原始波形点。
在低速率语音重建任务上,与固定低速率采样和基于预定低速率波形的神经恢复方法相比,所提语义采样在波形保真度、频谱一致性、感知质量上均获得提升,表明可学习观测前端在同等观测预算下保留了更多有用信息。
一种通过可学习前端将采样对象从波形点迁移到语义响应、从而改善低速率语音重建质量的新型采样框架。
大规模预训练ASR模型(如Whisper)在低资源语言微调时面临灾难性遗忘,现有持续学习方法难以处理多语言场景下的跨任务干扰,主导语言会偏置优化方向,导致低资源语言性能下降。
提出统一梯度投影(UGP)框架,结合语言平衡梯度调节和经验回放(ER): - 语言平衡参考梯度:从每个历史语言中均匀抽取相同数量的回放样本计算参考梯度,消除主导语言偏差。 - 梯度投影:当当前梯度与参考梯度冲突(内积<0)时,将当前梯度投影到参考梯度的正交补空间,避免破坏历史知识。 - 与ER协同:ER提供数据级优化,梯度投影提供方向级约束,共同提升稳定性-可塑性权衡。
在Whisper-small/medium/large-v3上评估(FLEURS数据集),与FT、标准ER、标准A-GEM对比: - UGP在所有规模上取得最佳或竞争性结果,在large-v3上FWER仅0.04%(近乎零遗忘)。 - UGP有效降低平均WER(AWER)和遗忘率(FWER),同时保持目标语言性能(TWER)。 - 在5-50小时极端数据稀缺场景下仍保持结构稳定性。
UGP通过统一梯度投影框架有效解决了多语言低资源ASR中的灾难性遗忘问题,在大模型上实现接近零遗忘,兼具强泛化性和鲁棒性。
语音增强(SE)虽然能提高人类听感的语音质量,但增强后的语音不一定能改善自动语音识别(ASR)性能,甚至可能增加词错误率(WER)。现有解释(如伪影、过度抑制)停留在定性层面,无法定位是增强中的哪个成分(幅度修正还是相位校正)损害了识别。
提出推理时极性投影(Inference-Time Polar Projection)诊断方法。对于STFT域的复数掩码M = Ae^{jϕ},将其投影为M_{α,γ} = A^α e^{jγϕ},其中α控制幅度强度,γ控制相位校正强度。通过扫描α和γ(取值范围[0,1]),将ASR退化转化为可测量的幅度和相位效应,无需重新训练任何模型。该投影还可作为轻量级修复手段:针对目标识别器校准幅度强度。
在VoiceBank+DEMAND数据集上,使用FRCRN-SE等增强器测试Whisper和wav2vec 2.0识别器。核心发现: - 幅度强度是主要影响维度,相位校正对ASR无益处。 - 识别器依赖性显著:波形输入的wav2vec 2.0偏好强幅度校正(α接近1),而log-Mel输入的Whisper呈U型响应,偏好较弱校正(α约0.6)。 - 极性投影可作为训练无关的修复方法:在验证集上校准α即可缓解SE-ASR不匹配。
本文提出了一个简洁而有效的诊断框架,将SE对ASR的负面影响分解为可独立控制的幅度和相位因子,为理解和缓解该问题提供了实用工具。
现有方法过度依赖跨模态冲突设计,但在BAH数据集上效果有限;小样本(778训练视频)导致阈值校准过拟合,验证集上0.741 macro-F1但在测试集上仅0.690。
通过简单可解释特征与诚实校准,在BAH挑战中超越复杂融合方法,强调信号来源与校准的重要性。
传统的压力-压力(P-P)声强测量方法对麦克风间距与声波波长的关系敏感,而心形-心形(C-C)方法虽然对此不敏感,但实际心形麦克风的指向性存在偏差,导致方向依赖的估计误差。
本文提出基于球面紧框架麦克风配置的声强测量框架,通过沿多个方向(紧框架方向)测量方向性强度分量,利用最小二乘或紧框架的简单加权求和重建三维声强矢量。使用勒让德多项式和球谐展开对指向性误差建模,并引入几何依赖的泄漏度量(leakage metric)来量化不同麦克风排列的误差抑制能力。
理论分析和数值模拟表明,紧框架配置通过几何平均有效抑制方向依赖的误差;所提出的泄漏度量能成功预测麦克风指向性不完美对重建强度矢量的影响;即使在相对较大的麦克风间距下(传统P-P方法中不可行),也能实现准确的宽带声强估计。
本文为使用方向性麦克风阵列的声强测量提供了物理可解释且实际有用的方法,通过紧框架的几何冗余度增强了对指向性误差的鲁棒性。
L2口语自动评估依赖大规模标注语音数据,但这类数据稀缺,而书面语料丰富。直接使用TTS将书面语转为语音存在口语与书面语的结构性差异(如口语有犹豫、重复等)。
论文系统分析了TTS生成L2口语数据的条件,提出口语化预处理与属性匹配策略,有效提升自动评估性能。
西班牙语语音可懂度客观评估缺乏专用数据集和跨语言无参考度量性能验证,现有无参考度量在语言不匹配时性能显著下降。
构建了SpInt(西班牙语语音可懂度数据集),包含5148条带行为可懂度分数的语音,覆盖11个信噪比和3种处理条件(未处理、FullSubNet+、SGMSE+);系统评估5种基于参考的度量(STOI、ESTOI、STGI、HASPI、SIIB)和2种基于深度学习的无参考度量(MOSA-Net+、W2V-SIP)。
该研究首次对西班牙语语音可懂度进行系统性客观度量评估,并公开SpInt数据集,为跨语言无参考度量改进提供基准。
现有预训练音频骨干网络未能充分捕捉机器声音的频率特定特征,且跨频带依赖关系建模不足。
提出ECHOv2,一种两级频带分裂表示学习方法: 1. 带内自蒸馏:每个子带独立进行自蒸馏学习,保留细粒度频谱信息。 2. 带间监督:引入额外的带间分支,通过全局上下文对齐和掩码子带重建实现显式跨频带交互。 3. 结构化多摘要令牌聚合:使用多个摘要令牌实现可控的频率粒度区域感知交互。 4. 统一评估基准:建立DCASE 2020-2025上的统一ASD基准,包含基于嵌入和基于适应的两种评估协议。
实验表明,ECHO作为频带分裂骨干已优于现有强基线,而ECHOv2通过显式跨频带监督进一步提升性能。消融研究验证了带内学习、带间监督和结构化聚合粒度的有效性。
ECHOv2通过显式建模跨频带依赖关系,为异常声音检测提供了强大的表示学习框架。
舞蹈到音乐生成任务面临高质量配对舞蹈–音乐数据稀缺的问题,收集成本高且受版权限制,导致端到端模型训练困难。
提出两阶段框架: 1. 跨模态表示学习:利用预训练的MotionBERT(运动)和MERT(音乐)编码器提取特征,结合节拍信息通过对比学习对齐运动与音乐的潜在空间。 2. 条件生成:采用ControlNet风格的适配器将对齐后的运动特征注入预训练的AudioLDM(文本到音频扩散模型),实现运动控制的音乐生成。
在AIST++数据集上,该方法在舞蹈-音乐对齐和音频质量方面均优于现有方法,客观指标(如音频质量)达到竞争水平,主观评分略低于SOTA但对齐性能显著提升。
通过充分利用未配对和配对数据,结合预训练编码器与对比对齐,有效解决了舞蹈到音乐生成中的数据稀缺问题。
现有少步文本到音频生成模型(如MeanAudio)在单步生成质量上仍显著落后于多步模型,且直接应用Fréchet距离(FD)后训练虽能提升单步质量,但会破坏多步采样路径,导致多步采样性能严重退化。
提出FdAudio,结合多表示FD损失和MeanFlow一致性约束: - FD后训练:通过多个预训练音频编码器(PANNs、PaSST、BEATs、AudioMAE)的队列估计器计算FD损失,动态归一化多表示损失,优化单步生成分布。 - MeanFlow锚定:引入MeanFlow一致性目标作为正则项,保留模型的速度场,防止多步采样退化,使得同一模型既能高效单步生成,又能通过多步采样保持高质量。
在AudioCaps上,120M参数的FdAudio达到少步模型中SOTA单步T2A生成质量:FD降低11.4%,FAD提升28.8%(相对MeanAudio基线)。解决了FD后训练的多步退化问题,25步采样性能匹配或超越强多步模型。
FdAudio通过FD后训练与MeanFlow锚定巧妙平衡了单步效率与多步质量,为实时T2A应用提供了实用解决方案。
现有音频LLM在长录音(如会议、播客)中缺乏可靠的时间定位能力,无法生成可解析的时间戳或细粒度的时间引用。
inter-timings(文本格式hh:mm:ss或专用token),充当时间锚点,支持最长120分钟输入。通过简单的周期性时间标记和高效的合成数据,实现了长音频中可靠的细粒度时间定位,是实用化音频LLM的重要一步。
GigaAM Multilingual 是一个面向中亚低资源语言(哈萨克语、吉尔吉斯语、乌兹别克语)的语音基础模型。该模型采用 Conformer 编码器,通过 HuBERT-style 目标在 2M 小时音频上预训练,并引入聚类级数据平衡策略(预训练)和域感知采样方法(微调)以缓解高资源语言主导问题。在目标语言上,该模型优于 Whisper Large v3 和 Omnilingual-1B,尤其是在自发语音上提升显著。
多语言 ASR 模型对低资源语言(如中亚语言)性能不佳,主要由于数据不平衡导致模型偏向高资源语言;现有的开源预训练编码器在低资源场景下适应能力有限。
GigaAM Multilingual 通过聚类级预训练平衡和域感知微调,为低资源中亚语言提供了高效的 ASR 解决方案,并开源模型。
传统AVAS(声学车辆警示系统)评估采用单一声源视角,但现实交通中多车共存,其组合声音可能导致烦恼感知非线性变化,无法通过简单能量叠加预测。
通过双耳听测实验,使用合成声(S1)和真实电动车AVAS录音(S2、S3),在虚拟声学环境(TASCAR)中模拟单辆车及两辆车对向通过场景(同步、+1s、+2s延迟)。被试(N=10)对13种刺激在0-100连续量表上评分烦恼度,并计算A计权声压级及心理声学参数。
本研究验证了多源AVAS场景的烦恼感知不能由单源结果线性叠加,支持场景化评估方法,并指出脉冲性心理声学参数是关键预测因子。
Warlpiri是一种极度低资源的澳大利亚原住民语言,仅有约1.5小时转录语音数据,难以直接训练ASR系统。跨语言迁移学习依赖合适的高资源源语言选择,但传统方法(如基于语系或数据可用性)不准确,缺乏系统性相似性分析。
提出结合声学相似性(基于预训练语音模型的嵌入余弦相似度)和语言学相似性(句法、音素库、语法、类型学特征)的框架,对高资源语言排序,并选择最相似的语言进行Whisper微调。具体包括: - 声学相似性:使用ECAPA-TDNN、wav2vec 2.0、XLSR-53提取多层嵌入,计算余弦相似度。 - 语言学相似性:从WALS、SSWL、Ethnologue、PHOIBLE、Grambank等数据库构建特征向量,计算余弦或汉明距离。 - 实验:将Whisper small先在源语言上微调,再在Warlpiri上微调,对比多种源语言。
本文首次系统证明结合声学和语言学相似性可有效指导低资源ASR的源语言选择,为Warlpiri等原住民语言提供实用方案。
当前Speech Language Models (SLMs) 在声音象征性(如bouba/kiki效应)上与人类感知存在显著偏差,尤其是在听觉通道上。SLMs未能捕捉人类依赖的声学线索(如频谱倾斜),导致跨模态匹配失败,影响人机对齐。
该研究首次基于真实语音揭示了SLM在声音象征性上的认知鸿沟,并定位了失败的关键环节——听觉表征而非视觉处理。
现有的自动MOS预测模型在跨语料库(cross-corpus)场景下泛化能力不足,容易受到领域漂移(domain shift)的影响。同时,缺乏对ViViT和SSL架构在大规模(130k+样本)跨域、多语言、唱歌等复杂音频上的系统对比研究。
该研究通过大规模、系统化的LODO验证,首次明确指出了冻结SSL骨干在跨域MOS预测中的优越泛化能力,并提供了工程化的开源实现。
现有的超轻量语音增强模型(如GTCRN)在进一步降低计算复杂度时,简单压缩网络会导致性能急剧下降,尤其在低频噪声抑制方面表现不佳。
提出CoFi-Lite,一种极高效的超轻量语音增强模型,通过将频谱建模解耦为粗粒度(Coarse)和细粒度(Fine)两条并行路径:粗路径处理全带包络,细路径聚焦低频细节并利用幅值和相位信息。引入Cross-Path Fusion (CPF)模块在瓶颈处实现跨路径特征交互。整体参数量仅83.12k,每秒乘加操作数(MACs/s)仅12.87M。
CoFi-Lite以GTCRN仅40.26%的计算复杂度达到了更优的性能。其大模型变体CoFi-Lite (Large)在与SOTA超轻量模型AdaptCRN性能相当的同时,计算成本降低了19.34%。
CoFi-Lite通过粗细双路径并行设计与交叉融合模块,在极低计算量下实现了语音增强性能的显著提升。
WaveNet风格的卷积网络在吉他放大器建模中表现优异,但计算成本过高,只能运行在桌面或专用DSP硬件上,无法在iPhone等移动设备上实时运行。
本文通过90%迭代剪枝和定制稀疏引擎,首次将WaveNet风格的吉他放大器模型实时部署在iPhone上,展示了剪枝技术在实际移动端音频应用中的巨大潜力。
工业音效设计中的音频生成系统需要同时满足多个实际需求:生成逼真音频、保持参考声音的感知身份、支持可控变体、以及工作流效率。然而,现有评估方法通常局限于文本到音频(TTA)、无条件生成或特定任务设置,缺乏针对参考引导的音效变体(reference-guided SFX variation)的标准化评估框架,导致不同方法难以横向比较。
提出一个生产导向的评估框架,包含: 1. 九大生产需求:保真度与真实性、身份保持、多样性、时间对齐、能量控制、可控性、定位编辑、推理效率、数据效率。 2. 两阶段评估协议: - 阶段1:统一的参考引导音频到音频(ATA)变体任务,所有方法在ESC-50数据集上评估。 - 阶段2:能力特定分析,评估原生操作(如SFX变形、时间对齐、修补、定位编辑)。 3. 结合客观指标(FAD、ImageBind对齐、多样性)和人类研究(感知身份保持、瞬态诊断)。
在统一的ATA设置下,AudioX在参考对齐与多样性之间取得最佳平衡,并支持SFX变形;其他基线在特定编辑操作上表现更优。框架揭示了不同方法的互补优势与权衡。
本文提出了首个针对工业音效变体生成的标准化评估框架,通过两阶段协议和九项需求,为异构方法的公平比较和实际部署提供了决策依据。
传统离散天线阵列(SPDA)的波束赋形设计在天线数量趋于无穷时可转化为连续孔径阵列(CAPA)系统的连续电流分布函数优化,但现有方法(如傅里叶级数离散化)存在近似误差且计算复杂度高;而变分法(CoV)仅适用于单用户或多用户单CAPA场景,无法处理同时存在用户间和用户内干扰的多用户多CAPA系统。
本文提出一种函数WMMSE(加权最小均方误差)算法,直接优化连续波束赋形函数。首先推导了多用户多CAPA系统可达速率的闭式表达式,并建立和速率最大化与加权MSE最小化的等价性。通过正交基展开将函数优化转化为系数矩阵优化,导出最优性条件并映射回函数域,得到u_k(r)、W_k、v_k(s)的迭代更新方程,其中v_k(s)的更新需通过二分法求解拉格朗日乘子满足功率约束。
仿真表明,所提算法在可达和速率和计算复杂度上均优于基于傅里叶级数离散化的基线方法。
本文首次为多用户多CAPA系统设计了直接优化连续波束赋形函数的WMMSE算法,有效避免了离散化误差并降低了复杂度。
ReGen通过分层表示生成替代表示对齐,在超低比特率下实现了高效、高质量的波形和语音生成。
现有TSE模型在合成数据上表现优异,但难以泛化到真实远场嘈杂环境,主要原因在于模拟数据与真实数据之间的领域差距。
通过高质量数据清洗与多阶段课程训练,简单的TSE模型能在真实远场场景中取得领先性能,凸显数据准备的重要性。
音素分割与识别是语音处理的基础任务,但传统方法将两者分开建模,且依赖大量人工标注。专家标注一小时语音需40-100小时,成本高且主观性强。
提出了SPAM(Self-supervised Phonological Activation Mapping)方法,利用自监督语音模型(S3M)的表示空间,通过音系特征向量(如清浊、鼻音等)线性分解,构建每个时间帧的激活映射。在此基础上,设计了两个无需梯度下降的轻量级预测头: - 分割头:基于相邻帧SPAM的余弦距离和峰值检测,定位音素边界。 - 识别头:将每帧的SPAM与PanPhon词典中规范音系向量进行相似度匹配,实现零样本识别。 该方法仅需不到1分钟的标注数据,且能识别训练中未出现的音素。
在多种语言和数据集(包括低资源语言和非典型语音)上达到强分割和识别性能,具有样本高效性和泛化能力。
巧妙利用自监督模型中的音系结构,以极简方式统一了音素分割与识别,兼具解释性和实用性。
现有基于大语言模型(LLM)的音频-视觉语音识别(LLM-AVSR)方法通常独立预训练音频和视觉编码器,输出经投影后融合作为软提示输入LLM进行识别。但大多数方法未显式处理音频、视觉和文本模态之间的表征差异,导致跨模态集成效果受限。此外,时间同步并不保证语义同步,直接组合时间对齐特征难以有效减少歧义。
本文提出基于最优传输(OT)的语义对齐框架,在融合前显式弥合模态差距。具体来说: 1. 将音频特征、视觉特征和LLM的语言嵌入建模为共享隐空间中的经验概率分布,使用熵正则化的OT计算模态特征与语言嵌入之间的概率耦合矩阵。 2. OT耦合作为软伪标签监督对比学习,鼓励提取语义一致、跨模态一致的音频-视觉表征。 3. 对齐模块插入编码器和投影层之间,无需修改预训练编码器和LLM架构。
在LRS3-TED基准上,所提方法在干净和多种SNR的噪声条件下均持续超越强基线,达到当前最佳性能(state-of-the-art)。
通过OT将多模态特征显式对齐到LLM的语言空间,显著提升了LLM-AVSR的鲁棒性和准确性。
哮喘影响全球2.6亿人,但诊断依赖肺功能检查(肺量测定法)和专科评估,在初级医疗和资源匮乏地区可及性差。传统的语音生物标志物研究仅关注声学特征,未整合临床背景信息。
提出一种多模态Mixture-of-Experts(MoE)框架,自适应地结合从持续元音发声和朗读任务中提取的声学嵌入,以及结构化临床和人口统计数据。模型在Colive Voice研究的1218例哮喘患者和健康对照匹配队列上评估。多模态模型实现AUROC 0.85和Brier评分0.17,优于单模态和双模态方法。自适应门控分析显示,在呼吸道症状负担较重的参与者中,模型更依赖音频特征;而在症状较轻的个体中,临床特征贡献更大。
该研究展示了利用智能手机收集的语音记录进行可扩展、可解释的哮喘筛查的可行性,为远程数字健康监测提供了新范式。
当前语音深度伪造检测系统(如基于wav2vec 2.0、HuBERT、WavLM的模型)在准确率上表现优异,但其预测过程缺乏可解释性,难以理解模型基于哪些声学或语言学特征做出“真实”或“伪造”的判断。这使得系统在安全、公平等关键应用中难以获得信任,也不利于后续改进。
本文提出一个音素级可解释性分析框架,主要包括三部分: 1. 自监督前端:使用WavLM提取帧级语音表示。 2. CNN分类器:采用时间卷积网络作为后端,结合掩码时间平均池化得到话语级表示,并输出真实类与伪造类的logit。 3. 事后解释模块:基于Grad-CAM计算真实类(bona fide-CAM)和伪造类(spoof-CAM)的注意力图,再通过Whisper转写和Bournemouth Forced Aligner对语音进行音素级强制对齐,将注意力值按音素/停顿段平均,得到与语言学单元(音素、非语音段)关联的重要性得分。
该方法无需修改检测模型,即可将解释从低层声学特征提升到人类可理解的语言学单元,并支持大规模统计比较。
在ASVspoof 5数据集上,所提框架使用的检测器取得了竞争性的等错误率(EER)。通过聚合语料库中音素级归因分数,统计分析发现: - 不同欺骗攻击(spoofing attack)和不同说话人之间存在显著差异的音素激活模式; - 元音、擦音及静音/非语音区域对模型判决贡献尤为突出; - 解释未牺牲检测性能,实现了可解释性。
本文首次将语音深度伪造检测的归因分析映射到音素级语言单元,在保持检测精度的同时提供了人类可理解的解释,促进了可信任AI的发展。
合成多说话人对话数据广泛应用于训练对话ASR系统,但对话时机属性(如暂停时长、重叠频率)对下游ASR性能的影响尚未明确。现有方法多关注数据真实感(匹配语料库统计),但真实分布不一定是最优训练分布。
在匈牙利语BEA-Dialogue基准上: - 更高重叠暴露与更低cpWER相关,而更长、更多变的间隙与更高cpWER相关;cpCER趋势类似但统计支持较弱。 - 贝叶斯优化带来适度聚合改进,但主要价值在于分析:揭示模拟训练数据中存在重叠-间隙权衡。 - 高表现设置不一定靠近语料库分布,可能位于外推区域。
该工作通过可控时机参数化和优化框架,系统揭示了对话时机属性对ASR训练的影响,为合成数据的设计提供了任务驱动的诊断方向。
现有的音频评估方法主要针对孤立语音片段,缺乏对全双工语音代理对话中原始立体声音频的整体评估,且人类评分成本高昂(约两个数量级)。
首次使用LALM(Gemini 2.5 Flash)作为音频评判器,直接对全双工代理-客户对话的原始立体声波形进行评分,覆盖8个生产维度(如语音清晰度、韵律自然度等),并与三位校准人类评分者对比,同时引入对抗性缺陷注入测试敏感性。
在5个维度上LALM与人类的一致性(Spearman ρ)与人类间一致性差距不超过0.07;在6个维度上,LALM评分与人类均值偏差在1分以内的会话占比60%以上;在45/48个(缺陷,维度)单元中,LALM的缺陷检测敏感度不低于人类。但存在天花板效应导致简单一致性高而Krippendorff α近乎为零。
该研究为将LALM作为全双工语音评估的替代或第四评分者提供了可靠的实证基础,但需按维度验证而非全局假设。
神经音频编解码器(NAC)生成的离散音频令牌在自动说话人验证(ASV)中性能显著低于传统频谱特征(如Fbank),尽管令牌保留了说话人信息。
提出跨特征知识蒸馏(CFKD)框架:使用预训练的Fbank-based教师模型,通过余弦相似度损失在嵌入层指导基于离散令牌的学生模型,使学生模型有效利用令牌中蕴含的说话人判别信息。训练目标结合分类损失和蒸馏损失,权重λ控制正则化强度。
在VoxCeleb1数据集上,ECAPA-TDNN1024学生模型在λ=40时EER从3.38%降至2.25%(相对改进35.3%),接近教师模型(2.21%);ResNet34学生模型EER从7.55%降至4.03%(相对改进42.9%)。最优蒸馏权重λ=40显著大于传统同质蒸馏设置。
提出有效提升离散音频令牌在ASV中性能的知识蒸馏框架,缩小了与连续特征系统的差距。
全双工口语对话模型在提升交互动态(如低延迟、反馈、打断处理)时往往牺牲推理和指令跟随能力,存在"智能-动态"权衡。
提出DuplexPO框架,通过强化学习将"何时说话"与"说什么"解耦。 - 动态关键窗口采样:仅从长对话中提取交互关键窗口(如轮换、反馈、打断)进行优化。 - 分解对话动态奖励(FCDR):精细化的时间信用分配,针对轮次发起、反馈、让步和常规参与。 - GRPO风格优化:限制策略漂移,保留语义能力。
DuplexPO显著提升全双工行为(及时反馈、流畅轮换、打断处理),同时在事实QA、指令跟随、语音理解和推理基准上保持性能。用户感知的自然度和响应性提升。
首次系统性地将对话动态作为独立优化目标,通过强化学习分离"何时说"与"说什么",实现交互流畅性与模型智能的同步提升。
现有音视频语音识别(AVSR)系统在现实场景中常因信号损坏和分布偏移而性能下降。传统融合方法(如注意力机制、门控模块)提供点估计,无法捕获模态可靠性。已有概率建模方法常将偶然不确定性和认知不确定性独立处理,忽略了两者的内在关联(例如数据噪声应影响模型置信度)。
提出UBG-Net,包含两个关键模块: 1. Modality Uncertainty-aware Bayesian Fusion (MUBF): - 显式建模输入分布的偶然不确定性(通过均值和方差),利用重参数化技巧生成随机嵌入。 - 将偶然不确定性参数(均值和方差)拼接为上下文向量,输入贝叶斯门控网络(包含贝叶斯线性层和Sigmoid门控),动态调制多模态特征融合。 - 贝叶斯门控网络通过变分推断学习权重后验,结合特征级KL散度损失和权重KL散度损失,统一建模两种不确定性。 2. Distribution Uncertainty-aware Hierarchical Voting (DUHV): - 推理时采用蒙特卡洛采样生成多个假设序列。 - 首先应用多数投票选出频率最高的候选集;若出现平局,则选择其中推理分数(序列对数概率)最高的序列作为最终输出。
此外,采用两阶段训练策略:第一阶段微调预训练AV-HuBERT,第二阶段冻结主网络,仅训练UBG-Net模块和插入解码器的DoRA(低秩适应)。
通过将偶然不确定性注入贝叶斯网络以指导门控融合,并设计层次投票解码策略,UBG-Net在多个音视频语音识别基准上达到SOTA,显著提升了鲁棒性。
Speech LLM中,语音序列长度远大于文本(约4倍),导致自回归解码时KV缓存增长,造成显著效率瓶颈。现有方法在适配器层提前下采样,但会丢失难以恢复的细粒度信息。
提出SpeechKV,在LLM内部第5层开始对语音token的KV缓存应用可学习池化(learned pooling),将相邻R个键/值向量加权合并为一个,保留全分辨率查询和残差流,实现压缩到文本级粒度。该方法与模型联合训练,避免训练-测试不匹配。
在71K小时ASR数据上训练Qwen3-1.7B模型,SpeechKV在R=4时性能与未压缩基线持平甚至更优:实体识别错误率相对降低6.6%,OpenASR上降低2.3%,解码速度提升至少1.49倍(随音频长度增加可达2倍)。注意力分析表明,压缩后深层注意力更聚焦。
SpeechKV通过推迟压缩到LLM内部,在几乎不损失性能的情况下大幅加速语音LLM解码,是一种简洁高效的方法。
当前基于LLM的TTS系统在需要精确词级风格干预的场景(如有声书、配音)中,缺乏显式的词级多维度声学属性控制能力,主要受限于细粒度标注数据稀缺和架构设计挑战。
实验表明WordVoice在多维度上实现了优越且解耦的控制,同时保持有竞争力的零样本合成稳定性。
WordVoice通过数据与架构创新,首次在LLM-based TTS中实现显式、解耦的多维词级控制。
基于麦克风阵列的被动声学监测在森林生物多样性感知中日益重要,但现场录音成本高、难以复现,且对森林和大气条件控制有限,导致阵列系统设计与评估困难。现有仿真工具无法灵活关联森林特征与阵列录音,或缺乏可复现的端到端流水线。
提出ForestIR,一个物理信息驱动的可复现仿真框架: - 路径基声传播模型:结合直接路径、地面反射(镜像源)、树干单次散射(单散射圆柱模型)、以及可选的枝叶散射,生成源-麦克风冲激响应。 - 环境因素建模:考虑大气吸收(ISO 9613-1)、声速随温度/湿度/气压变化、地面类型参数化。 - 灵活场景配置:支持真实树木位置或合成森林(均匀/排斥采样),可独立控制植被结构、地面条件、大气状态、阵列几何和噪声。 - 可复现流水线:提供命令行界面和Python API,支持批量渲染和消融实验。
四个实验验证: 1. 定位误差对植被布局敏感:SRP-PHAT定位误差随植被布局变化。 2. 大气失配影响定位:温度引起的声速变化导致固定声速假设下的定位偏差。 3. 与现场测量对比:模拟冲激响应与芬兰雪地正弦扫频测量结果匹配。 4. 合成鸟鸣声与真实波形相似:MFCC余弦相似度、频谱互相关、声学复杂度指数等指标验证。
ForestIR提供了一个可复现、物理合理的森林声学仿真工具,能系统化评估大气和植被对阵列录音及声源定位的影响,为阵列设计和算法测试提供支持。
传统数据驱动的音乐和声生成方法缺乏可解释性、可控性和可维护性,难以满足信息系统开发(ISD)对透明性和可评估性的要求。
提出一种可维护的混合生成架构,结合量子启发式候选探索(基于重叠旋律上下文的加权候选和声表示)和显式规则优化层(减少和弦变化、平滑声部进行、强制终止等)。生成模块维护多个候选的叠加态,通过全局目标函数迭代更新权重;优化层在不替换整体和声的前提下修正结构不一致。
在11首单旋律(含爵士、乡村、民谣及原创)上评估,使用结构度量(和弦密度、低音跳进等)、参考度量(精确匹配、功能一致性和声相似性)和鲁棒性度量。结果显示优化层显著提高了结构连贯性、稳定性和可预测性,同时保留了多个有效和声变体。
该工作为可维护、可评估的混合生成系统提供了系统化设计范式,在可控制性与生成多样性之间取得平衡。
现有基于核回归的声场估计方法中,物理约束神经核(Ribeiro et al. [18])仅针对单次快照测量优化方向加权函数,导致过拟合和泛化性能差,无法适应未见过的源位置。
提出一种学习型物理约束神经核,将方向加权函数建模为源位置相关的隐式神经表示(INR),输入包含方向η和源位置y。通过训练多个源位置的声传递函数(ATF)数据集,学习共享的方向模式。核函数仍满足Helmholtz方程,通过Lebedev求积法离散化积分,保证平移不变性。网络使用随机傅里叶特征(RFF)编码+MLP+Softplus输出非负权重,损失函数为归一化均方误差(NMSE)。
在仿真房间(4m×6m×3m,T60=200ms)中,使用图像源法生成100个随机源位置的ATF,分为训练/验证/测试集(80%/10%/10%)。麦克风置于两个同心球层(半径0.5m和0.49m),目标区域为半径0.5m的球体。结果表明,所提方法优于基于单次快照的物理约束神经核,能够学习到与目标声场方向性匹配的加权函数,且对未见源位置具有更好的泛化能力。
本文通过引入源位置依赖的隐式神经方向加权,显著提升了核回归声场估计的泛化性能,是对现有快照方法的重要改进。
现有语音匿名化隐私评估广泛使用等错误率(EER),但EER基于1-to-1验证威胁模型,无法反映1-to-N数据库链接攻击的真实风险——全局指标掩盖了局部隐私泄露,即使EER接近50%(看似安全),1-to-N攻击仍可能达到100%成功。
提出基于信息论的评估框架,核心指标为局部信息泄露(LID),将原始相似度分数校准为后验概率,量化单条测试话语对攻击者的信息增益(比特数)。框架包含内部聚合器(计算单条LID)和外部聚合器(汇总全局指标,如平均值、最大值)。
对VoicePrivacy 2024 Challenge顶级系统评估发现:EER近48%的系统仍有最大1比特的局部信息泄露,使攻击者成功率翻倍。表明局部化指标对捕获最坏情况风险至关重要。
该论文首次系统性地揭示了EER在1-to-N攻击下的威胁模型错配,并提出了信息论驱动的LID指标,为语音匿名化隐私评估提供了更严谨、更实际的方法。
现有音频分类数据集在特定场景(如家庭环境)中标注数据稀缺,通用数据集覆盖不足,专用数据集规模有限。
提出TriA Pipeline,一种大规模自动音频标注流水线,包含四个阶段:标准化、音频活动检测(AAD)、音频事件检测(AED)和过滤。利用BEATs模型进行事件检测,并通过美学指标和CLAP相似度过滤,生成高质量标注数据。构建了TriA数据集,超过2130小时,覆盖431个音频类别。
在三个家庭音频分类任务(DESED AC、Kitchen20、Non-speech7k)上,使用TriA子集TriAGK与人工标注数据结合,平均准确率提升3.97%,Macro-F1提升3.35%。主观评估注解准确率达93.67%。
TriA Pipeline通过自动化流水线有效缓解了特定场景音频标注数据稀缺问题,显著提升了模型性能。
提出伪增量训练嵌入学习器与随机分类器相结合,有效解决了FCAC中的灾难性遗忘和过拟合问题,性能优越且复杂度低。
现代端到端ASR系统(CTC、AED、RNN-T)内部已包含语言建模能力,且常在不使用外部LM的情况下评估,导致经典困惑度(PPL)与词错误率(WER)的对数线性关系是否仍然成立变得不确定。此外,内部LM的干扰以及大型语言模型(LLM)的融合进一步挑战了这一关系。
该论文通过大量实验验证了现代端到端ASR中PPL与WER的log-log线性关系仍然大致成立,但斜率受内部LM、编码器上下文和外部语料规模等因素影响,为LM集成提供了重要参考。
传统分布式多通道维纳滤波(dMWF)要求全连接网络,且拓扑受限;现有TI-DANSE等迭代算法收敛慢、假设全局子空间完全重叠(FODS)。本文提出TI-dMWF,适用于拓扑不受约束的无线声学传感器网络(WASN),在全局-局部子空间(GLS)假设下,通过单次发现-估计过程实现集中式MWF性能。
TI-dMWF为拓扑不受约束的WASN提供了首个迭代无需求、单次运行即最优的分布式节点特定信号估计算法。
现有语音到语音(S2S)语言模型的评估标准(如WER、MOS)仅关注信号质量和识别准确率,无法全面反映对话中的自然度。自然度涉及响应时机、打断、韵律、情感、方言一致性、人际立场等多个维度,而现有基准要么依赖昂贵的人工标注,要么只关注单一维度(如延迟或打断),缺乏统一的自动化评估框架。
对7个当代S2S模型(GPT-audio-1.5、GPT-realtime-2、Qwen3-Omni-30B、Qwen2.5-Omni-7B、Gemini-2.5-flash、Gemini-3.1-flash、Mini-Omni)进行评估,发现: - 模型在信号质量和ASR错误率上接近人类水平。 - 但在延迟、回合重叠、方言保留、情感适应和人际立场动态方面与人类显著不同,例如模型可能回答过快(打断)、方言突然变化、情感表达平淡或立场不匹配。
SPEARBench提出了首个全面、自动化、开源的流式S2S对话自然度基准,揭示了当前模型在“听起来自然”与“互动自然”之间的鸿沟。
现有的说话人嵌入(x-vector)提取器是描述性的而非生成性的:它们将观测到的语音段映射到一个固定向量,但无法在没有参考音频的情况下根据自然语言描述生成新的说话人嵌入分布。传统方法要么从无条件分布中采样,要么受限于预定义类别,缺乏灵活的控制能力。
ProPS(Prompted Profile Synthesis)提出了一种基于自然语言提示的说话人嵌入分布生成框架。其主要创新包括: 1. 任务定义:首次提出自然语言条件说话人分布合成任务,即根据自由文本描述生成x-vector的高斯混合模型(GMM)分布。 2. 模型架构:使用预训练的Sentence-BERT将文本提示编码为语义嵌入,通过一个三层MLP输出混合权重,从预计算的组件库(由训练集中每个说话人配置文件的GMM组成)中选择并组合高斯分量,形成条件分布。 3. 训练策略:采用三阶段训练:首先为每个配置文件独立拟合GMM初始化均值和方差;然后预训练MLP以预测混合权重;最后联合微调所有参数。 4. 数据利用:利用大规模CapSpeech数据集,包含丰富的说话人属性(年龄、性别、口音、韵律等)和对应的自然语言描述,以及GPT生成的多样化文本描述。
论文通过负对数似然(NLL)和下游属性分类准确率评估生成的x-向量分布。实验表明,ProPS能够生成与提示匹配的说话人属性(如年龄、性别、口音、韵律特征),且分布质量优于现有方法(如PromptSpeaker)。具体结果需参考原文。
ProPS通过自然语言提示实现了对说话人嵌入分布的可控生成,为TTS和VC等系统提供了灵活的用户接口,是生成式语音技术的重要进展。
当前多模态大语言模型(如Qwen3-Omni)在引入音频理解与生成能力后,往往会在纯文本基准(推理、知识、对齐等)上出现明显退化,限制了模型在通用智能场景中的实用性。
本文提出Nemotron-Labs-Audex-30B-A3B(Audex),基于纯文本MoE LLM(Nemotron-Cascade-2-30B-A3B)构建统一音频-文本模型: - 单一Transformer解码器架构:音频经编码器+MLP投影到文本嵌入空间,文本与量化音频token在生成时统一处理,实现无缝模态融合。 - 音频编码器:采用AF-Whisper(基于Whisper Large-v3),支持语音与通用音频理解。 - 双音频编解码器:分别为语音和通用音频设计独立代码本,灵活支持高效生成。 - 多阶段训练:精心筛选157.4B音频token + 320.5B文本token,经监督训练→文本级Cascade RL→多领域在线蒸馏。
| 维度 | 关键结果 | |------|----------| | 文本推理 | AIME 2025: 91.2(纯文本98.3带工具),IMO AnswerBench: 81.1(纯文本79.3),几乎无退化甚至略优 | | 语音识别 | OpenASR WER 6.82%,LibriSpeech clean 1.34%,优于Step-Audio和Qwen3-Omni | | 语音翻译 | Fleurs xx→en BLEU 34.0,COMET 86.9 | | 音频理解 | MMAU 75.6,Audio Entailment 95.0%(显著优于基线) | | 文本到语音 | Seed-TTS-Eval WER 1.70% | | 通用音频生成 | 支持音乐、环境音生成(AudioCaps FID 66.9) |
Audex以统一的单一Transformer解码器架构,在保持文本智能不退化(甚至部分提升)的前提下,首次在开源模型中实现了音频理解/生成(语音+音乐+环境音)的SOTA性能,是迈向通用音频智能的关键一步。
传统语音反演系统主要针对英语开发,缺乏跨语言泛化验证。口腔声道变量(TVs)和源信息(SFs)的联合估计在跨语言场景下的表现未充分研究。
本文首次实现多语言语音反演系统,证明基于英语训练的模型在法、俄语上具有良好泛化能力。
现有大规模公开语音语料库多为单声道,无法用于全双工口语对话语言模型(SDLM)的训练。电话对话语料库(如Fisher)规模有限,难以扩展。
提出DuplexChat-Pipe开源管道,从公共播客RSS源构建说话人分离的全双工对话语音。管道包含四阶段:1) 基于语言标签的Feed收集与过滤;2) 音频检索与清洗(去除音乐、长音频);3) 基于说话人日志的对话分割(保留双说话人片段);4) 使用扩散模型DialogueSidon进行语音分离与恢复,输出每个说话人独立声道。
构建了DuplexChat语料库:英语282,634小时,日语132,723小时,共约415k小时,为目前最大开源SDLM资源。音频质量评估(DNSMOS、SQ-STOI、SQ-PESQ)优于Fisher;说话人分离质量(ITC、ITD)与Fisher相当。话轮转换动态分析显示日语对话更频繁交换话轮、更多回馈和重叠,符合人类对话模式。
首个开源、可重复运行的大规模全双工说话人分离对话语音管道及语料库,为SDLM训练提供了重要数据基础。
传统的通用语音增强模型虽能泛化,但计算资源需求大,难以部署于助听器等边缘设备。实际场景中用户常处于相对固定的声学环境(如特定说话人、噪声类型),因此探索小模型通过上下文特化来匹配或超越大模型性能成为关键。
本文通过系统性实验确立了说话人身份是语音增强特化最有效的上下文因素,并展示了小模型通过针对性特化可在大幅降低计算成本的同时达到甚至超过大通用模型的性能,对资源受限的实时应用具有重要指导意义。
在动态多说话人场景中,目标说话人提取面临说话人移动、方向未知、说话人交叉等挑战。传统波束形成方法需要精确的强引导(如连续DoA),而弱引导仅依赖初始方向。现有深度学习模型在动态场景中性能下降,且难以泛化到不同阵列配置。
本文提出了一种基于弱引导和自回归的HOA波束形成方法,有效解决了移动说话人提取中的方向未知和动态变化问题,兼具泛化性和鲁棒性。
现有音频基准无法匹配真实录音与其合成孪生版本,即无法跨越合成-真实边界进行实例级对应。
首个跨合成-真实边界的实例级音效匹配基准,揭示实例级对比学习泛化性优于类别级不变性。
MOSAIC通过多查询交叉注意力和双域对抗训练,在统一LA/PA反欺骗中实现了可解释的线索-层对齐,性能接近专用PA模型,但2021 PA泛化仍待改进。
真实世界中的环境噪声严重降低了神经语音编解码器(NSC)的重建质量,尤其是在低比特率和低信噪比条件下,现有方法往往只关注干净目标而忽视对噪声成分的学习,导致性能受限。
提出FocalSE方法,在NSC的连续嵌入空间中同时进行特征去噪、噪声特征分离和噪声识别。核心组件包括: - Focal Mask噪声分离模块(FMNS):采用双分支结构,基于focal调制机制和Transformer块生成focal mask,从噪声嵌入中提取增强嵌入,并分离出噪声嵌入。 - 噪声识别模块(NR):使用ResNet1D-18对分离的噪声嵌入进行噪声分类,进一步提升分离效果。 训练策略包括预训练阶段(干净数据训练DAC)和噪声适应阶段(冻结DAC编码器,微调FocalSE)。
在LibriTTS和ESC50数据集上,以DAC为基础编解码器,对比SECE和FD-CBR基线。在6.0 kbps和2.5 kbps比特率下,不同SNR(-5dB~10dB)条件下,FocalSE在PESQ、STOI、SI-SDR等指标上均达到最佳或次优性能,且完整模型(含噪声识别)优于消融变体,证明了各模块的有效性。
FocalSE通过联合特征去噪、噪声分离与识别,显著提升了神经语音编解码器在复杂噪声环境下的适应性,优于现有方法。
DELTA-TTS通过轻量级LoRA适配将AR TTS模型高效转换为dLLM,在保持高质量的同时大幅提升推理速度。
本文提出了一种新颖的说话人解耦音节标记化方法,通过 chunk-wise 回归有效提升了音节标记的语言内容纯度,并在多个下游任务上取得显著改进。
现有语音匿名化系统(SAS)在生成伪说话人时,身份多样性不足,易被自动说话人验证(ASV)系统攻击。
提出NouveauVoice,基于Hierarchical Deep Variational Autoencoder (NVAE) 的伪说话人生成框架,可作为即插即用模块集成到现有语音转换系统(如FACodec、CosyVoice2)中。通过ELBO目标优化,生成高表达性、多样化的伪说话人嵌入,并支持匿名化强度灵活控制。
在VoicePrivacy Challenge协议下,对ASV攻击者模型达到38%以上的等错误率(EER),且通过MMD分析验证了伪说话人多样性。在匿名性、多样性和下游语音任务(如可懂度、情感表达)之间取得了合理权衡。
NouveauVoice通过分层变分自编码器生成多样化伪说话人,有效提升了语音匿名化的鲁棒性和实用平衡。
现有口音归一化方法依赖自然录制的平行L1-L2语音对或合成语音监督,导致质量下降。此外,离散tokenizer的K-Means聚类可能不最优,交叉熵损失对最终目标(内容保持和口音减少)信号弱。
在L2-ARCTIC数据集上七个英语口音评估: - 监督微调后WER从12.40%降至9.89% - RL后训练进一步降至9.23% - 优于帧到帧、直接流匹配和基于提示的token转换基线
TokAN通过自监督离散token和GRPO后训练,在无需合成语音监督下实现了高质量的口音归一化。
CLAP等音频基础模型被广泛用作通用特征提取器,但其内部表示结构尚不明确。以往研究多聚焦于高级语义特征(如语种、情感)或特定领域,对于低层声学属性(混响、响度、频谱特征)的编码能力缺乏系统性评估,存在争议(如CLAP是否编码噪声或混响)。
提出一种系统性的探针(probing)框架,在CLAP冻结嵌入上训练三种复杂度递增的探针(线性、MLP、核脊回归),预测四个低层声学属性:RT60(混响时间)、LUFS(响度)、SC(频谱质心)、RP(相对音高)。跨五个数据集(白噪声、NSynth音符、VCTK语音、MusDB18HQ音乐混合、SonicMaster全曲)评估,涵盖噪声、语音、音乐等域。此外,还分析了八种其他音频基础模型,并验证了跨模态一致性(文本嵌入与声学属性方向的几何对齐)。
所有四个低层声学属性均可从CLAP嵌入中可靠恢复。发现两种编码模式:RT60、LUFS和RP近似线性编码(线性探针表现良好),而SC需要非线性探针。对于线性编码的属性,RT60和LUFS的特征方向跨数据集几何一致,而RP高度依赖领域。该结果在八种其他基础模型上泛化,但幅度不变架构自然丢弃了响度信息。跨模态定性实验显示,描述混响的文本嵌入与RT60特征方向对齐。
本文通过系统的探针实验,揭示了CLAP嵌入中低层声学属性的线性与非线性编码特性,为理解音频基础模型的内部表示提供了关键实证。
提出了一种通用且有效的方法来修复长语音录音的时间戳对齐问题,并释放了大规模、高质量的儿童语音数据集,对儿童 ASR 研究有重要价值。
核心痛点:传统情感语音转换(EVC)需要显式目标情感(如标签、参考语音或风格描述),但实际场景中用户更倾向给出相对变换指令(如“让声音稍微平静一点”)。现有方法无法处理这种相对、方向性的情感变换。
方法创新: 1. 新任务定义:提出指令引导的相对情感语音转换(instruction-guided relative EVC),用自然语言指令描述相对于源语音的情感变化。 2. 数据集:构建TRACE-Instruct,包含分类转换、强度修改和开放式情感变化的相对指令对,通过LLM生成。 3. 模型TRACE-EVC:核心模块Emo-Compass将情感变化建模为源锚定的整流流(source-anchored rectified flow),预测变化的幅度和方向,无需目标标签或参考音频。支持零样本转换。
实验结果:TRACE-EVC能准确遵循相对情感指令,同时保持说话人身份、语言内容和语音质量,在标准分类情感转换中也具备竞争力。
一句话评价:首个实现指令引导的相对情感变化语音转换的零样本框架,通过源锚定整流流和专用数据集解决了相对情感控制的挑战。
核心痛点:低资源太平洋原住民语言的ASR面临数据量极少、标注质量不一(声学条件、转录不一致、对齐不可靠)的挑战,标准微调对噪声敏感。
方法创新:提出QuaSR框架,将样本权重分解为数据侧可靠性(声学质量、转录稳定性、音文对齐质量三方面评分)与模型侧可学习性(训练损失),两者相乘得到统一样本效用分数,指导训练加权。
实验结果:在Bislama、Nafsan、Lelepa、Nguna四种语言上验证,QuaSR优于标准微调和替代数据选择策略,在Lelepa和Nguna上WER降低最多4.01个点,CER降低最多3.76个点。
一句话评价:首个系统分析太平洋原住民语言ASR数据质量并整合为样本重加权的方法,有效提升低资源ASR适应性能。
在鸟类发声发育研究中,现有方法通常对发声进行静态声学描述或分类,缺乏量化单个发声随时间变化程度的无监督度量。
提出 trajectory variance(轨迹方差),一种基于反事实推理的无监督度量。流程包括: 1. 使用卷积VAE将语谱图压缩到128维潜在空间; 2. 训练年龄条件位移模型(6层残差MLP+AdaLN),通过最优传输形成训练对,预测不同年龄间的潜在位移; 3. 对每个发声在7个目标年龄生成反事实潜在向量,计算其方差作为可塑性分数。
提出一种全新的无监督度量,无需标签即可量化单个发声在发育中的可塑性,为动物发声发育研究提供了新工具。
当前医学声学信号(心音、呼吸音、咳嗽声)分析缺乏多模态推理基准,且没有基于频谱图(临床标准可视化)的评估协议。
提出CaReCoS基准,整合7个公开数据集,通过Gemini 3 Flash生成显式(基于元数据)和推断(临床推理)两类问答对,所有模型接收梅尔频谱图图像+文本问题进行评估。
评估9个SOTA模型,最高准确率仅51.2%(GPT-5.1),医学微调模型(Med-LLaVA, MedGemma)表现更差,儿科心音(ZCH)最具挑战性。
CaReCoS首次系统评估多模态模型在医学声音频谱图上的推理能力,揭示了当前模型的显著局限。
现有鸟类声音分析主要聚焦于物种识别,忽略了叫声类型(call-type)的生物学意义(如行为、繁殖、社交等)。多任务学习(同时预测物种和叫声类型)面临任务间损失不平衡问题,不同任务在难度、类别不平衡、收敛速度上存在差异,固定权重组合容易偏向一方。
本文在BirdCallNet基础上扩展为多任务分类(物种+叫声类型),并系统比较了四种损失平衡策略:固定加权、同方差不确定性加权(Homoscedastic Uncertainty Weighting)、动态平均加权(DWA)和梯度归一化(GradNorm)。实验涵盖四种预训练音频编码器(ConvNeXtBS、EAT、BirdMAE、ProtoCLR)和三种适应范式(线性探测LP、注意力探测AP、全微调FT)。
本文系统评估了多任务生物声学分类中的自适应损失平衡策略,揭示任务间权衡与适应方法的选择至关重要,为实际部署提供了实用指导。
野外录制的鸟类声音重叠、背景噪音多,且训练数据标签不完整(仅标注主导物种),导致分类困难。源分离可提升分类性能,但分离误差会带来假阳性(false positive gain),而传统最大池化聚合策略未有效抑制这一问题。
提出混合物约束最大池化(MCM),对每个分离通道的预测概率进行裁剪:若该通道对某物种的概率增幅超过阈值 τ·pmix,则将其限制为 (1+τ)·pmix,从而抑制因分离伪影导致的假阳性,同时保留真阳性增益。此外,采用两个分离器(FTRNN和TF-Locoformer)的集成,利用其互补性提升分类性能。
在芬兰鸟类(4600个3秒片段)和马达加斯加鸟类(2215个3秒片段)数据集上,MCM在类别平均平均精度(CMAP)、标签加权标签排名平均精度(lwlrap)和ROC曲线下面积(AUC)等指标上均优于标准最大池化。集成分离器系统优于单个分离器系统。
MCM有效平衡了源分离带来的真阳性增益与假阳性抑制,集成不同架构的分离器进一步提升了鸟类分类性能。
案例研究:使用标准化数据集进行语音类型分类(Voice Type Classification),验证了框架的可行性。基准数据集涵盖跨语料库的标注一致性。
本文系统性地解决了儿童长录音语料库的异构性、缺乏基准和隐私治理三大互依问题,提供了可复现的开源解决方案。
音频深度伪造检测模型在受控基准上表现优异,但在真实场景中泛化能力差。先前研究指出数据集特定伪影导致这一差距,但缺乏系统工具识别模型利用哪些声学属性作为捷径。
非语音干预产生最大性能下降,确认非语音间隔为主要捷径;频谱和能量扰动影响较小且模棱两可。
首次提出基于因果干预的捷径诊断框架,为反欺骗模型提供可解释的鲁棒性分析工具。
传统源追踪任务将“源”等同于生成架构,忽略了训练数据、超参数等关键因素,导致模型无法泛化到未见过的架构-数据组合(如已知架构+新数据或反之)。现有方法缺乏显式解耦,限制了开集场景下的性能。
在 MLAAD 数据集上,对于 Few-Shot 开集识别任务,所提方法显著优于基于角度间隔的基线(如 ArcFace),尤其在组合泛化场景(已知架构+新数据或反之)表现突出,在完全开集场景也有一致性提升。
本文通过因子化分解和结构化原型,在合成语音源追踪任务中首次实现架构与数据因素的显式解耦,显著提升了开集泛化能力。
一项严谨的跨语言抑郁检测研究,通过对比对齐和逐层分析揭示了模型缩放和评估泄露的关键问题。
现有语音抑郁症检测研究在时间聚合(temporal aggregation)步骤上缺乏系统性对比,多数工作固定使用单个自监督学习(SSL)骨干网络和手动选择的Transformer层,导致性能提升可能源于管道而非聚合方法本身。此外,约三分之一的配置会退化为预测单一类别,且聚合架构在不同骨干网络和随机种子下的鲁棒性被忽视。
该工作通过大规模跨骨干、跨语料的受控实验,揭示了抑郁症检测中时间聚合方法的鲁棒性问题,为临床语音基准测试提供了新视角。
传统方法将自动语音识别(ASR)和方言识别(DID)作为独立任务优化,导致性能权衡,尤其在印度语言等低资源、多方言场景中。现有联合方法常以牺牲ASR性能换取DID提升。
提出基于多模态特征融合的联合ASR-DID框架,包含ASR块和DID块: - ASR块:使用SSL编码器和Conformer编码器提取语音特征。 - DID块:通过瓶颈编码器(1D卷积+瓶颈Transformer)提取语音方言特征,RoBERTa编码器从CTC嵌入中提取文本方言特征,经门控机制融合,再经注意力编码器精化,生成方言嵌入。 - 方言嵌入与Conformer输出拼接(梯度分离)以增强ASR特征,避免梯度干扰。 - 联合优化CTC损失、注意力损失和交叉熵损失。
在RESPIN数据集的8种印度语言(33种方言)上,平均DID准确率81.63%,平均CER 4.65%、WER 17.73%,优于基线方法(如ASR-DID、ASR-DID-ROB等),有效缓解了ASR-DID权衡。
提出了一种有效的多模态融合框架,同时提升了低资源印度语言方言识别和语音识别性能。
核心痛点:有声书叙述风格对听众吸引力的影响缺乏大规模数据驱动研究,现有工作局限于小样本或定性分析,无法为推荐系统和角色分配提供量化依据。
方法创新: - 使用LibriVox公开数据集(8,854本有声书,1,206位叙述者,65种体裁),提取129维声学与韵律特征(通过eGeMAPSv02、YAMNet、whisper-tiny)。 - 建立全局Generalized Linear Model (GLM)、按体裁GLM和按书名(同一文本不同录音)的Linear Mixed-Effects (LME)模型,分离内容与叙述风格的影响。 - 将观看率按四分位数分类,训练逻辑回归等分类器与排序模型。
实验结果: - 声学特征与观看率存在显著统计关联,且该关联在控制书名效应后仍然稳健。 - 不同体裁中声学特征的影响模式不同。 - 分类和排序任务中,声学特征具有预测能力,验证了叙述风格对吸引力的独立贡献。 - 使用Spotify内部细粒度指标复现了类似结论。
一句话评价:首次系统性、大规模地将有声书叙述声学特征与真实消费数据(观看率)关联起来,为个性化推荐和叙述者选择提供了数据驱动方法。
无法获取全文内容,跳过总结。
现有小样本增量音频分类(FCAC)方法假设基类与增量类样本同分布,但实际应用中存在域偏移。本文首次提出跨域小样本增量音频分类(CD-FCAC)问题,同时面临类增量导致的灾难性遗忘和域偏移两大挑战。
提出对抗对比学习策略(Adversarial Contrastive Learning),融合对抗训练与对比学习: - 对抗训练:通过频谱扰动生成对抗样本模拟目标域,训练编码器提取域不变嵌入。 - 对比学习:基训练阶段使用监督对比损失增强类内紧凑性和类间可分性。 - 增量训练:冻结编码器,仅更新分类器,并保存旧类嵌入均值以缓解遗忘。
在LS-100、NSynth-100、FSC-89三个公共数据集构成的六组跨域对上进行实验,平均准确率超过现有方法。
首次系统性地解决跨域小样本增量音频分类问题,提出的对抗对比学习策略有效提升模型在域偏移和类增量场景下的泛化能力。
现有语音语言模型(SLM)训练遵循文本大语言模型范式,依赖大规模语音指令调优数据,面临两大瓶颈: 1. 数据膨胀:语音序列长度是文本的20倍以上,导致有效数据规模严重不足。 2. 灾难性遗忘:在大量语音token上继续训练会使模型遗忘原始文本LLM的知识和能力。
提出SPEECHCOMBINE,一种无需指令调优的语音语言模型训练框架: - 从文本LLM基座模型出发,仅进行一次语音连续预训练(30k小时数据),得到语音适配模型。 - 利用模型合并(model merging)技术,将文本指令调优模型的权重差异(Δθ_inst)直接移植到语音适配模型上,实现指令跟随能力向语音域的迁移。 - 关键设计:语音预训练必须从基座模型开始,而非指令调优模型,以保证知识结构的可组合性。
SPEECHCOMBINE通过创新的模型合并策略,在无需指令调优的情况下实现了跨模态指令跟随能力,为SLM训练开辟了新方向。
无法获取全文内容,跳过总结。
无法获取全文内容,跳过总结。
无法获取全文内容,跳过总结。
无法获取全文内容,跳过总结。
无法获取全文内容,跳过总结。
该论文提出了一种高效的多目标预训练方法,在不增加推理开销的前提下,显著提升了低资源AAI性能,尤其适用于实时或资源受限场景。
无法获取全文内容,跳过总结。
无法获取全文内容,跳过总结。
无法获取全文内容,跳过总结。
SPARCLE通过对比学习融合声学与发音人信息,显著提升低资源TTS的发音准确性,是对G2P系统的有效替代。
标准跨语言说话人确认评估中,语言不匹配与说话人差异性相互混淆,难以区分性能下降的真正原因。
本文通过精心设计的实验,系统分离了说话人和语言因素在跨语言说话人确认中的影响,证实语言不匹配是性能退化的主导因素,为构建语言鲁棒模型提供了重要基准。
现代自动说话人验证(ASV)系统易受对抗性扰动影响。现有的基于扩散模型的净化方法虽有效,但其反向去噪过程需要迭代采样,导致推理延迟高。
本文通过实验观察发现,扩散净化中的前向加噪过程提供了大部分鲁棒性增益。基于此,作者将对抗净化重新表述为一个可学习加噪问题,提出正激励噪声预测器(PnP),这是第一个显式引入正激励噪声(π-noise)到净化任务的框架。PnP学习输入自适应的π-noise并将其与输入混合,以提升下游ASV系统的鲁棒性。框架包含两个变体:PnP-Gaussian(简单的加性形式)和PnP-Diff(扩散风格形式,与扩散模型的前向加噪过程对齐)。PnP-Diff还可与扩散去噪器级联以进一步提升净化语音的感知质量。
在四个先进ASV骨干网络上进行实验,PnP在白盒、黑盒和防御者感知自适应攻击下均能有效防御,同时保持自然语音的性能。与代表性净化基线相比,PnP在防御效果、对真实语音的影响和推理效率之间取得了竞争性平衡,实时因子低至0.014。级联扩散去噪器后,WB-PESQ可达3.591,SI-SDR达21.14 dB。
本文提出了一种高效、轻量的对抗净化方法,通过学习前向加噪过程替代昂贵的反向去噪,在ASV领域实现了速度与鲁棒性的良好平衡。
现有基于深度神经网络(DNN)的多通道语音增强方法通常依赖固定的麦克风阵列几何结构,导致在未见或不规则配置下泛化能力差。当前的阵列无关方法(如 TAC 层、注意力机制、元学习等)往往需要复杂架构或大规模多样化数据集,仍难以泛化到分布外(OOD)的阵列布局。
本文深入分析 AmbiDrop 框架,其核心创新包括: - Ambisonics 输入:训练时使用理想 Ambisonics 信号,其通道固定且空间表示独立于传感器几何,简化学习过程。 - 通道级 Dropout:训练中引入通道级 dropout 层,模拟实际部署中 Ambisonics 编码误差(如由非球面或稀疏阵列引起的),增强模型对不完美估计的鲁棒性。 - Ambisonics Signal Matching (ASM):推理时,将任意阵列的麦克风信号通过 ASM 线性变换为 Ambisonics 系数,实现阵列无关处理。 - 通用性:框架可适配不同 DNN 骨干网络,并支持退化的传感器(如丢失近半麦克风)和缩小网络规模。
在多种模拟(1D、2D、3D)和真实(Project Aria 眼镜)阵列上,AmbiDrop 显著优于基线阵列无关方法。即便在 OOD 阵列或传感器故障下,性能保持稳健。消融研究显示 dropout 配置、缺失通道和网络规模的影响。
AmbiDrop 通过 Ambisonics 表示与通道 dropout 的结合,实现了灵活、鲁棒且高效的阵列无关语音增强,适合边缘部署。
现有语音分析工具(如Praat)难以集成现代深度学习表示,且用于语音比较时流程繁琐。
Speech Playground 结合 Python 后端(FastAPI)和 Web 前端(SvelteKit),提供统一的交互环境,支持连续、离散、变长等多种特征类型。内置多种编码器(SSL、发音、音系特征等),支持 TextGrid 注释和强制对齐,可配置距离度量(如 DTW)与对齐模式(全局/半全局),实现可视化与听觉比较。
(论文未提供定量实验,重点在工具设计与用例演示。)
一个面向语音研究、表示验证和 CAPT 实验的交互式语音分析与比较工具。
从目标到架构再到应用的系统对齐视角,为音频自监督学习提供了清晰的分类和设计指导,尤其适合理解当前及未来趋势。
多模态大语言模型(MLLMs)在自动痴呆分类(ADC)中展现出潜力,但存在两个关键问题:1) 直接依赖文本推理(如chain-of-thought)容易产生幻觉和不一致的理由,导致性能低于无LLM的基线;2) 在高风险的医疗场景中,不忠实的解释是不可接受的。
本文提出DeTAiL框架,通过三个阶段的训练来利用MLLM的内部表示: 1. 理性蒸馏:使用教师LLM生成基于标签的解释,通过SFT训练学生模型生成理由和标签。 2. RL后训练:采用GRPO优化模型,奖励包括正确性和格式,提高推理质量。 3. 非线性适配器:在调优后的MLLM隐藏表示上训练一个小型MLP分类器,利用池化后的隐藏特征进行最终分类,避免仅依赖文本理由的缺陷。 此外,还引入了测试时强化学习(TTRL)用于跨域适应。
在两个数据集(ADReSS和LEADS)上,DeTAiL在准确率、迁移性和可解释性方面均优于强基线方法(如LoRA微调、直接推理等)。结果表明,推理能力对迁移性有益,但在域内准确率和可解释性上取决于理由的质量和模态覆盖。
本文系统评估了MLLM推理在痴呆分类中的作用,并提出DeTAiL框架有效利用隐藏表示提升性能,揭示了推理的利弊。
现有基于语音的抑郁症检测系统多为黑箱模型,缺乏可解释性,且在人口统计群体间可能存在偏差,限制了临床应用。此外,高复杂度模型(如自监督语音编码器)虽表现良好,但容易利用数据中的虚假关联(如访谈者行为)导致性能膨胀。
本文提出一个透明、公平的框架,使用低复杂度模型(随机森林RF、支持向量机SVM、多层感知机MLP)和人类可理解的声学特征(MFCC、eGeMAPS)。通过多种特征选择策略(随机基线、统计显著性、排列重要性、LIME、SHAP)筛选出最相关的15个特征,并结合置换检验、访谈者一致性检查消除虚假相关性。在DAIC-WOZ和E-DAIC数据集上进行人口统计公平性分析(使用归一化期望成本NEC)。
在严格无泄漏的测试集上,MLP配合XAI选择的特征子集达到82%的准确率,与复杂模型相当甚至更优,同时保持可解释性和公平性。
通过可解释特征和低复杂度模型,本文在抑郁症检测中实现了性能与临床可信度的平衡,为公平、可靠的辅助诊断系统提供了方法论框架。
传统的TTS评估以自然度(naturalness)为主要指标,但自然度是一个模糊概念,且无法反映语音在不同使用场景中的合适性(appropriateness)。实际应用中,同一段语音在不同任务(如朗读、助理、动画角色等)下的感知差异很大,单一的自然度评分无法有效区分系统优劣。
本文系统性地研究了5个TTS系统(Kokoro、Gemini TTS、Kyutai-TTS、GPT-4o-mini-tts、ElevenLabs)在5个领域(AI助理、读者、演员、动画角色、自发说话者)中的自然度和合适度。通过150名受试者的感知实验,采用5点Likert量表对自然度(human-likeness)和合适度(convincingness)进行评分,并用拉丁方设计平衡样本。同时分析了声学特征(节奏、表现力、音质)和自动度量(如UTMOSv2、DNSMOS、WER等)与感知评分的关系。
本文通过跨领域感知实验揭示了TTS评估中自然度与合适度之间的复杂关系,强调了上下文感知评价的必要性。
现有罗马数字分析数据集(AugmentedNet Dataset 和 Distant Listening Corpus)编码范式不一致(RomanText vs DCML),导致整合困难,阻碍大规模训练和研究。
Dilemmadata 最终包含 1,621 首曲目(353 AND + 1,268 DLC),超过 280 万音符级罗马数字注释,涵盖精确时值、根音、质量、转位、扩展音等特征。
该工作不仅产出了目前最大的同质罗马数字数据集,更揭示了异构标注标准间深刻的语义鸿沟,呼吁社区转向基于概率的模糊目标标签。
基于深度学习的多通道语音增强依赖大量训练数据,常用数据增强采用简化几何声学(如图像源法)模拟房间脉冲响应(RIR),但此类低保真模拟无法充分捕捉真实环境的声学复杂性(如低频模态、衍射等),导致模型在真实场景下性能受限。
本文系统研究了房间声学模拟保真度对多通道语音增强的影响。使用SpatialNet模型,在三种不同保真度的训练数据集上训练: - ISM-U:基于图像源法(gpuRIR),随机采样混响时间和房间尺寸(无先验信息); - ISM-M:基于图像源法,匹配高保真数据集的房间尺寸和混响时间(有先验信息); - Hybrid:使用Treble SDK的混合模拟(波+几何),包含真实材料、家具、散射体等,频率相关边界条件。
target为直达声,评估使用实测Eigenmike阵列数据。
本文通过严谨对比实验证实:高保真混合声学模拟能显著提升多通道语音增强的实测性能,为数据增强策略提供了重要指导。
现有自监督语音模型(SSL)在跨语言条件下如何编码发音运动信息尚不明确,尤其是对于芬兰语和俄语这类类型学差异显著的语言。
本文通过系统探测芬兰语和俄语双语发音数据,证明多语言SSL模型能够跨语言高效编码发音信息,且中间层和舌部运动预测最为可靠。
现有基于交叉重建的解缠评估无法检测潜空间分区间的信息泄露,且传统解缠指标(如DCI、MIG)针对维度级结构,不适用于分区级编解码器。
提出基于探针的解缠评估框架:对预训练AT编解码器的每个嵌入分区独立训练轻量MLP,回归房间声学参数(T60、C50、DRR)并分类说话人身份,利用预期与非预期分区的性能差距(Δ)量化解缠程度。该方法将DCI的信息性原理从维度扩展到分区。
该工作为神经音频编解码器提供了一种可靠的解缠量化工具,揭示了AT训练目标导致的非对称信息泄露,并证明声学嵌入自发学习了有物理意义的房间参数。
当前音乐音频语言模型在二元乐器问答(Binary Instrument QA)基准上表现高准确率,但这可能源于对乐器-流派关联等捷径的利用,而非真正的音频接地能力。标准评估无法揭示模型在混淆乐器区分、多标签识别和时域定位等更细致任务上的缺陷。
本文基于OpenMIC-2018数据集构建了一个递进式诊断基准序列,包括五个任务: 1. 二元乐器存在性问答(Binary Instrument-Presence QA) 2. 减少流派先验影响的硬例问答(Genre-Prior-Reduced Presence QA) 3. 混淆感知乐器判别(Confusion-Aware Instrument Discrimination,二选一) 4. 长上下文多标签乐器识别(Long-Context Multi-label Instrument Recognition,30秒音频,四选多) 5. 时域乐器定位(Temporal Instrument Localization,30秒音频,选择出现的时间段)
该设计旨在逐步增加诊断难度,暴露模型在聚合准确率下隐藏的行为偏差。
本文通过多轴诊断基准揭示了当前音乐语言模型在乐器理解上的系统性盲点,证明了二元QA的高分不能代表鲁棒的音频接地能力,呼吁采用更细致的评估协议。
SwiftAudio通过仅文本蒸馏实现了高效的一步TTA生成,兼顾推理速度与数据效率,性能逼近多步扩散模型。
现有的语音语言模型(SLM)使用固定帧率(如25Hz或12.5Hz)表示语音,忽略了语音信息密度随时间变化的特性(如静音段信息稀疏),导致计算浪费,且无法在推理时根据设备和网络条件灵活进行质量-速度的权衡。
FlexiSLM是首个支持动态和可控帧率的SLM,其关键创新包括: 1. 动态帧率框架:在语音输入和输出端均使用帧合并模块(Frame Merging Module),根据信息密度动态压缩帧数(≤12.5Hz),避免了固定帧率的低效。 2. 可控帧率机制:引入条件信号,允许用户直接指定平均输出帧率(如4.0Hz、6.25Hz),无需重新训练即可控制推理速度和质量。 3. 架构设计:采用“thinker-talker”架构,其中thinker为LLM骨干(基于Qwen2.5-7B-Instruct),talker输出FlexiCodec的动态帧率语音token和帧长度,并引入token延迟策略以同步语音与文本。
FlexiSLM通过动态帧率编码首次实现SLM中推理阶段可控的质量-速度权衡,为高效语音交互提供了新范式。
现有语音编辑方法主要关注词级内容修改,并将内容、说话人和情感编辑视为独立任务,缺乏灵活性和细粒度控制。此外,多属性编辑中属性表示高度耦合,难以实现独立控制。
在多个任务上达到最先进性能:说话人和情感可控性优于基线,支持词、音素、子音素级内容编辑,以及三者联合编辑。
UniSAE通过DPPG表示和两阶段架构,首次在单一框架内实现了灵活的细粒度语音属性编辑,显著提升了编辑的精确性和可组合性。
深度神经网络(DNN)驱动的语音质量评估(SQA)模型(如UTMOS)被广泛应用于语音合成、增强等领域,但其鲁棒性不足,易受域外样本影响。现有研究主要关注自然出现的鲁棒性问题,而本文从对抗攻击角度主动构造样本,揭示模型的设计缺陷。
本文针对UTMOS模型提出两种攻击方向: 1. 分数保持攻击(Score-preserving attack):在保持UTMOS预测分数不变的前提下,最大化感知质量的下降; 2. 质量保持攻击(Quality-preserving attack):在保持感知质量不变的前提下,最小化UTMOS预测分数。
攻击在三个优化空间中进行: - 原始波形(Waveform):直接优化波形; - 梅尔谱+HiFi-GAN:优化梅尔谱图,通过HiFi-GAN声码器转换为波形; - EnCodec潜空间:优化神经音频编解码器EnCodec的潜表示,再解码为波形。
攻击方法基于C&W攻击的惩罚式优化框架,使用L2距离作为感知质量的近似度量。
本文通过设计两种对抗攻击,系统性地探测了UTMOS模型的鲁棒性弱点,为SQA模型的安全性评估提供了新视角。
当前语音对话系统(S2S)评估缺乏可解释的语音原生韵律和节奏指标,现有评估多基于文本、任务成功率或主观评分,无法直接量化对话中的韵律和节奏行为。池化的人类统计参考(pooled references)可能掩盖与说话人特征和交互状态相关的系统性偏差,导致评估校准不佳。
本文为对话系统的韵律和节奏评估提供了一个数据驱动、可解释的匹配参考框架,能有效检测不合理行为,作为感知评估的补充。
将强语音到文本(S2T)大语言模型扩展为语音到语音(S2S)模型时,直接微调骨干网络会破坏原始S2T性能(灾难性遗忘),而附加下游语音合成模块会引入串行文本到语音瓶颈。
本文提出PRIME-Speech框架,冻结完整S2T骨干网络,仅训练语音生成模块。核心创新包括: 1. 隐藏状态同步:因果音频后解码器以时间戳同步方式条件于中间骨干状态,而非等待完整文本响应或固定文本块,实现并行生成。 2. 混合条件向量:结合骨干状态、前一个文本嵌入和音频历史均值,提供语义、词汇和声学连续性。 3. 多令牌预测(MTP):应用于音频分支,每次更新预测多个码本令牌,降低有效码率(从25 Hz降至25/k Hz),提升首音频延迟而不修改推理路径。 4. 训练时分段打包与缓存重置:将无关单轮样本拼接为伪多轮对话,文本KV缓存跨轮累积,音频KV缓存每轮重置,避免交叉轮声学漂移,无需额外多轮S2S数据。
在语音翻译、口语问答、语音理解和多轮对话任务上,PRIME-Speech在保持冻结骨干S2T行为的同时,产生准确、低词错误率(WER)的语音响应。未给出具体数值,但声称优于基线方法。
PRIME-Speech通过隐藏状态同步解耦推理与语音合成,在零遗忘前提下高效扩展S2T LLM为S2S模型。
现有的训练无关缓存加速方法(如TeaCache、TaylorSeer)主要针对文本条件生成,忽略了音频驱动肖像动画中固有的空间和模态不平衡:高频音频信号集中在人脸区域,而背景和身份保持低频静态。统一缓存导致高频细节丢失(图1c),而逐模块缓存导致内存爆炸(图2a)。
SyncCache首次针对音频驱动肖像动画中的非对称动力学设计无训练缓存加速,通过空间和模态解耦实现显著提速与高质量生成。
核心痛点:现有音频-视频生成模型通常采用双分支架构,每个模态使用单独的预训练tokenizer,导致表示空间差异,造成语义错位,且计算成本高。
方法创新:提出AVTok,一种新颖的统一tokenizer,将音频和视频联合编码为紧凑的1D离散潜在表示。架构采用双流Transformer,共享编码器-解码器和模态特定可学习查询,实现高效编码。提出层级训练策略VFAL(Video-First-Audio-Later),逐步优化各模态重建能力,并利用音频-视觉基础模型的特征进行表示对齐学习。
实验结果:AVTok在音频-视频重建以及下游任务(音频到视频、视频到音频、类别条件联合生成)中均达到领先性能,与单模态SOTA方法相比具有竞争力。
一句话评价:AVTok首次实现了统一音频-视频1D tokenization,为高效、语义对齐的视听生成提供了新方向。
现有音频深度伪造检测系统在跨域场景下泛化能力差,因为它们依赖于特定攻击或录音条件的特征。自监督语音模型提供了丰富的多层表示,但现有方法要么使用单层,要么不加区分地融合所有层,且层重要性仅在训练后才能揭示。
提出了一种与模型无关的两阶段方法: 1. 第一阶段:使用轻量级XGBoost探针评估每个Transformer层的跨域判别能力,生成层排名,识别信息深度区域。 2. 第二阶段:仅选择排名靠前的层(如4层),通过逐层注意力池化和共享瓶颈投影进行融合,同时冻结骨干网络(如XLS-R)。
关键发现:信息层聚集在深度区域(而非唯一最优位置),且探针选择因骨干网络而异(骨干特异性)。
通过探针引导的层选择策略,在不增加模型复杂度的情况下显著提升了音频深度伪造检测的跨域泛化能力。
现有音频深度伪造检测方案面临三大挑战:(i) 准确性不足,尤其在面对未见过的伪造技术时泛化能力差;(ii) 隐私问题,基于云的检测需要上传音频,不适用于记者和事实核查人员;(iii) 计算复杂度高,难以部署在消费级设备上。
该工作通过截断自监督模型+线性分类器的极简设计,实现了高准确性、强隐私保护且在边缘设备上可部署的音频深度伪造检测方案。
原始BEST-RQ使用Conformer编码器,在语音、音乐和环境声音的跨域音频表示学习中性能不平衡,且Conformer架构难以直接采用编码器-预测器分解(掩码区域移除会导致卷积邻域破坏)。此外,BEST-RQ在跨域迁移的整体表现仍有提升空间。
BEST-RQ-2 保留 BEST-RQ 的冻结随机投影离散目标(K=8192 codebook),主要引入两项改进: 1. ViT编码器:替代Conformer,支持对非重叠16×16谱图块进行patch tokenization,使编码器可处理任意子集掩码。 2. 两阶段上下文化-然后预测:编码器(ViT,12层)仅处理未掩码块,轻量预测器(ViT,4层)接收编码器输出和可学习掩码标记,为掩码块预测logits;预训练后丢弃预测器,推理时仅使用编码器。
该设计分离了上下文建模和预测任务,类似于JEPA风格。BEST-RQ-2在训练时计算损失仅针对掩码位置,推理计算量与BEST-RQ (ViT)相同(22.5 GFLOPs)。
在X-ARES(线性探测)和XARES-LLM基准上评估冻结编码器表示: - X-ARES线性探测(MoM):BEST-RQ-2 0.50,优于BEST-RQ 0.43、Audio-JEPA 0.42、BEST-RQ (ViT) 0.44。 - 领域表现:BEST-RQ-2在环境声音(0.41)和音乐(0.58)上显著提升,语音(0.51)略低于BEST-RQ(0.59),但整体平均更高。 - XARES-LLM:BEST-RQ-2同样在总体迁移得分上超越单阶段基线。
消融实验表明,性能提升主要源于两阶段分解而非架构变化(BEST-RQ (ViT) 与 BEST-RQ 性能相近)。
BEST-RQ-2通过简单有效的“上下文化-然后预测”两阶段设计,在不增加推理开销的前提下,显著提升了自监督音频表示在语音、音乐和环境声音间的跨域迁移能力。
现有音频检索嵌入主要针对音频-字幕匹配优化,缺乏对多样化检索目标和可控检索行为的支持,难以处理复杂声学环境、长时录音及指令驱动的检索需求。
提出 ALM2Vec,基于预训练的大型音频语言模型(LALM)MiDashengLM,通过对比学习训练统一的音频嵌入空间。支持文本、音频及多模态输入,并引入指令感知的嵌入提取,实现可控制的检索(如音频问答、属性条件检索)。训练采用两阶段:预训练(15秒音频,4000步)和微调(30秒音频,2000步),使用 LoRA 适配语言模型,冻结音频编码器。
ALM2Vec 基于大型音频语言模型实现了统一、可控的音频检索,在多个基准上表现优异,且支持指令驱动的灵活检索。
传统痴呆检测方法多依赖单一模态(声学或语言学),忽略两者的互补性;手工标注的信息单元(IU)编码方案无法全面捕捉语义和语篇特征。
提出多模态框架:1)使用Whisper同时提取声学表征(编码器输出)和ASR转录文本;2)声学通路通过时序网络+注意力池化得到固定维度嵌入;3)语言通路利用LLM(GPT-5.2)从转录中提取46个可解释特征(词汇多样性、句法复杂度、语义连贯性、语篇模式),经特征选择优化为29维;4)门控融合网络动态融合两种模态。
在ADReSS和ADReSSo基准上,分别达到F1=89.47%和90.14%,优于单一模态;消融实验证明多模态融合一致优于单模态。
首次将Whisper的双重角色与LLM可解释特征结合,通过门控融合实现声学与语言学的有效互补,在痴呆检测任务上取得优异成绩。
BEST-RQ使用固定的随机投影量化器生成伪标签,其量化器固定不变且基于低层次的log-Mel特征,导致训练目标较弱,且对随机初始化敏感。
在Librispeech 960h上预训练,使用100h微调,与原始BEST-RQ相比,WER从10.1%降至8.8%(相对降低12%)。三种改进均贡献约3-4%的相对提升。
本文通过在线精炼伪标签的方法在保持BEST-RQ简洁性的同时显著提升了ASR性能。
提出跨语言ASR无关的语音痴呆检测框架,通过光谱位移场和交叉注意力融合,揭示了多模态融合效果高度依赖语料库特性。
MeloDISinger通过旋律感知的时长比例预测和flow-matching音频填充,首次在歌声编辑中实现了严格时长保持与高质量编辑,显著优于现有方法。
现有语音自监督学习(SSL)方法主要专注于判别式任务(如ASR、说话人识别),通过对比预测、掩码建模等方式提取鲁棒的上下文表示,但缺乏对语音信号生成信息的保留,导致在生成任务(如波形重建、语音转换)上表现不足。传统的分析-合成范式在经典信号处理中有效,但在现代SSL中合成目标常被忽略或仅作为后处理。
OLIVE提出联合优化分析和合成目标的端到端预训练框架: - 分析分支:基于视图增强的掩码蒸馏(view-augmented masked distillation)。对输入波形施加独立的数据增强(如时域变换),分别作为学生和教师视图,学生从掩码学生特征预测教师连续目标(归一化的多层教师输出均值的指数滑动平均),使用L2损失。 - 合成分支:基于波形重建。使用HiFi-GAN生成器从早期编码器局部特征(未掩码的学生视图)重建波形,结合mel谱损失、对抗损失和特征匹配损失。 - 统一目标:分析损失和加权合成损失联合优化,早期特征通过合成约束保留信号细节,后期上下文表示通过分析目标趋向不变性。解码器在预训练后保留,可直接用于波形生成。
OLIVE在生成任务和说话人相关任务上优于基线(如wav2vec 2.0、HuBERT、data2vec),在识别和语义任务上保持竞争力,并显著提升波形重建质量。
OLIVE通过统一的视图增强掩码预测与波形重建,首次在语音SSL预训练中实现了分析与合成的联合优化,平衡了判别性与生成性,为多任务通用表示学习提供了新思路。
SONAR等非序列化句子级嵌入模型在大规模多模态应用中虽有高效优势,但存在解码不稳定性,表现为输出中随机模式无限重复、句子截断等异常行为。这些异常类似于LLM的结构性幻觉,传统检测方法需内部解码概率或多次采样,计算成本高。
本文提出一种基于嵌入自一致性的异常检测方法:计算原始语音嵌入与错误转录文本嵌入之间的余弦距离或欧氏距离,距离超过阈值则判定为异常。核心发现是异常转录的嵌入会远离原始嵌入。此外,通过分析每个维度对输入变化(速度、音高、词序、时长)的响应,识别出特定维度(如第654维)与输出长度相关,可用于异常修正。
该工作揭示了非序列化嵌入维度可指示解码异常,并据此构建了高效、无需额外解码状态的检测器,为多模态概念模型的可靠性提供了新视角。
核心痛点:个体 HRTF 获取困难,通用 HRTF 和合成 HRTF 的性能缺乏在同一实验框架下的系统比较。
方法创新:通过两个 VR 定位实验,在 19 名受试者中比较了五种 HRTF 条件(个体测量、KEMAR、随机非个体、高分辨率扫描合成、摄影测量合成),并验证了重测信度。
实验结果:侧向定位指标对 HRTF 类型不敏感,而极坐标指标和混淆率表现出强依赖性;随机 HRTF 优于 KEMAR;高分辨率合成 HRTF 的性能与个体测量相当;摄影测量合成 HRTF 和 KEMAR 的性能最差。
一句话评价:首次在同一 VR 定位协议中全面比较五种个性化水平的 HRTF,为非个体基线选择提供了实用指导,并强调了网格分辨率对仰角定位的重要性。
声音事件检测(SED)受限于标注数据稀缺,现有半监督方法依赖一致性正则化,但对基于大规模预训练自监督编码器的系统效果不佳。
在DESED验证集上,ATST-SEDv2达到0.645 PSDS1和0.822 PSDS2(cSEBB后处理),建立新SOTA。
本文通过条件混合统一了混合策略,并引入嵌入级对比损失,显著提升了半监督SED的性能。
现有基于LLM的音视频语音识别(AVSR)模型在干净条件下表现优异,但面对噪声环境时性能显著下降。原因在于LLM骨干网络预训练于纯文本数据,微调时仅更新少量参数(LoRA),缺乏对噪声鲁棒性的显式建模,导致音频编码器输入的噪声会直接污染LLM的内部表示。
本文提出VIB-AVSR,通过将变分信息瓶颈(VIB)层插入LLM的指定层(实验表明第4层和第8层最优),对音频隐藏状态进行压缩。VIB层由两层MLP实现,输出高斯分布的均值和方差,并通过重参数化采样得到瓶颈表示,再与原始表示插值(α=0.5)后传入后续层。训练时优化VIB目标:最大化转录似然的同时,最小化KL散度以压缩与任务无关的噪声信息。无需修改架构或额外数据,仅增加少量计算。
在LRS2数据集上,与基线Llama-AVSR相比: - 有噪声训练:在多噪声类型(babble、speech)和SNR(-10到5dB)下,WER平均降低1-2个百分点(如babble噪声下平均WER从18.85%降至17.39%)。 - 干净训练:同样有提升,且在极端噪声(-10dB)下增益更明显(如speech噪声下WER从42.13%降至37.44%)。 - 在无噪声条件下性能几乎不变(WER≈2.4%)。
一种轻量级、即插即用的方法,通过变分信息瓶颈机制显著提升LLM-based AVSR模型对噪声的鲁棒性,且不牺牲干净语音性能。
现有ASR测试集在数字、不流利、实体和大小写等格式上采用不一致的标注约定,标准归一化器抹去了用户关心的格式差异。当前基准无法衡量模型是否遵循用户对输出风格的偏好。
对四个模型(SALMONN、Qwen-Audio、Qwen2.5-Omni等)的基准测试显示,排名随偏好类型发生变化,暴露了传统评估掩盖的质量差异。
Preference-ASR通过条件化参考于用户指令,首次实现了对ASR系统遵循格式化偏好能力的系统评估,弥补了现有基准的空白。
现有神经语音编解码器通常采用固定帧率(FFR),在静音或平稳段浪费比特,在语音快速变化段分辨率不足。可变帧率(VFR)编码通过自适应分配帧率来改善效率,但需要传输位置/时长的边信息,导致总比特率公平比较下VFR增益不明显。此外,现有VFR方法在边界选择、边信息设计和可控实验上存在不足。
DTM-Codec(127M参数,LibriSpeech-960训练)在匹配总比特率下,重建质量和可懂度全面优于FFR基线。尽管模型规模和训练数据小于BigCodec、X-Codec 2.0等,但在多个指标上达到或超越它们。代码开源。
DTM-Codec通过动态令牌掩码和高效边界选择,在严格匹配总比特率下首次展示了VFR对FFR的可靠且广泛的重建增益。
噪声鲁棒带宽扩展(NR-BWE)旨在从带噪低分辨率输入重建高质量宽带语音,但现有方法难以兼顾高频重建和噪声抑制。标准流匹配目标仅提供单向监督,噪声下速度估计模糊,导致生成轨迹偏离干净语音流形。
提出 VeRe-Flow,一种基于流匹配的清洁引导框架,引入多级清洁监督: 1. 速度对比正则化(VeCoR):双向监督,吸引预测速度朝向干净轨迹,排斥远离噪声轨迹。 2. 表示对齐(REPA):将中间特征与干净自监督学习(SSL)表示对齐,促进噪声不变语义特征。 3. 架构改进:集成卷积残差模块和噪声鲁棒SSL条件(XEUS)作为额外语义引导。
在Valentini-Botinhao数据集上,VeRe-Flow在LSD、DNSMOS OVRL和MOS上均超越所有基线(包括生成式和非生成式)。具体:LSD最低(1.10),DNSMOS OVRL最高(3.12),MOS最高(4.14)。
VeRe-Flow通过速度对比和表示对齐有效引导流匹配生成干净语音,在NR-BWE任务上达到SOTA。
现有的单自由度(1-DOF)集总模型无法在结构阻尼下维持自激振动,除非引入复杂的声道耦合模拟;同时,这些模型难以准确模拟声带闭合阶段,常导致闭合不充分或物理不一致。多自由度模型虽能捕捉更多动力学特征,但参数多、计算开销大。
该研究提出了一种物理驱动、参数精简的1-DOF声带模型,通过流分离和接触力的显式建模,在不借助声道耦合的情况下实现了自持振动与准确闭合,为高效发声模拟提供了新范式。
水下声学机器学习面临公开标记数据集稀缺的问题,与空气声学领域(如ESC50、GTZAN等大型基准)相比,水下数据集通常规模小、声学多样性有限,导致模型训练受限且跨域泛化能力差。此外,水下录音常包含重叠的生物和人为声音、强背景噪声以及类别不平衡,缺乏标准化的预处理和标注流程,限制了可重复性和公平基准比较。
该工作通过构建新数据集和提出结合边际损失与特征对齐的方法,有效缓解了水下声学分类中的类不平衡和跨域漂移问题。
GigaSpeechBench是一个全面、真实、多语言多维度ASR/AST基准,填补了对中东、东南亚低资源语言、方言、口音、术语和年龄变化评估的空白,并证明了现有模型在真实场景中性能显著下降。
传统非自回归语音识别(NAR ASR)方法通常从随机、完全掩码或固定长度标记序列开始,需要多次迭代重建完整转录,效率低下。CTC提供的贪婪假设虽然快速但精度有限,且现有扩散模型从无信息状态开始,浪费计算资源。
在LibriSpeech数据集上,使用ESPnet编码器时,test-clean/test-other的WER从3.5/7.9降至2.6/5.8(相对降低25.7%/26.6%);使用Whisper medium编码器时,从2.6/6.1降至2.0/4.7(相对降低23.1%/23.0%)。消融实验验证了各设计选择的有效性,解码器预训练和预训练编码器集成带来显著性能提升。
该工作通过将NAR ASR重构为基于CTC假设的编辑细化,结合编辑流和扩散框架,以极小计算开销实现了卓越的识别精度提升。
大规模弱监督ASR数据存在两个主要问题:1) 标签噪声(如拼写错误、未说话文本);2) 数据多样性导致特定领域性能次优。传统方法通常只进行简单预训练,未充分处理这些问题。
提出三步训练策略: 1. Step 1: 预训练 — 使用整个弱监督数据集训练基于CTC的编码器-仅ASR模型。 2. Step 2: 过滤与继续预训练 — 利用Step 1模型转录所有数据,计算字符错误率(CER),过滤掉CER高于阈值r的样本,然后继续预训练。 3. Step 3: 数据选择与微调 — 若目标域训练集不可用,则从过滤后的子集中选择与目标域声学相似(基于SSL嵌入的余弦相似度)的样本进行微调。
关键创新点:将过滤和选择结合,且复用已用过的训练样本,不依赖额外数据。
提出了一种简单有效的过滤与选择策略,显著提升了大规模弱监督ASR在目标域的性能,且无需额外数据。
HPRO通过结构化偏好空间和渐进式优化,解决了情感TTS中信息冲突和尺度差距问题,实现了更可控、更自然的情感语音合成。
传统实验室主观听测(P.800)可靠但成本高、耗时长;众包听测(P.808)快速廉价但结果质量较差,表现为评分范围缩窄、方差增大,导致平均评分偏移(MAE=0.573, RMSE=0.659)。
系统对比三类筛选方法: 1. 预筛选:听力预测试和问卷,但效果不佳。 2. 中筛选:陷阱问题(随机要求特定评分)和黄金标准问题(参考评分阈值),可有效识别注意力缺失的参与者。 3. 后筛选:基于锚点排序(MNRU等级正确性)和评分跨度(参考与最差锚点评分差),能显著提升结果与P.800的一致性。
本文通过系统实验验证了后筛选方法能有效提升众包听测结果质量,使其接近实验室水平,为低成本主观评估提供了实用方案。
保险欺诈在呼叫中心场景中难以检测,尤其是首次损失通知(FNOL)阶段。现有方法主要依赖结构化数据、文本或图像,忽略了跨通话的说话人身份重用信号。真实呼叫中心音频因隐私和生物识别数据限制而难以研究。
提出 DG^VoiC 框架,用于匿名化真实呼叫中心音频的说话人聚类。流程包括: - 基于 NER、正则表达式和 WhisperX 词级时间戳的敏感信息对齐匿名化; - 使用 Resemblyzer 预处理的语音聚焦预处理(静音去除); - 滑动窗口(6秒窗口,3秒步长)提取 ECAPA-TDNN 说话人嵌入; - 余弦相似度聚类,并设置三个条件(相似度>0.718、簇中客户数>4、簇一致性)以生成风险评分。
在 56 个样本(22 个人工标注簇)的验证集上,最佳配置(ECAPA-TDNN + 均值池化 + 6秒滑动窗口 + 余弦阈值0.718)达到:AMI 96%,ARI 95%,完整性 98%,同质性 100%,V-measure 99%,准确率 95%,F1 0.96。额外发现的2个簇实际源于真实录音中的噪声或变化。
该方法在真实呼叫中心条件下有效实现说话人聚类,为欺诈调查提供强辅助信号。
传统的符号音乐对齐方法要求音符一一对应,无法处理排练、即兴等场景中的非唯一对齐(如一个谱面音符对应多个演奏音符,或一个演奏音符对应多个谱面音符)。
提出对Match文件格式的简单扩展: - 虚拟谱面音符(virtualSnote):用于一个谱面音符对齐多个演奏音符(如排练重复、装饰音)。 - 虚拟演奏音符(virtualPnote):用于一个演奏音符对齐多个谱面音符(如相同音乐内容的重复小节)。 - 扩展Section行:增加section和omittedSection行,支持标注排练重复段落和省略段落。 扩展保持向后兼容,不引入新格式。
论文以钢琴排练对齐和低音连续对齐为例,展示了扩展格式如何编码重复、插入、删除等复杂对齐关系。未提供量化实验结果。
通过微小的格式扩展优雅地解决了非唯一音符对齐的编码问题,实用性强,适用于音乐排练和即兴演奏分析。
保险欺诈造成巨额经济损失,早期检测(首次损失通知FNOL阶段)面临数据稀缺问题,尤其是缺乏公开的多模态(文本+语音)数据集,现有方法多基于私有文本数据,难以复现和扩展。
提出一个端到端的多模态混合NLP管道,包含:1)合成数据生成:用GPT-2生成欺诈/合法对话,xTTS合成双说话人音频;2)ASR与双音化:WhisperX将音频转为文本并标注说话人;3)特征提取:NER+正则提取实体,BERT+RAG检索历史叙述,Resemblyzer提取说话人嵌入;4)规则评分:融合多模态信号(文本、语音、说话人身份)计算风险分数,检测叙述复用、结构不一致和跨案例声音重复。
数据集验证和组件级评估表明管道稳定且具有迁移潜力,平衡了灵敏度和误报率,为多模态欺诈检测提供了可复现基线。
该工作通过合成多模态数据填补了保险欺诈检测领域的数据空白,并提出了一个集成文本、语音和说话人信息的透明评分框架,具有重要研究价值。
长音频(如烹饪、清洁)具有天然层次结构(事件→子活动→活动),现有方法分别建模各层级导致跨层级不一致,且需要多层级标注。
提出层次活动语法(Hierarchical Activity Grammar),一种概率上下文无关文法(PCFG),编码层次组合和时间顺序约束。通过语法引导解码,从事件级后验概率推断出动作-子事件解析树,进而导出子活动分割和活动分类,无需子活动或活动标签训练。引入噪声非终结符处理缺失/杂散事件;采用Earley-style最大后验解码。
在MultiAct长音频数据集上,所提方法改进了时间顺序一致性(Edit分数),产出了可解释的层次结构。
一种无需中间层标注、利用语法先验增强长音频活动识别一致性的结构化推理方法。
该工作通过大规模多语言多情感语料库和系统评测,揭示了语音强调模型跨语言和情感泛化的关键规律,为构建鲁棒、可迁移的强调检测系统提供了重要基准和见解。
现有神经音频自编码器多采用固定帧率,对信息密度不同的区域分配相同的时间预算,导致不必要的长序列,影响生成模型的计算和内存效率。
提出Elastic Time,一种即插即用的重瓶颈模块,可将预训练的固定帧率自编码器转换为动态帧率模型。核心是训练一个轻量级潜在预测器,根据预测准确性判断帧的冗余性,在推理时通过贪心或动态规划算法自适应选择帧边界,仅保留锚定帧并用预测器重构其余帧。无需外部语义监督,支持推理时按用户指定压缩率调节。
在多个压缩率下,Elastic Time相比固定下采样和CodecSlime等基线,在重建质量(如SI-SNR、PESQ)与效率之间取得了更好的权衡。动态规划版本性能最优,贪心算法接近且更高效。
一种将固定帧率自编码器灵活转换为动态帧率的插件方法,兼顾效率与质量。
现有的非侵入式语音质量评估(SQA)模型要么依赖大规模自监督学习(SSL)模型或多模态大语言模型,计算开销大;要么紧凑型模型(如DNSMOS Pro)泛化能力有限,对未见过的失真或录音条件适应性差。
提出DNSMOS-C,在DNSMOS Pro的中间嵌入层引入基于MOS的对比学习损失(SCOREQ triplet loss),实现端到端联合优化。模型保持轻量级架构(4层卷积+全局池化+3层全连接),同时通过对比损失引导嵌入空间按感知质量排序,提升泛化性。训练损失为高斯负对数似然(GNLL)加对比损失,平衡因子λ=1。
在BVCC、Tencent、NISQA等数据集上,DNSMOS-C在相关性指标(LCC、SRCC)上持续优于DNSMOS Pro,且标准差更低(训练更稳定)。在跨域测试集(NISQA TEST FOR/P501/LIVETALK)上,相关性指标多数提升。潜在空间分析(PCA、聚类)表明,对比损失使嵌入空间按MOS排序,并保留对失真/噪声类型的分辨能力。
DNSMOS-C通过轻量级对比学习损失显著提升紧凑型端到端SQA模型的泛化能力和训练稳定性,且不增加推理开销。
现有说话人日志标注工具(如 gryannote)虽然关注标注成本,但并未实际度量成本。人工标注耗时且昂贵,且缺乏量化不同辅助手段效果的机制。
提出 voxmap-studio,一个基于 React 的开源标注工具,集成 pyannote 生态系统。创新点包括: - 快速初始化:使用步幅加速的日志引擎自动生成假设,标注者只需纠正而非从头绘制。 - 内置成本度量:记录每种编辑操作(创建、删除、分割、调整大小、重新分配)的次数和耗时,作为一等输出。 - 确认门控导出:每个片段需人工确认(至少听一遍)才能导出,并注入“幻影”片段作为注意力检查,防止未验证输出泄漏。 - 标签辅助:通过嵌入相似度高亮不确定片段、聚类画廊和推荐功能加速标注。
在 AMI 语料库 9 个文件上进行初步研究,比较三种条件:C1(纯手动)、C2(自动初始化+不确定性高亮)、C3(额外添加画廊和推荐)。结果: - C1 成本最高(editOps=761, DER=0.177),且以创建操作为主。 - C2 成本最低(editOps=278, DER=0.079),工作转向纠正。 - C3 反而成本上升(editOps=418),说明更多辅助未必更好。
该工具首次将标注成本作为一等输出,为量化不同辅助策略的效果提供了实证基础,但初步研究样本量小,结果需进一步验证。
wav2tok 2.0 针对查询-示例口语词检测(QbE-STD)任务,现有方法如 wav2tok 依赖紧密耦合的聚类和对齐训练,难以扩展;BEST-STD 等虽可扩展但仅隐式处理对齐。
提出两阶段训练框架: 1. Stage I: 基于 BEST-STD 架构,通过对比学习(SimCLR风格)和向量量化学习判别性、说话人不变的帧级表征。 2. Stage II: 引入显式成对令牌一致性约束: - CTC对齐损失: 最大化正样本为锚点下的去重令牌序列的CTC似然,禁止空白令牌。 - DTW对齐帧级令牌预测损失(新颖): 利用DTW对齐路径,为每个锚帧选择对齐帧中余弦相似度最大的正样本令牌作为目标,最小化负对数似然。 - 自适应权重: 通过对比损失与CTC损失的比值动态调整CTC权重,稳定训练。
在 LibriSpeech train-clean-100 的令牌一致性评估中,wav2tok 2.0 在 unigram 和 bigram Jaccard 相似度上全面优于 HuBERT、WavLM、SpeechTokenizer、EnCodec、BEST-STD 及 wav2tok(如 256 代码本:0.83 vs. 0.80 unigram, 0.75 vs. 0.72 bigram)。在 QbE-STD 检索基准上一致超越 BEST-STD 和通用 tokenizer。
wav2tok 2.0 在保持可扩展性的同时,通过显式对齐损失显著提升了口语词检测的令牌一致性,是检索导向语音标记化的新标杆。
本文提出了一种动态门控融合的双编码器框架,有效解决了单编码器跨域泛化不足的问题,在通用音频表示上达到SOTA。
多模态系统常使用质量感知融合(quality-aware fusion)根据模态可靠性加权,但现有评估仅报告整体性能,未验证可靠性分数是否真正影响模型决策,可能仅因数据相关性或架构灵活性而提升。
提出泄漏安全的诊断方法:固定训练后的模型和输入,在测试时打乱可靠性分数(Broken-Q)与原始对齐分数(Clean-Q)比较。若预测依赖分数,性能应下降。实验仅在全观测样本上进行,排除缺失影响。同时计算排列间隙(permutation gap)和Oracle headroom量化潜在改进空间。
本文提出简洁有效的诊断方法,揭示了现有质量感知融合方法在常见设置下未真正利用质量信号,为多模态鲁棒性研究提供了重要反思。
当前助听器语音理解评估指标(如 HASPIv2)主要基于模拟失真下的客观可懂度,与真实消费者在商业助听器上的主观感知(如“理解容易度”)缺乏明确关联,难以反映实际用户体验。
本文通过大规模真实数据和基于Whisper的差异嵌入方法,有效预测了听者对商业助听器语音理解的主观容易度,显著优于传统客观指标HASPIv2。
日语TTS面临汉字多音字(kanji polyphony)挑战:2136个常用汉字共有4378种读音,上下文决定读音;现有系统训练数据中日语占比低,缺乏针对性数据增强;评估缺乏汉字级标注,且CER/WER受正字法变体干扰。
通过大规模数据缩放和针对性数据合成,有效解决了日语汉字多音字问题,实现了SOTA读音准确率和跨语言鲁棒性。
现有音频tokenizer大多基于帧级或短窗级别的量化、聚类或重建,导致序列级别的属性(跨实现一致性、长度、终止、紧凑性、编辑几何)难以直接控制。编辑距离是自然的序列度量,但不可微,难以直接优化。
PairAlign提出通过序列级自对齐学习紧凑的音频token字符串。将tokenization视为条件序列生成:encoder输出连续条件,autoregressive decoder生成从BOS到EOS的符号序列,直接学习token身份、顺序、长度和终止。训练使用两个内容保持的视图,使每个视图的token字符串在另一视图表示下高似然,同时利用in-batch负样本区分。采用三阶段训练:Stage I训练VQ几何tokenizer作为基线;Stage II冻结encoder和quantizer,利用确定性VQ目标训练autoregressive decoder进行交叉配对;Stage III引入EMA teacher进行自适应序列tokenization,并包含anti-bypass正则化、长度约束等技术。
在连续3秒语音上,PairAlign学习到紧凑、词汇丰富、非退化的token字符串,具有强跨视图一致性。检索时速率12.71 tokens/s,相对于VQ几何基线减少约55%的token数。在编辑距离检索中表现良好,但暴露了紧凑性-局部性权衡:在高密度几何或预训练SSL tokenizer上不一定全面占优。
PairAlign通过自对齐与自回归解码将帧级几何先验扩展为序列级紧凑音频tokenizer,实现了跨视图一致且可编辑距离搜索的符号表示。
CodecSep通过直接在神经音频编解码器潜在空间中进行文本引导掩码,实现了高效、低延迟的通用声音分离,显著降低了计算成本,同时保持了分离性能。
当前实时语音AI系统(如GPT Realtime-2、Gemini 3.1 Flash Live、Qwen3.5 Omni系列)在决策时严重依赖词汇内容,忽视语音中的情感、语调、口音等非词汇线索,导致在紧急呼叫、欺诈检测等场景中做出错误行为(如挂断哭泣者电话、批准恐惧中的转账、注册讽刺意愿者)。
本文揭示了实时语音AI的“情感智能鸿沟”——听得见但不倾听,警示在依赖语气和情感信息的场景中需谨慎部署。
传统音频流水线将语音增强(SE)和自动增益控制(AGC)作为独立模块级联,导致两种局限:AGC先于SE会无差别放大噪声和语音,降低信噪比;SE先于AGC则易过度抑制低音量语音,且残留噪声被AGC放大。
SE-AGCNet通过端到端联合训练有效解决了SE与AGC的协同难题,在会议场景下显著提升语音质量和ASR性能,并提供了可复现的数据管道与标准化评测方法。
标准CFG在零样本TTS中同时增强文本和说话人条件,导致两者权衡;分支选择性方法虽可分别增强但存在权衡。
提出四分支残差分解(full, text-only, speaker-only, null),将全条件方向分解为文本残差、说话人残差和联合残差。基于此设计联合残差重加权,在标准CFG基础上独立控制说话人残差和联合残差,提供更细粒度的控制。
在F5-TTS和CosyVoice2上,该方法在保持文本正确性的同时提升了说话人相似度(CosyVoice2在多个数据集上提升ASR错误率指标;F5-TTS在英语集上提升说话人相似度)。
提出联合残差重加权方法,通过四分支分解和独立加权联合残差,有效平衡了零样本TTS中的说话人相似度和文本准确度。
传统的强制对齐(Forced Alignment)方法主要依赖 HMM-GMM 框架,虽然精度高但依赖发音词典和 G2P 转换,无法适应自发语音中的实际发音变化。现代端到端 ASR 模型(如 wav2vec2.0、HuBERT、Whisper)虽在识别上表现优异,但未针对时间边界定位优化,导致对齐精度不足。
提出一种全可微分的神经强制对齐架构,包括: 1. 双分支编码器:表示编码器(用于音素身份验证和边界检测,通过对比损失 MNCE 区分稳态帧和过渡帧)和上下文编码器(生成帧级音素概率)。 2. 可微软动态规划解码器:基于 Soft-DP 的端到端可训练模块,保持梯度流动。 3. 对比损失(MNCE):增强稳态音素区域与过渡边界区域的声学区分。 4. 端到端联合优化:结合 MNCE、交叉熵和 Soft-DP 损失。
在手工标注的英语基准上超越 HMM-GMM 和现有神经对齐方法,并泛化到词级对齐和未见语言。
首个结合对比表示学习与可微动态规划的端到端音素对齐系统,显著提升边界精度。
传统将预训练语音编码器(如基于ASR或SSL的模型)接入大语言模型(LLM)构建Speech LLM时,存在表征空间不对齐问题:ASR编码器产生语言特定的连续特征,而LLM工作于语言无关的语义空间,轻量适配器难以弥合这一鸿沟。
提出在语音编码器预训练中引入双向翻译任务(X↔en),迫使编码器学习语言无关的抽象语义表示。具体设计:1)采用Whisper-style Seq2Seq架构,预训练后仅保留编码器;2)定义三种预训练配置:ASR-Only(仅多语言转录)、ASR & ST (X→en)(非英语→英语翻译,模拟Whisper)、ASR & ST (X↔en)(双向翻译,包含英语→其他语言);3)改进prompt格式支持双向翻译(OWSM风格)。
基于Llama-3.2-1B/3B-Instruct frozen LLM,在ASR、ST(X→en和en→X)任务上评估。双向翻译预训练(X↔en)始终最优: - 在1B LLM上,ASR WER从16.6降至14.6(en),ST X→en BLEU提升(如ja: 7.1→11.8); - 在3B LLM上,en→X翻译(seen语言)提升显著(如zh: 28.3→30.8),unseen语言(fa, id, sv, tr)同样受益; - 相比仅X→en翻译,双向翻译带来更一致且更大幅度的改善,证明对称翻译目标对语义对齐的关键作用。
该工作通过系统性对比实验,首次验证了双向翻译预训练能有效解决语音编码器与LLM的模态鸿沟,为构建高性能Speech LLM提供了新的预训练范式。
方言变体对大型语言模型(LLM)和语音语言模型(SLM)构成显著挑战,尤其是日语方言的鲁棒性尚未被系统研究。
本文首次系统评估日语方言在文本和语音LLM中的鲁棒性,揭示了模态间方言能力迁移规律,并指出方言数据和编码器微调是关键改进手段。
现有扩散式文本到语音(TTS)模型在处理表达性语音中的尖锐韵律转换(如快速音高变化、清浊音边界)时效果不佳,固定的周期激活函数(如Snake)适应性有限。
本文提出自适应振荡激活函数Oscilla,定义为 x + tanh(α sin²(x))。该函数结合了周期性的正弦分量和可学习参数α,通过tanh饱和机制实现门控,自适应调节振荡响应,同时线性旁路保持信号稳定。将其集成至StyleTTS2的解码器中,形成OscillaTTS系统。
在LJSpeech(单说话人)和ESD(多情绪)数据集上,OscillaTTS在主观(MUSHRA评分86.67±1.49)和客观指标(MCD 6.59±0.01,F0-RMSE 0.35±0.003)上均优于StyleTTS2、GlowTTS、GRADTTS、FastSpeech2等基线,尤其在韵律建模上表现更佳。
OscillaTTS通过引入可自适应调制的振荡偏置,有效提升了扩散TTS对表达性语音中尖锐动态的建模能力。
跨语言文本到语音(TTS)中,口音转换和强度控制仍是基本挑战,尤其是对于低资源和语音多样的印度语言。现有基于大语言模型(LLM)的TTS系统虽有强跨语言泛化能力,但对口音特征和强度的显式控制有限。
提出CrossAccent-TTS框架,包含口音强度控制器(Accent Intensity Controller, AIC),通过加权语言嵌入注入口音子空间,实现口音间平滑插值和推理时口音强度细粒度调制。另设口音抑制模块(Accent Suppression Module),利用对抗性学习将口音与说话人/风格表征解耦,保留说话人相似性。模型基于Qwen 2.5(0.5B)和Neucodec语音编解码器,自回归生成声学令牌。
在Indic Multilingual数据集(986小时)和L2-ARCTIC数据集(27小时)上评估,CrossAccent-TTS实现了精确的口音强度控制,在口音相似性和可控性上优于IndicF5、XTTS-v2、CV AE、GST-based等基线,同时保持说话人相似性和自然度。
首次实现跨语言口音强度连续可控的TTS,在低资源印度语言和L2英语口音上均有效。
波兰语儿童发音错误筛查依赖专家,资源有限;波兰语辅音密集,咝音系列复杂,自动筛查难度大。
本文提出了一种针对波兰语儿童咝音替换的可解释筛查流水线,在有限数据上取得了合理的识别和筛查性能,并设计了安全的护理人员辅助框架。
当前呼吸声学基础模型(FMs)仅在智能手机录音上评测,而临床部署日益转向体耦合(BC)可穿戴设备,其传感器通过组织和骨骼衰减高频内容,导致FM可靠性未知。
首个系统评估呼吸声学基础模型在体耦合可穿戴传感器条件下性能的基准,揭示了显著的传感器依赖性和任务特异性退化。
自动吉他转录(AGT)领域缺乏带速度标签的公开数据集,且速度在吉他上的定义模糊,导致多数模型忽略速度预测。
首次提出吉他转录中的速度预测方法,通过合成数据预训练结合真实数据微调,实现了有效的速度预测,但音符转录性能提升有限。
传统无人机语音控制依赖严格预定义命令列表,无法处理非专业用户的自然口语(含犹豫、重复、修正等不流畅现象)。级联方案(ASR+语义分析)延迟高且错误传播,而端到端方法因缺乏大规模配对音频-意图数据而难以实现。
提出端到端口语理解架构,冻结自监督学习(SSL)声学编码器(基于Wav2Vec),后接轻量级LSTM+注意力池化分类头。创新引入跨模态知识蒸馏:训练时利用冻结的文本教师(如CamemBERT)编码ASR转录,通过余弦损失对齐声学表示与语义嵌入,推理时无需转录。在法语自发语音语料库VoiceStick(29对非专业用户真实遥操作场景)上评估。
端到端架构结合冻结SSL编码器与知识蒸馏,在实时无人机语音控制中实现低延迟、高鲁棒性,比级联方案更优。
现有水下辐射噪声(URN)标准(如ISO 17208-1、ANSI/ASA S12.64)主要针对水面船舶,无法适用于水下电动车辆(SEV),因其辐射特征以窄带谐波和调制分量为主,而非宽带空化噪声,且在浅海环境中受背景噪声、传播效应和方向依赖性的影响,难以表征。
提出一个八步法框架,结合校准的经过测量、同步车辆元数据(速度、深度等)、背景噪声评估、子系统导向的谱解释和传播校正的源级估计。核心在于通过窄带和时频分析解析SEV特有的电机驱动相关音调,而非宽带方法。
在A18D AUV的沿海测试中,观测到5.56、11.1和22.2 kHz附近的驱动相关音调群,谐波结构延伸至105 kHz。源相关音调PSD估计范围为77–120 dB re 1 µPa²/Hz @ 1m。
该工作填补了SEV水下噪声标准化表征方法的空白,其子系统分析和高频扩展(>105 kHz)显著优于以往局限于5–16 kHz的研究。
U-Net跳跃连接虽保留精细声学细节,但可能传递噪声相关的低级特征,增加解码器负担;扩散/得分模型迭代采样步数多,限制实时部署。
提出无跳跃连接的编码器-解码器骨干,用于流匹配(Flow Matching)语音增强。通过潜在表示对齐(LRA),利用冻结的Descript Audio Codec(DAC,去除残差向量量化)提取干净语音潜在特征,监督瓶颈和解码器表示。采用x预测参数化、FiLM时间嵌入、多周期/多分辨率判别器。
在WSJ0-CHiME3和VoiceBank-DEMAND上评估,仅5次函数评估。相比U-Net基线,LRA在VB-DMD上PESQ从2.88提升至3.11,DNSMOS、WVMOS等感知指标最佳;WSJ0-CHiME3上PESQ略有提升。对抗训练改善感知质量但略微降低SI-SDR。
该方法通过无跳跃连接架构与DAC潜在对齐,有效抑制噪声泄露,在保持高效推理的同时提升感知质量。
首个针对中文新闻TTS原始输入发音的自动化、可复现基准,揭示了商业系统在密集书面形式上的显著性能差距。
高阶Ambisonics (HOA) 格式(如3阶需16通道)在传输和存储时占用极高带宽(如12,288 kbps),需要高效的、低延迟的编解码器以满足AR/VR等实时通信场景。
本文评估了最新的3GPP IVAS编解码器(场景音频模式,SBA)与多单声道方法(EVSx16,即独立对每通道应用EVS)的感知质量。IVAS结合SPAR和DirAC算法,通过提取低时间分辨率空间参数并传输有限数量的传输通道(TCs),利用通道间相关性实现高效压缩。
IVAS编解码器利用HOA通道相关性在低比特率下实现高效压缩,但其性能依赖于内容类型,需要根据应用场景选择编码策略。
当前LALM(大型音频语言模型)在评估生成语音时主要关注整体自然度,忽略了副语言学细粒度特征(如语速、强调、风格等),且存在严重的校准失败(尤其在Tie情况下无法正确弃权)。
提出了PARAPairaudioBench,一个包含5,175个音频对的成对基准测试,覆盖5个副语言学维度:Style、Rate、Emphasis、Age、Gender。设计包括:(1)诊断性多维度评估,分解副语言判断为五个标准;(2)显式Tie条件,评估模型在模糊情况下的弃权能力;(3)文本控制,通过相同/不同文本条件分离词汇与声学依赖。
PARAPairaudioBench揭示了当前LALM-as-a-Judge在细粒度副语言评估上的系统缺陷,为未来模型改进提供了诊断性基准。
现有说话人日志方法(如VBx)使用高斯PLDA后端,不适用于现代长度归一化且基于角度边界的球面嵌入;EEND-VC框架的聚类阶段依赖多个启发式步骤(如过滤短片段、余弦重分配),不够简洁。
在多个标准说话人日志基准上,SphereVBx在级联和EEND-VC流水线中均提升聚类准确性,并在EEND-VC框架中取得与基线相当或更优性能,同时显著简化聚类阶段(减少启发式步骤)。
SphereVBx通过球面贝叶斯聚类为EEND-VC提供了统一、简洁且性能优异的替代方案。
该论文通过多阶段自引导框架和细粒度语义条件化,显著提升音频分离与分类的联合性能,在DCASE 2026 S5任务上大幅超越基线。
Existing plucking mechanisms lack the precision and flexibility to study sub-millimeter changes in plucking trajectory, leaving the effect of microscopic geometric variations on guitar sound largely unexplored.
This paper provides the first high‑resolution experimental data on how micrometer‑scale plucking depth variations systematically affect guitar tonal qualities, highlighting the necessity of precise mechanical repeatability in guitar testing.
历史木管乐器因年代久远、结构脆弱或保存限制而无法演奏,其声音无法被公众、研究人员和演奏者获取。博物馆中的大量乐器处于“沉默”状态,文化遗产的声学维度被忽视。
提出 Digital Revival 项目,采用非侵入式声学测量(输入阻抗、几何扫描)和物理建模,结合高分辨率采样与 EWI(电子吹管)控制器,将历史乐器声音数字化为可演奏的数字乐器。主要方法包括: - 对于可演奏乐器(如Haka长笛):在受限条件下高保真采样,结合物理建模(Respiro插件)和攻击音层,构建三层数字乐器。 - 对于不可演奏乐器(如Warder长笛):通过几何成像(CT扫描)获取管体数据,使用多模态波导理论物理建模,并基于3D打印复制品进行特征提取。 - 数字乐器通过Kontakt实现,支持EWI实时演奏,保留乐器“声音DNA”的同时创造新的音乐身份。
该工作通过声学测量、物理建模与数字控制器的系统性融合,成功“复活”了历史木管乐器的声音,为文化遗产声学保护与创造性再利用提供了可复用的方法论。
现有端到端EEG引导目标语音提取(TSE)模型在试验内(within-trial)评估中表现优异,但在跨试验(cross-trial)泛化中失败。原因是模型容易利用试验特定的EEG模式(如时间自相关、缓慢漂移)作为捷径,而非关注与注意力相关的神经信号,导致在未见过的试验中性能急剧下降。
提出TRUST-TSE,一种两阶段训练框架: 1. 阶段1:对比预训练 - 使用注意说话人负采样(attended-speaker negative sampling),即从同一说话人的其他片段中抽取负样本,迫使EEG编码器学习细粒度的EEG-语音对齐,抑制试验身份线索。 2. 阶段2:置信度加权提取 - 基于EEG-源相似度计算置信度权重,并加权SI-SDR损失,引导提取器关注与EEG嵌入对齐良好的样本。
在KUL和DTU数据集上,TRUST-TSE在严格跨试验协议下显著优于端到端基线(如NeuroHeed),展示了可靠的跨试验泛化能力。
本文系统分析了跨试验泛化瓶颈,并提出简洁有效的两阶段训练方案,为实用化脑控听觉技术提供了新思路。
Aligner-Encoder 模型中的对齐仅在编码器顶层急剧形成,导致训练过程敏感且对长语句的识别性能严重下降。
提出 InterAligner,通过在中间层(第15层)添加辅助对齐目标,使用更细粒度的 token 序列(BPE 256),并在早期层(第12层)添加中间 CTC 损失(InterCTC),使得对齐能够渐进地在深度方向上形成,从而缓解晚层对齐瓶颈。
通过渐进中间对齐目标有效提升了 Aligner-Encoder 的鲁棒性和长语句识别性能。
传统汽车音响系统在提供沉浸式音频体验时,受限于扬声器布局,难以在车内创建个人声区,且对乘客干扰较大。头枕集成扬声器虽有50年历史,但未成为标准配置,其在沉浸式音频中的潜力尚未被充分验证。
该研究通过严格的主观实验证明了头枕集成扬声器结合双耳处理可有效增强汽车沉浸式音频体验,为下一代车载音响设计提供了有力依据。
传统MVDR波束形成器对麦克风自噪声和阵列失配敏感,现有的WNG约束或对角加载方法依赖固定、手动调节的阈值,无法适应未知或时变的声学环境,导致性能次优。
提出一种数据驱动的MVDR框架,通过双分支神经网络联合估计时频噪声掩码(用于协方差矩阵估计)和频率相关的WNG阈值(用于鲁棒性控制)。将可微分的WNG约束MVDR层嵌入网络,实现端到端优化。WNG阈值不再作为固定超参数,而是通过数据学习得到。
实验表明,在语音质量和可懂度指标上,所提方法一致优于固定WNG阈值的传统MVDR方法,尤其在阵列失配条件下优势明显。
提出首个端到端学习WNG约束和噪声协方差的鲁棒MVDR框架,实现了自适应鲁棒性与指向性权衡。
现有音乐源恢复(MSR)方法在信号重建准确度与语义一致性之间存在权衡,多阶段系统(如X-LANCE)虽语义拟合好但波形重建精度低,单阶段系统(如DTT-BSR)同样面临MMSNR(多梅尔信噪比)有限的问题。
提出两阶段级联系统DTT-BSR+: 1. 第一阶段(生成式分离):采用基于GAN的DTT-BSR分离器,对退化混合信号进行语义分布拟合,输出与干净源分布一致的估计。 2. 第二阶段(波形重建):使用改进的Demucs网络(Demucs-L),去除BLSTM瓶颈以聚焦局部波形重建,并用时间域L1损失和多分辨率STFT损失联合优化,提升波形级精度。 该设计将分布拟合与信号重建解耦,避免两者冲突。
提出了一种有效的生成-回归级联框架,在音乐源恢复任务上实现了信号重建与语义一致性的较好平衡,达到领先性能。
高维自监督学习(SSL)特征(如Wav2Vec2、HuBERT、Data2Vec的1024维输出)导致计算复杂度高,训练时间长,尤其在资源受限环境中难以部署。同时,构音障碍语音因发音缓慢、不清、多变,传统ASR系统性能不佳。
提出SSL-AutoEncoder(SSL-AE)瓶颈方法,通过自编码器将高维SSL特征压缩为低维瓶颈表示(实验维度k=512,256,128,64,32,13),在保持关键语音信息的同时降低模型复杂度。自编码器采用无监督逐批训练(每批256帧,每批20轮),仅保留编码器用于特征提取,解码器用于训练。将压缩后的瓶颈特征输入Kaldi DNN-HMM ASR流水线,降低训练时间和计算成本。
在TORGO构音障碍语音数据集上评估,包含15位说话人(8位构音障碍,7位正常),按严重程度分为低、中、高三组及对照组。采用四种训练-测试配置(Sys0-Sys3)。主要结果: - MFCC基线:平均WER 55.89%。 - 零样本SSL解码:Wav2Vec2最佳平均WER 60.35%。 - 微调Wav2Vec2:平均WER 40.48%,但需约30小时训练和11 GiB GPU。 - 提出的SSL-AE方法:在保持或降低WER的同时,训练时间减少8倍(相比SSL基线),效率显著提升。
通过自编码器瓶颈压缩SSL特征,在构音障碍ASR中实现了计算复杂度和识别性能的优化平衡,为资源受限场景提供高效方案。
低资源现代标准阿拉伯语(MSA)中,数据稀缺和合成-真实语音域差距限制了发音错误检测与诊断(MDD)的性能。
提出一种两阶段端到端框架: 1. 混合架构:将大规模多语言预训练编码器(wav2vec2-XLS-R)与因果扩张时序卷积网络(TCN)结合,保留细粒度语音变化。 2. 分层两阶段训练:第一阶段在大量母语和合成数据上学习通用声学-音素映射;第二阶段在少量真实学习者语音上微调,弥合域差距。 3. 多样性感知集成推理:在多检查点之间构建混淆网络(CN),并结合修正Kneser-Ney N-gram语言模型重评分,提升预测稳定性。
在QuranMB.v2测试集上,音素级F1分数达0.7201,相对基线(0.4414)提升63.1%,在Interspeech 2026 IqraEval.2挑战中排名第一。
该框架通过两阶段训练与集成推理,在低资源阿拉伯语MDD任务上取得了SOTA性能。
现有大型音频语言模型(LALM)在跨音频比较推理方面能力不足,尤其是在情感比较任务中,无法提供可解释的决策依据。传统序数情感识别方法仅依赖标注标签,缺乏显式推理过程。
提出了推理引导的序数语音情感识别框架: 1. 结合语义音频描述(由Qwen3-Omni-Captioner生成)和GeMAPS声学特征(提取18个低层描述符的均值和标准差,离散化为定性等级),构建比较推理轨迹。 2. 采用监督微调(SFT)和直接偏好优化(DPO)进行训练,其中DPO使用正确/错误答案对应的推理轨迹构建偏好对。 3. 使用大型推理模型生成结构化推理轨迹(少于5句),确保可解释性和准确性。
通过结合语义与声学特征的推理轨迹,首次将LALM应用于可解释的情感比较推理,数据效率高且效果显著。
低资源语言自动语音识别(ASR)由于缺乏高质量转录数据,面临性能瓶颈。传统预训练-微调范式依赖大量标注语音-文本对,而收集准确转录成本高昂。
提出在自监督预训练和监督ASR微调之间引入音频-图像表示对齐阶段,利用无需转录的音频-图像对(来自Vaani数据集)进一步适应预训练音频编码器。具体包括: - 使用预训练视觉编码器(SigLIP2 Base/Large、Qwen3-VL)提取图像特征,固定视觉编码器。 - 音频编码器(FastConformer)通过对比学习(SigLIP sigmoid loss)对齐音频和图像表示,引入对齐头(MLP)和注意力池化。 - 三种配置:SigLIP(单向量余弦相似度)、SigLIP-MT(多查询注意力池化,16 tokens)、Qwen-MT(类似,但视觉侧top-k tokens)。 - 对齐后,音频编码器与混合CTC-TDT解码器联合微调于转录数据。
本文巧妙利用跨模态对齐作为转录无关的预训练增强,简单有效,为低资源ASR提供新思路。
越南语说话人识别面临数据资源匮乏,现有数据集(如Vietnam-Celeb、VoxVietnam)规模小、声学多样性不足,且大多依赖人脸信息进行身份标注,限制了数据来源(如无法包含仅音频的播客、电话录音等),增加了数据采集成本和标注质量对图像条件的敏感性。
提出一种不依赖视觉模态的数据集构建流程:1)数据收集:从YouTube手动筛选采访、娱乐、播客三类频道的播放列表,获取音频和文本元数据(标题、描述、字幕)。2)说话人分割:使用Pyannote的speaker-diarization-3.1模型进行说话人日志化,生成匿名说话人ID和时间戳。3)说话人识别:利用LLM(Gemini 2.5 Pro)结合视频元数据和逐句样本,基于结构化提示推断真实身份,输出JSON映射及证据。4)说话人合并:对同一说话人跨视频的身份进行规范化(去前缀、标准化),并采用基于ECAPA-TDNN嵌入的余弦相似度聚类(阈值0.7合并,0.2分离),辅以人工验证。5)数据清洗:去除异常段(基于IQR的余弦相似度)、短于1秒的段、总时长低于30秒的说话人,并对主导说话人(如主持人)进行下采样以平衡分布。
构建的VieSpeaker数据集包含365,874个话语、4,715个说话人,总计902.03小时,是迄今最大且最全面的越南语说话人识别数据集。实验采用ECAPA-TDNN架构,在WeSpeaker框架上训练。与仅用Vietnam-Celeb或VoxVietnam的基线相比,VieSpeaker训练的模型在评估集上表现出更好的鲁棒性和泛化能力,尤其在跨域场景下。数据集划分包含4000个说话人的训练集(VieSpeaker-T)和715个说话人的评估集(分为Easy和Hard两个协议)。
VieSpeaker通过创新的无视觉依赖管道,显著扩大了越南语说话人识别数据集规模,为低资源语言的数据构建提供了新方向。
扩散语音增强模型(如StoRM)在噪声功率失配下,SI-SDR退化曲线在训练噪声幅度处出现尖锐的非光滑过渡(“kink”),但其成因不明。
提出路径变分流分析,将输出对噪声缩放参数的敏感性分解为连续矩阵值泛函K(M)与预测器敏感性的乘积,并证明该kink定位到预测器阶段,且给出充要条件。将分析扩展到离散Euler-Maruyama采样器。
论文为假设验证设计了完整的实验程序,包括五个实证支柱和四项必需实验,但具体数值结果尚未给出(待后续报告)。现有数据支持了假设1(分数雅可比连续性)。
首次从理论上定位了扩散语音增强模型中噪声功率失配引起的kink现象,提供了精确的路径变分流分析方法。
核心痛点:传统Schroeder谐波复音(Schroeder's harmonic complex)在频带边缘存在稳态频率固定成分,易被听者察觉,干扰行为实验解释;周期调频扫描(periodic FM sweep)虽没有稳态成分,但每个周期起始处存在宽带点击成分。
方法创新:提出“渐缩Schroeder复音”(tapered Schroeder complex),通过扩展频带并在频带外施加渐缩函数(指数衰减,阶数M控制衰减斜率),同时保持频带内幅度平坦。相位仍采用Schroeder原始相位公式(式2),从而保留线性调频特性并抑制边缘效应。
实验结果:与Schroeder复音和周期FM扫描相比,渐缩Schroeder复音的频谱图无明显的水平(稳态)或垂直(点击)线条,仅有轻微边缘拖尾。听觉测试表明稳态成分和点击感被显著抑制。
一句话评价:简单有效的频谱边缘平滑方法,解决了听觉研究中长期存在的刺激伪迹问题。
传统基于ANN的语音增强模型参数量大、计算成本高,难以部署在低功耗边缘设备上。现有SNN方法性能不如ANN,且通常只建模单一频谱维度,未能充分利用幅度谱和复数谱的互补优势。
提出GSU-DBNet,一种双分支SNN架构,包含编码器-分离器-解码器。分离器中采用双路径门控脉冲单元(GSU):频率路径使用双向BiGSU捕获全局频谱相关性,时间路径使用单向GSU进行因果时序建模。解码器双分支分别估计复数掩码(通过DeepFilter进行相位感知重建)和幅度掩码,然后加权融合。使用门控脉冲单元(GSU),仅含遗忘门,参数为LSTM的一半。
在VoiceBank+DEMAND数据集上,GSU-DBNet以394K参数达到PESQ 3.04,CSIG 4.28,CBAK 3.57,COVL 3.68,SSNR 9.94。参数仅为代表性ANN模型的4.5%-10.6%,PESQ比DPSNN高0.84,比Spiking-FSN高0.38。
GSU-DBNet以极少的参数实现了与先进ANN模型相当的语音增强性能,展现了SNN在低功耗场景下的潜力。
水下声学调制识别面临分布偏移(低SNR、未见过环境、未见过通信参数、仿真到实测)时,异构信号表示(2D时频图/循环平稳图与1D高阶功率谱)的不均匀退化导致融合鲁棒性差。现有评估缺乏统一协议,不同偏移类型混在一起,难以归因;现有融合方法对称处理所有模态,无法抑制退化模态的影响。
首个系统解决水下声学调制识别中分布偏移下异构表示融合鲁棒性的工作,兼顾基准与模型创新。
传统时频分析方法(如WVD、PWVD)在处理多分量信号时面临严重的交叉项干扰,且现有深度学习方法缺乏对变换族一致性的显式约束,难以在抑制交叉项的同时保持高分辨率。此外,针对谐波结构的对数频率域统一处理框架缺乏,且存在谐波抑制、节奏表示(Tempogram、Metrogram)精度不足等问题。
论文在合成数据和真实语音/音乐上展示了改进的准确性,相比已有方法(如RIFT、CNN-based方法)在交叉项抑制、时频浓度和噪声鲁棒性上有显著提升。谐波PHAST-Net能提取干净的基频Tempogram和Metrogram,支持下游节拍追踪等任务。
PHAST-Net统一解决了时频分析中的交叉项抑制、谐波处理、可解释性重建等关键问题,是当前最先进的时频表示估计框架。
远程语音增强系统中,设备将增强后的音频流回用户时,因声学往返延迟超过10ms引发可感知的自身语音失真(echo-like artifacts),现有方法延迟高、计算开销大。
首个系统研究远场语音增强中自身语音抵消的工作,以极低延迟和轻量级模型实现了高效、实用的解决方案。
人类对话中话轮转换的高效性需要听者在几百毫秒内预测话轮结束点。以往研究关注句法和语用完成线索,但韵律线索(尤其是边界前延长)的作用尚需量化验证。本文系统研究话轮末尾单词是否比句中单词更长,以及该延长是源于韵律修饰还是词汇选择,并定位延长在单词内的分布。
本文通过多语料库大规模分析,稳健地证实了话轮末尾单词延长是跨语言、跨风格的普遍韵律现象,且该延长源于韵律修饰而非词汇选择,主要定位于单词最后音节。
传统声学标志检测依赖信号处理启发式方法,精度不足;深度学习方法在时序定位和类型识别上仍有挑战,尤其是不同标志类型(如元音 vs 爆破音)的检测难度差异大。
该工作系统性地验证了Conformer与自监督特征在声学标志检测中的潜力,高斯软标签策略有效缓解了标注时序歧义,为精细化语音事件检测提供了新思路。
核心痛点:声学地标理论的研究受限于缺乏大规模、准确标注的地标数据集。手动标注成本高、一致性差,且连续语音中的协同发音和弱化现象使得从自然语音中获取可靠标注变得困难。
方法创新:提出逆向方法——通过物理合成器生成语音并同时算法生成地标标签。使用 Pink Trombone 声道合成器,直接控制发音参数,在发音事件发生的精确时间点自动放置地标标签(如闭合、释放)。生成了包含超过 20 万个合成词的语料库,覆盖男性和女性两种配置,并附有时间对齐的标注。使用 STOI 度量可懂度。
实验结果:报告了地标频率和主导线索模式的统计结果,支持定量研究和自动地标检测器的训练/基准测试。
一句话评价:该工作构建了首个大规模、无歧义标注的声学地标数据库,为地标理论验证和自动检测系统提供了可靠基准。
现有Text-to-Speech (TTS)的强化学习(RL)研究主要集中在大型语言模型(LLM)上,而基于流匹配(Flow-Matching, FM)的TTS模型尚未充分探索。已有的RL方法(如PPO、DPO)需要训练多个辅助模型或大量人工偏好数据,成本高且不稳定。
首个将在线强化学习成功应用于流匹配TTS的工作,通过SDE转换实现无需辅助模型的直接微调,并验证了多目标奖励加权组合的有效性。
当前音频编辑领域缺乏系统性的综述,现有综述多聚焦于音频语言模型、口语语言模型或通用音频生成,对基于基础模型的音频编辑讨论不足。音频编辑任务多样,从精细的局部修改到全局变换,且对可控性、时间定位和内容保持有不同要求。
本文提出统一的任务分类法,将音频编辑分为三大类:声学编辑(响度、降噪、混响、均衡)、语义编辑(语言、表达、风格)和实例编辑(替换、删除/提取、插入、叠加)。总结了基于基础模型的两种主要范式: 1. 基于Token的编解码语言模型:将音频转换为离散token序列,通过自回归填充或选择性重生成进行编辑。代表工作包括AudioLM、VALL-E、VoiceCraft、SpeechX等。 2. 扩散与流匹配模型:在连续声学空间(如梅尔谱)中进行条件去噪或流变换,适用于高保真重建和细粒度控制。代表工作包括WaveGrad、F5TTS、AudioLDM、Stable Audio等。
此外,从训练策略上分为基于训练和免训练方法,并整理了相关资源(数据集、评估协议、数据构建工具)。
本文是首个系统综述基础模型时代音频编辑的论文,提出了统一的任务分类法并总结了主流范式,为后续研究提供了清晰的框架和资源汇总。
现有音频生成范式(离散token自回归、级联LM+生成器、非自回归流匹配)均存在局限性:离散token方法受限于信息瓶颈(尤其对多音音乐和环境声音),级联方法牺牲端到端优化,非自回归方法缺乏上下文理解和自然变长生成。此外,统一语音、声音和音乐生成时存在text–audio不对称性:语音需要局部对齐注意力,而声音和音乐需要全局扩散注意力,混合训练会降低非语音生成质量。
AudioCALM在语音、声音和音乐生成基准上均达到或超越域特定SOTA,并优于先前统一模型。
AudioCALM通过连续隐空间自回归流匹配和不对称模态专家设计,首次在同一模型中实现了高质量、端到端、可变长度的统一语音、声音和音乐生成。
论文揭示了音频VAE中存在的Rate-Distortion-Regularity Trilemma(率-失真-正则化三难问题):标准各向同性高斯先验假设所有潜在通道具有同等容量,与音频信号的频谱层次(低频结构可压缩,高频纹理随机不可压缩)不匹配,导致无序信息打包(Disordered Information Packing),即关键语义与高频噪声随机交织,损害重建保真度和潜在空间规整性。
STAR-VAE在多种音频域(声音、音乐)上达到最先进的重建保真度,显著优于基线(如标准VAEs、CNN-based VAEs);结构化潜在空间同时改进了传统扩散模型和STAR-Gen的生成性能,在文本到音频生成任务中取得SOTA。消融实验证实STAR诱导层次化信息组织、防止重建漂移。
本文通过拓扑感知正则化巧妙化解音频VAE的容量-保真度-规整性矛盾,为高质量音频生成提供了简洁有效的通用解决方案。
ASR模型(尤其是Whisper large v3)会产生流畅但无语音基础的幻觉转录,传统指标(如WER)无法有效区分幻觉与其他错误,且多依赖参考文本,限制了实际部署。缺乏真实语音的人类注释数据进一步阻碍了检测方法验证。
本文系统对比了三种ASR幻觉检测范式,发现内部解码器状态探针结合后期融合是当前最有效的无参考检测方案,为实际部署提供了方向。
大型语音语言模型(SLMs)参数庞大、推理延迟高,且存在模态偏差,即模型过度依赖语言先验而忽视声学特征。对比解码(CD)虽能缓解此问题,但需双路径逐token生成,推理延迟翻倍,训练开销巨大。
提出对比音频感知蒸馏(CAAD),两阶段框架: 1. 阶段1:Pseudo-GT生成——利用DeSTA框架从音频元数据(如性别、情感、声学环境)生成伪真值序列作为统一锚点。 2. 阶段2:对比音频感知蒸馏——同步教师强制策略同时计算正路径(音频+文本)和负路径(仅文本)的logits,通过外推得到音频感知目标,让学生模型通过KL散度和交叉熵损失学习。
关键创新:同步教师强制策略实现全序列并行化,避免逐token生成的计算开销。
CAAD通过同步教师强制策略将对比解码的推理开销转移到训练中,高效蒸馏出音频感知能力,实现低延迟且抗偏差的语音语言模型。
当前ASR系统的幻觉检测方法多基于非语音或人工损坏音频,缺乏对自然语音中真实幻觉的研究和标准化基准。
HALAS是首个针对真实语音ASR幻觉的人工标注数据集,揭示了现有检测方法的不足,为幻觉缓解研究提供了可靠基准。
本文针对DCASE 2026 Challenge Task 7的域增量音频分类问题,提出了一种基于域特定专家和原型分类器的系统。核心痛点在于模型在增量阶段无法同时访问过去和未来的域数据,易发生灾难性遗忘。方法创新包括:1) 使用多个冻结的域特定专家,每个专家在各自域训练后固定,避免参数干扰;2) 采用DeepInversion生成合成数据回放,保留过去域知识;3) 基于原型学习的余弦原型分类器,将各专家高层特征拼接后归一化,通过可学习温度缩放进行软分类;4) 针对特征缺失问题,训练跨阶段回归插补器,利用完整数据预测缺失特征。实验结果表明,提交的四个系统在开发集上达到78.38%微平均和78.92%宏平均准确率,远超官方基线。一句话评价:该方法通过冻结专家和原型分类器有效缓解灾难性遗忘,在域增量学习任务上取得显著提升。
现有注意力图评估方法(如RISE-eval)存在两个问题:1) 某些条件下不同注意力图的评估结果难以区分;2) 评估过程受与注意力图质量无关的因素干扰。
提出Modified RISE-eval算法,针对上述缺点进行改进,通过优化输入采样和评估机制,使评估结果更可靠。
在说话人识别任务中,使用GradCAM和LayerCAM生成注意力图,并用Modified RISE-eval进行评估。结果表明:GradCAM在利用最深网络层激活图时更好,LayerCAM在利用较浅层激活图时更好。
本文系统梳理注意力图评估方法,提出改进算法,为XAI在说话人识别中的应用提供了有效工具。
现有的语音理解基准主要聚焦于单说话人场景或孤立子任务,缺乏对真实多说话人对话中说话者中心理解能力的系统性评估。
MSU-Bench填补了多说话者对话理解基准的空白,揭示了现有模型在说话者定位与推理上的关键瓶颈。
现有扩散模型用于语音增强时缺乏语言指导,导致泛化能力不足,尤其在未知噪声环境下性能下降。
提出一种基于wav2vec 2.0特征的条件扩散模型:使用预训练的wav2vec 2.0从带噪语音中提取语音特征,通过特征线性调制(FiLM)注入U-Net瓶颈层。为压缩时间序列,推导出基于线性高斯状态空间模型的指数平滑(EMA)作为最优因果聚集策略,以单个缩放-平移对调节瓶颈。FiLM生成网络仅有少量可训练参数,保持轻量。
在VoiceBank-DEMAND和LibriMix数据集上评估,与StoRM基线相比: - PESQ提升约0.4(例如OURS-128达到2.8742 vs StoRM-128的2.4862) - STOI和DNSMOS(SIG, BAK, OVRL)均有提升 - SI-SDR略有下降(例如17.9844 vs 18.5656),但整体性价比高 - 消融实验显示平滑系数α=1.0最优,且瓶颈处FiLM效果最好 - 推理速度方面,32通道模型可实时处理(RTF=0.55)
该工作通过将自监督特征作为条件信号有效引导扩散语音增强,在感知质量上显著超越现有方法,且计算开销小。
传统自适应房间均衡方法(如Fx-LMS)在处理时变声学条件和复杂激励信号(如音乐)时表现不佳,因其刚性公式难以适应动态变化。
提出一种基于可微数字信号处理(DDSP)的模块化框架,用于闭环自适应房间均衡。该框架支持可互换的均衡器结构、响应估计方法、损失函数和优化器,并通过自动微分将经典Fx-LMS作为特例包含在内。实验采用时变测量的房间冲激响应,对比了时域和频域损失函数,并分析了在线房间响应估计精度和帧长度对性能的影响。
相对于非均衡响应,系统距离降低70%,在最差情况下mel谱距离降低13%。频域目标函数比时域更稳定。框架提供了开源PyTorch实现。
该工作通过模块化DDSP框架统一了传统自适应滤波与可微信号处理,为探索自适应房间均衡新方法提供了基础。
当前语音语言模型(SLM)在语义和知识能力上存在不足,而引入文本数据和预训练文本语言模型(如交错语音-文本训练)虽能提升性能,但其内部机制尚不明确。
本文使用logit lens方法分析交错SLM的中间层表示,发现模型在未专门训练语音识别的情况下,会隐式地将语音表示转录为对应文本(隐式转录),并在文本空间中进行后续推理,最后再映射回语音空间。通过最大池化聚合语音token位置的logits,追踪模态偏好和转录准确性。
首次揭示了交错语音-文本LM在内部隐式地将语音转写为文本并进行推理的机制,为优化SLM提供了新的理解视角。
现有的端到端IVD方法(如AVIVDNet、HAVT-IVD)依赖于全帧、片段级别的融合,容易过拟合场景背景和全帧上下文,产生不稳定的时间决策,缺乏明确的先验来对齐车辆与麦克风,导致在域漂移下脆弱且数据效率低。
提出TAVR-IVD框架,基于多目标跟踪的音频-视觉推理: - 实例锚定:通过目标检测和跟踪构建车辆轨迹(tracklet),将问题从全帧分类转为每条轨迹的跨模态推理。 - 几何条件绑定(MASP):利用车辆几何信息(轨迹位置、位移)作为空间先验,从全局混合多声道音频中归因到具体车辆。 - 轨迹条件分类器:沿轨迹聚合多模态证据,产生稳定的逐车状态预测。 - JACE模块:通过监督对比学习构建状态结构化的跨模态潜在空间,减少捷径学习,增强域鲁棒性。 - 新数据集:构建AVIVD-LT(同地不同天)和AVIVD-M(不同站点)评估集,测试跨天和跨站点泛化。
在AVIVD验证集及新构建的测试集上取得SOTA,证明高精度和更好的域迁移鲁棒性。
通过轨迹级音频-视觉推理,显著提升路边车辆怠速检测的准确性和跨域泛化能力。
音频问答任务中,许多问题仅凭文本先验即可正确回答,导致模型不依赖音频证据,而任务要求模型必须基于音频内容作答。初步实验发现,即使移除音频,强开放音频语言模型仍能回答大部分样本,这削弱了音频推理的必要性。
提出基于模型困惑模式的数据筛选策略(Audio-Dependency-Aware Data Curation)。在微调前,对Qwen3-Omni模型进行三种输入条件的诊断推理:正常音频-问题对、空音频、打乱音频。根据模型在不同条件下的正确性(N, E, S)将训练样本分为多个桶(如强音频依赖、文本先验、打乱泄露等)。微调时仅使用强音频依赖样本(N=1, E=0, S=0),并添加少量空音频负样本(目标为“无法从音频确定”),同时使用文本-only响应归一化器处理解析失败的生成。此外,通过冻结音频塔和多模态投影器、使用LoRA低秩适配进行高效微调。
通过数据筛选聚焦音频依赖样本,有效提升模型音频问答性能,是一种简洁且高效的数据质量优化范式。
构音障碍语音严重程度分类面临说话人变异性、类别不平衡和数据集有限等挑战,现有模型在不同语料库间的通用性差。
提出DSSCNet框架,结合卷积神经网络(CNN)、Squeeze-and-Excitation网络(SENet)和残差网络(ResNet),通过跨语料库预训练和微调策略提升说话人无关(SI)分类性能。在TORGO和UA-Speech数据集上进行跨库迁移实验(UA-Speech→TORGO和TORGO→UA-Speech)。
DSSCNet通过知识迁移有效提升跨语料库构音障碍严重程度分类的鲁棒性和泛化能力。
儿童语音因生理和认知发展导致的音高波动、共振峰变化、发音模式差异等,使得年龄和性别分类极具挑战。现有方法多针对成人语音,且缺乏对自监督模型各层编码能力的系统分析。
该研究系统揭示了SSL模型在儿童语音年龄与性别分类中层间信息分布规律,证明了无需微调即可利用早期层特征取得良好效果,为低资源儿童语音应用提供了实用指导。
现有 Mandarin MDD 方法主要关注音素级检测精度,但未能显式分离音段与声调错误,导致诊断反馈有限,缺乏对发音错误成因的细粒度解释。
提出基于音韵特征的 MDD 框架,在统一的 Wav2Vec2-CTC 架构中联合建模音段属性(如发音方式、部位)和声调属性(分类标签或音高目标描述符)。通过将音素分解为低层音韵成分,实现更详细、可解释的诊断反馈。
相比仅用音素的基线系统,所提方法在 LATIC 非母语语料库上将误接受率(FAR)降低 10.1%,诊断错误率(DER)降低 23.6%。跨语料库泛化测试(AISHELL-1)中,属性识别错误率(AER)降低超 40%(IPA-D vs IPA-S)。
首个系统性联合建模音段与声调属性的 Mandarin MDD 框架,有效提升了诊断细粒度和准确性。
日语G2P转换面临独特挑战:无词边界、汉字多音、数词不规则发音等。传统规则系统(如OpenJTalk、MeCab)依赖词典,对未登录词和特殊读法处理有限。
首个大规模日语G2P基准,证明LLM结合规则后处理可显著超越传统方法。
当前的强多语言ASR模型(如Whisper)在微调合成代码切换(CSW)数据时,会显著退化单语言性能(例如,标准LoRA微调导致德语WER相对增加418%)。因此,如何在不损害已有能力的前提下提升代码切换鲁棒性是一个重要挑战。
提出贝叶斯因子化适应(Bayesian Low-Rank Adaptation, BLoRA),通过引入贝叶斯先验,学习稀疏且含不确定性的适配矩阵,使模型仅修改与切换相关的少量权重,从而在不覆盖原始知识的前提下有效集成新知识。该方法仅需少量合成数据(LLM生成代码切换文本 + TTS拼接语音),无需真实代码切换语音。
提出一种无需真实代码切换数据、可扩展的强模型适应方法,通过贝叶斯稀疏适配有效平衡代码切换能力与单语言性能。
现有全双工口语对话系统(如Moshi)仅处理音频模态,缺乏面部表情、唇动、头部运动等非语言线索,无法模拟真实人类对话的多模态同步性。
Moshi-Face是首个实现全双工多模态口语对话的模型,成功将实时面部生成集成到对话系统中,在低延迟下实现音视频对齐。
现有的神经语音编解码器在低比特率下难以同时实现高质量重建和有效的特征解耦(语义、说话人、韵律),且常依赖多层级残差量化导致高帧率,或解耦不彻底导致特征混淆。
在LibriSpeech test-clean上,AugCodec在重建质量(如PESQ、STOI)和语义保持(WER)方面显著优于FACodec、FreeCodec等基线,同时以12.5Hz的超低帧率运行,展示了优良的解耦能力与压缩效率。
AugCodec通过精巧的数据增强实现了高效的低比特率解耦语音编解码,为语音压缩与下游任务提供了紧凑且分离的表征。
传统神经语音编解码器(如EnCodec、SoundStream)学习整体表示,将语言内容、说话人身份和韵律交织在一起。虽然对零样本语音克隆有效,但在需要精确控制或保留韵律的任务(如语音转换)中,这种缠结使得难以在不改变内容或音色的情况下操控韵律。
ProsoCodec提出将韵律建模为条件残差,而非解耦的独立流: - 显式文本和说话人先验:利用预训练ASR提取文本转录,利用预训练SV提取说话人嵌入,作为前缀令牌同时注入编码器和解码器。 - 离散瓶颈:通过二进制球面量化(BSQ)形成严格的信息瓶颈,迫使离散令牌只捕获未被内容和说话人解释的韵律变化(如语调、节奏)。 - 低频mel带约束:编码器仅输入低频mel谱(0-4kHz),因为韵律线索主要存在于低频区域。 - 双话语训练策略:训练时使用同一说话人的两段不同话语分别作为源和参考,避免推理时参考话语的韵律泄漏到输出中。 - 扩散解码器:基于DiT的流匹配模型,以参考mel谱和源令牌为条件重构高质量mel谱。
ProsoCodec通过将韵律视为条件残差,结合显式先验和精心设计的训练策略,在语音转换中实现了出色的韵律保留和音色迁移,无需复杂的对抗解耦。
在发动机生产线热测试中,背景噪声严重干扰声音分析,导致传统人工检测和现有AI系统诊断准确率下降,易遗漏故障并引发客户投诉。
提出RAB-U-Net(Residual Attention Block U-Net),在标准U-Net中集成残差块和注意力机制,以改进特征提取、缓解梯度消失、聚焦重要声学区域,从而有效去除发动机声音中的环境噪声。
在真实工厂环境数据集上,RAB-U-Net相比传统滤波、小波去噪及标准U-Net等方法,显著降低噪声残留,提升故障检测准确率,具备实时应用潜力。
一项针对工业噪声环境的创新深度学习降噪方案,通过残差注意力增强U-Net,有效提升发动机热测试诊断可靠性。
现有语音研究框架(如ESPnet2)在处理大规模数据集(百万小时级)和复杂模型时存在工程负担重、实验逻辑与核心组件耦合紧密、数据集集成和迭代效率低等问题。例如,在ESPnet2中为Whisper添加LoRA支持需要修改超过20个文件和670行代码。
ESPnet3通过模块化架构和配置驱动的数据管理,显著降低了大规模语音研究和实验的工程复杂性,提升了可扩展性和开发效率。
现有 CodecFake(CF)检测器主要针对年轻成人语音,对老年人语音(具有独特声学特征如气息声增加、音高稳定性下降等)泛化能力极差,且缺乏专门的数据集和方法。
首个针对老年人语音 CodecFake 检测的基准工作,通过多模态 FM 融合有效解决年龄域偏移问题。
心音(Phonocardiogram, PCG)作为一种有前景的生物特征模态,具有独特性和内在活性,传统上难以伪造。然而,随着神经音频编解码器(Neural Audio Codec, NAC)合成技术的快速发展,攻击者可以生成感知上无法区分的伪造心音,对心音生物识别系统构成严重威胁。现有研究缺乏针对这一新型伪造攻击的系统检测方法。
实验表明,GROOT将MFCC与WavLM融合后取得了最先进性能,优于单一特征表示及其他竞争基线,验证了谱-SSL融合的有效性。封闭身份识别实验进一步确认了NAC合成心音保留患者身份信息,凸显了检测的紧迫性。
本文首次系统研究心音伪造检测,提出基准数据集与创新融合框架,为心音生物识别安全提供了重要基础。
传统发动机声音合成(如Engine Order Enhancement)在逼真度和可调性之间存在权衡,且难以同时建模谐波和噪声成分。现有神经音频合成方法虽然逼真度高,但难以集成到现有嵌入式EOE框架中。
提出EONE模型,通过端到端可微的分析-合成方法学习发动机声音的紧凑参数表示。核心创新包括: 1. 因子化RPM-扭矩增益曲线:将每个谐波和噪声带的幅度分解为RPM和扭矩的独立一维函数(乘法组合),减少参数并保持可调性。 2. 可微合成路径:将参数优化转化为梯度下降问题,避免传统DSP分析的歧义。 3. 预训练-微调策略:先在大规模发动机录音上预训练Timbre Encoder-Decoder学习隐空间,再在目标录音上微调增益曲线,实现鲁棒泛化。 4. 与现有EOE框架兼容:学习的参数可直接映射到传统DSP实现,部署于嵌入式系统(如EVx Suite)。
频谱指标(如MRSTFT)和听力测试表明,尽管压缩为紧凑参数表示(40个点/曲线),重建保真度仍足够高。在EVx Suite上的集成验证了技术可行性。
一种兼顾逼真度、可调性和嵌入式部署可行性的发动机声音参数化学习框架。
DisSpeech通过离散token表示与非自回归生成策略,在低资源条件下实现了高质量、可控的普通话口吃语音合成,并有效提升了ASR系统的鲁棒性。
任务型语音助手需要将用户语音映射到结构化输出(如语义框架、函数调用)。传统ASR-LLM级联方法受限于ASR转录错误,尤其在噪声环境下会传播至下游任务。而口语语言模型(SLM)可直接处理语音,但其适应新任务通常需要配对的语音-目标标注数据,收集成本高昂。
CORTIS提出一种纯文本适应框架:仅使用文本形式的任务监督数据(指令-结构化输出对)微调SLM中的LLM组件,同时冻结语音编码器和模态适配器。通过保持训练时文本查询与推理时语音查询在提示模板中的位置一致,利用SLM预训练的语音-文本对齐能力,使模型在推理时直接从语音生成结构化输出。方法无需任务特定的语音-目标配对数据。
基于Qwen2.5-Omni骨干,在FSC、SLURP及内部产品数据集上评估。与使用相同文本监督训练的ASR-LLM级联相比,CORTIS在干净语音下表现相当,在噪声(babble噪声)条件下尤其在高层任务语义保持上优势更明显。表明纯文本微调SLM是一种实用的语音助手适应策略。
CORTIS通过纯文本监督微调SLM,有效避免了ASR级联的误差传播,且无需昂贵的语音标注,在噪声环境下展示了更好的语义鲁棒性。
现有印地语自动语音识别(ASR)基准数据集在地理多样性、人口统计代表性及转录鲁棒性方面存在明显不足:大多仅覆盖少量地区,缺乏对方言和口音差异的充分覆盖;每个音频片段仅提供单一参考转录,忽略了同一语音内容可能存在多种有效转录的主观性;对代码切换(code-switching)和噪声场景的标注不足;此外,缺乏多模态(图像+语音)的基准数据,难以评估多模态ASR模型。
本文提出 Vaani Benchmark V1.0,一个面向印地语的包容性多模态基准数据集。 - 数据来源:从Vaani项目中采集自发语音,通过让说话者描述图像(共8,315张图像)来诱导自然口语。 - 地理覆盖:覆盖印度22个邦/中央直辖区、104个地区,共3,252位说话者,总时长20.64小时。 - 多参考转录:每个音频片段由三位独立转录者生成三份参考转录,支持多参考WER计算,更公平地评估ASR系统。 - 丰富元数据:包括说话者ID、已知语言、居住地邮政编码、邦信息、性别等;明确标注代码切换内容(同时提供本地文字和原文字转录)及非语音事件/噪声。 - 质量控制:经过多轮人工与自动化检查,确保转录准确性;转录者来自同一地区以保证方言熟悉度。 - 公开/闭集分割:每个地区50%数据公开,其余作为闭集用于排行榜,防止过拟合。
基准测试了多个开源和闭源ASR模型,采用三种WER计算方式:Approach 1(单参考)、Approach 2(最优参考选择)、Approach 3(多参考对齐联合计算)。核心结果如下: - Vaani Fast Conformer(开源)表现最佳,Approach 3下WER为10.6%,各方法平均WER 15.2%。 - Gemini-3.1-Pro(闭源)紧随其后,Approach 3 WER 11.9%。 - Sarvam Saaras v3、Indic-conformer-600m-multilingual 等模型也进行了对比。 - 区域性分析显示WER随地区变化显著(标准差约4-5%),验证了地理多样性的重要性。 - 多参考方法(Approach 3)显著降低了WER,说明传统单参考可能高估错误率。
Vaani Benchmark通过大规模多参考转录、全面地理覆盖和多模态设计,为印地语ASR系统提供了更包容、更公平且贴近实际的评估基准,填补了现有数据集的关键空白。
商业语音AI平台(如ElevenLabs)提供的性化合成声音可能强化性别刻板印象和权力不对称,尤其是女性声音常被性化和顺从化,男性声音则被赋予支配和积极特质。
该研究首次系统性地揭示了商业语音AI中合成声音的性别偏见,通过实验证明性化声音不仅反映社会刻板印象,还通过声学特征主动编码和放大性别权力不对称。
现有语音重建评估依赖Mean Opinion Score (MOS)评估自然度和说话人相似性,但MOS存在灵敏度低、可靠性差、饱和等问题,无法很好地适配语音重建任务(即提高可懂度的同时保留说话人身份)。
提出包含主观和客观两部分的新评估框架: - 主观评估:使用Best Worst Scaling (BWS)而非MOS,通过情境化任务(INTELLIGIBILITY和RECONSTRUCTION)让听者分别评估可懂度和说话人身份保留。 - 客观评估:发现标准指标(WER、余弦相似度等)对严重不清晰说话人预测效果差,提出基于TTSDS2的双参考分布度量,同时衡量合成语音与高可懂度语音(可懂度)和原始不清晰语音(说话人身份)的距离。
在193个说话人(四种言语障碍)、17个零样本TTS系统上进行评估。主观BWS结果显示: - 可懂度:StyleTTS2最高,Fish Speech次之,大多数系统优于原始录音。 - 重建质量:IndexTTS2最高,Qwen3-TTS和E2-TTS次之。 框架验证了可靠性和任务对齐性。
该论文提出了一个针对语音重建任务的专用评估框架,克服了MOS的不足,主观和客观方法均与任务场景高度对齐。
可微音频处理器通常在机器学习框架中设计和优化,但部署为实时音频效果仍需手动用专用DSP语言重写,过程易错、耗时,且将研究原型与生产工具分离。
提出ADAC(自动可微音频编译器),其流程为:遍历训练模型的计算图 -> 提取参数 -> 降级为与框架无关的JSON中间表示 -> 生成等价的FAUST代码。支持拓扑:串联、并联、递归。关键特性包括: - 可听训练:每个梯度步后替换运行插件中的模型,使优化过程可听。 - 宏控制:提供混响时间、干湿比、预延迟等参数,且保持稳定性。 - 稳定性证书:根据小增益定理分析循环稳定性,在构建插件前验证导出的参数。 - 部署管道:单次调用完成代码生成、认证、JUCE项目生成、编译和安装。
ADAC弥合了可微音频模型与实时DSP部署之间的鸿沟,通过编译器自动生成高效、稳定、可微调的FAUST代码,并支持可听训练和端到端部署。
首个对10种NVV类型进行系统评估的研究,提出的条件蒸馏与MoE方法有效兼顾了NVV和语音验证性能的提升。
现有说话人解耦编解码器面临权衡:显式抑制说话人泄漏的方法(如梯度反转、扰动)训练复杂且不稳定,而简单设计(如BiCodec)可能导致局部token中残留说话人信息。同时,低比特率编解码器多依赖文本对齐、可变帧率或生成式解码器,引入额外假设或牺牲重建保真度。
SDP-Codec提出一种单阶段训练的说话人解耦、音高注入编解码器: 1. 局部流:使用vq-wav2vec的连续预量化特征(而非离散单元),通过小码本(300或1536条目)强制瓶颈以去除说话人信息; 2. 音高注入:提取归一化F0,通过音高编码器-解码器(含全局条件去归一化)注入局部流,并采用软标签音高重建损失(360 bin cent直方图与高斯模糊目标)提供平滑梯度; 3. 全局流:基于WavLM特征通过感知器重采样器生成固定长度说话人嵌入,通过位置无关交叉注意力和自适应蛇形激活抑制局部信息; 4. 训练目标:多尺度mel L1损失、承诺损失、LSGAN对抗损失+特征匹配损失、软标签音高重建损失。
SDP-Codec通过单阶段流水线结合音高注入与紧凑码本,在极低比特率下实现高质量重建和强零样本语音转换,同时有效减少说话人泄漏。
语音处理中自回归解码策略缺乏统一的形式化框架,导致策略选择、比较和评估困难。现有定义隐式且多样,存在不一致性;搜索策略常被视为实现细节,缺少系统分类和基准测试。
提出一种广义的自回归解码形式化框架,将AR策略视为由四个模块化步骤(估计、决策、先验更新、终止测试)组成的迭代过程。该框架基于SIPC(随机整数概率约束问题)形式化,明确定义AR预测器的包含标准,并支持确定性/随机策略的统一描述。
论文未提供具体实验,但展示了框架在消融研究中的潜力,能够隔离每个步骤的贡献。
该工作为理解、比较和设计语音处理中的AR解码策略提供了首个系统化形式化工具。
MindAlign提供了一种可扩展、模块化的脑到文本解码方案,首次实现有限数据下从fMRI解码内心言语的自由生成。
传统电磁驱动弦乐器多采用闭环反馈或确定性激励(如正弦波),导致音色稳定但频谱稀疏,缺乏复杂性和变化性。
本文提出一种开环随机激励范式:使用白噪声信号直接驱动电磁线圈,无反馈、无相位锁定、无音高控制。通过定制电磁线圈(8Ω直流电阻、~255匝、钕磁铁增强),实现宽带随机磁场激发琴弦振动。同时,通过优化线圈磁场聚焦和空间布局,降低电磁串扰。
频谱对比显示:传统拨弦产生清晰基频和离散谐波;随机激励产生密集、均匀分布的谱峰,能量更平坦,音色更复杂丰富。
成功将量子谐振子与经典随机振子的相空间类比转化为可听的声学现象,为量子启发乐器设计提供了新颖的物理实现平台。
当前生物特征验证领域普遍使用ROC-AUC、EER或验证准确率作为全局指标,但ISO/IEC 19795-1标准推荐在特定操作点(如低FMR)报告性能。全ROC-AUC在[0,1]的FMR范围内等权平均,而实际部署仅关注低FMR区间(如10^-3),导致全局指标可能掩盖低FMR性能甚至颠倒系统排名。
论文重新审视ISO/IEC 19795-1标准,强调以DET曲线和固定FMR下的FNMR为主要报告指标,辅以部分AUC、log-FMR AUC、最小检测成本等,并建议使用bootstrap置信区间和配对检验来量化不确定性。实验覆盖人脸、语音、虹膜和指纹四种模态,涉及七个预训练匹配器,验证了全ROC-AUC与操作点性能的差异。
以人脸为例,FaceNet获得更高的全ROC-AUC,而ArcFace在FMR=10^-3下获得更高的TMR,且差距显著(置信区间不重叠)。这表明根据全ROC-AUC和操作点性能会得到不同的系统排名。其他模态也有类似现象。
该论文有力地论证了生物特征验证中应弃用全ROC-AUC作为主要指标,转向操作点导向的标准化报告,并提供了实证和检查清单。
现有的指令可控语音合成方法通常依赖粗粒度的情感标签,缺乏对细粒度情感强度(如低、中、高)的显式建模,导致情感控制不稳定,且语言指令难以捕获详细的声学情感关联。
提出EmoInstruct-TTS,一种双路径指令引导框架,结合自然语言语义指导与结构化情感嵌入实现细粒度情感调制。具体包括: - Emotion2embed:一种监督式语义-声学情感嵌入,覆盖48种情感状态(27个细粒度类别+7种基本情绪×3个强度等级共21个情绪-强度组合),通过多任务学习(分类+排序)保持强度顺序结构。 - ICE-Flow:指令条件情感流模型,将自由形式的自然语言指令映射到声学基础的情感嵌入,采用样本级监督和分布级正则化防止模式塌陷。 - 双路径合成:将LLM语义规划(路径1)与显式情感嵌入控制(路径2)分离,通过LLM生成语义token,结合情感嵌入和说话人嵌入,由CFM TTS和BigVGAN生成波形。
EmoInstruct-TTS通过双路径结构将语义规划与细粒度情感控制分离,有效提升了指令驱动情感语音合成的可控性和自然度。
声学-发音反转(AAI)在领域偏移(如说话人属性变化、跨语言条件)下性能显著下降,现有资源多为英语且说话人多样性有限,缺乏系统性的跨语言和跨性别评估基准。
该工作通过构建双语EMA语料库和标准化评估协议,首次系统隔离了性别和语言两种域偏移因素,为跨语言AAI研究提供了重要基准和洞见。
传统分类器引导(CG)需要分别训练分类器和扩散模型,导致参数量和计算成本高。联合能量模型(JEM)虽能统一两者,但面临训练不稳定和归一化常数难处理的问题。
提出Score Subnet框架,冻结预训练的噪声条件化语音分类器,在其中间表示上附加轻量级解码器子网络,仅训练子网络(DSM目标)。子网络融合分类器的前向特征图(forward taps)和通过JEM边际似然反向传播得到的梯度特征图(gradient taps),实现参数高效的扩散生成。支持无条件采样和标准分类器引导的条件采样。
在SC09基准上,与标准U-Net扩散和开源模型相比,Score Subnet在极大减少可训练参数和计算量的同时(总参数量约U-Net的1/2,GMACs约1/3),在FID、FAD、MOS等指标上达到相当或更优的性能。在低数据(3%训练数据)、零样本等消融实验中,性能优于或接近U-Net+CG。
本文巧妙地将预训练语音分类器转化为扩散生成骨干,通过轻量适配子网实现单模型、低成本的语音生成,为判别式与生成式模型的融合提供了新思路。
现有口吃分类数据集多为片段级标签,缺乏帧级标注,难以用于细粒度口吃事件时长评估。大部分方法仅能进行片段级分类,而临床评估(如SSI-4)需要帧级时长信息。
提出基于注意力多实例学习(MIL)的神经网络架构,包括实例型(max-pooling)和嵌入型(attention pooling)两种模型。利用预训练语音编码器(wav2vec 2.0、WavLM、Whisper)提取特征,通过LSTM平滑帧级输出,再经投影层和MIL池化实现片段级和帧级分类。嵌入型方法首次将注意力MIL应用于口吃分类,无需帧级预训练即可零样本实现帧级分割。
在SEP-28k-E数据集上,帧级F1分数提升23%,片段级F1提升2%-9%。在FluencyBank数据集上达到SOTA。
本文通过多实例学习有效利用片段级标签实现帧级口吃分割,显著提升帧级分类性能。
RTFree-F5通过自监督语音条件替代参考转录,显著提升非标准语音的零样本TTS性能,无需外部ASR依赖。
传统平均意见得分(MOS)预测模型通常预测语句级别的自然度得分,对日语中局部的音高重音错误不敏感,无法正确反映重音正确性。
提出PASQA(Pitch-Accent-focused Speech Quality Assessment),显式针对音高重音正确性进行建模。主要创新包括: 1. 使用可控文本转语音(TTS)系统构建带重音错误的日语数据集,通过修改重音位置生成不同严重程度的样本,并基于错误率计算伪重音质量分数。 2. 基于自监督表示(wav2vec 2.0)提取声学特征,并采用以下四种策略增强模型: - Mora条件融合:利用文本得到的mora序列作为辅助语言信息,通过交叉注意力与声学特征融合。 - 排序损失:采用Bradley-Terry模型的对数排序损失,强调样本间重音质量的相对排序。 - 辅助帧级错误定位任务:增加帧级二分类头,预测每个帧是否属于重音错误短语。 - 说话人不变训练:通过梯度反转层(GRL)使模型学习说话人不变的表征,减少说话人差异的干扰。
在内部构建的重音错误数据集上(训练集2,130,858样本,测试集包含13个见过说话人和4个未见说话人),PASQA在排序准确性上显著优于传统MOS模型,对见过和未见说话人均表现良好。与人类判断的一致性更高:Spearman秩相关系数(SRCC)达0.828,Kendall tau(KTAU)达0.614。此外,PASQA在域外TTS模型上也展示了鲁棒性。
PASQA通过显式建模重音错误,在日语音高重音正确性评估上实现了比传统MOS模型更高的排序准确性和与人类判断的一致性。
现有用户自定义关键词唤醒(UD-KWS)系统学习说话人不变的表征,无法拒绝说出正确关键词的冒名顶替者(如旁观者或音频回放),导致误激活。同时,传统文本相关说话人验证(TD-SV)方法需要针对每个关键词重新训练,破坏了UD-KWS的零样本灵活性。
提出ZP-KWS框架,通过双分支结构解决双零样本问题(未见关键词和未见说话人): 1. GE2E预训练的紧凑说话人编码器(EfficientTDNN-Small,约0.9M参数),在亚秒级语句上稳定嵌入,相对EER降低62%。 2. 音素监督的音频编码器:通过帧级音素对齐损失(L_align)增强音素辨别能力,对难最小对样本提升区分度。 3. 乘法后期融合:推理阶段将语义概率和声纹概率相乘,实现严格AND条件,无需重新训练即可在常规(C-KWS)、目标偏置(TB-KWS)和目标唯一(TO-KWS)模式间切换。
在LibriPhrase、Google Speech Commands和Qualcomm数据集上,ZP-KWS在TO-KWS模式下将FRR@1% FAR相对降低最多60%(与最强基线相比),同时保持有竞争力的关键词检测性能。模型总参数量仅1.55M,适合边缘部署。
ZP-KWS以极低参数代价实现了亚秒级文本无关说话人验证与零样本关键词唤醒的联合建模,有效防御冒名顶替者。
现有生成式语音增强方法(如BBED、FlowSE)依赖显式时间步嵌入(time-step embeddings)来调节矢量场,导致模型对轨迹过拟合(trajectory overfitting),推理时数值偏差易使状态偏离预期分布,且计算成本高(NFE高)。
u = n + σz,与时间步 t 无关。因此显式条件化是冗余的。ARF 通过消除时间条件化,实现了高效、鲁棒的生成式语音增强,在推理效率与重建质量之间取得了优越平衡。
音乐音色缺乏专用词汇,依赖跨模态隐喻,现有研究多集中于英语、希腊语、德语、法语、捷克语等,但公开的原始数据稀缺,限制了跨文化模型与多语言MIR系统的发展。
PolSeT是首个系统性的波兰语音色语义数据集,填补了开放音色研究数据的空白,可支持跨文化比较与多语言语义嵌入模型训练。
自监督语音特征(如WavLM)同时编码了内容和说话人信息,现有SVD分解方法虽然能分离出共享内容矩阵和说话人变换矩阵,但各维度的语义含义不明确,限制了可控语音处理。
本文对WavLM特征进行内容-说话人因子化分解,并首次系统分析子空间维度与语音特征(基频、强度、共振峰、性别等)的关联。对于内容子空间,直接按奇异值排序的维度与帧级特征进行相关性分析;对于说话人子空间,将说话人矩阵展平后应用PCA得到主成分,再与说话人级平均特征作相关性分析。此外,通过干预实验(修改特定维度值并重构语音)验证维度的可控制性。
本文首次揭示了SSL分解子空间维度的语音学语义,并提供了一种无需训练的细粒度语音控制方法。
当前的MOS预测模型在作为TTS质量的代理指标时,主要关注声学保真度,但对韵律自然度、口音准确性等细微质量维度的敏感性不足。模型预测分数与人类感知之间存在系统性差异,尤其在韵律错误和说话人特征方面。
本文通过三种受控扰动(声学退化、韵律错误、说话人特征变化)系统地比较了人类MOS评分与模型预测分数。设计了三个实验组: - Group A:自然语音加噪声、剪辑、MP3压缩等声学退化。 - Group B:使用可控韵律的TTS系统生成带有故意翻转音高重音模式的语音。 - Group C:自然语音的音高和语速变化(包括自然分布内和人工偏移)。
使用6种MOS预测模型(SHEET-MB、SHEET-BV、UTMOS、UTMOSv2、NISQA、DNSMOS)进行评估。
本文通过受控扰动实验揭示了当前MOS预测模型在韵律和说话人特征感知方面的显著局限性,为改进模型指明了方向。
现有语音表示学习多侧重语言级监督,忽视了同一语言内部的地理变体(如地区、方言)对表示空间结构的影响。大规模多语言场景下,联合语言与地区粒度的监督如何影响嵌入几何尚未被充分探究。
该工作首次在大规模印度多语言语音数据上系统证明,联合语言与地区监督能够在不损伤语言辨别力的前提下,显著提升嵌入空间对地理变体的结构化编码能力。
传统发音评估依赖标注的非母语语音数据或强制对齐,成本高且难以扩展到低资源场景。
提出轻量级无监督/半监督框架,仅使用母语资源训练。核心组件:1) Audio2DUnit:SSL编码器+K-means码本将语音离散化为token;2) Token语言模型(TLM):n-gram模型计算token的surprisal,反映音位偏差;3) Text2DUnit:seq2seq模型将文本映射到同一离散空间;4) DTW对齐:比较学习者的声学token与文本生成的规范token,提取对齐特征。融合surprisal和DTW特征进行回归评分。
在SpeechOcean762上,PCC从0.60提升至0.66(加入文本引导),接近有监督基线。跨数据集L2-ARCTIC上取得一致提升。
利用离散语音token的surprisal实现无需标注非母语数据的发音评估,兼具轻量级和有效性。
构音障碍语音识别(ASR)由于数据稀缺和说话人间变异性大而表现不佳,传统数据增强方法需要大量说话人特定数据,重新引入采集瓶颈。
本文提出使用零样本语音克隆作为低负担增强策略,采用Higgs Audio V2模型,仅需每个说话人单个参考话语(平均7.2秒)即可合成训练数据。在TORGO数据集上克隆说话人,生成TORGO-Synth数据集(18小时),并微调Whisper-medium模型。通过说话人相似性分析、数据规模效应分析和跨语料库迁移评估(SAP-1102)全面验证克隆数据的效果。
零样本语音克隆能以极低的采集成本为构音障碍ASR提供有效的训练信号,显著提升识别性能且具有良好的泛化能力。
构音障碍语音识别面临严重程度差异大、数据稀缺的挑战,现有ASR系统性能有限。
提出在端到端预训练Wav2Vec2模型微调中,系统性应用四种域内数据增强方法:说话速率修改(SRM)、音高修改(PM)、共振峰修改(FM)和声道长度扰动(VTLP),并针对不同严重级别优化增强因子。
基于TORGO数据集,按严重级别单独微调Wav2Vec2模型。最佳WER:低严重度9.02%(SRM, s=0.8)、中严重度38.11%(SRM, s=0.8)、高严重度55.15%(PM, τ=0.8),相对提升分别为30.02%、16.64%、15.47%。
本文首次系统地将传统数据增强技术应用于Wav2Vec2微调,有效缓解了构音障碍语音数据不足问题,显著提升了跨严重级别的识别性能。
构障碍语音由于发音精度受损导致显著的声学变异性,传统ASR系统性能不佳。数据稀缺、说话人内/间差异大是主要挑战。
该文通过系统对比多种谱特征与声学模型组合,并创新性调整F-TDNN训练策略,显著提升了构障碍语音识别性能。
儿童语音识别(ASR)面临声学变异性大、数据集不匹配和预训练偏见等挑战。现有ASR系统多基于成人数据训练,在儿童语音上性能显著下降。低资源场景下缺乏大规模标注数据,限制了模型泛化能力。
本研究系统性分析了三种自监督学习(SSL)模型(Wav2Vec2、HuBERT、WavLM)在不同微调策略下的表现,包括年龄特定、性别特定和跨数据集微调。实验在两个儿童语音数据集(PFSTAR(英式英语)和CMU Kids(美式英语))上进行,首次深入探讨年龄和性别因素对SSL模型微调的影响。
本文为低资源儿童ASR提供了重要的微调策略指南,强调面向儿童的微调需考虑年龄、性别和数据多样性。
现有流式语音增强方法在算法延迟与质量之间只能做二元选择(因果 vs 非因果),每个模型固定一个延迟点,缺乏在单一卷积架构内系统探索延迟-质量权衡的统一框架。
在 VoiceBank+DEMAND 上,12.5 ms 全因果模型 PESQ 3.35 匹配或超越之前最佳因果模型(46.5 ms 时 PESQ 3.27);75.0 ms 时 PESQ 3.43。参数量固定 1.37M。
首个通过训练时可配置延迟的卷积流式语音增强框架,在低延迟下达到甚至超过高延迟因果模型的质量。
现有全双工口语对话系统(Full-Duplex Spoken Dialogue Systems)虽宣称具备全双工能力,但定义模糊、能力参差,现有综述仅沿单轴(级联/端到端、工程化/学习化)比较,忽略了系统内部决策位置、交互类型和瞬时行为等关键维度。
本文提出三个正交分析框架: 1. L0–L3 架构层次:定位双工决策在模型栈中位置(外部模块L0、隐状态预测L1、令牌同步L2、共享潜在表示L3); 2. T×I×R 交互本体:将每个交互时刻描述为时间关系(T)、用户意图(I)与系统响应(R)的三元组,并定义六个酸测试单元; 3. 决策状态机(IDLE/LISTEN/SPEAK/WAIT/DUAL):五状态十一转移,描述系统瞬时行为演化。
本文为全双工口语对话系统提供了首个系统化设计空间定义,并通过多维审计揭示了当前系统的实际限制与未来方向。
S-JEPA通过软聚类目标与在线GMM更新,在消除硬聚类缺陷的同时,以更少参数取得了竞争性能,为自监督语音表示学习提供了更优雅且信息丰富的范式。
DASH通过多层的原型蒸馏实现了ASR在噪声环境下的鲁棒性提升,且不牺牲干净性能,是一种高效且通用的自蒸馏框架。
现有ASR基准(如IndicVoices、CommonVoice、FLEURS)在固定提示条件下评估,无法判断AudioLLMs是否真正利用上下文还是依赖参数记忆。而上下文ASR基准(如Earnings-22、ContextASR-Bench、ProfASR-Bench)多限于英语或合成语音,且仅测试单一上下文类型,缺乏系统性变化。
提出了IndicContextEval,一个56小时、8种印度语言、23个专业领域的自然语音基准。设计了7级提示框架(L0-L6),逐步引入语言、元数据、音频描述、实体列表(英语/本地文字)、以及对抗性错误实体,从而能够将性能变化归因于特定上下文类型。数据集包含555位讲者的自然语音,并配有人工审核的转录和结构化元数据。
评估了GPT-4o Transcribe、Gemini 3 Flash、Sarvam Audio、Gemma-3N等5个模型。结果显示:不同模型对上下文的利用行为差异显著:有些模型能有效利用上下文(如Gemini 3 Flash在L5达到最佳NEER 17.39%),有些则基本忽略,甚至对抗性提示(L6)后所有模型返回接近L1的水平。Native-script实体(L5)对GPT-4o、Gemini 3 Flash、Gemma-3N产生较大性能提升,但对Sarvam Audio效果较小。
IndicContextEval是首个系统性评估多语言AudioLLMs上下文利用能力的基准,揭示了模型行为差异和上下文提示的不稳定性,为未来研究提供了重要测试平台。
现有帕金森病(PD)语音检测主要基于持续元音,但持续元音仅反映受控发声状态,无法体现连续语音中的发音转换、时间组织及协调需求。此外,现有方法存在数据泄露、人口统计偏倚等问题。
提出基于连续语音的PD检测框架: 1. 从连续语音中提取元音中心区域,避免非元音段干扰。 2. 结合传统声学特征(eGeMAPS)和新型非谐波特征(inharmonicity),两者形成互补。 3. 采用说话人级评估、严格防止数据泄露(说话人级分层、仅训练集预处理、组内缩放等)。
在两个数据集(NeuroVoz西班牙语、Voice Diagnostics瑞典语)上,连续语音模型优于持续元音模型。非谐波特征在NeuroVoz上提升性能,在VD数据上无显著影响。
首次系统证明连续语音相比持续元音在PD检测中的优势,并引入非谐波特征作为补充。
现有的歌唱深度伪造检测数据集存在以下问题:语言单一(多为英语)、生成模型种类有限(如SONICS仅使用两种架构)、缺乏文本对称性、多语言和多模型泛化能力不足。
本文提出SingFox数据集,包含20种语言(14种国际语言+6种印度语言)、超过113,802个音频片段(总时长126.32小时)、1150位歌手。数据集分为6个轨道(T1-T6),针对语言多样性、音乐流派、替代伪造等场景。生成模型涵盖GAN(HiFi-GAN、BigVGAN、UnivNet)、扩散模型(DiffSinger、DiffRhythm)、语音转换(RVC、So-VITS-SVC)和文本到音乐(MusicGen)。数据集采用文本对称设计,避免模型依赖非语义线索。
跨测试中最高准确率达77.84%。代码公开在GitHub。
SingFox是一个大规模、多语言、多生成模型的歌唱伪造检测基准数据集,填补了现有数据集在多语言和模型多样性方面的空白。
提出结合Whisper嵌入与规则分数的双阶段补偿框架,有效缓解语音转录错误和缺失运动子测试问题,为临床痴呆筛查提供高效准确的语音评估方案。
扩散模型用于音频到音频转换时,通常需要任务特定的训练或条件,且初始化时间(t_init)的选择缺乏理论指导,常通过手动调优。
提出扩散预热初始化(Diffusion Warm Initialization),利用预训练的无条件扩散模型,从引导信号x^(g)(可带噪声或不带)开始反向扩散过程,通过调整初始化时间t_init(或τ_init)控制转换程度,无需任务特定训练或条件。算法统一框架(Algorithm 1)支持多种音频转换任务。
以音色迁移为例,使用基于音高的Jaccard距离和Fréchet音频距离评估保真度和真实性。结果表明: - 早期初始化(t_init小)生成更真实但偏离引导信号; - 后期初始化(t_init大)保留更多输入结构但修改有限。 - 发现显式噪声注入并非必要,引导信号本身可作为有效初始化状态。 - 该方法在多个任务(音色迁移、MIDI-Real合成、音频增强)上达到与专门管道竞争的 results。
提出一种简单、通用、无需额外训练的音频转换框架,通过调整初始化时间即可控制真实-保真权衡。
构音障碍言语评估面临临床标注数据稀缺的瓶颈,现有方法受限于受限词汇且依赖匹配对照组,难以扩展。
提出利用语音合成评估语料库(QualiSpeech)中的MOS标注数据增强构音障碍评估系统。采用两种训练范式: 1. 联合训练(Joint Training):将QualiSpeech与SAP数据按1:1混合,对MOS分数线性映射到SAP严重性尺度后联合优化。 2. 微调(Fine-Tuning):先在QualiSpeech上预训练,再在SAP上微调。 模型基于SSL预训练编码器(如wav2vec 2.0/HuBERT),加时间池化和回归头,端到端微调。
本文开创性地将语音合成评估数据用于构音障碍严重性评估,缓解了临床数据稀缺问题,验证了跨域感知知识迁移的可行性。
留声机唱片从1924年电气录音开始,为了最大化信息密度和提高信噪比,切割时采用了非均匀的频率响应(即预加重曲线)。回放时必须应用逆曲线以恢复平坦响应。1953年前,不同唱片公司使用不同的曲线,甚至同一公司的曲线随时间变化,导致回放均衡复杂。数字处理方法灵活、成本低,但需要将连续时间滤波器离散化,这会在奈奎斯特频率附近引入偏差。
本文系统性地评估了八种离散化连续时间滤波器的方法,以RIAA曲线(原型由三个时间常数定义,包含高频去加重)作为测试基准。八种方法包括:零阶保持(Zero-Order Hold)、三角近似(Triangle Approximation/First-Order Hold)、脉冲不变法(Impulse Invariant)、双线性变换(Bilinear Transform,未加预失真)、零极点匹配(Zero-Pole Matching)、复数误差最小化(Complex Error Minimization,分两步:加权方程误差最小化+加权输出误差最小化迭代)。这些方法均为阶数保持型(分母阶数不变,但分子阶数可能升至分母阶数)。
论文片段未给出具体实验结果,但根据标题和摘要,后续应包含各方法在幅度响应、相位响应、计算复杂度、延迟等方面的量化比较。重点评估高频段(接近奈奎斯特频率)的近似精度。
本文全面比较了多种数字滤波器设计方法在留声机回放均衡中的应用,为数字音频复原提供实用指南。
当前动态范围压缩器(DRC)模型评估通常依赖代理指标(如L1误差、多分辨率短时能量MSTE),但这些指标无法直接衡量模型核心行为——时变增益信号。硬件压缩器会引入二次效应(相位偏移、噪声等),使得从音频输入输出对中提取真实增益信号成为病态逆问题,代理指标可能被这些效应主导,无法准确反映增益误差。
本文提出直接利用硬件压缩器的控制电压(CV)信号作为真实增益信号,进行模型评估与训练。具体贡献包括: - 公开SSL G384总线压缩器数据集,包含音频输入输出对及对应的CV信号(按比例对应分贝增益)。 - 设计实验:训练灰盒模型(基于可微DSP),直接使用CV信号作为损失(目标函数),并与使用L1和MSTE代理损失训练的模型比较。 - 直接CV损失可避免代理指标对二次效应的敏感性,提供更准确的行为一致性度量。
本文通过引入控制电压直接测量,解决了动态范围压缩器模型评估中的代理指标偏差问题,并提供了实用数据集,为精确建模硬件压缩行为奠定了新基准。
Mild Cognitive Impairment (MCI) 检测中,基于语音的多模态模型常利用与标签相关的人口统计特征(如性别、语言)作为捷径,导致不同子组(性别、语言)间性能差异大,影响公平性和可靠性。
提出 FMD (Fair MCI Detection) 框架,包含两大模块: 1. 跨模态融合 (Cross-Modal Fusion):使用交叉注意力机制以文本为锚点,融合语音、文本和图像模态,捕捉细粒度跨模态交互(如语义与韵律的关联)。 2. 去偏学习 (Unlearning via Gradient Reversal):引入辅助的人口统计分类器,通过梯度反转层削弱共享表示中的人口统计信息,强迫模型学习对 MCI 判别任务有效且对人口属性不变的特征。
在 TAUKADIAL 和 PREPARE 两个多语言基准上评估: - 整体 F1 显著提升(TAUKADIAL: 92.6 vs 基线最佳 84.1;PREPARE: 60.1 vs 基线最佳)。 - 最差子组 F1 大幅提高,性能差距缩小,尤其在性别和语言子组上。 - 跨数据集迁移实验表明去偏学习提升了表示鲁棒性。
FMD 通过跨模态融合与梯度反转去偏,在提升 MCI 检测精度的同时显著缓解了人口统计偏差,是多语言多模态公平医疗诊断的先进方案。
MagpieTTS-LF以纯推理方式实现了无需重新训练的长文本连贯语音生成,软注意力先验与状态传播机制有效解决了长序列中的韵律与一致性问题。
现有空间音频捕获与再现框架通常针对特定输入(如Ambisonics或原始麦克风阵列)和特定输出格式(如双耳或扬声器),缺乏统一处理多种格式的方案。线性方法在麦克风数量少时性能受限,参数化方法虽能提升感知质量但未通用化。
提出nCOMPASS框架,统一处理Ambisonic信号或原始麦克风阵列信号。框架在时频域估计空间元数据(包括多个主声源和具有自身角功率分布的环绕成分),通过捕获信号的空间协方差拟合参数。利用这些元数据构建目标播放格式的空间协方差,推导最优混合矩阵进行转码。同时支持捕获和播放设置的独立旋转。避免显式空间滤波操作,提高在挑战场景(如紧密声源)下的鲁棒性。
通过客观双耳线索度量和主观三部分听音测试(模拟Ambisonic接收器、球形麦克风阵列、头戴麦克风阵列),与多种现有参数化渲染方法比较。结果表明nCOMPASS在多样化内容和接收配置下具有感知优势,尤其对于低阶和几何受限阵列。
nCOMPASS是首个统一Ambisonics和原始麦克风阵列输入、支持任意播放格式的通用参数化空间音频转码框架,在鲁棒性和灵活性上超越现有方法。
现有大型音频语言模型(LALM)在训练时仅通过稀疏的文本响应token提供监督信号,导致模型丢弃了大量细粒度的声学信息(如语音细节、韵律、音高、情感等),无法有效利用这些信息生成回答。
提出Continuous Audio Thinking (CoAT)框架,在音频输入和模型响应之间插入一个连续的潜在思考块(由特殊token组成),并通过多专家知识蒸馏(包括音频特征重建、语音内容、声音事件、副语言特征、音高预测)监督该思考块的隐状态,使其在潜在空间中组织和保留声学信息,无需文本化或自回归解码。CoAT可集成到现有LALM中,且推理时仅需一次prefill,不增加自回归解码成本。
在Qwen2-Audio、Qwen2.5-Omni-7B、Audio Flamingo 3三个模型上评估,覆盖音频推理、理解、音乐分类、语音情感、语音转录等多个基准,CoAT均带来一致性能提升,且延迟低于文本链式思维方法。分析验证了辅助监督从思考位置传播到文本响应。
CoAT通过连续潜在思考空间和多专家蒸馏,有效提升了LALM对细粒度声学信息的利用能力,是一种即插即用的高效范式。
现有基于序列化输出训练(SOT)的多说话人语音语言模型(SLM)需要扩展LLM词汇表并微调解码器,导致灾难性遗忘,损害推理、总结和问答能力。
提出说话人日志条件化SLM(Diarization-Conditioned SLM),通过帧级说话人依赖变换(FDDT)将说话人活动概率整合到声学编码器每一层,提取目标说话人表示,而LLM解码器保持冻结。实例化为Dixtral,结合DiCoW(说话人日志条件化Whisper)编码器和VoxTral SLM。
通过说话人日志条件化声学编码器,在不改变LLM解码器的情况下实现多说话人语音理解,有效避免灾难性遗忘,显著提升多说话人ASR和语音问答性能。
嵌入式机器学习在微控制器类设备上部署面临严苛的资源限制(内存、能量、延迟),传统云端ML流程无法直接移植。关键挑战包括:数据采集与硬件耦合、特征提取需兼顾降维与信息保留、模型评估需考虑实际部署的类不平衡和时序行为、以及流式部署中的调度与稳定性问题。
本文提出一个以部署为中心的端到端流水线,涵盖数据采集、窗口化、特征提取(RMS+PSD用于惯性,MFCC用于音频)、模型选择、评估、运行时执行和现场监控。强调两个代表性案例:惯性手势识别(2秒3轴加速度计窗口,提取33维特征)和小足迹关键词识别(1秒音频,MFCC+一维卷积)。创新点包括:将特征提取视为信号驱动的压缩(而非简单前处理);提出确定性控制与概率模型协同的架构;给出类不平衡下的评估指标(F1、宏平均F1等)和时序平滑机制。
论文未提供具体数值实验,但给出了设计规则和评估指南:混淆矩阵作为部署产物,需关注每类精确率/召回率/假阳性率;滑动窗口需结合状态机避免闪烁;模型选择需满足内存、延迟和能量预算(参考表I、II)。
本文是一份实用的TinyML工程指南,系统性地连接了数据、特征、模型和部署的各个环节,尤其适合微控制器平台的开发者。
传统的Token-to-Waveform(Token2Wav)解码器在多步流匹配模型中依赖迭代采样,导致高推理延迟,存在质量与速度的权衡。
提出了一种在压缩潜在空间中使用MeanFlow的一步Token2Wav生成方法,大幅降低推理延迟的同时保持高保真度。
传统方法难以将复杂临床构念(如信息显著性、语义类别等)操作化为可量化指标,且高维特征可解释性差。
针对Cookie Theft图片描述任务定义7个任务特异性构念,利用LLM(GPT-4o、Claude 3.5 Sonnet、LLaMA-3.2)直接给出严重度评分及自然语言解释,支持少样本学习。
Claude 3.5 Sonnet在ADReSS数据集上达到85%准确率,专家对评分的平均认同度为3.99/5;开源模型LLaMA-3.2经微调后可在私有数据上部署。
本文展示了LLM在认知障碍筛查中实现可解释、任务特异评估的潜力。
痴呆和抑郁是老年人群中最常见的神经精神障碍,两者症状重叠(如认知下降、情感淡漠),导致鉴别诊断困难。现有评估工具(如MMSE、PHQ-9)多为症状总分或认知任务驱动,缺乏对共病状态的并行分级评估。
本研究首次将LLM应用于临床访谈的痴呆与抑郁并行分级评估,通过平行量表设计和结构化特征提取显著提升了痴呆严重度预测的准确性,展示了自动神经精神筛查的临床潜力。
传统压扩MEMS麦克风ADC在输入信号跨越不同幅度段边界时会产生可听伪影(glitches),主要原因包括段间增益/失调失配、幅度检测延迟以及Sigma-Delta调制器固有的记忆效应。
本文提出一种基于VCO-ADC的压扩读出ASIC,利用多速率时域量化实现瞬时高分辨率信号表示,避免传统SDM所需的抽取滤波器延迟。通过非均匀采样方案(多速率频率-数字转换器)解耦量化噪声与VCO频率,保持标准音频采样率。驱动器与振荡器电路协同优化,实现>112dBc峰值SFDR(无反馈DAC)和GΩ输入阻抗。
采用0.13µm CMOS工艺,完整读出芯片包括两个模拟通道和数字处理/校准模块,输出标准单比特PDM。实测动态范围114.3dB,功耗399µW,Schreier FoMSNDR 171.0dB,FoMDR 191.3dB。相比传统SDM压扩方案,切换瞬态误差噪声底显著降低。
通过VCO-ADC的瞬时时间域特性有效抑制压扩边界伪影,实现高性能低功耗MEMS麦克风读出。
本研究探讨自监督语音模型(wav2vec2.0)是否具备对人类音调语境补偿(perceptual compensation)的模拟能力。先前研究声称预训练模型能隐式学习音系结构,但该文通过伪复制汉语普通话声调感知实验发现,纯预训练模型在嵌入相似性中未表现补偿,微调模型虽有轻微补偿但远未达到人类水平,表明监督学习对抽象音系规则的必要性。
该研究严谨揭示了自监督预训练不足以使模型学会音调语境补偿,为语音模型的感知能力评估提供了重要参照。
现有基于 flow matching 的语音增强方法主要在频谱域(Mel 谱或 STFT)操作,仅将 SSL 特征作为外部条件,而未充分利用 SSL 表示的结构丰富性。Mel 谱缺乏相位信息,STFT 呈重尾分布,且频谱特征中音高、音色、语言内容高度耦合,增加了生成建模的难度。
提出 PhASE-Flow,完全在 SSL 表示空间(WavLM 衍生)中操作。利用 WavLM 提取两类表示:低层 acoustic 表示(第一 Transformer 层)和高层 phonetic 表示(最后一层)。采用 DiT-based flow matching 模块,以 phonetic 表示为条件,建模 clean acoustic 表示的条件分布。推理时通过神经声码器重建波形。
在 DNS 2020 测试集上,PhASE-Flow 在感知质量(DNSMOS、UTMOS)、可懂度(dWER)和说话人相似度上均优于 SOTA 方法(TF-GridNet、StoRM、FlowSE、LLaSE-G1、AnyEnhance)。仅需 4 个采样步骤即可达到竞争性能,大幅提升推理效率。
PhASE-Flow 通过在 SSL 表示空间内进行音素条件声学流匹配,实现了高质量、高效率的语音增强。
自动语音识别(ASR)系统的训练需要大量高质量的标注语音数据,但采集真实语音数据成本高昂且耗时,尤其对于资源匮乏的印度语言(如印地语、卡纳达语、泰卢固语),数据稀缺限制了模型性能。
该研究系统性地验证了合成语音数据在印度语言ASR微调中的有效性,并揭示了数据来源、说话人多样性和模型规模等关键因素对性能增益的影响,为低资源语言ASR提供了实用指导。
非自回归(NAR)解码通过并行生成输出令牌提高了语音识别速度,但由于无法利用之前生成的令牌来消除不确定性,导致识别性能下降(多模态问题)。
提出非自回归最小贝叶斯风险(NAR-MBR)解码框架: - 利用NAR模型输出概率进行高效无偏采样(单个前向计算即可获得多个样本)。 - 通过最大化期望效用(基于WER)选择最优输出序列,而非最大化输出概率。 - 在Mask-CTC基础上,采用概率性掩码和Gumbel-max技巧进行采样。 - 通过移除最长公共前缀/后缀、缓存重复对、并行化等策略加速编辑距离计算。
在LibriSpeech、Switchboard、AMI和web presentation corpus上,NAR-MBR解码比AR波束搜索快43.1倍,同时比原有NAR解码(Mask-CTC)在精度和速度上均有提升,且无需额外训练。
一种无需额外训练、通过高效采样和MBR决策显著提升非自回归语音识别性能与速度的实用解码方法。
现有参考无关的文本到音频(TTA)评估指标(如CLAPScore)仅进行粗粒度的全局文本-音频相似度匹配,与人类主观评分的相关性低,尤其忽略了短促的声学事件。
提出ELSA,一种参考无关的细粒度TTA评估指标。ELSA通过LLM将文本查询分解为语义独立的声学事件,并使用语言查询的音频源分离(LASS)模型提取对应音频片段的表示,然后计算事件级精度和召回率,并与全局匹配分数自适应结合。
在AudioCaps、Clotho、MusicCaps、RELATE四个基准上,ELSA与人类主观评分的Spearman和Kendall相关系数均高于所有基线指标(包括参考无关和参考依赖方法),如AudioCaps的REL任务上ρ=46.5%(比第二高出17.8%)。在组合性评估(CompA)上也表现优异。
ELSA通过事件级语义对齐显著提升了TTA自动评估与人类判断的一致性。
结核病(TB)筛查中,基于咳嗽音频的自动检测面临跨设备、跨环境变异、人群异质性等问题,现有方法多关注单流主干,缺乏对异质表示(预训练模型嵌入与经典谱特征)互补性的系统研究。
提出COBALT框架,通过码本对齐的双曲原型(hyperbolic prototypes)融合两股异质表示:首先将预训练模型(如PaSST、Whisper)和手工谱特征(MFCC、LFCC)分别编码为序列,经轻量适配和令牌化后映射到Poincaré球空间;利用共享双曲原型码本进行向量量化对齐,并通过多臂赌博机机制学习每个原型的可靠性权重,最终拼接加权证据和交互项后由MLP分类。
在CODA TB DREAM Challenge基准上,COBALT一致优于单表示和拼接基线,融合MFCC+PaSST取得最佳性能,创下新SOTA。PaSST在单表示中表现最强,CNN后端优于FCN。
首次系统融合预训练音频表示与手工谱特征进行咳嗽结核病检测,通过双曲原型对齐和赌博机权重实现有效互补。
多模态大语言模型(LLM)在自动语音识别(ASR)中进行多语言转写时,常常错误识别输出语言,导致转录不忠实,影响下游任务质量。尤其在短时或嘈杂语音段中,语言遵从性(language adherence)问题突出,且缺乏标准化的评估方法。
在单语和语码切换数据集上比较了三种方法,评估了语言违反率和词错误率(WER)之间的权衡。具体数值未在截取内容中给出,但声称CoT方法在减少语言违规方面有效,且不显著增加WER。
本文系统定义了多模态LLM中的语言遵从问题,并提出实用指标与轻量级缓解方法,为实际部署提供了指导。
在远场麦克风阵列中,方向到达角(DoA)估计面临空间混叠问题:宽带方法(BB)通过聚合所有频带优化函数来鲁棒处理混叠,但无法利用频域稀疏性实现单帧多说话人估计;窄带方法(NB)能利用频域稀疏性,但每个频带的局部估计容易受到空间混叠影响。
提出基于单频滤波(SFF)的窄带DoA估计器: - 利用SFF时频表示的高SNR区域(特别是浊音段声门闭合瞬间附近),在这些区域进行互相关计算。 - 通过SFF谱平坦度进行语音活动检测(VAD),仅选择浊音段中SNR高的时频点。 - SFF提供了良好的时间-频率分辨率折中,避免了传统STFT的时频分辨率取舍问题。
该工作通过SFF时频表示和VAD,显著提升了窄带DoA估计在远场恶劣环境下的鲁棒性。
语音在噪声环境下可懂度下降,不同音素受影响程度不同(元音比辅音更鲁棒),且幅度谱和相位谱对可懂度的贡献尚不明确。
该论文系统探究了幅度谱和相位谱在不同噪声环境下对辅音可懂度的贡献,揭示了相位谱在噪声中的鲁棒性优势。
传统基于短时傅里叶变换(STFT)的广义互相关(GCC)到达方向(DoA)估计器在噪声和混响环境下性能下降,而单频率滤波(SFF)表示能同时提供高时间分辨率(激励源特征)和高频率分辨率(谐波),但现有SFF-based DoA估计器缺乏系统评估。
本文系统比较了SFF和GCC-based DoA估计方法,提出PHAT加权的SFF包络互相关,验证了SFF域在复杂声学环境下的优越性。
核心痛点: 跨语言语音阿尔茨海默病检测(SADD)中,模型在未见语言上泛化能力差,由于语言特异性干扰(如口音、语法差异)导致性能下降。
方法创新: 提出ORBIT框架,融合多语言语音(如mHuBERT)和文本(如XLM-RoBERTa)预训练模型,通过双向交叉注意力对齐模态;引入多标签对抗学习(在融合、几何投影和聚类分配三个层面)消除语言编码;同时将表示投影到球面和双曲流形,利用互补几何结构,并通过共识聚类和原型分类实现零样本跨语言迁移。
实验结果: 在英语、中文、西班牙语、希腊语四种语言上,采用LOLO和LTLO评估协议,ORBIT在多模态融合设置下显著优于单模态和简单级联基线,验证了语言不变性表示的有效性。
一句话评价: 首个将多模态预训练融合与语言不变性约束结合用于零样本跨语言阿尔茨海默病检测的工作,通过对抗学习和双曲几何学习有效抑制语言混淆。
文本到音乐生成(TTM)的客观评估缺乏能够反映人类偏好的细粒度指标。现有指标如FAD衡量分布相似性而非人类偏好,且无法对单个生成进行评分。绝对MOS回归受评分者主观尺度漂移影响,而成对比较(A vs B)能更可靠地捕获偏好。
TuneJury 是一个开源的、实例级别的成对奖励模型,输入为文本提示和音频片段,输出一个偏好分数。架构上,使用冻结的LAION-CLAP(文本+音频)和MERT(音频)编码器,拼接2048维嵌入,通过约2.8M参数的可训练MLP头得到标量分数。训练采用RankNet的共享权重成对逻辑损失,数据来自四个公开人类标注来源(Music Arena、MusicPrefs、AIME、SongEval),共约17.5K训练对,不使用伪标签增强。 此外,提出了锚定校准(Anchor Calibration),一种事后、逐系统的Bradley-Terry校准方法,能够仅用约25倍少的校准数据匹配重新训练的精度,适应新TTM系统。
TuneJury以极小的参数量和大规模的纯人工偏好数据,实现了具有竞争力的音乐生成偏好预测,并通过锚定校准实现高效的系统适应。
低帧率(≤6.25 Hz)神经音频编解码器在自回归语音合成中可显著降低推理计算成本,但其质量退化机制尚未被充分理解。已有工作将6.25 Hz处的性能悬崖归因于音素碰撞(一个帧内包含多个音素),但缺乏深入验证。
本文通过控制变量消融实验,系统研究低帧率退化的真正原因: - 固定训练策略:对比固定裁剪时长(0.38秒)与固定token序列长度两种训练配置。 - 假设检验:量化评估音素碰撞和码本饱和两种假说。 - 框架:基于DAC(16 kHz),保持架构和码本大小(12级RVQ,码本1024)不变,仅改变帧率(1.6~100 Hz)。
本文揭示了低帧率编解码器退化的真正原因在于训练时token数量不足,而非帧率本身的固有限制,为极低帧率(≤3.125 Hz)的实用化铺平了道路。
现有预训练音素编码器(PPEnc)如 MP BERT、PL BERT 需要大量预训练(约10个epoch)才能获得较好性能,主要原因是音素序列长、词汇量小、语义编码困难,导致学习词级和句级特征效率低。
提出 CraBERT,采用级联融合架构: 1. 使用冻结的预训练子词级 DistilBERT 提供词/句级先验信息; 2. 通过基于动态时间规整(DTW)的子词-音素对齐算法,将子词表示上采样后与音素嵌入逐元素相加,再输入音素级 BERT(PBERT); 3. 预训练任务包括掩码语言建模(MLM)和音素到词(P2G)预测,权重共享与初始化加速收敛。
CraBERT 通过级联融合预训练子词表示,大幅降低了音素编码器的预训练成本,同时在语音合成自然度和韵律上保持竞争力。
小型合奏或管弦乐录音中,近距离麦克风会捕获相邻声源的泄漏(bleeding),导致音轨隔离困难,影响混音质量。
本文提出将通道排列等变性作为核心学习原则:训练时对输入麦克风通道和对应的参考目标施加相同的随机排列,迫使模型学习排列等变的映射,减少对固定通道-乐器关联的依赖,从而提升对录音设置变化的鲁棒性。在Hybrid Demucs架构基础上改编为多通道版本,输入P路近场麦克风信号,输出P路去串扰估计。
在合成数据(SynthSOD弦乐合奏)和真实URMP录音上评估,使用SDR作为指标。与不采用排列训练(No perm)的基线相比,排列感知训练(Perm)在未见过的房间、布局和真实录音上均显著改善SDR(如URMP弦乐合奏平均SDR提升从+0.3 dB增至+5.3 dB(幅度谱输入))。
本文提出了一种简洁有效的数据驱动策略——通道排列等变性训练,显著提升了多通道音乐源分离在去串扰任务中的泛化能力。
老年人语音识别面临三大挑战:1) 标注数据稀缺且成本高昂;2) 伪标签质量不可靠,直接解码错误率高;3) 说话人间异质性(发音退化、语言退化等)加剧了系统性能下降。
提出一种结合置信度分数引导的增量式伪标签与说话人自适应训练的半监督方法: 1. 置信度估计模块(CEM):轻量级二元分类器(3层残差FFN),基于Whisper解码输出和top-10 logits逐令牌预测置信度,通过编辑距离对齐训练,并对无标签数据取平均得到语句级分数。 2. 置信度引导的数据排序:对每位说话人内语句按置信度降序排列,均分为K组,跨说话人组合形成从高到低置信度的K个子集。 3. 增量式伪标签:按照课程学习轨迹,从高置信度子集开始逐步加入训练。每次迭代用当前模型为下一子集重新生成伪标签,并合并所有已处理子集进行微调。 4. 说话人自适应训练:为每位训练说话人初始化可学习说话人提示(prompt),与输入拼接,通过LoRA联合训练说话人提示和适应参数,解码时采用说话人自适应模型提升伪标签质量。
在DementiaBank Pitt(英语)和JCCOCC MoCA(粤语)老年人语音数据集上,相比半监督基线方法,词错误率(WER)或字符错误率(CER)绝对降低1.45%和2.27%(相对降低6.21%和6.98%),差异具有统计显著性。
首次将置信度引导的增量伪标签与说话人自适应训练结合,有效缓解了老年人语音半监督学习中的标签噪声和异质性挑战。
老年人语音识别面临多重挑战:说话人异质性、数据稀疏、言语产生和语言能力衰退、缺乏跨语句上下文信息。现有说话人自适应方法存在延迟高、未有效融合音频和文本信息、缺乏跨语句文本信息等局限。
提出一种基于跨语句音频-文本提示的在线说话人自适应方法,用于老年人语音识别。该方法通过双跨模态融合(Dual Cross-Modality Fusion)整合历史语音和文本信息,利用Q-Former模块压缩可变长度的历史上下文,生成紧凑的说话人提示(speaker prompts),实现零样本、实时的自适应。训练分为两步:说话人自适应训练(SAT)和在线音频-文本提示自适应。测试时,系统能同时解码和自适应("decoding while adapting"),无需伪标签或额外延迟。
在英语DementiaBank Pitt和粤语JCCOCC MoCA老年人语音数据集上,所提在线自适应方法相比说话人无关(SI)模型显著降低了词错误率(WER)或字符错误率(CER),分别绝对降低0.61%和1.22%(相对降低2.99%和4.48%)。实时因子(RTF)加速比高达9.83倍,优于离线批处理自适应。与i-vector、x-vector、ECAPA-TDNN等基线相比,音频-文本提示方法表现更优。
该工作首次将跨语句音频-文本提示用于老年人语音识别的在线说话人自适应,实现了低延迟、高性能的零样本自适应。
现有基于向量量化(VQ)的神经音频编解码器(NAC)语音增强方法,在离散和连续潜空间中的建模策略差异未被充分探索,且VQ正则化的内在作用(独立于离散处理)未被分离验证。此外,预训练编解码器在噪声输入下的匹配问题导致性能下降。
本文通过系统比较连续与离散潜空间建模,揭示了VQ正则化对鲁棒性的内在贡献,并提出了基于连续潜空间预测且结合VQ正则化的高性能生成式语音增强框架cNAC-SE。
现有方法通常将文本到音频生成(TTA)和音频编辑视为独立任务,采用任务特定的架构或模块,导致系统复杂、可扩展性差,且忽视了任务间交互的潜在益处。
提出 AudioWeave 统一模型: 1. 联合条件建模:通过因子化位置嵌入,使单个扩散Transformer(DiT)骨干能同时处理TTA和音频编辑的异构输入条件(文本、参考音频)。 2. 渐进多阶段训练策略:先预训练TTA基础模型,再混合训练TTA和音频编辑,结合任务特定注意力掩码,缓解任务竞争和灾难性遗忘。 3. 采用流匹配(Flow Matching)目标训练,结合混合DiT架构(双流MMDiT块和单流DiT块)。
在TTA和六个音频编辑任务上,统一模型达到了与任务特定模型相当的性能,验证了方法的有效性。
AudioWeave通过联合条件建模和渐进训练,首次实现了无需任务特定组件的统一音频生成与编辑,为多任务音频生成奠定了基础。
Joycent通过扩散模型和解耦表示,实现了无需口音音素预测的高质量口音TTS,兼具口音自然度与说话人保真度。
Euler的Gradus Suavitatis对称处理分子和分母,但人类对音程的感知是非对称的(低音与高音角色不同),且该公式在13个标准音程数据上出现三重并列,无法区分某些重要音程(如小三度、小六度、大二度)。
提出非对称公式 f(p/q) = p + Ω(q),其中p为分子(高音),q为分母(低音),Ω(n) = Σ e_i(p_i - 1) 为加权素因子指数和。该公式将高音视为谐波序列中的位置,低音视为素复杂度,并引入两阶段感知解释。此外,证明Euler公式可解释为加权谐波重合计数,权重为 Ω*(n)。
在13个标准音程的人类协和度排名上(Krumhansl数据),f公式的Spearman ρ=0.989,优于Euler公式的0.979,与max(p,q)相同,但f解决了Euler的三重并列,仅留下一个两重并列(小六度与大二度)。对三全音(45/32)的区分更为显著(f=50 vs Euler的14)。
该工作通过非对称算术公式更好地拟合了人类音程协和度感知,并揭示了与谐波重合模型的深层联系,具有理论简洁性和实证优势。
传统声学-发音反演(AAI)模型依赖电磁发音描记术(EMA)数据,采集成本高、规模有限,导致模型泛化能力不足。
提出ArtBoost,利用大规模语音-3D面部网格数据集(如TFHP)生成伪发音轨迹。流程包括: 1. ASR引导的语句分割,将长视频切分为与EMA数据集兼容的语句级片段。 2. 从面部网格中追踪可见发音器官(上唇、下唇、下切牙)的运动轨迹,转换为12通道伪标注。 3. 预训练AAI模型(仅监督可见通道),然后在真实EMA数据上微调(全通道监督)。
ArtBoost通过大规模合成数据缓解了AAI数据稀缺问题,方法简洁有效,具有较好的可扩展性。
短时说话人验证(SDSV)中,测试语音通常短于3秒,导致说话人表示不稳定,对噪声和音素变化敏感,性能下降。
提出混合注册与帧级神经重评分结合的方法,有效解决了短时说话人验证中的表示不稳定问题,并在大规模数据集上验证了有效性。
现有Codecfake(CF)检测基准主要集中于英语(少量中文),忽略了东南亚(SEA)语言。SEA语言具有独特的语音、声调及韵律结构,导致英语训练的检测器泛化性差。此外,现有音频语言模型(ALM)体积庞大,不适合低资源、低延迟场景。
该工作填补了SEA语言CF检测的空白,并提供了实用化的轻量级解决方案。
现有语音质量评估方法通常关注整体自然度,而非语言发声(Non-verbal vocalizations, NVs)的评估主要检查类型和位置正确性,忽略了NV事件自身的感知质量。通用多模态大语言模型(如Gemini)在NV质量评估中与专家评分不一致,无法可靠替代人工判断。
NVMOS是首个能够可靠预测语音中非语言发声感知质量的专用模型,通过局部事件聚焦设计实现了与专家评分高度一致的性能。
传统的 Dec-IVA 方法在分布式麦克风阵列中,由于不同阵列间的输出排列不一致(permutation inconsistency)以及源模型假设的强跨阵列依赖,导致分离性能提升有限,甚至不如局部 IVA。
首次将 DOA 几何约束引入分布式 IVA,通过约束排列和弱化跨阵列依赖,实现了更鲁棒、更高效的分布式盲源分离。
细粒度音色迁移中,源乐器的乐器特有表现细节(如颤音、起音)与目标乐器不兼容,导致音色模糊和伪影。现有方法(如ControlNet微调)会刚性保留所有细节,损害目标音色真实性。
提出AdaTT:一种目标自适应机制,在ControlNet框架内通过文本提示动态缩放音高和响度控制信号的帧级影响。包含两个关键模块: - Control Scale Predictors (CSPs):对ControlNet输出进行帧级缩放。 - Text-Guided CSPs (TG-CSPs):结合文本嵌入独立调节音高和响度控制输入,实现信号级调制。 此外,设计半自动数据构建流水线,利用SAO-ControlNet推理和专家验证生成跨乐器配对训练数据。
在URMP和Solos数据集上,AdaTT在CLAP分数(音色保真度)和Chroma分数(结构一致性)上均优于基线(SAO-ControlNet),尤其在跨乐器迁移中表现更佳。音频示例见项目页面。
AdaTT通过目标自适应控制平衡结构保持与音色真实性,是细粒度音色迁移的有效方案。
现有音频语言模型(ALM)的提示学习主要集中在文本编码器上,忽略了音频编码器侧的可学习提示潜力,导致跨模态对齐受限,难以适应少样本音频分类任务。
提出音频侧提示学习(ASPL)框架,在音频编码器的三个关键阶段注入可学习的连续提示向量(仿射变换),实现阶段式调制: 1. 频谱调制:在log-mel频谱图上进行频率维度的缩放(类似可学习均衡器)。 2. 令牌级提示:在Patch Embedding后的令牌特征上进行通道维度的重校准。 3. 结构提示:在首个Swin Transformer块的输出上进行早期层条件化。 该模块可与现有文本侧提示方法(如CoOp、CoCoOp、PALM)即插即用,参数高效(共享类间参数)。
在11个数据集上的16-shot设置下,ASPL*(完整三阶段)平均提升约1.1%的Top-1准确率,且参数开销极小。与PALM结合时,平均准确率从77.86%提升至79.26%。
通过对称地在音频编码器侧引入轻量级阶段性调制,有效弥补了文本中心提示方法的不足,为少样本音频分类提供了一种高效互补方案。
微调大规模Transformer基础模型(如Whisper、AST)在语音和音频任务中计算和内存成本高昂。现有参数高效迁移学习(PETL)方法(如Bottleneck适配器、LoRA、Conformer适配器)虽然降低了参数量,但性能仍有提升空间,且未能利用新兴的状态空间模型Mamba的优势。
这是首次将Mamba状态空间模型作为参数高效迁移学习技术应用于语音和音频,通过轻量级共享投影和低秩Mamba块,在显著减少参数的同时,实现了可比或更优的性能。
病理语音(如帕金森病、ALS等)常存在不均匀退化:部分词语清晰(锚点),其余区域严重失真。现有方法(SFT、句子级GRPO)无法区分忠实重建与流畅改写,且依赖大量配对数据。
提出AP-GRPO框架,包含: - 锚点门控奖励:保留可靠的可听锚点; - 帧间音素对齐奖励:通过病理风格文本到音素路径(TTDS)与原始语音的音素后验图(PPG)进行软动态时间规整(Soft-DTW)匹配,衡量重建内容的音素支持度。 该框架无需参考文本,直接利用患者自身语音信号作为对齐目标。
在ALS、脑瘫、痴呆、帕金森四种疾病上,AP-GRPO显著提升重建忠实度:最严重条件下词错误率(WER)从0.75降至0.29。同时有效抑制幻觉插入,适应不同疾病严重性而不需手动调参。
首个将组相对策略优化(GRPO)与音素对齐结合用于病理语音重建的方法,利用锚点结构实现自适应且可解释的语音恢复。
现有语音深度伪造检测方法通常将整个话语作为黑盒处理,通过时间平均或注意力机制聚合声学特征,忽视了不同音素类别携带的信息量差异,导致决策缺乏可解释性。
提出音素引导的交叉注意力框架,将检测分解为可解释的音素条件过程:基于三个概率假设(音素估计充分性、声学主导音素估计误差、音素先验无信息),将欺骗后验概率因子化为音素类别出现权重与类条件欺骗概率的加权和。架构使用自监督声学流(XLS-R)和音素后验概率图(PPG)交叉注意力,音素锚点作为查询,声学特征作为键值,输出显式的每音素权重,实现结构化的可解释性。
在三个数据集(LJSpeech衍生、ASVspoof 2019 LA、ASVspoof 5 Track 1)上验证,发现塞音、擦音、塞擦音、鼻音和静默边界闭锁具有最高判别力,而元音和半元音重要性较低。通过音素组消融实验证实了这一排序。
首次将音素级可解释性内置到深度伪造检测架构中,通过概率因子化和交叉注意力实现透明决策,兼顾性能与解释性。
现有呼吸声学基础模型(FM)在咳嗽分类任务上表现优异,但对其从咳嗽音频中预测连续健康指标(如年龄、BMI、疾病概率)的能力几乎没有探索。先前研究仅评估单一模型、线性探测,缺乏多模型比较、非线性头评估和跨数据集泛化。
本文提出了一个多模型、多目标的咳嗽回归基准,评估五种冻结的FM(OPERA-CT, OPERA-CE, OPERA-GT, HEAR, M2D+RESP)在三个数据集(CIDRZ、Coswara、CoughVID)上的六个回归目标(年龄、BMI、X光异常概率、结核概率)。比较了三种回归头:线性、MLP-small(256单元瓶颈+dropout)和全MLP。采用受试者分离协议,报告MAE并与均值预测基线(MAD)对比。
本文系统评估了呼吸声学基础模型在咳嗽连续量回归上的能力,揭示了模型、头容量与数据集大小之间的权衡,为低资源临床部署提供了指导。
说话人去识别(Speaker De-identification)的关键挑战在于平衡隐私保护(移除说话人身份信息)与下游任务效用(如认知健康检测)之间的冲突。传统基于解耦(disentanglement)的方法假设隐私变量(说话人身份)与效用变量(如痴呆症状态)独立,但在健康领域这些变量常常相关,导致隐私泄露或效用损失。
提出 DDPO-VC 框架,通过强化学习(RL)后训练扩散模型(Diffusion Model)实现说话人去识别。主要创新点: 1. 使用扩散模型进行语音生成,避免量化损失,提升自然度。 2. 引入强化学习(DDPO)通过奖励信号优化隐私-效用权衡,无需对潜在变量做显式建模。 3. 结合隐私教师(说话人验证器)和效用教师(痴呆症分类器)设计奖励函数。 4. 采用归一化奖励和信任区域约束稳定训练。
在两个痴呆症语音基准(ADReSS 和 FHS)上,DDPO-VC 在隐私保护(EER)和认知效用(AUC)方面均优于多种强基线方法。
提出了一种新颖的基于 RL 后训练扩散模型的说话人去识别框架,有效处理隐私-效用相关场景,尤其在健康领域表现出色。
当前基于LLM的TTS方法(如CosyVoice)缺乏对说话风格中韵律模式的显式建模,导致合成语音的说话人相似性受限。已有方法(如CoT prompting)静态预计算整个话语的韵律,忽略了目标语音的特定风格。
提出动态韵律预测方法:在生成每个音节的语音帧之前,基于目标文本、参考语音以及先前已预测的语音,动态预测当前音节的韵律。韵律由音节级特征(时长、平均能量、平均音高、音高范围)经k-means聚类得到韵律token。整体架构基于CosyVoice,LLM交替生成韵律token和语音token,并利用先前生成的韵律和语音token作为条件。
在中文数据集(ESD、内部、AISHELL-3)上进行了MOS和偏好测试。与CosyVoice(50k)和CoT方法相比,所提方法在MOS上略有提升或持平,但在偏好测试中表现出更高的说话人相似性(ESD上偏好达51.5%)。此外,动态韵律预测方法在小规模训练数据上展现出缩小韵律学习差距的潜力。
动态韵律预测通过将先前预测语音融入韵律建模,有效增强了LLM-based TTS的说话人相似性。
DuraMark: Duration-Embedded Watermarking in LLM-based TTS
DuraMark 通过创新的时长级水印嵌入范式,在保证语音质量的同时,大幅提升了对抗生成式攻击的鲁棒性,为 LLM-based TTS 的版权保护和溯源提供了新方案。
现有音频水印检测研究缺乏统一的大规模基准,无法系统比较不同水印注入方法在真实分布偏移(如压缩、噪声、对抗攻击)下的检测性能。
VoxWatermark填补了音频水印检测缺乏统一基准的空白,为鲁棒检测研究提供了标准化平台。
现有文本到音频(TTA)生成虽进步显著,但音频编辑面临两大挑战:时间一致性(仅修改目标区域)和背景保持(非编辑背景音不变)。由于音频的叠加特性,现有方法难以解耦重叠声音,导致修改特定部分时引起整个音频的意外变化。基于训练的方法需构建复杂三元组数据集或依赖专用架构,计算开销大且灵活度低。
通过定量和主观实验,FreeSonic在多种音频编辑任务中实现了高保真度和一致性。消融研究证实了各组件的贡献,效率分析显示推理速度优于现有模型。
首次将RF反转引入免训练音频编辑框架,通过时序感知解耦注意力实现了精准、一致的音频编辑,兼顾时间一致性与背景保持。
现有基于反演的音频编辑方法(如SDEdit、ODE反演)需要在噪声状态下折中:浅噪声保留源细节但编辑不足,深噪声增强语义但破坏瞬态、节奏、音色等感知细节。缺乏直接保留源结构的同时实现语义变化的方法。
提出AudEdit,一种无需训练、无需反转的文本引导音频编辑框架,基于预训练的整流流音频生成器(Stable Audio 3)。核心思路:直接构造源到目标的ODE路径,在每个流步骤中,比较目标条件和源条件的速度场(在共享随机源边际下),并利用它们的差异更新编辑潜变量。不经过噪声状态,无需优化或注意力图访问。
在FSD50K音效集和Song Describer Dataset音乐集上,AudEdit相比SDEdit、ODE反演和FireFlow三个强基线,在CLAP文本对齐和音频保留方面均取得一致提升。例如,音效集上目标文本CLAP相似度从0.42提升至0.52,FAD从65.70降至50.37。
AudEdit通过无反转的源到目标速度差分流编辑,在保留音频细节的同时显著提升编辑语义对齐,为文本引导音频编辑提供了高效、无需训练的解决方案。
当前大型音频语言模型(LALM)在复杂音频推理任务中存在以下问题: - 缺乏问题条件化的感知,无法聚焦于与问题相关的音频片段; - 推理链不可检查,难以验证其真实性; - 缺少领域知识且无法重新访问音频以恢复遗漏信号; - 评估不仅关注答案正确性,还需推理过程忠实于音频证据(如Interspeech 2026音频推理挑战赛的rubric评分)。
提出EChO-Agent,一种模块化智能体框架,将复杂音频问答分解为四阶段流水线: 1. 工具增强观察:根据问题类型静态调度预定义工具(音频事件检测、ASR、语音情感识别、音乐分析),生成原始观测。 2. LLM证据整合:使用DeepSeek-V3进行相关性过滤、跨观测合成和证据结构化,将原始观测转化为紧凑、问题导向的证据链。 3. 证据条件音频推理:以Qwen-3-Omni-Instruct为骨干,结合原始音频、问题和结构化证据,生成逐步推理的候选答案。 4. 验证与输出仲裁:进行格式合规性检查、推理-答案一致性检查,并通过双通道仲裁从两个候选答案中选择最终输出。
关键创新点在于将工具输出转化为结构化证据,并强制推理过程基于证据,同时引入自我验证机制。
EChO-Agent通过结构化证据链和自验证机制显著提升了音频推理的准确性和推理过程的可信度,为解决LALM在复杂音频推理中的局限性提供了有效方案。
总结生成失败: 'utf-8' codec can't encode character '\ud835' in position 11587: surrogates not allowed
深度学习模型处理多维信号时,学习到的表示缺乏显式信号结构且难以检查,导致可解释性差。
该论文通过多分辨率滤波器组和Volterra核构建可解释、节俭的深度学习系统,在多个应用领域实现了高性能与紧凑表示。
生成具有情感表达的自然语音,特别是在单一说话人情感合成和跨说话人风格迁移(目标说话人仅有中性数据)任务中,控制语音的表现力和自然度是主要挑战。
通过潜表示学习,该方法在 VLSP 2022 情感语音合成任务中展现出潜力,但自然度仍有提升空间。
现有空间自监督音频模型在宏观声源定位任务上表现优异,但未能验证它们是否真正编码了微观的耳间相位精细结构(微秒级),而非依赖简单的启发式策略(如频谱时间干扰纹理)。
该工作通过严格的BMLD基准暴露了当前空间音频基础模型在真实相位编码上的根本缺陷,揭示了模型依赖频谱时间干扰纹理而非跨通道相位计算的机制,为未来研究指明了方向。
当前自监督音频表示学习严重依赖大规模真实音频数据集(如AudioSet、LibriSpeech),带来高昂的数据收集、清洗和隐私成本,且学到的表示易受数据分布偏差影响,缺乏对音频生成因素的可解释性。
提出AudioPG框架,完全摒弃真实数据,采用程序化音频合成器实时生成无限多样的音频课程。合成器基于物理声学原理,通过参数化基元(谐波合成、调频、宽带脉冲、ADSR包络、瞬态噪声、频谱阻尼等)组合生成波形。然后训练Transformer掩码自编码器(MAE)在log-Mel频谱图上进行75%掩码重建,迫使模型学习音频的组成结构规律。预训练仅需单GPU 20分钟,无需任何真实录音。
首次验证了无需真实数据的纯合成音频预训练可达顶尖迁移性能,兼具高效、可解释和强泛化能力。
提出了一种高效的多模态LLM框架,通过生成式分类统一声学与文本特征,实现了对神经退行性疾病的高精度分期。
该工作通过声学相似性引导的上下文学习,实现了无需微调的跨会话语音情感合成标注,为VR协作场景提供了高效的数据驱动决策支持。
传统TTS系统依赖离散的Unicode嵌入,每个字符独立处理,导致对未见字符泛化能力差,跨语言适应时需扩展嵌入矩阵,增加模型复杂度和训练成本。
提出Pixel-TTS,首个基于视觉文本表示的端到端TTS框架。将文本渲染为16×16灰度图像,通过2D卷积(核大小16×16,步长16×16)将每个patch映射为512维嵌入,利用ConvNeXtV2块处理。采用条件流匹配(CFM)损失,结合CTC文本对齐和HuBERT语音表示对齐的辅助损失。无需嵌入矩阵扩展,利用视觉相似性加速收敛。
Pixel-TTS通过像素级文本编码有效提升了TTS在跨语言、低资源和噪声场景下的泛化能力,同时保持合成质量。
现有音乐与机器学习之间的类比停留在隐喻层面,缺乏形式化的结构同构性证明。
将音乐分析与机器学习机制进行形式化同构映射,并通过反向声化验证结构对应关系,提出手性概念,具有跨学科创新性。
BayLing-Duplex以极简的令牌设计实现原生全双工语音对话,在极低数据量下达到甚至超越大规模全双工模型性能,为学术友好和高交互性能兼顾提供了有效方案。
现有助听器算法评估和训练的数据集要么是模拟数据(不够真实),要么是录音数据(但缺乏多种场景同时覆盖)。多数数据集仅包含脉冲响应或仅包含音频,且很少同时考虑多种麦克风/扬声器配置、多种耳塞类型以及多种混响条件。
本文提出HIDVAS数据集,同时满足以下所有自由度: - 麦克风配置:耳背式(BTE)助听器麦克风、鼓膜处麦克风、外部麦克风; - 扬声器配置:外部扬声器(8个不同角度)和耳内接收器(RIC)扬声器; - 耳塞类型:开放式、半开放式、封闭式、无RIC; - 录音内容:脉冲响应(扫频)和音频(男女语音、语音噪声、歌声、弦乐、管乐、打击乐); - 混响条件:4种T30(0.09s、0.47s、0.73s、1.48s),通过改变房间和吸音材料实现。 数据以“助听器一体盒”形式提供,包含所有通道对,并保留硬件效应,增强真实感。
通过三个用例展示数据集价值: 1. 反馈路径:开放/半开放耳塞的反馈路径相似且远大于封闭耳塞; 2. 直接-混响比(DRR):BTE麦克风的DRR低于靠近声源的外部麦克风,且随混响时间增大差异增加; 3. 泄露:开放/半开放耳塞的声泄露明显高于封闭耳塞。 数据集公开可用。
首个同时涵盖多种耳塞、多麦克风、多扬声器、多混响条件以及脉冲响应+音频的助听器数据集,为算法评估与训练提供了高度真实的“一体盒”平台。
现有AAD模型未充分挖掘频域EEG信息,多频带处理多采用手工特征或浅层拼接,忽略了频带特有模式和跨频带交互。
提出FAConformer框架:1) 将EEG信号分解为多个频带,每个频带由独立CNN-Transformer编码器进行频带特异性建模;2) 频带感知注意力(FAA)模块将频带特征作为token进行自适应融合;3) 频带辅助监督(BAS)防止弱贡献分支欠优化。
在DTU和KUL数据集上,三种决策窗口长度下,FAConformer一致优于12个基线方法,分别比当前SOTA高4.9%和3.0%。
FAConformer通过层次化频带感知建模,有效利用了频域信息,显著提升了AAD性能。
该工作首次正式定义并评估了集成说话人日志、识别和拒绝未知说话人的统一任务,并发布了大规模基准数据集。
现有自监督语音模型(如wav2vec 2.0、HuBERT)编码了韵律、说话人、语言等纠缠信息,导致在仅依赖韵律的任务中鲁棒性不足;手工设计的韵律特征可能不完整或次优。
与手工特征、大型自监督模型(wav2vec 2.0、HuBERT等)、emotion2vec及VQ-VAE基线相比,提出的嵌入在挑战性条件下表现出竞争性或更优的性能,尤其在跨说话人和跨文本场景中更具鲁棒性。
该工作系统地探索了基于自编码器的全局韵律嵌入提取方法,并提供了新的评估基准,证明了纯韵律表示在解耦和鲁棒性上的优势。
本工作首次将角色条件(role-conditioning)引入实时多人语音对话的 turn-taking 决策,通过语音LLM和推理增强显著提升 role-consistent 行为,是角色扮演语音代理的重要进展。
现有高保真有限元模型计算成本高,难以进行大规模参数研究;简化模型无法捕捉真实声门形态和生理机制。
提出一种计算高效的声带生物力学模型,将声带分为体层(beam)和覆盖层(membrane),耦合喉内肌激活的后置模型(posturing model),通过静态映射获得声带预应变和声门角度,作为动态beam-membrane模型的输入,模拟发声时的流固耦合和碰撞。
模型产生的发声特征与高保真有限元模拟和临床研究定性一致,能复现后部声门开放、前部声门开放、沙漏形等声门形态对发声动力学的影响,计算成本大幅降低。
该工作提供了一个兼具生物力学可解释性和计算效率的声带模型,为探索正常发声及嗓音障碍机制提供了实用工具。
当前级联式口语对话系统(如 Unmute)因被动检测说话结束(endpoint)导致延迟瓶颈(通常 1-2 秒),而人类仅约 250 ms 响应。
提出 Endpoint Anticipation (EPA):基于语音的双流 Transformer 模型(EPA-S 单目标、EPA-M 多目标),提前 0.32-2.56 秒预测用户话轮结束信号;在用户说话期间即可启动 LLM 和 TTS 的推测执行(speculative execution),若预测错误则丢弃预计算内容。引入 MRA、PAR、ERC、HEA 四项指标衡量延迟降低与计算冗余的权衡。
在 SpokenWOZ 和 Switchboard 数据集上,EPA 优于 VAP 基线:以 640 ms 为目标时,MRA 达 640 ms(最大降低),HEA 约 67%,PAR 约 66%,ERC 约 34%。集成到 Unmute 后,平均延迟降低 505 ms(相对 28.4% 计算冗余增加),有效掩盖级联处理瓶颈。
首项将端点检测从被动转为主动预测的工作,在保持实用性前提下显著降低延迟。
传统音频插件开发的工作流程在效率与迭代速度之间存在矛盾:原生编译追求高性能,但修改代码后需重新编译、加载插件,周期长;而动态解释则牺牲性能。FAUST语言虽简化了DSP描述,但编译-重载循环仍然存在。
本文提出 faust2clap,一个将 FAUST DSP 规范编译为 CLAP 插件格式的双模式编译系统: 1. 静态模式:预先编译生成原生二进制,实现最高效率。 2. 动态模式:通过运行时解释(libfaust 虚拟机和文件监控),支持不中断宿主应用程序的 DSP 代码热重载。 3. 参数身份保持:提出基于地址的身份匹配算法和稳定插槽分配方案,确保热重载后参数值和宿主自动化绑定得以保留。 4. 自动分类启发式:根据元数据、文件名词汇和结构分析自动将 DSP 分类为效果器或乐器。
faust2clap 是首个官方维护的 FAUST 到 CLAP 编译通道,通过双模式设计和稳定的参数身份保持,显著提升了音频插件开发的迭代效率。
神经网络语音增强需要配对的失真和干净参考信号,但模拟数据与实际环境不匹配,导致在真实场景(如CHiME6)中性能受限。
提出Close-to-Distant microphone Projection (C2D projection),利用训练阶段可用的近麦(CM)和远麦(DM)真实录音,估计一个投影矩阵(基于PMWF变体),将CM信号转换为与DM对齐的干净参考信号,同时抑制噪声和干扰。
在CHiME6 ASR任务上,使用C2D投影生成的训练数据训练的NN,以GSS输出作为辅助输入时,在oracle说话人分割下优于GSS基线。在CHiME8任务(使用估计的说话人标签)中,尽管存在训练与测试条件不匹配,该方法在大多数ASR场景下仍取得改进。
一种利用真实近远麦录音生成训练目标的创新方法,有效提升复杂场景下的语音增强性能。
多说话人语音识别(multi-talker speech recognition)的传统方法通常采用流水线(pipeline)方式,将自动语音识别(ASR)和说话人日志(speaker diarization)分开处理,但这种方式无法直接结合语义和说话人身份信息,尤其在语音重叠(overlap)场景下表现不佳。基于大语言模型(LLM)的方法虽然能联合建模,但需要大规模、高标注成本的多说话人语料。
本文提出了一种在有限真实录音数据下高效训练LLM系统的方法,主要贡献包括: - 双编码器架构(Dual-encoder):使用SenseVoice-small作为ASR编码器提取语义特征,Campplus作为说话人特征编码器提取说话人特征,并通过适配器(adapter)投影到统一维度。 - 特征交织(Temporal Interleaving):将语义特征序列和说话人特征序列按时间片交织,每个片段前加特殊标记,利用位置编码对齐。 - 长度感知说话人ID损失(Segment-aware Speaker ID Loss):按说话人片段的长度加权计算交叉熵损失,更好对齐日志评估指标(如cpCER)。 - 自适应损失掩码(Adaptive Loss Masking):根据损失分布动态屏蔽高损失token(通常来自重叠区域),减少幻觉(hallucination)。 此外,采用多阶段训练:先纯ASR训练,再加入说话人信息联合训练,然后模拟长对话,最后在真实会议数据上微调。
在AliMeeting和Aishell4语料上,相比开源基线(如SpeakerLM等),相对改进分别达到18%和24%。
通过结构设计和损失函数改进,有效平衡了ASR和说话人日志任务,在有限数据下实现了显著性能提升。
STFT语音增强中,重叠分析帧导致相邻帧高度相关,产生冗余计算,尤其是在轻量级模型中。
提出HALO(Half-frame-rate Adaptive Learnable Operator),一种因果即插即用模块,在不改变STFT流程的前提下,将内部帧率减半。HALO包含两个自适应可学习算子:帧率压缩算子(D)和帧率恢复算子(U),均基于轻量级动态卷积。压缩算子融合相邻两帧信息,恢复算子从半帧率输出恢复全帧率频谱。HALO不增加算法延迟,可集成到多种轻量级STFT后端。
在DNS3数据集上,将HALO集成到GTCRN等轻量级模型中,在相近计算复杂度下,PESQ、ESTOI、SI-SNR等指标均一致提升。消融实验表明,直接去除重叠或简单降采样会显著降低性能,而HALO自适应算子有效保留了语音细节。
HALO通过降低内部帧率有效减少重叠引起的冗余计算,是一种通用且高效的轻量级语音增强加速模块。
语音令牌在时间粒度上与文本令牌不匹配:语音令牌速率(12.5-50 Hz)远高于文本令牌速率(约3.32 Hz),导致每令牌语义密度稀释,削弱了文本LLM预训练的原生推理能力。
该论文通过量化分析和新颖的令牌化设计,揭示了帧率和对齐深度对跨模态推理迁移的关键影响,为构建高效语音对话模型提供了实用指导。
提出一种数据无关、训练无关的语音基础模型压缩方法,通过参数聚类融合而非剪枝,在保持性能的同时提升硬件部署友好性。
多说话人ASR语料库的标注通常松散(包含停顿和边界填充),导致说话人日记模型训练后输出边界不紧凑,影响下游任务(如引导源分离、对话模型训练)。现有紧标注获取成本高(如DIHARD需资深标注者,VoxConverse依赖视频且耗时),且强制对齐方法受限于多通道录音。
提出利用因果模型与反因果模型(无法学习填充/补全行为)输出生成更紧凑的伪标签,并设计协同训练(co-training)框架: 1. 因果模型:只能利用过去信息,无法填充段前边界或预判静默; 2. 反因果模型:只能利用未来信息,无法填充段后边界; 3. 双模型输出加权后掩盖原始松散标签,生成紧伪标签,并迭代联合训练逐步紧化。
在多个数据集上,所提方法恢复了约70%的理想紧标签训练效果,显著提升下游任务性能(如语音分离中的掩码估计)。
通过因果-反因果一致性约束,首次实现仅利用松散标注即可训练输出紧凑边界的说话人日记模型,兼具实用性与有效性。
论文针对语音基础模型(SFM)知识蒸馏中训练效率低下的问题。现有堆叠方法(如 gradual stacking、MIDAS)通过分阶段逐步增加模型深度来加速训练,但会导致性能下降,原因是层位置不一致破坏了 SFM 各层特有的知识。
提出交错堆叠(Interleaved Stacking):在每个训练阶段,每隔 b 层选择一层复制,并将复制层插入到原始层之后,从而保持各层在整体中的相对位置不变。该方法保留了层位置一致性,并且自然兼容中间层知识蒸馏损失,有助于传递层特定知识。
在 SUPERB 基准上(PR、ASR、SF、SID 任务),使用 HuBERT 作为教师模型,12 层 Transformer 学生模型,采用 4 阶段训练。与 gradual stacking、MIDAS 以及无堆叠的全模型相比,交错堆叠在 Equal 和 Prop-1 两种调度策略下均取得最佳或接近最佳的性能,且训练速度提升约 1.2 倍。进一步实验表明,中间层 KD 损失权重 w 的加入可带来额外性能增益。
本文首次将堆叠方法应用于 SFM 蒸馏加速,提出的交错堆叠有效缓解了性能损失,具有实用价值。
现有神经语音编解码器多采用预设速率的离散符号(如VQ索引)或仅在符号生成后应用熵编码,导致表示学习与概率建模脱节,无法有效利用语音潜在变量的非均匀分布和时间依赖性。
本文提出ECC(Entropy-Constrained Codec),将标量量化与学习的熵模型结合,构建端到端率失真优化框架。主要创新点包括: 1. 基于超先验的侧信息、通道上下文建模、潜在残差预测和轻量级时间建模,用于训练时的率估计和推理时的算术编码。 2. 熵跳过(entropy skip)机制:利用解码器可用的尺度估计省略高度可预测的残差符号,无需传输额外跳过掩码。
在ViSQOL和PESQ指标上,ECC平均BD-rate比传统和神经编解码器基线分别降低39.9%和76.3%。在LibriTTS和VCTK数据集上,相比FunCodec,ViSQOL BD-rate降低44.2%/35.7%,PESQ BD-rate降低69.4%/83.3%。
ECC通过显式熵建模实现了低比特率下的优异率失真折衷,是神经语音压缩领域的一项重要进展。
生成式空间音频(尤其是First-Order Ambisonics, FOA)的评估缺乏公认的度量标准,现有指标(如FAD、强度向量)对空间控制参数(方位角、仰角)变化的敏感性尚不明确,难以判断模型是否遵循空间控制。
提出一个元评估框架,沿连续空间轨迹分析指标行为,定义三个理想属性: - Responsiveness(响应性):指标对参数变化的响应幅度,通过拟合三角模型(tent-like)的斜率并加权拟合优度(R²)量化。 - Smoothness(平滑性):指标沿轨迹的局部规则性,基于相邻样本间距离的方差计算。 - Symmetry(对称性):对称位置(如±90°)指标值的一致性,通过均方根误差(RMSE)取负指数得到[0,1]分数。
使用SoundSpaces 1.0的FOA房间冲激响应,生成三种复杂度递增的场景(单源、多源、单源多实例),并加入噪声,对常用指标进行系统评估。
首次系统性地对生成式空间音频评估指标进行敏感性分析,为选择合理度量提供了方法论和实证基础。
Gumbel-BEARD通过自动层选择,以极低计算成本实现低资源域自监督适应,取得多个儿童语音和方言数据集SOTA。
大型音频语言模型(LALMs)在音频理解中表现优异,但内部注意力机制不透明,难以定位具体声音事件的发生时刻。传统方法依赖专门训练或模态对比,无法有效揭示模型的时间注意力分布。
提出基于指令的激活引导(Instruction-Based Vector Steering):在固定音频输入下,对比不同指令(如“关注音频中有意义的部分”与“关注整个音频”)的模型激活差异,构建导向向量。注入该向量后,模型将更多注意力集中到与目标事件相关的音频区域,从而在不修改模型结构或不训练的情况下实现时间定位。
在自建的三事件组合音频基准上,通过读取导向引起的注意力变化,提出的窗口选择方法在Qwen2-Audio和Audio Flamingo 3上分别达到60.87%和68.72%的区间重叠率,显著高于直接提示(31.84%, 46.75%)和随机基线(27.74%)。分析表明该方法在后半层有效,且注意力变化与事件位置高度对应。
一种简单、无需训练且可解释的激活引导技术,能够有效重定向LALMs的时间注意力,并从中提取精确的事件位置。
全双工口语语言模型(FD-SLM)在同时听和说时,内部状态切换存在延迟(称为“状态惯性”),导致在用户突然打断时,模型仍偏向生成状态,错过用户输入的开头信息。
在PersonaPlex上,正确率从28%提升到45%,IWOR从40%提升到72%;其他多个FD-SLM上也有显著改进。
本文首次揭示了全双工口语模型的状态惯性现象,并提出了一种无训练的激活引导方法有效缓解该问题。
传统语音分析或仅关注词的时序位置(无物理时长)或将时长作为因变量,缺少将语义视为随时间连续变化的信号并分析其时间结构的方法。
提出语义时间尺度分析管道: 1. 将带时间戳的文字转录转换为语义时间序列: - 使用WordNet词深度(word depth)度量词汇通用/具体程度 - 使用SBERT嵌入计算上下文相似性 2. 用自相关窗口(ACW-0, ACW-0以外的衍生指标)量化时间依赖性 3. 设计多种打乱控制条件(随机词序、随机时长等)验证非随机性
本文为分析人类与AI语音的时间语义结构提供了简单可解释的时域特征框架,有望应用于语音处理和临床语言评估。
现有的开放词汇关键词检测(OV-KWS)系统结合上下文偏置(CB)能改善自动语音识别(ASR)对罕见专业术语的转录,但仅支持几百个术语的词汇表,无法扩展到大规模数据库。存储和延迟随词汇量线性增长,导致生产环境不可行(如12层Whisper-medium特征约7.3MB/词,80GB GPU仅能容纳约11,650词)。
本文提出三层压缩机制: 1. 层选择压缩:通过可学习的稀疏得分向量(sparsemax激活)自动选择最预测性的Transformer编码器层(从32层中选出l_comp层),减少层数。 2. 隐藏维度压缩:使用单隐藏层前馈网络(FFN)将隐藏维度从h(1280)降至h_comp。 3. 帧率压缩:利用1D卷积网络沿帧方向降低时间分辨率(从50帧/秒降至更低,因子α)。 整体压缩128倍,特征大小降至约57KB/词,48GB GPU可容纳约894,784词。无需微调Whisper模型,模块化训练。
提出一种可扩展的开放式关键词检测系统,通过有效的特征压缩大幅降低存储和延迟,适用于大规模生产环境。
现有基于RNN(如GRU、LSTM)的语音抑郁症水平估计方法难以捕捉长距离依赖,提取的特征主要集中于相邻语音片段,忽略了全局时序信息,导致抑郁相关关键特征提取不充分。
提出MA-DLE(Memory-Augmented Depression Level Estimation)框架,第一个将外部记忆库机制引入抑郁症水平估计。具体包括: 1. 记忆增强特征:通过余弦相似度从历史特征中筛选与当前GRU输出高度相似的特征作为语义补充;同时从低相似度特征中提取动态记忆特征(基于特征变异性),捕获行为与情绪波动。 2. 层次注意力融合模块(HAF):有效融合GRU输出、相似性检索特征和动态特征。
在DAIC-WOZ和E-DAIC数据集上达到当前最优性能(具体数值未在截取部分给出)。
首次将外部记忆机制应用于语音抑郁症自动评估,通过选择性记忆增强有效缓解了长期依赖建模问题。
现有全双工口语对话模型仅通过监督学习(token级似然最大化)训练,无法直接优化交互级行为,导致交互性问题,如过度沉默、时机不当的轮换、缺乏背面通道等。
提出基于强化学习的后训练对齐方法,全面改善全双工模型的交互性。具体包括: 1. 针对四个核心交互轴(暂停处理、轮换、背面通道、用户打断),从人类对话语料中自动提取短音频片段。 2. 使用轴特定奖励函数,通过组相对策略优化(GRPO)进行优化。 3. 额外引入基于LLM的奖励(LLM Judge)防止语义质量下降。
在两个开源模型(Moshi和PersonaPlex)上应用该方法,在Full-Duplex-Bench v1(离线评估)和v2(实时多轮对话评估)上均取得一致的交互性改进。
该工作首次系统性地通过RL全面优化全双工模型的多个交互维度,并验证了跨模型泛化性。
机场场面运行(尤其是高吞吐量枢纽)成为系统性能的瓶颈。着陆飞机的跑道出口选择和是否穿越活跃离场跑道(或使用端绕滑行道)的决策依赖复杂、上下文相关的因素(如进近速度、机型、机位、交通率、天气),且现有预测模型多为二元分类,忽略了实际运行中多个出口的差异和少数类样本的预测问题。
提出一个两阶段数据驱动的决策辅助框架,模仿管制员工作流:阶段I预测着陆飞机选择的跑道出口(每个流向三个候选出口),阶段II基于该出口预测飞机是否穿越离场跑道或使用端绕滑行道。模型使用ASDE-X轨迹数据、飞机属性、机位目的地、短期交通率(到达、离场、穿越使用)、机场天气等多个特征窗口。基准测试九种分类器(包括线性模型、神经网络、树集成),重点评估随机森林、XGBoost、LightGBM、CatBoost,并采用不平衡感知指标(macro-F1、精确率-召回率曲线、混淆矩阵、Brier分数、预期校准误差)。
本文提供了一个可解释的管制员决策支持工具,通过两阶段预测增强了态势感知,但少数类预测受类别重叠限制,需进一步处理不平衡问题。
哮喘和慢性阻塞性肺病(COPD)的鉴别诊断在临床上存在困难,因症状重叠易误诊。传统方法如肺功能测试依赖患者配合,且听诊主观性强。现有肺音分析研究多使用单一通道或全周期,未充分利用呼吸子阶段的时间信息,且二维表示(如声谱图)存在时域维度不一致问题。
本文系统优化了肺音二维输入表示和子阶段融合策略,证明MFCC配合简单直接拼接在哮喘与COPD鉴别中效果最佳,且数据增强并非总是有益。
语音增强型大语言模型(speech-augmented LLM)面临语音特征与文本语义对齐的挑战。传统方法直接映射语音到文本,忽略了发音细节,导致同音词混淆,且在低资源场景下性能受限。
提出音素优先(Phoneme-First) 方法,修改LLM提示词为“先转录为音素,再转录为文本”,让模型先预测音素序列,再生成最终转录。音素标签可从现有文本自动生成,无需额外标注。同时提出联合训练(Joint)策略,随机混合标准S2T和音素优先指令,提升泛化能力。
一种简单、低成本且有效的音素中间预测策略,能显著提升LLM语音识别的准确性和可解释性。
现有语音感知LLM通常仅使用单个预训练语音编码器,其性能受限于编码器的特定优势,不同编码器往往具有互补性但未被有效利用。
提出多种语音编码器融合策略,包括:特征拼接、Sigmoid门控、多头注意力门控、位置Transformer和时间Transformer。这些方法在保持序列长度不变的情况下,通过可学习的权重或注意力机制动态组合多个编码器的输出,以利用其互补优势。
本文系统性地探索了多种语音编码器融合策略,实验证明基于时间Transformer的融合方法在单语和多语ASR中均能显著提升性能且计算开销可控。
当前ASR在罕见领域术语和上下文相关的命名实体上识别效果差,现有上下文偏置方法主要依赖关键词列表,无法进行深层推理。
提出一种元数据驱动的推理链训练方法,利用视频描述等广域文本作为弱语义先验,构建400小时推理增强数据(包含ASR错误和LLM生成错误)。通过两阶段流程:先由文本LLM生成推理链(解释基于上下文的修正理由),再微调Speech-LLM执行链式推理(初始转录→上下文推理→最终转录),使模型在保持音频依据的同时实现深度上下文修正。
在YouTube衍生的M³AV测试集上,该方法降低了整体词错误率,尤其在罕见词和命名实体上表现显著提升,为语音识别中的深度上下文推理奠定了基础。
开创性地将链式推理引入语音识别上下文推理,实现从广域描述到深度上下文校正,兼具音频依据与主题一致性。
无监督术语发现中,主流中心聚类方法(如K-means)因归纳偏置产生近似均匀的类别频率分布,无法反映自然语言的长尾Zipfian分布。
本文质疑了中心聚类在术语发现中的主导地位,提出图聚类作为有效且可解释的替代方案,能更好地恢复词汇的Zipfian分布。
该工作将Proxy-Anchor度量学习与架构合并策略结合,有效解决了开放集TTS溯源问题,性能达到SOTA。
核心痛点:当前多模态大模型主要处理单声道音频,丢弃了空间音频中的方向、距离、运动等空间线索,导致无法进行声音定位、空间关系推理和空间场景理解。现有空间音频LLM方法需大幅修改或重新训练原始音频编码器,可能损害语义能力且缺乏灵活性。同时,大规模FOA空间音频QA数据和系统化基准缺失。
方法创新:提出Spatial-Omni,通过轻量级SO-Encoder将一阶Ambisonics(FOA)空间音频作为独立模态注入现有Omni LLM,无需修改原始音频编码器。SO-Encoder并行于原始音频编码器,接收4通道FOA梅尔特征和3通道强度向量(IV)特征,提取时空线索,并通过Temporal Pixel Shuffle Projector压缩为紧凑空间token,与音频、视觉、文本token联合推理。训练采用两阶段:先基于SELD指标监督训练SO-Encoder,再使用空间QA对微调整个模型。
实验结果:在构建的SO-Bench(16个子任务,涵盖基础检测、空间关系、复杂推理)上,Spatial-Omni显著优于现有开源大音频语言模型和Omni LLM,同时保持通用音频理解能力。消融实验证实性能提升主要来自真实空间token。
数据集:构建SO-Dataset(约40万FOA空间音频片段)和SO-QA(210万空间问答对),数据来源包括公开SELD数据集、真实录音和仿真。
一句话评价:首个以独立模态方式集成FOA空间音频到Omni LLM的轻量化框架,有效提升空间音频理解性能且不影响原有语义能力。
传统HMM-GMM在强制对齐任务中仍占主导,但多语言泛化能力有限;现有自监督方法(如MMS的CTC对齐)精度不足,尤其在不同语言上表现不稳定。
提出双阶段架构:1)对齐编码器:融合MMS(CTC词置信度)和UnSupSeg(无监督音素边界检测)两种自监督表示,采用Conformer/VGG等骨干网络进行边界概率预测;2)对齐解码器:可学习动态规划模块,利用四个特征函数(UnSupSeg距离、编码器输出、归一化和、MMS字符似然)联合优化,支持约束词长。训练采用分步迭代:先独立训练编码器(焦点损失解决类别不平衡),再与解码器交替微调。
通过自监督表示融合与可学习动态规划,实现了超越传统工具的多语言词级强制对齐,尤其为难标注语言提供了零样本方案。
当前的语音语言模型(SLM)能够感知副语言线索(如说话者身份、情绪、背景噪音等),但在开放域对话中往往忽略这些线索,导致模型在需要根据副语言线索调整回复的场景下表现不佳。例如,Qwen3-Omni-thinking在VoxSafeBench儿童声音任务中的安全感知率(SAR)仅为6.1%,尽管它能在MMSU副语言相关任务中达到52.8%。这种“感知-行为差距”是论文要解决的核心问题。
论文提出ParaBridge,一种在线自蒸馏(on-policy self-distillation)框架。其核心思想是:利用模型本身在推理时加入副语言指令脚手架(scaffold)后表现出的良好行为,来指导无脚手架模型的学习。具体而言,对于每个音频样本,模型被查询两次:一次无脚手架(学生)生成回复轨迹,一次有脚手架(教师)提供沿该轨迹的完整词汇分布。通过逐token的Jensen-Shannon散度损失,将教师的副语言感知行为蒸馏到学生中。该方法无需外部监督数据、人工标注或奖励模型,且训练时学生采用在线采样,避免了分布不匹配。
在Qwen3-Omni-thinking上,ParaBridge将无脚手架模型的VoxSafeBench SAR从14.6%提升至40.3%(甚至有脚手架基线仅29.0%),EchoMind平均评分从3.27提升至3.92。通用能力方面,MMAU-Pro、VoiceBench和GPQA与原始模型差距均在0.4分以内。该方法还泛化到未见过的副语言线索、从安全导向训练迁移到共情导向对话,并在不同SLM主干(MiMo-Audio-thinking)上验证有效。数据效率高,仅需500个学生rollout即可达到37.6% SAR。
ParaBridge通过在线自蒸馏,无需外部监督即可有效缩小SLM的副语言感知-行为差距,显著提升对话中的副语言响应能力,同时保持通用能力。
传统深度学习声纹认证在边缘设备上面临计算资源瓶颈(GPU依赖、高延迟)和单因素认证的安全漏洞(易受假体攻击和高保真重放)。
提出一种轻量级双因素级联架构: 1. 共享MFCC特征提取:20维静态MFCC + 20维一阶Delta,共40维特征,下游分类器复用; 2. 第一因素GMM说话人筛选:对角协方差GMM,含自适应概率阈值和动态联合绝对-相对边际约束(DLSC),抵御未知说话人和重放攻击; 3. 第二因素DTW口令验证:基于Sakoe-Chiba窗口约束的DTW,保证确定性延迟。
一种在资源受限边缘设备上实现高安全、低延迟的轻量级声学双因素认证方案。
Transformer-based Speech Foundation Models 在处理声学特性不匹配的目标域(如环境退化、带限、方言、儿童语音)时性能显著下降,而全量微调成本高。现有 PEFT 方法(如 LoRA)仅调整全局注意力,缺乏局部上下文建模,无法有效捕获域特定的声学变化。
提出 GC-LoRA (Gated Convolutional LoRA),在 LoRA 瓶颈中嵌入 Conformer 风格的门控深度可分离卷积,专门应用于注意力输出投影 (W_o),以在不破坏预训练全局表示的前提下高效捕获局部声学依赖。通过低秩空间内的点卷积、门控线性单元 (GLU)、深度卷积、组归一化和 Swish 激活实现局部特征细化,保持与 LoRA 相近的参数效率。
在 AMI(混响/噪声)、Switchboard(电话带宽限制)、CORAAL(非裔美国英语方言)、MyST(儿童语音)四个挑战性数据集上,以 Whisper-Medium 为骨干,GC-LoRA 相较标准 LoRA 取得 Word Error Rate (WER) 最高降低 10.9%,且参数量增长极小。全面优于 Zero-Shot、Full Finetuning、Adapter、LoRA-Output、Conv-LoRA、MultiConv-LoRA 等基线。
GC-LoRA 通过轻量级门控卷积注入局部声学归纳偏置,在多种声学域自适应任务中以极小额外参数达成显著性能提升,是一种结构更优的 PEFT 方法。
总结生成失败: Expecting value: line 1 column 1 (char 0)
多语言泛化能力弱、模态对齐困难,现有LLM-ASR框架在跨语言场景下性能下降明显。
在1500小时多语言数据集上,提出的方法(MoE + modified CIF)相比基线LLM-ASR在MLCSLM-dev上WER从23.26%降至15.27%,在CommonVoice-test上从19.57%降至13.87%,在FLEURS-test上从13.05%降至10.46%。扩展至8000小时训练后,进一步在所有测试集上超越Whisper-large-v3。
该工作通过MoE和CIF有效提升了多语言LLM-ASR的准确性和鲁棒性。
现有语音转换方法要么依赖复杂深度神经网络缺乏可解释性(如FreeVC),要么使用全局线性变换(如LinearVC)无法适应局部结构,导致表达力有限。
提出SSL-GMMVC,在自监督学习(SSL)特征空间中使用高斯混合模型(GMM)对源-目标特征联合分布建模,转换时通过后验加权求和实现局部线性仿射变换,兼具可解释性与表达力。提供了全协方差和跨对角协方差两种变体。
一种在自监督表示空间中使用局部线性GMM变换的可解释语音转换方法,兼顾性能与可分析性。
ANCHOR通过层次化多分辨率自回归框架,首次实现了对伪MOS度量的增量预测,在部分输入场景下显著优于现有全上下文模型。
传统Speech-LLM依赖专用语音编码器(如Whisper、Conformer),带来计算开销大、表示不匹配、信息瓶颈等问题。
提出Mel-LLM,一种无编码器架构:仅保留卷积下采样层和线性投影,将Mel频谱图分块直接输入LLM(Phi-4-MM),使LLM自身学习语音-文本对齐。ASR和TTS共享同一LLM骨干,通过LoRA适配。TTS使用连续V AE解码器生成Mel频谱图。
首次系统证明LLM可无需专用语音编码器直接理解并生成连续Mel频谱图,为统一语音-文本建模提供了简洁高效的Encoder-free范式。
DeRA-MOS通过解耦的列表排序和模态对齐损失,显著提升了TTM评估的排序一致性,是高效鲁棒的大规模评估框架。
传统讽刺感知研究依赖自然语音,无法独立控制韵律维度(音高、语速、响度)的因果影响,因为自然语音中这些特征共变。
本文通过可控神经TTS首次实现了对韵律线索独立因果效应的严格检验,揭示了人类与AI模型在讽刺感知中的不同线索加权模式。
多通道语音分离的判别模型在信号保真度指标上表现优秀,但生成的自然度差,存在人工伪影;生成模型(扩散/流模型)虽能提升听觉质量,但推理步骤多、计算开销大。现有级联校正方法(如Fast-GeCo)需要两阶段训练且依赖启发式截断,导致分布不匹配。
提出MeCo(MeanFlow-based One-Step Corrector),基于MeanFlow学习平均速度场,可直接将判别估计(t=1)一步映射到干净语音(t=0),无需启发式截断。引入Data-Space Optimization (DSO),包含两个互补目标: - xr-loss:通过Δ²加权惩罚长位移的预测误差,提升生成质量; - Endpoint SI-SDR loss:直接优化终端信号保真度。
在域内和域外场景中,MeCo均达到SOTA性能,同时获得高信号保真度和优越的人类听觉质量,且计算开销极小(一步推理)。
MeCo通过一步生成校正器有效融合了判别模型的高保真与生成模型的高自然度,在多通道语音分离中实现了效率与质量的平衡。
现有无声语音接口(SSI)中,sEMG和唇读信号各自存在局限性:sEMG对电极放置敏感、存在个体差异和信号漂移;唇读易受光照、头部姿态和遮挡影响。两者融合用于连续语音合成的研究不足,且缺乏对模态退化或传感器故障的鲁棒性。
提出一种掩码多模态语音合成框架,在训练时对sEMG和唇读信号进行模态掩码,迫使模型学习互补的跨模态表示。具体采用时间自适应掩码策略,模拟模态缺失或退化场景。框架包括多模态Transformer编码器,融合后接声码器生成语音。
在多说话人设置下,与最强的单模态基线相比,词错误率(WER)降低高达14个绝对百分点。掩码策略在低比特率条件下表现出关键性,且比特定退化数据增强方法更具泛化性。音素层面分析显示,多模态融合对元音和塞擦音尤其有益,但对爆破音和鼻音的区分仍有限。
该工作首次系统验证了掩码训练在sEMG与唇读融合的无声语音合成中的有效性,显著提升了鲁棒性。
去混响任务中,扩散模型虽表现优异,但其概率解释不适用于确定性卷积混响过程;现有模型未充分利用隐式学习的房间脉冲响应(RIR)信息。
揭示了U-Net去混响模型隐式编码RIR的能力,并提出基于对比学习RIR嵌入的条件化策略,在提升性能的同时加速推理。
现有语音-LLM接口面临两大极端:要么强制离散token对齐(如CTC)导致丢失副语言信息(如情感、韵律),要么使用无约束连续表示导致表示漂移,破坏冻结LLM的自回归解码稳定性。两者都未能正确对齐语音表示与LLM输入空间的几何结构。
提出C-Gate(Convex Gate),一种将语音映射到LLM输入嵌入凸包内的桥梁。具体步骤: 1. 使用Whisper编码器提取语音特征,下采样后通过Q-Former风格的交叉注意力计算与LLM所有token嵌入的相似度。 2. 选择top-16的token支持集,并将该帧表示为这些token嵌入的凸组合(权重由softmax归一化)。 3. 约束每个伪嵌入严格位于LLM嵌入表的凸包内,避免了基漂移,同时保留连续表达能力。 不再使用值投影或后码本MLP,仅训练桥接评分器和温度参数。
C-Gate通过几何约束(凸包)解决了语音-LLM接口中离散锁定与表示漂移的权衡,实现了ASR与副语言任务的联合提升,并揭示了嵌入空间轨迹的结构重要性。
当前ASR模型规模巨大,参数数量成为部署瓶颈,传统压缩方法依赖预训练大模型且降低计算预算。
提出Latent-Recursive-Transformer,将编码器分为Prelude、Recurrent block和Coda三部分,其中Recurrent block共享参数并循环迭代,在潜空间进行深度递归。通过层相似性分析验证中间层冗余,指导递归设计。
在LibriSpeech上,Latent-Recursive-Transformer(L1配置:nr=4, L=5, np=2, nc=2)以25.2M参数(减少66%)达到WER 2.16%/4.92%,与75.6M参数的基线(2.12%/4.76%)相当。递归深度和层分配存在权衡。
该工作系统探索了递归Transformer在ASR编码器中的应用,实现了显著的参数压缩而性能损失极小。
自动语音识别(ASR)系统在跨区域泛化方面存在严重不足,尤其是对于印度这样语言和方言高度多样化的地区。现有研究主要关注领域内适配,但缺乏对跨地理区域泛化能力的系统性分析。
该论文首次在印度背景下进行了地区级别的ASR跨区域泛化定量分析,揭示了地理距离与识别性能之间的显著相关性,为构建更具包容性的ASR系统提供了重要启示。
大规模语音基础模型在下游任务微调时面临两大挑战:1) 模型参数巨大,全微调计算昂贵;2) 顺序微调导致灾难性遗忘。参数高效持续学习(PECL)旨在解决这些问题,但在ASR领域研究不足。
提出Continual SSVD (CSSVD)方法: - 将预训练权重矩阵通过SVD分解为头部(高奇异值方向)和尾部(低奇异值方向); - 仅允许在低能量尾部子空间学习近似旋转矩阵,保护头部主成分,减少遗忘; - 后续任务通过权重平均融合旋转,进一步提升记忆保持; - 每遇到新任务重新计算SVD,允许重要奇异方向从尾部移动到头部,增强适应性。
在Two benchmarks上评估: - 使用OWSM v3.2 small模型(366.7M参数),仅更新线性层权重矩阵; - 与Full Fine-Tuning、LoRA、SSVD、MiLoRA、OPLoRA、BiLoRA、EWC-LoRA等方法对比; - CSSVD在两项实验中的平均WER分别为18.33和24.82,显著低于所有PECL基线,且遗忘最小(BWT分别为-1.9和-2.2)。
提出了一种简单有效的ASR参数高效持续学习方法,通过限制适应至尾部子空间和权重平均,实现了低遗忘和优越性能。
现有ASR模型在印度语言(如印地语、孟加拉语、卡纳达语、泰卢固语、马拉地语)上零样本场景下的性能影响因素缺乏系统性分析。
首次系统分析五种印度语言ASR性能受说话人和音频因素的影响,为实际部署提供带宽和精度优先的指导。
印度语言种类多(42种)、语音相似度高、低资源语言标注数据稀缺,且现有基准测试在录音条件、说话风格等方面差异大,导致跨语料库泛化困难。
系统采用编码器-分类器架构:预训练语音编码器(Whisper-medium或Vaani-FastConformer-Multilingual)提取帧级表示,经自注意力池化得到固定长度嵌入,再通过线性分类头输出42种语言概率。对比三种训练目标:交叉熵(CE)、监督对比损失+交叉熵(CE+SupCon)、层次softmax(HSM,按语系-语支-语言的树结构计算路径概率)。
本文系统比较了Whisper和FastConformer在42种印度语言识别上的表现,发现冻结FastConformer结合层次softmax在跨域泛化上最优,为大规模低资源语言识别提供了实用指导。
FlashTTS通过滞后多轨道、多令牌预测和2步流匹配,显著降低流式TTS延迟,同时保持高自然度和零样本克隆能力。
现有视频配音系统仅能合成孤立语音,无法同时生成环境音效和背景音,导致多步骤人工后期混合的碎片化工作流。
HoliDubber 提出一种整体视频配音框架,核心创新包括: 1. 联合生成语音与音效:通过单一文本提示(text prompt)同时生成语音和音效,打破了仅语音合成的局限。 2. Patch-based 自回归扩散 Transformer:采用因果语言模型对聚合的 patch 嵌入进行自回归建模以捕获全局时间结构,再通过扩散 Transformer 解码器在每个 patch 内生成高保真连续 token,实现分治策略。 3. 跨模态视觉融合:将视觉特征编码为 patch 级表示,通过交叉注意力与音频 patch 融合,使语音生成对齐说话人的视觉发音动态。 4. 多阶段训练策略:从大规模文本到音频预训练过渡到结构化提示微调,训练中随机丢弃辅助文本字段,使模型同时支持零样本配音(给定参考语音)和文本提示引导配音。 5. HoliDub-Bench 基准:从已有数据集构建带有同步视频-文本-音频三元组的基准,用于评估整体配音效果。
在多个基准上,HoliDubber 在语音质量、音画同步和说话人相似性方面显著优于现有方法。HoliDub-Bench 上的结果验证了联合生成语音与音效的有效性,为复杂声学场景下的整体视频配音建立了新范式。
HoliDubber 首次将视频配音从仅语音生成扩展到联合语音与音效生成,通过自回归扩散 Transformer 和跨模态融合实现了高质量、同步的整体音频合成。
MeanVC在流式零样本语音转换中面临三大局限:1)CARD训练方案导致有效序列长度加倍,内存消耗大且收敛慢;2)小chunk设置下转换质量下降,160ms块大小带来211ms延迟;3)基于参考梅尔谱的MRTE对参考音频质量敏感,低质量参考时说话人相似度下降。
MeanVC 2在性能上显著优于MeanVC,同时将端到端流水线延迟从211ms降至110ms(单CPU核)。
MeanVC 2通过FRC和UTTE实现了鲁棒低延迟的流式零样本语音转换,在保真度和效率上取得平衡。
当前主流文本转语音(TTS)系统通常依赖中间声学表示(如梅尔频谱)和单独训练的声码器,导致推理路径复杂、部署成本高。BareWave旨在实现完全波形原生的直接文本到波形生成,但面临三大训练挑战:原始波形缺乏强预训练表示支架、不同训练阶段需要不同噪声调度、数据空间感知损失与速度空间流目标的时间结构不匹配。
BareWave提出一个直接文本到波形的训练框架,包含三个关键技术: 1. 训练时表示对齐:利用冻结的自监督语音模型(如HuBERT)的特征对齐生成器的隐状态,注入语音先验。 2. 分阶段噪声调度:早期使用收敛友好的对数正态噪声分布,后期切换为均匀分布以增加干净区域的采样密度。 3. 速度感知感知对齐(VAPA):通过缩放多分辨率频谱距离,使感知损失与速度空间流目标的时间结构一致。 所有辅助分支在推理时移除,保持单一的波形原生生成路径。
在零样本语音克隆任务上,BareWave在可懂度、说话人相似度和自然度方面均达到强竞争性能,无需中间表示、预训练推理组件或独立声码器。消融实验表明,表示对齐、分阶段噪声调度和VAPA对性能至关重要。
BareWave首次在完全波形原生的流匹配TTS中实现了零样本语音克隆,通过巧妙的训练设计解决了直接波形生成的关键优化难题。
传统Few-shot Class-incremental Audio Classification (FCAC)方法假设类别数只增不减,但实际场景中类别数可能增加或减少(如智能音箱的语音关键词添加与删除)。现有方法无法处理类别减少的情况。
在LS-100、NSynth-100、FSC-89三个公共数据集上,平均准确率超过基线方法。代码已开源。
首个处理类别数可变(增减)的小样本音频分类方法,通过原型适应和伪训练策略有效应对类别动态变化。
AI生成音乐检测器在标准基准测试中表现鲁棒,但在实际部署中需要检测训练时未见过的生成器(generator shift)。现有基准测试可能高估鲁棒性,因为训练和测试集共享生成器特定伪影。
首次系统比较codec式离散token空间在生成器迁移下的表现,证明tokenizer选择是音乐深度伪造检测的关键实验变量。
现有基于说话人嵌入的语音增强方法通常需要干净的注册音频,或者从带噪语音中提取嵌入,但后者在噪声和域偏移下不可靠。
提出G-MaP-SE框架,包含: 1. 离线对干净语音嵌入拟合高斯混合模型(GMM)作为先验分布。 2. 在线将带噪语音嵌入通过温度加权的余弦相似度软匹配到GMM均值,得到精炼的先验嵌入。 3. 通过轻量级门控融合模块将先验嵌入注入到MP-SENet骨干网络中。 所有操作无需额外注册音频,且GMM先验可替换。
在VoiceBank+DEMAND和DNS2020数据集上,G-MaP-SE始终优于直接使用带噪嵌入的条件,并显著缩小了与使用干净嵌入的Oracle上限之间的差距,尤其在跨域场景下表现鲁棒。
提出了一种基于GMM先验匹配的轻量级引导语音增强方法,无需注册音频即可提升增强性能,有效应对噪声和域偏移。
声学隐身和全息通常被视为两个独立问题,现有主动方法的实现受限于不完整的孔径覆盖、传感与驱动之间的空间分离以及难以维持宽带精度等关键障碍。
提出一个基于沉浸式边界条件(IBC) 的统一框架,将隐身与全息视为同一边界操作的两种极限。通过选择不同的格林函数实现三种功能: - 均匀格林函数:抑制内部入射场,实现未知物体的宽带隐身; - 散射格林函数:合成全息散射体,在任意照明下复现目标物体的响应; - 异质格林函数:组合上述两种,用一个物体的散射特征替换另一个,实现声学伪装。
该框架基于基尔霍夫积分和格林函数分解,利用同一套物理装置(封闭的发射面和记录面)即可切换功能。
在三维时域有限差分(FDTD)数值模拟中成功演示了隐身、全息和伪装效果。模拟条件接近实验环境(现实源-接收器配置),并解决了三维实现的关键难题:封闭沉浸面的离散化和基于数据驱动的格林函数检索。结果表明可实现实时宽带三维声学操控。
本文统一了声学隐身与全息,提出了基于沉浸式边界条件的通用框架,为实时三维声学隐身、全息和伪装提供了可行路径。
现有设备端说话人日志(Speaker Diarization)系统受限于推理成本,在消费级硬件上难以实现实时或近实时处理。加速方法(如增大分割步长)虽能大幅提升速度,但会在非受控数据(如VoxConverse)上导致性能急剧下降(DER从0.075升至0.113),根本原因是聚类阶段的说话人漏数。
提出相对最小簇大小(Relative Minimum Cluster Size):
- 将固定阈值 mcs=12 替换为 mcs = round(f·n),其中 n 为总嵌入数,f≈0.01。
- 该机制自动适应每段音频的嵌入预算:数据量大的录音(如AMI)具有较大mcs,数据量小的录音(如VoxConverse)则使用较小mcs,避免小说话人被错误合并。
- 与增大步长(stride 3s)和逐块嵌入(per-chunk embedding)结合,构成完整加速流水线。
通过简单而高效的聚类超参数自适应调整,在保持受控数据性能的同时,显著恢复加速流水线在野外数据上的准确率,实现了实用化的设备端说话人日志。
传统物理信息神经网络(PINN)在声场插值中计算成本高、训练时间长,难以满足实时处理或在线学习的需求。
本文提出一种混合框架,结合PINN预训练和物理信息极限学习机(PIELM)。首先利用源域声场数据通过PINN预训练隐藏层权重,然后针对目标声场,使用闭式解更新输出层权重,避免迭代微调。该框架将波动方程作为约束,实现快速、物理一致的声场插值。
在一维自由场仿真中,预训练后的PIELM在插值精度上与PINN微调相当,但适应时间降低超过三个数量级。实验还评估了不同信噪比下的性能。
本文提出了一种高效且物理一致的声场插值方法,显著降低了计算开销,适用于实时应用。
当前大型音频-语言模型(LALMs)依赖海量参数(>7B-30B)和高计算成本,难以部署在资源受限环境。
提出TinyGiantALM(1.5B),采用指令感知特征精炼(Instruction-Aware Feature Refinement)框架,包含: 1. 三流声学前端:Whisper(细粒度语音)、HTS-AT(事件级)、CLAP(全局语义)。 2. 查询引导投影器(Query-guided Projector):使用E-Branchformer编码局部-全局依赖,并通过用户意图向量进行交叉注意力精炼。 3. 语义门控(Semantic Gating):利用CLAP锚点生成软门控,动态调制音频特征,聚焦任务相关信号。
TinyGiantALM通过精巧架构设计在极低参数下实现稳健音频推理,为边缘设备提供可行方案,但深层逻辑叙事能力仍受规模限制。
视频到音频生成(V2A)需要同时满足视听对齐、语义一致、时间同步和感知质量,但现有方法主要关注模型架构和训练目标,推理时对齐(inference-time alignment)尚未充分探索。早期中间步骤奖励噪声大,搜索空间大,导致推理时搜索具有挑战性。
提出 SMC-ITA(Sequential Monte Carlo Inference-Time Alignment),将V2A推理时对齐建模为搜索问题。方法包含: 1. 使用基于流匹配的SDE求解器引入随机性,保持轨迹多样性; 2. 采用前瞻(lookahead)策略从当前步快速推演至最终样本,获得更可靠的中间奖励估计; 3. 结合序贯蒙特卡洛重采样(系统重采样)根据奖励权重自适应调整轨迹分布,逐步聚焦高奖励区域。
在VGGSound测试集1k子集上,以MMAudio-S-16kHz为基座模型,SMC-ITA相比单轨迹采样实现: - DeSync(时间不同步)相对降低55.67% - IB-score(视听对齐)提升20.23% - Audio Quality(音频质量)提升15.44% 在相同NFE预算下,SMC-ITA优于Best-of-N和Beam Search,实现最佳整体权衡。消融实验验证了前瞻策略和系统重采样的有效性。
SMC-ITA通过序贯蒙特卡洛重采样和前瞻奖励估计,在不改变模型参数的情况下显著提升了视频到音频生成的对齐质量和推理效率。
急性哮喘发作评估需要快速解读呼吸音、氧合、气流受限、语言受限、呼吸功、精神状态和对缓解治疗的反应。传统的纯音频分类器虽能检测喘息模式,但缺乏透明的临床推理和安全升级逻辑,存在“寂静胸”等高风险误判。
提出AeroSpectra Sentinel,一种客户端研究原型,结合短时傅里叶变换(STFT)呼吸音分析、轻量级机器学习筛查、临床特征融合和五阶段大语言模型(LLM)提示链。系统架构分为六层:声学捕获、信号预处理、频谱智能、轻量级ML筛查、临床上下文融合与LLM提示链、结构化输出。提示链包括:信号QA、频谱生物标志物、临床融合、安全护栏和FHIR就绪交接生成。信号处理采用高通滤波、自适应门控、STFT频谱图、喘息带能量等显式方程。临床融合使用规则逻辑,结合临床条件与声学谓词计算风险评分,并触发关键覆盖。
在包含1211个WAV录音的公开呼吸音数据集上,随机森林模型在584个记录的哮喘与非哮喘二元分类中达到91.10%准确率和78.69% F1分数;多层感知器达到89.73%准确率和78.26% F1分数;紧凑型log频谱图CNN基线仅73.29%准确率和55.17% F1分数。五标签多分类(支气管、哮喘、COPD、健康、肺炎)达到77.40%准确率和77.23%宏F1。针对LLM组件,在40个模拟临床场景上比较四种提示变体,带护栏+FHIR模式的变体在安全性和文档一致性上表现最佳。
该工作通过轻量级频谱特征与可审计提示链的结合,为急性哮喘风险决策支持提供了透明、可追踪的框架,但仍是研究原型,非临床验证产品。
Paediatric-HGNN通过异构图表征词汇-声学层次交互,在儿童口吃检测上取得优于现有模型的效果,并提供了可解释性。
现有的生成式固定滤波器主动噪声控制(GFANC)方法采用反应式控制范式,仅基于当前噪声帧生成控制滤波器,无法预测噪声的动态变化,导致对快速变化噪声的跟踪滞后。
提出了预测式固定滤波器主动噪声控制(PFANC)方法,采用主动控制范式。利用卷积循环神经网络(CRNN)处理多个连续噪声帧,预测下一帧的控制滤波器权重向量,从而提前生成适配即将到来噪声的控制滤波器。理论分析基于高阶马尔可夫链,证明多帧输入可提高控制滤波器预测的能力。
在线性和对数啁啾信号以及真实动态噪声上的数值仿真表明,PFANC在控制动态噪声方面优于GFANC、GFANC-Bayes和GFANC-Kalman,且在不同声学路径下具有良好的泛化性。网络参数仅略微增加。
PFANC通过CRNN多帧预测实现了对动态噪声的前瞻性控制,显著提升了跟踪能力和降噪性能。
总结生成失败: Expecting value: line 1 column 1 (char 0)
音频-视觉大语言模型(av-LLMs)在处理长视频时,视频token和KV缓存线性增长,导致GPU内存不足。现有压缩方法对所有token一视同仁,忽视了音频与视觉token的严重不平衡,且依赖手工设计的通用代理查询(proxy query)评估重要性,无法准确反映token移除对输出的扰动。
OmniMem提出了一种扰动感知、模态感知的KV缓存压缩框架,包含三大创新: 1. 扰动感知的KV选择(Perturbation-aware Selection):结合注意力分数(重要性)和余弦相似度(冗余性),选择移除后对注意力输出扰动最小的KV对。重要性反映token被后续层使用的频率,冗余性衡量token信息是否可被邻居替代。 2. 音频-视觉预算分配(AVBA):首次针对av-LLMs提出模态感知的逐层KV缓存预算。通过归一化注意力熵和层内值向量余弦相似度,为每一层的音频和视觉token分配不同预算,避免音频模态被视觉主导。 3. 预算感知微调(Budget-aware Fine-tuning):在微调时引入逐层预算约束和梯度反向传播设计,促使模型将有用信息集中到保留的token中,进一步提升压缩效果。
在VideoMME Long、LVBench和LVOmniBench三个长视频理解基准上,使用Video-SALMONN 2+(4B/8B)和Qwen2.5-Omni模型,OmniMem在相同内存预算下比无训练压缩基线(如cosine similarity + generic proxy query)提升2-4%绝对准确率,微调后再提升1-2%。
OmniMem通过扰动感知和模态感知的KV缓存压缩,显著提升了流式音频-视觉大语言模型的长视频理解能力,是首个同时解决token不平衡和重要性评估偏差的压缩框架。
现有的深度伪造语音检测模型在处理基于神经音频编解码器生成的语音(CodecFake)时泛化能力差。使用编解码器重合成语音(CoRS)作为代理数据可以提高性能,但存在代理数据与真实场景(in-the-wild)之间的域差异(proxy-to-wild domain gap),包括伪影不匹配、静音不匹配、内容与说话人不匹配。
提出域移位特征增强(DSFA)方法,在微调过程中将确定性特征统计量转换为随机分布,模拟真实世界的变化。具体包括:1)使用后训练的SSL骨干网络(Wav2Vec2-Large-AntiDeepfake)提取深层特征;2)DSFA通过估计特征均值和标准差的批次级方差,建模域不确定性,并采用重参数化技巧进行随机采样,通过AdaIN合成增强特征;3)联合训练目标结合监督对比损失和交叉熵损失。
在CodecFake+数据集和自行收集的CoSG ExtEval扩展集(包含40个未见生成模型和长音频)上进行评估。结合DSFA的方法在CoSG Eval和CoSG ExtEval上均达到最优性能,显著降低了等错误率(EER)。可视化表明DSFA促进了域不变特征的学习。
本文通过DSFA有效缩小了代理数据与真实场景的域差异,提升了CodecFake语音检测的泛化能力,达到了最先进水平。
VISA通过多模态特征增强和细粒度路由,实现了音频推理中准确性与推理质量的最佳平衡。
当前音频-视觉语音识别(AVSR)模型在标准LRS3基准上表现近乎完美(WER<1%),但这一性能可能源于对LRS3测试集的过拟合,而非真正的泛化能力。该测试集仅0.9小时,与433小时训练集严重失衡。
作者从大规模MultiVSR数据集中构建了严格匹配LRS3测试集分布的新评估集MV2LRS3,通过kNN匹配七个关键属性(时长、年龄、性别、肤色、头部偏转角均值与标准差、信噪比、语速)。不同于直接复制LRS3构建流程,该方法在保持分布一致性的同时避免了数据收集的极端挑战。
该工作系统性地揭示了AVSR模型在严格分布匹配条件下的泛化失败,强调了超越单一基准评估的重要性,并为未来鲁棒性研究提供了标准化测试集。
标准扩散训练中,置信度加权通常被认为危险:模型若自信地犯错,梯度放大将加速错误。本文证明在监督扩散中,梯度方向由真实噪声锁定,置信度仅影响步长而不扭曲方向,因此该直觉失效,反而带来结构收益。
提出 Eisbach log-barrier:基于 DiT 输出空间能量分布的熵计算无参数权重。高熵(不确定/平坦)抑制梯度,低熵(自信/有结构)保留梯度。应用于 Stable Audio 3 Medium 的 LoRA/DoRA 微调,形成在线自参考数据课程——无需外部评判或预过滤,完全来自模型前向传播。
在 MusicCaps 上微调 1000 步后,屏障模型生成的四首角色曲目(小猪王子、浣熊数学家等)展现出:清晰的乐句结构(引子-发展-高潮-解决)、主题发展、声学区分(低频/高频能量分布差异显著)。自相似矩阵显示块对角模式,表明结构分段性。对比基线,屏障模型产生更强的结构发展而非模式坍缩。
一种参数自由、自适应的在线数据课程机制,通过熵权重有效提升音乐生成的结构多样性和发展性。
总结生成失败: 'utf-8' codec can't encode character '\ud835' in position 6331: surrogates not allowed
现有连续自回归TTS模型面临长程误差累积问题,缺乏离散量化的缓冲,小预测误差被解码器忠实重构并反馈到下一步,导致生成不稳定。
dots.tts通过语义AudioVAE、全历史条件流匹配和自校正后训练,解决了连续自回归TTS的长程不稳定问题,实现了SOTA性能。
代码切换(Code-Switching, CS)语音识别中,模型在CS区域(如语种交替点)容易出现严重错误,现有微调方法缺乏针对这些混淆区域的显式优化信号。
提出POI-aware对比学习框架,包括: 1. CS-NMG近音生成流水线:利用ASR的N-best输出和LLM(Gemini 2.5 Pro)生成POI(兴趣点)局部替换候选,并通过声学、文本(Levenshtein距离)和音素(G2P)三重过滤保留硬负样本。 2. 对比微调:结合POI加权交叉熵(WCE)锚点损失和多负样本对比排名损失(InfoNCE),鼓励模型偏向正确转录而非声学近音假说。 3. 基于Whisper-small + LoRA进行高效微调。
在CS-FLEURS(cmn-eng)和ViMedCSS(vie-eng)上,对比标准LoRA微调,WER和PIER均降低超过2%;三重过滤版本最佳(WER 14.06 / PIER 15.10 在cmn-eng上)。与MWER等序列级方法相比也取得一致提升。
通过LLM辅助生成POI局部硬负样本并结合对比学习,显著提升了代码切换语音识别在关键区域的鲁棒性。
热带地区的生物声学数据集稀缺,现有数据集主要集中在欧洲和北美,导致物种识别模型(如BirdNET)在东南亚等地区表现极差(PR AUC仅0.03-0.04)。缺乏标准化、高质量、可复现的鸟类声音数据集。
MyGardenBird为东南亚鸟类声学监测提供了首个标准化、经过严格质检的机器学习就绪数据集,有效填补了热带地区数据空白。
现有语音带宽扩展(BWE)方法在重建高频相位和谐波结构时存在伪影,如金属感、参数爆炸、受限感受野等问题。
FSC-Net以紧凑参数实现优异的BWE性能,通过FFC全局上下文建模和渐进学习策略,有效解决极端带宽扩展中的谐波恢复难题。
在细粒度情感识别准确率和共情对齐质量上显著超越现有 SOTA 基线。
通过认知推理框架和专门数据集,有效解决了 ALMs 在复杂情感交互中的语义主导和认知浅层问题。
现有的语音生成模型通常依赖离散语音标记器,导致细粒度声学细节丢失,且多阶段流水线(自回归+扩散)阻碍端到端联合优化,语义规划与声学渲染分离限制了性能和可控性。
VoxCPM2通过层次化连续潜在建模和统一架构,实现了大规模多语言可控语音生成,无需离散标记器,性能强大且开源。
大音频语言模型(LALMs)在细粒度频谱时间感知上存在明显缺陷,例如对早期信号和特定频率范围不敏感,整体性能落后于人类水平。现有方法依赖大量标注真实数据,成本高且受隐私限制;合成数据方法多需依赖生成模型或仅补充特定任务,缺乏通用性。
本文提出 SpectCount,一种数据高效的微调方法,通过完全合成的音频信号(脉冲计数任务)实时生成训练数据,无需任何真实音频、人工标注或预训练生成模型。关键步骤: - 信号生成:随机生成多个正弦脉冲(不同频率、时间偏移、幅度),叠加白噪声,并确保脉冲间最小间隔,形成多样化的训练样本。 - 计数任务:模型学习对音频中的脉冲数量进行计数(如“bee”、“three”),从而迫使模型锻炼细粒度的频谱时间检测与聚合能力。 - LoRA微调:使用低秩适应(LoRA)仅更新少量参数,保持预训练知识,优化交叉熵损失。
SpectCount通过精心设计的合成信号计数任务,以极低成本显著提升了LALMs的细粒度音频理解能力,展示了合成数据在音频领域的高效泛化潜力。
SEAM通过数据驱动和模型设计的捷径感知策略,实现了鲁棒、轻量的实时脚本化语音检测。
核心痛点: 自监督学习(SSL)模型提取的离散语音标记虽然能高效压缩数据并保持较强性能,但离散化过程不可避免地造成信息损失,导致下游任务性能低于连续SSL特征。
方法创新: 提出仅在推理阶段使用软标记分配(soft token assignment),即在训练时仍采用传统的硬离散化以保持训练效率,但在推理时通过计算连续SSL特征到各聚类中心的距离,经softmax得到后验概率分布,然后对嵌入向量进行加权求和作为下游模型输入。该方法保持训练时的高压缩效率,同时通过建模标记分配的不确定性增加推理时信息量。
实验结果: - ASR任务(LibriSpeech-100h训练):软分配推理(hard/soft)在所有域内和域外测试集上一致优于硬分配(hard/hard),尤其在域外非母语语音(ERJ)上甚至超越连续特征基线;小簇数量时效果更显著。 - 语音合成任务(LJSpeech训练):软分配在域内重构和域外语音转换(TIMIT)中均降低MCD、F0 RMSE、WER,提升UTMOS等指标。 - 分析表明软分配表示与音素类别对齐更准确。
一句话评价: 一种简单有效的推理时软分配策略,在不牺牲训练效率的前提下显著提升离散标记在下游任务上的性能和泛化能力,尤其适合域外和非母语场景。
现有双耳声源定位模型多采用固定推理图,无法适应非平稳声学环境和未见过的场景,且缺乏类似人类听觉中传出神经反馈的调节机制。
提出BiEAR,一种受人类听觉启发的自适应双耳前端,核心创新包括: - MOC反馈模拟:通过神经控制器在推理时动态调节双耳听觉滤波器组的频率选择性(Q因子),实现时频自适应表示。 - 耳专用控制器:设计左右耳独立的神经反馈控制器,支持绝对和相对两种Q因子控制策略,实现非对称滤波。 - 多任务后端:采用8个扇区SAD-Net联合进行声源检测、方位估计和距离分类,使用ILD、IPD和互相关特征。
BiEAR通过生物启发的自适应双耳前端,显著提升了多说话人定位与距离估计在动态声学环境中的鲁棒性。
当前基于CLAP的音频-文本检索模型虽然在大规模数据上表现良好,但无法有效处理包含细粒度音乐属性(如调性、和弦进行、节奏、拍号等)的长文本描述。实验表明,这些模型仅利用前40-50个token,后续token对检索性能贡献甚微。原因是标准对比学习目标将音频和文本分别池化为单一全局表示,丢失了帧级和token级的细节信息。
提出FIGMA架构,采用多视角对比学习: 1. 全局对比损失:对齐音频均值池化表示与文本[CLS]标记。 2. 帧级/令牌级对比损失:对齐音频帧特征与文本token特征。
具体实现:冻结预训练的MuQ音频编码器和E5文本编码器,仅训练轻量级投影头(约22M参数)。音频投影器和文本投影器各由两个Transformer层和一个线性层组成,将特征映射到512维共享空间。
构建FGMCaps:包含38万训练对和1万测试对,每条标注了节奏、调性、和弦进行、拍数、流派和情绪。数据通过自动化工具(BeatNet、Omnizart、Essentia)提取特征,并利用Qwen3-Next-80B-A3B-Instruct生成连贯描述。
在多个音乐检索基准(包括域外评估)上,FIGMA一致优于现有CLAP模型,相对提升高达73.3%。特别是在长文本条件下,帧级对比显著提升了细粒度检索能力。
FIGMA通过多视角对比学习有效解决了标准CLAP模型对长文本细粒度描述利用不足的问题,在音乐检索任务上取得了显著进步。
传统端到端全双工语音对话系统在真实声学环境中,干扰说话人声音泄漏到用户麦克风,被编码为用户查询的一部分,导致大语言模型条件信号污染,引发不稳定的轮次转换和响应质量下降。
提出了干扰鲁棒自适应融合(IRAF)模块,是一个轻量级、流式兼容的模块。IRAF通过目标说话人嵌入和用户音频嵌入预测每一帧的标量可靠性门控,动态调整用户音频对LLM输入的贡献。具体地,将目标说话人特征与用户音频嵌入拼接,经过因果Transformer层和线性层输出门控值(范围0-2),与用户音频嵌入逐元素相乘后与智能体文本嵌入相加。同时引入辅助二分类损失(权重0.1)以监督门控学习。
在MS MARCO和InstructS2S-200K数据集上,在干扰说话人条件下,IRAF均一致性地提升了响应质量(ASR词汇和语义指标)以及全双工交互的轮次转换和插入表现。
首次系统性地解决端到端全双工语音对话系统中的噪声干扰引起的条件污染问题,提出的IRAF模块简单有效且不增加额外延迟。
现有自监督语音情感识别(SER)模型使用一阶聚合(如平均池化)处理帧级特征,隐式假设特征独立,忽略了特征间的高阶相关性,丢失了情感区分性信息。直接计算二阶统计量面临维度爆炸和几何扭曲(膨胀效应)问题。
提出二阶相关(SOC)层,包含两个关键阶段: 1. 子空间投影与流形构建:通过可学习线性层将高维SSL特征投影到低维子空间,计算协方差矩阵并施加迹归一化,得到单位迹对称正定(SPD)流形上的描述符。 2. 切线空间映射:利用对数欧几里得映射(LEM)将SPD描述符投影到欧几里得切线空间,保持几何完整性,再通过半向量化得到紧凑向量,用于下游分类。
SOC作为即插即用模块,克服了维度不稳定性和几何失真问题。
在ESD和RAVDESS数据集上,使用Wav2Vec 2.0、HuBERT、WavLM三个冻结骨干网络,SOC在加权准确率(WA)、未加权准确率(UA)和Macro F1指标上均一致优于GAP、ASP、FA等基线。例如,在Wav2Vec 2.0上,SOC在ESD上相比GAP提升4.68%,在RAVDESS上提升4.42%。
该工作通过流形感知的二阶相关性建模,有效提升了自监督语音情感识别性能,为高阶统计量在SER中的应用提供了实践经验。
现有音频编码器多针对单一领域(如语音、通用音频、音乐),缺乏能同时覆盖多领域的通用编码器。自监督模型(SSL)在跨域任务上表现不佳,而近期研究表明有监督编码器更适合音频大语言模型(LLM)。
USAD 2.0通过域感知蒸馏和多阶段知识迁移,构建了首个同时覆盖语音、通用音频和音乐的高效通用音频编码器,并成功扩展至十亿参数。
现有音频表示方法难以同时支持理解与生成:连续自编码器重建好但潜在表示结构弱,自监督编码器有语义但不可解码。
提出 F3-Tokenizer,包含两个组件: 1. 归一化自编码器瓶颈:使用通道归一化和随机扰动替代KL正则化,产生尺度可控的连续潜在表示,用于重建和自回归生成。 2. 潜在侧表示编码器:在冻结的自编码器潜在表示上,使用随机量化多令牌预测(RQ-MTP)和冻结LLM监督训练,产生高维表示用于理解。 此外,训练一个补丁级流头,将LLM状态映射到连续自编码器潜在补丁,实现生成可控。
暂无。
F3-Tokenizer通过归一化连续瓶颈和表示编码器,统一了音频理解与生成中的表示,避免了额外编码器或离散码本,保持了自编码器潜在作为声学锚点。
病理语音(如ALS、帕金森病导致的语言障碍)与正常语音存在声学失配,导致传统ASR系统性能显著下降。病理语音数据集稀缺且说话人多样性有限,尤其是在非英语语言(如西班牙语)中,数据饥饿的微调策略易过拟合。
提出基于FiLM(Feature-wise Linear Modulation)的说话人条件化策略,将x-vector说话人嵌入注入到冻结的ASR编码器每个Transformer层,通过线性缩放和偏移调节内部表示,而不修改基模型权重。具体包括: 1. 使用预训练的多语言SiAmResNet34提取x-vector,对健康语音掩码为零向量。 2. 每个编码器层有独立的FiLM生成器(两层MLP),输出仿射参数γ、β和标量门控α。 3. 门控残差调制:H̃ = H + α(γ-1)⊙H + β。 4. 训练仅更新FiLM生成器和说话人提取器(约1.6%参数)。
本文提出一种轻量级、非破坏性的说话人适应方法,通过FiML在不改变预训练权重的前提下有效提升病理语音识别性能,并保持泛化能力。
零样本跨语言语音情感识别面临两大挑战:跨语言分布不匹配以及目标语言缺乏情感标注。传统基于监督迁移学习的方法需要目标语言标签,无监督方法虽不依赖标签但常利用目标语言数据或语言标签,且未能显式建模跨语言情感类别结构一致性。
提出一种情感判别表征学习方法,融合监督对比学习(Supervised Contrastive Learning)与说话人对抗学习(Speaker Adversarial Learning)。监督对比学习通过语言感知加权(language-aware weighting)增强跨语言情感对齐,而说话人对抗学习通过梯度反转层(GRL)抑制说话人相关线索,促使模型学习说话人不变的表征。此外,采用层次化跨语言采样策略(hierarchical cross-lingual sampling)构建对比批次,确保多种语言和情感类别的共存。
在9个零样本跨语言设置(如EN→DE、CN→FR等)下进行实验,使用UAR和Macro-F1评估。提出的方法(Proposed)显著优于两个基线(Baseline 1、Baseline 2)及其消融变体(Proposed w/o L_SupCLR、Proposed w/o L_SpkAdv)。消融实验证实了两个损失项的有效性。可视化表征空间显示情感类别聚类更紧凑,跨语言情感对齐更佳。
该工作通过显式对齐跨语言情感表征并解耦说话人信息,以少量语言训练数据实现了成本高效的零样本跨语言语音情感识别。
现有归一化编辑距离(NED)评估无监督词发现中的词典质量时,存在大簇偏向:NED对所有簇内单位对等权重平均,导致大簇质量主导分数,难以公平评估。此外,NED仅衡量同质性(Homogeneity),忽略了类别如何分布在簇中(完备性)。
通过合成和真实词典实验,所提度量组合(加权NED+逆度量)与词典真实分布的相似性相关性更高,且对导致评估偏差的因素更鲁棒。与标准NED+比特率组合相比,新度量更能准确反映词典质量。
该文指出标准NED的缺陷,提出更公平、更全面的词典评估度量,对零资源语音处理领域具有重要意义。
基于语音的阿尔茨海默病(AD)检测受限于病理语音数据稀缺。传统数据增强方法(如噪声注入、音调变换)仅生成现有录音的变体,无法引入新的语义内容或显式建模病理特有的说话特征(如AD式不自然停顿)。
提出CoSTA框架,包含四个组件: 1. 认知状态条件TTS模型:基于CosyVoice2和F5-TTS,通过指令微调或引入认知标签,分别合成具有AD和健康对照(HC)特征的语音。 2. 多样化转录本池:构建包含人工转录本(MT)和36种ASR转录本的池子,研究文本来源对TTS增强的影响。 3. 数据增强策略:包括基于自参考和类内交叉合成的训练增强,以及测试时增强(TTA)。 4. AD检测模型:基于WavLM的语音检测模型。
在ADReSS数据集上,CoSTA实现了85.83%的音频-only准确率,相比基线提升4.16%。实验表明ASR驱动的增强常优于MT驱动。
通过认知状态条件TTS合成病理语音并结合ASR转录本多样性,有效缓解了数据稀疏问题,显著提升AD检测性能。
论文指出在多任务学习(MTL)框架下,针对第二语言(L2)语音识别的双输出(表面转录和意义转录)任务存在不对称性:MTL提升意义转录性能,但导致表面转录退化,且退化程度随语言和表面-意义差异(编辑距离)变化。英语中的退化比韩语更严重,原因在于编码器级别的表征纠缠。
论文系统地揭示了多任务学习在双输出L2语音识别中的表征纠缠问题,并分析了语言依赖机制,为设计解纠缠的MTL框架提供了重要见解。
现有大型音频语言模型(LALMs)的安全对齐评估主要基于单语言文本有害提示,忽略了多语言和口语场景,尤其是代码切换语音下的泛化能力。
首项系统研究代码切换语音对LALMs安全对齐的影响,揭示了现有安全机制在多语言口语输入下的脆弱性。
实际广播视频档案中,目标人物可能出现声音但未见画面(Audio-only)、画面但未说话(Visual-only)、或两者兼有。固定多模态融合会因无效模态引入噪声,性能甚至低于最佳单模态系统。
提出查询自适应框架,包含活跃模态检测模块: 1. 基于跨模态分数一致性(同一查询下,一个模态检索的top-n文件在另一模态下的分数分布)设计特征,结合模态内和模态间分数统计量。 2. 使用逻辑回归分类器(因数据有限)判断查询属于AoP、VoP或AVP。 3. 根据检测结果自适应设置融合权重λ(AoP:1, VoP:0, AVP:0.5)。
在BBC Rewind语料库(12,594个视频)上: - 模态检测准确率89% - 自适应融合P@1达到94.2%,优于仅音频(82.9%)、仅视觉(93.4%)和固定融合(90.0%),恢复了与Oracle(96.6%)之间64%的差距。
通过跨模态分数一致性有效检测缺失模态,实现查询自适应融合,显著提升真实场景下音视频人物检索精度。
当前基于人工神经网络(ANN)的语音增强方法虽然性能优异,但计算复杂度和能耗高,限制了在边缘设备上的部署。而脉冲神经网络(SNN)具有超低功耗潜力,但其离散二进制激活和复杂的时空动态导致信息丢失,性能下降。因此,如何在保持性能的同时降低计算复杂度成为关键挑战。
提出了一种双分支混合神经网络(DBHN-Net),包含ANN分支和SNN分支。 - 网络架构:双分支并行,ANN分支利用BandSplit模块和TF-Mamba模块(基于Mamba的时序建模)降低计算量;SNN分支引入Spiking Feature Extraction Group (SFEG) 和 Information Transformation Block (ITB),通过残差连接减轻信息损失。 - 信息融合:Interaction模块实现分支间渐进式信息交换;TF-Cross Attention-Fusion (TF-CAF) 模块通过时频双域交叉注意力进行最终融合,数据自适应地引导SNN分支保留关键信息。
在三个公开数据集上,DBHN-Net保持优越性能,同时相比基线模型平均降低7.5倍计算复杂度(平均7.5倍减少)。
提出了一个创新的ANN-SNN双分支混合网络,通过架构设计、模块创新和融合机制,成功在低复杂度下实现了高性能语音增强。
Traditional metrics like Word Error Rate (WER) mask systemic safety degradation in ambient clinical scribes (ASR + LLM pipelines). A small increase in WER can correspond to a large increase in unsafe clinical outputs, as WER is semantically unaware.
This paper exposes the dangerous disconnect between signal fidelity (WER) and clinical safety, and provides a principled framework (paired acoustic stress test) for evaluating robustness of ASR→LLM pipelines in healthcare, with actionable metrics that capture semantic safety drift.
现有神经语音编解码器大多采用统一的逐帧量化策略,为所有帧分配相同比特率,未考虑语音内容特性(如浊音/清音),导致清音帧浪费比特,限制了低比特率下的性能。
提出 VoCodec,一种基于浊音驱动的低比特率流式神经语音编解码器。核心组件包括: - 浊音检测器:利用帧能量在基频范围内的累积判断浊音/清音,输出浊音标志令牌。 - 浊音驱动量化器:对浊音帧采用残差标量-矢量量化(RSVQ),对清音帧采用简单标量量化(SQ),实现比特率自适应分配。 - 掩码高效训练:采用双路径并行量化和掩码机制加速训练。 整体架构基于 StreamCodec 的全因果编解码器,以 MDCT 谱为建模目标。
VoCodec 通过感知驱动的浊音自适应比特分配,在极低比特率下实现高质量流式语音编解码,具有实用价值。
传统零样本文本转语音(TTS)模型在给定说话人提示时,说话人身份与韵律属性(如语速、音高)紧密耦合,难以在不改变提示的情况下独立调节风格。现有可控TTS方法需要风格标签、参考样本或文本描述,缺乏连续插值和多轴组合能力。
GLASS框架提出将每个声学属性视为奖励定义的控制方向。核心创新包括: - 奖励引导的GRPO训练:对每个控制轴,冻结TTS骨干网络,使用组相对策略优化(GRPO)训练单个轻量级LoRA适配器。奖励基于语音令牌长度(语速)、平均基频(音高)和词错误率(可懂度)。 - LoRA算术实现组合:独立训练的适配器可在推理时通过线性LoRA算术进行交换、插值和组合(如α∆Wfast + (1-α)∆Wslow),无需重新训练骨干。 - 说话人无关风格方向:多说话人提示训练确保适配器可迁移至未见过的说话人。
在Seed-TTS-eval test_en数据集上(N=1088),GLASS在语速和音高控制上达到与DSP处理相当的样式偏移,同时保持自然度、说话人相似度和可懂度(WER、SpkSim、UTMOS等指标优于DSP基线)。连续插值实验显示α从0到1可平滑调节语速(2.30→5.52 SPS)和音高(男声107→155 Hz,女声166→239 Hz),混合点α=0.5处WER最低。
GLASS通过GRPO学习可组合的LoRA风格适配器,实现了零样本TTS中无需标签的、说话人保持的连续风格控制。
现有神经语音编解码器(如RVQ)在超低比特率(如0.5 kbps)下性能急剧下降,后级VQ贡献小却消耗相同比特率,导致效率低下。
提出P2PSynCodec,核心是Plain-to-Pseudo协同向量量化器(P2PSVQ): - Plain VQ:量化产生基本token,用于传输(计入比特率)。 - 多个Pseudo VQ:基于基本token通过神经网络预测辅助token,不消耗比特率。 - 解码时,基本token与预测的辅助token联合重建语音,大幅降低比特率。 - 训练采用两阶段:先训练RVQ教师模型,再固定编码器/解码器/Plain VQ,用交叉熵损失训练Pseudo VQ。
通过零比特率伪向量量化预测,在极低比特率下实现了高质量语音重建,为超低带宽场景提供了高效解决方案。
传统TTS和SVS需要不同条件:语音依赖语言韵律,歌声需要显式旋律控制。统一模型易导致梯度冲突,降低生成质量。
UniVoice通过因子化条件和空旋律令牌巧妙解决语音与歌声统一生成中的条件冲突,性能媲美专用模型。
现有Code-Switching ASR(CS-ASR)方法主要针对已见语言对(如中英、韩英),但实际中语言对数量呈组合增长,收集所有配对的数据不可行。本文研究如何将从有限已见语言对(KO-EN、JA-EN、DE-EN)学到的CS能力泛化到未见语言对(KO-JA、KO-DE)。
本文首次系统验证了CS-ASR跨语言对泛化的可行性,但实验表明现有模型合并和域泛化方法仅能带来有限提升,亟需针对CS-ASR特性设计的新技术。
现有的文本到音频检索方法(如CLAP、Pengi)因文本与音频之间的模态鸿沟,难以实现细粒度语义对齐,常返回语义不匹配的结果。
提出FORTE框架,包含三个阶段: 1. FOL引导的查询优化:将自然语言查询转化为一阶逻辑(FOL)表示,通过约束搜索(最佳优先搜索)生成保留核心语义同时增强区分性的逻辑形式。 2. 参数高效跨模态对齐:使用轻量级投影模块和对比学习,在不微调预训练编码器的情况下对齐音频嵌入到优化后的查询空间。 3. 谓词感知重排序:在推理阶段利用逻辑一致性对检索结果进行重排序,消除残余不匹配。
在AudioCaps和Clotho基准上,FORTE在细粒度场景下显著优于强基线方法,验证了符号推理与表示学习结合的有效性。
首次将一阶逻辑系统性地融入文本到音频检索流程,通过结构化语义推理提升了检索精度。
真实场景下音频-视觉语音识别(AVSR)面临视角变化、音频失真、视觉遮挡等问题,导致模态质量下降和音视频异步,现有方法鲁棒性不足。
提出了一种结合多视角自监督学习和模态感知融合的鲁棒AVSR框架,在多种挑战性条件下显著提升性能。
传统相位敏感光时域反射计(ϕ-OTDR)在分布式声学传感中易受偏振诱导衰落、局部信号退化及强环境干扰影响,导致性能不稳定。
提出Sagnac辅助增强ϕ-OTDR架构,利用Sagnac干涉仪提供连续相位响应作为辅助传感源,补偿ϕ-OTDR信道的衰落区域;通过FPGA上的互相关过程实现异质信号对齐;建立标准化基准评估框架,对比传统特征工程、概率浅层分类器、单分支深度模型和双分支融合模型。
在10km传感光纤上对六类代表性声学事件进行实验,双分支融合模型在平衡测试集上达到89.79%准确率、89.83%宏F1分数和5.00%虚警率。通道分组显著影响双分支评估,部署决策应基于准确率、宏F1、虚警率、漏报率和延迟等多指标。
该工作为ϕ-OTDR DAS提供了物理驱动的增强策略和可复现的基准协议,推动了融合传感方法的工程化评估。
人类能够连续地感知说话人之间的相似度,但语音基础模型(如自监督模型和大规模监督模型)生成的说话人嵌入与人类感知是否一致尚不清楚。现有研究主要关注说话人验证(二分类),忽略了相似度的连续性。
该研究系统性地验证了语音基础模型的说话人嵌入与人类感知相似度之间的关联,为开发更符合人类感知的模型提供了指导。
自动音频字幕(AAC)面临词选择不确定性和对大规模序列到序列或LLM模型的依赖,限制了实际部署。现有方法虽利用辅助标签或主题先验,但往往依赖复杂解码器或多编码器管道,未系统分析语义指导与模型效率之间的权衡。
提出一个资源高效的AAC框架,显式地基于预测的AudioSet语义进行字幕生成。具体包括: - 音频编码器:使用在AudioSet上预训练的ConvNeXt-Tiny提取帧级声学特征。 - 关键词模块:用另一个冻结的ConvNeXt-Tiny分类器预测前K个AudioSet关键词,并将词嵌入拼接至声学特征后形成联合表示。 - 语言解码器:采用紧凑的自定义六层BART风格解码器(3个编码器层和3个解码器层),在联合声学-语义条件下自回归生成字幕。 该方法在减少解码器容量需求的同时提升了语义连贯性和跨域鲁棒性。
在Clotho V2和AudioCaps上进行了域内和跨域评估。主要结果(SPIDEr/FENSE): - Clotho域内:0.286/0.478(优于所有紧凑方法) - AudioCaps域内:0.470/0.615(优于大多数基线) - 跨域设置下也表现出竞争性能。 与大型预训练方法(如Pengi)相比,在保持竞争力的同时大幅降低了模型复杂度。
本文通过融合预测的AudioSet关键词作为显式语义指导,在紧凑架构下实现了高效且高质量的音频字幕生成。
当前多模态情感分析(MSA)通常使用生成式解码(generative readout)从大语言模型(LLM)中获取情感分数,即将分数作为文本字符串生成后解析为数字。这种方法将连续的回归目标与离散的自回归解码绑定,存在精度限制、推理延迟高、输出不可解析或越界等问题,且其成本未被充分量化。
论文提出一种判别式隐状态读取(discriminative hidden-state readout)方法,基于原生全模态LLM Qwen2.5-Omni-7B的Thinker模块。具体地,丢弃生成头,取最后一个非填充token在最后一层的隐藏状态,通过轻量级多层感知机(MLP)直接回归连续情感分数,仅需一次前向传播。采用4位量化和低秩适应(QLoRA)微调,仅训练约1.14%的参数,使7B模型可在单张32GB消费级GPU上运行(峰值内存10-21GB)。通过受控对比实验(固定骨干网络、数据和LoRA配置,仅改变读取方式)确保改进归因于读取机制本身。
在CMU-MOSI和CMU-MOSEI数据集上,判别式读取达到了与最新技术相当的性能(MOSI: MAE 0.551, Corr 0.888; MOSEI: MAE 0.506, Corr 0.790),且四项随机种子实验稳定性好(MOSI: MAE 0.570±0.014, Corr 0.877±0.009)。受控对比中,生成式读取的平均绝对误差超过两倍,存在约2.8%的不可解析零样本输出,且推理速度更慢。模态消融实验揭示了各模态的贡献。
本文揭示了在连续MSA任务中,如何从大语言模型中读取结果与如何训练同样重要,判别式读取是比生成式解码更准确、高效、可靠的替代方案。
现有扩散模型在语音增强中需要多步推理(50-200步),推理速度慢;一步生成方法如MeanFlowSE依赖大规模预训练编码器(如WavLM-Large),计算成本高,难以部署。标准Rectified Flow(RF)采用确定性线性插值路径,无法捕捉语音信号的多模态后验分布,鲁棒性不足。
提出SB-RF框架,融合Schrödinger Bridge(SB)与Rectified Flow(RF): - SB:将生成过程建模为熵正则化最优传输问题,构建数据自适应的随机“概率管”轨迹,替代RF的刚性线性路径,增强对复杂噪声的鲁棒性。 - RF速度匹配:在SB路径上使用RF的速度匹配目标(预测y-x),使轨迹在正则化消失时逼近最优传输测地线(直线),实现一步生成。 - 训练损失:联合速度匹配损失、多分辨率Mel谱损失和PESQ损失,提升重构质量。 - 推理:使用欧拉ODE求解器一步生成干净语音。
SB-RF通过将Schrödinger Bridge的随机最优传输路径与Rectified Flow的确定性速度匹配结合,实现了高质量、鲁棒、一步生成的语音增强。
现有音效(SFX)数据集采用不同标签体系、分类法和元数据格式,导致不兼容、不可比、难以合并等问题。
提出一个模块化数据集重新标注框架,基于行业标准 Universal Category System (UCS) 作为共享结构。包含: - 基于规则的多阶段标签转换流水线(预定义映射、子类别匹配、类别匹配、同义词搜索) - 冲突解决机制(特异性过滤、多数投票、位置优先级) - UCS感知的分层数据集拆分工具 - 支持多数据集合并
在 AudioSet、FSD50K、ESC-50 三个数据集上转换,生成 EnvSound-UCS 数据集,包含 58,057 个音频片段。自动转换率高,需要最少人工干预。
通过引入工业标准UCS,有效统一了非兼容的音效数据集标注,促进了数据集互操作性和扩展性。
传统MDD系统使用语言无关的图结构(如分类图)建模发音错误,无法捕捉不同母语(L1)背景下的系统性混淆模式,且分类图忽略跨类别混淆、等权连接、无方向性等问题。
在L2-ARCTIC数据集上,F1-score达59.52%,优于L1-aware基线(56.83%)和分类图方法(CAT-GCN-MDD 58.12%),验证语言特定统计图的有效性。
通过数据驱动的方式为不同母语群体构建统计混淆图,显著提升了MDD的检测与诊断性能。
现有音频表示基准(如HEAR, SUPERB, MARBLE)主要关注单声道和语义任务,缺乏对空间信息的系统评估;任务导向的基准(如DCASE, LOCATA)将表示质量与下游架构、监督信号、训练策略混杂,难以隔离空间编码能力。
提出Spatial Audio Representation Learning (SARL)基准,通过控制仿真构建平衡空间声学场景数据集,覆盖源级(方位角、仰角、距离、事件类别)和房间级(RT60、体积、形状)因素。采用统一线性探针协议,在冻结编码器上训练轻量分类器,实现架构无关的比较。此外,引入敏感性分析,通过扰动源或房间因素测量嵌入的几何响应。
对14个预训练编码器(单声道、立体声、双耳、FOA格式,涵盖自监督、监督、编解码器范式)进行评估,发现: - 输入格式和训练范式显著影响空间编码能力,多通道(尤其是FOA)模型整体更优。 - 源级因素(方位角、距离、类别)的系统解码难度始终低于房间级因素(RT60、体积、形状)。 - 敏感性分析显示,表示对不同因素(源vs房间)的扰动呈现异质性响应,房间因素变化对嵌入影响更大。
该工作通过控制探针范式系统性揭示了当前预训练音频表示对空间信息的编码偏好与偏差,为空间表示学习提供了标准化评估工具。
当前LLMs在音乐理解与生成方面主要聚焦于西方调性传统,对结构迥异、低资源的非西方音乐传统(如南亚古典音乐)缺乏系统评估。现有基准和生成框架无法捕捉基于拉格(raga)、塔拉(tala)的旋律与节奏约束。
该工作首次系统评估LLMs在南亚古典音乐上的能力,揭示了结构有效性与风格忠实性是分离的目标,并验证了现有自动指标不足以评估文化引导的音乐生成。
儿童自动语音识别(ASR)面临挑战:儿童语音与成人差异大,且在不同发育阶段(3-12岁及以上)变化显著。现有的单一共享适配器无法充分捕捉年龄相关的声学变异,导致不同年龄组的词错误率(WER)存在较大差距。
本文首次系统研究年龄感知适配器调优在儿童ASR中的应用,证明年龄专用适配器优于统一条件适配器,且预测年龄路由可行。
作者提出5项保守但关键的现代化修复:
- TorchScript兼容:移除脚本化路径中的动态状态突变和子模块构造,为逆辅助函数提供精确静态类型。
- 逆STFT约束:限制可靠逆变换仅适用于均匀频率尺度(freq_scale='no'),对其他尺度抛出显式运行时错误。
- CFP修复:将Blackman-Harris窗口导入从scipy.signal改为scipy.signal.windows。
- VQT一致性:确保γ=0时VQT退化为CQT,符合数学定义。
- 引入iCQT:基于Landweber迭代的可微逆CQT模块,重建波形SNR>30 dB,支持端到端梯度传播。
本文对nnAudio进行了工程导向的保守现代化,解决了阻碍研究和部署的关键兼容性与正确性问题,但未引入新算法或改进性能。
基于语言模型的文本转语音(LM-TTS)系统中,情感韵律的跨说话人控制面临挑战:传统任务向量算术在模块化架构中有效,但在LM-TTS中因架构差异(情感信息缺乏明确的权重功能位点)而失效。
该工作首次证明在LM-TTS中,基于说话人嵌入的质心算术可实现有效的无训练情感控制,且跨语言适用。
当前多模态安全基准仅关注视觉模态,无法评估同时处理视觉、音频和文本的全能大语言模型(Omni LLMs)的安全性。现有基准依赖单一模态,不能反映现实世界中需要跨模态综合判断的复杂安全场景。
MCBench揭示了当前Omni LLMs在跨模态安全推理上的严重缺陷,为提升多模态模型的安全感知能力提供了关键基准和诊断工具。
当前的大型音频语言模型(LALMs)均为离线模式,需要完整音频片段才能响应,且流式音频模型各自仅处理单一任务(如流式ASR或语音对话),缺乏统一的在线交互能力。
本文提出AUDIO-INTERACTION,一个统一的流式在线交互模型,通过“感知-决策-响应”循环实时处理音频流,自主决定何时响应或保持沉默。其训练框架SOUNDFLOW包含三部分: 1. 交互数据合成:通过分层事件策展流水线(含TFJP模块)将短片段合成为连贯的长交互序列。 2. 交互感知训练:将音频建模为块级序列决策,引入历史回顾和理解感知沉默机制。 3. 异步交互推理:采用先进先出方案解耦编码与解码,降低首帧延迟4.5倍。 此外,构建了STREAMAUDIO-2M数据集(302k小时,2.6M样本,覆盖7大能力28子任务)和PROACTIVE-SOUND-BENCH评测集。
在8个基准上,AUDIO-INTERACTION在主流任务上保持竞争力(MMAU 58.15 vs 57.81),并在全语音和多轮设置中超越现有模型。同时解锁了实时ASR、流式音频指令跟随和主动帮助等离线模型无法实现的能力。
AUDIO-INTERACTION通过统一流式架构实现了在线音频交互的范式转变,兼顾性能与实时性。
传统发音模型难以复制双声唱歌(如Sygyt)中窄带共振峰聚焦效应,标准低维声道参数化无法精确控制高频泛音区域。
提出可微分Kelly-Lochbaum波导扩展模型,包含:(1)舌下辅助声源;(2)三次B样条声道参数化;(3)空间可学习阻尼;(4)泛音显著性损失函数。通过梯度下降端到端优化。
在20个独立Sygyt片段(5位歌手、10个音高)上,相比发音基线降低30-38%对数谱距离,在泛音区域提升最显著;倒谱包络分析显示能准确恢复合并共振峰结构;表现优于DDSP谐波+噪声基线。
提出首个基于可微分发音模型的双声唱歌复制合成方法,物理参数可解释且性能优异。
UAT通过耦合连续音频扩散与离散文本扩散的双流DiT架构,首次实现扩散中心框架下的统一音频生成、编辑与字幕,有效桥接声学合成与语义理解。
现有监督源分离依赖大量干净源数据,且易受域偏移影响。无监督方法多采用回归或预训练生成先验,但回归会产生伪影,而预训练先验仍需干净数据。
提出SURF(Separation via Unsupervised Remixing Flow),一种无监督流匹配框架,直接从观测混合中学习源分离。核心步骤: 1. 教师模型(初始为MixIT)估计源; 2. 对估计源进行重混(remixing)生成新混合及伪目标; 3. 学生流匹配模型(基于FLOSS)学习预测重混源或原始混合; 4. 学生模型通过指数移动平均更新教师模型,迭代提升。
方法本质上连接了流匹配的速度场与回归目标,并揭示了与Wake-Sleep算法的联系。
在图像和音频分离基准上,SURF显著优于现有无监督方法,达到新SOTA。
SURF首次将流匹配成功应用于无监督源分离,无需干净源数据,性能领先。
当前语音大语言模型(Speech LLMs)在处理长语音(>30秒)时存在显著性能下降,主要因为:1)大多数模型基于Whisper编码器,只支持30秒音频;2)即使较新模型(如Phi-4、Qwen2.5-Omni)移除架构限制,但缺乏长语音训练数据,导致泛化不足。IWSLT 2026指令跟随赛道的新任务(包括惊喜任务)对模型避免过拟合提出了挑战。
本文通过大规模数据增强和创新的重排序策略,有效提升了多语言长语音指令跟随性能,揭示了似然重排序在语义任务上的失败模式,为解决长语音多任务学习提供了实用方案。
传统的自动语音识别(ASR)评估依赖参考文本(如WER),但实际场景中参考文本往往不可得。现有无参考方法如内部置信度或语言模型评分,要么校准差、过自信,要么忽略语音信号本身。缺乏既能局部定位错误又无需额外训练的指标。
提出READ(Reference-free Hypothesis Evaluation with Acoustic Discrepancy),利用预训练的离散自回归TTS模型(如CosyVoice2),在教师强制模式下计算给定文本假设下语音令牌的条件负对数似然,作为声学差异度量。通过TTS注意力图提取单调对齐,将帧级差异映射回文本段,实现细粒度错误定位。无需额外训练,可直接用于假设优化(句子级重打分、段级组合、与ROVER集成)。
首个利用TTS生成模型的声学差异实现无参考、细粒度、鲁棒的ASR假设评估与优化方法。
语音大模型(SLLM)在复杂推理任务中显著落后于文本模型,但该差距并非均匀分布:空间、句法、事实类任务上语音性能与文本相当,而在需要实体跟踪的逻辑推理任务(如web of lies)上,语音准确率跌至随机水平。作者诊断其根本原因在于语音编码中的时间池化与降采样操作模糊了离散的实体边界,导致隐式推理中实体-属性绑定失败(entity binding failure)。
提出实体感知思维链(Entity-Aware Chain-of-Thought, EA-CoT),在推理前强制模型显式列举实体、记录属性声明,将隐式绑定转换为文本空间中的显式锚定。针对web of lies任务设计四步提示:(1)列举所有人名;(2)记录每个声明;(3)逐步推理;(4)提取答案。通过对比控制实验(其他任务使用结构化CoT但无实体跟踪)和Token预算分解,确认语音增益完全来自显式语义绑定指令,而非生成长度增加。
在Qwen2.5-Omni和Phi-4-Multimodal上评估VoiceBench BBH的四个子集(共1000条)。web of lies上S2T准确率从随机水平提升至接近文本水平:Qwen提升16.8个百分点(从约50%到66.8%),Phi-4提升24.4个百分点(从约50%到74.4%),模态差距大幅缩小。其他任务中语音性能本就接近文本,EA-CoT带来的增益较小。Token预算分解表明,仅增加生成长度(256→1024)无改善,增益全部来自指令本身。
该工作精准定位了语音推理落后的核心瓶颈,并通过简洁有效的推理时干预几乎消除了模态差距,为语音大模型的推理能力提升提供了全新视角。
现有神经音频编解码器在重构质量与token效率之间难以平衡,往往编码背景噪声、录音伪影等感知无关信息,导致语义和声学信息丢失,token率过高(数百t/s),阻碍LLM-based音频生成。
CleanCodec通过感知引导的编码策略,首次在极低token率(12.5 t/s)下实现SOTA重构质量和下游任务性能,兼顾效率与鲁棒性。
声场重建(尤其是HRTF上采样)面临数据稀疏、个性化差异大、传统深度学习方法易过拟合的问题。小样本条件下,难以捕捉多尺度统计结构。
提出Masked Wavelet Scattering Transform Neural Field (MSNF),两阶段框架: 1. Phase 1:Mask Identification——从少量多受试者数据中学习二进制掩码,筛选出跨个体一致性的WST系数。 2. Phase 2:Neural Field Reconstruction——利用MLP神经场连续建模声场,损失函数结合观测MSE和掩码后的WST系数MSE,施加统计先验正则化。 关键技术:WST作为可解释、固定滤波器组的特征提取器,避免学习型CNN过拟合;掩码机制保留共享结构,滤除噪声。
通过HRTF上采样任务验证,与基线方法(消融研究)比较,证明MSNF有效提升稀疏观测下的重建精度。
首次将WST作为先验用于声场重建,提出掩码神经场框架,兼具可解释性与小样本泛化能力。
传统图像源模型(ISM)在计算矩形房间的高阶反射时,复杂度为 O(k^N)(k为半径,N为维度),导致N≥3时计算代价高昂,难以生成高维房间脉冲响应(RIR)的混响尾部。此外,传统ISM的反射数量呈多项式增长,与真实声场的指数增长不符,导致混响时间偏差。
本文提出基于高斯圆问题(GCP)的计算方法,将ISM中的晶格点计数问题转化为GCP,并利用几何卷积(FFT)降低复杂度。具体地: - 通过递归关系(式5)和面积函数(式6),将N维晶格点计数简化为低维子问题。 - 进一步利用卷积核(式7)和FFT(式8),将复杂度降至 O(N k^2 log k),内存需求 O(N k^2)。 - 扩展至非原点源-接收器情况(式10-11),支持坐标平移、缩放和加权(如壁面反射系数)。 - 提出两种RIR重构方法:通过体积函数的有限差分近似(2.2节),以及复数反射系数的组合(2.3节)。
本文通过数学降维与信号处理技巧,显著加速了高维ISM计算,为生成高密度、低着色的混响尾部提供了可行方案,但牺牲了角度依赖和连续性(仅整数坐标)。
助听器要求极低的延迟(<10 ms)和功耗(1-3 mW),而当前的DNN语音增强系统在嵌入式硬件上难以同时满足这些约束。传统方法如波束形成、谱减法在非平稳噪声环境下性能下降,DNN方法虽效果好但计算量大,无法直接部署。
该工作通过系统测量明确了嵌入式FPGA部署时域DNN语音增强的资源需求,并量化了与助听器部署之间的差距,为未来低功耗硬件优化提供了方向。
直接随机平滑(RS)在音频分类中是不明确的,因为音频预处理(归一化、特征提取、后处理)改变了被认证的空间,导致相同的半径可能对应不同的认证对象。
提出表示感知的报告框架,要求明确指定:认证对象(波形、特征空间、后处理)、扰动位置、增益策略、原始半径、信号相对尺度(SNR等效)、后噪声变换。定义了三种合同:固定增益波形平滑、特征空间平滑、后处理波形平滑。
在关键词检测(Speech Commands)和环境声音分类(ESC-50)上诊断: - 相同原始半径(0.007996)下,不同波形能量导致不同SNR(83.98 vs 90.97 dB); - 特征空间平滑在ESC-50上获得更高认证准确率(68.42% vs 65.53%),但认证的是特征而非波形; - 裁剪或峰值归一化改变有效扰动几何(D_geom差异达230-351×)。
本文揭示了音频随机平滑中表示选择的关键影响,为鲁棒性报告的标准化提供了重要指导。
传统助听器依赖固定的频率增益和压缩,无法在复杂声学环境(如鸡尾酒会问题)中提供足够支持,且未解决内耳编码功能障碍(如毛细胞损伤、突触病变)。
提出可微分听觉环路(DAL)框架,整合生物启发的CARFAC耳蜗模型(已移植至JAX)和轻量级CNN网络SEANet。通过比较正常听力与模拟听力损伤的神经活动模式(NAP)和稳定听觉图像(SAI),利用梯度下降优化SEANet,使其同时实现降噪和听力补偿。
在神经表征和信号保真度指标上,DAL优化的SEANet优于传统Master Hearing Aid (MHA)基线。
首个基于可微分生物模型实现超个性化助听器信号处理的ML框架,有望硬件部署用于临床。
本文通过通道导向设计解决EEG信号早期混合导致的信息损失,显著提升从EEG到音乐的重建质量,并提供了理论分析和强经验验证。
低资源语言的对话式自动语音识别(ASR)因缺乏领域匹配的多说话人训练数据而严重受限。传统数据增强方法无法引入新的词汇、说话人角色、话语结构或主题变化。
提出一个三阶段流水线: 1. LLM生成场景与对话:使用LLM生成包含话题、参与者元数据(年龄、性别、职业、角色)以及结构化多轮对话。 2. 元数据条件TTS合成:根据说话人元数据从参考库中匹配最接近的语音配置文件,利用xTTS-v2进行语音克隆合成。 3. 说话人感知对话模拟:将合成的话语按对话结构组合,包含停顿、重叠等交互特征。
实验对比了GPT、Claude Haiku、Gemini、Grok 1、Qwen五种LLM家族,在单生成器、固定预算混合和规模扩展设置下均采用FastConformer-Large训练。
在匈牙利语BEA-Dialogue基准上,合成对话持续提升ASR性能。最大配置使用67小时真实对话+636小时模拟数据,性能超过使用2700小时匈牙利语训练的零样本模型。生成器选择和组成方式显著影响增益。
LLM生成的对话数据经TTS合成后,可作为真实对话语料的有效补充,尤其适用于低资源语言的对话ASR训练。
助听器中声学反馈限制最大增益,传统开环训练的深度反馈消除(DFC-OL)在高增益下可能不稳定,导致啸叫。
提出在环训练的DFC(DFC-IL),将DFC直接集成到优化循环中,使模型在训练中暴露于不稳定场景;采用两阶段训练策略:先在稳定系统预训练,再在宽增益范围微调,从而学习鲁棒的啸叫抑制。
在测量反馈路径上的实验表明:小增益时DFC-IL与DFC-OL性能相近,均优于自适应滤波器;高增益时DFC-IL通过维持系统稳定性明显优于DFC-OL。
DFC-IL通过训练与推理一致性显著提升助听器稳定增益,是反馈消除领域的有效改进。
实时音乐伴奏生成面临严格因果约束:模型必须低延迟生成,不能访问未来输入,且需保持音乐连贯性。先前方法因采用教师强制(teacher forcing)导致暴露偏差(exposure bias),在自回归推理中错误累积,且往往需要一定的未来视角(lookahead)才能实现强混合适配,限制了实时应用。
在多乐器音乐伴奏基准上,LiveBand在客观音频质量(如FAD)、节拍对齐准确率和混合遵循度(如MIREX指标)方面均显著优于先前基于因果Transformer的离散令牌方法,并在消费级GPU上实现实时流式生成(无未来lookahead)。
首个严格因果、无未来视角的实时伴奏生成系统,通过对抗序列监督与训练推理一致设计,实现了高质量、高同步的现场音乐伴奏。
现有音频-视觉事件识别方法多采用浅层融合(如拼接、分数级融合),难以有效建模复杂的跨模态依赖和长时序交互;端到端训练大规模Transformer模型计算成本高且训练不稳定。
提出稳定混合交叉注意力融合框架(Stable Hybrid Cross-Attention Fusion),包含: 1. 利用冻结的预训练VideoMAE和AST提取视觉与音频特征,并通过缓存特征提升效率。 2. FiLM(特征线性调制)模块以视觉为条件调整音频表示,实现早期跨模态交互。 3. 双向交叉注意力融合(音频→视觉和视觉→音频),配合多模态Transformer编码和模态-时间注意力,进一步捕获互补信息。
在AVE数据集上,最佳验证准确率91.74%,五次独立运行测试准确率83.85±1.40%,平均性能优于单模态及简单多模态基线。
提出了一种高效、稳定的混合融合策略,有效结合预训练模型与条件调制,在多模态事件识别中取得领先性能。
现有零样本TTS方法通常使用VAE潜变量或mel频谱等压缩表示,导致信息损失和非端到端训练,限制了生成质量。直接对原始波形建模虽有潜力,但因音频信号序列过长而极具挑战。
提出WavTTS,首个基于流匹配(Flow Matching)与扩散Transformer(DiT)的原始波形生成TTS模型。关键设计包括: - 波形分块(Patchification):将原始波形划分为非重叠块,降低序列长度。 - x-预测目标:直接预测干净波形,相比速度预测更稳定。 - 多尺度mel频谱监督:提供感知指导,加速收敛。 - 噪声调度设计:对齐信号-噪声方差,并采用高噪声偏移时间调度,提升鲁棒性和自然度。
在开源基准上,WavTTS接近当前最先进的潜在空间生成式零样本TTS模型性能,显著优于以往端到端语音生成模型。
WavTTS验证了直接对原始波形进行扩散式TTS的可行性,挑战了高质量TTS必须依赖中间声学特征或离散令牌的普遍假设。
现代说话人验证(SV)系统依赖难以用自然语言解释的说话人嵌入,缺乏结构化、可查询的文本证据层。现有语音-文本语料多为话语级描述,缺少说话人级、双语、野外环境的证据基监督。
SpeakerCard-1M提供了首个大规模、双语、证据基的说话人级文本-音频语料,为可解释SV及跨模态研究奠定基础。
COMPASS为S2ST评估提供了第一个标准化、多维且领域感知的统一基准框架,显著提升了评估的可比性和实用性。
现有联合音频-视频生成模型(如MM-Diffusion)需要大量训练资源,且即使训练后仍常出现文本-模态不对齐、音视频不同步等问题,用户需多次推理才能获得满意结果。
在VGGSound和JavisBench-mini上,所提框架在文本一致性、感知质量和音视频同步上均显著优于基线和单验证器方法(如Best-of-N、EvoSearch),总体提升约23%(基于JavisDiT)。
首个系统研究ITS在多模态生成中的应用,通过多验证器与自适应加权策略有效提升了联合音频-视频生成质量。
首个基于动态评分量规的音频指令跟随评估框架,兼具高判别力、可解释性和跨领域通用性。
本文通过创新的Active-Frame池化与多组件训练策略,成功将Whisper应用于多类咳嗽分类,在公开数据集上达到领先性能,并实现移动端部署。
当前语音增强领域的研究缺乏对生成式与判别式方法的系统性比较,尤其是在鲁棒性、计算复杂度以及幻觉特性方面的全面评估。现有工作多基于小规模、同质化数据集,且未充分考虑实际应用中常见的低信噪比、训练数据不匹配等场景。
论文构建了大规模的生成式(扩散模型如SGMSE+、BBED、GALDSE;条件流匹配FlowSE;一致性模型SE-Bridge;GANs如NoCoGAN、DisCoGAN、CMGAN、NCSN++ (GAN))与判别式(DCCRN、GCRN、NoCoGAN (D)、NCSN++ (D))模型库,在多维度(高/低SNR匹配/不匹配、数据量、收敛速度、复杂度-性能权衡)上进行对比,并引入词错误率(WER)和音素相似度(LPS)评估幻觉效应。
该研究首次系统性地在多维度对比了生成式与判别式语音增强方法,实证了GANs在性能与复杂度间的最佳平衡,为实际部署提供了重要参考。
现有音频分词器在理解与生成任务间存在权衡:重建导向的编解码器保留声学保真度但缺乏丰富语义;语义感知分词器通常依赖独立的语义和声学流,导致冗余或对齐不足。此外,语义监督常局限于ASR转录,忽略说话人身份、情感、韵律、声学场景等非文本线索。
EntangleCodec通过语义-声学纠缠和丰富字幕对齐,实现了统一且高效的离散音频表示,在重建、理解和生成任务上均达到 competitive 性能,且在小模型规模下展现出强大的扩展能力。
多模态融合中,不同模态的贡献不平衡,弱模态可能包含有用信息但也可能引入噪声或冲突,直接融合会干扰预测。现有方法多在联合优化阶段调整损失或梯度,忽略了在融合前就能识别并调制不可靠模态成分的可能性。
提出Value-Gated Modality Refiner (VGMR),一种轻量级预融合校准模块: - 在摘要层面捕获跨模态的一致与冲突信号; - 估计全局和通道层面的价值信号(context-conditioned impact evidence); - 使用价值信号指导细粒度门控,在融合前对原始模态特征进行增强、保留或抑制。 VGMR作为即插即用组件,可附加到不同融合骨干,无需修改预测头。
在情感理解、动作识别、音视频事件检测和音视频情感分类等五个基准上,VGMR在序列和卷积融合设置下均提升性能。额外分析(模态移除、合成噪声、训练动态、特征可视化)表明预融合校准能减少不可靠模态的干扰,实现更稳定的多模态优化。
本文提出了一种新颖的预融合上下文校准策略,通过价值估计显式区分模态成分的有用性,显著改善多模态融合的鲁棒性和性能。
现有音频-视觉大语言模型(LLM)幻觉评估基准主要关注环境声音(如狗叫)作为事件指示器,忽略了人类语音的丰富语义和时序结构。语音不仅指示事件发生,还包含密集语义(如指令、评论)和跨时间描述(过去、现在、未来),现有基准无法捕捉由此引发的幻觉模式。
提出 SVHalluc,首个全面评估语音-视觉幻觉的基准,从两个关键互补维度设计任务: 1. 语义幻觉: - 全局语义对齐(GSA):判断语音是否整体描述视频内容。 - 细粒度语义对齐(FGSA):判断语音中提到的物体是否在视频中可见。 - 跨模态语义绑定(CMSB):判断语音中的动作与视频中物体组合的事件是否真实发生。 2. 时序幻觉: - 时序对齐(TA):判断叙述事件是否与语音同时发生。 - 时序预测(TF):判断叙述事件发生在语音之前、同时还是之后。 - 跨模态时序绑定(CMTB):判断语音时刻对应的视觉动作。
所有任务采用二选一或多选题形式,系统诊断模型在语义和时序上的跨模态对齐能力。
SVHalluc 揭示了当前音频-视觉LLM在语音-视觉对齐上的根本局限,为未来跨模态鲁棒性研究提供了关键基准。
SegTune通过层级分段提示和LLM时长预测,首次实现了歌曲生成中时间动态属性的细粒度可控,显著提升了表达的动态性和对齐精度。
现有标记器通常针对单一模态设计(如图像分块、音频压缩、视频时空潜在网格),缺乏统一的跨模态标记语言。
提出 Wavelet as Tokenizer (WAT) 框架,核心思想是: - 使用一层 Haar 离散小波变换/逆变换作为前端,将信号分解为局部多尺度系数。 - 定义共享的小波系数标记模式:每个标记包含(值、模态、秩、尺度、位置、子带)等结构化元数据。 - 采用轻量级模态值适配器和共享的标记级编码器-解码器主干,支持音频(1D)、图像(2D)、视频(3D)的联合重建。 - 探索固定率能量选择和掩码稀疏训练,实现自适应标记分配。
本文初步证明音频、图像、视频可通过共享小波标记模式实现统一重建,为进一步实现通用离散词汇表奠定了基础。
当前听觉大语言模型(LLMs)在低资源任务(如儿童语音识别)中性能下降,因为模型未显式训练以利用少样本演示(few-shot demonstrations)进行推理。传统的少样本提示(ICL)虽可动态适应新领域,但效果上限受限于模型对演示条件格式的不熟悉。先前方法如直接微调可能导致零样本能力遗忘或仅学会格式而非利用演示。
提出FSA-GRPO(Few-Shot Aware GRPO),一种基于强化学习(GRPO)的模型无关后训练策略,通过设计两种奖赏鼓励模型利用少样本演示: 1. ASR奖赏:基于词错误率(WER)衡量转录准确性,鼓励模型在有用时利用演示。 2. 语义对齐奖赏:促使生成结果与检索到的演示标签在语义嵌入空间中接近,增强演示感知。 训练仅使用高资源成人ASR数据(Common Voice英文子集),无需目标域数据,即可提升通用少样本适配能力。此外,研究了数据选择策略和辅助奖赏权重,以优化训练配方。
首个基于强化学习(GRPO)的听觉LLM后训练方法,在不依赖目标域数据的前提下,有效提升模型的少样本适应能力并保持零样本性能。
SoulX-Transcriber通过两阶段训练和对话模拟数据管道,有效提升了多说话人转录在复杂对话环境中的鲁棒性和准确性,达到SOTA性能。
传统的语音去噪依赖合成干净-噪声配对数据,但真实场景中难以获取干净语音,导致域泛化差。Noisy Target Training (NyTT) 使用带噪语音作为目标,但优化目标不收敛于干净语音估计,存在偏差。
本文提出 Differential Noise Filtering (DNF),利用噪声不可分离性(网络无法区分同一分布下的两种背景噪声),同时估计带噪语音和人工噪声,通过相减得到干净语音。理论推导表明,NyTT 下网络倾向于输出两者噪声混合的一半,因此相减可完美抵消。该方法兼容合成与真实数据联合训练,且优化目标一致。
通过巧妙的双输出差分设计,将 NyTT 的固有偏差转化为优势,实现域自适应语音去噪的显著提升。
现有自监督语音表示学习方法(如HuBERT、WavLM)通常依赖严格的帧级对齐,限制了速度扰动等时间增强,且未能充分利用不同说话风格下的语言内容不变性。
提出了SiamCTC框架,结合孪生网络与连接主义时间分类(CTC),通过CTC损失学习柔性单调对齐,无需严苛的帧级对应;同时引入时间对比损失(Temporal InfoNCE)防止表示坍塌,并使用对齐一致性损失(KL散度)引导对齐质量。整体框架可处理速度扰动并保持时间一致性。
在LibriSpeech上使用HuBERT和WavLM作为基础模型进行微调,在音素识别(PER)和语音识别(WER)任务上均取得优于基线和SPIN、LASER等方法的结果。例如:HuBERT+SiamCTC在PER上降低1.09%,WavLM+SiamCTC在WER上降低0.48%。
SiamCTC通过CTC实现灵活的时间对齐,有效提升语音表示对语速变化的鲁棒性,是一种新颖且有效的自监督学习方法。
现有对话表征方法(如局部相邻轮次度量)混淆了对话特定的交互模式与说话人自身的特征,导致模型可能依赖说话人身份而非真正的对话协同适应(conversational entrainment),从而限制了其作为对话适应度量的有效性。
本文提出的speaker-switch测试是一种稳健的诊断工具,能够有效验证对话表征是否捕捉到真正的交互结构,而不仅仅是说话人特征。
Domain-agnostic incremental learning for sound classification: In domain-incremental learning (DIL), the same set of sound classes must be learned across multiple domains sequentially, without access to previous domain data and without domain labels at inference. The main challenge is catastrophic forgetting and accurate domain inference.
This paper formalizes the first benchmark for domain-agnostic incremental learning in audio classification (DCASE 2026), providing a challenging baseline and dataset for future research.
传统波束形成方法在处理移动宽频随机声源时,需要短时窗或时域多普勒补偿,难以处理长观测窗口和非平稳信号。论文作者此前提出的2.5D逆定位方法仅适用于单频源,无法直接扩展至随机宽频源。
基于自由场传播的模拟数据(速度高达100 m/s),验证了该方法能够定位和区分不同移动宽频声源,并讨论了非平坦谱和相关源的影响。
该工作理论推导严谨,首次将Loève谱与2.5D框架结合处理移动宽频随机声源,为频域逆定位提供了新思路,但当前仅限前向问题,逆问题求解未涉及。
Echo展示了单ViT编码器通过JEPA预训练和逐步专业化,可在共享潜在空间内同时支持说话人日志、语音识别和动态源分离,尽管在端到端ASR上存在瓶颈,但证明了多任务共存的可行性。
通过将文本信息集成到语音表示学习中,显著提升了EL语音增强的效果,为辅助通信技术提供了可扩展且实用的方法论。
该工作为语音亲属关系验证建立了开放世界评估基准,揭示了说话人嵌入中编码的亲属信息,但当前性能仍需提升。
本文首次为罕见喉部疾病RRP提供纵向语音数据集与基准,验证了自监督预训练模型在低资源场景下的优越性,为临床远程监测奠定基础。
本文介绍了DCASE 2026挑战赛任务2,通过双通道噪声感知设置推动无监督异常声音检测在噪声环境下的实际应用。
长语音识别(ASR)要求在准确率和延迟之间权衡。基于分块的流水线(如WhisperX)延迟低,但损失跨块上下文,需要脆弱的启发式方法来对齐说话者和时间戳。长上下文ASR模型(如VibeVoice-ASR)单次推理准确率高,但延迟高一个数量级。
提出MURMUR系统,在两层次上解决权衡: 1. 块间层次(Inter-chunk):重新审视分块流水线,将块大小作为可调超参数,中间块大小(300秒)在准确率和延迟间取得良好平衡。 2. 块内层次(Intra-chunk):利用注意力稀疏性,采用滑动窗口KV缓存淘汰策略,同时应用于输出token和语音token。语音token在大多数层中只需不到25%即可保留99%的注意力权重。
在AMI-IHM数据集上,MURMUR匹配单次推理准确率,同时延迟降低4.2倍。结合token淘汰后,相对tcpWER退化小于1%。
MURMUR通过分块并行推理和注意力稀疏性利用,在不牺牲准确率的前提下显著降低长语音ASR的推理延迟。
传统多音调估计(MPE)无法区分音高来源,多乐器MPE面临训练数据稀缺、源分配困难。
轻量级slot-attention框架为多乐器MPE提供了有前景的源感知方向,但源分配仍需更精细的耦合机制。
现有的EEG语音数据集大多规模小、模态单一、语言覆盖有限(多为英语或中文),且缺乏跨设备、跨会话的纵向记录,难以支持语音解码、多模态信号处理及跨域适应研究。此外,公开的日语发音EEG数据集尤为稀缺。
本文构建了JapanEEG数据集,包含1020小时同时记录的EEG(62-128通道)、面部EMG(3通道)和语音音频,来自3名健康日语母语者在开放式词汇发音任务中。使用了三种EEG系统(g.Pangolin、g.SCARABEO、eego™sports),跨数月采集多个会话,提供时间同步的多模态信号、语音事件标注和转写。数据集以BIDS格式公开,支持语音解码、伪影建模、纵向/跨设备适应及表示学习等研究。
技术验证表明:功率谱密度呈现1/f特征,任务相关α波段衰减,以及时间锁定的诱发电位,验证了信号质量。数据集总计1020小时,其中g.Pangolin系统贡献731.7小时,g.SCARABEO 134.6小时,eego™sports 153.7小时;包含大量发音事件(如sub-01 overt pangolin有115404个事件),支持丰富分析。
大规模、多模态、跨设备的日语EEG-EMG-语音数据集,为语音解码及相关领域提供了宝贵资源。
现有儿童指向语音(CDS)检测方法多基于孤立语句,忽略上下文信息,且主要针对英语,缺乏跨语言泛化能力。此外,缺乏在真实流水线(如自动分段)下的评估。
通过上下文增强和域内预训练,显著提升了长时录音中CDS检测的准确性和泛化能力。
PolySpeech-100是当前语言多样性最丰富的语音理解基准,为下一代包容性、全能的Speech-LLM评估树立了新标准。
提出一种连续效价-唤醒条件控制的语音对话框架,有效融合多模态情感线索,提升情感对齐。
连续归一化流(CNF)等深度生成模型在分布外(OOD)检测中存在“似然悖论”,即倾向于给OOD样本分配高似然,这是由于模型偏重低层结构细节而非高层语义一致性。现有方法大多将生成模型视为静态概率估计器,忽略了训练和推理过程中的动态信息。
本文提出拉格朗日子流(LSF)框架,通过将高维空间分解为目标子空间和互补空间,并利用“运动学密封”消除互补空间的速度分量,从而恢复子流的自治性,使局部密度变化可独立诊断。基于子流轨迹上的速度场,设计了几何诊断信号(如速度场散度、曲率等)用于OOD检测,特别针对零样本音素级错音检测任务。
在基于CNF的语音合成模型上进行实验,验证了LSF框架能有效缓解似然悖论。在真实错音检测基准上,所提指标优于基于似然的方法,展示了局部几何信号在OOD检测中的优势。
本文通过解耦全局流中的局部子流动力学,为CNF的OOD检测提供了新的诊断途径,并在语音错音检测中取得显著改进。
当前声音设计流程中,声音库检索(基于文本或手动浏览)与程序化合成(需参数调整)相互分离,工具碎片化导致创意迭代中断。
提出QuAP(Quality Audio Prototyping)原型系统,统一以下三模块: 1. 混合检索:结合文本元数据搜索与基于内容的相似性检索,采用MobileNetV3提取深度声学嵌入,通过FAISS实现近实时向量索引。 2. 程序化合成:嵌入六种优化后的合成模型(火、爆炸、喷气、火箭、直升机、枪声),覆盖加法、模态、减法等类型,并应用后处理(混响、压缩、EQ等)。 3. 智能参数引导:基于特征驱动瓶颈框架([21])和主观评估,提供感知有效的参数推荐范围,降低程序化交互门槛。
系统架构分为离线索引(异步提取嵌入并存储)与在线查询(拖放/文本输入,检索相似样本)两阶段,并支持检索样本与合成音频的混合分层。
QuAP通过统一检索与生成、结合智能参数引导,有效降低声音设计中的工具切换负担和合成参数复杂度。
SALLMs(语音感知大语言模型)在域外场景(如儿童语音、多语言、代码切换)中泛化能力差,即使预训练已接触过相关语言。现有方法如微调(计算昂贵)、LoRA(仍需梯度更新)、ICL(受限于语音声学变异性)均存在不足。现有的对比激活引导方法需要配对对比样本,在ASR中难以获取。
提出SALSA(Speech-Aware LLM Adaptation via Learned Steering Activations):一种轻量级引导方法,直接通过监督目标学习逐层引导向量,无需对比样本。干预形式:在每个引导层应用归一化加法更新:˜h_l = (h_l + v_l) / ||h_l + v_l|| * ||h_l||,仅训练引导向量V,所有骨干参数冻结。优化目标:自回归交叉熵损失。
在儿童语音(RSR, MyST, OGI Kids)、多语言(CommonVoice俄语和契维语)、代码切换(SEAME)等域外基准上,SALSA显著优于零样本和语音上下文学习基线,相对提升高达46.8%。分析显示:引导编码器(尤其是后层)比引导LLM主干更有效,表明引导调整高层声学/音素表示以对齐预训练语言模型空间,而非修改解码器。
SALSA是一种高效、无需对比样本的轻量级语音模型域外适应方法,通过学习编码器引导向量显著提升ASR性能。
当前韵律表示(prosody representation)在语音理解与生成中至关重要,但声学-韵律特征(如音高)不可避免地携带说话人身份信息,导致隐私泄露风险(如深度伪造身份盗窃)。传统方法依赖手工特征且归一化不可靠,而自监督学习方法往往忽略说话人解纠缠。
本文提出一种结合说话人解纠缠策略的自监督韵律表示学习方法。主要贡献: 1. 输入处理:使用声门波估计(glottal source estimation)替代原始波形,鲁棒性更强,并引入1kHz低通滤波减少词汇内容泄漏。 2. 隐藏单元:从声学-韵律特征(周期度、说话人归一化后logF0、ΔlogF0、第一梅尔倒谱系数)经k-means聚类生成,其中F0进行说话人均值归一化以消除说话人影响。 3. 损失函数:结合掩码预测损失(L_mp)、跨度边界损失(L_sb)和对抗性说话人识别损失(L_adv_spk)。通过梯度反转层,使编码器无法预测说话人身份,从而强制解纠缠。 4. 训练:使用GigaSpeech语料库(11K小时),通过伪说话人标签(聚类生成)训练500K步。
在三个下游任务上评估: - 音高重建(LibriTTS):使用MSE,包括零均值归一化版本。 - 短语边界检测(BU Radio Corpus):F1和准确率。 - 音节重音检测(BU Radio Corpus):F1和准确率。 - 说话人识别(VoxCeleb1)评估解纠缠效果。
结果:提出的编码器在所有韵律任务上优于HuBERT-base和原始韵律特征基线,尤其在音节重音检测上提升显著。消融实验显示,说话人归一化和对抗损失均有效降低说话人信息泄漏,且不损害韵律建模性能。
通过说话人归一化与对抗损失,实现有效的韵律表示解纠缠,在保护隐私的同时提升韵律相关任务性能。
扩散和流匹配驱动的TTS模型虽然自然度高,但缺乏明确的情感控制;情感信号与说话人身份纠缠,导致现有监督方法需重新训练模型,成本高且泛化性差。
一种即插即用、无需重新训练的情感控制框架,有效解耦情感与说话人身份,在多种TTS模型上达到领先的情感表达能力。
UNISON是首个将层级深度LLM融合应用于统一音频生成与编辑的模型,通过统一的潜在空间和深度语义条件实现了多任务的高效联合训练与竞争性能。
匈牙利语对话语音识别(ASR)面临公共对话风格训练数据稀缺的问题。现有BEA-Dialogue语料库虽提供对话数据,但由于严格的说话人无关分割(训练/验证/测试集之间所有说话人均不重叠),可用时长仅85小时,限制了模型性能。
本文提出BEA-Dialogue+,通过放宽分割约束(仅保证主要说话人不重叠,允许实验者和对话伙伴出现在多个分割中),将语料库扩展到200小时。同时采用序列化输出训练(SOT)技术,在转录中插入说话人变化标记
在Whisper和FastConformer系列模型上评估,BEA-Dialogue+相比原语料库更具挑战性(更多重叠语音),但SOT微调一致地降低了WER、CER、cpWER和cpCER,并提高了说话人变化准确率(scAcc)。例如,FastConformer XLarge模型在BEA-Dialogue+上微调后WER从15.48%降至13.03%。
BEA-Dialogue+是一个更大且更具挑战性的匈牙利语对话ASR基准,通过可控的数据泄露权衡提供了实用的训练资源。
声学无人机检测面临严重的泛化问题:需在未见过的录音设备、环境及无人机类型(域外数据)中可靠区分无人机信号与环境噪声,同时保持极低的误报率以满足实际监控需求。
通过AudioSet预训练与针对性数据增强,显著提升了无人机检测的泛化能力,尤其在域外场景下表现鲁棒。
在公共广播系统和助听器中,声反馈限制了最大增益,同时信号常包含混响。现有方法分别处理声反馈消除(AFC)和去混响(DR),但缺乏联合处理方案。
论文证明在闭环延迟足够长且闭环传递函数可近似为FIR滤波器的条件下,声反馈信号可视为源信号的晚期混响分量,从而将联合DR和AFC问题转化为纯DR问题。采用加权预测误差(WPE)算法,结合STFT域递归最小二乘(RLS)实现联合处理。
使用MYRiAD数据库的RIR(混响时间0.5s)和CSTR-VCTK语音信号,在4麦克风阵列下对比WPE与连续自适应滤波器(CAF-CTF)。WPE在AFC性能上达到或超过CAF-CTF,同时实现去混响。
通过将反馈信号建模为晚期混响,首次实现去混响算法直接用于声反馈消除,简化了系统设计。
SwanVoice通过创新的数据流水线和模型架构,显著提升了长格式零样本对话语音合成的表现力和连贯性。
现有文本-语音合成(TTS)和文本-音频生成(TTA)模型通常分别处理语音和环境音频,难以联合生成自然融入环境上下文的语音。环境感知TTS方法(如VoiceLDM、VoiceDiT)未能充分建模跨模态交互,导致语音与环境不匹配。
提出ImmersiveTTS,基于多模态扩散Transformer(MM-DiT)架构,采用双流设计:语音流处理转录对齐的语音特征,环境流处理文本条件的环境上下文,通过联合注意力显式建模跨模态交互。引入领域特定表示对齐(Domain-Specific REPA)目标,利用预训练的自监督语音(如HuBERT)和音频编码器(如CLAP)对齐中间表示,提升语义一致性。采用流匹配(Flow Matching)生成目标。
在客观指标和主观听测上,ImmersiveTTS在自然度、可懂度和音频保真度上优于现有方法。消融实验验证了领域特定对齐的有效性。
一种通过显式跨模态交互和领域特定表示对齐实现高自然度环境感知语音合成的方法。
在视频到空间音频和文本到空间音频任务上,SwanSphere在生成质量和音视频对齐方面均优于基线模型,且延迟更低。
SwanSphere通过新颖的自回归扩散框架和对比学习策略,首次实现了流式低延迟、高保真的全景空间音频生成,解决了质量-延迟权衡和跨模态空间对齐两大关键难题。
提出SURE框架,包含: - 统一评估管道:标准化预测格式、归一化、评分,支持多种任务(ASR、S2TT、SD等)。 - 三轨设计:Track I(场景压力测试)、Track II(全栈理解评估)、Track III(可控训练,agent辅助转换论文+代码为可运行管道)。 - RPS指标:相对性能分数,基于当前最优动态归一化,支持任务扩展。
SURE通过标准化评估、多场景压力测试和可控训练,提升了语音理解模型部署导向的可比性和复现性。
现有语音翻译评估方法各自独立,难以统一比较不同模态(S2TT/S2ST)和不同模式(离线/流式)的系统。
提出OpenSTBench,一个统一的多维度评估框架: - 统一的输入格式、评估器接口和输出模式 - 三大评估维度:翻译质量(BLEU, chrF++, COMET, BLEURT)、语音质量(自然度、说话人保留、情感保留、副语言保真度)、时间质量(时间一致性、流式延迟) - 支持离线与流式设置,兼容S2TT和S2ST
对代表性系统(Qwen3-LiveTranslate、SeamlessM4T-v2等)评估发现,不同维度上系统排名变化显著,表明应基于应用需求进行多维度比较。
OpenSTBench是首个系统化统一多维评估语音翻译的框架,极具实用价值。
零样本TTS中,自回归解码延迟高,而直接应用块扩散到离散语音令牌时,由于语音令牌分布呈长尾(如静音令牌占主导),导致并行位置选择偏向高频令牌,降低合成质量。
通过轻量级推理时技术解决了离散语音令牌块扩散中的长尾偏差问题,实现了高质量、低延迟的流式零样本TTS。
现有音频超分辨率方法存在以下问题: 1. 单一带宽限制:如AEROMamba P只能处理固定输入带宽,无法灵活适应多种采样率。 2. 计算成本高:扩散模型(如AudioSR)虽然感知质量好,但迭代采样过程导致推理速度慢、GPU内存消耗大,难以实时部署。
提出FiPA-SR架构,基于GAN的感知音频超分辨率模型,关键创新点包括: 1. FiLM条件调制:在U-Net的残差块中引入特征线性调制(FiLM)层,通过输入采样频率的归一化向量γ(c), β(c)控制特征图的仿射变换,使单个模型能自适应处理不同输入带宽(8/20/32 kHz)。 2. 统一输入预处理:将低分辨率信号上采样至44.1 kHz,保证不同采样率下的频谱图尺寸一致。 3. 复合损失函数:结合对抗损失、频谱重建损失、特征匹配损失和PAQM感知损失进行训练。
在MUSDB数据集上,FiPA-SR与AudioSR和消融版本PA-SR对比: - 客观指标:在所有输入带宽(8/20/32 kHz)下,FiPA-SR的LSD(Log-Spectral Distance)更低、ViSQOL分数更高。 - 计算效率:GPU内存消耗仅为AudioSR的1/3,推理速度(10秒音频)快60倍以上,归因于参数量小(约100倍)和GAN单步生成。 - 消融实验:去除FiLM后(PA-SR)在低带宽下性能显著下降,表明FiLM对跨带宽泛化至关重要。
FiPA-SR通过FiLM条件调制实现了高效、低资源的多带宽音频超分辨率,在感知质量和计算效率上均优于扩散模型基线。
巴西葡萄牙语(pt-BR)的口音分类受限于可靠的标注数据。大规模自监督学习(SSL)模型虽然强大,但其训练过程会稀释社会语音信息,因为口音标签通常不可靠或未被用于训练目标。此外,SSL模型的高维嵌入空间将说话人身份和口音特征纠缠在一起,使得口音检测困难。
提出一种纯音频驱动的流程,利用多语言强制对齐器(ZIPA)在口语巴西葡萄牙语中定位特定的社会语音学标记(如/s/、/r/、/d/、/t/的变体),并结合经典信号处理(频谱特征、MFCC)或ZIPA softmax概率进行特征提取。通过低维声学特征和口音标记定位,避免了对SSL模型高维空间的依赖,且不需要社会语言学标签。
在三个音位任务(/s/韵尾、/r/韵尾、/d/-/t/腭化)上,使用平衡分层交叉验证评估。最佳结果表明:/s/韵尾分类准确率1.00(仅用ZIPA特征);/r/韵尾准确率0.85(频谱+ZIPA+Allosaurus组合);/d/-/t/腭化准确率0.88(频谱+ZIPA)。轻量级特征集在多数任务上优于或媲美大型SSL模型。
本文通过局部声学特征和强制对齐器,以最小的标注需求实现了高精度的巴西葡萄牙语口音分类,展示了音频驱动方法在口音任务中的潜力。
MARS首次揭示并解决了SSL-SVDD黑盒攻击中的线性陷阱问题,显著提升了对抗迁移性,暴露了当前防御的严重脆弱性。
检索增强文本到音乐(TTM)系统通过从音乐描述数据库中检索详细描述来增强用户的高层提示(如"给我一首学习的平静音乐"),但引入了一个安全依赖:攻击者可向数据库注入恶意描述(caption),误导生成过程。
提出双层次描述毒化攻击,在保持检索相关性的同时注入目标描述: 1. 锚点保留:保留原高层语义(如"平静学习")确保可检索性; 2. 目标生成:选择功能相反的目标(如紧张/恐怖),但低级声学描述(如慢速、回音)仍与原始查询兼容,避免冲突; 3. 低级注入:注入攻击者控制的声学描述(如"缓慢的脉冲无人机")影响后续生成。
在MusicCaps数据库、CLAP检索器和MusicGen生成器上验证:毒化后的生成音频与攻击者目标意图的相似度大致翻倍,同时与原始用户查询的对齐度几乎不变。
首次系统性揭示了检索增强文本到音乐系统中的描述毒化安全风险,并提出了有效的攻击方法。
当前视频到音频生成(V2A)模型在生成高质量音频方面表现优异,但缺乏对物理过程正确性的评估。现有基准主要关注感知真实性(如FAD、CLAP),忽略了模型是否真正理解物理因果机制。
提出FlatSounds基准,包含两种评估模式: 1. 受控反事实对:通过时间扭曲对齐视频,仅改变单个物理因素(如材料、容器满溢度),测试模型生成的音频是否反映相应物理变化。 2. 单视频模式:测试内部一致性(如重复相同撞击)和方向趋势(如钢琴音高递增)。 采用物理度量(如攻击时间、衰减率、音高)和时间对齐度量(命中覆盖率、时间误差)进行评估。
对SOTA模型(CoDi、ThinkSound、FoleyCrafter、Im2Wav)进行测试,发现关键权衡: - 文本描述提升物理和语义正确性,但降低时间同步。 - 移除文本描述后,部分模型时间对齐指标反而提升,表明模型依赖文本“作弊”而非真正理解视觉物理。 - 物理度量与人类偏好强相关。
FlatSounds揭示了V2A模型在物理推理上的严重缺陷,指出当前视觉编码器是核心瓶颈,未来需从像素层面学习物理过程。
铁路车辆螺栓接头预紧力损失导致刚度、阻尼和非线性特性变化,现有监测技术难以结合受控激振器测试和非线性特征感知。
提出一种基于振动声学技术的螺栓松动检测方法,采用单音和调频(FM)激励。在演示装置上,对螺栓施加0%、20%、40%、80%预紧力,使用三轴加速度计和麦克风采集信号。先通过正弦扫频和窄带白噪声识别主固有频率130 Hz,然后施加130 Hz单音激励和125-135 Hz调频激励(调制频率1-20 Hz)。通过谐波带功率比(归一化到载波)区分松动状态和80%预紧状态。
该方法结合受控激振器、加速度计和麦克风,无需预紧力传感器,通过可解释的非线性特征有效检测螺栓松动。
现有语音分词器难以同时满足可解码性、可学习性和语义丰富性,导致统一生成-理解模型需复杂架构设计。离散分词器有量化损失,连续分词器多仅优化重建或生成,缺乏统一表示接口。
HoliTok通过渐进式训练构建了兼顾保真与语义的连续语音潜空间,为统一语音生成与理解提供了高效且通用的表示接口。
专业音乐制作人在使用AI和自动化工具时面临速度与效率、可控性和创造性代理之间的张力。他们希望加快工作流程,但又担心失去对细节的控制和艺术自主权。
本文采用民族志方法,对专业录音工程师、混音师和制作人进行直接观察和半结构化访谈,深入理解AI工具在工作流程中的实际影响,而非仅依赖问卷调查。
专业人士普遍接受AI工具用于提高效率(如自动均衡、压缩),但对黑箱设计持谨慎态度。他们强调可控性至关重要,倾向于在自动化基础上保留手动微调能力。信任和舒适感是采用AI的关键因素。
该研究通过定性数据揭示了专业音乐制作人与AI工具之间的复杂关系,为设计更符合专业人士需求的自动化工具提供了重要指导。
呼吸音分类(RSC)在多站点部署时面临听诊器带来的设备偏差(device shift),不同设备的声学风格与病理内容纠缠,导致模型依赖设备伪影而非不变病理特征,泛化到未知设备性能下降。
提出一个因果启发的多模态联邦域泛化框架(BTS-CAFE),包含三个关键组件: - 生成式设备风格干预网络(GIN):通过内容保留的风格扰动(如增益干预、随机分组卷积、频率掩码)实现因果意义上的 do(S) 操作,打破设备风格与标签的虚假关联。 - 反事实文本增强:对文本元数据中的设备属性进行中和,消除文本分支中的捷径。 - 梯度对齐:在客户端间进行单样本梯度对齐,促进设备不变表示学习。
在 ICBHI 和 SPRSound 数据集上采用留一设备验证(LODO),所提方法在跨设备泛化上优于传统数据增强和联邦学习基线,包括 FedAvg、FedCAug 等。
该工作首次在联邦域泛化框架下系统地解决听诊器导致的设备偏差问题,通过因果启发的风格干预和梯度对齐有效提升了呼吸音分类的跨设备泛化能力。
传统的两阶段语音语言模型(如VALL-E、MELLE)先训练编码器(如codec或VAE),再训练自回归模型。编码器不感知下游任务,导致提取的表示可能不是最优的,并且离散化表示容易丢失任务相关信息。此外,自回归梅尔频谱建模常出现无限静音和单词遗漏等问题。
MELD提出一种基于梅尔频谱图的离散潜在变量模型,将编码器和自回归语言模型联合优化。模型扩展生成过程为离散潜在空间和连续梅尔频谱空间:1)使用soft向量量化(基于k-means初始化的码本)将梅尔帧量化为离散潜在变量;2)解码器仅Transformer自回归预测下一个离散潜在变量或文本token,同时通过变分下界(VLB)优化量化网络、自回归网络和重构网络;3)重构网络(类似Tacotron2)从潜在嵌入和历史信息重建梅尔帧,并附加卷积后处理;4)引入慢速惩罚(slowness penalty)促进生成多样性;5)通过特殊token
在零样本TTS延续任务上,MELD一致优于MELLE、VALL-E等基于codec的基线。在STT任务上,联合优化带来更低的词错误率,优于独立离散化的dMel表示。离散采样有效抑制了自回归梅尔建模中的无限静音问题。
MELD通过联合优化离散潜在变量模型,同时改善了梅尔频谱自回归建模的TTS和STT性能,为语音语言建模提供了一种新的范式。
CLAP模型在音频-文本多模态对比学习中存在显著的模态间隙(modality gap),导致零样本条件交换(如音频描述任务)性能下降。现有解释仅归因于锥形效应(cone effect),即均值偏移,但纠正均值效果有限。其他假设(信息不平衡、维度坍缩)缺乏验证。
提出COMET框架,基于PLS-SVD分解CLAP嵌入空间,揭示了彗星状结构:紧凑的共享语义头部(head)和弥漫的模态私有尾部(tail)。模态间隙由均值成分、头部和尾部共同贡献。基于此,提出训练无关的谱截断方法PLSHead,通过截断私有尾部并保留共享头部,有效缩小模态间隙。该方法无需大内存库或额外训练,同时大幅降低嵌入维度。
在零样本音频描述任务中,PLSHead使条件交换性能接近全监督方法;在音频-文本检索和音频描述任务中保持或提升性能,且显著降低维度。
一种新颖、高效、训练无关的模态间隙缓解方法,通过概念分解揭示了模态间隙的本质,并实现了显著的性能提升。
核心痛点:基于LLM的ASR虽然准确率高,但自回归解码速度慢。扩散语言模型(DLM)提供并行解码替代方案,但其解码策略在ASR中尚未被系统评估。
方法创新:本文系统评估了三种DLM解码策略:固定数量解码(每轮承诺固定数量的高置信度token)、静态置信度阈值解码(承诺置信度超过固定阈值的token)、动态置信度阈值解码(基于置信度分布自适应调整阈值)。提出了使用负对数似然(NLL)不确定性作为解码进度的代理指标,分析逐轮准确率和吞吐量。
实验结果:在LibriSpeech test-clean上,静态阈值策略(C=0.95)在WER 2.81%下实现1.7倍加速(vs AR基线WER 2.78%);全并行设置下达到3.5倍加速(WER 4.13%)。阈值策略在准确率-速度权衡上优于固定数量策略。ASR置信度高度集中(93.7% token置信度≥0.90),使得阈值策略能早期快速承诺可靠token。
一句话评价:静态阈值解码策略在DLM-based ASR中兼顾准确率和效率,是当前最优的并行解码方案。
当前语音语言模型(SLM)社区追求“统一”离散token,以同时支持语音理解和生成。然而,社区普遍依赖词错误率(WER)作为token质量的代理指标,形成一种幻觉:低WER的token必然保留了生成高保真语音所需的信息。本文指出,这本质上是欺骗性的:高频token之所以在生成任务中成功,是因为隐式信息泄漏;当通过极端压缩隔离纯语义信息时,会剥离连续生成模型所需的精细发音和微动态,导致合成失败。
为了验证假设,作者开发了一种动态压缩分词器(Dynamic Compression Tokenizer),其核心是宏观固定比率、微观动态对齐机制,智能地将连续表示与声学-语义边界对齐,从而实现超低帧率的同时保持极低WER。该方法克服了标准固定步长下采样任意截断音素边界的瓶颈,为公平评估提供了条件。
提出双探针协议(Dual-Probing Protocol),将同一超低帧率token序列分别输入判别性理解探针(基于冻结LLM)和生成性探针(基于连续流匹配,并采用oracle时间对齐)。通过控制语义完整性和时间混淆因素,隔离token本身的表示充分性作为唯一变量。
揭示了WER陷阱:理解能力(低WER)与生成能力(高保真合成)之间存在根本性矛盾。语义分类(由低WER奖励)与连续语音合成所需的音素轨迹本质上是正交的。极端语义压缩导致重构语音出现严重的发音模糊,即使有oracle时长对齐也无法挽回。
统一token的幻觉被打破,建议SLM社区转向显式解耦的语音表示,即分别优化用于理解和生成的表示。
本文犀利地指出了当前语音语言模型社区在“统一token”信仰下的方法论陷阱,并提供了严谨的实验证据和新的分析工具。
SwanBench-Speech为长语音生成提供了迄今为止最全面、细粒度的评测基准,有效揭示了当前模型的短板并推动了研究方向。
随着大型音频语言模型(LALMs)能力的增强,传统音频代理的“先分解再调用工具”策略可能不再有效,甚至成为瓶颈(orchestration bottleneck)。关键问题不再是能不能使用工具,而是何时需要获取外部证据来补充模型自身的判断。
提出 AUDIO-MIND,一个可审计、可插拔的音频理解框架: - 条件性证据获取:动态结合强前端模型与规划器引导的工具使用,仅在存在证据缺口时调用外部工具或重听操作。 - 工具分类与边界:将工具分为感知工具(提取观测)和变换工具(修改音频),并为每个工具定义明确的证据支持范围(tool boundaries),避免将局部测量误用为全局结论。 - 可审计推理轨迹:显式记录前端观测、规划器决策、工具输出、重听结果和最终理由,便于错误分析和质量提升。
AUDIO-MIND 通过条件性证据获取和显式审计设计,解决了强 LALM 下代理工具的过度使用问题,在准确性和可解释性上均有显著提升。
传统VSR系统采用从左到右的自回归解码,对视觉模糊的token(如不易区分的视素)可能过早做出错误决策,且无法利用后续上下文进行修正。
在LRS3数据集上(仅使用其标注训练数据)达到19.5%的WER,刷新当时SOTA。
首个将DLLM用于VSR的工作,通过灵活解码顺序和长度建模有效提升视觉语音识别性能。
当前语音深度伪造检测研究多集中于自动化系统,而人类在实际社会技术环境中检测合成语音的能力被低估。人类检测性能常受限于孤立实验室条件,忽略日常交流中的多模态线索(如情感、信任标签等),导致对检测能力的系统性高估。
该研究首次在社会技术框架下系统探究人类检测合成语音的上下文影响因素,揭示了听觉感知与信任机制的非对称性。
现有音频统一分词器通常使用高维连续表示(如>768维)联合编码语义和声学信息,导致下游扩散变换器(DiT)建模负担重,需要更宽的模块或更多参数才能有效收敛。
LoSATok通过语义瓶颈将音频表示压缩至128维,同时支持高效理解和生成,为跨域音频统一建模提供了轻量级解决方案。
MoDAl通过自监督的对比-解相关双目标学习,成功发现并利用了被先前工作丢弃的Broca区互补语言信息,显著提升了语音神经假体的解码性能。
当前自动化语音分析在认知评估中存在三个瓶颈:(i) 仅聚焦于阿尔茨海默病与健康对照的二元分类,对轻度认知障碍(MCI)的细微变化不敏感;(ii) 数据集多为英语单任务,泛化性差;(iii) 将临床评分视为独立平坦的目标,忽略了标准认知评估固有的层次结构。
本文利用TREND研究中的5754条德语录音(包含1个MMSE筛查任务和5个CERAD+诊断任务),构建了三级预测层次:Level 1(任务级)、Level 2(领域级)和 Level 3(全局级)。提取了手工声学特征(eGeMAPS,包括韵律和嗓音质量子集)和自监督学习表征(wav2vec 2.0, HuBERT)。采用5×3嵌套交叉验证,比较了Ridge回归、SVM/SVR和XGBoost在不同特征和任务上的预测性能。关键创新点在于建模评分层次结构,并揭示了任务约束对预测性能的影响:开放式任务(如音素流畅性)的性能随层次升高而下降(“专家”表征),而结构化任务(如MMSE)的性能随层次升高而上升(“通才”表征)。
本文通过层次化建模揭示了任务约束与认知评估层级的交互作用,为细粒度语音分析用于MCI检测提供了新视角,但手工特征在二元分类中的优势表明SSL表征仍需优化。
大型音频语言模型(LALMs)在多轮交互中难以保留非语音声学信息(如环境声音),存在语义(语音)和声学(非语音)理解之间的性能差距,但根本原因不明。
本文系统性地揭示了多轮LALM中非语言声学记忆退化的原因——表示层漂移而非检索失败。
低比特率语音编码在带宽受限场景下至关重要,但现有方法在高度压缩时丢失关键信息,导致质量严重下降。波形编解码器(如SoundStream、EnCodec)依赖残差向量量化(RVQ),进一步降低比特率困难;频谱编解码器(如MDCTCodec)虽轻量,但在超低比特率下性能退化。
提出CFMDCTCodec,完全在改进离散余弦变换(MDCT)域操作,结合轻量级编码器-量化器-解码器结构的MDCT频谱编解码器和噪声先验感知的条件流匹配(CFM)增强器。编解码器使用单码本量化实现极低比特率压缩,增强器通过条件MDCT速度场滤波器与ODE求解器,在幅度自适应噪声先验引导下恢复精细频谱细节。采用非对抗联合训练,同时优化重建、量化和CFM目标。
在0.65 kbps超低比特率下,客观和主观评估均优于SoundStream、EnCodec、MDCTCodec、FlowDec等基线,逼近大规模编解码器(如BigCodec)的感知质量,且参数量和计算复杂度显著更低。
提出了一种高效的低比特率神经语音编解码方案,通过MDCT域编解码器与CFM增强器的协同,实现了高质量与低复杂度的平衡。
本文描述了KSAA-2026共享任务2的获胜系统,该任务要求从语音音频和未带变音符的转录文本中生成完全带变音符的阿拉伯文本,仅有2,327个训练样本且不允许使用外部数据。系统基于CATT-Whisper多模态架构,通过训练正则化(R-Drop一致性正则化、Optuna优化的高权重衰减超参数、Focal Loss)和推理时集成(200次随机前向传播平均)显著提升性能,最终以23.26%的WER获得第一名。
该工作证明了在低资源多模态阿拉伯语变音符恢复任务中,训练正则化比架构创新更为关键,结合MC Dropout集成可有效提升性能。
超低比特率语音编码在带宽受限场景中至关重要,但极端比特率下信息丢失和量化不稳定导致自然度和说话人身份保持困难。现有波形域或谱域编码器通常需要深度下采样/上采样层或多码本量化,导致计算复杂度高,难以在极低比特率(如250 bps)下取得高质量。
提出FMelCodec,一种基于梅尔谱的三阶段编码-精炼-重建(CRR)框架: 1. 梅尔谱编码阶段:采用单码本VQ(1024条目),结合在线聚类策略重分配未充分利用的码字,防止码本崩溃,实现640倍压缩。 2. 条件流匹配精炼阶段:利用轻量级速度场估计器和CFM求解器,对粗梅尔谱进行精炼,并引入自一致性训练支持少步推理,降低计算开销。 3. 声码器驱动重建阶段:使用预训练的HiFi-GAN声码器从精炼梅尔谱重建波形。
系统可在16 kHz下运行于250 bps,48 kHz下运行于750 bps,无需依赖自监督语义特征,模型和计算复杂度低。
在两个数据集(两种采样率)上,客观(如PESQ、STOI)和主观(MOS)评估一致表明,FMelCodec在超低比特率下实现了更高的语音重建质量和说话人相似度,同时计算和模型复杂度低于强基线(如Encodec、APCodec、WavTokenizer等)。
FMelCodec通过梅尔谱域的三阶段CRR框架和条件流匹配精炼,在极低比特率(250 bps)下实现了高质量语音编码,兼顾效率与性能。
在基于刺激重构的听觉注意力解码(AAD)中,深度学习模型在不平衡数据集(即每个音频刺激作为注意和不注意角色出现次数不均)上会高估解码准确率,这一问题未被系统研究。
首次系统揭示并解决了刺激重构AAD中数据集不平衡导致的性能高估问题,提出了实用的交叉验证协议。
现有基于方向统计的掩码估计方法(如cACGMM, cBMM, cWMM)分别定义,缺乏统一框架来系统研究密度轮廓对分离性能的影响。
提出复数球面学生t混合模型(cSTMM),通过自由度参数ν统一了cACGMM(ν=M)、cBMM(ν→∞)和cWMM(ν→∞且特征值约束)。推导了基于广义MM的参数估计过程,并给出了高浓度近似(HCA)。
在无噪声的LibriSpeech混响语音(使用实测RIR)上进行评估,使用单一开发集选择的ν*=1,在所有声学条件下均优于ν=M(cACGMM等效设置),平均SDRi提升0.25 dB。同时数值验证了模型恢复(cACGMM、cBMM、cWMM)。
cSTMM提供了一个统一且灵活的框架,通过调整密度形状改善了盲语音分离性能,但增益随麦克风/源数量变化。
现有神经声码器通常局限于GAN或扩散模型之一,难以灵活应对实际应用;ConvNeXt基生成器(如Vocos、WaveNeXt)仅在GAN框架中使用,在多说话人场景下性能有限;扩散模型虽训练快但CPU推理慢。
提出WaveNeXt 2统一框架,基于ConvNeXt架构,通过残差去噪和子建模,使同一生成器同时适配GAN和扩散模型。具体地: - 修改WaveNeXt生成器以预测每个时间步的噪声分量,而非直接生成波形。 - GAN版本(GAN-WaveNeXt 2)采用固定点迭代简化训练,无需初始噪声和增益调整。 - 扩散版本(Diff-WaveNeXt 2)将去噪任务分为四阶段,每个子模型负责特定噪声范围,并结合BDDM噪声调度和频谱增强后滤波。
WaveNeXt 2通过残差去噪和子建模首次在同一架构中高效实现了GAN和扩散两种声码器,兼顾速度与质量。
当前情感文本到语音(TTS)模型虽然成功控制言语韵律,但忽略了非语言发声(NV),如笑声、哭泣等,而这些对于真实情感表达至关重要。现有NV数据集缺乏细粒度标注,限制了模型精确控制NV生成的能力。
该论文通过细粒度非语言发声数据集和模型,显著增强了情感TTS的情感表现力和可控制性。
被动多目标跟踪中,传统的检测前跟踪方法假设目标对传感器数据的贡献仅由其运动状态决定,忽略了未知发射信号的影响,导致在低信噪比下性能下降。
提出子空间TBD方法,利用复Bingham分布构建似然函数,将归一化多通道传感器数据投影到由假设目标状态导向矢量张成的信号子空间上,无需显式建模或估计未知发射信号。在粒子滤波框架中,每个多目标假设对应一个低维子空间,通过评估数据与子空间的对齐程度计算似然。
在模拟声学环境(3m×3m房间,40个麦克风)中,对两个移动目标进行跟踪,信噪比为-10 dB。提出的子空间TBD方法能够有效跟踪目标,而传统确定性贡献基线方法产生更大的跟踪误差。
提出一种适用于被动传感场景、对未知发射信号鲁棒的子空间检测前跟踪方法。
级联ASR-LLM口语对话系统面临错误传播问题:ASR转录错误(尤其删除错误)会污染下游LLM处理,而传统置信度过滤无法区分错误类型(听觉感知 vs 语言理解),且无法检测删除错误,导致恢复策略单一、效率低。
提出因果感知错误恢复框架,包含: 1. 细粒度错误检测器:基于冻结ASR内部表征(TDT联合嵌入、编码器输出),训练轻量级模块,区分感知错误、理解错误、删除错误和失真事件(如噪声、混响等)。 2. LLM驱动的交互澄清:利用检测器输出的结构化错误信息(位置+原因),引导LLM生成针对性澄清问题(如要求重复、换环境等),通过多轮对话消除歧义,避免无效重提示。 3. 迭代式恢复流水线:ASR→检测→LLM澄清→用户回应→更新转录,最多K轮直至澄清。
该工作通过细粒度因果诊断赋能LLM进行主动澄清,为级联口语对话系统错误恢复提供了高效、可解释的范式。
语音系统面临非平稳环境,现有持续学习(CL)方法假设任务边界离散、表征解耦,但现代语音基础模型(如wav2vec 2.0、HuBERT、Whisper)的表征高度纠缠,同时编码语言、说话人、副语言等多因素,导致传统CL策略(如EWC、LwF)在参数级约束难以稳定共享表征几何结构。微调(LoRA、Adapter)虽减少破坏性更新,但仍引入跨任务干扰。
提出以表征为中心的CL分类法,根据表征几何演化方式分为四类: - 几何保持:在分布偏移下维持现有结构(如适应新声学条件)。 - 几何扩展:融入新信息(如新语言、说话人)同时保持兼容性。 - 几何对齐:保持多模态表征空间(如声学-文本)的一致性。 - 几何专门化:为基础模型适配新能力(如音频描述、对话)。
此外,从适应位置(声学编码器、对齐层、语言模型、记忆系统、智能体)提供了补充视角。
现有方法(重放、正则化、架构隔离)在语音基础模型场景下存在根本性局限:重放受隐私和存储限制;正则化在纠缠表征中参数级约束失效;架构隔离(如PEFT)仍残留表示漂移。强调了灾难遗忘不仅表现为性能下降,更会导致潜在表征几何的腐蚀(如音素可分性降低、说话人流形塌缩)。
本文系统反思了语音领域CL的假设缺陷,提出了针对基础模型表征特性的新分类与开放挑战,为后续研究提供了理论与评估框架。
传统Capon波束形成器在非平稳声学环境中,固定窗口的样本协方差估计无法适应时变干扰,导致性能下降。
提出时间分段波束形成器,基于动态规划的分段最小二乘(SLS)框架,将观测记录划分为变长平稳段,并引入复杂度惩罚项防止过拟合。包括: - 批处理分段波束形成器(BSB):全局优化,非因果。 - 在线分段波束形成器(OSB):因果实时处理,通过动态变化点检测自适应调整窗口,具有对数遗憾界。
在SwellEx-96数据集和分布式麦克风阵列上验证,OSB相比固定窗口方法具有更低的输出功率和更高的干扰抑制能力。
一种数据驱动的动态分段波束形成框架,有效解决非平稳环境下的自适应滤波问题。
现有基于语音的帕金森病检测主要依赖监督学习,需要大量标注数据。虽然LLM和LALM展现了零样本推理能力,但不同输入模态(手工声学特征 vs 原始音频波形)对多语言PD检测性能的影响尚不明确。
本文系统地比较了两种零样本PD检测输入模态:(i) 从语音中提取的手工声学特征输入通用LLM(LLaMA 3);(ii) 原始波形输入LALM(Qwen2-Audio、Pengi)和LARM(Audio-Reasoner)。实验在四种语言的PD语音数据集上进行(孟加拉语、英语、意大利语、西班牙语),统一了特征提取和提示模板。
该研究首次系统对比了零样本LLM/LALM在PD检测中不同输入模态的效果,揭示了模态选择对多语言泛化的关键影响。
现有零样本文本到语音(TTS)系统虽能模仿参考语音的风格和音色,但难以从不同参考中独立控制二者,且预训练解耦表示在未见过的风格-音色组合上泛化性差。
FC-TTS通过层次化生成架构和辅助训练目标,有效利用解耦语音表示,实现了对风格和音色的独立零样本控制。
该论文通过四个互补探测系统性审计了临床访谈抑郁症检测基准,揭示了评估不稳定性和模态偏差,提供了更保守的参考点和外部验证基线。
核心痛点:在嘈杂、声学多样化的现实场景中,传统TTS模型表现不佳,且高质量语音数据获取成本高昂。需要一种能在野外数据上稳定训练、生成自然且难以被检测的合成语音的方法。
方法创新: 1. 基于F5-TTS架构:采用flow matching和diffusion transformer的非自回归TTS基础模型。 2. 指数移动平均(EMA):在监督微调中集成EMA,稳定训练、提升泛化能力,缓解过拟合。 3. 双评分提示选择(DPS):使用LALM(Qwen2.5-Omni)对音频提示进行质量评分(情感丰富度、表现力、适用性),再使用LLM(Qwen3-30B-A3B)对文本提示进行语义对齐验证,筛选高质量参考。
实验结果: - 开发集:UTMOS 3.20,说话人相似度0.51,WER 8.65%。 - 官方评估:在三个先进SASV系统上取得最佳a-DCF分数(0.1582, 0.5233, 0.2562),表明合成语音最难被检测,自然性和真实性最高。
一句话评价:通过EMA稳定微调和双评分提示选择,F5-TTS-DPS在野外TTS任务中实现了高自然度和强欺骗性,在WildSpoof 2026 TTS赛道中取得领先。
非侵入式可懂度预测任务中,无法使用干净参考信号,需要利用助听器处理后的语音直接预测听力受损者的理解程度。现有方法多使用预训练模型,但如何有效融合多个编码器(如Canary和WavLM)的互补表征,以及融合时机(帧级还是话语级)尚不明确。
提出帧对齐融合(Frame-Aligned Fusion),在池化前对WavLM进行可学习步长卷积下采样,使其与Canary较粗的时间轴对齐,实现帧级拼接融合。同时对比了单骨干基线、均匀分数平均、池化后融合、交叉注意力及反向对齐等策略。所有方法在左右耳分别处理,保持双耳信息。
最佳模型(帧对齐融合+可学习卷积)在CPC3评估集上达到RMSE 24.96±0.06、相关系数0.796±0.001,优于其他融合策略。时间偏移分析表明,精确的帧同步并非必要,粗粒度局部对应是关键。
该工作系统性地揭示了在非侵入式可懂度预测中,预训练多编码器的帧级局部融合优于话语级融合,为助听器评估提供了有效归纳偏置。
传统Clarity Prediction Challenge(CPC)中的可懂度预测方法直接将整句话的音频编码后回归一个句子级分数,但句子可懂度本质上是单词识别结果的聚合,导致训练信号的粒度不匹配。
本文提出参考条件化的词级正确性建模: - 使用冻结的Whisper模型,编码器处理退化语音,解码器以教师强制方式输入规范文本,得到词级解码器状态。 - 增加对齐感知的局部声学分支:通过辅助字符级解码器的交叉注意力图动态选择头部,为每个参考词提取对齐的声学特征。 - 增加全局声学分支:平均池化编码器状态获取句子级校准信号。 - 将解码器特征、局部声学特征、全局声学特征和听障者严重程度嵌入拼接,通过轻量级分类器预测每个参考词的正确概率,再平均得到句子可懂度。
在CPC3官方评估集上,解码器基线RMSE=24.92,相关性=0.795;联合融合方法提升至错误词F1=0.778,MCC=0.626,相关性=0.806,RMSE=24.39。Whisper medium模型上观察到一致趋势。
本文通过引入词级建模和对齐感知多粒度声学融合,有效弥合了训练信号粒度不匹配问题,显著提升了听力受损者语音可懂度预测的准确性。
音素级发音评分需要大量细粒度的音素标注,数据昂贵且稀缺,制约了计算机辅助发音训练(CAPT)系统的性能。
提出一种基于GOPT架构的弱监督训练方法:通过将字/句级别的评分作为监督信号,利用平均或注意力池化机制从音素级预测汇总得到高层级分数,从而仅用高层级标签即可训练音素级评分模型。进一步提出两阶段训练:先用句子级标签预训练,再用少量精选的音素级标签微调。
在Speechocean762数据集上,使用仅句子级标签训练的音素级评分(通过池化)与完全监督(所有层级标签)的结果相当。两阶段训练在仅使用10%音素级标签时性能接近完全监督。
巧妙利用高层级标签的弱监督信号,显著降低了对音素级标注的依赖,实现了近乎全监督的性能。
现有统一音频语言模型在自动语音识别(ASR)、文本转语音(TTS)和实时口语交互三项任务上,往往无法达到专用系统的深度。传统级联流水线在语音转文本中间表示时丢失信息,且不同任务目标(如ASR的准确高效转录、TTS的可控表达、实时交互的低延迟与人格一致)难以自然对齐。
StepAudio 2.5 提出统一的音频语言基础模型,核心思想是:一旦文本和音频共享良好的多模态表示空间,任务差异化便从架构转向操作模式(数据、目标、解码约束)。 - 后训练范式:从标准监督微调(SFT)扩展到任务定制的强化学习从人类反馈(RLHF),作为定义复杂优化目标的主要机制。 - 共享骨干:采用音频编码器-适配器-LLM解码器架构,解码器承载语义、上下文和生成能力。任务专用化通过方向性推理实现:ASR利用可验证的多令牌解码(MTP-5)每次向前步预测6个令牌以加速;TTS通过基于偏好的RLHF和上下文丰富的监督实现可控、富有表现力的合成;Realtime通过生成式奖励建模实现低延迟、人格一致的对话。 - 训练流程:渐进式预训练,包括对齐阶段(冻结编码器和LLM,仅训练适配器)、多模态训练(文本和语音各800B令牌,分为热身和主训练)、冷却阶段(600B高质量数据,扩展序列长度至32K)。
在ASR、TTS和Realtime的标准基准上,StepAudio 2.5 取得最先进的结果,超越领先的统一模型和专用系统。
StepAudio 2.5 证明了一个统一的音频语言基础模型能够通过任务定制的RLHF和解码策略,在理解、生成和交互三个方向上同时达到专用系统的水平。
弱监督声音事件检测(SED)中,获取精确的时间边界标注成本高昂。现有可解释性方法(如集成梯度)虽可用于音频分类,但其在时序定位任务中的有效性尚未被系统评估。
本文系统评估了集成梯度(Integrated Gradients, IG)应用于仅经片段级标签训练的音频分类器时,能否恢复声音事件的时序活动信息。使用合成多声道音频(10类家庭声音,精确的起止时间标注),通过IoU、帧级F1和Pointing Game指标测量IG属性与事件边界的一致性。与弱监督帧级CNN(FW-WS,使用片段级标签)和强监督帧级CNN(FW-SS,使用帧级标签)进行对比。
在10类家庭声音合成数据集上,IG达到平均IoU=0.39,帧级F1=0.52,Pointing Game准确率=82.6%。作为对比,FW-WS为0.42 IoU、0.55 F1、97.3% PG;FW-SS为0.45 IoU、0.58 F1、97.9% PG。所有方法显著优于随机基线。
本文证明即使没有时间监督,后验IG也能捕获有意义的声音事件时序活动模式,其定位性能接近显式生成帧级预测的模型,为弱监督SED的可解释性提供了一种有效替代方案。
UniSRM通过多维度推理分解和一致性强化学习,首次实现了覆盖多种场景的可解释、高可靠语音统一奖励模型。
传统的Evidential Deep Learning (EDL) 使用Dirichlet分布的期望损失,计算复杂且优化困难,难以集成到标准训练流程。同时,softmax分类器在不确定性估计中的理论基础不足。
论文提出一种简化EDL框架的方法:通过泰勒展开将Dirichlet期望损失近似为在Dirichlet均值处评估的损失(plug-in loss),证明当证据足够大时近似误差趋于零。该框架将标准softmax分类器作为特例纳入,从而为softmax用于不确定性估计提供了理论支持。
在Google Speech Commands v1数据集上进行关键词识别任务,比较了经典EDL、简化EDL(包括softmax变体)的预测准确率和选择性预测性能(覆盖-准确率权衡)。结果表明,简化EDL在性能上与传统EDL相当,但实现更简单。
提出了一种理论上合理、实现简单的EDL简化方法,弥合了理论复杂性与实际部署之间的差距,并首次在语音识别任务中展示了EDL的不确定性估计能力。
核心痛点:传统声学语音情感识别(SER)模型在政治演讲的Pathos(情感诉求)分析中表现不佳,原因包括:1)标准SER基准(如EMO-DB)使用表演性语音,生态效度低;2)声学模型缺乏对语义和语境的深度理解;3)Pathos维度(由TRUST多智能体LLM流水线定义)与声学维度(Arousal/Valence)存在概念差异。
方法创新: - 比较三种分析模态:(1)emotion2vec_plus_large声学SER模型,通过后验Russell Circumplex投影得到连续Arousal/Valence;(2)Gemini 2.5 Flash多模态LLM,同时分析音频和转录,开放标签;(3)TRUST-Pathos得分(由三个LLM辩护者集成通过中位数共识得到)。 - 对EMO-DB进行系统性质量评估,使用Gemini进行开放式标注,揭示其结构性缺陷(性别编码不一致、文本转录错误、类别不兼容)。 - 引入后验Russell Circumplex投影概念,并讨论其假设和局限性。
实验结果: - 在Felix Banaszak的Bundestag演讲(51个片段,41个有效Pathos得分)上,Spearman秩相关表明:Gemini Valence与TRUST-Pathos强相关(ρ=+0.664, p<0.001),而emotion2vec Valence不相关(ρ=+0.097, p=0.499)。 - 在EMO-DB上,Gemini开放标注的总匹配率仅为30.1%,其中Disgust匹配率0%,Boredom匹配率12.3%,而平均置信度高达0.82,表明置信度与正确性不一致。 - 低唤醒度的Boredom常被误标为Neutral,表明Gemini在低唤醒德语语音上的表现存在表示差距。
一句话评价:基于LLM的多模态分析在捕捉政治演讲中语义定义的Pathos维度上显著优于纯声学模型,但声学特征仍对低层Arousal估计有帮助;同时揭示了现有SER基准的生态效度缺陷。
当前音频去噪系统采用固定的目标-噪声定义,缺乏上下文感知,导致在不同场景下可能移除有用成分或无法抑制无关成分。
提出自动上下文音频去噪(ACAD)概念,根据推断的音频上下文动态定义目标和噪声。本文限制上下文为声学场景类别,将场景典型事件定义为上下文内(IC),非典型事件定义为上下文外(OC)。方法包含两个模块: 1. 上下文提取器C:预训练的声学场景分类器(CRNN),从输入音频提取上下文嵌入。 2. 去噪模型D:基于UNet,以噪声频谱和上下文嵌入为输入,输出掩码,实现OC成分去除。 训练分两阶段:先预训练C,再联合训练D(冻结或微调C)。
在包含6个声学场景(厨房、公园、餐厅、洗手间、街道、地铁)的合成数据集上,比较了无上下文、Oracle上下文、无关上下文等方法。所提ACAD方法在客观指标上优于所有基线,表明上下文感知能提升去噪性能。
首次将声学场景上下文融入音频去噪,通过动态定义噪声实现自适应降噪,为上下文感知音频处理开辟新方向。
提出DMA-KWS框架,通过双阶段匹配、多模态注册和持续适应,有效解决用户定义关键词唤醒的零样本、说话人差异和数据成本问题,性能SOTA。
Flow-matching 文本到语音(TTS)系统虽然实现了强大的零样本说话人相似度和自然度,但仍然存在内容保真度问题,特别是由于不完美对齐导致的跳跃和重复错误。这些错误在生成语音中表现为单词或短语的重复或跳过,严重降低系统可靠性,甚至可能带来安全合规风险。
提出了 RobustSpeechFlow,一种通过扩展对比流匹配(Contrastive Flow Matching)并引入长度保持的重复和跳跃潜在增强(augmentation)来改进对齐鲁棒性的训练策略。该方法无需外部对齐器、ASR 模型或偏好数据,直接惩罚现实世界中常见的失败模式。具体地,在潜在空间合成“硬负样本”:通过保留长度不变的区域覆盖操作模拟重复错误(同时隐含跳过),以及通过移位并用静默填充模拟跳过错误。训练时,模型不仅学习正确的流匹配轨迹,还通过对比正则化项分离出朝向这些负样本的错误方向,从而在推理时避免类似错误。
RobustSpeechFlow 通过针对 TTS 典型对齐错误的简单潜在增强对比训练,在几乎不增加额外成本的前提下有效提升了内容鲁棒性,是一种实用且高效的改进方案。
无法获取全文内容,跳过总结。
传统的自动主观语音质量评估(SSQA)通常仅提供整体( utterance-level)评分,无法捕捉局部退化,例如短暂失真。现代语音系统产生的高质量语音中退化可能仅局部出现,因此需要更精细的评估。
该工作通过部分混合增强和监督对比学习,首次实现了局部退化的同时检测与分类,为语音质量评估提供了更细粒度的解释性。
传统线性约束波束成形(如LCMV)依赖于精确的空间签名估计,实际场景中难以保证性能;现有深度波束成形方法虽能学习空间和频谱表示,但缺乏显式空间约束,无法可靠实现干扰零陷。
提出一种基于DNN的波束成形框架,通过自适应多损失函数(受增广拉格朗日启发)同时优化信号重建和线性空间约束。损失函数包含三项: 1. SI-SDR损失(目标重建) 2. 无失真响应惩罚(|w^H a_target - 1|^2) 3. 对数域零陷惩罚(10log10(||w^H A_interf||^2))
模型采用U-Net架构,融合注意力机制,输入多通道混合信号及估计的目标RTF和干扰子空间。训练时惩罚权重逐步增加,使网络学习满足约束的波束权重。
在模拟多说话人场景下,所提模型(带估计RTF)相比经典LCMV和未使用RTF引导的模型,在SI-SDR、PESQ等指标上取得更优性能,且旁瓣控制和背景噪声衰减更好。
首次将线性约束显式嵌入DNN波束成形损失函数,实现可解释的多说话人增强和可靠零陷控制。
音频推理面临三大障碍:1)缺乏真正基于音频的推理数据;2)捷径学习和模态幻觉;3)推理深度与实时延迟之间的权衡。
本文首次系统性地定义了音频推理的统一框架,将相关研究归纳为四种范式: - Audio-to-Text推理:从声学信号推断文本答案,强调声学基础。 - Audio-to-Speech推理:在口语交互中嵌入推理,平衡推理深度与对话延迟。 - Audio-Visual推理:整合同步的听觉和视觉证据,需要跨模态对齐和消歧。 - 智能体音频推理:将复杂音频任务分解为感知、规划、工具使用等模块。
此外,论文详细综述了推理范式(CoT提示、监督微调、强化学习、延迟感知交互)以及模型基础(编码器、投影器、LLM骨干、语音分词等)。
作为综述论文,未提供新实验结果,但总结并对比了现有模型(如Audio-CoT、Audio-Reasoner、Mini-Omni等)在各类基准上的表现。
第一篇全面聚焦音频推理的综述,清晰梳理了问题定义、模型基础、范式分类和未来挑战。
传统房间声学模拟(如射线追踪、镜像源法)计算量大,难以用于实时交互式虚拟环境。直接预测房间脉冲响应(RIR)存在高维度和相位不一致问题。
提出基于1D-CNN的框架,直接从房间几何和材料属性预测多频带(24个三分之一倍频程)能量衰减曲线(EDC)。 - 采用复合损失函数:对数域MSE + 斜率惩罚(步长50的差分),确保单调衰减、抑制“阶梯”伪影。 - 模型参数从900万降至90万(90%减少),推理速度提升5倍。 - 使用线性插值上采样+随机符号粘性(RSS)方法重建完整RIR。
一种高效且物理约束的深度学习框架,通过1D-CNN和定制损失函数实现多频带EDC的精确预测,适用于实时声学渲染。
被动声学监测(PAM)在热带生态系统中面临挑战:持续录音产生大量无用音频(鸟鸣占比<10%),现有鸟声数据集多来自温带,模型泛化到热带效果差(声景密集、物种丰富、非鸟类生物声多)。缺乏专为边缘设备设计的短时长、二分类(存在/不存在)数据集。
基线模型MobileNetV3-Small在三随机种子上达到99.57%±0.25%准确率和0.9985±0.0002 AUC,表明标签质量高、任务可分离性强。
首个面向热带边缘部署的大规模鸟类活动检测数据集,具备高质量标签和可复现管道。
当前最先进的TTS模型依赖大规模私有数据集,训练数据不可公开,限制了可复现性和系统性研究。开放数据集规模不足,导致开放模型与私有模型性能差距显著。
该工作通过构建最大的开放TTS数据集和高效的过滤管道,训练出与私有数据模型性能匹敌的DiT-TTS模型,并引入多条件鲁棒性评估基准,极大推动了TTS研究的可复现性。
<|toolcall_begin|>等),允许助手说话时发出工具调用。首个原生支持语音-语言-动作同步的全双工模型,通过三通道结构实现了语义驱动的轮次控制和实时工具调用。
长音频理解中,音频序列极长(如1小时音频对应12k文本token但100k+语音token),且需跨时间分布的多模态声学线索(语音内容、说话人身份、情感、声音事件)进行组合推理。现有LALM直接处理长音频存在计算瓶颈,而基于ASR或音频字幕的方法忽略非语言信息。
提出PlanRAG-Audio,一种基于规划的检索增强生成框架: 1. 音频与语音处理:将原始音频转换为多模态表示(转录、说话人、声音事件等),存入结构化数据库。 2. 检索计划:LLM分析查询生成结构化计划Θ(q),指定所需模态、过滤器、融合方式、输出字段及答案格式。 3. 结构化检索:规则型SQL生成器将计划编译为SQL查询,执行后仅返回相关片段。 4. 答案生成:基于检索结果生成最终答案。 该框架将推理成本与原始音频长度解耦,支持零样本处理多种长音频任务。
在广泛的语音/音频检索任务上,PlanRAG-Audio提高了推理准确性,并随音频持续时间增加保持性能稳定(通过将推理成本与原始音频长度解耦)。
一种通过显式规划检索来高效处理长音频多模态推理的创新框架。
实时声场控制应用中,使用因果有限窗口测量数据重建声场时,传统频域方法假设频带间独立,忽略了窗口引起的频带相关性,导致重建次优。
在模拟和实测声场上验证,相比频域有限窗口基线方法,提出的因果时空估计器在短窗重建中性能更优,且样本选择有效降低计算成本。
本文通过随机波动方程协方差和因果时空LMMSE估计器,并结合预算约束样本选择,显著提升了因果短窗下的声场重建精度。
总结生成失败: 'utf-8' codec can't encode character '\ud83d' in position 14452: surrogates not allowed
在对话语音分离中,远场麦克风捕获的混合信号与近场(close-talk)麦克风捕获的信号之间存在严重的域不匹配问题。近场信号虽然能量高,但包含大量来自其他说话人的串扰(cross-talk)和背景噪声,无法直接用作训练远场分离模型的伪标签。
提出跨说话人语音减少(Cross-Talk Reduction, CTR)任务,旨在从每个近场混合中分离出佩戴者本身的语音。设计CTRnet,利用近场和远场混合信号对进行训练,包括无监督、弱监督和半监督变体。进一步提出PuLSS(Pseudo-Label based far-field Speech Separation),将CTRnet估计的干净近场语音作为伪标签,用于训练远场语音分离模型。整个框架可直接在真实目标域数据上训练,避免了合成数据训练的泛化问题。
在CHiME-6数据集上,PuLSS在Oracle和估计说话人日志条件下均取得了最先进的ASR性能,超越所有CHiME-7/8挑战提交结果。据作者所知,这是首个在真实“野”对话数据上显著优于引导源分离(GSS)的神经语音分离方法。
提出了一种利用近场麦克风信号作为弱监督信号进行远场语音分离的新框架,有效缓解了域不匹配问题,并在真实场景中取得突破性能。
分布式麦克风阵列的盲源分离(BSS)中,直接对全阵列应用FastMNMF计算成本随麦克风数量快速增长(O(IM⁴)),而只使用单个子阵列则无法利用其他子阵列的信息,分离性能受限。
提出Distributed FastMNMF,在源空间协方差矩阵(SCM)上施加块对角结构,每个块对应一个子阵列,使得矩阵求逆和联合对角化仅在子阵列内进行。同时,NMF源谱图模型在所有子阵列间共享,从而聚合源活动信息而舍弃子阵列间协方差。
在同步、无噪声的固定房间和阵列/源几何仿真中: - 计算时间低于全阵列FastMNMF; - 平均源失真比(SDR)高于单子阵列FastMNMF; - 可应用于五源条件(每个子阵列4个麦克风,局部欠定)。
提出了一种计算高效且性能适中的分布式BSS方法,在计算复杂度和分离性能之间取得平衡。
现有视频文字到音频(VT2A)模型在处理矛盾视频和文本条件时,视觉线索主导采样轨迹,导致生成音频难以替换为反事实目标声音。
提出 CounterFlow,一种无需重新训练的推理时两阶段采样方案: - Phase 1:保留视频条件,使用分解引导(decomposed guidance)构建视频对齐的时间结构,同时通过源文本负提示抑制视觉隐含声源。 - Phase 2:移除视频条件,仅用文本条件和负提示精炼目标音色。 该方法基于预训练流匹配VT2A骨架(如MMAudio),通过阶段切换实现结构-身份分离。
在VGGSound-Sparse Clean数据集上,CounterFlow在反事实替换质量(∆FLAM 0.2641,正比率92.0%)和整体质量(FAD 23.55,IS 7.915)上显著优于CAFA、ReWaS等基线,同时保持竞争性的时序对齐(DeSync 0.6695)。消融实验验证了分解引导和Phase 2负提示的必要性。
CounterFlow通过两阶段推理采样解耦了视觉时间结构与声音身份注入,实现了高质量的反事实视频拟音生成。
传统的空间选择性非线性滤波器(SSF)使用目标到达方向(DOA)作为空间线索提取目标说话人,但其性能严重依赖于训练时的麦克风阵列几何结构,当应用于不匹配的阵列几何时性能显著下降。
本文提出几何条件空间选择性非线性滤波器(GC-SSF),主要包括两点创新: 1. 几何条件分支:基于FiLM(特征级线性调制)层,将麦克风阵列几何信息作为条件输入,用于调制SSF的中间特征图。 2. DOA-麦克风位置编码(DOA-MPE):联合编码目标DOA和所有麦克风位置,以反映阵列几何与目标声源的空间关系。
系统结构:在基线SSF(包含F-LSTM和T-LSTM)基础上,添加编码器(Conv1d层)处理DOA-MPE特征,生成缩放和偏置参数,通过FiLM层注入到SSF的三个不同位置(POI 1/2/3)进行调制。
在圆形、均匀线性和随机阵列上评估,训练采用随机阵列。结果表明: - GC-SSF在不匹配几何上显著优于基线SSF(无论基线是在固定圆形阵列还是随机阵列上训练)。 - 基线SSF在匹配的圆形阵列上最佳,但在不匹配几何上严重退化;GC-SSF则有效缩小了性能差距,在所有几何上表现稳定。 - 错误DOA敏感性分析显示GC-SSF同时具备良好的跨几何泛化能力和高空间选择性。
本文提出的GC-SSF通过几何条件分支和DOA-MPE特征,显著提升了SSF对不同麦克风阵列几何的泛化能力,且不牺牲空间选择性。
流式自动语音识别(ASR)系统中,识别罕见词和领域特定词(如人名、地名)的准确率较低。现有上下文偏置方法多针对离线场景,无法直接应用于流式ASR。基于CTC的词检测(CTC-WS)方法在离线设置中表现优异,但需要完整音频序列,无法逐块处理。
本文提出流式CTC-WS(Streaming CTC-WS),将CTC-WS扩展到流式ASR场景。主要创新包括: 1. 跨块状态化词检测(Stateful Word Spotting across Chunks):维护活动关键词路径(token passing),使跨多个音频块的关键词得以检测。 2. 增量提交机制(Incremental Commitment Mechanism):将识别结果分为提交区(committed region)和保留区(hold region),仅输出不受未来音频影响的片段,延迟不确定区域。 3. 在线关键词替换:基于帧级重叠率,在提交区内用检测到的关键词替换贪婪解码输出中的词。该方法无需修改声学模型或额外训练,可直接集成到流式ASR流水线。
在STOP1(人名)和STOP2(地名)数据集上,使用NVIDIA Streaming模型(FastConformer + CTC/RNN-T混合架构)评估: - CTC解码下,STOP1的WER从18.36%降至12.83%,F-score从66.84%提升至89.61%;STOP2的WER从12.09%降至10.48%。 - 流式CTC-WS在两种解码方式(CTC和RNN-T)上均优于基线方法,证明了其有效性。
本文提出了一种无需修改模型架构的流式上下文偏置方法,通过跨块状态管理和增量提交机制,在实时ASR中有效降低了WER并提升了关键词F-score,具有实际部署价值。
本文通过NKP分解与分数阶优化的有效结合,显著提升了子带自适应滤波器在复杂噪声环境下的稳健性与效率。
乌尔都语虽有2.3亿使用者,但在语音技术领域资源极其匮乏,面临从右到左(RTL)的Perso-Arabic脚本、频繁的乌尔都语-英语代码切换(code-switching)、以及与印地语声学相似性等独特挑战。现有语料库规模小、副语言标注缺失,导致ASR性能差距显著。
本文提出UrduSpeech,一个156小时的乌尔都语语音语料库,附带12维副语言元数据(如情绪、语音质地、口音、音高、节奏等)。创新点包括: - 构建LLM驱动的数据筛选管道,集成语音分离(Demucs)、说话人日志(Pyannote 3.1)和严格过滤(时长<2s或>35s的片段被丢弃),最终得到71,792个话语片段。 - 利用Gemini 2.5 Pro进行转录和副语言标注,通过精心设计的提示工程确保阿拉伯-乌尔都语脚本保真度、强制逐字转录代码切换,并生成12维副语言标签。 - 发布9小时人工校正的US-Benchmark基准集,覆盖标准乌尔都语(US-Std)、代码切换(US-CS)和巴基斯坦口音英语(US-EngPk)三个子集。 - 语料库包含59.2h US-Std、89.4h US-CS和7.3h US-EngPk,性别平衡(60/40),涵盖新闻、戏剧、诗歌、Bait-Bazi(罕见文学形式)等12个领域。
该论文系统性地解决了乌尔都语语音资源匮乏问题,通过LLM驱动的高效管道构建了大规模、多维度、高保真的语料库,为低资源语言语音技术设立了新基准。
Nigerian 语言(如 Yorùbá、Hausa、Igbo、Nigerian Pidgin、Nigerian English)面临数据稀缺、正字法不一致、声调符号、口音多样、频繁代码切换和本地化命名实体等挑战,导致 ASR 性能远低于高资源语言。
提出 SBPN(Sometin Beta Pass Notin)框架,采用两阶段知识蒸馏: 1. 学生-教师蒸馏:从多个预训练的特定语言单语模型中蒸馏知识,并结合语言特定的 N-gram 语言模型。 2. 迭代自改进:使用伪标签数据进一步微调模型。
数据方面:收集 4713.5h 标记数据和约 10000h 未标记数据(经语音增强、说话人分离、VAD、语言识别过滤等处理)。模型有 Base(120M)和 Large(600M)两个版本。
在 Nigerian 语言上,相对词错误率(WER)平均降低 29%,在 Common Voice 和 Fleurs 等基准上优于现有单语和多语言模型。
首个针对 Nigerian 语言的开源多语言 ASR 基础模型,通过知识蒸馏和伪标签显著提升低资源语言识别性能。
弱标签音频数据集(如AudioSet)中,不同类别的标注质量差异大,存在三类未充分研究的监督不可靠性:虚假添加(SAN)、相似类间误分配(MAN)、软标签噪声(SLN)。这些导致类级别的优化偏差,且现有方法多假设实例级别的噪声可建模,难以适用于多标签弱标注场景。
提出类级监督不可靠性(CSU)框架:为每个类别学习一个可训练的不可靠性参数σ,在训练时根据σ大小降低不可靠类别的监督权重。不改变模型架构或推理过程,统一处理SAN、MAN、SLN。同时构建了人工验证的混合数据集ESC-FreeGen50(含真实和生成音频),提供受控的不可靠性设置。
在ESC-FreeGen50和AudioSet上,CSU在不同架构和不可靠性类型下均提升了鲁棒性,验证了显式建模类级不可靠性的有效性。
通过类级参数化控制监督强度,简洁有效地提升弱标签音频标注在多种标签噪声下的鲁棒性。
多媒体制作中,寻找与创作者印象匹配的音效或环境声音仍主要依赖手动过程,尤其对于漫画等视觉媒体,视觉拟声词(onomatopoeic images)能通过字形、笔画、布局和装饰图案传达听觉印象,但视觉拟声词与声音之间的跨模态检索尚未充分探索。
提出双向检索框架,利用预训练的CLIP图像编码器和CLAP音频编码器(冻结),训练轻量级模态特定投影头(两层MLP,512→512→256),将图像和音频嵌入对齐到联合嵌入空间。训练目标包括对齐损失(L2距离)和声音事件分类损失(交叉熵),保留类判别信息。推理时移除分类器,使用余弦相似度进行检索。
构建了Multimodal Image-Audio Onomatopoeia (MIAO)数据集,包含850对图像-音频样本,覆盖50个声音事件类别,由17位插画师根据声音绘制拟声词图像。
在MIAO数据集上,按插画师划分训练/验证/测试集。提出的方法在image-to-audio (I2A)和audio-to-image (A2I)任务上显著优于零样本基线(直接比较CLIP和CLAP嵌入)。具体:mAP I2A 61.45% vs 6.77%,A2I 61.08% vs 7.82%;Recall@1 I2A 53.60% vs 2.00%,A2I 64.60% vs 6.00%。
通过微调投影头而非全模型,有效对齐视觉拟声词与声音的嵌入空间,实现高性能双向检索。
证明适应预训练表示对于视觉拟声词-声音检索的重要性;未来可探索更多样化的视觉风格和声音类型。
韩语口语问答(SQA)中,ASR错误通过ASR-LLM级联传播,导致下游语义失败。传统ASR指标(如CER)无法完全捕捉下游性能损失,尤其是韩语单字符错误会引发语义级失效。
论文系统揭示了韩语ASR-LLM级联中信息损失的主要瓶颈在于ASR阶段,并强调了直接音频输入(LALM)在缓解转录信息损失上的潜力,为多模态口语理解提供了实证依据。
该工作通过精细化的数据工程和语义感知潜空间优化,在极有限资源和数据下实现了高性能可控音乐伴奏生成。
现有空间选择性主动噪声控制(SSANC)系统假设准确的二次路径(secondary path)估计,但实际中二次路径因用户耳朵解剖结构和设备佩戴差异而变化,导致性能下降和系统不稳定。
提出一种鲁棒软约束优化框架,通过最小化一组二次路径估计(来自人类测量)的平均代价函数,计算单个控制滤波器。该框架不需要精确的个体二次路径估计,而是利用路径变化集合来增强鲁棒性。
仿真和实时控制平台(dSPACE SCALEXIO LabBox)实验表明:与匹配情况相比,该方法平均性能略有下降,但显著缩小了二次路径失配下的性能波动范围,提供了更一致的性能。
提出了一个实用的鲁棒SSANC设计策略,有效应对复杂实际环境下二次路径的不确定性。
现有大型音频语言模型(LALM)在面对多语言干扰时,缺乏选择性听觉注意能力,即在存在语义相似的多语言干扰语音时,无法可靠地关注目标流并抑制干扰。现有基准测试(如多说话人ASR、通用LALM评估、可信度测试)未直接评估这一能力。
提出了MUSA(Multilingual Selective Attention)基准,是一个多语言选择题问答(MCQ)基准,用于评估LALM在语义合理的多语言干扰下的源定位推理能力。每个样本包含一个英语目标对话和一个同领域语义等价的干扰对话(英语、西班牙语、韩语或中文),并设计三种评估设置:单说话人、基于源分离的两阶段、端到端鸡尾酒会。同时提供了诊断性错误分类(目标误推理、干扰源混淆、无依据推理)。
评估了6个LALM(2个闭源:GPT-4o mini Audio、Gemini-2.0-Flash;4个开源:Qwen2-Audio、MERaLiON-2、Audio-Flamingo-3、Qwen2.5-Omni)。主要发现: - 单说话人性能高不转化为鸡尾酒会鲁棒性(如Gemini-2.0-Flash准确率从0.955降至0.242)。 - 源分离提升性能但未能恢复单说话人水平,且源归属问题未解决,常产生自信的错误答案。 - 错误主要由干扰源混淆主导(Gemini-2.0-Flash在鸡尾酒会中干扰占比0.918)。 - 模型在负信噪比下严重退化,且置信度校准变差。 - 跨语言干扰差异不由语义距离解释,而与语音重叠和时长失配有关。
MUSA基准揭示了现有LALM在多语言干扰下选择性听觉注意的严重缺陷,为未来鲁棒性研究提供了重要测试平台。
训练音频VAE时,正则化强度难以平衡:过度正则化导致重建质量差,正则化不足导致隐空间不稳定且难以预测。传统方法手动调整KL散度权重λ,缺乏系统性的压缩-重建权衡研究。
提出目标KL正则化(Target-KL Regularization),通过直接回归KL散度到目标值(而非加权KL项)来固定VAE的理论比特率。将KL散度与率失真理论中的编码代价关联,推导比特率公式:bps = (S / log2) * KL,其中S为帧率。通过优化 (KL - KL_target)^2 使模型达到指定压缩率,实现连续VAE的显式比特率控制。
本文通过目标KL正则化将连续VAE的压缩率显式可控,为音频生成中的隐空间正则化提供了系统化工具,并在文本到音频任务中验证了最优压缩率的存在。
SemaVoice通过SFM引导的语义对齐有效缓解了连续自回归TTS中的语义-声学不匹配问题,实现了高质量的零样本语音合成。
音频超分辨率(SR)和带宽扩展(BWE)旨在从低分辨率或带限观测中重建高保真信号,但缺失的高频内容具有先天的一对多歧义性。早期判别式深度神经网络模型将BWE/SR视为确定性映射问题,容易产生回归到均值效应和频谱过度平滑,导致高频丰富度不足。
本文系统梳理了从判别式映射到现代生成式建模的范式转变。详细评述了自回归模型、变分自编码器、生成对抗网络、扩散和基于分数的模型、流方法以及薛定谔桥等生成方法,并分析了它们在表示域、架构、条件机制以及重建保真度、感知质量、鲁棒性和计算效率之间的权衡。
作为综述论文,本文未提供新的实验结果,而是对各方法的优缺点进行了对比分析,强调了生成方法在解决模糊性方面的优势。
该综述首次全面跟踪了BWE/SR从点估计到分布感知生成建模的演进,为设计高保真音频系统提供了结构化的分类和实用路线图。
MedASR通过开源、小型、高效的Conformer模型,解决了医疗ASR中数据、训练和推理三大挑战,实现了高精度长序列听写。
本文通过数据预测均值流和轻量级低延迟架构,首次实现了实时语音恢复的流匹配模型,计算量降低两个数量级,是实时音频生成领域的突破性工作。
传统的ASR系统在口腔癌(OC)术后患者语音识别上表现不佳,主要由于OC语音数据稀缺且变异大,导致模型泛化能力差。
本文验证了结合数据增强和LLM纠错是提升口腔癌术后语音识别性能的有效策略。
真实多说话人对话数据匮乏,人工标注成本高昂且隐私受限,严重制约了多说话人ASR和说话人分离模型的发展。现有合成数据策略碎片化,缺乏对任务差异性和模拟参数影响的系统理解。
该工作通过系统实验揭示了合成数据生成策略中任务相关的关键权衡,并提供了高效开源工具,对多说话人语音处理领域具有重要指导意义。
当前音频大语言模型缺乏对说话人特定信息的组织能力,传统的说话人验证系统只能输出标量分数而无法提供语言证据。现有说话人感知语言模型局限于二元标签或描述性轮廓,无法统一进行说话人理解、比较和推理。
提出 SpeakerLLM,一个面向说话人的音频-LLM框架,统一了单句说话人轮廓、录音条件理解、语句对比较和证据组织的验证推理。核心创新包括: - 层级说话人分词器:联合使用话语级嵌入(总结身份和轮廓线索)和帧级特征(保留细粒度声学证据如音高、音色明亮度和录音条件)。 - 验证推理目标构造策略:将推理分解为三个模块:环境状态(录音条件)、轮廓兼容性(属性证据)和决策(相同/不同),并包含反例(相同轮廓不同说话人,不同轮廓相同说话人)以防止捷径。 - 两阶段训练:先训练基础版(SpeakerLLM-Base)用于说话人轮廓QA和录音条件QA,再训练推理版(SpeakerLLM-VR)用于证据组织的验证推理。
SpeakerLLM通过层级表示和结构化推理目标,首次将说话人验证从后端打分问题转变为可解释的自然语言接口。
传统的语音翻译系统通常采用级联架构(语音识别+文本翻译),但存在级联错误累积、无法利用副语言信息(如韵律、犹豫等)的问题。现有的SpeechLLM系统虽然整合了语音编码器和LLM,但要么是离线处理(等待完整话语),要么采用固定的wait-k策略,导致在真实场景中(如说话人停顿、语速变化)出现幻觉、延迟或遗漏翻译。
本文提出了一种流式SpeechLLM架构,核心在于让LLM学会自适应地决定何时输出翻译、何时等待更多音频。具体包括两种模型: 1. Intermixed Model:在LLM的输入和输出中混合语音token和文本token,并引入一个特殊的等待token "W"。LLM输出W时表示需要更多音频,输出文本token时则直接翻译。训练时利用源语言和目标语言的自动对齐来确定W的位置。 2. Early-Exit Wait Policy:为降低设备功耗,在LLM的浅层增加一个快速等待策略头,通过少量计算决定是否等待(输出W)或交给LLM(输出E),从而减少LLM的调用次数。
此外,论文提出了等待惩罚(wait penalty) 参数来调节延迟与翻译质量的权衡,并设计了一种新的训练方法(利用自动对齐生成W token序列)。
在多个语言对上的实验表明,本文提出的流式系统翻译质量接近非流式基线,但延迟仅为1-2秒,显著优于固定wait-k策略。同时,early-exit策略在几乎不损失翻译质量的情况下有效降低了能量消耗。
本文创新性地将学习型等待策略引入SpeechLLM,实现了高质量、低延迟的流式语音翻译,并兼顾了设备能耗。
早期帕金森病(EarlyPD)的语音检测具有重要的临床意义,但研究不足。现有研究在数据集、语言、语音任务、评估协议和早期定义上存在显著差异,导致结果难以比较和复现。
本文提出了首个针对语音早期PD检测的基准(Benchmark),旨在实现公平、可复现的跨方法评估。主要创新包括: 1. 标准化早期PD定义:采用Hoehn & Yahr(H&Y)≤2且诊断后病程(TAD)≤5年的标准。 2. 开放与私密双轨制:开放轨使用PC-GITA和NeuroVoz公开数据集,私密轨引入PERSPECTIVE-Base私密数据集。 3. 固定说话人独立划分:采用5折交叉验证,每折验证/测试集包含6名EarlyPD和6名HC,并平衡性别。 4. 多维度评估:涵盖不同训练数据量设置(AllPD、AllPD-subset、EarlyPD、EarlyPD+Private)、三种语音任务(持续元音、DDK、句子朗读)、以及按数据集、性别、疾病分层的分析。 5. 基线方法:测试了BDHPD、InceptionPD、RECA-PD三种模型。
首个系统性的语音早期帕金森病检测基准,为未来研究提供了标准化的评估协议和可复现的基线结果,具有重要的临床和科研价值。
FSD50K数据集虽规模较大且开放,但包含大量多源样本(背景干扰或重叠事件),导致标签噪声,限制了其用途。约70%的开发集样本存在此问题。
提出一个自动化数据策展框架: 1. 利用扩散模型(Stable Audio Open 1.0)为每个单源类合成干净音频作为参考。 2. 通过混合单源目标与干扰/噪声生成受控的多源样本,构建训练集(单源:多源=1:1)。 3. 使用预训练音频编码器BEATs + Bi-LSTM + MLP分类器,训练以区分单源/多源样本。 4. 应用该模型自动识别并过滤FSD50K中的多源样本,得到FSD50K-Solo子集。
在人工专家策展的测试集上取得强性能,并通过Audiobox Aesthetics的PC和PQ分数进一步验证。
论文提出了一种可扩展的自动化音频数据集质量提升方法,有效解决了FSD50K的多源标签噪声问题。
当前最先进的节拍跟踪模型(如Beat Transformer、Beat This)在标准数据集上接近完美,但在SMC数据集上F-score仅0.63,存在系统性盲点。SMC数据集由217段节奏复杂的40秒音乐组成,模型普遍表现出三类失败模式:八度错误(正确相位但错误节拍层级)、连续性错误(局部正确但全局不稳定)、完全跟踪失败(F<0.3且AMLt<0.3)。
本文通过细粒度诊断揭示了当前节拍跟踪模型在复杂音乐上的根本失败原因在于激活函数对非节拍事件的置信错误,而非后处理DBN,并提出了训练数据多样化与多假设节奏估计的具体改进方向。
节奏游戏(如Clone Hero)的谱面制作需要大量手动工作,社区面临瓶颈:制作一个包含五种乐器、四个难度的谱面需要数小时,新手学习成本高。现有自动音乐转录(AMT)系统不直接生成可玩谱面,而端到端方法缺乏定量评估。
提出STRUM,一个完整的音频到谱面管线,无需任何先验元数据(如节奏、调性)。核心组件: - 源分离:使用htdemucs 6s将混合音频分离成6个音轨。 - 鼓:两阶段CRNN起始检测器(V14) + 六模型集成分类器(将鼓事件分为7类)+ 频谱混淆修正(鼓棒裁决器、Phase-3校正器、Tom细化CNN) + 目标启发式规则。 - 吉他/贝斯:CRNN起始检测 + pYIN单音高跟踪 + 基于规则的五弦映射。 - 人声:Whisper单词级时间戳 + pYIN音高轮廓 + 动态时间规整对齐。 - 键盘:频谱峰值检测 + 滑动窗口音高分配。 - 后处理:合并各乐器MIDI,统一节拍和速度元数据。
在30首歌曲(筛选自65首,满足鼓音轨RMS阈值)的基准测试上,以±100 ms容忍度和每首歌全局偏移搜索: - 鼓:F1=0.838,精度0.823,召回0.854 - 贝斯:F1=0.694,精度0.658,召回0.734 - 吉他:F1=0.651,精度0.745,召回0.578 - 人声:F1=0.539,精度0.632,召回0.470 - 鼓每类准确率:Kick 0.61,Snare 0.44,Hi-hat 0.49,Ride/High-tom 0.19,Crash/Floor-tom 0.57 - 消融实验:鼓棒裁决器、Phase-3校正器、Crash/Ride冲突否决对F1有显著贡献(约0.5-0.6%下降)。 - 社区谱面与音频起始偏差:仅89.0%的ground truth事件在±100 ms内对应音频起始峰,说明社区谱面本身存在量化误差。
STRUM是首个开源的多乐器音频到可玩节奏游戏谱面管线,通过模块化设计、严格的操作包络定义和细粒度消融分析,在鼓上取得较好效果,但其他乐器仍有提升空间。
现有语音增强(SE)系统评估常用词错误率(WER),但WER高度依赖于自动语音识别(ASR)模型的选择和文本归一化流程,且现代ASR模型与人类识别增强语音的相关性尚未深入探究。
本文系统比较了多种现代端到端ASR模型(包括CTC、Transducer、Attention架构)在噪声和深度神经网络SE伪影下的表现,通过听力实验评估与人类WER的相关性。选取了QuartzNet(CTC)、wav2vec2(CTC)、Parakeet TDT(Transducer)、Whisper(Attention)等模型,并采用多种SE模型(如SGMSE+、NCSN++M等)生成增强语音,进行综合评估。
听力实验表明:Transducer模型(Parakeet TDT v2)与人类WER相关性最高,在评估子集上人类WAcc为95.1%,Parakeet TDT达到97.0%,而Whisper Large v3 Turbo为98.1%但可能存在幻觉问题。然而,现代ASR模型的噪声鲁棒性及其对上下文的利用可能削弱对声学增强性能的评估有效性,导致“好得不像真的”结果。
本文提醒研究者在使用ASR评估SE时需谨慎选择模型并明确报告配置,否则WER可能误导对增强效果的判断。
当前语音大语言模型虽在基础语音识别任务上表现优异,但缺乏细粒度、多维度的感知能力,难以解耦微声学线索、声学场景和副语言信号等复杂特征,导致对真实世界语音的理解不完整。该问题源于三个交互因素:高质量表现性数据稀缺、缺乏多维度属性的细粒度建模、以及依赖覆盖范围有限且粗粒度的基准。
在FMSU-Bench上的广泛评估表明,现有语音LLM在多维度细粒度理解上仍需显著改进;而FM-Speech大幅超越当前开源模型,建立了鲁棒的真实世界语音理解范式。
该论文系统地解决了语音理解中的细粒度多维度感知难题,通过创新的数据管道、全面的基准和先进的模型,推动了语音AI向更具感知力和同理心的方向迈进。
Chunkwise Aligner 在保持流式能力的同时,大幅降低了训练和计算成本,是流式 ASR 的高效替代方案。
大规模麦克风阵列在动态声学环境中,由于快拍数不足,样本协方差矩阵病态,导致白噪声增益(WNG)下降,目标信号严重抵消。传统的对角加载方法需要计算矩阵的极值特征值,精确特征分解复杂度为O(M^3),计算负担大。
本文提出一种基于Krylov子空间的快速自适应对角加载方法。利用Lanczos迭代,将大规模空间协方差矩阵投影到k×k三对角矩阵(k≪M),通过计算Ritz值近似极值特征值。只需k次矩阵-向量乘法(复杂度O(kM^2))即可得到最小所需加载量,严格保证WNG在指定范围内。
仿真(M=15,快拍数L=37)和SWellEx-96实际数据实验表明,仅需k=4次迭代,所提方法在输出SINR、WNG约束、均方误差等方面与精确特征分解性能完全相同,而计算复杂度大幅降低。
该方法在保证鲁棒波束成形性能的同时,将特征值估计的复杂度从O(M^3)降至O(kM^2),是一种高效实用的自适应对角加载方案。
传统双耳信号匹配方法依赖于显式的到达方向(DOA)估计或静态假设,难以实时跟踪移动声源,且无法灵活支持用户自定义的视野增强(FoVE)功能,导致在增强现实/虚拟现实等动态场景中空间音频渲染效果不佳。
提出一种基于混合专家(MoE)框架的信号相关双耳化方法,将每个候选方向视为一个“专家”,每个专家设计一个信号相关的双耳滤波器。通过在线凸优化和指数加权组合,动态融合各专家输出,实现隐式定位和连续声源跟踪。同时,通过增益控制和失真控制两种策略扩展至视野增强,允许用户强调或抑制特定方向的声音,且无需特定阵列几何结构。
在仿真(pyroomacoustics,RT60≈200ms)和真实环境(头戴式4麦克风阵列)中,移动说话人沿6°步长连续运动(≈2m/s)。提出的基于残差能量的损失函数有效跟踪说话人运动,混合权重自适应组合滤波器。与现有BSM、COMPASS-BSM、d-BSM相比,MoE在保持双耳线索(ITD/ILD)精度的同时,提供了动态视野增强能力。
本文通过混合专家框架实现了无需显式DOA估计的动态视野增强双耳化,为下一代消费级音频设备的空间音频渲染提供了灵活且鲁棒的解决方案。
音频-视觉大语言模型(AVLLMs)能够联合处理音频、视觉和文本,但其内部跨模态信息交互机制尚不明确,尤其是与单模态或多模态LLMs相比,音频-视觉的双向交互增加了复杂性。现有研究缺乏对AVLLMs内部信息流向的深入分析,导致模型安全性和鲁棒性难以保障。
(论文未提供具体数值,但声称在多个近期AVLLMs上验证发现一致,且所提幻觉缓解方法有效降低幻觉。)
该论文首次系统揭示了AVLLMs中跨模态信息集中于跨模态汇聚令牌的机制,并据此提出简洁有效的幻觉缓解策略,为多模态模型可解释性和安全性研究提供了新方向。
从稀疏麦克风测量中重建3D声场是一个病态问题,传统基于物理的方法在测量稀疏时性能下降,而现有深度学习方法(如GAN、DDPM)存在训练不稳定、推理慢或仅限2D等问题。
SF-Flow将流匹配成功应用于3D声场幅度重建,在训练效率和稀疏适应性上优于现有方法。
现有零样本音乐编辑方法在处理密集的多音轨混合时,无法实现精确的特定音轨音色转换。主要集中在两个问题:1) 基于原始交叉注意力的方法导致边界泄漏(非目标音轨被改变);2) 基于内部特征保留的刚性约束导致目标错位(目标音轨无法正确生成)。根本原因是语义注意力缺乏频谱分辨率,无法在密集混合中定位目标。
提出Polyphonia框架,核心是声学引导的注意力校准(Acoustic-Informed Attention Calibration)。首先通过盲源分离提取概率声学先验——理想比率掩码(IRM),作为粗粒度的频谱边界。然后利用该先验在扩散模型的交叉注意力过程中进行调节:1) 源特征插值:根据声学先验混合缓存的特征与当前特征,保持背景一致性;2) 声学调制:将声学先验作为布局偏置,缩放并加到目标相关的注意力能量矩阵上,强制目标对齐。
在MUSDB18-HQ和MusicDelta数据集上,构建了包含1,170个任务的标准化测试集PolyEvalPrompts。相比基线方法,Polyphonia在目标对齐(CLAP分数)上提升15.5%,同时保持音乐保真度和非目标完整性。
Polyphonia通过引入声学先验解决了语义-声学错位问题,实现了零样本多音轨音色转换的精确控制。
现有的全双工口语对话系统在模型生成回复时同时处理用户输入的语音流,但传统LLM基于单序列生成,难以自然支持用户流的实时输入。如何将用户流路由到LLM中是一个关键架构问题。
论文提出了一个统一框架,将仅文本LLM扩展为全双工口语对话系统,并对比了两种路由策略: - 通道融合(CF-Duplex):将用户流直接注入LLM输入,实现时间对齐的融合。 - 交叉注意力路由(XA-Duplex):将用户流作为外部记忆,通过交叉注意力适配器访问,保持LLM自身生成上下文独立。
两种变体在共享的模型和训练条件下进行比较,包括流式语音编码器、适配器、音频解码器等模块。
论文系统地研究了全双工口语对话中用户流路由的设计问题,为不同场景下的路由策略选择提供了实用指导。
潜在扩散模型的性能受限于潜在空间的模型可塑性(modelability),即下游生成器学习其分布的效率。现有方法多聚焦于提高生成器表现力或重构保真度,但忽略了潜在空间中语义与无关变量(如信号功率)的纠缠,导致生成器需学习复杂联合分布,收敛慢且质量受限。
PoDAR框架:一种自监督方法,通过随机功率增强(±6dB增益)和潜在一致性损失,将编码器潜在空间显式分解为功率子空间(前k个通道)和功率不变的语义子空间(剩余通道)。训练时约束语义子空间在功率扰动下保持不变,从而解耦功率与语义。 部分CFG:在生成时仅对语义子空间应用无分类器引导,避免放大功率等干扰变量,提升高引导尺度下的鲁棒性。
PoDAR通过简单而有效的功率解缠策略,显著改善了音频潜在空间的模型可塑性,加速了扩散模型训练并提升了生成质量,且部分CFG带来额外鲁棒性收益。
传统音频源定位依赖多麦克风阵列或分布式麦克风,而单麦克风场景下缺乏空间信息。本文提出利用混响的晚期尾部(late tail)来判别两个音频信号是否来自同一位置,从而在不依赖多通道的情况下实现源定位。
在模拟和真实环境下的说话人分割(speaker diarization)任务中评估。与基于xvector+PLDA的深度学习基线相比,所提方法具有竞争力,且两者性能不相关,表明可融合提升整体效果。
首次将WPE混响尾部估计用于单通道源判别定位,在说话人分割中验证有效性,但要求信号宽带且源位置相对固定。
当前的音频深度伪造检测系统在干净条件下表现良好,但在真实世界的媒体传输中(如压缩、重采样、噪声、混响等)鲁棒性不足。现有基准测试主要关注干净合成语音,忽略了实际部署中的分布偏移。
RADAR Challenge 2026 引入了双阶段评测: - 开发阶段(Phase 1):英语数据集,带有媒体变换的真实标签,用于系统分析和论文撰写。 - 评估阶段(Phase 2):多语种数据集(英语、新加坡英语、中文普通话、台湾中文、日语、越南语),包含超过 10 万条语音,语种和变换组合更多样。
数据集构建: - 开发集基于 LlamaPartialSpoof 的完整伪造子集,并应用额外媒体变换。 - 评估集包含 50,000 条真实语音(来自 Common Voice 等 7 个语料库)和 52,726 条伪造语音(由 10 种 TTS 系统生成,包括商业和开源系统)。 - 媒体变换管线(见表 IV、V)模拟真实传输流程,各子项按概率顺序应用。
训练策略:采用开放训练政策,允许使用公开数据(排除开发集重叠部分),鼓励多样性。
33 支团队参加开发阶段,22 支提交最终评估结果。结果揭示了在多语言和媒体变换条件下的鲁棒性挑战,包括变换不匹配、伪造源可变性、跨语言泛化等。具体 EER 数值未在片段中给出,但整体凸显了现有方法的不足。
首个系统性地评估媒体变换条件下多语言音频深度伪造检测的挑战赛,为鲁棒性研究提供了重要基准。
现有语音评估方法主要关注情感强度或语音质量,忽略了语音表达是否适应当前语境(如叙事背景、对话意图)。这限制了在故事型或交互型应用(如有声书、对话系统)中对语音系统的可靠评估。
该研究首次系统性地定义了语境丰富的语音表达恰当性评估任务,并构建了数据集与模型,显著优于现有方法。
GibbsTTS 通过运动最优调度和矩校正解决了 MI-DFM 的调度和误差问题,在零样本 TTS 中取得了领先性能。
<ANHUI>、<asr>)。<PROMPT START>等特殊token注入热词列表),并采用两阶段过滤降低计算开销。Dolphin-CN-Dialect通过数据采样、tokenizer优化和热词偏置等创新,在保持轻量化的同时实现了方言ASR的显著提升,并支持流式部署,是面向实际多方言场景的强实用方案。
语言模型(LM)基语音增强在严重噪声下会产生不可靠的条件表示,导致感知上合理但语言内容错误的输出(语言幻觉)。
提出 L3-SE 框架,核心是噪声不变声学-语义蒸馏: 1. 基于同一 WavLM 骨干网络构建两个教师模型:WavCodec(声学目标)和 WavS2T(语义目标),各自学习任务特定的层聚合。 2. 学生网络 NI-Encoder 从带噪语音中提取噪声不变的声学-语义表示,通过表示级对齐损失同时匹配两个教师的目标。 3. 将蒸馏后的表示作为前缀条件,输入解码器自回归 LM 预测干净声学令牌,再通过 WavCodec 解码器重建波形。
在低 SNR 和混响条件下,L3-SE 在语言一致性指标上显著优于先前 LM 基语音增强方法,同时保持竞争性的感知质量。
通过联合声学-语义蒸馏学习噪声不变条件表示,有效减少 LM 基语音增强的语言幻觉,提升内容保真度。
现有语音水印方法(如WavMark、AudioSeal)依赖神经网络训练,易受加性噪声影响,且缺乏可解释性;传统PCA水印方法多用于频域变换,未充分利用潜在空间的几何结构。
提出Latent Secret Spin (LSS),一种盲语音水印方法,在神经音频编解码器的连续潜在空间中,通过秘密密钥控制的伪随机调度,对主成分平面进行小角度正交旋转,在潜在特征的主成分协方差中引入可控的离对角项,实现水印嵌入。检测时无需原始信号,仅需估计旋转后的协方差签名。该方法无需训练任何神经网络,轻量且可解释。
实验表明LSS在不同数据集上泛化良好,保持感知质量,对常见信号操作(如压缩、加性噪声、滤波)具有鲁棒性,且可灵活调整载荷大小。
LSS是一种无需训练、可解释的盲语音水印方法,通过潜在空间中的几何旋转实现鲁棒且不可感知的水印嵌入。
孟加拉语(Bangla)作为全球超2.3亿人使用的语言,在语音技术领域资源匮乏。长语音识别(ASR)和说话人分离面临方言差异、噪声环境、多人重叠说话等挑战。现有模型(如Whisper、PyAnnote)在孟加拉语上表现不佳。
通过针对性微调和多角度数据增强,显著提升了孟加拉语长语音识别与说话人分离性能。
ShipEcho是一个免费、交互式的V-URN映射工具,通过多SL模型选择和高效传播模型,降低了海洋噪声监测的门槛,支持近实时和历史分析。
声学回声和背景噪声在免提系统和扬声器中严重干扰语音质量。传统判别式方法(如DeepVQE)在回声抑制和近端语音保留之间难以平衡,尤其在双讲场景下引入伪影。现有生成式方法(如SGMSE、StoRM)虽在降噪上表现优异,但应用于回声控制时不可复现(未公开架构、训练数据或配方)。
DiffVQE首次实现了可复现、高性能的混合扩散声学回声控制,以单步推理超越判别式SOTA DeepVQE。
现有测试时自适应(TTA)中的熵最小化(EM)方法应用于自回归生成模型时,存在理论碎片化:教师强制型方法(使用伪标签降低逐token熵)与强化学习方法(将熵作为代价通过策略梯度优化)缺乏统一数学基础,导致梯度计算不准确。
以Whisper ASR为测试床,在超过20个多样化领域(包括声学噪声、口音和多语言场景)上进行TTA,所提方法一致提升性能。该工作是首个对Whisper进行TTA的大规模实证研究。
该论文为自回归模型在测试时自适应中的熵最小化提供了严谨的理论基础,并通过大量实验验证了有效性。
在临床治疗(如AVATAR疗法)中,语音克隆的退化输出会破坏沉浸感和治疗效果,需要一种轻量、可解释的自动检测方法快速识别明显失败的合成语音。
基于源-滤波器模型,提出使用低维声学特征(中位数基频f0、声道长度VTL、谐波噪声比HNR)的输入-输出一致性进行阈值分类。采用非对称阈值法(对正负偏差分别优化阈值),在两种声码器(WaveRNN和HiFi-GAN)上评估。
该研究验证了简单的源-输出声学一致性特征(尤其是f0和HNR)可作为检测退化语音克隆的轻量、有效的一级筛选工具,适用于实时或大规模应用。
想象语音解码面临数据集稀缺、时间不确定性高、信噪比低等挑战,导致现有非侵入方法仅能分类少量词汇且泛化性差。
提出三阶段零样本解码流水线: 1. 想象到听映射:基于配对MEG数据,训练线性/非线性模型(线性滞后回归、MLP、CNN、UNet、RNN、TCN)将想象响应映射为听响应。 2. 听语音对比解码器:仅用听MEG训练对比学习模型,将神经信号与词嵌入对齐。 3. 零样本解码:将新受试者想象MEG通过映射模型得到预测听响应,再输入解码器完成解码。
关键设计:使用节奏性诗歌/旋律刺激并招募音乐家确保时间对齐;所有评估在留出受试者上进行。
首次实现零样本想象语音解码,通过映射到听空间规避了想象数据标注难题。
单通道说话人距离估计在无校准条件下(未知信号起始时间、未知声源电平)性能严重下降,此前研究依赖模拟数据中的传播延迟伪影,未探究模型利用房间冲击响应(RIR)的具体成分。
该工作首次系统解耦RIR成分与校准条件,揭示早期反射是无校准时距离估计的关键,为鲁棒系统设计提供依据。
当前语音匿名化评估主要依赖等错误率(EER)等自动说话人验证指标,但这些指标受限于分类器选择和操作点,无法全面反映隐私风险,可能导致对隐私保护的过高估计。
提出了相似度排名披露(Similarity Rank Disclosure, SRD)指标,基于信息论,直接对特征表示(如说话人嵌入、基频、音素嵌入)进行操作,无需依赖分类器决策,提供阈值无关的隐私泄露评估,能同时刻画平均和最坏情况下的隐私披露量(以比特为单位)。
在2024 VoicePrivacy Challenge系统上应用SRD,与EER对比,SRD能揭示EER未能检测到的隐私泄露和系统特定弱点,例如某些系统在特定特征上的隐私保护不足。
SRD是一种灵活、可解释的语音匿名化评估工具,能更全面地量化隐私风险。
深度伪造音频对语音认证系统构成威胁,被动检测方法易受生成模型演进和真实世界信道失真的影响。
提出非对称相位编码(APC),一种免训练的加密签名层,结合: - Ed25519数字签名(64字节,128位安全) - Reed-Solomon纠错(t=30,纠15字节) - 伪随机STFT相位bin选择(相位通道) - 幅度QIM通道:基于对数幅度差的量化索引调制 - 盲提取、非可否认性
在1,000条LibriSpeech测试集(10秒,44.1kHz)上,8种攻击条件下验证率97.5%-98.3%,PESQ=3.02,CPU延迟数十毫秒。与AudioSeal、WavMark、SilentCipher对比,APC在免训练、可签名方面有优势。
APC通过将密码学签名嵌入音频信号,实现了高质量、免训练、抗伪造的音频水印,适合C2PA溯源场景。
现有语音助手在智能家居场景中缺乏处理复杂用户需求的能力,特别是结合时空约束、语音输入、动态状态跟踪和混合主动交互模式的任务。
提出了MIST(Multimodal Interactive Speech-based Tool-calling Dataset),一个合成多轮、语音驱动的代码生成任务,运行在IoT设备上。该数据集通过可扩展的数据生成框架构建,模拟真实世界智能家居场景中的工具调用和互动。
开源与闭源多模态大语言模型(MLLMs)在MIST上存在显著性能差距,即便是最先进的闭源模型也有改进空间。
MIST为研究混合主动语音助手在物理世界约束下的推理提供了新颖的基准和生成工具。
传统音乐风格分析依赖于人工标注的乐谱或符号表示,缺乏从原始音频到信息论分析的端到端流水线,且自动转录精度不足,导致基于音频的统计特征难以直接与音乐理论衔接。
该论文通过认证转录连接音频与信息论分析,首次在钢琴曲库规模上生成作曲家级信息论轮廓,并揭示了新古典音乐在转移分布上的Zipfian规律性。
大型音频语言模型(LALMs)在部署时通常会对音频进行压缩以减少内存和延迟,但压缩可能对特定关键查询族(如语音内容、事件计数、说话人状态)的答案准确性造成严重损害,而整体平均精度可能看似可接受。现有方法缺乏对任务感知的答案保留的考虑。
本文首次提出任务感知的答案保留音频压缩框架。主要贡献包括: 1. 形式化定义:将答案保留定义为族级超量风险问题(family-wise excess-risk),证明其与受限答案充分性的等价性。 2. 签收协议:给出实践者可直接使用的压缩预算决策协议,基于统计置信度返回点估计和置信感知的压缩预算前沿(compression-budget frontier)。 3. 理论分析:推导了查询族划分细化对预算的影响(更细的划分可能导致更严格的预算),以及查询条件压缩的理论优势(在理想情况下可减少保留信息量)。
在五个多选题音频问答基准(包含SpeechContent、EventCounting等任务)上,使用Qwen2-Audio-7B-Instruct和Qwen2.5-Omni-7B backbone评估。主要发现: - 数据集平均误差会隐藏严重的族级失败(如极端受损族被平均掩盖)。 - 声明的查询族划分会影响签收预算决策。 - 查询条件压缩仅在特定族域下有助于保持答案保留。
本文为LALM音频压缩提供了首个任务感知的答案保留框架,通过理论分析和实证揭示了平均精度指标的不足,并为实践者提供了可操作的签收协议。
LiVeAction通过非对称架构和简化损失函数,在低功耗边缘设备上实现了高效、高质量、多模态的数据压缩,在率失真-复杂度权衡上超越现有最先进生成式tokenizer。
权值衰减在大语言模型中广泛使用,但其对Transformer损失景观的理论作用尚不明确。现有理论仅适用于凸或浅层模型,无法直接应用于深度注意力网络。
首次严格证明了带有L2正则化的Transformer交叉熵损失函数满足Villani函数的三个条件:强制、高斯尾部可积和微分增长。推导出对数索波列夫常数和庞加莱常数的表达式,建立了与有限时间收敛保证和PAC-Bayesian泛化界的联系。提出可扩展的Villani诊断Ψ_s(θ) = -∆F + s^{-1}∥∇F∥²,并使用Hutchinson迹探测器高效估计。
在GPT-Neo-125M模型上,使用Penn Treebank和WikiText-103数据集,验证了Ψ_s的二次增长、Hessian谱膨胀以及指数收敛行为,与理论预测一致。
该工作为权值衰减在Transformer优化中的几何作用提供了严格的数学基础,揭示了其作为Langevin动力学快速混合和曲率感知优化关键要素的角色。
WavCube通过两阶段“压缩-丰富”流程,将语义SSL特征转化为紧凑、声学增强的统一表示,首次在单一空间中平衡理解、重建与生成,实现SOTA性能与高效训练。
总结生成失败: 'NoneType' object has no attribute 'choices'
总结生成失败: Error code: 503 - {'error': {'message': 'Service is too busy. We advise users to temporarily switch to alternative LLM API service providers.', 'type': 'service_unavailable_error', 'param': None, 'code': 'service_unavailable_error'}}
现有语音大语言模型(SLM)基于文本大语言模型(TLM)构建,但存在显著的模态差距,导致语音问答性能远低于文本。先前工作主要从输出侧缩小差距(如中间文本令牌、思考者-说话者架构),但模态差距仍然存在。
提出 TextPro-SLM,从输入侧缩小模态差距。核心组件: 1. WhisperPro:统一语音编码器,基于Whisper-large-v3,输出同步的文本令牌(内容)和韵律嵌入(语气、情感、音色等),通过附加的梅尔重构器强制保留韵律信息。 2. LLM骨干:训练时结合知识蒸馏(保持原始TLM语义能力)和韵律理解任务,使模型同时理解语言内容和副语言信息。
该方法使SLM更接近“韵律感知的文本LLM”,输入表示与TLM兼容且保留韵律。
本文通过从输入侧分离内容与韵律表示,有效且数据高效地缩小了语音与文本LLM之间的模态差距。
现有零样本语音克隆模型依赖参考音频的转录文本,在低资源语言和无文字方言场景下难以应用。同时,自回归模型存在推理瓶颈和错误累积,非自回归模型在多语言扩展中需要统一的文本表示。
X-Voice 是一个 0.4B 参数的流匹配(flow-matching)模型,支持 30 种语言的零样本跨语言语音克隆。主要创新包括: - 两阶段训练范式:第一阶段在 420K 小时多语言语料上训练基础模型 X-Voice_s1,使用国际音标(IPA)作为统一表示;第二阶段利用 X-Voice_s1 合成 10K 小时说话人一致的音频作为提示,微调得到 X-Voice_s2,从而完全摆脱对参考文本的依赖。 - 双重语言注入:在文本级和时间级分别注入语言标识,有效缓解跨语言合成中的口音泄漏。 - 解耦调度 CFG:采用解耦和调度的无分类器引导(Classifier-Free Guidance),在保持音色的同时提升发音准确性和自然度。 - 开源生态:开源全部训练语料(420K 小时)、高质量子集(30K 小时)及评估基准。
主观和客观评估表明,X-Voice 优于现有流匹配多语言系统(如 LEMAS-TTS),并与百亿参数模型(如 Qwen3-TTS)性能相当,实现了无转录文本的零样本跨语言克隆。
一个高效、开源的多语言零样本语音克隆模型,通过创新的两阶段训练彻底消除对参考文本的依赖,在 30 种语言上达到业界领先水平。
总结生成失败: Error code: 500 - {'error': {'message': 'Internal Server Error', 'type': 'internal_error', 'param': None, 'code': 'internal_error'}}
总结生成失败: <!DOCTYPE HTML PUBLIC "-//W3C//DTD HTML 4.01 Transitional//EN" "http://www.w3.org/TR/html4/loose.dtd">
Generated by cloudfront (CloudFront) HTTP3 Server Request ID: g-XwBluCqu8VyVemflC-3seLOvvW8nBjhVz3RZXUGzOSuI-2V434wQ==
提出了一种专为多通道语音增强设计的空间上采样GAN模型及特征调节框架,有效突破了麦克风数量限制,性能接近理想全阵列水平。
核心痛点: 1. 传统客观指标(如PESQ、STOI)领域通用性差,无法跨语音、音乐、音效统一评估。 2. 通用多模态大模型(MLLM,如GPT-4o)在专业音频评估中表现不稳定。 3. 专用LLM评估模型缺乏零样本泛化能力和指令灵活性,对提示词变化敏感,评分尺度固定。
方法创新: - 提出JASTIN框架,将音频评估转化为自指令推理任务,结合冻结的音频编码器、可训练的音频适配器和微调的LLM骨干。 - 引入四维数据准备流水线:多源、多任务(24个任务,包含人工标注、伪标签、代理任务)、多校准(支持不同评分尺度)、多描述(LLM改写指令模板)。 - 通过自指令训练实现语义敏感性与词汇鲁棒性的平衡:对评估规则和校准尺度的变化自适应,对纯措辞变化保持评分一致。
实验结果: - 在语音、声音、音乐及域外评估任务上,Pearson和Spearman相关系数与人类主观评分达到SOTA,且无需任务特定重训练。 - 一致优于通用MLLM。
一句话评价: JASTIN是一个统一、指令驱动的零样本音频评估框架,通过精心设计的训练数据和架构实现了跨域泛化与指令鲁棒性。
现有全模态模型(如 GPT-4o)通常采用 ASR + LLM + TTS 的级联架构,导致语音与文本处理分离,错误难以归因至统一表示空间。小规模模型(0.1B 参数)下,简单堆叠模态模块不再可行,设计选择必须可解释且可测量。
<|audio_spk|>、右对齐参考码子 prompt 和 192 维 CAM++ 嵌入实现,无需额外 TTS 模块。MiniMind-O 是一个小规模、完全可检查的全模态模型,展示了在 0.1B 参数限制下,通过精心设计的桥接、数据格式和参数高效接口,实现高质量语音、文本、图像输入与流式语音输出的完整交互循环。
该论文通过大规模主观实验和客观指标对比,系统揭示了噪声和语音增强对语音编解码器可懂度的影响,为低码率神经编解码器的实际部署提供了关键评估。
现有音频深度伪造检测方法将语音视为同质信号,忽略了其内部音素结构,尤其在情感操纵语音(如情感语音转换EVC)中,情感表达通过音素级变化实现,而现有方法在情感匹配条件下缺乏可解释性和细致分析。
本文通过音素级分析和自监督嵌入,为情感操纵语音深度伪造检测提供了可解释且鲁棒的新方法。
传统语音嵌入将语义、说话人、方言等多重属性混杂在单一向量中,无法支持按属性条件控制的相似度检索。
提出因子分区嵌入框架:每个语音片段映射为一个向量,其子空间对应不同属性轴(语义、说话人、方言等)。采用共享声学编码器(如WavLM)加多个线性投影头,每个投影头通过教师蒸馏或对比学习训练。检索时,相似度计算为各轴余弦得分的带符号加权和,可实现属性联合检索或抑制某一属性。
在跨语料库(CMU ARCTIC、VCTK、方言数据集等)的检索任务中,通过带符号轴权重可抑制相同说话人偏差,突出语义匹配结果。
首次将可控多轴相似度搜索引入语音领域,通过可解释的加权机制实现灵活的属性条件检索。
目前自动语音识别(ASR)系统在构音障碍(dysarthric)等非典型语音上表现脆弱。尽管音频-语言模型能够在推理时通过提供临床上下文(如诊断标签、语音评级)来提升性能,但尚不清楚这些模型是否真正利用此类信息。
该论文系统揭示了当前多模态音频-语言模型在构音障碍语音识别中未能有效利用临床上下文,但通过针对性微调可以显著改善性能,为更包容的ASR提供了评估基准。
自监督语音模型(S3Ms)在下游任务中表现优异,但其学习到的表示在自然和对抗扰动下的几何结构变化尚不明确。现有方法使用表示相似性或全局维度分析,难以捕捉局部几何变化,且无法直接关联下游ASR性能退化。
提出GRIDS框架,利用局部内在维度(LID)逐层分析S3M表示。对WavLM和wav2vec 2.0的每一层计算帧级LID,通过调和平均聚合得到层级标量,再结合多个层形成12维特征向量。LID衡量局部邻域扩张速率,能有效捕捉扰动导致的几何变形。
本文首次将LID应用于自监督语音模型的鲁棒性分析,揭示了局部几何结构与下游性能的关联,为无监督异常检测提供了新思路。
首次将多实例学习应用于生态瞬时评估中的语音生物标志物检测,有效捕获日内时间动态并提升分类性能。
多模态大语言模型(MLLMs)在推理时存在模态利用不平衡问题,文本标记主导生成过程,导致幻觉(输出与视觉/听觉输入不一致)。现有训练后干预方法常依赖启发式规则,未能显式量化模态贡献。
提出 LIME(Learning Inference-time Modality Enhancement),一种无需训练、推理时增强模态利用的框架。利用层间相关性传播(LRP)量化每个标记对输出的贡献,定义相关性目标函数,通过推理时优化键值(KV)表示来提升模态标记的相关性,同时保持模型原始分布(通过KL散度约束)。
在多个视觉和音频基准测试上,LIME一致减少幻觉,增强模态接地,且不牺牲生成质量。LRP分析显示,标准解码下模态标记相关性低,而LIME使其相关性集中至相关区域。
无需额外训练数据或参数修改,通过推理时KV更新直接平衡模态贡献,有效缓解多模态幻觉。
现有语音AI公平性研究分散,缺乏统一框架:通用机器学习综述忽略语音特有属性(如声学纠缠),NLP综述仅关注文本,而语音专注综述通常限于单一任务(如ASR)或风险维度(如隐私)。这导致跨任务的共享失败模式被遗漏。
本文为调查综述,未包含实验。
一篇系统构建语音AI公平性统一框架的全面综述,从定义到缓解形成连贯分析管道,填补了跨任务综述空白。
传统口吃评估依赖人工听觉判断,耗时、昂贵且主观性强;现有数字工具多为被动练习平台,缺乏动态、个性化干预能力。
提出Virtual Speech Therapist (VST) 平台,整合三部分: 1. 口吃自动检测引擎:基于自监督学习模型(如wav2vec2)进行实时流利度分析,识别重复、阻塞、延长等障碍类型; 2. 智能体治疗规划模块:利用多智能体大语言模型(LLM)自主生成、批判、迭代优化个性化治疗计划,包括专门的批判智能体确保安全性、方法学合理性和循证一致性; 3. 临床医生在环(Clinician-in-the-Loop, CITL):治疗计划需经言语病理学家审核、修改、批准后方可交付患者,保持临床监督。
由专家言语治疗师评估,VST能持续生成高质量、循证的治疗建议,有望减轻临床工作负担并改善治疗效果。
首个将深度学习的口吃检测与大语言模型智能体推理及临床医生监督相结合的综合性AI言语治疗平台,填补了agentic AI在言语治疗中的应用空白。
现有TTS评估方法存在主观评价不稳定、客观评价忽略动态语音质量的问题,无法评估TTS系统在长时间语音合成中表现出的语音动态性和表现力。
提出基于语音映射(voice mapping)的客观评估框架,将语音样本映射到音高-响度二维空间,并用CPPs(Cepstral Peak Prominence)等指标量化每个区域的语音质量。通过对比合成语音与原始语音的映射差异,评估模型对语音动态的捕获能力。
对六个代表性TTS模型(Merlin, Tacotron 2, Transformer TTS, FastSpeech 2, Glow-TTS, VITS)进行分析,使用LJSpeech数据集100句。结果显示: - VITS具有最大语音范围; - Glow-TTS在软发声方面表现优异(高频谱平衡); - CPPs在7-8 dB时语音自然,超过10 dB则显机器人化。
该论文提出了一种新颖的基于语音映射的TTS质量评估方法,通过可视化语音在音高-响度空间中的质量分布,有效揭示模型在语音动态和表现力方面的差异。
多语言语音克隆中,主流说话人编码器(如WavLM-base-plus-sv、ECAPA-TDNN)在面对同一说话者不同语种(如印地语、泰卢固语、泰米尔语)时,会输出差异显著的嵌入向量,导致跨语种身份丢失。例如,WavLM-base-plus-sv在印地语与英语之间余弦相似度下降0.082,ECAPA-TDNN下降0.105。
提出LASE(Language-Adversarial Speaker Encoder),结构为:1)冻结的WavLM-base-plus主干网络;2)可训练的投影头(两层MLP输出256维嵌入);3)梯度反转层(GRL)连接的语言分类器(4语种)。训练结合两种损失:监督对比损失(SupCon)保持说话人身份;梯度反转交叉熵损失(GRL)迫使嵌入对语言不敏感。采用三阶段λ调度(先让SupCon收敛再引入对抗)。
LASE通过简单的对抗训练投影头有效缓解了印地语脚本下的说话人身份语言漂移问题,证明小规模针对性训练即可显著改善跨语种说话人一致性。
由于缺乏真实多语种同一说话人数据,使用ElevenLabs合成8个声音在4种语言下的语音,经质量门控后获得1118训练对和1043测试对。
传统扬声器距离估计(SDE)模型在稀疏的真实房间脉冲响应(RIR)数据下性能有限,缺乏多样化的训练数据导致泛化能力不足,尤其在中等至远距离场景中误差较大。
本文通过生成式RIR增强与严格质量控制,显著提升了扬声器距离估计精度,尤其在中等至远距离场景,为声学数据增强提供了有效范本。
传统的解码探针(Decoding Probe)存在两个主要局限性:(1)不同特征的贡献无法直接比较,因为准确率依赖于类别数量和分布;(2)特征相关性(如词身份与语法类别)会导致探针结果被混淆,无法判断模型是否真正编码了目标特征。
本文提出编码探针(Encoding Probe),反转探针方向:从可解释特征集 Y 重建模型内部表示 X(即 g: Y → X)。通过多元岭回归模型,并采用特征消融(ablation)来分析每个特征的相对贡献(通过重建误差的增加量衡量),同时能够控制特征之间的相关性。该方法源自神经科学中的脑编码(brain encoding)范式。
在语音模型(wav2vec2系列)和文本模型(BERT)上,使用声学、音系、句法、词汇和说话人身份等特征集进行实验。结果显示:(1)说话人相关效应在不同训练目标(自监督、ASR微调、SID微调)和数据集上差异显著;(2)句法和词汇特征对重建有独立的贡献,即使它们高度相关。这表明编码探针能更精确地分离不同信息类型的作用。
本文提出的编码探针提供了一种比传统解码探针更可解释、更可控的模型表示分析方法,能够直接量化并比较不同特征的贡献,同时有效处理特征相关性问题。
提出首款基于Transformer的无监督端到端控制滤波器生成框架,简化了ANC管道并提升了降噪性能。
现有视频转音频(V2A)模型虽然能合成语义合理的声音,但未显式建模房间声学效应(如混响和房间冲激响应RIR),导致对这些效果的控制能力有限。
本文提出MMAudioReverbs,基于预训练的V2A模型MMAudio,通过微调(无需修改网络架构)统一处理去混响和RIR估计两个任务。利用MMAudio隐式学习的视觉与房间声学关系,将视觉信息作为物理先验,辅助声学处理。通过重新解释条件信号和目标潜变量的角色,在同一流匹配框架下实现两种任务。
实验表明:视觉信息有助于更稳定的去混响行为,并提升估计RIR的物理可解释性(尤其是早期能量特征与场景视觉一致)。初始化为预训练权重相比从头训练效果更好,音频和视觉线索在不同物理声学类型上各有优势。
本文开创性地证明了预训练多模态V2A基础模型可直接用于物理声学任务,为声学处理提供了新的视觉先验范式。
自回归(AR)模型结合扩散头在文本到音频(TTA)生成中取得了优异性能,但其迭代解码和多步采样过程导致高延迟,限制了实时应用。
提出AUDIODEAR框架,核心包含两部分: 1. 能量-距离训练目标(Energy-Scoring Head):替代扩散损失,直接一步将高斯噪声映射为音频潜变量,消除递归扩散采样过程。 2. 辅助上下文表示蒸馏(Auxiliary Contextual Representation Distillation):利用预训练的扩散AR模型(IMPACT)作为教师,通过蒸馏对齐学生模型(能量评分模型)与教师的骨干网络表示,缩小一步与多步采样的质量差距。
该框架在保持AR迭代步骤(r)不变的前提下,将采样步数(n)降为1,实现快速生成。
在AudioCaps基准上,AUDIODEAR在客观指标(FD、FAD、KL、IS、CLAP)和主观指标上均优于现有一步/少步基线(ConsistencyTTA、SoundCTM、AudioLCM、AudioTurbo)。与最先进的AR扩散系统IMPACT相比,批量推理速度提升8.5倍,同时音频质量极具竞争力。
首次将能量-距离目标应用于TTA生成,结合表示蒸馏,实现了高质量、低延迟的一步采样TTA合成。
现有语音深度伪造检测和定位模型依赖通用语音基础模型(SFMs)的表示,但下游微调收益递减,模型泛化性差,对未见生成方法和真实世界扰动敏感。离散化预训练目标(如量化token)丢失了深度伪造痕迹信息。
提出Alethia,首个专为语音深度伪造任务设计的基础编码器。预训练结合两个分支:①瓶颈掩码嵌入预测(连续嵌入预测,避免量化损失);②基于流匹配的频谱图重建(生成式预训练)。学生模型从掩码波形中预测教师模型的连续嵌入,并重建未掩码频谱图。
在5个任务(语音/唱歌深度伪造检测、局部伪造定位、源追踪等)的56个基准数据集上,Alethia显著超越Wav2vec2、HuBERT、WavLM等SOTA SFMs,对真实世界扰动更鲁棒,且零样本泛化到未见过领域(如唱歌深度伪造)。
首个针对语音深度伪造的基础编码器,通过连续嵌入预测与生成式预训练联合优化,突破离散目标局限,实现强泛化与鲁棒性。
大象叫声分类面临数据稀缺、标注昂贵的问题,传统监督方法易过拟合且泛化差。
利用预训练的声学嵌入模型(来自通用音频、语音、其他物种生物声学),保持嵌入模型固定,仅训练轻量级下游分类器(逻辑回归、MLP、RNN、GRU、LSTM)。对Transformer编码器进行逐层分析,发现中间层(如第2层)嵌入更有效,可大幅减少参数量。
在非洲象和亚洲象数据集上,Perch 2.0嵌入+下游分类器AUC分别达0.849和0.936,与端到端AST模型(AUC约0.87和0.95)差距在2.2%以内。中间层嵌入保留约10%参数即达到相近性能。
首次证明无需微调的跨物种声学嵌入可高效分类大象叫声,为低资源生物声学分类提供新范式。
现有生物声学分类模型大多基于16 kHz采样率预训练,仅能处理0-8 kHz基带,丢失大量动物高频叫声信息(如蝙蝠可达200 kHz)。时间扩展方法虽能压缩高频至基带,但会降低频谱分辨率并增加计算开销。
提出自适应多频带编码框架:将原始音频全频谱分解为多个非重叠频带,通过外差法将各频带下变频至基带,分别输入预训练编码器提取特征,再通过五种融合策略(均值池化、门控池化、混合专家、混合门控、自注意力)得到统一表示。该方法兼容任何现有音频模型,无需重新训练。
在三个数据集(Dogs、CBI、Bats)上使用八种预训练模型和五种融合策略进行实验。表示分析和分类实验表明:融合表示在两个数据集上显著优于基带和时间扩展基线;对于高采样率模型(如48 kHz BirdNET),多频带方法仍能带来额外增益。
一种轻量级、即插即用的多频带融合框架,有效利用超声频段信息,显著提升跨物种生物声学分类性能。
LRS-VoxMM是一个更具挑战性、覆盖多样场景和退化条件的野外AVSR基准,能更好评估视觉信息的实际价值。
该工作通过融合预训练音视频模型和LLM驱动聚类,显著提升了多说话人重叠语音场景下的转录和分组性能。
传统数据驱动的语音分离方法(如MRX、Demucs等)在电影音频源分离(CASS)中面临挑战:电影音频背景音效复杂多变,且难以获取大量特定条件的训练数据;同时,现有方法忽视了电影脚本这一可用知识源。
提出一种知识驱动的目标语音提取方法,利用发音方式(manner of articulation)作为辅助知识。框架包括: 1. 将电影音频与脚本进行强制对齐,获取帧级发音方式标注(鼻音、近音、闪音、塞音、擦音、塞擦音、元音共7类)。 2. 构建发音感知分离器:将帧级发音向量(m=7)通过线性投影层与音频特征(d=1025)相加,作为语音提取器的输入。 3. 语音提取器可采用任何目标音频提取架构,输出分离的语音。
在Sound Demixing Challenge的DNR-nonverbal数据集(训练1000、验证50、测试100段1分钟混合音频)上进行实验。结果表明:使用发音感知嵌入的方法相比不使用任何知识源的方法,在包含背景音效的语音片段上取得更好的分离效果。
通过引入发音方式这一语言学知识,有效提升了复杂电影音频中目标语音的提取性能,为知识驱动与数据驱动结合提供了新思路。
现有的口吃检测系统只能在事件发生时识别(检测),无法提前预测,导致治疗干预(如合声提示)滞后。音频预测对于闭环干预至关重要,但此前缺乏可部署规模的系统。
该论文首次实现音频口吃预测并完全在设备端运行,通过分层评估揭示了严重事件的预兆信号,且模型可零样本迁移至儿科临床语音,但整体预测性能仍有提升空间。
当前语音生成领域广泛使用基于情感嵌入的余弦相似度(EMO-SIM)作为自动化评估指标,假设如emotion2vec等情感识别模型的嵌入空间能有效度量情感相似性。然而,该假设未经严格验证,可能导致指标奖励声学模仿而非真实情感表达,误导模型开发方向。
论文提出三项评估标准验证EMO-SIM的有效性: 1. 分类情感鲁棒性:通过控制说话人身份和语言内容的对抗性三元组任务,测试区分离散情感的能力。 2. 维度情感敏感性:在连续情感维度(价态、唤醒度)上评估相似度与情感差异的单调性及区分度。 3. 人类感知对齐:使用合成语音的三元组偏好任务,比较指标选择与人类判断的一致性。 此外,引入均值中心化校准以缓解嵌入空间的各向异性问题。
本文系统揭示了现有情感嵌入相似度在语音生成评估中的严重缺陷,为未来客观指标设计提供了关键警示和验证框架。
跨语言说话人验证中,语言与说话人特征高度纠缠,导致系统在“不同语言同一说话人”与“同语言不同说话人”这对最难场景下表现严重退化。传统对抗解耦方法会无差别惩罚与语言相关的说话人判别性特征,牺牲了说话人区分能力。
提出 Dual-LoRA 框架,在冻结的预训练骨干中注入两条并行的LoRA适配器流(说话人分支和语言分支),实现参数高效的解耦微调。核心是 语言锚定对抗机制(Language-Anchored Adversary):通过共享判别器,语言分支为对抗训练提供真实语言线索,使对抗梯度只针对语言内容而非任意相关性,从而保留说话人特征。此外采用非对称秩设计(说话人分支秩16,语言分支秩4)和三个阶段课程训练策略。
在 TidyVoice 基准上,单系统验证EER最低达0.91%(w2v-BERT2骨干),在官方挑战中排名第3。最难场景(同人异语 vs. 异人同语)EER从基线5.19%降至1.62%。多个骨干上(ResNet变体、w2v-BERT2)均取得一致提升。
一种参数高效的跨语言说话人验证解耦方法,通过语言锚定对抗训练有效分离语言与说话人特征,显著提升最难场景下的验证性能,且推理时零额外开销。
传统神经语音编解码器在超低比特率(≤1.5 kbps)下严重退化,从声学失真转变为语义损失,导致可懂度急剧下降。
本文通过系统分析语义先验在超低比特率语音编码中的角色与边界,提出了语义退休现象和比特率感知调节策略,为生成式语音编码提供了理论指导与实践方案。
语音匿名化中,韵律(prosody)的保留与否是关键问题:保留韵律能保持语义和情感,但可能泄露说话人身份;丢弃韵律可增强隐私,但损失表现力。现有方法要么完全丢弃韵律,要么缺乏在推理时控制韵律保留程度的机制,导致效用-隐私权衡固定。
提出 DiffAnon,首个基于扩散模型的语音匿名化框架,利用无分类器引导(CFG)实现推理时对韵律保留的连续、显式控制。具体创新: 1. 将匿名化建模为在 RVQ 码本的语义嵌入(SpeakerTokenizer 的一级量化嵌入)上逐步细化声学细节的过程,使扩散过程自然对齐 RVQ 的迭代细化结构。 2. 使用掩码韵律模型(MPM)提取帧级韵律特征,FreeVC 说话人编码器提取说话人嵌入,通过 CFG 在推理时调节韵律条件强度,实现从完全抑制到完全保留韵律的插值。 3. 同时支持伪说话人引导,进一步控制说话人条件强度,增强隐私。
在 VoicePrivacy Challenge 2024 上评估,DiffAnon 实现了强效用(低 WER、高韵律保真度)和竞争性隐私(高 EER),并能通过调节韵律 CFG 权重系统性地导航效用-隐私权衡。
DiffAnon 首次在单模型中实现了可插值、可控制的推理时韵律保留,为语音匿名化提供了灵活的效用-隐私权衡控制机制。
传统抑郁检测依赖主观访谈和问卷,现有语音生物标志物多基于静态声学汇总统计,忽略了语音动态中的非线性时间结构,难以捕捉抑郁对发声系统状态演化、重复和稳定性的影响。
提出基于递归量化分析(RQA)的非线性声学动态框架,利用DAIC-WOZ数据集中142名参与者的COVAREP 74维帧级声学轨迹,计算每个通道的递归率作为生物标志物。采用逻辑回归结合ANOVA特征选择和分层5折交叉验证,并与静态声学基线、熵特征、Hurst指数、确定性代理、Lyapunov-like不稳定代理等对比。
递归率生物标志物平均交叉验证AUC=0.689,优于所有对比方法(静态基线0.593、熵0.646、预测性0.590、Hurst 0.477、确定性0.418、Lyapunov代理0.663)。置换检验p=0.004显著,bootstrap置信区间[0.568, 0.758]。特定通道(如通道6)的递归率具有高区分力。
递归分析揭示抑郁相关发声状态轨迹改变,为数字精神科生物标志物提供新的动态系统视角。
跨语言语音克隆在科学语音领域面临挑战,包括技术术语、代码切换、韵律模式以及多语言数据稀缺。
提出了一种结合集成蒸馏和参数高效微调的跨语言科学语音克隆方法,在低资源场景下实现了可懂度与说话人相似度的平衡。
当前深度伪造音频检测方法在跨数据集和真实场景下泛化能力不足,监督对比学习(SupCon)虽被用于提升鲁棒性,但其关键设计选择(相似性函数、负样本规模)在音频伪造检测领域缺乏系统性研究,现有工作通常将对比学习作为辅助损失而非独立分析其设计影响。
该论文通过控制实验揭示了SupCon中相似性函数与负样本缩放策略对音频伪造检测泛化性能的重要交互影响,为对比学习在反欺骗领域的应用提供了设计指导。
传统语音情感识别(SER)系统多基于手工设计的声学特征(如MFCC、基频等)和经典机器学习分类器(如SVM、k-NN),难以捕捉语音中随时间变化的复杂情感模式。此外,现有系统常忽略情感信息,限制了人机交互的自然性和个性化。
本文提出一种基于MFCC特征和LSTM深度学习的SER系统。具体流程: 1. 使用TESS数据集(2800条录音,7种情感),预处理包括统一时长(3秒)、提取40维MFCC系数(采样率22.05kHz,n_fft=2048,hop_length=512)。 2. MFCC序列输入单向LSTM网络,其门控机制(遗忘门、输入门、输出门)有效捕获长期时序依赖,解决梯度消失问题。 3. 输出层通过Softmax进行7类情感分类。
本文通过MFCC与LSTM的简单结合,在TESS数据集上取得了优异性能,证明了LSTM在语音情感识别中的有效性。
现有歌曲生成评估基准缺乏专业粒度,无法捕捉多维美学细微差别;主观评估存在一致性差、评分压缩等问题。
提出了SongBench,一个基于歌曲创作核心元素的七维度细粒度评估框架:Vocal、Instrument、Melody、Structure、Arrangement、Mixing、Musicality。构建了包含11,717个样本的专家标注数据集,覆盖多种模型和语言,通过严格的专家校准和质量控制确保标注可靠性。
实验表明,SongBench在各项指标上与专家评分高度相关,尤其在系统级相关性上优于SongEval(Musicality维度的LCC 0.976 vs 0.839)。
SongBench是目前最大、最细粒度的Text-to-Song评估基准,能够有效诊断模型性能差距。
当前主流的音频推理模型依赖强化学习与验证奖励(RLVR),但RLVR仅优化离散标签的正确性,导致模型在真实对话中丧失自然度、情感连续性和沉浸感,沦为“答录机”。作者将此现象称为“可验证奖励陷阱”。
提出Step-Audio-R1.5,首次将基于人类反馈的强化学习(RLHF)系统性地引入音频推理。通过训练基于人类偏好判断的奖励模型,统一优化正确性、流畅性和情感共鸣,跳出奖励陷阱。架构采用Qwen2音频编码器(25Hz,冻结)、2倍下采样适配器(12.5Hz)和Qwen2.5 32B LLM解码器。训练分为三阶段:音频中心中期训练(强化音频推理)、冷启动SFT(优化多轮对话行为)、基于规则生成奖励模型的RLHF(联合优化显式约束与偏好驱动目标)。
在语音转文本基准(如AudioMultiChallenge、Step-Caption等)上,Step-Audio-R1.5显著优于前代,并与Gemini 3 Pro等商业系统竞争。多轮对话能力在自然交互维度上大幅提升。
Step-Audio-R1.5通过RLHF解决了音频RLVR的“可验证奖励陷阱”,在保持推理准确性的同时大幅改善了对话自然度与用户体验。
传统的语音增强+说话人识别级联方法存在两个问题:1) 预训练的语音增强模型可能引入伪影,且未充分利用噪声语音中的说话人信息;2) 联合训练时,说话人编码器容易过拟合,且无法平滑地从干净语音过渡到噪声环境。
在多个噪声测试集上,UF-EMA方法优于现有方法(如单独训练、联合训练、观察添加等),展示了优越的噪声鲁棒性。
提出了一种结合UNet融合与EMA更新的噪声鲁棒说话人识别框架,有效利用了预训练增强模型的多源信息并缓解了过拟合问题。
音频感知大语言模型(ALLMs)在音频理解与推理任务中表现优异,但仍频繁产生幻觉或过度自信的输出。尽管不确定性估计在纯文本LLMs中已有广泛研究,但在ALLMs中尚未被系统性探索,音频条件生成引入了感知模糊性和跨模态 grounding 等额外挑战。
本文首次系统性地实证研究了ALLMs中的不确定性估计。基准测试了五种代表性方法:预测熵(Predictive Entropy)、长度归一化熵(Length-Normalized Entropy)、语义熵(Semantic Entropy)、离散语义熵(Discrete Semantic Entropy)和 P(True)。采用两阶段协议:先用低温解码获得预测答案,再通过采样估计不确定性。
在通用音频理解与推理基准上,语义级和验证性方法(语义熵、P(True))一致优于 token 级基线(预测熵、长度归一化熵)。在可信度导向基准(幻觉检测、不可回答问题)上,方法相对有效性变得高度依赖模型和任务,表明通用推理基准的结论不能直接迁移。此外,不确定性驱动的自适应推理作为下游应用进行了探索,但其效果取决于替代推理策略本身是否有益。
本文填补了ALLMs不确定性估计的空白,揭示了语义级方法在通用场景的优势及其在可信场景的局限性。
商业级Indic TTS系统需要大量GPU资源和商业数据,开源多语言基座(如Chatterbox)不支持Telugu/Tamil,且输出质量远逊于商业系统。
本文以极小代价(无商业训练数据、仅微调0.97%参数)将不支持Telugu/Tamil的冻结多语言TTS基座提升至商业级,并开源LoRA权重和推理代码。
ASAP通过利用平面阵列的方位优先特性,显著提升了3D DOA估计的效率和精度,适用于实时声源定位应用。
现有对话情感识别方法忽视个体表达差异,将不同说话人视为可互换实体,导致特征错配和融合失效,尤其在多轮对话中识别效果差。
提出多级说话人自适应网络(ML-SAN),通过三阶段自适应过程: - 输入层校准(Input-level Calibration):使用特征级线性调制(FiLM)将原始音视频特征调整至与说话人无关的中性空间。 - 交互层门控(Interaction-level Gating):基于说话人身份信息动态重新调整每个模态(如语音或面部特征)的信任度。 - 输出层正则化(Output-level Regularization):在潜在空间中保持说话人特征的一致性,引入辅助分类任务。
在MELD和IEMOCAP数据集上,ML-SAN的加权F1分数分别达到67.73%和73.28%,优于所有基线(如MultiEMO提升1.39%和1.26%),消融实验验证了各组件的有效性。
通过多级说话人自适应机制,有效解决了说话人身份混淆问题,显著提升多模态对话情感识别的鲁棒性和准确性。
Nyishi和Adi是印度阿鲁纳恰尔邦的两种低资源语言,属于Tani语支。此前缺乏系统性声学-韵律分析,尤其是在节奏方面。传统基于间隔的节奏度量方法存在局限性,且难以用于语言区分。
本文采用基于幅度调制(AM)低频(LF)频谱分析的节奏共振峰分析(RFA),直接从语音信号的包络中提取节奏特征(NDP、MFDP、VFDP),无需人工分割。同时提取DCT系数和MFCC表征频谱调制和整体频谱组织。通过统计建模和机器学习(SVM、MLP)评估节奏和频谱特征在语言区分中的层次性。
本文为低资源语言内部的声学区分提供了统一的信号处理框架,验证了节奏和频谱特征在互补水平上编码语言差异的假设。
现有研究对韩国撒娇语(aegyo)的语音特征关注不足,尤其缺乏对元音空间的系统性分析,而元音空间是构建孩童化语体的重要声学维度。
该研究首次揭示韩国撒娇语通过系统性地增加F1(元音降低)来模仿儿童声学特征,并伴随前元音选择性前移,为语体中介的语音风格化提供了量化证据。
现有音频语言基准测试未能反映真实的听觉理解能力,模型无需音频输入即可通过文本先验(text prior)获得60-72%的准确率;音频依赖项中仅3.0-4.2%需要完整音频,大部分可通过局部片段解决。
提出了两个诊断轴: - 文本先验(Text Prior):量化无音频输入时模型的表现,通过Text Backbone、None(无音频)和Full(完整音频)三个设置对比。 - 音频依赖(Audio Reliance):通过将音频分割为等长片段,计算保留率(retention rate)和片段充分性,区分片段足够与跨片段依赖。
联合分析将项目分为五类:文本可解(TS)、音频需要(AN)、片段充分(FS)、跨片段(XS)、音频有害(AH)、不可解(UN)。
该论文系统地揭示了音频语言基准测试中的文本先验和局部音频依赖问题,为更可靠的评估设计提供了实用指导。
本文首次将ACR建模为段级Seq2Seq任务,通过创新的令牌分解和预训练策略有效缓解过分割与数据不平衡问题,在复杂和弦识别上取得SOTA。
DriftSE以单步生成范式实现了高保真语音增强,兼顾质量与效率,为实时应用提供了新方向。
现有联合音频视频生成模型(如双分支扩散Transformer)存在两个缺陷:1) 在去噪全过程中通过交叉注意力机制将高低层次信息完全耦合,而音频和视频的低级实现在本质上是不同的渲染过程,这种均匀耦合导致不必要的纠缠和建模效率降低;2) 非自回归、固定输出长度,无法适应输入文本长度和自然变化的语速。
提出Talker-T2AV自回归扩散框架,将生成分解为两个阶段: - 高层次跨模态建模:共享自回归语言模型作为高层时序规划器,将音频和视频编码为时间对齐的潜序列,通过元素级求和融合,以文本为前缀自回归预测下一个联合补丁。 - 低层次模态专有渲染:两个轻量级扩散Transformer头独立解码隐状态为帧级音频和视频潜变量,分别处理各自信号特性。 该设计天然支持变长输出,且单一模型无需架构修改即可执行联合音频视频生成、音频驱动说话头、视频配音等任务。
在说话头基准上,Talker-T2AV在唇同步精度、视频质量、音频质量上均优于双分支扩散Transformer基线,同时比级联管线获得更强跨模态一致性,并在音频驱动合成和视频配音上匹配或超越专用系统。
一个通过将高低层次解耦、自回归扩散实现灵活变长、强跨模态联合的说话头音频视频生成框架。
现有可解释AI(XAI)研究在说话人识别任务中仅关注网络表示的扁平聚类(如K-means),忽略了表示之间可能存在的层次关系。
论文未在片段中提供详细数值结果,但通过算法评估(Rosenberg方法)验证了层次聚类质量,并使用HCCM成功将部分簇匹配到个体语义类(如“male”、“UK”)及合取类(如“male and UK”)。
该工作为理解神经网络的内部表示组织提供了新视角,通过层次聚类分析揭示了说话人识别网络中超越独立簇的复杂结构,并提出可解释的匹配与诊断工具。
传统方向性选择性固定滤波器主动噪声控制(D-SFANC)在应对移动噪声源时存在响应滞后问题,由于依赖当前帧的到达方向(DoA)选择控制滤波器,无法提前适应声源位置变化,导致噪声抑制性能下降。
提出预测性方向性SFANC(PD-SFANC),利用卷积循环神经网络(CRNN)从多帧参考信号中提取时空特征,预测下一帧的DoA,从而预先选择最合适的预训练控制滤波器。系统采用双模块架构:协处理器(如手机)以帧率运行CRNN进行滤波器预选,实时控制器以采样率执行噪声消除,实现无延迟的主动控制。CRNN通过交叉熵损失训练,所有参数自动学习,无需人工调参。
数值模拟在多种移动场景下(静态、匀速、变速)对比了多个基线方法(FxLMS、SFANC、D-SFANC、DFG-SFANC),PD-SFANC在噪声追踪能力和动态降噪性能上均表现出优越性。CRNN的DoA预测分类准确率在测试环境下达到86.8%-91.7%(不同信噪比和混响条件)。
本文通过CRNN预测移动声源轨迹,实现了对方向性固定滤波器ANC系统的前瞻性控制,显著提升了动态噪声抑制效果,并降低了系统复杂度。
现有语音助手基准测试缺乏领域广度、声学多样性和组合推理复杂性,无法有效评估工具调用能力。级联管道(ASR-LLM)受限于ASR错误传播和副语言特征丢失。
提出Audio2Tool数据集,包含30,000个查询,覆盖智能汽车、智能家居和可穿戴三个领域。设计八级复杂度层次(直接指令、参数化、多意图、隐式推理、大海捞针、纠正、对话、意图混合),并采用零样本语音克隆TTS和多样噪声模拟真实环境。
评估多种最新SpeechLM和ASR-LLM管道,在简单命令上性能良好,但在组合性和声学挑战下显著下降。
首个针对真实工具调用和声学条件的大规模语音基准,系统性地测试了语音到工具管线的鲁棒性。
传统的词级时间戳预测通常依赖外部强制对齐工具(如HMM、CTC),需要额外的对齐步骤和词典,且端到端模型可能存在识别准确率与时间戳预测之间的权衡。
本文在Granite-speech模型基础上提出In-Sync框架,实现联合转录与词级时间戳预测。主要创新包括: 1. 语音长度增强:拼接连续话语,平衡长尾时间戳分布,提升大时间戳的覆盖。 2. 时间戳嵌入正则化:引入辅助损失,通过高斯核目标矩阵强制时间戳嵌入的相似度结构,体现单调时序。 3. 减少教师强制:在自回归生成中随机扰动时间戳输入,增强模型鲁棒性。
在多个数据集上,In-Sync变体在保持或提升ASR词错误率(WER)的同时,显著降低了时间戳平均偏移(AAS)和畸形样本比例(MAL)。完整策略(长度增强+正则化+减少教师强制)在平均指标上优于混合训练基线。
In-Sync通过轻量级训练策略高效地将时间戳预测融入语音大语言模型,无需外部对齐工具,同时提升ASR性能。
多说话人自动语音识别(ASR)需要同时识别说话内容、说话人身份及时间信息。现有方法主要分为四类:级联流水线(误差传播严重)、联合训练模型(需大量数据)、LLM辅助混合系统(受上游质量限制)、统一端到端Speech-LLM(依赖大模型和大量数据,对时间建模弱)。
提出DM-ASR,一种说话人日志感知的多说话人ASR框架: - 将多说话人转录重构为多轮对话生成问题,利用外部说话人日志(diarization)作为显式结构先验。 - 通过特殊标记离散化机制将说话人日志转换为说话人和时间戳token,作为LLM的提示。 - 支持词级时间戳预测,在转录中交错生成单词和时间戳token,提升输出结构和文本准确性。 - 解耦说话人-时间结构(谁、何时)与语言内容(什么),使LLM专注于语言建模,降低学习难度。
在中文(如AISHELL-4)和英文(如AMI、CHiME-6)基准上,DM-ASR使用较小模型(如7B以下)和有限训练数据即达到强性能,与现有统一方法相当或更优。进一步分析表明,模型能有效利用可靠diaization信息,并随模型增大逐渐学习纠正不完美的日志。
一篇实用且高效的半端到端多说话人ASR工作,通过显式注入说话人日志先验,显著降低了模型对规模和数据的依赖。
现有音频效果估计方法分为纯预测和纯搜索两类。纯预测方法(如DNN)误差累积,且难以处理效果链的顺序和参数;纯搜索方法需要已知干信号进行重建,但实际中干信号未知。
提出两阶段方法: 1. DNN预测阶段:设计三种预测任务划分(Dry-Type-Direct、Bypass-Type-Iter、Bypass-Config-Iter),使用基于Hybrid Transformer Demucs和SunAFXiNet的架构,联合预测干信号和效果配置(类型、参数、顺序)。 2. 搜索阶段:基于预测的干信号和效果类型序列,使用CMA-ES算法优化效果参数,以SI-SDR作为重建相似度目标。通过先预测干信号,使搜索阶段能够利用重建相似度进行补充优化。
在吉他音乐片段上评估: - 所有两阶段方法均优于纯预测方法。 - 最优任务划分:先预测效果类型组合(Dry-Type-Direct),再通过搜索估计顺序和参数。
首次将预测和搜索方法有效结合,通过干信号预测使重建相似度成为可用的搜索目标,显著提升了音频效果链估计的准确性。
现有大型音频语言模型(LALMs)在短音频上表现优异,但在长音频(数分钟至数十分钟)的时间感知任务上严重退化,表现为时间幻觉(预测事件超出有效时间范围)和时间戳漂移(时间对齐逐渐偏离),且随音频时长增加而加剧。主要原因包括缺乏专门的长音频时间标注数据集、基准测试和建模方法。
LAT-Audio 在 TAG、DAC、TAC 任务上均超越了现有模型(如 Audio-Flamingo 3、Gemini 等),并且随着输入时长增加表现出更好的鲁棒性。
本文系统性地解决了长音频时间感知的数据、基准和模型缺陷,提出了有效的渐进推理框架,是该领域的重要推进。
传统MOS评分无法提供细粒度诊断,且现有评估方法多依赖全局标量或高层感知,忽略了具体声学伪影和语言特异性(如普通话声调)。
在1600样本黄金测试集上,TTS-PRISM(7B)在12维度上的LCC、SRCC和MSE_norm全面优于Step-Audio-R1(33B)、Qwen3-Omni(30B)和Gemini-2.5-Pro。消融实验验证了指令微调、CoT推理和负样本的有效性。
首个面向普通话语音的细粒度、可解释、开源评估框架,通过多维评分和推理实现了超越通用模型的诊断精度。
UniSonate首次在无参考音频、仅文本指令的条件下,统一生成语音、音乐和音效,并实现SOTA性能与正迁移效应。
现有特征融合方法(如简单拼接、Feature Refinement Loss)在自然语音场景(如Fearless Steps Apollo语料库)下效果不佳,难以充分挖掘不同SSL模型之间的互补信息。
提出深度交叉注意力(Deep Cross-Attention, DCA)融合方法,通过在多个SSL模型输出的特征之间应用交叉注意力机制,动态融合互补信息,替代传统的加权和或共注意力方法。此外,对Feature Refinement Loss进行了超参数分析,揭示了其在FSC Phase-4语料库上的局限性。
在FSC Phase-4语料库上,提出的DCA融合方法实现了绝对词错误率(WER)降低1.1%的提升;在CHiME-6数据集上同样验证了有效性。同时,首次提供了FSC Phase-4语料库的ASR基线结果及逐通道分析。
该研究通过创新的深度交叉注意力融合策略,有效提升了自监督学习特征在复杂自然语音场景下的ASR性能,并且为Fearless Steps Apollo社区资源提供了高质量元数据。
提出了一种无提示的MDD框架,通过解耦声学保真度和规范先验,有效避免了CTC的稀疏性和语言偏差,实现了SOTA性能。
传统滑音(portamento)研究仅将其视为二元存在/不存在现象,测量频率和时长,忽略了滑音的陡峭程度(梯度)这一表达性特征。两个时长相同的滑音若音程跨度不同,听觉效果截然不同。
引入第三个量化描述符——声谱梯度(Hz/s),通过Sonic Visualizer的旋律声谱图层、GIMP像素分析和频率轴校准协议进行测量。同时提出增益恢复协议,使得1930年代模拟录音中微弱的滑音痕迹也能被分析。
对22个贝多芬钢琴与大提琴奏鸣曲录音(1930-2012)的开场小节进行分析,得出梯度值范围从约600 Hz/s(晚期录音)到超过4000 Hz/s(早期20世纪表演)。验证了梯度陡峭度与速度负相关的假设:慢速演奏产生更陡、更长的滑音,快速演奏产生更平缓的滑音或无滑音。表明20世纪滑音衰落是一个梯度连续变平的过程,而非二元切换。
该论文通过物理校准的梯度指标,为历史录音的滑音风格演变提供了可量化的连续维度,弥补了传统事件计数和时长测量的不足。
现有光学键盘传感系统(如PNOScan、Moog PianoBar及McPherson等人的研究)专为现代钢琴设计,无法适应历史键盘乐器(羽管键琴、击弦古钢琴、早期钢琴)的多样化几何结构、有限间隙和非标准布局。历史键盘研究缺乏非侵入式、可复制的运动捕捉方案。
PHOTON采用反射式光学传感器,安装于琴键杠杆末端下方,直接测量垂直位移,不干扰机械动作。系统模块化、低轮廓,支持多排键盘(如双排羽管键琴)和可变键数。硬件(KiCad原理图/PCB)和固件(CircuitPython)完全开源。传感器采用选择性启用(而非连续驱动),可扩展至122个传感器。提供约100个可分辨位置等级(约1cm行程),部分传感器采样率>250Hz。USB复合设备输出标准MIDI和串行位置流。
通过案例研究展示羽管键琴键-动作运动轨迹(Attack/Aftertouch/Release)。系统能区分约100个位置等级,非线性插值但单调。高分辨率模式下>250Hz采样。与现有方法(Hamilton等人的拨子运动检测、Schmidt等人的键下传感器)对比,PHOTON更紧凑、易安装、兼容更紧空间。
PHOTON是首个面向历史键盘乐器的非侵入式开源光学跟踪系统,填补了该类乐器运动捕捉的空白。
现有深度学习方法(如DCNN)处理周期性信号时,需要大量计算资源和针对每个信号单独训练,难以部署在资源受限的IoT设备上。固定膨胀因子难以适应基频变化的信号。
提出R-DCNN方法:使用一维膨胀卷积网络(DCNN),通过轻量级重采样(Resampling)将不同基频信号的时间轴对齐到参考信号,从而重用同一组网络权重。只需一次观测即可训练,推理时仅需调整时间缩放因子。
(文中未提供具体数值,但声称)在去噪和波形估计精度上与经典自回归(AR)方法及单独训练的DCNN相当,计算复杂度显著降低。
一种低复杂度、适合资源受限设备的周期性信号去噪方法,通过重采样实现了跨基频的权重共享。
现有说话人日志(SD)系统要么采用模块化流水线(如VAD、分割、嵌入、聚类)导致错误级联,要么采用端到端神经方法(EEND)受限于固定说话人数和长录音处理能力。DiariZen虽为开源SOTA,但其实现分散在多个仓库,缺乏统一、可复现的教程,研究者难以理解或扩展。
DiariZen是一个混合SD流水线,结合了EEND风格神经分割前端和VBx聚类后端。主要创新包括: 1. 结构剪枝WavLM-Large编码器(参数从316M降至63M,通过DPHuBERT风格剪枝),并采用学习加权层组合(SUPERB方式)提取帧级特征。 2. Conformer后端 + 幂集分类:预测最多4个说话人、最多2人重叠的11类组合(静音/单说话人/双说话人),而非独立的多标签分类。 3. 滑动窗口高重叠(90%) 后接重叠相加(OLA)和滤波,获得连续分割和瞬时说话人数。 4. 基于WeSpeaker ResNet34的说话人嵌入提取,带重叠排除掩码。 5. VBx聚类(PLDA评分 + AHC + VB-HMM)实现全局说话人身份匹配。
论文提及DiariZen在AMI、VoxSRC和DIHARD-III等多个基准上取得开源SOTA性能。示例中对AMI 30秒录音处理得到13个片段、4个全局说话人。
DiariZen通过混合架构结合神经分割与概率聚类的优势,以模块化教程和可视化方式促进可复现研究。
传统口语对话系统基于严格的轮流说话范式,无法处理中断、语音重叠、动态轮次协商等自然交互现象,导致对话不自然、响应迟缓。现有数据集多为单通道或脚本化,缺乏真实对话中的中断、反馈、背景干扰等细节;评估指标仅关注识别准确率或任务完成率,忽略中断处理、响应时机等交互维度。
本文主要介绍数据集和基准设计,未提供具体实验结果。但挑战赛接收了多个参赛团队的方案,并将在后续论文中总结。
该工作为全双工口语对话系统提供了首个大规模真实交互基准,推动更自然、更具交互性的模型评估。
当前多模态大模型(OLLMs)在音乐符号处理(ONP)方面存在碎片化研究、偏向西方五线谱的严重记谱偏差,以及“LLM-as-a-judge”评估的主观性导致系统幻觉。
提出ONOTE基准,包含三种记谱系统(五线谱、简谱、吉他谱)和四个任务轨道(视觉乐谱理解VSU、跨格式符号转换CNC、音频到符号转录AST、符号音乐生成与美学SMG)。采用确定性评估管道,通过规范音高投影和序列对齐(基于Levenshtein编辑距离)消除主观评分偏差。
对领先OLLMs的评估揭示了感知准确性与音乐理论理解之间的根本脱节。
ONOTE为音乐符号处理提供了客观、多格式的基准,有助于诊断复杂规则约束领域中的推理漏洞。
传统BSS-Eval指标(如SDR、SI-SDR)与感知音频质量评分相关性差,尤其在生成式模型上。
提出两种基于MERT嵌入的侵入式评估指标: - MSE_MERT:计算目标与分离信号在MERT嵌入层(第12层)的均方误差。 - FAD_song2song:每首歌上计算分离信号与目标信号嵌入分布的Fréchet距离。
利用自监督音频模型MERT的嵌入特征,显著提升了音乐源分离客观评估与主观感知的一致性。
传统Tonnetz(音网)理论主要基于欧拉音网(Eulerian tonnetz),聚焦于大小三和弦,缺乏对其他音乐系统(如自然音阶、五声音阶、十二音体系)的统一数学刻画,且音网构造过度依赖声部进行(voice leading)的直觉概念。
本文从组合几何视角出发,利用配置(configuration)和Levi图(双正则二分图)系统构建多种音网: - 将欧拉音网建模为Daublebsky von Sterneck型D222配置{12³},特里斯坦属和弦(属七与半减七)对应D228配置。 - 自然音阶三和弦:建立类型{7³}的二分图(girth 4),音级与和弦构成平面六边形镶嵌。 - 自然音阶七和弦:Fano配置{7³}完全刻画声部进行关系。 - 五声音阶:基于Desargues配置{10³}构建音网。 - 十二音体系:基于Cremona-Richmond配置{15³}构建音网。 - 提出音网构造可脱离声部进行,仅基于集合包含关系(如半音音高集与大三和弦集之间的自然映射也形成D222配置),并证明大小三和弦对偶性可被打破。
论文主要提供理论构造,未涉及实验数据,但给出了多个具体配置的图示(如Figure 4-9)和命题(Proposition 1-7),以及它们在平面上的镶嵌表示。例如: - C大调音阶的七和弦对应Fano配置,其Levi图是一个7顶点7线结构。 - 五声音阶的Desargues配置包含10个点与10条线,每条线3个点。 - 特里斯坦音网中,女武神咏叹调的和声进行对应一个八循环。
本文为音乐理论中的音网提供了统一的组合几何框架,展示了从自然音阶到十二音体系的多种配置构造,并论证了基于集合包含关系的音网新范式,是数学与音乐学交叉的深度研究。
现有CodecFake(CF)检测数据集主要针对英语或汉语,缺乏对印度语言(Indic languages)的关注。印度语言具有丰富的语音多样性和韵律变异性,导致基于英语的SOTA检测器在Indic语言上泛化能力差。此外,现有音频大语言模型(ALM)在零样本设置下表现不佳。
首次针对Indic语言神经音频编解码合成语音深伪检测,提出专用数据集和双曲空间ALM模型,显著提升检测性能。
儿童语音的ASR错误率较高(5%-50%),现有置信度估计方法在噪声和发音错误场景下不可靠,需要识别可靠的ASR输出以减轻负面影响。
提出两种 utterance-level 可靠性选择方法: - Read speech: [prompt]方法——将ASR输出与原始阅读提示逐字匹配,匹配则视为可靠。 - Dialogue speech: [LLM-classification]方法——利用大语言模型(LLM)基于语义和语法一致性分类句子的可靠性。 此外,还测试了两种ASR模型(Whisper-V2和Whisper-FT)输出一致时的 Agreement 策略。
提出了一种新颖的、轻量级的utterance-level ASR可靠性筛选方法,在儿童语音场景下取得高精确率和低错误率,具有实际应用价值。
通过自适应置信度加权和统计语言模型,有效提升低资源德拉维达语言医疗ASR性能。
现有大音频语言模型(LALM)的评估基准主要集中在英语,缺乏针对韩语的综合评估,且现有韩语言语基准多针对传统语音处理任务,无法评估LALM的语音理解和忠实度。
KoALa-Bench填补了韩语LALM评估的空白,通过创新性忠实度任务揭示了模型对语音输入的依赖程度,为多语言语音模型研究提供了重要基准。
传统的公平性指标(如Equalised Odds、Demographic Parity)孤立地评估受保护属性,忽略了属性与模型误差的联合依赖关系,无法捕捉交叉性偏见,且不能量化绝对偏见程度,难以指导缓解策略。
提出Weighted-Attribute Fairness (WAF),通过线性模型学习人口统计属性与每类二元交叉熵误差之间的关系,直接输出各属性对误差的贡献分数(正负表示偏向特权/非特权组)。支持同时输入人口统计和语音特征,并利用PCA筛选关键维度,提升误差预测的鲁棒性。在合成数据上验证了WAF与互信息的强相关性(Pearson/Spearman相关系数≥0.82),优于传统指标。
该工作为SER公平性评估提供了可解释、量化属性贡献的新指标,弥补了传统指标在联合建模和绝对偏见度量上的不足,并验证了SSL模型存在性别偏见。
现有TTS多阶段生成方法(如语义-声学token预测)主要关注粗到细的声学特征层次,但未显式建模语音生成中的时间动态(temporal dynamics),即从粗时间分辨率到细时间分辨率的渐进细节细化。
提出Chain-of-Details (CoD)框架,将语音生成分解为多个时间分辨率阶段(如三级),每个阶段使用掩码音频token建模(MATM)逐步细化时间细节。所有阶段共享同一解码器和码本,实现参数高效利用。在最低细节级别,模型自然执行音素规划,无需显式时长预测器。推理时以非自回归方式并行生成每个时间级别的token。
在多个数据集上评估,CoD-TTS以显著更少的参数达到与现有方法(如VALL-E、NaturalSpeech 3等)竞争的性能,表明显式时间动态建模可提升合成语音的自然度。
CoD通过级联时间粗到细生成,以参数高效方式实现了更自然的语音合成。
训练单个模型同时支持离线高精度和低延迟流式ASR时,流式模式性能退化严重,尤其在低延迟(<0.5s)场景下。
提出统一ASR Transducer框架,结合chunk-limited attention(带右上下文)和动态chunk卷积(DCConv)。核心贡献是提出MCR-RNNT(模式一致性正则化),通过高效Triton GPU实现,在双模式训练中最小化离线与流式联合输出的KL散度,减少模式冲突。
通过高效的模式一致性正则化,显著缩小离线-流式性能差距,实现高精度低延迟统一ASR Transducer。
电容式传感器(以驻极体电容麦克风ECM为例)的自噪声主要由前置放大器栅偏置电阻的热噪声引起。传统电路中,同一RC时间常数同时决定噪声低通截止频率和信号高通截止频率,导致噪声降低与信号带宽之间存在权衡。
提出PDS-Amp(光电直流伺服放大器),用光电元件(如光电管)替代栅偏置电阻,作为超高阻抗电流源。通过滞后-超前补偿的DC伺服回路,利用LED反馈控制光电流,稳定栅偏置电压,从而解耦噪声和信号截止频率。制作了基于锌光阴极的光电传感器,实现亚皮安级暗电流。结合共源共栅JFET前置放大器(通过自举减小输入电容),有效降低自噪声。
使用12 pF模拟麦克风实现11 dBA的自噪声,虽使用小振膜ECM胶囊,但性能与数千美元的大振膜电容麦克风相当。实际ECM胶囊录音实验定性证实背景噪声显著降低。
PDS-Amp通过光电直流伺服技术突破传统栅偏置电阻的噪声-带宽权衡,为电容式传感器提供了一种低自噪声解决方案。
混合波束成形(HBF)架构降低了硬件复杂度,但限制了对全阵列观测的访问,导致经典的协方差方法(如MVDR和SMI)无法直接实现。现有H-MVDR方法依赖于不可观测的全阵列协方差矩阵,且缺乏协方差重建框架,性能在实际硬件中无法达到理论上限。
本文提出Rock Road to Dublin(RR2D)结构化协方差补全框架,从部分观测的样本协方差矩阵(SCM)估计不可观测的分析协方差矩阵(ACM)。RR2D利用信号在阵列上的平稳性,通过Dykstra交替投影算法施加正半定、Toeplitz和块约束,重建虚拟ACM。重建的ACM使得混合SMI(H-SMI)公式可实现,并与现有H-MVDR优化框架完全兼容。
对于32元混合阵列,仿真显示:直接使用先前的H-MVDR公式实现的H-SMI性能下降,而通过RR2D重建后的H-SMI一致优于先前的混合SMI和部分数字基线,性能接近H-MVDR参考。
RR2D通过结构化协方差补全弥合了理论H-MVDR与实际混合硬件之间的差距,实现了从非完备观测中重建协方差矩阵。
大型语言模型(LLMs)在歌词到旋律生成中展现出潜力,但通过监督微调(SFT)训练的模型经常产生音乐上不合理的结果,如节奏差、音域不合适等问题,被称为“约束违反”。SFT模型缺乏对音乐原则的鲁棒遵守,导致单调的音高序列、节奏不自然的音符持续时间、音域超出人声范围等缺陷,限制了其实用性。
本文提出一个新颖的对齐框架,通过基于规则的音乐约束自动灌输音乐知识,无需人工标注。关键步骤包括:1) 定义五个规则约束:格式约束(确保输出符号格式正确)、歌词约束(确保歌词与旋律对齐)、音符约束(避免单调)、持续时间约束(确保节奏合理性)、音域约束(确保旋律可唱)。2) 自动生成偏好数据集:从SFT模型的输出中,使用规则评估生成配对数据(规则合规的“胜者”和违规的“败者”)和非配对数据(仅违规输出)。3) 顺序对齐策略:先应用直接偏好优化(DPO)在配对数据上,然后应用卡尼曼-特沃斯基优化(KTO)在非配对负样本上,以高效学习偏好信号。
实验在英文和中文测试集上进行,使用客观和主观指标评估。客观指标包括音高分布相似性(PD)、持续时间分布相似性(DD)和旋律距离(MD)。与基线方法(如SongMASS、TeleMelody、SongComposer)相比,提出的方法显著提高了性能:例如,在中文测试集上,PD从30.79%提升到33.94%,DD从33.68%提升到43.44%,MD从3.11降低到2.58。主观评估通过平均意见分数(MOS)进行,提出的方法得分3.42,接近地面真实录音(3.50),优于其他基线(如SongComposer的2.92)。结果验证了规则对齐的有效性,减少了音乐错误,提升了生成旋律的音乐性和连贯性。
这是一个创新的方法,通过基于规则的自动对齐框架,有效解决了LLMs在歌词到旋律生成中的音乐约束问题,显著提升了生成质量和可部署性。
在深度学习的增量学习(continual learning)场景中,灾难性遗忘(Catastrophic Forgetting)是一个关键挑战。默认情况下,深度神经网络在学习新任务或适应新数据分布时,会因内部表示被覆盖而迅速忘记先前学到的模式,导致性能下降。这在音频分类等应用中尤为突出,阻碍了模型在动态环境中的持续适应能力。
本文提出一种创新的方法,将生物启发的赫布学习(Hebbian learning)应用于音频分类的增量学习。主要创新点包括: - Kernel Plasticity 方法:通过调制学习率,在增量学习过程中选择性调节网络核(kernels)。具体来说,基于每个核的平均权重变化和激活值,识别重要核(top k kernels),并调整其更新以平衡新信息学习和旧知识保留。增强不重要核的可塑性(α > 1),同时保护重要核的稳定性(0 < β < 1)。 - 结合 SoftHebb 算法:采用 SoftHebb 作为赫布学习的变体,通过贝叶斯解释和动态学习率改进,实现无监督的特征提取。 - 多头部分类器架构:在任务增量学习(task-incremental learning)中,为每个新任务实例化新的分类头,与共享的赫布卷积特征提取器结合,确保任务标签在训练和推理时可用。
实验在 ESC-50 数据集上进行,该数据集包含 50 个环境音频类别。将类别分为 5 个增量任务:首个任务包含 30 类,后续 4 个任务各 5 类,类间不重叠。模型采用五层赫布卷积层和任务特定分类头。 - 性能:在五个增量步骤后,整体分类准确率达到 76.3%,显著优于未使用 kernel plasticity 的基线方法(68.7%)。 - 稳定性:该方法在任务间显示出更大的稳定性,通过专门指标评估,有效缓解了遗忘过程,保持了先前任务的性能。 - 对比:与基于反向传播的传统方法(如弹性权重整合、无遗忘学习等)相比,提出的赫布学习方法在生物合理性和无监督特性上具有优势。
这项工作首次将赫布学习与增量学习相结合,为音频分类提供了一种生物启发的、无监督的方法,在缓解灾难性遗忘和提升持续学习能力方面展现出潜力。
NIM4-ASR 通过创新的多阶段训练和 RAG 集成,显著提高了 LLM-based ASR 的效率、鲁棒性和可定制性,为实时应用提供了实用的解决方案。
指令跟随文本到语音(TTS)的评价存在显著不足,主要问题包括基准覆盖有限(尤其在音色相关控制、组合案例和副语言行为方面)、诊断粒度弱(难以区分内容错误、指令执行失败或感知质量下降),以及多语言支持不充分。现有评价资源无法满足开放式指令跟随的需求。
提出MINT-Bench基准,通过以下创新方法解决上述问题: - 采用分层多轴分类法,基于十个原子声学属性构建核心库存,覆盖音色、风格控制及其组合、动态实现、基于人物或场景的提示,以及特殊案例如异常发声和非语言事件。 - 设计可扩展的多阶段数据构建管道,生成语义清晰的指令-文本对,支持新控制设置和语言的扩展。 - 引入分层混合评价协议,逐步评估内容一致性、指令跟随和感知质量,结合客观工具和基于大型音频语言模型(LALM)的判断,提供细粒度诊断。
在十种语言上的实验表明: - 指令跟随TTS远未解决;前沿商业系统整体领先,但领先开源模型具有高度竞争力,在本地化设置如中文中甚至能超越商业对手。 - 基准揭示内容保真度强不代表可控性强,更难的组合和特殊额外声音案例是当前系统的主要瓶颈。 - 实验强调了结构化、诊断性评价框架的重要性,超越扁平提示集和聚合分数。
MINT-Bench提供了一个全面、诊断性、可扩展的多语言基准,通过结构化分类和混合评价协议,显著推进了指令跟随TTS的评价研究,并开源工具以促进未来发展。
传统的语音情感识别(SER)系统严重依赖标记的口语语音,导致在低资源多语言设置中数据稀缺、跨语言转移效果差。情感与语言内容纠缠,监督信号分布不均,限制了模型的泛化能力。
提出NOVA-ARC框架,利用非语言声音(如笑声、哭泣)作为监督信号,通过韵律线索训练情感识别模型。使用双曲几何捕捉情感结构,通过双曲向量量化代码本和最优传输原型对齐,实现从标记非语言声音到未标记多语言口语语音的无监督适应。
在ASVP-ESD、MESD、AESDD、RAVDESS、Emo-DB、CREMA-D等数据集上进行评估。NOVA-ARC在非语言到语言适应和语言到语言转移设置下均表现最佳,优于欧几里得版本和自监督学习基线(如WavLM、wav2vec 2.0)。例如,在MESD数据集上,使用MMS编码器时准确率达到96.47%。
这是一个开创性工作,首次将非语言声音作为监督源引入多语言SER,有效解决了跨语言情感转移的瓶颈,为低资源场景提供了新范式。
音频深伪检测在医疗领域中面临病理语音变异性挑战。现有检测器主要基于健康语音训练,在病理条件下性能显著下降,导致在临床设置中鲁棒性不足。医疗语音作为临床信号和身份验证工具,易受现代语音攻击,缺乏病理感知的数据集和检测框架。
该工作通过引入首个病理感知医疗音频深伪检测基准和几何感知框架,填补了领域空白,提升了检测鲁棒性,但依赖于现有数据集和编解码器多样性,未来需扩展至更广泛临床条件。
该工作通过创新数据合成和专家混合架构,有效解决了表达性语音翻译的关键挑战,显著提升了非言语声学保留和情感保真度,为真实世界 S2ST 应用提供了实用解决方案。
现有大型音频-语言模型(LALMs)的生成性偏见未被充分探索,现有评估方法依赖合成语音和多项选择题(MCQs),提供片面的公平性视图,无法反映真实世界开放生成任务中的偏见。
提出VIBE框架,通过真实世界人类录音和开放任务(如故事生成、个性化推荐)评估生成性偏见。使用LLM提取结构化属性,并以总变异距离(TVD)量化偏见分布偏移,实现无约束输出和易扩展性。
评估11个先进LALMs,发现系统性偏见:性别提示常比口音提示引发更大的分布偏移,表明模型复制社会刻板印象;偏见高度任务依赖,没有单一模型在所有任务中偏见都低。
VIBE提供了一个有效的创新框架,用于评估LALMs在真实场景中的生成性偏见,揭示了当前模型的局限性并推动公平性研究。
该论文提出了一种创新的两阶段语音匿名化框架,有效平衡隐私保护和数据效用,为语音隐私研究提供了新思路和更全面的评估方法。
该论文提出了一个创新的BIOSS框架,有望通过状态空间表示桥接物理和数据驱动模型,为房间声学建模研究开辟新路径。
现有音频深度伪造检测(ADD)系统主要依赖脚本录音数据(如ASVspoof数据集)训练,在现实世界(in-the-wild)深度伪造上泛化能力差。这是因为脚本录音缺乏真实世界的声学变异(如背景噪音、房间声学、压缩伪影)和自然不流利性,导致检测模型性能下降,限制了实际应用。
论文提出ICLAD(In-Context Learning with Comparison-Guidance for Audio Deepfake Detection),一种基于in-context learning的训练免费检测方法。核心创新是Pairwise Comparative Reasoning (PCR)策略,指导音频语言模型(ALMs)生成和比较真实与伪造证据,以过滤幻觉和深度伪造无关的声学属性。框架包括两个阶段:离线推理生成证据缓存(包括初始证据、证据协调和离线存储),和在线推理通过检索相似示例进行预测(包括示例检索和动态路由到专门检测器)。这提供了文本解释并无需参数更新。
在in-the-wild数据集上,ICLAD提高了macro F1分数,相比专门检测器(如Wav2Vec2-AASIST)有最高2倍的相对改进。分析表明ICLAD具有灵活性,并可在开源ALMs上部署,有效泛化到未见数据。
ICLAD是一种创新的训练免费方法,显著提升了音频深度伪造检测在现实世界数据上的泛化能力和解释性,为自适应检测范式提供了新思路。
数据驱动方法在合成语音检测中存在以下核心痛点:过度依赖非语音特征(如静音区间、背景噪声),导致模型泛化能力差,且在去除这些特征后性能急剧下降;缺乏可解释性,可能使模型在法律程序中不可接受;神经编码检测虽能捕获合成痕迹,但聚焦于声码器阶段的痕迹,可能误判自然语音为合成,且存在泛化问题,未能真正检测文本到语音或语音转换系统产生的合成语音。
论文是综述性质,未提出新方法,而是系统分析现有数据驱动方法:SincNet-based方法(如RawNet2、RawGAT-ST、AASIST)使用原始音频输入和sinc滤波,但时间不变性导致模型聚焦特定频段;SSL-based方法(如XLSR-AASIST、XLSR-SLS、XLSR-Mamba)基于wav2vec 2.0预训练模型,提升泛化但可解释性差;神经编码检测方法(如Wang et al. 2024、Sun et al.)通过自声码管道生成训练数据,但局限于声码器痕迹检测。论文创新在于批判性分析趋势,指出不应仅关注神经编码检测,并推荐多元化研究方向。
论文引用多项研究结果:SincNet-based方法在ASVspoof挑战中表现优异(如RawNet2成为基线),但收敛于高/低频段和非语音区域,影响泛化;SSL-based方法(如XLSR-AASIST)改进性能并降低泛化问题;神经编码检测方法在特定声码器上有效,但泛化能力有限,对未训练声码器失效。整体上,数据驱动方法表现依赖训练数据质量,神经编码检测作为临时方案有局限性。
这篇论文为合成语音检测领域提供了重要批判性综述,警告过度依赖神经编码检测的风险,并倡导结合假设基方法来克服数据驱动算法的不足,指导未来研究方向。
Fault Intensity Diagnosis (FID) 在智能制造中至关重要,但现有数据驱动方法如 CNN 和 Transformers 忽略目标类之间的层次依赖性,导致模型在实际部署中性能受限,无法有效处理复杂工业系统中的细微故障识别。
论文提出 Deep Hierarchical Knowledge Loss (DHK) 框架,通过引入层次知识约束改进 FID。核心创新包括: - Hierarchical tree loss (L_HT):修改二元交叉熵损失,结合正负层次知识(从子节点到祖先节点的正知识和从父节点到子节点的负知识),确保预测与层次结构的一致性。 - Focal hierarchical tree loss (L_FHT):扩展 L_HT 以增强适用性,并设计两种基于树高度的自适应加权策略(标准化高度权重和比例高度权重),平衡不同层次类的处理。 - Group tree triplet loss (L_GTT):整合群组概念和树距离,引入层次动态边缘,精确建模类间边界结构知识,提高边界学习能力。 - 框架整体:将数据流映射转换为分形流映射,融合层次知识到目标函数中,实现层次一致性表示和预测。
在四个真实世界数据集上进行广泛实验,包括三个来自 SAMSON AG 的 cavitation 数据集和一个公开数据集。实验结果显示,DHK 框架在故障强度诊断任务上优于现有状态的艺术方法,消融研究进一步验证了其有效性。
该论文通过创新性地将层次知识嵌入损失函数,显著提升了 FID 的准确性和鲁棒性,为工业故障诊断提供了可扩展的通用解决方案。
传统光学音乐识别(OMR)系统依赖多阶段处理管道和手工规则,在处理手写或退化乐谱时鲁棒性差、可扩展性有限。现有方法在平衡细粒度视觉特征提取和时序依赖建模方面存在挑战。
提出一个端到端 OMR 框架,结合瓶颈残差卷积特征提取和双向门控循环单元(BiGRU)时序建模。使用 ResNet-v2 风格的残差瓶颈块和多尺度扩张卷积来捕获细粒度符号细节和全局谱线结构,通过 BiGRU 建模时序依赖,并使用连接时序分类(CTC)损失进行端到端训练,无需显式对齐标注。
在 Camera-PrIMuS 数据集上:序列错误率(SeER)为 7.52%,符号错误率(SyER)为 0.45%,音高、类型和音符准确率分别为 99.33%、99.60%、99.28%。在 PrIMuS 数据集上:SeER 为 8.11%,SyER 为 0.49%,准确率类似。平均训练时间每轮 1.74 秒,显示高计算效率。
该论文有效整合了先进的视觉特征提取和时序建模技术,在光学音乐识别任务中实现了高准确率和效率。
语音分析用于神经退行性疾病(特别是肌萎缩侧索硬化症,ALS)的早期诊断和监测面临关键挑战:缺乏大规模、注释良好的参考数据集;评估协议不标准化,难以进行公平比较;疾病表现异质性和录音条件可变性增加了分析难度;隐私约束限制敏感语音数据的共享。
本文介绍了SAND(Speech Analysis for Neurodegenerative Diseases)挑战,通过多学科合作创建了一个改进的数据集和评估框架。创新点包括:扩展VOC-ALS数据集,增加更多受试者和纵向数据以支持疾病进展建模;提供盲测试集,由神经学家注释但标签对参与者保密;实施标准化评估协议,使用抗不平衡度量确保公平比较;采用m-health应用Vox4Health进行语音采集,确保数据质量和匿名性。
SAND挑战吸引了全球超过800名参与者,覆盖五大洲,主要来自学术机构,反映了该主题的高相关性。数据集包括339名意大利说话者(205名ALS患者和134名健康对照),总计2,712个语音信号,基于ALSFRS-R量表进行标注。挑战设置两个任务:多分类(估计诊断和构音障碍严重程度)和进展预测(使用纵向数据)。尽管具体模型结果未在片段中详述,但挑战促进了机器学习模型在ALS语音分析中的发展和测试。
SAND挑战为ALS语音分析提供了一个重要的基准数据集和标准化评估框架,推动了AI在神经退行性疾病诊断中的临床应用。
Speech Large Language Models (SLLMs) 在高资源语言(如英语和中文)中表现出色,但在低资源语言(如泰语)中性能显著下降。主要挑战包括:1) 现有常用语音编码器(如Whisper系列)在低资源语言中表现不佳,且不支持广泛的语音理解任务;2) 基于ASR的对齐范式需要训练整个SLLM,导致高计算成本;3) 低资源语言中配对语音-文本数据稀缺。
论文提出三种创新方法以解决这些挑战: - XLSR-Thai:首个泰语自监督学习语音编码器,通过在36,000小时泰语语音数据上持续训练XLSR模型获得,旨在提取更丰富的语音表示以支持多任务理解。 - U-Align:一种资源效率更高、多任务效果更好的通用语音-文本对齐方法,使用DTW-loss直接对齐适配后的语音表示与文本嵌入,而不涉及LLM,降低计算成本并提升对齐效果。 - Thai-SUP:一个管道,从高资源语言(如英语)文本理解数据生成低资源语言语音理解数据,通过LLM-based数据增强、翻译和文本转语音合成,创建了首个开源泰语语音理解数据集(超过1,000小时)。
这篇论文为低资源语言的多任务理解SLLMs提供了一个全面、创新且开源的解决方案,通过改进编码器训练、对齐策略和数据生成,显著提升了性能并降低了资源需求。
核心痛点: AI生成音乐在流媒体平台泛滥,现有检测方法(如表示学习和自编码器指纹识别)在未见生成器上泛化能力差,且受音频编解码器和流派分布影响。
方法创新: 提出ArtifactNet框架,将问题重构为法医物理学,专注于提取神经音频编解码器(如RVQ)留下的不可逆残差伪影。使用ArtifactUNet(3.6M参数)从幅度谱中提取残差,通过HPSS分解为7通道法医特征,并由紧凑CNN(0.4M参数)分类。引入代码感知训练以提高跨编解码器鲁棒性。
实验结果: 在ArtifactBench基准(6,183轨道,22个生成器)的未见测试集(n=2,263)上,ArtifactNet达到F1=0.9829,FPR=1.49%,优于CLAM(F1=0.7576)和SpecTTTra(F1=0.7713)。参数效率高,总参数4.0M,比CLAM少49倍,比SpecTTTra少4.8倍。代码感知训练将跨编解码器概率漂移减少83%。
一句话评价: ArtifactNet通过法医残差物理学,提供了一个轻量级、高效且泛化能力强的AI音乐检测范式。
现有全模态系统主要局限于被动感知-响应范式,缺乏可扩展的代理行为、实时交互、自主工具利用和跨模态推理能力,这些是实际部署的关键障碍。
Qwen3.5-Omni引入多项关键技术升级: - 采用混合注意力MoE(Mixture-of-Experts)架构,在Thinker和Talker中实现高效推理。 - 支持256k上下文长度,可处理长达10小时音频和400秒720P视频(以1 FPS)。 - 引入ARIA(Adaptive Rate Interleave Alignment)技术,动态对齐文本和语音单元,显著改善流式语音合成的稳定性和自然度。 - 扩展多语言支持至113种语言用于语音识别和36种用于语音合成。 - 新增能力:可控音频-视觉字幕(生成结构化描述和自动场景分割)、实时交互(包括语音中断识别和零样本语音克隆)、原生全模态代理行为(如自主WebSearch和音频-视觉Vibe编码)。
Qwen3.5-Omni-Plus在215个音频和音频-视觉理解、推理和交互子任务中达到SOTA(State-of-the-Art),在关键音频任务中超越Gemini-3.1 Pro,整体音频-视觉理解与之匹配。模型在文本和视觉模态上保持SOTA性能,无退化。
Qwen3.5-Omni通过创新架构和大规模多模态训练,实现了高效的全模态理解和生成,在音频-视觉交互和实时应用中表现卓越,推动了AI向更自然、代理式的多模态系统发展。
自动节拍检测工具(如MUsanim)在处理复调室内音乐录音(特别是历史录音,如1930-2012年的贝多芬钢琴和大提琴奏鸣曲录音)时系统性地失败。失败原因包括乐器谱重叠(如大提琴和钢琴)、音频质量差、以及表达性时间现象(如rubato、fermatas)的干扰,导致无法准确提取节拍数据或产生不可靠结果。
提出一个手动、条理化的节拍测量协议,使用累计时间戳架构设计。关键创新包括: - 累计时间测量:从乐章开始记录累计耗时,而非单独小节持续时间。 - 误差隔离:单个小节的计时错误不影响后续小节。 - 内部自验证:所有小节持续时间之和需独立验证为总乐章时长。 - 表达性保真度:捕捉实际表演中的时间现象,如rubato和fermatas。 - 跨学科开发:与VLSI设计工程师合作,强调精度和误差建模。
协议应用于超过一百个贝多芬钢琴和大提琴奏鸣曲乐章录音,生成数据集并可视化通过tempographs、直方图、脊线图等图表。数据集和分析代码公开可用,展示了手动方法能可靠提取小节级节拍数据(以毫秒分辨率),并有效处理表达性时间变化。
手动标注不是方法论的退步,而是对计算工具在复调历史录音特定挑战下内在限制的原则性响应。
在高风险金融预测中,声学特征可能因媒体训练的语音调节而变成噪音,而不是信号,导致多模态融合性能显著下降,特别是在野外电话会议环境中,训练有素的演讲者可能引入矛盾的声学伪装。
本研究采用两流延迟融合架构,对比声学流(提取音调方差、抖动方差等临床声学特征)和文本流(使用FinBERT计算脚本与非脚本部分的Sentiment Delta)。通过L1正则化进行特征选择,并提出'声学伪装'概念来解释性能退化,挑战了多模态融合的普遍假设。
孤立文本流对尾部风险事件的召回率为66.25%,孤立声学流为50.83%,而延迟融合元学习器降至47.08%,表明声学特征融合反而降低了性能,支持声学伪装假说。
本文揭示了在高风险金融环境中声学特征的局限性,为计算副语言学应用提供了重要边界条件,并强调了纯NLP方法在成本敏感风险预测中的优越性。
生成模型在语音增强中常产生语言和声学幻觉,导致输出不真实的语音内容或说话者特性,限制了实用性和可靠性。现有方法优先考虑感知质量但低估幻觉效应,如在URGENT 2025挑战中,纯生成模型虽获高分但幻觉严重。
提出UniPASE,一个统一生成框架,扩展低幻觉的PASE框架以适应通用语音增强(USE)。创新点包括: - 核心模块DeWavLM-Omni:通过知识蒸馏从WavLM微调,在语音表示域执行增强,处理多种失真(如噪声、混响、编码失真等)。 - 显式声学增强阶段:使用Adapter生成增强的声学表示,保留丰富细节,提高说话者保真度。 - 多采样率支持:通过PostNet模块将16 kHz波形上采样到48 kHz,再下采样到原始率,实现灵活输入输出处理。
在多个评估数据集上(覆盖子任务和全任务),UniPASE达到优异或竞争性能,相比现有SOTA模型。在URGENT 2026挑战赛中获第一名,展示强鲁棒性和泛化能力,源代码和演示已公开。
UniPASE是一个创新的生成模型,有效克服幻觉问题,实现高保真度的通用语音增强,推动了纯生成方法在实用场景中的应用。
现有语音语言模型(SLMs)的基准测试存在局限性:主要关注基本音频理解、孤立研究个别风险,或将固有有害内容与因声学上下文(如说话者身份、副语言线索、环境声音)而变得有问题的内容混为一谈。这导致难以评估SLMs在社会对齐方面的表现,尤其是在多用户、共享环境中部署时,模型需要根据音频上下文调整响应以确保安全、公平和隐私。
论文提出了VoxSafeBench,这是首个联合评估SLMs社会对齐的基准,涵盖安全、公平和隐私三个维度。采用Two-Tier设计:Tier 1评估内容中心风险(转录本本身有害),Tier 2评估音频条件风险(转录本良性,但正确响应取决于说话者、副语言线索或环境)。基准包括22个任务,支持双语(英语/中文)覆盖,并采用判别式和生成式评估格式。创新点在于通过结构化的任务分离内容与上下文风险,并通过中间感知探针验证Tier 2的有效性。
大规模评估显示,当前SLMs存在显著的语音基础差距:在文本上看似稳健的安全措施在音频条件下退化。具体地,Tier 1中,多轮越狱攻击进一步侵蚀安全性;Tier 2中,模型常能感知音频线索但未能适当行动,导致安全意识下降、公平性因人口统计差异通过声音传达而退化、隐私保护在声学上下文提示下失效。这表明SLMs过度依赖词汇内容,未能一致地将行为基于副语言和环境信号。
VoxSafeBench为评估语音语言模型的社会对齐提供了全面基准,揭示了语音基础是可信SLMs的关键瓶颈,填补了现有研究空白。
语音基础抑郁检测模型在评估时存在说话者泄漏问题,即训练和测试集中有相同说话者,导致性能高估(如准确率超90%),但泛化到未见说话者时性能急剧下降至接近随机水平,表明模型可能依赖说话者身份线索而非抑郁相关的声学生物标志物,限制了临床实用性。
本研究系统揭示了当前语音抑郁检测系统中身份泄漏的严重问题,强调了严格说话者独立评估协议的必要性,以推动更鲁棒和临床可泛化的模型发展。
多模态对话情感识别(MERC)面临三个主要挑战:跨模态输入中的冗余或重叠情感信息、情感信号在时间和语义上对齐不完美、高阶说话人交互建模不足(仅依赖成对建模可能不够)。
提出一个框架,集成双空间特征解耦和双分支图学习。首先,使用共享编码器和模态特定编码器分离模态不变和模态特定表示,通过重构损失、循环一致性损失、边界损失和正交性损失优化解耦。其次,构建双分支:在模态不变分支中,使用傅里叶图神经网络(Fourier GNN)捕捉全局一致性和互补模式,并引入频域对比学习增强区分性;在模态特定分支中,构建说话人感知超图神经网络(Hypergraph NN)建模高阶交互,并加入说话人一致性约束保持语义连贯。最后,双分支表示融合用于情感分类。
在 IEMOCAP 和 MELD 数据集上进行实验,该方法在准确性和鲁棒性上优于现有最先进方法,验证了其有效性。
该框架通过创新性地解耦特征和双分支图学习,有效解决了多模态对话情感识别中的关键挑战,提升了性能。
大型自监督语音(SSL)模型在资源受限环境中的部署困难,因其模型大小限制。阿拉伯语语音建模具有挑战性:方言多样性大、多语言影响(如英语和法语),通用多语言模型可能无法充分捕捉阿拉伯语特定模式。训练和部署语言聚焦的SSL模型成本高,需要大规模计算和长时间训练。
提出HArnESS模型家族,一个阿拉伯语中心的SSL模型,从零开始训练。使用迭代自蒸馏方法:从大型双语阿拉伯语-英语教师模型(HArnESS-L)蒸馏到轻量级学生变体(HArnESS-S浅层和HArnESS-ST浅层薄层)。结合双语预训练以增加多样性和正则化。研究PCA-based压缩教师监督信号,简化蒸馏目标空间,匹配学生模型容量。基于HuBERT风格的掩码预测预训练,采用迭代自蒸馏管道。
评估在自动语音识别(ASR)、方言识别(DID)和语音情感识别(SER)下游任务上。与HuBERT-Large和XLS-R相比,HArnESS在阿拉伯语任务上表现一致更好,压缩模型在结构大幅减少下仍保持竞争力。模型公开发布以支持未来研究。
HArnESS提供了一个实用的阿拉伯语中心自监督语音基础模型,通过蒸馏有效平衡性能与效率,适合实际语音应用。
该研究提出了一种实用的、无需人工注释的方法,通过多模型分歧优先化医疗转录中的不确定区域审查,提高效率和安全潜力,但需进一步临床验证。
该论文旨在解决开放集说话人识别中的关键挑战:在有限 enrollment 数据下,提高基础模型的利用效率,增强对未见说话人的鲁棒性,并减少 few-shot 调优过程中的随机性,以提升泛化能力。
在 VoxCeleb、3D-Speaker 和 ESD 等数据集上进行评估: - 在 Vox1-O–like 测试集上,将等错误率 (EER) 从 1.28% 降低至 0.09%,相对减少约 93%。 - 在其他数据集上,EER 和 minDCF 指标均有显著改善,OSCR 和 ACC 也得到提升,证明了方法的有效性和泛化能力。
SpeakerRPL v2 通过集成多种学习目标和模型融合策略,显著提高了开放集说话人识别的鲁棒性和性能,是该领域的一个重要进展。
GatherMOS展示了LLMs作为元评估器在语音质量评估中的潜力,通过集成多源信息实现了低依赖标注数据的可扩展评估,为未来研究提供了实用策略。
深度学习技术生成了高度逼真的合成语音,导致欺诈、冒充和虚假信息等安全威胁。当前深度伪造音频检测方法主要依赖深度神经网络,虽然性能强,但计算资源需求高且缺乏可解释性,难以揭示判别声学线索。
本文采用经典机器学习方法,建立可解释的基线。关键创新包括:提取韵律(如音高变异性)、音质(如抖动和颤动)和频谱(如频谱质心和带宽)特征;使用ANOVA进行特征选择;训练多种分类器(逻辑回归、LDA、QDA、高斯朴素贝叶斯、SVM、GMM);并在高保真(44.1 kHz)和电话质量(16 kHz)音频条件下评估。
在Fake-or-Real数据集上,RBF SVM模型表现最佳:测试准确率约93%,EER约7%(44.1 kHz和16 kHz条件均如此)。线性模型(如逻辑回归、线性SVM)准确率约75%。特征分析表明,音高变异性(如f0_std_v)和频谱丰富度(如频谱质心、带宽)是关键判别线索。统计分析确认了模型性能的显著差异。
该论文提供了一个强大、可解释的基线,有助于未来深度伪造音频检测器的开发和声学线索理解。
当前语音深度伪造检测(SDD)系统在标准基准数据集(如ASVspoof)上表现良好,但在面对表达性和情感性欺骗攻击时泛化能力不足。这些系统往往过度依赖欺骗数据集中特定的伪影,而非学习自然语音的可转移线索,如韵律变化,导致在分布偏移下性能下降。人类则通过内化真实语音的韵律和说话人模式来检测合成语音的偏差。
论文提出ProSDD,一个两阶段框架:第一阶段(仅使用真实语音)通过监督掩码预测学习说话人条件下的韵律表示,基于音高、语音活动和能量提取的结构化嵌入;第二阶段(使用真实和欺骗语音)联合优化欺骗分类和韵律学习,通过辅助损失保留韵律建模。该框架使用轻量级分类头,避免复杂架构依赖,强调通过韵律表示增强模型鲁棒性。
ProSDD在多个数据集上显著提升性能:在ASVspoof 2024上,等错误率(EER)从25.43%降低到16.14%(基于2019训练)和从39.62%降低到7.38%(基于2024训练);在EmoFake和EmoSpoof-TTS上实现约50%的相对性能提升。结果表明,该方法在标准基准和情感性攻击下均具有优越泛化能力。
ProSDD通过结合韵律表示和两阶段训练,有效增强了语音深度伪造检测对表达性和情感性攻击的鲁棒性,同时保持标准基准上的竞争力,为领域提供了新的泛化策略。
全双工语音语言模型(如 Moshi)在实现高交互性的同时,面临事实性不足的挑战。扩大模型规模可以提高事实性,但会显著增加推理成本,破坏实时交互性。
论文提出 MoshiRAG,一种模块化框架,将紧凑的全双工前端与异步知识检索后端结合。关键创新在于利用语音响应中关键词延迟的自然时间差,在响应生成过程中异步触发检索,从而在不中断对话流的情况下整合外部知识。系统设计确保检索延迟不超过2秒,并支持即插即用的检索方法,无需重新训练模型。
MoshiRAG 在问答基准测试中显著提高了事实性,达到与非双工语音模型相当的水平,同时保持了全双工系统的交互性。此外,模型在域外数学推理任务上表现良好,展示了其泛化能力和工具使用潜力。
该研究通过创新的异步检索机制,有效解决了全双工语音模型在事实性和交互性之间的权衡问题,为构建更可靠和用户友好的语音AI助手提供了新方向。
传统物理建模方法(如有限差分方案)在计算声学波传播时计算成本高,难以实现实时应用,导致声音合成领域依赖大量录音而非物理方程,效率低下且资源密集。
数字波导(DWG)模型通过优化一维波传播介质(如弦、管)的计算,提供高效物理模拟,扩展至多维波导网格,并集成现代机器学习(如进化算法和神经网络)及可微分数字信号处理技术进行参数优化,提升模型准确性和计算效率。
数字波导已成功应用于实时乐器建模(如Yamaha VL1合成器)、声效、人工混响和人声合成,通过开源代码和Web Audio API实现浏览器内实时音频合成,验证了其高效性和实用性。
数字波导是声音合成中连接物理准确性与计算效率的关键技术,结合传统方法与现代优化,推动了音频处理领域的创新。
当前大型音频语言模型(LALMs)在音频推理方面能力有限且不稳定,主要由于高质量音频推理数据集的稀缺。现有数据集如AudioSet、AudioCaps等仅提供简短标签,不足以支持深度推理,且依赖闭源模型导致成本高和可复现性差。
论文提出Audio-Cogito,一个全开源解决方案,用于增强LALMs的深度音频推理能力。关键创新包括: - Cogito-Pipe:一个四阶段管道(数据收集、QA构建、CoT生成、质量验证),自动构建高质量音频推理数据集,产生545k个多样样本,覆盖声音、语音和音乐领域。 - 自蒸馏策略:使用相同模型架构(基于Qwen3-Omni-Thinking)进行推理数据生成和微调,确保推理模式一致性和逻辑连贯性。 - 通过自由形式的CoT生成和双阶段质量验证,提升数据可靠性和模型性能。
该研究通过系统化的开源数据构建和自蒸馏方法,显著提升了音频推理的深度和可靠性,为音频AI社区提供了重要贡献。
零样本语音转换(VC)在交互式场景中面临挑战,因为需要同时实现高保真说话人转换和低延迟流式推断,这在现有系统中难以兼顾。
提出 X-VC,一个在预训练神经编解码器潜在空间中进行一步转换的零样本流式 VC 系统。它采用双重条件声学转换器,结合源编解码器潜在和来自目标参考语音的帧级声学条件,并通过自适应归一化注入话语级说话人信息。训练时使用生成的对数据和角色分配策略(包括标准、重建和反转模式),以减少训练与推断之间的不匹配。流式推断采用分块方案与重叠平滑,与编解码器的分段训练范式对齐。
在 Seed-TTS-Eval 数据集上,X-VC 在英语和中文中实现了最佳流式词错误率(WER),在相同语言和跨语言设置中表现出强说话人相似度,并且离线实时因子显著低于基线方法,表明其在高质量、低延迟转换方面的有效性。
X-VC 通过编解码器空间的一步转换,为构建高效、实用的零样本流式语音转换系统提供了一个创新且可行的解决方案。
在无人机搜索救援任务中,现有方法面临挑战:视觉传感系统负载重且易受视线阻挡(如森林树冠或浓雾),热红外成像在夜间工作但可靠性低(如在高温背景或遮挡物下)。声学传感虽可靠轻量,但传统麦克风阵列方法计算开销大、能效低,盲搜索阶段(占任务时间超90%)浪费能源,而低功率睡眠架构可能导致高误检率。
提出Sky-Ear系统,基于圆形麦克风阵列设计两阶段音频处理: - Sentinel阶段:使用单通道MAE(Masking Autoencoder)进行异常检测,将音频转换为Mel-spectrogram分析频率-时间特征,通过重构背景噪声检测受害者声音(如尖叫或呼喊)。 - Responder阶段:触发多通道定位,基于TDoA估计方向,采用环缓冲机制跟踪音频流。 - 连续定位:通过多观测优化检测方向,提高精度,定理1和2提供数学基础。 系统优化能效,只在异常检测时激活高功耗处理。
进行广泛模拟实验验证性能: - 使用综合音频数据集(环境背景噪声、无人机螺旋桨噪声、受害者声音)微调MAE模型,适应不同SAR场景。 - 评估受害者检测准确性和定位误差,验证连续定位通过多观测提升精度。
Sky-Ear系统通过能效优化和精确声学检测,为无人机搜索救援任务提供了创新且可靠的解决方案。
传统房间补偿方法主要关注改善扬声器再现的频谱(音色)和时间准确性,但忽略了空间准确性,尤其是在混响环境中的距离感知。这由直接-混响比(DRR)决定,而传统方法无法有效控制 DRR,导致空间图像不准确。此外,传统补偿滤波器设计复杂,可能引入伪影(如预回声),且在空间位置间鲁棒性差,仅适用于低频范围。
论文提出了一种新方法,通过添加一个延迟的次级辅助源来修改感知混响声场,从而补偿频谱和空间不准确性。具体而言,辅助源在频率选择性的方式下向混响声场添加能量,以调整 DRR 作为频率的函数。通过适当延迟辅助源(激活优先效应),确保听众只感知主要扬声器作为声源,而不察觉辅助源的存在。这种方法允许同时控制频谱和空间属性,超越传统单滤波器方法。
方法进行了感知评估,结果表明: - 能够有效改变主要扬声器的感知(包括空间和音质),而不让听众感知到辅助源。 - 与一个成熟的商业房间补偿算法相比,性能相当。 - 具有多个优势,如改善空间鲁棒性、减少伪影风险,并能在更广泛的频率范围内工作。
该研究创新性地结合了辅助源和优先效应,为房间补偿中的空间准确性提供了新思路,有望提升沉浸式音频播放体验。
传统流式语音合成系统面临两个主要瓶颈:1. 高延迟:依赖计算密集型神经声码器(如HiFi-GAN)进行相位重建,导致流式推理延迟显著增加;2. 音频质量下降:连续回归声学建模(如基于Mel频谱图)易导致频谱过度平滑,损失高频细节和音质自然度,影响实时交互应用。
论文提出了一种新颖的端到端非自回归架构,主要创新点包括: - 块生成策略:优化用于超低延迟的块处理,实现流式文本到波形生成。 - 深度顺序解码:集成修改后的FastSpeech 2骨干网络,采用渐进式深度顺序解码策略,直接建模Mimi神经音频编码器的高度压缩离散潜在空间(包含32层残差矢量量化代码)。该方法动态条件化高层量化器,解决语音对齐退化问题,无需引入时间自回归开销。 - 语言独立设计:架构无需语言特定修改,在英语和马来语单说话人数据集上验证其鲁棒性。
该架构通过离散声学建模和深度解码策略,成功平衡延迟与音质,是流式语音合成领域的高效解决方案。
这是一个创新且实用的方法,通过利用常见词提示和偏置词位置预测,有效提升了SLLM在ASR中对偏置词的识别能力,同时保持了模型简单性和用户友好性。
现实世界中的语音音频常经过后期效果处理(如降噪、压缩、均衡等),以提高可懂度和广播质量。然而,现有语音数据集通常缺乏精确的效果和参数注释,这使得音频效果识别(AEI)任务的系统研究受限,尤其是在处理分布退化和域偏移时,阻碍了生产感知内容理解、音频工程辅助等应用。
VoxEffects 填补了语音音频效果识别领域的空白,提供了一个标准化、可扩展的数据集和基准,有望推动音频工程、内容理解和法医学应用的研究。
在真实世界中,语音信号常被噪声和混响降质,严重影响语音质量和可懂度。对于耳蜗植入(CI)用户,由于时间-频率解码能力有限,这种降质更为严重,导致语音理解能力显著下降。现有语音增强(SE)方法,如基于Transformer或生成式模型,泛化能力差,可能引入失真,且大多数针对正常听力者设计,缺乏对CI用户的特定需求适应。
本文提出TokenSE,一个基于Mamba的离散令牌语音增强框架,专为CI用户设计。框架在神经音频编解码器(NAC)空间中操作,使用Mamba-based模型从降质语音中预测干净编解码器令牌。Mamba的线性复杂度优于Transformer的二次复杂度,适合计算资源有限的CI应用。创新点包括同时处理噪声和混响(而非单独处理)、微调NAC编码器以适应降质条件、并引入Mamba变体(如单向、双向和Transformer-MHSA混合模型)以优化性能。
客观评估显示TokenSE在域内和域外数据集上 consistently outperforms baseline methods,包括基于Transformer、GAN和其他SE方法。主观听力实验表明,CI用户在不利噪声和混响环境下的语音可懂度有明显改善,验证了框架的有效性。
TokenSE是首个针对CI用户的离散令牌语音增强框架,创新地结合Mamba的效率和离散令牌表示,显著提升语音可懂度,为听力辅助技术提供了有前景的解决方案。
现有音频标记化器在融合多模态信息(特别是视频)时,重建音频质量显著下降,这限制了音频语言模型在理解任务中的有效性,尤其是在音频信号模糊或不完整的场景下。
提出了Timing-Aware Pre-Quantization Fusion (TAPF)方法,基于三个关键发现:1. 融合在标记化架构中的位置对保持重建质量至关重要;2. 对比学习虽在连续表示融合中有效,但不适用于离散标记化;3. 时间轴融合(基于特征独特性原理)优于特征维度融合。TAPF通过时间感知方式在预量化阶段整合视觉信息,解决重建质量下降问题。
在标准基准测试中,TAPF不仅维持了高保真音频重建,还在下游理解任务中优于单模态音频标记器和现有多模态融合基线,实现了理解和生成能力的平衡。
该工作为多模态音频标记化提供了一个有效且创新的解决方案,成功解决了重建质量与跨模态理解之间的权衡问题。
生成式 AI 技术的快速发展使得深度伪造音频与真实语音难以区分,对数字通信的完整性构成威胁。传统被动检测方法(如机器学习分类器)存在反应性、泛化能力有限、易受对抗攻击等缺陷,且无法处理音频真实性中的模糊场景(如 AI 降噪)。现有音频水印方法过度强调鲁棒性,导致水印在恶意语义篡改(如语音转换)后仍能幸存,无法有效指示语义完整性失效。
StreamMark 是首个基于深度学习的半脆弱音频水印框架,专为主动深度伪造检测设计。其创新点包括:引入半脆弱性概念,使水印对良性转换(如噪声、压缩、风格迁移)鲁棒,而对恶意转换(如文本到语音、语音转换、语音编辑)脆弱;采用编码器-失真-解码器架构,在 STFT 复杂域中嵌入水印以提升不可感知性;通过独特训练目标,使用双路径失真层(包含良性转换集和恶意转换集)明确区分两类转换,优化半脆弱行为。
在综合基准测试中,StreamMark 展现出高不可感知性(SNR 24.16 dB, PESQ 4.20),对现实失真如 Opus 编码保持鲁棒。对良性 AI 风格转换,消息恢复准确率 >98%;而对深度伪造攻击,消息恢复准确率降至机会水平(约 -50%),验证了其半脆弱性。这些结果证明了 StreamMark 在实时企业耳机场景中的实用性和有效性。
StreamMark 开创性地将半脆弱水印概念应用于音频领域,为主动检测深度伪造提供了可靠且高效的解决方案,弥补了传统方法的不足。
现有音频语言模型(ALMs)的情感智能(EI)评估基准存在多个局限性:大多依赖合成语音,缺乏真实声学细微差别;限于单轮交互,无法评估多轮情感轨迹跟踪;依赖开放式评分,引入主观偏差;忽略跨模态冲突,如声学-语义不一致,导致评估不全面。
本文提出HumDial-EIBench,一个基于真实人类录音的多轮对话基准。创新点包括:将情感跟踪和因果推理任务重新表述为客观多选题,使用对抗性干扰项以减少评分主观性;引入声学-语义冲突任务,评估模型在文本与声学矛盾时的鲁棒性;覆盖情感轨迹检测、隐式因果推理、同情心响应生成和跨模态冲突识别,提供更全面的EI评估框架。
评估了八个主流ALMs(如Moshi、Qwen系列、GPT-4o等)。结果表明:多数模型在多轮情感跟踪和隐式因果推理上表现困难,显示出对上下文理解的不足;所有模型在同情心响应生成中表现出文本和声学同情心的解耦;在跨模态冲突任务中,存在严重的文本主导偏差,揭示模型在处理矛盾信号时的弱点。
HumDial-EIBench通过真实对话数据和客观任务设计,有效弥补了现有EI评估基准的不足,为ALMs的情感智能提供了更可靠、全面的评估工具。
传统自动语音识别(ASR)系统仅能转录语音内容,无法识别说话人身份,限制了在会议转录、对话分析等实际应用中的效果。现有方法通常采用多阶段管道,如先进行说话人分离(speaker diarization)再执行ASR,容易导致错误传播并增加系统复杂性。此外,现代端到端ASR架构往往缺少精确的词级时间戳,阻碍了联合任务优化。
该论文通过创新的说话人聚类标签和数据增强,有效利用了语音感知LLMs的优势,实现了高效的说话人属性ASR,为统一对话理解提供了新方向。
语音识别系统在未包含于训练数据的目标域(域外数据)上表现不佳,导致高词错误率。无监督域适应方法虽能通过教师-学生训练和集成学习减少错误,但仍远逊于监督域内训练,亟需更高效的策略以缩小性能差距。
提出一种同时更新教师模型集成和单一学生模型的方法(STU),消除传统顺序训练的需求。该方法在每轮迭代中,基于无标签目标数据生成伪标签来训练学生模型,并通过指数移动平均同步更新所有教师模型的权重,从而渐进增强教师生成标签的质量。这避免了多阶段训练中的信息丢失,提高了训练效率和适应性。
实验使用三个有标签源数据集(AMI、WSJ、LS360)和一个无标签目标域(SwitchBoard)。在Switchboard eval00测试集上,所提方法使词错误率绝对提升4.6%,显著优于基线方法:单教师-学生训练(STS)、KAIZEN(单教师同时更新)、集成教师-学生(ETS)和多阶段集成教师-学生(METS)。最优参数为α=1e-5、Δ=40、τ=0.90。
该方法通过联合更新教师和学生模型,以简单有效的方式提升了无监督域适应性能,为语音识别跨域应用提供新思路。
该方法通过神经协方差估计实现了高效的方向保持MIMO语音增强,平衡了性能、计算效率和实用性,为多通道音频处理提供了创新解决方案。
传统主动噪声控制(ANC)系统主要基于FxLMS算法,依赖线性假设,在处理宽带非平稳噪声或非线性声学路径时受限。此外,传统方法会同时消除所有信号,可能意外损害语音信号,影响正常通信。
本文提出一种语音保留的深度学习ANC系统,使用卷积循环网络(CRN)作为核心架构,结合长短期记忆(LSTM)网络和复杂频谱映射(CSM)技术,以解决非线性失真问题。设计了特殊语音保留损失函数,引导模型选择性保留目标语音,同时抑制环境噪声。通过图像源方法(ISM)构建高保真声学模拟环境,模拟真实混响效果。
实验表明,提出的Deep ANC系统在噪声降低方面显著优于传统FxLMS算法,特别是对于非平稳噪声(如人群嘈杂声)。基于PESQ和STOI的评估确认系统有效保留了目标语音的自然性和可理解性。
这是一项创新工作,成功将深度学习应用于混响环境中的ANC,实现了噪声降低与语音保留的平衡,具有实际应用潜力。
开放大型音频-语言模型(LALMs)的进展相较于视觉-语言模型较慢,且现有模型过度依赖学术基准,导致在长音频、噪声和多样现实世界音频上泛化能力差,限制了音频在通用多模态系统中的应用。
Audio Flamingo Next(AF-Next)引入以下关键创新:1) 更强的基线音频-语言模型,显著提升跨任务准确率;2) 可扩展的大规模音频理解数据构建策略,构建了超过1百万小时的训练数据,包括AudioSkills-XL、LongAudio-XL等数据集;3) 支持长达30分钟的复杂音频输入,通过延长上下文长度;4) Temporal Audio Chain-of-Thought,一种新的推理范式,将中间推理步骤显式与音频时间戳对齐,增强时间对齐和解释性;5) 基于课程的训练策略,涵盖预训练、中训练和后训练阶段,使用GRPO强化学习。
AF-Next在20多个音频理解和推理基准测试中表现出色,优于类似大小的开放模型,并与更大的开放权重和闭源模型竞争甚至超越,特别是在长音频和现实世界音频任务上显示出强鲁棒性和泛化能力。模型开源了三个变体:AF-Next-Instruct、AF-Next-Think和AF-Next-Captioner,分别用于问答、高级推理和详细描述。
AF-Next是一个前沿的开放音频-语言模型,通过创新数据扩展、推理范式和训练方法,显著推进了音频理解和推理,为开放研究提供了透明和可复现的资源。
论文指出,在音乐-味道交叉模态研究中,收集大型对齐数据集困难,因为感知实验成本高且规模小,导致深度学习和大规模分析受限。多模态管道存在特征空间不一致、跨来源归一化弱和可重复性有限的问题。
研究提出了两个互补实验来应对这些挑战: 1. 转移分析:测试音频-味道相关性、特征重要性排名和潜在因子结构从实验音轨集合(257个带人类注释的轨道)转移到FMA衍生语料库(约49,300个带合成标签的片段)。 2. 感知验证:通过在线听众研究(49名参与者,20个轨道)验证从食物化学衍生的计算味道目标与人类感知的对齐。方法包括归一化协议、转移诊断和结构化统计测试(如排列测试、Mantel测试、Procrustes分析)。
该论文通过创新的归一化和验证方法,为音乐-味道交叉模态研究提供了可扩展和可重复的数据集解决方案,促进了多模态AI的稳健发展。
在端到端全双工语音语言模型中,使用标准强化学习(如GRPO)优化交互时间动态时,会引发语义质量下降,表现为严重的生成崩溃和重复问题。这是由于模型同时优化时间控制和语义生成,导致奖励黑客行为,牺牲了语义连贯性。
提出ASPIRin框架,通过动作空间投影将细粒度文本词汇映射到粗粒度的二进制状态(主动语音 vs. 非主动沉默),解耦了“何时说话”和“说什么”。该方法使用基于规则的奖励来平衡用户中断风险和响应延迟,并优化投影状态政策,从而独立学习交互时间而不影响语言建模能力。
在Full-Duplex-Bench上的评估显示,ASPIRin在暂停处理、回音、平稳转接和用户中断等场景中优于基线方法(如Moshi、Standard SFT和Standard GRPO)。具体地,它减少了n-gram重复超过50%,保持了语义连贯性,并在交互时间指标上表现优异,如降低接管率和延迟。
ASPIRin有效解决了全双工语音语言模型中交互时间与语义连贯性的权衡问题,为自然对话系统提供了一种创新且实用的优化框架。
论文指出,在同时语音翻译(SimulST)中,现有的REINA(Regularized Entropy Information Adaptation)方法虽然基于信息增益训练READ/WRITE策略,但缺乏时间意识。这导致策略偏向于读取大部分音频后才开始写入,出现“read loops”现象,即系统持续预测READ而不输出,从而增加延迟并降低流效率。
为解决这一问题,论文提出了两种改进方法: 1. REINA-SAN(Supervised Alignment Network):利用大型语言模型(LLM)生成的单调对齐作为监督信号,通过软标签损失引导政策学习,增强时间意识。 2. REINA-TAN(Timestep Augmented Network):向政策网络添加音频持续时间编码(基于正弦嵌入),提供显式的时间表示,帮助政策感知音频消耗时长,从而更稳健地决策READ/WRITE。
实验基于Whisper Large V3模型,在多个基准测试(如FLEURS、EuroparlST)和语言方向(如德语、法语、西班牙语到英语)上进行评估。结果如下: - 两种方法均显著优于基线REINA,解决了稳定性问题。 - REINA-TAN在流效率方面略优,提供更好的延迟-质量Pareto前沿;REINA-SAN对“read loops”更稳健。 - Normalized Streaming Efficiency(NoSE)得分提升最多7.1%,在Whisper模型上达到state-of-the-art性能。
该方法通过增强时间意识,有效提升了同时语音翻译的流效率和稳健性,为自适应策略在大型基础模型上的应用提供了实用改进。
Remote asynchronous learning environments, such as distance universities, lack sufficient emotional cues compared to face-to-face classrooms, making it challenging to create a pleasant learning experience and address learners' emotional states effectively.
The paper proposes using speech-based self-control tasks to collect spontaneous monologue speech from students. It investigates whether this speech shows perceptible variations in valence, arousal, and dominance (VAD) dimensions. The approach involves developing a dataset from open-ended responses, conducting subjective listener evaluations for emotion labeling, and performing automatic dimensional emotion prediction studies.
The investigations indicate that speech acquired through self-control tasks can effectively sense student emotions in remote learning environments. Subjective evaluations and automatic prediction studies support this feasibility, suggesting opportunities to integrate paralinguistic speech processing technologies into remote learning for enhanced instructional design and feedback.
This work offers an innovative speech-based method for emotion sensing in remote education, with promising potential to improve learning experiences through automated emotional analysis.
这项研究通过利用法国视听广播的多样音频内容,推动了统一音频表示学习的发展,并为数据选择和去重在SSL中的重要性提供了实证见解。
该方法创新地利用离散令牌和语言模型,实现了高质量的多轨音乐源分离,为生成性音频处理开辟了新途径。
全双工对话音频(每个说话者单独轨道)对口语对话研究至关重要,但难以大规模收集,因为大多数野外双人对话音频是退化的单声道混合,包含背景噪声、混响和压缩伪影。现有语音分离方法通常基于单声道清洁语音,不适用于自发对话音频中的重叠模式、韵律和互动时机差异。
论文提出DialogueSidon模型,用于从退化的单声道双人对话音频中联合恢复和分离出清洁的全双工轨道。方法结合两个核心组件: - SSL-VAE:基于自监督学习(SSL)模型特征(如w2v-BERT 2.0)的变分自编码器,将高维SSL特征压缩成紧凑潜在空间,适用于扩散建模。 - 扩散基潜在预测器:估计说话者特定的潜在表示从退化混合中,然后通过SSL-VAE解码器重构波形。 模型分两阶段训练:第一阶段训练SSL-VAE构建潜在空间;第二阶段训练潜在预测器,使用低秩适应(LoRA)等技术优化。
在英语、多语言和野外对话数据集上的实验显示,DialogueSidon在可懂度和分离质量上显著优于基线方法(如统一恢复和分离基线),同时实现更快的推理速度。结果强调了模型在内容保存和分离效果方面的改进。
DialogueSidon是一个创新的模型,有效解决了从野外对话音频中恢复高质量全双工轨道的挑战,通过结合SSL-VAE和扩散模型,推动了对话语音研究的数据可用性和系统性能。
LLM-based ASR(基于大语言模型的自动语音识别)的性能和数据效率高度依赖于 speech-language 接口设计。常见方法是使用学习型投影器将语音特征映射到 LLM 嵌入空间,但缺乏对连续(投影器)和离散(音素)接口的系统比较,特别是在高低资源设置下的差异。
这项研究系统性地评估了 LLM-based ASR 中的 speech-language 接口,展示了音素基方法在低资源设置下的优越性,为接口设计提供了新见解。
自然自动配音(Automated Dubbing, AD)面临同步挑战,特别是持续时间同步(isochrony)和嘴唇同步(lip-sync),这对保持观看体验至关重要。现有方法在语言结构不同时难以实现准确的嘴唇同步,且可能影响语义保留。
本文提出 PS-TTS 方法,包括两个主要步骤: 1. Isochrony (ISO):通过神经机器翻译(NMT)对源文本进行翻译,并使用 TTS 持续时间预测器选择与源语音持续时间最匹配的候选文本,实现时间对齐。 2. Phonetic Synchronization (PS):使用动态时间规整(DTW)基于元音距离评估语音相似性,选择发音相似的目标文本。进一步提出 PS-Comet,结合 COMET 语义相似性度量,在保持嘴唇同步的同时更好地保留意义。
在韩语和英语唇读数据集、配音演员数据集上评估。PS-TTS 和 PS-Comet TTS 在客观指标(如嘴唇同步错误置信度 LSE-C、距离 LSE-D 和 UTMOS)上优于没有 PS 的基线 TTS 系统,并在韩英和英韩配音中超过专业配音演员。实验扩展到法语,测试所有语言对,PS-Comet 在所有情况下表现最佳,平衡了嘴唇同步准确性和语义保持。
PS-Comet 通过整合语音和语义相似性,实现了更准确、自然的自动配音,适用于跨语言应用。
Word Error Rate (WER) 作为自动语音识别(ASR)的主流评估指标,无法检测脚本崩溃(script collapse)现象,即模型在错误书写系统中产生流畅输出,而 WER 仍可能显示有限错误率,导致评估误导和实际部署中输出不可读。
提出脚本保真率(Script Fidelity Rate, SFR),定义为假设字符串中目标脚本字符的比例,基于 Unicode 块成员资格计算,无需参考转录(reference-free)。SFR 补充了 WER,能直接量化脚本保真度,并满足有界性、单调性和可组合性等度量属性。
在 FLEURS 测试集上评估六种语言(Pashto、Urdu、Hindi、Bengali、Malayalam、Somali)跨越四种书写系统,覆盖九个 ASR 模型(包括 Whisper 系列、MMS-1B、SeamlessM4T-v2)。在 53 个模型-语言对中,18 个(34%;95% Wilson CI: 23–47%)表现出脚本崩溃(SFR < 10%),主要涉及 Whisper 模型;MMS-1B 和 SeamlessM4T-v2 在所有评估语言上 SFR 高于 99%。识别出三种脚本崩溃模式:拉丁语音替代(较小 Whisper 模型在 Indic 语言)、阿拉伯语替代(用于 Somali 的拉丁书写)、以及德瓦纳加里替代(较大 Whisper 模型将所有 Indic 音频视为 Hindi)。
该研究为多语言 ASR 提供了一个有效的补充评估指标 SFR,系统揭示了脚本崩溃问题,有助于改进模型评估和部署中的脚本保真度。
对话AI中,生成表达性和可控的文本到语音(TTS)仍然具有挑战性。主要问题在于细粒度语音风格和情感的控制,传统上需要大量标注的训练数据,导致数据瓶颈和扩展困难。
论文提出一个可扩展且数据高效的级联框架,结合文本风格令牌和高质量音频提示。音频提示作为上下文学习(ICL),在推理时引导模型的韵律和音色,无需权重更新。此外,引入基于ICL的在线强化学习(RL)策略,使用主观美学奖励(AES-CE)优化自回归韵律模型,同时通过CTC对齐防止幻觉,确保可理解性。
通过全面的人类感知评估,论文展示了显著改进。在自然性方面,ICL模型相比零基线有+7.5%的净胜率(CMOS);在表达性(CV AD维度)方面,相比零基线有+79.6%的改进,相比GPT-4o有+5.6%的改进。这些结果证实了方法的有效性。
该研究通过级联提示和基于ICL的在线RL,为对话TTS提供了高效且可控的解决方案,在自然性和表达性方面均有显著提升。
人类主观评估 Text-to-Speech (TTS) 系统质量(如 Mean Opinion Score (MOS) 和 Side-by-Side (SBS) 比较)虽然被视为金标准,但成本高、速度慢、易受评估者偏差影响,制约了 TTS 系统的快速迭代和大规模应用。自动化评估的需求迫切,以填补传统客观指标与人类感知之间的鸿沟。
本研究提出了一系列神经模型,旨在自动化 TTS 质量评估: - 相对评估 (SBS): 引入 NeuralSBS,基于 HuBERT 编码器,通过反对称双线性层学习音频对之间的偏好概率,确保逻辑一致性(如 P(A > B) = 1 - P(B > A))。同时探索了多模态变体 NeuralSBSBert,通过跨注意力融合 BERT 文本特征。 - 绝对评估 (MOS): 增强 MOSNet,采用序列长度批处理、掩码填充和序列级损失优化;引入 WhisperBert,一种多模态堆叠集成方法,结合 Whisper 音频特征和 BERT 文本嵌入,通过弱学习器和元学习器预测 MOS 分数。此外,尝试了基于 SpeechLM 的架构,但发现性能不佳。 - 数据预处理: 使用数据标准化(Std SOMOS)减少评估者偏差,并应用信号和语音级数据增强。
该研究通过创新神经模型为 TTS 自动化评估提供了高效、与人类判断高度对齐的解决方案,显著降低了评估成本并加速了 TTS 系统开发。
当前语音深度伪造检测领域面临三个主要挑战:实现碎片化,不同模型和工具包分散在多个代码库中,导致集成困难;隐藏配置,训练食谱中存在未公开的设置(如填充策略、学习调度),影响可复现性;编程障碍,现有工具包如 WeDefense 使用混合语言(Python 和 Bash),增加调试和扩展成本。这些问题限制了研究的可复现性、基准测试和跨研究比较。
DeepFense 提出一个统一、模块化和可扩展的框架,专门针对语音深度伪造检测。创新点包括: - 纯 Python/PyTorch 实现:使用 Apache 2.0 许可证,易于访问和修改,降低编程门槛。 - 模块化架构:将系统分解为配置协调器(基于 YAML)、数据工厂(处理数据管道)、DeepFense 引擎(前端、后端、损失组合)、训练器和日志记录组件,实现松耦合设计。 - 配置驱动:通过单个 YAML 文件指定完整实验设置(如数据集、模型架构、训练参数),提高可复现性和易于共享。 - 插件系统:基于注册表的架构,允许用户通过装饰器轻松添加新组件(如前端、后端、损失、增强),无需修改核心代码。 - 大规模支持:集成超过100个食谱和400个预训练模型,覆盖多个数据集(如 ASVspoof、ADD 挑战)和架构,是当前最大规模的工具集合。
DeepFense 通过大规模实验验证了其有效性和可靠性: - 在复制最先进结果时,DeepFense 匹配或优于原始报告。例如,在 ASVspoof 2019 训练的系统上,AASIST 后端平均 EER 从 22.83% 降低到 20.16%,MLP 后端从 20.88% 降低到 19.15%。 - 实验覆盖约100个系统、六个训练集和13个测试集(包括语音和非语音数据集),展示了跨域泛化能力。 - 关键发现:训练数据选择对跨域泛化有积极影响,但前端特征提取器(如 Wav2Vec 2.0)主导性能方差;同时,揭示了高绩效模型在音频质量、说话者性别和语言方面的严重偏见。
DeepFense 是一个全面且实用的开源工具包,通过标准化、模块化和配置驱动设计,显著提升了语音深度伪造检测研究的可复现性、实验效率和公平性评估,有望加速该领域的创新和部署。
现有语音分离系统通常依赖全合成混合物训练,限制了在现实嘈杂场景中的泛化能力。当使用域内(即自然嘈杂)语音训练时,由于背景噪声与语音的不可分离性以及标准损失函数(如SI-SDR)的对称性,系统倾向于保留噪声在估计中,导致不理想的优化结果,表现为输出中包含混合噪声。
论文提出了一种无监督去噪方法,结合两个关键创新: 1. 环形混合(Ring Mixing):一种批次构造策略,确保每个源语音信号在两个不同的混合物中使用,通过公式 (x_k = s_k + s_{k+1})(带环绕)生成批次。 2. 信号一致性误差比(SCER)辅助损失:一种新的损失函数,惩罚来自不同混合物的同一源估计之间的不一致性。SCER损失定义为 (\ell_{\text{SCER}}(\hat{s}{k;x{k-1}}, \hat{s}{k;x{k}}; s_k) = -10 \log \frac{\|s_k\|^2}{\|\hat{s}{k;x{k-1}} - \hat{s}{k;x{k}}\|^2}),与标准SI-SDR损失结合使用,打破对称性并激励去噪。
在基于WHAM!的基准测试中,该方法能够将残留噪声减少一半以上,仅从嘈杂录音中有效学习去噪。实验还展示了使用VoxCeleb中的自然嘈杂语音训练系统,提高了泛化能力,在无监督设置下达到与全监督系统相当的去噪性能。
该方法通过创新的批次策略和损失函数,成功解决了语音分离中无监督去噪的关键挑战,为利用真实世界数据训练更具泛化性的系统提供了有效途径。
论文指出,在多说话者环境中,设备寻址语音检测是一个关键挑战,现有方法如语音活动检测(VAD)和唤醒词检测不足,因为它们无法处理交互历史或引起对话中断,导致在模糊话语中检测精度低。
论文提出Sequential Device-Addressed Routing(SDAR)框架,将问题形式化为基于因果交互历史的顺序决策问题,并实现Selective Attention System(SAS)系统。SAS采用三阶段设备端架构:声学几何前端抑制干扰、轻量级话语级分类器提取证据、会话感知时间上下文阶段集成历史信息,以在边缘硬件上实现低延迟路由。
在60小时多说话者英语测试集上,SAS在音频配置下达到F1=0.86(精度0.89,召回0.83),音频+视频融合配置下F1=0.95(精度0.97,召回0.93)。移除因果交互历史(Stage 3)导致最大性能下降(F1从0.95降至0.57±0.03),表明时间上下文在决策中至关重要。系统在ARM Cortex-A硬件上运行,延迟<150ms,占用空间<20MB。
这篇论文通过SDAR框架和SAS实现,创新地将时间上下文集成到设备端语音检测中,显著提升了在多说话者环境下的检测精度和实用性。
Speech LLMs(大语言模型在语音应用)的训练依赖于大规模音频-文本对,导致成本高昂。现有文本对齐方法如TASU通过模拟CTC后验从文本中训练,但缺乏对不确定性和错误率的控制,使得课程设计依赖经验,限制了在低资源适应和跨域泛化中的效果。
TASU2是一个可控的CTC模拟框架,它从文本和指定的词错误率(WER)范围生成伪CTC后验分布,提供更接近声学解码界面的监督信号。这实现了基于WER的课程设计,无需音频数据或文本转语音(TTS)。关键创新包括WER条件的模拟、分布级监督和可控制的错误档案。
在多个实验设置中,TASU2优于基线方法: - 在文本对齐任务中,TASU2在LibriSpeech等源域数据集上降低了WER,并改善了在SlideSpeech和TED-LIUM等跨域数据集上的泛化性能。 - 在低资源适应任务中,TASU2在Medical和SlideSpeech等目标域上取得了显著收益,同时减少了源域性能下降,优于文本对齐和TTS增强基线。 - 后验相似性分析显示,TASU2模拟的CTC后验更接近真实声学后验,且WER控制有效。
TASU2是语音LLM对齐方法的重要进展,通过可控模拟提升了训练效率和低资源适应能力,为实际应用提供了更实用的解决方案。
传统音频-视觉语音增强(AVSE)在多说话者环境中面临关键瓶颈:难以可靠识别听众的目标说话者,导致目标声音提取不准确,限制了现实世界部署能力。
本文提出GG-AVSE框架,创新点包括:1) GG-VM模块,通过凝视跟踪(使用Ganzin Sol Glasses)和YOLO5Face检测器动态提取目标说话者的面部特征;2) 集成预训练的AVSEMamba模型,采用零-shot合并和部分视觉微调(PVFT)策略,有效处理视觉域差异;3) 提出匹配分数(结合空间距离和IoU)实现凝视到面部的鲁棒关联。
在AVSEC2-Gaze数据集上评估,GG-AVSE相比无凝视基线显著提升:PESQ从2.370提高到2.609(提升10.08%),STOI从0.8802提高到0.9258(提升5.18%),SI-SDR从9.16dB提高到11.33dB(提升23.69%),验证了凝视线索在解决目标说话者歧义中的有效性。
GG-AVSE框架通过集成凝视指导,显著增强AVSE在多说话者场景下的性能,具有良好的可扩展性和实用前景,尤其适用于助听设备和可穿戴应用。
LLM-based 自动语音识别(ASR)在现实部署中面临两大挑战:一是效率和识别质量之间的权衡,尤其是在轻量级设置下,模型因处理语音-文本模态差距而消耗额外容量;二是幻觉问题,联合训练时编码器受 LLM 梯度主导,导致表示漂移,依赖语义先验而牺牲声学保真度,增加幻觉风险。
论文从熵分配视角重新审视 LLM-based ASR,提出三个指标量化训练范式在编码器和 LLM 之间的熵减少分配:归一化谱熵(NSE)、语音可访问信息(PAI)和条件语义可访问信息(CSAI)。基于此,提出基于能力边界感知的多阶段训练策略:重新设计预训练以缓解模态差距,并引入迭代异步 SFT(IA-SFT)阶段在对齐和联合 SFT 之间,以保持功能解耦并约束编码器表示漂移,优化参数效率和幻觉鲁棒性。
在普通话和英语 ASR 基准测试中,该方法使用仅 2.3B 参数实现与最先进模型竞争的性能,同时通过解耦导向设计有效减轻幻觉,促进高效、稳健的现实部署。
该论文通过熵分配分析和创新多阶段训练,显著提升了 LLM-based ASR 的参数效率和鲁棒性,为工业应用提供了重要指导。
该方法通过引入情感共振范式,创新性地解决了跨语言情感识别中的标签稀缺和动态特征捕获问题,为低资源语言应用提供了高效解决方案。
EvoTSE通过动态注册更新和检索机制,有效解决了TSE中的说话人混淆和静态注册问题,显著提升了在复杂音频场景下的提取性能。
该研究为CI用户设计了一个创新的语音增强模型,通过注意力机制和双路径RNN优化时频处理,显著提高了语音可懂度和质量,具有重要的应用潜力。
自我监督学习(SSL)在语音处理中主要使用时间域预测目标(如 wav2vec 2.0、HuBERT),而音频表示学习通常在时频谱图上操作(如 SSAST)。这两种范式难以相互转移,导致模型在跨领域任务上性能下降,迫切需要统一的框架来联合学习音频和语音的表示。
提出了 ULTRAS(Unified Learning of Transformer Representations for Audio and Speech),一个基于变换器的统一框架。关键创新包括:1) 对长时间段音频(160ms 窗口)进行掩码,以编码音节级声学信息;2) 将输入音频转换为 log-mel 频谱图,并分割为频谱块进行编码;3) 使用组合损失函数(加权时间损失和频谱损失)联合预测频谱目标(通过 K-means 量化)和时间目标(基于 HuBERT 嵌入),迫使表示编码时频特征;4) 架构借鉴 Vision Transformer,采用随机掩码策略和变换器编码器。
在多种语音和音频下游任务(如语音识别、音频事件分类)上进行了评估,使用冻结的 SSL 模型和轻量级分类头。预训练在 LibriSpeech 和 AudioSet 的混合数据集上进行(200 小时和 2000 小时设置)。实验结果显示,ULTRAS 在性能上优于其他基线方法(如 wav2vec 2.0、HuBERT 和 SSAST),验证了联合时频建模的有效性。
ULTRAS 是一个创新的统一框架,通过联合预测时频目标,显著提升了音频和语音表示学习的泛化能力和下游任务性能。
阿拉伯语(现代标准阿拉伯语MSA)缺乏临床验证的自动化音素级发音评估工具,现有专有系统如Microsoft Azure Pronunciation Assessment未针对阿拉伯语音系学特点(如丰富辅音库、咽音音素)进行本地化,临床有效性和可扩展性受限。
提出Harf-Speech框架:一个模块化系统,用于阿拉伯语音素级发音评估。方法包括:1. 使用MSA音标化器生成参考音素序列;2. 微调多个ASR架构(如OmniASR-CTC-1B-v2)进行语音到音素预测;3. 基于Levenshtein对齐和最长公共子序列(LCS)算法进行音素分割和评分;4. 混合评分器结合准确性和完整性指标,输出临床尺度的分数。
Harf-Speech提供了一个开放、模块化、临床对齐的阿拉伯语音素级发音评估框架,通过本地化建模和专家验证,推动了可扩展语音治疗和语言学习的技术进步。
现有VR听觉化方法中,几何声学计算复杂度高,难以实时生成高质量音频;深度学习模型在准确预测低阶反射方面存在局限;现有数据集多样性不足,且RIR类型(如单声道和双耳RIRs)不完全满足VR交互需求。
提出一个多模态深度学习模型,输入包括场景信息(几何和声学属性)和低阶反射波形,输出空间房间脉冲响应(SRIRs),以降低计算复杂度并便于集成个性化头相关传递函数。构建了包含多样化3D场景和SRIRs的新数据集。模型架构结合GCN-TF编码器、LoR编码器(并行处理波形和Mel-spectrogram)和参数解码器,优化了早期反射和晚期混响的生成。
在多项客观指标(如MAE、T60、DRR、Mel-spectrogram错误)上,该方法优于基线系统MESH2IR、Listen2Scene和M2PAIR,显示了在实时SRIR计算中的优越性能。数据集特征分布更广泛,提升了模型泛化能力。
该研究通过创新多模态输入和SRIR输出,有效解决了VR听觉化中实时音频渲染的挑战,提升了真实感和计算效率。
传统主动噪声消除(ANC)技术依赖于耳道内的误差麦克风来测量和调整噪声消除效果,但开放式耳机智能眼镜无法使用这种设计,因为它们不能密封耳道,导致在嘈杂环境中音频质量下降。
提出首个实时ANC系统,通过分布在眼镜框架上的八个MEMS麦克风阵列捕获环境噪声,利用神经网络进行虚拟耳内感知来估计噪声在耳道中的传播。系统采用双管道架构:CPU运行神经网络(每200毫秒更新一次滤波器系数),DSP实时生成抗噪声信号(延迟113微秒)。方法还支持用户校准以优化性能。
在100-1000 Hz频率范围内的8个移动环境中进行用户研究,使用自定义3D打印原型眼镜,实现平均噪声减少:无校准时9.6 dB,用户校准时11.2 dB。系统能有效处理动态声学条件,适用于真实世界穿戴场景。
这篇论文首次在开放式耳机智能眼镜上实现了实时主动噪声消除,通过创新性的虚拟耳内感知和低延迟处理,为穿戴式音频增强和未来智能交互奠定了技术基础。
本文系统性评估了语音基础模型在说话人日记化中的跨年龄泛化能力,为应对年龄多样性提供了实用见解和基准,推动了鲁棒语音处理的发展。
现有音频视觉导航(AVN)方法在未见声音类别和环境中泛化能力有限,主要问题包括对声音语义特征的过拟合、对训练环境动态和几何的依赖,导致在分布外场景下性能下降,如方向推断不稳定和导航轨迹振荡。
提出 BDATP 框架,包括两个核心组件:Binaural Difference Attention (BDA) 模块,通过显式建模双耳差异来增强空间方向感知,减少对语义类别的依赖;Action Transition Prediction (ATP) 任务,作为辅助正则化项,通过预测动作转移来促进跨环境的策略一致性,缓解过拟合问题。该框架可集成到主流 AVN 基线中,共同优化感知和策略学习。
在 Replica 和 Matterport3D 数据集上的实验表明,BDATP 显著提升了性能,特别是在挑战性的零样本泛化设置中。例如,在 Replica 数据集的未见声音类别上,成功率达到最高 21.6% 的绝对提升(例如,AV-WaN + BDATP 达 70.7%),并展示了跨不同导航架构的稳健性。
BDATP 框架通过强调空间感知和策略正则化,有效地解决了 AVN 中的泛化问题,为未见场景下的音频视觉导航提供了创新解决方案。
现有语音代理系统在实时工具使用和真实世界不流畅性处理方面存在显著差距。当前基准多数依赖合成音频,缺乏对真实语音中填充词、停顿、自我纠正等自然不流畅性的评估,无法有效衡量模型在动态状态回滚和多步API调用中的表现。
论文引入Full-Duplex-Bench-v3 (FDB-v3)基准,其创新点包括:1) 使用真实人类音频,系统注释五种不流畅类别(填充词、停顿、犹豫、错误启动、自我纠正);2) 设计多步工具链场景,涵盖旅行与身份、金融与计费、住房与位置、电子商务支持四个领域;3) 包含21个自我纠正和状态回滚场景,以测试实时意图更新能力;4) 基于模拟API实现确定性输出,支持自动评分。
评估六种模型配置:GPT-Realtime、Gemini Live 2.5、Gemini Live 3.1、Grok、Ultravox v0.7和Cascaded基线。结果显示:GPT-Realtime在任务完成率(Pass@1 0.600)和避免中断方面领先(13.5%);Gemini Live 3.1延迟最低(4.25秒),但轮转率最低(78.0%);Cascaded基线轮转率完美,但延迟最高(10.12秒)。自我纠正处理在所有系统中都是最一致的失败模式,成功率低于59%。
FDB-v3填补了评估实时语音代理在工具使用和真实不流畅条件下的空白,为公平模型比较和未来研究提供了关键基准。
现有唱歌声音深度伪造检测(SVDD)系统主要基于16 kHz采样音频,受限于奈奎斯特定理,只能捕获0-8 kHz频段,丢弃了高频信息。然而,专业唱歌包含复杂音高、宽动态范围和音色变化,高频谐波和呼吸纹理是检测伪造的关键线索,导致传统方法在高分辨率唱歌检测中性能不足。
提出Sing-HiResNet框架,首次系统探索高分辨率(44.1 kHz采样率)音频在SVDD中的应用。该框架采用联合全频带-子频带建模:全频带模型捕获全局上下文,而多个子频带专家模型隔离频谱中不均匀分布的合成伪影。通过四种融合策略(如决策级聚合、特征级拼接)集成多尺度特征,以优化检测性能。
在WildSVDD数据集上进行实验,结果表明高频子频带提供了必要的补充线索。Sing-HiResNet框架显著优于16 kHz采样模型,达到最先进水平,证明了高分辨率音频和战略性子频带集成对健壮在实际环境中检测至关重要。
该研究开创性地结合高分辨率音频与子频带建模,为唱歌深度伪造检测提供了更有效和健壮的解决方案,推动了该领域的技术进步。
随着人工智能和边缘计算的快速发展,对低精度算术的需求日益增长,现有乘法累加(MAC)或处理元素(PE)架构主要针对中高精度数据设计,无法高效支持FP8和FP4等低精度格式。此外,AI工作负载中采用多种FP8(E4M3、E5M2)和FP4(E2M1、E1M2)格式,需要硬件能动态重配置精度而不增加逻辑冗余或关键路径延迟。
论文提出DHFP-PE(双精度混合浮点处理元素),采用创新的位分区技术,使单个4位单元乘法器能作为标准4×4乘法器用于FP8,或作为两个并行2×2乘法器用于FP4,实现100%硬件利用率。架构结合可配置乘法器数组、共享乘法器资源和格式自适应累加,支持FP8和FP4格式,优化低功耗和高吞吐量AI工作负载。
在28nm技术中实现,该PE达到1.94 GHz的操作频率,面积0.00396 mm²,功耗2.13 mW。与最先进设计相比,面积减少60.4%,功耗节省86.6%。实验显示其适用于AI边缘处理器、神经网络加速器和混合精度训练引擎。
该设计通过高效硬件复用和动态精度调整,为AI加速提供了灵活、低功耗的浮点处理解决方案,显著优化了面积和功耗表现。
AffectSpeech是一个开创性的大规模情感语音数据集,通过细粒度文本标注和人类-LLM协作管道,为语音情感标注和合成研究提供了高质量资源,推动了该领域的进展。
零样本关键词唤醒(ZSKWS)系统在构建自适应和个性化语音界面时面临挑战:计算资源受限、标注训练数据有限,以及现有方法难以区分语音相似的关键词,导致在实际部署中假警报率(FAR)较高。例如,如图1所示,'call mom'和'come on'等关键词在语音上相似,容易引发假警报。
论文提出MALEFA,一种轻量级零样本关键词唤醒框架,其创新包括: - 多粒度对比学习:联合学习utterance-level和phoneme-level对齐,通过跨注意力和对比学习目标捕获全局语义和细粒度发音。 - 假警报感知损失:引入基于sigmoid的精度约束损失,直接惩罚假阳性,优化低假警报率。 - 轻量级设计:模型仅650K参数和93M FLOPs,支持资源受限设备的实时部署。架构包括特征提取器(音频和文本编码器)、模式提取器(跨注意力对齐)和模式鉴别器。
在四个公共基准数据集(Google Speech Commands, Qualcomm, LibriPhrase Easy/Hard, AMI)上评估: - 准确率:达到90%的准确率,在LibriPhrase Hard数据集上AUC为93.58%,EER为13.91%。 - 假警报率:显著降低,在AMI数据集上FAR为0.007%,优于先前方法(如PhonMatchNet的17.879%)。 - 消融研究:显示多粒度对比学习和假警报感知损失对性能至关重要;移除任一组件会降低准确性或增加假警报率。 - 计算效率:模型轻量,参数少,适合实时部署。
MALEFA是一种创新的轻量级框架,通过多粒度学习和假警报抑制,有效解决了零样本关键词唤醒中的假警报问题,并在多个数据集上展示了优越性能,适用于资源受限环境。
TTS 模型比大型语言模型(LLMs)更数值脆弱,因为其连续波形生成和对微小数值扰动感知敏感。传统的精度降低技术(如 BlockFloat8 和低保真计算)在 LLMs 中有效,但在 TTS 系统中应用会导致可听见的伪影、相位不稳定和谱失真,限制了成本降低。
提出了 Lightning V2,一个针对 Tenstorrent 硬件协同优化的生产级 TTS 模型。通过精度感知的架构设计和硬件-软件协同优化,实现了超过 95% 的低保真计算保真度和超过 80% 的 BlockFloat8 部署,而不降低音频质量。利用 Tenstorrent 的 Network-on-Chip、分布式 SRAM 和确定性执行模型,减少内存移动和冗余权重获取。
实现了高精度优化:95% 低保真计算保真度和 80% BlockFloat8 部署,模型大小减少约 2 倍,内存传输节省。在 550 个并发 TTS 请求下,相比 NVIDIA L40S 基线,成本降低了约 4 倍,同时保持生产级音频保真度。
这项研究通过精度协同设计和硬件感知优化,成功重塑了实时语音推理的经济性,为 TTS 系统提供了高效低成本的解决方案。
现有full-duplex口语对话系统中的turn检测方法面临两大问题:一是依赖语音活动检测(VAD),缺乏语义理解,易受背景噪声、回声道和犹豫影响;二是基于自动语音识别(ASR)的方法引入高延迟,且在重叠语音和噪声环境下性能下降。此外,现有数据集缺乏真实交互动态,如自然转场、重叠语音和噪声,限制了模型的评估和部署。
论文提出FastTurn框架,通过统一声学和流式语义线索实现低延迟和鲁棒turn检测。主要创新包括: 1. 架构设计:结合流式CTC解码快速生成部分转录,减少延迟;集成Conformer编码器提取声学特征,通过LLM(如Qwen3-0.6B)进行语义推理;最终通过声学适配器和turn检测器融合声学与语义线索,提升预测准确性。 2. 训练策略:采用四阶段训练流程:语义预训练(在ASR数据上训练Conformer和CTC)、模态对齐(训练LLM适配器)、联合训练(结合声学嵌入和CTC提示)和模态融合(训练声学适配器和turn检测器),以优化延迟-准确性权衡。 3. 数据集发布:构建FastTurn测试集,基于真实人类对话,包含转场、重叠语音、回声道、暂停、音调变化和环境噪声,弥补现有数据不足。
实验表明,FastTurn在turn检测任务中实现更高决策准确性和更低中断延迟,相比基线方法(如Smart Turn、TEN Turn Detection、Easy Turn)。在挑战性声学条件(如噪声和重叠语音)下保持鲁棒性能,验证了其在实际full-duplex对话系统中的有效性。评估指标包括延迟和准确性,具体数据在截断内容中未详述。
FastTurn通过创新地融合声学和流式语义线索,为full-duplex口语对话系统提供了一个高效、低延迟且鲁棒的turn检测解决方案,显著提升了交互自然性和实用性。
传统目标语音提取方法依赖于干净的注册音频来识别目标说话者,这在真实嘈杂环境中难以获取,限制了实时应用和用户切换说话者的灵活性。
本文提出一种enrollment-free的目标语音提取方法,通过混合音频直接预测一小组合说话者嵌入,使用教师-学生框架:教师模型基于WavLM和Attentive Statistics Pooling提取单说话者嵌入,学生模型输出多说话者嵌入,通过排列不变监督对齐到共享身份流形。这消除了对外部注册的需求,将TSE重新定义为基于混合音频候选嵌入的选择问题。
在嘈杂的LibriMix数据集上,所提嵌入在聚类指标(如准确率、NMI、ARI)上优于WavLM+K-means基线;集成到多个TSE后端(pDCCRN、SpEx+、DPCCN)后,显著提高SI-SDRi、PESQ、STOI等客观质量指标,并在真实DNS-Challenge录音上表现出泛化能力。
该研究通过mixture-to-set嵌入有效解决了嘈杂环境中的说话者分离问题,为enrollment-free TSE提供了实用且创新的解决方案。
多说话者对话场景中,全面理解需要联合语音识别、说话者属性和时间戳定位。现有方法面临挑战:重叠语音、回音、快速轮换、固定上下文窗口限制;传统级联框架有错误传播和缺乏联合优化问题,而端到端方法如序列化输出训练(SOT)在处理复杂现象时机制不足。
提出了Speaker-Reasoner,一个端到端语音大型语言模型,采用代理多轮时间推理。关键创新包括:迭代全局到本地推理(通过边界提议和切片级解码)、说话者感知上下文缓存以扩展处理长音频并保持说话者一致性、三阶段渐进式训练策略(多任务基础、时间交互学习、缓存学习)。
在AliMeeting和AISHELL-4多说话者会议数据集上进行了实验,显示相对于强端到端基线有持续改进,特别是在处理重叠语音和复杂轮换方面性能提升显著。
Speaker-Reasoner通过创新性的多轮交互和缓存机制,有效解决了多说话者语音识别中的时序和一致性挑战,是一个有前景的端到端解决方案。
在复杂声学环境中,音频-视觉导航(AVN)面临核心挑战:双耳音频线索因障碍物、衍射和场景几何而变得间歇性不可靠,尤其是在泛化到未听过声音类别时,导致音频特征分布偏移,增加跟随虚假模式或错误方向的风险。现有方法通常假设音频可靠性高,采用静态融合机制(如拼接或注意力),缺乏动态校准能力,使代理在失真环境中易受声学幻觉影响。
提出可靠性感知音频-视觉导航(RA VN)框架,关键创新包括: 1. 声学几何推理器(AGR):通过几何代理监督和异方差高斯负对数似然目标,学习观察依赖的分散作为可靠性线索,无需推理时的几何标签。 2. 可靠性感知几何调制(RAGM):将学习到的几何线索转换为软门,动态调制视觉特征,减轻跨模态冲突。 3. 动态融合机制:基于音频可靠性自适应调整多模态集成,在音频线索可靠时充分利用,不可靠时降低影响。
在SoundSpaces数据集(Replica和Matterport3D环境)上评估RA VN: - 性能指标:使用成功率(SR)、路径长度加权成功率(SPL)和行动数加权成功率(SNA)。 - 结果:RA VN在heard和unheard声音设置中均优于基线方法(如A V-Nav、Gan et al.等),具体为: - Replica数据集:heard设置SR 97.0%(vs. A V-Nav 93.0%),unheard设置SR 53.1%(vs. A V-Nav 47.3%)。 - Matterport3D数据集:heard设置SR 70.9%(vs. A V-Nav 68.8%),unheard设置SR 35.6%(vs. A V-Nav 34.5%)。 - 鲁棒性:在未听过声音场景中表现出显著鲁棒性。
该研究通过引入可靠性感知的几何融合机制,有效解决了AVN中的跨模态冲突和音频不可靠性问题,提升了导航性能和在挑战性环境中的鲁棒性。
现有音频-视觉导航方法主要依赖简单特征拼接或后期融合,缺乏显式的目标相对位置表示,且视觉表示学习缺乏听觉引导,导致学习效率低和泛化能力差。
提出Spatial-Aware Conditioned Fusion (SACF)框架,包括两个核心组件:Spatially Discretized Localization Descriptor (SDLD)模块,通过离散化方向距离并编码为紧凑描述符来显式建模空间意图;Audio-Descriptor Conditioned Visual Fusion (ACVF)模块,使用FiLM-style通道调制,基于音频嵌入和空间描述符动态调制视觉特征,实现目标导向的融合表示。
在SoundSpaces基准测试中,SACF在Replica和Matterport3D数据集上提高了导航性能指标(如SPL、SR、SNA),尤其在未听过目标声音的跨场景测试中表现出优越泛化能力,同时降低了计算开销。
SACF通过显式空间离散化和条件调制,显著提升了音频-视觉导航的效率和泛化能力,为跨模态任务提供了新思路。
当前音频视觉导航(Audio-Visual Navigation, AVN)方法面临泛化能力不足的挑战。具体来说,现有算法在训练时听到的声音源上能达到98%的导航成功率,但在未听到的声音源上性能急剧下降至52%,表明模型在应对新环境和声音源时缺乏适应性。这限制了在现实多变场景中的应用,如救援和家庭服务。问题根源在于:1) 音频特征提取能力不足,无法充分建模音频中的时空依赖性;2) 多模态融合方法僵化,无法根据场景变化动态调整音频和视觉特征的权重。
本研究提出了一种音频空间引导的融合方法(Audio Spatially-Guided Fusion for Audio-Visual Navigation, ASGF-Nav),核心创新包括: - 音频空间状态编码器(Audio Spatial State Encoder, ASE):基于CRNN和音频强度注意力机制,自适应提取音频中隐含的空间状态信息,如声源方向和距离,从而增强特征鲁棒性。 - 音频空间状态引导融合模块(Audio Spatial State Guided Fusion, ASGF):采用跨注意力机制和自适应门控,动态对齐并融合音频和视觉特征,减轻感知不确定性带来的噪声干扰,实现多模态自适应协调。 - 整体框架通过GRU结合历史状态,为策略学习提供富有时序上下文的信息,改善导航决策。
在Replica和Matterport3D数据集上进行实验,与多个基线方法对比: - 在未听到任务(Unheard)上,ASGF-Nav表现显著优于现有方法。例如,在Replica数据集上,ASGF-Nav的导航成功率(SR)从基线AV-WAN的52.8%提升到76.5%,路径长度指标(SPL)从34.7%提升到63.3%。 - 在听到任务(Heard)上,性能保持竞争力,如在Replica上SR达94.5%,SPL达82.7%。 - 结果验证了方法在未知声音源分布下的强泛化能力,通过音频空间引导有效提升了模型适应性。
该论文通过引入音频空间状态引导的动态融合策略,创新性地解决了音频视觉导航的泛化难题,为复杂多变环境中的自主导航提供了有效方案。
现有的自监督语音模型(S3Ms)如 wav2vec 2.0 和 HuBERT 在音素对比方面表现优异,但对韵律对比(如英语重音、日语音高重音、汉语声调)的敏感性尚未被直接测量。这限制了评估和优化模型在韵律相关应用中的能力,尤其在低资源语言和复杂韵律系统中缺乏高效、无标签的评估方法。
提出 'prosodic ABX' 框架,扩展传统 ABX 任务到韵律领域。核心是利用韵律最小对(如英语名词-动词对、日语音高重音对、汉语声调对),通过动态时间规整(DTW)比较语音表示的距离,计算 ABX 分数以评估模型对韵律对比的区分能力。该方法无需训练或显式标签,仅需少量示例,语言无关,适用于资源有限场景。还构建并发布了英语和日语的韵律最小对数据集,补充了现有汉语数据。
在英语、日语和汉语数据集上评估了 17 种 S3Ms(包括 wav2vec 2.0、HuBERT、XLSR-53 等)和声学基线(mel spectrograms、MFCCs)。结果显示,S3Ms 在最佳层能有效区分韵律对比,错误率低于声学基线。模型和层排名在多种实验条件(如自然 vs. 合成语音、不同说话者)下保持稳定,证明方法的鲁棒性。人类实验作为参考,S3Ms 表现接近人类水平,尤其在英语和日语任务中。实验还表明,合成语音可作为自然语音的有效替代,降低数据收集成本。
该研究通过创新性的 prosodic ABX 框架,首次系统评估了自监督语音模型中的韵律对比表示,为语言无关的韵律分析提供了实用工具,推动了韵律敏感模型的发展和应用。
自我监督语音模型(如Wav2Vec2和HuBERT)在学习过程中如何编码语言结构尚不明确,尤其是不同层次的语言结构(如音素、音节、词汇、句法)是否以层次方式组织,以及这些结构在训练中出现的顺序和时间轨迹。
研究系统分析了六种Wav2Vec2和HuBERT模型在831小时荷兰语语音数据上的训练,使用探针方法评估九种语言结构(从声学到句法)在模型层和中间检查点中的编码。创新点包括跨多个结构层次的比较、不同模型架构(Wav2Vec2 vs. HuBERT)和目标(对比损失 vs. 预测损失)的效应分析,以及结合时间尺度和抽象程度的解释框架。
不同层次的语言结构在模型层状模式和学习轨迹上表现出显著差异,例如较低层次结构(如音素)在早期层中编码较好,而较高层次结构(如句法)在后期层中更明显。学习轨迹受结构抽象程度和时间尺度影响,预训练目标级别(如高阶预测任务)强烈影响层状组织和学习动态,导致更大并行性。
这项研究深入揭示了自监督语音模型学习语言结构的动态过程,为模型解释性和语言学习建模提供了重要见解。
论文指出,在通用语音增强(USE)领域,现有方法存在显著局限性:预测方法(如基于判别模型)在客观评估中表现良好,但主观感知质量不足;而生成方法(如基于生成模型)能提供更好的主观质量,但易产生幻觉(hallucinations),即引入不真实的音频内容。生成-预测融合系统试图平衡客观和主观指标,但仍有改进空间。URGENT挑战赛进一步强调了对多样化语音源和语言族的鲁棒性需求。
本文提出GAP-URGENet(生成-预测融合框架),主要创新点包括: - 双分支架构:系统由两个平行16-kHz分支组成:生成分支(generative branch)和预测分支(predictive branch)。生成分支扩展了低幻觉范式PASE,通过DeWavLM-Omni进行全栈语音恢复,并利用声码器(Vocoder)重构波形;预测分支在谱图域进行增强,提供补充线索以保持信号细节。 - 后处理模块(PostNet):融合两个分支的输出,并执行带宽扩展(BWE)生成48-kHz波形,后下采样到原始采样率,提高鲁棒性和感知质量。 - 技术细节:生成分支引入改进的Vocos架构作为适配器(Adapter),使用对抗和特征匹配损失;预测分支采用TF-GridNet架构;PostNet基于CWS-TF-GridNet,并集成感知质量损失(如PESQ和UTMOS)。系统包含约567.76M参数,计算需求为472.84 GMACs/秒。
在ICASSP 2026 URGENT挑战赛的官方验证集上,GAP-URGENet在多项指标上优于基线方法(如BSRNN和BSRNN-Flow)。例如,在DNSMOS、NISQA、UTMOS、SCOREQ、PESQ、ESTOI、SBS、LPS和SpkSim等指标上均达到最高分,尤其是在盲测阶段排名第一。这表明生成-预测融合策略在平衡客观和主观评估方面的有效性。
GAP-URGENet通过创新的生成-预测融合框架,在通用语音增强任务中实现了优异的鲁棒性和感知质量,成为当前最先进的解决方案。
T5Gemma-TTS通过编码器-解码器架构和PM-RoPE创新性地解决了零-shot TTS中的文本稀释和持续时间控制问题,在多语言评估中表现出色,推动了语音合成技术的发展。
当前自动说话人验证(ASV)系统通常是黑盒模型,缺乏透明度,难以用于需要高问责的应用,如法医说话人比较(FSC)。FSC强调提供详细证据支持决策,而ASV系统只输出相似度分数,缺乏解释性,限制了用户信任和错误追踪。
提出了PhiNet,一个具有语音解释性的说话人验证网络。它利用语音证据来增强局部和全局解释性:局部解释性提供音素级别的比较,显示每个音素对验证决策的贡献;全局解释性识别音素的独特性排名,帮助理解系统偏差。训练方案模拟验证过程,确保决策一致性。
论文在多个基准数据集(如VoxCeleb、SITW、LibriSpeech)上进行了定性和定量评估。结果表明,PhiNet在说话人验证性能上与传统黑盒ASV模型相当,同时提供了有意义的解释性分析,例如识别出鼻音和元音对说话人验证的重要性,并展示了音素独特性排名与FSC启发式一致。
PhiNet通过引入语音解释性,有效桥接了ASV和FSC之间的差距,在保持高性能的同时提供了透明和可解释的决策过程。
现有音高估计方法在强噪声、混响和多说话者环境中性能显著下降,且许多先进方法(如基于隐藏马尔可夫模型或神经网络的方法)依赖大量训练数据,限制了实际应用的灵活性和鲁棒性。
论文提出一种新型音高估计器,使用听觉滤波器组(如伽马通滤波器)将信号分解为子带,并引入频率覆盖度量来优化子带数量和中心频率选择,避免经验性设置。子带信号通过计算归一化自相关进行音高估计。此外,开发了一种基于广义标签多伯努利(GLMB)滤波器的音高跟踪器,采用Ornstein-Uhlenbeck过程建模音高状态转移,并应用测量驱动的出生模型自适应处理新音高目标,实现了无需训练的单说话者和多说话者音高跟踪。
在各种加性噪声(如白噪声、环境噪声)和混响房间的真实录音测试中,所提方法在准确性上优于多种先进音高估计方法(如基于自相关、谐波产品谱等方法),在多数场景下表现出更好的鲁棒性。
这项研究通过结合子带编码和概率跟踪滤波器,提供了一种高效、无需训练的解决方案,显著提升了音高估计与跟踪在恶劣音频环境下的鲁棒性和实用性。
该研究通过结合语音分析和神经生理学数据,提供了一个鲁棒、跨语言可泛化且神经验证的抑郁症检测方法,为临床翻译和客观诊断工具发展奠定基础。
现有说话者定位方法在强混响环境(如混响时间高达1秒)和并发说话者情况下效果不佳,特别是在处理移动说话者时面临挑战。现有技术如子空间方法(如MUSIC、ESPRIT)、转向响应波束形成器和基于TDOA估计的方法(如GCC-PHAT)易受混响和空间混叠影响,难以可靠提取直接路径信号。
本文提出两种新算法以增强混响鲁棒性: 1. Onset-MCCC方法:基于听觉滤波器组将麦克风信号分解为子带,利用语音和房间冲激响应模型检测和编码清晰的语音起始,通过多通道互相关系数(MCCC)结合子带结果估计说话者到达方向(DOA),抑制随机反射并避免空间混叠。 2. MCC-PHAT方法:扩展广义互相关-相位变换(GCC-PHAT),利用多麦克风冗余信息处理混响问题,通过多通道交叉相关性提高定位准确性。
方法在模拟混响环境(混响时间T60高达1秒)和真实混响室(T60≈0.65秒)中评估,使用静态和移动说话者数据。实验结果表明,与现有先进方法如Neuro-Fuzzy、TF-CHB和EB-ESPRIT相比,所提方法能可靠定位说话者,在强混响下表现出色。
该方法通过结合语音起始检测和多通道互相关,有效解决了混响条件下的说话者定位问题,具有较高的鲁棒性和实用价值,适用于智能环境应用如视频会议和自动相机转向。
现代神经 TTS 系统在高保真波形生成上表现优异,但合成语音的自然度严重依赖准确的韵律建模(如音高轮廓、时长模式和重音位置)。标准文本编码器仅捕获语言内容,缺乏明确的韵律知识,导致韵律推断不足,造成过度平滑的语调,限制了可控性。
本研究通过创新的多阶段预训练策略,成功提升了韵律感知 TTS 的性能,为韵律建模和 TTS 预训练提供了重要见解。
Diff-VS通过高效应用EDM框架和音乐感知的U-Net改进,首次在声源分离中实现了生成性方法与判别性方法在客观和主观指标上的竞争力,推动了生成性模型在该领域的实用化探索。
当前音频-视觉语音识别(AVSR)系统虽然集成了大型语言模型解码器,但改进是来自于语言建模还是音频-视觉编码不明确;此外,音素或视素信息的整合在AVSR中较少被探索,限制了模型在噪声条件下的鲁棒性。
提出了Viseme-Guided AV-HuBERT (VisG AV-HuBERT),一个多任务微调框架,通过辅助视素分类来增强模型对视觉发音特征的依赖。该方法扩展了AV-HuBERT,添加了一个轻量级的视素预测子网络,使用混合CTC/CE损失函数进行联合优化。
在LRS3数据集上评估,VisG AV-HuBERT在基线AV-HuBERT上实现了可比或改进的性能,特别是在重噪声条件下。例如,在-10 dB SNR(语音噪声)下,词错误率从13.59%降至6.60%(相对改进51.4%)。错误分析显示替换错误显著减少,表明语音单元区分能力提升。在LRS2数据集上的评估确认了泛化能力。
该工作证明了显式视素建模能有效增强编码器表示,为通过编码器级改进开发噪声鲁棒的AVSR系统提供了新方向。
This challenge task significantly advances spatial audio processing by incorporating realistic complexities and robust evaluation, driving progress in immersive communication and smart environment applications.
现有零-shot文本到语音(TTS)模型通常仅支持有限语言(如几十种),忽略数百种低资源语言,限制了全球语音技术覆盖。传统的离散非自回归(NAR)模型依赖复杂的两阶段管道(文本到语义,再到声学),导致错误传播和信息瓶颈,影响音频质量和训练效率。
OmniVoice提出单阶段离散NAR架构,基于扩散语言模型风格,直接映射文本到多码书声学令牌,简化流程并避免两阶段问题。关键创新包括: - 全码书随机掩码:随机掩码所有码书令牌(平均50%掩码率),替代传统"逐层"掩码,提升训练收敛速度和生成质量。 - LLM初始化:从预训练自回归大语言模型(LLM)初始化Transformer主干,继承语言知识,首次在NAR TTS中应用,显著提高语音可理解性。 - 大规模多语言数据:构建581k小时开放源数据集,覆盖600+语言,采用语言级重采样策略(β=0.8)平衡高低资源语言,支持广泛覆盖。
在581k小时多语言数据集上训练,覆盖超过600种语言。在中文、英文和102种语言的多语言基准测试中,实现了最先进(SOTA)性能,在可理解性、说话者相似性和自然度方面优于现有方法。模型还支持多维度控制(如提示去噪、语音属性设计),增强实用性。
OmniVoice是首个大规模多语言零-shot TTS模型,通过简化架构和创新训练策略,实现了前所未有的语言覆盖和高质量语音生成,为全球低资源语言提供了可行解决方案。
该研究提供了一个实证驱动的训练配方,通过结合大规模多语言数据和自监督学习表示,显著提升了电话识别的多语言泛化能力,推动了语音处理领域的发展。
当前操作模态识别方法在阻尼估计上存在局限性,尤其是基于经验方法导致估计不准确,这直接影响预警系统的性能。具体而言,阻尼行为的错误预测会导致事件持续时间(如高加速度持续时间)的误判,从而在结构健康监测和异常检测场景中,基于振动幅度的警报系统可能失效,影响安全决策。
本文提出一种新颖的信息论方法,用于动态系统识别,特别针对输出-仅阻尼估计。该方法整合了信息论指标,如Shannon熵和Kullback-Leibler散度,结合振动测量数据,以提高阻尼估计的准确性。通过概率分布分析和信号能量计算,该方法能在近实时监控中优化模型选择,准确捕捉系统动态行为,并增强警报持续时间估计的可靠性。
研究使用了两个主要数据集进行验证:一是来自University of Bath的多轴模拟表的新真实世界数据,二是国际基准问题IASC-ASCE结构健康监控数据集。实验结果表明,该方法能有效选择最优模型,准确估计阻尼参数和警报持续时间,相较于传统方法,显著提升了系统识别和监控的精度。
该信息论方法为动态系统识别和结构健康监测提供了一个强大且准确的工具,通过整合信息论概念,解决了当前阻尼估计的挑战,具有广泛的应用潜力。
本文指出,当前数据驱动的音乐学和音乐生成研究受限于缺乏大规模、基于生物力学约束的钢琴和弦数据集。理论和弦空间与乐器特定和弦空间(受演奏者生理限制)之间存在差距,这阻碍了模型在真实演奏背景下分析音型(voicing)对心理声学感知的影响。
这项研究填补了生物力学约束钢琴和弦数据集的空白,通过实证分析揭示了音型偏度在不和谐度预测中的关键作用,为音乐生成、音型拓扑和心理声学建模提供了新颖见解和实用资源。
LongCat-AudioDiT 是一个高效且高性能的扩散基TTS模型,通过在波形潜在空间中直接操作简化流程并提高生成质量,推动了纯扩散方法在语音合成领域的发展。
多语言语音识别中,基于音素到字素(P2G)的转换面临两大挑战:语言感知生成(模型需根据音素序列生成语言特定正字法)和严重跨语言数据不平衡(高资源语言主导训练,低资源语言样本稀缺)。传统方法如加权有限状态转换器(WFST)依赖语言特定资源,难以扩展多语言或快速词汇更新。
论文提出简化采样-K边缘化(S-SKM),作为SKM的蒙特卡洛近似变体,避免计算基于CTC的S2P概率权重,从而降低训练复杂度。此外,采用统一输出空间(包含语言标识符令牌)以支持多语言生成,并实施低资源过采样策略(目标最小曝光时间)来缓解数据不平衡。
在十语言CV-Lang10基准上,通过稳健训练(如DANP和S-SKM)和低资源过采样,平均词错误率(WER)从10.56%显著降低至7.66%。单语言消融研究(波兰语和德语)显示S-SKM与SKM性能相近(WER约4-12%),验证了其有效性。
该研究通过创新训练方法和数据平衡策略,有效推进了多语言LLM-based P2G,为多语言语音识别提供了高效、可扩展的解决方案。
核心痛点:阿拉伯语自动发音评估面临多重挑战,包括缺乏标准化基准和开放标注数据集、数据稀缺、语音学复杂性(如34个音素、强调辅音区分)以及diglossia(现代标准阿拉伯语作为第二语言学习),导致历史研究难以比较和复现。
方法创新:IQRA 2026挑战引入了新的真实人类误发音数据集Iqra Extra IS26,补充了现有训练资源。参与者采用多样化的方法,包括基于CTC的自监督学习模型(如Wav2Vec2.0、HuBERT)、两阶段微调策略(如先通用训练后误发音适应)、生成式大型音频-语言模型(LALMs),以及优化架构如时序卷积网络(TCN)和最优时序传输分类(OTTC)。
实验结果:在QuranMB.v2基准上,最佳系统(whu-iasp)达到F1-score 0.7201,比第一版(约0.47)提升0.28。共有19支团队参与,性能显著提高,归因于新数据和创新建模策略。
一句话评价:该挑战推动了阿拉伯语误发音检测研究的成熟,为未来工作奠定了更强基础。
现有语音-文本对齐模型(如ParaCLAP)只能处理有限的风格属性(如基本情感),而真实语音包含更丰富的内在(如音高、纹理)和情境(如情感)维度,且常以自由形式自然语言描述,当前模型支持不足,限制了风格提示TTS、语音检索等应用的发展。
ParaSpeechCLAP通过双编码器架构和创新训练策略,成功支持广泛语音风格标签,并在多个应用中展示了优越性能,推动了丰富风格语音处理的发展。
传统声学到发音倒置方法主要依赖电磁发音图(EMA)数据,但这些数据仅覆盖声道前部,传感器数量有限,且存在数据获取困难、辐射风险以及无法捕捉完整声道(如咽部和喉部)信息等问题。实时磁共振成像(RT-MRI)数据能提供完整声道覆盖,但面临数据质量低、噪声大、空间分辨率有限以及缺乏自动轮廓提取工具等挑战。
本研究提出了一种创新的完整声道倒置方法:使用RT-MRI数据,自动提取声道轮廓(而非原始图像),以聚焦几何动态并减少冗余像素信息。结合去噪音频,采用双向长短时记忆网络(Bi-LSTM)架构进行倒置。实验重点评估了三种音频嵌入(MFCCs、LCCs和HuBERT)的影响以及数据集大小(从10分钟到3.5小时)对性能的作用。此外,引入了新的测量指标——喉部高度,以更全面评估倒置精度。
在测试数据上,平均均方根误差(RMSE)为1.48 mm,接近像素大小1.62 mm。结果表明,使用RT-MRI数据实现从声门到嘴唇的完整声道倒置是可行的,且音频嵌入中HuBERT表现最佳,数据集大小增加能提升性能。
该方法通过创新使用轮廓提取和高质量数据,在声学到发音倒置中实现了高精度结果,为完整声道建模和应用(如语音康复)提供了有效途径。
核心痛点: AI 配音内容评估具有多维度性(包括同步性、清晰度、说话者一致性、情感对齐和语义上下文),但人类平均意见分数(MOS)作为金标准成本高、难以大规模应用。
方法创新: 提出一种层次化多模态融合架构,集成音频、视频和文本特征,通过 intra- 和 inter-modal 融合层渐进整合;引入 Proxy MOS 作为弱监督标签,通过主动学习优化客观指标权重;使用轻量级 LoRA 适配器实现参数高效微调。
实验结果: 在 12k 印地语-英语双向配音剪辑上训练,模型预测与人类感知对齐度高(PCC>0.75),全多模态系统性能优于单模态和双模态配置。
一句话评价: 该研究为 AI 配音内容的自动评估提供了一个可扩展且感知对齐的解决方案,结合多模态融合和弱监督策略。
印度语言多样性高,现有语音数据集存在三大主要问题:缺乏广泛语言覆盖(尤其忽视低资源语言)、缺乏地理和人口统计学覆盖(忽略区域变体和方言),以及缺乏多模态数据(多为单一语音-文本模态),限制了包容性语音技术发展。
VAANI项目采用地理中心的数据收集方法,从印度165个地区系统性采集数据,使用图像提示鼓励自发语音回应,创建对齐的图像-语音-文本多模态数据集,并通过严格自动和手动质量评估确保高标准。
数据集包含约289,000张图像、约31,270小时音频和约2,067小时转录语音,覆盖112种语言、来自31个州和联合领土的165个地区,许多语言首次在这种规模的数据集中表示,提升了语言包容性。
这是一个开创性的努力,通过创建印度代表性的多模态数据集,为促进语言包容性和发展包容性语音模型提供了重要资源。
BiFormer3D offers an innovative time-domain approach that effectively addresses HRIR spatial up-sampling, enhancing reconstruction quality and flexibility for spatial audio applications.
现有房间声学模拟库如pyroomacoustics(PRA)在双耳渲染中依赖非Spherical Harmonics(SH)域处理,导致高计算开销、不支持Magnitude Least Squares(MagLS)优化、实时头部旋转能力有限,以及多源场景下的效率瓶颈。
SHroom引入了一个开源Python框架,通过将Image Source Method(ISM)计算的镜像源批量投影到SH基上生成Ambisonic Room Impulse Response(ARIR)。关键创新包括:固定一次解码器(amortised over sources)、MagLS渲染以改善感知质量、Wigner-D矩阵实现快速头部旋转(<1 ms/frame),以及可组合处理器链支持球形阵列模拟和Ambisonic/Binaural Signal Matching编码。
与PRA基线相比,SHroom在使用MagLS时在SH阶数5达到感知透明性(Log Spectral Distance 2.02 dB,在1-2 dB Just Noticeable Difference内)。性能评估显示:解码开销在多源情况下从7倍减少到3.1倍(K=1到8),动态头部旋转成本低于1毫秒每帧,且缩放性优于PRA,尤其在低SH阶数和多源场景中。
SHroom通过统一的SH管道显著提升了房间声学模拟和双耳渲染的效率与质量,是实时音频应用和研究的强大工具。
传统方法如手工音频特征和监督学习模型在捕捉音乐中groove的复杂、非线性交互方面存在局限性,只能提取孤立维度,而groove是主观、风格依赖的体验,现有方法无法全面编码其多层面特性。
本研究创新地采用七种预训练的深度学习模型(AudioMAE, CLAP, M2D, MATPAC++, MERT, MuQ, MusicFM)直接从音频信号提取嵌入,使用线性探测(Ridge回归)预测groove评分。关键创新包括:1) 系统对比深度学习嵌入与传统手工特征(基于MIR工具箱提取的16个特征);2) 引入源分离技术以分析单个乐器(如鼓、贝斯)对groove预测的贡献,从而揭示音乐元素的独立作用。
实验基于包含148首歌曲的数据集,覆盖funk、pop、rock等多种风格。结果显示,深度学习模型能成功编码风格依赖的groove组件,在预测groove评分方面普遍优于传统手工特征。具体发现包括groove特征受底层音乐风格驱动,深度学习表示能捕获传统方法遗漏的复杂、非线性的节奏和音色交互。
本研究通过实证分析,证实了预训练自监督深度学习模型在捕捉主观音乐体验如groove方面的强大潜力,为音乐信息检索领域提供了基于表示学习的新范式。
现有的说话者匿名化系统修改音色但保留口音(如区域或非本地口音),这降低了隐私保护效果,因为口音可以缩小匿名集,导致说话者链接性和社会感知问题(如可信度判断)。口音被视为个人可识别信息,影响隐私攻击。
提出PHONOS,一个流式系统,用于实时外国口音转换以增强说话者匿名性。关键创新包括: 1. 两阶段方法:离线生成黄金说话者话语(使用静音感知DTW对齐和零样本语音转换,结合本地发音和非本地音色/节奏),在线训练因果口音翻译器(基于TVTSyn骨架,最多40ms前瞻)。 2. 训练使用联合交叉熵和CTC损失,映射非本地内容令牌到本地等效令牌。 3. 支持低延迟(单GPU上≤241 ms)和流式处理,保留时长和暂停结构。
在印度口音英语数据集上评估: - 非本地口音置信度减少81%。 - 听测评分与口音减少一致。 - 说话者链接性降低,口音中性化的话语在嵌入空间中远离原始说话者(余弦相似度降低)。 - 延迟低(≤241 ms),合成质量通过NISQA-MOS和主观MOS验证。
PHONOS是一个高效的流式系统,通过口音中性化显著增强隐私保护,同时保持低延迟和实用沟通效果,适用于在线流应用。
领域缺乏一个统一的概念框架来处理节奏数据。现有方法如 nPVI(归一化成对变异性指数)有限,只能测量等时性(isochrony),并且受到方法论批评,难以描述复杂的节奏结构。
提出了 rhythmic segment analysis 框架: - 概念化:将节奏数据视为固定长度的段(segments),每个段可分解为持续时间(duration)和模式(pattern),其中模式是间隔之间的比率。 - 可视化:统一了现有可视化方法(如相位图、比率图、光栅图),并引入新的模式-持续时间图(pattern-duration plot),结合聚类转换网络来揭示节奏规律。 - 测量:推广了节奏比率(rhythm ratios)和 nPVI;将 nPVI 重构为与等时性的平均距离,并提出更一般的 anisochrony 测量来替代它。引入了 quantality 概念来描述节奏的近似离散性。
论文提供了理论框架和几何可视化示例(如图1和图2),展示了段、模式、持续时间和距离测量之间的关系。通过 Python 包 rhythmic-segments 实现,但具体应用数据未在提供的片段中详细展示。
该框架以其简洁性和通用性,为节奏数据分析提供了一个统一的理论基础,有助于澄清概念、可视化和测量节奏规律。
Stuttering detection faces challenges such as data scarcity, limited model generalizability across languages and datasets, and variability in stuttering manifestations across individuals and contexts. Previous systems often struggled with small datasets, poor cross-corpus performance, and insufficient exploration of cross-linguistic consistency.
This paper introduces a multilingual stuttering detection system using wav2vec 2.0 (W2V2) models pre-trained on multiple languages. It incorporates multi-task learning with language detection as an auxiliary task and employs Focal Loss to handle class imbalance. The system is trained on combined data from four datasets (KSoF, SEP-28k-E, FluencyBank, AS-70) in English, German, and Mandarin, aiming to capture language-independent stuttering characteristics.
Multilingual training achieves performance comparable to or better than previous single-language systems across English, German, and Mandarin. It demonstrates improved results on the KSoF dataset for four out of five dysfluency types and supports the hypothesis of cross-linguistic consistency in stuttering. The TRILANG-LL variant with length-limited training data shows optimal performance with a 7-second threshold.
This research effectively leverages multilingual data to enhance the robustness and generalizability of automated stuttering detection systems, paving the way for more universal applications.
当前音频深度伪造检测方法存在严重的偏差问题,导致在未见数据集上泛化能力差。检测器倾向于学习不相关因素如说话者身份和语义内容,而不是真正的伪造伪影,从而影响跨域性能。这源于数据集特定特征和自监督学习模型中的固有编码偏差。
本文提出Artifact-Focused Self-Synthesis (AFSS) 方法,通过两种机制生成伪假样本以减轻偏差:自转换(使用同说话者语音转换系统)和自重构(通过神经声码器重建),强制真实和伪假样本共享相同的说话者身份和语义内容。此外,引入可学习的重新加权损失,动态调整对合成样本的重视,促使检测器专注于通用生成伪影。AFSS不依赖预收集假数据集,所有训练样本均从真实音频生成。
在7个数据集上的广泛实验表明,AFSS实现了最先进的性能,平均等错误率(EER)为5.45%。具体地,在WaveFake数据集上EER为1.23%,在In-the-Wild数据集上为2.70%,显著优于现有方法如AASIST和SSL-based模型,并消除了对假数据集的依赖。
AFSS方法通过系统性地消除说话者身份等混淆因素,有效减轻了音频深度伪造检测中的偏差,实现了优异的跨域泛化能力和实用性。
现有多模态情绪识别在对话(MERC)方法通常忽略跨场景(如不同说话者、话题、风格、噪声水平)的域差异(domain shift)和标签噪声(noisy labels)问题,导致模型在从源域迁移到未见过的目标域时泛化能力受限,影响在实际场景中的部署。
提出双分支图域适应(Dual-branch Graph Domain Adaptation, DGDA)框架: 1. 构建情绪交互图以建模话语间的复杂情感依赖。 2. 设计双分支编码器,包括超图神经网络(HGNN)显式建模多元关系,和路径神经网络(PathNN)隐式捕获全局依赖。 3. 引入域对抗判别器来学习跨域的不变表示,处理域差异。 4. 结合正则化损失以抑制噪声标签的负面影响,提高模型鲁棒性。该框架首次在MERC中联合解决域适应和标签噪声问题。
在IEMOCAP和MELD数据集上进行广泛实验,DGDA consistently outperforms strong baselines,优于现有基线方法,并更好地适应跨场景对话,展示了优越的泛化性能。理论分析提供了更紧的泛化界。
这是一个创新的框架,首次将域适应和标签噪声处理集成到多模态情绪识别中,提升了模型在真实跨场景环境下的实用性和可靠性。
原发性进行性失语症(PPA)诊断模型面临数据稀缺挑战,因为临床数据收集成本高、伦理限制严格,且现有公共资源如DementiaBank和AphasiaBank规模有限。先前研究通过模拟不流畅语音生成训练数据,但方法不够全面,仅模拟孤立的不流畅性(如重复、插入或停顿),未能捕捉PPA作为多层级表型(语义、语音、时间缺陷)的互动,导致临床真实性不足和泛化能力差。
本研究提出HASS(Hierarchical Aphasic Speech Simulation)框架,首次分层模拟logopenic variant PPA(lvPPA)的临床缺陷。方法包括:1) 词汇检索损伤层:基于临床专家指导,使用LLM(Gemini 3)模拟内容级不流畅性(如迂回、错误启动),考虑词汇偏倚和句法约束;2) 语音编码破坏层:在词对齐IPA表示中引入六种错误标记(如暂停、替换、删除),模拟语音级缺陷,并根据严重程度控制标记分布。整个流程整合TTS(VITS)合成语音,确保不流畅性保留。HASS提供了可扩展的临床数据增强方案,生成严重程度可控的合成数据集。
实验显示HASS显著提升PPA检测模型性能:使用HASS生成数据训练的模型在跨站点泛化评估中,AUC达到0.892(±0.076),优于基线0.850(±0.122),召回率(Dys)从0.659提升至0.899。数据分布分析确认模拟数据遵循临床标记层次,主要标记(暂停、删除、替换)占主导,且随严重程度增加。模型基于Wav2Vec 2.0 fine-tuned with LoRA,在真实临床录音(如Baycrest、Hopkins PPA语料库)上展示出更好的泛化能力。
HASS是一个创新、临床接地气的语音模拟框架,有效解决了PPA数据稀缺问题,通过分层模拟多级缺陷提升了检测模型的准确性和泛化性。
核心痛点: 1. 传统复杂高斯分布(如Local Gaussian Model)假设幅度和相位统计独立,难以表示个体源信号(如语音)的多样幅度特性(如重尾或轻尾)和实际相位结构。 2. 现有非高斯分布(如复杂广义高斯、复杂Student-t、alpha-stable分布)基于圆对称假设,忽略相位相关性,不适合建模音频信号中的确定性谐波结构。 3. 基于超球模型的幅度分布(如非中心卡方、κ-µ、非中心gamma分布)提供了灵活幅度统计,但未明确结合复平面几何,导致与复值观测不匹配。
方法创新: 1. 提出新概率模型:power-weighted noncentral complex Gaussian distribution,定义为p(z; μ, σ², α) = |z|²ᵃ⁻² e^{-|z-μ|²/σ²} / (πσ²ᵃ Γ(α) L_{α-1}(-|μ|²/σ²)),其中z为复值变量,μ为均值,σ²为方差,α为形状参数。 2. 直接在复平面上制定模型,保留复值观测的几何结构,通过形状参数α实现非线性相位扩散,控制分布从弧状扩散(沿相位方向)到原点集中的连续几何变化。 3. 推导幅度和功率分布,形成一个统一框架,涵盖Rice、Nakagami、gamma等多个经典分布作为特例。 4. 提供理论分析,包括统计量(均值、方差、高阶矩、峰度)推导和高效采样方法。
实验结果: 1. 在语音功率谱建模实验中,新模型在log-likelihood方面一致优于传统功率分布(如指数、gamma、非中心gamma分布),展示了更好的拟合能力。 2. 通过可视化展示了参数α和μ对分布形状的影响,验证了模型灵活表示不同语音信号(如浊音和爆破音)统计特性的能力。
一句话评价: 该模型为复杂值数据的概率建模提供了一个灵活且统一的框架,特别适用于语音信号处理,能有效捕捉幅度-相位耦合和重尾统计特性,弥补了传统方法的不足。
标准的LLM-based ASR系统通常孤立处理每个话语,无法有效利用对话上下文,导致在处理上下文实体(如名称、位置和领域特定术语)时性能受限。同时,在LLM-based ASR中,先前轮次的音频被表示为长序列音频令牌,随着对话长度增加,上下文令牌数量快速增长,引发高计算成本、内存瓶颈和延迟问题。
为解决上述问题,论文提出了'Abstract Compression'方法。该方法将先前轮次的音频部分压缩为固定数量的学习潜在令牌,同时保留对应的转录文本显式表示。这种方法旨在通过减少音频令牌的占用来降低上下文成本,同时保留上下文的语义和声学信息。论文还介绍了两阶段训练策略,以有效学习压缩表示。
实验表明,在有监督的多轮训练后,多模态对话上下文确实能提升LLM-based ASR的性能,特别是在上下文实体的识别上(以Bias-WER衡量)。Abstract Compression模型在领域内和领域外测试集上,能够部分恢复原始上下文条件下的性能增益,同时显著减小了音频上下文的令牌足迹。消融研究进一步分析了压缩设置的各个因素对性能的影响。
该论文通过创新性的压缩方法有效平衡了上下文利用的计算成本与ASR性能,为高效的对话感知ASR系统提供了实用方案。
这项研究通过创新地结合视觉线索和生成建模,首次解决了电影音频分离中的数据缺乏和性能瓶颈问题,为音频增强领域带来了重要进展。
现有公开房间脉冲响应(RIR)数据集普遍存在元数据异构、命名不一致、空间坐标缺失以及文档不完整等问题,导致研究可重复性差和跨数据集比较困难。这些局限性阻碍了声学测量、空间音频和语音处理等领域的发展。
本文提出UPV_RIR_DB,一个结构化的RIR数据库,通过层次化目录组织和标准化元数据模型来解决上述问题。创新点包括:采用显式空间坐标记录源-接收器位置,提供详细获取参数和硬件描述,并引入中央索引链接每个RIR文件到其实验上下文,确保可追溯性和可重复分析。数据库设计兼容MATLAB和JSON工作流,促进数据共享和重用。
UPV_RIR_DB包含166个多通道RIR文件,测量于西班牙瓦伦西亚理工大学的三个房间,覆盖多个源-接收器对,总计18,976个单脉冲响应。每个房间的元数据文件记录了获取参数、空间几何和声学指标(如混响时间)。数据库已公开在Zenodo平台,支持声学研究应用。
UPV_RIR_DB是一个设计精良的结构化RIR数据库,有效弥补了现有数据集的不足,为声学测量和空间音频研究提供了可重复、易访问的资源。
当前音频预训练领域面临的主要挑战是监督源的局限性:依赖弱、嘈杂且规模有限的标签(如现有音频 caption 数据集不超过百万对),导致模型碎片化,无法形成统一的表示来处理语音、音乐和环境声音的多样任务。这阻碍了通用音频理解模型的发展。
论文提出一个数据中心的范式来解决这一瓶颈: 1. 数据构建:利用高保真音频 captioner(Qwen3-Omni-Captioner)处理 CaptionStew 400k-subset,生成 SOTA-quality 的自然语言描述。 2. Unified Tag System (UTS):通过 LLM 解析 captions,构建首个统一标签系统(最多 3k 标签),自然连接语音、音乐和环境声音,提供强监督源。 3. 预训练目标比较:系统研究不同目标,包括判别式的多标签分类(MTC)和生成式的并行解码(PAR),以探索监督源的影响。
基于新数据源和 UTS 的实验表明: - UTS-trained 模型:在域外泛化(如语音/音乐任务)上优于基于 AudioSet 的 MTC 基线,尽管使用数据量减少 5 倍。 - SOTA-Caps-trained 模型:在大多数音频理解任务上 consistently 超越基线模型。 - 核心发现:监督源的质量和覆盖范围是音频预训练性能的主要驱动因素,而预训练目标的选择影响下游任务的 specialization。这证实了数据质量比数据量更关键。
该研究通过强化监督源和引入统一标签系统,为音频预训练提供了数据中心的解决方案,有望推动通用音频表示学习的统一和发展。
论文针对多模态对话情感识别(MCER)中的两个主要问题:1. 音频和视频模态因环境噪声和采集条件限制而包含过多噪声,导致特征失真;2. 不同模态间数据质量和信息承载能力不平衡,特别是文本模态在情感理解中的主导作用被现有方法忽视,导致融合阶段的信息扭曲和权重偏差。
提出一种基于关系图的微分去噪和扩散注意力融合模型: 1. 微分Transformer:通过显式计算两个注意力图之间的差异,增强时间一致信息并抑制时间无关噪声,有效对音频和视频模态进行去噪。 2. 关系子图构建:构建模态特定和跨模态关系子图,捕捉说话者依赖的情感依赖,精细建模模态内和模态间关系。 3. 文本引导的跨模态扩散机制:利用自注意力建模模态内依赖,并自适应地将视听信息扩散到文本流中,实现更鲁棒和语义对齐的多模态融合。
在多个真实世界数据集(如IEMOCAP和MELD)上进行实验,结果显示该模型优于现有最先进方法,显著提高了MCER的鲁棒性和准确性。具体性能提升体现在抑制噪声干扰和缓解模态不平衡问题上。
该模型通过创新的微分去噪和文本主导的扩散融合,有效解决了MCER中的关键挑战,为多模态情感识别提供了更鲁棒的解决方案。
全双工语音语言模型(SLMs)的发展受限于高质量、多说话者对话数据的稀缺,现有大规模资源主要是单说话者或量少。自然对话中的重叠、回话等复杂动态处理困难,标准处理管道存在对话标注错误和ASR幻觉。
提出了Sommelier,一个稳健、可扩展的开源音频预处理管道,专为全双工SLMs设计。关键创新包括:模块化框架,处理音频标准化、VAD、说话者对话、重叠分离(通过相似性计算和分离模型)、背景音乐去除(选择性使用PANNs和Demucs),以及基于集合的ASR(使用ROVER和重复过滤)以减少幻觉。强调保留对话动态如重叠和回话,而非剥离它们。
通过在全双工模型Moshi上微调使用Sommelier处理的数据(83小时),并在Full-Duplex-Bench上评估,结果显示多项指标改进,例如在停顿处理、对话流暢性和中断处理上优于基线(见表1)。其他实验验证了对话准确性(Sortformer优于pyannote)、重叠分离音频质量提升(见表3),以及ASR准确性提高。
Sommelier是一个创新的数据预处理管道,有望缓解全双工SLMs的训练数据瓶颈,支持更自然的人类-计算机语音交互。
传统语音情感识别(SER)与自动语音识别(ASR)集成方法面临关键问题:特征融合存在性能瓶颈,多任务学习(MTL)因ASR(追求情感不变表示)和SER(依赖副语言可变性)目标冲突导致优化干扰。此外,使用域外ASR知识会引发领域不匹配,削弱SER性能。
提出AdaLTM框架:基于WavLM-Large预训练模型,从域内ASR和SER微调模型中提取任务向量,通过自适应层间可学习系数(如λ参数)将任务向量合并到冻结的基础模型中。该方法避免梯度干扰,实现语言与副语言知识的深度感知平衡。
在MSP-Podcast数据集上的实验表明,AdaLTM在双向量合并设置下达到未加权平均召回率(UAR)38.94%和宏观F1分数35.20%,优于MTL基线。域内ASR知识显著提升性能,验证了领域一致性的重要性;自适应层间合并策略优于全局合并。
该研究通过创新任务向量合并框架,有效解决了ASR和SER集成中的优化冲突和领域不匹配问题,为语音情感识别提供了新思路。
现有多通道语音增强和分离方法主要是判别式模型,虽然在信噪比(SNR)上表现出色,但会引入非线性失真,导致语音不自然、感知质量下降和可懂度降低,尤其在低信噪比环境中更明显。生成式方法(如扩散模型)能改善感知质量,但客观指标往往不如判别式方法。
论文提出Uni-ArrayDPS,一个统一的扩散优化框架,用于多通道语音增强和分离。关键创新包括: - 利用预训练的清洁语音扩散模型作为先验,无需额外训练或微调(训练免费)。 - 框架是生成式、阵列无关的,支持增强和分离任务,泛化性强。 - 方法基于扩散后采样(DPS),使用判别式模型的输出来估计噪声空间协方差矩阵(SCM),然后计算似然以优化清洁语音源。 - 通过结合判别式和生成式输出(如插值)进一步提升性能。
实验显示,Uni-ArrayDPS能持续改进多种判别式模型,在增强和分离任务中显著提升感知质量、可懂度和自动语音识别(ASR)性能。在真实世界数据集上也报告了强结果,验证了其有效性。
这是一个创新的训练免费生成式方法,统一了多通道语音处理的优化,有效平衡了客观指标和感知质量。
自动抑郁检测模型在半结构化临床访谈中面临系统偏见问题:模型可能仅利用访谈者提示(interviewer prompts)而非参与者语言进行预测,导致性能膨胀和缺乏可解释性。这种偏见源于访谈脚本的一致性,使得模型可以利用固定提示和位置作为捷径,而非从参与者语言中学习真正的语言线索。
论文通过分析三个数据集(ANDROIDS、DAIC-WOZ、E-DAIC)量化了这种提示诱导偏见(prompt-induced bias)。研究方法包括: - 数据准备:为缺乏完整转录的数据集(ANDROIDS 和 E-DAIC)使用 WhisperX ASR 管道生成自动转录。 - 模型架构:使用两种模型家族(Longformer 和 GCN)以测试偏见的模型无关性。 - 实验设置:训练和评估参与者-only(P)和访谈者-only(I)模型变体,直接比较其对抑郁检测的贡献。 - 定量和定性分析:通过 F1 分数评估性能,并通过热图等可视化工具分析决策证据的分布。
实验结果在表1和表2中报告: - 在多个数据集上,访谈者-only 模型常匹配或优于参与者-only 模型。例如,在 ANDROIDS 上,I-Longformer 达到 0.98 宏平均 F1 分数,而 P-Longformer 为 0.79。 - 这种偏见是跨数据集的(出现在 ANDROIDS、DAIC-WOZ、E-DAIC 中)和模型无关的(在 Longformer 和 GCN 中都观察到)。 - 定性分析显示,I-模型将决策证据集中在狭窄的访谈段(如特定提示位置),而 P-模型更广泛地分布在参与者语言中。 - 测试集结果(表2)进一步确认了偏见的存在,表明在现实条件下模型性能可能被高估。
这项研究突出了在自动抑郁检测中谨慎处理访谈者提示的重要性,强调需要确保模型从参与者语言中学习,以避免利用脚本 artifact 导致的偏见,从而提高模型的可靠性和可解释性。
X-OPD 是一种创新的训练框架,通过在线策略蒸馏有效对齐语音和文本模态的能力,为下一代智能语音交互模型提供了高效且低成本的解决方案。
构音障碍语音数据有限,导致跨语言检测成为一个重要但具有挑战性的问题。语音表示(如自监督学习模型提取的特征)往往编码语言依赖的结构,这可能会干扰跨语言的构音障碍检测,特别是在帕金森病语音分析中。
提出了一种表示级的语言移转(LS)方法,通过基于质心的向量适应来对齐源语言和目标语言的语音表示分布。该方法使用健康控制(HC)语音计算语言质心,然后调整源语言表示以减少语言依赖的变异,而无需重新训练底层语音模型。这种方法直接在表示空间操作,简单且高效。
在捷克语、德语和西班牙语的帕金森病语音数据集上评估,使用口述DDK录音。在跨语言设置中(目标语言帕金森病语音不可用),LS显著提高了敏感性和F1得分(例如,使用HuBERT模型,敏感性和F1分别从0.35/0.74提升到0.93/0.74等)。在多种语言设置中(目标语言帕金森病语音可用),LS也带来了较小但一致的性能增益。表示分析显示LS减少了嵌入空间中的语言身份,支持其移除语言依赖结构的解释。
该研究创新地提出了一种轻量级的跨语言适应方法,有效缓解了语言依赖变异对构音障碍检测的干扰,提升了模型在跨语言和多语言场景中的泛化能力。
现有的歌唱声音合成方法在歌词编辑时面临挑战:要么依赖于周围上下文恢复旋律,提供有限的控制(如上下文学习策略);要么需要手动对齐歌词和旋律注释(如商业SVS工具),这增加了工作负担、限制了灵活性和可扩展性。现有方法如Vevo2在旋律保持和歌词遵从性上表现不足,SoulX-Singer仍需手动对齐,阻碍了歌唱声音编辑的广泛应用。
YingMusic-Singer通过创新的扩散模型架构和强化学习优化,显著提升了歌唱声音编辑的灵活性、可控性和性能,有效解决了现有方法在无对齐旋律保持和歌词修改中的核心挑战。
判别式多通道语音增强模型(如基于深度学习的波形或STFT域模型)虽然在客观指标(如信噪比)上表现优异,但在处理挑战性环境噪声(如低信噪比条件)时,常因回归目标和神经网络非线性引入失真,导致感知质量下降,并可能对下游任务(如自动语音识别,ASR)产生负面影响。现有方法多为固定阵列设计或需要重新训练,限制了通用性。
论文提出ArrayDPS-Refine,一个无需训练、生成式、阵列无关的精炼方法,用于增强任何判别式多通道语音增强模型的输出。其核心创新包括: 1. 训练免费生成精炼:直接利用预训练的干净语音扩散先验,无需对判别式模型进行微调或重新训练。 2. 噪声空间协方差矩阵(SCM)估计:首先从判别式模型增强的语音和原始嘈杂混合信号中估计噪声SCM,以提供准确的似然指导。 3. 基于ArrayDPS的扩散后采样:结合估计的噪声SCM,在扩散后采样框架中进行似然计算,从而实现从判别式输出到更高质量语音的生成式优化。该方法扩展了ArrayDPS,首次应用于多通道语音增强的精炼任务。
ArrayDPS-Refine在多个判别式模型上(包括最先进的波形和STFT域模型)进行了评估,结果表明: - 一致性能提升:在可理解性(如STOI)、质量(如PESQ)和词错误率(WER)指标上均实现显著改善。 - 超越SOTA:作为第一个多通道生成方法,在某些场景下能够超越最先进的判别式模型。 - 减少失真:通过音频演示(提供在线链接)证实,能有效减少判别式模型引入的失真,提高感知质量。
ArrayDPS-Refine是一个创新的、训练免费的生成式精炼框架,通过巧妙结合扩散模型和噪声SCM估计,成功解决了判别式多通道语音增强中的失真问题,推动了该领域向更高感知质量的进展。
论文指出,当前口语对话系统中的中断检测存在两大问题:一是基于语音活动检测的方法过于"trigger-happy",容易将用户的反饋语误判为中断,导致系统不当中断;二是端到端模型虽鲁棒但延迟高,无法及时响应用户中断意图。此外,领域内缺乏基于真实对话的基准和整体评估指标,阻碍了研究进展。
论文提出一个综合框架以解决上述限制: - SID-Bench:首个完全基于真实世界人类对话构建的语义感知中断检测基准,包含中英文数据,覆盖中断、反饋语和噪声场景,提供语义和时序精准标注。 - APT(Average Penalty Time)指标:一种复合评分指标,通过为误报和延迟响应分配时间惩罚,精确量化响应性与鲁棒性的权衡。 - LLM-based检测模型:采用"大规模预训练加少样本微调"范式,利用LLM语义分析能力捕捉意图的细微线索,优化中断检测。
在SID-Bench上的评估显示,所提模型显著优于主流基线方法,APT降低了近三倍,成功平衡速度与稳定性,确立了新的state-of-the-art性能。
该论文通过引入真实数据基准、综合评估指标和高效LLM模型,有效解决了口语对话系统中长期存在的中断检测挑战,推动了自然全双工交互的发展。
开源文本到语音(TTS)框架在低资源语言(如罗马尼亚语)上的适用性有限,面临双重挑战:高质量训练数据稀缺和先进架构的高计算需求。这导致工具链设置复杂、数据预处理困难,以及计算效率低下,阻碍了在资源受限环境中的广泛采用。
本研究采用实践性评估方法,系统比较了四个广泛采用的开源TTS架构:FastPitch、VITS、Grad-TTS和Matcha-TTS。评估维度包括定性方面(如安装便捷性、数据集准备和硬件要求)和定量方面(如合成质量)。通过客观指标和主观听力测试,评估生成语音的可理解性、说话者相似性和自然度,以提供可复现的协议和评估标准。
结果显示,在工具链设置、数据预处理和计算效率方面存在显著挑战,影响了低资源语境下的采用。合成质量评估揭示了在罗马尼亚语上的性能瓶颈,包括可能的发音错误和不自然的韵律,突出了开源工具在语言多样性支持方面的不足。
这项研究为低资源语言TTS开发提供了实用的指导,并强调了开源工具在普及性和可访问性方面的改进空间,促进了更包容、语言多样的语音合成研究。
个体头相关传递函数(HRTF)对准确的空间音频双耳渲染至关重要,但传统获取方法需要消声室、扬声器阵列和专用设备,成本高且不易访问。现有个体化方法在准确性、成本和用户努力之间权衡,缺乏可广泛部署的解决方案。
本研究探索使用消费级硬件(如iPhone)进行摄影测量重建(PR)3D头部和耳朵网格,结合Mesh2HRTF工具合成个体HRTF。方法基于SONICOM数据集,处理150名对象的72张图像,使用Apple的Object Capture API生成PR网格,并通过数值评估、听觉模型和行为实验与测量HRTF、高分辨率3D扫描HRTF、KEMAR和随机HRTF比较。
PR合成HRTF在互耳时间差(ITD)线索上保持良好,但互耳电平差(ILD)和光谱错误增加。听觉模型预测和行为实验显示,与测量HRTF相比,PR HRTF导致更高的象限错误率、降低的高度准确性和更多的前后混淆,在感知指标上表现甚至比随机HRTF差。结论是当前摄影测量管道支持个体HRTF合成,但受限于耳廓形态细节不足和高频光谱保真度,影响单耳线索的准确性。
该方法为个体HRTF合成提供了一种基于消费硬件的可访问基线,但当前技术限制导致感知性能不佳,需要进一步改进以提升实用价值。
现有音频字幕数据集(如AudioCaps、WavCaps等)面临三大问题:数据规模有限(通常手动标注,仅有数千样本)、描述粒度粗(通用性描述,缺乏细粒度细节)、来源单一(主要依赖特定领域如AudioSet),这限制了大型音频-语言模型(LALMs)在多样化和真实世界音频理解任务中的泛化能力。
提出ACA VCaps数据集,源自ACA V100M音频集。创新点在于采用多专家分析管道:使用专家模型从语音、音乐和声学属性等角度分析音频,再通过链式思考(CoT)增强的大型语言模型(LLM)合成丰富、细粒度的描述,从而生成大规模(13.0千小时,4.7百万样本)、多领域(覆盖语音、音乐、声音事件及其组合)的高质量字幕数据。
在音频字幕任务上,预训练于ACA VCaps的模型在MECAT-Caption基准测试中取得DATE分数60.9,显著优于其他数据集(如AudioSetCaps的37.4)。下游泛化任务中,模型在语音识别(AISHELL-2等)、声音事件分类(VGGSound)、音乐分析(NSynth)和情感识别(IEMOCAP)等多个任务上表现更佳,验证了数据集的泛化能力。
ACA VCaps通过结合大规模、多专家分析和LLM合成,提供了一个突破性的音频字幕资源,显著提升了音频理解模型的性能和实用性。
该研究提出了一种高效且泛化性强的掩码策略 DWM,为基于掩码预测的音频表示学习提供了实用指导,平衡了性能与计算成本。
该方法通过自回归引导贝叶斯跟踪,有效解决了动态场景中的说话者提取问题,在保持计算效率的同时提升了增强性能。
Speech Emotion Recognition (SER) 在现实世界场景中面临两大主要挑战:严重的类不平衡(例如,某些情感类别样本稀少)和自然、自发语音的普遍存在。现有方法通常只在最终分类层应用监督信号,这限制了中间表示的判别能力,导致模型在自然和不平衡条件下性能下降。
论文提出 Crab(Contrastive Representation and Multimodal Aligned Bottleneck),一个双模态 Cross-Modal Transformer 架构,集成自监督学习模型:使用 WavLM 提取语音表示和 RoBERTa 提取文本表示。核心创新是 Multi Layer Contrastive Supervision (MLCS),在网络多层(而不仅是最终层)注入多正对比学习信号,鼓励情感判别性表示,且不在推理时引入额外参数。此外,采用加权交叉熵损失以缓解数据不平衡问题。
在三个基准数据集上评估:IEMOCAP(提示/表演语音)、MELD(弱提示)和 MSP-Podcast 2.0(自然语音)。实验结果显示,Crab 在 Unweighted Average Recall 和 Weighted Average Recall 指标上 consistently 优于强单模态(如仅用 WavLM)和多模态基线(如传统 CMT 方法),在自然和高度不平衡条件下提升尤其显著。
该论文通过引入多层对比监督策略,提供了一种高效且 robust 的 SER 方法,能有效处理自然和不平衡语音数据,推动了多模态情感识别领域的发展。
音乐生成技术的进步使得合成音乐更加逼真,导致音乐生态系统的完整性和来源面临挑战,如冒充和欺诈行为。现有音乐 deepfake 检测数据集存在不对称性(如领先静音),导致模型学习捷径特征,泛化能力差,在未见过的生成器或不同预处理管道上性能下降显著。
论文引入 Echoes 数据集,具有语义对齐和高提供商多样性,以促进鲁棒检测器的发展。语义对齐通过条件生成音频样本来实现:直接使用真实波形或通过 LLM 生成歌曲描述来提示音乐生成系统,确保伪造音频与真实参考在语义级别对齐。数据集覆盖 10 个流行音乐生成提供商,包括文本到音频和音频到音频模型,以防止捷径学习并提高泛化能力。
在跨数据集评估中,使用 Wav2Vec2 XLS-R 2B 表示作为基线,结果显示:Echoes 是 in-domain 最难的数据集(EER 9.36%),比 AIME(6.40%)、SONICS(2.06%)和 FakeMusicCaps(8.61%)更具挑战性。训练在现有数据集上的模型在 Echoes 上转移性能差(EER 高达 41.7%),而训练在 Echoes 上的模型在其他数据集上泛化最好,平均 EER 21.0%,并在 AIME 和 SONICS 上取得最佳转移性能。
Echoes 通过语义对齐和提供商多样性填补了音乐 deepfake 检测数据集的空白,提供了一个挑战性的基准,有助于开发更鲁棒和可转移的检测器。
论文通过创新的零样本后融合方法,有效结合了 ALMs 的语义理解和 FMs 的专业能力,为语音情感识别任务提供了新的 SOTA 基准。
论文指出,情感计算中广泛使用的分类情感标签(如Ekman的基本情感,包括happy、sad、anger)掩盖了情感的细微差别、模糊性和主观性。这导致系统不确定性高,应用领域受限,尤其是在处理情感模糊性、混合情感、跨模态不一致和注释者分歧时。分类标签的刚性边界与情感的动态、模糊本质不匹配,挑战了基于单一分类标签的"地面真值"概念。
论文主张采用连续维度模型(如效价、唤醒和优势,VAD)以更准确地捕捉情感的连续性。提出使用软标签技术、分布模型、模糊分类器和情感分析框架来处理情感模糊性,例如通过多任务学习模型学习注释者特定的标签分布。强调从分类标签转向分布表示,以保留情感的内在模糊性和多样性,从而提高系统的解释性和伦理部署。
基于对IEMOCAP等数据集的批判分析,论文显示分类标签与VAD值之间存在显著偏差,注释者分歧常见(例如,多数投票掩盖了分歧)。新兴方法如分布模型能更好地处理模糊性,提高召回率和解释性。论文引用相关研究(如软标签技术和模糊分类器)支持连续和分布表示的优势,但实验细节因内容截断而不完整。
这篇论文为情感计算领域提供了深刻的批判视角,推动从刚性分类向灵活、连续的情感建模转变,有望提升系统真实性和伦理兼容性。
大型音频语言模型(LALMs)的性能依赖于音频编码器的语义丰富性,但当前大多数先进LALMs仅使用有限选择(如Whisper)的预训练音频编码器,导致架构多样性瓶颈和集成差距,影响模型的通用理解和生成能力。
论文提出Interspeech 2026 Audio Encoder Capability Challenge,通过XARES-LLM框架提供统一的生成评估。该框架使用预训练音频编码器作为前端,结合LLM解码器(如SmolLM2-135M),通过训练轻量投影层(如MLP和LoRA)进行连接,评估编码器在分类(Track A:如关键词识别、情感分析)和理解(Track B:如语音转录、音频描述)任务中的表现。挑战设计包括开发轨道(Track A、B)和隐藏轨道(Track A Hidden、B Hidden),以标准化的方式解耦编码器开发与LLM微调。
在Track A(分类任务)中,THU-Voice以平均分91.2%领先,在ASV2015和VoxCeleb1-Bin等任务中表现优异,显示其强大的音频特征提取能力;THU-HSCI-2以90.8%紧随其后,在FSD50k和GTZAN Genre等任务中突出。Track B(理解任务)中,trans-encoder以平均分65.9%最高,在语音转录和音频描述任务中表现稳健。XARES-LLM框架确保了结果的稳定性和可复现性,硬件差异对排名影响小于1%。
该挑战通过创新的生成评估框架,有效推动了音频编码器技术的标准化和性能提升,为下一代多模态语言模型的发展奠定了重要基础。
对话自动语音识别(CASR)在处理重叠语音、远场噪声和可变说话者数量时仍然具有挑战性。传统评估指标如词错误率(WER)及其变体(如 tcpWER)无法有效捕捉语义错误,并且对重叠区域的识别性能缺乏细粒度分析,限制了系统比较的准确性。
论文引入了两个关键创新评估指标: 1. tcpSemER:扩展时间约束最小排列词错误率(tcpWER),使用基于嵌入的语义相似性(如 MiniLM-L12v2)替代 Levenshtein 距离,以衡量语义错误率,更关注意义改变的错误。 2. 重叠感知分解:将 tcpWER 和 cpWER 分解为重叠(E_ov)和非重叠(E_1spk)部分,支持独立评估不同区域的识别性能,并提供标准化版本以隔离固有难度。
在三个数据集(Mixer-6、NOTSOFAR-1、DiPCo)上系统比较了基于 LLM 的系统(包括任务特定 LLM 如 VibeVoice 和 Voxtral Mini Transcribe v2,以及通用多模态 LLM 如 Gemini 3.0 Flash)和模块化流水线系统(如单通道 DiCoW 和多通道 NTT CHiME-8)。主要发现: - 基于 LLM 的系统在双说话者设置(如 Mixer-6)中表现竞争性,但随着说话者数量和重叠增加(如 DiPCo),性能显著下降。 - 模块化流水线系统在复杂场景中更稳健,特别是在多通道配置下。 - 新指标 tcpSemER 对文本规范化方案更鲁棒(相对变化 3-21% vs. tcpWER 的 17-56%),能有效区分语义和表面错误。
该论文通过提出语义和重叠感知指标,为对话 ASR 系统评估提供了更全面和鲁棒的框架,有助于揭示不同方法的优劣并推动领域进步。
自动语音识别 (ASR) 系统在安全关键领域(如自动驾驶、医疗)部署增加,但易受对抗攻击,可能导致严重后果。现有防御方法如输入变换和对抗训练有局限性:输入变换可能被攻击者适应并引入延迟或感知伪影;对抗训练计算成本高、可扩展性差,且常降低良性输入性能。检测方法如 Noise Flooding 计算昂贵,其他方法依赖模型内部信息或对良性变化敏感。
提出 Precision-Varying Prediction (PVP) 方法,通过改变 ASR 模型推理时的数值精度(如 FP32、FP16、BF16)来增强对抗鲁棒性。核心创新包括: 1. 随机精度采样:在推理时随机切换精度,使针对特定精度优化的对抗示例失效,提高鲁棒性。 2. 精度多样性检测:评估输入在多种精度下的转录,计算精度多样性评分(基于词错误率),使用高斯分类器区分对抗示例。方法无需重新训练、模型无关、高效,适用于 Green AI 部署。
实验使用多种 ASR 模型(CTC、seq2seq、Transformer、Whisper)和攻击类型(Carlini & Wagner、Psychoacoustic),在 LibriSpeech 数据集上进行。结果: - 鲁棒性提升:随机精度采样显著降低攻击成功率,良性输入性能无退化。 - 检测性能:精度多样性检测在多种模型和攻击上表现竞争,能可靠识别对抗示例。 - 自适应攻击评估:针对多精度优化攻击,PVP 仍保持有效性。
PVP 是一种简单、训练无关的方法,有效增强 ASR 系统对抗鲁棒性和检测能力,具有实际应用潜力。
当前方法如物理感知方向感知神经声场(PI-DANF)在插值一阶Ambisonics(FOA)房间脉冲响应(RIR)时,通过软惩罚项将神经网络输出正则化以遵循物理原理(如线性动量方程)。然而,PI-DANF的预测结果仍可能偏离物理方程,无法保证严格遵循,导致在测量数据有限时重建精度受限。
本研究提出速度势神经场(VPNF),通过建模单通道速度势函数来重构FOA信号。VPNF使用神经网络近似速度势函数,然后通过自动微分计算其对时间和麦克风位置的偏导数,直接得到FOA的四个通道(声音压力和粒子速度)。这种方法确保重构的FOA信号在任意时间和位置自动满足线性动量方程,无需额外惩罚项。此外,VPNF可加入基于波方程的软惩罚项以进一步正则化。网络架构采用改进的多层感知机(MLP)和SIREN激活函数,优化时结合数据保真度损失和物理损失。
实验在模拟的FOA RIR数据集上进行,使用HARP1工具生成10个随机房间的早期反射数据。评估设置包括从稀疏测量(如30-200个位置)重构RIR。VPNF与基准方法(如普通神经场和PI-DANF)比较,结果显示在测量数据较少时,VPNF在重构精度和物理一致性方面表现更优,确认了其有效性。实验还表明VPNF+变体(通过修改网络参数化)进一步提升了性能。
VPNF通过严格整合物理原理到神经网络设计中,显著提高了一阶Ambisonics房间脉冲响应插值的准确性和效率,尤其是在数据有限场景下。
该语料库为自然环境下动态语音情感识别研究提供了宝贵资源,填补了现有数据集的空白,有望推动情感计算领域的发展。
现有 Spoken Dialogue Models (SDMs) 缺乏时间意识,难以遵循明确的时长指令(例如生成约15秒的响应),这限制了在语音助手等现实应用中的交互质量和实用性,因为控制响应时长对于提升用户体验至关重要。
提出 TiCo,一个两阶段后训练框架:第一阶段通过自我生成与 Spoken Time Markers (STMs) 训练模型的时间意识,使模型能估计已用时长;第二阶段使用强化学习与可验证奖励来优化时长控制,使模型在生成过程中实时调整响应以满足目标时长,同时保持响应质量。
通过 TiCo-Bench 评估,TiCo 显著提高了 SDMs 对时长约束的遵守率,实验结果表明响应质量得以保持,并且该方法能够泛化到训练中未见的时长范围。
TiCo 提供了一种简单高效的后训练方法,有效解决了 SDMs 中时间可控性的挑战,具有实际应用潜力。
THz 通信系统面临高路径损失、分子吸收和大气湍流等挑战,导致信道估计困难。传统训练-based 方法需要大量导频,降低频谱效率;盲估计方法计算复杂度高且收敛不稳定。
通过广泛模拟,使用高分辨率传输(HITRAN)数据库的实际 THz 信道,评估了所提 MU-WD-SB 方案在 NMSE、误码率(BER)和频谱效率(SE)方面的性能增益,优于传统训练-based 和其他半盲学习技术。
该论文创新性地将半盲学习应用于 THz 大规模 MIMO 系统,有效降低了训练开销并提高了信道估计准确性,为下一代无线通信提供了实用解决方案。
跨说话者风格转换中,现有方法常出现说话者泄漏问题,即参考说话者的音色被错误捕获,导致身份不匹配和性能下降。此外,需要外部预训练说话者或情感编码器,且高质量表达性数据稀缺,限制了模型的应用和自然度。
SelfTTS提出以下创新点: 1. 多正对比学习(MPCL)损失:用于诱导说话者和情感嵌入的聚类表示,基于标签生成有效集群,无需复杂批处理流程。 2. 显式嵌入解缠:结合梯度反转层(GRL)和余弦相似度损失,直接作用于说话者和情感嵌入,去除重叠信息,确保鲁棒的跨说话者风格转换。 3. 自我增强策略:利用模型基于VITS架构的固有语音转换能力,通过自我增强生成合成数据,提升合成语音的自然度,同时保持情感表达和目标音色。
实验结果表明,SelfTTS在情感自然度(eMOS)和稳健稳定性(目标音色和情感)方面优于最先进的基线模型。评估包括跨语料库实验,使用公开数据集和代码验证了方法的有效性。
SelfTTS是一个创新的文本到语音模型,通过有效的解缠和增强技术,显著提升了跨说话者风格转换的质量和自然度,无需依赖外部编码器。
现有Wi-Fi手势识别方法主要基于双基地传感,分析信道状态信息(CSI)模式,但缺乏精确空间信息(如距离),导致对环境变化、设备部署和多目标移动高度敏感。在控制环境中有效,但在真实世界、拥挤的公共场所中性能显著下降,无法区分前景手势和背景运动。
WiRD-Gest提出一种新颖的单基地Wi-Fi传感系统,使用单个未修改的商用现成(COTS)设备(如笔记本电脑)提取Range-Doppler(RD)信息。关键创新包括: - 全双工单基地管道,在单设备上实现自包含传感,无需硬件修改,同时保持正常Wi-Fi通信。 - 利用RD地图作为输入数据,提供空间维度信息,提高鲁棒性和泛化能力。 - 开发同步和自干扰消除算法,确保高保真RD估计。 - 首个基于RD数据的Wi-Fi单基地传感深度学习基准,评估多种模型(如CNN2D+RNN/GRU/LSTM、3D CNN、Video Transformers)。
WiRD-Gest是首个在COTS设备上实现单基地Wi-Fi手势识别的实用系统,通过引入空间信息,显著提高了在真实世界环境中的准确性、鲁棒性和泛化能力。
联邦学习(FL)与自监督学习(SSL)结合用于语音任务微调时,面临显著异构性挑战:系统异构性(客户端计算能力差异大,导致straggler效果和资源浪费)和任务异构性(下游语音任务如自动语音识别和关键词检测需要不同表示深度,统一全模型更新效率低下)。
在五个下游语音任务上评估:自动语音识别(ASR,LibriSpeech)、关键词检测(KWS,Google Speech Commands)、情感识别(ER,IEMOCAP)、说话人识别(SID)和自动说话人验证(ASV,VoxCeleb1)。使用Wav2Vec 2.0 Base作为骨干,实验设置包括集中式训练、同质联邦学习和异质联邦学习场景。结果表明,框架在资源约束的联邦环境中显著减少计算开销,支持异构硬件,并在保持竞争性能的同时优化收敛。
该研究通过创新的自适应早期退出和层级聚合机制,有效平衡了联邦语音学习中的效率与性能,为异构环境下的隐私保护微调提供了实用解决方案。
现有语音深度伪造源验证系统通常假设源嵌入独立于说话人特征,但此假设未经验证。说话人特征与合成痕迹纠缠,导致模型依赖说话人线索而非源证据,引发捷径学习,降低了源验证的鲁棒性和泛化能力。
论文提出一个说话人解缠度量学习(SDML)框架,集成两种新颖损失函数: - ChebySD-AAM:基于切比雪夫多项式近似,解决标准AAM-Softmax的梯度不稳定问题,并引入阈值化说话人自适应边际来减少说话人信息。 - RiemannSD-AAM:将源和说话人嵌入投影到双曲空间,利用黎曼度量距离建模复杂分布,以更好解缠说话人特征并学习更具区分性的源特征。
在MLAAD基准测试中,使用四种新提出的协议(针对源-说话人解缠场景)评估SDML框架。结果显示,RiemannSD-AAM在所有测试模型(如ECAPA-TDNN、ResNet34、AASIST、Mamba)中表现最佳,显著降低等错误率(EER)并提高AUC值,表明方法有效提高了源验证性能。
该研究首次结合切比雪夫多项式和黎曼度量学习,提出一个创新的说话人解缠框架,显著增强了深度伪造源验证的鲁棒性和准确性。
DiT-Flow通过流匹配、潜在空间技术和参数高效适应,为多失真语音增强提供了一个高效、鲁棒且可扩展的解决方案。
核心痛点 低资源语言如台湾台语(Taiwanese Hokkien/Southern Min)在语音技术中代表性不足,尤其是在老年人中缺乏真实世界意图识别数据集。台语主要口语化,缺乏标准书写系统,导致可靠自动语音识别(ASR)系统不可用,限制了医疗保健和家庭助手等场景的实用口语语言理解(SLU)系统开发。
方法创新 引入了TaigiSpeech数据集,包含21位老年人(年龄54-78岁)的3,079条真实世界话语,涵盖8个意图类别(4个紧急意图和4个非紧急意图)。为解决标注数据稀缺,探索了两种可扩展的数据挖掘策略:1) 关键词匹配挖掘,利用中间语言(如中文)的副标题通过大语言模型伪标签;2) 音频-视觉挖掘,利用多模态线索最小化文本监督。这些方法支持低资源和无书写语言的数据集构建。
实验结果 评估了轻量级神经网络和自监督学习(SSL)语音模型等基线模型。实验结果显示,在挖掘数据上训练的模型在真实世界老年人录音上评估时性能显著下降,表明域不匹配,突出了现实部署的挑战。这强调了TaigiSpeech作为低资源SLU现实基准的必要性。
一句话评价 这项研究为低资源语言口语理解提供了宝贵的真实世界数据集和实用数据挖掘方法,同时揭示了现实世界部署中的域不匹配问题,促进了老年友好技术的开发。
音频表示学习通常孤立地评估设计选择(如输入前端、序列主干和序列长度),但这些轴是耦合的,导致结论不通用。纯注意力模型在长序列上面临二次方计算复杂度和内存限制,而压缩前端(如mel-spectrograms)会丢失相位和精细时间细节,限制了模型性能。
引入HELIX控制实验框架,参数匹配在约8.3M参数,比较纯Mamba、纯注意力和一个最小混合模型(带单个注意力瓶颈)。混合模型结合原始波形前端、双向Mamba主干和单个全局注意力层,旨在隔离架构效应并提供全局交互能力。框架设计允许独立变化输入表示、主干家族和注意力比例,以研究它们之间的交互作用。
在六个数据集上的实验显示:输入表示的偏好取决于主干架构;注意力在短、静止音频任务中可能损害性能,但在长序列(如5分钟、30,000令牌)上变得关键。具体地,在5分钟说话人识别任务中,纯注意力模型因内存溢出失败,而HELIX混合模型在纯Mamba基础上弥补了11.5点的性能差距。结果表明,设计选择应根据任务和序列长度动态调整。
HELIX提供了一个控制框架,揭示了音频表示学习中设计选择之间的耦合,并通过混合Mamba-Attention架构有效扩展到长序列任务,为未来音频模型优化提供了指导。
长形式音乐生成面临两个主要挑战:1) 高计算和内存需求,因为音频表示序列长度与时间成正比,导致冗余和资源限制;2) 长期依赖建模困难,难以保持全局音乐连贯性和主题连续性。
论文提出 SqueezeComposer,一个简单而强大的策略:通过时间加速音频(如 2×、4×、8×)来减少序列长度和计算需求。具体来说,先在加速域生成音乐(使用扩散模型在 Mel 谱图上操作),然后恢复原速以恢复完整时间结构。这种方法模型无关,遵循从抽象到详细内容的层次生成原则,并能直接应用于现有音乐生成模型。
在以下两个任务上验证有效性:1) 长形式音乐生成(评估时间控制,包括续写、补全和从头生成);2) 全歌伴唱生成(评估音轨控制)。实验结果表明,该方法实现了高效、可扩展和高质量的长形式音乐生成,音频样本在指定网站可获取。
SqueezeComposer 提供了一种创新且实用的策略,通过时间加速有效缓解了长形式音乐生成的资源瓶颈,同时保持音乐质量。
大多数现有神经音频编解码器(如SoundStream、DAC、Encodec)专注于高保真重建,需要高帧率和比特率,忽略了跨多样音频域(语音、音乐、通用声音)的统一低帧率建模。此外,高重建质量不一定产生语义信息丰富的表示,限制了在下游基于大语言模型(LLM)的生成任务中的有效性。
提出OmniCodec,一个为低帧率设计的通用神经音频编解码器。关键创新包括: - 语义-声学解耦:利用预训练理解模型Qwen3-Omni-AuT-Encoder的音频编码器作为语义分支输入,实现语义和声学表示的分离,提升语义信息建模能力。 - 分层多码本设计:采用向量量化(VQ)和残差向量量化(RVQ)的分层结构,支持低帧率(12.5 Hz和6.25 Hz),适配LLM的令牌空间。 - 自引导策略:引入自引导损失,引导解码器处理量化令牌和连续预量化潜在表示时产生相似输出,提高码本利用率和重建质量。 - 纯因果感受野:模型设计支持流式处理和快速推理,适用于实时音频应用。
在LibriSpeech(语音)、GTZAN(音乐)和AudioSet(通用声音)数据集上进行评估,使用指标如PESQ-WB、STOI、Mel距离等。OmniCodec在相同比特率下,相比基线模型如Mimi codec、UniCodec和AUV,实现了显著更优的重建质量,并提供了更语义信息丰富的表示,有利于下游音频生成任务。例如,OmniCodec-32L在4400 bps比特率下,在语音、音乐和通用声音域均表现出色。
OmniCodec是一个创新的低帧率通用音频编解码器,通过语义-声学解耦和自引导机制,在重建质量和语义表示上均超越现有方法,为基于LLM的音频生成提供了高效的音频标记器。
Large Audio-Language Models (LALMs) 在指令跟随能力方面表现出下降,特别是在音频条件下。目前,LALMs 的上下文学习(ICL)能力在音频条件下尚未得到系统研究,存在显著的知识差距。
提出 ALICE(Audio-Language In-Context learning Evaluation)框架,一个三阶段评估方法,逐步减少文本指导:Stage 1(明确约束)、Stage 2(隐含约束)和 Stage 3(仅音频)。该框架通过控制音频输入和演示输出,隔离文本线索的贡献,以评估 LALMs 能否从音频条件下的示例中推断任务目标和生成正确格式的响应。
在六个 LALMs(包括 Qwen2-Audio、DeSTA2.5-Audio、BLSP-Emo、Qwen2.5-Omni、Phi-4-Multimodal 和 Gemini 2.5 Flash)上评估四个音频理解任务(ASR、SER、GR、MMAU)和两个输出约束类别(CEQ 和 CoT)。结果显示一致的对称性:上下文演示改善了格式遵从性(Format Compliance Rate),但未能改善甚至降低了核心任务性能(如 Word Error Rate 和准确性)。这表明 LALMs 能从演示中学习表面格式模式,但难以利用跨模态语义接地来可靠推断任务目标。
ALICE 提供了一个创新的系统框架,揭示了 LALMs 在跨模态上下文学习中的关键局限性,为未来模型改进和跨模态集成研究提供了重要见解。
听力障碍患者在全球范围内面临社交、认知和生活质量下降的挑战,传统助听器方法独立优化噪声减少(NR)和听力损失补偿(HLC),导致在复杂声学环境中表现不佳。现有深度学习(DNN)方法需要训练额外的听觉模型仿真器,缺乏可微分模型,限制了端到端优化和个性化应用。
提出端到端多任务学习框架,使用单个深度神经网络(DNN)预测两个时频掩码,分别对应 NR 和 HLC。集成固有可微分的听觉模型,允许通过指数调整掩码独立控制 NR 和 HLC 量,无需训练仿真器。听力图作为 DNN 输入,实现听者特异性个性化,无需为每个用户重新训练。
方法能独立调整 NR 和 HLC,客观指标优于单一训练目标优化。在性能上超过分别训练 NR 和 HLC 的两个 DNN 级联,并与传统助听器处方(如 FIG6)竞争。这是首个使用听觉模型为广泛听者配置文件训练单个 DNN 进行联合 NR 和 HLC 的研究。
该研究创新地结合多任务学习和可微分听觉模型,为个性化、可调整的助听器信号处理提供了高效端到端解决方案。
儿童语音分类研究受限,尤其对于低资源语言如阿拉伯语,缺乏公开、大规模、多样化的数据集。现有模型基于成人语音,难以泛化到儿童语音,因儿童语音具有独特的声学和语言特征(如声调高、发音不一致),且阿拉伯语音素间相似度高,加剧分类难度。
提出Abjad-Kids数据集,包含46,397个阿拉伯语儿童语音样本(来自3-12岁儿童,141个类别,覆盖字母、数字和颜色),所有样本在控制规格下录制(如2秒时长、16 kHz采样率)。设计分层音频分类方法,基于CNN-LSTM架构:采用两阶段策略,首先通过分组模型(静态基于语言学发音点分组或动态聚类分组)将相似类别分组,然后在每个组内使用专门分类器。此方法旨在减少类别混淆,应对高类内相似性和有限样本问题。
实验评估表明,静态基于语言学分组方法性能优于动态聚类分组。CNN-LSTM模型结合数据增强(如合成数据)有效提升分类效果,但大部分实验出现过拟合挑战,可能由于样本数量有限,即使使用数据增强和模型正则化。结果突显了数据稀缺对模型泛化的影响。
该研究通过引入Abjad-Kids数据集和创新的分层分类方法,为阿拉伯语儿童语音分类领域提供了宝贵资源和技术框架,有助于推动低资源语言教育技术发展。
LL-SDR 通过离散表示和解纠缠技术,提供了一个高效、低延迟的语音增强解决方案,在保持性能的同时显著降低延迟。
随着AI语音合成技术的快速发展(如仅需几秒参考音频即可克隆目标声音),合成音频在带来合法应用(如低带宽通信)的同时,也增加了恶意使用风险(如深度伪造、诈骗)。传统音频取证方法主要关注检测音频的真实性(真实 vs. 合成),但未能解决授权使用问题,即验证合成音频是否由合法身份驱动,这给语音认证、视频会议等场景带来了新的安全挑战。
论文提出了一个新颖的音频取证任务——音频头像指纹识别(Audio Avatar Fingerprinting),旨在验证合成音频是否由授权身份驱动。该方法扩展了现成的说话人验证模型(TitaNet),用于两个任务: 1. 真实 vs. 合成语音检测:利用TitaNet的嵌入空间,在未训练于合成音频的情况下,仍能有效区分真实和合成语音。 2. 音频头像指纹识别:通过微调TitaNet,学习说话风格特征(如个人特定说话习惯),以识别驱动语音的身份,而不依赖于声音的声学外观。 此外,由于现有数据集缺乏自重现(self-reenactment)和交叉重现(cross-reenactment)案例,论文引入了新数据集来支持此任务的训练和验证。
初步实验显示,TitaNet模型在标准合成语音检测任务中表现良好,即使训练时未接触过合成音频。对于音频头像指纹识别任务,通过微调,TitaNet嵌入空间能调整以有效识别驱动身份,表明该方法在区分自重现和交叉重现案例方面具有潜力。结果暗示了利用现有说话人验证模型进行音频取证的可行性。
这项研究首次将音频头像指纹识别引入音频领域,为合成音频的授权使用提供了创新解决方案,具有重要的实际应用价值和安全性提升潜力。
传统蚊子监测方法依赖陷阱和人工识别,慢、费力、难以扩展且暴露工作人员于感染风险。音频监测提供非破坏性、低成本、可扩展的替代方案,但在真实记录条件下,蚊子物种分类困难。蚊子飞行音调窄带、信噪比低、易被背景噪声掩盖,且流行病学相关物种录音有限,导致类不平衡。设备、环境、收集协议的变化增加鲁棒分类难度,模型可能依赖域特定特征而非物种相关声学线索,导致跨域泛化差,这是部署的主要瓶颈。
论文提出BioDCASE 2026跨域蚊子物种分类挑战的官方基线系统。使用log-mel频谱特征(重采样至8 kHz,FFT,64 mel频带)和轻量级多时间分辨率卷积神经网络(MTRCNN),具有主物种分类头和辅助域分类头。模型处理变长音频剪辑,通过动态填充和长度感知掩码实现,参数少(0.22百万),提供完全可复现的训练和测试脚本。评估基于seen和unseen域的平衡准确率(BA_seen和BA_unseen)及域偏移差距(DSG),以衡量跨域泛化而非仅域内识别。
在开发数据集上,基线系统在seen域上平衡准确率(BA_seen)为0.8806,在unseen域上(BA_unseen)为0.1751,域偏移差距(DSG)为0.7055。结果显示模型在已知域上表现强,但在未知域上显著退化,突显跨域泛化是核心挑战,而非域内识别。实验设置使用AdamW优化器,十次随机种子运行,报告均值和标准差。
该基线系统有效展示了跨域蚊子物种分类的泛化难题,为未来研究提供了清晰、可复现的基准,强调在真实部署中需关注域鲁棒性而非仅准确性。
现有文本到语音(TTS)系统在表达性语音合成中主要依赖文本或参考音频,缺乏对非语言手势线索的利用,导致语音韵律缺乏自然度和与手势的时间对齐,限制了在如配音、播客等应用中的有效性。传统方法忽略了手势作为丰富韵律来源的潜力,这是一个相对未探索的研究领域。
提出 Gesture2Speech,一个新颖的多模态 TTS 框架,利用手势作为控制信号来调制语音韵律。关键创新包括: - 多模态 Mixture-of-Experts (MoE) 架构:动态融合语言内容、音频特征和手势输入,通过专门专家模块(如语音 MoE、视频 MoE、全局 MoE)提取风格表示,实现细粒度控制。 - 手势-语音对齐损失:显式建模手势和韵律之间的时间对应关系,确保细粒度同步,增强表达性。 - LLM-based 语音解码器:以融合的风格表示和手势令牌为条件,生成时间对齐的表达性语音,结合 HiFi-GAN 声码器输出波形。 - 处理多模态输入:整合文本、参考音频和手势视频特征,使用 Perceiver 模块进行特征压缩和跨模态融合。
在 PATS 数据集上进行评估,Gesture2Speech 在语音自然度和手势-语音同步性方面优于最先进的基线方法。论文指出这是首次利用手势作为韵律控制信号在神经语音合成中,并提供了演示样本链接。
该研究开创性地将手势作为韵律控制信号引入神经语音合成,为多模态表达性 TTS 提供了新的方向,有望提升人机交互的自然度和实用性。
现有文本到语音(TTS)系统存在两个关键缺陷:1) 句子级控制缺乏全局连贯性,无法建模长上下文中的情感弧线、多说话者交互(如中断、重叠语音)等;2) 声音控制不完整,忽略声学场景(如背景噪声、环境效果),导致语音脱离真实世界上下文。这些限制了TTS在复杂、长音频场景中的应用。
论文提出Any2Speech(ATS)框架,针对无边界长音频合成。创新点包括: - 数据策略:采用“标注优于过滤/清洗”方法,保留噪声和复杂数据(如重叠语音、背景事件),并设计顶层-句子-令牌(Global-Sentence-Token)分层注释模式,以自然语言描述场景、情感、声学环境等维度。 - 模型架构:基于VibeVoice(支持长音频的连续标记器架构),引入链式思维(Chain-of-Thought)推理,将理解和合成分离为规划阶段和生成阶段,提升可解释性和全局连贯性;同时使用维度丢弃(Dimension Dropout)训练策略,增强对不完整指令的鲁棒性。 - 原生代理架构:Global-Sentence-Token注释模式作为结构化语义接口,将文本通道扩展为信息完整的宽带宽控制通道,支持从前端LLM代理将任意模态输入转换为生成命令,实现从Text2Speech到Any2Speech的范式扩展。
论文在vibevoice-7B模型上验证了方法:CoT和Dimension Dropout显著提升了复杂场景下的指令跟随能力和表达性。数据利用率超过90%(相比传统过滤方法的10-30%保留率),模型在噪声和复杂数据训练后表现出更好的生成质量和可控性。具体定量结果未在片段中详细给出,但强调了对全局连贯性和场景完整性的改进。
该工作通过分层注释和推理策略,推动了TTS向第四代原生代理和全场景建模的演进,为长音频合成提供了创新解决方案。
传统音频-视觉目标说话人提取(AV-TSE)系统通常深度集成音频和视觉特征,重新学习整个分离过程。然而,在野外音频-视觉数据集(如 LRS2)上,噪声和混响可能导致保真度上限,限制了分离质量,同时音频-only 模型存在排列歧义问题,无法自动识别目标说话人。
提出 Plug-and-Steer 框架,将分离和选择解耦。使用冻结的预训练音频-only 骨干网络(如 ConvTasNet、DPRNN)负责高保真分离,视觉模态仅用于目标选择。引入 Latent Steering Matrix(LSM),一个简约的线性变换,在骨干网络内重新路由潜在特征,通过视觉转向模块预测门控值,将目标说话人锚定到指定输出通道。该方法避免了重新学习分离过程,保留了音频骨干的声学先验。
在 LRS2-2mix 数据集上进行实验,使用四个代表性架构(ConvTasNet、DPRNN、TF-GridNet、MossFormer2)作为音频骨干。与基线 AV-TSE 方法相比,Plug-and-Steer 在 SI-SDRi、DNSMOS 和 NISQA 指标上实现了可比或更好的性能,特别是在感知质量上接近或超过原始音频骨干,同时提高了计算效率。实验验证了 LSM 在不同层中的有效性,并展示了在清洁和噪声预训练配置下的稳健性。
Plug-and-Steer 提供了一种高效且可扩展的方法,通过解耦分离和选择,利用预训练音频模型的优势进行目标说话人提取,减少了对噪声视觉数据的依赖,并促进了未来分离引擎的集成。
大音频语言模型(LALMs)推理时缺乏对音频输入的明确锚定,导致推理链可能不忠实于音频证据,主要依赖文本先验,影响可解释性和性能。
提出两阶段框架:第一阶段通过监督时间戳对齐(STA)学习音频段的时间定位;第二阶段使用基于奖励的优化(GRPO)将时间戳锚定集成到推理中,提升音频证据的引用。
在多个语音基准数据集上实验显示,时间戳锚定提高了准确性(如IoU和F1分数提升),增强了音频注意力、推理一致性和行为如区域探索。表1表明STA显著改善时间戳对齐性能。
该论文通过引入时间戳锚定机制,有效增强了LALMs推理的忠实性和可解释性,为多模态音频推理提供了新方向。
核心痛点: 尽管大语言模型(LLMs)常被用作大音频语言模型(LALMs)的知识骨干,但LLMs通过纯文本预训练编码了多少听觉知识以及这如何影响下游性能尚不明确;现有研究多关注架构设计或训练策略,而忽略LLM骨干自身听觉知识的评估。
方法创新: 提出了一个系统评估框架,包括三种设置:(1)直接听觉知识评估,使用新构建的AKB-2000基准(覆盖6个类别的2000个听觉知识问题);(2)级联评估,通过音频字幕器将音频转换为文本描述,由LLM推理;(3)音频基础评估,将LLMs微调成端到端LALMs(使用DeSTA自蒸馏框架),评估多模型家族(如Qwen、Llama)的听觉知识转移。
实验结果: 发现听觉知识在模型家族间差异显著,Qwen通常优于Llama;纯文本评估结果与音频性能强正相关,可作为轻量级代理选择LLM骨干;LLMs在语音学任务上表现差,揭示纯文本预训练局限性;级联评估可匹敌甚至超越端到端LALMs,表明当前系统受音频编码器限制。
一句话评价: 这篇论文通过全面评估LLMs的听觉知识,为音频研究中的LLM选择提供了实证基础,并强调了纯文本知识对多模态适应的重要性。
生成与场景声学一致的音频对沉浸式虚拟环境至关重要。现有神经声场方法(如Neural Acoustic Fields)需要每个环境的密集音频测量和昂贵训练,缺乏可扩展性。少样本方法(如Few-ShotRIR、xRIR)提高了跨房间泛化能力,但通常依赖多个录音(如8-20个),且是确定性的,无法捕捉稀疏上下文下房间脉冲响应(RIRs)的固有不确定性,导致预测不稳健。
提出FLAC(Few-shot flow-matching acoustic synthesis),一种基于流匹配的概率性生成模型,用于少样本声学合成。关键创新包括: 1. 生成建模:首次将生成流匹配应用于显式RIR合成,通过扩散变换器(DiT)训练流匹配目标,建模稀疏场景上下文(如深度图、声学观察、传感器位姿)下合理RIRs的分布,显式捕捉声学不确定性。 2. 多模态条件化:条件生成基于声学、空间和几何线索(如K个RIR录音、源位置、全景深度图),实现场景一致的声音生成,甚至仅用一个音频测量。 3. 评估框架:引入AGREE(Acoustic-GeometRy EmbEdding),一个CLIP风格的双编码器网络,对齐RIRs和场景几何在共享潜在空间中,支持通过检索和分布指标进行几何一致性评估。
在合成数据集AcousticRooms和真实世界数据集Hearing Anything Anywhere上评估: - FLAC仅用一个样本(one-shot)就优于8个样本的当前最优方法(如xRIR),在少样本场景下实现了卓越的泛化能力。 - 模型能泛化到已知房间中的新源-接收器对,以及全新环境,展示了鲁棒性和数据效率。 - AGREE嵌入支持零-shot音频-几何检索,提供额外的场景一致性度量。
该方法首次将生成流匹配应用于显式RIR合成,为稳健和数据高效的声学合成开辟了新方向,解决了少样本场景下的不确定性问题。
语言文档化面临重大挑战,约一半语言可能在本世纪末消失,许多语言缺乏记录。自动音素库发现是关键任务,但现有方法有限,需要无监督学习来加速研究,避免依赖标注数据。
引入DiscoPhon,一个多语言基准,用于评估从离散语音单元中无监督发现音素库。覆盖6个开发语言和6个测试语言,系统只使用10小时未见语言的语音,产生离散单元并映射到预定义音素库,通过many-to-one或one-to-one分配。评估包括单元质量(使用PNMI指标)、识别(使用Phone Error Rate)和分割(使用R-value和F1)。提供四个预训练的多语言HuBERT和SpidR基线模型,利用自监督学习编码语音信息。
基线结果显示,在开发语言和测试语言上,SpidR模型表现优于HuBERT,尤其在finetuned on 10h后。例如,在many-to-one轨道中,SpidR VP-20 finetuned在测试语言上PER为59.73%,R-value为54.17%。音素信息在当前模型中足够可用,但表现因语言而异。
DiscoPhon为无监督音素发现提供了全面且标准化的评估框架,推动自监督语音表示学习在语言文档化中的应用。
单声道无监督语音去混响是一个挑战性的ill-posed逆问题,由于缺乏干净参考信号和空间线索,导致难以有效分离混响。监督深度学习方法需要成对的混响-干净语音数据,但真实数据获取困难,合成数据易造成领域不匹配问题。现有无监督方法如加权预测误差(WPE)计算高效但未充分利用数据先验,USDnet等神经网络方法依赖多通道约束或计算负担重,而噪声目标训练(NyTT)因混响为卷积过程而非独立噪声而失效。
提出增强混响目标训练(ARTT),包含两个阶段: 1. 混响目标训练(RTT):将观测的混响混合信号进一步与合成统计相对传递函数(RTF)卷积以增加混响,然后训练深度神经网络(DNN)以判别方式恢复原混响信号。尽管目标是混响的,但DNN学习减少混响,实现初始去混响。 2. 在线自蒸馏:基于平均教师算法,使用指数移动平均(EMA)教师网络动态生成稳定目标。通过不对称输入构造(教师用较干净信号加噪声,学生用进一步混响和噪声增强信号),结合蒸馏损失和辅助正则化,改进去混响稳定性和性能,同时实现去噪。
在WSJ0CAM-DEREVERB数据集上评估,使用单声道混合。ARTT在感知语音质量(PESQ)、扩展短时客观可懂度(eSTOI)和尺度不变信噪比(SI-SDR)等指标上显著优于先前无监督基线(如USDnet、BUDDy)。结果表明ARTT能有效减少混响并提升语音质量和可懂度,验证了其无监督去混响的优越性。
ARTT通过创新的增强混响目标训练和在线自蒸馏机制,克服了单声道无监督语音去混响的挑战,提供了一种高效且稳定的解决方案,显著推动了该领域的发展。
现有 Audio Multimodal Large Language Models (Audio MLLMs) 在标准语音基准测试中表现优异,但由于声学信号与词汇语义通常对齐,模型可能依赖文本语义推理而非真正处理声学信息,导致声学忠实度评估不足,难以区分模型是否进行真实声学推断。
引入 DEAF 基准,包含超过 2,700 个冲突刺激,覆盖三个声学维度:情感韵律(ESC)、背景声音(BSC)和说话人身份(SIC)。设计渐进文本干扰框架(Level 1-3),通过逐步增加文本影响(从仅语义冲突到误导提示及组合),以区分语义内容偏见与提示诱导顺从。提出诊断指标如 Acoustic Robustness Score (ARS) 和 Acoustic Sensitivity Score (ASS) 来量化模型对文本线索的依赖。
评估七个 Audio MLLMs 显示一致文本主导模式:模型对声学变化敏感(通过 ASS 衡量),但预测主要由文本输入驱动(Acc 较低),ARS 揭示高基准性能与真正声学理解之间的差距,表明模型在冲突条件下倾向于依赖文本。
DEAF 是一个全面诊断基准,有效暴露 Audio MLLMs 的声学忠实度不足,为未来模型改进和更稳健的音频理解提供了关键评估工具。
当前用户定义关键词检测(UDKWS)系统主要依赖音素级匹配,忽视用户特定的韵律特征(如语调、重音、节奏),导致在个性化关键词、意图变化和口音差异时可靠性低、易误解意图。
论文提出ProKWS框架,通过双流编码器整合细粒度音素学习和个性化韵律建模: - Phoneme Stream:使用对比学习提取说话者不变音素表示,增强对混淆词的鲁棒性。 - Prosody Stream:从少量注册样本中提取紧凑的韵律签名,捕获个体语调、节奏和意图变化。 - Collaborative Fusion Module:动态融合音素和韵律信息,使用Feature-wise Linear Modulation(FiLM)调整音素特征,并结合交叉注意力进行多模态融合,实现个性化检测。 训练采用复合损失函数,包括utterance loss、音素对比损失和韵律相似性损失。
ProKWS通过协同学习音素和韵律,显著提升了个性化关键词检测的准确性和适应性,为语音交互系统提供了更灵活可靠的解决方案。
随着智能语音助手(如Amazon Alexa、Apple Siri)的普及,用户对隐私和个性化需求增加。传统关键词识别(KWS)系统仅支持预定义关键词,缺乏灵活性;开放词汇KWS(OV-KWS)可检测任意关键词,但未结合用户身份以实现个性化,导致易受混淆词或相似声音干扰。现有方法如两阶段搜索或跨模态方法计算资源高或性能受限,而多任务学习结合KWS和说话人验证(SV)仍未能提供完全可定制的个性化体验。
本文提出PCOV-KWS,一种多任务学习框架,用于个性化、可定制的开放词汇关键词识别。关键创新包括: 1. 多任务学习架构:使用音频编码器,包含共享编码器和两个线性子编码器分别处理KWS和SV任务,通过硬参数共享学习底层特征,分离高层特征。 2. 度量学习训练准则:采用SphereFace2将多类分类转化为多个二分类,消除类别间竞争,使用动态调整函数扩展相似度分布范围。 3. 优化策略:应用PCGrad进行多任务损失权重优化,减少梯度冲突,提升训练稳定性。 4. 音频编码器改进:基于TC-ResNet,通过NoisyDARTS搜索和优化技术(如ConvNeXt改进)提出TDResNeXt,提高网络性能和推理效率。 5. 数据集:使用过滤后的Multilingual Spoken Words Corpus(MSWC)英语子集进行大规模训练。 6. 置信度集成块(CIB):集成KWS和SV输出的置信度,适应不同任务,提高推理性能。
PCOV-KWS是一种高效的多任务学习框架,通过结合KWS和SV,实现了可定制、个性化的开放词汇关键词识别,在性能和资源效率上优于现有方法,推动语音助手向更隐私和用户友好的方向发展。
重叠语音处理是多说话者自动语音识别(ASR)中的关键挑战,现有方法如排列不变训练(PIT)需要预先固定说话者数量且计算效率低,序列化输出训练(SOT)依赖于不准确的语音对齐,导致在真实世界数据(如网络视频)中处理重叠语音时对齐错误和灵活性不足。
提出基于shuffle product和部分顺序有限状态自动机(FSAs)的新框架,用于建模重叠语音。通过扩展连接主义时间分类(CTC)目标,使用shuffle FSA作为监督序列,边缘化所有可能的子词、词或短语级别序列化。引入时间约束的部分顺序FSAs以减少图大小,并直接建模(token, speaker)元组实现说话者属性转录。Viterbi对齐通过shuffle product FSA实现单次对齐,首次在多说话者录音中实现这一功能。
在合成LibriSpeech重叠数据上评估性能,证明该方法能够实现单次对齐和说话者属性转录,为多说话者ASR提供统一视角,将现有方法如token-level SOT和SD-CTC视为特例。所有算法使用k2 / Icefall实现,并在实验中展示了灵活性与计算成本的权衡。
该工作为多说话者ASR引入了基于shuffles的数学框架,有望改进真实世界重叠语音数据的处理,推动该领域的研究进展。
当前全双工口语对话模型(SDLMs)在处理流式语音输入时存在局限性:大多数模型继承文本大型语言模型的序列处理模式,不能同时进行听和想的认知活动,导致与人类自然交互不符。早期方法在用户说话时使用填充令牌(如
论文提出FLAIR(Full-duplex Latent and Internal Reasoning)方法,这是一种潜在推理框架,模拟人类内部认知过程。关键创新包括: 1. 潜在推理机制:在用户说话期间,通过递归更新潜在嵌入状态进行连续、隐式的推理,无需生成显式文本令牌,严格遵循因果约束。 2. 基于ELBO的训练框架:使用证据下界(ELBO)目标进行监督微调,通过变分推断优化潜在变量模型,引入非因果全局感知专家来近似后验分布,使因果模型能学习全局推理能力。 3. 无额外延迟:推理过程无缝集成到全双工SDLMs中,不增加推断时的计算开销,支持实时交互如用户打断和主动回应。
实验评估显示,FLAIR方法在多个语音基准测试中取得竞争性结果,包括事实知识问答、多轮对话、开放生成和多项选择任务。该方法有效处理对话动态,如用户打断,并在全双板交互指标上表现稳健,同时保持低响应延迟和高成功率。
这篇论文创新地将潜在推理引入全双工口语对话模型,解决了边听边想的认知建模挑战,为实时人机交互提供了高效且自然的解决方案。
该系统通过多源证据融合、显式可靠性分层和矛盾驱动验证,显著提升了音频问答的准确性和推理透明度,为涉及异构源的推理任务提供了可推广的架构原则。
Velopharyngeal dysfunction (VPD) 筛查依赖于专业语音病理学家的评估和标准化录音条件,限制了在低收入和中等收入国家的可扩展访问。机器学习模型在临床录音条件下表现优异,但在真实世界部署中(如消费设备和非控制声学环境)性能显著下降,主要由于 domain shift 导致模型依赖录音伪影而非病理相关线索。
提出一个两阶段框架以提高鲁棒性:1) Nasality representation pre-training:使用监督对比学习(SupCon)在辅助数据集(LibriSpeech Alignments)上学习鼻音重点表示,通过口腔与鼻音上下文监督和采样策略减少说话人和语音内容混淆;2) Frozen-encoder VPD screening:冻结预训练编码器,作为特征提取器,在0.5秒音频块上使用轻量级分类器(如LR/SVM/MLP/XGBoost)进行筛查,并通过概率聚合生成录音级决策,使用固定阈值评估。
该方法通过预训练鼻音重点表示,有效减少对录音伪影的依赖,增强了从实验室到真实世界场景的鲁棒性,为可部署的语音基数字健康工具提供了实用解决方案。
现有 Sound Source Localization (SSL) 方法通常仅提供点估计,缺乏不确定性量化 (UQ),这在多源场景和挑战性声学条件(如混响和噪声)中尤其成问题,导致下游任务决策风险增加。传统方法依赖启发式阈值,无统计保证。
论文利用 Conformal Prediction (CP) 框架及其扩展,提出两种互补的 UQ 方法:1) 针对已知源数量情况,构建覆盖真实源位置的预测区域;2) 针对未知源数量情况,先可靠估计活跃源数量,再构建预测区域。方法适用于任何产生空间似然图的 SSL 方法(如 SRP-PHAT 或 DNN-based 模型),提供有限样本统计保证,并控制多种风险(如漏检和误检)。
在模拟环境和真实世界录音上广泛评估,涵盖不同混响水平和源配置。结果显示,在已知和未知源数量场景下均能实现可靠的有限样本保证和一致性能,预测区域大小可自适应局部似然图景观。
该工作为多源 SSL 提供了一个通用的、基于统计的不确定性量化和风险控制框架,显著提升了定位系统的可靠性和下游应用实用性。
大型音频-语言模型(LALMs)在语音生成中实现可靠情感控制面临挑战:情感转换常偏离目标情感,并因拒绝、幻觉或改写而降低语言保真度。
提出首次神经元级情感控制研究,通过成功筛选的激活聚合识别情感敏感神经元(ESNs),实现无训练的情感转向。方法包括四个阶段:激活采样、成功EVC实例筛选、ESN识别(基于频率、熵、均值偏差和对比边际标准)、推理时干预(如转向、注入)。
在三个LALMs(Qwen2.5-Omni-7B, MiniCPM-o 4.5, Kimi-Audio)上评估,ESN干预产生情感特异性增益,泛化到未见说话者,并通过自动和人工评估支持(62%成对比较偏好干预样本)。可控性取决于选择器设计、掩码稀疏性、筛选和干预强度。
论文建立了在语音生成LALMs中进行无训练情感控制的机制框架,通过神经元级干预实现高效情感转向。
野外语音数据收集中面临韵律与语义的混淆(语义内容多变,干扰韵律分析)和隐私风险(原始音频数据敏感且可识别),影响数据质量和合规性。
提出一个内容控制、隐私优先的智能手机协议:使用标准化朗读句子(正、中、负情感效价)控制词汇内容;在设备上使用OpenSMILE提取韵律特征(如eGeMAPS和ComParE集);立即删除原始音频,仅传输特征数据,确保隐私保护。
协议在大型面板研究(N=560)中部署,收集9,877个录音。参与者合规性高(启动率67.8%,完成率96.8%);数据质量筛选后,特征有效用于分类任务,如预测说话者性别(准确率未详述)和瞬时情感状态(效价、唤醒度),验证了协议的实用性。
这是一个创新的、可复制的隐私保护框架,为野外韵律数据收集提供了受控且生态有效的解决方案。
传统的目标声音检测(TSD)方法通常采用双分支架构,分别编码参考音频和混合音频,导致架构复杂、参数冗余,且泛化到未见声音类别的能力有限。现有方法如TSDNet依赖于生成条件嵌入向量并与混合编码器配对,优化过程繁琐,难以在真实噪声场景中实现高效检测。
提出统一编码器框架,使用共享的ConvNeXt编码器处理参考和混合音频的Log-Mel频谱图,将两者映射到同一表示空间,简化架构并增强特征对齐。融合模块支持多种策略(元素乘法、FiLM、交叉注意力)以自适应结合参考和混合特征,并通过BiGRU进行时序建模。采用多任务损失函数,结合剪辑级交叉熵损失和帧级二元交叉熵损失,以同时优化类别预测和时序定位。
在URBAN-SED数据集上,该方法实现段级F1得分83.15%和总体准确率95.17%,超越基线方法如TSDNet(76.3% F1)。融合策略中,交叉注意力表现最佳(86.06% F1)。跨域评估在AudioSet-Strong上显示良好泛化能力,未见类别训练时仅性能小幅下降(F1 73.47%)。统一编码器设计相比双分支在ConvNeXt和CNN14骨干网络上均提升性能。
该工作通过共享表示学习简化了目标声音检测架构,在性能上实现新SOTA,并展示了强大的跨域泛化能力,为参考引导音频任务提供了高效解决方案。
自动语音识别系统,尤其是基于神经网络的系统,对对抗攻击的脆弱性一直是研究热点。现有攻击通常在过空气场景下有效,但容易被人类听觉检测到,这限制了其实用性。论文指出,当前过空气攻击难以实现真正的不可察觉性,亟需开发更隐蔽的方法。
论文提出了一种新算法,用于生成针对Wav2Vec语音识别神经网络的过空气白盒攻击。创新点包括: - 集成多种数据增强步骤:心理声学掩蔽(基于Schönherr等人的方法,用于降低攻击可听性)、频率响应模拟(模拟扬声器和麦克风响应)、房间模拟(使用Pyroomacoustics模拟不同环境)和随机音频时间偏移(提高时间不敏感性)。 - 修改损失函数:结合连接主义时间分类损失和心理声学掩蔽条件,通过优化参数λ来平衡攻击有效性和不可察觉性。 - 模拟多样化环境:生成超过700个房间变体进行攻击生成,以增强鲁棒性。
实验使用JBL Go 3扬声器和Lenovo ThinkPad麦克风进行过空气测试,评估成功率和错误率。关键结果: - 成功率和错误率随λ变化:例如,当λ=0.15时,攻击成功率可达40%(全部数据增强启用时),但生成时间大幅增加(如11.5小时)。 - 增加λ(提高掩蔽)意外地提高了攻击鲁棒性,但也导致计算迭代次数指数增长(如图5所示),限制了进一步优化。 - 数据增强步骤的缺失会影响性能:例如,省略房间模拟会显著降低成功率(实验6)。
该研究在提高过空气对抗攻击的不可察觉性方面取得进展,但面临计算复杂度高和实际不可察觉性未完全实现的挑战,为未来工作提供了重要参考。
传统说话人日记化系统主要针对约束场景如会议和访谈,但开放世界视觉媒体(如电影和电视剧)引入新挑战:1) 长视频理解(电影长达数小时,电视剧数十小时),2) 大量说话人(多达数十个角色),3) 音频视觉异步(说话人声音与面部可见性不一定同步),4) 野外环境变化(多样声学条件和复杂视觉动态)。这些使得现有方法在开放世界场景中受限。
提出CineSRD(Cinematic Speaker Registration & Diarization)框架,是一个无训练的多模态说话人日记化方法,利用视觉、声学和语言线索: - 视觉锚点聚类:使用主动说话人检测和面部嵌入聚类进行初始说话人注册,将视觉聚类作为锚点对齐音频特征。 - 音频语言模型(ALM):整合语音和字幕信息进行说话人转折检测,补充未注册的屏幕外说话人并细化注释。 - 多模态融合:通过投票和相似性计算,融合视觉、音频和文本模态,提升鲁棒性。
CineSRD在提出的视觉媒体基准测试(包括中文、中文方言和英文子集)中表现优异,并在传统数据集中有竞争力,验证了其在开放世界设置中的鲁棒性和泛化性。实验表明,该方法能有效处理复杂场景,优于现有方法。
CineSRD是处理开放世界视觉媒体说话人日记化的高效多模态框架,通过整合视觉、声学和语言线索,解决了传统方法的局限性。
Speech Large Language Models (SpeechLLMs) 在直接处理口语输入时保留口音和感知性别等线索,这可能导致响应中身份依赖的偏见,尤其是交叉性偏见(口音和性别组合),影响 AI 系统的公平性和实用性。
研究采用语音克隆技术(如 MegaTTS3)创建合成数据集,保持语言内容恒定,系统化改变六种英语口音和两种性别表现。通过 2,880 个控制交互,结合点状 LLM 评委评分、配对比较和 Best–Worst Scaling (BWS) 方法,并进行人类验证,首次实现大规模交叉性偏见量化评估。
实验发现 Eastern European–accented 语音在 helpfulness 分数上显著较低,特别是女性声音,表明隐式偏见存在;响应保持礼貌,但 helpfulness 有差异。LLM 评委能捕捉偏见方向趋势,但人类评估员敏感性更高,揭示更尖锐的交叉性差异。配对比较和 BWS 支持这些发现,强调了评估方法的重要性。
该论文首次对 SpeechLLMs 中的交叉性偏见进行了系统量化,为 AI 公平性研究提供了关键见解和创新评估框架。
Music Source Restoration (MSR) 任务需要从经过复杂生产处理(如均衡、压缩、混响和编解码器伪影)的完全混合和掌握的音乐中恢复原始、未经处理的乐器 stems。这比传统的音乐源分离或恢复更具挑战性,因为它涉及反转非线性生产链,且源是未知的。
本研究提出一个两阶段系统。首先,使用一个集合的预训练音乐源分离模型(包括 BS-RoFormer 和 MDX23C)生成初步的源估计。然后,通过基于 BSRNN 的恢复模型进行目标重建,细化这些估计,实现联合分离和恢复。
在 MSRBench 验证集上,系统(EnsembleSep+BSRNN)在大多数乐器类别上超越了基线,使用 MMSNR 和 FAD-CLAP 指标评估。具体地,在挑战测试集上,系统达到 MMSNR 2.3405、FAD 0.2253,平均 MOS 3.2262,排名第二。
该两阶段方法有效地结合了集合分离和目标恢复,在 MSR 任务上取得了显著性能提升,但数据稀缺仍是未来改进的关键瓶颈。
SimulU 通过创新的免训练策略,有效解决了长形式同步语音到语音翻译的挑战,为端到端实时翻译提供了有前景的实用路径。
深度学习方法在语音处理中占主导地位,但存在多个局限性:需要大规模数据集(如Whisper训练需68万小时数据)、训练资源密集、内部表示不稀疏且缺乏组合性、难以实现持续学习、容易发生灾难性遗忘。Assembly Calculus (AC) 作为生物启发的替代方案,但其本身也有限制:假设离散输入符号、未指定跨时间尺度组织、缺乏全局损失函数。
本文提出一个基于AC的语音处理框架,主要创新包括: 1. 神经编码:将连续语音特征通过二进制神经编码(如概率mel谱图二值化和人口编码MFCC表示)转换为AC兼容的稀疏表示。 2. 多区域架构:组织组装体跨层次时间尺度和类别,包括耐火组装体层次用于边界检测和每类循环区域用于分类。 3. 跨区域更新方案:引入轨迹共振评分机制,从组装体动态中读取音素和单词身份。
在两个核心任务上评估: - 边界检测:音素边界F1分数0.69,单词边界F1分数0.61,无需权重训练。 - 分类:音素识别准确率47.5%,命令识别准确率45.1%。 结果表明AC-based动态系统是深度学习的有前景替代方案,展示了在有限训练下处理连续语音的能力。
该论文成功地将Assembly Calculus应用于连续语音处理,为解决深度学习的效率和组织问题提供了生物启发的创新框架。
Self-attention 的 O(n^2) 复杂度在长序列(如语音帧)上导致内存和延迟瓶颈,特别是在边缘设备上,其中神经加速器(如 Apple ANE)缺乏对动态 n×n 矩阵乘法的有效支持,迫使 GPU 回退,降低了能效。
引入 Learnable Pulse Accumulator (LPA),一种 O(n) 复杂度的替代方案,替换 key-query dot products。它使用学习到的门控函数定义序列上的软窗口,包括: - Aperiodic pulses:处理内容依赖的分割。 - Periodic pulses:捕捉多尺度节奏结构。 - Positional pulses:用于固定结构偏差。
LPA 仅使用深度卷积、sigmoid 门控和加权求和,所有这些操作都与移动加速器兼容。此外,提出了一种渐进层替换方法,包括 MSE 诊断扫描来确定每层替换难度和顺序。
LPA 提供了一种硬件友好的线性复杂度注意力替代方案,显著加速边缘设备上的语音识别,同时保持合理准确度,并揭示了语言计算层比声学层更难替换。
端到端自动语音识别(ASR)系统在特定领域数据上性能显著下降,主要原因是缺乏足够的领域内文本和语音资源。现有基于合成数据的方法存在两个关键限制:领域特定词汇多样性不足,以及合成语音缺乏真实发音的变异性(如发音错误和替代)。
论文提出一个基于合成数据的ASR领域适应框架,包含两个主要创新点: 1. LLM-based文本增强管道:使用大型语言模型(LLM)多阶段生成候选句子,并通过新颖的过滤策略平衡类型-标记比(TTR)、困惑度和领域术语覆盖,以优化词汇多样性和相关性。 2. 语音重拼写增强(PRA):在文本阶段引入发音变异性,通过LLM生成反映真实发音的伪拼写(如使用字母表示发音错误),而不是像传统方法SpecAugment那样在声学层面修改。PRA使合成语音更接近真实世界变化,同时兼容标准文本到语音系统。
在四个领域特定英文数据集上进行评估:ATCOSIM和ATCO2(空中交通控制)、Court(最高法院诉讼)、MedSyn(药物描述)。实验结果表明,该方法在所有数据集上一致减少词错误率,验证了结合领域特定词汇覆盖和现实发音变异性能显著提高ASR鲁棒性。
该框架通过高效利用合成数据和LLM驱动增强,有效解决了ASR领域适应中的数据稀缺和语音多样性问题,推动了ASR系统在实际应用中的性能提升。
现有语音深度伪造检测系统主要依赖于自监督学习(SSL)编码器的连续特征,这些特征在抽象语义时可能衰减细粒度的合成痕迹(如瞬态建模不完美、谱细节过平滑)。同时,神经音频编解码器通过残差向量量化(RVQ)形成粗到细的离散层次结构,但这一结构在检测任务中未被充分利用,导致对合成伪影的捕捉不足。
论文提出一个层次感知的表示学习框架,核心是Quantizer-Aware Static Fusion (QAF-Static)。该方法通过可学习的全局维度权重建模量化器级别贡献,形成与法医线索对齐的结构化编解码器表示。保持SSL编码器骨干(如WavLM)冻结,仅更新4.4%额外参数,实现轻量级SSL-编解码器融合,保留了RVQ的层次结构并避免过早跨流交互。
在ASVspoof 2019 Logical Access数据集上,相对EER减少46.2%;在ASVspoof5数据集上,相对EER减少13.9%,优于强基线(如Attentive Merging基线)。实验表明,该方法在保持训练稳定性和低计算开销的同时,显著提升了检测性能。
该方法创新性地利用编解码器量化器层次结构,通过轻量级融合增强语音深度伪造检测的准确性和鲁棒性,为领域提供了高效的表示学习新方向。
现有算法作曲方法如Nancarrow的tempo canons、Xenakis的stochastic distributions和L-system grammars发展孤立,缺乏统一参数框架整合符号结构、随机细节和硬件约束,导致难以处理Yamaha Disklavier上的超人类钢琴密度,同时面临速度依赖延迟(VDL)和感知从离散事件到纹理的过渡挑战。
提出Amanous系统,通过distribution-switching统一三种作曲传统:L-system符号选择不同分布制度而非固定参数调制。采用四层架构(符号→参数→数字→物理),包括硬件抽象层形式化VDL和键重置约束,以及收敛点微积分作为控制接口链接宏观时间结构与微观纹理生成。
Amanous提供了一个创新且可解释的硬件感知作曲系统,有效统一了多种算法作曲传统,为超人类钢琴密度处理建立了约束感知的统一框架。
可靠且可解释的第二语言(L2)语音自动评估是一个核心挑战,大型语音语言模型(SpeechLLMs)往往难以与人类评分者的 nuanced 变异性对齐,导致评估不一致和不可靠。
引入了一个 rubric-guided reasoning framework,明确编码多aspect人类评估标准(准确性、流利度、韵律),并校准模型不确定性以捕捉自然评分变异性。 fine-tune Qwen2-Audio-7B-Instruct 模型,使用多rater human judgments,开发了 uncertainty-calibrated regression approach,支持 conformal calibration 以生成可解释的置信区间。
模型在流利度和韵律评估上表现可靠,但准确性评估存在固有难度。 Gaussian uncertainty modeling 和 conformal calibration 方法在 alignment with human ratings 方面 outperformed regression 和 classification baselines。
Rubric-guided, uncertainty-calibrated reasoning offers a principled path toward trustworthy and explainable SpeechLLM-based speech assessment。
核心痛点
传统目标说话者提取(TSE)方法在双耳音频设置中依赖于到达方向(DOA)估计或注册信号,可能扭曲感知的空间位置,影响语音可懂度和听感,尤其对听力受损听众不利。鸡尾酒会问题在混响和并发说话者环境下更具挑战性。
方法创新
提出一种基于头部相关传递函数(HRTF)的双耳TSE框架,使用HRTF作为显式空间先验来指导提取。模型基于多通道深度盲源分离骨干,适应双耳设置,训练在多样化的测量HRTF数据上以实现跨听众泛化,而非针对特定听众。通过HRTF调制特征,保留双耳线索(如ILD和ITD),同时增强语音质量。架构包括卷积编码器、NBC2自注意力块和线性解码器,操作在STFT域。
实验结果
使用WSJ0语料库和SofaMyRoom框架模拟混响环境(T60在0.2-0.8秒,SIR在-5到5 dB)。损失函数结合尺度不变信噪比(SI-SDR)和平均绝对误差(MAE)。验证通过模拟和真实头躯模拟器(HATS)记录,显示在保留空间一致性的同时提高了语音质量。
一句话评价
该工作创新地利用HRTF作为空间线索,有效解决双耳TSE中的空间保留问题,具有跨听众泛化能力和实际应用潜力。
RECOVER 是一个鲁棒的后处理框架,通过代理性协调多假设和约束性 LLM 编辑,显著提升 ASR 实体校正的准确性和鲁棒性。
当前TTS系统通常为语音提示和文本提示的音色控制使用单独模型,统一这两种控制信号到一个模型是理想的,但跨模态对齐的挑战导致架构和训练目标过于复杂。
提出CAST-TTS框架:使用预训练编码器(Flan-T5用于文本、WavLM-based ECAPA-TDNN用于语音)提取特征,通过多阶段训练策略在共享嵌入空间中对齐语音和投影的文本表示,并利用单一的跨注意力机制统一控制音色,简化了架构。
在语音提示任务中,CAST-TTS达到最高SPK-SIM(78.4),并在WER(2.05%)和UTMOS(3.91)等指标中具有竞争力;在文本提示任务中,相比基线方法(如CapSpeech-NAR和Parler-TTS),CAST-TTS在Style-ACC(91.15%)和主观评估(如Sim-MOS 4.11)上表现更优,整体性能与专用单输入模型相当。
CAST-TTS是一个简单有效的框架,通过统一的跨注意力机制简化了音色控制的跨模态对齐,在保持高性能的同时提高了灵活性。
传统声音源定位方法(如 SRP-PHAT、MUSIC、MLE)在真实环境中(如混响和噪声)表现不佳,特别是对于多声源。数据驱动的深度学习网络(DNN)缺乏可解释性,而经典迭代算法则更透明,但可能对初始化和局部最优敏感。
提出了一种可解释的展开期望最大化网络(Unfolded EM Network),通过将迭代 EM 过程嵌入到编码器-EM-解码器架构中,减少了初始化敏感性并改进了收敛性。使用 Pair-Wise Relative Phase Ratios(PRPs)作为特征,基于复杂高斯混合模型(CGMM)进行最大似然估计,并引入离群聚类增强鲁棒性。
在合成数据集上(基于 WSJ 语料库)进行实验,对比 Batch-EM 基线。结果显示,在混响条件下(T60=0.2s),提议的网络将 RMSE 降低了约 39%,并显著减少了定位误差超过 0.5 米的样本比例,表现出优越的准确性和鲁棒性。
该网络在混响环境中显著提高了定位鲁棒性,有效结合了数据驱动方法的性能和经典算法的可解释性。
数据稀缺导致自动平均意见分数(MOS)预测模型容易学习虚假相关性,如数据集特定的声学特征(如乐器音色、环境背景噪声),而不是泛化的质量特征,从而在部署到未见数据时泛化能力差。
引入领域对抗训练(DAT)框架,通过梯度反转层(GRL)强制模型学习领域不变的表示,以分离质量感知和干扰因素。系统研究三种领域定义策略:DAT-Source(基于数据集元数据)、DAT-Kmeans(基于K-means聚类的隐式声学模式)和DAT-Random(随机分配作为基线),并强调策略选择依赖于特定MOS方面(如生产质量、内容享受)。
在AES-Natural数据集上评估,涵盖四个MOS维度:生产质量(PQ)、生产复杂性(PC)、内容享受(CE)和内容有用性(CU)。实验表明,DAT策略有效减轻声学偏差,提高与人类评分的相关性(如皮尔逊相关系数),并在未见生成音频场景中实现卓越泛化,优于静态领域先验方法。使用MultiGauss和Audiobox-Aesthetics作为骨干模型验证了鲁棒性。
该研究通过创新的领域对抗训练和系统化的领域定义探索,为生成音频质量评估提供了更可靠、泛化的解决方案,解决了数据稀缺下的虚假相关性问题。
核心痛点:现场音乐表演中,多轨音频常受到声道间声学泄漏(bleeds)的污染,且需要零延迟混音以保持音频-视频同步。现有自动音乐混音(AMM)系统大多针对离线生产,缺乏处理泄漏和实现零延迟的端到端解决方案。
方法创新:提出了AiLive Mixer(ALM),一个基于深度学习的系统。主要创新包括:1) 多率处理(MR),将系统分为两个帧率(如975ms和50ms)以降低延迟;2) 架构改进,如Transformer encoder块学习声道间上下文,GRU块学习时间上下文;3) 数据增强策略,通过参数化工具模拟泄漏;4) 零延迟训练,预测未来音频帧的增益。系统基于DMC(Differentiable Mixing Console)改进,增加了RMS条件、音频嵌入模型微调等功能。
实验结果:论文在Section 6展示了实验结果,比较了多率处理和单率处理(SR),并在真实现场表演数据上测试。结果表明,ALM能有效处理泄漏,实现零延迟混音,并在延迟和混音质量上优于基线方法。
一句话评价:ALM是首个针对现场音乐表演的端到端深度学习自动混音系统,创新性地解决了泄漏和延迟问题,为现场音频处理提供了新方向。
DSQA(构音障碍语音质量评估)面临数据稀缺问题,依赖昂贵的主观专家评估,且现有模型(如SpICE)在跨语言和病因的未见数据集上鲁棒性不足,限制了临床应用和泛化能力。
论文提出一个三阶段框架:首先,使用基于Whisper的教师模型为SAP数据集中未标记的样本生成伪标签;其次,结合LibriSpeech正常语音数据集,进行弱监督预训练,采用标签感知对比学习策略以增强对多样说话人和声学条件的鲁棒性;最后,微调预训练模型用于下游DSQA回归任务,以实现严重性级别估计。该方法通过伪标签和数据增强,有效利用未标记数据和大规模正常语音,提升模型性能。
在五个跨域测试数据集(UASpeech、DysArinVox、EasyCall、EWA-DB、NeuroVoz)上,平均SRCC(Spearman秩相关系数)达到0.761,优于基于Whisper的基线(平均SRCC 0.732)和SOTA方法如SpICE。在SAP测试集上,SRCC为0.719。实验表明,弱监督和LibriSpeech集成对提升跨域鲁棒性至关重要。
该研究通过创新数据增强和弱监督对比学习框架,成功解决了DSQA中的数据稀缺挑战,显著提高了模型在多样未见数据集上的鲁棒性和性能。
现有视频到音频生成方法主要依赖文本提示,但面临两个关键瓶颈:训练数据中声音类别的语义粒度不足(例如,将不同狗的吠声粗粒度地标记为“吠叫”),以及文本描述无法精确编码微声学特征(如“金属撞击声”无法区分冲击瞬态和共振衰减),导致细粒度声音合成困难。
提出AC-Foley框架,以参考音频为条件,通过多模态联合训练(视频、音频、文本)和两阶段训练框架(声学特征学习和时间适应)实现精确音频控制。该方法支持细粒度声音合成(如不同材质的脚步声)、音色转移(如将小提琴旋律转换为唢呐音色)、零样本生成(如无需训练即可合成独特武器声音),并提升音频质量。
实验结果表明,AC-Foley在音频质量上显著优于基线方法,Fréchet距离降低20%,Kullback-Leibler距离降低28%,Mel Cepstral失真降低22%。在参考音频条件下达到state-of-the-art性能,即使无条件时仍与当前最优方法竞争。
AC-Foley通过引入参考音频条件,有效克服了文本控制的局限性,为视频到音频合成提供了更精确、灵活且高质量的音频生成能力。
这是一个宝贵的历时语音语料库,通过平衡性别和年龄控制,为法语语音学演变研究提供了高质量、可访问的数据资源。
自动音乐流派分类是音乐信息检索(MIR)中的一个长期挑战,但现有研究主要集中在西方音乐,针对非西方音乐如尼泊尔音乐的研究稀缺。尼泊尔音乐包含丰富的文化和声学多样性,但缺乏公共数据集,流派边界模糊,导致分类系统难以开发。
顺序CRNN(CNN后接LSTM)达到最高分类准确率84%,显著优于最佳经典模型(逻辑回归和XGBoost,均为71%)和其他深度学习架构。实验提供了详细的每类精度、召回率、F1分数、混淆矩阵和ROC分析,并基于文化背景对错误分类模式进行解释,反映尼泊尔音乐传统中的真实重叠。
这篇论文通过构建新数据集和系统实验,证明了CRNN在尼泊尔音乐流派分类中的优越性,填补了MIR领域在非西方音乐研究中的空白。
当前文本转语音(TTS)系统在整合非言语发音(NVs)时,评估缺乏标准化指标和可靠的真实参考音频。NVs常被错误地视为声学工件而非交流行为,现有数据集不平衡,导致评估偏差且难以量化生成质量。
论文提出NV-Bench,首个基于功能分类的基准,将NVs视为交流行为,而非仅声学事件。它包含1,651个多语言、真实世界的utterances,平衡覆盖14个NV类别,并引入双维度评估协议:指令对齐(使用新的声学字符错误率PCER)评估可控性,声保真度(测量与真实录音的分布差距)评估声学真实性。此外,开发了一个多语言NV自动语音识别(NV ASR)模型用于高质量转录。
实验表明,NV ASR在标准ASR测试集和NV专用测试集上均表现出色,例如在SMIIP-NV测试集上CER为1.29%,OCER为1.36%,优于基线模型。在NV-Bench上评估多个TTS模型(如Orpheus-TTS、CosyVoice3变体),结果显示客观指标与人类感知强相关,为模型性能提供了可复现的衡量。
NV-Bench为NVs在TTS中的评估提供了一个标准化的综合框架,有望推动更自然、可控的语音合成系统发展。
本研究提出了一种基于神经网络的时频bin-wise线性组合(NN-TFLC)框架,用于解决欠定情况下的目标源提取问题。通过结合多个波束形成器并预测时频一致的组合权重,该方法在无需噪声协方差先验的情况下提高了性能。
在欠定混合中(源数多于麦克风数),传统波束形成方法性能严重下降。现有的时频bin-wise切换(TFS)和线性组合(TFLC)策略在独立决策每个时频bin时,削弱了时间-频谱一致性,导致不连续性和性能下降。
提出NN-TFLC框架,使用神经网络编码混合信号和波束形成输出,并通过交叉注意力机制预测时频bin-wise的线性组合权重。该方法构建MPDR波束形成器,无需显式噪声协方差估计,支持可变数量的输入波束形成器,并仅需单次更新步骤。
在双麦克风场景下,NN-TFLC-MPDR consistently outperforms TFS/TFLC-MPDR,并且 achieves competitive performance with TFS/TFLC built on MVDR beamformers,后者需要噪声先验。
该方法通过神经网络的上下文建模,有效改善了欠定情况下目标源提取的鲁棒性和准确性,为音频增强领域提供了新思路。
标准自注意机制在语音情感识别中存在二次计算和内存复杂度问题,限制了在长序列或资源受限环境中的可扩展性。
本研究提出系统性的基准测试,比较多种高效注意机制,包括 RetNet、LightNet、GSA、FoX 和 KDA,以优化语音情感识别系统的计算效率。
在 MSP-Podcast 数据集的两个版本上评估,结果显示标准自注意机制在识别性能上最佳,但高效注意变体显著减少了推理延迟和内存使用,最高可降低一个数量级,突出了准确性和效率之间的权衡。
本研究通过系统性基准测试,为设计可扩展和资源高效的语音情感识别系统提供了关键见解和实用指导。
现有研究缺乏在可比条件下系统比较大型语言模型(LLMs)在自动语音识别(ASR)中的应用方法,特别是紧密集成声学模型(AM)与LLM(称为speech LLM)与传统浅层融合方式之间的对比。这导致难以评估LLMs对ASR性能的实际益处和最佳利用策略。
本研究进行了广泛的消融实验,探讨speech LLMs中不同标签单元、微调策略(如全微调与LoRA)、LLM大小(如Qwen2 0.5B至7B)、预训练数据、注意力接口(如前缀LLM、合并注意力模型)、编码器下采样、文本提示和长度归一化的影响。创新性地研究联合CTC识别以缓解speech LLMs的幻觉问题,并提出优化方法。同时,系统比较紧密集成模型与浅层融合基线,包括使用延迟融合进行单遍识别。
实验在Librispeech(960小时)和Loquacious(25K小时)数据集上进行训练和评估,使用HuggingFace ASR排行榜。模型包括基线注意力编码器-解码器(AED)模型、前缀LLMs和合并注意力模型,配置不同LLM大小和训练策略(如从预训练LLM微调)。具体性能指标未在片段中详细给出,但强调了在可比条件下的系统比较。
这项研究填补了LLMs在ASR中应用的系统比较空白,为未来优化LLMs集成方法提供了重要基准和见解。
语音去混响在远距离麦克风场景中仍然具有挑战性,主要原因是混响与目标信号高度相关,导致传统方法在真实环境中泛化能力差,容易过拟合到合成数据,并引入伪影或失真目标信号。
论文提出IF-CorrNet,一种基于帧间相关性的滤波器估计架构。该方法不直接估计复杂频谱,而是通过计算短时傅里叶变换(STFT)的帧间相关性矩阵作为网络输入,显式捕获混响反射的物理特性,并估计多帧深度滤波器用于每个时频点。这种方法将学习目标从黑盒频谱映射转移到显式滤波器估计,约束解空间,简化训练过程并提高鲁棒性。网络架构采用双路径模块(频率和时间模块)和卷积增强的Transformer块(如ConvFFN)来有效建模时间频率依赖。
在REVERB Challenge数据集上,IF-CorrNet在模拟数据(SimData)和真实数据(RealData)上均表现出色。具体来说,在RealData上,SRMR指标从基线的3.180提升到7.548(完整模型),显示出在非合成环境中的强鲁棒性。其他指标如PESQ、SNRfw也有显著改善。实验还表明,适当的滤波器长度(L=3)能平衡去混响效果和语音失真。
IF-CorrNet通过显式利用帧间相关性进行深度滤波器估计,为单通道语音去混响提供了一种高效且鲁棒的方法,有效解决了真实环境中的泛化问题。
核心痛点 论文指出,spectrogram-based输入特征已成为深度学习音频和语音分类模型中最流行的选择,但存在许多与分辨率和表示类型相关的设置,这些差异影响不同应用领域的性能,需要针对任务进行优化。
方法创新 本文是一个综述论文,没有提出新方法,而是系统分类和总结了spectrogram的变种,包括线性spectrogram、对数缩放spectrogram、Mel-spectrogram、Constant-Q transform等,通过taxonomy表(如表1)讨论了它们的维度、元素缩放和频率跨度特性。
实验结果 由于是综述,论文未报告新实验结果,但总结了现有研究,强调了不同spectrogram设置(如Mel-spectrogram用于语音分析,Constant-Q transform用于音乐分析)对各种音频和语音任务的适用性。
一句话评价 这篇论文提供了一个有价值的综述,帮助研究人员理解并选择最适合特定音频和语音分析应用的spectrogram特征表示。
当前端到端口语对话系统面临两个关键差距:模态差距(modality gap),涉及韵律、情感等副语言信息在文本评估中不可见;口语化差距(colloquialness gap),区分书面脚本与自然口语的风格差异。这些差距导致现有方法难以可靠评估和优化口语对话行为。
本文提出 SDiaReward,一个端到端多轮奖励模型,基于新构建的 SDiaReward-Dataset 训练,该数据集包含针对模态和口语化差距的偏好对。模型直接处理完整多轮语音对话,使用成对偏好监督优化,能联合评估模态和口语化。此外,建立了 ESDR-Bench,一个分层基准,用于鲁棒的对话级评估,通过元数据注释确保分布多样性。
实验表明,SDiaReward 在成对偏好准确性上达到最先进水平,显著优于通用音频 LLMs。模型能捕捉相对对话表达性,超越表面合成线索,提高跨域和录制条件的泛化能力。代码、数据和演示已公开。
该方法通过数据驱动的奖励建模,有效解决了口语对话中的模态和口语化差距,为端到端口语系统提供了可靠的评估和优化框架。
SoulX-Duplug通过创新的文本引导流式架构,解决了全双工语音对话中的关键挑战,提供了高效、低延迟的解决方案,并在实验中展现出卓越的实用性和性能提升。
大型音频-语言模型(LALMs)在推理能力上存在根本限制,现有方法如链式思维(CoT)提示需要额外训练和监督,导致高计算成本和数据需求。
提出三种无需训练的模型转向策略: - Vanilla Steering:为每个测试样本动态提取转向向量,基于CoT与非CoT隐藏状态差异。 - Speech-derived Generalized Steering (SGS):从辅助语音数据中提取共享转向向量,提高计算效率。 - Text-derived Generalized Steering (TGS):从文本数据中提取转向向量并跨模态转移到语音推理,展示数据高效性。 这些方法在推理时通过操纵隐藏状态(如注入缩放向量)来增强CoT推理。
在四个LALMs(Voxtral, Phi4-mm, Qwen2.5, AF3)和四个基准测试(College, High School, Elementary Mathematics, ReveAL-CoT)上进行评估: - 转向方法普遍提升CoT性能,最高绝对准确率增益达4.4%(如TGS在AF3上)。 - TGS实现从文本到语音的跨模态转移,仅需少量样本达到竞争性能,数据效率高。 - Vanilla Steering在计算预算类似下优于自一致性方法,且生成操作更少。
该工作为增强LALMs推理提供了一种实用、高效且无需训练的方法,通过隐藏状态操纵实现跨模态转移,具有重要应用潜力。
核心痛点: 现有神经音频编解码器(NAC)和基于大型语言模型(LLM)的文本到语音(TTS)基准测试通常优先考虑重建质量和客观指标,缺乏主观评估,特别是针对非标准语音如带口音的英语。这导致对模型在多样化语音类型上性能的理解不足,且尚未系统评估模型在口音相似度等方面的能力。
方法创新: 论文提出了CodecMOS-Accent数据集,一个包含4,000个样本的平均意见得分(MOS)基准,用于评估24个NAC重合成和TTS系统(涵盖9个重合成模型和15个语音克隆模型)。数据集基于VCTK语音库,涉及32个说话者和10种英语口音。通过大规模主观测试(25名听者、19,600个注释),评估了三个维度:自然度(S-NAT)、说话者相似度(S-SPK-SIM)和口音相似度(S-ACC-SIM)。该方法创新在于提供了首个针对口音语音的全面MOS基准,并结合了客观指标分析。
实验结果: 系统级分析显示:说话者和口音相似度有强相关性(S-SPK-SIM和S-ACC-SIM范围高于S-NAT),表明模型能先捕捉全局属性如口音和说话者身份。客观指标(如单词错误率、嵌入余弦相似度、预测MOS)具有预测能力。有趣的是,一些TTS系统(如CosyVoice 2)在自然度上超过了地面真实数据,但地面真实在说话者和口音相似度上最高。此外,当听者与说话者有相同口音时存在感知偏差。这些发现揭示了模型在口音克隆上的潜力及其评估的挑战。
一句话评价: CodecMOS-Accent数据集为NAC和带口音的TTS研究提供了关键基准,推动了更人性化的语音质量评估,并揭示了模型在口音保持方面的进步和局限性。
现有口音标准化(Accent Normalization)方法通常缺乏对口音强度的精细控制,而许多实际应用如语言学习和配音需要可调整的 accent retention(即保留部分原口音)。
提出 DLM-AN(Diffusion Language Model for Accent Normalization),一个基于 masked discrete diffusion over self-supervised speech tokens 的可控口音标准化系统。关键创新包括:引入 Common Token Predictor (CTP) 来识别源令牌中可能编码 native pronunciation 的部分,并通过阈值控制重用这些令牌以初始化反向扩散过程,从而实现平滑、可解释的口音强度控制。此外,集成 flow-matching Duration Ratio Predictor (DP) 来自动调整总输出持续时间,以更好地匹配 native rhythm。
在 multi-accent English 数据上的实验表明,DLM-AN 在所有比较系统中实现了最低的 word error rate (WER),同时提供 competitive accent reduction 和 smooth, interpretable accent strength control。
DLM-AN 是首个基于离散扩散的口音标准化系统,通过简单的令牌重用机制有效实现了口音强度的可控性。
当前音频反欺骗系统通常采用二元分类框架,区分真实(bona fide)语音与欺骗(spoofed)语音,但这种框架在分层生成处理下失效。良性转换(如语音恢复和声音质量转换)虽然保持说话者真实性,却引入分布偏移,导致系统将其误分类为欺骗,增加实际部署中的误报风险。
论文提出以下创新点: 1. 引入四类分类框架:将音频分为真实、转换(良性处理)、欺骗、以及转换欺骗四类,以替代传统二元分类,旨在区分恶意欺骗和良性处理。 2. 分析自监督学习(SSL)嵌入:使用Wav2Vec2、HuBERT和Whisper等SSL模型的嵌入,通过t-SNE可视化和方向一致性分析,研究良性转换在表示空间中的漂移效应。 3. 声学相关性研究:结合声学特征(如频谱倾斜和声源参数)解释分类结果,提供可解释的洞察。 4. 发布基准数据集:提供包含真实和欺骗音频及其良性转换版本的数据集,用于评估反欺骗系统的鲁棒性。
该研究通过多类分类框架和SSL分析,有效解决音频反欺骗中良性转换被误判的挑战,提升了系统的实用性和鲁棒性,为深伪检测领域提供重要改进方向。
现有扩散和流匹配TTS模型面临离散时间结构(如对齐和节奏)与连续谱内容建模之间的根本矛盾。两阶段模型(如Grad-TTS)依赖固定对齐,可能导致平均韵律和机械拉伸;单阶段模型(如E3 TTS)避免显式对齐,但存在对齐不稳定性问题。
提出跳扩散框架,在一个生成过程中统一离散跳跃(建模时间结构)和连续扩散(细化谱内容)。引入Upsample–Diffuse–Downsample (UDD)策略,以重用预训练扩散网络,支持可变长度跳跃。框架包括位置预测器(分类式插入槽预测)和内容预测器(帧内容生成),实现结构和内容的迭代联合优化。
在LJSpeech数据集上评估:单次变体(仅替换回归式时长预测器为分类式)实现3.37% WER(低于Grad-TTS的4.38%)和更高UTMOSv2分数;完整迭代UDD变体在非分布慢语速中能自适应插入自然停顿,而非均匀拉伸。结果验证了分类式时长建模优于回归方法,并避免了两阶段模型的韵律塌陷。
该方法通过跳扩散和UDD策略,有效解决了TTS中结构和内容联合建模的挑战,显著提升智能性和自然度。
Existing Audio-Visual Speech Enhancement (A VSE) methods commonly use objectives like Scale-Invariant Signal-to-Noise Ratio (SI-SNR) and Mean Squared Error (MSE), which often correlate poorly with perceptual quality and provide limited interpretability. Traditional metrics such as PESQ and STOI do not always align with human subjective perception, leading to a gap between optimization targets and actual listening experience.
The paper proposes LR-A VSE, a reinforcement learning-based framework that integrates a Large Language Model (LLM) for interpretable reward generation. An audio LLM (SALMONN) generates natural language descriptions of enhanced speech, which are converted into a 1-5 rating score via a sentiment analysis model (BERT). This score serves as the reward signal for Proximal Policy Optimization (PPO) to fine-tune a pretrained A VSE model. The approach enhances perceptual alignment and provides explicit, human-interpretable feedback beyond scalar metrics.
Experiments on the 4th COG-MHEAR A VSE Challenge (A VSEC-4) dataset demonstrate that LR-A VSE outperforms a supervised baseline (pretrained with SI-SNR) and a DNSMOS-based RL baseline in objective metrics (PESQ, STOI), neural quality metrics, and subjective listening tests. The LLM-guided reward leads to improved speech quality and intelligibility.
This work innovatively combines LLM-generated natural language feedback with reinforcement learning for audio-visual speech enhancement, achieving better perceptual quality and enhanced interpretability in the optimization process.
音乐流派分类(MGC)传统上依赖于信号处理特征和简单分类器,但自我监督学习(SSL)嵌入的有效性未被充分挖掘,尤其是分类器架构和训练策略设计不足,限制了性能提升。
本研究使用预训练通用音频SSL模型(如BYOL-A、PANNs、VGGish)提取特征嵌入,设计了一个深度神经网络(DNN)分类器,优化了架构(如隐藏层、激活函数、正则化),并探索了多任务训练,结合交叉熵、对比损失和三元组损失,通过损失权重优化增强表示判别力。
在GTZAN数据集上,BYOL-A嵌入达到81.5%准确率,优于PANNs(77%)和VGGish(79.5%);在FMA-Small上为64.3%。DNN分类器比线性分类器提升10-16%准确率。多任务训练中,优化损失权重(如α=0.35, β=0.35)实现最佳性能。跨数据集联合训练(GTZAN+FMA-Small)导致GTZAN性能轻微下降(78.0%),但FMA-Small保持可比(64.25%)。
该研究通过精心设计的DNN分类器和多任务训练策略,显著提升了基于SSL嵌入的音乐流派分类性能,为音频表示应用提供了有效范例。
VoXtream2通过动态说话速率控制和流式生成,显著提升了TTS系统的自然性和实用性,为实时语音交互应用提供了有效解决方案。
核心痛点:音频深度伪造模型归因旨在通过识别生成合成音频样本的源模型来减轻其滥用,但面临模型更新、多样化生成条件(如检查点、文本提示、声码器、说话者身份)下的鲁棒性挑战。SSL(自监督学习)衍生的声学特征在归因任务中表现出色,但其成功驱动因素和判别能力的局限性仍不明确。
方法创新:本研究通过受控实验系统调查SSL特征如何捕捉音频深度伪造中的架构签名。从零开始重新训练四个常用语音生成系统(FastPitch, VITS, Grad-TTS, Matcha-TTS),控制数据(使用LJSpeech数据集)、训练协议、文本提示、声码器等变量。采用轻量级归因系统,基于k近邻(kNN)分类器结合SSL特征(来自wav2vec2-xls-r-2b和w2v-bert-2.0),评估架构归因和检查点归因的性能。
实验结果:架构归因准确率高(F1分数达0.98),而检查点归因较弱(F1约0.50),反映了模型训练阶段间的细微差异。SSL模型在域外(OOD)场景中表现稳健,但受文本提示和声码器选择影响:文本提示重叠导致检查点归因性能显著下降,而声码器变化对性能影响较小。VITS模型更易区分检查点,其他架构随着训练收敛更难分离。不同SSL模型有非重叠弱点,但总体上在识别音频深度伪造来源方面保持强大。
一句话评价:该研究深入揭示了SSL模型在音频深度伪造归因中的鲁棒性、偏差和局限性,为实际反欺骗应用提供了关键见解和指导。
BrainWhisperer 通过将大型 ASR 模型与神经数据结合,为语音脑机接口提供了一个可扩展的基础模型,有效解决了数据稀缺、计算成本和跨参与者泛化等关键挑战,同时注重隐私和用户控制。
主观测试(如多媒体质量评估)的结果常被视为“真理数据”,但包含噪声(如离散评分尺度、有限投票数、个体偏见等),导致客观估计器的评估指标(如Pearson相关系数PCC和均方误差MSE)追求完美值(PCC=1.0或MSE=0.0)既不现实也不可重复。这限制了客观估计器的合理开发和性能评估。
提出一种新方法,基于基本假设推导出PCC和MSE的数学界限,这些界限是主观投票方差的函数。当投票方差信息可用时,界限可数据驱动计算;否则,提供两种备选方案:使用其他测试的方差信息或使用投票模型。引入基于二项分布的投票模型(BinoVotes)及其衍生的平均意见分数模型(BinoMOS),该模型能捕捉MOS的离散性和投票数依赖性,并提供所需的方差信息。
通过比较18个提供投票方差信息的主观测试数据,BinoMOS模型生成的PCC和MSE界限与实际数据直接计算的界限高度吻合。此外,方法允许为任何主观测试(即使无方差信息)设置合理的PCC和MSE期望值,有助于判断客观估计器是否还有改进空间。
论文通过数学推导和建模,为多媒体质量评估中的主客观一致性提供了实用界限框架,显著提升了客观估计器评估的合理性和准确性。
自监督语音模型(S3Ms)在语音处理任务中表现出色,但其内部上下文编码机制尚不明确。尽管S3Ms常被描述为上下文化,如何将相邻音素的语音信息组合到单个帧级表示中仍是一个未解决的问题,限制了对其表示空间结构的理解。
论文提出了一种新假设:单个帧级S3M表示不仅编码当前音素,还通过位置相关的正交子空间编码相邻音素的语音信息。这扩展了先前工作,将语音向量框架从单个音素扩展到序列上下文。具体提出了四个预测来验证:帧级组成性、上下文语音向量、位置正交性和语音边界隐含。
通过实验验证了预测:帧级表示支持语音类比操作(如添加浊音向量),证实了组成性;上下文语音向量可恢复相邻音素属性;位置相关子空间显示正交性,允许区分当前、前一个和下一个音素;语音边界在表示变化中隐含,支持基于位置的信息编码。实验使用了wav2vec 2.0、HuBERT和WavLM等模型,在TIMIT和VoxAngeles数据集上进行测试。
该研究通过揭示S3Ms如何通过位置依赖正交子空间编码语音上下文,为自监督语音模型的内部机制提供了关键见解,推动了模型解释性的进展。
该方法通过创新地应用扩散模型和灵活的条件机制,有效解决了RIR完成中的不连续性和真实感问题,为音频数据增强和声学处理提供了新途径。
基于大型语言模型(LLM)的文本转语音(TTS)系统依赖自回归Transformer,导致二次计算复杂度,限制了在长序列场景(如播客、有声书)中的实际应用,尤其是在边缘设备上。线性时间替代方案如Mamba虽然效率高,但牺牲了全局上下文建模能力,影响表达的语音合成质量。
本文提出MamTra,一种交替的Mamba-Transformer混合架构,旨在结合Mamba的线性时间效率和Transformer的全局建模能力。创新点包括: 1. 架构设计:探索多种Transformer到Mamba的替换策略(如交错、连续、数据驱动),以优化效率与质量的平衡。 2. 知识转移:引入多级蒸馏策略,从预训练的Transformer教师模型转移知识到混合学生模型,避免从头训练的高成本。通过权重映射(如将Transformer的Q、K、V投影权重初始化Mamba的C、B、x投影),并采用交叉熵损失、对数蒸馏和嵌入约束进行微调。 3. 线性化分析:将自注意力线性化为递归形式,实现从Transformer到Mamba的结构对齐。
系统实验表明: - 效率提升:MamTra在推理时减少GPU VRAM使用量高达34%(相比CosyVoice 2基线),同时保持语音保真度。 - 训练效率:即使仅使用原始训练数据集的2%进行知识蒸馏,也能恢复性能,词错误率(WER)仅增加0.25%。 - 复杂度分析:混合架构实现亚二次计算复杂度和亚线性键值缓存增长,在长序列场景中显著降低延迟和内存需求。 - 配置优化:通过实验确定了最佳混合比例(如Transformer:Mamba为1:1或1:3)和层放置策略(如BlockBeg或数据驱动方法)。
MamTra是一种创新的混合架构,在文本转语音领域有效平衡了计算效率和表达质量,为实际部署提供了可行的解决方案。
音频-视觉语音识别(AVSR)模型在利用音频和视觉信息时,模态贡献平衡不明确,尤其是在干净条件下,模型倾向于音频偏向,视觉贡献不明显,导致对噪声的鲁棒性有限。
提出 Dr. SHAP-AV 框架,使用 Shapley 值量化模态贡献,引入三种分析:Global SHAP 用于整体模态平衡,Generative SHAP 用于解码过程中的贡献动态,Temporal Alignment SHAP 用于输入-输出对应关系。该方法扩展了 Shapley 值到跨注意力架构,并支持多粒度分析,超越静态归因。
在六个 AVSR 模型(AV-HuBERT、Auto-AVSR、Whisper-Flamingo、Llama-AVSR、Llama-SMoP、Omni-AVSR)和 LRS2、LRS3 基准测试上实验,发现:1) 随着音频质量下降,模型向视觉依赖转移,但即使在 -10 dB SNR 下,音频贡献仍保持 38-46%;2) 模态平衡在生成过程中演化,不同模型表现各异;3) 模态时间对齐在噪声下保持稳健;4) 不同噪声类型诱导不同程度的视觉依赖;5) 话语长度影响模态贡献,模型特定;6) SNR 是模态平衡的主导因素,识别难度影响最小。
这项研究通过 Shapley 值为 AVSR 提供了深入的模态行为洞察,揭示了持久音频偏向,推动了显式模态加权机制的发展,并鼓励将 Shapley 值作为标准诊断工具。
当前大型音频语言模型(LALMs)在与人交互时,通常忽略语音中的副语言线索(如年龄、性别、情绪),只基于查询内容响应。这导致同理心交互减弱,并引发儿童安全问题,例如模型可能为儿童用户提供不适合的指导,如电气安全等场景。
该研究通过创新的层分析和微调协议,显著增强了LALMs的副语言感知能力,提升了模型的安全性和交互同理心,具有重要应用价值。
传统声学-发音倒置方法依赖有限数据,如电磁发音仪(EMA)存在传感器数量少、干扰发音等局限性;实时动态MRI(rt-MRI)数据质量低、分辨率差、数据集小,且缺乏可靠轮廓跟踪工具,阻碍了准确发音道重建。
本研究采用高分辨率(136×136像素)rt-MRI数据,通过自动轮廓跟踪提取发音轮廓而非全图像;创新性地比较三种语音分割级别:基于Wav2Vec 2.0的自动转录、使用Astali的强制对齐分割、专家手动校正分割,并与MFCCs基线对比,评估语音信息纳入的效果。模型架构基于Bi-LSTM,输入改为语音表示而非原始语音信号。
基线模型(使用MFCCs)表现最佳,平均RMSE为1.51 mm;语音分割方法中,专家校正模型RMSE为1.61 mm,接近基线但略差,其他方法(Wav2Vec 2.0和Astali)性能更差。结果表明,直接使用MFCCs可能更有效,手动校正的额外预处理努力收益有限。
该研究评估了语音信息在发音道重建中的作用,发现基于MFCCs的简单方法优于复杂语音分割,为权衡预处理成本与精度提供了实用见解。
核心痛点: MRI环境下的语音录音受扫描仪噪声污染,即使去噪后也与清洁语音有显著差异(如能量降低和高频损失),限制了声学-发音反转在实际应用中的可行性,因为真实场景通常需要清洁语音输入。
方法创新: 提出使用清洁语音作为去噪MRI语音的替代方案,以提升实用性。开发了基于语音分割的分层对齐算法,从句子到音素逐级对齐MRI和清洁语料库,确保时间一致性。采用自监督学习模型HuBERT-Base作为输入特征提取器,结合神经网络架构(两个全连接层和两个Bi-LSTM层),输出八个发音器官的轮廓坐标(共50个点),使用均方误差损失函数进行回归优化。
实验结果: 通过三种实验配置评估:M2M(MRI语音训练和测试)、M2C(去噪MRI语音训练、清洁语音测试)、C2C(清洁语音训练和测试)。C2C配置达到均方根误差1.56毫米,接近M2M的1.51毫米,表明清洁语音能有效支持发音反转,性能与基于MRI的方法相当;M2C配置性能下降,显示训练数据与测试数据不匹配的影响。实验还验证了对齐方法的重要性,使用动态时间规整(DTW)对齐后性能略有下降。
一句话评价: 这项研究证明了清洁语音在声学-发音反转中的有效性,性能接近基于MRI的方法,为医疗、语音技术等实际应用提供了更便捷、低噪声的解决方案。
原始 ReDimNet 架构中,为了保持时间分辨率(T)不变,通道维度(C)的扩展导致 1D 处理路径的计算成本呈二次增长,限制了模型的可扩展性和效率,在说话人验证任务中难以平衡计算资源与准确性。
ReDimNet2 通过引入时间维度池化(time-pooling)在 1D 处理路径中,减少时间步数,从而在保持残差连接和维度重塑逻辑有效的同时,允许更激进的通道扩展。具体改进包括:在中间阶段应用时间池化(如 halving T),使用上采样对齐不同时间分辨率的特征图以维持残差连接,并释放计算预算用于增加通道数,实现双重效率提升(1D 和 2D 路径均受益)。
在 VoxCeleb1 基准测试中,ReDimNet2 提供了七种配置(B0-B6,参数范围 1.1M 到 12.3M,计算成本 0.33 到 13 GMACs)。与原始 ReDimNet 相比,在所有规模点上均改善了计算成本(GMACs)与准确性(EER)的帕累托前沿。例如,B6 配置在 Vox1-O 上达到 0.287% EER,比 ReDimNet-B6 提高 28% 相对准确性,同时减少 36% 计算成本和 18% 参数。此外,ReDimNet2 在更大规模模型中表现更佳,并在域外测试集上展示了更好的泛化能力。
ReDimNet2 通过简单而创新的时间池化策略,有效解决了说话人验证模型的可扩展性问题,在保持高准确性的同时显著提升了计算效率。
传统语音情感研究主要依赖声学分析,但底层发音运动执行与情感的联系尚不清楚,尤其是在声学信息有限或不可用的环境中(如无声语音界面和辅助通信技术),情感解码面临挑战。
本研究创新性地使用表面肌电图(sEMG)记录面部和颈部肌肉活动,系统比较发声和无声语音产生中的情感解码;引入一个包含2,780个话语、12名参与者的多任务数据集,评估个体内和个体间解码性能;结合多种特征和模型嵌入进行分析,并设计消融实验探讨情感签名的持久性。
EMG表示能可靠解码挫折情感,最高AUC达0.845;情感签名在无声语音中持续存在,表明其嵌入在运动活动中;解码性能在个体间和不同发音模式中泛化良好,突出了sEMG在情感感知应用中的潜力。
这项研究为EMG-based情感解码提供了实证基础,特别推动了无声语音界面向更自然、表达性通信的发展。
GAN-based vocoders 在语音合成中面临效率和泛化能力的权衡问题。现有方法如扩散模型(Diffusion-based frameworks)和 Flow Matching(FM)虽然提高了泛化能力,但往往牺牲了计算效率;而传统 GAN vocoders 如 BigVGAN 在泛化时效率下降。这导致需要一种方法在保持 GAN 高效性的同时,增强对未见数据(如新说话人或风格)的泛化性能。
提出 Relativistic Adversarial Feedback(RAF),一种新颖的 GAN 训练框架。RAF 包括两个核心组件: 1. 质量差距:利用自监督学习(SSL)模型(如 WavLM 和 HuBERT)和 Multi-resolution STFT(M-STFT)距离来量化生成波形与真实波形之间的感知差异,从而提供更丰富的质量评估。 2. 判别器差距:采用相对性配对 GAN(RpGAN)的思想,通过相对性反馈鼓励判别器为每个真实/伪造样本对分配独立决策边界,而非全局边界。这促进了对训练数据分布的更全面覆盖。 RAF 的训练目标是最小化 SSL 辅助的判别器差距,通过对抗反馈提升生成器的表示学习能力。
RAF 是一个创新且高效的训练框架,通过结合 SSL 模型和相对性配对,显著提升了 GAN vocoders 的性能和泛化能力,同时保持了 GAN 的计算效率优势。
SEMamba++ 通过集成语音特定归纳偏置,创新性地结合 Frequency GLP 和多分辨率并行处理,显著提升了通用语音恢复的准确性和效率,为解决复杂退化场景下的语音恢复问题提供了有力框架。
评估动漫风格语音缺乏标准化的客观指标,依赖成本高的主观判断,且动漫风格没有共享的绝对尺度,使传统平均意见分(MOS)协议不可靠。
提出AnimeScore,一个基于偏好的框架,通过成对排名自动评估动漫风格。收集15,000个成对偏好判断和自由形式描述,分析声学特征;使用自监督学习(SSL)基础模型训练排名模型,超越手工艺特征上限。
手工艺声学特征达到69.3% AUC上限,而SSL基础模型(如掩码预测表示)达到90.8% AUC,接近人类比较判断。数据集公开可用,支持快速模型筛选和基于人类反馈的强化学习(RLHF)优化。
该工作为动漫风格语音评估提供了首个实用的自动化框架和数据集,显著提升评估效率和模型优化能力。
斯瓦希里语作为非洲广泛使用的语言(超过1亿使用者),与其他非洲语言一样,面临高质量标注语音数据稀缺的挑战。高资源语言如英语拥有大量专业转录数据,而低资源语言如斯瓦希里语必须用有限标注数据实现竞争性自动语音识别(ASR),这阻碍了服务于非洲语言社区的语音技术发展。
本研究提出一种持续预训练(CPT)方法,结合未标注音频和有限标注数据,用于低资源斯瓦希里语ASR。具体方法包括: 1. 伪标签CPT:使用基线模型(wav2vec2-bert-2.0)对未标注音频生成伪标签(置信度>75%),然后进行持续预训练。 2. 监督微调:在伪标签CPT后,使用有限标注数据(5K或20K样本)进行监督微调。 3. 训练管道:包括标签模型训练、伪标签生成、CPT和监督微调三个阶段,使用保守超参数防止灾难性遗忘。
该方法通过伪标签持续预训练有效解决了斯瓦希里语ASR的数据稀缺问题,以最小标注数据实现最先进性能,为其他低资源语言提供了实用路径。
语音生物识别系统(特别是说话者验证)在性别上存在系统性性能差距,即使整体验证准确率高。这种差距源于两个机制:1. 人口统计快捷学习:模型训练中利用性别与说话者身份之间的虚假相关性作为捷径;2. 特征纠缠:性别相关的声学变化与身份线索重叠,难以在不降低说话者鉴别能力的情况下移除。这导致在共享决策阈值下,不同性别组的错误率不平等。
提出Fair-Gate,一个公平感知的可解释风险门控框架。主要创新包括: 1. 风险外推(Risk Extrapolation, REx):在代理性别组间惩罚说话者分类风险的变化,以减少组间捷径依赖。 2. 局部互补门控:通过软路由掩码将中间特征分配到身份分支和性别分支,保持特征维度不变,提供可解释性(可检查哪些特征被分配到身份或性别路径)。 3. 综合训练目标:结合说话者分类、对抗性别分类、嵌入去相关、门控正则化等损失函数,优化效用-公平权衡。
该工作通过因果分析和创新框架,有效解决了说话者验证中的性别偏见问题,同时保持了高验证性能,为公平语音生物识别提供了实用方案。
语音感知语言模型(SLMs)如注意力编码器-解码器模型采用自回归推理,每次生成一个令牌需要LLM的一次前向传递,导致推理速度慢、并行性受限,影响自动语音识别系统的实时性和效率。
提出自投机解码方法,利用SLM中预训练的CTC编码器作为草稿模型,无需额外训练。过程分三步: - CTC解码和验证:基于CTC输出分布的帧级熵,若所有熵值低于阈值,直接接受贪婪CTC假设为最终输出。 - SLM验证:否则,在单次LLM前向传递中验证CTC假设,使用令牌似然性的放松接受准则(如似然高于阈值)。 - 自回归回退:若验证失败,从最长验证CTC前缀恢复自回归解码。 该方法通过CTC和SLM的互补错误模式提升准确性,并加速推理。
在九个语料库和五种语言上测试,使用1B参数LLM和440M参数CTC编码器。在HuggingFace Open ASR基准上,实现5.58%的词错误率,逆实时因子提高4.4倍,仅比纯自回归搜索增加12%的相对WER。实验显示,在不同阈值设置下能平衡速度和精度,例如在高效模式下WER略增但推理加速显著。
该方法巧妙结合CTC的快速解码和LLM的准确性,通过自投机机制优化了ASR系统的推理效率与性能,为语音识别领域提供了一种实用的加速方案。
手动标注咳嗽音频的起始点耗时、费力且存在卫生风险,在临床环境中不可行,阻碍了可扩展的移动健康筛查工具的开发。需要自动检测咳嗽活动以避免人工干预,并确保下游疾病分类模型的准确性。
提出使用两个预训练的 transformer 模型进行咳嗽活动检测:XLS-R(基于语音训练的 transformer)和音频声谱图 transformer(AST)。创新点包括: - 应用 transformer 模型于咳嗽检测任务,首次探索其在此领域的潜力。 - 优化 XLS-R,仅使用其前三层,以减少计算和内存需求,适用于智能手机应用。 - 与 logistic regression 基线比较,评估 transformer 模型的性能优势。 - 研究自动提取咳嗽对下游结核病分类模型的影响,对比人工标注的咳嗽输入。
预训练的 transformer 模型在咳嗽活动检测中表现卓越,有效减少人工依赖,集成到结核病筛查工具具有可行性。
部分虚假语音(partially fake speech)指仅特定单词被编辑的语音,其检测和定位虚假区域极具挑战性,因为编辑可能仅改变语义,而现有方法在泛化到不同编辑风格时表现不佳。
本研究提出一种语音LLM(Speech LLM)模型,通过下一个token预测来定位虚假单词。创新点包括:构建基线Align模型(结合ASR和帧级检测器),并探讨三种输入模态的Speech LLM:音频-only(SLM-A)、音频+转录(SLM-AT)和转录-only(LLM-T),以分析模型在不同场景下的行为。
在PartialEdit(PE)和AV-Deepfake1M(AV1M)数据集上的实验表明:当转录可用时(SLM-AT),模型在WordF1指标上表现最佳(PE: 90.79%, AV1M: 97.51%)。跨域测试显示模型过度依赖数据集特定的编辑模式(如极性替代),泛化能力有限(例如,从PE训练到AV1M测试时WordF1仅为12.03%)。
该论文系统探索了LLM在部分虚假语音定位中的潜力,并揭示了模型依赖的编辑模式,为未来提高泛化能力奠定了基础。
现有视频到音频生成(V2A)模型存在以下主要问题:风格控制受限于训练数据,缺乏灵活性;美学质量难以通过显式奖励建模评估;缺乏综合评分系统来整体评估语义一致性、时间对齐和感知质量。
论文提出V2A-DPO框架,包含三个核心创新: 1. AudioScore:一个基于人类偏好对齐的综合评分系统,评估生成音频的语义一致性、时间对齐和感知质量。 2. 自动化偏好对数据生成:利用AudioScore驱动管道,结合少量人工标注数据,生成大规模偏好对用于DPO优化。 3. 课程学习驱动的DPO优化:针对基于流的生成模型,通过分阶段训练(从简单到复杂偏好对)提升优化效果。
在VGGSound数据集上的实验表明,使用V2A-DPO优化的Frieren和MMAudio模型在多个指标上优于使用DDPO优化的版本和预训练基线。具体改进包括:IS提升1.81绝对值(10.4%相对),IB-score提升0.86绝对值(2.6%相对),DeSync降低0.09绝对值(20.5%相对)。DPO优化的MMAudio在多个指标上达到SOTA性能,超越已发表的V2A模型。
该论文通过创新地将直接偏好优化应用于视频到音频生成,有效解决了人类偏好对齐的挑战,显著提升了生成音频的质量和综合评估。
该论文揭示Mean Opinion Score (MOS)作为语音质量评估标准存在隐藏的性别偏见:男性听众倾向于给更高的评分,尤其在低质量语音中差距最大(例如,在BVCC数据集中,男性听众平均评分2.988,女性2.886),这种偏见随语音质量提高而减小。聚合MOS标签和自动MOS预测模型(如SSL-MOS)继承并放大了这种偏见,导致评估不公平,无法准确反映不同性别的感知标准。
提出一种性别感知的MOS预测模型,创新点包括:使用抽象的二值组嵌入来学习性别特定评分模式,而非直接输入性别标签。模型架构包括共享SSL编码器、预测整体MOS的Mean Net分支和预测性别特定MOS的Gender Net分支,通过共享权重实现条件处理,从而自主发现数据中的性别差异。
该研究首次系统分析了MOS中的性别偏见,并提出创新的性别感知模型,为公平语音评估提供了重要洞见和方法。
在计算听觉场景分析(CASA)中,多标签音频标签(AT)常面临声学相似性导致的歧义问题,使得仅从音频波形中难以区分某些事件。缺乏结构化地理空间语义上下文(GSC)的标准化任务和基准数据集限制了利用GSC减少歧义的研究。
本研究提出了地理空间音频标签(Geo-AT)任务,将多标签AT条件化于GSC和音频。引入了Geo-ATBench数据集,包含3,854个真实世界多声道音频剪辑(10.71小时),配对POI衍生的GSC表示,覆盖28个事件类别和11个语义上下文类别。并提出了GeoFusion-AT框架,评估特征级、表示级和决策级融合策略在三种代表性音频骨干网络(PANNs、AST、CLAP)上的性能。
实验表明,结合GSC通常能提高AT性能,特别是在声学混淆的标签上。通过10名参与者的众包听力研究(579个样本)显示,模型在Geo-ATBench标签和聚合人类标签上的性能无显著差异,支持Geo-ATBench作为人类对齐的基准。
这项工作为CASA社区提供了一个结合地理空间语义上下文的音频标签基准和框架,有助于开发更稳健的机器听觉系统。
现有说话人属性语音识别(SA-ASR)系统在处理长形式、多说话人重叠语音时,面临两大挑战:一是难以同时捕获细粒度时间边界(timestamped attribution),二是缺乏鲁棒的跨块全局说话人身份一致性(global speaker identity consistency),导致转录不准确和身份漂移。
提出 G-STAR(End-to-End Global Speaker-Tracking Attributed Recognition)系统,创新性地集成时间感知的说话人跟踪模块和 Speech-LLM 转录主干。跟踪模块基于 Sortformer 风格,采用 Arrival-Order Speaker Cache(AOSC)维护全局说话人状态,支持端到端训练和灵活优化(如组件级和联合训练)。方法通过 interleaved temporal fusion 融合说话人线索到 LLM 生成中,实现结构化输出(SOT 格式),确保 meeting-level 身份一致性。
在 MLC、AMI、Fisher 和 Candor 等会议数据集上进行实验,G-STAR 在局部和全局 SA-ASR 任务上表现优异,超越了 Speech-LLM 基线(如 VIBEVOICE-ASR)和传统流水线方法。实验分析了 cue fusion 策略、局部与长上下文权衡以及层次化目标的影响,证明了其在挑战性场景中的竞争力。
G-STAR 是一个高效且实用的端到端框架,通过结合说话人跟踪和 LLM 生成,显著提升了多说话人语音识别中的全局身份一致性和时间精度,具有部署潜力。
FireRedASR2S是一个高性能的工业级一体化ASR系统,通过模块化设计和数据扩展,显著提升了多语言和方言识别的准确性、鲁棒性和可部署性。
当前语音tokenizer在多模态大型语言模型(MLLMs)中用于连接语音和文本,但研究发现其所谓的"语义"表示实际上更偏向语音信息而非真正的词汇语义,导致与文本语义不匹配,这可能损害MLLMs在语音理解任务中的性能。
本文系统性地探测了四种代表性语音codec(EnCodec、DAC、MIMI、MIMO)的语义和语音内容。创新方法包括:1)词级探测任务,通过比较同义词和近音词对的欧几里得距离来评估语义和语音信息密度;2)发音语音探测,使用从实时磁共振成像(rt-MRI)提取的声带距离(VTD)特征进行生理基础的语音编码评估;3)跨模态语义对齐分析,采用Centered Kernel Alignment(CKA)测量文本和语音表示之间的结构相似性。
初步实验表明,随着codebook层数的增加,EnCodec的特征距离波动无明显规律,而其他codec(如DAC、MIMI、MIMO)显示欧几里得距离逐渐增加,表明信息累积。总体而言,当前语音tokenizer主要捕获语音结构而非词汇语义,这验证了核心痛点中的假设。
本研究通过多角度探测揭示了当前语音codec在语义编码上的不足,为设计下一代更有效的语音tokenizer提供了关键见解和实用指导。
现有非线性模态合成模型在Max环境中的实时实现有限,大多数工具如Sound Design Toolkit (SDT)和Synth-A-Modeler仅支持线性模态合成,而离线模拟的非线性模型(如VKGong和VKPlate)未完全集成到实时交互平台中,限制了作曲家和声音设计师的创意探索。
论文提出了nlm,一组统一的Max外部对象,使用C++和Eigen库优化实现,支持实时非线性模态合成。模型涵盖弦、膜和板,基于模态分解(如方程(3))和数值积分(如impulse-invariant discretisation),允许交互控制物理参数(如张力、阻尼),加载自定义模态数据,并提供多通道输出。创新点包括集成非线性力模型(如方程(9)-(11))和灵活激发方法(如方程(12)),降低使用门槛。
nlm在标准硬件上实现高效实时性能:可处理约100个板模态(vk模型)和数百个弦/膜模态,计算复杂度为O(NM^2)(板模型)。系统在典型条件下数值稳定,但强激发可能导致不稳定,未来计划通过能量钳位策略改进。开源软件包含示例预设和帮助文件,支持创意应用。局限性包括模态数量增加时的计算负载和稳定性挑战。
nlm为音频社区提供了强大的实时非线性模态合成工具,成功集成到Max环境中,促进了物理建模的创意探索和交互式声音设计。
现有分布式算法如分布式自适应节点特定信号估计(DANSE)算法是迭代的,收敛速度慢,不适用于需要快速适应的动态声学环境。此外,这些算法假设所有节点观察相同的目标源(全重叠期望子空间,FODS),但在实际中,节点可能观察不同的源(部分重叠期望子空间,PODS),导致算法性能下降或无法保证最优性。
本文提出分布式多通道维纳滤波(dMWF),一种非迭代的分布式滤波器,适用于全连接无线声学传感器网络。dMWF在PODS场景下也能达到最优性能,匹配集中式多通道维纳滤波的均方误差。其核心创新在于让节点交换节点对特定的低维融合信号,估计共享源的贡献,从而在减少通信带宽的同时实现快速、准确的信号估计,无需迭代收敛。
通过模拟语音增强实验,dMWF在短操作时间内在客观指标上优于DANSE算法,展示了其非迭代设计的优势。实验证明dMWF能快速适应动态环境,提供可靠的噪声减少性能,突出了其在通信带宽有限场景下的实用性。
dMWF为无线声学传感器网络提供了一种高效、非迭代的分布式滤波方法,解决了现有算法在迭代速度、源重叠假设和通信带宽方面的核心限制。
这篇论文的核心痛点是缺乏现实嘈杂语音数据集,特别是针对荷兰语。大多数现有的荷兰语语音数据集(如CGN、Jasmin-CGN、Common Voice 12)在安静环境中录制,无法真实模拟现实世界中的背景噪音和Lombard效应(说话者在噪音中自然调整语音)。这导致自动语音识别(ASR)和语音增强(SE)模型的评估往往基于合成噪音数据,限制了它们在真实场景中的性能泛化能力。因此,需要一个新的数据集来填补这一空白。
论文提出了一个新的数据集DRES(Dutch Realistic Elicited Speech),以解决上述痛点。创新点包括: 1. 收集了1.5小时的半自发荷兰语语音,通过三个任务(自由讲话、图片卡、提示卡)诱导更自然的语音,相比阅读语音更具真实性。 2. 在四个不同的公共室内环境(Ahoy、Pulse、IDE、Arch)录制,捕捉多样化的背景噪音(如交谈声、喧闹声),增加数据的现实性。 3. 使用四通道线性麦克风阵列记录多通道音频,为后续研究提供基础。 4. 数据集包含80名说话者(包括母语和非母语者),提高了说话者多样性。 5. 提供了详细的转录和质量评估,使用DNSMOS进行客观评分,突出了录制地点的语音质量差异。
论文进行了以下实验: 1. 评估了八种SOTA ASR模型(包括Google Chirp 3、Microsoft Azure ASR、Whisper等)在DRES数据集上的性能,发现五种模型的词错误率(WER)低于22%,表明在嘈杂条件下ASR仍有可接受的性能。 2. 测试了五种单通道SE算法(包括传统方法如频谱减法和现代深度学习模型如SGMSE+)对语音质量和ASR性能的影响。结果发现: - 语音质量客观指标(DNSMOS)在不同SE算法下有所变化,但SE并未改善ASR性能,甚至可能引入伪影损害ASR。 - 与基于合成噪音的先前研究相反,在现实条件下,SE对ASR无积极效果,强调了在真实环境中评估的重要性。 3. 分析显示,数据集中的语音质量在Ahoy(展览场馆)最低,反映其更具挑战性的声学条件。
这篇论文通过引入一个高质量的现实荷兰语语音数据集DRES,强调了评估ASR和SE模型在真实嘈杂环境中的必要性,并挑战了语音增强总能改善语音识别性能的传统假设,对多语言和现实场景下的语音技术研究具有重要贡献。
当前大型音频-语言模型(LALMs)在多音频理解方面存在显著不足,尤其是在非语义属性(如情感、音调)和输入缩放(音频数量增加)时性能急剧下降。现有基准主要关注单音频设置,缺乏对多音频场景的系统性评估,导致模型在现实应用中的局限性未被充分揭示。
论文引入了MUGEN基准,这是一个全面的多音频理解评估框架,覆盖35个任务和7个维度(包括语义、说话者、情感、时间感知、声学场景、音乐分析和组合声学推理),采用音频作为选项的设计以强制跨音频比较。此外,提出了训练免费改进策略:音频置换自一致性(APSC)通过多样化音频顺序来增强预测鲁棒性,结合链式思维(CoT)推理进一步提高性能。
MUGEN为多音频理解提供了首个全面基准,揭示了当前LALMs的关键盲点,并通过创新策略为未来模型改进奠定了重要基础。
获取高质量真实世界房间脉冲响应(RIR)是劳动密集型的,导致数据稀缺,限制了数据驱动RIR生成方法的发展。传统物理模拟方法需要环境参数,而现有深度学习方法如图像驱动或参数条件模型存在输入数据获取困难或依赖领域知识的问题。
本研究首次通过微调预训练的文本到音频(TTA)模型(如Stable Audio Open)进行RIR生成,利用其大规模生成音频先验,仅需少量真实数据。创新点包括:1)使用视觉语言模型(VLM)构建文本-RIR配对数据集,通过图像标注和LLM-as-a-judge框架确保声学有效性;2)引入上下文学习(ICL)策略,将自由形式用户提示转换为标准化格式,以适应多样输入。
实验使用BUT ReverbDB数据集,定量评估显示模型在RT60错误上表现优异(平均误差5.56%),优于基线方法Image2Reverb,且与PromptReverb可比但训练数据量减少近100倍。主观MUSHRA测试和下游自动语音识别(ASR)性能评估证实生成RIR的合理性和实用性,有效用于语音数据增强。
该研究通过微调预训练TTA模型,实现了数据高效的高质量RIR生成,为音频模拟和语音处理提供了创新解决方案。
核心痛点: 大规模omni模型需要大量多模态数据和计算成本,扩展语音模态时面临数据稀缺、成本高昂的问题,且现有方法可能引发灾难性遗忘,破坏预训练模型的原有性能。
方法创新: 提出SPEECH-OMNI-LITE框架,通过添加轻量级、可训练的plug-and-play模块(speech projector和speech token generator)到冻结的视觉-语言(VL)主干上,实现语音理解与生成能力的扩展。引入低成本数据构造策略,从现有ASR语音-文本对生成QTATS(Question–Text Answer–Text–Speech)数据,支持有效的语音生成训练。
实验结果: 实验表明,即使使用仅数千小时的语音训练数据,SPEECH-OMNI-LITE在口语QA性能上与使用数百万小时数据的omni模型相当,同时模块展现出跨VL主干的可转移性。图1显示,SPEECH-OMNI-LITE能以约十分之一的训练成本达到竞争性表现。
一句话评价: 该论文提出了一种高效、轻量级的框架,以低成本扩展VL模型到语音模态,解决了数据稀缺和灾难性遗忘问题,同时保持原有性能。
扩散概率模型在语音恢复中应用时,反向过程需要多次评估大型神经网络,导致计算成本高。现有的快速采样方法(如DPM-Solver)主要针对无条件扩散模型,无法直接用于条件扩散模型(如SGMSE+),因为两者扩散过程不同:前者从数据分布到高斯分布,而后者在目标分布和噪声观测之间插值。
在多个语音恢复任务上测试,包括噪声减少、带宽扩展、去剪辑、MP3解码和去混响。提出的求解器仅需10次NFEs即可恢复干净语音,性能与需要40多次NFEs的高阶自适应RK45求解器相当,展示了高效性和广泛适用性。
该工作为条件扩散模型提供了统一的数学框架和高效的快速求解器,显著降低计算成本,推动了语音恢复技术的实际应用。
传统关键词检测(KWS)系统在噪声环境中性能受限,主要依赖单通道输入和级联管道,将前端增强与检测器分离,导致联合优化受阻,限制了噪声鲁棒性和目标说话人感知能力。
提出一种端到端多通道 KWS 框架,集成三个核心组件:空间编码器学习多通道信号的通道间特征(如相位和电平差异);空间嵌入注入方向先验(基于已知的 DOA 标签);以及流式主干(如 MDTC)处理融合表示。该方法允许从多通道输入到检测输出的整体优化,提高在噪声和干扰下的性能。
在模拟噪声环境(使用 Google Speech Commands v1 数据集和 DEMAND 噪声,SNR 0-10 dB)中,实验表明:空间建模(通过空间编码器)和方向先验(通过空间嵌入)各自优于单通道基线和级联系统(如 GSC beamformer 增强)。两者组合使用时,准确率最高,验证了端到端多通道空间建模的有效性,尤其是在低 SNR 条件下。
该研究成功开发了一个端到端方向感知 KWS 框架,通过集成空间建模和先验知识,显著提升了噪声环境中的检测鲁棒性,为复杂声学场景的应用铺平了道路。
现有神经网络音频合成方法(如DDSP)主要关注近似引擎声音的频谱特征,而非直接建模其物理原因——即序列性的排气压力脉冲结构。这导致模型缺乏对底层脉冲时序和波形形状的精确控制,限制了重建质量和参数可解释性,特别是在处理非谐波过程、极低频率和快速时序序列时存在挑战。
本文提出脉冲列车-共振器(PTR)模型,一种可微分合成架构,直接建模引擎声音的脉冲列车结构和排气系统传播。关键创新包括:集成物理知识作为归纳偏置(如谐波衰减、热力学音高调制、阀动力学包络),使用可微分的脉冲合成和递归Karplus-Strong共振器模拟排气声学,并通过梯度优化实现端到端学习。模型通过输入工程(如转速和扭矩导数)和物理条件信号(如油门和DCFO因子)增强动态行为建模。
PTR模型在三种不同引擎类型的7.5小时音频数据上进行验证。相比谐波加噪声基线模型,PTR在谐波重建上提高了21%,总损失减少了5.7%。同时,模型提供了对应物理现象(如燃烧事件和排气共振)的可解释参数,增强了其实际应用价值。代码、模型权重和音频示例已开源。
该工作通过物理引导的神经网络合成,在引擎声音建模中实现了更高质量的音频重建和参数可解释性,为音频合成领域提供了新的方向。
生成式语音增强(Generative Speech Enhancement)在追求高感知质量时,常面临幻觉(hallucination)问题,导致语音内容或说话者特征不一致。现有方法如PASE(Phonologically Anchored Speech Enhancer)虽能减少幻觉,但在恶劣条件(如强噪声和混响)下感知质量有限,难以达到工作室级别(studio-quality)标准。
论文提出StuPASE模型,基于PASE进行两处关键改进: 1. 干目标微调(Dry-Target Finetuning):使用不含模拟早期反射的干燥语音作为训练目标,微调PASE,显著提升去混响性能。 2. 流匹配生成(Flow-Matching-Based Generation):将PASE中基于GAN的声学增强模块替换为流匹配模块,结合梅尔声码器,实现在恶劣条件下生成高质量、低幻觉的语音。
StuPASE在多个评估指标上优于当前最先进的语音增强方法(如TF-GridNet、FlowSE、SenSE、Adobe Enhance Speech V2)。实验使用客观指标(如DNSMOS、UTMOS、SpkSim、LPS、SBS、WER)和主观评估(Q-MOS、S-MOS),显示其能同时保持低幻觉和高感知质量,达到工作室级别标准。
StuPASE通过干目标微调和流匹配生成,有效平衡了生成式语音增强中的感知质量与内容保真度,是推动该领域向低幻觉、工作室质量发展的重要创新。
大型音频语言模型(LALMs)在处理音频-文本任务时,经常出现幻觉问题,如忽略音频输入或生成合理但错误的内容。这限制了其在实际应用中的可靠性,需要有效的解码策略来缓解。
本研究系统评估了四种对比解码(CD)策略:音频感知解码(AAD)、音频对比解码(ACD)、音频最小测试时间干预(AMTI)和解码通过对比层(DoLa)。为分析错误模式变化,引入了过渡矩阵(Transition Matrix)框架,自动分类响应状态(如幻觉无音频、错误推理等),并使用LLM-as-a-Judge进行自动评估,以可视化CD对错误纠正的机制。
本研究通过系统实验和错误分析,为基于基线错误配置选择适合CD增强的LALM架构提供了清晰实用指南。
口语语言模型(SLMs),特别是交错SLMs,在推理时计算成本高昂,因为每个生成步骤都需要使用完整的变换器深度解码,尤其对于长语音序列,这限制了实时部署的可行性。
提出SPAR-K框架,一种模态感知的早期退出方法,专为交错SLMs设计。核心创新在于引入语音交替深度调度:在语音令牌生成中,大多数位置在固定中间层早期退出以减少计算,同时周期性插入全深度解码步骤作为“刷新”,以缓解因早期退出引起的分布偏移,从而保持感知质量。
在Step-Audio-2-mini和GLM-4-Voice两个SLM上评估,使用四个数据集(AlpacaEval、Llama Questions、TriviaQA、WebQuestion),涵盖推理、事实QA和对话任务。实验结果表明,SPAR-K在最大准确度下降仅0.82%的情况下,减少平均语音解码深度达11%(Step-Audio-2-mini)和5%(GLM-4-Voice),同时平均意见评分(MOS)和词错误率(WER)变化可忽略,且无额外计算开销。此外,研究证实文本LLM中广泛使用的基于置信度的早期退出策略在SLMs中效果不佳,凸显了语音令牌的独特性。
SPAR-K是首个针对交错SLMs的早期退出工作,通过周期性调度有效加速推理,同时最小化质量损失,为SLM部署提供了实用解决方案。
当前语音和文本的自监督学习目标主要关注语言重建,但对情绪线索表示不足,导致情绪识别性能受限。此外,在对话情绪识别(ERC)中,存在上下文依赖、说话人轮换和模态不平衡等挑战。在语音合成领域,实现无文本、非并行的语音到语音情绪风格转移,同时保持说话人身份和语言内容,是一个未解决的难题。
通过广泛的客观和主观评估,验证了所提方法的有效性。在情绪风格转移中,实现有效的情绪转移、说话人保持和内容不变性;在情绪识别任务中,多个基准数据集上表现出鲁棒性能,尤其在低资源场景下通过数据增强提升识别准确率。
该论文通过创新的声学-语义联合建模方法,显著提升了情绪理解和合成能力,为构建更可靠的AI情绪感知系统奠定基础,具有临床应用潜力。
现有零样本语音转换模型在情感控制方面表现不佳或不一致,缺乏显式情感控制机制,导致情感转换准确率低,难以实现高强度的目标情感转换。
提出Emotion-Aware Prefix方法,基于VEVO两阶段语音转换框架(序列调制和声学实现)。通过情感感知前缀编码器提取内容不变的情感风格嵌入,结合深度前缀提示机制将情感信息显式注入序列调制阶段,实现情感控制的增强,同时保持语言内容、说话者身份和语音质量。
在Emotion Speech Dataset (ESD)上评估,情感转换准确率(ECA)从基准VEVO的42.40%大幅提升至85.50%,其他指标如说话者相似度(Spk-Cent SIM为0.500)、语音质量(UT-MOSv2为2.960)和可懂度(WER为6.28%)均保持良好。消融实验表明,联合控制序列调制和声学实现对情感合成至关重要,且方法具有通用性。
该方法通过引入显式情感控制机制,显著提升了语音转换模型的情感转换能力,为情感语音合成应用提供了高效解决方案。
该论文系统研究了RVQ深度在神经音频编解码器中作为对抗性防御的作用,为ASR的预处理方法提供了新见解,并展示了可控量化粒度在平衡容量与稳健性上的有效性。
Speech Content Factorization (SCF) 是一个封闭集方法,要求所有说话人都包含在分解过程中,这限制了其在开放集语音转换(如处理未见说话人)和音色提示文本到语音等下游任务中的应用,因为重新计算分解成本高且不适用于数据不足的说话人。
Universal Speech Content Factorization (USCF) 扩展 SCF 到开放集设置,通过最小二乘优化学习一个通用语音到内容映射(提出了三种方法:W1、W2、W3),并从仅几秒钟的目标语音中推导说话人特定变换矩阵,实现了一样本适应和零样本语音转换。
在语音转换实验中,USCF 作为零样本系统,在可理解性(WER 为 2.70%、2.31% 等)、自然度(UTMOS 约为 2.8)和说话人相似性(Spk Sim 约为 0.42-0.56)方面与基线方法(如 kNN-VC、LinearVC、SCF)竞争性相当。此外,USCF 特征可用作训练音色提示文本到语音模型的声学表示,展示了其训练效率和实用性。
USCF 是一个简单、可逆的线性方法,有效解决了语音内容因子分解中的开放集问题,在语音转换和文本到语音任务中实现了高性能和低数据需求。
论文指出,现实世界环境是动态的,音频和视觉分布随时间变化,而现有音频-视觉分割(AVS)系统假设静态训练设置,导致在持续学习场景下面临灾难性遗忘、跨模态干扰和评估复杂性增加等挑战。具体痛点包括:多模态对齐退化、细粒度分割边界难以维持,以及新类别引入带来的特征空间偏移。
论文提出两个主要创新点: 1. CL-AVS基准:首个无需示例的持续学习基准,针对音频-视觉分割,包括四种学习协议:任务增量学习(TIL)、类增量学习(CIL)、域增量学习(DIL)在单源AVS数据集上,以及任务自由持续学习在多源AVS数据集上。 2. ATLAS基线框架:一个无需示例的持续学习方法,采用音频引导的预融合条件调制视觉特征通道,并通过低秩锚定(LRA)机制稳定适配权重,以减轻参数漂移和灾难性遗忘。ATLAS基于LoRA适配器,实现参数高效的持续学习。
根据论文摘要,广泛的实验表明,ATLAS在不同持续学习场景中表现出竞争性性能,为终身音频-视觉感知奠定了基础。具体实验细节在提供的片段中未完全展开,但强调了基准的全面性和方法的有效性。
该论文为音频-视觉分割的持续学习领域提供了开创性的基准和强有力的基线方法,推动了多模态系统在动态环境中的实际应用。
VoxEmo 为 Speech LLMs 在语音情感识别中提供了一个全面、标准化的评估框架,有效解决了零样本随机性和情感模糊性挑战。
先前的自回归语言模型(LMs)用于无损音频压缩仅限于8位音频,不适用于实际高保真设置(如16/24位)。标准样本级令牌化导致词汇量呈指数增长(如16位需65,536个令牌,24位需16,777,216个),使高比特深度音频压缩计算不可行,难以与传统编解码器(如FLAC)竞争。
提出Trilobyte,一种字节级令牌化方案,将每个音频样本分解为字节序列(如24位分解为3个字节),词汇量从指数缩放O(2^b)降至常数O(1)。这实现了首个可训练的24位音频LM压缩,兼容任何自回归建模框架(如Transformer),并改进了16位音频的压缩率。
在多样化的全保真音频(音乐、语音、生物声学)上,LMs在8位音频上平均优于FLAC 217%,在16位音频上优于18%,但在更高比特深度(如24位)压缩增益变得有限。采样率(16kHz-48kHz)和数据域对压缩性能影响较小,比特深度是关键限制因素。
Trilobyte为高保真音频的无损压缩提供了基于语言模型的可行方法,实现了24位音频的可处理建模,但压缩增益随比特深度增加而减弱,表明仍有优化空间。
自回归(AR)LLM-based ASR 系统虽然准确率高,但其顺序解码限制并行性,导致高延迟和低吞吐量,不适合实时应用。此外,这些系统丢弃了语音编码器产生的初始假设,尽管它常提供合理草案。CTC 等非自回归(NAR)方法虽并行但受条件独立假设限制,缺乏强大语言建模能力,易产生局部错误。
NLE 将 ASR 重构为条件转录编辑任务,采用非自回归方法。它使用预训练的 CTC 语音编码器提取声学嵌入和初始假设,然后通过双向 LLM 编辑器进行并行编辑。创新点包括: - 交错的填充策略(interleaved padding strategy),利用 Transformers 的身份映射偏差,使模型专注于修正而非完全重建,支持局部插入操作。 - 通过 LoRA 适配器将预训练 LLM 适应为双向注意力,实现非自回归编辑,同时保持 LLM 权重可共享。 - 训练时使用潜在对齐目标(CTC-style objective)处理变长映射。
NLE 通过非自回归编辑结合 LLM 的语言知识,在保持高准确性的同时大幅提升推理速度,为实时 ASR 应用提供高效解决方案。
This paper offers a thorough review of computational approaches to early language acquisition, emphasizing unsupervised learning and ecological validity to bridge theory and empirical findings.
视听语音识别(AVSR)通过融合声学和视觉线索(如唇部运动)来提高转录鲁棒性,尤其在噪声环境中。然而,AVSR模型的训练依赖于大规模标注的视听数据,这对于大多数低资源语言来说是不可获得的,因为这些语言缺乏标注的视频语料库,限制了AVSR的广泛应用。
论文提出了一种零AV资源AVSR框架,利用合成视觉数据来克服数据稀缺问题。具体方法包括: - 从音频-仅有语料库(如西班牙语和加泰罗尼亚语的音频数据集)生成合成视听数据,通过唇语同步技术(使用预训练的Wav2Lip+GAN模型)将静态面部图像动画化,生成与音频同步的说话头视频。 - 该方法不依赖任何真实标注的视听数据,而是使用合成视频作为视觉监督,与真实音频配对进行训练。 - 基于AV-HuBERT模型进行微调,采用序列到序列设置,并结合半自动标注管道构建评估基准(如为加泰罗尼亚语创建手动标注的测试集)。
该框架通过合成视觉数据为低资源语言的视听语音识别提供了一种可行替代方案,显著降低了数据依赖,拓展了多模态语音识别的应用范围。
现有研究在跨语言副语言语音任务中,缺乏系统化评估方法,任务级语言依赖不明确,方法不统一。具体地,先前研究通常关注孤立语言对或任务特定设置,限制了可比性,无法系统评估任务级语言依赖性。
提出了Cross-Lingual Transfer Matrix (CLTM),一种归一化成对测量方法,量化捐赠语言数据对目标语言下游性能的影响。CLTM基于性能变化,定义为捐赠语言数据引起的目标语言性能变化相对于等效目标语言数据的标准化比率。此外,引入了多个度量如相对Frobenius偏差、相对不对称性和平均行余弦相似性,以系统分析转移模式。
应用CLTM到两个副语言任务(性别识别和说话人验证),使用44种语言和基于HuBERT的多语言编码器。实验结果表明,任务和语言间存在系统性的转移模式:性别识别任务显示出更强的语言无关性(较低的相对Frobenius偏差),而说话人验证任务则表现出更大的语言依赖性。这些模式反映了副语言任务中的跨语言交互特性。
该论文提供了一个有效的性能基础框架来系统量化跨语言转移,有助于深入理解副语言任务的跨语言依赖,并为未来研究提供可比性标准。
该论文通过模糊感知推理框架增强了LALMs的情感理解能力,为情感模糊建模提供了新见解,具有实际应用价值。
当前基于大型语言模型(LLM)的生产语音管道(如ASR-LLM-TTS)依赖沉默超时进行对话转向(turn-taking),导致响应延迟和不自然的中断。现有模型如VAP(Voice Activity Projection)和基于文本或单通道音频的分类器无法完全捕获真实对话中的复杂现象(如重叠、打断、回应),且缺乏语义建模能力或处理双通道上下文。
DualTurn提出一种新颖的方法,通过两阶段训练学习对话转向: - Stage-1(生成性语音预训练):使用双通道对话音频,模型自动回归地预测双方说话者的未来音频令牌,以无监督方式学习对话动态、语义和韵律信息。架构包括冻结的Mimi神经编解码器(用于音频编码)和Qwen2.5-0.5B LLM骨干。 - Stage-2(转向信号预测):在预训练骨干上微调12个轻量级分类头(每通道6个),预测六种转向信号(如发言结束、中间停顿、发言开始等),这些信号基于自监督的语音活动对齐生成。信号随后通过启发式或逻辑回归(LR)探针映射到五个代理动作(如开始说话、继续聆听)。 - 关键创新:首次将S2S生成性预训练作为表示学习阶段,用于模块化管道中的显式转向预测;模型连续监控双通道,提前预测转向边界,无需依赖语音活动检测(VAD)。
在标准数据集Switchboard(138会话测试集)和otoSpeech上评估: - 代理动作预测:DualTurn(0.5B参数)优于VAP(5.8M参数),加权F1分数在Switchboard上为0.633 vs. 0.389,在otoSpeech上为0.707 vs. 0.461,其中回应(backchannel)检测提升显著(BC F1 0.349 vs. 0.000)。 - 字级转向预测:使用预测信号,DualTurn在字级转向分类上优于3.1B参数的音频-文本融合模型(AUC 0.930 vs. 0.880)。 - 预测提前性和减少中断:模型能提前约240ms预测转向边界(中值-360ms vs. VAP的-140ms),并将ST-for-CL混淆降低5个百分点,减少中断。
DualTurn通过双通道生成性预训练,有效解决了对话转向问题,为语音系统提供了更自然、准确和低延迟的转向预测,填补了现有S2S模型与模块化管道之间的能力鸿沟。
核心痛点 端到端全双工语音对话模型(如 SALM-Duplex 和 Moshi)的隐藏状态在持续处理用户语音时,泄漏说话者身份信息,导致隐私风险,可能违反 GDPR 等法规。实验显示,这些模型的隐藏状态在不同层和对话轮次中均存在显著泄漏,例如 SALM-Duplex 的连续编码器 EER 为 28.5%,Moshi 的离散编码器 EER 低至 6.4%,接近完美识别。
方法创新 论文提出两种流式匿名化设置来缓解泄漏:Anon-W2W(波形到波形)将 Stream-Voice-Anon 作为波形级前端,保留原始编码器;Anon-W2F(波形到特征)在特征域替换编码器并启用匿名化,消除冗余处理。这些方法基于 Stream-Voice-Anon,旨在实时保护隐私而不牺牲对话实用性。
实验结果 在 VoicePrivacy 2024 评估协议下,Anon-W2F 将离散编码器基线的 EER 从 11.2% 提升到 41.0%(接近 50% 随机机会),显著增强隐私;Anon-W2W 在保持亚秒级响应延迟(FRL 低于 0.8 秒)的同时,保留了基线 sBERT 分数的 78-93%。层析和轮次分析显示,匿名化后隐私保护显著改善,但 Moshi 的 W2W 设置随对话长度逐渐退化。
一句话评价 这项研究首次系统分析了全双工语音对话模型中的说话者身份泄漏,并提出了有效的流式匿名化方法,在增强隐私保护的同时保持了对话质量,为隐私合规的语音助手开发提供了实用方案。
现有视频到音频生成方法通常采用两阶段设计:首先通过对比学习对齐音频-视频(AV)编码器,然后利用视频表示指导音频生成。这种方法虽然在全局语义对齐上有效,但限制了时间节奏同步,因为对比学习将AV对视为整体,未区分时间片段,且视频指导是全局的,未能精确指导每个音频片段的节奏和幅度。这导致生成的音频在语义和节奏上与视频内容不同步,影响自然性和协调性。
本文提出Foley-Flow框架,包含两个核心创新: 1. 掩码音频-视频对齐(VAMA):通过掩码建模训练单模态AV编码器,让音频编码器在对应视频片段的指导下恢复被掩码的音频片段,从而学习语义和节奏一致性,而非仅依赖对比学习。 2. 动态条件流:基于速度流生成框架,利用时间变化的视频特征作为动态条件,逐步指导对应音频片段的生成,实现精细的节奏同步和高效推理。
在VGGSound数据集上评估,Foley-Flow在多个指标上超越现有方法,达到最先进性能: - 语义对齐指标(如对齐准确度)最佳。 - 节奏指标(如Kullback-Leibler散度、Frechet Audio Distance)显著改善。 实验结果表明,模型能生成语义和节奏连贯的音频,与各种视频序列协调。
Foley-Flow通过掩码对齐和动态条件流,有效地解决了视频到音频生成中的节奏同步问题,为这一任务设定了新基准。
核心痛点: 多语言说话人验证面临跨语言数据有限和说话人嵌入中语言依赖信息的问题,导致在语言不匹配条件下性能显著下降,并因对英语中心数据集的依赖而加剧。
方法创新: 1) 采用多语言自监督 w2v-BERT 2.0 模型作为主干,增强 Layer Adapters 和 Multi-scale Feature Aggregation 以更好地利用多层表示;2) 应用语言对抗训练策略,使用 Gradient Reversal Layer 促进语言不变说话人嵌入;3) 利用多语言零样本 TTS 系统 Qwen3-TTS 合成多语言语音,增加语言多样性。
实验结果: 实验结果表明,微调大规模预训练模型获得竞争性能,语言对抗训练进一步增强了鲁棒性,合成语音增广在有限训练数据条件下提供额外增益。评估在 TidyVoice 2026 Challenge 的开发集和评估集上进行,包括已见和未见语言子集。
一句话评价: 该论文通过结合语言对抗学习和合成语音增广,创新地解决了多语言说话人验证的挑战,提升了跨语言性能和鲁棒性。
Whispered speech 缺乏声带振动和基频,导致声学线索退化,使得 whisper-to-normal (W2N) 转换具有挑战性,尤其是在并行数据有限的情况下。现有方法依赖稀缺的并行 whispered-normal 数据,且传统的基于 DSP 的伪 whisper 数据存在分布差异,提供有限性能提升。此外,对抗学习方法训练不稳定,难以保持说话者音色和自然韵律。
提出 WhispEar,一个双向框架,基于统一的语义表示来捕捉 whispered 和 normal speech 之间的说话模式不变信息。框架包含 W2N 和 normal-to-whisper (N2W) 模型,其中 N2W 模型支持从丰富的 normal speech 中生成零射伪并行 whisper 数据,用于可扩展的数据增强。训练分为三个阶段:语义分词器蒸馏、共享流匹配声学模型训练、统一分词器训练与伪并行数据生成。该方法通过语义对齐减少对并行数据的依赖,并实现高效缩放。
实验在双语(中文和英文)数据集上进行,评估指标包括语音质量(如 UTMOS、DNSMOS)、可懂度(WER/CER)、韵律(F0 相关性)和说话者相似性。WhispEar 在 whisper-to-normal 转换中优于强基线(如 WESPER、DistillW2N、CosyVoice2、MaskCycleGAN),并通过增加生成的伪并行数据,性能持续改善,验证了数据为中心缩放的有效性。例如,在 wEar 数据集上,WhispEar-Scaled 在各项指标上表现出显著提升。
WhispEar 通过创新的双向框架和伪并行数据生成策略,有效解决了 whispered speech 转换中的数据稀缺问题,实现了高性能、可扩展的语音转换,并为该领域提供了大规模双语数据集。
文本到音频(T2A)扩散模型生成高质量音频,但需要数十次函数评估(NFE),导致多秒延迟和有限吞吐量,在生成规模下带来高用户感知延迟和基础设施成本。
SoundWeaver 提出首个训练无关、模型无关的服务系统,通过语义预热启动加速 T2A 扩散。系统包括三个关键组件: 1. Reference Selector:通过语义和时长感知门控检索并时序对齐缓存音频候选,利用 CLAP 评分和金字塔索引优化检索。 2. Skip Gater:使用上下文多臂老虎机(MAB)动态决定跳过的 NFE 百分比,平衡效率与质量,并采用排名奖励归一化和提示方差加权训练。 3. Cache Manager:轻量级缓存管理器,通过质量感知淘汰和细化维护缓存效用,定义重要性分数并应用指数衰减更新。
在真实音频跟踪(如 AudioCaps)上评估,SoundWeaver 仅用约 1K 条目的缓存,实现了 1.8–3.0 倍的端到端延迟加速,同时保持或提高了感知质量。实验在 A100 GPU 上进行,使用 Clotho v2 构建缓存。
SoundWeaver 通过智能缓存和动态跳过策略,有效利用音频语义相似性,显著提升了文本到音频扩散服务的效率和实用性。
大多数现有的Audio-Visual Target Speaker Extraction (AVTSE)方法依赖于frontal-view视频,这限制了在现实场景中非frontal视角下的鲁棒性,因为非frontal视角可能包含补充的articulatory信息。
本文提出Multi-View Tensor Fusion (MVTF)框架,将多视角学习转化为单视角性能增益。在训练阶段,利用同步多视角唇视频通过MVTF学习跨视角相关性,使用pairwise outer product显式建模不同视角唇嵌入的乘性交互。在推理阶段,系统支持单视角和多视角输入。MVTF模块基于TF-GridNet骨干,包括LSTM处理和tensor融合,增强了视角不变表示,无需推理时多相机设置。
在MEAD数据集上的实验表明,MVTF-GridNet在单视角输入下利用多视角知识实现了显著的性能增益(例如,SI-SDR平均提升至15.718),在多视角模式下进一步提高了整体性能和鲁棒性。与基线方法如GridNet、Projected Addition和Attention Fusion相比,MVTF在多个测试视角下表现更优,并展示了在头部姿势变化下的鲁棒性。
MVTF框架通过有效融合多视角信息,显著提升了AVTSE系统的鲁棒性和实用性,尤其在单视角输入下表现突出,为现实世界应用提供了新思路。
引擎声音建模在汽车音频行业中至关重要,尤其对于主动声音设计、虚拟原型和数据驱动合成方法。这些应用需要大量标准化、清洁的音频录音,配备精确时间对齐的操作状态注释。然而,由于成本高、专业测量设备需求和不可避免的噪声污染,此类数据难以获取。
提出分析驱动的过程生成框架,用于生成具有样本精确控制注释的引擎音频。方法包括:通过音高自适应谱分析从真实录音中提取谐波结构,然后驱动扩展的参数谐波加噪声合成器。该框架集成了谱分析特征提取、参数合成模型和多通道同步编码,确保生成音频保留真实声学特性并嵌入控制参数。
使用该框架生成了Procedural Engine Sounds Dataset(19小时,5,935文件),涵盖广泛操作条件、信号复杂性和谐波轮廓。验证显示合成数据保留了特征谐波结构及其对操作条件的依赖性。基线实验证实了数据集适合基于学习的参数估计和条件合成任务。
这项工作为引擎声学研究和数据驱动音频合成提供了一个高质量、可控且可扩展的数据集,支持了多种应用,如音色分析、参数估计和生成网络。
自动帕金森病(PD)检测从语音中是一个有前景的非侵入性诊断工具,但引发了严重的隐私问题。匿名化可以缓解隐私风险,但可能抑制PD检测所需的病理信息,导致隐私与检测性能之间的权衡挑战。
本研究创新性地评估了两种匿名化方法(STT-TTS和kNN-VC)在两个西班牙语数据集(PC-GITA和Neurovoz)上对PD检测的影响。使用基于Wav2vec2特征的PD检测器进行性能评估,并分析声学失真,以量化隐私保护下PD信息的保留程度。
kNN-VC保留了宏观韵律特征(如持续时间和F0轮廓),在PD检测上的F1分数仅比原始基线低3-7%,表明隐私保护的PD检测是可行的。STT-TTS则通过消除韵律信息严重损害了PD检测性能,F1分数大幅下降。实验结果还显示,kNN-VC在句子任务上表现更佳,而独白任务更具挑战性。
kNN-VC在保护隐私的同时,有效支持了帕金森病的语音检测,为医疗语音处理中的隐私保护提供了实用解决方案。
现有语音增强模型在真实世界环境中部署后适应新声学条件时,面临高计算和内存成本,不适合设备端部署。传统方法如大量数据增强或复杂模型架构增加负担,而现有适应方法如RemixIT需要大量参数更新,可能导致过拟合和收敛缓慢,且在处理动态序列性场景变化时泛化能力有限。
提出一个轻量级自监督适应框架,基于低秩适配器(LoRA)。框架冻结预训练的主干网络,仅通过更新低秩适配器来适应新声学场景,参数更新少于1%。使用自监督训练生成伪目标,避免对干净参考音频的依赖,支持序列性场景变化的持续适应,提高效率并减少灾难性遗忘。
在111个环境、37个噪声类型和三个SNR范围(包括挑战性的[-8,0] dB)的评估中,使用GRU和DPRNN两种网络架构。框架在每场景仅20次更新内,平均SI-SDR改进1.51 dB。与基线方法RemixIT相比,感知质量竞争或更优(如PESQ和STOI分数),收敛更平滑稳定,参数更新少,验证了其在设备端部署的实用性。
该工作提出了一种高效、轻量级的自监督适应方法,显著提升语音增强模型在真实世界动态环境中的鲁棒性和性能,适合资源受限的设备端应用。
传统音频带宽扩展方法在重建高频细节上效果有限;现有的学习型方法如扩散模型计算成本高,难以实时部署;GAN-based方法虽快但通常支持固定的输入/输出采样率对,缺乏灵活性。
提出基于Vocos神经声码器的BWE模型,通过将所有输入重采样到48 kHz,使单个网络支持任意输入采样率(8-48 kHz)。引入Linkwitz-Riley启发式频率精炼器,平滑融合原始低频和生成高频,提高感知质量。使用ConvNeXt-style块和对抗训练,优化频谱和感知损失。
在VCTK语料库上评估,模型在Log-Spectral Distance (LSD)上表现竞争性(如8→48 kHz LSD为0.85),ViSQOL得分高(如8→48 kHz ViSQOL为3.51)。实时因子(RTF)极低,在NVIDIA A100 GPU上为0.0001,在8核CPU上为0.0053,展示出高速性能和零样本泛化能力。
该模型在音频带宽扩展中实现了高质量与高效率的优异平衡,具有灵活性和实用性,适用于实时和大规模部署。
当前音频-视觉语音识别(AVSR)方法主要关注唇部运动,忽视了视频中丰富的视觉上下文(如场景和屏幕文本),导致在识别同音词、命名实体和领域特定术语时存在歧义问题。此外,该领域数据稀缺,缺乏针对上下文AVSR(CAVSR)的高质量数据集。
提出VASR框架,专注于CAVSR,通过多模态推理“看到”视觉上下文。引入Audio-Visual Chain-of-Thought(AV-CoT)机制,将CAVSR建模为感知(提取视觉和音频特征)、推理(跨模态消歧)和转录(生成文本)的三步推理过程,有效缓解“单模态主导”问题(即模型过度依赖音频或视觉线索)。还构建并开源了一个可扩展的数据管道和VASR测试集,以解决数据稀缺问题。
实验表明,AV-CoT机制显著缓解了单模态主导问题,在CAVSR任务中实现了最先进的性能。VASR框架在消除语音歧义方面表现优异,特别是在汉语等同音词丰富的语言中。
这篇论文通过创新的多模态推理框架,结合视觉上下文有效提升语音识别准确性,为上下文感知语音识别领域提供了重要进展。
自我监督语音模型(S3Ms)在表示语言相似性时,通常仅反映地理邻近性或表面类型学特征,难以捕捉深层次的家谱关系和长期语言接触信号。
论文通过大规模扩展S3Ms的语言覆盖范围,从126种语言增加到4,017种语言,比较了MMS-LID模型系列(126, 256, 1,024, 4,017语言版本)。采用嵌入提取(基于最终transformer层隐藏状态计算语言质心)和层次聚类(Ward-linkage)分析49种语言的表示空间,并通过调整兰德指数(ARI)和标准化互信息(NMI)评估系统发育恢复能力。
这项研究表明,大规模多语言训练使S3Ms能够内部化多层语言历史,为计算系统发育学和语言接触研究提供了新的计算视角。
肠道声音(BS)具有瞬时性、低振幅和不可预测的间隔,使得手动听诊难以准确检测,导致临床评估主观性强、变异性高,缺乏定量测量。传统方法依赖医生主观判断,听诊时间延长增加临床工作量。
本研究提出一个自动化管道,用于BS的分割和分类。关键创新包括: 1. 基于能量的事件检测算法:使用短时分析(1 ms非重叠帧)提取时间域特征(如RMS振幅和能量变化),结合自适应阈值检测BS事件,以应对BS形态多样性。 2. 音频频谱图变换器(AST)模型分类:预训练的AST模型用于将检测到的声音段分类为四种BS模式(Single Burst, Multiple Burst, Continuous Random Sound, Harmonic Sound)。 3. 专门化模型:训练两个独立模型,一个针对健康个体,一个针对患者,以提高性能。 4. 端到端自动化:集成事件检测和模式分类,减少手动标注需求,标注时间降低约70%。
该研究提供了一个有效的端到端自动化系统,通过结合事件检测和深度学习分类,为胃肠道听诊提供了客观、定量的诊断工具,有望改善临床决策和大型数据集标注。
大多数公开可用的工业故障分析数据集存在以下局限:在实验室条件下收集,聚焦于有限机器类型(如电机或轴承);依赖单一传感模态(通常是音频或振动),未能捕捉多模态互补信息;噪声条件被排除或通过合成数据增强引入,导致与实际工业部署不匹配。
本文引入SSCC(Single-Speed Chain Conveyor)多模态工业故障分析数据集,从单一速度链输送机系统收集,包含三种音频通道和四种振动通道。关键创新包括:覆盖正常操作和四种故障类型(lean、dry、loose、screwdrop)在不同速度、负载和噪声条件下;集成真实工厂噪声,支持信道分析和多模态融合研究;提供统一评估协议,支持无监督故障检测(正常样本训练)和有监督故障分类(平衡数据集划分)。
基于预训练音频编码器(如BEATs、CED、DaSheng等)的故障检测性能(AUROC)评估显示,融合多模态特征通常优于单一模态。例如,BEATs融合特征的AUROC达到0.891,验证了多模态方法的有效性。
提供一个实用且可扩展的基准,推动鲁棒多模态工业故障分析研究,填补了现有数据集的空白。
提取患者医疗条件从代码切换的Hinglish(印地语-英语混合)临床对话中面临重大挑战,包括快速说话人交替、高度重叠语音、多语言代码切换、嘈杂远场录音和自发语音,这些因素复杂化了标准提取流程。
提出一个级联系统:1)使用端到端神经说话人日记化与向量聚类(EEND-VC)处理密集和重叠语音,优化用于医生-患者对话;2)通过领域特定微调、Devanagari脚本规范化和对话级LLM错误纠正,适应Qwen3 ASR模型进行转录;3)评估文本级级联系统与多模态端到端音频框架,利用开源和专有LLM进行医疗条件提取。
在DISPLACE-M数据集(真实世界Hinglish医疗对话)上评估,系统达到18.59%的tcpWER(转录错误率),在DISPLACE-M挑战中获得第一名(25名参与者)。实验还对比了不同LLM性能,专有端到端模型设定了性能上限,而开源级联架构具有高度竞争力。
该系统通过协同说话人日记化和ASR,在代码切换医疗对话提取中实现了优异性能,为低资源语言和现实环境提供了有效、可复现的解决方案。
核心痛点: 自闭症韵律差异的跨语言研究证据有限,现有研究多集中于基频(f0)分析,而对声音质量和强度动态的实证数据不足,导致对语言独立标志的识别不全面。
方法创新: 本研究采用多语言语料库(芬兰语、法语、斯洛伐克语),从超过5,000个停顿间单元提取88个声学特征,使用主成分分析(PCA)进行降维,并应用线性混合效应模型(LMMs)进行统计分析,以控制语言和说话者间的变异,从而孤立可能区分诊断组的韵律特征。
实验结果: 跨语言分析显示,自闭症说话者表现出更高的总体强度变异性、更清晰的声音质量(更高的谐波噪声比和alpha比),但减少了时间强度动态和较低的中央f0。单语分析揭示了语言特定细微差别:斯洛伐克语在基频模式上与跨语言结果一致,但在声音质量上有所不同;芬兰语结果与跨语言声音质量发现相似;法语数据因样本量有限未显示显著差异,但贡献于跨语言模型。
一句话评价: 该研究挑战了基于缺陷的模型,通过跨语言声学分析提出了自闭症的复杂韵律特征,强调声音质量和强度动态在语言独立标志中的重要性。
核心痛点
自闭症儿童的语音韵律特征在不同语言中可能存在差异,现有研究缺乏跨语言的系统性比较,难以识别哪些声学线索是语言特定的、哪些是语言通用的,这限制了鲁棒分类器的开发。
方法创新
本研究采用跨语言方法,结合监督分类(XGBoost和Random Forest模型)与声学-韵律特征(通过openSMILE工具提取eGeMAPS特征),进行语内和跨语料库转移实验。研究重点不在于追求最优性能,而是作为分析工具,探索语言依赖和共享的线索,并通过特征重要性分析(如TreeSHAP和排列重要性)来识别关键声学标记。
实验结果
- 语内模型:芬兰语性能最佳(准确率0.84,F1 0.88),斯洛伐克语次之(准确率0.63,F1 0.68),法语最差(准确率0.68,F1 0.56)。
- 跨语言转移:所有语料池化模型总体准确率0.61,F1 0.68。留一语料库实验显示,对斯洛伐克语(F1 0.70)和芬兰语(F1 0.78)转移成功,但对法语(F1 0.42)转移较差。
- 特征重要性分析表明,自闭症相关的声学标记部分跨语言共享,但非完全语言不变,提示需要语言感知建模。
一句话评价
这项研究通过跨语言实验揭示了自闭症语音线索的部分共享性,为未来开发语言感知的鲁棒分类器提供了重要基础。
语音基础模型在处理低资源太平洋土著语言时面临严重的数据稀缺和分布距离问题,这些语言缺乏大规模标注语料库,且与预训练数据中的高资源语言分布差异大。这导致模型在适应时容易发生灾难性遗忘,并引发可塑性-稳定性的严峻困境。
本研究提出一个实证框架,使用Whisper-Small作为基础模型,评估了两种适应策略:全参数微调(Full Fine-Tuning)和低秩适应(LoRA)。方法包括交叉语言转移分析、表示漂移量化(通过余弦距离测量内部激活变化)和持续学习分析(序列学习多个语言),以探究适应过程中的内部动力学。
实验显示,随着训练数据量增加,字符错误率(CER)和词错误率(WER)普遍改善,但LoRA在序列学习中遭受严重灾难性遗忘,而全参数微调导致更大内部表示漂移。表示漂移分析证实适应引发模型内部重组,突出了当前方法在稳定性上的不足。
本研究强调了为低资源、代表性不足语言开发数据高效且结构鲁棒的适应策略的紧迫性,以应对语音识别中的公平性和可扩展性挑战。
长语音识别中,大型编码器-解码器模型如 Whisper 常出现幻觉(如虚构词、重复循环、内容省略),错误在分段处理时积累和放大,尤其在利用前段转录作为解码上下文时加剧。
提出 Whisper-CD,一个训练免费的对比解码框架,基于多负信号对比:使用三种音频扰动(高斯噪声注入、静音信号、音频时间偏移)生成负 logits,通过 log-sum-exp 聚合形成统一目标,在推断时逐令牌解码以抑制幻觉。
在五个英语长语音基准测试(如 CORAAL、Earnings22)中,Whisper-CD 显著减少词错误率(WER),最高降低 24.3 百分点,生成吞吐量比波束搜索快 48%,且兼容现有 Whisper 系统无需重训练。
Whisper-CD 是一种高效、无需训练的解码时方法,能有效解决长语音识别中的多样错误模式,提升准确性和实用性。
流式说话者匿名化(SA)在保留情感内容方面面临挑战,主要问题包括:1. 基于神经音频编解码器语言模型的音频延续训练范式倾向于退化源情感,模型默认到主导声学模式而非保留副语言属性;2. VQ瓶颈丢弃了携带情感信息的细粒度声学细节,导致情感退化。
提出StreamVoiceAnon+方法,通过以下创新点解决情感保留问题:1. 监督微调(SFT),使用相同说话者的中性-情感话语对进行训练,强制模型从源内容生成情感输出而非复制提示模式;2. 帧级情感蒸馏,在声学令牌隐藏状态上应用蒸馏损失,隔离情感学习与内容监督,避免梯度竞争。所有修改仅限于微调阶段,无推理延迟增加,流式延迟保持180ms。
在VoicePrivacy 2024协议上评估:1. 情感保留(UAR)达49.2%,相对于基线(39.7%)提升24%;2. 可理解性(WER)为5.77%;3. 隐私(EER)为49.0%,保持较强隐私。与先前沿流式方法相比,实现了最高的情感保留和零推理开销。
StreamVoiceAnon+通过改进训练范式和引入帧级蒸馏,有效提升流式说话者匿名化中的情感保留,同时维持隐私和可理解性,适用于实时隐私保护应用。
零-shot Text-to-Speech (TTS) 模型在生成语音时,难以解耦口音和音色等语音特征,导致输出常同时继承参考语音的口音和音色,限制了其在口音自由语音克隆等应用中的实用性。
提出一种新颖的、后处理的、无需训练的方法,称为激活引导(activation steering)。首先离线提取层特定的引导向量(steering vectors),这些向量基于TTS模型内部激活在带口音和中性语音之间的差异。在推理时,应用这些引导向量来引导模型生成口音中和、音色保留的语音,方法基于Qwen3-TTS模型实现,采用单层引导策略。
实验使用ARCTIC和L2-ARCTIC数据集提取引导向量,并在L2-ARCTIC和speechocean762数据集上进行评估。结果显示,引导向量能有效减少输出口音(如降低口音匹配率AMR-CN,提高中性口音匹配率AMR-US),同时对未见说话者表现出强泛化能力。音色相似度得到较好保持,方法高效且适用于实时应用。
该方法为口音中和零-shot TTS提供了一种高效、实用的解决方案,无需额外训练,具有广泛的应用前景,如语音克隆和语言学习辅助。
现有神经音频编解码器主要优化为梅尔频谱重建,导致音频可理解性差;语义编码器蒸馏(SED)方法仅关注编码器,不保证解码器输出的可理解性,且可能引入声学质量下降问题。
提出了自监督表示重建(SSRR)损失,将自监督表示(如 W2V-BERT 2.0)作为重建目标,直接优化编解码器输出以重建这些表示,从而提高可理解性并加速训练。该方法整合到 JHCodec 中,这是一个零预视、流式 Transformer 架构的编解码器,支持低延迟应用。
SSRR 损失显著加速训练收敛,使用单 GPU 即可达到竞争性能;提高音频可理解性指标(如词错误率 WER);实现高可理解性且无需额外预视机制,降低延迟。JHCodec 在实验中表现出最先进的性能,同时保持低训练成本。
JHCodec 结合 SSRR 损失,有效解决了神经音频编解码器在可理解性与低延迟之间的权衡,是一个实用的流式音频压缩方案。
关键词识别(KWS)在环境噪声中准确性下降,现有测试时适应(TTA)方法(如 AdaKWS)在处理严重类别不平衡(稀有关键词 vs 频繁背景声音)时失败,导致标准熵最小化(EM)使模型对频繁类别过于自信,忽略稀有关键词检测。
论文提出 ImKWS 方法,包含两个创新点:1) 解耦熵最小化(DEM),将标准熵分解为奖励分支和惩罚分支,通过可调参数独立控制更新强度,缓解类别不平衡导致的偏置;2) 多视图一致性损失,通过音频变换增强预测一致性,确保梯度稳定并抑制噪声样本影响。方法结合两阶段样本选择策略优化适应过程。
在 Google Speech Commands 数据集上模拟严重不平衡(关键词:非关键词 = 1:8)和不同信噪比(SNR)噪声环境,ImKWS 在宏 F1 分数上显著优于基线方法(如 TBN、Tent、SAR、ETA、AdaKWS)。例如,在 ESC-50 噪声下,ImKWS 在 SNR = -10 dB 时宏 F1 比 AdaKWS 提高 1.23%,显示其在低 SNR 和不平衡场景下的鲁棒性。
该论文首次针对现实不平衡场景的 KWS TTA 提出有效解决方案,通过解耦熵和一致性正则化显著提升了适应性能,为轻量级语音模型的动态部署提供了新思路。
口音变异性是自动语音识别(ASR)系统的主要错误来源,导致用户群体间性能差异,影响公平性和可访问性。现有方法如参数微调或参数高效微调(PEFT)成本高、缺乏控制,且未理解口音信息在模型中的编码位置。
论文提出将口音变化视为隐藏表示中的可解释子空间,通过在激活空间中进行层间分析和控制。方法包括:提取编码器层激活,估计口音诱导的平均偏移方向;使用 Accent Alignment Score(AAS)和特异性分数量化层对口音的敏感性,发现口音信息集中在中间编码器层;引入无参数激活转向,在推理时通过注入转向向量修改表示,而无需更新模型权重。
在 VCTK 和 L2-ARCTIC 数据集上,针对八个口音(如苏格兰、南美、西班牙等)进行实验。结果显示,中间层对口音最敏感,激活转向能显著降低词错误率(WER),提高 ASR 性能。
该方法为语音基础模型的口音适应提供了可解释、高效且可扩展的解决方案,增强了 ASR 的鲁棒性和公平性。
现有多模态系统通常依赖单独的专业模态编码器(如图像、音频、文本编码器),导致系统复杂性和计算开销随模态数量线性增加。统一模型如Mixture-of-Experts (MoE) 虽然尝试解决,但引入参数膨胀、路由开销和更高训练复杂度,仍需多编码器并行加载。
本文提出Omni-C(Omni-Compress),一个基于Transformer的单一密集编码器,通过无模态对比自监督学习在大型未对齐数据上预训练,学习跨异构模态(图像、音频、文本)的共享表示。关键创新包括:最大化参数共享的主干网络、轻量级模态特定投影头缓解模态间冲突,无需MoE、配对监督或路由机制。设计支持顺序模态处理和低内存推理,适合内存受限系统部署。
实验显示Omni-C在单模态任务(如图像分类)和跨模态任务(如检索和零射推断)中达到与专业模型相当的性能。零射性能在音频和文本上略有下降,但通过轻量级线性探测或参数高效微调(如SBoRA)可大幅恢复。与多编码器基线相比,推理内存使用显著减少,提高效率。t-SNE可视化表明模态在嵌入空间中形成清晰分离的簇,同时保持了模态内判别力。
Omni-C通过简化架构和自监督学习,实现高效统一的多模态表示学习,为降低系统复杂性和内存开销提供了创新解决方案。
神经编解码语言模型在离散语音合成中,推理时容易因令牌级不一致和分布漂移而产生感知伪像,影响合成语音的自然度。现有方法如 SpeechAlign 需要重新训练或偏好优化,计算成本高;而解码时间调整如 VALL-E 2 仅针对特定失败模式(如重复控制),缺乏对令牌序列全局一致性和局部自然性的显式评估。
提出 MSpoof-TTS,一个无训练的推理框架,通过多分辨率欺骗检测引导分层解码来提升零样本合成质量。创新点包括:1) 多分辨率令牌级欺骗检测框架:训练多个独立模型在不同时间粒度(如 10、25、50 令牌段)上检测真实与合成令牌序列的分布差异,使用 Conformer 架构捕获局部和长期依赖;2) 分层欺骗引导解码策略:结合熵感知采样(EAS)和基于欺骗分数的候选剪枝与重排序,在推理时逐步优化生成,无需修改基础编解码语言模型参数。
论文通过实验验证了 MSpoof-TTS 框架的有效性,表明在多样解码配置下,能一致提高基于编解码语音生成的感知质量和鲁棒性,减少令牌级 artifacts 并增强输出自然度。具体实验细节未在片段中详述,但摘要强调其在零 shot 合成中的改进。
这项工作创新地将欺骗检测作为推理时指导机制,为离散语音合成提供了一种高效、无训练的质量提升方案,具有较强的实用性和鲁棒性。
大型语音基础模型(LSFMs)在自动语音识别(ASR)中通过域特定微调适应多领域时,会产生多个定制化检查点,导致维护和部署复杂化,且当新数据可用时,重新进行全微调计算成本高昂。
提出BoostedTSV-M,一种新的模型合并算法,基于TSV-M(任务奇异向量合并),通过奇异值提升机制缓解秩塌陷,并使用牛顿-舒尔茨正交化改进数值稳定性,从而增强任务特定信息的保留和算法稳健性。
在10个欧洲葡萄牙语(EP)领域上评估了11种合并算法,包括提出的BoostedTSV-M。实验使用Whisper Large-v3作为基础模型,结果表明BoostedTSV-M在EP领域内(ID)性能优于全微调,同时保持领域外(OOD)泛化能力,且在英语和多语言基准测试中表现良好。
该研究为多域ASR提供了一种高效且可扩展的模型合并方法,通过算法创新显著提升了性能、稳定性和泛化能力。
单通道语音增强方法在复杂声学环境中面临显著挑战,包括低信噪比、高混响、动态说话人、重叠语音和非平稳噪声等情况,导致性能下降和语音失真。
提出了一种新颖的视觉信息神经网络波束成形网络(VI-NBFNet),整合了麦克风阵列信号处理和深度神经网络。该方法利用预训练的视觉语音识别模型提取唇部运动特征作为输入,用于语音活动检测和目标说话人识别。通过引入基于注意力的端到端监督波束成形框架,系统能够处理静态和动态说话人,并联合学习音频-视觉特征、掩码表示和空间信息。
实验评估使用感知语音质量评估(PESQ)、短时客观可懂度(STOI)和深度噪声抑制平均意见得分(DNSMOS)等指标。与基线方法(如VI-SSE、VI-MSE和VI-SA-BF)相比,VI-NBFNet在静态和动态说话人场景中展现出更好的语音增强性能和鲁棒性。
该研究通过整合视觉信息和注意力机制,有效提升了语音增强在复杂环境中的适用性和效果,为多模态语音处理提供了轻量级解决方案。
自动音素识别在幼儿语音中仍是一个未解决的挑战,主要由于数据稀缺、儿童语音与成人语音在声带结构和声学特征上存在显著差异,且现有公开数据集多为英语且覆盖年龄较大,限制了跨语言和早期发展研究。
论文引入了BabAR系统,通过创建TinyVox语料库(标准化自PhonBank,包含超过50万个音素转录的儿童发声,覆盖5种语言),并采用多语言儿童中心日长录音进行自监督预训练,结合上下文感知微调(提供20秒音频上下文)来提升音素识别性能。
BabAR在跨语言儿童语音音素识别中表现优异,错误分析显示替换错误主要发生在相同宽泛音素类别内,表明适合粗粒度发展分析;自动提取的言语成熟度指标(如规范发声比例)与文献中的发展估计一致,验证了其适用性。
该研究为儿童语音的音素识别提供了一个有效的跨语言解决方案,通过大规模数据集和创新训练方法,推动了自动工具在发展研究中的应用。
现有的大型音频语言模型(LALMs)在单音音频(monophonic audio)中表现良好,但在多音音频(polyphonic audio)中性能显著下降,因为多个声音事件同时发生,导致模型难以区分和推理其组合关系。当前基准测试如AIR-Bench和MMAU-Pro对多音音频的覆盖有限,缺乏系统性评估组合推理的能力。
论文提出了PolyBench,这是第一个专门设计用于评估多音音频中组合推理的基准。关键创新包括: - 基准构建:涵盖五个评估子集——计数(Counting)、分类(Classification)、检测(Detection)、并发(Concurrency)和持续时间估计(Duration),要求模型推理多个并发事件及其关系。 - 数据来源:从真实世界录音中采样多音音频片段,包括DataSED、DESED和MAESTRO-Real数据集,以确保场景真实性。 - 评估方法:采用多项选择问答(MCQA)格式,结合人类-LLM协作生成问题,并引入LLM-based法官进行细粒度错误分析,区分感知误解和推理失败。
评估显示,最先进的LALMs在多音音频设置中表现一致下降,暴露出在组合推理方面的根本瓶颈。具体实验设置涉及多样化的开源模型,但片段中未提供具体数字结果;重点在于基准揭示的性能退化趋势。
PolyBench是一个首创的基准,有效识别了LALMs在多音音频组合推理中的关键瓶颈,为未来模型改进提供了重要工具。
语音音色属性检测(vTAD)任务中,深度神经网络嵌入虽然性能良好,但缺乏物理可解释性,计算成本高,且需要大量训练数据和GPU加速,限制了其在需要可靠性和解释性的实际应用(如法医学)中的使用。
研究了一个紧凑的声学参数集,包含13个与语音生产相关的声学特征(如基频、共振峰频率、谐波谱形状、非谐波源度量)及其时间动态(通过变异系数捕获),形成一个26维向量。该方法无需可训练参数,计算成本可忽略,并提供显式可解释性,用于分析人类音色感知背后的物理特征。
在VCTK-RVA数据集上,该声学参数集在vTAD任务中达到82.87%的准确率和17.21%的等错误率,优于传统倒谱特征(如MFCC和LFC)和监控DNN嵌入(如ECAPA-TDNN和FA-Codec),并接近最先进的自监督模型(如WavLM-Large with ASTP-L)。分析表明,时间动态在区分音色属性中起关键作用。
这项工作提出了一种高效、可解释且无需训练的音色检测方法,为语音AI系统的可靠性和解释性提供了重要贡献,促进了基于声学参数的细粒度语音分析。
语音生产分析依赖于声学输出,但它无法直接揭示神经生理基础。同时采集实时MRI、EEG和表面EMG面临技术挑战,包括MRI引起的电磁干扰(如梯度伪影和脉冲伪影)以及肌源伪影(如面部肌肉运动),这些会污染信号并阻碍多模态数据的准确分析。
研究首次实现了实时MRI、EEG和表面EMG的同时采集,捕捉发音运动、大脑信号和肌肉活动。开发了一个多阶段伪影抑制管道:使用模板减法进行梯度伪影校正和脉冲伪影校正,并结合基于参考的典型相关分析(CCA)以EMG和EOG为参考去除肌源和眼动伪影。实验设计包括三种语音任务(全音、无声和想象语音),并使用低场强MRI(0.55T)以改善与电生理记录的兼容性。
初步结果表明,伪影被有效衰减:梯度伪影和脉冲伪影校正后,EEG信号质量改善;CCA方法成功抑制了与EMG和EOG相关的伪影。时间对齐显示,MRI视频和EEG记录的持续时间差异小(平均8.3毫秒/秒),在可接受范围内。EEG/EMG设备对MRI视频的发音区域没有显著影响,验证了设置的兼容性。
这项研究为语音神经科学提供了一个前所未有的多模态窗口,有望推动脑机接口和语音解码技术的发展。
Whispered-to-Normal (W2N) speech conversion is challenged by temporal misalignment between whisper and voiced recordings, lack of paired data, and degradation of intelligibility in prior methods such as VAE-based and GAN-based approaches, which suffer from over-smoothing, training instability, or audible artifacts.
FlowW2N introduces a conditional flow matching approach that trains exclusively on synthetic, time-aligned whisper-normal pairs, eliminating alignment issues. It conditions on domain-invariant features, specifically high-level ASR embeddings (e.g., from Whisper), which show strong invariance between synthetic and real whispered speech, enabling generalization without real paired data. A layer selection criterion balances content informativeness and cross-domain invariance for optimal performance.
On the CHAINS and wTIMIT datasets, FlowW2N achieves state-of-the-art intelligibility, reducing Word Error Rate (WER) by 26-46% relative to prior work like DistillW2N and QuickVC. Inference requires only 10 steps and no real paired data, with high naturalness and speaker similarity scores.
FlowW2N is an innovative method that effectively overcomes alignment and data scarcity in W2N conversion through synthetic data training and domain-invariant conditioning, setting a new benchmark for efficiency and quality.
在低资源个性化语音合成中,使用零样本文本转语音(ZS-TTS)进行数据增强时,天真地混合大量合成语音与有限真实录音会导致说话人相似性降低,尽管可理解性可能提高。
提出 ZeSTA 框架,包括: - 域条件训练(DC):通过轻量级域嵌入(如真实或合成标签)区分训练数据,在推理时仅使用真实域条件,以保留合成语音的语言多样性同时减少说话人身份偏移。 - 真实数据过采样(OS):在微调过程中重复真实目标说话人样本,以强调真实数据并稳定适应。 框架不修改基础 TTS 架构(如 VITS),适用于低资源场景。
ZeSTA 为低资源个性化 TTS 提供了一种简单高效的解决方案,有效平衡了说话人相似性和可理解性,适用于实际部署。
专业音乐制作过程(如均衡、压缩、混响、失真等效果)违反传统音乐源分离的线性混合假设,导致直接分离未处理干音困难,目标是从混合和母带处理后的音频中恢复原始未处理的乐器干音,包括八类乐器:人声、吉他、键盘、合成器、贝斯、鼓、打击乐、管弦乐元素。
论文提出一个两阶段模块化学习系统: - 分离阶段:使用单个BandSplit-RoFormer分离器预测八个目标干音加一个辅助干音。采用三阶段课程训练:从4干音(人声、鼓、贝斯、其他)的干净混合物微调(使用LoRA),扩展到母带处理混合物,最后扩展到8干音通过头扩展,同时冻结骨干网络。 - 恢复阶段:使用HiFi++ GAN波形恢复器,先训练为通用模型,再细化为八个乐器特定专家。恢复训练使用分离器生成的输入以匹配测试时误差,提高训练-测试对齐。
在MSR Challenge 2025测试集上,系统达到平均客观指标:MMSNR 0.8329, Zimtohrli 0.0189, FAD 0.6223,系统级MOS为3.5510。表1显示各干音的详细结果,例如贝斯MMSNR 1.5486,鼓0.9552等。限制包括对噪声混合物的敏感性、数据集不匹配导致的偏差,以及时间效应去除的模糊性。
这是一个高效的两阶段音乐源恢复方法,结合先进的分离和生成恢复技术,在挑战中表现竞争性,但未来需改进数据质量和效应感知条件。
现有语音深度伪造检测系统主要依赖自监督学习表示和传统时频表示,但这些方法未能充分利用语音信号的高阶谱依赖性,导致对精细结构特性建模不足。
引入基于循环平稳性和谱相关密度的声学特征提取框架,提出时间结构的SCD特征,以捕获语音中频率分量之间的谱相关性,建模周期性统计结构。
在ASVspoof 2019 LA、ASVspoof 2021 DF和ASVspoof 5数据集上评估,融合自监督学习和SCD嵌入后,在ASVspoof 2019 LA上将等错误率从8.28%降低到0.98%,并在ASVspoof 5上显示一致改进。
该研究通过循环平稳性分析补充自监督表示,为语音深度伪造检测提供了理论基础强且高效的声学前端特征。
现有基于大语言模型(LLM)的音频-视觉语音识别(AVSR)方法面临模态对齐不足、计算负载高、对输入噪声敏感等问题。先前方法通常独立投影音频和视觉特征或采用浅层融合,限制了跨模态对齐和互补交换。
论文提出AVUR-LLM方法,包含三个核心模块: 1. 稀疏模态对齐(SMA):在音频编码器(使用Whisper)上层稀疏插入轻量级对齐块,以音频为键/值校准视觉特征(使用AV-HuBERT编码器),保持音频表示稳定并减少计算开销。 2. 自适应调制融合(AMF):在解码器中,基于声学可靠性信号(通过前向探针计算)进行令牌级门控,自适应调制视觉特征注入,增强互补性。 3. 视觉单元引导精炼(VUR):将视觉特征离散化为令牌序列,用作LLM(通过LoRA适配)重评分的提示,对N-best假设进行精炼,提升识别准确性。
在LRS3数据集上的实验表明: - 在433小时训练数据下,WER降低至0.75%(优于基线如Llama-AVSR的0.95%)。 - 在噪声环境下,0 dB信噪比(SNR)时,相比基线系统实现37%的相对WER改进。 - 扩展训练数据(LRS3+VoxCeleb2,1759小时)进一步提升性能至WER 0.70%。
该方法通过稀疏对齐和视觉单元引导,高效解决了AVSR中的模态融合挑战,显著提升了噪声鲁棒性和识别准确性。
早期阿尔茨海默病检测依赖于昂贵和侵入性的生物标志物(如PET成像或脑脊液分析),这些方法在临床环境中难以普及。此外,基于语音和语言分析的非侵入性检测方法缺乏公开可用的数据集,特别是对于非英语语言(如德语),这限制了跨语言研究和可重复性。
论文引入了PARLO痴呆语料库(PDC),这是一个德国多中心、临床验证的资源,专门用于阿尔茨海默病研究。PDC包含208名德语参与者的语音录音,包括健康对照组、轻度认知障碍(MCI)患者和轻度至中度痴呆(DEM)患者。数据通过标准化的iPad测试电池收集,涵盖八项神经心理学任务(如故事阅读、命名任务、图片描述和回忆任务),并提供了手动验证的转录、详细的人口统计、临床和生物标志物元数据。
基线实验包括:自动语音识别(ASR)基准测试,评估不同认知和任务条件下的转录质量;自动测试评估,用于命名任务,验证ASR与手动评分的一致性;以及基于视觉-LLM的零样本分类,探索生成模型在自动痴呆评估中的潜力。这些实验证明了基于语音的自动认知评估的可行性,并突显了回忆驱动语音生产的诊断价值。
PDC建立了首个公开可用的德语基准,推动了神经退行性疾病的跨语言和多模态研究,为低成本、可扩展的认知障碍检测提供了关键资源。
ASR(自动语音识别)系统在不同口音之间持续存在性能差异,但这些差距的内部机制仍然理解不足,限制了语音驱动技术的可访问性。
论文提出 ACES(Accent Subspaces)方法,这是一个基于表示的审计框架,通过提取口音判别子空间来探测模型的脆弱性和差异。该方法包括三个阶段:子空间提取、子空间约束攻击(使用对抗扰动)和投影输出干预,旨在将口音方向与性能差异联系起来,而非提出新的训练方法。
使用 Wav2Vec2-base 模型和五种英语口音(非洲、百慕大、印度、马来西亚、美国)进行实验。关键发现包括:口音信息集中在低维早期层子空间(层3,k=8);投影幅度与每话语 WER(词错误率)呈正相关(r=0.26);子空间约束扰动在表示偏移和退化之间产生更强的耦合(r=0.32),优于随机子空间控制(r=0.15);线性衰减子空间不能减少性能差异,反而略微恶化,表明口音相关特征与识别关键线索深度纠缠。
ACES 定位口音子空间为重要的诊断工具,而非简单的公平性干预手段,强调了在 ASR 中处理口音差异的复杂性。
手动从超声图像测量肌肉形态(如舌背肌厚度)耗时、主观,且存在测试者间变异性,限制了大规模语音和临床研究。超声成像技术虽有进步,但缺乏自动化分割工具,导致进展受限。
提出 SMMA(Skeleton-based Morphometric Muscle Analysis)框架,结合深度学习分割和骨架化厚度量化。包括两个核心组件:1) 使用卷积神经网络(如 UltraUNet)自动分割肌肉边界;2) 应用骨架化算法提取肌肉中轴,计算厚度和长度。该框架消除了手动标注需求,标准化测量过程。
SMMA 实现了专家级准确性,自动化测量舌背肌厚度,为语音运动控制和吞咽障碍评估提供了可扩展的研究工具。
当前EEG-to-Text解码模型存在三个主要问题: 1. 语义偏见(Semantic Bias):模型过度拟合到通用模板(如“He was a...”),导致生成内容重复且缺乏多样性。 2. 信号忽视(Signal Neglect):模型基于语言先验而非神经输入产生幻觉,甚至在纯噪声输入下也能生成流畅文本,表明解码并非真正依赖神经信号。 3. BLEU陷阱(BLEU Trap):传统评估指标(如BLEU)被高频停用词和模板人为夸大,掩盖了语义保真度的不足,误导模型性能评估。
论文提出SEMKEY,一个两阶段信号接地框架,通过解耦语义指导来应对以上挑战: 1. 并行多任务属性提取阶段:通过预测四个高层语义属性(情感、主题、长度、惊奇值),作为语义锚点,引导模型避免语义偏见和重复。 2. 多视角主动检索解码阶段:采用Q-K-V注入机制,将EEG嵌入作为键值对,语义提示作为查询,强制模型在解码过程中主动检索神经输入,确保生成严格基于信号。 此外,引入新的评估协议,包括N-way检索准确率和Fréchet距离,以更全面评估多样性和对齐性。
SEMKEY在实验中表现出色: - 在噪声输入测试中有效消除幻觉,正确生成无序令牌,验证了信号依赖性。 - 在稳健协议上达到SOTA性能,相比基线GLIM,在Self-BLEU上提升42.7%,FD上提升54.4%,24-Way检索准确率上提升36.4%。 - 证明了框架在开放生成任务中的有效性,解决了教师强制(Teacher Forcing)依赖问题。
SEMKEY通过创新性的语义解耦和信号接地机制,显著提升了EEG-to-Text解码的语义保真度和信号依赖性,为该领域的实际应用提供了可靠框架。
以往的研究主要关注自监督学习(SSL)语音模型中不同层之间如何编码信息,但很少探讨语音特征是否被捕获在SSL特征的个体维度内。这限制了对模型内部结构的理解以及在语音合成等应用中直接操控特征的能力。
该研究提供了一种简单有效的方法来解析SSL模型的内部表示,并为语音合成中的声音修改应用提供了实用工具,增强了模型的可解释性。
实时直播平台如抖音需要低延迟、高稳定性的交互反馈机制,包括弹幕重叠问题、礼物风暴处理、长会话稳定性、语音清晰度,以及LLM驱动评论的情感连贯性和实时性挑战。具体设计约束包括非侵入式集成、高负载可读性、低延迟反馈、长会话稳定性、语音清晰度、LLM驱动评论。
DLIOS提出一个LLM增强的实时多模态交互叠加系统,创新包括: - 三层透明窗口架构:独立渲染弹幕、礼物粒子效果、VIP入场动画。 - 事件驱动捕获管道:基于WebView2和线程安全事件总线。 - WINMM音频安全设计:异步垃圾箱模式防止死锁。 - 四段LLM提示调度系统(T1-T4):每首歌生成情感连贯的广播式评论。 - RadioPersonaConfig模式:JSON序列化,支持热交换多角色广播。 - 实时弹幕快速反应引擎:关键词路由到静态或LLM生成响应。 - Suwan Li AI歌手-词曲作者案例研究:基于Suno生成100+ AI歌曲。
36小时压力测试显示:零弹幕重叠、零死锁崩溃、礼物效果P95延迟≤180 ms、LLM到TTS段P95延迟≤2.1 s、TTS集成响度增益9.5 LUFS。
DLIOS是一个创新的实时多模态交互系统,成功整合LLM技术以增强直播体验,在性能和稳定性上表现优异。
基于语音的认知障碍(CI)检测为非侵入性早期诊断提供可能,但在人口统计学和临床亚组(如性别、年龄、抑郁状态)中存在性能差异,导致公平性和泛化性问题,可能加剧健康不平等。具体地,女性和年轻参与者的分类能力较低,误分类风险更高,反映了表示偏见。
本研究系统性地分析了传统声学特征(MFCCs、eGeMAPS)与自监督学习模型Wav2Vec 2.0(W2V2)嵌入在CI和抑郁分类中的偏见。使用DementiaBank Pitt Corpus数据集,通过数据平衡处理,评估了亚组性能差异,并探讨了跨任务泛化能力,首次全面调查声学模型在CI检测中的偏见影响。
该研究凸显了在临床语音AI部署中,公平感知评估和亚组分析对确保模型可靠性和减少健康差距的必要性。
语音深度伪造检测模型在未见攻击(如未知伪造类型、说话人)上的泛化能力有限,现有方法主要基于预训练加监督微调(SFT)范式,容易导致模型在域外数据上性能下降和灾难性遗忘问题。
受大语言模型领域启发,论文首次将强化学习(RL)微调应用于二进制语音深度伪造检测,采用Group Relative Policy Optimization (GRPO)算法进行微调。通过对比SFT、纯GRPO及混合设置,并引入变体(如移除负奖励或调整正则化),探索RL对泛化能力的影响。
实验使用多个自监督学习(SSL)前端模型(如XLS-R-2B、MMS-1B)和后训练模型,在域内(Deepfake-Eval-2024)和域外测试集(如ADD23)上进行评估。结果显示,纯GRPO微调在所有域外测试集上提高性能(平均EER降低),同时保持域内性能,优于SFT-only和SFT+GRPO混合方法。消融研究证实,GRPO中的负奖励是提升泛化的关键因素,而正则化项影响较小。
该研究创新地将GRPO引入语音深度伪造检测,证明了RL微调在改善模型泛化方面的有效性,为领域提供了新的微调策略和见解。
DBMIF有效结合了BC语音的鲁棒性和AC语音的自然性,为实际场景中的可靠语音增强提供了一种自适应、平衡的解决方案。
传统数字信号处理(DSP)在应对动态非稳态噪声时能力有限,通常依赖手动调优;深度学习模型虽强大,但作为“黑盒”缺乏可解释性,并可能引入不自然的音频伪影。现有可微分DSP(DDSP)方法多用于非因果或离线处理,难以满足实时语音增强的低延迟需求。
提出时间变化滤波(TVF),一个包含1百万参数的轻量级模型,用于实时语音去噪。TVF结合神经网络(基于GRU)与数字信号处理,通过神经网络骨架动态预测35个级联二阶IIR滤波器(双二次滤波器)的系数,实现动态噪声适应。创新点包括采用系统化处理技术优化计算,将滤波器级联操作向量化为张量格式,加速训练;推理时使用串行实现以保持21毫秒的低延迟。模型结构限制为线性时域滤波,旨在避免伪影并提升感知音频质量。
在Valentini-Botinhao数据集上进行评估,与静态参数均衡器(PEQ)和先进的DFNet3模型比较。所有模型从头开始在相同数据集上训练。实验表明,TVF能有效适应变化噪声条件,同时在保持DSP链可解释性方面优于基线,展现了在实时应用中的潜力。
TVF通过可解释的滤波链,为实时语音去噪提供了高效、透明的解决方案,成功弥合了传统DSP与深度学习之间的差距。
基于深度学习的个人声区(PSZ)系统训练依赖于模拟的声学传递函数(ATFs),但理想化的点源模型存在显著的仿真到现实差距,导致泛化能力受限。物理信息组件虽能改善性能,但各组件(如频谱校正、指向性建模、头相关传递函数)的个体贡献不明确,难以在有限预算下优化训练数据构建。
本研究采用Binaural Spatial Audio Neural Network(BSANN)作为固定渲染框架,进行控制消融实验。通过逐步丰富模拟ATFs:从基线点源模型(C0)开始,依次添加无回声测量的扬声器频率响应(FR, C1)、分析圆活塞指向性(DIR, C2)和刚性球头相关传递函数(RS-HRTF, C3),形成四个配置。实验保持神经网络架构和训练协议不变,仅改变ATF生成管道,以量化各物理组件的增量影响。
该研究通过消融实验量化了物理声学建模对神经PSZ渲染的关键贡献,为资源有限场景下的训练数据优化提供了实用优先级指导。
现有大型语言模型(LLM)的安全评估和红队测试主要集中于文本输入,缺乏系统化的基础设施来测试对齐是否推广到音频、图像和视频等多模态输入。现有工具未整合多轮自动化攻击、跨模态负载交付和自动化安全判断,导致评估效率低且不能捕捉部分信息泄漏。
MUSE(Multimodal Unified Safety Evaluation)是一个开源、以运行为中心的平台,首次集成跨模态负载生成(通过TTS、图像渲染和视频合成)、三种多轮攻击算法(Crescendo、PAIR、Violent Durian)、提供者无关模型路由和基于LLM的五级安全分类法(包括完全遵守、部分遵守、间接拒绝、直接拒绝和非响应)。创新点包括:双重度量框架(硬攻击成功率ASR仅计完全遵守,软ASR包括部分遵守)和Inter-Turn Modality Switching(ITMS),用于通过每轮模态旋转探索对齐是否跨模态边界泛化。
实验跨越六个多模态LLM(来自四个提供者),共约3,700次红队测试。多轮策略在单轮拒绝接近完美的模型上实现高达90–100%的ASR。ITMS在已饱和基线上不统一提高最终ASR,但通过破坏早期轮防御加速收敛。消融研究显示模态效应方向是模型家族特定的,而非普遍现象,强调需要提供者感知的跨模态安全测试。
MUSE是一个创新的平台,首次统一了多模态安全评估,提供了细粒度分析和可控实验框架,有助于系统性测试和改进LLM的安全对齐。
论文指出,在音频欺骗检测(spoof detection)领域,语言不匹配(language mismatch)是一个未被充分探索的领域转移(domain shift)轴。现有公开资源和基准(如ASVspoof、ADD)多集中于高资源语言,导致反欺骗措施(countermeasures, CMs)可能依赖于语言相关特征(如音韵学)而非欺骗特定线索,从而影响跨语言泛化能力。随着欺骗工具日益多语言化,而部署的反欺骗措施常面临语言异构音频,跨语言评估和鲁棒性变得至关重要。
本研究通过构建大规模多语言语料库和创新的阈值转移评估方法,系统揭示了语言在音频欺骗检测中的关键作用,为跨语言鲁棒性研究和实践提供了宝贵资源与框架。
该研究为无监督语音识别提供了坚实的理论框架和实用的训练方法,通过推导错误界限和提出序列级损失,推动了单阶段统计模型优化的发展。
在大型音频语言模型(LALMs)中,通过测试时间扩展(Test-Time Scaling)增加推理计算,如使用强化学习优化结构化推理轨迹,可能导致边际甚至负面性能增益,相比直接回答调优表现更差。这一现象源于音频感知衰减,即随着推理长度增加,音频事件感知能力下降,进而损害推理性能。
提出了 MPAR2(多步感知感知推理)范式,旨在缓解音频感知衰减。该方法鼓励动态感知推理,将复杂音频问题分解为感知丰富的子问题。采用两阶段训练策略:首先通过监督冷启动训练教导模型结构化推理,然后使用强化学习进一步优化音频感知和推理能力。
在 CAFE 评估框架下,MPAR2 将感知准确性从 31.74% 显著提升至 63.51%,有效缓解了感知衰减。在 MMAU 基准测试中,MPAR2 达到 74.59% 的准确率,同时增强推理能力。分析显示,MPAR2 能强化 LALMs 在推理中关注音频输入,并动态调整推理预算以匹配任务复杂性。
这篇论文系统性地分析了 LALMs 中的音频感知衰减问题,并提出了创新的多步感知推理方法,显著提升了音频事件的感知和推理性能。
该研究通过创新的多尺度时序表示学习和连续概率解码策略,显著提升了MEG语音检测的鲁棒性和准确性,为脑机接口和神经科学应用提供了有力工具。
非侵入性脑磁图(MEG)信号用于音素分类面临主要挑战,包括信噪比低、类不平衡严重以及会话特定的分布偏移,这限制了其在语音解码中的准确性和泛化能力。
提出MEBM-Phoneme框架,基于BrainMagic架构增强,通过以下创新点: - 模型架构:引入短时多尺度卷积模块捕获细粒度时间依赖,结合深度可分离卷积进行高效跨尺度融合,并使用卷积注意力层动态加权时间依赖。 - 验证策略:采用堆叠式本地验证集,通过会话感知采样方法近似保持分布,以处理类不平衡。 - 训练协议:结合随机时间偏移、自适应加权交叉熵损失和随机采样策略,提升训练稳健性和平衡学习。
在LibriBrain Competition 2025 Track 2中评估: - 验证集上:F1宏平均60.95%,Top-3准确率89.54%,Top-5准确率95.08%。 - 在线测试集表现有波动,但整体显示出强泛化能力。 - 消融实验表明各模块均贡献性能提升,强调了多尺度时间建模的有效性。
该研究通过创新的多尺度时间建模和训练稳定化策略,为MEG基于语音感知分析提供了高效且稳健的解码框架。
自动语音识别(ASR)系统通常在干净、近距离录音上训练和评估,但在真实环境中,房间反射和混响会改变语音信号并降低识别准确性。现有基准数据集(如 REVERB 和 CHiME)存在局限性:要么缺乏配对干净参考,要么使用合成或有限的房间脉冲响应(RIR)集,或者没有按声学测量(如 RT60 和 DRR)分层,这阻碍了对 ASR 鲁棒性的系统评估。
论文提出 Whisper-RIR-Mega 基准数据集,该数据集将干净的 LibriSpeech 话语与通过 RIR-Mega 语料库中的真实房间脉冲响应(RIR)卷积得到的混响版本配对。数据集设计包括按 RT60(混响时间)和 DRR(直接-混响比)分层划分,确保测试集在声学条件下平衡,允许直接比较干净与混响条件下的词错误率(WER)和计算清晰的混响惩罚。
评估了五个 OpenAI Whisper 模型(tiny、base、small、medium、large-v3)在 1600 个测试样本上。所有模型在混响条件下都表现出更高的 WER 和字符错误率(CER)。混响惩罚(delta WER)范围从 0.12 到 1.07 个百分点,具体取决于模型大小:Whisper-tiny 模型惩罚最大(1.07 pp),而 Whisper-small 和 Whisper-medium 惩罚最小(0.12 和 0.15 pp)。实验结果显示了模型容量和训练目标如何与声学退化非平凡地相互作用。
该论文提供了一个有效的配对干净-混响语音基准,支持对 ASR 在房间声学中鲁棒性的可重复研究和社区协作,通过公开数据集、代码和基准结果推动领域进步。
音频输入在多模态大语言模型(MLLMs)中进行Shapley值解释时面临三大挑战:1) 维度爆炸:原生音频标记化产生超过150个编码帧,导致联盟空间扩大约10^42倍,使计算不可行;2) 语义稀释:单个音频帧缺乏独立意义,归因结果难以解释;3) 边界伪影:标记边界常切割语音过渡,引入失真,降低Shapley值估计的保真度。
论文提出Spectrogram-Guided Phonetic Alignment (SGPA),一个四阶段预处理管道: 1. 转录分解:将文本转录分解为词和字符,建立字符到词的映射。 2. CTC对齐:使用Wav2Vec2-XLSR-53模型通过Connectionist Temporal Classification强制对齐,获取字符级时间边界。 3. 频谱边界细化:基于短时能量和频谱通量,在局部窗口中调整边界到声学稳定区域(如停顿),减少伪影。 4. 词级聚合:将字符边界合并为词对齐的音频段,将玩家数量从约50个原生标记减少到约7个词段,大幅降低计算复杂度。
SGPA是一个模型无关的预处理层,有效解决音频输入中Shapley值解释的计算瓶颈,同时增强语义可解释性,为音频可解释AI提供了实用基础。
论文创新性地整合在线设备权重与架构适应,显著提升个性化关键词检测的效率和实用性,为边缘语音接口提供了可扩展的优化方案。
波兰语自动语音识别(ASR)面临挑战,主要由于语言结构复杂(如屈折变化和随意句子结构)和数据资源有限。标准基准测试(如Mozilla Common Voice)基于日常语言,缺乏专业词汇和复杂上下文,难以准确评估模型在专业领域(如医学访谈)的性能。
本研究创新性地提出一个两阶段ASR解决方案,结合End-To-End ASR模型和大型语言模型(LLM)。具体方法包括:使用Whisper模型进行ASR转录,然后通过LLM纠正和改进输出,形成ASR+LLM管道。同时,系统比较了多种现代E2E ASR模型(如QuartzNet、FastConformer、Wav2Vec 2.0、ESPnet2、Scribe ElevenLabs)在波兰语基准和医学访谈数据集上的性能,测试了不同音频条件(干净、带宽受限、退化)。
在标准波兰语基准(Mozilla Common Voice和VoxPopuli)上,Whisper模型在开源模型中表现最佳(基于词错误率WER和字符错误率CER)。在医学访谈数据上,Scribe ElevenLabs模型在波兰语识别中表现最优,展示了更好的泛化能力。实验还表明,模型在标准基准上的性能差异不一定转化为专业数据上的差异,突出了领域特定评估的重要性。
该论文通过综合比较和LLM增强,为波兰语ASR在专业领域的应用提供了有效方法,强调了模型适应性和数据多样性的关键作用。
婴儿哭声分类面临多个挑战:信号短且非平稳,标注数据有限且不平衡,存在跨婴儿和数据集(如Baby2020和Baby_Crying)的强域偏移,环境噪声和样本泄漏(leakage)问题影响模型泛化。
在Baby2020(3类)和Baby_Crying(5类)数据集上进行跨域评估,使用泄漏安全分割: - 实现了改进的macro-F1分数(具体数值未在片段中给出,但论文声称改进)。 - 验证了模型轻量化和实时处理能力,适合移动部署。
这项工作提出了一种高效、跨域鲁棒的婴儿哭声分类框架,结合了先进的序列建模和集成技术,为儿科监测提供了可行解决方案。
DISPLACE-M挑战专注于嘈杂农村医疗场景中的自然医疗对话说话人日记化(Speaker Diarization),面临语音重叠、背景噪音、方言变异、自发对话和环境噪音等独特挑战,数据集包含开发集和评估集,具有低重叠、高信噪比和活跃对话转接等特点,但变异性可能影响系统性能。
研究比较了两种说话人日记化框架:一是基于SpeechBrain的模块化管道,使用ECAPA-TDNN嵌入提取,结合不同VAD方法(如Silero和Pyannote)和聚类算法;二是基于预训练WavLM的混合端到端系统Diarizen,集成Conformer块和线性分类器,探索了多种聚类技术,包括AHC、VBx、k-means和SC变体(SC-fixed、SC-adapt、SC-pNA、SC-MK),并应用中间滤波进行后处理。创新点包括评估VAD影响和先进聚类方法在端到端系统中的应用。
实验结果表明,Diarizen系统相比SpeechBrain基线在说话人日记化错误率(DER)上约有39%的相对改进。最佳提交系统使用Diarizen基线结合AHC和较大上下文窗口(29帧)的中间滤波,在开发集和评估集上的DER分别为10.37%和9.21%,在Phase I中排名第六(共11支队伍)。其他聚类变体(如SC-adapt和SC-MK)表现接近AHC,但未显著超越。
该研究通过系统评估模块化和端到端框架,证明了Diarizen在复杂音频条件下对说话人日记化的有效性,为医疗对话处理提供了实用技术方案。
现有文本到音频(T2A)生成方法在处理复杂文本提示(尤其是涉及复杂音频效果的提示)和实现精确文本-音频对齐方面面临挑战。数据质量不足和建模方法缺陷导致事件遗漏、幻觉或对齐错误。
论文提出结合大型语言模型(LLM)数据增强和强化学习(GRPO)的方法。首先,使用 LLM 生成高质量、详细的音频描述以改善文本-音频语义对齐。然后,应用 Group Relative Policy Optimization(GRPO)微调基于 Diffusion Transformer(DiT)的 T2A 模型,并通过多种奖励函数(如 CLAP、KL、FAD)优化。
实验结果表明,基于 GRPO 的微调显著提高了合成保真度和提示遵循度,奖励函数设计对音频质量有重要影响。
该方法通过数据增强和强化学习的结合,有效提升了 T2A 生成的准确性和可控性,为 RL 在音频合成中的应用提供了新思路。
论文关注大型语音-语言模型(LSLMs)中的模态间隙(modality gap),即语音输入与文本输入在复杂推理任务(如知识问答和逻辑推理)中存在的性能差距。即使模型能准确转录语音,语音输入的推理能力仍显著低于文本输入,表明语音未能充分利用LLM的知识和推理能力,核心问题在于语音的冗余性阻碍了稳定的决策形成。
论文提出从静态几何对齐转向动态推理轨迹分析的新框架,通过层对层(layer-by-layer)的表示演化来诊断模态间隙。使用跨层CKA分析(Centered Kernel Alignment)结合语音-文本token对齐,评估四个开放权重的端到端模型在SpeechMMLU和VoiceBench BBH数据集上的表现。方法创新包括识别语音处理的三个阶段:结构转换、语义扩散和决策不稳定,并引入“信息稀释”(Information Dilution)机制来解释语音冗余如何导致后期层无法稳定形成正确词汇选择。
实验发现,语音表示在中间层与文本表示对齐,形成一个广泛的跨层对齐带,但由于语音的冗余性(语义内容分布在多个帧中),在后期层中无法稳定地驱动正确决策。简单的统计校准(如均值和方差匹配)在输入层应用时无效甚至有害,表明模态间隙不仅仅是分布偏移。结果强调了需要从特征级匹配转向token或时间粒度操作,以浓缩冗余语音为信息密集单元。
该论文提供了对模态间隙的深入机理分析,揭示了语音冗余是推理瓶颈的关键原因,为未来端到端语音LLMs的改进指明了动态表示优化的方向。
该基准为音频深度伪造检测建立了可复现的基线,提供了关于SSL表示可靠性的实用见解,推动了该领域的研究标准化。
在超低比特率约束下,神经音频编解码器需要同时确保语义建模的准确性和声学信号的高保真重建,但现有方法如Mimi在集成语义和声学分支时,资源分配不均可能限制重建质量,尤其是在可懂度和感知质量之间的权衡。
论文提出熵引导的组残差向量量化(EG-GRVQ)方法,用于超低比特率神经语音编解码器。该方法扩展了组残差向量量化(GRVQ)框架,基于信息论假设编码器信道激活近似高斯分布,使用信道方差作为信息内容的代理。通过将编码器输出分组,使每组累积方差相等,实现信息平衡分配,从而提高码本效率、减少冗余,并加强声学分支以提升重建保真度,同时保留语义分支以维护可懂度。
在LibriTTS和VCTK数据集上的训练和评估表明,EG-GRVQ在客观指标上优于基线方法。例如,在0.6875 kbps下,与Mimi(重训)相比,PESQ提高0.1至1.881,STOI提高至0.890,ViSQOL提升至2.496,同时码本利用率更均衡,归一化均方误差(NMSE)降低,验证了方法在感知质量和可懂度上的改进。
该方法通过熵引导分组策略,有效优化了码本效率和信息分配,在超低比特率条件下显著提升了神经语音编解码器的综合性能,为通信导向场景提供了高保真解决方案。
核心痛点: 现有语音自然度预测器针对单说话者、单句话评估,无法有效捕捉对话级别的自然度,如流畅的交替、适当的填充词和对话动态,导致与人类判断相关性低或甚至负相关。
方法创新: 提出双通道自然度预测框架,用于双说话者、多轮对话的自然度评估。该框架利用预训练编码器(如 Whisper、WavLM、Audiobox-Aesthetics)处理双通道音频输入,并通过数据增强(如大规横合成数据)提高模型的鲁棒性。
实验结果: 在 ConvTTS 数据集上,基于 Whisper 的双通道模型与人类判断的 Pearson 相关系数达 0.482,优于现有预测器(如 NISQA 和 UTMOSv2)。在 FDX-Conv 数据集的系统自然度评估中,模型也展现出良好的泛化能力,验证了其在领域外条件下的有效性。
一句话评价: 该工作为对话语音自然度评估提供了一个简单且有效的自动预测框架,填补了现有研究的空白,并显示出在现实应用中指导对话系统开发的潜力。
论文针对 CHiME-9 MCoRec Challenge,核心问题是在室内社交环境中识别和聚类多个并发自然对话。场景特点是语音重叠率超过90%,最多八个说话者参与四个同时对话,导致严重声学干扰和传统单主题会议方法的失效。
提出一个多模态级联系统,利用从同步360°视频提取的每个说话者视觉流和单声道音频。创新点包括: - Active Speaker Detection (ASD):使用预训练音频-视觉编码器,采用两阶段迁移学习(先微调分类器再端到端优化),结合数据增强(如噪声注入)和时域平滑后处理。 - Audio-Visual Target Speech Extraction (AVTSE):开发四个系统(System I–IV),基于不同自监督预训练模型(如BRAVEn)和多模态架构,合成训练数据模拟2-3说话者混合,优化目标语音提取。 - Audio-Visual Speech Recognition (AVSR):集成多种框架,包括Whisper和大型语言模型(LLM)如Qwen 2.5和DeepSeek R1,通过自监督预训练策略(如BEST-RQ损失)和模型融合(后验概率平均、ROVER)提升转录准确性。 - 对话聚类:使用LLM进行零样本聚类,设计两阶段流程(候选生成和选择),通过投票融合提高鲁棒性,实现高效说话者分组。
在开发集上: - 最佳单级联系统实现Speaker Word Error Rate (WER) 32.44%。 - 通过ROVER融合多个前端和后端变体,WER降低至31.40%。 - LLM-based对话聚类达到speaker clustering F1分数1.0。 - 最终Joint ASR-Clustering Error Rate (JACER)为15.70%,提交3在精炼开发集上WER为29.35%。
该研究通过多模态集成和LLM技术,显著提升了在极端声学环境下的语音识别和对话聚类性能,为复杂场景的语音处理提供了创新解决方案。
传统的文本引导目标语音提取(TSE)方法使用离散类别表示连续语音属性(如语速、音高),忽略了说话者间的相对关系,导致细粒度区别在量化过程中丢失。当目标说话者和干扰说话者属性相似但被分配到同一类别时,系统无法有效区分,降低了TSE的准确性和鲁棒性。
该论文通过引入相对线索和两阶段框架,创新性地解决了文本引导目标语音提取中的细粒度区分挑战,显著提升了系统性能和实用性。
语音处理系统易受人类声音随年龄变化的影响,但现有数据集存在局限性:横向数据集(如TIMIT)缺乏纵向覆盖;纵向数据集(如CSLU、VoxAging)规模小或标签质量差,无法同时支持大规模、长时间跨度、验证元数据的建模需求。
引入VoxKnesset数据集,基于以色列议会(Knesset)2009年至2025年的录音,包含2300小时希伯来语语音,覆盖393个说话人,最长跨度达15年。数据集提供对齐的转录本和验证的人口统计元数据(如年龄、性别),并通过多阶段对齐管道确保质量,支持纵向说话人建模和老化分析。
使用现代语音嵌入(WavLM-Large、ECAPA-TDNN、Wav2Vec2-XLSR-1B)进行基准测试:说话人验证的等错误率(EER)在15年内从2.15%升至4.58%,显示性能随老化下降;年龄预测中,横向训练的模型无法捕捉说话人内部老化信号,而纵向训练的模型能恢复有意义的时域变化;跨数据集评估表明VoxKnesset在可转移性上表现良好。
VoxKnesset是一个开源的大规模纵向希伯来语语音数据集,有效填补了老化说话人建模的资源空白,为开发老化鲁棒语音系统和推动希伯来语语音处理提供了关键支持。
开发低资源语言(如哈萨克语)的自动语音识别(ASR)系统面临转录语料稀缺的挑战,导致模型性能受限,全球标准下哈萨克语仍属低资源语言。
本研究提出使用歌曲作为非传统数据源来改善哈萨克语ASR。构建了一个包含3,013个音频-文本对的歌曲数据集(约4.5小时,来自36位艺术家的195首歌曲),基于Whisper模型在七种训练场景下进行微调(包括单独使用歌曲、Common Voice Corpus (CVC)、FLEURS及其组合),探索歌曲在低资源ASR中的潜力。
实验结果表明,歌曲微调能显著提升零样本基线的性能。例如,在Songs、CVC和FLEURS混合训练下,Whisper Large-V3 Turbo在CVC测试集上达到27.6%的归一化词错误率(WER),在FLEURS上为11.8%,在Kazakh Speech Corpus 2 (KSC2)上将错误率从81.2%减半至39.3%。但与使用1,100小时KSC2语料库训练的上限模型相比,性能仍有差距,显示歌曲不是全面替代方案。
歌曲作为一种广泛可访问、语言无关的资源,在缺乏大型语音语料库时能为低资源ASR提供可测量的改进,但需结合其他数据以优化性能。
音乐生成模型已能处理复杂多模态输入(如文本、歌词、参考音频),但现有评估机制滞后:传统指标如Fréchet Audio Distance (FAD) 是分布级的,无法提供样本级信号;现有方法如SongEval、PAM等分散且专注于孤立属性,不能处理灵活的输入组合,导致模型能力与评估方法不匹配。
该论文通过建立全面的生态系统,填补了音乐奖励模型在复合多模态指令下评估的空白,为多模态音乐生成对齐研究提供了重要工具。
当前音频大语言模型(Audio LLMs)和现有基准主要偏向高资源语言和全球主流音乐类型,忽略低资源、传统、区域音乐,导致模型在非主流内容上的文化理解不足,缺乏全面评估,存在系统偏见。
提出了Voices of Civilizations (VoC)基准,是第一个多语言问答(QA)基准,用于评估音频LLMs在完整音乐录音上的文化理解。通过四步自动化管道构建:歌曲选择(手动从YouTube选取38种语言的代表歌曲)、上下文收集(使用Gemini 2.5 Pro生成双语文化背景文档)、属性提取(从文档中提取地区、情绪、主题)、问题生成(生成1,190个多项选择题,涵盖语言、地区、情绪和主题)。覆盖380首歌曲和38种语言。
评估了Gemini 2.5 Pro、Qwen2.5-Omni-7B和Kimi-Audio-7B-Instruct在四种设置下的表现:噪声(作为下界)、音频(英文QA)、音频(原语言)、音频+文档。结果显示,模型在语言识别上准确率高(>85%),但在提取文化属性(地区、情绪、主题)时表现差,尤其在低资源语言;提供文本背景后性能大幅提升(接近完美)。专家在中文歌曲上达到79.31%准确率。模型表现出对高资源语言的偏好和文化偏见。
VoC基准揭示了音频LLMs在文化理解方面的显著局限,强调了需要更多多样化和包容性的训练数据,以推动全球音乐理解研究的公平发展。
现有可听设备(如耳机、助听器)的声音控制粗糙,仅支持全局噪声抑制或单一目标声音聚焦,无法满足用户在复杂声学场景中独立调整多个同时存在声音源(如同时抑制交通噪音并增强语音)的需求。这限制了用户对声景的精细控制和个性化体验。
Aurchestra 系统引入两个关键创新:1) 动态接口:通过声音事件检测模型自动识别环境中活跃声类(如语音、交通、鸟鸣),仅显示相关控制选项,减少用户认知负荷;2) 实时设备上多输出提取网络:使用双路径时频模型替代注意力机制,基于多热编码用户选择,为每个选定声类生成独立音频流,支持每类音量独立调节。系统针对资源受限硬件(如 Orange Pi、Raspberry Pi、GAP9)进行模型优化,实现低延迟(6毫秒音频块)和高效能处理。
在20个声类数据集上训练后,Aurchestra 在信号质量(SNRi 11.99 dB vs 基线 7.29 dB)和参数效率(0.5M vs 1.2M 参数)上显著优于先前的实时单目标基线(Semantic Hearing)。系统支持多达5个重叠目标声音的实时提取,在多种硬件平台上实现低于10毫秒的推断延迟(如 Orange Pi 上5.22毫秒)。用户研究显示,背景噪声抑制改善(+1.54点)和整体听觉体验提升(+0.95点);动态接口减少目标声音选择时间67.9%。
Aurchestra 首次在资源受限可听设备上实现了精细、实时的声景控制,将可听设备从简单过滤器转变为可编程的听觉增强工具,为增强听觉系统的发展开辟了新方向。
临床听诊(auscultation)是心肺疾病诊断的基础步骤,但需要多年经验解读音频线索,限制了其可扩展性。现有深度学习方法大多局限于简单分类任务(如二元分类),缺乏临床可解释性和对多样临床推理任务(如报告生成、鉴别诊断、比较分析)的支持,这阻碍了AI在临床环境中的广泛应用。
提出了StethoLM,第一个专门用于心肺听诊的音频-语言模型,能够执行七种指令驱动的临床任务:二元分类、检测、报告、推理、鉴别诊断、比较和基于位置的分析。模型架构集成音频编码器和医疗语言模型主干,通过多阶段训练(结合监督微调和直接偏好优化)进行优化。同时,引入了StethoBench基准,包含77,027个指令-响应对,基于16,125个标注的心肺录音,以支持模型训练和评估。
StethoLM在领域内和领域外数据上显著优于通用多模态模型(如Qwen2.5-Omni),建立了新的最先进性能,展示了专门指令驱动训练在提高鲁棒性和性能方面的重要性。实验表明,模型能有效处理多种临床推理任务,并为临床决策提供支持。
StethoLM为临床听诊中的指令跟随AI系统奠定了基础,推动了医疗AI从简单分类向多任务临床支持的转变。
法语临床访谈的自动语音识别(ASR)面临高词错误率(WER),通常超过30%,尤其是在自发语音中,说话人标注(speaker diarization)错误常见,受限于医疗术语、同音词和法语特有的形态学挑战。非英语语言的医疗语音数据稀缺,加剧了ASR性能下降的问题。
提出了一种迭代多通道LLM后处理架构,使用Qwen3-Next-80B模型,交替进行说话人识别(SR)和词识别(WR)通道。方法包括: - SR通道:将通用说话人标签映射到临床角色(如患者、医生),基于对话模式和医疗术语。 - WR通道:纠正ASR错误、解决同音词、匿名化个人姓名,并保留自发语音标记(如犹豫声)。 - 通过领域适配提示和角色提示优化性能,支持离线部署。
在两个法语临床数据集上评估:自杀预防(SP)电话咨询和清醒神经外科(AN)咨询。使用Wilcoxon signed-rank测试,在SP数据集上观察到显著WDER降低(p < 0.05, n=18),在AN数据集上保持稳定性(n=10)。计算成本可接受,实时因子(RTF)为0.32,无输出失败,表明适合离线临床部署。
该研究证明了LLM后处理在改善法语临床访谈转录和说话人标注方面的有效性,为非英语医疗语音处理提供了实用解决方案。
Fréchet Audio Distance (FAD) 是评估文本到音频生成的标准指标,但其得分严重依赖预训练编码器的嵌入空间。编码器的训练任务决定了哪些声学特征被保留或丢弃,导致 FAD 继承系统性任务诱导的偏见,可能与人耳感知不一致,限制了其作为感知代理的可靠性。
这篇论文系统地实证分析了 FAD 中编码器训练任务导致的偏见,通过创新的评估分解和归一化方法,为未来开发更符合人类感知的评估原生编码器提供了重要洞察和方向。
传统战术、军事和灾害响应环境中的通信设备(如VHF/UHF收音机)面临体积大、功耗高、不便穿戴、安全性有限以及难以实现无缝免提通信等问题。
提出一种基于LoRa的微型加密语音通信设备设计,集成VOX麦克风、数字音频压缩、ESP32微控制器、AES-128加密和LoRa传输。设备采用模块化分层架构,支持短距离(1-1.5km视距)半双工通信,强调低功耗、高安全性和穿戴式设计。
理论分析显示:通过链路预算验证,通信范围可达1-1.5km,接收功率约-78.73 dBm,链路裕度约41 dB;延迟≤300ms;电池续航12-16小时;使用AES-128加密确保安全性。
这项工作展示了LoRa技术在安全语音通信领域的实用潜力,为战术环境提供了轻量、节能的解决方案。
传统音频处理方法在理解和生成任务之间存在表示鸿沟。理解任务通常使用高维语义编码器(如Whisper),产生语义嵌入但缺乏细节重构能力;生成任务依赖于低维声学标记器(如VQ-VAE),确保高保真重构但语义信息有限。现有统一方法要么采用独立的语义和声学组件导致计算冗余和系统复杂性(如Mimi),要么训练单模型但往往在语义表示或重构质量上做出妥协(如一些连续标记器)。
DashengTokenizer 提出了一种新颖的范式逆转:冻结预训练的强语义编码器(如MiDashengLM-7B的630M参数Transformer),并通过简单的线性投影将声学信息(从128-bin梅尔频谱图提取)注入到高维语义特征中。该方法仅需训练一个轻量级声学编码器(0.66M参数的2D卷积)和声学解码器(173M参数的Vocos架构),使用相加融合和语义保留损失(L_sem)来防止声学特征淹没语义信息,实现单阶段训练,避免了多阶段蒸馏的复杂性。
DashengTokenizer 通过简单高效的声学注入方法,成功统一了音频理解和生成,挑战了VAE架构在音频合成中的必要性,为音频基础模型提供了更高效和通用的解决方案。
论文指出,低资源印度语言的语音数据集稀缺,且现有数据集通常仅针对单一任务设计,缺乏跨任务分析。这导致研究人员对现有资源的可用性认识不足,尤其是在多语言和多任务场景下,阻碍了包容性语音技术的研究进展。核心问题包括数据稀缺、资源分散、跨任务效用不明,以及在印度这样的语言多样性国家中,资源覆盖不均。
论文提出了Task-Lens框架,这是一种跨任务调查方法,用于评估印度语音数据集在多个下游任务中的就绪度。方法包括四个阶段:1) 数据集发现:从多个学术数据库和门户网站搜索相关资源;2) 数据集过滤:基于预定义标准(如语言、元数据、可访问性)筛选数据集;3) 特征提取:提取10个标准化特征(如音频属性、标注类型)来描述每个数据集;4) 效用映射:通过任务-特征关联矩阵,评估数据集对9个下游任务的适用性(如自动语音识别、语言识别、情感识别等)。创新在于系统性地分析了数据集的跨任务潜力,而不是局限于单一任务分类。
基于给定内容,论文分析了50个印度语音数据集,覆盖26种语言,总计超过91,257小时的音频。研究发现许多数据集包含未充分利用的元数据,可支持多个任务。Task-Lens通过跨任务分析,识别了任务和语言之间的缺口,例如某些任务(如音频深度伪造检测)和语言(如低资源印度语言)缺乏足够的数据集支持。结果旨在帮助研究人员优先数据收集和促进数据集复用。
该研究提供了一个创新的跨任务分析框架,显著提升了低资源语言语音数据集的可见性和利用率,有助于推动多语言语音技术的包容性发展。
现有大型音频语言模型(LALMs)在真实社交场景中交互质量不足,主要表现为感知与表达脱节,生成输出呈机械的“读-语音”风格,缺乏自然韵律变化和非语言声音(如停顿、叹息和笑声),限制了人类化交互的潜力。
提出Hello-Chat,一个端到端的音频语言模型,专注于真实日常场景。创新点包括:1)构建大规模真实对话数据集,保留完整声学特征和交互模式;2)通过细粒度标注提取多维度信息(如文本内容、非语义特征、情感状态和环境背景),建立语义-声学映射;3)采用模态交错训练策略,随机替换“用户音频-文本指令-模型音频”序列中的模态,增强模态对齐和指令跟随能力。
在通用音频理解基准(如自动语音识别ASR和音频问答AudioQA)上达到state-of-the-art(SOTA)性能。主观听力评估显示,模型生成的语音在韵律自然性、情感准确性和交互流畅性上显著优于现有开源基线,难以与真实人类语音区分。
Hello-Chat通过结合深度音频理解和细粒度生成控制,为下一代高保真、同理心AI语音代理提供了重要技术突破。
Emotion Recognition in Conversations (ERC) 面临独特挑战,需要模型捕捉多轮对话的时间流并有效整合多模态线索。现有系统通常采用单一架构,混淆了时间上下文建模和多模态融合,导致性能受限,尤其在数据稀缺时容易过拟合,难以处理模态不平衡问题。
论文提出 MiSTER-E(Mixture of Speech-Text Experts for Recognition of Emotions),一个模块化的 Mixture-of-Experts (MoE) 框架,将模态特定上下文建模与多模态信息融合解耦。关键创新包括: - 使用大型语言模型(LLMs)如 LLaMA-3.1-8B 和 SALMONN-7B fine-tuned 用于语音和文本,提取丰富的 utterance-level 嵌入,并通过卷积-递归上下文建模层增强。 - 集成三个专家:语音专家、文本专家和跨模态专家,通过学习的门控机制动态加权输出,实现自适应融合。 - 引入监督对比损失用于语音-文本表示对齐,以及基于 KL 散度的正则化促进专家预测一致性,提升模型稳定性和泛化能力。
在三个基准数据集上评估:IEMOCAP、MELD 和 MOSI。MiSTER-E 实现了加权 F1 分数分别为 70.9%、69.5% 和 87.9%,超越了多个基线语音-文本 ERC 系统,展示了 state-of-the-art 性能。实验还包括消融分析,突出了方法中各组件的贡献。
MiSTER-E 通过模块化 MoE 架构有效解决了 ERC 中的模态不平衡和融合难题,实现了高性能和通用性,推动了多模态情感识别领域的发展。
端到端自动语音识别(ASR)模型在低资源条件下性能显著下降,严重依赖大量标注数据。现有的一致性正则化(CR)方法主要应用于连接时序分类(CTC),但在其他模型(如非自回归模型)中的应用尚未充分探索,限制了ASR在资源有限和半监督场景下的性能提升。
论文提出了Align-Consistency,一种扩展CR到Align-Refine(一种基于迭代精炼的非自回归ASR模型)的新方法。关键创新包括:将CR应用于整个迭代精炼过程(包括基础CTC和后续精炼步骤),以增强模型对输入扰动的稳定性;在完全监督和半监督设置中整合非自回归解码和CR,提高推理速度的同时提升准确性;在半监督学习中,使用非自回归模型生成在线伪标签,并通过CR进行模型微调,有效利用未标记数据。
Align-Consistency成功融合了非自回归解码的效率优势和一致性正则化的鲁棒性,显著提升了ASR模型在监督和半监督场景下的准确性和实用性。
差分麦克风阵列(DMAs)在远场声学信号采集中具有高方向性和紧凑结构优势,但设计连续可操控的差分波束形成器面临挑战。现有方法如对称约束法(DMA-SymNull)限制了操控方向,系列扩展法(DMA-SeriesExp)需要先验知识,而空约束法(DMA-Null)缺乏理论清晰度和直观性,导致波束模式不准确、操控性不足,且可能放大噪声。
本文提出一种基于方向导数约束的新框架,用于设计均匀圆形阵列(UCAs)上的连续可操控差分波束形成器。通过约束波束模式在目标方向的一阶导数为零,并适当设置高阶导数,确保波束在目标方向达到最大响应,实现精确操控。该方法结合了失真约束、空约束和导数约束,形成线性方程组求解波束形成器权重,提高了操控灵活性,并提供更直观、鲁棒的波束模式设计。
模拟评估采用8个全向麦克风的UCA,半径2.0 cm,比较了所提方法(DMA-DerivCon)与传统空约束法(DMA-Null)、对称空约束法(DMA-SymNull)和系列扩展法(DMA-SeriesExp)。结果表明,所提方法能产生连续可操控的波束模式,确保主瓣对准目标方向,减少不必要的增益峰值,从而有效增强目标信号并抑制噪声和干扰。
该论文提出了一种创新的方向导数约束方法,显著改进了差分波束形成器的连续操控性和理论清晰度,为音频增强应用提供了更有效和鲁棒的解决方案。
该研究通过极端数据增强和算法后处理,为低资源Bengali语音处理提供了高效、实证的基准,强调了数据质量和策略优化的重要性。
传统听觉注意力解码(AAD)方法依赖预处理技术如滤波器组提取音频包络,这压缩了时间-频率结构,丢弃了潜在诊断信息,并在短决策窗口下性能脆弱,限制了实时助听器应用。
提出使用两层散射变换(Scattering Transform)作为预处理替代方案,通过级联复小波卷积、模操作和低通平均,构建局部平移不变且稳定于时间变形的表示,捕捉高阶调制信息(如调制中的调制),以增强AAD性能。
在KU Leuven (KUL)数据集上,散射变换显著提高了subject-related条件下的性能;在Technical University of Denmark (DTU)数据集上,效果依赖于模型类型或训练数据量(如10折交叉验证)。使用多种神经网络模型(CNNs, LSTMs, Transformer/graph-based)和评估策略(如Dietterich's 5x2 cross-validation)验证了其优越性。
散射变换作为一种数学驱动的预处理方法,能提取额外相关信息,有潜力改善AAD在短窗口和有限数据场景下的鲁棒性和实时适用性。
检测深度伪造语音中合成部分(即合成词)比整体检测更复杂,需要序列决策而非单一二元决策。现有方法如专用检测器开发成本高,涉及数据收集、模型设计、训练和部署资源。
提出一种成本效益高的方法,通过微调预训练的Whisper模型,使用下一个token预测来检测合成词,同时进行语音转录。创新点包括:添加特定令牌(如
在域内测试数据(如E.Voc和E.TTS)上,微调Whisper实现了低合成词检测错误率(FAR和FRR)和转录错误率(WER),与专用ResNet152模型相当。在域外测试数据(如E.AV1M和E.PE)上,性能有所下降,但仍与ResNet152相当,表明需要改进泛化能力。
该方法成功将合成词检测集成到现有ASR模型中,减少了开发成本,但需进一步研究以提升在未见生成模型上的泛化性能。
本文旨在探究语音生产中不同条件(vocalized, mimed, imagined)的神经表示之间的关系,这对于理解内部语音过程和开发脑-计算机接口(BCI)至关重要,特别是在解码想象语音时缺乏外部时间线索等挑战。
使用公开的立体定向脑电图(sEEG)数据集(VocalMind),训练线性解码器重建频谱图,并评估跨条件泛化。同时,与非线性神经网络解码器(使用卷积和循环层)进行比较,并通过基于排名的分析量化刺激特异性可区分性。
线性解码器在不同条件间成功转移,表明共享的语音神经表示;mimed语音在vocalized和imagined条件之间起中介作用,共享运动相关结构与前者、计划相关结构与后者;线性模型在刺激特异性可区分性上优于非线性模型。
这项研究深入探索了不同语音生产模式的神经表示相似性,为BCI应用和语音神经科学提供了有价值的见解。
这是一个创新方法,针对低资源、方言丰富的语言 ASR 挑战,通过方言感知和多任务学习显著提升性能,为类似语言处理提供了有效蓝图。
该论文通过创新的并行处理架构有效解决了移动说话者分离的挑战,显著提升了多通道语音分离性能,适用于动态声学环境。
传统语音增强方法中,扩散模型通常在连续短时傅里叶变换(STFT)域操作,导致高计算需求,因为STFT表示的高维度和迭代采样过程。同时,基于自回归的方法(如Transformer语言建模)推理速度慢,而现有类似方法如MaskGIT缺乏理论依据,可能无法近似原则似然。
本研究提出了ADDSE(Absorbing Discrete Diffusion for Speech Enhancement),首次将吸收离散扩散(ADD)应用于语音增强。该方法利用神经音频编解码器(NAC)的潜在空间进行离散表示,结合非自回归的扩散采样以实现高效推理。为处理残差向量量化(RVQ)代码的层次结构,创新性地设计了RQDiT架构,融合RQ-Transformer和扩散Transformer(DiT)的技术,用于非自回归建模。
在Libri-TUT和Clarity-FSD50K两个数据集上,ADDSE在非侵入式客观指标上表现出竞争性能,特别是在低信噪比和少采样步骤时。与基线方法如Conv-TasNet、BSRNN和SGMSE+相比,显示了优越性,证明了其高效性和有效性。
这项研究为语音增强领域提供了一个计算高效且理论坚实的生成模型框架,通过离散扩散在压缩的潜在空间中操作,显著提升了性能。
核心痛点:低资源自动语音识别(ASR)面临数据稀缺的挑战,特别是在台湾闽南语等语言中,虽然有大量口语内容(如电视剧),但转录数据有限,且字幕通常只有普通话,导致ASR系统性能不佳,影响语言保存和媒体可访问性。
方法创新:提出了TG-ASR框架,引入并行门控交叉注意力(PGCA)机制,该机制自适应地整合来自多语言翻译的嵌入(如通过多语言BERT生成)到Whisper ASR解码器中,以增强跨语言语义指导,同时确保训练稳定性和最小化语言间干扰。方法包括两阶段训练:先微调Whisper,再冻结部分参数并更新PGCA层。
实验结果:基于新构建的YT-THDC语料库(30小时台湾闽南语电视剧语音,带有对齐普通话字幕和手动验证转录),实验表明该方法实现了14.77%的相对字符错误率降低,有效提升了低资源ASR性能,并识别出最能增强性能的辅助语言。
一句话评价:这项研究创新地利用翻译引导学习解决低资源ASR问题,具有实用价值,能促进语言多样性和技术包容性。
传统端到端歌曲生成模型存在数据密集、计算密集、可编辑性有限的问题;而现有compositional方法中组件独立使用常导致节奏不齐、和谐漂移和间歇性歌声处理困难,缺乏系统基准和组件协同设计。
提出MIDI-informed singing accompaniment generation (MIDI-SAG),利用符号vocal MIDI分数作为条件信号,结合melody harmonization模块生成和弦进行,以改善节奏和和谐对齐;通过显式节奏/和谐控制与潜在扩散的音频延续能力,处理间歇性歌声并确保结构完整性;构建模块化compositional管道,包括melody composition、SVS和MIDI-SAG,使用轻量级训练组件降低资源需求。
在单个RTX 3090 GPU上训练,仅需2.5k小时音频数据,在多个感知质量指标上接近开源端到端基线;提供音频演示并计划开源模型、代码和数据集元数据。
该工作通过MIDI-informed方法有效解决了compositional歌曲生成中的对齐和结构完整性问题,以较低计算成本实现了高质量、可编辑的歌曲输出。
现有Omni-Modal Large Language Models (Omni-LLMs) 在处理复杂现实场景时,表现出肤浅理解和情感响应不匹配的问题。主要问题包括:音频和视觉线索可能复杂、隐式或冲突;Thinker-Talker架构通过隐藏状态隐式连接,导致情感细节丢失;数据稀缺,缺乏真实世界、细粒度注释的多模态对话数据;评估方法有限,忽略情感智能的上下文对齐。
EmoOmni-7B模型在相同Talker下,性能与Qwen3Omni-30B-A3B-Thinking相当,表明E-CoT和真实世界数据可以有效补偿参数规模,在较小模型下实现高效多模态情感对话。
EmoOmni通过显式情感推理和指令指导表达,在较小模型规模下实现了高效的多模态情感对话,弥补了现有Omni-LLMs的情感智能不足。
核心痛点 传统音频分割和源分离方法依赖大量标注数据,如预分割的训练数据,这在现实场景中往往稀缺或不可得,限制了模型的训练和应用。特别是在音乐和电影音频中,缺乏单乐器段或结构化知识(如乐谱)导致分割和分离精度低。
方法创新 提出一种知识驱动的框架,利用外部知识源(如乐谱)结合隐马尔可夫模型(HMM)进行音频分割。该方法不依赖任何预分割的标注数据,直接从输入音频和相关知识自主学习构建模型。应用包括音乐分割、音乐源分离(MSS)和电影音频源分离(CASS),其中知识(如声音类别活动指示)被投影并融入分离器输入,以改善分离性能。
实验结果 在模拟数据集Slakh2100上,乐谱引导的学习在音乐分割和分离任务中表现优异。在电影音频源分离任务中,使用DnR数据集,该方法在DnR-nonverbal数据集上达到了state-of-the-art性能,优于纯数据驱动技术(如Demucs和BSRNN)。实验表明,知识驱动方法在无标注数据场景下有效提升了分割和分离的准确性。
一句话评价 该研究提出了一种创新的无监督知识驱动方法,有效利用外部知识解决音频分割和分离中标注数据稀缺的挑战,具有广泛的应用潜力。
现有情感语音数据集多依赖演绎或实验室诱导的情感,难以反映真实情境中的自发情感表达,导致模型在自然场景中的泛化能力受限。
提出iMiGUE-Speech数据集,扩展自iMiGUE视频数据集,专注于自发语音情感分析。数据集基于真实网球大满贯赛后采访音频,捕获运动员在胜负后的自然情感。创新点包括:添加语音转录(使用Whisper Large)、说话者角色分离(采访者与受访者)、词级强制对齐(使用Montreal Forced Aligner),并通过自动处理流程(如pyannote.audio进行说话者日记化)提取元数据。数据集可同步配对原始iMiGUE的微手势注释,形成多模态资源。
论文引入两个评估任务以建立初始基准:语音情感识别(SER)和基于转录的情感分析。这些任务利用预训练表示评估数据集在声学和语言模态中捕获自发情感状态的能力。具体性能数据在截断部分未提供,但强调了数据集对自发情感分析的实用性。
iMiGUE-Speech填补了自发情感语音数据的空白,为多模态情感分析和真实场景下的语音研究提供了宝贵资源。
核心痛点:自动语音识别(ASR)在嘈杂环境中性能严重下降。语音增强(SE)前端能有效抑制背景噪音,但常引入伪影,损害识别准确性。Observation Addition(OA)通过融合嘈杂语音和SE增强语音来改善识别,但现有OA方法需要训练神经预测器来确定融合权重,增加了系统复杂性、依赖真实转录本,并可能导致泛化问题。
方法创新:本文提出了一种无训练、基于可懂度指导的OA方法。融合权重直接从后端ASR系统输出的置信度中派生(使用如Whisper、Parakeet、Wav2Vec2的置信度估计),避免了额外训练。方法包括置信度引导的OA(使用权重系数S'融合嘈杂和增强语音)、切换策略(基于置信度选择信号)和帧级OA扩展,旨在自适应平衡互补信息,以语音可懂度而非信号质量为导向。
实验结果:在多个SE模型(如Demucs和GR-KAN MP-SENet)和ASR系统(如Whisper、Parakeet、Wav2Vec2)上进行了广泛实验,覆盖in-domain(VoiceBank-DEMAND)和out-of-domain(CHiME-4)数据集。结果表明,提出的置信度引导OA在Word Error Rate(WER)上优于现有OA基线(如SNR-OA、DNSMOS-OA、Classifier-OA),特别是在真实噪音场景中显示出强鲁棒性和性能提升。例如,在CHiME-4真实数据集上,Conf-OA相比基线显著降低了WER。
一句话评价:该方法是一种简单、高效且泛化能力强的SE后处理技术,通过无训练方式利用ASR内部置信度,显著提高了嘈杂环境下的ASR性能,同时降低了部署复杂性和对真实转录本的依赖。
在临床语音工具中,多语言设置下病理语音标记与口音变异的几何可分离性不明确,系统可能误分类健康的非母语说话者或错过多语言患者的病理信号,缺乏几何特征化导致临床特征与口音变异在表示空间中可能不可分。
提出一个四指标聚类框架(包括Silhouette Score、Davies–Bouldin Index、Calinski–Harabasz Index和Bootstrap Stability),结合t-SNE嵌入手工制作的声学特征(来源-滤波器模型),用于评估情感、语言和病理语音特征的几何解缠,并引入混淆检测方法量化病理-语言重叠与排列零基线比较。
实验结果显示一致的层次:情感特征形成最紧密的聚类(平均Silhouette 0.250),其次是病理特征(0.141)和语言特征(0.077)。病理-语言重叠保持在0.21以下,高于排列零但有界,适合临床部署。信任度分析和Bootstrap稳定性确认嵌入的保真度和结论鲁棒性。
该框架为跨多样化人群提供公平可靠的语音健康系统提供了可行指南,突出了几何分析在临床语音AI中的关键作用。
现有语音解纠缠方法缺乏对维度独立性的原理性量化,依赖下游任务性能作为分离的代理指标,无法直接评估情感、语言和病理维度之间的统计依赖性。
引入一个信息理论框架,通过整合有界神经互信息(MI)估计器(MINE 和 CLUB)与非参数验证(KSG)来量化手工制作声学特征中的跨维度统计依赖性。框架包括源-滤波器归因分析,以分解每个语义维度的源和滤波器贡献,并使用自适应加权和集成训练提高估计稳定性。
在六个语料库上,跨维度MI保持较低(<0.15 nats),表明统计耦合弱,支持维度独立性假设;源-滤波器MI较高(0.47 nats)。归因分析显示,情感维度以源为主(80%),语言和病理维度以滤波器为主(分别为60%和58%)。
该论文提供了一个原理性框架,有效量化语音中维度的独立性,为解纠缠表示学习提供了理论基础和实用工具。
当前混合情感识别方法存在局限性,主要痛点是现有模型在预测多个同时存在的情感状态时,往往忽略情感之间的价一致性(valence consistency)和结构化相关性(structured correlations)。大多数方法将情感类别视为独立,没有充分考虑相同价情感更可能共现、相反价情感相互排斥的心理学先验,导致在真实世界复杂情感场景中性能不足。
本文提出了一种名为 Memory-guided Prototypical Co-occurrence Learning (MPCL) 的创新框架,以解决上述痛点。框架包括三个阶段:1) 多尺度关联记忆融合:通过多尺度关联记忆机制融合多模态生理和行为信号,捕获内在相关性;2) 原型对齐和共现学习:构建情感特异性原型记忆库,生成语义丰富的表示,并采用原型关系蒸馏确保跨模态对齐。此外,引入记忆检索策略提取语义级情感类别共现关联;3) 分层语义压缩和分布预测:通过自底向上的分层抽象过程,学习情感信息表示,实现精确的情感分布预测。该方法受人类认知记忆系统启发,结合心理学先验,提升了对混合情感中结构化关系的建模能力。
论文在两个公共数据集上进行了综合实验,结果显示 MPCL 在混合情感识别任务中,在定量和定性方面均 consistently 优于 state-of-the-art 方法。具体性能数据未在提供的片段中详述,但摘要强调其在准确预测情感分布方面的优越性。
该框架创新性地整合了心理学先验和计算模型,通过原型学习和记忆机制有效提升了混合情感识别的准确性和解释性。
这是一个创新的多模态方法,利用图神经网络有效建模语音-手势交互,为aphasia评估提供了更全面和自动化的解决方案。
音乐源恢复(MSR)旨在从混合和处理过的录音中恢复未处理的音轨,核心挑战包括:1)分离重叠的音源(如人声、乐器),2)重建被音乐生产效果(如动态范围压缩、混响)退化的信号。这些难点使得MSR比传统音乐源分离(MSS)更具复杂性,要求模型同时具备分离和生成高质量音频的能力。
论文提出DTT-BSR,一个创新的混合生成对抗网络(GAN)模型,用于音乐源恢复。关键创新点包括: - 骨干网络:采用DTTNet(Dual-Path TFC-TDF UNet)作为高效U-Net结构,用于多分辨率频谱处理。 - 长期依赖建模:集成RoPE(Rotary Positional Embeddings)transformer块,以捕获音频序列中的长期时间依赖。 - 精细特征提取:引入双路径循环神经网络(RNN)模块,用于提取时间-频率域的细粒度特征。 - 端到端框架:结合判别性分离和生成性恢复,通过复合损失函数(包括Multi-Mel STFT损失、对抗损失和特征匹配损失)进行训练,以优化感知质量。
DTT-BSR在ICASSP 2026 Music Source Restoration Challenge中取得显著成果: - 客观性能:在官方测试集上排名第3(基于MMSNR、Zimtohrli、FAD-CLAP等指标),具体为MMSNR 1.4520(越高越好),Zimtohrli 0.0182(越低越好),FAD-CLAP 0.2907(越低越好)。 - 主观评价:排名第4,平均意见得分(MOS)为3.5425(分离)和2.5412(整体)。 - 参数效率:模型紧凑,仅7.1M参数,训练在单GPU上约26小时完成。 - 音轨表现:在吉他、键盘和管弦乐等非人声音轨上表现优异,表明模型在非人声乐器分离方面有优势。 - 基准比较:在MSRBench上,相比基线模型,MMSNR提升24.62%,FAD-CLAP降低24.93%。
DTT-BSR通过结合GAN、RoPE transformer和双路径RNN,在紧凑模型中实现了高保真音乐源恢复,特别在非人声乐器分离上表现突出,为音频增强领域提供了有效的端到端解决方案。
现有基于大语言模型(LLM)的文本转语音(TTS)系统在低延迟双流合成方面存在不足,主要问题包括: - 依赖传统的GMM-HMM强制对齐工具(如MFA),流程繁重且灵活性差。 - 固定比例交织文本和语音令牌难以捕捉对齐规律,导致模型学习时间依赖困难。 - 现有方法在平衡合成质量和延迟方面有局限,影响流式应用的性能。
论文提出CTC-TTS,一种基于连接时序分类(CTC)的双流TTS方法,核心创新点包括: - 使用CTC对齐器替换MFA,提供轻量级、灵活的语音-音素对齐,无需帧级精确边界。 - 引入bi-word交织策略:将当前单词的音素、分隔符、下一个单词的音素与当前单词的语音令牌组合,形成训练序列。 - 设计两个变体以平衡质量与延迟: - CTC-TTS-L:沿序列长度连接令牌,提高生成质量。 - CTC-TTS-F:沿特征维度堆叠嵌入,降低首包延迟。 - 模型基于解码器Transformer,使用神经音频编解码器(NAC)处理离散令牌。
实验在单说话者和多说话者设置下进行: - 单说话者流式合成:在VoiceAssistant400K数据集上,CTC-TTS优于LLMVox基线,在质量-延迟权衡上表现更佳。 - 多说话者零样本任务:在LibriSpeech数据集上,CTC-TTS在延续和跨说话者任务中优于固定比例交织和MFA-based方法(如ELLA-V)。 - 具体指标:CTC-TTS在语音质量和流式性能上均有所提升,支持低延迟应用。
CTC-TTS通过创新的CTC对齐和bi-word交织,有效解决了LLM-based TTS中的对齐不灵活和延迟问题,为双流合成提供了高效且可扩展的解决方案。
口音正常化(AN)系统常面临不自然的输出和内容失真的问题,主要由于训练数据的稀缺(缺乏平行L1-L2语料库)和刚性的时长建模。
论文提出了一种新颖的"source-synthesis"数据生成方法,通过生成L2源语音并利用真实本地语音作为训练目标,避免了TTS伪影的学习,且无需真实L2数据。同时,引入CosyAccent模型,一个非自回归系统,隐式建模节奏以保持自然性,同时提供总输出时长的显式控制,特别适用于如配音等需要时长保留的任务。
实验结果表明,尽管训练时不使用任何真实L2语音,CosyAccent在内容保存和自然性方面优于使用真实数据训练的基线模型,展示了其有效性。
CosyAccent通过创新的数据策略和模型设计,有效解决了口音正常化中的关键挑战,为语音合成领域提供了有前景的解决方案。
在自动语音识别(ASR)领域,自回归(AR)模型(如Transformer seq2seq系统)虽然准确性高,但由于逐令牌顺序解码导致推理速度慢,不适合实时或大规模应用。非自回归(NAR)模型(如CTC)支持并行解码,提升效率,但受限于输出令牌间的条件独立假设,性能显著下降,现有扩散基础的NAR ASR模型(如Transfusion、FFDM)仍存在性能差距,无法与AR基线竞争。
提出MDM-ASR框架,基于掩码扩散模型(Masked Diffusion Models),将预训练的语音编码器与Transformer扩散解码器结合,实现并行令牌预测。创新包括:1. Iterative Self-Correction Training (ISCT):通过暴露模型到自身中间预测,减少训练-推理不匹配。2. Position-Biased Entropy-Bounded Confidence-based sampler (PBEB-Conf):结合位置偏置的采样器,提升解码稳定性和结果。该框架直接从标准编码器-解码器架构扩展,使用离散扩散公式,提供明确的概率解释和理论支撑。
在多个基准英语数据集上的实验表明,MDM-ASR在准确性上优于先前的NAR模型(如Transfusion、FFDM、Whisfusion),并与强大的AR基线(如Whisper、Canary)竞争,同时保持并行解码的高效率。多语言任务中也展现了稳健性能。消融研究验证了模型缩放、ISCT和推理策略的有效性。
该论文通过扩散基础的非自回归解码,成功在ASR中平衡了准确性和效率,为实时应用提供了有前景的解决方案。
自监督语音模型(S3Ms)已知编码丰富的语音学信息,但其表示空间的结构如何映射音韵特征仍未被充分探索,导致对S3Ms内部工作机制的理解不足。
提出假设:音韵特征在S3Ms的表示中是线性表示的,支持音韵类比,例如通过向量算术 [b] ≈ [p] + ([d] - [t]) 来捕获浊音特征。研究设计实验,在96种语言上测试19个音韵特征,使用自监督模型(如wav2vec 2.0、HuBERT、WavLM)和基线光谱表示(MFCC、MelSpec),通过余弦相似度和成功率评估音韵向量的方向性,并引入尺度参数λ探索向量尺度与声学特征连续相关性的控制能力。
该论文首次系统性地揭示了自监督语音模型中的音韵向量算术,为理解S3Ms的表示结构和实现语音合成中的音韵控制提供了创新性见解。
在异常声音检测中,基于局部密度的分数归一化(LDN)用于增强域偏移下的鲁棒性,但性能高度依赖邻域大小。固定小邻域可能导致不稳定,而增大邻域时,若跨越嵌入空间中的簇边界,会违反局部性假设,破坏局部密度估计,导致检测精度下降。
提出集群出口检测(CED),一种轻量级、训练免费的机制。CED通过计算距离比率来检测距离跳跃(簇出口),从而自适应地为每个参考样本选择邻域大小,以保持局部密度结构的完整性,替代固定邻域大小。
在五个嵌入模型(如BEATs、OpenL3)和五个基准数据集(如DCASE系列)上的实验表明,CED提高了对邻域大小选择的鲁棒性,并带来了相对于固定小邻域基线的持续性能提升。
CED通过自适应邻域选择有效解决了LDN中的局部性违反问题,提升了异常声音检测系统的鲁棒性和准确性。
半监督学习在自动语音识别中依赖于伪标签,但存在确认偏差和错误传播问题,导致噪声监督和性能下降。传统方法如基于置信度或不确定性的过滤策略不理想,因为它们丢弃了潜在有价值的音频数据。
提出 ReHear 框架,通过音频感知大型语言模型进行迭代伪标签细化。该框架结合 ASR 模型和 Audio LLM 建立协作循环,利用多模态输入(ASR 假设和源音频)校正错误,生成高保真伪标签用于 ASR 微调。还包括可选过滤机制,如基于启发式规则或模型的策略,以减轻 LLM 幻觉。
在多个基准数据集(Earnings-21, Earnings-22, SPGISpeech, AMI Meeting Corpus)上实验,ReHear 有效减少了错误传播,一致优于监督和伪标签基线方法。实验设置中使用 Whisper-Large-v3 作为 ASR 模型,Voxtral-Mini-3B-2507 作为 Audio LLM 校正器,并应用 LoRA 和 QLoRA 进行参数高效微调。
ReHear 通过集成音频感知 LLM 进行迭代伪标签细化,为半监督 ASR 提供了一种创新且有效的解决方案,显著提升了鲁棒性和数据效率。
呼吸系统疾病是全球主要死因,当前自动化肺音听诊分析虽然能预测病理,但缺乏实时自然语言交互能力,限制了在动态临床环境或患者应用中的实用性。
论文创建了首个呼吸音频问答(RA-QA)数据集,整合11个公开数据集,包含约7.5百万QA对,涵盖60多个临床属性和三种问题类型(单验证、多选、开放)。并引入基准,比较音频-文本生成模型与传统音频分类器,以评估性能。
实验揭示了不同属性和问题类型的性能变化,建立了基线,显示生成模型在交互式响应中具有潜力,为更先进架构铺路。
该工作开创了呼吸音频QA领域,提供了首个多模态数据集和基准,推动了交互式、智能诊断工具的发展。
现有语音增强(SE)生成模型,如流匹配(flow matching)和扩散桥模型(diffusion bridge models),缺乏统一的理论框架,并且与预测(判别性)模型之间的联系未充分探索,限制了性能提升和理论理解。
提出一个统一框架,将流和扩散桥模型解释为构造高斯概率路径在配对噪声和干净语音数据之间,通过设计均值和方差轨迹来统一多种模型。分析揭示了这些生成模型的采样步骤在理论上等价于预测性语音增强,从而引入预测等价性见解。基于此,开发一个增强桥模型,结合有效概率路径设计、改进网络架构(如高性能骨干网络、时间嵌入机制)、优化损失函数和训练策略,以提高性能和效率。
在去噪和去混响任务上进行实验,结果显示提出的模型在性能上优于现有流和扩散基线模型(如OUVE、BBED、SBVE、OT-CFM),同时参数更少、计算复杂度降低。实验还强调,由于生成框架的预测性本质,其性能存在上限约束。
该论文通过统一理论和实证分析,为语音增强生成模型提供了新见解和高效改进方法,但指出其预测性限制了性能潜力。
MeanVoiceFlow通过创新应用平均流和改进训练策略,为语音转换提供了一种高效、高性能的单步解决方案,显著提升了转换速度和实用性。
现有多模态音乐表示学习模型难以捕捉自然语言描述中的用户意图,因为现有数据集(如MusicCaps)主要基于专业音乐家注释,聚焦于技术描述,缺乏日常听众的自然、主观语义表达。这导致模型在跨模态音乐检索、文本到音乐生成等任务中表现不佳。
本文引入MusicSem,一个基于Reddit有机讨论构建的语义丰富语言-音频数据集,包含32,493个语言-音频对。创新点包括:提出五类语义分类法(描述性、大气、情境性、元数据相关、上下文),以结构化自然音乐描述;数据集捕获更广泛的音乐语义,如情感共鸣和共听模式;详细阐述数据构建流程和伦理考虑。
使用MusicSem评估多种多模态模型(如检索和生成模型),发现模型普遍缺乏对语义区分的敏感性,突出现有模型在理解细粒度语义方面的挑战。实验结果强调了数据集作为基准的价值,支持未来语义敏感模型的研究。
MusicSem是一个新颖的语义感知资源,有望推动人类对齐的多模态音乐表示学习研究。
海洋生物声学分析中,检测和分类海洋动物信号(如虎鲸的点击声)面临重大挑战。手动标注耗时且不切实际,难以处理大量数据以获得可靠结果。现有基本数学模型在复杂环境(如低信噪比、区分点击和回声)中表现不佳,限制了自动分析的效率和准确性。
提出一种创新方法,将基于图像的物体检测技术应用于高级小波变换表示。具体而言,使用深度学习神经网络(如CLICK-SPOT),结合小波变换(优于传统短时傅里叶变换频谱图)来改进特征提取。方法包括声音分割(使用ANIMAL-SPOT)、物体检测(采用YOLO模型)、后处理(如FOD优化和随机森林分类)以增强检测精度和点击-回声区分能力。
论文在挪威虎鲸水下录音数据集上进行实验,比较了多种方法:PAMGuard独立实验、FOD检测、ANIMAL-SPOT分割、YOLO物体检测及其后处理优化。结果表明,结合小波变换和深度学习的方法在点击声检测和分类中有效,特别是在处理不同信噪比环境和区分点击与回声方面显示出潜力。最终优化版本提升了性能,证实了方法的实用价值。
该论文创新地整合小波变换和深度学习技术,为海洋生物声学中的自动信号检测和分类提供了高效且可扩展的解决方案,具有重要的科研和应用前景。
传统基于第一阶Ambisonics(FOA)的空间音频系统受限于低空间分辨率(仅四通道麦克风),导致声音源定位(SSL)和语音增强(SE)性能下降。现有参数化上混方法(如DirAC和COMPASS)通过估计场景参数(如方向到达)来渲染高阶Ambisonics(HOA)数据,但误差在steering vectors估计不准确时会传播,影响整体空间直接性和滤波效果。
SIRUP提出一种基于潜在扩散模型的虚拟上混器,直接对steering vectors进行空间超分辨率处理。方法采用两阶段架构:首先使用变分自编码器(VAE)学习HOA数据的紧凑潜在表示,然后训练条件扩散模型生成HOA嵌入,条件输入为FOA数据(通过零填充处理)。这种端到端方法避免了传统分析-渲染管道的脆弱性,提升了空间直接性和分辨率。
SIRUP通过扩散模型创新性地解决了FOA系统的空间分辨率限制,为高直接性空间音频处理和增强应用提供了高效、稳健的解决方案。
多分支深度神经网络(如AASIST3)在音频反欺骗领域表现出色,但其内部决策过程不透明,缺乏对分支间合作或竞争策略的理解;传统可解释性方法(如输入级显著性图)未能捕捉中间协调策略;标准性能指标可能忽略结构依赖,导致模型在某些攻击下性能下降。
提出一个框架,结合谱分析和游戏论方法:使用协方差算子和特征值分解从14个内部组件提取谱特征;基于CatBoost元分类器和TreeSHAP量化分支贡献和置信度,定义归一化贡献份额和置信度得分,以链接内部策略与经验性能。
识别了四种操作原型:"Effective Specialization"(如攻击A09,EER 0.04%)、"Effective Consensus"、"Ineffective Consensus"(如攻击A08,EER 3.14%)和"Flawed Specialization"(如攻击A17和A18,EER 14.26%和28.63%),后者暴露了模型对错误分支的过度依赖导致性能退化。
该研究通过量化多分支架构的内部策略,直接关联模型性能与结构决策,为设计更鲁棒和可解释的音频反欺骗系统提供了关键见解。
当前语音大语言模型(speech LLMs)声称通过直接处理音频来捕捉副语言线索(如韵律、情感),超越传统的ASR→LLM级联管道。然而,论文指出,现有研究存在局限性:缺乏对LLM骨干网络的严格控制,导致无法区分架构效应和骨干效应;且大多仅关注聚合准确度,忽略了逐示例行为分析,难以判断语音LLMs是否真正利用了音频信息。
论文引入了匹配骨干行为测试(matched-backbone behavioral testing),通过构建使用相同LLM骨干的ASR→LLM级联(如Whisper + 对应语音LLM的骨干),隔离了架构影响。行为评估采用逐示例指标:Cohen's κ(一致性)、条件错误重叠(共享失败模式)和McNemar's测试(系统性偏差)。机制分析使用logit lens揭示隐藏状态中的文本涌现,以及LEACE概念擦除验证文本表示的因果必要性。
这项研究通过严谨的方法和机制分析,揭示了当前语音LLMs在多数任务中本质上等价于昂贵且噪声敏感的ASR→LLM级联,为未来模型设计提供了关键见解。
流式从字形到音素和韵律(G2PnP)转换在无分词语言(如日语)中面临挑战,因为现有方法如LLM2PnP依赖显式单词边界,无法直接应用于无分词语言。此外,流式处理需要低延迟,同时保持G2PnP的准确性,这对提升语音对话模型的响应速度至关重要。
提出CC-G2PnP模型,基于Conformer-CTC架构,专门用于流式G2PnP。采用块感知流式处理,将输入字形标记分成块,允许块内和过去上下文的注意力,实现低延迟推理。引入最小向前看(MLA)机制,确保每个标记至少有最小向前看,以改善边界预测稳定性。CTC解码器动态学习字形和音素之间的对齐,无需预定义单词边界,使其适用于无分词语言。模型还包括自条件CTC以提高性能。
在日语数据集(6D-Eval)上进行实验,评估G2PnP准确性(使用字符错误率CER和句子错误率SER)和处理时间。CC-G2PnP在流式设置下显著优于基线流式Dict-DNN模型,尤其在引入最小向前看(MLA)后性能提升。最佳配置(块大小5,MLA 1或2)接近非流式模型的性能。处理时间测量显示低延迟,适用于实时集成到LLM和TTS管道中。
CC-G2PnP通过Conformer-CTC架构和最小向前看机制,有效解决了无分词语言中流式G2PnP的难题,实现了高准确性和低延迟的平衡,为流式语音合成提供了实用解决方案。
语音到语音合成模型,特别是用于语音模仿的领域,研究不足。现有方法如参数化系统和拼接系统生成高人工样本,机器学习方法如GANs在噪声鲁棒性和结果真实性上存在局限。
提出Speech to Speech Synthesis Network (STSSN),结合预训练语音识别模型(DeepSpeech)和语音合成模型(Tacotron2),通过说话者风格嵌入实现语音风格转换。模型输入源说话者内容音频和目标说话者风格音频,输出模仿目标声音的语音。
使用LibriSpeech数据集训练STSSN,基准测试比较STSSN与CycleGAN。通过平均意见评分(MOS)评估,STSSN在生成真实音频上优于CycleGAN,显示更佳效果。
STSSN有效整合先进技术,为语音模仿提供了可行解决方案,尽管有潜在恶意应用风险,但积极用例如身份保护和媒体多样性使其研究有价值。
当前音频语言模型存在显著限制:文本优先模型(如SALMONN)扩展预训练文本LLM,导致语义瓶颈,无法进行通用音频到音频建模;语义唯一模型(如TWIST)丢弃声学细节,限制高保真理解和生成;原生音频模型(如Moshi)聚焦特定任务,缺乏文本集成。这些方法均未联合建模语义、声学和文本,阻碍了多模态音频AI的发展。
本文提出原生音频基础模型,采用下一个令牌预测框架,联合建模语义内容、声学细节和文本令牌。关键创新包括:1) 系统研究设计选择(数据源、文本混合比例、令牌组合),建立验证过的训练食谱;2) 首次通过IsoFLOP分析(64个模型,3×10^18到3×10^20 FLOPs)推导离散音频模型的缩放定律;3) 使用话语级交错令牌(避免对齐错误),支持音频延续、文本延续、音频到文本和文本到音频四种能力。
缩放定律分析显示,最优数据增长快于最优模型大小(D ∝ C^0.579,N ∝ C^0.367),即数据增长1.6倍于模型大小。基于此,训练了SODA模型套件(135M到4B参数,500B令牌),验证了缩放预测。SODA作为灵活骨干,在音频和跨模态基准测试中表现竞争性,并通过微调实现语音保留的语音到语音翻译,展示了统一架构的实用性。冷启动训练优于热启动,提供更高稳定性。
这篇论文通过系统实证研究,建立了音频基础模型的训练食谱和缩放定律,为多模态音频AI的发展提供了重要基准和开源资源。
这项研究通过FPGA上的事件图神经网络实现,为事件音频处理提供了一个高效、低功耗、低延迟的硬件友好解决方案,在分类和关键词识别任务中达到先进性能。
相位声码器(PV)基的时间伸缩技术在音频信号处理中被广泛应用,但在处理打击乐成分时会出现'percussion smearing'(打击乐模糊)的artifact。这是由于幅度谱在时间伸缩过程中被拉长,而新生成的相位却是局部化的,导致时域结构不匹配,从而严重降低打击乐部分的质量。传统方法要么依赖启发式处理,要么进行信号分离,但都存在局限性,无法完全消除该问题。
本文提出SELEBI方法,利用非平稳Gabor变换(NSDGT)实现自适应时间-频率分析。核心创新是动态调整分析窗口长度:在含有显著打击乐能量的区域使用短窗口,直接计算时间局部化的幅度谱。这样做确保了幅度和相位谱在时域结构上的一致性,同时保留了完美重构属性,使得合成信号稳定且高保真。该方法避免了信号分离,专注于解决幅度与相位的不匹配问题,提供了理论上的严谨性。
实验结果表明,SELEBI方法能有效减轻打击乐模糊,并在不同拉伸因子下产生自然的音质。相比传统相位声码器和现有打击乐感知方法,SELEBI在保持音频特征(如清晰度和动态范围)方面表现更优。
SELEBI通过自适应窗口压缩和数学严格的处理,成功解决了时间伸缩中的打击乐模糊问题,为音频处理提供了高效且稳定的新方案。
核心痛点:空间音频控制(如声区控制、主动噪声控制)依赖于准确的声学传播模型,但环境变化(特别是声速变化)会导致声学脉冲响应的系统性延迟和相位不匹配,从而降低性能。现有方法通常假设已知声速、需要多个麦克风或依赖离线校准,不适用于传感器配置有限的系统。
方法创新:提出一种在线单通道声速估计方法,仅需一个观察麦克风在多通道音频播放期间运行。该方法利用SICER(Sinc Interpolation–Compression/Expansion Resampling)模型来描述声速变化对信号的影响,通过最小化测量音频信号与参数声学模型预测之间的误差来估计当前声速。算法框架包括信号建模、声速估计和鲁棒控制,允许在声速变化超出阈值时更新控制滤波器。
实验结果:仿真实验在室内设置(16个扬声器、多控制麦克风)中进行,声速在333m/s到353m/s间变化。结果显示,该方法能准确跟踪声速变化,对白噪声、语音和音乐等多种输入信号均有效。在声区控制应用中,使用估计声速补偿传播误差后,声学对比度(AC)提高、归一化信号失真功率(nSDP)降低,性能优于固定滤波器基准,接近基于真实声速的基线。
一句话评价:该论文通过创新性的在线单通道声速估计技术,为多通道音频控制系统提供了实用的鲁棒性增强方案。
自动说话人验证系统在实时语音助手中对重放攻击高度脆弱,现有方法难以可靠区分真实语音和重放语音,尤其是在多通道录音中缺乏有效的空间特征表示。
提出声学地图作为新颖的空间特征表示,通过基于延迟和求和波束形成的经典方法计算,编码方向能量分布以捕捉人类语音辐射和扬声器重放之间的物理差异。设计轻量级卷积神经网络(约6k参数)对声学地图进行分类,实现高效检测。
在ReMASC数据集上表现出竞争性性能,模型在环境依赖和独立条件下均保持鲁棒性,能泛化到不同麦克风阵列、波束形成器和未见过的声学环境。
该方法利用声学地图提供了一种紧凑、物理可解释的特征空间,有效提升了多通道重放语音检测的准确性和泛化能力。
传统语音情感识别方法主要依赖分类标签(如快乐、愤怒)或维度标签(如效价、唤醒度),但这些方法在表示情感的多样性和可解释性方面存在局限:分类方法无法处理混合或模糊情感,维度方法虽连续但不易直观理解。
论文提出基于颜色属性(色调、饱和度、值)的情感表示框架,作为连续且直观的情感分数。通过众包标注日本情感语音语料库(JVNV),分析颜色属性与情感的关系。构建了支持向量回归和深度神经网络模型进行颜色属性预测,并探索多任务学习,结合颜色属性回归和情感分类以提升性能。
实验表明,颜色属性与情感类别显著相关:例如,快乐和惊讶的色调集中在45度附近(黄色系),愤怒在340度(红色系),负面情绪如恐惧、悲伤在270度附近(蓝色系)。饱和度和值与情感特性一致,如高唤醒情感饱和度高。回归模型成功预测颜色属性,多任务学习提高了分类和回归任务的性能。
该研究创新地将颜色属性引入语音情感识别,提供了更丰富、可解释的情感表示,并通过多任务学习验证了其有效性。
当前异常声音检测(ASD)评估协议隐含假设测试时机器身份已知,并在机器级别进行评估。然而,在实际监控场景中,多个已知机器并发运行,测试记录可能无法可靠归属到特定机器,这导致部署约束(如每台机器专用传感器)和评估偏差,隐藏了方法鲁棒性差异。
论文提出一个最小修改的评估协议:在测试时移除机器身份信息,将多个机器的测试记录合并并联合评估,同时保持训练数据和评估指标(如AUC、pAUC)不变。机器身份标签仅用于事后评估,以分析性能退化。此外,引入隐式机器识别任务作为辅助指标,量化异常检测性能下降与识别准确性之间的关系。
实验使用DCASE挑战数据集(如DCASE2020-2025)和代表性ASD方法(包括判别训练模型、基于预训练嵌入的方法如OpenL3和BEATs、以及机器特定模型)。结果显示,当机器身份不可用时,异常检测性能普遍下降,且下降程度与隐式机器识别准确性强相关。归一化性能退化度量表明,方法鲁棒性差异在标准评估中被隐藏。
该研究揭示了ASD标准评估协议的局限性,强调了机器身份假设在实际部署中的不现实性,为开发更稳健和可扩展的监控系统提供了重要见解。
传统3D打印故障检测方法,如视觉检查和硬件传感器,存在成本高、侵入性强、实时监控能力有限、易受环境干扰等问题,难以实现高效、非接触式的监测。
本论文提出了一种基于声学信号分析和卷积神经网络(CNN)的实时故障检测方法。通过使用音频传感器捕获3D打印机操作时的声音,转换为频谱图(如Mel-spectrograms),并利用CNN模型进行分类,以识别常见机械故障,如喷嘴堵塞、丝料断裂和皮带打滑。该方法采用非接触式监测,结合带通滤波(100–1200 Hz)和噪声减少技术,实现高效、成本效益的实时故障检测。
初步实验结果表明,音频信号结合机器学习技术能可靠地增强实时故障检测,提供可扩展的解决方案。实验使用Makerbot Method X打印机、Sparkfun音频传感器和ABS材料,通过频谱图分析和CNN模型进行故障分类,但具体性能数据因内容截断未提供。
该研究为3D打印故障检测提供了一种创新的AI驱动方法,具有非侵入性、成本低和实时性强的优势,有望提升制造业质量控制并减少生产中断。
Resp-Agent 是一个创新的多模态系统,通过闭环设计统一了呼吸声音的生成和诊断,解决了关键挑战并推动了该领域的进展。
Existing neural audio autoencoders are designed with a reconstruction-first approach, leading to high latent token rates (e.g., 75-150 Hz), slow encoding (constituting up to 30% of training time), and fragmented architectures that separate discrete vs. continuous latent representations and different audio channel formats (mono, stereo, mid/side). This hinders practical generative workflows from preprocessing to inference conditioning, especially for high-fidelity music at 44.1 kHz.
The paper introduces the Generative-First Autoencoder (GenAE), a unified architecture optimized for generation. Key innovations include: - Architectural modifications: Efficient activations (SnakeLite), early downsampling, separable convolutions, aggressive temporal downsampling (increasing from 2048× to 3360×), mel-spectrogram fusion, windowed self-attention, and unified multi-format conditioning via audio channel format tokens. - Training optimizations: Multi-format data augmentation, auxiliary mel loss, and co-prime multi-resolution losses to enhance generalization and robustness. - Post-training step: Discretizes a trained continuous model (GenAE-KL) to support both continuous and discrete latents (GenAE-VQ) without retraining the backbone, using latent restructuring.
GenAE achieves significant improvements: - Speed: 10× faster encoding compared to prior methods. - Compression: 1.6× lower latent rates, with a 60-second mono audio signal compressed to 788 tokens. - Unified design: Eliminates channel-format-specific variants while maintaining competitive reconstruction quality in metrics like SI-SDR and STFT loss. - Performance: Outperforms baselines such as SoundStream, EnCodec, DAC, Stable Audio Open, and CoDiCodec in balancing speed, quality, and compression, as shown in ablation studies and benchmark comparisons.
GenAE is a unified and efficient neural audio autoencoder specifically designed for generative modeling, offering substantial gains in processing speed, compression rates, and architectural flexibility for diverse audio applications.
现有语音驱动面部表情生成系统采用多阶段管道(LLM、TTS、A2F),模块解耦导致高層情感和韵律信息在文本输出中丢失,TTS和A2F需重复推断相同属性,造成信息损失和冗余计算。
提出UniTAF(UniTextAudioFace)框架,基于IndexTTS2和UniTalker,重用TTS中间表示(如语音时序和韵律变化)直接驱动A2F,实现文本到音频和面部表情的统一生成。采用模块化设计,冻结TTS主干,添加音频特征适配器和A2F解码模块,保持模型独立性和可替换性。探索情感控制机制从TTS转移到联合模型。
论文从系统设计角度验证可行性,未提供定量生成质量结果。讨论了在UniTAF数据集上的训练挑战,如音频长度、语义密度和情感表达的对齐问题,并提出通过注入地面真实音频令牌等策略缓解。项目代码已开源,为后续语音-表情协同设计提供工程实践参考。
这是一个注重工程实践的创新框架,通过有效利用TTS中间表示,为解决语音和面部表情生成中的信息对齐问题提供了实用路径。
纯语音语言模型(pure speech language models)旨在直接从原始音频学习语言,不依赖文本资源。然而,自监督语音编码器提取的离散令牌序列过长,难以建模长距离依赖。现有音节分词方法(如Sylber和SyllableLM)依赖复杂多阶段训练管道,限制了实际应用。
ZeroSyl提出一种无需训练的简单方法: - 使用冻结的WavLM模型,提取层13的特征L2范数,通过峰值检测(prominence-based peak detection)识别音节边界。 - 在检测到的边界内,对层22的特征进行均值池化(mean-pooling),然后使用K-means聚类生成离散词汇。 - 训练一个因果语言模型(基于OPT-125M架构)在生成的音节单元序列上。 该方法避免了复杂训练,实现了高效音节分词。
ZeroSyl通过简单设计实现了高性能音节分词,为口语语言建模研究提供了新的有效路径,展示了无需复杂训练即可获得竞争性结果的潜力。
传统目标语音提取(TSE)方法依赖预录制的高质量注册语音,这破坏了用户体验并限制了在自发人机对话场景中的可行性,导致交互不流畅。
论文提出Enroll-on-Wakeup(EoW)框架,利用唤醒词片段(如“Hi, Pandora”)作为自动注册参考,无需用户预录制语音,实现零努力注册。此外,研究了基于LLM的TTS(如IndexTTS2、xTTS、CosyVoice)进行注册增强,通过清洁再合成或扩展拼接来改善噪声环境下的目标说话人引导。
在五个真实噪声场景(如距离、混响和SNR变化)中,评估了四种先进TSE模型(SEF-PNet、LExt、CIE-mDPTNet、SoloSpeech)。结果显示,当前TSE模型在EoW-TSE中面临性能下降,但TTS辅助显著增强了听觉体验;然而,在语音识别(ASR)准确性方面仍有差距,尤其是在短小、噪声注册片段下。
这是一个开创性的研究,首次系统探索EoW-TSE,为无缝人机交互提供了创新框架,但需进一步优化以克服注册片段短小和噪声污染带来的挑战。
该方法通过创新地结合瓶颈变压器和卷积特征提取,显著提升了非侵入式STOI预测的性能,为语音评估领域提供了更实用的解决方案。
自监督学习(SSL)通用音频表示模型在作为特征提取器时表现卓越,但其内部表示如何实现鲁棒泛化仍不明确,缺乏机制可解释性。
应用机制可解释性框架,通过分析跨任务的条件激活模式来识别类别特异性神经元。引入Audio Activation Probability Entropy(AAPE),基于Language Activation Probability Entropy(LAPE)改编,用于量化神经元对声音类别的选择性。使用Transformer编码器架构的Vision Transformer(ViT)预训练模型(M2D)进行比较分析。
实验在多个音频数据集(如ESC-50、VoxCeleb1、GTZAN)上进行,结果表明: - SSL模型在未见过任务中发展出类别特异性神经元,覆盖几乎100%的类别,而监督学习(SL)模型覆盖较少。 - 这些神经元在跨任务和跨类别中共享响应,例如语音性别属性和音乐音高。 - 通过引导消融实验,确认类别特异性神经元对分类性能有功能影响。 - 神经元共享分析显示,SSL模型在跨类共享方面优于SL模型,特别是在语音和音乐属性上。
这篇论文首次对通用音频SSL模型进行了系统的神经元级分析,为理解其内部表示提供了新见解。
This paper effectively addresses high-frequency information loss in multi-rate speech quality assessment by proposing a spectral-augmented SSL model with two-step training, leading to improved accuracy and generalization.
在语音合成中,修改嗓音质量特征如creak(吱吱声)时,由于creak与pitch(音高)之间的相关性(称为“inter-speaker” correlation),会导致pitch改变,从而影响说话人身份的保持。现有数据集(如LibriTTS-R)中,creak概率与pitch负相关,使得修改creak时pitch也随之变化,降低了说话人验证性能。
本研究提出一种数据集适应方法来disentangle pitch和creak。具体方法包括:1) 使用LibriTTS-R数据集,通过音高移位(pitch shifting)将utterances的音高调整到性别平均音高,并添加随机噪声,以打破creak与pitch之间的相关性;2) 训练一个基于条件连续标准化流(CCNF)的说话人操纵块,集成到Text-to-Speech(TTS)系统(如YourTTS)中,用于全局修改creak概率,同时保持其他声学特征对齐。
实验表明:1) 在适应后的数据集上,creak与pitch之间的相关性显著降低(如Table 1所示,男性speaker的相关系数从-0.7降至0.0);2) 说话人验证性能在多种creak操纵强度下得到显著改善;3) 声学特征分析(如H1-H2、HNR、CPP)显示,creak修改后,这些特征与预期一致,表明方法有效保持了声学相关性。
该研究通过创新的数据集适应和CCNF-based操纵,成功解决了在语音合成中disentangle pitch和creak的挑战,显著提升了说话人身份保持,对语音教学、语音识别和说话人验证应用具有重要价值。
病理性语音增强(Speech Enhancement, SE)面临数据稀缺和声学特性异常的挑战。现有的SE模型在神经典型语音上表现良好,但对病理性语音性能显著下降,因为病理性语音数据集小、噪声多,且声学特性如音高和语速异常,导致模型泛化能力差。
本文系统研究数据增强(DA)策略以提升病理性SE性能。评估三种DA类别:transformative增强(包括音高变换、时间拉伸和SpecMix)、generative增强(使用YourTTS和XTTS合成语音)、以及噪声增强。在两种最先进的SE模型上测试:predictive复杂谱回归(CR)模型和generative薛定谔桥(SB)模型,并在西班牙PC-GITA数据集上进行实验。
实验结果显示,噪声增强在所有策略中表现最一致且效果最显著,能大幅提升SE性能。transformative增强(特别是SpecMix)提供中等改进,而generative增强效果有限,在高增强比例时甚至可能损害性能。DA的效果因SE模型而异,对predictive CR模型更有益。尽管DA改善了病理性SE,但病理性与神经典型语音之间的性能差距依然存在。
本研究为病理性语音增强提供了数据增强策略的系统评估,强调了噪声增强的有效性,但指出需要针对病理性语音的更有针对性DA策略以缩小性能差距。
长音频(如多小时的录音)在工业和个人设置中越来越常见,但手动审查不切实际。现有音频语言模型在长音频问答(QA)中面临重大挑战,包括上下文长度限制、自然语言时间表达的高变异性(如12小时与24小时格式、相对短语),以及开放生成中的幻觉问题,导致难以进行精确时间推理和可靠回答。
论文提出LongAudio-RAG (LA-RAG),一个混合框架,用于多小时长音频的问答。核心创新包括:首先,通过音频接地模型(AGM)将长音频转换为带时间戳的声学事件记录(包括事件名称、起止时间、置信度等),存储在SQL数据库中;其次,在推理时,系统解析时间参考、分类意图(如检测、计数、总结)、检索相关事件,并仅基于这些约束证据使用大型语言模型(LLM)生成答案。此外,系统部署在混合边缘-云环境中,音频检测在IoT设备上运行以减少带宽,LLM在GPU服务器上运行以增强语言推理,实现低延迟和高可扩展性。
在合成的长音频基准上(包括Home-IoT和Industrial-IoT数据集),LA-RAG相比基线方法显著提高准确性。例如,在检测任务中,LA-RAG达到约90%的准确率,在计数和总结任务中也优于原始RAG或文本到SQL方法。同时,系统延迟较低(约0.5秒),展示了高效性和实用性。详细结果见论文中的Table 1。
该工作为解决长音频QA问题提供了一个创新且实用的混合方法,结合事件级检测和LLM推理,有效减少幻觉并支持精确时间推理,具有实际部署价值。
传统自动词命名识别系统难以准确识别中风后失语症患者的语音,因为患者常伴有发音不流利、错误和语言障碍,导致自动化评估不可靠,限制了临床应用的效率。
提出基于对比语言-音频预训练(CLAP)的方法,将词命名识别重构为音频-文本匹配问题。使用预训练的wav2vec2模型作为音频编码器和DistilRoBERTa-base作为文本编码器,通过对比学习在共享嵌入空间中映射音频和文本,从而提高对发音变异、不流利和重叠语音的鲁棒性,无需针对每个新单词重新训练。
在两个法国中风后失语症患者的语音数据集上评估,该方法达到高达90%的准确率,显著优于基于分类和自动语音识别(ASR)的基线方法,展示了在具有挑战性的录音中的有效性。
该研究创新地应用CLAP框架解决失语症语音识别难题,为临床自动化评估和辅助技术提供了高效且可扩展的解决方案。
Bengali (Bangla) 是一种全球广泛使用的语言,但在开放语音技术中资源严重不足,特别是在长时自动语音识别(ASR)和说话人日志(diarization)方面。现有的大部分孟加拉语语料库集中于短时、单说话人的话语(如朗读语音),无法有效处理长录音中的挑战,包括多话题、多变声学环境、多说话人对话以及时间上的错误累积。说话人日志资源尤其稀缺,缺乏与英语等语言的类似基准(如 AMI、DIHARD)的可比性。
论文提出了 Bengali-Loop,两个社区基准来弥补这一差距: 1. 长时ASR语料库:包含 191 个录音(总计 158.6 小时,792k 单词),来自 11 个 YouTube 频道,通过可重复的字幕提取管道和人工循环转录验证收集,确保了高质量参考转录。 2. 说话人日志语料库:包含 24 个录音(总计 22 小时,5,744 个标注段),具有完全手动标注的说话人转换标签,采用 CSV 格式(开始时间、结束时间、说话人 ID),并定义了单标签重叠策略以简化标注和评分。 此外,提供了标准化的评估协议(WER/CER 用于 ASR,DER 用于 diarization)、详细的标注规则和数据格式,以支持可重复的基准测试和未来模型开发。
这篇论文为孟加拉语长语音技术提供了全面的社区基准和标准化的评估框架,有效填补了资源不足的空白,并促进了可重复研究和未来模型创新,对低资源语音技术领域具有重要贡献。
这项研究为歌唱语音合成提供了一种物理信息化的参数估计方法,增强了可解释性和控制能力,但周期性建模仍需改进。
这是一个综合性的多学科提案,旨在利用AI和先进技术改善耳蜗植入者的空间听力,具有潜在的科研创新和临床应用价值。
当前自动说话人验证(ASV)系统在面对零努力冒名攻击和欺骗攻击(如语音转换VC和文本到语音TTS)时性能下降,需要集成ASV和反欺骗(CM)子系统以提高鲁棒性,但现有集成方法在单独任务评估时可能性能退化。
提出ELEAT-SAGA架构,核心是Score-Aware Gated Attention(SAGA),通过CM分数动态调制说话人嵌入。探索早期集成(S1)、晚期集成(S2)和完全集成策略,并引入交替训练:Alternating Training for Multi-Module(ATMM)和其改进变体Evading Alternating Training(EAT)。使用预训练的ECAPA-TDNN提取说话人嵌入,AASIST提取CM分数或嵌入。
在ASVspoof 2019 Logical Access和Spoofceleb数据集上评估,SASV-EER为1.22%,minimum a-DCF为0.0304,显著优于基线方法。结果表明,分数感知注意力机制和交替训练策略有效增强SASV系统的鲁棒性。
该工作通过创新的动态调制机制和优化训练策略,为欺骗鲁棒说话人验证提供了高效解决方案,提升了系统在真实场景中的可靠性。
BreathNet通过集成呼吸线索、特征融合和损失优化,显著提高了音频深假检测的泛化能力和准确性。
维度缩减是机器学习中用于减少计算成本、缓解过拟合并加速训练和推断的基础技术。传统方法如主成分分析(PCA)依赖于矩阵乘法,这在资源受限设备(如助听器和嵌入式系统)上可能成为计算瓶颈。元素选择作为一种无乘法的维度缩减方法,消除了乘法成本,但关键挑战在于高效选择最优元素子集。
本文提出一种快速交换基元素选择算法,用于无乘法维度缩减。方法通过选择输入元素的子集实现维度缩减,仅涉及内存访问而无标量乘法。创新点包括: - 将元素选择建模为离散优化问题,最小化从选定元素到目标向量(如分类标签或输入本身)的线性回归均方误差。 - 使用矩阵反演引理推导快速评估公式,将每次候选交换的主要计算简化为小2×2矩阵的反演,显著降低计算复杂度。 - 采用交换基局部搜索策略,迭代应用目标函数提升的交换,直至收敛到局部最优。
在MNIST手写数字数据集上实验,将784维图像向量降至100维: - 加速算法比朴素实现快200倍以上(计算时间从约1800秒减少到8秒)。 - 与PCA相比,提议方法的归一化重建损失为0.1367,高于PCA的0.0856,但计算成本显著降低。 - 可视化显示所选元素更分散,考虑了像素间相关性,优于仅基于高方差的选择。 - 图像重建结果表明,方法在保持可接受重建质量的同时,避免了乘法操作。
该研究提出了一种高效的无乘法维度缩减方法,特别适用于资源受限的机器学习系统,在计算效率和准确性之间实现了有效平衡。
自动语音识别(ASR)系统在口音语音上性能显著下降,主要原因是声学-音素和韵律的偏移导致与训练数据不匹配。现有的伪标签选择方法(如基于语言模型困惑度过滤)以文本为中心,可能偏好流畅但与声学不匹配的假设,从而在微调时放大错误,且带标签的口音适应成本高昂。
论文提出一种多模态一致性引导、无参考的数据选择管道,用于ASR口音适应的无监督场景。关键创新包括: 1. 目标感知预选择:基于子模互信息(FLMI)进行查询相关的预选择,提高相关性并减少计算负担。 2. 扰动解码:为每个话语生成多个伪转录(通过模型参数和输入扰动),以增加多样性。 3. 多模态一致性评分:使用两个无参考信号评估每个假设的质量: - 在共享嵌入空间(使用冻结的SONAR编码器)中的语音-文本对齐。 - 预测的词错误率(WER),通过轻量级MLP基于语音和文本嵌入预测。 4. 选择规则:基于百分位的简单选择规则,保留可靠的伪标签用于微调,同时丢弃噪声话语。
该方法通过整合多模态一致性信号,为ASR口音适应提供了一种高效、无监督的数据选择框架,显著提升了伪标签质量并减少了依赖监督数据的需求。
PhysioSER通过整合生理学指导的特征表示和四元数建模,有效解决了SER中可解释性不足和振幅-相位耦合缺失的问题,显著提升了识别性能和跨语言泛化能力。
Deep Neural Networks (DNNs) 在低信噪比(SNR)场景下,特别是面对谐波噪声(如旋转机械产生的循环平稳噪声)时,性能显著下降,难以有效抑制噪声并可能引入语音失真。标准基于短时傅里叶变换(STFT)的 DNN 架构无法利用噪声的循环平稳性(cyclostationarity)结构,因为 STFT 处理丢弃了频谱相关性,导致模型缺乏抑制谐波干扰的归纳偏置。
本文提出一种两阶段语音增强框架,结合循环平稳性感知的预处理和深度学习。第一阶段使用循环最小功率无失真响应(cMPDR)光束形成器作为前端预处理,通过频率偏移和频谱协方差矩阵来抑制谐波噪声成分,利用噪声的频谱相关性而不需修改 DNN 架构。第二阶段采用轻量级 DNN 架构,如卷积循环神经网络(CRNN)或超低复杂度网络(ULCNet),进行掩码估计和进一步去噪。cMPDR 通过时间域调制精确对齐循环平稳分量,增强预处理效果。
在合成数据和真实世界数据(如 IDMT-ISA Electric Engine 数据集)上的实验表明,cMPDR 预处理结合轻量 DNN(如 CRNN)在低 SNR(-20 dB 到 0 dB)下 consistently 优于端到端 DNN 基线及 Wiener 滤波预处理。具体地,参数效率高的 CRNN 加 cMPDR 在性能上超越了更大的 ULCNet 模型处理原始或 Wiener 滤波输入,同时模型参数量减少约 30%。结果证实,显式结合循环平稳性先验比单纯增加 DNN 容量更有效地抑制谐波干扰。
该工作通过整合循环平稳性感知预处理和轻量深度学习,为低 SNR 语音增强提供了一种高效且性能优越的混合解决方案,突出了先验知识在噪声抑制中的重要性。
自监督语音模型(如HuBERT)在扩展到新语言时面临泛化困难,并在持续训练中容易发生灾难性遗忘,导致先前学到的知识丢失。现有方法如大规模联合训练成本高昂,而参数高效方法如LoRA在处理语言干扰时表现有限,限制了多语言场景下的有效性。
提出Lamer-SSL框架,集成层感知的LoRA专家混合(Lamer)模块和重播策略。Lamer模块结合LoRA的效率和混合专家(MoE)的灵活性,通过层感知专家分配策略,将更多专家分配给深层Transformer层以捕获丰富的语义信息,而浅层分配较少专家以处理语言无关的声学特征。重播策略使用少量先前语言数据(如英语)在持续训练中回放,以缓解遗忘,无需访问整个历史数据集。
在ML-SUPERB协议下的自动语音识别(ASR)和语言识别(LID)任务中,Lamer-SSL有效将HuBERT-Large扩展到新语言(如汉语和粤语),同时保持对先前语言(如英语)的强性能。实验显示,仅使用2.14%的可训练参数,在ASR任务上字符错误率(CER)降低,LID任务上准确率(ACC)提升,优于基线方法如HuBERT-LoRA和mHuBERT-147。
Lamer-SSL是一种参数高效的持续训练框架,成功平衡了共享和语言特定表示,为自监督模型的多语言扩展提供了可扩展且抗遗忘的解决方案。
解码器-only架构在自动语音识别(ASR)中面临整合异质模态(如连续语音特征和离散文本令牌)的挑战。之前方法依赖额外的对齐模块或适配器,增加了模型复杂性和训练难度。
论文提出了一种解码器-only Conformer架构,结合模态感知稀疏混合专家(MoE)。主要创新点包括: - 统一解码器:使用单一堆栈处理语音和文本,无需外部语音编码器或预训练大型语言模型(LLM)。 - 模态感知MoE:分离的专家池用于语音和文本,采用硬路由和top-1选择,专门处理不同模态。 - 混合因果性:在Conformer块中,语音部分使用双向自注意力,文本部分使用因果自注意力。 - 训练策略:结合CTC损失在语音位置和标签平滑的交叉熵损失在文本生成,提高训练稳定性。
在Librispeech数据集上,提出的113M参数模型在test-clean和test-other的WER分别为2.8%和5.6%,优于139M参数的AED基线(3.2%和6.0%)。在Common Voice 16.1多语言数据集上,平均WER从12.2%降低到10.6%。这表明模型在减少参数的同时提高了准确性。
该研究首次展示了通过模态感知MoE在随机初始化的解码器-only架构中超越强AED基线,为ASR提供了一种简化且高效的替代方案。
现有视频定制方法主要分为两类:调优基础(tuning-based)和免调优(tuning-free),它们专注于生成身份一致的视频,但要么不包含音频(如典型视频定制),要么音频内容不能自由指定(如音频驱动视频定制)。这限制了在需要个性化音频-视频内容的应用中的灵活性,例如电影、广告和游戏。
OmniCustom 提出一个基于 Diffusion Transformer (DiT) 的框架,用于同步音频-视频定制(sync audio-video customization)。关键创新包括: - 引入独立的参考图像和音频 LoRA 模块,通过自注意力层控制视觉身份和音频音色,避免大规模计算开销。 - 结合对比学习目标与标准流匹配目标,使用参考条件样本作为正例,无参考条件样本作为负例,增强身份和音色保留能力。 - 训练于自建的大规模、高质量音频-视觉人类数据集 OmniCustom-1M(包含一百万单人人像视频)。
通过广泛定性定量实验,OmniCustom 在生成身份一致、音色保真的音频-视频内容方面优于现有方法。实验展示其在零样本设置下的有效性,能够根据参考图像、参考音频和文本提示同步生成个性化视频和音频。
该研究首次提出同步音频-视频定制任务,并提供了一个高效、可扩展的零样本框架,推动了多模态生成模型向更实用和灵活的应用发展。
现有音乐描述符数据集主要关注描述符提取,但忽略了用户意图中的偏好信息(如正面、负面或参照性意图),导致音乐推荐系统在处理开放式查询时效果有限,难以准确理解用户需求。
该论文通过创建新数据集和基准测试,为音乐查询中的细粒度用户意图理解提供了重要工具,同时揭示了LLMs在上下文依赖描述符提取上的局限性,对改进音乐推荐系统具有参考价值。
现有房间声学分析工具面临两大挑战:一是昂贵的商业软件(如 ODEON、CATT-Acoustic)需要大量资金和培训投入;二是开源的命令行工具(如 Python Acoustics 库)缺乏直观的用户界面和可视化功能,使非专业人员难以访问。这导致在建筑、音频工程和听力研究中,结合严谨信号处理与直观可视化的工具稀缺,阻碍了广泛应用。
论文提出了 AcoustiVision Pro,一个开源网络平台,针对房间冲激响应(RIR)分析进行创新:1. 平台计算 12 个标准化声学参数(如 RT60、C80、D50、STI 代理、IACC),基于数学理论和感知相关性;2. 集成 RIRMega 和 RIRMega Speech 数据集,提供数千个带元数据的模拟 RIR,用于基准测试和教育;3. 引入新颖可视化,包括交互式 3D 反射映射、瀑布衰减图和房间模态密度分析;4. 自动化合规检查,支持 ANSI S12.60、ISO 3382 等 10 个国际标准;5. 开发健康评分系统,综合多个声学参数生成可操作建议。
通过初步案例研究和评估,AcoustiVision Pro 在多个领域展示出实用性:课堂声学分析可优化语音可懂度;医疗设施设计有助于减少患者压力;录音室评估支持音频工程改进。平台提供详细 PDF 报告和 CSV 数据导出,便于工程文档和进一步分析,并支持基于 FFT 卷积的实时仿真。
AcoustiVision Pro 是一个突破性的开源平台,将专业级声学分析与易用性相结合,为研究人员、建筑师和教育工作者提供了可访问的工具,有望推动房间声学领域的创新和应用普及。
自动语音识别(ASR)系统在处理领域特定短语(如命名实体)时容易发生误识别,导致下游任务失败。现有基于大语言模型(LLM)的命名实体校正方法未能充分利用LLM的复杂推理能力,且缺乏高质量推理数据,难以处理罕见实体和语音歧义情况。
提出RASTAR(检索增强自教学推理模型与自适应思维链)框架,主要包括两个关键组件: 1. 重新表达语言模型(RLM):用于命名实体识别(NER),通过模拟人类语义重构整个句子,替代传统的序列标注方法,以捕获全局语义信息。 2. 自适应思维链自教学推理模型(A-STAR):采用自训练技术生成思维链推理数据,根据任务难度动态调整推理深度,并利用直接偏好优化(DPO)进行自我改进,从而减少推理开销并提高校正准确性。
在AISHELL-1和Homophone数据集上进行评估,命名实体字符错误率(NE-CER)相对于强基线(如DANCER)分别减少了17.96%和34.42%,NER模块在召回率、精确率和F1分数上均优于现有方法。
该研究通过结合检索增强和自适应推理,有效解决了ASR命名实体校正中的推理和数据稀缺问题,展示了显著的性能提升和实用性。
音乐认知研究中缺乏合适的‘最小对’刺激来精确测量轮廓组件(如旋律、节奏、音色)在音乐熟悉性中的相对权重。人类能基于整体轮廓识别音乐,但现有方法难以解释这种认知过程,且音乐记忆不依赖于时频域中的固定模式,导致实验设计挑战。
提出基于联合时频散射(JTFS)的方法生成‘音乐共色’。JTFS 通过两个阶段:首先使用 Morlet 小波滤波器组提取听觉特征,然后使用时频调制小波分析谱图。通过高斯低通滤波实现时间平移(尺度 T)和频率平移(尺度 F)的不变性,从而捕捉音乐轮廓。使用 Kymatio 开源软件(支持 GPU 计算和自动微分)实现,无需手动预处理如转录或源分离。重建过程采用梯度下降,从噪声信号优化生成与原始音频感知相似的 metamers。
论文片段未提供具体实验数据或定量结果,但详细描述了方法的数学基础、算法实现和代码示例,表明该方法能有效生成音乐共色,适用于音乐认知实验的刺激设计,并具有计算效率。
该研究创新性地将 JTFS 应用于音乐共色生成,为音乐认知研究提供了无需预处理的自动化工具,具有促进实验设计和音频合成的潜力。
传统 HRTF 上采样方法(如距离加权插值和基础函数分解)依赖于单个主题的稀疏测量,受空间采样定理限制,在稀疏采样条件下性能显著下降。现有学习型方法虽利用跨主题信息,但大多聚焦于空间关系建模,频域依赖关系被隐式或独立处理,未能充分利用 HRTF 幅度响应在频域的局部连续性和长程结构。
论文系统调查频域特征建模,比较不同架构(包括每频率多层感知器、卷积、膨胀卷积和注意力模型)在 HRTF 幅度上采样中的效果。基于分析,提出频域 Conformer 架构(FD-Conformer),结合 Conformer 设计以显式联合捕捉局部频谱连续性和长程频率相关性,改善频域依赖建模。
在 SONICOM 和 HUTUBS 数据集上的实验表明,所提方法在 interaural level difference (ILD) 和 log-spectral distortion (LSD) 指标上达到最先进性能,特别是在严重稀疏测量条件下重建准确性更高,验证了显式频域建模的有效性。
该研究通过创新性频域建模,显著提升了稀疏测量下的 HRTF 幅度上采样精度,推动了空间音频渲染技术的发展。
现有基于双向Mamba(BiMamba)的流式自动语音识别(ASR)方法在动态块大小训练时面临高开销问题,传统块处理(chunk-wise processing)导致训练速度慢、内存使用高和性能下降,且现有方法如LC-BiMamba限于固定块大小解码。
本论文提出TC-BiMamba模型,结合双向Mamba和CNN编码器,核心创新是Trans-Chunk机制,使BiMamba在动态块大小下以离线风格训练双向序列,有效捕获全局上下文。该方法通过简化训练过程,实现1.3倍训练速度提升、50%内存减少和性能改善,并使用混合解码器(Mamba替换自注意力)维持线性计算复杂度。
在AISHELL-1和AISHELL-2数据集上实验,TC-BiMamba在离线和非流式ASR(如块大小16设置)中表现优异。与基线U2++相比,字符错误率(CER)降低,如离线CTC CER为5.25%(AISHELL-1),与LC-BiMamba匹配但模型参数更少(约47M参数)。训练效率提升验证了Trans-Chunk机制的有效性。
这是一项创新的工作,通过Trans-Chunk机制高效解决了动态块大小训练挑战,推动了流式ASR的统一模型发展,具有实际应用价值。
音频-语言模型(Audio-LLMs)在处理音频和文本冲突时,系统性倾向于遵循文本而非音频,即使被明确指示信任音频。这被称为文本主导(text dominance),揭示了模型在模态仲裁中的不对称性,可能导致实际部署中错误依赖陈旧或不正确的文本信息,影响语音接口的可靠性。
论文引入音频-LLM模态评估(ALME)基准,包含57,602个控制的音频-文本冲突刺激,跨8种语言(如英语、中文、日语等)。通过文本主导比率(TDR)量化模型行为,并比较音频-文本冲突与文本-文本冲突以隔离模态特定效应。方法包括细粒度调整消融实验(如训练音频投影层或应用LoRA)来定位文本主导的来源,以及使用级联基线区分信息内容和仲裁可访问性。
关键发现:音频-LLMs在音频-文本冲突下的文本主导(TDR=16.6%)比文本-文本冲突(TDR=1.6%)高10倍,表明仲裁不对称性;音频嵌入的信息内容更高(音频-仅准确性97.2% vs 级联准确性93.9%),但文本更易于仲裁访问。干预措施显示:强制转录增加文本主导(从19%到33%),而将文本框架为“故意损坏”减少80%文本主导;跨语言和跨模型(如GPT-4o、Gemini 2.0 Flash、Qwen2-Audio、Ultravox)存在显著变异,CJK/阿拉伯语模型通常文本主导更高。细粒度调整消融提供因果证据:文本主导源于LLM推理而非音频编码器。
论文通过多语言、多模型实验系统性地揭示了音频-LLMs在模态仲裁中的偏差,为改进模型设计和评估提供了重要见解,强调了信息内容与仲裁可访问性的关键区别。
当前唇语到语音合成(L2S)方法通常依赖于中间表示,如mel频谱图或离散自监督学习(SSL)令牌,导致信息损失,无法捕捉高保真语音所需的细粒度声学细节。视觉到音频的映射是ill-posed问题,一个唇动序列对应多个有效语音渲染,增加了合成难度。现有方法如Uni-Dubbing使用离散令牌预测,但视觉输入信息稀疏,难以支持复杂的语言建模任务。
本文提出SLD-L2S框架,基于层次子空间潜在扩散模型。创新点包括:直接映射视觉唇动到预训练神经音频编解码器的连续潜在空间,避免中间表示的信息损失;设计子空间分解模块将视觉表示分解到多个并行子空间;引入扩散卷积块(DiCB)作为网络骨干,捕获时间和跨子空间依赖;采用重新参数化流匹配技术直接生成目标潜在向量,并结合语义一致性损失和语音语言模型(SLM)损失以提高训练效果和语音清晰度。
实验表明,SLD-L2S在多个基准数据集上实现了最先进的生成质量,在客观和主观评估中均超越现有方法。
SLD-L2S通过创新地集成层次子空间潜在扩散模型和音频编解码器,为唇语到语音合成提供了高保真、高效的解决方案。
散射变换(Scattering Transform)在作为可微分损失函数时,由于路径众多,计算成本高且内存消耗大,严重限制了其在神经网络训练中的应用,特别是在大规模梯度下降中。这使得在音频、语音和计算机视觉领域的感知质量评估任务中,难以高效使用散射变换进行优化。
论文提出SCRAPL(Scattering Transform with Random Paths for Machine Learning),一种随机优化方案,通过以下创新点提高效率: - 随机路径采样:均匀采样散射变换的路径来近似梯度,实现计算加速。 - P-Adam(Path-wise Adaptive Moment Estimation):扩展Adam优化器,处理路径非独立同分布问题,通过路径自适应的矩估计平滑梯度。 - P-SAGA(Path-wise Stochastic Average Gradient with Acceleration):基于SAGA算法的路径版本,维护路径梯度记忆以加速收敛。 - θ-重要性采样:初始化启发式方法,根据梯度变化率采样路径,提升优化性能。 这些方法共同减少散射变换的计算负担,使其适用于大规模可微分数字信号处理(DDSP)。
在无监督声音匹配任务中,应用SCRAPL于粒度合成器和Roland TR-808鼓机,结果表明: - 相比多尺度谱损失(MSS),SCRAPL在准确性上更优(例如,在感知质量评估中),计算成本略高但可接受。 - 相比完整联合时频散射变换(JTFS),SCRAPL在准确性上接近(在因子2内),但计算成本显著降低(在因子2内),内存效率更高,适合大规模部署。 - 实验通过平均合成器参数误差和计算成本评估,显示SCRAPL在帕累托前沿上取得平衡,优于其他基线方法。
SCRAPL是一种高效的随机优化框架,通过智能路径采样和优化技术,有效解决散射变换的计算瓶颈,在保持高性能的同时推动可微分信号处理和音频机器学习的发展。
传统同时语音翻译(Simultaneous Speech-to-Speech Translation)方法依赖于单词级对齐的监督数据,但这些数据难以大规模收集,且通常基于语言特定的启发式方法进行合成对齐,导致效果不佳和流程复杂。
论文提出Hibiki-Zero系统,创新点在于完全无需单词级对齐数据。首先使用句子级对齐数据训练基础模型,然后通过强化学习(RL)策略,具体采用GRPO(Group Relative Policy Optimization)优化延迟,同时保持翻译质量。基于多流架构(multistream architecture),模型同步处理源语音并生成目标语音和文本,奖励系统仅基于BLEU分数,简化了训练。
在五个多语言到英语(X-to-English)任务中,Hibiki-Zero在翻译准确性、延迟、语音身份保留和自然度方面实现了最先进(state-of-the-art)性能。此外,模型能够以少于1000小时的语音数据适应新输入语言。作者发布了模型权重、推理代码和一个45小时的多语言基准数据集用于评估。
该方法通过消除对齐数据需求,显著简化了训练流程,提高了多语言可扩展性和实用性,为同时语音翻译领域带来了重要突破。
现有离散音频tokenizer方法通常依赖预训练编码器、语义蒸馏或异构CNN架构,这些设计引入了固定的归纳偏差,限制了重构保真度并阻碍了有效扩展。
提出CAT(Causal Audio Tokenizer with Transformer),一个纯Transformer架构,从零开始联合优化编码器、量化器和解码器,实现高保真重构。基于CAT,开发了MOSS-Audio-Tokenizer,一个1.6亿参数的大规模音频tokenizer,在300万小时多样化音频数据上预训练,支持可变比特率(0.125 kbps 到 4 kbps)、低帧率(12.5 Hz)和流式处理。利用CAT的离散令牌,开发了首个纯自回归TTS模型,并提出了Progressive Sequence Dropout训练策略。
MOSS-Audio-Tokenizer在语音、声音和音乐上,在各种比特率下一致优于现有编解码器,实现高保真重构。此外,它支持竞争性的自动语音识别(ASR)性能,无需辅助编码器,并显示出随着模型规模和计算预算增加而持续改进的重构质量。
CAT架构作为一个统一、可扩展的接口,为未来音频基础模型的音频压缩、理解和生成奠定了基础。
监督学习的深度模型在说话人识别中严重依赖大量人类标注数据,导致成本高昂、难以扩展,且在未见条件下泛化能力差。
论文将自监督学习(SSL)实例不变性框架(如SimCLR、MoCo、DINO)应用于说话人识别,系统研究了SSL框架的超参数影响、组件角色(如数据增强、投影器、正采样),并比较了单阶段和多阶段SSL方法。
在一致的实验设置下,DINO在下游任务中表现最佳,能有效建模说话人内部变异性,但对超参数和训练条件高度敏感;SimCLR和MoCo提供鲁棒替代,有效捕获说话人间变异性且不易崩溃。
这篇论文全面回顾了自监督学习在说话人识别中的应用,指出了当前挑战和未来研究方向。
现有同理心语言模型(LLMs)主要依赖文本输入,但文本在捕捉语音中的情感细微差别方面有限,导致情感探索能力不足,难以实现深度的人类-AI交互同理心。现有方法如BLSP-Emo虽然整合了语音,但仍缺乏对语音信号中情感细微变化的系统性建模,影响了同理心响应的质量。
论文提出RE-LLM(Refining Empathetic Speech-LLM),通过集成维度情感嵌入和辅助学习来增强语音-LLMs。具体创新包括: - 情感细微模块:使用预训练的wav2vec 2.0模型提取维度情感嵌入(如效价、唤醒、优势),并将其与语音编码器输出结合,提供更丰富的情感信息。 - 多视角辅助任务:在训练阶段引入分类(四类主要情感)和回归(三维情感属性)的辅助任务,以帮助模型更好地理解情感细微差别。 - 训练策略:采用预处理生成预期响应和期望行为对齐的两步训练过程,优化KL散度损失,并结合交叉熵和均方误差损失进行整体训练。
在三个数据集上(IEMOCAP、ESD、MSP-PODCAST)进行了评估: - 同理心指标:RE-LLM在情感反应分数上相对提升,例如在ESD上比文本-LLM基线提高14.79%,比语音-LLM基线提高6.76%。探索分数提升更显著,如在ESD上相对提升139.28%和9.83%。 - 语音情感识别:无权重准确率在IEMOCAP上提高5.4%,在ESD上提高2.3%,在MSP-PODCAST上提高6.9%。 - 所有改进均通过Wilcoxon符号秩检验验证为统计显著,表明模型在同理心响应生成和情感理解方面有实质性进步。
RE-LLM通过融合语音情感细微差别和引入辅助学习任务,有效提升了语音-LLMs的同理心响应能力,为未来同理心AI交互提供了有前景的方法。
语音增强(SE)系统通常需要辅助模块(如语音活动检测、信噪比估计、声学场景分类)以实现稳健的上下文感知行为,但这些模块的计算成本高,部署在边缘设备上不切实际,而云端推理会引入延迟并损害隐私。
本研究提出利用动态通道剪枝(DynCP)模型中的剪枝掩码作为特征,通过简单的线性/逻辑回归模型预测辅助信号属性,如语音活动检测、噪声分类、F0估计等,避免了部署额外模型的计算开销。该方法利用了二进制掩码,使预测过程简化为加权和,计算开销可忽略。
实验结果显示,在语音活动检测上达到93%准确率,噪声分类84%,F0估计R2为0.86。性能评估覆盖多个分类、回归和说话人验证任务,证明了该方法的有效性。
该工作创新地将动态剪枝技术应用于辅助任务估计,为边缘设备上的高效语音增强和信号属性提取提供了新思路。
现有大型音频-语言模型(LALMs)的基准(如SAKURA和MMAR)主要评估模型基于内部知识的推理能力,忽视了现实世界场景中需要外部信息检索的情况。这导致模型在处理超出训练数据的问题时,容易产生幻觉,影响事实准确性。
论文提出AudioRAG基准,首次系统评估音频推理与信息检索的结合能力。方法包括:1) 基于开源数据集和在线视频,使用LLM(如GPT-4o)生成和手动收集多跳问题-答案对;2) 设计代理管道,基于WebThinker增强音频处理工具和搜索工具,支持自主推理和外部知识检索。
评估多个SOTA LALMs(如Qwen2.5-Omni、Audio Flamingo 3),结果显示准确率较低(如Qwen3-Omni为37.0%),证实模型难以处理音频推理和信息检索任务。代理管道(如Qwen3-Omni + Qwen3-8B)将准确率提升至46.2%,相对改进达24.9%,提供了强基线。
AudioRAG是一个创新性基准,有效填补了音频推理与信息检索结合的空白,为未来多模态AI研究提供了重要工具和方向。
大型音频语言模型(LALMs)在细粒度听觉感知任务(如音高估计、事件计数)上表现不可靠,现有方法依赖数据密集型训练来内化感知能力,面临高标注成本和数据效率低下的挑战。
提出AudioRouter框架: - 使用强化学习(RL)将工具使用明确为离散决策问题,优化轻量级路由策略。 - 路由模块决定是否调用外部音频工具(如音高跟踪、事件检测工具),并选择具体工具,同时保持基础音频推理模型冻结。 - 通过相对结果奖励机制(比较使用工具和直接推理的性能)训练路由策略,无需手动标注工具使用标签。
AudioRouter通过强化工具使用决策,为音频理解提供了一个数据高效且可扩展的替代方案,避免了对感知能力内化的依赖。
音频语言模型在处理需要精确时间定位的任务(如词对齐、说话人分离)时面临以下问题: - 幻觉问题:标准方法生成时间戳作为文本令牌序列,容易产生与音频内容无关的输出。 - 计算效率低:文本生成过程自回归,导致高计算成本。 - 长度泛化差:模型在训练分布外的音频持续时间上表现不佳,容易出现大误差。
论文提出“frame-level internal tool use”方法: - 内部工具使用:训练音频语言模型利用其内部音频表示直接执行时间定位,避免文本生成。 - 轻量级预测机制:通过两种损失函数训练: - 二元帧分类器:预测每个帧是否包含目标事件。 - 非均匀泊松过程(IHP)损失:建模时间事件强度,处理稀疏和依赖事件。 - 直接时间戳提取:使用确定性函数(如峰值检测)从概率分布中提取时间戳,提高效率。
在多个任务上评估: - 任务:词定位、说话人分离、音频事件定位。 - 性能:优于基于令牌的基线方法,IHP损失通常表现更好。 - 效率:推理速度提升超过50倍,仅需单次并行处理音频帧。 - 泛化能力:在分布外音频持续时间上保持高准确性,显著减少幻觉。
该方法通过内部工具使用,有效提升了音频语言模型在时间定位任务中的准确性和效率,克服了标准文本生成方法的局限性。
现有语音起源系统面临主要挑战:神经水印系统如AudioSeal虽能实现鲁棒和本地化检测,但缺乏第三方可验证的加密证明将特定时间片段与发行者签名原始内容绑定;而C2PA等起源标准使用签名清单和Merkle碎片验证,但在重编码或常规分布处理下易失效。实际工作流涉及拼接、裁剪和平台级变换,需要系统在分布变换后保持有效性,并支持分块本地化验证。
MerkleSpeech提出一种创新系统规范,结合四个组件:确定性分块指纹、基于Merkle树的承诺、发行者签名和紧凑带内水印负载。提供两个验证层级:WM-only层,仅依靠水印负载恢复,在常见分布变换下提供鲁棒归因;MSv1层,结合Merkle包含证明和签名,提供严格完整性保证。系统使用短语音分块计算感知指纹,构建Merkle树,签名根,嵌入负载以检索证明,实现公开信息验证。输出为拼接感知的时间线,指示各区域通过哪一层级及失败原因。
论文描述了实验目标和设置:针对极低假阳性率进行评估,测试在重采样、带通滤波和加性噪声下的鲁棒性,并考虑神经编解码器作为主要压力因素。实验使用非重叠分块(L=S=2.0秒),指纹选项包括基于MFCC的严格指纹和SSL嵌入二值化,以实现不同鲁棒性-完整性权衡。实验目标旨在验证本地化拼接和鲁棒性类别。
该研究提出了一种实用的语音起源验证系统,巧妙结合稳健水印和加密证明,适用于真实分布变换场景,为分块处理和第三方验证提供了创新解决方案。
表达性语音合成需要生动的韵律和时机正确的停顿,但当前文本转语音(TTS)模型在处理长音频时面临挑战,特别是训练数据稀缺(如儿童故事书数据集较小),导致自然性和表达性不足。
在Blizzard Challenge 2017数据集上评估,与使用连续两句子音频训练的基线模型相比,提出的方法在主观评估中自然性和风格适用性得分更高,且合成的语音在句子间停顿分布上更接近真实语音。数据统计显示,增强后训练数据量增加,提升了模型性能。
该方法通过创新的数据增强和对比训练策略,显著增强了儿童故事语音合成的表达性和自然性,为资源有限的表达性TTS提供了有效解决方案。
当前音乐生成模型依赖解耦表示(如结构和音色)来实现可控生成,但这些表示的真实语义和属性未充分探索,导致可控性不确定,实际嵌入可能与预期分离不一致。
论文提出并适配了一个基于探针(probing)的评估框架,扩展自synesis框架,用于系统评估解耦表示的四个关键轴:信息性(informativeness)、等变性(equivariance)、不变性(invariance)和解耦性(disentanglement)。该方法应用于音乐音频,比较了多种无监督解耦模型(SS-VQ-VAE、TS-DSAE、AFTER),并隔离了特定策略(如数据增强和对抗性目标)以分析其影响。
评估揭示了模型表示之间存在高互信息,解耦不彻底,例如在音色和结构嵌入中观察到信息重叠。结果表明当前无监督策略未能产生真正解耦的表示,挑战了可控音乐生成的现有方法,并提示需重新定义可控性。
这项研究系统性地评估了解耦表示,揭示了当前方法的局限性,为可控音乐生成的未来工作提供了重要洞察和框架基础。
传统语音交互系统依赖级联架构(如ASR、LLM、TTS),存在信息丢失和错误传播问题;现有端到端大音频语言模型(LALMs)如Qwen2.5-Omni使用Thinker-Talker架构,牺牲了端到端语音指令跟随能力和直接对话可控性;此外,智能-说话者耦合问题导致数据准备困难和语音定制灵活性受限,而全双工交互在序列生成范式中更具挑战性。
提出Covo-Audio,一个7B参数的端到端LALM,直接处理连续音频输入并生成音频输出。采用分层三模态语音-文本交错框架,集成连续声学特征、离散语音token和自然语言文本,实现跨模态深度对齐和融合。引入智能-说话者解耦技术,通过多说话者训练和上下文适应,分离对话智能和语音渲染,支持高效语音定制。发展Covo-Audio-Chat-FD变体,通过预训练阶段纳入全双工交互,实现低延迟、流暢的全双工语音交互能力。
在广泛的语音和音频任务上进行评估,包括语音-文本建模、语音理解、音频理解、半双工和全双工语音对话。结果表明,Covo-Audio在可比规模模型中达到最先进或竞争性能,例如在多个基准测试上优于开源模型,并匹配更大系统在关键指标上的表现。具体地,在语音理解和全双工交互任务中表现突出。
Covo-Audio通过创新的架构设计、多阶段训练策略和智能解耦技术,有效解决了音频语言模型中的核心问题,展示了紧凑模型在集成复杂音频智能与高层次语义推理方面的强大潜力,为高效部署提供实用路径。
现有声学格林函数计算方法在矩形房间中主要适用于完全反射(硬墙)边界条件,对于具有一般表面阻抗(特别是软墙或显著吸收)的墙壁,当前分析方法存在不足,如传统数值方法(如有限元法、边界元法)收敛慢或计算成本高,且特征函数展开方法缺乏闭式解和高效算法。
本文扩展了先前研究,引入额外的一阶渐近近似(包括硬墙、软墙和不对称墙等情况),以处理任意阻抗值。提出了一种半解析、高效、可靠的方法,通过特征函数展开来计算格林函数,并讨论了谱基的正交性和完备性,提供了一个通用框架。该方法基于特征值问题的分析,并利用分离变量简化了矩形房间的求解。
通过数值测试进行了验证,表明在足够高的截断阶数下,计算误差可忽略不计,使得该方法适合作为数值模拟的基准。摘要中提到方法可靠且准确,但具体实验细节在截断内容中未完整展示。
本文提供了一种更通用的格林函数计算方法,扩展了声学建模的范围,使其适用于各种表面阻抗条件,具有实际应用价值。
Real-time voice conversion (VC) and speaker anonymization (SA) systems commonly use static global embeddings for speaker identity, which creates a mismatch with the time-varying nature of speech content. This dynamic-static discrepancy leads to reduced expressivity, over-smoothed timbre, and challenges in balancing privacy (anonymization) with speech quality and naturalness, especially under strict streaming latency constraints.
TVTSyn introduces a content-synchronous, time-varying timbre (TVT) representation to address this mismatch. Key innovations include: - Global Timbre Memory (GTM): Expands a global timbre seed into multiple compact facets, allowing frame-level content to attend and retrieve relevant facets over time. - Factorized Vector-Quantized (VQ) Bottleneck: Regularizes content features to reduce residual speaker leakage while preserving linguistic information. - Spherical Interpolation and Gating: Enables smooth local variations in timbre while maintaining identity geometry, controlled via a learned gate. - Streamable Architecture: The system is designed for causal, low-latency synthesis with minimal future access in the encoder and fully causal decoding.
TVTSyn provides an efficient and scalable solution for privacy-preserving speech synthesis, effectively bridging the gap between content and identity conditioning in streaming VC and SA tasks.
环境声音分类(ESC)面临挑战,因为环境声音在时域和频域特性上变化显著,导致分类困难。传统方法如基于手工特征的机器学习(如MFCCs、Spectral Contrast)缺乏对噪声的鲁棒性和泛化能力。深度学习方法中,卷积神经网络(CNNs)难以捕捉音频序列中的长距离依赖关系,而基于Transformer的模型如音频谱图变换器(AST)虽然性能优异,但依赖大规模预训练数据和大量计算资源,不适用于资源受限或数据有限的场景。
本研究提出使用堆叠特征技术来增强CNNs的性能。通过聚合多种互补的声学特征,包括Log-Mel Spectrogram (LM)、Spectral Contrast (SPC)、Chroma (CH)、Tonnetz (TZ)、Mel-Frequency Cepstral Coefficients (MFCCs)和Gammatone Cepstral Coefficients (GTCC),形成丰富的多通道输入表示。特征被统一调整为128×128尺寸并沿通道轴堆叠,创建图像状结构供CNNs处理。实验比较了两种CNN架构:基线CNN(CNN-1)和增强版CNN(CNN-2,带批量归一化和dropout),并与预训练在AudioSet等大规模数据集上的AST模型进行对比。研究在ESC-50和UrbanSound8K数据集上进行,包括不同训练制度如预训练和微调。
结果表明,特征堆叠的CNNs在计算和数据效率上优于AST模型,特别是在缺乏大规模预训练或大量训练数据的情况下。这使得它们成为资源受限和边缘级声音分类场景的理想选择。实验设计分析了在不同训练数据和预训练多样性下,特征堆叠CNNs与Transformer模型的比较,突出了堆叠特征在提高分类准确性和泛化能力方面的有效性。
该研究表明特征堆叠的CNNs是环境声音分类中一种高效且实用的替代方案,尤其适用于计算和资源受限的应用。
Gencho 是一个创新的生成式方法,通过扩散变换器和结构感知编码器,显著提升了盲 RIR 估计的多样性、真实性和应用范围。
处理混合的心呼吸信号(如心脏和肺部声音)在智能医疗诊断中具有挑战性,需要高效的盲源分离、聚类和异常检测方法来提高分析准确性和可解释性。现有方法可能面临信号重叠、噪声干扰和缺乏可解释性等问题。
该论文通过整合生成AI、物理启发算法和量子机器学习,为心呼吸信号处理提供了创新解决方案,展示了在推动智能医疗诊断系统方面的潜力。
长视频音轨合成面临三大关键挑战:计算可扩展性差,由于密集帧级注意力在长序列中导致二次内存成本高和注意力稀释;时间一致性不足,标准自回归模型缺乏全局语义锚点,引发风格漂移;语义盲点,现有方法依赖表面视觉表征,无法捕捉深层叙事逻辑如情感弧(如紧张上升或解决)。
提出NarraScore分层框架,核心洞察是将情感视为叙事逻辑的高密度压缩。创新点包括:使用冻结Vision-Language Models (VLMs)作为连续情感传感器,从高维视频流中提取密集、叙事感知的Valence-Arousal轨迹;采用Dual-Branch Injection策略,通过全局语义锚点确保风格稳定性和局部Token-Level Affective Adapter(通过直接元素级残差注入)调节精细叙事紧张度,实现参数高效的动态控制。
实验证明NarraScore在一致性和叙事对齐方面达到最先进水平,计算开销可忽略,有效减轻数据稀缺导致的过拟合风险,为长视频音轨生成建立全自动范式。
NarraScore通过分层情感控制,成功弥合视觉叙事与音乐动态之间的语义鸿沟,推动了高质量、自主化视频音轨生成的进展。
自动语音识别(ASR)模型通常基于短序列(少于30秒)训练,假设语音片段独立同分布,这导致在处理长格式音频(如会议、讲座)时需要分段,可能引入错误和信息丢失,限制了上下文信息的利用。
本研究提出系统方法处理超长上下文ASR: - 采用FastConformer架构结合连接主义时序分类(CTC)损失,提高效率和内存使用。 - 集成Flash Attention算法,优化自注意力的计算,支持长达一小时的序列处理。 - 引入序列长度热身策略,从短序列开始训练并逐步加长,以稳定收敛。 - 对比多种位置编码方法(如正弦编码、旋转位置编码),探索其对长序列性能的影响。
实验基于大规模数据训练ASR模型,序列长度从10秒到1小时不等: - 性能改善在上下文长度达到21.8分钟时最优,相对短上下文基线提升14.2%;更长序列无额外收益,趋于平稳。 - 位置编码方案和模型宽度/深度是影响长序列利用的关键因素;增加参数或训练轮次提升总体性能,但不改善长上下文相对利用。 - 长上下文在训练与测试领域差异大时最有益;对噪声数据表现更稳健。 - 合成评估显示模型利用上下文的语言和声学信息,但语言理解相对简单。
这项研究通过全面实验揭示了长上下文ASR的潜力和限制,为架构设计和实践应用提供了重要指导,推动了领域发展。
自监督学习(SSL)模型(如 wav2vec 2.0)在语音处理中表现出色,但其自注意力机制导致二次计算复杂度(O(n²)),训练计算量大。现有线性时间替代方案 SummaryMixing(SM)虽然效率高,但仅使用全局平均摘要,缺乏局部上下文,限制了精细时间建模能力,这在低资源语音识别中尤为重要。
本文提出 Windowed SummaryMixing(WSM),扩展 SM 通过加入局部邻域摘要(基于窗口的均值计算),以增强局部上下文捕获,同时保持线性时间复杂度(O(n))。此外,引入选择性微调策略:在 SSL 模型中,用 WSM 块替换选定的自注意力层(如最后两层),并仅微调这些新块,而不是更新整个模型。这减少了计算、内存和延迟,适合低资源设置。
在多个低资源数据集(如 Kathbath Hindi、Mexican Spanish、SBCSAE 等)上评估,使用多种 SSL 模型(如 wav2vec 2.0、XLS-R)。结果显示: - WSM 在多数情况下优于或匹配基线(如 SM 和原始注意力),降低词错误率(WER)。例如,在 Hindi 数据集上,WSM 将 WER 从 18.20(SM)降至 17.03(表1)。 - 选择性微调(仅替换最后两层)提供最佳性能与效率平衡,同时减少峰值 VRAM 使用达 40%。 - WSM 在保持线性复杂度的同时,改善了时间依赖性。
WSM 是一种高效方法,通过增强局部上下文和选择性微调,显著提高了 SSL 模型在低资源语音识别中的性能,同时降低资源消耗。
音乐源分离(MSS)模型通常假设混合物是干净源的线性组合,忽略了真实世界中的信号退化(如噪声、混响、编解码失真),导致学术研究与实际音频工程应用之间存在差距。音乐源恢复(MSR)任务旨在解决这一问题,通过分离并恢复乐器信号到未处理状态,以支持专业混音和历史录音增强等应用。
提出顺序BS-RoFormer框架,将MSR任务分解为三个专用模块:去噪、音乐源分离和去混响。具体创新包括: - 使用预训练的BS-Rofo-SW模型进行六种乐器分离,并微调模型处理更细的八种乐器类别(如将“其他”输出分解为合成器、鼓、打击乐和管弦乐元素)。 - 采用训练策略:数据清洗与混合(结合RawStems和MoisesDB数据集)、随机混合增强(合成不同歌曲的混合物以增加数据多样性)、音频长度扩展(扩展训练段至最长10秒以增强长上下文建模)。 - 系统架构中,去噪模块先处理输入以移除宽带噪声,分离模块基于冻结预训练模型和微调模型,去混响模块仅应用于人声以防止去除乐器音色中的混响效果。
在MSR挑战2025中,该系统排名第一,在所有评估指标中表现最佳: - 客观指标:MMSNR得分为4.4623,Zimt为0.0137,FAD为0.1988。 - 主观指标(平均意见分数MOS):分离分数4.2358,恢复分数3.3892,整体分数3.4665。 - 通过配置实验(Baseline、Large、Large+Random)优化训练策略,基于FAD指标选择最佳配置。
该系统通过创新的顺序框架和高效训练策略,在复杂音乐源恢复任务中实现了最佳性能,突显了模块化设计和数据增强在音频处理中的重要性,并指出未来挑战可简化乐器数量以更专注于恢复质量。
流匹配模型在文本到语音合成中能产生高质量输出,但其推理时的迭代采样过程导致计算成本高、延迟大,限制了实时应用。现有蒸馏方法如一致性模型和MeanFlow存在训练不稳定、过程方差、端点误差积累或计算开销大等问题。此外,直接重用连续时间架构用于离散步生成导致参数效率低下。
DSFlow是一种模块化蒸馏框架,提出以下创新: - 双监督策略:结合端点匹配损失和确定性平均速度对齐损失,提供互补学习信号,提高训练稳定性和收敛性。 - 步感知令牌:用轻量级离散令牌替换连续时间嵌入,大幅减少时间调节路径的参数,并适应少步推理的离散步空间。 - JVP-free 平均速度计算:基于MeanFlow的平均速度公式,开发无雅可比向量积的实现,保留轨迹级监督,避免计算开销。
实验表明,在多种基于流的文本到语音架构上,DSFlow在少步(如1、2、4步)和一步合成中一致优于标准蒸馏方法,达到教师级质量,同时减少了模型参数和推理成本,实现高效实时合成。
DSFlow通过双监督和步感知架构,有效解决流匹配模型的推理效率瓶颈,在保持高质量的同时,实现了一步语音合成的实用化部署。
Joint Embedding Predictive Architectures (JEPA) 在自监督语音表示学习中遭受严重的表示崩溃(representation collapse),导致编码器丢弃语音区别,下游任务表现接近随机。现有方法如 HuBERT 和 WavLM 依赖迭代离线聚类(如 k-means),需要多次重新训练,增加计算成本,并使用硬分配忽略声学边界的不确定性。
提出 GMM-Anchored JEPA: - 使用冻结的高斯混合模型(GMM)一次性在 log-mel 谱图上拟合,生成软后验作为辅助目标,避免迭代重新聚类。 - 结合衰减监督计划:总损失包括 JEPA 损失和聚类损失,权重 λ 从 1.0 线性衰减到 0.01,使 GMM 监督主导早期训练以稳定表示,后逐渐过渡到 JEPA 目标,同时保留残差锚定防止漂移。 - 软聚类保留声学边界的不确定性,提供更丰富的监督信号,并适用于不同编码器架构(如 Conformer 和 Transformer)。
该方法通过一次性软聚类和衰减监督,有效避免迭代计算并稳定 JEPA 训练,在多个下游任务上实现性能提升,为自监督语音表示学习提供高效替代方案。
主观评分含有固有噪声,限制了模型与人类相关性,但现有可靠性度量如Pearson's correlation ratio、ICC(Intraclass Correlation)、Cronbach's alpha在异方差噪声场景下存在局限性(如假设同方差噪声或难以解释模型性能),导致模型性能评估可能误导,无法区分模型限制与数据质量问题。
提出ρ-Perfect,一个实用估计方法,用于量化主观评价数据集最高可达相关性上限。它基于完美预测器(定义为条件期望E[Y|X])与平均评分的Pearson相关系数,通过方差分解在异方差噪声下计算,仅需单个评估的评分分布(无需重复评估)。ρ-Perfect平方近似于两个独立主观评估间的测试-重测相关性,提供了理论验证和实证支持。
在多个数据集(BVCC、MovieLens、SOMOS、MERP)上验证,使用分裂评分方法(Split-Raters和Split-Ratings)模拟重复评估。结果显示ρ-Perfect平方与实测相关性匹配(如BVCC中ρ-Perfect²≈0.800 vs. Corr≈0.801),有效估计了可靠性上限。比较现有度量时,ρ-Perfect更适应不平衡数据集(如MovieLens),而ICC(2, k)可能高估可靠性。实验证实ρ-Perfect能区分模型性能限制与数据质量不佳情况。
ρ-Perfect为AI模型在主观评估数据集上的性能提供了可靠的量化上界,通过量化评分噪声,有助于更准确地评估模型并区分其局限性与数据固有噪声。
Existing methods for sound source tracking face significant challenges: classical array-processing algorithms (e.g., MUSIC, ESPRIT, SRP) require grid searches, precise calibration, and are sensitive to initialization. Supervised learning approaches (e.g., Cross3D, Neural-SRP) rely on costly ground truth position labels, which are difficult to obtain and hinder on-device training. Prior unsupervised methods are either not fully unsupervised, rely on multi-modal data, or suffer from high computational complexity and parameter counts, making them impractical for audio devices.
The paper proposes a physics-guided variational model for unsupervised sound source tracking. It utilizes a variational autoencoder structure with a physics-based decoder. Key innovations include: - A variational encoder processes GCC-PHAT features and microphone array geometry to output parameters of a von Mises-Fisher distribution in latent space. - A physics-based decoder injects spatial information via backpropagation, enabling unsupervised estimation of source directions without labeled data. - The model is designed for single-source tracking but includes a theoretical extension to multi-source scenarios.
Experiments on real-world data demonstrate that the proposed method: - Achieves performance comparable to state-of-the-art supervised models (e.g., Cross3D, Neural-SRP). - Offers computational complexity similar to supervised approaches, making it feasible for practical applications. - Exhibits robustness to altered microphone array geometries and corrupted microphone position metadata during testing. - Generalizes well across different experimental setups, with results discussed in three main experiments.
This paper introduces an efficient and robust unsupervised method for sound source tracking that bridges the gap between classical and supervised approaches, offering practical potential for real-world audio systems.
传统自动语音识别(ASR)在噪声环境下性能严重下降,音频-视觉语音识别(AVSR)通过融合音频和视觉模态来提高鲁棒性,但现有融合机制往往次优、计算成本高,且跨模态交互不充分。
提出 CoBRA(Cross-modal Bottleneck for Robust AVSR),一种基于瓶颈的融合框架。在 Conformer 编码器上引入一组可学习的瓶颈令牌,通过调节信息流实现跨模态交换,避免直接注意力计算以减少开销。探索了 sequential 和 mean fusion 策略,并强调融合深度是关键因素,以 mid-level 融合效果最佳。
在 LRS2 和 LRS3 数据集上评估,CoBRA 在干净条件下达到词错误率(WER)1.6%(LRS3)和 2.8%(LRS2)。在噪声条件下,相比基线 CM-seq2seq,最大改进达 7.42% WER,在低信噪比(-7.5 dB)下对 babble 噪声相对改进 40.0%。模型使用仅 664 小时训练数据,表现竞争性,优于可比基线,展示了数据效率和噪声鲁棒性。
CoBRA 是一种高效、噪声鲁棒的 AVSR 方法,通过瓶颈融合平衡了计算成本和性能,为噪声环境下的语音识别提供了创新解决方案。
Current audio formats face fundamental trade-offs: lossless formats like FLAC preserve quality but lack adaptability for different playback environments, lossy formats reduce file size at the cost of fidelity and do not support stem-level access, and spatial audio formats like Dolby Atmos increase file size and licensing barriers. These limitations stem from storing audio as a fixed mix rather than composable elements.
The paper introduces the Stem-Native Codec (SNC), a novel audio container format that stores music as independently encoded stems (e.g., vocals, drums, bass) plus a low-energy mastering residual. Key innovations include: exploiting lower information entropy in separated stems for efficient compression, using Opus VBR encoding within a Matroska container, and incorporating metadata for spatial positioning and adaptive playback rules. This architecture enables bit-accurate reconstruction while reducing file size and supporting adaptive features like context-aware playback and user-controlled remixing.
SNC was validated on a 2:18 test track, achieving a 38.2% reduction in file size compared to FLAC (7.76 MB vs. 12.55 MB) while maintaining perceptual transparency (STOI = 0.996). The mastering residual had an RMS level of -29.97 dB, capturing only 6.4% of the original energy, and objective metrics like Spectral Convergence (0.0402) and SNR (24.86 dB) confirmed high fidelity. The stems-plus-residual approach successfully decouples compression efficiency from feature richness.
SNC offers a stem-native audio codec that effectively addresses the trade-off between file size and functionality, enabling efficient lossless storage and adaptive playback capabilities for next-generation audio systems.
传统目标说话人提取系统主要依赖预注册的干净语音作为线索来识别目标说话人,但在许多现实场景(如临时会议或语音助手交互)中,这种线索不可用,限制了现有方法的适用性。
提出DAE-TSE框架,首次使用关键词(部分转录)作为线索来指定目标说话人。它采用Detect-Attend-Extract范式:通过关键词引导的线索编码器(KCE)检测关键词存在并生成说话人嵌入,KCE结合自动语音识别和说话人验证的联合训练;然后使用Band-Split RNN作为语音提取骨干,从混合语音中提取目标语音。
实验表明,DAE-TSE在仅使用28.4%完整转录的情况下,优于依赖干净注册语音的标准TSE系统,并提供约100毫秒的关键词定位误差。
该工作创新性地利用部分转录作为TSE的线索,为现实场景提供了灵活实用的解决方案。
SoulX-Singer is a groundbreaking zero-shot singing voice synthesis system that combines large-scale data, dual-input control, and advanced modeling to deliver high-quality, flexible, and practical synthesis for real-world applications.
Audio大型语言模型(AudioLLMs)的发展受限于缺乏多样化、对话式和指令对齐的语音-文本数据,特别是在中东和北非(MENA)地区,方言多样性高,真实多说话者录音收集成本高且缓慢,这限制了模型在人物基础和方言覆盖方面的进步。
引入MENASpeechBank,一个参考语音库,包含约18K高质量语音从124个说话者,覆盖英语、现代标准阿拉伯语和地区阿拉伯语变体。开发了一个可控合成数据管道,包括:构建基于世界价值观调查的人物档案、定义约5K对话场景分类、通过语义相似度匹配人物和场景、使用LLM生成约417K角色扮演对话(用户作为人物,助手作为帮助代理),并合成用户回合以通过参考语音保留说话者身份和多样性。
论文提到评估了合成和人类录制的对话,并提供分析,但具体实验结果未在截取片段中详细展示。摘要中指出实验旨在评估合成数据对AudioLLM性能的影响,包括对话场景和口语问答任务。
这是一项数据为中心的研究,为AudioLLMs提供了关键的语音资源和端到端合成数据管道,有望推动模型在多样化和个性化语音交互中的应用。
传统TTS系统依赖高质量录音室数据(如LibriTTS、MLS),难以处理野外自发语音,面临环境噪声、转录错误、韵律多样性(如犹豫、填充词)和时长建模困难等挑战。
该研究通过结合语音增强、非自回归架构和精细的推理参数优化,有效提升了零样本TTS在野外语音场景下的性能,为现实语音生成提供了实用方案。
音频深度伪造检测(ADD)现有方法主要依赖局部或成对特征交互,忽略了高阶交互(HOIs),导致难以捕捉合成音频中跨多个声学维度的协同伪影,限制了检测的泛化能力。
提出HyperPotter,一种基于超图的框架,通过聚类超边和类感知原型初始化,显式建模高阶协同交互。关键组件包括关系伪影放大模块和原型导向的超边初始化机制,以增强信息性协同伪影并高效构建关系。
在11个数据集上平均相对增益22.15%,优于基线;在4个跨域挑战数据集上超越最先进方法13.96%,显示出对多样化攻击和说话者的优越泛化性能。
该研究首次从信息论角度探讨音频深度伪造检测中的高阶效应,通过超图建模协同交互,显著提升了检测的泛化能力。
传统神经声码器(如WaveFit)在从自监督学习(SSL)特征生成高质量语音波形时面临两大挑战:1)由于SSL特征缺乏信号处理知识,无法使用手工设计的先验噪声采样方法,只能从高斯噪声开始推理;2)无法利用梅尔频谱图的能量信息进行显式增益调整,模型需要隐式学习能量预测,增加了训练难度。
WaveTrainerFit在WaveFit基础上引入两大关键改进:
可训练先验:通过变分自编码器(VAE)学习目标语音的分布,使推理过程从接近目标语音的噪声开始,而非高斯噪声,从而减少推理步数。
参考感知增益调整:对可训练先验施加约束,使其学习语音能量,从而进行显式增益调整,解放声码器隐式能量预测的任务,让模型更专注于波形建模的关键方面。
WaveTrainerFit通过引入可训练先验和参考感知增益调整,显著提升了从SSL特征生成语音的质量和效率,为数据驱动特征的声码器设计提供了新思路。
外部声场插值是一个具有挑战性的问题,传统方法通常需要特定的麦克风阵列配置和先验的源条件知识。现有方法如球面波函数展开对正则化和麦克风分布敏感,而基于神经网络的物理信息模型在训练时可能因源点发散而困难。
本文提出了一种基于高斯过程回归的插值方法,使用具有可训练内积公式的点源再生核来拟合外部声场。该方法的关键创新在于: 1. 定义了一个基于加权内积的再生核希尔伯特空间,使用参数化权重函数自动衰减高阶谐波分量 2. 核函数基于非齐次亥姆霍兹方程的外部波函数解,默认满足物理约束 3. 允许使用任意分布的麦克风阵列,不依赖于特定的阵列配置
在数值模拟实验中,将提出的方法与传统的球面波函数展开方法和已建立的物理信息机器学习模型(点神经元网络)进行比较: 1. 在100 Hz至2.5 kHz的分析频率范围内,平均插值误差降低约2 dB 2. 在目标区域内更一致地重建真实声场 3. 在球形阵列分布和完全随机分布两种情况下均表现出优越性能
本文提出的物理约束核方法为外部声场估计提供了一种灵活且准确的新框架,突破了传统方法对麦克风阵列配置的限制。
ARCHI-TTS通过创新的语义对齐器和高效推理设计,在保持高质量语音合成的同时,显著提升了计算效率,为零样本TTS提供了实用且可扩展的解决方案。
论文针对分布式多输入多输出(D-MIMO)网络中仅使用载波相位进行高精度定位时面临的挑战: 1. 相位同步误差:分布式天线点(AP)之间的相位同步误差会显著降低定位性能。 2. 计算复杂度:传统方法在估计所有可能的整数模糊度时计算开销大,难以满足下一代无线网络对低延迟的要求。 3. 相位敏感性:仅依赖相位测量时,系统对硬件损伤和环境噪声高度敏感。
论文提出了一种基于深度学习的相位仅定位框架,主要包括两个核心部分: 1. 双曲线交点定位方法: - 使用差分相位测量,通过超几何关系确定用户设备(UE)位置。 - 包含差分模糊度估计器(基于多层感知机MLP)和梯度下降(GD)求解器。 2. 基于深度学习的AP选择方法: - 设计神经网络(NN)动态选择最优的AP对(仅估计两个模糊度),以最大化定位精度。 - 特征工程:结合测量特征(如差分相位、信噪比SNR)和几何特征(如AP间距离、角度关系)。 - 网络结构:输入层(8I维)、5个隐藏层(ReLU激活)、输出层(线性激活,预测所有可能AP对的定位误差)。
该研究通过深度学习驱动的AP选择策略,有效解决了D-MIMO网络中相位仅定位的同步误差和计算效率问题,为6G高精度低延迟定位提供了实用化方案。
当前语音对话系统(SDS)的安全评估主要依赖文本中心方法,忽略了音频特有的副语言线索(如语调、强调)和转录错误,且缺乏针对多轮口语对话的结构化安全评估资源。
该研究填补了多轮口语对话安全评估的空白,通过受控基准揭示了LALM作为安全法官的架构-模态权衡,为实践者提供了基于转录质量和声学环境的配置指导。
自动语音识别(ASR)在对话语音中面临挑战,主要由于大规模、标注良好的多说话人对话数据稀缺,尤其是在低资源语言(如匈牙利语)中。现有方法如简单拼接增强缺乏真实对话的动态时序特性,导致ASR模型在真实多说话人对话中泛化能力差。
该研究成功将说话人感知的对话模拟框架扩展到匈牙利语,并通过C-SASC进一步优化时序建模,为低资源语言的对话ASR提供了有效的数据增强策略,同时强调了时序细节建模的益处与局限性。
预训练的自动语音识别(ASR)和语音增强(SE)模型在匹配的噪声和信道条件下表现优异,但在面对域偏移(特别是未见过的噪声和信道失真)时性能严重下降。现有方法通常独立处理噪声或信道失真,缺乏统一框架,且依赖大量标注数据或复杂训练流程,限制了实际应用的可扩展性。
提出URSA-GAN(Universal Robust Speech Adaptation Generative Adversarial Network),一个统一的、域感知的生成框架,旨在同时缓解噪声和信道条件的不匹配。关键创新包括: 1. 双嵌入架构:包含噪声编码器和信道编码器,分别预训练以捕获域相关表示,这些嵌入用于条件化GAN生成器,合成在声学上与目标域对齐的语音,同时保留语音内容。 2. 动态随机扰动:一种新颖的正则化技术,在生成过程中向嵌入引入受控变异性,提升对未见域的鲁棒性。 3. 两阶段训练流程:第一阶段训练编码器提取噪声和信道嵌入;第二阶段使用这些嵌入指导生成器合成目标域语音,判别器确保生成语音的真实性。
在多样噪声和信道不匹配场景下评估: - ASR任务:在跨域信道条件下,URSA-GAN有效降低字符错误率(CER)。 - SE任务:在噪声语音场景中,改善感知指标。 - 混合评估:在结合噪声和信道退化的复合测试条件下,URSA-GAN展现出泛化能力,ASR性能相对提升16.16%,SE指标相对提升15.58%。
URSA-GAN通过统一处理噪声和信道失真,以数据高效的方式显著提升了ASR和SE系统在复杂真实场景中的鲁棒性和泛化能力。
基于离散化语音表示(如语义或语音学标记)的自动语音识别(ASR)系统,虽然具有高效性,但在环境噪声下性能会显著下降,噪声鲁棒性尚未得到充分研究。现有研究主要集中在基于连续特征(如FBANK或SSL特征)的ASR系统上,而针对标记ASR的前端增强策略仍存在空白。
本文首次系统性地提出了四种前端增强模型,根据输入/输出表示进行分类: 1. Wave-to-Wave (W2W-E):传统语音增强,将噪声波形转换为增强波形。 2. Token-to-Token (T2T-E):直接从噪声标记映射到增强标记。 3. Vector-to-Token (V2T-E):使用SSL模型的加权和特征作为输入,输出增强标记。 4. Wave-to-Token (W2T-E):直接以噪声波形为输入,输出增强标记,简化系统结构。
这些模型独立于ASR后端训练,具有模块化优势。W2T-E方法通过微调整个SSL模型(使用CTC损失)实现,尽管训练成本较高,但推理成本最低。
在CHiME-4数据集上的实验表明: - W2T-E增强前端在标记ASR中表现最佳,在大多数情况下甚至优于基于连续SSL特征的ASR系统。 - 标记级准确率(如UED)与ASR准确率(WER)并不总是正相关,表明仅优化标记级指标可能不足以预测识别性能。 - 实验还比较了不同tokenization模型(如MLP、E-Branchformer、TCN)在V2T-E中的效果。
本文通过系统性的前端增强策略,显著提升了基于标记的ASR在噪声环境下的鲁棒性,为高效且鲁棒的语音处理系统提供了重要基础。
语言引导的音频-视觉分割(Ref-AVS)任务旨在通过联合推理视频、音频和文本来分割自然语言描述的目标对象。现有研究主要关注生成分割掩码,并通过与真实掩码计算IoU来评估模型性能。然而,在实际部署中,真实掩码往往不可用(即无参考),导致无法自动评估掩码质量。现有数据集和模型缺乏对掩码质量评估的显式建模或自动化支持,这限制了分割系统的可靠性和可解释性。
提出新任务MQA-RefAVS:在Ref-AVS背景下引入掩码质量评估任务,要求在不依赖真实掩码的情况下,自动评估候选分割掩码的质量。具体包括:估计掩码与未观察到的真实掩码的IoU、识别错误类型(如完美、完全错误、内部切割、膨胀、侵蚀、合并)、推荐质量控制操作(如接受、小修、大修、拒绝)。
构建基准数据集MQ-RAVSBench:基于Ref-AVSBench数据集构建,包含1,840个视频、2,046个参考文本,生成26,061个掩码实例。每个掩码涵盖六种代表性错误模式,模拟真实质量变化,从完全准确到几何缺陷和语义错误。数据集分为训练集和测试集,测试集进一步分为Seen和Unseen子集以评估泛化能力。
提出模型MQ-Auditor:基于多模态大语言模型(MLLM)的审计器,通过监督指令调优训练,显式推理音频、视觉、语言和掩码信息。MQ-Auditor在推理时不需真实掩码,可直接估计IoU和评估质量,支持下游分割改进。
在MQ-RAVSBench上的广泛实验表明,掩码质量评估在Ref-AVS设置中具有挑战性,现有开源和商业MLLMs(如Gemini-3-Flash)表现不佳。相比之下,MQ-Auditor能提供更准确和可靠的评估。此外,MQ-Auditor可与现有Ref-AVS模型(如TGS-Agent)集成,有效检测分割失败并提升分割性能。
该研究填补了Ref-AVS中掩码质量评估的空白,通过新任务、基准数据集和高效模型,提升了分割系统的可解释性和实用性,为多模态分割的可靠部署提供了重要支持。
现有音频-视觉视频高光检测模型通常未充分利用音频模态,主要依赖预训练模型提取的高层语义特征,而忽略了声音丰富的频谱-时间动态特性。这导致模型无法有效捕捉音频中的瞬态声学事件(如突然的声音变化),而这些事件往往是视频关键时刻的重要线索。
提出DA ViHD框架,核心是双通路音频编码器: 1. 语义通路:使用预训练的PANN模型处理原始音频波形,提取高层语义信息(如语音、音乐、特定声音事件) 2. 动态通路:处理对数梅尔频谱图,通过多分支架构捕获频谱-时间动态特性 - 使用时间注意力图和速度注意力图 - 引入显著性门控机制 - 采用频率动态卷积层,动态组合基础核的输出来形成自适应滤波器
音频特征融合采用早期自注意力策略,先对两个通路的特征分别进行自注意力处理,再通过元素级乘法融合,让动态特征调制语义特征以增强显著信息。
在Mr.HiSum大规模基准测试上取得了新的最先进性能,证明了双面音频表示对提升高光检测性能的关键作用。
该研究通过创新的双通路音频编码器设计,有效解决了现有模型对音频动态特性利用不足的问题,为音频-视觉视频高光检测领域提供了新的技术思路。
该研究首次系统地将测试时缩放技术引入音频语言模型的模糊情感识别领域,为构建更鲁棒、情境感知的情感智能系统奠定了重要基准。
印度农业咨询服务数字化面临自动语音识别(ASR)系统在农业领域多语言(特别是低资源语言)中准确转录的挑战,传统ASR评估框架无法有效处理农业术语错误带来的实际风险(如农药名称误识别可能导致作物损失)。
该研究通过引入领域特定评估指标和全面基准测试,为低资源农业ASR系统提供了实用的改进方向和基线标准。
视觉引导声学高亮任务旨在通过视频流指导,将不平衡的音频重新平衡,创造连贯的视听体验。现有方法主要基于判别模型,但音频混音存在固有的模糊性(如不平衡音频与平衡音频之间没有自然的一对一映射),导致模型难以处理这种多对多关系,常造成视觉和听觉焦点错位。
通过广泛的定量和定性评估,该方法在视觉引导音频混音任务上一致超越先前最先进的判别方法,验证了生成建模在此类问题中的优越性。实验使用Muddy Mix数据集,并采用四步流匹配(与推理步骤数一致),滚动损失通过端到端反向传播优化模型权重,而非仅输入。
该研究通过条件流匹配框架和滚动损失创新,有效解决了视觉引导声学高亮中音频混音的模糊性问题,实现了跨模态对齐的显著提升。
该论文提出了一种基于SVD的统一模态框架,有效解决了混合SMA-LMA阵列在稀疏声场重建中的挑战,通过数据驱动模态提升了空间分辨率和鲁棒性,为声场分析提供了理论依据。
本文针对克罗地亚语查卡维亚方言缺乏开放语音数据集的问题,指出当前语音技术主要关注资源丰富的标准语言,忽视了方言变体,尤其是在语音模态中。这限制了方言在人工智能研究和应用中的发展。
本研究通过创新性地构建和发布首个查卡维亚方言语音数据集,并成功微调ASR模型,显著提升了方言语音识别性能,为方言保护和人工智能应用提供了宝贵资源。
当前语音深度伪造检测(SDD)前端设计面临两大挑战: 1. 传统数字信号处理(DSP)方法(如MFCCs、LFCCs、CQCCs)虽然透明、计算高效,但难以捕捉高层次语义细节,导致性能不足。 2. 自监督学习(SSL)方法(如XLSR、HuBERT、MMS)性能优越但缺乏可解释性,可能忽略细粒度频谱异常,且计算成本高、可解释性差,这在音频取证等需要透明证据的领域尤为关键。
论文提出WST-X系列,首次将小波散射变换(WST)应用于语音深度伪造检测,结合了DSP的透明性和SSL的鲁棒性: - WST原理:通过小波模算子级联生成稳定、平移不变的表示,无需训练数据,具有清晰的物理解释(多尺度过程分析)。 - WST-X系列设计: - WST-X1(并行集成):结合1D WST(处理原始波形)和PT-XLSR(基于提示调优的XLSR模型),通过双分支架构融合特征。 - WST-X2(级联集成):先使用PT-XLSR提取SSL特征,再应用2D WST分析时间-特征平面中的结构异常。 - 参数优化:强调小平均尺度(J)、高频率分辨率(Q)和方向分辨率(L)对捕捉细微伪影的关键作用。
在Deepfake-Eval-2024数据集上评估,使用minDCF、EER、F1-score和AUC等指标: - WST-X表现:在多种参数设置下,WST-X系列显著优于现有前端(具体数据在截断部分未完整显示,但摘要指出“outperforms existing front-ends by a wide margin”)。 - 关键发现:小J值(如J=2)结合高Q和L值能有效捕获细微伪影,突显平移不变和形变稳定特征的价值。
WST-X系列通过小波散射变换桥接了传统DSP与SSL方法的优势,为语音深度伪造检测提供了高性能且可解释的新前端,有望推动音频取证领域的发展。
语音技术发展主要服务于高资源语言,导致撒哈拉以南非洲语言使用者面临显著的数字化鸿沟。该地区拥有超过2000种语言,但缺乏大规模、高质量、开放许可的语音语料库,阻碍了自动语音识别(ASR)和文本转语音(TTS)系统的开发。
WAXAL数据集通过大规模、多语言的语音资源,显著填补了非洲语言在语音技术领域的资源空白,为开发包容性技术和数字语言保护提供了重要基础。
当前吞咽困难(dysphagia)的诊断主要依赖侵入性方法(如FEES、VFSS)或放射成像,这些方法成本高、需要专业人员操作,且临床吞咽评估缺乏客观性和准确性,导致诊断敏感性和特异性有限。
本研究提出了一种自动化框架,利用便携式非侵入性颈部声学传感结合机器学习进行吞咽困难筛查。通过采集吞咽过程中的颈部声学信号,提取特征(包括频率、振幅、曲线下面积等),并采用随机森林分类器(RFC)进行异常检测。创新点包括:在FEES期间实时收集声学数据,使用超过600个吞咽事件进行模型训练,结合领域知识特征和预训练音频模型(如OPERA、OpenSMILE),并评估了固定参数和滑动窗口分割策略以模拟临床部署。
在患者级分割的测试中,异常检测任务(2类)的AUC-ROC达到0.904(使用领域知识特征),AUC-PRC为0.913,平衡准确率为0.755。分割和聚合分析显示,滑动窗口分割的AUC-ROC为0.893,固定参数分割为0.868,而人工分割的吞咽事件达到0.967。这些结果表明非侵入性声学传感在吞咽健康监测中具有可行性和高准确性。
该研究通过非侵入性声学传感和机器学习,为吞咽困难筛查提供了一种高效、可扩展的解决方案,有望改善临床诊断的客观性和可及性。
3D打印市场快速增长,预计2025年收入达150亿美元,但面临日益增多的网络安全威胁,特别是知识产权(IP)盗窃。攻击者可通过侧信道攻击(如声学侧信道)窃取设计文件,现有防御方法(如添加扬声器)成本高且不实用。
本文提出QuietPrint,一种无需额外硬件的保护方法,通过最小化修改G-code来混淆声学信息,防止攻击者从录音中重建打印模型。创新点包括:分析3D打印机声源(如步进电机和冷却风扇),评估各声源对重建的贡献,并提出防御机制。
实验使用Elegoo Neptune 3 FDM 3D打印机和Microsoft Surface Pro 7+内置麦克风进行数据采集。分析显示,仅通过风扇噪声的能量特征即可线性预测喷嘴位置(如从X=0 cm到18 cm的移动),攻击者可利用简单插值线准确推断位置。在CoreXY打印机中,攻击者可能使用两个录音设备确定性地重建喷嘴在X和Y轴的位置。
QuietPrint提供了一种低成本、无需硬件的声学侧信道防御方案,有效应对3D打印中的IP盗窃风险,具有实际应用潜力。
RIR-Former通过Transformer架构和创新的分段解码设计,实现了高效、通用的RIR重建,解决了现有方法在灵活性和泛化性方面的关键限制。
论文指出,时域传输线(TL)模型在模拟耳蜗基底膜(BM)位移时,通常基于一维(1-D)假设,忽略了耳蜗实际配置中的高维效应,如短波区域的压力聚焦和横向粘性阻尼。这些效应在频率域中更容易表达,但在时域实现中难以整合。具体地,1-D非线性TL模型假设增益和频率选择性紧密耦合,而小哺乳动物(如沙鼠)的耳蜗频率选择性对声级依赖性较弱,导致模型在模拟高压缩性时表现不足,缺乏约10 dB的压缩增益。
论文提出了一种时域短波导纳校正方法,以在TL模型中整合2-D效应。该方法基于Sisto等人的频率域2-D TL模型(S-2D模型),该模型包含压力聚焦和粘性阻尼效应。通过自回归滤波和回归技术,将压力聚焦因子(α)和粘性阻尼项引入到时域V-1D模型中,形成新的V*模型。校正因子通过反馈环路实现声级依赖性,从而在时域中模拟波长相关效应,解耦增益和频率选择性。
在针对沙鼠耳蜗生理学定制的TL模型中实施校正后,模型实现了增益和频率选择性的部分解耦,提供了额外的5 dB增益,并将压缩机制的声音范围扩展了10 dB。这解决了初始模型中压缩不足的问题,更准确地模拟了小哺乳动物的耳蜗响应。
该研究通过创新的时域校正方法,有效整合了2-D流体效应,提升了TL模型在小哺乳动物耳蜗模拟中的准确性和适用性。
自动说话人验证(ASV)系统在安全关键应用中广泛使用,但容易受到重放、文本到语音和语音转换等欺骗攻击的威胁。虽然专用的反欺骗(CM)系统可以检测欺骗语音,但它们不验证说话人身份,使得在对抗条件下,单独的ASV或CM系统不足。这促使了欺骗感知说话人验证(SASV)的发展,以联合处理说话人验证和欺骗检测。
本文提出了一种模块化的SASV框架,通过非线性融合、显式建模交互以及使用依赖于操作条件的可训练a-DCF损失进行优化,有效重用公开可用的ASV和CM系统。具体方法包括: - ASV分支:使用固定的ASV编码器(如ECAPA-TDNN或ReDimNet)提取说话人嵌入,通过加权余弦相似度计算说话人相似性,并进行仿射校准以生成适合融合的对数似然比(LLR)。 - CM分支:使用冻结的CM编码器(如SSL-AASIST)提取欺骗嵌入,与ASV测试嵌入拼接后通过MLP分类器生成CM分数,同样进行仿射校准。 - 分数融合:通过非线性分数级融合公式(公式1)结合校准后的ASV和CM LLR,其中参数控制说话人和欺骗证据的相对贡献,生成单一的SASV分数。 - 联合优化:所有可训练组件(嵌入重加权、校准层、CM分类器和融合模块)在SASV决策级别进行端到端优化,使用二进制交叉熵和a-DCF的加权组合作为损失函数。
在WildSpoof挑战赛数据集上评估,使用ECAPA-TDNN和ReDimNet作为ASV嵌入提取器,SSL-AASIST作为CM模型。关键结果包括: - 基线系统中,SKA-TDNN在开发集上表现最佳(a-DCF为0.3118)。 - 提出的SASV配置中,最佳性能通过结合预训练的ReDimNet ASV嵌入和微调的SSL-AASIST表示实现,在进展评估集上a-DCF为0.0515,在最终评估集上为0.2163。 - 微调SSL-AASIST组件显著提升了性能(例如,从0.1193降至0.0985)。 - 最终评估集性能较低,可能由于难度增加或未见条件,需进一步分析。
该研究通过模块化框架和联合优化,有效提升了SASV的鲁棒性,在WildSpoof挑战赛中展示了显著性能改进,但最终评估集表现暗示泛化挑战仍需解决。
HuPER通过模拟人类音素感知的自适应多路径机制,在数据效率和跨语言泛化方面取得了突破性进展,为音素级语音处理提供了新的研究方向。
提出PL-Distill框架,包含两个核心组件: 1. 投影层蒸馏(PDist):引入注意力加权中心核对齐(AwCKA),基于教师模型自注意力分数动态加权音频嵌入,突出情感关键时间步,并解决特征维度不匹配问题。 2. 逻辑层蒸馏(LDist):最小化教师和学生模型在音频和文本模态输出逻辑之间的KL散度,确保跨模态一致性。
学生模型架构:基于Qwen2-Audio教师模型(8.4B参数),压缩为1.1B参数学生模型(约13%大小),使用相同音频编码器(Whisper large v3)和轻量级LLM(Qwen2-0.5B)。
PL-Distill通过创新的注意力加权中心核对齐和双层级蒸馏策略,有效解决了大型音频-语言模型在资源受限环境中的部署难题,实现了高性能压缩,为语音情感识别的实际应用提供了可行方案。
传统监督式语音分离方法在噪声环境下缺乏灵活性,当声学环境变化时通常需要重新训练,性能容易下降。现有基于扩散模型的语音分离方法在背景噪声存在时研究较少,且现有逆采样方法(如DPS)因使用精确的SDE/ODE求解器而抑制了采样过程中的全局信号调整。
SSNAPS通过创新的扩散逆采样框架,在无监督条件下实现了多说话人语音与背景噪声的高效分离,在灵活性和性能方面均超越现有监督方法。
论文指出,自监督说话人嵌入(如SimCLR训练的嵌入)在说话人验证系统中广泛使用,但存在严重的人口统计信息泄露问题,包括性别、年龄和口音等敏感属性。这种泄露会引发公平性、隐私和伦理合规风险,可能导致跨人口统计群体的系统性偏见,或使攻击者能从看似匿名的嵌入中推断出受保护属性。
论文提出并比较了两种去偏策略: 1. 对抗性去偏:通过梯度反转层进行对抗训练,抑制嵌入中的人口统计信息。 2. 因果瓶颈架构:在表示管道末端引入因果瓶颈层,明确分离人口统计信息和残差信息,将人口统计属性建模为因果上游因素,限制其对学习表示的影响。
该研究揭示了自监督说话人嵌入中人口统计泄露的根本局限性,并阐明了当前去偏方法中固有的权衡,为公平和负责任的语音技术部署提供了重要见解。
传统信号处理(SP)教育依赖静态多媒体工具和预设计内容,缺乏实时交互和个性化学习体验,导致学生难以将抽象概念转化为实践,学习门槛高,参与度低。
本文提出SPEduAFM,一种基于音频基础模型(AFMs)的概念框架,将生成式AI(GenAI)集成到SP教育中。AFMs利用大规模预训练和Transformer架构,支持实时音频处理、多模态集成(如音频-文本)和自监督学习,无需大量标注数据。关键创新包括:通过AFMs实现自动讲座转录、交互式演示和包容性学习工具,将传统SP原则与GenAI驱动创新结合,降低编程要求,提升可访问性。
论文通过一个案例研究(DSP课程中的交互式听觉演示)展示AFMs如何提高理解和参与度。AFMs在任务如自动语音识别、文本到语音、音频合成和情感识别中表现出色,支持跨任务泛化。应用包括实时转录、多语言处理、情感识别和自适应教学,增强个性化学习和自动化评估。
该论文前瞻性地将音频基础模型引入信号处理教育,通过GenAI技术提升教学互动性和可及性,为工程教育创新提供了实用路线图,但需解决伦理和可解释性等挑战。
现有异常声音检测(ASD)生成模型存在以下主要问题: 1. 特征分布学习不完整:传统自编码器(AEs)和生成对抗网络(GANs)难以完全捕捉正常声音的复杂特征分布,导致对结构相似的异常声音重建误差不足 2. 训练不稳定:GANs存在模式崩溃风险,在复杂声学场景中应用受限 3. 模态单一:几乎所有现有模型仅使用梅尔频谱图作为输入,忽略了原始波形中的关键信息 4. 局部敏感性不足:现有模型倾向于捕捉全局宏观特征,对局部时频区域的弱瞬态变化不够敏感 5. 扩散模型的新挑战:去噪扩散概率模型(DDPMs)可能将异常特征视为噪声并去除,使异常检测复杂化
提出TLDiffGAN框架,包含以下核心创新:
TLDiffGAN通过创新性地融合潜在扩散模型与GAN框架,并整合多模态声学信息,有效解决了异常声音检测中特征学习不完整、训练不稳定和局部敏感性不足等核心问题,在检测性能和时频定位能力上均表现出色。
音频深度伪造检测面临挑战,因为现代TTS和语音转换系统生成的伪造音频越来越逼真,难以与真实语音区分。现有方法(如Sensitive Layer Selection, SLS)通常独立处理自监督学习模型(如XLS-R)的多层表示,忽略了时间动态和层级依赖关系,导致特征同质化和跨域泛化能力差。
论文提出HierCon,一种分层对比注意力框架,用于音频深度伪造检测。主要创新包括: 1. 分层注意力框架:通过三个阶段建模依赖关系: - 阶段1:时间注意力,在每个层内对时间帧应用可学习注意力,强调携带合成伪影的帧。 - 阶段2:组内注意力,将24个层分为8组(每组3层),在相邻层间建模局部依赖。 - 阶段3:组间注意力,跨层组聚合信息,整合不同抽象级别的证据。 2. 对比正则化:引入基于边界的对比学习,通过对比损失鼓励域不变嵌入,提高跨域鲁棒性。 3. 可解释性:注意力机制提供可视化,揭示哪些时间区域和层组对检测贡献最大。
在ASVspoof 2021 DF和In-the-Wild数据集上评估,HierCon实现了最先进的性能: - ASVspoof 2021 DF:EER为1.93%,相比独立层加权方法(如XLS-R + SLS的2.09%)相对提升36.6%。 - In-the-Wild:EER为6.87%,相比XLS-R + SLS的8.87%相对提升22.5%。 - 消融实验表明,分层注意力和对比学习均对性能提升有贡献,结合使用时效果最佳。
HierCon通过分层建模和对比学习,有效提升了音频深度伪造检测的准确性和跨域泛化能力,为自监督学习在安全领域的应用提供了新思路。
当前多模态大语言模型(MLLMs)在语音输入场景中存在系统性偏见问题,包括语言、口音、性别和选项顺序等维度。现有研究主要关注文本模态的偏见,而语音技术(如自动语音识别ASR)本身也存在跨人口统计和语言因素的性能差异,导致从文本到语音的转换可能放大现有偏见。
该研究首次建立了语音集成LLMs的公平性与鲁棒性统一评估框架,填补了文本与语音评估间的空白,为多语言语音技术的偏见检测提供了重要基准。
DAMA通过结构感知适应,在保持准确性的同时显著提升多语言ASR的效率和可扩展性,为低资源语言应用提供了有效解决方案。
传统情感识别方法主要依赖单模态数据(如文本或音频),难以捕捉人类情感表达中言语和非言语线索之间的微妙互动,例如语调与语义的矛盾或讽刺表达。这限制了系统在动态、上下文依赖的对话场景中的准确性和鲁棒性。
本文提出了一种轻量级多模态基线方法,结合了基于Transformer的文本分类器(如BERT变体)和自监督语音表示模型(如wav2vec 2.0),通过简单的后期融合集成策略整合文本和音频模态。该方法旨在提供一个透明、易于复现的参考实现,而非追求最先进性能,特别适用于SemEval-2024 Task 3数据集(基于《Friends》剧集构建)。
在有限的训练协议下(如超参数调优和评估受限),实验结果表明多模态融合相比单模态模型(仅文本或仅音频)能提升情感识别的准确性。研究强调了多模态方法在增强情感信号检测可解释性和效果方面的潜力,但结果应视为参考点而非最终基准。
本文提供了一个实用的多模态情感识别基线,通过简单集成文本和音频模型,在轻量级设置下验证了多模态融合的优势,为未来更严格的比较和领域应用奠定了基础。
房间脉冲响应(RIR)估计作为一类逆问题(如去噪、解卷积),传统方法面临两大挑战:1)监督学习方法需要大量配对训练数据,且泛化能力差,易受训练分布外数据影响;2)经典贝叶斯方法(如最大后验估计)仅提供单点估计,无法捕捉病态逆问题中的后验不确定性,且依赖手工设计的先验(如ℓ₂、ℓ₁正则化),表达能力有限。
本文提出RIR-Flow,一种免训练的贝叶斯框架,结合流匹配与解析维纳去噪器解决RIR逆问题。核心创新包括: 1. 解析先验推导:基于RIR的统计结构(建模为方差指数衰减的高斯过程),推导出闭式最小均方误差(MMSE)维纳去噪器,无需数据驱动的先验,提供可解释的解析先验。 2. 流匹配集成:将该解析去噪器作为先验集成到现有流基逆求解器(如FLOWER框架)中,通过引导后验采样解决逆问题,实现训练免指导。 3. 扩展非线性与非高斯问题:通过局部高斯近似引导后验,将方法扩展到非线性、非高斯逆问题(如去削波),保持高效推理。 4. 统一框架应用:覆盖去噪、ℓ₂和鲁棒解卷积、修复、去削波等多种RIR逆问题,实验显示在低信噪比下性能稳定提升。
在真实RIR数据上的实验表明: - 相比基线方法(如监督学习、经典正则化方法),RIR-Flow在多种逆问题中实现更稳定、改进的重建效果。 - 在低信噪比条件下表现鲁棒,凸显了经典RIR模型与现代流基生成推理结合的有效性。 - 通过局部高斯近似,方法在非线性、非高斯设置中仍保持实用性。
RIR-Flow通过解析先验与流匹配的巧妙结合,为RIR逆问题提供了一个免训练、可扩展且性能优越的贝叶斯解决方案,有效弥合了经典模型与生成式AI的鸿沟。
传统音频压缩方法(如基于信号处理的传统方法)和现代神经编解码器(如SoundStream、EnCodec、DAC等)主要设计用于波形重建,在超低比特率(如低于1kbps)下性能急剧下降,导致严重的声学伪影和语义失真,无法满足低带宽通信和生成式音频-语言建模等应用需求。
论文提出生成式音频压缩(Generative Audio Compression, GAC),这是一种从信号保真度转向任务导向有效性的范式转变。GAC基于AI Flow框架和信息容量定律(Law of Information Capacity),核心思想是“更多计算,更少带宽”。方法分为两个阶段: 1. 阶段1(速率最小化):在发送端通过语义理解提取紧凑的语义表示,使用信息瓶颈原则过滤比特级冗余,确保语义对齐。 2. 阶段2(信息恢复):在接收端利用大规模生成模型(1.8B参数)通过生成合成恢复高保真音频,使用整流流匹配解码器重建细节。
GAC通过将信息负担从通信信道转移到计算,实现了超低比特率下的高保真音频压缩,是生成式智能传输在听觉领域的创新应用。
XACLE挑战赛的目标是构建一个能够自动预测音频与文本对齐分数的模型,以替代人工主观评估。主要难点在于:1)音频-文本对齐任务缺乏大规模标注数据;2)需要模型能够准确理解音频语义内容并与文本描述进行匹配;3)现有方法(如CLAP)在音频-文本对齐任务上性能有限。
该研究通过创新的三阶段训练流程和LALM架构,有效解决了音频-文本对齐任务中数据稀缺问题,证明了伪标签预训练在音频语言模型中的关键作用,为多模态对齐任务提供了新思路。
现有语音分词器存在以下问题:1)自监督学习(SSL)分词器(如k-means聚类)能捕捉语音结构但丢弃了必要的韵律信息;2)神经音频编解码器(NACs)保留过多声学方差,导致下游模型需要学习复杂分布;3)混合编解码器虽结合两者优势,但依赖多层令牌结构,使下游使用复杂化;4)解耦编解码器常需辅助方法(如梯度反转、对比学习)来强制分离,且解耦效果不理想。
Kanade提出一种单层解耦语音分词器,主要创新点包括: - 架构设计:采用双分支结构,内容分支处理深层SSL特征(与语言内容相关),全局分支处理浅层SSL特征(与说话人特征相关)。 - 无辅助方法的解耦:仅通过信息瓶颈实现无监督解耦,无需梯度反转等复杂技术。 - 量化方式:使用无码本量化(FSQ),有效将内容量化为单层令牌。 - 训练策略:结合SSL特征重建损失(强调语音信息)和梅尔谱图重建损失(强调韵律信息),鼓励内容分支编码最大语言信息。 - 数据效率:仅需600小时数据和1.2亿未冻结参数训练。
Kanade通过简洁的单层架构,有效结合了SSL令牌的语言可用性和NAC令牌的生成质量,无需复杂下游架构,为语音语言建模提供了高效且高性能的分词解决方案。
当前基于扩散模型的语音增强方法存在两大问题:1)将语谱图视为普通2D图像进行均匀处理,忽略了音频固有的结构稀疏性,导致频谱表示效率低下;2)计算复杂度极高,限制了实际应用。
提出DVPD(Dual-View Predictive Diffusion)模型,通过双视角协同实现轻量级语音增强: 1. 训练阶段: - 频率自适应非均匀压缩(FANC)编码器:保留关键低频谐波,修剪高频冗余 - 轻量级图像化谱感知(LISA)模块:从视觉角度以最小开销捕获特征 2. 推理阶段: - 免训练无损提升(TLB)策略:利用双视角先验提升生成质量,无需额外微调 3. 架构特点:并行预测-扩散双分支结构,通过频率感知交互模块实现跨分支协同
DVPD通过创新的双视角协同设计,在显著降低计算成本的同时保持了卓越的语音增强性能,为生成式语音增强的效率-质量权衡设立了新基准。
传统基于文本的语音编辑方法面临两大核心挑战: 1. 内容-风格纠缠问题:现有方法主要在声学空间操作,导致内容修改时不可避免地影响声学风格,引发生成不稳定和边界伪影 2. 感知不连续性:编辑区域与原始上下文难以无缝融合,即使声学特征一致,仍可能出现韵律不匹配或语义不连贯
论文提出“编辑内容,保留声学”原则的框架,包含两大核心组件:
该研究通过创新的解耦架构和基于预训练TTS模型的强化学习对齐机制,为基于文本的语音编辑任务提供了系统性的解决方案,在保持声学一致性的同时实现了高质量的语义修改。
现代语音克隆(VC)技术虽然能通过少量参考音频合成与目标说话人高度相似的语音,但在实际部署中面临鲁棒性不足的问题。参考音频噪声、文本提示不完美、下游处理多样性等因素会显著影响性能,而现有研究缺乏对VC鲁棒性的系统性评估,尤其是在真实场景下的输入变化、生成挑战、输出后处理和对抗扰动等方面。
本文提出了RVCBench,首个全面评估现代VC系统鲁棒性的基准测试,覆盖整个生成流程。它包括四个鲁棒性维度:输入鲁棒性(如参考音频和文本提示的变化)、生成鲁棒性(如跨语言和长上下文合成)、输出鲁棒性(如后处理压缩和深度伪造检测)以及音频扰动鲁棒性(如被动噪声和主动防御扰动)。RVCBench包含10个任务,涉及225个说话人、14,370条话语和11个代表性VC模型,基于公开数据集构建,支持标准化评估。
评估揭示了VC的显著鲁棒性差距:在常见输入变化和后处理下性能急剧下降;长上下文和跨语言场景进一步暴露稳定性限制;被动噪声和主动扰动均影响生成鲁棒性。具体来说,输入变化会破坏内容一致性和保真度,生成瓶颈导致音色、情感和内容保存退化,后处理削弱输出质量,而扰动有效抑制说话人相似性和生成质量。
RVCBench为VC鲁棒性提供了首个系统性基准,揭示了当前模型在实际部署中的关键失败模式,推动了更鲁棒和可部署VC模型的发展。
现有音频深度伪造检测研究主要集中于单说话人场景,而多说话人对话环境中的深度伪造(如政治操纵、电信诈骗)已成为一个未充分探索的重大威胁,缺乏专门的数据集和检测方法。
基线模型提供了有用的基准,但结果表明,在多变对话动态下可靠检测合成语音方面存在显著差距,突显了多说话人深度伪造检测研究的不足。
该研究填补了多说话人对话音频深度伪造检测的空白,通过分类法和数据集为未来研究奠定了基础,但检测性能仍需提升以应对现实威胁。
VOXSERVE通过创新的模型抽象和流式优化,解决了SpeechLM服务中的架构多样性和流式性能挑战,为高效语音系统开发提供了统一平台。
论文指出,音频驱动说话头生成的主要挑战是实现唇部与音频的视听一致性(唇同步)。现有方法如Wav2Lip和AttnWav2Lip在生成高频细节时存在困难,因为音频和视觉特征的简单拼接无法学习音频内容信息与嘴部纹理信息之间的深层关联,且音频信息在解码器深度增加时逐渐减弱,导致音频编码器失效问题。
论文提出LPIPS-AttnWav2Lip方法,包含三个主要创新: 1. 生成器设计:采用基于残差结构的卷积块注意力模块(CBAM),增强对唇部区域信息的编码和解码关注,抑制无关信息影响。使用U-Net架构但减少编码器和解码器层数,以减轻音频信息影响减弱问题并降低训练难度。 2. 语义对齐模块:引入基于双分支结构的FFC层扩展网络感受野,获取视觉特征图的局部和全局上下文信息;使用自适应实例归一化(AdaIN)将视觉特征的统计信息与音频潜在向量对齐,增强唇部区域的音频驱动,不增加计算成本。 3. 损失函数:用LPIPS损失替代对抗损失,模拟人类对图像质量的判断,减少训练过程中的不稳定性和梯度消失/爆炸问题,为唇同步提供更好的训练环境。
论文通过主观和客观评估验证了方法的有效性: - 在唇同步准确性方面,使用LSE-C和LSE-D等指标进行评估。 - 在视觉质量方面,使用FID等指标进行评估。 - 结果表明,该方法在唇同步准确性和视觉质量上表现出色。
LPIPS-AttnWav2Lip通过引入语义对齐模块和LPIPS损失,有效解决了音频驱动说话头生成中的唇同步和图像质量问题,为任意说话者提供了通用的解决方案。
传统Ambisonics编码方法(如基于最小二乘的静态滤波器矩阵)在处理不规则麦克风阵列时存在局限性:低频能量损失或噪声放大、高频空间混叠导致的球谐模式失真。现有深度学习方法通常需要为每种阵列几何结构重新训练,缺乏泛化能力;而基于几何元数据的方法(如Gen-A)无法捕捉复杂的阵列传输函数(ATFs),如设备散射效应。
提出一种基于交叉注意力机制的深度神经网络模型,用于将任意麦克风阵列信号编码为Ambisonics格式。关键创新包括: 1. 输入扩展:同时处理音频信号(X)和复数方向性ATFs(H),取代仅依赖几何元数据的方法,能更准确表征真实阵列特性。 2. 双编码器架构:使用独立的信号编码器(Encsig)和方向性编码器(Encdir),分别提取特征。 3. 交叉注意力融合:通过多头注意力机制将信号特征与方向性特征动态结合,生成与阵列无关的潜在表示(Z_Attn),再解码为时频依赖的混合矩阵E。 4. 泛化能力:支持固定麦克风数量但任意ATFs(包括位置、指向性模式和设备散射)的未见阵列,无需重新训练。
在模拟数据上评估两个场景: 1. 移动电话阵列(复杂散射):所提方法在尺度不变信噪比(SI-SDR)上优于所有基线(静态编码、参数化DSP方法、Gen-A神经网络),并在所有Ambisonics指标上超越静态编码器。 2. 自由场条件:达到最佳SI-SDR,与现有神经方法性能相当,同时优于静态编码器。 分析表明,注意力权重有效利用了方向性元数据进行空间编码。
该研究通过结合阵列传输函数与交叉注意力机制,实现了对任意麦克风阵列的高效、泛化Ambisonics编码,显著提升了复杂散射环境下的空间音频质量。
本研究通过层感知早期融合方法,有效结合声学和语言嵌入,提升了认知状态分类性能,并揭示了中层编码器层在多模态协同中的关键作用,为临床语音分析提供了可解释的见解。
现有情感感知TTS系统(包括基于LLM的设计)通常依赖固定情感嵌入的缩放或外部引导,限制了其建模情感特定潜在特征的能力,导致情感表达的精确性和可控性不足。
提出EmoShift框架,核心是EmoSteer层,通过学习输出嵌入空间中每个目标情感的转向向量来捕捉其潜在偏移,实现精确、一致的情感控制。该方法仅需1000万可训练参数(不到全微调的1/30),具有轻量级、可解释、即插即用的特点,支持通过调整增益因子α实现情感强度的细粒度控制。
EmoShift通过轻量级激活转向机制,在保持TTS系统核心架构不变的情况下,实现了更精确、可控的情感表达,为情感感知语音合成提供了高效解决方案。
多说话人自动语音识别(ASR)在重叠语音和会话特定词汇场景下面临双重挑战:1)声学层面——目标说话人语音在重叠区域受到干扰,导致归属错误;2)语言层面——对领域特定词汇(如专有名词、术语)适应性不足,训练数据中稀疏或未见词汇导致识别错误。
提出CALM框架,联合上下文声学-语言建模,实现端到端的多说话人ASR个性化。核心创新包括: 1. 声学建模:使用ECAPA-TDNN提取说话人嵌入,通过FiLM调制Conformer编码器的中间和最终隐藏状态,实现目标说话人条件化。 2. 语言建模:采用基于动态词汇的上下文偏置,使用Transformer编码偏置列表,构建动态词汇表,通过加权softmax控制偏置权重,避免过/欠偏置。 3. 联合优化:结合CTC、注意力、interCTC和VAD多任务损失,实现声学与语言信息的深度融合。
在多个数据集上验证有效性: - LibriSpeech2Mix:B-WER从12.7降至4.7(A4方法,N=100×2) - CSJMix2:B-CER从16.6降至8.4(eval3) - LibriSpeech3Mix:在N=100×3时,WER从9.2降至8.4,B-WER从17.0降至6.9 - AMI语料库:在IHM-mix条件下验证标准化语音混合性能 实验表明,CALM在保持低U-WER/U-CER的同时,显著提升B-WER/B-CER,实现跨语言的稳健性能。
CALM通过端到端的声学-语言联合建模,有效解决了多说话人ASR中重叠语音和领域词汇的双重挑战,为个性化语音识别提供了可扩展的解决方案。
论文指出,尽管解码器专用大型语言模型(LLMs)在自动语音识别(ASR)中展现出潜力,但实现流式识别仍面临挑战。现有方法常依赖CTC或混合模型进行强制对齐,导致级联设计复杂,且固定音频块生成令牌的方法难以自适应最小化延迟。
提出一种流式LLM-ASR方法,核心创新包括: 1. 读/写策略网络:基于单调分块注意力(MoChA),动态分割语音嵌入,实现音频与文本的同步处理。 2. 最小延迟训练目标:引入minLT损失,指导策略网络优化分割边界,减少延迟。 3. 联合训练策略:流式与非流式ASR模型共享参数,简化训练流程并降低开发成本。 4. 端到端优化:使用低秩适应(LoRA)联合训练语音编码器、适配器、策略网络和LLM。
在AISHELL-1和AISHELL-2普通话基准测试中,方法优于现有流式ASR基线: - AISHELL-1:字符错误率(CER)为5.1%。 - AISHELL-2:CER为5.5%。 延迟优化使平均令牌生成延迟减少62.5%,对识别精度影响可忽略。
该方法通过动态分割和延迟优化,有效解决了LLM在流式ASR中的挑战,在保持高精度的同时显著降低延迟,具有实用价值。
论文针对DCASE 2025挑战赛任务4(S5)中,现实音频混合物常包含同类别声源(如多人同时说话)的问题。现有系统(如基线ResUNetK)在标签查询源分离(LQSS)中,因重复标签导致输出与参考源对齐模糊,影响训练和评估。官方评估指标CA-SDRi在重复标签下失效,限制了系统在真实场景中的应用。
实验在DCASE25T4基线系统上验证,扩展标签预测模型以支持同类别标签。结果表明,所提方法能有效处理同类别源,新指标在有无同类别源的混合物上均表现稳健,提升了S5系统在真实场景中的性能。
该研究通过创新损失函数和评估指标,解决了音频语义分割中同类别源处理的难题,推动了沉浸式通信中声音场景分析技术的实用化。
该论文通过信息论分析揭示SSL表示在噪声下的语义信息损失问题,并提出解耦的语音聚合层,有效提升了语音增强模型的语音内容保留能力,为SE领域提供了新的语义对齐视角。
论文指出,语音欺骗攻击、说话人验证漏洞和恶意语音数据操纵已成为人工智能和机器学习系统中的关键安全威胁。随着深度学习技术在语音合成和深度伪造方面的快速发展,语音安全系统面临前所未有的挑战,特别是在缺乏法律框架的情况下,声音数据的滥用问题日益突出。
论文提出了一种新颖的掩蔽能量扰动(MEP)方法,用于对抗说话人识别系统中的误分类。该方法基于能量掩蔽,在频域中对原始语音数据的小能量区域应用掩蔽,然后生成对抗性扰动,针对人类听觉模型不易察觉的区域。MEP 方法包括基本 MEP 攻击和迭代 MEP(I-MEP)攻击,通过梯度下降优化扰动,同时使用掩蔽特征来限制扰动范围,以保持音频质量。
实验在 LibriSpeech 数据集上进行,使用了 ResNetSE34-L、ResNetSE34-V 和 ECAPA-TDNN 等说话人识别模型。结果表明,MEP 和 I-MEP 方法在音频质量(通过 PESQ 和 SNR 评估)和逃避效果(通过 EER 评估)方面均优于传统对抗攻击方法(如 FGSM、I-FGSM、MI-FGSM、PGD)。例如,I-MEP 在 PESQ 得分上达到 3.7657-3.7709,SNR 达到 38.07-38.14 dB,显示出最小的感知失真和最高的信号质量。在 EER 方面,MEP 和 I-MEP 能有效提高错误率,表明其对抗攻击的有效性。
该研究通过创新的能量掩蔽方法,在保持语音质量的同时有效提升了对抗攻击的成功率,为说话人识别系统的安全防护提供了新思路。
该研究通过系统优化MAE框架的三个关键组件,显著提升了领域自适应SSL在临床语音疾病分类中的性能,为数据受限的医疗音频应用提供了有效的设计参考。
现有语音建模方法面临两个主要问题:1)语音标记频率过高(通常12.5-50Hz),导致建模效率低下;2)现有的音节级编码方法(如Sylber初代)仅限于英语朗读语音,缺乏通用性,且丢失了大量声学细节(如说话人身份)。
Sylber 2.0提出了一种通用的音节嵌入框架,主要创新包括: 1. 多语言音节学习:扩展了自监督学习框架,支持从多种语言和表达风格中学习音节结构 2. 边界检测器:引入并行化音节边界检测,提高分割效率 3. 辅助声学编码器:专门编码音节标记中的声学细节,弥补纯语言内容的信息缺失 4. 连续嵌入空间:采用连续嵌入而非离散量化,避免多码本复杂性,特别适合多语言场景 5. 轻量级声码器:使用Siuzdak(2024)声码器从压缩嵌入合成24kHz原始波形
Sylber 2.0通过创新的音节级编码框架,在保持极低标记频率(~5Hz)的同时实现了多语言通用性和高质量重建,为高效语音建模提供了新的基础抽象。
论文指出,基于LLM和代理的合成AI人物角色在设计和产品决策中应用日益广泛,但现有方法(如基于提示的角色扮演)常产生有说服力但不可验证的响应,缺乏证据基础,导致幻觉、不一致性和透明度不足,这增加了决策风险,尤其是在早期设计或战略背景下。
论文提出PersonaCite系统,通过检索增强的交互将AI人物角色重构为证据受限的研究工具。关键创新包括: 1. 实时证据检索:在每次对话轮次中检索实际的VoC(客户之声)数据。 2. 响应约束:将LLM响应限制在检索到的证据范围内。 3. 明确弃权:当证据不足时,系统明确承认知识缺口,避免生成推测性响应。 4. 源属性:提供响应级别的来源归属,增强可验证性和可追溯性。 系统采用代理架构,使用Python、AI.SDK和Next.js实现,并利用Gemini和GPT-4O进行对话处理。
通过半结构化访谈和部署研究,涉及14名行业专家(来自UX研究、产品管理、设计和AI战略),初步发现包括: - 感知益处:反应模拟被视作设计加速器,支持早期探索、快速迭代和利益相关者对齐,特别是在用户访问受限时。 - 有效性关注:专家强调透明度、可追溯性和信任的重要性,关注LLM幻觉和数据质量。 - 设计张力:系统作为直接用户参与的补充工具,而非替代品,无法完全捕捉真实用户的细微洞察。 - 关键特性认可:源属性和明确知识缺口承认受到参与者高度评价。
PersonaCite通过检索增强的交互和证据约束,将AI人物角色从说服性模拟转向可验证的研究工具,有效缓解幻觉问题,提升设计工作流程中的透明度和信任,但需注意其作为补充而非替代用户研究的定位。
该研究通过融合EEG注意力线索与音频处理,为人工耳蜗在复杂听觉环境中的认知自适应处理提供了紧凑且鲁棒的解决方案,显著提升了多人说话场景下的语音分离性能。
传统十二音序列主义(classic serialism)在序列构建中主要关注音符之间的音程关系,导致音程变化有限,限制了作曲家在序列方法中的创新可能性。作曲家需要新的方法来扩展序列材料的多样性和结构复杂性。
本文提出基于Jean Barraqué的增殖序列(proliferating series)方法,通过数学群论分析序列的结构特性。关键创新在于: 1. 序列构建方式:选择两个传统十二音序列,提取从第一个序列到第二个序列的音符排列变换(即置换),并重复应用此置换生成新序列(增殖)。 2. 置换表示:将置换表示为不相交循环的乘积,置换的阶(即生成的序列数量)等于循环长度的最小公倍数。 3. 与传统序列变换结合:研究从原始序列通过传统变换(如转位、逆行、倒影、逆行倒影)得到的序列作为增殖起点,分析其增殖行为和结构。 4. 泛化应用:将方法扩展到微音阶(micro-tonal scales)和其他音乐参数(如节奏),使用模n运算替代模12,适用于任意音高划分。
本文通过数学群论系统化地分析了Barraqué的增殖序列,为序列主义作曲提供了新的理论工具和创作可能性,促进了音乐与数学的跨学科融合。
论文针对小规模数据集(如EA V数据集,仅42名参与者,约280个训练样本/受试者)上的多模态情感识别问题,探讨复杂注意力机制是否有效。核心痛点是:在小数据场景下,复杂模型(如Transformer)容易过拟合,破坏预训练特征,导致性能下降。
论文系统评估了三类模型: 1. M1(基线Transformer):包括EEG Transformer、Audio Spectrogram Transformer(AST)和Vision Transformer(ViT),使用预训练架构。 2. M2(因子化注意力机制):针对各模态结构定制,如EEG的三流Transformer(空间、时间、不对称注意力)、音频的时频双注意力、视频的因子化时空注意力,旨在提升性能但引入复杂性。 3. M3(CNN改进):通过简单领域特征工程优化基线CNN,如音频添加delta MFCCs、EEG使用频域特征(如带功率和微分熵),强调领域知识和实现细节。
该研究通过实证表明,在小数据多模态情感识别中,简单领域特征工程比复杂注意力机制更有效,为资源有限场景提供了实用指导。
传统TTS系统依赖高质量录音室数据(如LibriTTS、MLS),难以处理野外自发语音,面临环境噪声、转录错误、多样韵律和说话风格(如犹豫、填充词)等挑战,导致语音自然度和可懂度下降。
该研究通过结合语音增强、非自回归架构和系统推理优化,有效提升了零样本TTS在野外语音上的性能,为现实语音生成提供了实用方案。
当前音频深度伪造检测(ADD)方法主要依赖局部时域/频域特征或成对关系建模,忽视了高阶交互(HOIs)的作用。高阶交互能够捕捉多个特征组件协同作用产生的判别性模式,而现有方法无法有效建模这种超越成对依赖的复杂关系。
HyperPotter通过引入超图建模高阶协同交互,为音频深度伪造检测提供了新的理论视角和实用框架,显著提升了跨场景泛化性能。
WaveTrainerFit通过可训练先验和显式增益调整,有效解决了SSL特征到波形生成的映射难题,在提升音质和效率的同时降低了模型训练复杂度。
外部声场插值(即声源边界周围区域的声场重建)是声学信号处理中的基础问题,具有波场合成、主动噪声控制等应用。传统方法面临挑战:需要特定麦克风阵列配置、对声源条件有先验知识、对正则化和麦克风分布敏感,且点源模型在声源位置发散导致神经网络训练困难。
提出一种基于高斯过程回归的插值方法,使用点源再生核和可训练内积公式来拟合外部声场。核心创新包括: 1. 物理约束核:基于非齐次亥姆霍兹方程的外部波函数解定义再生核希尔伯特空间(RKHS),默认满足物理约束。 2. 参数化加权内积:使用径向权重函数(如指数衰减形式)确保收敛,自动通过参数α和β决定高阶分量的衰减,无需手动截断。 3. 灵活估计器:不依赖麦克风分布,允许任意麦克风分布,参数直接从录音数据优化。 4. 优化框架:结合核岭回归和高斯过程回归,通过最大化对数似然并添加条件数正则化来优化核参数。
在数值模拟中,与球形波函数展开(SWF)和点神经元网络(PNN)对比: - 插值误差降低:在100 Hz至2.5 kHz频率范围内,平均归一化均方误差(NMSE)降低约2 dB。 - 一致性更好:在目标区域内更一致地重建真实声场。 - 分布鲁棒性:在球形阵列和随机麦克风分布下均表现良好。
该方法通过物理约束核和可学习参数,实现了对外部声场的高效、灵活插值,显著提升了重建精度和鲁棒性。
ARCHI-TTS通过创新的对齐器和高效推理设计,在保持高质量零样本语音合成的同时,大幅提升了计算效率,为实用化部署提供了新思路。
论文针对分布式多输入多输出(D-MIMO)网络中的载波相位定位(CPP)问题,指出现有研究对相位同步误差的影响探索不足。这些误差会显著降低定位精度,而实际应用(如6G网络)又对低延迟和高精度有严格要求。
该论文通过深度学习优化AP选择,有效解决了D-MIMO中相位同步误差导致的定位精度下降问题,同时降低了计算复杂度,为6G高精度定位提供了实用解决方案。
当前语音对话系统(SDS)的安全评估主要依赖文本中心方法,忽略了音频特有的副语言线索(如语气、强调)和转录错误,且缺乏针对多轮口语对话的结构化安全评估资源。
该研究通过创新的基准和系统分析,为多轮口语对话的安全评估提供了首个全面框架,揭示了LALM在模态和架构上的性能权衡,并提出了实用指南。
自动语音识别(ASR)在对话语音中面临挑战,主要由于大规模、标注良好的多说话人对话数据稀缺,尤其是在低资源语言(如匈牙利语)中。现有方法如简单拼接增强缺乏真实对话的动态性,导致ASR模型在真实多说话人对话中泛化能力差。
本文提出并应用了两种方法: 1. Speaker-Aware Simulated Conversations (SASC):将单说话人录音转换为真实多说话人对话的数据增强框架,通过建模说话人特定的时序行为(如停顿和重叠)来提高对话真实性。这是首次将SASC应用于匈牙利语。 2. C-SASC:SASC的扩展变体,引入了基于话语时长的条件停顿建模,以更准确地反映人类对话中的局部时序依赖(如较长话语前通常有较长停顿),同时保持原方法的简单性和效率。
本研究验证了说话人感知对话模拟在匈牙利语ASR中的鲁棒性,并强调了在合成对话生成中增加时序建模细节的益处和局限性,为低资源语言对话ASR提供了有效数据增强策略。
预训练的自动语音识别(ASR)和语音增强(SE)模型在匹配的噪声和信道条件下表现优异,但在面对域偏移(如未见过的噪声和信道失真)时性能严重下降。现有方法通常独立处理噪声或信道失真,缺乏统一框架,且依赖大量标注数据或复杂训练过程,限制了实际应用的可扩展性。
本文提出URSA-GAN(Universal Robust Speech Adaptation Generative Adversarial Network),一个统一的生成框架,用于联合适应噪声和信道失真。关键创新包括: - 双嵌入架构:使用噪声编码器和信道编码器,分别从目标域的无标签语音中提取实例级嵌入,捕获细粒度的噪声和信道特征。 - GAN-based生成器:利用这些嵌入条件生成语音,合成与目标域声学对齐的语音,同时保留音素内容。 - 动态随机扰动:一种新颖的正则化技术,在生成过程中向嵌入引入受控变异性,增强对未见域的鲁棒性。 - 两阶段训练流程:第一阶段训练编码器提取嵌入,第二阶段训练生成器和判别器合成语音,实现高效学习。
在多种噪声和信道不匹配场景下的评估显示,URSA-GAN显著提升了ASR和SE性能: - 在ASR任务中,字符错误率(CER)相对改善16.16%。 - 在SE任务中,感知指标相对改善15.58%。 - 在结合噪声和信道退化的复合测试条件下,验证了模型的泛化能力。
URSA-GAN通过统一的生成框架和动态扰动机制,有效解决了跨域ASR和SE中的噪声和信道不匹配问题,提升了模型在真实场景中的鲁棒性和适应性。
论文指出,基于离散语音表示(如语义或语音学标记)的自动语音识别(ASR)系统,在现实噪声环境中性能会显著下降,因为噪声会破坏标记的准确性。尽管连续特征ASR系统已通过前端增强技术(如语音增强)提升了噪声鲁棒性,但针对标记ASR的前端增强研究尚不充分,特别是增强应在波形、连续特征还是标记层面进行,缺乏系统探索。
论文提出了四种前端增强模型,根据输入/输出表示分类: - Wave-to-Wave (W2W-E):传统语音增强,从噪声波形生成增强波形。 - Token-to-Token (T2T-E):从噪声标记直接映射到增强标记。 - Vector-to-Token (V2T-E):从SSL模型的连续特征(如加权和特征)生成增强标记,引入多层感知机(MLP)、E-Branchformer或时序卷积网络(TCN)作为标记器。 - Wave-to-Token (W2T-E):从噪声波形直接生成增强标记,通过微调SSL模型(如WavLM)并添加线性层,使用CTC损失训练。 这些模型独立于ASR后端训练,实现模块化设计,便于系统更新。
在CHiME-4数据集上的实验表明: - W2T-E 在标记ASR中表现最佳,词错误率(WER)最低,甚至优于基于连续SSL特征的ASR系统。 - 增强性能不总是与标记级准确度(如单位编辑距离UED)相关,表明UED可能不足以预测ASR准确性。 - W2T-E虽然训练成本较高,但推理最简单、成本最低,且系统整体结构简洁。
该研究首次系统评估了多种前端增强策略对标记ASR噪声鲁棒性的影响,证明了Wave-to-Token增强的有效性,为高效且鲁棒的语音处理系统提供了新方向。
语言引导的视听分割(Ref-AVS)任务旨在通过视频、音频和文本联合推理来分割自然语言描述的目标对象。现有研究主要关注生成分割掩码,并通过与真实掩码计算IoU来评估模型性能。然而,在实际部署中,真实掩码往往不可得(即无参考),这使得评估掩码质量变得困难。现有方法仅提供单一的IoU分数,缺乏对掩码错误的细粒度诊断和可解释性评估,无法支持质量控制和后续改进。
提出新任务MQA-RefAVS:在Ref-AVS背景下引入掩码质量评估任务,要求在不依赖真实掩码的情况下,自动评估候选分割掩码的质量,包括估计IoU、识别错误类型和推荐质量控制动作。
构建基准数据集MQ-RAVSBench:基于Ref-AVSBench数据集,包含1,840个视频和2,046个参考文本,生成26,061个掩码实例。每个掩码涵盖六种代表性错误类型(完美、全负、内部切割、膨胀、腐蚀、合并),覆盖几何和语义问题,并标注IoU和推荐动作(接受、小修、大修、拒绝)。
提出模型MQ-Auditor:基于多模态大语言模型(MLLM)的审计器,通过监督指令调优,显式推理音频、视觉、语言和掩码信息,在推理时无需真实掩码即可评估掩码质量。模型输出定量(IoU)和定性(错误类型、动作建议)评估。
在MQ-RAVSBench上的广泛实验表明,掩码质量评估在Ref-AVS设置中具有挑战性,现有开源和商业MLLMs(包括Gemini-3-Flash)表现不佳。相比之下,MQ-Auditor能提供更准确可靠的评估,并可集成到现有Ref-AVS系统中,检测分割失败并支持下游分割改进。
该工作首次系统性地解决了Ref-AVS中掩码质量评估的参考缺失问题,通过新任务、基准和模型,为多模态分割的可靠部署提供了重要工具。
现有音视频高光检测模型主要依赖视觉模态,对音频模态利用不足。现有方法通常只提取音频的高层语义特征(如语音、音乐类型),而忽略了音频丰富的频谱-时间动态特性(如瞬态声学事件、能量快速变化),这些动态特性对于识别视频中的关键时刻至关重要。
提出DAViHD框架,核心是双通路音频编码器: 1. 语义通路:使用预训练的PANN模型处理原始音频波形,提取高层语义信息(如语音、音乐、特定声音事件) 2. 动态通路:处理对数梅尔频谱图,通过多分支架构捕获频谱-时间动态特性 - 使用时间注意力图和显著性门控 - 处理帧间差异生成速度注意力图 - 采用频率动态卷积层,动态组合基础核的输出来形成自适应滤波器
音频特征融合采用早期自注意力策略,先对两个通路的特征分别进行自注意力处理,再通过元素级乘法融合,让动态特征调制语义特征。
该研究通过创新的双通路音频编码器,充分挖掘音频的语义和动态双重特性,显著提升了音视频高光检测的性能,为多模态视频理解提供了新思路。
该研究开创性地将测试时缩放技术引入音频情感识别领域,为解决情感模糊性这一长期挑战提供了系统性的评估框架和方法论基础,为开发更具情感智能的语音AI系统指明了方向。
印度农业领域缺乏针对性的ASR评估框架:现有通用ASR评估框架无法处理农业领域术语的重要性差异,误转录农药名称、作物病害等关键术语可能导致严重后果。
印度语言ASR资源不足:特别是低资源语言如奥里亚语(Odia),在农业领域面临技术术语、方言变体和恶劣声学环境的挑战。
真实农业录音质量差:实地录音存在背景谈话、风声、回声、重叠语音等多种音频问题,传统实验室数据集无法反映实际部署环境。
提出农业加权词错误率(AWWER):根据农业术语的重要性分配权重(核心术语权重4,一般词汇权重1),通过词典匹配实现,比传统WER更能反映领域需求。
引入LLM效用评分:使用GPT-4o对转录结果进行1-4分评分,评估其在实际农业咨询中的可用性。
系统评估10个ASR模型:涵盖开源模型(Whisper、Meta MMS、AI4Bharat)、商业API(Google STT、Azure Speech)和学术模型(Vaani、Spring Labs),在多语言环境下进行对比。
分析说话人日志化影响:针对多人录音场景,评估最佳说话人选择策略对WER的改善效果(最高可降低66%)。
奥里亚语挑战最大:Azure Diarize(最佳说话人)达到35.1% WER,而Google STT高达70.7%
说话人日志化效果明显:对奥里亚语,启用说话人日志化后WER从70.7%降至35.1%。
音频质量问题突出:奥里亚语高噪声样本比例最高(13.6%),背景谈话是所有语言中最主要的音频问题。
模型表现差异大:
本研究首次为印度农业领域的多语言ASR建立了系统评估基准,通过创新的领域加权指标和全面的模型对比,揭示了低资源农业场景下ASR的实际挑战与改进方向。
现有视觉引导声学高亮任务主要采用判别式模型(如DEMUCS),但音频混音存在固有的多对多映射模糊性,导致模型难以在视觉和听觉焦点之间建立精确对齐。
论文通过定量和定性评估表明,该方法在Muddy Mix数据集上持续超越先前最先进的判别式方法,验证了生成式建模在视觉引导音频混音任务中的优越性。
该研究通过创新的条件流匹配框架和滚动损失机制,有效解决了视觉引导声学高亮中的多对多映射难题,推动了跨模态音频增强技术的发展。
该论文提出了一种基于SVD的统一模态框架,有效解决了混合麦克风阵列在稀疏声场重建中的挑战,通过数据驱动模态提升了在混响环境下的鲁棒性和准确性。
本文针对克罗地亚语查卡维亚方言缺乏公开语音数据集的问题,指出当前语音技术主要关注标准语言,忽视方言变体,限制了方言研究和AI应用的发展。
这项工作通过创新性地构建和发布首个查卡维亚方言语音数据集,并成功应用于ASR模型微调,为方言语音技术研究和文化遗产保护提供了宝贵资源。
当前语音深度伪造检测(SDD)前端设计面临两大挑战: 1. 传统手工特征(如MFCC、LFCC、CQCC):虽然透明、计算高效,但难以捕捉高层次语义细节,性能有限 2. 自监督学习(SSL)特征(如XLSR、HuBERT、MMS):性能优越但缺乏可解释性,可能忽略细粒度频谱异常,且计算成本高、存在过拟合风险
提出WST-X系列特征提取器,首次将小波散射变换(WST)应用于语音深度伪造检测: - WST原理:结合小波变换和非线性操作(类似深度卷积网络),无需训练数据,通过数学定义实现平移不变性和变形稳定性 - 双模态设计: - 1D WST:直接处理原始波形,捕捉声学细节 - 2D WST:处理时间-频率表示(如频谱图),检测高阶结构异常 - 两种集成策略: - WST-X1(并行集成):1D WST与PT-XLSR(提示调优XLSR)并行处理,特征拼接 - WST-X2(级联集成):PT-XLSR提取SSL特征后,通过2D WST进一步处理 - 关键参数发现:小平均尺度(J)、高频率分辨率(Q)和高方向分辨率(L)对捕捉细微伪影至关重要
WST-X系列通过结合小波散射变换的数学严谨性与自监督学习的语义表达能力,在保持可解释性的同时实现了卓越的检测性能,为语音深度伪造检测提供了新的研究方向。
语音技术发展主要集中于高资源语言,导致撒哈拉以南非洲语言(代表超过2,000种语言和超过1亿使用者)面临显著的数字化鸿沟,缺乏大规模、高质量、开放许可的语音语料库,阻碍了自动语音识别(ASR)和文本转语音(TTS)系统的开发。
WAXAL 是一个开创性的资源,通过大规模、高质量的语音数据,显著推动了撒哈拉以南非洲语言的语音技术发展,促进了数字包容性和语言保存。
当前吞咽障碍(dysphagia)诊断主要依赖视频荧光吞咽研究(VFSS)、纤维内镜吞咽评估(FEES)等侵入性或放射性方法,存在成本高、需要专业人员操作、诊断敏感性和特异性有限等问题。临床吞咽评估缺乏客观工具,导致临床决策不确定性。
该研究通过非侵入性颈部声学传感结合机器学习,为吞咽障碍筛查提供了一种高效、可扩展的客观评估工具,在临床应用中显示出显著潜力。
3D打印市场快速增长,预计2025年收入达150亿美元,但面临日益增多的网络安全威胁,特别是知识产权(IP)盗窃。攻击者可通过侧信道攻击(如声学侧信道)窃取设计文件,现有防御方法(如添加扬声器)成本高且占用空间。
提出QuietPrint方法,通过最小化修改G代码来保护3D打印机免受声学侧信道攻击,无需额外硬件(如大型扬声器或降噪设备)。该方法分析声学噪声源(如步进电机和冷却风扇),并设计防御机制混淆声学信息,使其无法被重构。
实验使用Elegoo Neptune 3 FDM 3D打印机和Microsoft Surface Pro 7+笔记本电脑内置麦克风进行数据采集。分析显示,冷却风扇噪声的音频能量与喷嘴水平移动位置呈线性相关,攻击者可通过简单插值线预测喷嘴位置。在CoreXY打印机中,攻击者使用两个录音设备可能确定性地重构喷嘴在X和Y轴的位置。
QuietPrint提供了一种低成本、无需硬件的创新方案,有效应对3D打印中的声学侧信道威胁,具有实际应用潜力。
RIR-Former通过结合位置编码和分段解码,实现了高效、通用的RIR重建,为声学信号处理提供了有前景的解决方案。
论文针对时域传输线(TL)模型在模拟耳蜗基底膜(BM)位移时,由于一维(1-D)设计限制,难以整合更高维度效应(如短波区域的压力聚焦和横向粘性阻尼)的问题。这些效应在频率域中更易表达,但在时域实现中具有挑战性,导致模型在模拟小型哺乳动物(如沙鼠)耳蜗生理时,增益与频率选择性紧密耦合,压缩不足(约10 dB),限制了模型在非平稳声音响应中的准确性。
提出了一种时域短波导纳校正方法,结合自回归滤波和回归技术,将2-D效应(基于Sisto等人的频率域S-2D模型中的压力聚焦和粘性阻尼)整合到基于V-1D模型的时域TL框架中。创新点包括: 1. 引入压力聚焦因子(α)和校正因子(β),通过数值方法在时域中模拟波长依赖的增益补偿。 2. 使用反馈循环使校正因子与声级相关,实现瞬时和非瞬时非线性的结合。 3. 开发了V*模型,融合V-1D和S-2D模型的元素,以改进沙鼠耳蜗模型的性能。
在沙鼠模型中实施校正后,模型实现了增益与频率选择性的部分解耦,提供了额外的5 dB增益,并将压缩机制的声音级范围扩展了10 dB。这解决了初始模型中压缩不足的问题,使模型更贴合小型哺乳动物的生理数据,提高了在模拟耳蜗响应时的准确性和适用性。
本研究通过创新的时域数值校正,有效解决了TL模型中高维效应整合的难题,提升了模型在模拟小型哺乳动物耳蜗非线性响应时的性能,为听觉计算模型的发展提供了重要参考。
自动说话人验证(ASV)系统在安全关键应用中广泛使用,但容易受到重放、文本到语音和语音转换等欺骗攻击。虽然专用反欺骗(CM)系统可以检测欺骗语音,但它们不验证说话人身份,使得在对抗条件下独立的ASV或CM系统不足。这促使了欺骗感知说话人验证(SASV)的发展,以联合处理说话人验证和欺骗检测。
本文提出了一种模块化SASV框架,通过非线性融合、显式建模交互以及使用依赖于操作条件的可训练a-DCF损失进行优化,有效重用公开可用的ASV和CM系统。框架包括ASV分支、CM分支和分数融合模块: - ASV分支:使用固定ASV编码器提取说话人嵌入,通过加权余弦相似度计算说话人相似度,并进行仿射校准以产生适合融合的对数似然比(LLR)。 - CM分支:使用冻结的CM编码器提取欺骗嵌入,与ASV测试嵌入连接后通过MLP分类器处理,并进行仿射校准。 - 分数融合:通过非线性分数级融合结合校准后的ASV和CM LLR,使用参数控制说话人和欺骗证据的相对贡献,产生反映目标身份和真实语音联合置信度的单一SASV分数。 - 联合优化:所有可训练组件(嵌入重加权、校准层、CM分类器和融合模块)在SASV决策级别端到端优化,使用二进制交叉熵和a-DCF的加权组合进行训练。
在WildSpoof挑战中评估,使用ECAPA-TDNN和ReDimNet作为ASV嵌入提取器,SSL-AASIST作为CM模型。最佳性能通过结合基于ReDimNet的ASV嵌入和微调的SSL-AASIST表示实现,在进展评估集上a-DCF为0.0515,在最终评估集上为0.2163。与基线系统(如SKA-TDNN的a-DCF为0.3118)相比,该方法显著提升了性能。
该研究通过模块化设计和联合优化,有效提升了SASV系统的鲁棒性,在WildSpoof挑战中展示了优越性能,为对抗欺骗攻击提供了实用框架。
HuPER通过模拟人类音素感知的自适应多路径推理机制,在数据效率和零样本多语言迁移方面取得突破,为音素建模提供了新的诊断视角和实用框架。
提出PL-Distill框架,包含两个核心组件: 1. 投影器级蒸馏(PDist):引入注意力加权中心核对齐(AwCKA),通过教师模型的自注意力分数动态加权音频令牌,突出情感关键时间步,并解决特征维度不匹配问题。 2. 逻辑级蒸馏(LDist):最小化教师和学生模型在音频和文本模态输出逻辑之间的KL散度,确保跨模态一致性。
PL-Distill通过创新的注意力加权机制和双层级蒸馏策略,有效解决了大型音频-语言模型在资源受限环境中的部署难题,实现了高性能的模型压缩与跨模态知识迁移。
本文针对单麦克风音频-视觉语音分离和增强在真实环境噪声中的挑战,指出现有监督方法缺乏灵活性,当声学环境变化时性能下降,需要重新训练。
提出SSNAPS方法,基于生成逆采样,使用专用扩散先验建模干净语音和环境噪声,并联合利用它们恢复所有底层源。采用解耦退火后验采样(DAPS)作为逆采样器,重新制定以处理多个统计独立信号。方法完全无监督,可分离任意数量的说话者,并扩展到处理屏幕外说话者分离。
在1、2和3个说话者与噪声的混合上评估,SSNAPS在词错误率(WER)上始终优于领先的监督基线方法。分离出的噪声组件具有高保真度,适用于下游声学场景检测。
SSNAPS是一种创新的无监督音频-视觉语音分离方法,通过扩散逆采样有效处理噪声环境,在灵活性和性能上超越监督方法。
论文指出,自监督说话人嵌入(如SimCLR训练的嵌入)在说话人验证系统中广泛应用,但存在严重的人口统计信息泄露问题,即嵌入中无意编码了性别、年龄、口音等敏感属性。这引发了公平性、隐私和伦理合规风险,可能导致跨人口统计群体的系统性偏见,或使攻击者能从看似匿名的嵌入中推断受保护属性。泄露不仅源于统计相关性,还涉及底层因果机制,使得仅基于相关性的缓解方法不足。
论文提出并比较两种去偏策略来缓解泄露: 1. 对抗性去偏:通过梯度反转层进行对抗训练,抑制嵌入中的人口统计信息。 2. 因果瓶颈架构:在表示管道末端引入因果瓶颈层,明确建模人口统计属性为因果上游因素,限制其对最终嵌入的影响,从而分离人口统计和残差信息。
研究框架包括:使用SimCLR创建基线说话人判别表示;应用对抗性去偏;引入因果瓶颈;使用线性和非线性探测分类器量化泄露(评估超出线性可分离性的信息);通过ROC-AUC和EER评估说话人验证性能。
该研究通过系统实验揭示了自监督说话人嵌入中人口统计泄露的复杂性和缓解挑战,为开发更公平、隐私保护的语音技术提供了重要见解,但强调现有方法在完全抑制泄露同时保持高性能方面仍有局限。
传统信号处理(SP)教育依赖静态多媒体工具和预设计内容,难以提供动态、交互式的学习体验,导致学生理解抽象概念困难,且编程门槛高,限制了可访问性和参与度。
本文提出SPEduAFM,一种基于音频基础模型(AFMs)的概念框架,将生成式AI(GenAI)集成到SP教育中。AFMs利用大规模预训练和Transformer架构,直接从原始音频学习表示,支持实时交互、多模态处理(如音频-文本集成)和跨任务泛化。通过案例研究(如DSP课程中的交互式听觉演示),展示了AFMs如何实现自动讲座转录、个性化反馈和包容性学习工具。
论文未提供具体实验数据,但通过理论分析和案例研究论证了AFMs的潜力:增强多媒体学习方法的参与度、交互性和可访问性;通过实时转录和情感识别等功能,降低学习门槛,促进体验式学习。同时,讨论了伦理、可解释性和定制化等挑战,并提出实用建议。
该论文前瞻性地提出了AFMs在信号处理教育中的创新应用,为工程教育提供了生成式AI驱动的转型路径,但需进一步实证研究验证其实际效果。
TLDiffGAN通过融合潜在扩散模型与GAN的优势,结合双分支特征提取和时序增强技术,有效解决了异常声音检测中特征捕捉不完整和局部敏感性不足的问题,在性能和可解释性上取得显著提升。
音频深度伪造检测面临两大挑战:1)现有基于自监督学习(SSL)的检测器(如XLS-R + SLS)将Transformer各层视为独立,忽略了层间依赖关系;2)忽略了时间动态性,即合成伪影仅出现在特定时间区域,而非所有帧均等重要。这导致特征同质化,限制了模型对跨域生成技术和录音条件的泛化能力。
提出HierCon(Hierarchical Contrastive Attention)框架,包含三大核心创新: 1. 分层注意力架构:分三阶段建模依赖关系: - 阶段1:时间注意力(Temporal Attention)——在每个层内对时间帧进行加权,突出携带伪影的关键帧。 - 阶段2:组内注意力(Intra-Group Attention)——将24个Transformer层分为8组(每组3层),在相邻层间建模局部依赖。 - 阶段3:组间注意力(Inter-Group Attention)——跨组聚合信息,整合不同抽象层次(如声学、韵律、语义)的证据。 2. 对比学习正则化:引入基于边距的对比损失(margin-based contrastive loss),与二元交叉熵(BCE)损失联合优化,鼓励域不变嵌入,提升跨域鲁棒性。 3. 可解释性设计:注意力权重可可视化,揭示哪些时间区域、层和组对检测贡献最大。
在ASVspoof 2021 DF和In-the-Wild数据集上达到SOTA性能: - ASVspoof 2021 DF:EER为1.93%,相比独立层加权方法(XLS-R + SLS)相对提升36.6%。 - In-the-Wild:EER为6.87%,相对提升22.5%。 - ASVspoof 2021 LA:EER为2.46%,优于基线(3.88%)。 消融实验证实:分层注意力(贡献~70%)和对比学习(贡献~30%)均有效提升性能,且联合使用效果最佳。
HierCon通过分层建模时间、层间和组间依赖,结合对比学习,显著提升了音频深度伪造检测的准确性和跨域泛化能力,为复杂伪造攻击提供了更鲁棒的解决方案。
当前多模态大语言模型(MLLMs)在处理语音输入时存在系统性偏见问题,包括语言、口音、性别和选项顺序等维度。现有研究主要集中在文本模态的偏见评估,缺乏对语音模态中偏见敏感性的系统研究,特别是跨语言、跨人口统计和结构变化的综合评估。
该研究首次系统评估了多语言MLLMs在语音模态中的偏见敏感性,建立了统一的公平性和鲁棒性评估框架,填补了文本与语音评估之间的空白。
DAMA通过结构感知的适应,实现了高效、可扩展的多语言语音识别,在低资源场景下展现出优越的鲁棒性和效率。
单模态方法的局限性:传统情感识别方法主要依赖文本或音频等单一模态数据,难以捕捉人类表达情感时言语与非言语线索之间的复杂交互。例如,说话者的文字可能与语调相矛盾,或细微的语音变化可能传达讽刺、反讽或压抑的情感。
情感动态性与上下文依赖性:现有系统常将情感视为静态、上下文无关的标签,忽略了人类情感的动态性和受文化、情境、人际因素影响的特性。
数据与模型挑战:情感识别面临数据集偏见(如文化代表性不足)、语言复杂性(如比喻、反讽、多语言切换)以及模型对隐含情感理解不足等问题。
轻量级多模态基线方法:提出一个结合文本和音频模态的简单、可复现的基线系统,旨在为SemEval-2024 Task 3数据集提供一个参考实现。
技术组件:
融合策略:使用简单的后期融合集成方法,结合文本和音频模型的输出,以提升情感识别性能。
实验设计:采用轻量级训练协议(有限超参数调优和评估),强调多模态融合在何时优于单模态模型,并明确说明其作为参考点的局限性。
该论文提供了一个透明、易复现的多模态情感识别基线,有效结合文本和音频信息,为后续研究奠定了实用参考基础,但强调其非最先进性质,适合作为起点而非终点。
论文指出,房间脉冲响应(RIR)估计作为一类逆问题(如去噪、解卷积),传统方法面临两大挑战:1)监督学习方法需要大量配对训练数据,且泛化能力差,容易受训练分布限制;2)经典贝叶斯方法(如最大后验估计)通常只提供单点估计,无法捕捉后验分布的不确定性,这在病态逆问题中尤为重要。
本文提出RIR-Flow,一种无需训练的贝叶斯框架,用于解决RIR逆问题。核心创新包括: 1. 解析先验推导:基于RIR的统计结构(建模为方差指数衰减的高斯过程),推导出闭式的最小均方误差(MMSE)Wiener去噪器,作为流匹配中的解析先验,避免了数据驱动先验的需求。 2. 流匹配框架集成:将该解析去噪器集成到现有的基于流的逆问题求解器(如FLOWER框架)中,通过引导后验采样解决逆问题。 3. 扩展至非线性与非高斯问题:通过局部高斯近似引导后验,将方法扩展到非线性、非高斯逆问题(如去削波),保持了实际有效性。
实验在真实RIR数据上进行,覆盖多种逆问题:去噪、ℓ2和鲁棒解卷积、修复、去削波。结果表明,RIR-Flow在低信噪比条件下表现稳健,重建质量优于基线方法,特别是在处理复杂逆问题时。
RIR-Flow巧妙地将经典RIR统计模型与现代基于流的生成推理相结合,提供了一种无需训练、可解释且高效的贝叶斯框架,显著提升了RIR逆问题处理的鲁棒性和泛化能力。
传统音频压缩方法(如基于信号处理和神经编解码器)在超低比特率(如低于1kbps)下性能急剧下降,导致严重的声学伪影和语义失真,难以满足低带宽通信和生成式音频-语言建模的需求。
论文提出生成式音频压缩(GAC),基于AI Flow框架和信息容量定律(IC-1),实现从信号保真度到任务导向有效性的范式转变。核心创新包括: - 理论框架:利用信息容量定律,通过增加接收端计算能力(模型参数)来补偿传输带宽限制,体现“更多计算,更少带宽”理念。 - 两阶段设计: 1. 阶段一(率最小化):在发送端使用语义编码器提取紧凑的语义表示,通过信息瓶颈原则过滤比特冗余,并与语言模型对齐,确保语义内容保留。 2. 阶段二(信息恢复):在接收端使用大规模生成式解码器(基于整流流匹配)从语义表示中重建高保真音频,依赖模型先验恢复声学细节。 - 模型规模:采用1.8B参数模型,实现高效信息压缩和重建。
GAC通过结合语义理解和生成式合成,在超低比特率下实现了音频压缩的突破性进展,为低带宽应用提供了高效解决方案。
XACLE挑战赛的目标是构建一个能够自动预测音频与文本对齐分数的模型,以替代人工主观评估。主要难点在于:1)音频-文本对齐任务缺乏大规模标注数据;2)需要模型能够准确理解音频语义内容并与文本描述进行匹配;3)现有方法(如CLAP)在音频-文本对齐任务上性能有限。
该研究通过创新的三阶段训练流程和LALM架构,有效解决了音频-文本对齐任务的数据稀缺问题,显著提升了性能,为音频语言模型在多模态对齐任务中的应用提供了重要参考。
当前语音分词器面临三个主要挑战:1)需要同时提取语音学和韵律信息,同时抑制说话人身份等非语言信息;2)现有解耦编解码器通常依赖梯度反转、不变性学习等辅助方法来实现分离,但这些方法效果有限;3)现有方法要么丢失韵律信息(如SSL tokens),要么保留过多声学方差导致下游建模复杂(如NACs),要么需要复杂架构(如混合编解码器)。
Kanade提出了一种单层解耦语音分词器,主要创新点包括: 1. 简单架构:仅使用单层token流(12.5/25 Hz),无需多层token结构 2. 无辅助方法的解耦:通过信息瓶颈实现无监督解耦,无需梯度反转等辅助方法 3. 双分支设计: - 内容分支:处理深层SSL特征(第6和9层),专注于语言内容 - 全局分支:处理浅层SSL特征(第1和2层),捕获说话人特征等非语言信息 4. 双重重建损失:同时使用SSL特征重建损失(强调语音学信息)和梅尔谱图重建损失(强调韵律信息) 5. 无码书量化:使用FSQ(有限标量量化)有效量化内容
Kanade通过简洁的单层架构实现了SSL tokens的语言可用性和NACs的生成质量的结合,为语音语言建模提供了高效实用的分词解决方案。
现有基于扩散模型的语音增强方法将语谱图视为普通2D图像进行均匀处理,忽略了音频固有的结构稀疏性,导致频谱表示效率低下和计算复杂度过高。
提出DVPD(Dual-View Predictive Diffusion)模型,通过双视角(视觉纹理和物理频域表示)协同利用语谱图特性: 1. FANC编码器:频率自适应非均匀压缩,保留关键低频谐波,修剪高频冗余 2. LISA模块:轻量级基于图像的频谱感知模块,以最小开销从视觉角度捕获特征 3. TLB策略:训练无损提升策略,在推理阶段利用双视角先验提升生成质量,无需额外微调
在多个基准测试中达到SOTA性能,与当前最先进的轻量级模型PGUSE相比: - 参数量仅需35% - 推理MACs仅需40% 实现了高保真语音质量与极致架构效率的平衡
DVPD通过创新的双视角协同设计,在语音增强领域实现了计算效率与性能的突破性平衡。
文本到语音编辑技术面临的主要挑战是实现'不可感知'的编辑,即修改后的语音片段与上下文无缝融合。现有方法在声学空间中操作,存在内容与风格纠缠的问题,导致生成不稳定和边界伪影。早期非自回归方法推理稳定但难以建模长距离依赖,产生单调韵律;而基于神经编解码语言模型的自回归方法自然度好,但易出现幻觉和边界伪影。
论文提出一个基于'编辑内容,保留声学'原则的新框架,包含两个核心组件: 1. 结构基础:将编辑过程解耦,在解耦的语义空间中进行内容操作,生成仅表示语言内容和粗略韵律的编辑令牌,然后通过流匹配解码器进行声学重建,确保声学连贯性。 2. 感知对齐:引入自一致性奖励组相对策略优化,利用预训练的文本到语音模型作为隐式批评者,结合自动语音识别词错误率和时长约束,构建复合奖励,以增强全局连贯性并实现感知对齐。
实证评估表明,该方法在智能性、鲁棒性和感知质量方面显著优于最先进的自回归和非自回归基线方法。
该框架通过解耦编辑和强化学习对齐,有效解决了文本到语音编辑中的不可感知性问题,提升了编辑质量和稳定性。
现代语音克隆(VC)技术能够从仅几秒的参考音频中合成与目标说话人高度匹配的语音,应用于个性化语音接口和配音等场景。然而,在实际部署中,VC模型面临参考音频噪声、文本提示不完美和下游处理多样性等问题,这些因素会显著损害其鲁棒性。尽管基于自回归编解码器令牌语言模型和扩散模型的VC技术进展迅速,但在现实部署变化下的鲁棒性仍未得到充分探索。现有基准测试要么侧重于清洁环境下的质量评估,要么关注更广泛的音频生成鲁棒性,缺乏针对VC全流程鲁棒性的系统性研究。
本文提出了RVCBench,一个全面的基准测试,用于评估VC在整个生成流程中的鲁棒性,涵盖输入变化、生成挑战、输出后处理和对抗扰动四个维度。具体包括10个鲁棒性任务,涉及225个说话人和14,370个话语,并评估了11个代表性的现代VC模型。RVCBench基于八个公共数据集构建,支持18个鲁棒性评估,覆盖多语言和跨语言设置。模型分为三类:自回归编解码器令牌模型、扩散和流声学模型、混合模型。评估指标包括说话人相似度(SIM)、平均意见得分(MOS)、梅尔倒谱失真(MCD)、实时因子(RTF)和词错误率(WER)。
通过RVCBench的实证分析,得出以下关键发现:在输入鲁棒性方面,内容一致性对输入变化脆弱,文本变化和参考音频波动都会破坏克隆稳定性并降低保真度。在生成鲁棒性方面,领域偏移、跨语言克隆和长文本合成暴露了瓶颈,包括音色、情感和内容保存的退化。在输出鲁棒性方面,后处理是弱点:压缩会降低输出音频质量,而最先进的深度伪造检测器仍能可靠标记输出,损害稳定性和隐蔽性。在音频扰动鲁棒性方面,被动和主动扰动仍然高度有效,在攻击/防御设置下显著抑制说话人相似度和生成质量。
RVCBench为VC鲁棒性提供了首个系统性基准测试,揭示了当前模型在实际部署中的关键失败模式,并促进了更鲁棒和可部署VC模型的发展。
现有音频深度伪造检测研究主要集中于单说话人场景,而多说话人对话环境中的深度伪造(如政治操纵、电信诈骗)已成为新兴且未被充分探索的威胁,缺乏专门的数据集和检测方法。
基线模型提供了有用的基准,但结果表明,在多变对话动态下可靠检测合成声音方面存在显著差距,突显了多说话人深度伪造检测研究的不足。
该研究填补了多说话人对话音频深度伪造检测的空白,通过分类法、数据集和基准测试为未来研究奠定了基础,但检测性能仍需提升以应对现实威胁。
现有语音语言模型(SpeechLM)部署系统在流式应用中面临两大挑战:1) 缺乏统一框架支持多样化的SpeechLM架构(如不同音频编码器、LLM骨干和深度LLM),导致系统碎片化、工程成本高;2) 现有系统未针对流式语音服务的独特性能指标(如时间到第一音频和流式可行性)进行优化,难以实现低延迟和高吞吐量。
VOXSERVE提出一个流式中心的SpeechLM服务系统,主要创新包括:1) 设计模型执行抽象,将模型架构细节与系统级优化解耦,支持多种SpeechLM架构;2) 引入流式感知调度算法和异步推理管道,优化端到端效率;3) 实现模型无关的优化(如批处理、分块去令牌化、缓存管理和CUDA图),提升性能。
在多个现代SpeechLM上的评估显示,VOXSERVE在可比延迟下,比现有实现实现10-20倍的吞吐量提升,同时保持高流式可行性。系统支持七种不同架构的SpeechLM,并灵活适应分布式推理等场景。
VOXSERVE通过统一抽象和流式优化,显著提升了SpeechLM服务的效率和可扩展性,为语音AI部署提供了实用解决方案。
论文指出,音频驱动说话头生成的主要挑战是实现唇部与音频的视听一致性(唇同步)。现有方法如Wav2Lip和AttnWav2Lip在生成高频细节时存在困难,因为音频和视觉特征的简单拼接可能导致音频信息在解码过程中逐渐减弱,无法有效学习音频内容与嘴部纹理的深层关联,从而影响唇同步的准确性和图像质量。
论文提出LPIPS-AttnWav2Lip方法,包含三个主要创新点: 1. 生成器设计:采用基于残差结构的卷积块注意力模块(CBAM),增强对唇部区域信息的编码和解码,抑制无关信息影响。同时,使用U-Net架构但减少编码器和解码器层数,以缓解音频信息随解码深度减弱的问题,并降低训练难度和资源消耗。 2. 语义对齐模块:引入基于双分支结构的FFC层扩展网络感受野,获取视觉特征图的局部和全局上下文信息;使用自适应实例归一化(AdaIN)将视觉特征的统计信息与音频潜在向量对齐,增强音频对唇部区域像素的驱动,实现语义层面的特征融合,不增加计算成本。 3. 损失函数优化:用LPIPS损失替代对抗损失,模拟人类对图像质量的判断,减少训练过程中的不稳定性和梯度消失/爆炸问题,为唇同步提供更好的训练环境。
论文通过主观和客观评估验证了方法的有效性: - 在唇同步准确性方面,使用LSE-C和LSE-D等指标进行评估,显示出优异性能。 - 在视觉质量方面,使用FID等指标进行评估,生成高质量图像。 - 代码已开源,便于复现和进一步研究。
LPIPS-AttnWav2Lip通过创新的语义对齐和损失优化,显著提升了音频驱动说话头生成的唇同步准确性和视觉质量,为通用说话人应用提供了有效解决方案。
传统Ambisonics编码方法存在以下主要问题:1)基于几何信息的传统数字信号处理方法(DSP)在低频段存在能量损失或噪声放大,在高频段出现空间混叠导致的球谐模式失真;2)现有的深度神经网络(DNN)方法通常需要为每个麦克风阵列重新训练模型,缺乏泛化能力;3)先前使用麦克风位置作为元数据的DNN方法只能处理自由场条件下的全向阵列,无法表征复杂的设备散射效应。
本文提出了一种基于交叉注意力机制的深度神经网络方法,用于将任意麦克风阵列信号编码为Ambisonics格式。主要创新点包括: 1. 使用阵列传递函数(ATFs)作为元数据:替代传统的几何信息,ATFs能够更准确地表征真实世界阵列的频率相关方向特性,包括麦克风位置、指向性模式和设备体散射效应。 2. 分离编码器架构:设计独立的音频编码器(Encsig)和指向性编码器(Encdir),分别处理音频信号和ATFs。 3. 交叉注意力机制:通过多头注意力将两个编码器的特征表示进行融合,生成与阵列无关的潜在空间音频表示,然后解码为Ambisonics混合矩阵。 4. 泛化能力:模型能够泛化到具有相同麦克风数量但任意ATFs的未见阵列配置。
在模拟数据上进行了两个场景的评估: 1. 移动电话场景(复杂体散射):提出的方法在所有Ambisonics信号指标上均优于静态编码器,在尺度不变信噪比(SI-SDR)上表现最佳。 2. 自由场条件:模型达到最佳SI-SDR,与现有神经解决方案性能相当,同时超越静态编码器。
与三个基线方法对比:传统静态编码、参数化DSP方法(使用oracle DOAs)、以及使用麦克风位置元数据的DNN方法(Gen-A)。实验表明,在复杂散射场景中,本文方法在SI-SDR上表现最优,且在所有指标上一致优于静态编码器。
本文通过引入阵列传递函数作为元数据并结合交叉注意力机制,实现了对任意麦克风阵列的高质量Ambisonics编码,显著提升了在复杂真实场景中的泛化能力和编码性能。
本研究通过层感知早期融合方法,有效结合声学和语言嵌入,显著提升认知状态分类性能,并深入揭示了多模态协同机制和层深度对临床应用的关键影响。
现有情感感知TTS系统(包括基于LLM的设计)通常依赖缩放固定情感嵌入或外部引导,限制了建模情感特定潜在特征的能力,导致情感表达的精确性和可控性不足。
提出EmoShift框架,核心是EmoSteer层,通过学习输出嵌入空间中每个目标情感的转向向量来捕获其潜在偏移,实现精确、一致的情感控制。该方法仅需1000万可训练参数(不到全微调的1/30),是轻量级、可插拔的激活转向框架,无需改变或重新训练基础模型。
EmoShift通过轻量级激活转向机制,在情感感知语音合成中实现了高效、精确的情感控制,为可解释和可控的情感表达提供了新思路。
多说话人自动语音识别(ASR)在重叠语音和会话特定词汇场景下面临双重挑战: 1. 声学挑战:重叠语音中非目标说话人干扰导致说话人归属错误 2. 语言挑战:对领域特定词汇(专有名词、术语等)适应性不足
CALM提出联合上下文声学-语言建模框架,主要创新点: - 统一框架:将目标说话人提取与上下文偏置集成到端到端系统中 - 声学建模:使用说话人嵌入驱动的目标说话人提取(ECAPA-TDNN+FiLM调制) - 语言建模:基于动态词汇的上下文偏置(Transformer偏置编码器) - 多任务训练:结合CTC、注意力、interCTC和VAD损失
在多个数据集上验证有效性: - LibriSpeech2Mix:B-WER从12.7降至4.7(相对改善63%) - CSJMix2:B-CER从16.6降至8.4(相对改善49%) - LibriSpeech3Mix:在N=100×3条件下,WER从9.2降至8.4 - AMI:在标准化语音混合上验证性能
CALM通过联合声学-语言建模,在多说话人ASR中实现了显著的个性化性能提升,特别是在处理重叠语音和领域特定词汇方面表现出色。
现有基于大语言模型(LLM)的自动语音识别(ASR)系统在非流式场景中表现出色,但将其扩展到流式识别(即实时、增量转录)仍面临挑战。主要问题包括:1)现有方法通常依赖CTC或混合模型进行强制对齐,导致级联设计复杂,难以端到端优化;2)基于固定音频块的方法无法自适应地最小化流式识别中的令牌生成延迟。
本文提出了一种新颖的流式LLM-ASR方法,核心创新点包括:
动态分段机制:采用基于单调分块注意力(MoChA)的读/写策略网络,自适应地对输入语音嵌入进行分段。该网络逐帧监控语音,直到触发读取信号,此时缓冲的语音段与前一令牌一起输入LLM进行下一令牌预测。
最小延迟训练目标:引入最小延迟训练(minLT)损失,利用强制对齐的黄金边界指导策略网络学习更准确的语音-文本对齐,从而减少流式识别的延迟。
联合训练策略:提出参数共享的流式与非流式ASR模型联合优化框架。两者共享所有参数,但前向计算路径不同,训练时每个批次随机分配流式或非流式模式,简化训练流程并降低开发成本。
端到端优化:整个系统(包括语音编码器、适配器、策略网络和LLM)采用低秩自适应(LoRA)进行端到端联合训练,支持动态细化分段边界。
在AISHELL-1和AISHELL-2普通话基准测试上的实验表明:
该工作通过创新的动态分段机制和延迟优化目标,成功将LLM应用于流式ASR,在保持高准确率的同时显著降低延迟,为实时语音识别提供了高效端到端解决方案。
论文针对DCASE 2025挑战赛任务4(S5)中,现实音频混合物常包含同类别声源(如多人同时说话)的问题。现有系统(如基线ResUNetK)在标签查询源分离(LQSS)中,因重复标签导致输出与参考源对齐模糊,影响训练和评估。官方评估指标CA-SDRi在重复标签下失效。
实验在DCASE25T4基线系统上验证,结果表明: - 所提方法能有效处理同类别源,提升系统在含重复标签混合物上的性能。 - CA-PI-SDRi指标在有无同类别源的混合物上均表现稳健,优于原CA-SDRi。 - 方法可扩展至其他LQSS和S5系统,代码已作为DCASE 2026挑战赛基线发布。
该研究通过创新损失函数和评估指标,解决了音频语义分割中同类别源处理的难题,提升了系统在现实场景下的实用性和评估准确性。
该研究通过信息论分析揭示SSL模型噪声鲁棒性不足,并提出解耦的语音聚合层,在语音增强中有效平衡声学与语义目标,为噪声环境下语音处理提供了新视角。
语音欺骗攻击、说话人验证漏洞和恶意语音数据操纵已成为人工智能和机器学习系统中的关键安全威胁。深度学习和语音合成技术的快速发展,特别是深度伪造,对维护基于语音的安全系统和生物特征认证机制的完整性带来了前所未有的挑战。语音克隆等攻击在关键领域(如医疗文档和银行生物识别)中导致未经授权访问的风险增加,而现有法律框架不足,阻碍了语音数据(包括深度伪造)在未来的广泛应用。
本研究提出了一种新颖的掩蔽能量扰动(MEP)方法,用于对抗说话人识别系统中的误分类。该方法利用功率谱对原始语音数据进行能量掩蔽,在频域中对小能量区域应用掩蔽,然后生成对抗性扰动,针对人类听觉模型不易察觉的区域。MEP 方法包括基本 MEP 攻击和迭代 MEP(I-MEP)攻击,通过梯度下降生成对抗样本,同时使用能量掩蔽来最小化感知失真。该方法结合了心理声学原理,选择性扭曲高能量语音成分,同时保持感知质量。
实验在 LibriSpeech 数据集上进行,使用了预训练的说话人识别模型(如 ResNetSE34-L、ResNetSE34-V 和 ECAPA-TDNN)。评估指标包括感知语音质量评估(PESQ)、信噪比(SNR)和等错误率(EER)。结果显示,I-MEP 攻击方法在所有模型中取得了最高的 PESQ 分数(3.7657 至 3.7709)和 SNR 值(38.07 至 38.14 dB),表明其在保持音频质量方面表现最佳。在 EER 评估中,MEP 和 I-MEP 方法相比基线和其他攻击方法(如 FGSM、I-FGSM、MI-FGSM、PGD)显示出更高的攻击成功率,例如在 ResNet34-L 模型中,I-MEP 的 EER 达到 44.04%,而基线为 0.25%。
该研究提出的 MEP 方法在对抗说话人识别系统时,有效平衡了隐私保护和音频质量,通过能量掩蔽技术实现了高攻击成功率和低感知失真,为语音安全领域提供了创新的防御思路。
该研究通过系统优化自监督学习的核心组件,有效解决了临床语音分析中的数据稀缺和领域不匹配问题,为医疗音频领域的模型适配提供了重要方法论参考。
现有语音建模方法面临两个主要问题:1)语音token频率过高(通常12.5-50Hz),导致建模效率低下;2)现有的音节级token方法(如Sylber)仅限于英语朗读语音,缺乏通用性,且丢失了大量声学细节(如说话人身份)。
Sylber 2.0提出了一种通用的自监督音节嵌入框架,主要创新包括: - 多语言音节学习:扩展了原始Sylber框架,能够从多种语言和风格中学习音节结构 - 边界检测器:引入并行化音节边界检测,提高分割效率 - 辅助声学编码器:专门编码音节token中缺失的声学细节(如音色) - 连续嵌入空间:采用连续嵌入而非离散量化,避免多码本复杂性,更适合多语言场景 - 三组件token结构:每个音节token包含时长、内容嵌入和声学嵌入三个部分
Sylber 2.0通过创新的音节级编码框架,在保持极低token频率的同时实现了多语言通用性和高质量的声学重建,为高效语音建模提供了新的基础抽象。
现有基于LLM的合成AI角色在设计和产品决策中存在以下关键问题: 1. 响应不可验证:提示驱动的角色扮演常产生有说服力但无法验证的响应,掩盖了证据基础 2. 缺乏系统证据检索:现有方法依赖预计算统计摘要或提示工程,缺乏实时证据检索和验证机制 3. 幻觉风险:LLM容易产生看似合理但未经证实的用户观点,存在身份误传和合成数据可靠性问题 4. 透明度不足:缺乏数据来源追踪和响应生成过程的透明度,影响用户信任
PersonaCite系统通过以下创新机制解决上述问题: 1. 检索增强的角色模拟:在每次对话轮次中实时检索实际的VoC(客户声音)数据 2. 证据约束响应:将LLM响应严格限制在检索到的证据范围内 3. 显式知识缺口确认:当证据不足时,系统明确放弃回答而非生成推测性响应 4. 响应级来源归属:为每个声明提供底层VoC数据源的追踪和引用 5. 代理上下文工程:采用ACE方法确保提供正确的证据作为上下文,避免简洁偏见和上下文崩溃
通过14位行业专家的半结构化访谈和部署研究,获得以下初步发现: 1. 反应模拟价值:参与者认为反应模拟在早期设计探索、快速迭代和利益相关者对齐方面具有显著价值 2. 补充而非替代:接地气的角色是直接用户参与的补充工具,而非替代品 3. 透明度关键性:信任AI角色的基础在于数据来源和响应生成的透明度 4. 工作流程优势:能够在用户招募前测试多个设计概念被视为重要的工作流程优势 5. 验证机制认可:参与者特别赞赏来源归属和显式知识缺口确认功能
PersonaCite通过将AI角色重新定义为证据约束的研究工具,在保持响应说服力的同时显著提升了可验证性和透明度,为负责任的人本设计工作流程提供了创新解决方案。
该研究通过融合EEG注意力线索与音频处理,为人工耳蜗在复杂听觉场景中的认知自适应处理提供了紧凑、低延迟且鲁棒的解决方案,显著提升了目标说话者分离性能。
传统十二音序列主义(经典序列主义)在构建序列时,通常基于音符之间的音程保持不变,这限制了作曲家在音程变化上的多样性,可能导致音乐材料重复或缺乏创新性。作曲家需要新的方法来扩展序列主义的可能性,以创造更丰富的音乐结构。
本文提出并研究了Jean Barraqué的增殖序列(proliferating series),这是一种基于数学群论的序列构建方法。核心创新在于:不再保持音程不变,而是保持两个连续序列之间音符的排列(即置换)不变。通过选择一个基础序列和其通过传统序列变换(如转位、逆行、倒影、逆行倒影)得到的第二个序列,定义从第一个序列到第二个序列的置换,然后重复应用该置换生成新的序列(增殖)。这种方法利用置换的循环结构,通过计算循环长度的最小公倍数来确定可生成的序列数量,从而提供更广泛的音程变化和音乐材料。
本文通过数学框架系统化地探索了增殖序列的潜力,为序列主义音乐创作提供了新的理论工具和实践方法,有望推动音乐创新。
论文针对小规模多模态情感识别数据集(如EAV数据集,仅42名参与者,约280个训练样本/受试者)中,复杂注意力机制(如Transformer)可能因过拟合和破坏预训练特征而性能不佳的问题。研究探讨了在数据有限的情况下,是否应优先采用基于领域知识的简单特征工程而非复杂架构。
该研究通过系统实验证明,在小数据集多模态情感识别中,基于领域知识的简单特征工程比复杂注意力机制更有效,为资源有限场景提供了实用指导。
论文针对在野外(in-the-wild)语音数据上训练文本转语音(TTS)系统的挑战,包括环境噪声和声学条件导致的转录错误、以及自发语音中韵律和说话风格的多样性(如犹豫、填充词和可变节奏)使时长建模更加困难。
该研究通过结合语音增强、非自回归架构和系统提示分析,有效提升了零样本TTS在野外语音数据上的性能,为现实语音生成提供了实用解决方案。
音频深度伪造检测(ADD)现有方法主要依赖局部或成对特征交互,忽略了高阶交互(HOIs),导致难以捕捉合成音频中跨多个声学维度的协同伪影,限制了检测的泛化能力。
提出HyperPotter,一种基于超图的框架,通过聚类超边和类感知原型初始化,显式建模高阶协同交互。关键组件包括:关系伪影放大模块和原型导向的超边初始化机制,以增强信息性协同伪影并高效构建关系。
在11个数据集上平均相对增益22.15%,在4个跨域数据集上超越最先进方法13.96%,展示了在多样化攻击和说话者条件下的优越泛化性能。
该研究首次从信息论角度探讨音频深度伪造检测中的高阶效应,通过超图建模协同依赖,为提升检测泛化性提供了有效路径。
传统WaveFit声码器在使用自监督学习(SSL)特征时面临两个主要问题:1)无法利用信号处理知识进行手工噪声采样,只能从高斯噪声开始推理;2)无法利用梅尔频谱图的能量信息进行增益调整,需要模型隐式学习能量预测。
WaveTrainerFit在WaveFit基础上引入两个关键改进: 1. 可训练先验:通过变分自编码器(VAE)学习目标语音的先验分布,使推理可以从接近目标语音的噪声开始,而非高斯噪声 2. 参考感知增益调整:对可训练先验施加约束以匹配语音能量,使声码器无需隐式学习能量预测任务
WaveTrainerFit通过引入可训练先验和参考感知增益调整,有效解决了SSL特征声码化中的噪声采样和能量预测问题,在保持高质量输出的同时显著提升了推理效率。
外部声场插值是一个具有挑战性的问题,传统方法通常需要特定的麦克风阵列配置和先验的源条件知识。现有方法如球面波函数展开(SWF)对正则化和麦克风分布敏感,而点神经元网络(PNN)等数据驱动方法在训练时可能因声压在源位置发散而困难。
本文提出了一种基于高斯过程回归(GPR)的插值方法,使用具有可训练内积公式的点源再生核来拟合外部声场。该方法的核心创新包括: 1. 物理约束核设计:基于非齐次亥姆霍兹方程的外部波函数解定义再生核希尔伯特空间(RKHS),确保满足物理约束。 2. 参数化加权内积:引入径向权重函数(如指数衰减形式),自动衰减高阶谐波分量,参数α和β可从数据中优化。 3. 灵活性与通用性:不限制麦克风分布,允许任意麦克风阵列配置,通过核岭回归(KRR)进行系数估计。
在数值模拟中,将所提方法(Proposed)与球面波函数展开(SWF)和点神经元网络(PNN)进行比较: - 性能指标:在100 Hz至2.5 kHz频率范围内,所提方法平均降低插值误差约2 dB(归一化均方误差,NMSE)。 - 阵列鲁棒性:在球形t-design阵列和随机分布阵列上均表现一致,优于对比方法。 - 重建质量:在目标区域内更一致地重建真实声场,归一化平方误差(NSE)分布更优。
该研究通过物理约束核与数据驱动优化相结合,为外部声场插值提供了一种灵活且高性能的解决方案,显著提升了插值精度和阵列鲁棒性。
ARCHI-TTS通过创新的对齐器和高效推理设计,在保持高质量零样本语音合成的同时,显著提升了计算效率,为实用化部署提供了新思路。
论文针对分布式多输入多输出(D-MIMO)网络中的载波相位定位(CPP)问题,指出现有研究对相位同步误差的影响探索不足。这些误差会显著降低定位精度,而实际应用中还需满足低延迟要求,因此需要降低模型复杂度。
该论文通过深度学习优化AP选择,有效解决了D-MIMO中相位同步误差导致的定位精度下降问题,同时降低了计算复杂度,为6G部署提供了实用解决方案。
好的,作为一名专业的AI领域研究员,我已详细阅读了您提供的论文内容。以下是我为您撰写的中文深度总结。
1. 核心痛点 这篇论文旨在解决一个新兴且关键的问题:如何准确、自动化地评估多轮语音对话中的社会危害性内容(如暴力、骚扰、仇恨言论)的安全性?
现有方法的不足主要体现在三个方面: * 文本中心化:当前的安全评估主要依赖对话的文本转录,完全忽略了音频特有的副语言线索(如语气、重音、情绪)和环境信号(如背景噪音),而这些信息对理解意图和危害程度至关重要。 * 转录瓶颈:自动语音识别(ASR)系统(如Whisper)的转录错误会直接影响基于文本的评估的准确性,导致漏判或误判。 * 缺乏对话结构:现有的语音毒性数据集主要标注孤立的单句,缺乏对多轮对话中上下文延续、话轮转换和意图演变的考量,而这正是真实语音交互的核心特征。
2. 方法创新 作者并未提出一个全新的模型,而是构建了一个系统性的评测基准和研究框架,以科学评估现有大型音频-语言模型作为“安全法官”的能力。其核心创新在于:
可控的基准数据集构建:
系统化的评估框架:
3. 实验结果 在作者构建的包含24,000个可控不安全对话变体的基准上,对多个LALM法官配置进行了全面测试。主要发现如下:
4. 一句话评价 这篇论文的价值在于首次系统性地构建了多轮语音对话安全评估的基准,并揭示了将LALM用作“安全法官”时在模型架构、输入模态和实际部署条件(如转录质量)之间存在的复杂权衡关系,为研究者和从业者提供了宝贵的实证洞察和可操作的配置指南。
好的,作为一名专业的AI领域研究员,我已详细阅读了您提供的论文内容。以下是我为您撰写的中文深度总结。
这篇论文旨在解决低资源语言(以匈牙利语为例)的对话式语音识别(Conversational ASR) 所面临的核心挑战。具体问题包括: * 数据稀缺:真实、大规模、标注良好的多说话人对话数据,尤其是对于匈牙利语这类资源较少的语言,极其匮乏。 * 建模复杂性:真实对话中存在复杂的时序动态,如快速话轮转换、语音重叠、个性化的停顿习惯等,这使得在纯净单人语音数据上训练的ASR模型泛化能力差。
现有方法的不足: * 早期拼接方法:简单地将不同说话人的孤立语音片段随机拼接,完全忽略真实对话的时序模式,导致生成的对话极不自然。 * 统计话轮模拟方法:虽然通过从真实对话中学习停顿和重叠的统计分布来改进时序,但假设所有说话人具有相同的时序行为,忽略了说话人个体间的差异(例如,有些人习惯快速回应,有些人则习惯长停顿)。 * SASC方法的局限性:尽管说话人感知模拟对话(SASC)通过为每个说话人建模独立的时序分布,显著提升了模拟的真实性,但其假设话轮间的停顿与即将到来的话语长度无关。然而,人类对话中,计划性长话轮前通常有较长停顿,而简短回应则紧随其后,这种局部时序依赖在SASC中未被建模。
作者提出了两项核心创新:
SASC框架的匈牙利语适配与应用:首次将说话人感知模拟对话(SASC) 框架应用于英语以外的语言(匈牙利语)。该框架的核心是使用马尔可夫链模型模拟话轮转换,并为模拟对话中的每个虚拟说话人学习并应用其个性化的时序分布(如停顿长度、重叠概率),从而在合成对话中保持说话人个体的一致性。
提出C-SASC扩展框架:在SASC的基础上,作者提出了条件SASC(C-SASC)。这是本文的主要方法创新。
这篇论文的价值在于,它不仅成功地将先进的说话人感知对话模拟技术推广至低资源语言(匈牙利语),验证了其普适性,更通过提出C-SASC框架,在保持方法简洁性的同时,巧妙地引入了更符合人类对话习惯的局部时序依赖建模,为合成对话数据的真实性设立了新的、可操作的基准,并对其增益的条件性和局限性进行了严谨分析,对推动对话式ASR的数据增强研究具有重要的理论和实践意义。
好的,作为一名专业的AI领域研究员,我已详细阅读了您提供的论文内容。以下是我为您撰写的深度总结:
这篇论文旨在解决自动语音识别和语音增强模型在跨域场景下的性能严重退化问题。具体来说,当预训练的ASR和SE模型遇到训练时未见的噪声类型或录音信道(如不同麦克风、设备) 时,其性能会急剧下降。这种“域不匹配”是实际应用中的主要瓶颈。
现有方法的不足主要体现在: * 处理单一:大多数现有方法要么只针对噪声适应,要么只针对信道适应,缺乏一个能同时处理两种失真的统一框架。 * 模拟粗糙:现有的数据模拟方法通常只捕捉粗粒度的域特性,忽略了细粒度的、语句级别的变化,这限制了模型的鲁棒泛化能力。 * 依赖数据或过程复杂:传统的域适应方法(如对抗训练)通常需要大量目标域标注数据或复杂的训练流程,在实际中难以扩展。
作者提出了一个名为 URSA-GAN 的统一、领域感知的生成对抗网络框架。其核心创新点如下:
模型架构:
关键训练策略与损失函数:
论文在多个数据集和任务上进行了广泛评估: * ASR任务:在跨信道条件下测试(如用不同设备录制的语音)。 * SE任务:在多种噪声环境下测试。 * 混合测试集:构建了同时包含噪声和信道退化的复合挑战性测试集,以验证模型在复杂真实场景下的能力。
性能提升: * 在复合测试条件下,URSA-GAN在ASR任务上取得了16.16% 的相对字符错误率降低,在SE任务上取得了15.58% 的感知指标提升。 * 实验结果表明,URSA-GAN在各类跨域场景下均能一致地提升模型鲁棒性和泛化性能,显著优于现有方法。
这篇论文的价值在于提出了首个能统一、精细化地联合建模噪声与信道失真的生成式域适应框架,并通过创新的动态扰动机制实现了高效、强泛化的跨域语音处理,为ASR和SE模型走向复杂多变的现实世界应用提供了切实可行的解决方案。
好的,作为一名专业的AI领域研究员,我已详细阅读了您提供的论文内容。以下是我为您撰写的中文深度总结。
这篇论文旨在解决一个新兴且关键的问题:如何提升基于离散语义令牌(Token)的自动语音识别(ASR)系统在噪声环境下的鲁棒性。
作者的核心创新在于系统性地提出并比较了四种不同输入/输出域的前端增强策略,旨在为令牌ASR提供噪声鲁棒的输入令牌。所有前端模块均独立于ASR后端进行训练,保证了模块化和可替换性。
四种前端增强模型: 1. Wave-to-Wave (W2W-E):传统语音增强。输入噪声波形,输出增强后的波形。增强后的波形仍需经过SSL模型和令牌化流程,才能输入令牌ASR。 2. Token-to-Token (T2T-E):令牌级增强。直接输入噪声令牌序列,通过一个网络(如带嵌入层的SLM架构)映射到增强后的令牌序列。 3. Vector-to-Token (V2T-E):连续特征到令牌的增强。输入从SSL模型提取的加权和连续特征,通过一个分类器(如MLP、E-Branchformer、TCN)直接预测增强后的令牌。该方法旨在蒸馏k-means的量化知识并融入噪声不变性。 4. Wave-to-Token (W2T-E):波形到令牌的增强。这是本文重点验证的有效方法。直接以噪声波形为输入,微调整个SSL模型(在其顶部添加一个线性分类层),使用CTC损失函数,使其直接输出干净的令牌序列。
关键训练细节: * 训练目标:对于令牌输出型前端(T2T-E, V2T-E, W2T-E),作者采用在去重后令牌上的CTC损失进行训练,实验表明其性能略优于在重复令牌上的交叉熵损失。 * 模块化设计:所有增强前端与ASR后端解耦训练,增强了系统的灵活性和可维护性。 * 特征利用:在V2T-E中,创新性地使用了SSL模型所有层的加权和特征,以捕获分层语音信息。
这篇论文通过首次系统性地探索不同域的前端增强策略,不仅证明了为离散令牌ASR设计专用增强模块的必要性和有效性,更关键地发现了“波形直接到令牌”(W2T-E)这一简洁而强大的方案,能够在噪声鲁棒性上超越主流的连续特征ASR,为构建既高效又鲁棒的新一代语音处理系统奠定了重要的方法论基础。
好的,作为一名专业的AI领域研究员,我已详细阅读了您提供的论文内容。以下是我为您撰写的中文深度总结:
这篇论文旨在解决语言引导的视听分割任务中一个被忽视的关键问题:在缺乏真实标注(参考)的情况下,如何自动评估生成的分割掩码的质量。
作者为解决上述问题,提出了一个完整的解决方案,包括一个新任务、一个新基准和一个新模型。
新任务(MQA-RefAVS):正式定义了“参考自由的掩码质量评估”任务。给定视频、音频、参考文本和一个候选掩码,模型需要输出三项评估:
新基准(MQ-RAVSBench):为了系统研究该任务,作者基于Ref-AVSBench数据集构建了首个专门用于掩码质量评估的基准。其核心创新在于自动化构建了覆盖多种常见失败模式的掩码:
Full_neg),模拟目标识别错误。新模型(MQ-Auditor):提出一个基于多模态大语言模型的审计员模型。
这篇论文的价值在于,它超越了视听分割领域传统的“生成-评估”范式,首次系统性地提出并解决了“参考自由掩码质量评估”这一关键的后处理与可靠性保障问题,通过构建专用基准和模型,为构建更可靠、可解释、闭环的自动化分割系统铺平了道路。
好的,作为一名专业的AI领域研究员,我已详细阅读了您提供的论文内容。以下是我为您撰写的深度总结:
这篇论文旨在解决音视频视频高光检测任务中的一个关键问题:现有模型未能充分利用音频模态的丰富信息。具体而言: * 现有方法的不足:当前的主流方法(如基于Transformer的多模态模型)通常将音频视为一个次要或辅助模态。它们大多依赖预训练的音频模型(如PANNs)提取高层语义特征(例如,识别语音、音乐等类别),但完全忽略了音频信号本身固有的、丰富的“谱时动态特性”。 * 动态特性的重要性:论文指出,许多视频高光时刻(如笑声、爆炸声、掌声、突然的静默)恰恰是由瞬态的、能量快速变化的声学事件所标志的。这些事件在频谱图上表现为特定频带的能量突变。仅依赖高层语义(“听到了什么”)而忽略这些低层动态(“声音如何演变”),导致模型无法精准捕捉高光时刻的时序动态,预测结果往往过于平滑,与真实的高光分布不匹配。
作者提出了一个名为 DAViHD 的新框架,其核心创新在于设计了一个双通路音频编码器,以同时建模音频的语义内容和谱时动态。 * 模型架构: 1. 视觉编码器:使用预训练的CNN提取帧级特征,并通过自注意力捕获长程依赖。 2. 双通路音频编码器: * 语义通路:使用预训练的PANN模型处理原始音频波形,按1秒分段提取高层语义嵌入(回答“听到了什么”)。 * 动态通路:这是一个精心设计的模块,以对数梅尔频谱图为输入,专门捕捉低层动态特性。其核心是一个多分支架构: * 从原始频谱图生成时间注意力图和显著性门控。 * 从帧间差分频谱图生成速度注意力图,以显式建模变化速率。 * 将这些注意力信息与全局上下文结合,生成一个控制向量。 * 该控制向量动态地调制一组频率动态卷积的基础核,从而生成一个自适应的、频率感知的滤波器来处理频谱图。这使得卷积操作能够打破传统2D卷积将时-频轴视为空间等价的限制,更贴合声音的物理特性。 3. 音频特征融合:在融合前,分别对语义和动态特征进行早期自注意力处理,以捕获各自流内的时序依赖。然后使用逐元素相乘进行融合,让动态特征作为门控来调制和增强语义特征中的显著信息。 4. 多模态融合与预测:融合后的音频特征与视觉特征通过双向交叉注意力进行交互,并保留残差连接。最后,将原始特征和交叉增强后的特征拼接,通过一个MLP回归得到帧级高光分数。 * 损失函数:采用均方误差作为损失函数,直接优化预测的高光分数与真实分数之间的差距。
这篇论文的价值在于,它首次系统性地论证并实现了对音频模态“谱时动态特性”的深度建模,通过创新的双通路音频编码器设计,将“听到什么”与“声音如何变化”相结合,为音视频高光检测这一任务提供了更丰富、更精确的音频表征,从而显著推动了该领域的性能边界。
好的,作为一名专业的AI领域研究员,我已详细阅读了您提供的论文内容片段。以下是我为您撰写的中文深度总结。
论文标题: 《通过测试时缩放解码音频-语言模型中的模糊情感》
这篇论文旨在解决语音情感识别领域的一个根本性难题:现实世界中的情感表达往往是模糊、重叠且依赖于语境的,而现有主流方法将其简化为一个离散的分类问题(如“高兴”、“悲伤”),无法有效捕捉这种复杂性。
现有方法的不足主要体现在三个方面: * 建模局限: 传统方法依赖清晰、单一的“多数投票”标签,忽略了情感固有的模糊性和主观性,导致模型在面对真实、微妙的情感表达时性能不可靠。 * 数据瓶颈: 高质量、标注了模糊情感的数据集稀缺且标注成本极高,因为即使是人类专家也难以对模糊情感达成一致。 * 新模型能力未明: 新兴的大规模音频-语言模型(ALMs)通过多模态预训练,展现出无需显式情感监督即可进行细致推理的潜力。然而,它们处理模糊情感的能力尚未得到系统性的探索和评估。同时,在推理阶段提升模型性能的测试时缩放(TTS) 技术(如思维链提示、搜索-验证)在NLP任务中效果显著,但其在情感计算,特别是处理模糊情感方面的有效性仍是未知的。
作者并未提出一个全新的端到端模型,而是构建了首个针对ALMs在测试时缩放下的模糊情感识别基准,并进行了系统性分析。其创新性体现在方法论框架和评估体系上:
这篇论文的价值在于首次系统性地架起了测试时缩放技术与音频-语言模型处理模糊情感能力之间的桥梁,通过建立一个严谨的基准和分析框架,为开发更稳健、情境感知且具有情感智能的语音AI系统奠定了重要基础。
好的,作为一名专业的AI领域研究员,我已详细阅读了您提供的论文内容片段。以下是我为您撰写的中文深度总结。
论文标题: 《面向印度农业场景的自动语音识别基准测试》
这篇论文旨在解决一个具体而紧迫的现实问题:如何为印度农业领域的多语言语音交互服务,构建和评估可靠、实用的自动语音识别系统。
本文的核心贡献并非提出一个新的ASR模型,而是构建了一套全面的、面向农业领域的ASR评估基准框架。其创新点主要体现在评估方法论上:
这篇论文的价值在于,它首次为低资源、高噪音的农业领域多语言ASR应用建立了一个严谨、实用且以领域效用为核心的评估基准,不仅揭示了当前技术的性能边界与挑战,更通过创新的评估指标和细致的错误分析,为未来面向现实世界应用的ASR系统研发与选型提供了至关重要的路线图和决策依据。
好的,作为一名专业的AI领域研究员,我已详细阅读了您提供的论文内容。以下是我的深度总结:
这篇论文旨在解决视觉引导的音频高亮任务中的核心挑战。该任务的目标是,根据伴随的视频内容,自动调整(重新混音)一个平衡不佳的音频,使音频的重点(如人声、特定音效)与视觉焦点(如说话的人、关键动作)对齐,从而创造更和谐的视听体验。
现有方法的不足主要体现在两个方面: * 建模范式不当:先前的工作采用判别式模型,试图学习从“差混音”到“好混音”的一对一映射。然而,音频重混音本质上是多对多的任务——同一个视频场景可以有多种合理的“好混音”方式,也可以由多种“差混音”方式生成。判别式模型难以捕捉这种分布间的复杂映射关系,导致性能受限。 * 误差累积与跨模态对齐困难:当采用基于流的生成模型时,模型需要在早期步骤就决定增强或抑制哪些声源。早期的微小预测错误会在迭代生成过程中不断累积和放大,导致最终轨迹偏离目标分布。此外,现有方法将视觉特征直接输入主模型,迫使主模型在完成音频回归的同时,还需隐式地学习音频与视觉的对应关系,增加了学习难度。
作者提出了一个名为 条件流匹配 的生成式框架,并引入了两项关键创新:
核心框架:条件流匹配
创新一:滚动损失
创新二:改进的条件模块
这篇论文的价值在于,它通过将视觉引导音频高亮任务范式性地从判别式转向生成式,并针对生成式流模型在该任务中的两大核心挑战——误差累积和跨模态对齐——提出了精巧而有效的解决方案(滚动损失与早期融合条件模块),从而在理论和实践上均显著推进了该领域的发展,确立了生成建模在此类视听协同任务上的优越性。
好的,作为一名专业的AI领域研究员,我已详细阅读了您提供的论文内容。以下是我为您撰写的中文深度总结。
论文标题: A Unified SVD-Modal Solution for Sparse Sound Field Reconstruction with Hybrid Spherical-Linear Microphone Arrays
1. 核心痛点 这篇论文旨在解决在混响环境中,使用混合球面-线性麦克风阵列进行稀疏声场重建时,如何有效融合两种阵列数据以提升重建精度和鲁棒性的问题。 * 现有方法的不足: * 仅使用球面麦克风阵列(SMA): 受限于有限的球谐函数阶数,在低频时分辨率不足,在高频时则会出现空间混叠。 * 直接级联法: 将SMA和线性麦克风阵列(LMA)的观测数据简单拼接后处理。由于LMA通道对房间混响高度敏感,这种直接融合会引入虚假成分,严重损害稀疏重建的性能。 * 残差精炼法(RR): 作者先前提出的两阶段方法(先用SMA做初始估计,再用LMA残差进行精炼)虽然有效,但仍是一种启发式设计,缺乏一个统一、原则性的理论框架来处理混合阵列的几何结构。
2. 方法创新
作者提出了一种基于奇异值分解(SVD)的统一模态框架,将混合阵列视为一个整体进行建模。
* 核心思想: 对描述声场(平面波方向)到麦克风观测之间映射关系的传递算子进行SVD分解。
* 具体步骤:
1. 模态分解: 对传递矩阵 H(f) 进行SVD:H(f) = U(f)Σ(f)V^H(f)。其中,U(f) 的列向量构成正交的“麦克风模态”,V(f) 的列向量构成正交的“声场模态”,Σ(f) 为按耦合强度(奇异值大小)降序排列的对角矩阵。
2. 降维与白化: 保留前 K 个主导奇异值及对应的模态(U_K, V_K),将观测数据投影到 U_K 上,并用 Σ_K 的逆进行白化,得到一个稳定、正交且按重要性排序的模态字典 \tilde{H}(f)。
3. 稀疏求解: 在新的模态字典下,求解一个带混合 ℓ_{2,p} 范数约束的优化问题,以估计稀疏的平面波系数。
* 方法的优势:
* 统一性: 为SMA和LMA的组合提供了一个原则性的数学框架。当仅使用SMA时,该方法自动退化为经典的球谐函数处理。
* 数据驱动: 模态基由阵列的几何结构和声学传递特性直接决定,能自适应地捕捉混合阵列的互补空间信息。
* 鲁棒性: SVD天然地对模态进行排序和正则化,抑制了噪声和混响对弱耦合模态的影响,从而提升了在恶劣声学环境下的重建稳定性。
3. 实验结果 * 测试设置: 在仿真混响环境中进行评估。使用一个由64元SMA和4个8元LMA组成的混合阵列。房间尺寸为10×8×3米,混响时间(RT60)为0.3秒。声源为2到10个不等的语音平面波,距离为1.5米至3.5米。使用迭代重加权最小二乘法(IRLS)进行稀疏重建。 * 评估指标: 能量图失配(衡量空间能量分布的准确性)和角度误差(衡量声源定位的准确性)。 * 性能对比: 与基线方法(仅SMA、直接级联法、残差精炼法RR)相比: * 能量图失配: 所提出的SVD模态方法(使用9、16、25个模态)在所有频率、声源距离和数量下,均显著且一致地低于仅SMA和直接级联法,与RR方法性能相当或更优。 * 角度误差: 所提方法、直接级联法和RR的定位精度相近,均明显优于仅SMA的方法。增加模态数量可以进一步降低角度误差,但可能会轻微增加能量图失配(存在任务依赖的权衡)。 * 模态分析: 通过主角度分析证实,SVD导出的模态与经典球谐函数基存在频率依赖的偏差,尤其是在低频和高频(超过混叠极限)时,SVD模态能提供更稳定、更具空间选择性的表示。
4. 一句话评价 这篇论文的价值在于,它超越了简单的数据融合启发式方法,通过引入一个基于SVD的统一模态分析框架,为混合麦克风阵列的声场处理提供了坚实的数学基础,显著提升了在真实混响环境中进行高分辨率稀疏声场重建的鲁棒性和准确性。
好的,作为一名专业的AI领域研究员,我已详细阅读了您提供的论文内容。以下是我为您撰写的中文深度总结。
这篇论文旨在解决一个在AI语言技术领域普遍存在但常被忽视的问题:对低资源方言,特别是其语音模态的支持严重不足。
作者的核心贡献并非提出一个全新的模型架构,而是创造性地构建并发布了一个高质量、多用途的方言语音数据集,并以此为基础展示了如何高效利用小规模数据适配现有SOTA模型。其方法是一个系统性的数据处理与模型适配流程:
数据集的构建与处理流程:
模型适配策略:
这篇论文的价值在于,它通过一个优雅的、多学科交叉的数据工程实践,不仅填补了克罗地亚语方言语音数据集的空白,为低资源语言AI研究提供了可复制的范式,更在技术层面验证了“小数据”驱动“大模型”适配的有效性,同时为文化遗产的数字化保存与活化开辟了切实可行的路径。
好的,作为一名专业的AI领域研究员,我已详细阅读了您提供的论文内容。以下是我为您撰写的中文深度总结:
这篇论文旨在解决语音深度伪造检测中前端特征提取器的设计难题。现有方法主要分为两类,各有显著不足: * 传统数字信号处理特征:如梅尔频谱、LFCC等。这些特征透明、可解释、计算高效,但因其手工设计的滤波器组存在频谱平滑效应,难以捕捉深层语义细节和细微的声学伪影,导致检测性能存在瓶颈。 * 自监督学习特征:如XLSR、HuBERT等。这些特征鲁棒性强、性能优越,但它们是数据驱动的“黑箱”模型,缺乏可解释性,且计算成本高,在需要提供透明、可复现科学证据的音频取证场景中,其不可解释性是一个根本性缺陷。
作者提出了一个名为 “WST-X系列” 的新型特征提取器家族,其核心是首次将小波散射变换引入语音深度伪造检测。 * 核心组件:小波散射变换:WST是一种无需训练的数学算子,通过级联小波模运算和低通滤波,能够生成对信号平移和形变具有不变性和稳定性的表示。它可被视为深度卷积网络的数学对应物,兼具物理可解释性和分层特征提取能力。 * WST-X系列架构:作者设计了两种集成策略,将WST与强大的自监督模型(采用提示微调的XLSR-300M)相结合,以融合两者的优势: * WST-X1(并行集成):采用双分支并行架构。一个分支对原始波形进行1D WST,提取精细的时域声学细节;另一个分支使用PT-XLSR提取高层语义特征。两路特征经对齐后拼接。 * WST-X2(级联集成):采用单一路径级联架构。首先用PT-XLSR处理波形,得到高维潜在特征图;然后将其视为“图像”,输入2D WST进行处理,以捕捉特征图内部的时间动态和通道间的结构相关性(如谐波、共振峰过渡等)。 * 关键参数洞察:通过实验分析,作者发现对于检测任务,较小的平均尺度J(保留高频细节)结合较高的频率分辨率Q和方向分辨率L,对于捕捉生成语音中的细微伪影至关重要。
这篇论文的价值在于,它创造性地将具有严格数学基础和良好可解释性的小波散射变换与高性能的自监督学习模型相结合,为语音深度伪造检测提供了一类性能强劲且可解释的新型特征提取方案,在追求检测性能与模型透明度之间取得了重要平衡。
好的,作为一名专业的AI领域研究员,我已详细阅读了您提供的论文内容片段。以下是根据您要求的结构撰写的深度总结:
这篇论文旨在解决撒哈拉以南非洲语言在语音技术领域面临的数据严重匮乏问题。具体而言: * 问题:语音技术(如自动语音识别ASR和文本转语音TTS)的发展严重偏向高资源语言(如英语、中文),导致全球超过1亿使用非洲语言的用户无法享受其便利,形成了巨大的“数字鸿沟”。 * 现有方法的不足: * 数据规模小:现有的非洲语言语音数据集(如来自广播档案或特定项目的数据)通常规模有限,覆盖的语言和说话人多样性不足。 * 覆盖范围窄:虽然存在一些大规模多语言数据集(如Common Voice、FLEURS),但它们对非洲语言的覆盖仍然非常有限,无法满足训练鲁棒模型的需求。 * 数据质量与类型单一:缺乏同时包含大规模、高质量、自然口语(用于ASR)和高质量、单说话人录音(用于TTS)的统一资源。
本文的核心贡献并非提出新的算法模型,而是构建并发布了一个大规模、高质量、多语言的非洲语言语音数据集——WAXAL。其创新性体现在数据集的构建方法论上: * 数据集构成: * ASR数据集:包含约1,250小时的自然口语录音,覆盖14种语言。采用图像提示的方式,让说话人描述图片,以收集更自然、多样的自发语音(而非朗读文本)。 * TTS数据集:包含超过180小时的高质量、单说话人录音,覆盖10种语言。录音在类似专业录音室的环境中进行,使用音素平衡的脚本,旨在构建高保真度的TTS系统。 * 协作式数据收集:项目与非洲本土的四所学术和社区机构(如加纳大学、麦克雷雷大学等)深度合作,确保数据收集过程符合本地语言习惯和文化背景,并雇佣本地语言专家进行转录。 * 严格的质量控制与伦理规范: * 对ASR数据进行了人工转录(覆盖10%的音频)和质量检查,移除个人身份信息。 * 所有参与者均签署知情同意书,转录员获得高于当地平均水平的报酬。 * 数据集以宽松的CC-BY-4.0许可证公开发布,鼓励学术和商业用途。
本文是一篇数据集论文,因此没有像模型论文那样报告在标准测试集上对比SOTA模型的性能提升。其“实验结果”主要体现在对数据集本身的详细统计和分析上: * 测试/验证基础:论文提供了WAXAL数据集的全面统计信息,包括各语言的录音时长、话语数量、说话人的人口统计分布(年龄、性别)等(如图2、3、4和表1所示)。这些统计数据本身即为后续研究提供了评估基准。 * 性能体现:数据集的“性能”通过其规模、质量和多样性来体现: * 规模:总计超过1,400小时的标注语音数据,是当前针对该地区语言最大规模的公开资源之一。 * 质量:ASR数据源自自然口语,TTS数据为专业录音室品质,并由专家转录。 * 多样性:覆盖21种语言(ASR 14种, TTS 10种,有重叠),涉及超过100万使用者,说话人 demographics 分布广泛。 * 对比基线:论文在“相关工作”章节中明确指出,WAXAL在数据规模和覆盖语言数量上显著超越了之前针对撒哈拉以南非洲语言的特定数据集(如ALFFA项目、BibleTTS等)。
这篇论文的价值在于通过构建并开源一个大规模、高质量、伦理规范的多语言非洲语音数据集,为填补全球语音技术的“数字鸿沟”提供了至关重要的基础设施,有望直接推动面向非洲语言的包容性AI技术的研究与发展。
好的,作为一名专业的AI领域研究员,我已详细阅读了您提供的论文内容。以下是我为您撰写的深度总结:
这篇论文旨在解决吞咽困难(Dysphagia)的早期、客观、非侵入性筛查难题。吞咽困难是影响老年人及特定疾病患者(如中风、帕金森病)的常见健康问题,可能导致吸入性肺炎等严重后果。
现有方法的不足主要体现在: * 诊断方法:当前金标准(如视频透视吞咽研究VFSS、纤维内镜吞咽评估FEES)虽然准确,但具有侵入性(需插入内窥镜)、有辐射风险(X光)、成本高昂且依赖专业医师操作,难以用于大规模、频繁的筛查。 * 筛查方法:临床床边吞咽评估虽简便,但主观性强、敏感性和特异性有限,导致临床决策存在不确定性。 * 新兴技术:已有研究探索使用加速度计、肌电图等信号结合机器学习进行检测,但普遍存在样本量小、未与金标准同步验证、测试食物单一等问题,限制了其临床有效性和泛化能力。
作者提出了一套基于颈部非侵入性声学传感与机器学习的自动化吞咽困难筛查框架。其核心创新在于数据采集的同步性和特征工程的针对性。
这篇论文的价值在于,它通过与金标准诊断同步的独特数据采集方式,结合针对性的特征工程,首次有力地证明了低成本、非侵入性的颈部声学传感结合机器学习,可以成为一种高精度、可扩展的吞咽困难自动化筛查工具,为弥补当前临床筛查手段的不足提供了极具前景的解决方案。
好的,作为一名专业的AI领域研究员,我已详细阅读了您提供的论文内容片段。以下是根据论文前部分内容撰写的深度总结。
这篇论文旨在解决3D打印领域面临的一个关键安全问题:通过声学侧信道攻击窃取打印模型的知识产权(IP)。具体来说,攻击者可以利用放置在打印机附近的录音设备(如智能手机、笔记本电脑的麦克风)采集打印过程中产生的噪音,通过分析这些声音信号,能够推断出打印喷头的运动轨迹,进而逆向还原出打印对象的G代码或三维模型。
现有方法的不足主要体现在防御方案上: * 硬件方案成本高昂且不实用:已有研究提出通过添加大型扬声器和放大器来产生掩盖噪音,但这需要约1000欧元的额外成本,并占用大量物理空间,难以在实际生产环境中部署。 * 缺乏有效的软件/算法级防护:尽管声学侧信道攻击已被多个研究证明是可行的,但论文作者指出,目前尚缺乏一种无需额外硬件、切实可行的防御方案来保护3D打印机免受此类攻击。
根据已提供的论文内容,作者的研究思路和初步方法创新点如下(请注意,完整方法细节在截断部分之后): * 核心思想:提出一种名为 “QuietPrint” 的防御方案,其最大优势在于无需任何额外硬件,仅通过对打印指令(G代码)进行最小程度的修改来实现安全防护。 * 方法论框架: 1. 系统性声源分析:首先深入分析了3D打印机噪音的多个来源(电源风扇、步进电机、冷却风扇),并评估了每种声源对信息泄露的贡献度。研究发现,喷嘴冷却风扇的噪音能量与喷头在X轴上的位置存在线性相关性,仅凭这一简单特征,攻击者就能较准确地定位喷头。 2. 威胁模型明确:聚焦于现实场景,假设攻击者使用普通设备(如笔记本电脑内置麦克风)进行录音,而非不切实际的专业设备。 3. 防御方向:基于上述分析,论文提出将通过混淆声学信息的方式来设计防御机制,目标是使得即使攻击者录下音频,也无法从中重建出原始打印模型。其实现途径是修改G代码,这暗示了可能通过注入伪装运动、调整运动参数等方式来破坏声音与运动轨迹之间的可预测映射关系。
根据已提供的内容,实验设置和初步发现如下: * 硬件平台:使用 Elegoo Neptune 3 熔融沉积成型(FDM)3D打印机作为测试对象。 * 数据采集:为模拟真实攻击场景,使用 Microsoft Surface Pro 7+ 笔记本电脑的内置麦克风 进行录音,摒弃了之前研究中使用的专业麦克风。 * 初步验证实验: * 攻击可行性验证:设计实验让喷头从X=0cm匀速移动到X=18cm,记录音频。通过计算音频能量(每100ms片段的绝对值之和)并取对数,发现log(能量)与水平移动距离呈线性关系。 * 简单攻击演示:利用上述线性关系作为“标定曲线”,在一个包含多个停顿点的复杂移动序列中,仅凭音频能量这一单一特征,就能相当准确地预测出喷头的实时位置。这强有力地证明了声学侧信道攻击的严重性和简易性。 * 核心结论:冷却风扇噪音是主要的信息泄露源,且利用简单特征即可实现有效攻击。这为后续设计针对性的防御方法(QuietPrint)提供了关键依据。
(注:关于QuietPrint方法的具体实现细节、完整的防御实验、与基线方法的对比量化结果(如重建错误率、信号混淆度等)在提供的片段中尚未出现,预计在论文第6、7节。)
这篇论文的价值在于,它首次系统性地分析并实证了3D打印机声学侧信道攻击的简易性与严重性,并创新性地提出了一种纯软件、零硬件成本的防御框架(QuietPrint),为保护增材制造领域的知识产权提供了一个极具实用前景和可部署性的安全解决方案。
好的,作为一名专业的AI领域研究员,我已详细阅读了您提供的论文内容片段。以下是我为您撰写的中文深度总结:
这篇论文旨在解决从稀疏测量中连续、高精度地重建房间脉冲响应这一核心问题。RIR是描述声学环境特性的关键,但密集测量耗时费力,不切实际。
现有方法的不足主要体现在以下几个方面: * 泛化性差:许多基于深度学习的方法(如CNN、PINN、隐式神经表示)需要针对每个新声学场景进行重新训练或微调,缺乏跨场景的泛化能力。 * 灵活性受限:部分方法(如将RIR视为图像进行修复的扩散模型)依赖于均匀网格的麦克风阵列,无法处理任意或随机布置的麦克风位置。 * 建模不全面:一些方法仅关注低频段、忽略相位信息,或只重建部分RIR(如仅早期反射或晚期混响),未能完整建模RIR的时域结构。 * 效率低下:基于扩散模型的方法需要大量去噪步骤,推理速度慢,难以满足实时或低延迟应用的需求。
作者提出了 RIR-Former,一个基于Transformer的、单步前馈的通用RIR重建框架。其核心创新点如下:
模型架构:
关键特性:
训练策略:
这篇论文的价值在于首次将坐标引导的Transformer与针对RIR时域特性的分段解码架构相结合,提出了一个兼具高精度、强泛化性、高计算效率和无网格灵活性的RIR重建框架,为声场重建在实际场景中的部署提供了有力的解决方案。
好的,作为一名专业的AI领域研究员,我已详细阅读了您提供的论文内容片段。以下是我为您撰写的中文深度总结。
论文标题: 时域耳蜗传输线模型的短波导纳修正
这篇论文旨在解决一个耳蜗计算模型中的关键矛盾:如何在一个时域一维传输线模型中,有效地整合并模拟二维流体力学效应,特别是短波区域的压力聚焦效应。
作者提出了一种创新的短波导纳修正方法,旨在将二维效应“注入”到时域一维模型中,从而构建一个新的混合模型(𝑉⋆模型)。
根据摘要和引言部分的描述:
这篇论文的价值在于创造性地通过系统辨识和滤波技术,将频域二维模型的物理洞见“翻译”并整合到时域一维框架中,不仅解决了特定物种模型适配的难题,更提供了一种普适的方法论,用于在高效时域仿真中兼顾多维物理效应。
好的,作为一名专业的AI领域研究员,我已详细阅读了您提供的论文内容。以下是我为您撰写的中文深度总结:
这篇论文旨在解决欺骗感知的说话人验证这一核心问题。在安全关键应用中,传统的自动说话人验证系统虽然能识别说话人身份,但极易受到重放、语音合成、语音转换等欺骗攻击。而独立的欺骗检测系统虽能识别伪造语音,却无法验证说话人身份。因此,在对抗性环境下,单独使用任何一种系统都是不足的。现有的SASV方法虽然尝试联合两者,但在如何有效整合预训练的ASV和CM模型、显式建模两者交互、以及如何针对特定应用场景进行优化方面,仍缺乏一个灵活、模块化且性能优异的统一框架。
作者提出了一种模块化、可训练的分数级融合SASV框架,其核心创新点在于:
˜ρ,用于显式控制说话人证据和欺骗证据的相对贡献,从而建模两者间的交互。这篇论文的价值在于提出了一个高度模块化、可解释且性能卓越的SASV框架,它通过可训练的非线性分数融合机制,巧妙地实现了预训练ASV与CM模型的深度协同与联合优化,为构建鲁棒且实用的欺骗感知说话人验证系统提供了清晰有效的技术路径和实证依据。
好的,作为一名专业的AI领域研究员,我已详细阅读了您提供的论文内容。以下是我为您撰写的中文深度总结。
这篇论文旨在解决语音识别中音素级建模的瓶颈问题。尽管基于词的大规模ASR系统已取得巨大成功,但在音素层面的进步却相对有限。现有方法存在两大根本性不足: * 监督信号不匹配:当前主流方法在训练音素识别模型时,过早地引入了词汇级监督(例如,使用G2P生成的“规范”音素序列作为目标)。这导致模型学习的目标(如“last Sunday”)与实际的声学信号(如“las[] Sunday”)存在差异,阻碍了模型充分利用声学-音素线索,并损害了后续的音系学和词汇推理能力。 * 处理机制僵化:人类的语音感知是一个动态、闭环、多路径的系统,能够根据声学证据的强弱和上下文,灵活地在自下而上(声学驱动)和自上而下(词汇、语境驱动)的处理模式间切换。而现有的AI系统通常采用单向、前馈的单一处理管道,缺乏对这种自适应、多路径感知动态的建模能力,因此在声学条件恶劣或语音不清晰时表现不佳。
作者提出了一个名为 HuPER 的模块化、受人类认知启发的语音感知框架。其核心创新在于将音素感知建模为声学证据与语言知识的自适应推理过程,并实现了多路径推理。框架包含四个关键组件: * HuPER-Recognizer(类似颞上回STG):负责自下而上的声学-音素感知。它是一个基于WavLM-Large的音素识别器。其核心训练策略是“双重稳健风险校正”自学习: 1. 在一个小规模标注数据集(如TIMIT)上训练初始识别器。 2. 将其应用于大规模仅有文本的数据集(如LibriSpeech),生成“教师”伪音素标签。 3. 引入一个校正器模型,学习将G2P生成的规范音素序列,通过编辑操作(保留、删除、替换、插入)转换为更贴近声学实际的“代理”音素标签。 4. 用校正后的代理标签重新训练识别器。DRRC理论保证了该过程的稳健性,即使代理标签或缺失标签的概率模型之一不准确,最终的风险估计仍是一致的。 * HuPER-Perceiver(类似颞上沟STS):负责音素-词汇整合。它将Recognizer输出的音素证据与显式的词汇和音位配列先验相结合,生成音素增强的词假设。 * Dysfluent WFST:提供显式的自上而下约束机制。它用一个加权有限状态转换器来建模口吃、发音变异等现象,可以接受外部参考文本或内部生成的词假设作为输入,施加语言约束。 * HuPER-Scheduler(类似额下回IFG):作为中央调度器,根据声学证据的强弱和任务上下文,动态选择推理路径: * 清晰语音:信任自下而上的音素证据,直接输出。 * 模糊/退化语音:激活HuPER-Perceiver,结合词汇先验生成词假设,再经Dysfluent WFST精炼。 * 有参考文本的语音:直接将已知文本通过Dysfluent WFST施加约束进行转录。
这篇论文的价值在于,它首次提出了一个统一且显式的计算框架,不仅以数据高效的方式在音素识别任务上实现了SOTA性能,更重要的是,它成功地将人类语音感知的多路径、自适应、闭环认知机制建模到AI系统中,为构建更鲁棒、更类人的语音感知基础模型开辟了新的方向。
好的,作为一名专业的AI领域研究员,我已详细阅读了您提供的论文内容。以下是我为您撰写的中文深度总结。
论文标题: 应用于语音情感识别的大规模音频-语言模型知识蒸馏中的注意力加权中心核对齐
这篇论文旨在解决大规模音频-语言模型在资源受限环境下的部署难题。具体而言,以Qwen2-Audio(84亿参数)为代表的LALM虽然在语音情感识别任务上表现出色,但其庞大的参数量导致高昂的计算和存储成本,难以在边缘设备等场景中应用。
现有方法的不足主要体现在两个方面: * 蒸馏策略的缺失与错配: 尽管知识蒸馏是模型压缩的有效手段,但现有研究主要集中于纯文本或多模态视觉模型,专门针对LALM的蒸馏方法探索不足。直接将视觉MLLM的蒸馏方法用于音频任务存在两个关键问题: 1. 无法捕捉音频的时序重要性: 视觉方法强调空间依赖(如物体间关系),而语音情感的关键线索(如特定语调、重音)往往集中在少数关键时间步上,需要能识别时序稀疏性的方法。 2. 投影器蒸馏被忽视: 投影器是LALM中负责将音频特征映射到语言模型空间、实现跨模态融合的核心模块。现有方法要么忽略了对投影器的蒸馏,要么在蒸馏时因师生模型特征维度不匹配而面临对齐困难。
作者提出了一个名为 PL-Distill 的轻量级知识蒸馏框架,其核心创新在于双层级蒸馏和一种新颖的特征对齐度量方法。
整体框架 (PL-Distill): 包含两个互补的蒸馏组件:
关键创新方法:注意力加权中心核对齐 (AwCKA)
w 与师生音频嵌入相乘,得到加权嵌入。然后计算加权嵌入之间的CKA相似度,即为AwCKA。L_DP = 1 - AwCKA,旨在最大化师生加权音频嵌入的相似性。逻辑层蒸馏 (LDist): 采用经典的带温度系数的KL散度损失,分别对齐师生模型在音频token和响应token上的输出概率分布(L_DA 和 L_DR),确保学生能模仿教师的最终预测行为。
训练策略与模型架构:
L_Total = λ1 * L_DP + λ2 * L_DA + λ3 * L_DR。这篇论文的价值在于,它首次系统性地提出了针对大规模音频-语言模型的知识蒸馏框架,并通过创新的注意力加权中心核对齐方法,巧妙地解决了跨模态投影器蒸馏中的维度不匹配与关键时序信息聚焦问题,为在资源受限场景下部署高性能的多模态语音理解模型提供了切实可行的解决方案。
好的,作为一名专业的AI领域研究员,我已详细阅读了您提供的论文内容。以下是我为您撰写的深度总结。
这篇论文旨在解决现实环境中、单麦克风条件下的视听语音分离与增强问题。具体而言,它需要从一个包含多个说话人语音和复杂环境背景噪声的混合音频信号中,分离出每个说话人的清晰语音以及高保真的背景噪声。
现有方法的不足主要体现在: * 监督方法的局限性:主流方法依赖于监督学习,需要大量成对的“混合-干净”数据来训练模型。这类方法虽然在特定训练条件下表现优异,但缺乏灵活性。一旦声学环境发生变化(如噪声类型改变),模型性能会显著下降,通常需要针对新环境重新训练。 * 无监督方法的探索不足:虽然基于扩散模型的无监督生成框架(利用干净语音的先验分布)展现出潜力,避免了上述问题,但在同时存在多个说话人和背景噪声的复杂场景下,相关研究非常稀少。此外,先前的一些扩散逆采样方法(如DPS)在采样过程中存在缺陷,容易陷入局部最优,抑制了对信号的全局调整。
作者提出了一个名为 SSNAPS 的全新无监督框架。其核心创新在于将扩散逆采样技术系统性地应用于多说话人、带噪的视听语音分离任务。
p(语音,噪声 | 混合音频) 中采样来恢复所有源信号。为此,系统联合利用了两种独立的扩散模型先验:一个用于干净语音,另一个用于环境噪声。y,SSNAPS执行一个迭代算法,每一步包含两个阶段:h_τ的估计,利用朗之万动力学从条件分布p(h_0 | h_τ, y)中采样,得到对干净源h_0(即所有语音和噪声)的更新估计。这一步的更新梯度由两部分组成:先验匹配项(迫使估计的源信号接近其各自扩散先验的预测)和重构似然项(迫使所有估计源信号之和在频域上接近混合音频y)。h_0按照扩散过程的前向公式添加一定量的噪声,得到下一轮迭代的起点h_τ。这篇论文的价值在于,它成功地将先进的扩散逆采样理论(DAPS)与视听多模态先验相结合,构建了一个强大且灵活的无监督语音分离框架,不仅在性能上超越了需要大量配对数据训练的监督方法,还首次实现了对屏幕外说话人的分离,为复杂真实场景下的鲁棒语音处理开辟了新路径。
好的,作为一名专业的AI领域研究员,我已详细阅读了您提供的论文内容片段。以下是根据您要求的结构撰写的深度总结:
这篇论文旨在解决自监督对比学习得到的说话人嵌入中存在的敏感人口统计信息泄露问题。具体而言,当使用SimCLR等方法训练说话人嵌入模型时,模型在捕捉说话人身份信息的同时,会无意中编码性别、年龄、口音等敏感属性。这种“人口统计信息泄露”会引发公平性、隐私和伦理风险,例如可能导致系统在不同人群间产生偏见,或允许从看似匿名的嵌入中推断出受保护的属性。
现有方法的不足在于: * 研究不足:大多数关于去偏的研究集中在有监督的说话人识别任务上,而针对自监督对比学习嵌入中人口统计信息泄露的系统性量化和缓解研究相对较少。 * 方法局限:现有的去偏策略(如对抗性训练)通常只针对单一属性,且主要关注线性可分离的信息(如性别),对非线性编码的属性(如年龄、口音)效果有限,并且会引入显著的公平性与性能的权衡。 * 视角单一:现有方法多基于相关性进行缓解,而忽略了人口统计属性与学习到的表征之间可能存在的因果机制,这限制了去偏的深度和效果。
作者提出了一个比较性研究框架,系统评估了两种去偏策略在自监督说话人嵌入中的应用:
对抗性去偏:在标准的SimCLR基线模型基础上,引入梯度反转层和一个对抗性分类器。该分类器试图从说话人嵌入中预测人口统计属性(性别、年龄、口音),而梯度反转层则迫使主编码器生成能够“欺骗”该分类器的嵌入,从而抑制这些敏感信息。这是一种基于相关性的去偏方法。
因果瓶颈架构:这是论文的核心创新。作者引入了一个因果瓶颈层,将其置于表征管道的末端。该架构将人口统计属性建模为因果上游因素,并明确地将嵌入分解为两部分:
训练与评估策略:作者使用线性探测(如逻辑回归)和非线性探测(如多层感知机)分类器来量化嵌入中人口统计信息的泄露程度,这能全面评估线性和非线性编码的信息。说话人验证性能则使用ROC-AUC和等错误率来评估。
根据摘要和引言部分的描述,论文的实验揭示了以下关键发现(具体数据集和绝对数值在提供的片段中未明确给出,但结论清晰):
这篇论文的价值在于,它首次在自监督对比学习框架下,系统性地量化了多个人口统计属性的泄露模式(线性vs非线性),并通过引入因果视角的瓶颈架构,与传统的对抗性方法进行对比实验,深刻揭示了当前说话人嵌入去偏技术的根本性局限与内在权衡,为未来设计更有效的公平性、隐私保护模型提供了重要的实证基础和理论洞见。
好的,作为一名专业的AI领域研究员,我已详细阅读了您提供的论文内容片段。以下是根据您要求的结构撰写的深度总结:
这篇论文旨在解决信号处理(SP)教育中长期存在的抽象性、高门槛和互动性不足的问题。传统的SP教学依赖于数学公式和静态工具(如MATLAB),学生难以将抽象概念(如傅里叶变换、滤波)与实际的音频信号处理应用直观联系起来。现有的多媒体教学方法(如《DSP First》和《Media Computation》)虽然引入了交互性,但其内容往往是预设计的、静态的,缺乏实时、动态、可个性化交互的能力。这导致学习体验不够沉浸,难以激发学生的深层理解和创造力。
本文并非提出一个具体的新模型或算法,而是提出了一个前瞻性的概念框架和整合路径,即 “SPEduAFM”。其核心创新在于系统性地论证并规划如何将前沿的音频基础模型(AFMs)这一生成式AI技术,深度整合到信号处理教育生态中。
核心方法(框架):作者提出利用AFMs(如Whisper, AudioLM, Wav2Vec 2.0等)的固有能力,构建一个服务于教育的AFM生态系统。这个框架的关键在于:
训练与部署策略:论文强调了AFMs的预训练与微调范式对教育的价值。即利用大规模数据预训练的通用AFM作为基础,教育者可以仅用少量领域特定数据(如特定口音的语音、专业噪声类型)对其进行微调,快速定制出适合本地化教学场景的工具,降低了技术应用门槛。
由于本文是一篇前瞻性、概念性的研究论文,它并未报告在特定数据集上的量化对比实验(如准确率、性能提升百分比)。其“实验”部分体现为: * 案例研究设计:论文设想了一个在数字信号处理(DSP)课程中使用AFM进行交互式听觉演示的案例,定性描述了其如何提升学生的理解与参与度。 * 功能演示:通过表I和图2,论文系统性地分类和列举了AFMs在各类教育应用场景(语音处理、语言支持、交互学习等)中可能实现的功能,并关联了现有的AFM实例(如Whisper用于转录),以此作为其可行性的佐证。 * 对比对象:论文的“提升”主要体现在与传统静态多媒体教学方法和早期单任务音频处理模型相比,AFMs带来了质的体验飞跃——从静态到实时,从单任务到通用,从工具使用到自然交互。
这篇论文的价值在于为生成式AI(特别是音频基础模型)与工程教育的深度融合提供了一个清晰、系统且极具启发性的路线图,将技术前沿的“可能性”转化为教育变革的“可行性”,指明了未来智慧教育的一个重要发展方向。
好的,作为一名专业的AI领域研究员,我已详细阅读了您提供的论文内容。以下是我为您撰写的深度总结:
这篇论文旨在解决无监督异常声音检测领域生成式模型面临的几个关键瓶颈: * 现有生成模型的固有缺陷: * 自编码器:学习到的特征分布不完整,重建映射过于宽泛,导致对结构相似的异常声音重建误差不足。 * 生成对抗网络:训练不稳定且易发生模式崩溃,在复杂声学场景中应用受限。 * 扩散模型:强大的分布学习能力可能将异常特征当作噪声去除,导致重建输出与异常输入差异微小,不利于检测。 * 输入模态单一:几乎所有现有模型都仅依赖梅尔频谱图作为输入,而时频变换过程会不可避免地丢失原始波形中的部分关键信息,这从根本上限制了模型性能的上限。 * 对局部异常不敏感:现有模型倾向于捕捉正常声音的全局宏观特征,对仅发生在局部时频区域的微弱瞬态变化不够敏感。
作者提出了一个名为 TLDiffGAN 的双分支创新框架,核心思想是融合多模态声学信息并增强对局部时频模式的敏感性。
模型架构:
损失函数与训练策略:
检测器:采用集成检测策略。
这篇论文的价值在于创造性地将潜在扩散模型与GAN框架深度融合,并辅以多模态特征融合和针对性的时序增强技术,系统性地解决了无监督异常声音检测中生成模型在重建保真度、训练稳定性和对局部异常敏感性之间的固有矛盾,实现了检测性能与可解释性(时频定位)的双重突破。
好的,作为一名专业的AI领域研究员,我已详细阅读了您提供的论文内容。以下是我为您撰写的深度总结:
这篇论文旨在解决音频深度伪造检测中,现有方法未能充分利用自监督学习模型所提供丰富层次化表征的问题。具体而言,现代TTS和语音转换技术生成的伪造音频越来越逼真,对安全和信任构成严重威胁。虽然基于自监督学习(如XLS-R)的模型能提取包含声学、韵律、语义等多层次信息的特征,但现有检测器(如Sensitive Layer Selection, SLS)存在两个关键不足: * 忽视时间动态性:它们平等对待每个时间帧,而实际上,合成伪影只集中在某些特定时间区域。 * 忽视层次间依赖性:它们将模型的每一层特征独立处理,忽略了浅层(声学特征)、中层(韵律特征)和深层(语义特征)之间的互补与依赖关系。这种独立处理方式会导致特征同质化,并削弱模型在面对不同生成技术和录音条件(跨域场景)时的泛化能力。
作者提出了名为 HierCon 的新框架,其核心创新在于分层对比注意力机制,具体包含以下三个部分:
模型架构:三层分层注意力
训练策略:基于间隔的对比学习 在标准的二元交叉熵分类损失之外,引入了一个对比损失。该损失函数通过计算批次内同类样本(正对)和异类样本(负对)嵌入之间的平均余弦相似度,并强制正对相似度高于负对一个固定间隔(margin)。这有助于:
整体优化
最终损失函数是分类损失和对比损失的加权和(L = L_CE + λ * L_con),通过联合优化,使模型同时具备准确的分类能力和良好的泛化性。此外,该框架具有可解释性,其注意力权重可以可视化,揭示哪些时间片段和网络层次对最终决策贡献最大。
论文在三个权威的音频伪造检测基准上进行了评估: * ASVspoof 2021 LA:相对同质的数据集。 * ASVspoof 2021 DF:包含超过100种生成技术的跨域数据集,挑战性高。 * In-the-Wild:真实世界场景数据集。
主要性能提升: * 在最具挑战性的 ASVspoof 2021 DF 数据集上,HierCon将等错误率降至 1.93%,超越了之前最好的XLS-R+SLS方法(2.09%),相对提升36.6%。 * 在 In-the-Wild 数据集上,EER为 6.87%,相比基线 相对提升22.5%。 * 在ASVspoof 2021 LA上也取得了有竞争力的结果(2.46% EER)。 * 消融实验证实,分层注意力和对比学习两者结合对性能提升至关重要,缺一不可。
这篇论文的价值在于,它通过一个精心设计的分层对比注意力框架,系统性地建模了音频表征中的时间与层次依赖性,并结合对比学习增强了模型的泛化能力,从而在跨域音频深度伪造检测任务上实现了显著的性能突破,并为模型决策提供了可解释的洞察。
好的,作为一名专业的AI领域研究员,我已详细阅读了您提供的论文内容。以下是我为您撰写的深度中文总结:
这篇论文旨在解决一个关键但被忽视的问题:当大型语言模型(LLMs)从纯文本输入扩展到语音输入时,其公平性和鲁棒性如何变化? 具体而言,研究者关注多模态大语言模型(MLLMs)在处理多语言语音问答任务时,对语言、口音、性别和选项顺序等变动的敏感性。
现有方法的不足主要体现在: * 评估空白:此前关于LLM偏见的研究主要集中在文本模态,缺乏对语音模态下系统性偏见的系统性评估。 * 数据集局限:现有的语音评测数据集要么缺乏对人口统计学因素(如性别、口音)的平衡控制,要么在内容多样性(如STEM问题)上有所欠缺,无法全面评估模型在真实、复杂语音场景下的表现。 * 风险放大:语音技术本身(如语音识别)已被证明存在对特定口音、性别的性能差异。因此,将LLM与语音结合,可能不仅会继承文本模型的既有偏见,还可能通过语音层级的变异性将其放大,这在公平性至关重要的应用(如语音助手、教育技术)中风险极高。
作者的核心创新在于构建了一个系统性的评估框架和高质量的数据集,而非提出新的模型架构。
数据集构建(BIASINEAR):
评估框架:
这篇论文的价值在于首次系统性地将LLM偏见研究从文本模态拓展至语音模态,通过构建一个高质量、多变量可控的评测基准和一套综合评估框架,揭示了语音如何作为一种新的“偏见放大器”,特别是放大了模型对选项顺序的结构性偏见,为未来开发更公平、鲁棒的语音集成大模型奠定了重要的评估基础。
好的,作为一名专业的AI领域研究员,我已详细阅读了您提供的论文内容。以下是我为您撰写的深度总结:
这篇论文旨在解决一个关键问题:如何高效、准确地将大规模多语言语音基础模型(如Whisper、MMS)适配到低资源语言上。
现有方法的不足主要体现在两个方面: * 全参数微调:计算和内存成本极高,且在低资源数据下极易过拟合或导致“灾难性遗忘”(即模型在适应新语言时,严重损害了对已见高资源语言的识别能力)。 * 主流参数高效微调方法(如LoRA):虽然参数效率高,但它们通常对所有模型层进行均匀的适配。论文通过层间分析发现,模型内部的语言表征呈现一种“U型”分布(即早期和后期层语言特异性强,中间层语言无关性强),均匀适配的策略忽略了这种内部结构,导致参数利用效率低下,在极端低资源场景下效果受限。
作者基于对模型内部“U型”语言表征模式的分析,提出了一个名为 DAMA(深度感知模型适配) 的框架。其核心创新在于根据模型不同层的角色和可塑性,差异化地分配适配能力,具体包含三个机制:
训练策略:DAMA本质上是一种结构感知的PEFT方法。它冻结原始模型的主干网络,仅在特定层注入并训练上述机制定义的、秩可变的低秩适配矩阵,从而实现对目标低资源语言的高效适配。
这篇论文的价值在于,它首次系统揭示了多语言语音模型中语言表征的“U型”层间分布规律,并基于此洞察提出了一个结构感知的适配框架(DAMA),在极低的参数成本下显著提升了模型对低资源语言的适配效率和效果,为构建可扩展、高效率的包容性多语言语音系统提供了重要的方法论。
好的,作为一名专业的AI领域研究员,我已详细阅读了您提供的论文内容片段。以下是根据您要求的结构撰写的深度总结:
这篇论文旨在解决对话场景下的多模态情感识别问题。具体而言,它关注如何更准确地识别和理解对话中由特定“原因”触发的复杂情感。
现有方法的不足主要体现在: * 模态单一性:传统方法多依赖单一模态(如纯文本或纯音频),难以捕捉人类情感表达中言语与非言语线索(如语调、语速)之间的微妙互动与矛盾(例如,用欢快的语调说悲伤的话,即“讽刺”)。 * 静态与脱离语境:许多系统将情感视为静态、脱离语境的标签,忽略了情感是动态演变且高度依赖于文化、情境和人际因素的这一本质。 * 复杂性与可复现性:虽然存在先进的多模态方法,但往往模型复杂、训练成本高,缺乏一个简单、透明、易于复现的基线系统作为后续研究的可靠参照点。
本文的核心并非提出一个全新的、突破性的模型,而是构建并系统性地记录了一个轻量级、可复现的多模态基线方法。其“创新”在于其简洁性、透明性和作为基准的实用性。
方法详细描述: * 模型架构:采用简单的后期融合集成策略。 1. 文本模态:使用基于Transformer的预训练模型(如BERT、RoBERTa或其变体DistilBERT)作为文本分类器,从对话文本中提取情感特征。 2. 音频模态:使用自监督语音表示模型Wav2vec 2.0,直接从原始音频波形中学习并提取包含语调、节奏等副语言信息的特征。 3. 融合策略:在各自单模态模型独立预测的基础上,通过后期融合(例如,对两个模型的预测概率进行加权平均或投票)来集成文本和音频的信息,形成最终的情感预测。 * 训练策略:论文明确采用了一种“轻量级”的实验协议,即有限的超参数调优和有限的评估。其目的是快速建立一个可工作的基线,而不是追求极致性能。这包括使用现成的预训练模型、进行最小程度的微调等。 * 损失函数:在提供的片段中未明确提及具体的损失函数,但鉴于这是一个分类任务,可以推断其使用了标准的分类损失函数(如交叉熵损失)。
这篇论文的价值在于为对话情感识别领域提供了一个清晰、易复现、且经过实证验证的多模态基线实现,确立了性能提升的“地板”而非“天花板”,极大地促进了后续研究的透明性与可比性。
好的,作为一名专业的AI领域研究员,我已详细阅读了您提供的论文内容片段。以下是我为您撰写的深度中文总结。
论文标题: 使用带有解析维纳去噪器的流匹配解决房间脉冲响应逆问题
这篇论文旨在解决房间脉冲响应(RIR)估计中的一系列逆问题,如去噪、反卷积、修复和削峰恢复。这类问题通常是不适定的,即从含噪声或退化的观测信号中恢复原始RIR存在多解性和不稳定性。
现有方法的不足主要体现在: * 数据驱动方法的局限性:基于监督学习或学习生成先验的方法(如扩散模型)需要大量配对数据进行训练,且泛化能力差,在训练数据分布之外表现不佳。 * 传统贝叶斯方法的局限:基于最大后验概率估计等点估计方法,无法捕捉不适定问题中固有的后验不确定性,可能导致结果不稳定或感知质量差。 * 现有流/扩散求解器的限制:许多基于生成模型的逆问题求解器依赖于数据驱动的先验(需要训练),且通常假设前向模型是线性的、噪声是高斯的,这限制了其在更广泛、更复杂的非线性/非高斯逆问题中的应用。
作者提出了一个名为 RIR-Flow 的免训练贝叶斯框架,其核心创新在于将经典的RIR统计模型与现代基于流的生成推理相结合。
这篇论文的价值在于优雅地弥合了经典信号处理理论与现代生成式AI之间的鸿沟,通过为RIR推导一个解析的生成先验,构建了一个免训练、可解释、且能统一处理多种线性/非线性逆问题的强大贝叶斯推理框架,为领域内解决数据稀缺和模型泛化问题提供了新范式。
好的,作为一名专业的AI领域研究员,我已详细阅读了您提供的论文内容。以下是我为您撰写的深度总结。
这篇论文旨在解决超低码率(< 1 kbps)下通用音频(语音、音乐、环境声)的高保真压缩这一极具挑战性的问题。该问题在低带宽通信和生成式音频-语言建模等应用中至关重要。
现有方法的不足: * 传统音频编码(如MP3):基于手工设计的信号处理和心理声学模型,在中高码率(数百kbps)下表现良好,但在超低码率下会迅速退化,产生严重的声学伪影和语义失真。 * 主流神经编解码器(如EnCodec, DAC):虽然利用神经网络(如RVQ、对抗训练)将高质量重建的码率降至3-12 kbps,但其根本范式仍是波形重建。它们没有显式地对高级语义信息进行建模,且模型容量有限,无法在极端压缩率下保留音频的感知质量和语义一致性。
作者提出了 “生成式音频压缩”(Generative Audio Compression, GAC) ,这是一次从“信号保真度”到“任务/感知有效性”的范式转变。其核心思想是 “以计算换带宽” ,即利用接收端强大的生成模型先验知识来弥补极端的通信带宽瓶颈。
理论基石:
* 信息容量定律(Law of Information Capacity, IC-1):该定律将通信与计算统一在一个信息守恒框架下。它量化了模型参数(ηN)如何从数据中吸收信息,从而减少需要通过信道传输的不确定性(L)。公式 H = R + ηN/D 揭示了传输码率(R)与模型容量(ηN)之间的权衡:要降低码率(R),就必须增加接收端生成模型的容量(ηN/D)。
模型架构与训练策略(两阶段框架): GAC将压缩过程分解为两个解耦的阶段,分别对应“理解”与“生成”。
阶段一:通过语义理解实现码率最小化
X 压缩为极低比特的离散语义令牌 Z。Z 不再代表声学比特,而是音频的语义精髓。LLM):最大化 Z 与对应文本描述 Y 的互信息。通过一个预训练的大语言模型作为语义先验进行监督,确保 Z 捕获了重建所需的核心语义内容。Linfo):最小化 Z 与原始音频 X 的互信息。这相当于一个“比特过滤器”,迫使编码器丢弃冗余的声学细节,只保留语义。LStage1 = -LLM + β * Linfo。最终,只有高度压缩的语义令牌 Z 被传输。阶段二:通过生成能力实现信息恢复
Z,合成出高保真、语义一致的音频 X_hat。vθ,将高斯噪声沿直线路径“流式”变换为目标音频分布。LStage2 = E[||vθ(Xt, t, Z) - (X1 - X0)||^2]。ηN 项)来“脑补”出丰富的声学细节,从而实现了从极简语义到完整音频的“信息恢复”。这篇论文的价值在于,它从信息理论的高度出发,提出并验证了“生成式智能传输”这一新范式,通过“语义理解+生成合成”的两阶段架构,首次在超低码率(<0.3kbps)下实现了通用音频的高保真压缩,为低带宽通信和生成式音频模型开辟了全新的技术路径。
好的,作为一名专业的AI领域研究员,我已详细阅读了您提供的论文内容。以下是我为您撰写的中文深度总结。
论文标题: The TMU System for the XACLE Challenge: Training Large Audio Language Models with CLAP Pseudo-Labels
这篇论文旨在解决音频-文本语义对齐评估这一具体问题,其背景是XACLE挑战赛。该任务的目标是构建一个模型,能够自动预测一段通用音频与一段描述性文本之间的语义对齐程度(即相关性),其预测结果需要与人类的主观判断高度一致。
现有方法的不足主要体现在: * 数据稀缺:高质量的人工标注音频-文本对齐数据(如XACLE数据集)规模非常有限(仅7.5K训练样本),直接在此类小数据集上训练大型模型极易导致过拟合。 * 模型架构局限:传统的音频-文本对齐模型(如CLAP系列)通常采用双编码器结构,通过对比学习进行训练。这种架构可能无法像大型语言模型那样,通过复杂的上下文推理来深入理解音频与文本之间细微、复杂的语义关联。 * 预训练任务不匹配:直接使用生成式任务(如自动音频描述)对模型进行预训练,其目标(生成文本)与最终的对齐评分任务(判别相关性)存在根本性差异,导致知识迁移效率不高。
作者提出了一种基于大型音频语言模型的三阶段训练框架,核心创新在于利用CLAP模型生成的伪标签进行大规模弱监督预训练。
模型架构:
<|AUDIO START|>, <|AUDIO END|>, <|SCORE|>)将音频特征与文本指令共同输入LLM。<|SCORE|>标记对应的LLM输出中回归出最终的对齐分数。三阶段训练策略(核心贡献):
这篇论文的核心价值在于,它巧妙地通过CLAP伪标签弱监督预训练这一高效策略,解决了音频-文本对齐任务中高质量标注数据稀缺的难题,并成功验证了大型音频语言模型在该判别式任务上相较于传统双编码器CLAP模型的架构优势,为音频理解与评估领域提供了新的有效范式。
好的,作为一名专业的AI领域研究员,我已详细阅读了您提供的论文片段。以下是我为您撰写的中文深度总结。
这篇论文旨在解决语音语言建模中高质量、解耦式语音分词器的设计难题。一个理想的语音分词器需要同时满足三个看似矛盾的要求: * 包含丰富的语音学(音素)和韵律学(语调、重音、节奏)信息,以支持语言理解和富有表现力的语音生成。 * 抑制非语言学信息(如说话人身份、背景噪声、录音设备特性),以简化下游模型的学习过程。 * 支持高质量的语音重建与合成,即能够将离散的token高质量地还原为语音波形。
现有方法的不足: * SSL(自监督学习)分词器(如HuBERT k-means聚类):擅长捕捉音素结构,但严重丢失了韵律信息,不适合高质量的语音合成。 * 神经音频编解码器(如EnCodec):通过多层残差向量量化保留了大量声学细节,重建质量高,但token速率高、信息混杂,将语言学和非语言学信息混合在一起,增加了下游语言模型学习的复杂度。 * 混合编解码器(如SpeechTokenizer):试图结合前两者的优点,但通常依赖复杂的多层token结构,且解耦不彻底,语言学信息容易“泄漏”到高层token中。 * 解耦式编解码器(如FACodec):明确追求信息分离,但往往需要依赖复杂的辅助方法(如对抗训练、对比学习、监督信号)来强制解耦,这不仅增加了训练复杂性,且实验表明其解耦效果并不理想。
作者提出了 Kanade,一个单层、解耦的语音分词器。其核心创新在于通过一个简洁、动机明确的双分支架构,实现了无需复杂辅助方法的无监督解耦。
核心架构(如图2所示): 1. 输入:使用冻结的预训练SSL模型(WavLM Base+)提取特征。这利用了SSL特征已具备良好语言学结构和易于分离的说话人信息这一先验优势。 2. 双分支处理: * 内容分支:将SSL深层特征(与语言学内容强相关,如第6、9层)输入一个内容编码器,经过下采样后,通过无码本量化技术(如FSQ)将其量化为单层、低速率(12.5/25 Hz)的离散token序列。这些token旨在编码音素和韵律。 * 全局分支:将SSL浅层特征(与说话人特性强相关,如第1、2层)输入一个全局编码器,生成一个单一的连续嵌入向量,用于编码说话人身份等非语言学、时不变的信息。 3. 解码器:将内容token和全局嵌入向量结合,共同重建原始的SSL特征和梅尔频谱图,最终通过声码器(如Vocos)生成波形。
关键训练策略与损失函数: * 双重重建损失: * SSL特征重建损失:迫使内容token必须包含足够的音素信息才能准确重建SSL特征。 * 梅尔频谱图重建损失:梅尔谱对韵律变化敏感,该损失迫使内容token也必须编码韵律信息。 * 信息瓶颈与自然解耦:全局分支为重建所需的非语言学信息提供了一个“专用通道”。由于SSL特征重建损失对这些信息相对不敏感,在内容编码器的信息带宽受限(通过下采样和量化)的情况下,模型会自然地将非语言学信息“推”向全局分支,从而实现优雅的解耦,无需额外的对抗或对比损失。 * GAN后训练:在基础重建训练后,引入判别器进行对抗训练,以进一步提升合成语音的自然度和质量。
论文在多个标准数据集和任务上进行了综合评估,并与当前主流开源语音分词器进行了对比。
主要评估指标与结果:
效率优势:Kanade仅使用600小时数据、1.2亿可训练参数进行训练,并产生单层、低速率的token流,极大简化了下游自回归语言模型的架构设计。
这篇论文的价值在于,它通过一个极其简洁而巧妙的设计(双分支+信息瓶颈),成功地将语音中语言学与非语言学信息进行了高效解耦,在一个单层token流中同时实现了SSL token的语言学表达能力和神经音频编解码器的高质量合成能力,为构建更简单、更强大的语音大模型提供了理想的基础组件。
好的,作为一名专业的AI领域研究员,我已详细阅读了您提供的论文内容。以下是我为您撰写的中文深度总结:
这篇论文旨在解决生成式语音增强模型(特别是扩散模型)计算成本过高的问题。现有方法(如基于分数的扩散模型)虽然能生成高质量语音,但存在两大根本性缺陷: * 对语谱图特性的忽视:大多数模型将语谱图简单地视为普通的2D图像,采用空间均匀的处理方式,忽略了其内在的物理结构稀疏性。具体来说,语谱图中低频谐波信息密集而关键,高频瞬态信息稀疏但同样重要。这种“一刀切”的处理方式导致了频谱表示的效率低下。 * 计算复杂度高昂:无论是“纯”扩散模型的大量迭代采样步骤,还是现有预测-扩散混合模型,其计算开销(参数量和乘加运算量)仍然巨大,难以在资源受限的设备上部署。
作者提出了一个名为 DVPD 的双视图预测扩散框架,其核心思想是协同利用语谱图的“双重属性”:既将其视为具有纹理的视觉图像,也将其视为具有物理意义的频域表示。该方法贯穿训练和推理全过程:
模型架构:
训练与推理策略:
这篇论文的价值在于,它通过深刻理解并协同利用语谱图的“声学-视觉”双重本质,设计了一个高度专业化的轻量级架构,为生成式语音增强领域在保持顶级性能的同时实现计算效率的突破性提升,树立了新的标杆。
好的,作为一名专业的AI领域研究员,我已详细阅读了您提供的论文内容。以下是我为您撰写的中文深度总结:
这篇论文旨在解决基于文本的语音编辑任务中的一个核心挑战:如何实现“不可察觉” 的编辑。具体来说,用户通过修改文本转录,希望生成的语音片段在内容上符合新文本,同时在音色、韵律、声学环境等所有非内容特征上与原语音上下文无缝融合,听起来像是一次性录制的。
现有方法的不足: * 声学空间直接编辑的缺陷:主流方法(无论是非自回归NAR还是基于神经编解码语言模型NCLM的自回归AR模型)通常在声学token空间进行操作。在这个空间中,语音内容与说话人风格、音色等声学特征高度纠缠。这种纠缠导致: * 生成不稳定:修改内容时容易引发“幻觉”(生成无关内容)或韵律失调。 * 边界伪影:编辑区域与未修改的上下文之间出现不自然的断裂或突变。 * 缺乏全局感知对齐:现有的强化学习奖励机制多针对文本转语音(TTS)任务设计(如清晰度、说话人相似度),无法有效评估和促进编辑区域与整个句子上下文在感知上的连贯性。
作者提出了一个名为 “编辑内容,保留声学” 的两阶段框架,核心创新在于结构解耦与感知对齐。
a. 结构基础:语义空间编辑 * 核心思想:将内容编辑与声学重建解耦。首先在一个解耦的语义空间中修改内容,然后由一个统一的声学解码器重建波形。 * 模型架构: 1. 语义生成模型:采用一个基于Transformer的大语言模型作为策略网络。它将编辑任务形式化为一个条件填充问题:给定目标文本、原语音前缀和后缀的语义token,模型预测需要编辑的中间部分的语义token。语义token仅编码语言内容和粗略韵律,与具体音色解耦。 2. 声学重建模型:使用一个流匹配解码器,将整个句子(包括未修改的前后缀和编辑后的中间部分)的语义token序列,映射到一个统一的声学流形中,并最终通过声码器合成波形。这确保了整个句子的声学连贯性。 * 训练:第一阶段使用标准的负对数似然损失进行监督训练,让LLM学会根据上下文填充合理的语义内容。
b. 感知对齐:自一致性奖励GRPO * 核心思想:在语义生成阶段后,引入强化学习进行微调,确保生成的语义token在统计分布上与自然语音的上下文保持一致。 * 关键创新——自一致性奖励: * 奖励设计:作者创新性地使用一个预训练的TTS模型作为隐式评判者。其原理是:一个强大的TTS模型捕获了自然语音的分布。计算编辑区域语义token在给定上下文条件下,由该TTS模型生成的似然概率,并将其作为奖励。这个奖励衡量了编辑内容与整个句子在自然语音分布下的统计一致性(包括韵律、节奏、协同发音等)。 * 辅助奖励: * 清晰度奖励:基于ASR的词错误率,确保编辑内容在语言学上是准确的。 * 时长一致性奖励:约束编辑区域的时长与目标文本合理匹配。 * 门控融合策略:设计了一个分段奖励函数,只有同时满足清晰度和时长基本阈值的样本,才能获得自一致性奖励,防止奖励黑客行为。 * 训练策略:采用组相对策略优化(GRPO)。对同一个输入采样一组输出,计算每个输出的奖励,并通过与组内平均奖励的标准化差值(相对优势)来更新策略。这种方法无需训练复杂的价值网络,更高效。
这篇论文的价值在于,它通过“解耦编辑与重建”的清晰哲学和“利用TTS模型作为一致性评判者”的巧妙构思,为基于文本的语音编辑任务提供了一个兼具高稳定性、高自然度和强上下文连贯性的创新框架,显著推进了“不可察觉编辑”这一终极目标的实现。
好的,作为一名专业的AI领域研究员,我已详细阅读了您提供的论文内容片段。以下是我为您撰写的中文深度总结。
这篇论文旨在解决一个关键但被忽视的问题:现代语音克隆模型在真实、非理想部署环境下的鲁棒性严重不足。
具体而言,尽管基于自回归编解码器语言模型和扩散模型的语音克隆技术取得了巨大进展,能够仅凭几秒参考音频就合成出与目标说话人高度相似的语音,但其性能严重依赖于“干净”的理想条件。在实际应用中,模型必然会遇到: * 有噪声或质量不佳的参考音频(如背景音、多人说话)。 * 不完美的文本提示(如格式错误、多语言混杂、诈骗内容)。 * 多样的下游处理(如音频压缩、深度伪造检测)。 * 对抗性扰动(如主动添加的防御性噪声)。
现有的研究存在明显不足: * 现有语音克隆评测基准(如CloneEval)主要关注“干净”设置下的合成质量,模型覆盖有限,且缺乏对上述鲁棒性失效模式的系统性压力测试。 * 通用的音频鲁棒性评测基准(如AHa-Bench)虽然研究音频生成的鲁棒性,但并非针对语音克隆任务定制,忽略了语音克隆特有的压力源(如参考音频的领域偏移、跨语言/长文本的身份漂移)。
因此,缺乏一个系统、全面、针对语音克隆全流程的鲁棒性评测基准,导致我们无法准确了解当前模型在实际部署中的脆弱点,阻碍了开发更健壮、可部署的语音克隆系统。
作者没有提出一个新的语音克隆模型,而是提出了一个系统性的评测基准——RVCBench,这是其核心创新。
RVCBench的设计框架: 它从整个语音克隆生成流程的视角出发,定义了四个维度的鲁棒性评测,覆盖了从输入到输出的所有环节: 1. 输入鲁棒性:评测模型对参考音频和文本提示变化的敏感性。 * 参考音频偏移:评测模型对不同口音、性别、年龄的说话人参考音频的适应能力。 * 文本提示偏移:评测模型对格式不规则(如拼写错误、混合语言)和恶意内容(如诈骗脚本)的鲁棒性。 2. 生成鲁棒性:评测模型在生成过程中的瓶颈。 * 跨语言泛化:评测用英语参考音频克隆非英语语音的能力。 * 长文本生成稳定性:评测生成长篇内容时,音色和内容一致性的保持能力。 * 表达保持:评测对参考音频中情感等副语言信息的克隆能力。 3. 输出鲁棒性:评测合成音频在输出后的表现。 * 后处理弹性:评测音频经过压缩(如MP3)等常见后处理后质量的下降程度。 * 深度伪造可检测性:评测当前最先进的深度伪造检测器能否有效识别出克隆音频。 4. 音频扰动鲁棒性:评测模型对音频扰动的抵抗和恢复能力。 * 被动扰动:评测参考音频被环境噪声(如咖啡馆、车站)污染后的影响。 * 主动扰动:评测模型对旨在防御克隆的主动对抗性扰动(如SafeSpeech)的敏感性。 * 去噪恢复:评测对受扰动音频进行去噪预处理后,能否恢复克隆质量。
评测资源与指标: * 数据集:整合了8个公开语音数据集,构建了一个包含225个说话人、14,370条话语的评测集,支持上述10个任务(18项具体评测)。 * 模型覆盖:评测了11个具有代表性的现代语音克隆模型,涵盖三大主流架构:自回归编解码器语言模型(如Fish-Speech)、扩散/流匹配模型(如StyleTTS-2)以及混合模型(如CosyVoice 2)。 * 评测指标:采用语音克隆领域的标准指标,包括说话人相似度、平均意见得分、词错误率、梅尔倒谱失真、实时因子,从音色保真度、内容准确性、音质和效率等多方面进行量化评估。
根据论文摘要和引言部分披露的初步发现(完整结果需阅读全文),RVCBench的评测揭示了当前语音克隆模型存在显著的鲁棒性缺陷:
这些发现首次系统性地描绘了当前语音克隆模型在实践中的失败图景,为后续研究指明了具体的改进方向。
这篇论文的价值在于创建了首个全面、系统、面向全流程的语音克隆鲁棒性评测基准RVCBench,它像一面“照妖镜”,清晰地揭示了当前先进语音克隆模型在非理想现实条件下的脆弱性,为未来开发更健壮、可信、可部署的语音克隆技术提供了至关重要的标准化测试平台和方向指引。
好的,作为一名专业的AI领域研究员,我已详细阅读了您提供的论文内容。以下是我为您撰写的深度总结:
这篇论文旨在解决一个新兴且被严重忽视的威胁:多说话人对话场景下的音频深度伪造。现有的音频深度伪造检测研究几乎完全集中于单说话人场景(如ASVspoof、ADD等数据集),其模型和数据集无法有效应对真实世界中日益增多的恶意应用,例如伪造政治辩论、商务会议录音等。现有方法的不足在于: * 数据集缺失:缺乏专门针对同一音频片段中包含多个说话人、具有自然对话动态(如话轮转换、重叠、背景噪音)的深度伪造数据集。 * 检测挑战:多说话人环境引入了单说话人场景中不存在的复杂性,如说话人分离、语音重叠、对话上下文一致性等,使得现有检测模型性能可能大幅下降。 * 威胁现实性:论文以2023年斯洛伐克选举前伪造的反对派领导人对话音频为例,强调了此类深度伪造在现实世界(尤其是政治操纵、电信诈骗)中可能造成的即时且严重的危害。
作者的核心贡献并非提出一个全新的检测模型,而是为这一新兴研究领域构建了系统性的研究基础,具体包括: * 概念性分类法:首次提出了一个针对多说话人对话音频深度伪造的三维分类框架(见图1),从对话语境(如访谈、辩论)、说话人构成(两人、多人)和操纵范围三个维度进行划分。其中,“操纵范围”被细分为: * 部分深度伪造:仅一个或多个说话人的部分语音被篡改。 * 完全深度伪造:整个对话(所有说话人)均为合成生成。 * 新数据集(MsCADD):创建并开源了首个专注于完全合成的多说话人对话音频深度伪造数据集。 * 规模与构成:包含2,830个音频片段(1,148个真实,1,682个伪造),时长10-22秒。 * 内容真实性:对话文本源自真实的YouTube多人对话语料库,确保了对话内容的自然性和多样性。 * 合成方法:采用两种先进的TTS模型(VITS 和基于 SoundStorm 的 NotebookLM)生成合成音频,以模拟不同的音色、口音和对话自发性(如笑声、停顿)。 * 多样性:涵盖了不同的说话人性别组合(男-女、女-女、男-男)以及干净/带噪背景。 * 基准测试:在MsCADD上系统性地评估了三个具有代表性的基线神经网络检测模型:LFCC-LCNN(轻量级CNN)、RawNet2(处理原始波形)和 Wav2Vec 2.0(自监督预训练模型),并报告了F1分数、准确率、真正例率和真负例率,为后续研究设立了性能基准。
这篇论文的价值在于前瞻性地识别并系统性地定义了“多说话人对话音频深度伪造”这一关键威胁领域,并通过提出首个分类法、创建首个专用基准数据集和提供初步性能基准,为该高度未探索但至关重要的研究方向奠定了坚实基石,推动了音频安全研究从单说话人向更复杂、更真实的对话场景演进。
好的,作为一名专业的AI领域研究员,我已详细阅读了您提供的论文内容。以下是我为您撰写的深度总结:
这篇论文旨在解决流式语音语言模型的高效部署难题。具体而言,现有方法存在两大核心不足: * 缺乏统一框架,部署碎片化:现代语音语言模型架构多样(如LLM主干、音频解令牌器、编码器的组合方式、码本设计等),导致现有部署方案通常是针对特定模型的“定制化”堆栈。这带来了高昂的工程成本(每换一个模型都需要重写优化逻辑)和次优的系统性能(无法在单一框架内进行全局优化,如协调LLM与解令牌器的调度)。 * 未针对流式应用优化:流式语音生成(如实时对话)对延迟和连续性有独特要求,其核心指标(如“首次音频时间”和“流式可行性”)与纯文本LLM的指标(如“首次令牌时间”)不同。现有系统(无论是LLM服务系统还是定制化方案)未能针对这些独特的性能指标进行端到端的优化调度,难以在保证低延迟和连续播放的同时,实现高吞吐。
作者提出了 VOXSERVE,一个以流式为中心的语音语言模型服务系统。其创新主要体现在两个层面: * 系统抽象层:设计了一个模型执行抽象接口,将模型架构细节与系统级优化解耦。这个接口能够统一描述和调度各种异构的语音模型组件(LLM、解令牌器、编码器),使得不同的模型架构可以在同一个框架下运行。这是实现统一优化的基础。 * 系统优化层:基于上述抽象,VOXSERVE实现了多项模型无关的优化: * 流式感知调度算法:针对流式指标(TTFA和流式可行性)进行优化。它不仅仅追求最小化延迟,而是智能地调度请求和模型组件,确保在满足“连续播放不中断”这一硬性约束的前提下,最大化系统吞吐量。 * 异步推理流水线:将LLM生成音频令牌与解令牌器将令牌转换为音频波形这两个主要阶段进行异步化处理,重叠计算与I/O,减少端到端延迟和空闲等待时间。 * 统一的性能优化原语:在抽象层之上,系统可以统一应用批处理、面向流式的分块解令牌、缓存管理和CUDA图优化等成熟技术,而这些技术此前因模型异构而难以通用化实施。
这篇论文的价值在于,它首次提出了一个统一、抽象且以流式性能为核心优化目标的语音语言模型服务系统,通过解耦架构与优化,系统性地解决了该领域部署碎片化和效率低下的痛点,为未来高效语音AI应用的规模化部署提供了重要的系统基础。
好的,作为一名专业的AI领域研究员,我已详细阅读了您提供的论文内容。以下是我为您撰写的深度总结:
这篇论文旨在解决野外环境下(in-the-wild)的通用音频驱动唇语同步问题。具体来说,其目标是开发一个能够根据任意说话者的音频,为任意身份的人物视频生成口型高度同步、视觉质量逼真的说话人脸视频的方法。
现有方法的不足主要体现在: * 音频-视觉特征融合不充分:以Wav2Lip及其改进版AttnWav2Lip为代表的主流方法,通常只是简单地将编码后的音频和视觉特征拼接(concatenate)后输入解码器。这种浅层的融合方式难以学习音频内容信息与嘴唇纹理信息之间的深层关联,导致音频信息在解码过程中逐渐衰减甚至失效,无法精确驱动高频细节(如细微的唇部动作)。 * 训练过程不稳定:基于生成对抗网络(GAN)的方法常面临训练困难、梯度消失或爆炸等问题,这会影响模型的收敛和最终生成图像的质量与稳定性。 * 泛化性与质量难以兼得:一些方法(如基于3D模型或特定人物训练的方法)成本高、泛化性差;而一些2D方法在提升泛化能力时,又可能在唇部同步精度或图像质量上做出妥协。
作者提出了一个名为 LPIPS-AttnWav2Lip 的新框架,其核心创新点围绕增强特征融合和稳定训练过程展开,主要包括三个部分:
这篇论文的价值在于,它通过引入语义对齐模块和LPIPS损失,从特征融合和训练稳定性两个关键层面改进了音频驱动唇语同步任务,为实现高精度、高泛化性且训练稳定的“野外”通用说话人生成提供了一个有效且创新的解决方案。
好的,作为一名专业的AI领域研究员,我已详细阅读了您提供的论文内容。以下是我为您撰写的中文深度总结。
论文标题: 《超越全向性:使用交叉注意力为任意麦克风指向性模式进行神经Ambisonics编码》
这篇论文旨在解决一个现实而棘手的问题:如何将来自任意、不规则配置的消费级麦克风阵列(如手机)的录音,高质量地编码为标准化的空间音频格式——Ambisonics。
核心痛点总结:需要一个既能处理复杂真实麦克风特性(而不仅仅是几何位置),又能实现跨设备泛化的Ambisonics编码方案。
作者提出了一种名为 “神经Ambisonics编码器” 的新型深度学习架构,其核心创新在于使用完整的、复数形式的阵列传递函数(ATF)作为元数据,并利用交叉注意力机制动态地融合音频信号与阵列特性信息。
模型架构:
Z_X。Z_H。Z_X 作为 查询,指向性特征 Z_H 作为 键 和 值。注意力机制会计算信号特征与指向性特征之间的相关性(分析),然后根据相关性对指向性特征进行加权组合(合成),生成一个与具体阵列无关的、融合了空间信息的潜在表示 Z_Attn。这个过程让模型能够“动态地咨询”阵列的特性来理解当前声音的空间构成。Z_Attn 通过一个可学习的仿射变换,解码为时频点上的复数混合矩阵 E。该矩阵用于将麦克风信号即时转换为目标Ambisonics信号。训练策略与损失函数:
(音频信号, ATF)到编码滤波器矩阵E的映射函数。由于ATF完整描述了阵列特性,模型在训练中见到了大量不同的ATF,从而获得了对任意具有相同麦克风数量但ATF未知的阵列的泛化能力。这篇论文的价值在于,它首次提出并验证了一个能够泛化到任意未知、非理想麦克风阵列的神经Ambisonics编码框架,通过引入完整的阵列传递函数和交叉注意力机制,巧妙地解决了消费级设备空间音频编码中的实用性与高质量之间的核心矛盾,为沉浸式音频在真实设备上的落地提供了关键技术路径。
核心痛点: 这篇论文旨在解决如何更有效地利用语音中的声学和语言学信息来提升认知状态(如认知正常、轻度认知障碍、阿尔茨海默病)分类性能的问题。现有方法存在三个主要不足:第一,多数研究依赖单一模态(仅声学或仅文本),无法全面捕捉痴呆症在语音中表现的复杂多维度线索;第二,在融合多模态信息时,通常采用简单的后期融合或拼接,未能深入探索特征层面的早期融合及其与模型内部表示深度的关系;第三,对于预训练模型(如wav2vec 2.0, Whisper),通常默认使用最终层输出,但中间层可能包含对认知评估更相关的副语言学特征(如韵律、停顿),而这一维度未被系统研究。
方法创新: 作者提出了一种层感知的早期融合方法,核心创新点在于系统性地探索了预训练编码器不同中间层的声学嵌入与文本嵌入的融合效果。
[T, D_audio + D_text]。实验结果: 在源自DementiaBank的公开数据集(共1,629名说话人,包含CN、MCI、ADRD三类)上进行了测试。
一句话评价: 这篇论文的价值在于,它通过严谨的层析实验揭示了多模态融合在认知状态分类中的有效性高度依赖于声学特征的表示深度,并明确了早期融合与后期融合分别优化不同性能维度(区分度 vs. 校准度),为构建更可靠、可解释的临床辅助诊断模型提供了重要的方法论指导。
好的,作为一名专业的AI领域研究员,我已详细阅读了您提供的论文内容。以下是我为您撰写的深度总结:
这篇论文旨在解决文本转语音(TTS)系统中情感表达的精确性与可控性问题。具体而言,当前许多情感感知TTS系统(包括基于大语言模型LLM的系统)存在以下不足: * 方法局限:主流方法通常依赖于缩放固定的情感嵌入向量或依赖外部提示(如自然语言描述)来引导情感生成。这种方法将所有模型参数共享,未能显式地建模不同情感类别在潜在空间中的特异性偏移。 * 结果问题:上述局限导致模型在渲染情感时可解释性差、可控性弱,难以在不同语句和情感类别间保持稳定且恰当的情感表达,尤其是在处理中性与非中性情感状态时。
作者提出了一个名为 EmoShift 的轻量级激活引导框架,其核心创新在于引入了一个 EmoSteer层。
* 核心思想:借鉴“激活引导”范式,通过学习情感特定的引导向量,在推理时直接修改模型隐藏状态,从而精确控制输出语音的情感,而无需重新训练或修改基础TTS模型。
* 模型架构与操作:
* 在基于LLM的TTS模型(如CosyVoice)的输出嵌入层后插入EmoSteer层。
* 对于目标情感 e,该层通过一个可学习的投影矩阵 W_e,将原始隐藏状态 h 投影为一个情感特定的引导向量 v_e。
* 修改后的隐藏状态为:h' = h + ϵ * v_e(训练时),或 h' = h + α * ϵ * v_e(推理时)。其中 ϵ 是基础缩放因子,α 是推理时可调的增益因子,用于精细控制情感强度。
* 训练策略:
* 轻量级:仅训练EmoSteer层中的投影矩阵参数(约1000万),而冻结庞大的基础TTS模型(如311M参数的CosyVoice)。这使得可训练参数量不到全参数微调的1/30。
* 即插即用:训练完成后,EmoSteer层可以无缝集成到现有TTS流程中,实现可移植的情感渲染。
α,可以实现情感强度的连续、可控调节,且不损害情感类别的保真度。这篇论文的价值在于,它巧妙地将轻量级、可解释的“激活引导”技术引入情感TTS领域,以极小的参数开销实现了更精确、更可控且可强度调节的情感语音合成,为构建高效、灵活的高表现力TTS系统提供了一种新颖且实用的解决方案。
好的,作为一名专业的AI领域研究员,我已详细阅读了您提供的论文内容。以下是我为您撰写的深度总结。
论文标题: CALM: Joint Contextual Acoustic-Linguistic Modeling for Personalization of Multi-Speaker ASR
这篇论文旨在解决多说话人、语音重叠场景下的个性化自动语音识别(ASR) 的核心难题。具体而言,现有系统在真实对话场景(如会议、群组讨论)中面临两大挑战: * 声学挑战:在语音重叠时,非目标说话人的声音会干扰系统,导致难以准确识别“谁在说什么”。 * 语言学挑战:对话中常出现训练数据中罕见或未见的专有名词、缩写和技术术语,标准ASR模型难以准确识别这些词汇。
现有方法的不足在于,它们通常孤立地处理这两个问题: * 目标说话人ASR方法专注于利用说话人嵌入等技术从混合语音中提取目标声学特征,但无法有效利用对话上下文中的词汇信息。 * 上下文偏置方法专注于利用给定的词汇列表(如与会者姓名、项目术语)来提升特定词汇的识别率,但在多说话人重叠场景下,难以与说话人身份信息有效结合,且扩展性受限。 因此,现有方案忽略了声学与语言学上下文之间的内在关联,导致在复杂的多说话人重叠对话中,个性化识别性能不佳。
作者提出了一个名为 CALM 的联合上下文声学-语言建模端到端框架,其核心创新在于将目标说话人提取与动态词汇上下文偏置深度融合。
模型架构:
损失函数与训练策略:
论文在三个数据集上进行了全面评估: * 模拟英语数据:LibriSpeechMix(2人和3人混合语音)。 * 模拟日语数据:CSJMix(基于自发日语语料库的混合语音)。 * 真实会议数据:AMI语料库(IHM-Mix条件,4-5人)。
主要性能提升(相比仅使用目标说话人ASR或上下文偏置的基线): * 在LibriSpeech2Mix上:偏置词错误率(B-WER) 从基线的12.7%大幅降低至4.7%,证明了其精准识别上下文相关词汇的能力。 * 在CSJMix2上:偏置字符错误率(B-CER) 从16.6%降至8.4%,证明了该框架跨语言的有效性。 * 在AMI真实数据上:同样观察到WER和B-WER的显著下降,验证了其在真实、非模拟多说话人会议场景中的实用性。 * 实验还表明,CALM在不同大小的偏置列表下均表现稳健,并且通过VAD辅助损失进一步提升了在语音重叠严重情况下的性能。
这篇论文的价值在于,它首次在一个统一的端到端框架内,系统性地整合了声学层面的说话人自适应与语言学层面的动态上下文偏置,为复杂多说话人重叠场景下的个性化ASR提供了一个强大且可扩展的解决方案,并在多语言和真实数据集上取得了显著优于现有技术的性能。
好的,作为一名专业的AI领域研究员,我已详细阅读了您提供的论文内容。以下是我为您撰写的深度总结:
这篇论文旨在解决一个关键问题:如何将仅解码器架构的大语言模型有效地应用于流式语音识别,并同时优化识别延迟。
现有方法的不足主要体现在: * 依赖外部对齐模块: 许多现有方法(如基于CTC或混合ASR系统)需要预先对语音和文本进行强制对齐。这种级联设计复杂,难以进行端到端优化。 * 缺乏自适应延迟控制: 一些方法采用固定大小的音频块进行处理,仅在块结束时生成文本。这种机制无法根据语音内容动态调整分割边界,导致延迟难以最小化,无法实现真正的低延迟流式识别。 * 训练流程复杂: 流式与非流式模型通常分开训练和维护,增加了系统开发和部署的成本。
作者提出了一套名为 “Streaming LLM-ASR” 的端到端流式识别框架,其核心创新点包括:
L_LLM)和MoChA解码器损失(L_MoChA)外,作者引入了最小延迟训练损失(L_minLT)。该损失利用一个预训练的混合ASR系统生成的强制对齐边界作为“黄金标准”,引导MoChA策略网络学习更准确、更及时的分割点,从而直接优化延迟。论文在以下三个普通话数据集上进行了评估: * AISHELL-1 (165小时) * AISHELL-2 (1000小时) * 内部多领域数据集(MD) (约1小时)
主要结果: * 识别准确率: 在AISHELL-1和AISHELL-2测试集上,该方法分别取得了5.1% 和5.5% 的字错误率(CER),一致优于近期提出的其他流式LLM-ASR基线模型。 * 延迟优化: 引入最小延迟训练损失(minLT)后,在几乎不影响识别准确率的前提下,实现了平均标记生成延迟降低62.5% 的显著效果。 * 消融实验: 验证了统一训练框架的有效性,并证明了利用预训练LLM参数(通过LoRA)带来的性能收益。
这篇论文的价值在于,它首次将动态分割的MoChA机制与LLM深度融合,并辅以创新的延迟感知损失和流式/非流式统一训练策略,为构建高精度、低延迟、且易于部署的端到端流式LLM-ASR系统提供了一个强大而优雅的解决方案。
好的,作为一名专业的AI领域研究员,我已详细阅读了您提供的论文内容。以下是我为您撰写的中文深度总结。
论文标题: 面向同类别声源的声场语义分割:一种类感知的置换不变信噪比方法
这篇论文旨在解决现实世界中多通道音频混合场景下,存在多个同类别声源时,现有声场语义分割系统性能下降和评估指标失效的核心问题。
具体问题:
现有方法的不足:
作者提出了一套完整的解决方案,包括改进的模型架构、新的损失函数和全新的评估指标。
1. 改进的音频标注模型:
2. 创新的源分离损失函数:类感知置换不变SDR:
3. 全新的评估指标:类感知置换不变SDR提升:
这篇论文的价值在于,它敏锐地指出了当前声场语义分割研究与应用(DCASE挑战赛)中的一个关键假设缺陷(类别互斥),并提出了一套从模型训练到性能评估的完整、优雅的解决方案,推动了S5技术向更复杂、更真实的音频场景迈进。
好的,作为一名专业的AI领域研究员,我已详细阅读了您提供的论文内容。以下是我为您撰写的中文深度总结:
这篇论文旨在解决语音增强(SE)模型中,如何更有效地利用自监督学习(SSL)表征中的语义(语音学)信息这一核心问题。
现有方法的不足主要体现在两个方面: * SSL表征的噪声鲁棒性缺失:主流的SSL模型(如HuBERT、WavLM)通常在干净语音上训练,当输入为含噪语音时,其表征中的语义信息会严重受损。虽然存在鲁棒性研究,但对这些大型模型进行微调成本高昂且可能损害其泛化能力。 * 聚合模块的优化目标错位:当前SE模型通常采用一个轻量级的聚合模块(如加权求和)来融合SSL模型的多层特征。然而,该模块是与SE模型联合训练的,其优化目标是与干净语音在声学层面(如频谱图)的相似度。这导致聚合模块倾向于选择对声学重建有用的特征,而非最能保留语义内容的特征,违背了引入SSL表征的初衷。
作者提出了一种解耦的、以语音学信息为先的优化框架,核心是 “语言聚合层”。
这篇论文的价值在于,它通过严谨的信息论分析揭示了当前语音增强中SSL表征聚合的根本矛盾,并提出了一种简单而有效的解耦优化范式,将“语义信息保留”作为聚合模块的首要且独立的设计目标,显著提升了增强语音的可懂度,为如何更智能地利用预训练模型提供了新思路。
好的,作为一名专业的AI领域研究员,我已详细阅读了您提供的论文内容。以下是我为您撰写的深度中文总结。
论文标题: 一种针对说话人识别系统误分类的有效基于能量掩码的对抗性规避攻击
这篇论文旨在解决针对说话人识别系统的对抗性攻击问题,其核心痛点是:如何在有效欺骗AI模型(高攻击成功率) 的同时,最大限度地保持原始音频的感知质量(低人耳可察觉性),从而实现更隐蔽、更实用的攻击。
作者提出了一种名为 “掩蔽能量扰动”(Masked Energy Perturbation, MEP) 的新方法,其核心创新在于将对抗性扰动的生成与人类听觉掩蔽效应相结合。
这篇论文的价值在于,它创新性地将心理声学原理(听觉掩蔽) 引入到对抗性攻击的生成过程中,提出了一种能在攻击有效性和音频不可感知性之间取得卓越平衡的新方法,为评估和增强说话人识别系统的鲁棒性提供了一个更贴近实际威胁的新视角和强大工具。
好的,作为一名专业的AI领域研究员,我已详细阅读了您提供的论文内容。以下是我为您撰写的中文深度总结:
这篇论文旨在解决基于语音的临床疾病分类中面临的两个根本性挑战: * 数据稀缺:获取大规模、高质量、带专家标注的医疗语音数据非常困难,这限制了传统监督学习模型的性能。 * 领域不匹配:为克服数据稀缺,常采用在通用音频数据集(如AudioSet)上预训练的模型进行迁移学习。然而,这些模型旨在区分“语音”与“音乐”等宽泛类别,其学到的特征表示缺乏捕捉临床语音中细微病理特征(如嗓音震颤、嘶哑)的分辨率,导致性能不佳。
现有方法(如SSAST)虽然利用自监督学习(SSL)减少了对标签的依赖,但其标准配置(如MSE损失、全局归一化、随机掩码)是为通用音频或视觉任务设计的,对于具有非平稳、复杂病理特征的临床语音谱图而言是次优的。
作者提出了一种针对领域优化的自监督学习(Domain-Adaptive SSL)方法,核心是系统性地优化掩码自编码器(MAE)框架的三个关键组件,以更好地适应临床语音数据的特点:
这篇论文的价值在于,它通过一项严谨的消融研究,系统地揭示了自监督学习(SSL)的关键组件(损失、归一化、掩码)在应用于数据受限的医疗音频领域时需要针对性优化,而非直接套用通用配置,从而为如何将SSL有效适配到专业医学领域提供了重要的方法论参考和设计范例。
好的,作为一名专业的AI领域研究员,我已详细阅读了您提供的论文内容。以下是我为您撰写的中文深度总结。
这篇论文旨在解决语音建模中“高效”与“通用”难以兼得的核心矛盾。具体而言: * 问题:现有的语音表征或分词方法存在两难困境。一方面,基于自监督学习(SSL)的模型(如HuBERT)能捕捉丰富的语言学信息,但其表征是帧级的,时间分辨率过高(通常为50-100 Hz),导致下游模型(如语音合成、语音识别)需要处理过长的序列,效率低下。另一方面,基于变分自编码器(VAE)或量化方法的最新工作(如Mimi, VibeVoice)虽然能将语音压缩到较低频率(如7.5-12.5 Hz),但它们通常牺牲了语言学内容的有效编码,且大多局限于单一语言(如英语)和特定风格(如朗读语音)。 * 现有不足:近期有研究提出利用音节作为约5 Hz的低频语音单元,在效率上优势明显。然而,这些方法(如初代Sylber)存在严重缺陷:1) 缺乏通用性:仅在英语朗读语音上训练,无法泛化到其他语言和表达风格(如歌唱);2) 缺乏声学细节:编码的音节令牌主要包含语言学内容,丢失了说话人身份、音色等关键声学信息,导致重建语音质量差或需要额外模块来补充。
作者提出了 Sylber 2.0,一个自监督的、通用的音节级语音编码-解码框架。其核心创新在于设计了一个动态、多组分的音节嵌入系统,并采用分阶段训练策略。
模型架构与编码流程:
关键训练策略与损失函数:
这篇论文的价值在于,它首次成功构建了一个真正通用、高效且信息完整的音节级语音抽象,通过创新的多组分嵌入设计和纯自监督训练,在极低的时间分辨率(~5 Hz)下同时保留了语言学和声学信息,为下一代高效、通用的口语语言模型奠定了关键的基石。
好的,作为一名专业的AI领域研究员,我已详细阅读了您提供的论文内容。以下是我为您撰写的中文深度总结:
这篇论文旨在解决一个关键问题:当前基于大语言模型(LLM)的“合成用户角色”在设计和用户研究中,虽然交互性强,但其回答往往缺乏可验证的证据基础,容易产生“有说服力但不可靠”的幻觉,从而误导设计决策。
现有方法的不足主要体现在: * 证据缺失与幻觉:现有方法主要依赖提示工程进行角色扮演,LLM会生成看似合理但无法追溯至真实用户数据的观点,存在严重的“幻觉”风险。 * 静态与不透明:基于数据生成的静态角色无法进行交互式访谈;而交互式角色则缺乏在对话过程中实时检索和引用证据的机制,其回答的“数据来源”不透明。 * 验证困难:设计师和研究人员无法核实角色回答是否真正代表了目标用户的真实声音,这削弱了其作为研究工具的有效性和可信度。
作者提出了 PersonaCite 系统,其核心创新在于 “检索增强的角色模拟” ,将证据约束从角色创建时转移到每一次交互时。具体方法如下:
这篇论文的价值在于,它没有停留在提升LLM角色扮演的“拟真度”,而是通过一套严谨的检索增强与证据约束架构,将AI角色重新定位为可交互、可验证的“经验证据档案”,为在以人为本的设计流程中负责任地使用AI提供了重要的方法论和系统范例。
好的,作为一名专业的AI领域研究员,我已详细阅读了您提供的论文内容。以下是我为您撰写的中文深度总结。
这篇论文旨在解决人工耳蜗(CI)用户在“鸡尾酒会”等复杂听觉场景下面临的核心难题:当多个说话者声音重叠时,传统CI处理策略无法识别并增强用户意图聆听的目标说话者,导致言语清晰度急剧下降。
现有方法的不足主要体现在两个方面: * 传统CI声音编码策略(如ACE):仅将声学能量映射为电刺激模式,完全忽略了用户的认知状态和选择性注意,不具备“认知适应性”。 * 基于深度学习的端到端CI处理模型(如DeepACE):虽然能分离多个声源,但输出的是两个独立的电刺激图,存在“标签置换歧义”问题。这意味着系统无法自动判断哪个输出对应的是用户想听的说话者,需要额外的选择机制(如外部选择器或用户手动选择),这在实时场景中不切实际。
作者提出了一种脑信息引导的端到端语音分离系统,将脑电图(EEG)提取的注意力线索与声学信号融合,直接生成单一的目标说话者电刺激图。
核心创新点包括:
* 模型架构(Neuro-DeepACE):
* 双模态编码:使用两个独立的卷积编码器分别处理音频混合信号和EEG注意力线索,生成特征 F_audio 和 F_EEG。
* 轻量级融合层:通过逐元素相乘的方式融合音频和EEG特征:F_fused = F_audio ⊙ F_EEG。这种设计计算高效,且能自然地引导网络关注与EEG线索相关的声学特征。
* 单目标输出:融合后的特征通过一个掩码生成器(TCN)产生单一掩码,应用于音频特征后,解码生成单一的目标说话者电刺激图。这从根本上解决了标签置换歧义问题,无需后处理选择。
* 训练策略(混合课程学习):
* 问题:真实EEG线索存在噪声、伪影和个体差异,质量不稳定。仅在理想化(干净)线索上训练会导致模型在实际应用中表现不佳。
* 解决方案:提出一种混合课程学习策略,在训练过程中动态控制EEG线索的质量:
* 30%概率使用干净线索:保持模型对高质量线索的利用能力。
* 65%概率使用按计划逐步增加的噪声:模拟EEG质量逐渐恶化的过程,提升鲁棒性。
* 5%概率使用随机中间噪声:增加训练样本的多样性,防止模型过拟合到某一种特定的噪声模式。
* 目的:使模型能够适应从高质量到低质量的各种EEG线索,确保在实际应用中性能稳定。
这篇论文的价值在于,它首次将轻量级、鲁棒的脑-机接口(BCI)融合机制与低延迟人工耳蜗处理管线相结合,通过创新的混合课程学习策略解决了脑电线索不稳定的核心挑战,为实现真正“认知自适应”的下一代人工耳蜗迈出了关键且务实的一步。
传统十二音序列主义(经典序列主义)在构建序列时,通常基于音符之间的音程保持不变,这限制了作曲家在音程变化上的多样性,可能导致音乐材料重复或缺乏创新性。Jean Barraqué 的增殖序列方法通过引入新的不变性——即序列间音符的排列变换(置换),而非音程,来扩展序列主义的可能性,但这种方法在数学结构和应用潜力方面尚未被充分探索,作曲家对其理解和利用有限。
本文从数学角度研究增殖序列,特别是基于传统序列主义变换(如转位、逆行、倒影、逆行倒影)构建的序列。关键创新包括: - 置换理论的应用:使用群论分析增殖序列的结构,将序列间变换表示为置换,并通过不相交循环分解来理解其行为。例如,置换的顺序(即增殖生成的序列数量)由循环长度的最小公倍数决定。 - 数学分类:将增殖序列的置换结构分类为循环组合(如 [{4}, {8}]),并研究不同变换类型(P、R、I、RI)下的增殖数量和可能结构。 - 泛化到微音阶:将方法扩展到非12音阶(如四分之一音或三度音),使用模 n 运算,允许任意音高划分,从而扩展了序列主义在微音音乐和其他参数(如节奏)中的应用。 - 实用工具:提供 Python 脚本(附录 A)帮助作曲家和音乐家操作序列并验证数学规律,即使他们不熟悉底层构造。
本文通过数学群论深入解析了 Jean Barraqué 的增殖序列,为序列主义提供了新的理论框架和实用工具,有望推动音乐创作向更复杂和多样化的方向发展。
论文针对小规模数据集(如EA V数据集,每个受试者约280个训练样本)在情感识别任务中面临的挑战,探讨复杂注意力机制是否有效。核心痛点是数据有限导致深度学习模型容易过拟合,复杂架构可能破坏预训练特征,从而影响性能。
论文系统评估了三类模型: - M1(基线Transformer):使用预训练Transformer架构(如AST、ViT)作为基准。 - M2(因子化注意力机制):针对EEG、音频和视频模态设计定制化注意力机制(如EEG的三流Transformer、音频的时频双注意力、视频的时空因子化注意力),旨在提升性能但引入复杂性。 - M3(CNN改进):通过简单领域特征工程(如音频添加delta MFCCs、EEG使用频域特征如带功率和微分熵)和错误修复(如移除多余softmax),强调领域知识和实现优化。
论文通过实证研究强调在小规模情感识别任务中,简单领域特征工程比复杂注意力机制更有效,为资源有限场景提供了实用指导。
论文指出,说话人验证系统在语言不匹配条件下性能显著下降,这主要是由于领域依赖英语中心数据,导致跨语言场景下的鲁棒性不足。
提出TidyVoice 2026挑战赛,专注于跨语言说话人验证。创新点包括: - 利用TidyVoiceX数据集,这是一个基于Mozilla Common Voice构建的大规模多语言语料库,涵盖约40种语言,专门设计用于隔离语言切换的影响。 - 采用开放训练条件,允许使用官方训练分区、其他公开或私有数据、预训练模型(如VoxCeleb、wav2vec2等)以及外部非语音数据增强。 - 评估集包含38种未见语言,测试系统对新语言的泛化能力,并分为两个试验列表:tv26_eval-A(注册语音来自已见语言,测试语音来自未见语言)和tv26_eval-U(注册和测试语音均来自未见语言)。 - 提供标准化数据、开源基线和严格评估协议,以促进公平、包容和语言无关的说话人识别技术研究。
论文为挑战赛计划,未提供具体实验结果,但定义了评估指标: - 主要指标:等错误率(EER),用于排名,在开发和评估阶段计算总体和四种试验对子集(目标对同语言、目标对不同语言、非目标对同语言、非目标对不同语言)。 - 次要指标:最小检测成本函数(minDCF),用于打破平局和全面性能分析,设置参数为C_miss = C_fa = 1.0,P_tar = 0.01。
该挑战赛通过引入多语言数据集和严格评估框架,有效应对说话人验证中的语言不匹配问题,推动领域向更公平和语言鲁棒的方向发展。
DisContSE通过联合离散与连续嵌入、引入语义增强模块和创新的单步反向过程,在显著降低推理复杂度的同时,全面提升了语音增强的保真度、可懂度和音素准确性,是该领域的高效突破性工作。
现有语音质量评估(SQA)模型主要从话语或系统层面进行整体质量评分,缺乏可解释性,无法定位具体质量问题。虽然帧级评分能提供更好的可解释性,但由于训练时缺乏强目标,模型难以调优和正则化。
提出一种基于片段一致性约束的正则化方法,用于改进帧级语音质量评分。该方法通过最小化完整上下文与随机切片上下文下嵌入表示和帧级评分之间的差异,减少帧级随机性,提高局部伪影检测精度。具体损失函数结合了SQA损失、嵌入一致性损失和帧评分一致性损失。
通过一致性约束正则化帧级评分,在保持整体质量评估性能的同时,显著提升了局部语音质量问题检测的精度和可解释性。
CAT通过结合多分辨率处理和表示正则化,有效解决了音频自监督学习中粒度单一和训练效率低下的问题,实现了性能提升和训练加速的双重突破。
现有文本到音频生成模型主要在变分自编码器的声学潜在空间中操作,导致生成的音频与文本描述之间的语义对齐不足,难以精确捕捉声音事件的全局身份和时序序列。
提出SemanticAudio框架,采用两阶段流匹配架构: 1. 语义规划器:在高层语义空间中生成紧凑的语义特征,规划全局事件布局。 2. 声学合成器:基于语义规划生成高保真声学潜在表示。 此外,引入无需训练的文本引导编辑机制,通过源和目标文本提示的矢量场差异在语义空间中实现精确属性级修改。
实验表明,SemanticAudio在语义对齐方面优于现有主流方法,如AudioLDM、Make-An-Audio、AudioGen和Tango。
该框架通过解耦语义规划和声学合成,显著提升了文本到音频生成的语义一致性和编辑灵活性。
传统自动语音识别(ASR)系统通常以词错误率(WER)作为主要评估指标,但在实际应用中(如字幕生成、笔记记录和下游口语理解任务),语义保真度更为关键。这一矛盾在构音障碍语音识别中尤为突出,因为发音不精确、不流畅和异常韵律会导致严重的语义失真,即使WER较低,也可能无法准确传达说话者的意图。
LLM代理后处理框架:提出一个基于大语言模型(LLM)的“法官-编辑”代理(JEA),对ASR生成的top-k假设进行后处理。该代理通过跨假设一致性分析,保留高置信度片段,选择性重写或融合不确定片段,以生成语义更准确的转录文本。
两种部署模式:支持零样本提示和轻量级微调两种模式,无需修改声学模型,训练成本低。
新基准数据集SAP-Hypo5:发布了目前最大的构音障碍语音后处理基准数据集,包含35k条语音,每条语音配有参考转录和ASR生成的top-5独特假设,支持可重复研究和未来探索。
多维度评估协议:除了WER,还引入了语义相似度指标(Q-Emb、BERTScore、MENLI)和下游任务指标(意图准确率、槽位微平均F1),提供更全面的系统性能评估。
WER改进:在SAP-Hypo5测试集上,微调后的JEA代理将WER从基线13.63%降低至11.78-12.13%,在错误样本(Err组)上从21.98%降低至18.79-19.26%。
语义指标提升:在Err组上,微调代理在语义指标上取得显著提升:Q-Emb从88.18%提升至89.57-89.84%,BERTScore F1从74.51%提升至77.53-77.92%,MENLI从55.62%提升至62.03-62.88%。
下游任务改进:意图准确率从82.51%提升至84.24-85.45%,槽位微平均F1从52.15%提升至56.90-57.85%。
领域适应性分析:研究发现WER对领域偏移高度敏感,而语义指标与下游任务性能相关性更强,表明语义保真度评估在现实应用中更为稳健。
该研究通过创新的LLM代理后处理框架和全面的多维度评估,有效解决了构音障碍语音识别中语义保真度的关键问题,为鲁棒语音识别系统的发展提供了重要方法论和基准资源。
Qwen3-ASR家族通过创新的LALM方法和全面训练策略,在多语言ASR和强制对齐任务中实现了高性能和高效率,推动了语音识别社区的研究和应用。
在时间紧迫的扩展现实(XR)场景中,用户需要在执行主要任务时快速将注意力重新定向到危险、警报或指令上。视觉带宽有限,而现有研究缺乏对用户在即时、时间受限条件下如何准确解释空间化听觉线索的实证理解,特别是在刺激特性和短期感知校准的影响方面。
本研究进行了一项受控探索性研究(N=17),量化用户在短暂听觉暴露下从空间音频推断粗略方向的准确性。使用HRTF渲染的宽带刺激(覆盖低频ITD、中频ILD和高频频谱线索),从听者周围的半密集方向呈现。研究考察了两个因素:刺激发射方向和短期视听反馈训练的存在与否,将空间音频定位为支持快速定向响应的即时注意力引导线索,而非通过扩展探索实现精确定位。
研究发现,短暂的空间线索可以传达粗略的方向信息,短期校准可以提高用户对听觉信号的感知。然而,仅凭听觉线索可能无法为复杂或高风险任务提供足够的精度,空间音频在与其他感官模态或视觉线索互补时可能最有效,而不依赖于头部驱动的细化。
这项研究为XR中空间音频作为快速注意力引导机制的潜力提供了实证基础,强调了多模态整合的必要性,并为时间关键型应用的设计提供了实用见解。
音乐抄袭检测研究存在三大核心问题:1)任务定义不清晰,与音频指纹识别、翻唱歌曲识别等其他音乐信息检索任务混淆;2)现有研究多依赖人工构建的数据集,导致模型过拟合,难以应用于真实场景;3)数据集和评估指标不一致,研究结果难以直接比较。
该研究通过明确定义任务和引入分段转录方法,为音乐抄袭检测提供了系统化的解决方案,但实际检测性能仍有提升空间,特别是在复杂真实场景中的应用。
语言局限性:现有构音障碍语音评估方法大多局限于单一语言(尤其是英语),难以扩展到其他语言,而全球神经疾病患者数量增长需要跨语言评估工具。
临床实践瓶颈:当前临床依赖言语病理学家的主观感知评分,存在主观性强、耗时、难以规模化的问题。
技术挑战:传统方法(如Goodness of Pronunciation)需要语言特定的声学模型和音素对齐标注,而神经方法需要大量标注数据且可解释性差。
语言特异性缺失:现有多语言模型仅使用通用表征,忽略了语言特定的音系结构对可懂度的影响,导致性能不如单语言模型。
两阶段框架设计:提出通用音素识别(UPR)+ 语言特定音素解释的框架,先获取语言无关的语音表征,再根据各语言的音系结构进行解释。
对比性音系特征映射:使用对比性音系特征距离进行音素到音位的映射和序列对齐,捕捉语言特定的音位对比关系。
新评估指标PhonCov:提出对齐无关的音素覆盖率指标,量化说话者音素库的减少情况,补充传统的PER和PFER。
多语言统一处理:支持英语、西班牙语、意大利语、泰米尔语四种语言,无需为每种语言单独训练模型。
指标改进:PER受益于映射和对齐的组合,PFER仅受益于对齐,PhonCov受益于映射。
临床相关性:框架捕捉到的可懂度下降模式与临床观察一致,证明其临床意义。
多语言验证:在四种语言上验证了框架的有效性,展示了跨语言应用的潜力。
该研究通过结合通用音素识别和语言特定音系建模,有效解决了多语言构音障碍语音评估中语言特异性与可扩展性的平衡问题,为临床提供了更客观、可解释的评估工具。
当前多模态大语言模型(LLMs)处理音频时通常仅使用单声道流,忽略了空间音频信息,而现有空间音频模型受限于固定麦克风几何结构,无法跨设备部署。
本文提出PhaseCoder,一种基于Transformer的空间音频编码器,无需依赖特定麦克风几何结构。它输入多通道原始音频和麦克风坐标,通过相位差提取空间信息,生成鲁棒的空间嵌入(称为“空间音频令牌”)。模型采用短时傅里叶变换(STFT)提取幅度和相位特征,结合序列、帧和麦克风位置嵌入,使用5层Transformer编码器处理,输出用于距离、方位角和仰角预测的嵌入。PhaseCoder与Gemma 3n LLM结合,通过微调使LLM能理解空间音频令牌,实现空间推理和定向转录任务。
PhaseCoder在麦克风不变定位基准测试中达到最先进水平,首次使LLM能从任意麦克风阵列执行复杂空间推理和定向转录。实验验证了模型在噪声环境下的鲁棒性和泛化能力。
PhaseCoder通过几何无关的空间音频编码,有效桥接了通用空间音频表示与LLMs的理解能力,为嵌入式AI和下一代助手提供了关键技术支持。
在线声源计数是助听设备等实时语音处理应用的关键技术,但现有方法存在以下问题:1)传统方法依赖手动调参的阈值,鲁棒性差;2)多数方法处理延迟高(200ms以上),不适用于低延迟场景;3)现有基于空间相干性的方法仅能检测声源激活,无法检测声源去激活;4)部分方法依赖麦克风阵列几何先验知识,通用性受限。
本文提出一种基于深度神经网络的在线声源计数方法,主要创新点包括: 1. 空间白化与广义幅度平方相干性(GMSC)特征:通过空间白化操作,将声源计数问题转化为变化检测任务,利用GMSC量化空间相干性作为特征。 2. 时间反转白化特征:针对声源去激活检测,提出一种时间反转的白化方法,将去激活问题转化为激活检测问题,解决了传统方法只能检测激活的局限性。 3. 紧凑神经网络架构:采用因果结构的时序卷积网络(TCN)和门控循环单元(GRU)网络,基于GMSC特征进行帧级声源数量估计,避免了手动阈值调优。 4. 低延迟处理:方法设计适用于双耳助听器设置,在混响和噪声环境中实现帧级在线处理,满足实时性要求。
在模拟双耳助听器场景(最多4个说话人、背景噪声、混响环境)中的实验表明: 1. 提出的DNN声源计数器在准确率和平均绝对误差上显著优于传统阈值方法。 2. 加入去激活特征后性能进一步提升。 3. GRU-based估计器表现优于TCN-based估计器,帧级准确率达到91.9%。
本文通过创新的时间反转白化特征和紧凑DNN架构,实现了鲁棒、低延迟的在线声源计数,解决了传统方法在去激活检测和阈值依赖方面的关键缺陷。
当前无参考(NR)语音质量评估模型面临两大核心问题:1)模型在训练数据集上表现良好,但在真实世界未见数据上性能显著下降,存在泛化能力不足的问题;2)使用多个数据集训练时,由于主观测试评分的非绝对性(语料库效应),不同数据集间的标签存在固有偏差,导致训练噪声和性能限制。
本文提出数据集隐藏(Dataset Concealment, DSC)方法,这是一种严格的评估框架,通过三种训练配置来量化模型泛化能力: - 个体模型:仅使用单个数据集训练 - 全局模型:使用所有数据集训练 - 隐藏模型:使用除目标数据集外的所有数据集训练
通过计算两个关键指标来评估模型: - 多样性差距:个体模型与全局模型性能差异,反映模型从多数据集学习的整合能力 - 隐藏差距:全局模型与隐藏模型性能差异,反映模型对未见数据的泛化能力
同时,为解决语料库效应,引入AlignNet中的数据集对齐器(Aligner)模块,在训练过程中学习数据集间的对齐关系,提升模型在未见数据上的表现。
DSC框架为语音质量评估模型的泛化能力提供了系统化的量化评估方法,结合数据集对齐技术,有效提升了模型在真实场景中的实用性。
在语音增强(SE)模型中,使用自监督学习(SSL)表示进行微调时,常采用均方误差(MSE)损失来比较增强语音和干净语音的SSL表示。然而,MSE损失容易利用SSL模型中的位置嵌入,通过位置相关性而非内容信息来最小化损失,这限制了模型的泛化能力和鲁棒性,尤其是在噪声环境中。
本研究提出了两种策略来缓解位置嵌入的利用问题: 1. 位置扰动通过随机零填充(SSL-MSE-PAD):在干净语音波形前后随机添加零填充,以破坏绝对位置对齐,鼓励模型关注内容信息。该方法基于SPIRAL框架,但首次在微调环境中进行评估。 2. 速度扰动结合软动态时间规整(soft-DTW)损失(SSL-SoftDTW):对干净语音应用速度扰动以模拟时间变化,并使用软DTW损失进行对齐,减少对绝对位置编码的依赖,实现基于内容的对齐。
实验在噪声增强的LibriSpeech数据集上进行,使用HuBERT-BASE作为SSL模型和master64作为SE模型。结果表明: - 基于soft-DTW的方法(SSL-SoftDTW)相比SSL-MSE基线,实现了更快的收敛速度和改进的下游任务性能(如自动语音识别和音素识别)。 - 随机零填充策略(SSL-MSE-PAD)在微调环境中有效,但性能提升不如soft-DTW方法显著。 - 这些策略强调了在基于SSL的语音建模中进行位置不变微调的重要性。
本研究通过创新性地结合速度扰动和软DTW损失,有效解决了SSL微调中的位置嵌入利用问题,提升了语音增强模型在噪声环境下的泛化能力和下游任务性能。
该论文通过创新的MWER算法和asr_eval工具集,显著提升了语音识别评估的准确性和灵活性,特别是在处理多语言和复杂语音场景时。
LLM-based ASR系统在适应新领域时面临挑战:标准文本微调会破坏语音投影器学习到的跨模态对齐,导致性能下降,且音频-文本配对数据稀缺昂贵。
提出一种新颖的文本去噪方法,将文本适应重新定义为去噪任务。通过噪声函数模拟音频投影输出,训练LLM从噪声输入恢复干净文本。采用多视图噪声驱动批处理策略,混合源域和目标域数据,包括音频-文本对、投影器诱导噪声和合成文本噪声,以保持跨模态对齐。该方法轻量级,无需架构更改或额外参数。
在两个数据集(DefinedAI和SlideSpeech)上评估,实现高达22.1%的相对改进,优于现有文本适应方法。实验使用WavLM-Large作为语音编码器和Llama 3.2 3B Instruct作为LLM。
该方法通过文本去噪有效解决了LLM-based ASR的领域适应问题,在保持对齐的同时提升了性能,具有实用性和可扩展性。
LLM-based ASR系统通常使用固定的手动定义提示词(prompt)进行训练和推理,但提示词设计的影响尚未得到充分探索。本文研究发现,提示词选择会显著影响ASR性能并引入不稳定性,没有单一提示词在所有情况下表现最佳。
提出了一种提示词投影器(prompt projector)模块,作为简单、模型无关的扩展,学习将提示词嵌入投影到LLM输入空间中更有效的区域,而不修改底层的LLM-based ASR模型。该模块与语音投影器(speech projector)共享相同架构,但输入维度不同,专门处理LLM嵌入而非语音特征。
本文通过引入可学习的提示词投影器,有效解决了LLM-based ASR系统中提示词敏感性问题,提高了系统的鲁棒性和性能一致性。
自监督学习(SSL)在语音处理中取得了显著进展,但其依赖大规模预训练数据集导致资源消耗高,成为瓶颈。尽管通常认为鲁棒性源于数据规模和多样性,但数据分布的作用尚不明确。本研究旨在探索如何通过数据选择策略提高SSL语音模型的效率和性能。
本研究系统性地比较了多种无监督数据选择策略对自动语音识别(ASR)性能的影响。方法包括: - 多样性采样:基于声学特征(MFCC)、说话人特征(WeSpeaker嵌入)和语言特征(SENSE嵌入),使用k-means聚类进行分层采样,以促进多样性。 - 长度采样:选择最长的50%话语进行预训练。 - 组合方法:结合说话人多样性和长度,从每个聚类中选择最长话语。
实验使用Loquacious数据集(包含25,000小时英语语音),预训练采用BEST-RQ框架,模型配置为12层Conformer,约100M参数,并在NVIDIA A100 GPU上训练。
本研究揭示了在预训练SSL语音模型中,数据长度比数据多样性或总体数量更为关键,为高效数据选择提供了新视角。
单词语音识别(SW-ASR)面临独特挑战,包括缺乏上下文信息(与连续语音识别相比)、发音变异性、背景噪声和说话者多样性,尤其在低资源、通信敏感领域(如医疗和应急响应)中更为关键。传统方法依赖领域特定词汇和云端计算,难以适应开放词汇或资源受限环境。
论文提出一个模块化框架SW-ASR,包括: 1. 预处理:去噪和音量归一化。 2. 混合ASR前端:结合Whisper和Vosk,基于置信度加权选择初始转录。 3. 验证层:提供四种匹配模式以处理词汇外词和低质量音频: - 余弦嵌入相似性 - Levenshtein距离 - 基于LLM的匹配 - 上下文引导匹配(结合余弦/LLM与周围上下文) 4. 集成SIP电话栈:支持意图驱动功能,如盲转呼叫和紧急警报。
SW-ASR通过混合ASR和上下文感知验证,有效提升了单词语音识别的鲁棒性和响应速度,适用于实时电话应用。
VoxMorph 通过解耦嵌入和零样本设计,实现了高效、可扩展的语音身份变形,显著提升了音频质量和攻击成功率,对生物识别安全具有重要影响。
传统提示调优(prompt tuning)在音频-语言模型(ALMs)中存在泛化能力不足的问题,具体表现为基类-新类权衡(Base-New Tradeoff, BNT)。这是由于音频数据集类别稀疏(通常仅数十类),导致学习到的提示嵌入空间语义结构被破坏,类嵌入过于孤立,削弱了与语义邻居的相似性,从而影响对未见类的泛化。
提出语义扩展提示调优(Semantically Expanded Prompt Tuning, SEPT),一个即插即用的框架。核心创新包括: 1. 语义邻居生成:使用大语言模型(LLM)为每个训练类生成语义相关的邻居词,扩展语义覆盖。 2. 语义扩展损失:引入带边界约束的损失函数,包括: - 类内紧凑性损失(L_intra):拉近类嵌入与其语义邻居的距离。 - 类间分离性损失(L_inter):推远类嵌入与其他类邻居的距离。 该损失通过拉-推机制促进嵌入空间的语义结构,增强泛化能力。 3. 模型无关性:SEPT可无缝集成到现有提示调优基线方法中,如CoOp,且推理时计算成本不变。
SEPT通过语义扩展和结构化损失有效解决了ALMs中提示调优的泛化瓶颈,为音频-语言模型的少样本学习提供了实用且高效的解决方案。