YAML Metadata Warning:empty or missing yaml metadata in repo card

Check out the documentation for more information.

% ============================================================================= % L-leakage 论文 — ICLR 2027 投稿源文件。 % 编译需要在此目录下的官方 ICLR 样式文件: % iclr2027_conference.sty (以及用于附录引用格式的 iclr2027_conference.bst) % 从 ICLR 2027 作者工具包下载。生成此 .tex 的环境没有 LaTeX 引擎,因此 % 未在本地就地验证编译;请在本地编译。 % 正文目标:<=9 页 (10pt ICLR 会议格式),之后附录不限页数 (章节 A-F)。 % 所有数字均独立地从已发布的 artifact 集合中重新推导。 % =============================================================================

Prior-Turn Audio Leaks Through KV Cache in Multi-Turn Speech-LLM Transcription: 前序对话音频通过 KV 缓存泄漏到多轮语音大模型转录中的诊断、跨架构因果证据与逐字存储的层级定位

匿名 ICLR 2027 投稿 论文编号:XXXXX

(审稿人/领域主席说明:已匿名化——无致谢,无可识别的作者信息)


摘要

多轮语音大模型助手在各轮对话间共享一个解码器 KV 缓存。此前尚无研究考察前一轮的音频是否会残留在该缓存中,并以正确性失效的方式污染后续的转录。我们诊断出这种前轮音频泄漏现象:在 MOSS-Audio-8B 上,两轮对话将第二段音频的 WER(词错误率)从 $0.240$ 提高到 $0.478$,其中 $12%$ 的样本对会输出第一段音频的词语。通过静音、时间反转和白噪声这三种反证条件,我们将泄漏定位到前段音频的正向内容本身(而非音频能量或格式),且该效应在没有任何"记忆"指令的情况下仍以 $75$–$97%$ 的比例持续存在。该现象在四个跨越三种架构类别(codec、编码器+连接器、Q-Former,参数量 7B–13B)的开源语音大模型上均可复现,另外在一个闭源模型上观察到较弱的边界信号。通过语音与文本的对照校准(三个纯文本大模型在相同的两轮协议下产生的 WER 增量 $\leq+0.040$、逐字复述率 $\leq9.5%$,相比之下 MOSS 音频条件下为 $+0.238$ WER、$19.6%$ 逐字复述率),我们将跨模态的额外泄漏效应剥离出来,作为语音特有的贡献。

阻断第二轮的 query 对第一轮 key 的注意力,可在两种 codec 架构上恢复泄漏(MOSS $90%$,$p{=}2.2{\times}10^{-14}$;MiMo $66%$,$p{=}1.1{\times}10^{-8}$),并通过注意力质量精确坍缩为零以及第二轮隐藏状态逐位一致得到验证。由此得出两项机制上的分离结论。第一,codec 架构的泄漏携带逐字的前段音频词汇($39/199$),而编码器+连接器架构的泄漏不携带任何逐字内容($0/199$,McNemar 检验 $p{=}3.6{\times}10^{-12}$):跨轮注意力质量是保真度的对照量,而非泄漏强度的预测量。第二,logit-lens 方法将逐字存储定位到解码器的较深层区段(峰值出现在 L24–35 层),一种非质量的(non-mass)value-patching 探针确立了较深层区段的 $V$(大致跨越 L18–35 层)为因果携带者(对该区段的第一轮音频跨度的 $V$ 进行静默,可消除 $85%$ 的逐字泄漏样本,并恢复 $40%$ 的 WER 差距;两个对照层区段则均无此效果)(图 \ref{fig:mechanism})。一种训练侧的音频锚定适配器 LoRA($2$M 参数,$8$B 解码器冻结,同批次内设 noLoRA 对照)将多轮 WER 降至单轮基线水平($p{=}4.3{\times}10^{-14}$),将逐字泄漏计数减半(McNemar 检验 $p{=}0.019$),并保留了对片段 A 的召回能力($47/50{=}94%$)——这是一个非主导型的部分正面结果(KV 重置在严格逐字泄漏和金标准"否"判定精度上仍然严格更优),在第二个 codec 模型(MiMo)上得到方向性的复现。我们将该泄漏现象定位为通用 Transformer KV 缓存性质的一个正确性维度,在语音这一模态中的具体表现。


1 引言

现代语音大模型(MOSS-Audio [mossa]、Qwen2-Audio [qwen2audio]、MiMo-Audio [mimoaudio])使用与文本语言模型共享的自回归解码器来转录和进行音频对话。在多轮使用中,所有先前的 token(包括前一轮音频的潜在表示)都会保留在 KV 缓存中,并在之后每一步解码时被注意力机制访问。

我们提出的问题是:驻留在 KV 缓存中的前一轮音频片段,是否会泄漏进入后续转录轮次?在 MOSS-Audio-8B 上,两轮对话将第二段音频的 WER 从 $0.240$ 提高到 $0.478$,且 $12%$ 的样本对会逐字输出第一段的词语。这一效应在单轮评估中是不可见的:一个能够完美转录单段音频的模型,仅仅因为第一段音频仍缓存在其中,就可能错误转录第二段。

文本大模型相关文献已经从效率角度(通过 attention-sink 和流式生成 [streamingllm])以及从隐私角度(通过跨用户 KV 缓存泄漏 [cacheprune, shadowcache])研究了 KV 缓存这一通用性质。但尚无研究涉及由前一轮内容导致的后续轮次正确性退化这一问题。我们使这一失效模式变得可见,并在四个开源语音大模型和三类架构上对其进行了诊断。一种非质量的 value-patching 探针将因果携带者定位到特定的解码器层区段。

本文是一篇诊断与因果证据论文,而非修复方案论文。跨轮注意力掩码作为因果工具(阻断第二轮 query 对第一轮 key 的访问可恢复泄漏),但在 WER 指标上被免费的 KV 重置基线严格支配。一种训练侧的音频锚定适配器 LoRA 被报告为一种非主导型的部分缓解方案。我们并不宣称提出了可部署的修复方案。

贡献。

(i) 现象与对照实验。 该泄漏现象在四个跨越 codec(MOSS、MiMo)、编码器+连接器(Qwen2-Audio)和 Q-Former(SALMONN-13B)架构的开源语音大模型上均得到确认。静音、时间反转、跨说话人和白噪声这四种反证条件将其定位到前段音频的正向内容本身(§ \ref{sec:main}–\ref{sec:controls})。该效应在没有任何记忆指令的情况下仍以 $75$–$97%$ 的比例持续存在;跨模态校准(§ \ref{sec:textllm-baseline})表明语音特有的额外效应约为文本大模型基线的 $5$ 倍。

(ii) 因果定位。 阻断跨轮注意力可在两种 codec 架构上恢复泄漏(MOSS $p{=}2.2{\times}10^{-14}$,MiMo $p{=}1.1{\times}10^{-8}$;§ \ref{sec:probe})。该因果性论断通过注意力质量精确坍缩为零以及第二轮隐藏状态逐位一致得到验证。Qwen2-Audio 显示出经过留出集验证的"受损子集"效应;SALMONN-13B 现象得到确认,但掩码修复受到稳定性因素的混淆。

(iii) 双轴机制。 跨轮注意力质量是保真度的对照量,而非泄漏强度的预测量(Qwen2 分配了更多注意力却泄漏更少逐字内容)。内容检视在 token 流层面证明了这一分离:codec 泄漏携带逐字的前段音频词汇($39/199$)。编码器+连接器架构不携带任何逐字内容($0/199$,McNemar 检验 $p{=}3.6{\times}10^{-12}$;§ \ref{sec:cross-qwen})。

(iv) 层级因果携带者。 logit-lens 方法将逐字存储定位到解码器的 L24–35 层。一种非质量的 value-patching 探针确立了较深层区段的 $V$(大致跨越 L18–35 层)为因果携带者(§ \ref{sec:layer-local})。在 L24–35 层对第一轮音频跨度的 $V$ 进行静默,可消除已知泄漏样本中的 $85%$。对照层区段 L0–11 和 L12–23 均无此效果。

(v) 非主导型缓解方案。 一个 rank-16 的音频锚定 LoRA($2$M 参数,$8$B 解码器冻结)将多轮 WER 降至单轮基线水平($p{=}4.3{\times}10^{-14}$),并将逐字泄漏计数减半($p{=}0.019$),同时保留召回能力。它是非主导型的:KV 重置在严格逐字泄漏指标上仍然严格更优(§ \ref{sec:related})。


2 方法

多轮引出方式(真实对话,非拼接音频)。 我们配对同一说话人的连续 LibriSpeech 片段 $(A,B)$。单轮(Alone):单轮"转录 B"。无修复(No-cure):第一轮"听这第一段音频并记住其内容" → 模型"明白了,我已听过第一段音频";第二轮"现在只逐字转录这第二段音频"。隔离修复(Isolate-cure):无修复条件 + 下述注意力掩码钩子。使用原生对话模板;贪心解码;WER 相对于 B 的金标准文本进行评估。

泄漏度量。 言语泄漏:无修复条件下 B 的转录文本中出现了来自 A 金标准文本的、长度 $\geq$4 个字符的 token,且该 token 不出现在 B 的金标准文本中,也不出现在单轮条件的转录中。这可以分离出通过缓存到达第二轮转录文本中的逐字片段 A 内容。WER 影响(与修复方式无关):若 $\text{WER}{\text{无修复}}-\text{WER}{\text{单轮}}\geq0.05$,则该样本对被判定为"受损"。

注意力掩码隔离(无需训练)。 令 $T_{1}$ 为覆盖第一轮的语言模型分组 token(我们对仅含第一轮的内容重新分词以对其进行定位)。在语言模型主干上注册一个 forward_pre_hook,克隆 attention_mask 并将其前 $T_{1}$ 列置零(即"整列"或二维掩码)。这同时阻断了第二轮 query 及第一轮自身对第一轮 key 的注意力。§ \ref{sec:probe} 随后通过一种仅作用于 query 的三维掩码(保留第一轮的自注意力完整)以原生方式注入,将跨轮分量单独隔离出来。不改变任何权重。


3 设置

模型(冻结参数,贪心解码): MOSS-Audio-8B [mossa]、Qwen2-Audio-7B [qwen2audio]、MiMo-Audio-Instruct [mimoaudio],跨越三类开源架构(自包含离散 codec、Whisper 编码器+连接器、Q-Former+Llama;参数量 7B–13B),另加一个闭源 API 的边界探测。专用 ASR 参照: 在完整的 LibriSpeech test-clean 数据集上($n{=}2620$),OpenAI Whisper-large 的 WER 为:贪心解码 0.185 / 文本 MBR 0.183 / 直接解码 0.179 / oracle 0.149;我们的单轮基线(MOSS 0.240)与此相当。多轮泄漏将其提升到 0.478。我们研究的是模型相对于自身的退化(不宣称"超越 Whisper")。数据: LibriSpeech test-clean [librispeech] 同说话人连续样本对。WER 通过 jiwer [jiwer] 计算。统计方法: 默认使用恢复方向上的单侧配对 Wilcoxon 检验(当 $p{\approx}0.05$ 时报告双侧结果),2000 次重采样的配对 bootstrap 95% 置信区间,配对二元结果使用精确 McNemar 检验。全文统一采用此约定,跨所有架构和条件保持一致。主要预先声明的评估终点是按说话人的聚类 bootstrap(重新中心化,双侧检验),每个头条结果均附带声明的敏感性分析集(按主体 $t$ 检验、渐近以及 Satterthwaite LMM,适用时),我们明确标注任何敏感性分析成员之间不一致的结果(称为"混合边界")。按说话人的聚类 bootstrap 对说话人进行有放回重采样(B=2000;199 个样本对只涉及 29 名说话人)。附录 \ref{app:stats} 中为每个头条结果报告了按说话人聚合的 Wilcoxon 检验。

预注册主评估终点与敏感性分析集。 为避免"从多种检验中挑选最优结果"的顾虑,头条推断性结论采用按说话人聚类 bootstrap,B=2000,双侧,重新中心化的方式。Qwen2 全集 $n{=}280$ 的 $p{=}0.023$ 就是在此约定下报告的。按主体聚合的 $t$ 检验、渐近 LMM Wald 检验以及 Satterthwaite LMM 作为敏感性分析集并列报告(并非事后挑选)。全文使用的"混合边界"和"依赖约定"这两个术语明确指:在主检验(聚类 bootstrap)以及至少一个敏感性分析成员上显著,而在其余成员上处于边界或不显著。敏感性分析成员的选择从不作为正面结论的依据。


4 实验

WER 附 2000 次重采样配对 bootstrap 95% 置信区间及配对 Wilcoxon 检验 $p$ 值(除特别说明外均为单侧恢复方向;接近 0.05 时报告双侧结果)。除特别标注外,所有头条 $p$ 值均为聚类稳健的。

4.1 主要结果:泄漏、隔离掩码与 KV 重置基线(MOSS,$n{=}199$)

表 1: MOSS $n{=}199$ 主要泄漏结果,按策略(单轮 / 无修复 / 掩码 / KV重置)给出 WER 95% 置信区间及逐字泄漏计数。

策略 第二轮 WER [95% CI] 言语泄漏
KV 重置(=单轮基线)$^\dagger$ 0.240 [0.218,0.263]
无修复(保留片段 A)$^\dagger$ 0.478 [0.420,0.541] 24/199 (12%)
二维隔离掩码(原生 SDPA) 0.262 [0.239,0.286] 0/199 (0%)

$^\dagger$ 无修复/KV重置行是 eager 路径的锚点结果($0.240\to0.479$)。在实际部署使用的原生 SDPA 后端下,无修复条件为 $0.471$(与 eager 路径不可区分,$p{=}0.569$)。$0.471\to0.262$ 的修复对比是在同一后端下进行的。

前一段音频几乎使 WER 翻倍(配对差 $+0.238$ [0.179,0.302]);KV 重置恢复到 0.240,在纯 WER 指标上严格优于掩码方法。我们坦率地说明这一点:掩码方法并不是比 KV 重置更好的转录器;它的价值在于操作层面(存储/保留),这将在 § \ref{sec:why-mask} 中量化。掩码 vs 无修复:$p{=}2.2{\times}10^{-14}$(单侧)。

4.2 受损子集上的严重程度(MOSS)

在 24 个言语泄漏样本对中:单轮 0.249 → 无修复 1.102 → 修复后 0.307。与修复方式无关的受损子集(无修复$-$单轮$\geq0.05$)为**n=90/199 (45%)**:单轮 0.258 → 无修复 0.801 → 隔离修复 0.299。泄漏的 A 词并非共现巧合:A 与 B 金标准文本间的 Jaccard 相似度为 0.08,且在 24 个言语泄漏样本对中,没有一个泄漏出的 A 词出现在 B 的金标准文本中。

4.3 跨架构结果:Qwen2-Audio-7B(编码器+连接器)

在 Qwen2-Audio 上($n{=}280$,原生 SDPA),单轮 WER 为 $0.134$,无修复为 $0.127$:无逐字泄漏,全集效应可忽略。前一轮的 KV 内容以次词汇(sub-lexical)方式损害了一个严格子集($n{=}28/280$,$10%$),隔离跨轮注意力有助于该子集($59/280$ 得到改善:均值从 $0.224\to0.044$)。全集上的修复效应处于混合边界状态(聚类 bootstrap $p{=}0.023$;按主体 $t$ 检验 $p{=}0.030$;LMM 处于边界)。扩展到 LibriSpeech test-other 数据集($n{=}200$)又发现 16 个受损样本对。合并后(44 个受损,29 个非平局),配对修复效应显著($p{=}3{\times}10^{-4}$,双侧)。我们将此标记为探索性复现,而非预注册的主要结果(§ \ref{sec:limitations})。

Qwen2-Audio 分配的跨轮注意力质量($0.621$)高于 MOSS($0.430$),但泄漏更少($-0.011$ vs $+0.239$)。因此跨轮注意力质量是保真度的对照量,而非泄漏强度的预测量。内容检视($n{=}199$;附录 \ref{app:content})在 token 流上展示了这种分离。codec 架构 MOSS 在受损样本对中的 $39/90$($43%$)携带逐字的片段 A 词汇。编码器+连接器架构 Qwen2 则不携带任何逐字词汇($0/22$,$0%$)。配对 McNemar 检验的不一致情形为:39 个 MOSS 独有 vs 0 个 Qwen2 独有($p{=}3.6{\times}10^{-12}$)。Qwen2 的次词汇渗漏是话题延续(如"POOR ALICE" → "Oh, the duchess!"),而非逐字内容。

我们检验了这种分离是否可归因于缓存音频的模态保真度(codec 离散 token 携带词汇内容;编码器+连接器的连续隐藏表示则不携带)。两项干预实验(Qwen2 连续$\to$离散化;MOSS 离散$\to$粗化,$n{=}199$,结构化 vs 随机对照;附录 \ref{app:content})并不支持这一因果解释。这种分离作为一种架构类别规律依然成立,但基于保真度的解释被证伪。一个逐头(per-head)熵探针(附录 \ref{app:body-extracts})显示质量数量轴在部分程度上与熵相关。泄漏内容轴($p{=}3.6{\times}10^{-12}$)作为更稳健的一半得以保留。

4.4 层级定位:逐字泄漏存储在解码器的哪个位置

我们利用逐层 logit-lens(一种标准的文本大模型可解释性工具,本文首次将其应用于语音大模型的 KV 缓存泄漏问题)来定位究竟在哪些解码器层,前段音频的 KV 缓存携带了逐字的片段 A 词汇内容。在真实音频注入的第二轮贪心解码过程中(无修复,缓存片段 A,转录片段 B;使用模型自身的 generate 路径,因此音频通过音频适配器注入,而不是纯粹的语言模型前向计算),我们通过前向钩子在每个解码步骤捕获每个解码器层的输出隐藏状态,将其经过最终层归一化 + 反嵌入(lm_head)投影,并检查投影后 top-$k$ token 中是否包含片段 A 的逐字词(内容检视中定义的词汇集,参见 § \ref{sec:cross-qwen} / 附录 \ref{app:content})。逐层逐字投影率 = 在层 $L$ 上,top-10 token 中包含片段 A 逐字词的解码步骤所占比例。

在 $n!=!20$ 个 MOSS 言语泄漏样本对(无修复转录文本中出现了逐字的片段 A 词,这些样本涉及 11 名不同的说话人)上——从 $n{=}199$ 的运行结果中事后选出的 20 个最严重的言语泄漏样本(该分析在预先选定的泄漏样本上具有结构性的确认性——因为只有在存在泄漏样本的地方,才可能存在这样的层区段——我们将此报告为首次公开发表的层功能图,并公开承认子集选择的局限)——结果显示出清晰的层级定位区段:

中间表格(MOSS,共 36 层):

解码器层区段(MOSS,共36层) 逐字投影率 解释
L0–L19(前约55%) ≈0.00–0.06 早期:声学/位置特征,逐字携带率低
L24–L35(后约33%) 0.16–0.37(峰值 L34) 逐字携带区段

片段 A 的逐字内容由解码器的一个较深层区段(L24–35/36)携带,前约 55% 的层的投影率接近零。该区段并非单一峰值,而是在深层维持一个持续的平台期(跨越 L24–35,约 $0.165$–$0.370$),表明该逐字表示分布于一个层区段范围内,而非集中在单一层——这促使我们进行下面按层区段窗口的掩码消融实验,以判断该区段是泄漏的因果通路,还是仅仅是其存储位置(我们发现对 L24–35 而言,后者更为准确:单独掩蔽它并不能实现修复;确切的通路位置仍是开放问题,见 § \ref{sec:layer-local-disc})。该区段所处的相对深度(约 $0.66$–$0.97$ 归一化深度)与文本大模型中的发现一致,即较深层携带词汇表面特征,而较浅层携带声学/位置结构。

单轮基线对照:单轮条件下(单轮转录 B,未缓存片段 A)运行相同的 logit-lens,得到的是一个平坦的低"重叠基线"(36 层中最大值 $\leq!0.033$,$n!=!20$),而非精确的零:在每一层,片段 A 词都可能因偶然的词汇重叠出现在 top-10 投影 token 中(该词汇集是片段 A 的内容词,模型在单轮条件下从未听过这些内容)。关键对比在于区段形状:单轮条件仅显示一个小的偶然重叠隆起(峰值 $0.033$,在 L25,约为其自身早期近零基线的 3 倍,由片段 A 中一些常见内容词如"trust"/"other"偶然出现在 top-10 中造成),而无修复条件在同一 L24–35 区域急剧且持续上升到 $0.165$–$0.370$——比单轮基线在该区段区域超出约 11 倍(无修复最大值 $0.370$ vs 单轮在同一 L24–35 窗口内最大值 $0.033$;逐层均值是头条指标——单轮/Qwen2 逐对最大值在孤立层处约高出 6 倍,但从未形成持续区段),且无修复与单轮的逐对差异在 $n!=!20$ 时是一致且显著的(配对单侧 Wilcoxon 检验 $p{=}6.6{\times}10^{-5}$;19/20 个样本对中无修复 $>$ 单轮)——这将逐字携带定位到前轮片段 A 的 KV,而非基础的 top-$k$ 重叠率。据我们所知,这是首次公开发表的针对语音大模型 KV 缓存泄漏的层功能图,它回答了机制定位问题(泄漏存在于何处):一个前轮音频的跨轮 KV 在解码器的较深层携带逐字词汇内容,而非在所有层均匀分布。

该区段是多轮缓存的内在属性,而非子集预选造成的泄漏假象。 上述言语泄漏区段是在 20 个预先选定的言语泄漏样本对(无修复条件下片段 A 逐字出现)上测得的。为排除该区段是选择这 20 个最严重泄漏样本所造成的假象,我们对受损但非泄漏的样本对运行了同样正确的 lens 分析:这 57 个样本对(不包括上述 20 个言语泄漏子集)满足无修复 WER $-$ 单轮 WER $\geq!0.05$(泄漏确实损害了这些样本),但无修复转录文本中没有任何片段 A 词逐字出现(次词汇损害,言语泄漏为 0)。如果该区段是子集预选的假象,它应该在这里消失;但实际上出现了一个较浅但共位的 L24–35 区段:最大值 $0.086$,在 L30(L26–34 均值为 $0.075$),约为单轮基线($0.033$)的 2.6 倍,约为言语泄漏区段($0.370$)的 $1/4.3$,其中 $29/57$ 个样本对显示出真实的后期区段(逐对最大值 $>!0.05$)。这种三层结构——言语泄漏区段 $0.370$ $\gg$ 非泄漏受损区段 $0.086$ $\gg$ 单轮基线 $0.033$,均共位于 L24–35——证明该逐字携带区段是缓存片段 A KV 的内在属性:只要片段 A 被缓存且损害了第二轮,该区段就会出现(无论是否有片段 A 词被逐字复述出来),其规模仅取决于逐字内容在转录文本中呈现的清晰程度。子集预选的顾虑就此得以排除。

子集匹配的跨架构对照实验。 上述 MOSS 有区段 vs Qwen2 无区段的对比在样本对集合上并不对称(MOSS 的 lens 分析用的是其 20 个泄漏样本;Qwen2 用的是前 20 个一般样本)。我们通过在 Qwen2 自身的 28 个受损样本对上运行相同正确的音频注入 lens 来消除这种不对称性(这些是 $n{=}280$ 原生 SDPA 子集中满足无修复$-$单轮 $\geq 0.05$ 的样本,恰好是 MOSS 显示出区段的条件类比)。即使在其受损样本对上,Qwen2 也没有显示出逐字区段:逐层均值投影率在 L0–29 上基本平坦($\leq!0.006$,除 L26 处一个孤立的 $0.022$ 尖峰,这是两段没有逐字词但存在偶然重叠的短转录文本造成的读数,而非存储区段的表现),顶层略有抬升(L30 $0.022$,L31 $0.039$),所有层最大值为 $0.039$。约为 MOSS $0.370$ 区段峰值的 $1/9.6$,与 MOSS 的单轮基线($0.033$)水平相当;$1/28$ 的转录文本中含有片段 A 词(与全集 $0/199$ 的比率一致)。因此跨架构区段对比是一种架构类别属性,而非子集选择的假象。

跨架构确认(Qwen2-Audio,编码器+连接器)。 我们在 Qwen2-Audio 上复现了该 logit-lens 分析($n!=!20$ 个样本对,32 个解码器层;Qwen2 的 $0.066$–$0.97$ 归一化深度大致对应 MOSS 的 L24–L35,因此跨架构比较是按深度对齐而非按绝对层号对齐的)。不存在逐字携带区段:所有 32 层的投影率均平坦,最大值为 $0.016$(噪声/重叠基线水平),相比 MOSS L24–35 区段的峰值 $0.370$——约 23 倍的跨架构对比差异。该区段在 codec 架构(MOSS)上存在,在编码器+连接器架构(Qwen2)上不存在样本对集说明(已公开披露): 这两组 $n!=!20$ 的运行并非同一批样本对——MOSS 的是 20 个言语泄漏样本对(无修复转录中片段 A 逐字出现,即可能存在逐字区段的子集),而 Qwen2 的是前 20 个一般样本对($0/20$ 言语泄漏,与全集 $0/199$ 比率一致),两者有 6 个重叠的样本对 ID;Qwen2 没有泄漏样本可选,因此跨架构对比是"在能激活该区段的条件下存在区段(MOSS 泄漏样本)"vs"即使在一般样本集上也不存在区段(Qwen2)"。这直接解释了内容检视中的分离现象(§ \ref{sec:cross-qwen},$p{=}3.6{\times}10^{-12}$):codec 模型在其解码器 KV(L24–35 层)中携带逐字的片段 A 词汇内容,因此会泄漏到第二轮转录中;编码器+连接器模型存储的是连续的 Whisper 隐藏表示,没有 token 到词的对齐,因此没有任何一层携带逐字内容,也就不会泄漏。层级定位是对内容检视所揭示的"是什么"以及注意力质量所体现的"对照量"(§ \ref{sec:cross-qwen})的一种互补性机制定位("在哪里")。

§ \ref{sec:layer-local-disc} 层级定位小结:L24–35 是逐字存储位置;非质量的 value-patch 确立了其作为因果携带者的地位。 logit-lens 将逐字存储定位到 L24–35(三层结构,$0.370 \gg 0.086 \gg 0.033$,均共位)。单独掩蔽 L24–35 并不能实现修复(非坍缩对比 $0.642 \gg 0.331$),因此该区段是存储位置,而非充分的修复目标。完整的层区段消融表格、退化性检验及随机窗口对照见附录 \ref{app:layer-controls}。该"存储但不足以修复"的模式在 MiMo-Audio-7B 上得到复现($N_L{=}36$,精确窗口,$n{=}80$;§ \ref{sec:mimo-band})。

通过 value-patching 实现的 L24–35 因果价值通路(MOSS,$n{=}120$)。 一种非质量的 value-patching 探针,将第一轮音频跨度处于层区段内的 $V$ 替换为静音运行的 $V$(key 和注意力权重不变,因此注意力质量不受扰动)。在 L24–35 层对 V 进行 patch,将多轮 WER 从 $0.453$ 降到 $0.367$($p{=}5.3{\times}10^{-3}$,相对于无修复条件),并将逐字泄漏样本数从 $20$ 降到 $3$($-85%$)。在 L0–11 和 L12–23 对照层区段进行相同的 V patch,无效果($p{=}0.23$ 和 $p{=}0.74$,不显著;L24–35 vs 任一对照 $p{\le}7.8{\times}10^{-4}$,McNemar $p{=}0.002$)。偏移窗口稳健性: 在 L18–29(一个与 L24–35 有 6/12 层重叠的较深 12 层窗口,其选取受掩码消融实验中随机窗口对照发现 L18–29 与 L24–35 并列表现的启发)进行 V patch,同样将泄漏样本数降到 $3/120$($-85%$),与 L24–35 相同。因此因果携带者并非精确等于 L24–35,而是一个大致跨越 L18–35 的较深层区段;L24–35 边界是 logit-lens 的峰值所在,而 V-patch 因果携带者共同延伸跨越更宽的较深三分之一区域。单独的单轮转录不受影响($0.234$)。因此 L24–35 层的 V 是逐字词的因果携带者(但整体 WER 退化并非完全由该 V 区段承载:WER 恢复 $40%$ vs 词汇消除 $85%$)。相关文件:vh_out/readpath_perlayer_moss.jsonlvh_out/valuepatch_l2435_moss.jsonl

为何 L24–35 是表层定位点:一条晚期涌现的 S 形曲线(MOSS,$n{=}20$)。 逐层逐字投影率从 L0 的 $0.008$ 几乎平坦地上升到 L23 的 $0.087$,随后急剧拐折:L24 达 $0.174$(首次翻倍越过),L29 达 $0.296$,峰值在 L34 达 $0.370$($n{=}20$ 个泄漏样本,单轮基线控制在 $\leq0.033$)。这是一条晚期涌现的 S 形曲线,其拐点与文本大模型中已被记录的"表层词汇内容在 lm-head 可解码深度处暴露"的位置相匹配——同样的最后三分之一区域,也是文本领域 logit-lens 研究中浅层词级特征浮现的位置。因此,存储在第一轮音频 KV 中的逐字内容在 L24–35 处的 lm-head 可解码深度浮现出来,不是因为存在音频特有的晚期积累,而是因为这是最后三分之一区域——任何浅层词汇表示(无论是像本文这样以文本 codec token 形式进入,还是像 Qwen2 那样通过 Whisper 编码器+连接器进入——后者浮现出的形式是次词汇渗漏而非逐字内容)都会在此处经由 lm-head 变得可被查询访问。这解释了跨架构内容分离现象(§ \ref{sec:cross-qwen},McNemar 检验 $p{=}3.6{\times}10^{-12}$):表层浮现位置是共享的,但存储的内容是架构类别相关的(codec 为逐字内容,编码器+连接器为次词汇内容),因为每种架构的音频处理管线将不同的浅层表示带入同一位置。

图 1: 机制:泄漏存储和读取的位置,以及一种非质量因果携带者检验。 (A) MOSS 无修复预填充期间,第二轮到第一轮音频 key 的逐层读取质量($n{=}30$),按早期 L0–11(绿色)、中期 L12–23(青色)以及存储区段 L24–35(蓝色,阴影)分区。读取质量单调上升,在 L29 处达峰值($0.82$),并在 L24–35 内集中(区段均值 $0.71$ vs L12–23 的 $0.51$、L0–11 的 $0.48$):解码器在与 logit-lens 所识别的存储位置相同的较深区段内读取泄漏的片段 A KV(这是相关性上的共位,因果检验见下方 value-patch 结果)。 (B) Value-patching 因果携带者检验:将 L24–35 音频跨度的 $V$ 替换为静音运行的 $V$(key 和注意力权重不变),可将逐字泄漏样本从 $20{\to}3/120$($-85%$);同样的 patch 用于对照层区段 L0–11($20{\to}21$)和 L12–23($20{\to}16$)均无效果,而无修复条件产生 20 个泄漏样本。因此 L24–35 的 $V$ 是逐字词的因果携带者,而非仅仅是共现的质量集中位置。

跨轮区块的连续预 softmax $\lambda$-缩放在所有三个维度上均被二值区块严格支配;完整剂量表见附录 \ref{app:layer-controls}。

4.5 跨架构边界:德语、SALMONN-13B 与一个闭源 API

德语(FLEURS,$n{=}200$): 该泄漏以相同的幅度复现,且聚类稳健(详见附录 \ref{app:body-extracts})。

SALMONN-13B(Q-Former,$n{=}199$): 泄漏效应最大($+0.875$ WER,$p{=}1.6{\times}10^{-33}$),效应量最强;掩码修复受骨干网络脆弱性的稳定性因素混淆(附录 \ref{app:body-extracts};§ \ref{sec:salmonn})。

闭源 Qwen3.5-Omni($n{=}100$): 无法应用修复掩码;观察到较弱的泄漏信号($p{=}0.49$,不显著),只能作为边界性观察(附录 \ref{app:body-extracts})。

4.6 跨架构:MiMo-Audio-Instruct(codec)

现象观察($n{=}199$,清洁样本 $n{=}152$):严重泄漏 70/152(46%,Wilson 区间 [38,54]%)。MiMo 上的仅 query 因果探针: 二维整轮掩码只部分恢复了 MiMo 的性能(全集与仅音频区域的差距 $p{=}6.5{\times}10^{-14}$,仅音频区域的空效应检验 $p{=}0.91$;$\delta{=}0.05$ 的 TOST 给出 $p{=}\max(p_1,p_2){=}0.99995$ $\Rightarrow$ 在 0.05 范围内等效;一个明确的负面结果);仅 query 掩码(阻断跨轮注意力),通过自定义 eager 路径注入(MiMo 的封装器会预先将 attention_mask 解析为 None,因此二维预钩子失效;我们在注意力 logits 层级注册阻断,并通过触发验证),给出**$p{=}7.2{\times}10^{-16}$(单侧)/ $1.4{\times}10^{-15}$(双侧)(均值修复$-$无修复差为 $-0.65$,18/199 平局),按说话人聚类 bootstrap $p{<}5{\times}10^{-4}$。在 173 个受损样本对子集(无修复$-$单轮$\geq0.05$,约 87%)上,修复恢复了 76% 的差距(双侧 $p{=}1.77{\times}10^{-18}$)。诚实的分区说明:** 76% 是整体值;25 个无修复 WER $\geq2.0$ 的受损样本对(长时的偏题 MiMo 续写)恢复约 95%,而约 148 个较为清洁的受损样本对(无修复$\leq2.0$)恢复约 55%,与 MOSS 相当。(仅 query vs 整列)的区别并非决定因素:在 MOSS 原生 SDPA 上,这两种修复方式是逐位一致的(§ \ref{sec:probe}),因此我们将 MiMo 三维掩码的恢复效果归因于跨轮阻断本身,而非保留自注意力的作用。(MiMo 生成过程具有不确定性:单轮中位数 0.111 vs 均值 0.846;我们报告的是配对结果+子集结果+中位数+分区结果,而非原始均值。)

4.7 多轮召回测试组:掩码方法在避免遗忘方面的价值

(本节以及 § \ref{sec:niche}、§ \ref{sec:why-mask} 是同一论点的三个切面:跨轮掩码——在第二轮 WER 上被免费的 KV 重置严格支配——之所以被保留,仅是作为因果工具外加一个小众的保留价值边际;读者可将这三节视作一个"掩码作为工具"的附录性内容块,直接跳到 § \ref{sec:cross-qwen} 阅读机制部分。)

掩码方法在第二轮 WER 上被免费的 KV 重置严格支配(§ \ref{sec:main}),因此其唯一有意义的价值在于保留:在后续轮次中恢复前轮内容。我们运行了一个三轮协议($n{=}150$,MOSS):第一轮 = 片段 A(被缓存);第二轮 = 转录片段 B;第三轮 = 回忆片段 A 中的一个显著词。三种条件:(a) 无修复(泄漏的第二轮,KV 保留);(b) 掩码(通过跨轮阻断实现干净的第二轮,KV 保留);(c) 重置(第二轮单轮进行,KV 被清除,A 消失)。结果:第二轮 WER 无修复 $0.689$,掩码 $0.249$,重置 $0.239$(掩码 $\approx$ 重置,均为干净结果;修复生效 $p{=}3.4{\times}10^{-17}$)。第三轮回忆:**掩码 $41%$(61/150)vs 重置 $0%$(0/150),Fisher 检验 $p{=}1.9{\times}10^{-22}$*。KV 重置是完全遗忘;掩码方法保留了 A 的 KV,并在第三轮中恢复了它而无需重新存储或重新编码前面的原始音频*(重置+重新输入的混合方案在 $n{=}60$ 下达到 45%,但每轮需付出约 2.7 GFLOP 的编码器重计算成本,以及客户端保留原始音频的义务;§ \ref{sec:why-mask})。

4.8 小众场景:无重播约束,以及跨架构扩展的代价

对于原始音频重新输入在结构上不可行的部署场景(例如流式/临时音频语音助手,以及带有已淘汰缓存的智能体音频 RAG,重新输入意味着数秒级的首字延迟),掩码是唯一能同时实现"第二轮干净"和"第三轮可恢复"的方案:在无重播第三轮协议下($n{=}150$,MOSS),掩码方案实现了 39/150 的"两者兼得"(干净且可恢复),而重置为 0/150(完全遗忘),朴素保留为 24/150(有泄漏);配对 McNemar 检验 $b{=}39$(掩码独有)/ $c{=}0$(重置独有)$p{=}3.6{\times}10^{-12}$;掩码相对于朴素保留的优势在于第二轮干净度,而非召回率($41%{\approx}39%$)。我们承认最诚实的层级结构:若有金标准转录可用 $\Rightarrow$ 文本路由方案占主导;若转录不完美但音频可重新输入 $\Rightarrow$ KV 重置+重新输入;若音频是临时性的且要求第二轮干净 $\Rightarrow$ 使用掩码方法,它首先是一种工具(§ \ref{sec:probe} 的因果论断正建立在此工具之上),其次才是最后手段,而非默认修复方案。该小众场景仅诚实地限定于 MOSS:Qwen2-Audio 表现出近期偏向性(回忆的是片段 B 而非 A),SALMONN-13B 在 transformers 4.40 环境下其 Llama-2 骨干网络没有可用的掩码注入路径(§ \ref{sec:limitations} D2);这被披露为单一架构的小众发现,未推广到多架构场景。

4.9 对照实验:内容 vs 格式

单轮 0.250;A$\to$B 0.486;静音 0.344;C$\to$B 0.420;纯文本 0.384;占位符 1.243。分解(头条数字是残差,不是翻倍的 WER): 相对单轮 $+0.486{-}0.250={+0.24}$ 的总提升分解为一个次要的格式效应(静音$-$单轮$=+0.093$,前段音频存在本身的效应)和一个音频内容特有的残差(A$\to$B$-$静音$=+0.142$,$p{=}2.4{\times}10^{-5}$);纯文本第一轮贡献了 $+0.131$(因此音频与文本之间的差距约为残差的一半),且该修复效果仅特定于阻断第一轮内容(占位符条件使效果恶化,$0.486\to1.243$)。决定性反证条件($n{=}120$): 时间反转的 A(revA,能量保留,内容打乱)0.394;中性(白噪声,有能量,无语音)0.336。A$\to$B 超过每一个(A$\to$B$-$revA$=+0.092$,$p{=}9.6{\times}10^{-3}$;$-$中性$=+0.150$,$p{=}3{\times}10^{-6}$;$-$静音$=+0.142$,$p{=}2.4{\times}10^{-5}$);66/120 个样本对是 A$\to$B==静音的平局情形。泄漏需要 A 正向、时间连贯的内容,而非任何音频能量先验。在 Qwen2 上的复现($n{=}120$): 单轮 0.136,A$\to$B 无修复 0.119,静音 0.099,C$\to$B 0.173。此处音频内容也以次词汇方式贡献了效应(A$\to$B$-$静音$=+0.020$,刚好显著),但比 MOSS 更弱,且静音轮次的符号在 Qwen2 上反转(静音 0.099 $<$ 单轮 0.136),与 MOSS 的格式惩罚方向相反——与通过编码器+连接器实现的说话人声学先验启动效应一致,我们将这一架构异质性坦率地披露而非淡化处理。

WER 端点的指令遵循混淆检验:泄漏在无记忆和无指令的第一轮引出方式下仍然存在(MOSS,$n{=}120$)。 一个自然的顾虑(由 ICLR 审稿人提出)是:该泄漏可能是指令遵循的假象(模型被明确告知"记住这第一段音频并记住其内容"以及"只转录这第二段音频";一个部分遵从"保留"指令的模型并不明显算是故障)。我们在相同的 $n{=}120$ 个 LibriSpeech 样本对上重新运行了 WER 端点检验(而非 AMI 是/否代理指标),使用两种不同的第一轮引出方式:nat(一个无记忆的问题:"第一段音频说的是什么语言?用一个词回答,然后我会问你别的问题。")和neu(无任何指令:"这是一段音频。")。结果:单轮 $0.234$;论文原始的mem条件("记住")$0.555$(配对相对单轮 $+0.321$,单侧 Wilcoxon 检验 $p{=}1.45{\times}10^{-11}$);nat $0.476$(配对 $+0.242$,$p{=}1.85{\times}10^{-10}$);neu $0.546$(配对 $+0.312$,$p{=}1.37{\times}10^{-12}$)。在无记忆问题下,泄漏仍以 mem 条件所致损害的75%的比例持续存在,在完全无指令的情况下则以97%的比例持续存在;因此这种损害不是指令遵循效应,即使没有任何"记住"式的框定,甚至没有任何指令,它依然存在;缓存驱动的跨轮污染是主导机制,而非提示词本身。(这一 WER 端点的排除性检验补充了 § \ref{sec:dependent} 中 AMI 自然引出方式的是/否代理指标,直接针对 WER 端点进行了验证。)相关文件:vh_out/leakage_moss_natural_t1.jsonl

4.10 跨模态校准:相同协议下的纯文本大模型基线

为校准语音特有的增量效应,我们在相同的 $199$ 个样本对、两轮、同说话人 LibriSpeech 协议下运行了三个纯文本指令微调大模型(Llama-3-8B、Mistral-7B-Instruct-v0.3、Qwen2.5-7B-Instruct)(第一轮 = 片段 A 的文本转录被缓存在 KV 中,第二轮 = "逐字转录片段 B")。多轮 WER 退化分别为 $+0.007$ / $+0.040$ / $-0.004$(最大 $+0.040$,三个条件中有两个不显著或为负),逐字片段 A 词汇复述率分别为 $4.0%$/$9.5%$/$3.5%$——相比之下 MOSS 音频条件为 $+0.238$ WER / $19.6%$ 逐字复述率。因此语音模态将上下文干扰效应放大了 WER 轴上至少 5 倍,逐字词汇轴上 2–5 倍。我们澄清:论文中 $+0.131$ 的纯文本对照条件(§ \ref{sec:controls})是语音模型内部的文本条件(MOSS 在第一轮接收片段 A 的文本而非音频),不是一个纯文本大模型基线;真正的纯文本大模型增量为 $\leq+0.040$ WER,逐字携带极少。语音特有的额外效应为 $+0.238 - (\leq0.040) = +0.20$ WER,以及 2–5 倍的逐字词汇率超额——这是一个文本领域的"陈旧 KV"文献未能涵盖的跨模态头条发现。相关文件:vh_out/cr_textllm_e1_{Qwen2.5-7B,Mistral-7B,Meta-Llama-3-8B}_n199.jsonl

4.11 跨说话人泛化性(MOSS,$n{=}80$)

泄漏在内容重叠几乎为零的情况下仍然持续存在($+0.170$,$p{=}1.8{\times}10^{-7}$)。

4.12 对抗性放大(MOSS,$n{=}80$)

重复灌注使逐字泄漏率翻倍($23.8%\to55.0%$,$p{=}4.5{\times}10^{-5}$);仅在 MOSS 上出现(MiMo 效应下降)。

4.13 掩码 vs KV重置:三轮保留测试(MOSS,$n{=}150$)

掩码保留片段 A 供第三轮回忆使用($41%$ vs 重置 $0%$,$p{=}1.9{\times}10^{-22}$)。

4.14 依赖性任务:KV重置丧失实用性(Qwen2,$n{=}240$)

KV重置使金标准"是"的召回率崩溃($70.7%\to0.8%$,$p{=}5.8{\times}10^{-25}$);纯文本路由方案优于所有音频缓存条件。

4.15 仅 query 因果探针、跨架构证据、后端独立性

表 2: 仅 query 因果探针,跨架构掩码修复恢复效果,按条件/阻断方式/位置/WER/p 值列出。

条件 阻断内容 后端 WER 恢复率 p 值
单轮(无前段) 0.249
无修复 0.479
音频 token 掩码 音频跨轮 eager 0.352 54% $1.3{\times}10^{-8}$
三维仅 query 全部跨轮 eager 0.323 67% $3.6{\times}10^{-9}$
三维仅 query 全部跨轮 原生 SDPA (v4) 0.262$^\ddagger$ 90% $2.2{\times}10^{-14}$
二维整列 全部+自身 原生 SDPA 0.262$^\ddagger$ 91% $2.3{\times}10^{-14}$

$^\ddagger$ 在原生 SDPA 上,三维和二维修复方法逐对完全一致(198/198,最大 $|\Delta\text{WER}|{=}0.00000$);我们重新运行了单轮+三维条件并转储了转录文本:136/199 逐字字符串一致 / 149/199 WER 与单轮完全一致,剩余 13 个样本对的差距在于转录文本不同但产生相同 WER(完整重新推导见附录 \ref{app:fidelity})。

零权重读取机制(与 WER 无关的验证)。 一个原生 SDPA 注意力质量读出实验(附录 \ref{app:fidelity},$n{=}30$)显示,在两种掩码下,第二轮到第一轮的后 softmax 注意力质量都精确坍缩为 0.000(相比无修复条件的 0.428,30/30)。随后一个针对解码器顶层的隐藏状态探针($n{=}30$,30/30 逐位一致)显示,第二轮隐藏状态在三维和二维掩码下逐位一致,即便二维掩码破坏了第一轮的自注意力(平均$|\Delta|{\approx}11.48$;逐对最小值约 9.26 / 中位数约 11.10 / 最大值约 15.67;最大$|\Delta|{\equiv}13368$),而三维掩码保留了它($|\Delta|{=}0$)。因此在两种掩码下,第二轮的 query 行都以精确为零的权重访问第一轮的 key,那个已发生分歧的第一轮表示对第二轮转录来说是因果上无关的。这是一条第二条独立于上述 WER 对比的机制路径,独立地解释了 198/198 逐位一致的 WER 结果,并驳斥了另一种可能解释——即逐位一致的输出来自两种掩码都保留了相同的第一轮 K/V。

注入来源说明。 v4 掩码是在一个注册的自定义注意力函数内应用的;v2/v3 的失败模式及其原因记录在附录 \ref{app:injection} 中。修复安全性: 在 $T_{1}{\pm}{1,3,5}$ 的偏移(包括灾难性的 $+5$ 偏移)下,$0/350$ 出现言语泄漏复发(附录 \ref{app:t1})。

结果强度总览。 为缓解本文信息密度过大的问题,我们总结了各架构上的证据强度(除特别标注外,均使用实际部署的原生 SDPA 后端);核心的因果证据集中在前三行。

表 3: 结果强度总览:各架构的现象一致性、跨轮掩码因果性、掩码作为可部署修复方案的状态。精简 5 列版本;详细状态字符串见下。

架构 现象(存在性) 跨轮掩码:是否因果? 掩码是否可作为可部署修复方案? 状态
MOSS-Audio-8B (codec) 强,$+0.238$ WER,$p{=}2.2{\times}10^{-14}$ ,90% 恢复率,注意力质量$=0$ 否(在 WER 上被 KV 重置支配;pool/InfLLM 同样无法胜出) 核心因果证据
MiMo-Audio-7B (codec) 强,$+0.809$ WER,eager 单侧 $p{=}7.2{\times}10^{-16}$ ,66%,原生 SDPA 双侧 $p{=}1.1{\times}10^{-8}$ 否(KV 重置占优) 核心因果证据
Qwen2-Audio-7B (编码器+连接器) 次词汇级,$0/199$ 逐字;受损子集 $+0.26$ 受损子集:是(73%,经留出集验证 $p{=}0.033$);全集处于混合边界 否(全集混合边界结果非确定因果) 核心(受损子集)+ 边界性(全集)
SALMONN-13B (Q-Former+Vicuna) 强,$+0.875$,$p{=}1.6{\times}10^{-33}$ 现象已确认;修复受稳定性混淆(34% 掩码诱发的退化) 否(已测试,受稳定性混淆,未实现修复) 初步规模扩展
Qwen3.5-Omni-Plus (约200B+ API) 弱,$p{=}0.49$ 不显著,3/100 逐字 未测试(API 黑盒) 不可测(API 黑盒) 仅边界性观察
Gemini-2.5-Pro (API) 未观察到($n{=}19$,功效不足) 不适用 不适用 仅边界性观察

无任何架构存在可部署的跨轮掩码修复方案;修复工程这条轴向仍是开放问题(§ \ref{sec:negatives-and-withdrawals})。


5 缓解方案

我们探索了四条缓解途径;只有音频锚定适配器 LoRA 在三个轴上均通过(但为非主导型),其余的在下面披露为已被证伪或仅为增量改进。

无需训练的正面修复方案。 我们在掩码方法之外尝试了三条途径;无一能干净地支配免费的 KV 重置。

(i) InfLLM 风格的移植 [infllm]:前轮音频单元使 InfLLM 的检索机制退化为一个二元的包含/排除操作。在 MOSS 上,此移植方案实现了第二轮 WER $0.239$(=KV重置基线),第三轮回忆率约 $41%$(与掩码方法相当,未超越)。第二轮的收益是一种提示词结构化效应,而非 InfLLM 机制本身的胜出。

(ii) 在 SALMONN-13B 上(其掩码修复方案在结构上被阻断,§ \ref{sec:limitations} D2),相同的移植方案同样失败:将片段 A 的音频嵌入区块清零会灾难性地损害生成质量(第二轮 WER $\approx!1.1$)。Q-Former+Llama 路径对被清零的音频嵌入不具容错性。

(iii) 纯文本 KV重置混合方案($n{=}150$):第三轮以文本形式注入片段 A 的前 5 个内容词。报告显示召回率达 $68.7%$,但 $148/150$($98.7%$)是对注入词的逐字回声,而非保留的 KV 所实现的回忆。

我们保留掩码方法作为诚实的因果工具,外加无重播小众场景中的边际价值(§ \ref{sec:niche},相对重置方案 McNemar 检验 $p{=}3.6{\times}10^{-12}$)。一种能在第二轮 WER 上超越 KV 重置并在多架构上保留回忆能力的可部署修复方案,仍是开放问题。相关方法(差分注意力 [difftformer]、逐头 KV 策略 [duoattention]、稀疏内存压缩 [moviechat])是我们未涉及但值得下一阶段研究的自然目标。另一条不同的途径:CAPL [capl] 通过校准(而非掩蔽)跨图像注意力,提供了一个跨模态先例——在不进行整列切断的情况下抑制跨输入渗漏。我们未对其进行测试。

位置保留的音频 KV 池化(B/C)。 除了上述掩码方法及三种正面修复方案外,我们还探索了一种音频 KV 池化途径,直接针对 L24–35 的逐字存储位置(而非阻断跨轮注意力):将片段 A 的音频 token K/V 跨度替换为一个池化表示,保持位置不变,在 MOSS 上进行。有两个变体。**(B,无需训练)** 将跨度均值广播回原长度:逐字泄漏率从 $16.7%$ 降到 $0.0%$(配对 Wilcoxon 检验 $p{=}8.5{\times}10^{-5}$,$n{=}120$ 个 LibriSpeech 样本对),同时在 AMI 依赖性任务上($n{=}120$)保持金标准"是"召回率为 $0.69$,相比 KV 重置基线的 $0.00$——抑制效果保持,回忆效果部分保持。**(C,可学习)** 用 $N{=}4$ 个每层可学习的软聚类锚点(8B 冻结,池化 query 用双重转录+判别损失训练 400 步)替代均值:泄漏保持 $0.0%$,回忆率上升到 $0.80$,WER 为 $0.338$。 $N{=}16$ 重现了 WER $0.335$(即 4 倍的锚点数只将 WER 移动了噪声级别的 $+0.003$)。WER 代价($0.338$ vs 单轮 $0.236$)是位置保留池化方法的结构性代价:压缩到 $N$ 个值,然后铺回跨度长度,因此无论 $N$ 是多少,解码器看到的都是平均化的 token。$N{=}4{\to}16$ 的扫描实验证明了学习和 4 倍锚点数都无法消除这一代价;要消除该代价需要真正的序列长度压缩(因果掩码/位置重计算),这是一种不同且更重的设计,我们未涉及。我们将 B/C 记录为一个诚实的增量缓解数据点:池化方法在匹配的泄漏抑制水平下($0.69$–$0.80$ vs $0.00$)在回忆效果上超越 KV 重置,但未能消除 WER 代价,因此它不能支配 KV 重置,也不能作为头条修复方案;跨轮掩码仍是因果工具(§ \ref{sec:probe}),而无锁定的真正压缩途径仍是未来的开放工作。相关文件:vh_out/pool_leak_moss_n120.jsonlpool_probe_ami_moss.jsonlc_pool_n4.ptc_pool_n16.ptc_pool_eval.jsonl

音频锚定适配器 LoRA 微调(训练侧)。 我们对 MOSS 音频适配器 + deepstack 音频合并器的 GatedMLP gate/up/down 线性层进行 LoRA 微调(rank $16$,$1{,}998{,}848$ 可训练参数,约占 8B Qwen3 冻结解码器的 $0.025%$)——涉及跨轮 KV 缓存、位置 ID 或解码器(因此 CT-SLOT-坍缩和 B/C 铺回失败模式不适用)。损失函数:片段 B 转录交叉熵 $+,0.5,\mathrm{KL}$(相对于 KV重置单轮教师在金标准位置 logits 上的散度)。在相同的 $120$ 个 LibriSpeech 泄漏样本对 $+$ $120$ 个 AMI 回忆试验上(种子 777)设置同批次 noLoRA 对照:多轮 WER $0.454 \to 0.158$(Wilcoxon 检验 $p{=}4.3{\times}10^{-14}$);逐字泄漏计数 $17.5%\to6.7%$(McNemar 检验 $p{=}0.019$);金标准"是"召回率 $47/50{=}94%$ 精确保留(0 处不一致)。400 步的主实验 $+$ 300 步的锚点交叉检验显示无临界点效应。通过两种判别指标确认了泄漏特异性:泄漏样本非对称性(21 个泄漏样本上 $+0.93$ vs 99 个非泄漏样本上 $+0.16$,相差 5.76 倍,Mann-Whitney 检验 $p{=}3.4{\times}10^{-11}$)以及乘性迁移空效应(纯迁移效应预测 $w{=}0.327$;观测值 $0.158$ 是该预测值的 $0.48$ 倍)。结论: 非主导型——KV 重置在严格逐字泄漏指标($0/199$)和金标准"否"($70/70$)上仍严格更优。这是第一个能在 WER/回忆率/泄漏计数三个轴上均有效、且不出现结构性坍缩/随机地板/WER天花板失败模式的修复方案。一个用于消除残差的 $L_{\text{antiverb}}$ 扩展项被证伪(步数匹配后:显著性来自训练步长而非该损失项本身;§ \ref{sec:negatives-and-withdrawals})。相关文件:vh_out/lora_audioground_b400.ptlora_audioground_eval_b400.jsonl,子段落详情见附录 \ref{app:layer-controls}。

在 MiMo-Audio-7B 上的跨架构复现。 我们在 MiMo-Audio-7B 上进行了复现(LoRA 应用于 speech_group_downcast + speech_embeddings_to_local + input_local_transformer,即 MOSS 适配器的功能类比)。相同的同批次 noLoRA 对照协议(种子 777,$120$ 个 LibriSpeech + $120$ 个 AMI 样本)。结果(MiMo): (i) 逐字泄漏计数 $21.7%\to11.7%$($26{\to}14/120$,McNemar 检验 $p{=}0.050$,因 MiMo 的思维噪声处于边界水平)。(ii) 多轮崩溃率减半,$46/120\to21/120$($-54%$),而单轮崩溃率不变($2/2$)——这是多轮特有的稳定化效应。(iii) 非崩溃 WER 子集($n{=}66$):$0.383\to0.257$(Wilcoxon 检验 $p{=}1.9{\times}10^{-3}$)。(iv) 通过强制是/否预填充(助手回复在"Answer:"处结束,阻断思维链)现在可以进行干净的回忆评估:$120/120$ 可解析;无修复条件下金标准"是",+LoRA 为 $45/50{=}90%$ vs 无LoRA为 $40/50{=}80%$(McNemar 检验 $p{=}0.27$,方向一致,无退化)。结论: 方向上追随 codec 类别的模式(泄漏减半,崩溃减半,回忆无退化),但显著性处于边界水平而非干净显著(因 MiMo 的思维噪声所致)。MOSS 精确为 $47/50{=}94%$。


6 相关工作

EnvMem [envmem] 研究了多轮声学记忆的遗忘现象(表示漂移),发现注意力"作用有限"——这与本文方向相反。我们将注意力质量与因果性混为一谈:总体质量(0.645)是描述性的,而逐对质量并非可靠的逐对损害预测量(MOSS 的 Spearman 相关系数 $\rho{=}{-}0.24$,$p{=}6.6{\times}10^{-4}$;Qwen2 的 $\rho{=}0.07$)。我们的因果证据是基于干预的(§ \ref{sec:probe} 的掩码 $\to$ WER 下降)。VoiceGiraffe [voicegiraffe]:小时级音频问答。JEDIS-LLM [jedisllm]:具有说话人分离结转 KV 的流式语音大模型。OmniMem [omnimem]/AudioKV [audiokv]:用于效率提升的 KV 淘汰/压缩方案。SICL-AED [siclaed]:编码器-解码器 AED 上下文学习。MBR/HyPoradise [mbr_asr, hyporadise]:候选选择,与本文正交。StreamingLLM [streamingllm] 研究了同样这一通用性质,但着眼于效率/隐私;我们的音频 token 掩码(54%)是保留 sink/驱逐音频 KV 策略在注意力侧的类比(是一种类比而非经验证等价关系)。我们将 KV 管理这一话题从效率/隐私扩展到一个新模态中的正确性。附录 \ref{app:priorart} 中的一个 12 项对抗性提问的先前工作检索确认——前轮音频内容 $\to$ 前向转录污染这一特定轴向,通过跨轮注意力因果探针诊断,并配合无需训练、轮次限定的掩码方法——是尚未被占据的研究空白。该现象是通用性的,而非语音特有的: 一个纯文本对照条件(第一轮 = 片段 A 的文本转录,无音频;第二轮 = 转录音频片段 B)在 MOSS 上显示出相同的模式——单轮 $0.284$ $\to$ 文本缓存条件 $0.416$($+0.131$ WER,配对 Wilcoxon 检验 $p{=}3.7{\times}10^{-4}$,$1/30$ 言语泄漏)。前轮文本同样通过 KV 缓存污染后续音频转录,这证实该泄漏是自回归解码循环 KV 共享机制的一种性质,而非音频模态本身特有的问题。


7 局限性

(1) 英语朗读语音; 同说话人连续样本对(跨说话人分析见 § \ref{sec:xspk})。更难语音场景的泛化性(已测试): 在完整的 LibriSpeech test-other 子集($n{=}200$,噪声更大)上,泄漏依然出现(单轮 0.319$\to$无修复 0.538),二维修复方案有效恢复(0.333),言语泄漏率为 12%(与 test-clean 一致),且两者在 29 名 test-other 说话人上均聚类稳健(泄漏聚类 bootstrap $p{<}5{\times}10^{-4}$ [朴素方法 $7.6{\times}10^{-17}$];修复聚类 bootstrap $p{<}5{\times}10^{-4}$ [朴素方法 $3.3{\times}10^{-16}$];聚合 Wilcoxon 检验 $\le3.7{\times}10^{-9}$)。非英语/噪声环境/远场/多说话人部署场景仍是开放问题。**(1')** 流式场景(已测试,已关闭):将片段 A 分成 $K{=}4$ 个增量作为第一轮中的 4 个独立音频片段($n{=}40$),泄漏依然出现($p{=}2.1{\times}10^{-7}$),三维修复方案依然有效(93.8%,$p{=}3.4{\times}10^{-7}$);一个由较小 $n$ 值和措辞差异导致的混淆幅度变化已被披露。真正的分块解码流式场景仍是开放问题。**$T_{1}$ 边界稳健性(已测试):** 修复方案能容忍 $T_{1}$ 定位误差 $\pm3$ 个 token 而不降低 WER(对 $T_{1}{\pm}{1,3,5}$ 进行扰动,$n{=}50$):$\pm1,\pm3$ 不显著,只有 $+5$ 出现灾难性效应,$p{=}1.6{\times}10^{-8}$;这种退化是不对称的——低估($-5$)保持安全,高估($+5$)导致生成崩溃(重复循环)——但任何扰动条件下言语泄漏均未复发(0/350,包括灾难性的 $+5$)(附录 \ref{app:t1})。(2) 聚类稳健性/独立单元。** 199 个样本对只涉及 29 名说话人,同一说话人的样本对并非严格独立同分布,因此朴素配对检验可能会给出反保守的结果。我们用按说话人聚类 bootstrap(B=2000)和按说话人聚合 Wilcoxon 检验重新检查了每个头条结果。所有 MOSS/MiMo 头条修复效果均存活($p{<}5{\times}10^{-4}$;聚合结果 $\le1.9{\times}10^{-9}$,eager 三维为 $9.3{\times}10^{-6}$)。在 $n{=}199$ 时,Qwen2 全集在*任一*后端上均未通过聚类检验(eager $0.042\to0.162/0.328$,不显著;原生 SDPA $0.022\to0.088$,不显著);扩展到 $n{=}280$(原生 SDPA)后变为混合边界(聚类 bootstrap $p{=}0.023$ + 按主体 $t(39){=}2.26$,$p{=}0.030$ 显著;渐近 LMM $p{=}0.074$ 边界不显著;Satterthwaite 退化情形 $p{=}0.148$ 不显著——效应虽小但真实且依赖约定,见下方"已解决"说明),而 eager 全集保持方向一致,仅通过其受损子集作为头条结果报告。**受损子集框定的事后性质在 $n{=}280$(完整 test-clean,40 名说话人)上得到"已解决":** (a) 全集修复效果不涉及任何子集选择,因此其构造上就不存在事后性问题,在聚类 bootstrap 下处于混合边界显著($p{=}0.023$,中心化 B=2000;按主体 $t$ 检验 $p{=}0.030$ 也显著;LMM 处于边界不显著;效应小但真实,均值 $+0.017$ WER;依赖约定,非确定性因果),取代了 $n{=}199$ 时的 $0.088$ 不显著结果;(b) 受损子集框定通过一个按说话人分层的留出集(20 名未见过的说话人,先验阈值 0.05:13 个受损,恢复率 64%,单侧 Wilcoxon 检验 $p{=}0.033$ [在 $n{=}13$ 下双侧不显著],中心化聚类 bootstrap $p{=}0.036$;训练半集 15 个受损,$p{=}0.0025$)独立得到验证。作为其前身的 $n{=}199$ 结果(8 个受损,$p{=}0.20$ 不显著)是一个功效地板,而非可选的停止点。我们将 Qwen2 原生 SDPA 全集结果限定为混合边界(聚类 bootstrap 稳健+按主体 t 检验显著,LMM 处于边界),受损子集留出集结果作为一个印证性的幅度定位,是单侧的,而非独立的双侧聚类证明。**(2')** 后端独立性:*核心*修复效果在三种架构上均与后端无关——eager(MOSS 67%/$3.6{\times}10^{-9}$;MiMo $7.2{\times}10^{-16}$)以及 MOSS 上的原生 SDPA(90%/$2.2{\times}10^{-14}$,136/199 逐字一致/149/199 WER 一致)、MiMo(66%,$p{=}1.1{\times}10^{-8}$)以及 Qwen2(全集 $p{=}0.023$,无事后选择问题;受损子集 73%,$4.8{\times}10^{-4}$;留出集 $p{=}0.033$)。三维 vs 二维的细化区别*未*在原生 SDPA 上得到确认(逐位一致 198/198)。**(3) 统计报告与 FWER。** 在 15 项检验组成的检验家族(附录 \ref{app:stats})中,核心修复效果 + MOSS 受损 + MiMo 受损子集通过了 Bonferroni 校正;当 Qwen2 全集条目使用 $n{=}280$ 原生 SDPA 后端($p{=}0.003$)时,BH 校正达到 15/15 单侧和双侧通过。我们*不*宣称所有头条结果都通过 Bonferroni 校验:MOSS/MiMo 的核心结果通过了;Qwen2 全集通过了 BH 校验但 Bonferroni 双侧校验处于边界(朴素 $p$ 值 $0.046$;聚类双侧 $0.023$),Qwen2 受损子集在 Bonferroni 校验下处于边界(单侧 $0.21$/双侧 $0.42$)但经留出集验证;反证 AB>revA 检验($9.6{\times}10^{-3}$)未校正时显著但未通过 Bonferroni 校验。(3') TOST。** § \ref{sec:mimo} 中的等效性检验($\delta{=}0.05$,$\alpha{=}0.05$)给出 $p_1{=}0.99995$,$p_2{=}2.7{\times}10^{-6}$,TOST $p{=}\max(p_1,p_2){=}0.99995$ $\Rightarrow$ 无法拒绝非等效性(在 0.05 范围内等效;均值差 $-0.601$,置信区间 $[-0.86,-0.32]$);此前"TOST 已拒绝"的措辞方向颠倒,现已更正。**(4) 开放问题:** 同后端下的二维 vs 三维对比(在 eager 二维干净运行时,原生 SDPA 下恰好为 0.000);层级定位消融实验(第二篇论文);非英语/噪声语音场景。**(5) 闭源 API 的局限性:** 闭源结果(§ \ref{sec:closed-source})是黑盒式的——我们无法检查其内部 KV 缓存的处理方式,无法应用掩码修复方案,也无法控制部署环境。Qwen3.5-Omni 的弱泄漏观察($n!=!100$,$p!=!0.49$,不显著)和 Gemini 的无泄漏观察($n!=!19$,功效不足以确认其确实无泄漏)都属于边界性观察,而非受控的机制检验。


8 结论

我们使一种模态特有的正确性失效现象变得可见并对其进行了诊断:在多轮语音大模型转录中,前一段音频的内容会残留在 KV 缓存中,并损害后续轮次的逐字转录——这是通用 Transformer KV 缓存性质在一个新模态(语音)中作为正确性维度(效率与隐私是此前已知的两个维度)的重新框定。在 MOSS-Audio-8B 上,WER 从 $0.240$ 提升到 $0.478$,在最严重的子集中模型甚至会替换整段内容;静音/无关内容/占位符/跨说话人/词汇量以及时间反转 A/白噪声等反证条件确立了前段音频内容的驱动作用。该现象在四个开源语音大模型和四类架构(参数量 7B–13B)上表现一致,在一个约 200B+ 参数的闭源模型上观察到较弱的边界信号。核心机制性结果(§ \ref{sec:probe}):阻断跨轮注意力在四个开源架构中的三个(MOSS、MiMo、Qwen2受损子集)上具有因果性;在 SALMONN-13B 上,现象已被确认($p{=}1.6{\times}10^{-33}$),但注意力掩码修复方案仍是一个开放的工程问题,尚未测试。该机制通过两种方式得到验证:第二轮到第一轮的注意力质量在两种掩码下都精确坍缩为 0($n=30$),且第二轮隐藏状态在三维和二维掩码下逐位一致,尽管二维掩码破坏了第一轮的自注意力而三维掩码保留了它——这是一种独立于其所解释的 WER 对比的零权重读取机制。内容检视随后在 token 流层面证明了架构类别相关的泄漏模态差异(codec 43% 逐字片段 A 词汇 vs 编码器+连接器 0%)。每个 MOSS/MiMo 头条结果都在按说话人聚类 bootstrap 下以 $p{<}5{\times}10^{-4}$ 的水平存活。整列掩码方案(91% 恢复率)在 WER 指标上被免费的 KV 重置(0.240)严格支配,在保留能力上被重置+重新输入的混合方案严格支配;我们仅将其保留作为建立因果论断的工具和一个小众操作选项,而一种修复方案。贡献:现象本身(语音模态中 KV 缓存泄漏的正确性维度)+ 泄漏跨架构因果定位到跨轮注意力 + 双轴机制规律(注意力质量=保真度对照量;泄漏内容=架构类别相关);掩码方法是辅助性的,与朴素基线进行了诚实的比较。

\bibliography{refs}

% =============================================================================


附录

附录 A 注意力掩码注入:v2/v3/v4 与 transformers 4.57 SDPA 流水线

概要:在 transformers 4.57.1 原生 SDPA 环境下,对于单个无填充的提示词,Qwen3Model.forward 只调用一次 create_causal_mask,该函数在预填充和解码阶段均返回 None(通过 _ignore_causal_mask_sdpa 实现的 sdpa-mask);每一层的 attention_mask 都是 None,因果性由 SDPA 的 is_causal 标志强制实现。因此,重写每层 attention_mask kwarg 的 forward_pre_hook 实际上是在重写一个内核忽略的 None 值。v2(逐层预钩子,仅作用于预填充阶段)只恢复了 26.4%($p{=}0.114$,不显著),因为它跳过了主导泄漏的解码步骤;v3(解码修复扩展)是完全的空操作,与无修复条件逐位一致。v4 通过在 ALL_ATTENTION_FUNCTIONS 中注册一个自定义注意力函数 sdpa_3d,在每个 Qwen3 层上设置 _attn_implementation="sdpa_3d",在该函数内部重建四维掩码(因果下三角 $+$ 跨轮行/列上的 $-\infty$),将框架提供的任何四维掩码重新加入作为填充保护(在无填充情况下不生效),并调用 $F.\text{scaled_dot_product_attention}$,设置 attn_maskis_causal=False,同时修复了这两个问题,掩蔽预填充和解码阶段。结果:单轮 0.23953 / 无修复 0.47068 / 3D_sdpa 0.26229 = 90.15% 恢复率,$p{=}2.214{\times}10^{-14}$。完整的 v2/v3 差异对比、源代码行指针以及 transformers 内部机制详见 SUPPLEMENTARY_S1.md

附录 B 原生 SDPA 保真度探针与逐位一致机制($n{=}30$)

探针 A(质量正对照): 模型的原生 SDPA 路径(非 eager),在所有层上注册 sdpa_3d;在预填充第 0 层读取第二轮到第一轮的后 softmax 质量,对第二轮 query 行取平均。在无修复条件下,原生 SDPA 路径将约 42.8% 的第二轮质量分配到第一轮 key 上;在三维仅 query 掩码和二维整列掩码下,该质量在 30/30 个样本对中精确坍缩为 0.000,并完全转移到第二轮区块(质量=1.000);三维和二维产生完全相同的逐对质量模式(30/30)。探针 B(隐藏状态隔离): 在同一样本对上,通过在 QWEN.layers[-1] 上的前向钩子捕获解码器顶层输出的隐藏状态(每种掩码下均捕获),并在第一轮和第二轮位置上进行逐对比较。

  • 第一轮,无修复 vs 三维:平均$|\Delta|{=}0.0$,最大$|\Delta|{=}0.0$,30/30(三维掩码精确保留第一轮自注意力)。
  • 第一轮,无修复 vs 二维:平均$|\Delta|{\approx}11.48$(逐对最小值 9.26 / 中位数 11.10 / 最大值 15.67),最大$|\Delta|{\equiv}13368$,0/30(二维掩码破坏了第一轮自注意力)。
  • 第二轮,三维 vs 二维:平均$|\Delta|{=}0.0$,最大$|\Delta|{=}0.0$,30/30(第二轮输出在两种掩码下逐位一致)。

结论。 198/198 逐位一致的 WER 结果有两种可能解释:(a) 两种掩码保留了相同的第一轮 K/V;(b) 两种掩码都将第二轮到第一轮的注意力驱动到精确为零,因此第二轮以零权重读取第一轮,第一轮的表示对第二轮而言是因果无关的。探针 B 区分了这两种解释:在二维掩码下,第一轮的表示相对无修复/三维条件发生了剧烈分歧(逐元素最高达 13368),而在三维掩码下则精确保留——这直接反驳了解释 (a)。然而第二轮隐藏状态在三维和二维掩码下逐位一致(30/30)。唯一一致的解释是 (b):两种掩码下的零权重读取(探针 A)阻止了那个已发生分歧的第一轮表示传播到第二轮。来源:leakage_moss_sdpa3d_fidelity_probes.py $\to$ vh_out/leakage_moss_sdpa3d_fidelity_probes_n30.jsonl;逐对运行日志"DONE"。完整详情见 SUPPLEMENTARY_S2_FIDELITY_PROBES.md

附录 C 统计方法:聚类 bootstrap、FWER、TOST

按说话人聚类 bootstrap: 对 29 名(MOSS/MiMo)或 40 名(Qwen2 $n{=}280$)说话人有放回重采样,B=2000,重新计算检验统计量;报告两种约定——重新中心化的双侧(头条结果,Qwen2 $n{=}280$ 的 $p{=}0.023$)以及双单侧百分位变体($0.018$,结论一致,此处"单侧"= 重采样均值 $\leq0$ 的比例)。Bootstrap 置信区间基于百分位法(例如 Qwen2 $n{=}280$ 全集 95% 置信区间 $[+0.003,+0.032]$,与约定选择无关)。在相同约定下,$n{=}199$ 的 Qwen2 全集给出 $0.088$ 不显著——与本文所主张的"由不显著变为显著"方向内部一致。15 项检验家族 + FWER: 对 15 项预先指定的检验采用 Bonferroni 和 Benjamini-Hochberg 校正;核心修复效果 + MOSS 受损 + MiMo 受损子集通过了 Bonferroni 校验;当 Qwen2 全集条目使用 $n{=}280$ 原生 SDPA 后端时,BH 校正达到 15/15 单侧和双侧通过。Qwen2 全集通过 BH 校验但 Bonferroni 双侧校验处于边界;Qwen2 受损子集在 Bonferroni 校验下处于边界但经留出集验证;反证 AB>revA 未校正时显著但未通过 Bonferroni 校验。TOST: MiMo 二维全集 vs 仅音频区域修复差异的等效性检验,$\delta{=}0.05$ WER,$\alpha{=}0.05$:$p_1{=}0.99995$,$p_2{=}2.7{\times}10^{-6}$,TOST $p{=}\max(p_1,p_2){=}0.99995$ $\Rightarrow$ 不等效(此前"已拒绝"的措辞方向颠倒)。完整表格见 SUPPLEMENTARY_S3_STATISTICS.md

附录 D 先前工作检索(12 项对抗性高难度提问)

我们对先前工作语料库运行了 12 项对抗性高难度提问,以确认这一特定研究轴向——前轮音频内容 $\to$ 前向转录污染,通过跨轮注意力因果探针诊断,配合无需训练、轮次限定的注意力掩码正确性干预方案——是尚未被占据的空白。全部 12 项提问均未在此轴向上返回相关结果。§ \ref{sec:related} 中的 6 篇引用文献均为真实存在(arXiv ID 已于 2026-07-25 验证可访问);最相近的邻近工作(EnvMem)方向恰恰相反(是遗忘而非前向污染)。剩余风险为中低水平。逐项检索结论详见 SUPPLEMENTARY_S4_PRIORART_SWEEP.md

附录 E $T_1$ 边界稳健性与 0/350 修复安全性

MOSS,$n{=}50$(v4 配对的前 50 个样本对),对 $T_{1}{\pm}{1,3,5}$ 进行扰动。50 样本子集上的同批次基线:单轮 0.275 / 无修复 0.574 / 三维偏移0 0.315(比 $n{=}199$ 锚点数据更嘈杂;稳健性结论使用同批次配对比较,不受基线偏移影响)。相对于 $T_{1}$ 精确值的逐对 Wilcoxon 检验:$\pm1,\pm3,-5$ 不显著,只有 $+5$ 出现灾难性效应($p{=}1.6{\times}10^{-8}$)。退化效应是不对称且渐进的:低估($-5$)保持安全(掩码方法阻断的第一轮 key 更少,但永远不会重新泄漏);高估($+5$)导致模型生成崩溃(重复循环/片段B截断),但**任何扰动条件下均未出现言语泄漏复发:在全部 7 种偏移 $\times$ 50 个样本对(共 350 个测试点)中为 0/350,包括灾难性的 $+5$*。该修复方案最坏情况下的失效表现是转录质量下降,而非其设计所要抑制的跨轮音频泄漏的复发——也就是说,该修复方案在关键意义上是安全*的。完整详情见 SUPPLEMENTARY_S5_T1_ROBUSTNESS.md

附录 F 内容检视:codec 逐字词汇泄漏 vs 编码器+连接器次词汇渗漏

本次投稿新增内容。 来源:L_LEAKAGE_CONTENT_INSPECTION_CODEC_VS_ENCODER.md;数据 = vh_out/leakage_moss_200.jsonl + leakage_qwen2_200.jsonl(各 $n{=}199$,相同引出方式;两者均已存储每对样本的 alonenocuregold_agold_b,因此无需新的 GPU 运行)。方法: 对每种架构,在 WER 受损子集(无修复$-$单轮 $\geq0.05$)上,我们检验 nocure 转录文本中是否包含一个逐字片段 A 词:一个长度 $\geq$5 字符的片段 A 内容词(已过滤停用词),该词出现在 nocure 中,但出现在片段 B 的金标准文本中,也不出现在 alone 中——从而分离出通过 KV 缓存到达第二轮的逐字片段 A 内容,而非来自片段 B 或模型通用词汇的内容。$\geq$4 字符不过滤停用词的变体给出同样的分离结果(对函数词的顾虑具有稳健性)。

表 4:

架构(音频表示方式) 全集逐字片段A词汇泄漏 受损子集上 词汇数
MOSS(codec 离散 token) 39/199 (19.6%) 39/90 (43%) 202
Qwen2(Whisper 编码器+连接器) 0/199 (0.0%) 0/22 (0%) 0

这种分离是极端的且形式上显著的,并非低统计功效造成的零结果。由于 MOSS 和 Qwen2 的运行是配对的(相同的 199 个 LibriSpeech 样本对,相同的引出方式),正确的检验是对逐对泄漏指标进行配对 McNemar 检验,而非非配对 Fisher 检验:2×2 不一致情形为 39 个 MOSS 独有泄漏 vs 0 个 Qwen2 独有泄漏(0 个两者皆有,160 个两者皆无),给出精确 McNemar 双侧 $p{=}3.6{\times}10^{-12}$(单侧 $1.8{\times}10^{-12}$)——唯一的不一致方向是 MOSS$>$Qwen2,在全部 39 个样本对中均如此。受损子集上的边缘 Fisher 检验(39/90 vs 0/22,双侧 $p{=}2.9{\times}10^{-5}$)仅作为较弱的次要检验报告(两个受损子集只在 12/22 个样本对上重叠,因此其独立性假设是近似的)。Qwen2 的全集逐字泄漏率为 $0/199$,按三规则给出单侧 97.5% 置信上界 $1.5%$——这是严格的证明;MOSS 全集为 $39/199$(19.6%,Wilson 95% 置信区间 $[14.7%,25.7%]$)。Qwen2 有 22 个 WER 明显受损的样本对(无修复 WER 高达 0.95),但个携带逐字片段 A 词。在相同的引出协议下,codec 存储的音频以逐字词汇内容的形式到达后续轮次;编码器+连接器存储的音频以次词汇/话题延续渗漏的形式到达,无任何逐字词。定性示例: MOSS 样本对 2——片段 A "CONGRATULATIONS WERE POURED IN UPON THE PRINCESS EVERYWHERE...";MOSS 无修复条件下片段 B 的转录重现了"princess/everywhere/poured"的逐字内容。Qwen2 样本对 22——片段 A "POOR ALICE";Qwen2 无修复条件下片段 B(White Rabbit)的转录输出"Oh, the duchess! Oh, the duchess!"(Alice$\to$duchess 是次词汇的主题延续,而非片段 A 中"Alice"这个逐字词)。这项结果解决了什么问题: 结合跨架构注意力质量分离现象(Qwen2 质量更高 0.621 / 泄漏更少 $-0.011$ vs MOSS 0.430 / $+0.239$),本文现在具备了一个双轴分离结论——质量=保真度对照量;泄漏内容模态=架构类别相关——在 token 流层面得到证明,将模态保真度这一说法从架构类别层面的推断转化为一种经证明的经验规律保留的诚实局限: (i) 该 $0/199$ 全集结果基于保留了转录文本的 $n{=}199$ 次运行;$n{=}280$ 扩展运行中的逐对转录文本未被持久化保存(v4 n280 的 artifact 只存储了 WER+注意力质量),因此重新确认 0/280 需要重新进行生成运行,而非无需 GPU 的查表操作——因此 $n{=}199$ 的全集(转录转储运行所覆盖的全部样本对)是全集的演示;(ii)"次词汇"是通过缺失性加定性主题延续观察证明的,而非通过一个正面的次词汇延续度量指标(逐对 n-gram 重叠/话题相似度版本留待第二篇论文的层级定位后续研究);(iii) MOSS 的"逐字"根据词过滤严格程度不同,在内容词层面(约 39 对)和句子层面(约 24 对,即预计算的言语泄漏计数)有所不同,两者均可报告。McNemar 检验和边缘 Fisher 检验的重新推导是确定性的(无需 GPU)。

附录 G 可复现性

所有脚本均在 [匿名化URL]/ 目录下(MOSS/MiMo/Qwen2 各变体的 leakage_*.py;经修正的 logit-lens 系列脚本 leakage_moss_lens_*_*correct*.py,包括内在区段增强分析;用于三层结构检验的 leakage_moss_lens_enhancement_harmed_nonleak.py;用于事后留出集分析的 cr_b_qwen2_holdout_n280.py;用于 bootstrap/Wilcoxon/TOST 的 leakage_stats.py);所有逐对 artifact 均在 vh_out/ 目录下。Qwen2 $n{=}280$ 全集逐对文件在发布时附带了重建的 spk(说话人)字段(leakage_qwen2_sdpa3d_v4_n280_withspk.jsonl),因此聚类双侧 $p{=}0.023$ 和 20 名说话人留出集 $p{=}0.033$ 可从发布的文件中直接复现,而非仅能从摘要 JSON 中获得。本文中每一个头条数字均已从这些 artifact 中独立地重新推导(零漂移),时间为 2026-07-26;§ \ref{sec:layer-local} 的 lens 数据(包括内在区段增强分析)已于 2026-07-29 重新验证为零漂移。

附录 H 补充材料

关于跨说话人泛化性、对抗性放大、掩码 vs KV重置保留能力、依赖性任务、SALMONN-13B 以及闭源边界测试的补充表格、逐对 artifact 及完整详细子章节,均可在匿名发布地址获取。各项的头条数字已在 § \ref{sec:experiments} 正文中逐条报告。

Downloads last month

-

Downloads are not tracked for this model. How to track
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support