跳转至

Geometric Inductive Biases for Semi-Supervised Equalization: The Constellation-Aware Transformer

会议: NeurIPS2026(任务归档;缓存为 arXiv v1,未独立核实录用)
arXiv: 2609.33695
领域: 信号处理与通信
关键词: 半监督均衡、星座几何、符号间干扰、双向 FIR、测试时训练

一句话总结

CAT 把已知星座点与接收信号从第一层起联合建模,并用双向 FIR 信号分支处理符号间干扰,在逐块半监督适应中减少所需导频,但这一收益依赖足够的导频与接收端训练计算,并非无监督或跨信道零样本解码。

研究背景与动机

接收端知道使用的是哪一种调制星座,却未必知道当前信道怎样改变这些点的位置。衰落和 I/Q 不平衡会扭曲星座,多径还会让相邻符号叠加形成符号间干扰(ISI)。导频提供已知符号与接收信号的对应关系,但每多发送一个导频,就少一个可携带有效数据的符号。传统 EM 和决策反馈式学习能够利用未标注载荷,却容易受初始化和错误硬判决影响;VAE-CNN 则把符号推断和前向信道重建联合训练,以少量导频加大量未标注载荷学习当前信道。

直接把 VAE 的编码器换成普通 Transformer,能够增加序列交互,却没有充分利用接收机已经拥有的知识。信号 token 的自注意力需要从有限样本中间接形成星座的几何参照,逐 token 的 MLP 又没有针对逆滤波的局部时序结构。本文关注的不是再增加离线标注数据,而是让每个新数据块中的导频与载荷更有效地约束模型:已知星座提供符号位置的模板,双向滤波提供适合块均衡的时间结构。

核心 idea:让接收信号与理想星座点在每一层中早期交互,并把信号的非因果去卷积与星座的几何细化分开处理,在同一半监督变分目标下学习未知信道。

方法详解

整体框架

输入是一个接收数据块,以及调制方案给定的全部理想星座点;输出是每个位置属于各个符号类别的后验概率。CAT 替换半监督 VAE 中的推断编码器,前向信道生成解码器仍与基线共用。这里的 VAE 解码器负责重建接收信号,不是最终把接收信号判成比特的通信解码器。

数据块包含已知导频和未知载荷。信号与星座分别投影到相同隐藏维度,信号加入固定正弦位置编码,而星座作为集合不加入位置编码。随后经过 3 个 TransFIRmer 块:每块先对全部信号与星座做联合双向注意力,再对两类 token 应用不同的前馈分支,最终读出信号位置的符号后验。

训练时,这个后验与前向信道生成解码器一起利用导频监督和载荷重建;推理时,已适应的 CAT 输出符号后验供硬判决或软比特解码使用。下图实线表示推断数据流,虚线表示仅用于适应的监督与生成训练分支。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["接收数据块 + 理想星座"] --> B["星座联合注意力"]
    B --> C["双流 TransFIRmer"]
    C -->|同一块内重复 3 层| D["逐位置符号后验"]
    D --> E["硬判决 / 软比特输出"]
    D -.-> F["半监督信道重建"]
    G["导频标签 + 接收观测"] -.-> F
    F -.->|仅训练更新| B

关键设计

1. 星座联合注意力:用已知几何模板参与每一层的信号推断

普通 Transformer 只对接收信号进行自注意力,CAT 则把全部 \(N\) 个信号 token 和 \(K\) 个理想星座 token 拼接为一段长度 \(N+K\) 的序列。查询、键和值均由这个完整序列产生,因此不只是“信号查询一个固定星座字典”:信号之间、星座之间以及两类之间都可以交互,星座表示也会随当前数据块更新。本文采用完整双向掩码,因为块均衡是利用前后观测的平滑问题,而不是必须逐符号输出的自回归预测。

这种早期交互让模型从第一层就知道每个候选符号的理想位置,再通过当前块学习它们如何被信道扭曲。即使信道无记忆,整块注意力仍有意义:同一个数据块共享衰落系数和 I/Q 不平衡,因此其他位置能够帮助识别共同的失真。不给星座添加位置编码,是因为星座点的几何坐标有物理意义,但输入列表中的先后顺序没有额外物理意义。

作者将信号—星座相关性与匹配滤波联系起来。附录 A.3 的高斯后验展开可简写为下面的归一化关系,其中 \(\mathbf z\) 是高斯噪声下的观测,\(\mathbf c_k\) 是候选星座点;这说明相关性项为何有用,也说明何时不能只保留点积。

\[ p(k\mid\mathbf z)\propto\exp\left(\frac{\mathbf z^T\mathbf c_k}{\sigma^2}-\frac{\|\mathbf c_k\|^2}{2\sigma^2}\right). \]

对于恒模星座,候选点能量项相同,归一化时可以消去;对于 QAM,内点和角点能量不同,这一项不能消去。所以“注意力等于高斯后验”不是适用于所有 QAM 的无条件恒等式。附录报告训练后隐式能量归一化把偏差从 0.95 nats 降至 0.04 nats,但这是实验观测,而不是一般性的精确后验保证。

2. 双流 TransFIRmer:让时序去卷积与星座几何细化各用合适的运算

ISI 的困难在于某个接收位置混入了多个发送符号;把每个信号 token 单独过 MLP,不会直接提供逆滤波所需的相邻位置运算。TransFIRmer 因而把标准前馈网络拆成两路:信号路使用正向和反向的一维卷积,星座路保留 MLP。信号路先按原序列卷积,再把另一份序列翻转后卷积并翻转回来,将两者相加;两条 token 流各自具有残差连接。

\[ \operatorname{FFN}_{\mathrm{sig}}(\mathbf Z)=\operatorname{Conv}_{\mathrm{fwd}}(\mathbf Z)+\operatorname{Flip}\left(\operatorname{Conv}_{\mathrm{bwd}}(\operatorname{Flip}(\mathbf Z))\right). \]

双向不是装饰:块 MMSE 均衡需要利用当前位置前后两侧的信息,反向支路提供非因果滤波的结构偏置。理想星座点并不是按时间排列的序列,因此对它们卷积反而引入不必要的顺序假设;并行 MLP 用来细化其几何表示。联合注意力继续交换两路信息,所以这不是彼此独立训练的两个均衡器。

附录 F.1 给出的实际配置是 3 层、隐藏维度 10、单头 Multi-Query Attention,两向卷积的核大小均为 12,星座 MLP 的单个隐藏层宽度为 10,dropout 为 0.1。理论上,注意力可承载匹配相关与白化的表示,双向卷积可逼近块 Wiener 接收机的非因果滤波结构;这些是表达能力与归纳偏置的论证,不意味着训练必然求出精确 Wiener 解,也不意味着非线性信道下它就是最优接收机。

3. 半监督信道重建:用载荷约束未知信道,但保留导频的符号锚定

仅有星座模板还不知道当前信道如何改变它。CAT 输出符号后验,生成解码器再从候选发送符号预测接收观测;如果符号推断和信道模型能共同解释大量未标注载荷,导频的少量标签就可以发挥更大作用。导频还直接训练符号分类,因此这不是纯无监督聚类,也不是把模型的硬伪标签当真值后反复训练。

无记忆信道的生成解码器是隐藏层宽度为 64、32、16 的 MLP,预测高斯观测的均值与方差。ISI 版本先用隐藏维度 32 的两层 MLP 表示无记忆失真,再用长度 12 的可学习复数 FIR 表示传播信道,并学习噪声方差。这条训练用的前向 FIR 与 CAT 信号分支中的双向逆滤波不是同一个模块:一个解释信道怎样生成观测,另一个帮助从观测恢复符号。

一个完整示例

考虑主实验中 16-QAM、64 个导频和 256 个载荷符号的 \(h^{(1)}\) 数据块。按第 2 节的定义,\(N\) 包括导频与载荷,因此这里共有 320 个信号位置,再加入 16 个理想星座点;联合注意力处理 336 个 token。这个计算只是在解释定义,不是另一个实验结果。

导频位置提供 64 个已知符号类别,载荷位置没有类别标签。每个 TransFIRmer 块先让 336 个 token 共同交互,再分别对 320 个信号位置做双向卷积、对 16 个星座位置做 MLP。经过 3 层后,信号位置输出 16 类后验;生成解码器依据这些潜在符号解释整个接收块。

优化结束后,在这个同一数据块的 256 个载荷符号上计算 SER。它衡量的是当前块的适应效果,不能改称对一个未见信道的直接泛化效果;下一块信道变化时,需要重新适应。

损失函数 / 训练策略

式(2)的三个组成部分分别为导频分类交叉熵、导频观测负对数似然和载荷负 ELBO。为避免把无记忆情况下逐位置写法误当成 ISI 的独立观测假设,这里用各自已归一化的平均损失记号概括原目标:

\[ \mathcal L_{\mathrm{SSL}}=\alpha\mathcal L_{\mathrm{pilot\text{-}CE}}+\gamma\mathcal L_{\mathrm{pilot\text{-}NLL}}+(1-\gamma)\mathcal L_{\mathrm{payload\text{-}NELBO}}. \]

导频两项按导频数归一化,载荷项按载荷数归一化;负 ELBO 包含后验下的负重建对数似然,以及符号后验相对均匀符号先验的 KL 项。ISI 编码器条件化于整个接收序列,生成解码器也显式建模序列卷积,不能把每个观测都视为仅由当前符号生成。附录 E 使用单样本近似与 Gumbel-Softmax 保持可微。

默认冷启动协议在每个块上从随机初始化训练 5,000 步,训练只使用该块导频和未标注载荷,SER 也在同一载荷上测量。这属于传导式测试时适应;不使用载荷真标签,也不使用其他信道实例的数据。CAVIA 基线及元初始化实验是明确例外,它们使用过去信道的离线训练信息。

AdamW 初始学习率为 0.001,权重衰减为 0.01,学习率线性降至零,小批量包含 16 个导频符号和 32 个载荷符号。分类权重为 0.2;生成监督权重逐渐退火,把重点转向载荷,Gumbel-Softmax 温度最低降至 0.5,两种退火均每 100 步更新。附录没有完整展开小批量采样与全块注意力如何结合,实现复现时需要核实,不能据这些描述自行补出代码细节。

实验关键数据

主实验

以下为原文表 2 的选取行:16-QAM,\(E_x/N_0=17\) dB,载荷 256;SER 是错误符号占评估符号的比例,越低越好。每种方法使用当前块进行适应,报告 1,000 次独立 Monte Carlo 试验的平均值;最优项是已知信道的参考解码器,不是同等信息条件下的可部署基线。

信道 导频数 VAE-CNN SER 普通 Transformer SER CAT SER 最优 SER
\(h^{(1)}\),5 taps 16 0.2900 0.3392 0.3580 0.0121
\(h^{(1)}\),5 taps 64 0.0523 0.0610 0.0198 0.0121
\(h^{(1)}\),5 taps 128 0.0494 0.0290 0.0156 0.0121
\(h^{(2)}\),4 taps 64 0.1002 0.0750 0.0340 0.0101
\(h^{(2)}\),4 taps 128 0.0869 0.0888 0.0257 0.0101
\(h^{(3)}\),10 taps 64 0.1709 0.1692 0.1181 不可计算
\(h^{(3)}\),10 taps 128 0.1087 0.1022 0.0846 不可计算

在前两个信道上,CAT 的 64 导频结果分别低于两种基线的 128 导频结果;10-tap 信道上仍有优势,但不能据此宣称同样能把导频减半。最少导频也不是始终获胜:在 \(h^{(1)}\) 的 16 导频条件下,CAT 比两个学习基线都差。原文的“三个 ISI 信道均优于基线”需要限定为至少 32 个导频。

消融实验

原文表 4 的两个条件不同:无记忆为 16 导频、64 载荷、22 dB;ISI 为 \(h^{(1)}\)、64 导频、256 载荷、17 dB。无记忆列保留原文给出的 95% 置信区间,未报告不补造;横向两列不是同一难度下的绝对比较。

配置 无记忆 SER ISI SER 说明
完整 CAT 0.0599 ± 0.0005 0.0198 联合注意力与双向 FIR
去掉反向 FIR 0.0608 ± 0.0005 0.0287 信号只保留正向卷积
FIR 换为 MLP 0.0615 ± 0.0006 0.0351 保留星座与联合注意力
去掉星座、保留双向 FIR 未报告 0.0438 隔离几何先验的作用
普通 Transformer 0.0628 ± 0.0007 0.0610 仅信号自注意力
星座先验旋转 45 度 0.1550 ± 0.0015 未报告 错误几何参照
星座也加位置编码 0.0631 0.0224 引入集合的人工顺序

关键发现

  • 收益来自适合任务的结构,而非仅增加输入。 去掉反向 FIR 后 ISI SER 从 0.0198 升至 0.0287,完全换成 MLP 则升至 0.0351;相应无记忆变化较小,符合“没有 ISI 就不需要去卷积”的解释。
  • 几何先验必须正确。 保留双向 FIR 但去掉星座得到 0.0438;错误旋转先验在无记忆场景下达到 0.1550,比无先验普通 Transformer 的 0.0628 更差。
  • 信噪比和信道长度限定收益。 表 3 中 CAT 在 \(h^{(1)}\) 的 14–26 dB 都领先;附录 C.1 显示 14 dB 时 FIR 增益最小,噪声主导时去卷积结构的相对价值下降。
  • 软输出也有收益,但仍为链路仿真。 第 5.2 节采用码率 1/2、码长 1024 的 5G NR LDPC,在目标 BLER 0.01 时相对普通 Transformer 改善 2.5 dB,ECE 从 0.089 降至 0.012,未使用温度缩放。

下面为原文表 1 的计算代价分析:\(N=256\),目标 SER 为 0.01,\(h^{(1)}\) 信道,SNR 16–24 dB;dB 增益是在相同目标 SER 下所需 SNR 的改善,不是 SER 本身减少多少 dB。

调制 星座点数 相对普通注意力的额外开销 目标 SER 下的 SNR 增益
16-QAM 16 约 13% 3.8 dB
64-QAM 64 约 56% 3.0 dB
256-QAM 256 约 300% 2.2 dB

注意力从信号长度的平方扩展到信号与星座总长度的平方,节省的是传输导频,不是接收端运算。更高阶调制的收益缩小、计算增加;I/Q 分解和廉价注意力只是附录提出的未来方向,尚未实验验证。

亮点与洞察

  • 让已知输出空间进入推断过程。 星座不是必须靠标注重新发现的潜在结构,把它作为可交互 token 有助于将学习重点转向信道变化。可迁移的原则是给模型一个正确的候选几何模板,而不是简单地多加一组 token。
  • 不同对象使用不同前馈偏置。 时间序列适合滤波,星座集合适合逐点几何细化;全局注意力与局部双向卷积互补。消融在 ISI 和无记忆条件下的差异比单独一个总体胜率更能支持这一解释。
  • 理论与训练结果必须分开阅读。 假设空间包含关系说明最优总体 MMSE 不会因可用星座信息增加而恶化;固定星座时附录 A.2 还说明两者可取相等。实际少导频收益来自结构和优化,而不是该包含关系自动证明的有限样本优势。

局限与展望

  • 适应协议而非未见信道直接泛化。 训练和测试都利用同一块的载荷观测,且块内信道固定;换信道后重新训练。没有空口、块内高移动性、HARQ 或调度层面的验证。
  • 导频不足仍会失败。 星座先验不能替代学习未知信道所需的全部信息,16 导频 ISI 结果不支持“极少导频始终更优”。
  • 冷启动代价不可忽略。 附录 C.2 在 \(h^{(1)}\)、128 导频下报告 5,000 步冷启动 SER 0.0156,50 步冷启动 0.0230,50 步 CAVIA 初始化 0.0159。后者依赖未计入适应时延的离线元训练,而且普通 Transformer 与 VAE-CNN 未做对应元训练,不能当成匹配总预算的加速胜利。
  • 时延仅为原文报告。 附录 C.3 报告单 RTX 4090、batch size 1、\(N=256\)、16-QAM 下完整训练一步为 24.5 微秒;本笔记未在本地复现,也不能把这个测量直接推广到实时部署。
  • 理论不是有限样本训练保证。 PAC-Bayes 导频效率推论是带假设的非正式论述,附录明确有限样本分离仍待证明;注意力和 FIR 的结构对齐也不保证收敛到最优接收机。
  • 缓存存在呈现与复现缺口。 第 5.3 节文字声称评估 TDL-A、TDL-C、TDL-D,但缓存表 6 只有 TDL-A、TDL-D 两行,不能补造 TDL-C 的绝对 SER;表 1 的 \(N\) 与“载荷 256”不是同一概念,计算开销不能混用长度。本文按各表条件保留这些边界。
  • QAM 的精确几何与高阶扩展仍需验证。 能量项不能由恒模推导直接忽略;动态相位跟踪的增益也来自额外 PLL 与学习旋转。显式能量偏置、统一元训练预算及高阶星座分解都值得作为后续受控实验。

相关工作与启发

  • vs VAE-CNN:沿用其导频监督加载荷 ELBO、共同学习前向信道的框架,主要变化是几何感知和时序感知编码器;不是新提出整个半监督变分均衡范式。
  • vs 普通 Transformer:相近规模下同时增加星座早期交互与双流 FIR 前馈结构。保留星座但换回 MLP,以及保留 FIR 但去掉星座,分别验证两类偏置的贡献。
  • vs CAVIA / 少导频元学习:CAVIA 从历史信道获得跨任务先验,CAT 冷启动只看当前块;二者信息预算不同。允许历史数据时可以结合,但应给各基线相同元训练机会。
  • vs DeepRx、ViterbiNet、DeepSIC:这些工作依赖离线或监督式学习协议,本文采用当前块导频加未标注载荷适应。更有意义的后续比较是把在线计算、离线数据与实际吞吐量一起计入接收机成本。

评分

  • 新颖性: 4/5。星座早期交互与对象特定双流前馈结合明确,变分学习框架继承已有工作。
  • 实验充分度: 3/5。包含消融、编码链路与标准信道仿真,但缺空口验证、统一元训练预算及完整复现细节。
  • 写作质量: 4/5。对总体容量与训练保证的区别有明确限定,缓存的 TDL-C 表格缺行仍需回查原始版式。
  • 价值: 4/5。对少导频神经均衡有可复用的结构启发,实际价值取决于在线训练时延与总计算预算。