Geometric Inductive Biases for Semi-Supervised Equalization: The Constellation-Aware Transformer¶
会议: NeurIPS2026(任务归档;缓存为 arXiv v1,未独立核实录用)
arXiv: 2609.33695
领域: 信号处理与通信
关键词: 半监督均衡、星座几何、符号间干扰、双向 FIR、测试时训练
一句话总结¶
CAT 把已知星座点与接收信号从第一层起联合建模,并用双向 FIR 信号分支处理符号间干扰,在逐块半监督适应中减少所需导频,但这一收益依赖足够的导频与接收端训练计算,并非无监督或跨信道零样本解码。
研究背景与动机¶
接收端知道使用的是哪一种调制星座,却未必知道当前信道怎样改变这些点的位置。衰落和 I/Q 不平衡会扭曲星座,多径还会让相邻符号叠加形成符号间干扰(ISI)。导频提供已知符号与接收信号的对应关系,但每多发送一个导频,就少一个可携带有效数据的符号。传统 EM 和决策反馈式学习能够利用未标注载荷,却容易受初始化和错误硬判决影响;VAE-CNN 则把符号推断和前向信道重建联合训练,以少量导频加大量未标注载荷学习当前信道。
直接把 VAE 的编码器换成普通 Transformer,能够增加序列交互,却没有充分利用接收机已经拥有的知识。信号 token 的自注意力需要从有限样本中间接形成星座的几何参照,逐 token 的 MLP 又没有针对逆滤波的局部时序结构。本文关注的不是再增加离线标注数据,而是让每个新数据块中的导频与载荷更有效地约束模型:已知星座提供符号位置的模板,双向滤波提供适合块均衡的时间结构。
核心 idea:让接收信号与理想星座点在每一层中早期交互,并把信号的非因果去卷积与星座的几何细化分开处理,在同一半监督变分目标下学习未知信道。
方法详解¶
整体框架¶
输入是一个接收数据块,以及调制方案给定的全部理想星座点;输出是每个位置属于各个符号类别的后验概率。CAT 替换半监督 VAE 中的推断编码器,前向信道生成解码器仍与基线共用。这里的 VAE 解码器负责重建接收信号,不是最终把接收信号判成比特的通信解码器。
数据块包含已知导频和未知载荷。信号与星座分别投影到相同隐藏维度,信号加入固定正弦位置编码,而星座作为集合不加入位置编码。随后经过 3 个 TransFIRmer 块:每块先对全部信号与星座做联合双向注意力,再对两类 token 应用不同的前馈分支,最终读出信号位置的符号后验。
训练时,这个后验与前向信道生成解码器一起利用导频监督和载荷重建;推理时,已适应的 CAT 输出符号后验供硬判决或软比特解码使用。下图实线表示推断数据流,虚线表示仅用于适应的监督与生成训练分支。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["接收数据块 + 理想星座"] --> B["星座联合注意力"]
B --> C["双流 TransFIRmer"]
C -->|同一块内重复 3 层| D["逐位置符号后验"]
D --> E["硬判决 / 软比特输出"]
D -.-> F["半监督信道重建"]
G["导频标签 + 接收观测"] -.-> F
F -.->|仅训练更新| B
关键设计¶
1. 星座联合注意力:用已知几何模板参与每一层的信号推断
普通 Transformer 只对接收信号进行自注意力,CAT 则把全部 \(N\) 个信号 token 和 \(K\) 个理想星座 token 拼接为一段长度 \(N+K\) 的序列。查询、键和值均由这个完整序列产生,因此不只是“信号查询一个固定星座字典”:信号之间、星座之间以及两类之间都可以交互,星座表示也会随当前数据块更新。本文采用完整双向掩码,因为块均衡是利用前后观测的平滑问题,而不是必须逐符号输出的自回归预测。
这种早期交互让模型从第一层就知道每个候选符号的理想位置,再通过当前块学习它们如何被信道扭曲。即使信道无记忆,整块注意力仍有意义:同一个数据块共享衰落系数和 I/Q 不平衡,因此其他位置能够帮助识别共同的失真。不给星座添加位置编码,是因为星座点的几何坐标有物理意义,但输入列表中的先后顺序没有额外物理意义。
作者将信号—星座相关性与匹配滤波联系起来。附录 A.3 的高斯后验展开可简写为下面的归一化关系,其中 \(\mathbf z\) 是高斯噪声下的观测,\(\mathbf c_k\) 是候选星座点;这说明相关性项为何有用,也说明何时不能只保留点积。
对于恒模星座,候选点能量项相同,归一化时可以消去;对于 QAM,内点和角点能量不同,这一项不能消去。所以“注意力等于高斯后验”不是适用于所有 QAM 的无条件恒等式。附录报告训练后隐式能量归一化把偏差从 0.95 nats 降至 0.04 nats,但这是实验观测,而不是一般性的精确后验保证。
2. 双流 TransFIRmer:让时序去卷积与星座几何细化各用合适的运算
ISI 的困难在于某个接收位置混入了多个发送符号;把每个信号 token 单独过 MLP,不会直接提供逆滤波所需的相邻位置运算。TransFIRmer 因而把标准前馈网络拆成两路:信号路使用正向和反向的一维卷积,星座路保留 MLP。信号路先按原序列卷积,再把另一份序列翻转后卷积并翻转回来,将两者相加;两条 token 流各自具有残差连接。
双向不是装饰:块 MMSE 均衡需要利用当前位置前后两侧的信息,反向支路提供非因果滤波的结构偏置。理想星座点并不是按时间排列的序列,因此对它们卷积反而引入不必要的顺序假设;并行 MLP 用来细化其几何表示。联合注意力继续交换两路信息,所以这不是彼此独立训练的两个均衡器。
附录 F.1 给出的实际配置是 3 层、隐藏维度 10、单头 Multi-Query Attention,两向卷积的核大小均为 12,星座 MLP 的单个隐藏层宽度为 10,dropout 为 0.1。理论上,注意力可承载匹配相关与白化的表示,双向卷积可逼近块 Wiener 接收机的非因果滤波结构;这些是表达能力与归纳偏置的论证,不意味着训练必然求出精确 Wiener 解,也不意味着非线性信道下它就是最优接收机。
3. 半监督信道重建:用载荷约束未知信道,但保留导频的符号锚定
仅有星座模板还不知道当前信道如何改变它。CAT 输出符号后验,生成解码器再从候选发送符号预测接收观测;如果符号推断和信道模型能共同解释大量未标注载荷,导频的少量标签就可以发挥更大作用。导频还直接训练符号分类,因此这不是纯无监督聚类,也不是把模型的硬伪标签当真值后反复训练。
无记忆信道的生成解码器是隐藏层宽度为 64、32、16 的 MLP,预测高斯观测的均值与方差。ISI 版本先用隐藏维度 32 的两层 MLP 表示无记忆失真,再用长度 12 的可学习复数 FIR 表示传播信道,并学习噪声方差。这条训练用的前向 FIR 与 CAT 信号分支中的双向逆滤波不是同一个模块:一个解释信道怎样生成观测,另一个帮助从观测恢复符号。
一个完整示例¶
考虑主实验中 16-QAM、64 个导频和 256 个载荷符号的 \(h^{(1)}\) 数据块。按第 2 节的定义,\(N\) 包括导频与载荷,因此这里共有 320 个信号位置,再加入 16 个理想星座点;联合注意力处理 336 个 token。这个计算只是在解释定义,不是另一个实验结果。
导频位置提供 64 个已知符号类别,载荷位置没有类别标签。每个 TransFIRmer 块先让 336 个 token 共同交互,再分别对 320 个信号位置做双向卷积、对 16 个星座位置做 MLP。经过 3 层后,信号位置输出 16 类后验;生成解码器依据这些潜在符号解释整个接收块。
优化结束后,在这个同一数据块的 256 个载荷符号上计算 SER。它衡量的是当前块的适应效果,不能改称对一个未见信道的直接泛化效果;下一块信道变化时,需要重新适应。
损失函数 / 训练策略¶
式(2)的三个组成部分分别为导频分类交叉熵、导频观测负对数似然和载荷负 ELBO。为避免把无记忆情况下逐位置写法误当成 ISI 的独立观测假设,这里用各自已归一化的平均损失记号概括原目标:
导频两项按导频数归一化,载荷项按载荷数归一化;负 ELBO 包含后验下的负重建对数似然,以及符号后验相对均匀符号先验的 KL 项。ISI 编码器条件化于整个接收序列,生成解码器也显式建模序列卷积,不能把每个观测都视为仅由当前符号生成。附录 E 使用单样本近似与 Gumbel-Softmax 保持可微。
默认冷启动协议在每个块上从随机初始化训练 5,000 步,训练只使用该块导频和未标注载荷,SER 也在同一载荷上测量。这属于传导式测试时适应;不使用载荷真标签,也不使用其他信道实例的数据。CAVIA 基线及元初始化实验是明确例外,它们使用过去信道的离线训练信息。
AdamW 初始学习率为 0.001,权重衰减为 0.01,学习率线性降至零,小批量包含 16 个导频符号和 32 个载荷符号。分类权重为 0.2;生成监督权重逐渐退火,把重点转向载荷,Gumbel-Softmax 温度最低降至 0.5,两种退火均每 100 步更新。附录没有完整展开小批量采样与全块注意力如何结合,实现复现时需要核实,不能据这些描述自行补出代码细节。
实验关键数据¶
主实验¶
以下为原文表 2 的选取行:16-QAM,\(E_x/N_0=17\) dB,载荷 256;SER 是错误符号占评估符号的比例,越低越好。每种方法使用当前块进行适应,报告 1,000 次独立 Monte Carlo 试验的平均值;最优项是已知信道的参考解码器,不是同等信息条件下的可部署基线。
| 信道 | 导频数 | VAE-CNN SER | 普通 Transformer SER | CAT SER | 最优 SER |
|---|---|---|---|---|---|
| \(h^{(1)}\),5 taps | 16 | 0.2900 | 0.3392 | 0.3580 | 0.0121 |
| \(h^{(1)}\),5 taps | 64 | 0.0523 | 0.0610 | 0.0198 | 0.0121 |
| \(h^{(1)}\),5 taps | 128 | 0.0494 | 0.0290 | 0.0156 | 0.0121 |
| \(h^{(2)}\),4 taps | 64 | 0.1002 | 0.0750 | 0.0340 | 0.0101 |
| \(h^{(2)}\),4 taps | 128 | 0.0869 | 0.0888 | 0.0257 | 0.0101 |
| \(h^{(3)}\),10 taps | 64 | 0.1709 | 0.1692 | 0.1181 | 不可计算 |
| \(h^{(3)}\),10 taps | 128 | 0.1087 | 0.1022 | 0.0846 | 不可计算 |
在前两个信道上,CAT 的 64 导频结果分别低于两种基线的 128 导频结果;10-tap 信道上仍有优势,但不能据此宣称同样能把导频减半。最少导频也不是始终获胜:在 \(h^{(1)}\) 的 16 导频条件下,CAT 比两个学习基线都差。原文的“三个 ISI 信道均优于基线”需要限定为至少 32 个导频。
消融实验¶
原文表 4 的两个条件不同:无记忆为 16 导频、64 载荷、22 dB;ISI 为 \(h^{(1)}\)、64 导频、256 载荷、17 dB。无记忆列保留原文给出的 95% 置信区间,未报告不补造;横向两列不是同一难度下的绝对比较。
| 配置 | 无记忆 SER | ISI SER | 说明 |
|---|---|---|---|
| 完整 CAT | 0.0599 ± 0.0005 | 0.0198 | 联合注意力与双向 FIR |
| 去掉反向 FIR | 0.0608 ± 0.0005 | 0.0287 | 信号只保留正向卷积 |
| FIR 换为 MLP | 0.0615 ± 0.0006 | 0.0351 | 保留星座与联合注意力 |
| 去掉星座、保留双向 FIR | 未报告 | 0.0438 | 隔离几何先验的作用 |
| 普通 Transformer | 0.0628 ± 0.0007 | 0.0610 | 仅信号自注意力 |
| 星座先验旋转 45 度 | 0.1550 ± 0.0015 | 未报告 | 错误几何参照 |
| 星座也加位置编码 | 0.0631 | 0.0224 | 引入集合的人工顺序 |
关键发现¶
- 收益来自适合任务的结构,而非仅增加输入。 去掉反向 FIR 后 ISI SER 从 0.0198 升至 0.0287,完全换成 MLP 则升至 0.0351;相应无记忆变化较小,符合“没有 ISI 就不需要去卷积”的解释。
- 几何先验必须正确。 保留双向 FIR 但去掉星座得到 0.0438;错误旋转先验在无记忆场景下达到 0.1550,比无先验普通 Transformer 的 0.0628 更差。
- 信噪比和信道长度限定收益。 表 3 中 CAT 在 \(h^{(1)}\) 的 14–26 dB 都领先;附录 C.1 显示 14 dB 时 FIR 增益最小,噪声主导时去卷积结构的相对价值下降。
- 软输出也有收益,但仍为链路仿真。 第 5.2 节采用码率 1/2、码长 1024 的 5G NR LDPC,在目标 BLER 0.01 时相对普通 Transformer 改善 2.5 dB,ECE 从 0.089 降至 0.012,未使用温度缩放。
下面为原文表 1 的计算代价分析:\(N=256\),目标 SER 为 0.01,\(h^{(1)}\) 信道,SNR 16–24 dB;dB 增益是在相同目标 SER 下所需 SNR 的改善,不是 SER 本身减少多少 dB。
| 调制 | 星座点数 | 相对普通注意力的额外开销 | 目标 SER 下的 SNR 增益 |
|---|---|---|---|
| 16-QAM | 16 | 约 13% | 3.8 dB |
| 64-QAM | 64 | 约 56% | 3.0 dB |
| 256-QAM | 256 | 约 300% | 2.2 dB |
注意力从信号长度的平方扩展到信号与星座总长度的平方,节省的是传输导频,不是接收端运算。更高阶调制的收益缩小、计算增加;I/Q 分解和廉价注意力只是附录提出的未来方向,尚未实验验证。
亮点与洞察¶
- 让已知输出空间进入推断过程。 星座不是必须靠标注重新发现的潜在结构,把它作为可交互 token 有助于将学习重点转向信道变化。可迁移的原则是给模型一个正确的候选几何模板,而不是简单地多加一组 token。
- 不同对象使用不同前馈偏置。 时间序列适合滤波,星座集合适合逐点几何细化;全局注意力与局部双向卷积互补。消融在 ISI 和无记忆条件下的差异比单独一个总体胜率更能支持这一解释。
- 理论与训练结果必须分开阅读。 假设空间包含关系说明最优总体 MMSE 不会因可用星座信息增加而恶化;固定星座时附录 A.2 还说明两者可取相等。实际少导频收益来自结构和优化,而不是该包含关系自动证明的有限样本优势。
局限与展望¶
- 适应协议而非未见信道直接泛化。 训练和测试都利用同一块的载荷观测,且块内信道固定;换信道后重新训练。没有空口、块内高移动性、HARQ 或调度层面的验证。
- 导频不足仍会失败。 星座先验不能替代学习未知信道所需的全部信息,16 导频 ISI 结果不支持“极少导频始终更优”。
- 冷启动代价不可忽略。 附录 C.2 在 \(h^{(1)}\)、128 导频下报告 5,000 步冷启动 SER 0.0156,50 步冷启动 0.0230,50 步 CAVIA 初始化 0.0159。后者依赖未计入适应时延的离线元训练,而且普通 Transformer 与 VAE-CNN 未做对应元训练,不能当成匹配总预算的加速胜利。
- 时延仅为原文报告。 附录 C.3 报告单 RTX 4090、batch size 1、\(N=256\)、16-QAM 下完整训练一步为 24.5 微秒;本笔记未在本地复现,也不能把这个测量直接推广到实时部署。
- 理论不是有限样本训练保证。 PAC-Bayes 导频效率推论是带假设的非正式论述,附录明确有限样本分离仍待证明;注意力和 FIR 的结构对齐也不保证收敛到最优接收机。
- 缓存存在呈现与复现缺口。 第 5.3 节文字声称评估 TDL-A、TDL-C、TDL-D,但缓存表 6 只有 TDL-A、TDL-D 两行,不能补造 TDL-C 的绝对 SER;表 1 的 \(N\) 与“载荷 256”不是同一概念,计算开销不能混用长度。本文按各表条件保留这些边界。
- QAM 的精确几何与高阶扩展仍需验证。 能量项不能由恒模推导直接忽略;动态相位跟踪的增益也来自额外 PLL 与学习旋转。显式能量偏置、统一元训练预算及高阶星座分解都值得作为后续受控实验。
相关工作与启发¶
- vs VAE-CNN:沿用其导频监督加载荷 ELBO、共同学习前向信道的框架,主要变化是几何感知和时序感知编码器;不是新提出整个半监督变分均衡范式。
- vs 普通 Transformer:相近规模下同时增加星座早期交互与双流 FIR 前馈结构。保留星座但换回 MLP,以及保留 FIR 但去掉星座,分别验证两类偏置的贡献。
- vs CAVIA / 少导频元学习:CAVIA 从历史信道获得跨任务先验,CAT 冷启动只看当前块;二者信息预算不同。允许历史数据时可以结合,但应给各基线相同元训练机会。
- vs DeepRx、ViterbiNet、DeepSIC:这些工作依赖离线或监督式学习协议,本文采用当前块导频加未标注载荷适应。更有意义的后续比较是把在线计算、离线数据与实际吞吐量一起计入接收机成本。
评分¶
- 新颖性: 4/5。星座早期交互与对象特定双流前馈结合明确,变分学习框架继承已有工作。
- 实验充分度: 3/5。包含消融、编码链路与标准信道仿真,但缺空口验证、统一元训练预算及完整复现细节。
- 写作质量: 4/5。对总体容量与训练保证的区别有明确限定,缓存的 TDL-C 表格缺行仍需回查原始版式。
- 价值: 4/5。对少导频神经均衡有可复用的结构启发,实际价值取决于在线训练时延与总计算预算。