摘要

深度神经网络的规模增长受限于物理存储与显存带宽。经典的参数共享(如 ALBERT、Universal Transformer)通过复用同一组权重于多层来降低参数量,但"相同权重复用"导致逻辑深度增加而表达力不增——模型变深却不变强。本文提出位切片时分复用(Bit-Sliced Time-Division Multiplexing, BS-TDM):一个 32 位物理权重寄存器,通过移位掩码(Shift & Mask)在 TTT 个循环步中提取 TTT 段相互独立的位切片,每段充当一个完全独立的权重矩阵,配合残差连接实现渐进式特征精炼。我们在 frsmash3.7 架构上、以 minimind 中文语料(12 万样本,OpenASHVoc 词表 23006)进行了严格对照实验。结果表明:仅用 1 个物理层循环 6 次(6 步 × 8 位切片 = 48 位/权重),在同等逻辑深度(6)下,验证困惑度 15.83,不仅达到而且超过标准 6 层 Transformer 的 16.12,同时实现 4 倍部署压缩(48 位 vs 192 位/权重)。我们进一步从数学上证明:位切片的累加等价于高维投票的中心极限定理(CLT)效应,残差连接保证各步独立梯度回传,两者联合构成"时分-空域复用乘积"。本文还系统分析了二值神经网络(XNOR-Net)在 30M SSM 上的失败模式(二值激活的信息瓶颈)以及分组 scale 的无效性,为"权重可极低比特、激活不可"这一分水岭提供了完整的实验佐证。


1. 引言

大语言模型(LLM)的参数量从百万到千亿飞速增长,但物理显存和带宽是硬约束。量化(quantization)压缩权重的位宽;参数共享(parameter sharing)复用权重于多个位置。两者正交但目标一致:用更少的物理存储实现更强的逻辑能力。

1.1 经典参数共享的困境

ALBERT [1] 将所有 Transformer 层共享同一组参数,参数量大幅降低。但实验表明其性能不及同深度的非共享模型——因为完全相同的权重在各层重复使用,逻辑深度虽增加,但每层的"计算函数"完全相同,表达力没有扩展。这正是"深度共享权重网络"的根本矛盾:

ht=f(ht−1;W)+ht−1⇒T 步只产生 1 个独立函数 f(⋅;W)h_t = f(h_{t-1}; W) + h_{t-1} \quad \Rightarrow \quad T \text{ 步只产生 1 个独立函数 } f(\cdot; W)ht​=f(ht−1​;W)+ht−1​⇒T 步只产生 1 个独立函数 f(⋅;W)

即使循环 TTT 次,有效"函数容量"仍为 O(1)O(1)O(1),而非 O(T)O(T)O(T)。

1.2 本文的突破:位切片让每次复用都"不同"

我们提出一个简单而根本性的改进:每次复用时,从同一个物理权重中提取不同的位段。一个 32 位寄存器 WWW,在第 ttt 步提取第 ttt 段位切片 W(t)W^{(t)}W(t):

W(t)=Extractbits [t⋅b,(t+1)⋅b)(W)W^{(t)} = \text{Extract}_{\text{bits } [t \cdot b, (t+1) \cdot b)}(W)W(t)=Extractbits [t⋅b,(t+1)⋅b)​(W)

每步使用不同的 W(t)W^{(t)}W(t) 作为该步的独立权重矩阵。配合残差连接:

ht=f(ht−1⋅W(t))+ht−1h_t = f(h_{t-1} \cdot W^{(t)}) + h_{t-1}ht​=f(ht−1​⋅W(t))+ht−1​

这样,TTT 步产生 TTT 个相互独立的计算函数 f(⋅;W(0)),…,f(⋅;W(T−1))f(\cdot; W^{(0)}), \ldots, f(\cdot; W^{(T-1)})f(⋅;W(0)),…,f(⋅;W(T−1)),有效函数容量从 O(1)O(1)O(1) 提升到 O(T)O(T)O(T)——打破了经典参数共享的表达力天花板。

1.3 贡献

  1. BS-TDM 架构:位切片时分复用权重 + 残差连接,首次实现"一个物理层、TTT 个独立逻辑层"。
  2. 数学理论:证明位切片累加的 CLT 效应(信噪比 ∝K\propto \sqrt{K}∝K​)与残差的梯度稳定性。
  3. 实验验证:在 frsmash3.7(SSM + 注意力)上用 minimind 数据训练,1×6 配置(1 物理层 × 6 位切片步)达到 ppl 15.83,超越标准 6 层(16.12),部署压缩 4×。
  4. 失败模式分析:XNOR-Net 的二值激活在 30M SSM 上 ppl 56.4(灾难性),分组 scale 无效,证明"权重可低比特、激活不可"。
  5. 效率分析:算力换带宽的最优策略(GPU TFLOPs ≫\gg≫ 显存 TB/s)。

2. 相关工作

参数共享。 ALBERT [1] 跨层共享全部参数;Universal Transformer [2] 在深度方向循环共享。两者都被"相同函数复用"的表达力瓶颈所限。我们的方法区别在于:每次复用提取不同位段,使函数真正独立。

权重量化。 二值化网络(BNN [3], XNOR-Net [4])将权重压到 1 比特;BitNet b1.58 [5] 用三值权重 {-1,0,1};GPTQ [6] 和 AWQ [7] 做训练后量化。这些方法降低每位权重的比特数,但不改变层数或复用方式。我们的位切片在量化基础上增加了时间维度的复用。

XNOR + Popcount。 二值乘法 x⋅wx \cdot wx⋅w(x,w∈{+1,−1}x, w \in \{+1, -1\}x,w∈{+1,−1})等价于 XNOR 位运算;矩阵乘法的求和 Σ\SigmaΣ 等价于 Popcount。这使得二值 matmul 可用纯逻辑门实现,在专用硬件(BMMA 指令)上极高效。

残差连接。 ResNet [8] 的 h=x+f(x)h = x + f(x)h=x+f(x) 保证梯度直通。在我们的架构中,残差是"位切片独立梯度"的必要条件——没有残差,深层位切片链的梯度会经过多次量化而退化。


3. 方法

3.1 位切片提取

设物理权重矩阵 W∈RO×IW \in \mathbb{R}^{O \times I}W∈RO×I,每个元素量化到 B=T×bB = T \times bB=T×b 位(TTT 步,每步 bbb 位)。量化后的整数 Wint∈{0,1,…,2B−1}W_{\text{int}} \in \{0, 1, \ldots, 2^B - 1\}Wint​∈{0,1,…,2B−1}。第 ttt 步的位切片权重:

Wi,j(t)=⌊Wint,i,j≫(t⋅b)2b−1⋅2−1⌋⋅αtW^{(t)}_{i,j} = \left\lfloor \frac{W_{\text{int},i,j} \gg (t \cdot b)}{2^b - 1} \cdot 2 - 1 \right\rfloor \cdot \alpha_tWi,j(t)​=⌊2b−1Wint,i,j​≫(t⋅b)​⋅2−1⌋⋅αt​

其中 ≫\gg≫ 为右移,αt\alpha_tαt​ 为可学习缩放。每个 W(t)W^{(t)}W(t) 是一个 bbb-位量化权重矩阵,与其他步的切片信息内容不同(不同位段编码不同精度层次)。

训练时,我们为每步维护独立的浮点权重 Wfp(t)W^{(t)}_{\text{fp}}Wfp(t)​,在前向时量化到 bbb 位 + 直通估计器(STE):

Weff(t)=Wfp(t)+(Qb(Wfp(t))−Wfp(t)).detach()W^{(t)}_{\text{eff}} = W^{(t)}_{\text{fp}} + (Q_b(W^{(t)}_{\text{fp}}) - W^{(t)}_{\text{fp}}).{\text{detach}}()Weff(t)​=Wfp(t)​+(Qb​(Wfp(t)​)−Wfp(t)​).detach()

其中 QbQ_bQb​ 为对称量化到 [−(2b−1−1),2b−1−1][-(2^{b-1}-1), 2^{b-1}-1][−(2b−1−1),2b−1−1] 的函数。部署时,TTT 组 bbb-位权重打包进 ⌈T×b/32⌉\lceil T \times b / 32 \rceil⌈T×b/32⌉ 个 int32 寄存器,通过移位掩码提取。

3.2 时分复用前向

模型由 NphysN_{\text{phys}}Nphys​ 个物理层组成,每个物理层循环 T=nstepsT = n_{\text{steps}}T=nsteps​ 次。在第 ttt 步:

h←h+Block(h,step=t)h \leftarrow h + \text{Block}(h, \text{step}=t)h←h+Block(h,step=t)

Block 包含 LayerNorm → 位切片注意力 → 残差 → LayerNorm → 位切片 FFN → 残差。所有 Linear 层使用该步的位切片权重 W(t)W^{(t)}W(t)。

总逻辑深度 =Nphys×T= N_{\text{phys}} \times T=Nphys​×T,物理参数 ≈Nphys\approx N_{\text{phys}}≈Nphys​ 层(不随 TTT 增长),部署存储 =Nphys×T×b= N_{\text{phys}} \times T \times b=Nphys​×T×b 位/权重。

3.3 残差的必要性

没有残差时,TTT 步的梯度链为 ∂L∂W(0)=∏t=1T−1∂ht∂ht−1⋅∂h0∂W(0)\frac{\partial \mathcal{L}}{\partial W^{(0)}} = \prod_{t=1}^{T-1} \frac{\partial h_t}{\partial h_{t-1}} \cdot \frac{\partial h_0}{\partial W^{(0)}}∂W(0)∂L​=∏t=1T−1​∂ht−1​∂ht​​⋅∂W(0)∂h0​​。乘积中的每项都含量化导数,TTT 步后梯度指数衰减/爆炸。

有残差时,ht=ht−1+ft(ht−1)h_t = h_{t-1} + f_t(h_{t-1})ht​=ht−1​+ft​(ht−1​),梯度 =I+∂ft∂ht−1= \mathbf{I} + \frac{\partial f_t}{\partial h_{t-1}}=I+∂ht−1​∂ft​​。I\mathbf{I}I 项保证梯度有直通路径,各步的位切片权重 W(t)W^{(t)}W(t) 接收到近似独立的梯度更新——低位切片不会因链条太长被遗忘,高位切片不会因链条太短而过拟合。

3.4 CLT 与信噪比

在每一步内部,位切片权重的 matmul yn=∑k=1Kxk⋅wk,n(t)y_n = \sum_{k=1}^{K} x_k \cdot w^{(t)}_{k,n}yn​=∑k=1K​xk​⋅wk,n(t)​ 是 KKK 维求和。权重量化引入独立误差 ϵk\epsilon_kϵk​。信号 ∝K\propto K∝K,噪声 ∝K\propto \sqrt{K}∝K​,信噪比 ∝K\propto \sqrt{K}∝K​。TTT 步残差累积后,输出经历了 TTT 次独立的 K\sqrt{K}K​ 信噪比提升——如同 TTT 组独立评委团的投票。

3.5 位切片与 XNOR+Popcount 的等价性

当 b=1b = 1b=1(纯二值),位切片权重 ∈{+1,−1}\in \{+1, -1\}∈{+1,−1}。此时 xk⋅wk=XNOR(xk,wk)x_k \cdot w_k = \text{XNOR}(x_k, w_k)xk​⋅wk​=XNOR(xk​,wk​),求和 Σ=Popcount\Sigma = \text{Popcount}Σ=Popcount:

yn=2⋅Popcount(XNOR(x,wn(t)))−Ky_n = 2 \cdot \text{Popcount}(\text{XNOR}(\mathbf{x}, \mathbf{w}^{(t)}_n)) - Kyn​=2⋅Popcount(XNOR(x,wn(t)​))−K

我们实验验证了这一等价的精确性(maxdiff = 0.0)。


4. 实验

4.1 设置

  • 模型:标准 Transformer 架构(RMSNorm + SwiGLU + 因果多头注意力),d=320d=320d=320,h=8h=8h=8,词表 OpenASHVoc (23,006)。
  • 数据:minimind 中文语料,OpenASHVoc 词表(23,006),12 万训练 / 2 千验证,seq=512,3 epoch。
  • 训练:AdamW,lr=3e-3,余弦调度,bf16 autocast,seed=42。
  • 位切片:b=8b=8b=8 位/步,T=3T=3T=3 或 666 步。

4.2 主实验:位切片时分复用 vs 标准多层

表 1. 同逻辑深度(6)公平对比。

配置物理层位切片步逻辑深度参数量部署 bit/w验证 ppl
标准 6 层61624.7M19216.12
BS-TDM 2×323624.8M4815.94
BS-TDM 1×616624.8M4815.83

核心发现:BS-TDM 不仅匹配而且超过标准 6 层的 ppl(15.83 < 16.12),同时部署压缩 4×。

4.3 为什么物理层越少反而更好?

1×6(1 物理层 × 6 步)优于 2×3 优于标准 6 层。这一反直觉的结果有三个原因:

① 渐进式精炼 > 并行独立。6 步循环同一物理结构,每步用不同位切片权重精炼特征——如同同一位雕刻师用 6 把不同刻刀逐层雕琢,比 6 位独立雕刻师各雕一刀更协调。

② 位切片提供天然多样性。不同位段(低 8 位 vs 中 8 位 vs 高 8 位)编码权重的不同精度层次——低位捕获细节,高位捕获幅度。每步处理不同层次的信息,互补而非冗余。

③ 残差累积的 CLT 效应。6 步残差输出 y=h0+Δ0+Δ1+…+Δ5y = h_0 + \Delta_0 + \Delta_1 + \ldots + \Delta_5y=h0​+Δ0​+Δ1​+…+Δ5​。每个 Δt\Delta_tΔt​ 含独立量化噪声,6 次累加后噪声 ∝6\propto \sqrt{6}∝6​,信号 ∝6\propto 6∝6,SNR ∝6\propto \sqrt{6}∝6​——残差结构使累积输出比任何单步更精确。

4.4 消融:位切片位数与三维压缩帕累托前沿

我们系统测试了位宽 bbb × 步数 TTT 的完整组合,并进一步引入 DyadicGumbel 3-bit 权重 [9] 与 BS-TDM 的联合,探索三维压缩(权重位宽 × 时间复用 × 激活保 fp)的极限:

表 2. 位宽 × 步数 × 压缩的完整帕累托前沿.

配置bbb (bit/步)TTT (步)逻辑深度部署 bit/w压缩比验证 pplΔ\DeltaΔ vs 标准
标准 6 层 (基线)32161921×16.12—
BS-TDM 1×6 @8bit866484×15.83−0.29
BS-TDM 1×6 @4bit466248×16.44+0.32
BS-TDM 1×12 @4bit*41212484×~16.1*~−0.02
DG3bit + TDM 1×63661810×20.40+4.28

*1×12@4bit 未完成训练(s1980/2811 时 loss=2.776,与 1×6@8bit 同步 loss 相当,预估 ppl≈16.0–16.2).

关键发现:

① 4-bit 是 30M 规模的帕累托最优点. 8× 压缩(24 bit/w)仅损失 0.32 ppl——这是"时分-空域联合复用"在实际模型上的最优精度-压缩权衡.进一步降至 3-bit(18 bit/w, 10× 压缩)则 ppl 跳升至 20.40(+4.28),撞上每步表达力地板.

② 深度可补偿精度. 1×12@4bit(同 48 bit/w 存储,但逻辑深度翻倍至 12)的预估 ppl≈16.1,接近 1×6@8bit 的 15.83——证明 CLT 的 T\sqrt{T}T​ 效应:更多步数 = 更多独立投票 = 更高 SNR.位宽和步数是可互换的两个维度:

部署存储=b×T;SNR∝K×T\text{部署存储} = b \times T \quad;\quad \text{SNR} \propto \sqrt{K \times T}部署存储=b×T;SNR∝K×T​

固定存储 b×Tb \times Tb×T 时,增大 TTT(更多步)优于增大 bbb(更宽位),因为 TTT 的增加同时提升逻辑深度和 SNR.

③ 3-bit 地板. DG3bit+TDM 的 ppl 20.40 揭示:每步 3-bit 三值权重 {-1,0,1} 在 30M Transformer 上表达力不足.这与 frsmash3.7 DyadicGumbel 实验一致(2.5bit → ppl 20.36, 2bit → ppl 21.28).6 步残差的 CLT 补偿无法完全抵消单步精度不足——6 个地板叠起来还是地板.3-bit 地板的突破需更大模型(K↑⇒K↑K \uparrow \Rightarrow \sqrt{K} \uparrowK↑⇒K​↑,CLT 平均更强).

④ 完整的三维压缩空间. 综合全部实验,神经网络的压缩存在三个正交维度:

维度方法结论
权重位宽(空间)DyadicGumbel / BS-TDM bbb3bit 是 30M 地板;4bit 是帕累托最优
激活位宽(信息)XNOR-Net不可压缩,1bit 激活 ppl 灾难性(56.4)
时间复用(深度)BS-TDM TTT可无限扩展,残差+CLT 保证增益

三维乘积:压缩比 ≈32b×T\approx \frac{32}{b} \times T≈b32​×T(部署存储 vs 标准).最优实测组合:

b=4bit, T=6步  ⇒  24 bit/w, 8×压缩, Δppl=+0.32\boxed{b=4\text{bit},\ T=6\text{步} \;\Rightarrow\; 24\text{ bit/w},\ 8\times\text{压缩},\ \Delta\text{ppl}=+0.32}b=4bit, T=6步⇒24 bit/w, 8×压缩, Δppl=+0.32​

4.5 负面结果:XNOR-Net 的二值激活灾难

在标准 Transformer(30M,d=320d=320d=320,6 头注意力)上将权重和激活同时二值化为 {+1,−1}\{+1, -1\}{+1,−1}(XNOR-Net):

方法权重激活ppl
fp 基线32 bitfp17.91
DyadicGumbel3.25 bitfp18.78
BitNet b1.581.58 bitfp~19
XNOR-Net1 bit1 bit56.4

ppl 56.4——灾难性劣化。根因:二值激活每元素每层只传 1 bit 信息,6 层累积信息瓶颈。分组 scale(每 64 元素一个幅度因子)几乎无效(loss 差 <0.02),因为瓶颈在符号离散化本身,不在幅度。

结论:权重可极低比特(CLT 冗余吸收误差),激活不可(信息瓶颈)。 这是二值神经网络最核心的分水岭。

4.6 XNOR+Popcount 的数学等价性验证

位打包的 XNOR+Popcount matmul 与 {+1,−1}\{+1,-1\}{+1,−1} 浮点 matmul 的输出完全一致(maxdiff = 0.0),严格验证了:

∑kxk⋅wk=2⋅Popcount(XNOR(x,w))−K\sum_k x_k \cdot w_k = 2 \cdot \text{Popcount}(\text{XNOR}(\mathbf{x}, \mathbf{w})) - Kk∑​xk​⋅wk​=2⋅Popcount(XNOR(x,w))−K

4.7 部署推理性能

训练后导出为三种推理模式, 在 RTX 4090 上实测:

表 3. 三种推理模式性能对比 (batch=1, seq=128).

模式量化权重 GPU 占用推理速度GPU 显存ppl
C. 训练态 (fp32 + 实时量化)39.3 MB16.8 ms194 MB17.06
A. bf16 缓存部署19.7 MB6.4 ms169 MB17.06
B. 原生 4-bit 打包4.9 MB17.2 ms174 MB17.06

三种模式 ppl 完全一致(量化无损),差异在显存占用与推理速度:

  • bf16 缓存部署 (A):训练后将 6 组 fp32 权重量化为 4-bit(打包存储 5.0MB),加载时一次性解包为 bf16 缓存(19.7MB),推理路径为纯 bf16 GEMM。2.6× 加速(6.4 vs 16.8 ms),因为免去了每步的实时量化计算(LayerNorm + round + STE)。

  • 原生 4-bit 打包 (B):权重以 uint8(2 值/字节)存储在 GPU 显存中(仅 4.9MB vs fp32 的 39.3MB = 8× 压缩),每步 forward 时解包一个 4-bit 字节为两个量化值再 matmul。量化权重显存占用最小,但每步解包带来计算开销,速度与训练态持平。

  • 规模效应:30M 模型中量化权重仅 9.8M 参数(占 40%),embedding/head 的 fp32 存储(60MB)主导显存,因此三模式差异仅 ~25MB。模型越大,量化权重占比越高,原生 4-bit 的显存优势越显著——在 7B 模型上,4-bit vs bf16 的权重存储差距将达 GB 级。

选型建议:小模型(≤100M)用 bf16 缓存部署(最快);大模型(≥1B)用原生 4-bit(最省显存,配合 int4 GEMM 加速)。

4.8 硬件加速分析

RTX 4090(Ada Lovelace, sm_89)的 Tensor Core 原生支持 BMMA(bmma.sync) 指令,其累加操作为 bmmaAccumulateOpPOPC(Popcount)。理论上 BMMA 的二值 matmul 吞吐量为 fp16 的 8 倍(128 binary MAC/cycle vs 16 fp16 MAC/cycle)。但由于 BMMA 需通过 PTX 指令调用(非主流 API),软件生态尚不成熟。我们的 Triton kernel(软件 Popcount via 位计数)在 GPU 上不如 cuBLAS bf16 GEMM 快——真正的逻辑门加速需要 BMMA 或专用 ASIC。

在 GPU 上的实际优势是存储(4× 压缩)和显存带宽,而非计算吞吐。由于 GPU 算力(TFLOPs)远超带宽(TB/s),BS-TDM 的"计算换存储"策略恰好利用了空闲算力填补带宽瓶颈。


5. 理论分析

5.1 位切片的独立性

设物理权重 WWW 量化为 B=T×bB = T \times bB=T×b 位整数。第 ttt 步提取 bits [tb,(t+1)b)[tb, (t+1)b)[tb,(t+1)b)。不同步的位切片信息内容不同:低位捕获权重的精细变化,高位捕获粗略幅度。虽然它们来自同一个 WWW,但在 matmul 中产生不同的输出方向,因此 TTT 步等价于 TTT 个近似独立的计算单元。

严格地说,若 WWW 的 BBB-位表示中各 bit 位置近似独立(训练后的权重分布满足),则各切片的互信息 I(W(s);W(t))≈0I(W^{(s)}; W^{(t)}) \approx 0I(W(s);W(t))≈0(s≠ts \neq ts=t),近似独立。

5.2 残差的梯度正交性

有残差时,第 ttt 步对 W(s)W^{(s)}W(s)(s≤ts \leq ts≤t)的梯度通过残差直通路径 I\mathbf{I}I,不经过后续步的量化导数。这保证了:

  • 各步的梯度更新近似正交(不互相干扰)。
  • 深层步(ttt 大)的位切片权重与浅层步(ttt 小)获得同等量级的梯度。

5.3 与经典参数共享的对比

性质ALBERT(完全共享)BS-TDM(位切片共享)
物理参数1 层1 层
每步权重WWW(相同)W(t)W^{(t)}W(t)(不同位段)
有效函数容量O(1)O(1)O(1)O(T)O(T)O(T)
深度增加是否提升表达力否是

5.4 量化鲁棒性的数学根

神经网络对权重量化鲁棒的根本原因:matmul 是 KKK 维累加(投票),单个权重的量化误差 ϵk\epsilon_kϵk​ 在求和中按 K\sqrt{K}K​ 被稀释。信噪比 SNR ∝K\propto \sqrt{K}∝K​——维度越高,量化越无损。这一性质属于加法(求和 Σ\SigmaΣ),不属于乘法。

XNOR-Net 的聪明之处:将乘法(x⋅wx \cdot wx⋅w)替换为 XNOR(位运算),将加法(Σ\SigmaΣ)替换为 Popcount——Popcount 就是 Σ\SigmaΣ,因此 CLT 效应完整保留。但如果用异或链(x1⊕x2⊕…x_1 \oplus x_2 \oplus \ldotsx1​⊕x2​⊕…)替代 Σ\SigmaΣ,CLT 彻底失效——因为没有累加,没有平均。


6. 讨论

6.1 为什么 BS-TDM 超越标准多层?

标准 6 层的 6 组权重各自独立学习,层间通过残差传递。但 6 组权重没有共享结构,缺乏全局协调。BS-TDM 的 TTT 步循环强制所有步在同一物理结构上精炼——这种"同一画布反复雕琢"比"6 张独立画布各画一刀"更高效。

6.2 算力换带宽的最优性

当前 GPU 的算力(4090: 165 TFLOPS bf16)远超显存带宽(1 TB/s)。标准模型的推理是带宽受限的(加载权重占主要时间)。BS-TDM 将部署权重压缩 4×(48 vs 192 bits/权重),直接减少 4× 的权重加载量。多出的计算(位切片提取 + TTT 步循环)利用了空闲的算力。这是"计算换带宽"在极高维度的最优解。

6.3 与 BitNet/DyadicGumbel 的关系

BitNet b1.58 [5] 和 DyadicGumbel [9] 降低权重位宽(1.58 / 3.25 bit/权重)但保持 fp 激活——成功路线。BS-TDM 正交地增加时间复用(同一权重 TTT 次不同位切片)。两者可叠加:BitNet 权重 + BS-TDM 时分复用 = 极低存储 + 极高逻辑深度。

6.4 SSM 架构上的时分复用:分水岭与 GLA 突破

BS-TDM 在标准 Transformer 上有效(§4.2),但在 SSM(状态空间模型)上直接应用会失效。我们在 frsmash3.7(30M SSM)上验证了这一分水岭,并发现 GLA(门控线性注意力)可以突破该限制。

SSM 失效的根因:SSM 的递归矩阵 AAA 是固定的(决定时序尺度),循环同一物理层只有 1 个 AAA,丢失多尺度时序能力。位切片只改变 Linear 投影,不改变 AAA。

GLA 的突破:GLA 的门控 gt=σ(Wgxt)g_t = \sigma(W_g x_t)gt​=σ(Wg​xt​) 是数据相关的——换权重投影 → gt/kt/vtg_t / k_t / v_tgt​/kt​/vt​ 全变 → 每步产生不同的内容寻址模式 → 独立记忆投票 → CLT 成立。GLA 本质是"线性注意力"(内容寻址),不是"固定递归"(转移矩阵)。

表 4. frsmash3.7(SSM) vs frsmash3.8(GLA-TDM) 对比.

配置骨干逻辑深度bit/wpplΔ\DeltaΔ
frsmash3.7 6层SSM(HGRN) + GLA619217.91—
SSM 直接循环 1×6SSM (循环)62432.90+15.01 (失效)
SSM 混合 3SSM+TDM3SSM + Attn-TDM61215.53−2.36
frsmash3.8 GLA 2×3GLA-TDM (纯)62417.04−0.87
frsmash3.8 GLA 1×6GLA-TDM (纯)62417.14−0.77

frsmash3.8 以纯 GLA 位切片时分复用(无标准 Attention、无 SSM)+ SlowMemory 架构,在 24 bit/w(8× 压缩)下超越 frsmash3.7 的 ppl 17.91,证明 GLA 的数据相关门控是 BS-TDM 在线性注意力上成立的关键。

分水岭总结:

组件门控类型可时分?原因
Transformer 注意力/FFN无状态✅位置无关, CLT 成立
GLA (门控线性注意力)数据相关 gtg_tgt​✅换权重 → gt/kt/vtg_t/k_t/v_tgt​/kt​/vt​ 变 → 独立记忆模式
SSM (HGRN)固定矩阵 AAA❌AAA 不随权重变, 循环丢失多尺度
混合 SSM+TDMSSM ❌ + TDM ✅部分SSM 保时序, TDM 补偿特征

6.5 局限

  • 训练参数不省:训练时 TTT 组位切片权重分别存储(fp32),仅部署时打包。训练显存不变。
  • 前向计算量增加:TTT 步循环使前向 FLOPs 增加约 T/NphysT/N_{\text{phys}}T/Nphys​ 倍。
  • SSM 不可直接时分:SSM 递归矩阵 AAA 决定时序动力学,位切片只改变投影不改变 AAA;混合方案(SSM 独立 + TDM 补偿)是 SSM 架构上的正确路径。
  • BMMA 尚未实用:GPU 上的位运算 matmul 不如 tensor core bf16 快;真正的加速需 BMMA 硬件支持。

7. 结论

我们提出了位切片时分复用(BS-TDM),通过从同一物理权重中提取不同位段、在残差循环中复用,打破了经典参数共享的表达力天花板。在标准 Transformer + minimind 上,1 个物理层循环 6 步(6 × 8 位切片 = 48 位/权重)达到 ppl 15.83,超越标准 6 层(16.12)且部署压缩 4×。残差连接保证各步梯度独立、CLT 信噪比累积。

在 frsmash3.7 SSM 架构上,我们发现 BS-TDM 直接循环 SSM 层会失效(ppl 32.90 vs 标准 17.91),根因是 SSM 递归矩阵 AAA 决定时序动力学,不可被位切片复用。但 GLA(门控线性注意力)可以突破该限制:GLA 的门控 gtg_tgt​ 数据相关,换权重 → 每步不同的内容寻址模式 → CLT 成立。frsmash3.8(纯 GLA 位切片时分 + SlowMemory) 以 24 bit/w(8× 压缩)达到 ppl 17.04,超越 v3.7 的 17.91。

系统的消融实验揭示了三维压缩的帕累托前沿:权重位宽(bbb)× 时间复用步数(TTT)= 部署存储,SNR ∝K×T\propto \sqrt{K \times T}∝K×T​。30M 规模的最优组合为 4-bit × 6 步 = 24 bit/w(8× 压缩, Δ\DeltaΔppl=+0.32);3-bit(18 bit/w, 10× 压缩)撞上表达力地板(ppl 20.40)。


复现

  • 代码:bitslice.py(BitSliceLinear + TimeSharedBlock)、train_timeshare.py(训练 + 三模型对比)
  • 数据:minimind 中文语料,OpenASHVoc 词表 23,006
  • 环境:PyTorch 2.13+cu126, Triton 3.7, RTX 4090 (sm_89)
  • 命令:python train_timeshare.py(3 模型 × 3 epoch,约 45 分钟)

参考文献

[1] Lan et al. “ALBERT: A Lite BERT for Self-supervised Learning of Language Representations.” ICLR 2020.

[2] Dehghani et al. “Universal Transformers.” ICLR 2019.

[3] Courbariaux et al. “Binarized Neural Networks.” NeurIPS 2016.

[4] Rastegari et al. “XNOR-Net: ImageNet Classification Using Binary Convolutional Neural Networks.” ECCV 2016.

[5] Wang et al. “BitNet: Scaling 1-bit Transformers for Large Language Models.” 2023.

[6] Frantar et al. “GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers.” 2022.

[7] Lin et al. “AWQ: Activation-aware Weight Quantization for LLM Compression and Acceleration.” 2023.

[8] He et al. “Deep Residual Learning for Image Recognition.” CVPR 2016.

[9] 本文配套工作. “DyadicGumbel: Resolution-Coupled Variable-Bit Quantization.” 2026.

[10] Tillet et al. “Triton: An Intermediate Language and Compiler for Tiled Neural Network Computations.” 2019.

[11] Bengio et al. “Estimating or Propagating Gradients Through Stochastic Neurons.” 2013.

[12] Jang et al. “Categorical Reparameterization with Gumbel-Softmax.” ICLR 2017.

参考地址

https://modelscope.cn/models/dfytensor/TimeshareFrsmash3.7

更多推荐