模型适配 · 新被试;次日实验暂缓发布

新被试、第二天:预训练模型该更新哪一部分?

预训练编码器遇到没见过的被试、而任务是它已适配过的任务时,该更新哪一部分:只训分类头、最后一个 Transformer 块,还是低秩适配器(LoRA)——三种方式的检查点、数据划分、初始分类头、批次和训练 5 轮的配方都相同。同一问题的次日版本也已运行;它的数据源处于暂缓状态,所以只列出、不给数字。

测量所用数据集:EEGMAT · 方法:LaBraM

简答

新被试、同一任务、不使用测试被试的任何标签:LaBraM Base 区分心算与静息,36 名被试按被试不重叠分成 5 折;连同分类头更新最后一个 Transformer 块,平衡准确率达到 65.7%,秩为 4 的 LoRA 为 64.1%,只做短训练的分类头为 56.6%;LoRA 减最后一个 Transformer 块的区间跨过零,所以无法说明哪一个更好。只训分类头的结果并不是冻结编码器能达到的最好结果:核心矩阵中同一批被试、同一数据划分上的冻结 LaBraM 配岭回归分类头,得分 64.6%,但分类头不同,也不是配对比较。第二天的问题这里没有回答:该实验已运行,但数据源处于暂缓状态,所以不发布它的任何数字。

新被试、同一任务、不使用测试被试的任何标签 · 2026 年 10 月 1 日审核

基础模型怎么适配:只训分类头、最后一个 Transformer 块(block)还是 LoRA?

LaBraM Base 在 EEGMAT 上区分心算与静息:36 名被试,按被试不重叠分成 5 折,所以每个分数都来自模型适配时没见过的人,也不使用测试被试的任何标签。三种更新方式从同一个分类头出发,以相同顺序看到相同的批次,都训练 5 轮(epoch)。3 个随机种子先在每名被试内平均,再求队列均值。

只训分类头 · 编码器冻结

56.6%
平衡准确率 56.6%

宏平均 F1 54.6% · 可训练参数 402 个

95% 区间 54.2%–59.0%

最后一个 Transformer 块 + 分类头

65.7%
平衡准确率 65.7%

宏平均 F1 62.3% · 可训练参数 482,882 个

95% 区间 61.6%–69.7%

秩为 4 的 LoRA + 分类头

64.1%
平衡准确率 64.1%

宏平均 F1 60.5% · 可训练参数 38,802 个

95% 区间 60.2%–67.8%

作为参照:核心矩阵中同一批被试、同一数据划分上的冻结 LaBraM,配上在标准化特征上闭式求解的岭回归分类头,平衡准确率为 64.6%(核心矩阵发布,experiments.json)。这里「只训分类头」那一组是在未缩放特征上只训 5 轮的短训练分类头——并不是冻结编码器能达到的最好结果——两者也不是配对比较。

+7.5 ppLoRA 减只训分类头,同一批被试(pp 为百分点)

LoRA 胜过短训练的分类头,但没有胜过最后一个 Transformer 块

36 名被试中 30 人提升、6 人变差;配对区间 +4.8 至 +10.1 pp。改为更新最后一个 Transformer 块,提升 +9.1 pp(+6.0 至 +12.2 pp)。LoRA 减最后一个 Transformer 块为 −1.6 pp,区间 −4.4 至 +1.0 pp:跨过零,所以无法说明哪一个更好。17 人用 LoRA 更好,19 人用最后一个 Transformer 块更好。

同样 36 名被试在两种方式下的被试平均分数之差 · 描述性被试 bootstrap 95% 区间 · 提升、变差与不变的人数。
比较平衡准确率宏平均 F1
LoRA − 只训分类头+7.5 pp+4.8 至 +10.1 pp30 人提升 · 6 人变差 · 0 人不变+5.9 pp+2.7 至 +9.0 pp22 人提升 · 14 人变差 · 0 人不变
最后一个 Transformer 块 − 只训分类头+9.1 pp+6.0 至 +12.2 pp30 人提升 · 5 人变差 · 1 人不变+7.7 pp+4.4 至 +11.2 pp27 人提升 · 9 人变差 · 0 人不变
LoRA − 最后一个 Transformer 块−1.6 pp−4.4 至 +1.0 pp17 人提升 · 19 人变差 · 0 人不变−1.9 pp−5.0 至 +1.1 pp15 人提升 · 21 人变差 · 0 人不变

在宏平均 F1 上提升更小,LoRA 相对只训分类头帮到的人也比平衡准确率上少:指标的选择会影响结论。

每种方式的代价

训练时间为 15 次拟合(5 折 × 3 个随机种子)之和,在一台 Apple 芯片 Mac 上用 PyTorch MPS 后端测得,不含加载与评测。
更新方式可训练参数训练时间,15 次拟合平衡准确率,逐个随机种子
只训分类头 · 编码器冻结40251.5 s56.9% · 56.4% · 56.5%
最后一个 Transformer 块 + 分类头482,88265.3 s65.7% · 65.7% · 65.7%
秩为 4 的 LoRA + 分类头38,802128.2 s64.4% · 65.1% · 62.7%

LoRA 可训练的权重比最后一个 Transformer 块少得多,但这里训练反而更久:它的适配器分布在全部 12 个 Transformer 块中,梯度要反传经过编码器的大部分;而且这里的实现是等效权重参数化,不是优化过的低秩算子。可训练权重少,本身并不意味着更省时间或内存。

路线图上承诺、但这一批没有给出的:峰值内存(只记录了下界采样,因此不发布);以及固定计算预算下的比较(各方式训练的是相同的 5 轮,而不是相同的计算量)。

次日 · 只发状态

同一个人,第二天:已运行,不发布

在某一天拟合的模型,换一天还管不管用、不管用时该更新哪一部分——这里还没有公开的数字。为它准备了两个数据源;出于不同的原因,两者都不能公开评分。

两个记录日:已运行并通过复核,暂缓发布

BNCI2015-001:12 名被试,每人记录两天。每名被试的模型用第一天训练,用第二天最前面的 0、10、20 或 40 个有标签的校准试次、以同样三种更新方式校准,再在第二天同一批后续试次上测试。与上面的结果不同,这个设计要用到测试被试本人的标签:用其第一天的试次训练,并且(零预算时除外)用其第二天最前面的试次校准。它已于 9 月 22 日运行,并通过了独立复核。该数据源的编辑暂缓仍然有效——目录标注的许可是 CC BY-NC-ND,数据说明也没有写伦理批准——所以不发布它的任何数字。

同一个人,之后的会话:只发状态

Stieger 纵向 BCI:获取的是一名被试的 11 次会话,而不是完整的数据集。公开的只有一点:加载程序和按时间顺序的划分(较早的会话训练、较晚的会话测试)在它上面可以运行。只有一个人时,任何分数都是这个人的分数,所以不发布;该数据源在9 月 27 日的发布中只列状态。

刻意分开的四个问题

新被试、新的一天、新数据集、新设备是四个不同的问题,要用不同的数据回答。在多名被试上训练出的任务适配器,并不能证明它能跨设备迁移。

一个相关的问题如今在另一份数据上有了两个经典基线的实测答案:同一个人的下一次会话,加入或不加入少量该会话的校准试次。见「EEG 解码器需要多少校准数据?」。

方法与局限

这个结果不是什么

一个固定的配方、三种更新方式、3 个随机种子,用在模型已适配过的任务的新被试上。它描述的是这个配方在这些被试上的表现,不是各更新方式的排名。

一个配方,不是调参后的排名

5 轮,AdamW,学习率 1e-4,批大小 32;没有超参搜索、验证集、早停或检查点挑选。换一个学习率或训练预算,各方式的先后可能改变。

新被试,不是新的一天或新设备

数据划分留出的是被试,任务是模型已经适配过的任务。这里没有测量新的记录日、新的头戴设备或新的数据集。

已公开的数据集

EEGMAT 是公开数据,它是否在 LaBraM 的预训练数据中,无法证实。

描述性区间

先在每名被试内平均 3 个随机种子,再做被试 bootstrap。它没有计入共享交叉验证模型带来的相关性。

适配器的大小

LaBraM 基础编码器有 5,819,936 个参数。对它的 12 个融合 QKV 权重做秩为 4 的更新,增加 38,400 个可训练参数(0.66%);加上 402 个参数的分类头,就是上面的 38,802 个。适配器张量以 float32 存储约 150 KiB(不含元数据)。

在任何真实 EEG 运行之前通过的工程检查: 适配器保存与重载后完全一致;合并权重后输出完全等价;每个 Transformer 块的适配器梯度有限且非零;更新后冻结编码器的权重保持不变;适配器零初始化时输出完全不变。

这些是参数计数,不代表准确率、速度、内存节省或隐私方面的任何结论。

这个问题已有前人研究

已有其他工作在评测 EEG 适配器:OpenEEGBench 覆盖 EEG 基础模型的参数高效微调;一项关于测试时适配的系统研究报告了分布偏移下时好时坏的收益;一篇近期预印本比较了固定计算预算下的自监督适配。我们的侧重点是校准成本、变差的情况,以及记录条件本身是否兼容。

EEGMAT · LaBraM adaptation, three matched update rules

Igor Zyma, Ivan Seleznov, Anton Popov, Mariia Chernykh, Oleksii Shpenkov · EEG During Mental Arithmetic Tasks 1.0.0, PhysioNet, doi:10.13026/C2JQ1P. Study: Zyma et al. (2019), doi:10.3390/data4010014. PhysioNet platform: Pollard et al. (2026), doi:10.1038/s44360-026-00096-z.

Open Data Commons Attribution License 1.0 · 仅发布聚合结果;本次适配沿用 2026-09-20 对这些记录的审查。

数据集记录 ↗

Stieger longitudinal BCI · one-person pilot

James R. Stieger, Stephen A. Engel and Bin He · Continuous sensorimotor rhythm based brain computer interface learning in a large population, Scientific Data 8, 98 (2021); data at doi:10.6084/m9.figshare.13123148.v1.

CC-BY-4.0 · 只发状态:不发布这个数据源的任何数字。

数据集记录 ↗

数据来源: adaptation-update.json · schema bci-report-adaptation-update-v1 · 生成于 2026-10-01。

数据来源: evidence-update.json · 适配器的参数计数与检查,来自 9 月 22 日发布的工程检查。

引用本页

BCI Report. 新被试、第二天:预训练模型该更新哪一部分?[EB/OL]. (2026-10-01). https://bci.report/zh/topics/model-adaptation/

数字来自发布 adaptation-update-20261001(2026-10-01)、evidence-update-20260922(2026-09-22)、research-preview-20260920(2026-09-20)。也请同时引用上游数据集:署名就在本页。

每个发布版本都在 Zenodo 存档:doi:10.5281/zenodo.23123296。 本站及各次发布的 BibTeX → · CITATION.cff ↗(英文)