纳入的队列记录
Main 9 条(共 14 条),Transfer Learning 14 条(共 14 条)。这是记录数,不能证明是不同的人。
跨会话迁移 · 同一被试,不使用后一次会话的标签
三个数据集、四项结果,逐项分开看。跨记录会话的运动想象:分类头用较早会话拟合的冻结 CBraMod,在两个队列中都高于频谱基线。后续访次上的目标检测:第一次访次训练的解码器,到最后一个标称访次时对目标的排序变差,平均精确率也更低。连续光标追踪:每一条纳入记录上,固定解码器都不如一个常数基线。
测量所用数据集:WBCIC-SHU motor imagery dataset、Longitudinal ERP dataset (RSVP)、Forenzo & He continuous-tracking EEG-BCI dataset · 方法:CBraMod
部分管用,而且每项结果都要单独看。WBCIC-SHU 运动想象——用每名被试的第 1 次记录会话训练、在第 3 次会话上测试,不使用第 3 次会话的任何标签;二分类队列 51 名被试、三分类队列 11 名被试,分开分析——分类头用第 1 次会话拟合的冻结 CBraMod,平衡准确率分别为 67.7% 和 51.6%,比相对频谱功率 + 岭回归(relative spectral ridge)高 +13.8 pp 和 +14.0 pp(pp 即百分点),两个配对区间都在零以上。它需要这名被试较早会话的标签,所以是同一被试的跨会话迁移,不是给新被试解码,也不能说明提升来自预训练。纵向 RSVP 任务上,15 名被试各自在第一次访次训练的解码器,在发布者标称的第 7 天访次上,对目标排序的 AUROC 为 0.888,在标称第 200 天为 0.853,配对变化 −0.035(−0.065 至 −0.006);目标事件只占约 2.5%,平均精确率从 0.359 降到 0.240。标称的访次标签不能把这两项下降归因于时间流逝。连续光标追踪中,用每条记录最早会话训练的固定 spectral ridge,在最晚会话上的总体误差高于一个常数的源会话均值对照——两个队列、两种响应变量下的每一条纳入记录都是如此:这是一个阴性结果,并且上尾极重。
WBCIC-SHU · 运动想象 · 第 1 次会话到第 3 次会话
被试想象左手或右手运动(二分类队列,51 名被试),或者在另一个独立的三分类队列中(11 名被试)再加上脚部动作,共记录三次会话。每名被试完整的第 1 次会话用于训练解码器,第 3 次会话用于测试;第 2 次会话不使用,也不使用第 3 次会话的任何标签。会话编号只是记录会话的序号,不保证固定的时间间隔,也不保证在不同的日子。两个队列分开分析,从不平均。
| 解码器 | 二分类运动想象 · 51 名被试左手或右手 | 三分类运动想象 · 11 名被试左手、右手或脚 |
|---|---|---|
| 源会话多数类先验预测第 1 次会话中最常见的类别:一个下限,不是模型 | 50.0%准确率 50.0% · 宏平均 F1 33.3% | 33.3%准确率 33.3% · 宏平均 F1 16.7% |
| 相对频谱功率 + 岭回归固定的 CPU 基线 | 53.9%95% 区间 52.7%–55.1%准确率 53.9% · 宏平均 F1 49.7% | 37.6%95% 区间 35.4%–40.0%准确率 37.6% · 宏平均 F1 34.1% |
| CBraMod · 冻结编码器,分类头用第 1 次会话拟合只拟合分类头,不训练编码器 | 67.7%95% 区间 64.8%–70.5%准确率 67.7% · 宏平均 F1 66.9% | 51.6%95% 区间 45.2%–58.3%准确率 51.6% · 宏平均 F1 50.5% |
| 解码器 | 二分类运动想象 · 51 名被试 | 三分类运动想象 · 11 名被试 |
|---|---|---|
| spectral ridge 减源会话先验 | +3.9 pp95% 区间 +2.7 至 +5.1 pp区间在零以上。 | +4.3 pp95% 区间 +2.1 至 +6.6 pp区间在零以上。 |
| 冻结 CBraMod 减 spectral ridge | +13.8 pp95% 区间 +11.3 至 +16.4 pp区间在零以上。 | +14.0 pp95% 区间 +7.5 至 +20.8 pp区间在零以上。 |
配对区间 +11.3 至 +16.4 pp。在人数较少的三分类队列中,差值为 +14.0 pp(+7.5 至 +20.8 pp)。CBraMod 这一组是在频谱结果出来之后才冻结的,并复用了同样的测试试次:这是一次比较性的后续分析,不是全新的测试集。没有结构相同的随机初始化对照,两种特征空间的维度与预处理也不同(相同的岭回归 alpha 并不能使两者的正则化程度相当),这个检查点的预训练数据中是否出现过 WBCIC-SHU 也没有确定,所以这个差值比较的是两条流程,不能说明它来自预训练。分类头用每名被试第 1 次会话的标签训练:不使用第 3 次会话的标签,并不等于能给新被试解码。
试次:二分类队列训练 10,199 个、测试 10,195 个;三分类队列训练 3,299 个、测试 3,300 个;没有排除任何被试或试次。186 条会话记录中有 6 条的试次数少于发布者标称的数量(实际 40,490 个,标称 40,500 个);其中 3 条在所用的会话中,按经过审查的可变试次数规则纳入,不补齐、不截断,也不按表现剔除;原先按严格计数设置的暂缓仍保留在记录中。缺失试次的原因不明。
纵向 RSVP · 目标检测 · 第一次访次训练的解码器
同一被试、离线的 RSVP 分类;访次为发布者的标称标签;不对目标会话做任何适配。Same-person, offline RSVP classification; publisher nominal visit labels; no target-session adaptation.
在快速序列视觉呈现(RSVP)中,屏幕上连续呈现人脸图像,解码器要找出其中少见的目标。15 名被试(数据源中的 A 组)在发布者标为第 1、7、80、200 天的访次上记录。每名被试的解码器只用其第一次访次训练和校准,之后原样在每个后续访次上评分:每个访次 15 名被试合计 72,000 个事件。
解码器:Normalized ERP features + logistic/Platt (CPU baseline)(归一化 ERP 特征 + logistic/Platt,CPU 基线)。
| 指标 | 标称第 7 天 | 标称第 80 天 | 标称第 200 天 |
|---|---|---|---|
| AUROC衡量排序,0 到 1;不是准确率 | 0.88895% 区间 0.864–0.911 | 0.87995% 区间 0.854–0.903 | 0.85395% 区间 0.827–0.879 |
| 平均精确率0 到 1;不是某个阈值下的精确率 | 0.359 | 0.310 | 0.240 |
| 对数损失每个事件,自然对数;越低越好 | 0.154 | 0.114 | 0.164 |
| Brier 分数越低越好 | 0.029 | 0.027 | 0.038 |
| ECE,10 个分箱期望校准误差;越低越好 | 0.023 | 0.020 | 0.039 |
| 目标事件占该访次全部事件 | 1,794 个(共 72,000 个)2.5% | 1,786 个(共 72,000 个)2.5% | 1,793 个(共 72,000 个)2.5% |
| 实际呈现的事件受保护的评分接口不提供此计数 | 不可得(空值,不是零) | 不可得(空值,不是零) | 不可得(空值,不是零) |
配对区间 −0.065 至 −0.006,在零以下。15 名被试中有 6 人下降了 0.05 AUROC 及以上。平均精确率也更低:标称第 7 天为 0.359,第 200 天为 0.240。这描述的是这一队列和这一解码器,不能说明变化是由时间流逝造成的。
标签编码:论文和发布者的示例脚本都把 1 记为非目标、2 记为目标,而数据发布中的 Trigger.txt 正好相反。这里遵循论文和脚本,这一优先顺序在建模之前就已确定;这处矛盾保留在明处。
连续光标追踪 · 阴性结果
离线、同一被试、不对目标会话做任何适配。Offline, same-person, no target-session adaptation
被试用运动想象控制光标,追踪一个在屏幕上连续移动的目标;发布者把数据分为 Main 与 Transfer Learning 两个队列。对每条纳入记录,固定的 spectral ridge 用最早一次完整记录会话中所有符合条件、非 chance 的 run 训练,在最晚一次会话上测试,不使用该会话的任何标签,并与源会话均值对照比较:即最早会话的平均响应,对每一行都重复使用。解码器在较晚的会话上能胜过这个常数吗?这里没有。
纳入的队列记录
Main 9 条(共 14 条),Transfer Learning 14 条(共 14 条)。这是记录数,不能证明是不同的人。
每种响应变量的目标行数
两种响应变量用的是同一批行:两个结果变量并不使独立样本加倍。没有删除任何响应行。
响应拟合
每条纳入记录、每种响应变量各一次,全部成功。
误差指标是联合的源会话标准差归一化 RMSE:误差除以最早会话中响应的标准差,在每个试次内先对两个坐标轴平均再开平方。越低越好。它是误差,不是百分比,也不是准确率。每条记录对其试次等权平均,每个队列的均值对记录等权;区间在队列内对记录重抽样。
两种响应变量,各有一张表。它们是同一批行上的不同结果变量:从不合并,它们的误差也不互相比较。
模仿的是记录时所用解码器的输出(由发布者保存),不是意图中的手部运动,也不是意图控制。
| 队列 | spectral ridge · 均值 | spectral ridge · 中位数 | 源会话均值对照 · 均值 | ridge 减对照 · 相同记录 |
|---|---|---|---|---|
| Main 队列纳入 9 条记录(共 14 条) | 192.29095% 区间 1.292 至 574.235 | 1.317均值是中位数的 146 倍 | 1.26695% 区间 1.214 至 1.316 | 191.02495% 区间 0.026 至 572.995ridge 误差更高的记录:9 条(共 9 条) |
| Transfer Learning 队列纳入 14 条记录(共 14 条) | 44.17295% 区间 0.955 至 130.476 | 0.990均值是中位数的 45 倍 | 0.86495% 区间 0.801 至 0.929 | 43.30895% 区间 0.105 至 129.601ridge 误差更高的记录:14 条(共 14 条) |
在发布者的屏幕坐标中,目标位置减光标位置,单独拟合的代理变量。
| 队列 | spectral ridge · 均值 | spectral ridge · 中位数 | 源会话均值对照 · 均值 | ridge 减对照 · 相同记录 |
|---|---|---|---|---|
| Main 队列纳入 9 条记录(共 14 条) | 698.49995% 区间 1.166 至 2,093 | 1.225均值是中位数的 570 倍 | 1.05695% 区间 0.977 至 1.133 | 697.44395% 区间 0.121 至 2,092ridge 误差更高的记录:9 条(共 9 条) |
| Transfer Learning 队列纳入 14 条记录(共 14 条) | 69.84495% 区间 1.071 至 207.287 | 1.182均值是中位数的 59 倍 | 0.91695% 区间 0.841 至 0.987 | 68.92895% 区间 0.143 至 206.410ridge 误差更高的记录:14 条(共 14 条) |
在四个“队列 × 响应变量”格子中,spectral ridge 的平均误差是其中位数的 45 到 570 倍:少数记录的误差极大。没有删除、截断或缩尾任何已评分的记录;极端误差的原因——特征分布偏移、对缩放敏感,还是别的原因——尚未确定。“每一条记录”这一结论针对的是总体主要误差,不延伸到次要指标,也不延伸到按记录时所用解码器划分的每一种情形。
覆盖情况。Main 队列纳入 9 条记录(共 14 条候选),结果以这一子集为条件;5 条在任何评分之前因元数据问题暂缓,并保留记录:2 条因为某次会话缺少必需的 Chance R01 记录;2 条因为按解码器划分的 run 分配与文档约定不符;1 条因为样本边界的几何结构不一致,其确切的数值原因没有得到独立重建。Transfer Learning 队列纳入 14 条(共 14 条)。合计 23 条纳入的队列记录,不能证明是 23 个不同的人:两个队列可能有相同的人,所以从不合并。
Transfer Learning 是发布者对该队列数据采集方式的命名;这里没有训练任何迁移学习模型。
对记录等权的均值及其 95% 区间。原始 RMSE 的单位是各响应变量的存储单位;R² 与 Pearson 无单位。常数预测没有相关系数,所以对照的 Pearson 值无定义:为空值,不是零。上面“每一条记录”的结论不延伸到这些指标,它们的配对差值也不发布。
| 队列与模型 | 原始 RMSE,水平 | 原始 RMSE,垂直 | R²,水平 | R²,垂直 | Pearson,水平 | Pearson,垂直 |
|---|---|---|---|---|---|---|
| Main 队列spectral ridge | 38.88995% 区间 0.309 至 116.038 | 50.59995% 区间 0.312 至 151.159 | −172,98395% 区间 −518,950 至 −0.018 | −296,66395% 区间 −889,988 至 −0.046 | 0.02995% 区间 0.00233 至 0.061 | 0.03495% 区间 0.00105 至 0.073 |
| Main 队列源会话均值对照 | 0.30695% 区间 0.290 至 0.321 | 0.30295% 区间 0.289 至 0.313 | −0.00049895% 区间 −0.000786 至 −0.000255 | −0.00037795% 区间 −0.000659 至 −0.000127 | 无定义(空值) | 无定义(空值) |
| Transfer Learning 队列spectral ridge | 4.44395% 区间 0.212 至 12.877 | 13.81595% 区间 0.229 至 40.954 | −5,44095% 区间 −16,319 至 −0.188 | −58,11795% 区间 −174,350 至 −0.339 | 0.04595% 区间 0.00527 至 0.096 | 0.01995% 区间 −0.022 至 0.075 |
| Transfer Learning 队列源会话均值对照 | 0.19895% 区间 0.184 至 0.212 | 0.20195% 区间 0.187 至 0.217 | −0.00018795% 区间 −0.000314 至 −0.0000754 | −0.00093795% 区间 −0.00140 至 −0.000531 | 无定义(空值) | 无定义(空值) |
| 队列与模型 | 原始 RMSE,水平 | 原始 RMSE,垂直 | R²,水平 | R²,垂直 | Pearson,水平 | Pearson,垂直 |
|---|---|---|---|---|---|---|
| Main 队列spectral ridge | 124.82895% 区间 0.412 至 373.616 | 332.15295% 区间 0.431 至 995.534 | −928,35095% 区间 −2,785,050 至 −0.183 | −6,442,34195% 区间 −19,327,021 至 −0.388 | 0.05095% 区间 0.031 至 0.074 | 0.07295% 区间 0.018 至 0.137 |
| Main 队列源会话均值对照 | 0.38895% 区间 0.366 至 0.413 | 0.37695% 区间 0.349 至 0.404 | −0.02695% 区间 −0.045 至 −0.00771 | −0.02195% 区间 −0.039 至 −0.00612 | 无定义(空值) | 无定义(空值) |
| Transfer Learning 队列spectral ridge | 9.77295% 区间 0.415 至 28.423 | 38.15195% 区间 0.445 至 113.515 | −21,50495% 区间 −64,511 至 −0.318 | −337,64095% 区间 −1,012,920 至 −0.391 | 0.03595% 区间 0.00847 至 0.067 | 0.03495% 区间 0.00753 至 0.062 |
| Transfer Learning 队列源会话均值对照 | 0.36695% 区间 0.327 至 0.402 | 0.38095% 区间 0.341 至 0.414 | −0.0066495% 区间 −0.010 至 −0.00352 | −0.01695% 区间 −0.030 至 −0.00526 | 无定义(空值) | 无定义(空值) |
方法与局限
使用发布者预处理后的衍生数据:58 个匿名通道编号,250 Hz,4 秒分段。每个通道在 4–8、8–13、13–30 与 30–40 Hz 频带上的 Welch 相对频带功率,取对数比:每个试次 232 个值。StandardScaler 只在第 1 次会话上拟合,之后是 RidgeClassifier(alpha 为 1,不加类别权重)。没有超参搜索、目标会话归一化、校准或拒识。
同样的试次,重采样到 200 Hz 并补零到 800 个采样点;每个试次、每个通道除以其自身的标准差,这是无量纲的输入,不是该检查点原生的幅值,所以这里也不复现上游基准中的数字。CBraMod 处于评估模式,所有权重冻结;四个时间片嵌入取平均,每个试次 11,600 个值;为每名被试单独在其第 1 次会话上拟合 StandardScaler 与 RidgeClassifier。没有训练主干网络,没有 LoRA,也没有目标会话校准。
57 个 EEG 通道,每个事件前 200 ms 到后 700 ms,做基线归一化;从 +100 到 +700 ms 取 6 个 100 ms 平均,每个事件 342 个值。每名被试第一次访次的第 1–3 组块拟合固定的 L2 逻辑回归,第 4 组块拟合 Platt 校准;后续访次在第 2–4 组块上评分。不使用 B 组。没有超参搜索、目标标签校准、微调或 LoRA。
62 个通道,1,000 Hz,发布者已做带通与陷波滤波。4 到 30 Hz 之间的 5 个频带,经逐试次的 FIR 滤波,取前 1 秒的频带功率,表示为相对通道的对数功率:每行 310 个值,来自试次内过去 2 秒的窗口,每 40 ms 一行。每种响应变量分别只在最早会话上拟合 StandardScaler 与响应缩放,之后是 Ridge(alpha 为 1)。没有调参、LoRA、目标会话校准或基础模型推理。
每个区间都是逐点的 95% 百分位区间,来自在各自队列内对被试(光标追踪中为记录)做的 10,000 次 bootstrap 重抽样,每个差值都用配对抽样。区间都以训练好的固定模型及其预测为条件:不包含重新拟合、预处理、模型与协议选择带来的不确定性——对 CBraMod 也不包含预训练数据重叠带来的不确定性——也没有做多重比较校正。
任何逐人或逐条记录的数值——所有最小值与百分位数,以及除光标追踪中与均值并列的四个 spectral ridge 中位数之外的所有中位数;哪些人下降了、哪些记录更差;WBCIC-SHU 的混淆矩阵;按记录时所用解码器划分的光标追踪结果;实测的计算量;以及任何被试、记录或文件标识。
Banghua Yang, Fenqi Rong, Yunlong Xie, Du Li, Jiayang Zhang, Fu Li, Guangming Shi and Xiaorong Gao · A multi-day and high-quality EEG dataset for motor imagery brain-computer interface, Scientific Data 12, 488 (2025), doi:10.1038/s41597-025-04826-y. Data: Banghua Yang and Fenqi Rong, WBCIC-SHU Motor Imagery Dataset, Figshare+, doi:10.25452/figshare.plus.22671172.v5, CC BY 4.0. Derived analysis by BCI Report; not endorsed by the authors.
论文陈述的伦理与知情同意:经清华大学医学伦理委员会批准(批准号 20190002),按《赫尔辛基宣言》开展。被试在了解实验流程、目的、要求与运动想象技巧之后,签署了书面知情同意。Approved by the Tsinghua University Medical Ethics Committee (approval number 20190002); carried out in line with the Declaration of Helsinki. Written informed consent was obtained from the participants after they were informed about the procedure, purpose, requirements and motor-imagery techniques.
Chen Yang, Yufeng Zhang, Hongxin Zhang, Yixuan Li, Yijun Wang and Xiaorong Gao · A longitudinal EEG dataset of event-related potential, figshare, doi:10.6084/m9.figshare.27201003.v1, CC0. Paper: Yufeng Zhang, Hongxin Zhang, Yixuan Li, Yijun Wang, Xiaorong Gao and Chen Yang, A longitudinal EEG dataset of event-related potential, Scientific Data 12, 1069 (2025), doi:10.1038/s41597-025-05378-x. Derived analysis by BCI Report; not endorsed by the authors.
论文陈述的伦理与知情同意:经清华大学机构审查委员会批准(编号 20230058)。每名被试在实验前阅读并签署了知情同意书。Approved by the Tsinghua Institutional Review Board (No. 20230058). Each participant read and signed an informed consent form before the experiment.
Dylan Forenzo and Bin He · EEG-BCI Dataset for “Continuous Tracking using Deep Learning-based Decoding for Non-invasive Brain-Computer Interface”, KiltHub, Carnegie Mellon University, doi:10.1184/R1/25360300.v1, CC BY 4.0. Citation the record requests: Dylan Forenzo, Hao Zhu, Jenn Shanahan, Jaehyun Lim and Bin He, Continuous tracking using deep learning-based decoding for noninvasive brain–computer interface, PNAS Nexus 3(4), pgae145 (2024), doi:10.1093/pnasnexus/pgae145. Derived analysis by BCI Report; not endorsed by the authors and not a reproduction of the paper's online results.
论文陈述的伦理与知情同意:经 Carnegie Mellon University 机构审查委员会批准;论文没有给出批准编号。每名被试在参加之前对实验方案给予了书面同意。Approved by the Institutional Review Board at Carnegie Mellon University; no approval number is given. Each subject provided written consent to the protocol before participating.
CBraMod,即这里的冻结编码器:其论文,以及固定检查点的 SHA-256 0792cb808c14…(版本 b9e961003214…)。WBCIC-SHU 是否出现在它的预训练数据中没有确定:模型论文说明预训练使用 TUH EEG 语料,固定版本的代码仓库把 SHU 列为下游任务,两者都没有给出针对该检查点的文件清单。
以上均为 BCI Report 的衍生分析,只发布聚合结果;不代表数据作者的认可,也不再分发任何原始数据。
数据来源: later-sessions-update.json · schema bci-report-later-sessions-update-v1。
BCI Report. 在较早会话上训练的解码器,到后来还管用吗?[EB/OL]. (2026-10-08). https://bci.report/zh/topics/later-sessions/
数字来自发布 later-sessions-update-20261008(2026-10-08)。也请同时引用上游数据集:署名就在本页。
每个发布版本都在 Zenodo 存档:doi:10.5281/zenodo.23123296。 本站及各次发布的 BibTeX → · CITATION.cff ↗(英文)