共享编码器 · 决策研究计划的第二条路线

一个 EEG 模型回答同一份数据上的多个问题,能和分开的模型一样好吗,代价又是多少?

一个编码器回答同一批窗口上的多个问题,对比每个问题单独一个模型,以及“知道自己在回答哪个问题”的分类头,数据量与计算量保持一致。运动想象用 OpenBMI,睡眠用 BOAS,EESM19 作为粗略重复。

测量所用数据集:EESM19 scalp subset、OpenBMI motor imagery (Lee et al. 2019)、BOAS · Bitbrain Open Access Sleep dataset · 方法:EEGNet、CBraMod

简答

在这些数据上,没能证明更省的设置也一样好。共享一个 EEGNet、每个问题配一个固定线性输出,比“知道自己在回答哪个问题”的分类头更省(运动想象上可训练参数 3,060 个,对比 20,116 个),但没能证明它与那个分类头相差在 2 pp(百分点)以内——这是运行前就定下的界值。在想象还是静息这个问题上(OpenBMI,51 名被试),那个分类头高出 +1.48 pp(+0.09 至 +2.89 pp);在睡眠五期分期上(BOAS),整个区间都高于 2 pp。告诉模型是哪个问题,本身没有可测的帮助:同一个隐藏层不告诉它问题时,在两个运动想象问题上都与那个分类头在 ±2 pp 内等效,在睡眠上非劣(界值 2 pp)。与每个问题单独一个 EEGNet 相比,共享一个小 EEGNet 主干在“哪只手”上的差值是 −1.43 pp(−2.57 至 −0.39 pp):显示出差异,而且不能排除损失达到 2 pp 或以上;在想象还是静息和睡眠分期上,这项比较无法下结论。

比较方法

四种设置,同一组问题

每个问题都是数据集里已有的标签,按标识提问:模型知道自己在回答哪个问题,但问题从不以文字给出。四种设置用同样的窗口回答同样的问题。

B-lin、B-sh 和 C1 从同样的初始权重出发,按同样的顺序看同样的批次,训练同样多的步数。两个主分析层级各跑 3 个随机种子:从头训练的 EEGNet(E1),以及在冻结的 CBraMod 特征上只训分类头(L1;同样的设置,加 -fz 标记)。用 LoRA 适配的 CBraMod(E2)只跑 1 个随机种子,作为次要层级。

三项比较回答这个问题。P1,C1 − B-lin:固定分类头能不能做得一样好?P5,C1 − B-sh:告诉分类头是哪个问题,有没有帮助?P2,B-lin − A:共享一个编码器会不会损失准确率?P4 是冻结 CBraMod 特征上的 P1。

每项比较都是平衡准确率的配对差值,单位是 pp,95% 区间由对被试重采样得到(有 3 个随机种子时,也对训练过程重采样)。每项比较都有两种读法。区间不含零,才算显示出差异。界值是 ±2 pp,由所有者在任何结果出来之前定下:整个区间都在界值以内,算等效;起作用的那一端在界值以内,算非劣;否则就是未达到界值。只有当一个领域里每个计入的问题在 P1 上都达到界值、而且固定分类头更省时,才说“固定分类头以更少的代价做得一样好”。固定分类头的准确率没有明显高于随机水平加 5 pp 的问题处于下限:照样报告,但从不计入。

主分析共有 21 项比较,不做多重比较校正,所以在没有真实差异的比较里,约每 20 项就可能有 1 项偶然显示出差异。平衡准确率先逐人计算,再在被试之间平均:它用来比较设置,不是部署时的错误率。这是“何时不该执行”页上研究计划的第二条路线。

主分析 · OpenBMI · EEGNet 与 CBraMod

运动想象:想象还是静息,哪只手

对 OpenBMI 运动想象段和静息记录中的每个 2 秒窗口,问两个问题:被试是在想象手部动作还是在静息(MI-A),以及是哪只手(MI-B,只用离线试次)?共 31,653 个窗口,来自 51 名被试;每名被试的两次会话都在同一折里,所以每次测试都是在新被试上。两个问题都通过了捷径检查和门槛,都计入。

+1.48 ppMI-A 上的 C1 − B-lin,从头训练的 EEGNet,3 个随机种子

“固定分类头以更少的代价做得一样好”:未得到支持

在想象还是静息上,条件化分类头比固定分类头高出 +1.48 pp(+0.09 至 +2.89 pp):不能排除差距达到 2 pp 或以上。在哪只手上,两者在 ±2 pp 内等效(−0.09 pp,−1.24 至 +1.04 pp)。固定分类头是更省的设置:可训练参数 3,060 个,对比 20,116 个;每个窗口的分类头乘加次数 960 次,对比 15,744 次。

平衡准确率的配对差值(pp),附 95% 区间;51 名被试,3 个随机种子。
比较问题差值(pp)是否显示差异界值 ±2 pp门槛
从头训练的 EEGNet(E1)
P1 · 条件化分类头 − 固定分类头C1 − B-linMI-A想象还是静息+1.48 pp95% 区间 +0.09 至 +2.89 ppC1 更高未达到 2 pp 界值通过门槛
P1 · 条件化分类头 − 固定分类头C1 − B-linMI-B哪只手−0.09 pp95% 区间 −1.24 至 +1.04 pp未显示差异在 ±2 pp 内等效通过门槛
P5 · 条件化分类头 − 不告知问题的同一隐藏层C1 − B-shMI-A想象还是静息+0.31 pp95% 区间 −0.91 至 +1.54 pp未显示差异在 ±2 pp 内等效通过门槛
P5 · 条件化分类头 − 不告知问题的同一隐藏层C1 − B-shMI-B哪只手+0.45 pp95% 区间 −0.60 至 +1.34 pp未显示差异在 ±2 pp 内等效通过门槛
P2 · 一个小 CNN 主干上的固定分类头 − 分开的模型B-lin − A(MI-A)MI-A想象还是静息−1.00 pp95% 区间 −2.21 至 +0.19 pp未显示差异未达到 2 pp 界值在这个样本量下无法下结论通过门槛
P2 · 一个小 CNN 主干上的固定分类头 − 分开的模型B-lin − A(MI-B)MI-B哪只手−1.43 pp95% 区间 −2.57 至 −0.39 ppA(MI-B) 更高未达到 2 pp 界值通过门槛
冻结 CBraMod 特征上的分类头(L1)
P4 · 条件化分类头 − 固定分类头C1-fz − B-lin-fz-sgdMI-A想象还是静息+1.54 pp95% 区间 +0.86 至 +2.30 ppC1-fz 更高未达到 2 pp 界值通过门槛
P4 · 条件化分类头 − 固定分类头C1-fz − B-lin-fz-sgdMI-B哪只手+1.09 pp95% 区间 +0.08 至 +2.12 ppC1-fz 更高未达到 2 pp 界值处于下限,不读界值处于下限:报告,不计入
S1 · 条件化分类头 − 不告知问题的同一隐藏层 · 次要C1-fz − B-sh-fzMI-A想象还是静息−0.12 pp95% 区间 −0.64 至 +0.33 pp未显示差异在 ±2 pp 内等效通过门槛
S1 · 条件化分类头 − 不告知问题的同一隐藏层 · 次要C1-fz − B-sh-fzMI-B哪只手+0.43 pp95% 区间 −0.39 至 +1.21 pp未显示差异在 ±2 pp 内等效处于下限,不读界值处于下限:报告,不计入

告诉分类头是哪个问题,没有带来可测的帮助:从头训练时,C1 − B-sh 在两个问题上都在 ±2 pp 内等效;在冻结特征上,想象还是静息也是如此。但这说明不了条件化分类头比固定分类头高出的部分从何而来:不告诉它问题的同一隐藏层对比固定分类头(B-sh − B-lin,次要对比 S2),在想象还是静息上为 +1.17 pp(−0.09 至 +2.54 pp),在这个样本量下无法下结论。与每个问题单独一个 EEGNet 相比,共享一个小主干(2,096 个参数)在哪只手上的差值是 −1.43 pp(−2.57 至 −0.39 pp):显示出差异,而且不能排除损失达到 2 pp 或以上;在想象还是静息上无法下结论。在冻结的 CBraMod 特征上,条件化分类头在想象还是静息上再次更高(+1.54 pp,+0.86 至 +2.30 pp);哪只手在那里处于下限。

每种设置的平衡准确率:51 名被试的均值,附 95% 区间。随机水平为 50.0%;门槛的下限为 55.0%。区间重叠时不排名:上面的配对差值才是比较。
设置MI-A · 想象还是静息MI-B · 哪只手
EEGNet,从头训练(E1)
固定分类头B-lin73.2%95% 区间 70.2%–76.2%67.5%95% 区间 64.6%–70.5%
共享隐藏层B-sh74.3%95% 区间 71.3%–77.3%67.0%95% 区间 64.1%–69.9%
问题条件化分类头C174.6%95% 区间 71.9%–77.5%67.4%95% 区间 64.4%–70.5%
分开的模型A74.2%95% 区间 71.3%–76.9%69.0%95% 区间 65.9%–72.0%
冻结的 CBraMod 特征(L1)
固定分类头B-lin-fz-sgd69.2%95% 区间 67.0%–71.5%56.1%95% 区间 54.8%–57.4%
共享隐藏层B-sh-fz70.9%95% 区间 68.4%–73.4%56.7%95% 区间 55.4%–58.2%
问题条件化分类头C1-fz70.8%95% 区间 68.4%–73.2%57.2%95% 区间 55.8%–58.6%
每种设置在运动想象上的代价(EEGNet,E1)。参数量、编码器前向次数、乘加次数和步数是精确值。每步耗时是在共享 GPU 上各设置交替测量一次得到的,只供参考:在代价规则里,耗时相差超过 1.2 倍才算数。
设置可训练参数每个窗口的编码器前向次数每个窗口的分类头乘加次数每次拟合的训练步数每步耗时
固定分类头B-lin3,060编码器 2,096 · 分类头 964 · 条件化 019607,9287.71 ms
共享隐藏层B-sh18,402编码器 2,096 · 分类头 16,306 · 条件化 0116,1047,9287.80 ms
问题条件化分类头C120,116编码器 2,096 · 分类头 15,812 · 条件化 2,208115,7447,9287.89 ms
分开的模型A5,156每个问题一个 EEGNet296010,4927.55 ms

捷径检查和门槛排除了什么

捷径检查(canary):在任何拟合之前,用每个窗口各通道的均值和对数方差训练一个岭回归分类器,只在第一折的 40 名训练被试内部训练和测试,看一个问题能不能只靠这些统计量回答;达到 85.0% 或以上的问题会被降级。结果为 MI-A 66.1%、MI-B 55.9%、MI-C 60.1%、MI-D 47.3%,所以没有问题被降级。门槛排除了一项:在冻结的 CBraMod 特征上,固定分类头在哪只手上的得分为 56.1%(54.8%–57.4%),区间没有完全高于 55.0% 的下限,所以这个问题在那里处于下限。

主分析 · BOAS · EEGNet 与 CBraMod

睡眠:分期、下一帧是否改变、前半夜还是后半夜

对 6 个多导睡眠图 EEG 通道上的每个 30 秒数据帧问三个问题,以人工共识分期为标准:睡眠分期(SL-A),下一帧的分期是否改变(SL-E),以及是前半夜还是后半夜(SL-F)。共 119,725 个数据帧,来自 100 名被试;同一名被试的所有夜晚都在同一折里。各期保持自然比例:W 16.0%,N1 3.7%,N2 60.3%,N3 4.4%,REM 15.7%;有 8.6% 的数据帧在下一帧改变分期。SL-E 和 SL-F 在很大程度上可以由当前分期预测:只用真实的当前分期读出,就能达到 61.9% 和 59.2%。

BOAS 在说明三处缺口后发布(所有者决定,2026 年 10 月 7 日):

  1. 知情同意声明没有说明被试是否同意公开共享或二次使用。The consent statement does not say whether participants agreed to public sharing or secondary use.
  2. 伦理与知情同意的陈述只来自发布者的数据集说明与 README,没有任何同行评审论文描述 BOAS。The ethics and consent statements come from the publisher's dataset description and README. No peer-reviewed paper describes BOAS.
  3. 伦理批件编号是在 1.1.1 版(2025 年 5 月)才加入发布的,发布中没有说明它是在记录之前还是之后批准的。The ethics reference was added to the release in version 1.1.1 (May 2025), and the release does not say when it was granted relative to the recordings.

被试在公开发布中是假名化的。这里没有任何结果是在评估 Bitbrain 的头带或它的自动睡眠分期;两者都没有使用。No result here evaluates Bitbrain's headband or its automatic sleep scoring; neither is used.

署名:Eduardo López-Larraz, María Sierra-Torralba, Sergio Clemente, Galit Fierro, David Oriol, Javier Minguez, Luis Montesano and Jens G. Klinzing · The Bitbrain Open Access Sleep (BOAS) dataset, OpenNeuro ds005555, version 1.1.3 (2026), doi:10.18112/openneuro.ds005555.v1.1.3. Polysomnography EEG and the human-consensus stage labels only; the headband recordings and the publisher's automatic labels are not used.

+6.96 ppSL-A 上的 C1 − B-lin,从头训练的 EEGNet,3 个随机种子

“固定分类头以更少的代价做得一样好”:未得到支持

只有睡眠分期计入。在 EEGNet 上,固定分类头在下一帧是否改变上处于下限(54.4%,53.5%–55.4%),在前半夜还是后半夜上也是(54.2%,53.0%–55.6%):照样报告,但不计入。在睡眠分期上,条件化分类头比固定分类头高出 +6.96 pp(+4.92 至 +9.09 pp):整个区间都高于 +2 pp。固定分类头更省:可训练参数 34,905 个,对比 243,817 个;每个数据帧的分类头乘加次数 33,696 次,对比 240,384 次;每步也更快。

平衡准确率的配对差值(pp),附 95% 区间;100 名被试,3 个随机种子。
比较问题差值(pp)是否显示差异界值 ±2 pp门槛
从头训练的 EEGNet(E1)
P1 · 条件化分类头 − 固定分类头C1 − B-linSL-A五期睡眠分期+6.96 pp95% 区间 +4.92 至 +9.09 ppC1 更高未达到 2 pp 界值通过门槛
P1 · 条件化分类头 − 固定分类头C1 − B-linSL-E下一帧分期是否改变+3.02 pp95% 区间 +1.55 至 +4.35 ppC1 更高未达到 2 pp 界值处于下限,不读界值处于下限:报告,不计入
P1 · 条件化分类头 − 固定分类头C1 − B-linSL-F前半夜还是后半夜+1.42 pp95% 区间 −0.25 至 +2.90 pp未显示差异未达到 2 pp 界值在这个样本量下无法下结论处于下限,不读界值处于下限:报告,不计入
P5 · 条件化分类头 − 不告知问题的同一隐藏层C1 − B-shSL-A五期睡眠分期−1.47 pp95% 区间 −3.79 至 +0.94 pp未显示差异B-sh 非劣(界值 2 pp)通过门槛
P5 · 条件化分类头 − 不告知问题的同一隐藏层C1 − B-shSL-E下一帧分期是否改变−1.41 pp95% 区间 −2.40 至 −0.50 ppB-sh 更高B-sh 非劣(界值 2 pp)处于下限,不读界值处于下限:报告,不计入
P5 · 条件化分类头 − 不告知问题的同一隐藏层C1 − B-shSL-F前半夜还是后半夜−0.14 pp95% 区间 −1.41 至 +1.15 pp未显示差异在 ±2 pp 内等效处于下限,不读界值处于下限:报告,不计入
P2 · 一个小 CNN 主干上的固定分类头 − 分开的模型B-lin − A(SL-A)SL-A五期睡眠分期−0.84 pp95% 区间 −2.73 至 +0.91 pp未显示差异未达到 2 pp 界值在这个样本量下无法下结论通过门槛
P2 · 一个小 CNN 主干上的固定分类头 − 分开的模型B-lin − A(SL-E)SL-E下一帧分期是否改变+1.20 pp95% 区间 +0.07 至 +2.44 ppB-lin 更高B-lin 非劣(界值 2 pp)处于下限,不读界值处于下限:报告,不计入
P2 · 一个小 CNN 主干上的固定分类头 − 分开的模型B-lin − A(SL-F)SL-F前半夜还是后半夜+2.01 pp95% 区间 +0.54 至 +3.89 ppB-lin 更高B-lin 非劣(界值 2 pp)处于下限,不读界值处于下限:报告,不计入
冻结 CBraMod 特征上的分类头(L1)
P4 · 条件化分类头 − 固定分类头C1-fz − B-lin-fz-sgdSL-A五期睡眠分期+0.19 pp95% 区间 −0.74 至 +1.14 pp未显示差异在 ±2 pp 内等效通过门槛
P4 · 条件化分类头 − 固定分类头C1-fz − B-lin-fz-sgdSL-E下一帧分期是否改变+1.75 pp95% 区间 +0.92 至 +2.63 ppC1-fz 更高未达到 2 pp 界值通过门槛
P4 · 条件化分类头 − 固定分类头C1-fz − B-lin-fz-sgdSL-F前半夜还是后半夜+0.77 pp95% 区间 −0.14 至 +1.67 pp未显示差异在 ±2 pp 内等效通过门槛
S1 · 条件化分类头 − 不告知问题的同一隐藏层 · 次要C1-fz − B-sh-fzSL-A五期睡眠分期−0.53 pp95% 区间 −1.10 至 +0.01 pp未显示差异在 ±2 pp 内等效通过门槛
S1 · 条件化分类头 − 不告知问题的同一隐藏层 · 次要C1-fz − B-sh-fzSL-E下一帧分期是否改变−0.22 pp95% 区间 −0.76 至 +0.30 pp未显示差异在 ±2 pp 内等效通过门槛
S1 · 条件化分类头 − 不告知问题的同一隐藏层 · 次要C1-fz − B-sh-fzSL-F前半夜还是后半夜+0.05 pp95% 区间 −0.57 至 +0.70 pp未显示差异在 ±2 pp 内等效通过门槛

在睡眠分期上,高出的部分来自隐藏层:不告诉它问题的同一隐藏层比固定分类头高出 +8.43 pp(B-sh − B-lin,次要对比 S2;+5.83 至 +11.12 pp),而 C1 − B-sh 为 −1.47 pp(−3.79 至 +0.94 pp),B-sh 非劣(界值 2 pp);在冻结的 CBraMod 特征上,C1 − B-sh 在三个问题上都在 ±2 pp 内等效。共享主干与分开的模型相比,在睡眠分期上无法下结论。在冻结的 CBraMod 特征上,固定分类头在睡眠分期和前半夜还是后半夜上都与条件化分类头在 ±2 pp 内等效,在下一帧是否改变上则不然(+1.75 pp,+0.92 至 +2.63 pp)。小 EEGNet 主干的五期分期准确率不高:固定分类头 34.4%,条件化分类头 41.4%,随机水平为 20.0%;冻结 CBraMod 特征上的固定分类头达到 70.7%。

每种设置的平衡准确率:100 名被试的均值,附 95% 区间。睡眠分期的随机水平为 20.0%,另两个问题为 50.0%;门槛的下限分别为 25.0% 和 55.0%。区间重叠时不排名。
设置SL-A · 五期睡眠分期SL-E · 下一帧分期是否改变SL-F · 前半夜还是后半夜
EEGNet,从头训练(E1)
固定分类头B-lin34.4%95% 区间 32.1%–37.0%54.4%95% 区间 53.5%–55.4%54.2%95% 区间 53.0%–55.6%
共享隐藏层B-sh42.9%95% 区间 40.1%–45.7%58.9%95% 区间 57.5%–60.2%55.8%95% 区间 54.2%–57.4%
问题条件化分类头C141.4%95% 区间 38.6%–44.2%57.5%95% 区间 56.0%–58.8%55.6%95% 区间 54.2%–57.1%
分开的模型A35.3%95% 区间 32.9%–37.8%53.2%95% 区间 52.2%–54.3%52.2%95% 区间 51.0%–53.7%
冻结的 CBraMod 特征(L1)
固定分类头B-lin-fz-sgd70.7%95% 区间 68.5%–72.7%63.5%95% 区间 62.3%–64.7%64.5%95% 区间 62.8%–66.1%
共享隐藏层B-sh-fz71.4%95% 区间 69.1%–73.6%65.5%95% 区间 64.1%–66.7%65.2%95% 区间 63.6%–66.9%
问题条件化分类头C1-fz70.9%95% 区间 68.6%–73.0%65.2%95% 区间 63.9%–66.5%65.2%95% 区间 63.6%–66.9%

由另一个问题推出的问题,需要单独的模型吗?

清醒还是睡着(SL-B)可以由睡眠分期推出。单独的清醒/睡眠模型 A(SL-B) 剩余的错误,比从五期模型 A(SL-A) 读出答案更少:它的剩余错误是读出的 0.684 倍。区间不能排除减少 20% 或以上(这是运行前定下的界值),所以“能推出的问题不需要自己的模型”未得到支持。

log R:专用模型的剩余错误(1 − AUROC)与读出的剩余错误之比的对数,附 95% 区间;100 名被试,3 个随机种子。
比较log RRAUROC,专用 / 读出是否显示差异界值 20%门槛
P3 · 它自己的模型 − 从五期模型读出A(SL-B) / A(SL-A) · SL-B−0.38095% 区间 −0.583 至 −0.2030.6840.941 / 0.914专用模型剩余的错误更少未达到 20% 界值通过门槛

用 LoRA 适配的 CBraMod(E2):次要,1 个随机种子,最后运行

这一组在 2026 年 10 月 7 日运行,那时本次运行的其他所有结果、以及两份独立审计都已知。它的设计(35 次 LoRA 拟合、随机种子、训练方案、把 30 秒输入切成 15 段 2 秒、各项比较)和运行条件在冻结协议时就已确定,没有任何一项是根据结果选的。为了让拟合能在中断后接着跑,运行时用了临时的私有检查点:运行期间为 33 次拟合写了 39 个,每个要么被同一拟合的下一个覆盖,要么在拟合完成时删除,没有一个留到拟合结束之后,现在剩下 0 个;运行前对续训做的一次检查,也以同样的方式删掉了它写的检查点。评分用的是冻结的代码,一份独立审计重算了全部 9 个条目。

平衡准确率的配对差值(pp),附 95% 区间;100 名被试,1 个随机种子:区间里没有训练过程的随机波动。
比较问题差值(pp)是否显示差异界值 ±2 pp门槛
S3-P1 · 条件化分类头 − 固定分类头C1 − B-linSL-A五期睡眠分期+0.54 pp95% 区间 −0.41 至 +1.51 pp未显示差异在 ±2 pp 内等效通过门槛由 E2 睡眠评分程序附上,并经其审计重算
S3-P1 · 条件化分类头 − 固定分类头C1 − B-linSL-E下一帧分期是否改变+3.00 pp95% 区间 +2.20 至 +3.81 ppC1 更高未达到 2 pp 界值通过门槛由 E2 睡眠评分程序附上,并经其审计重算
S3-P1 · 条件化分类头 − 固定分类头C1 − B-linSL-F前半夜还是后半夜+0.80 pp95% 区间 −0.19 至 +1.79 pp未显示差异在 ±2 pp 内等效通过门槛由 E2 睡眠评分程序附上,并经其审计重算
S3-P5 · 条件化分类头 − 不告知问题的同一隐藏层C1 − B-shSL-A五期睡眠分期+0.15 pp95% 区间 −0.15 至 +0.44 pp未显示差异在 ±2 pp 内等效通过门槛由 E2 睡眠评分程序附上,并经其审计重算
S3-P5 · 条件化分类头 − 不告知问题的同一隐藏层C1 − B-shSL-E下一帧分期是否改变+0.15 pp95% 区间 −0.13 至 +0.44 pp未显示差异在 ±2 pp 内等效通过门槛由 E2 睡眠评分程序附上,并经其审计重算
S3-P5 · 条件化分类头 − 不告知问题的同一隐藏层C1 − B-shSL-F前半夜还是后半夜+0.03 pp95% 区间 −0.23 至 +0.29 pp未显示差异在 ±2 pp 内等效通过门槛由 E2 睡眠评分程序附上,并经其审计重算
S3-P2 · 一个适配后的 CBraMod 上的固定分类头 − 分开的模型B-lin − A(SL-A)SL-A五期睡眠分期+0.10 pp95% 区间 −0.50 至 +0.69 pp未显示差异在 ±2 pp 内等效通过门槛由 E2 睡眠评分程序附上,并经其审计重算
S3-P2 · 一个适配后的 CBraMod 上的固定分类头 − 分开的模型B-lin − A(SL-E)SL-E下一帧分期是否改变−0.70 pp95% 区间 −1.51 至 +0.10 pp未显示差异在 ±2 pp 内等效通过门槛由 E2 睡眠评分程序附上,并经其审计重算
S3-P2 · 一个适配后的 CBraMod 上的固定分类头 − 分开的模型B-lin − A(SL-F)SL-F前半夜还是后半夜−0.31 pp95% 区间 −1.59 至 +0.98 pp未显示差异在 ±2 pp 内等效通过门槛由 E2 睡眠评分程序附上,并经其审计重算

适配 CBraMod 之后,固定分类头在睡眠分期和前半夜还是后半夜上与条件化分类头在 ±2 pp 内等效;在下一帧是否改变上,条件化分类头高出 +3.00 pp(+2.20 至 +3.81 pp)。共享与分开的模型相比:三个问题都在 ±2 pp 内等效。门槛所用的设置(E2 的固定分类头):SL-A 72.8%(70.9%–74.6%),SL-E 65.0%(63.8%–66.2%),SL-F 64.9%(63.3%–66.3%);全部通过。

每种设置在睡眠上的代价(EEGNet,E1)。参数量、编码器前向次数、乘加次数和步数是精确值。每步耗时是在共享 GPU 上各设置交替测量一次得到的,只供参考:在代价规则里,耗时相差超过 1.2 倍才算数。
设置可训练参数每个数据帧的编码器前向次数每个数据帧的分类头乘加次数每次拟合的训练步数每步耗时
固定分类头B-lin34,905编码器 1,200 · 分类头 33,705 · 条件化 0133,69619,9823.24 ms
共享隐藏层B-sh241,593编码器 1,200 · 分类头 240,393 · 条件化 01240,19219,9823.56 ms
问题条件化分类头C1243,817编码器 1,200 · 分类头 240,393 · 条件化 2,2241240,38419,9824.04 ms
分开的模型A37,305每个问题一个 EEGNet333,69659,9162.60 ms

捷径检查和门槛排除了什么

捷径检查在第一折的 80 名训练被试上的结果为 SL-A 36.8%、SL-B 59.9%、SL-C 70.7%、SL-D 82.1%、SL-E 56.5%、SL-F 58.4%,都低于 85.0%,所以没有问题被降级。门槛在 EEGNet 上排除了下一帧是否改变和前半夜还是后半夜;在冻结的 CBraMod 特征上和适配 CBraMod 之后,每个问题都通过了。

次要 · 粗略重复 · EESM19 · 1 个随机种子

在 EESM19 上做同样的比较(粗略)

EESM19 完整版(第一位评分者)中所有通过已发布核心规则的 30 秒存储数据帧,保持自然的分期比例:共 52,311 个数据帧,来自 20 名被试。从头训练的 EEGNet,1 个随机种子,没有共享隐藏层这一设置,所以这里无法把问题编码和隐藏层的作用分开。它与核心矩阵中类别平衡的头皮子集是不同的协议。SL-E 和 SL-F 在很大程度上可以由当前分期预测;这里没有计算只用分期的读出。

平衡准确率的配对差值(pp),附 95% 区间;20 名被试,1 个随机种子。
比较问题两种设置的均值差值(pp)是否显示差异界值 ±2 pp门槛
S13-P1 · 条件化分类头 − 固定分类头C1 − B-linSL-A五期睡眠分期66.7% / 63.2%+3.47 pp95% 区间 +1.54 至 +5.64 ppC1 更高未达到 2 pp 界值通过门槛由运行本身附上
S13-P1 · 条件化分类头 − 固定分类头C1 − B-linSL-E下一帧分期是否改变56.8% / 53.4%+3.38 pp95% 区间 +2.27 至 +4.36 ppC1 更高未达到 2 pp 界值处于下限,不读界值处于下限:报告,不计入由运行本身附上
S13-P1 · 条件化分类头 − 固定分类头C1 − B-linSL-F前半夜还是后半夜63.8% / 61.8%+2.09 pp95% 区间 +0.38 至 +3.74 ppC1 更高未达到 2 pp 界值通过门槛由运行本身附上
S13-P2 · 一个小 CNN 主干上的固定分类头 − 分开的模型B-lin − A(SL-A)SL-A五期睡眠分期63.2% / 64.7%−1.47 pp95% 区间 −2.90 至 −0.10 ppA(SL-A) 更高未达到 2 pp 界值通过门槛由运行本身附上
S13-P2 · 一个小 CNN 主干上的固定分类头 − 分开的模型B-lin − A(SL-E)SL-E下一帧分期是否改变53.4% / 52.1%+1.33 pp95% 区间 +0.42 至 +2.32 ppB-lin 更高B-lin 非劣(界值 2 pp)处于下限,不读界值处于下限:报告,不计入由运行本身附上
S13-P2 · 一个小 CNN 主干上的固定分类头 − 分开的模型B-lin − A(SL-F)SL-F前半夜还是后半夜61.8% / 62.5%−0.72 pp95% 区间 −2.10 至 +0.69 pp未显示差异未达到 2 pp 界值在这个样本量下无法下结论通过门槛由运行本身附上

在睡眠分期上,方向与 BOAS 一致:条件化分类头高于固定分类头(+3.47 pp,+1.54 至 +5.64 pp),未达到界值。捷径检查在 16 名训练被试上没有降级任何问题;门槛排除了下一帧是否改变。

次要 · 探索性

次要与探索性结果

运动想象和睡眠上的其他设置,未注明时为 1 个随机种子:所有问题一起训练有什么变化、训练更久、其他编码器和其他分类头。每一项都附上门槛,并注明是谁附上的。

展开次要结果

代号:K-all,数据集的全部问题一起训练(OpenBMI 加上 MI-C 和 MI-D;BOAS 加上 SL-B、SL-C 和 SL-D);primary K,只训主分析问题;2x,训练轮数加倍;step-matched(步数匹配),A(MI-B) 训练到与共享设置相同的步数;B-MLP64-fz,每个问题单独一个 64 单元的隐藏层;H,基于学到的问题编码的超网络(探索性:按构造与线性分类头等价);C2-fz,在 CBraMod 的 token 特征上做查询 token。每个门槛都注明是谁附上的:运行本身、所在层级的门槛,或独立的次要审计——冻结的评分漏掉的门槛由它补上。冻结特征上的 S2 是独立的次要审计算出来的,不是运行本身。

运动想象,OpenBMI
条目层级问题对比差值(pp)是否显示差异界值 ±2 pp门槛
S23 个随机种子E1MI-A想象还是静息B-sh − B-lin+1.17 pp95% 区间 −0.09 至 +2.54 pp未显示差异未达到 2 pp 界值在这个样本量下无法下结论通过门槛由独立的次要审计附上
S23 个随机种子E1MI-B哪只手B-sh − B-lin−0.54 pp95% 区间 −1.65 至 +0.74 pp未显示差异在 ±2 pp 内等效通过门槛由独立的次要审计附上
S10E1MI-A想象还是静息B-lin(K-all) − B-lin(primary)−2.32 pp95% 区间 −3.94 至 −0.75 ppB-lin(primary) 更高未达到 2 pp 界值通过门槛由独立的次要审计附上
S10E1MI-B哪只手B-lin(K-all) − B-lin(primary)−1.84 pp95% 区间 −3.26 至 −0.41 ppB-lin(primary) 更高未达到 2 pp 界值通过门槛由独立的次要审计附上
S10E1MI-A想象还是静息C1(K-all) − C1(primary)−1.12 pp95% 区间 −2.47 至 +0.21 pp未显示差异未达到 2 pp 界值在这个样本量下无法下结论通过门槛由独立的次要审计附上
S10E1MI-B哪只手C1(K-all) − C1(primary)−2.44 pp95% 区间 −4.75 至 −0.24 ppC1(primary) 更高未达到 2 pp 界值通过门槛由独立的次要审计附上
S5E1MI-A想象还是静息C1(2x) − B-lin(2x)+0.89 pp95% 区间 −0.55 至 +2.59 pp未显示差异未达到 2 pp 界值在这个样本量下无法下结论通过门槛由独立的次要审计附上
S5E1MI-B哪只手C1(2x) − B-lin(2x)−0.24 pp95% 区间 −1.43 至 +0.98 pp未显示差异在 ±2 pp 内等效通过门槛由独立的次要审计附上
S6-P1E1MI-C离线段还是在线段C1(K-all) − B-lin(K-all)−0.15 pp95% 区间 −2.86 至 +2.50 pp未显示差异未达到 2 pp 界值在这个样本量下无法下结论通过门槛由独立的次要审计附上
S6-P2E1MI-C离线段还是在线段B-lin(K-all) − A(MI-C)−2.75 pp95% 区间 −5.43 至 −0.22 ppA(MI-C) 更高未达到 2 pp 界值通过门槛由运行本身附上
S6-P1E1MI-D第一天还是第二天C1(K-all) − B-lin(K-all)−0.69 pp95% 区间 −4.17 至 +2.64 pp未显示差异未达到 2 pp 界值在这个样本量下无法下结论处于下限,不读界值处于下限:报告,不计入由独立的次要审计附上
S6-P2E1MI-D第一天还是第二天B-lin(K-all) − A(MI-D)+0.49 pp95% 区间 −3.23 至 +3.81 pp未显示差异未达到 2 pp 界值在这个样本量下无法下结论处于下限,不读界值处于下限:报告,不计入由运行本身附上
S12E1MI-B哪只手A(MI-B),步数匹配 − A(MI-B)−0.03 pp95% 区间 −1.63 至 +1.44 pp未显示差异在 ±2 pp 内等效通过门槛由独立的次要审计附上
S12-P2E1MI-B哪只手B-lin − A(MI-B),步数匹配−0.57 pp95% 区间 −2.09 至 +1.05 pp未显示差异未达到 2 pp 界值在这个样本量下无法下结论通过门槛由独立的次要审计附上
S3-P1E2MI-A想象还是静息C1 − B-lin−0.43 pp95% 区间 −1.06 至 +0.18 pp未显示差异在 ±2 pp 内等效通过门槛由独立的次要审计附上
S3-P2E2MI-A想象还是静息B-lin − A(MI-A)−0.09 pp95% 区间 −0.58 至 +0.39 pp未显示差异在 ±2 pp 内等效通过门槛由独立的次要审计附上
S3-P5E2MI-A想象还是静息C1 − B-sh−0.07 pp95% 区间 −0.36 至 +0.23 pp未显示差异在 ±2 pp 内等效通过门槛由独立的次要审计附上
S3-P1E2MI-B哪只手C1 − B-lin−1.07 pp95% 区间 −2.08 至 −0.08 ppB-lin 更高B-lin 非劣(界值 2 pp)通过门槛由独立的次要审计附上
S3-P2E2MI-B哪只手B-lin − A(MI-B)+0.35 pp95% 区间 −0.46 至 +1.18 pp未显示差异在 ±2 pp 内等效通过门槛由独立的次要审计附上
S3-P5E2MI-B哪只手C1 − B-sh−0.16 pp95% 区间 −0.71 至 +0.42 pp未显示差异在 ±2 pp 内等效通过门槛由独立的次要审计附上
S7L1 · ST-EEGFormer Base, pooledMI-A想象还是静息C1-fz − B-lin-fz-sgd−1.11 pp95% 区间 −1.89 至 −0.32 ppB-lin-fz-sgd 更高在 ±2 pp 内等效通过门槛由独立的次要审计附上
S7L1 · ST-EEGFormer Base, pooledMI-B哪只手C1-fz − B-lin-fz-sgd−0.26 pp95% 区间 −1.43 至 +0.85 pp未显示差异在 ±2 pp 内等效处于下限,不读界值处于下限:报告,不计入由独立的次要审计附上
S14L1 · CBraMod, pooledMI-A想象还是静息B-MLP64-fz − B-sh-fz−0.08 pp95% 区间 −0.66 至 +0.49 pp未显示差异在 ±2 pp 内等效通过门槛由独立的次要审计附上
X1L1 · CBraMod, pooledMI-A想象还是静息H − B-lin-fz-sgd−1.78 pp95% 区间 −2.30 至 −1.24 ppB-lin-fz-sgd 更高B-lin-fz-sgd 非劣(界值 2 pp)通过门槛由独立的次要审计附上
S14L1 · CBraMod, pooledMI-B哪只手B-MLP64-fz − B-sh-fz+0.59 pp95% 区间 −0.32 至 +1.57 pp未显示差异在 ±2 pp 内等效处于下限,不读界值处于下限:报告,不计入由独立的次要审计附上
X1L1 · CBraMod, pooledMI-B哪只手H − B-lin-fz-sgd−0.49 pp95% 区间 −1.17 至 +0.15 pp未显示差异在 ±2 pp 内等效处于下限,不读界值处于下限:报告,不计入由独立的次要审计附上
S8L1 · CBraMod tokensMI-A想象还是静息C2-fz − B-lin-fz-sgd−0.95 pp95% 区间 −2.27 至 +0.45 pp未显示差异B-lin-fz-sgd 非劣(界值 2 pp)通过门槛由独立的次要审计附上
S8L1 · CBraMod tokensMI-B哪只手C2-fz − B-lin-fz-sgd−5.31 pp95% 区间 −7.09 至 −3.69 ppB-lin-fz-sgd 更高B-lin-fz-sgd 非劣(界值 2 pp)处于下限,不读界值处于下限:报告,不计入由独立的次要审计附上
S23 个随机种子由独立审计算出L1MI-A想象还是静息B-sh-fz − B-lin-fz-sgd+1.66 pp95% 区间 +0.95 至 +2.44 ppB-sh-fz 更高未达到 2 pp 界值通过门槛所在层级的门槛
S23 个随机种子由独立审计算出L1MI-B哪只手B-sh-fz − B-lin-fz-sgd+0.66 pp95% 区间 −0.18 至 +1.48 pp未显示差异在 ±2 pp 内等效处于下限,不读界值处于下限:报告,不计入所在层级的门槛

BOAS 在说明三处缺口后发布(所有者决定,2026 年 10 月 7 日):

  1. 知情同意声明没有说明被试是否同意公开共享或二次使用。The consent statement does not say whether participants agreed to public sharing or secondary use.
  2. 伦理与知情同意的陈述只来自发布者的数据集说明与 README,没有任何同行评审论文描述 BOAS。The ethics and consent statements come from the publisher's dataset description and README. No peer-reviewed paper describes BOAS.
  3. 伦理批件编号是在 1.1.1 版(2025 年 5 月)才加入发布的,发布中没有说明它是在记录之前还是之后批准的。The ethics reference was added to the release in version 1.1.1 (May 2025), and the release does not say when it was granted relative to the recordings.

被试在公开发布中是假名化的。这里没有任何结果是在评估 Bitbrain 的头带或它的自动睡眠分期;两者都没有使用。No result here evaluates Bitbrain's headband or its automatic sleep scoring; neither is used.

署名:Eduardo López-Larraz, María Sierra-Torralba, Sergio Clemente, Galit Fierro, David Oriol, Javier Minguez, Luis Montesano and Jens G. Klinzing · The Bitbrain Open Access Sleep (BOAS) dataset, OpenNeuro ds005555, version 1.1.3 (2026), doi:10.18112/openneuro.ds005555.v1.1.3. Polysomnography EEG and the human-consensus stage labels only; the headband recordings and the publisher's automatic labels are not used.

睡眠,BOAS
条目层级问题对比差值(pp)是否显示差异界值 ±2 pp门槛
S23 个随机种子E1SL-A五期睡眠分期B-sh − B-lin+8.43 pp95% 区间 +5.83 至 +11.12 ppB-sh 更高未达到 2 pp 界值通过门槛由独立的次要审计附上
S23 个随机种子E1SL-E下一帧分期是否改变B-sh − B-lin+4.43 pp95% 区间 +3.10 至 +5.71 ppB-sh 更高未达到 2 pp 界值处于下限,不读界值处于下限:报告,不计入由独立的次要审计附上
S23 个随机种子E1SL-F前半夜还是后半夜B-sh − B-lin+1.56 pp95% 区间 −0.31 至 +3.49 pp未显示差异未达到 2 pp 界值在这个样本量下无法下结论处于下限,不读界值处于下限:报告,不计入由独立的次要审计附上
S10E1SL-A五期睡眠分期B-lin(K-all) − B-lin(primary)−2.55 pp95% 区间 −3.86 至 −1.31 ppB-lin(primary) 更高未达到 2 pp 界值通过门槛由独立的次要审计附上
S10E1SL-E下一帧分期是否改变B-lin(K-all) − B-lin(primary)+0.97 pp95% 区间 +0.23 至 +1.71 ppB-lin(K-all) 更高在 ±2 pp 内等效处于下限,不读界值处于下限:报告,不计入由独立的次要审计附上
S10E1SL-F前半夜还是后半夜B-lin(K-all) − B-lin(primary)−0.61 pp95% 区间 −1.37 至 +0.16 pp未显示差异在 ±2 pp 内等效处于下限,不读界值处于下限:报告,不计入由独立的次要审计附上
S10E1SL-A五期睡眠分期C1(K-all) − C1(primary)+4.14 pp95% 区间 +2.76 至 +5.49 ppC1(K-all) 更高C1(K-all) 非劣(界值 2 pp)通过门槛由独立的次要审计附上
S10E1SL-E下一帧分期是否改变C1(K-all) − C1(primary)+0.96 pp95% 区间 +0.11 至 +1.79 ppC1(K-all) 更高在 ±2 pp 内等效处于下限,不读界值处于下限:报告,不计入由独立的次要审计附上
S10E1SL-F前半夜还是后半夜C1(K-all) − C1(primary)+1.67 pp95% 区间 +0.55 至 +2.87 ppC1(K-all) 更高C1(K-all) 非劣(界值 2 pp)处于下限,不读界值处于下限:报告,不计入由独立的次要审计附上
S5E1SL-A五期睡眠分期C1(2x) − B-lin(2x)+1.71 pp95% 区间 +0.12 至 +3.25 ppC1(2x) 更高未达到 2 pp 界值通过门槛由独立的次要审计附上
S5E1SL-E下一帧分期是否改变C1(2x) − B-lin(2x)+2.13 pp95% 区间 +1.27 至 +2.93 ppC1(2x) 更高未达到 2 pp 界值处于下限,不读界值处于下限:报告,不计入由独立的次要审计附上
S5E1SL-F前半夜还是后半夜C1(2x) − B-lin(2x)+2.78 pp95% 区间 +1.72 至 +3.94 ppC1(2x) 更高未达到 2 pp 界值处于下限,不读界值处于下限:报告,不计入由独立的次要审计附上
S6-P1E1SL-CREM 还是 NREMC1(K-all) − B-lin(K-all)+5.50 pp95% 区间 +4.04 至 +7.04 ppC1(K-all) 更高未达到 2 pp 界值通过门槛由独立的次要审计附上
S6-P2E1SL-CREM 还是 NREMB-lin(K-all) − A(SL-C)−9.59 pp95% 区间 −11.77 至 −7.58 ppA(SL-C) 更高未达到 2 pp 界值通过门槛由运行本身附上
S6-P1E1SL-D是否 N3C1(K-all) − B-lin(K-all)+9.79 pp95% 区间 +6.69 至 +12.95 ppC1(K-all) 更高未达到 2 pp 界值通过门槛由独立的次要审计附上
S6-P2E1SL-D是否 N3B-lin(K-all) − A(SL-D)−2.13 pp95% 区间 −4.50 至 +0.07 pp未显示差异未达到 2 pp 界值在这个样本量下无法下结论通过门槛由运行本身附上
S113 个随机种子E1SL-E下一帧分期是否改变B-lin − B-lin 的分期读出+4.35 pp95% 区间 +3.46 至 +5.28 pp专用分类头更高描述性对比,不设界值不适用:描述性描述性
S113 个随机种子E1SL-E下一帧分期是否改变B-sh − B-sh 的分期读出+8.26 pp95% 区间 +6.91 至 +9.52 pp专用分类头更高描述性对比,不设界值不适用:描述性描述性
S113 个随机种子E1SL-E下一帧分期是否改变C1 − C1 的分期读出+6.67 pp95% 区间 +5.35 至 +7.90 pp专用分类头更高描述性对比,不设界值不适用:描述性描述性
S113 个随机种子E1SL-E下一帧分期是否改变A(SL-E) − A(SL-A) 的分期读出+3.09 pp95% 区间 +2.02 至 +4.14 pp专用分类头更高描述性对比,不设界值不适用:描述性描述性
S113 个随机种子E1SL-F前半夜还是后半夜B-lin − B-lin 的分期读出−0.35 pp95% 区间 −1.47 至 +0.87 pp未显示差异描述性对比,不设界值不适用:描述性描述性
S113 个随机种子E1SL-F前半夜还是后半夜B-sh − B-sh 的分期读出−1.34 pp95% 区间 −2.22 至 −0.48 pp由分期概率读出的更高描述性对比,不设界值不适用:描述性描述性
S113 个随机种子E1SL-F前半夜还是后半夜C1 − C1 的分期读出−1.24 pp95% 区间 −2.03 至 −0.48 pp由分期概率读出的更高描述性对比,不设界值不适用:描述性描述性
S113 个随机种子E1SL-F前半夜还是后半夜A(SL-F) − A(SL-A) 的分期读出−2.74 pp95% 区间 −4.48 至 −0.92 pp由分期概率读出的更高描述性对比,不设界值不适用:描述性描述性
S7L1 · REVE Large, pooledSL-A五期睡眠分期C1-fz − B-lin-fz-sgd−0.86 pp95% 区间 −1.60 至 −0.11 ppB-lin-fz-sgd 更高在 ±2 pp 内等效通过门槛由独立的次要审计附上
S7L1 · REVE Large, pooledSL-E下一帧分期是否改变C1-fz − B-lin-fz-sgd+2.30 pp95% 区间 +1.36 至 +3.20 ppC1-fz 更高未达到 2 pp 界值通过门槛由独立的次要审计附上
S7L1 · REVE Large, pooledSL-F前半夜还是后半夜C1-fz − B-lin-fz-sgd+0.08 pp95% 区间 −0.79 至 +0.98 pp未显示差异在 ±2 pp 内等效通过门槛由独立的次要审计附上
S14L1 · CBraMod, pooledSL-A五期睡眠分期B-MLP64-fz − B-sh-fz−0.17 pp95% 区间 −0.89 至 +0.54 pp未显示差异在 ±2 pp 内等效通过门槛由独立的次要审计附上
X1L1 · CBraMod, pooledSL-A五期睡眠分期H − B-lin-fz-sgd−2.72 pp95% 区间 −3.40 至 −2.09 ppB-lin-fz-sgd 更高B-lin-fz-sgd 非劣(界值 2 pp)通过门槛由独立的次要审计附上
S14L1 · CBraMod, pooledSL-E下一帧分期是否改变B-MLP64-fz − B-sh-fz−0.96 pp95% 区间 −1.71 至 −0.23 ppB-sh-fz 更高在 ±2 pp 内等效通过门槛由独立的次要审计附上
X1L1 · CBraMod, pooledSL-E下一帧分期是否改变H − B-lin-fz-sgd−1.94 pp95% 区间 −2.74 至 −1.14 ppB-lin-fz-sgd 更高B-lin-fz-sgd 非劣(界值 2 pp)通过门槛由独立的次要审计附上
S14L1 · CBraMod, pooledSL-F前半夜还是后半夜B-MLP64-fz − B-sh-fz−0.33 pp95% 区间 −1.13 至 +0.53 pp未显示差异在 ±2 pp 内等效通过门槛由独立的次要审计附上
X1L1 · CBraMod, pooledSL-F前半夜还是后半夜H − B-lin-fz-sgd−1.50 pp95% 区间 −2.29 至 −0.73 ppB-lin-fz-sgd 更高B-lin-fz-sgd 非劣(界值 2 pp)通过门槛由独立的次要审计附上
S8L1 · CBraMod tokensSL-A五期睡眠分期C2-fz − B-lin-fz-sgd+1.64 pp95% 区间 +0.58 至 +2.70 ppC2-fz 更高未达到 2 pp 界值通过门槛由独立的次要审计附上
S8L1 · CBraMod tokensSL-E下一帧分期是否改变C2-fz − B-lin-fz-sgd+2.93 pp95% 区间 +2.02 至 +3.83 ppC2-fz 更高未达到 2 pp 界值通过门槛由独立的次要审计附上
S8L1 · CBraMod tokensSL-F前半夜还是后半夜C2-fz − B-lin-fz-sgd+1.05 pp95% 区间 −0.03 至 +2.11 pp未显示差异未达到 2 pp 界值在这个样本量下无法下结论通过门槛由独立的次要审计附上
S23 个随机种子由独立审计算出L1SL-A五期睡眠分期B-sh-fz − B-lin-fz-sgd+0.72 pp95% 区间 −0.13 至 +1.64 pp未显示差异在 ±2 pp 内等效通过门槛所在层级的门槛
S23 个随机种子由独立审计算出L1SL-E下一帧分期是否改变B-sh-fz − B-lin-fz-sgd+1.97 pp95% 区间 +1.21 至 +2.74 ppB-sh-fz 更高未达到 2 pp 界值通过门槛所在层级的门槛
S23 个随机种子由独立审计算出L1SL-F前半夜还是后半夜B-sh-fz − B-lin-fz-sgd+0.72 pp95% 区间 −0.01 至 +1.51 pp未显示差异在 ±2 pp 内等效通过门槛所在层级的门槛
可由睡眠分期推出的问题(S4),log R
条目对比log RRAUROC,专用 / 读出是否显示差异界值 20%门槛
S4-SL-C100 名被试SL-C · A(SL-C) / A(SL-A)−0.82495% 区间 −0.980 至 −0.6750.4380.908 / 0.789专用模型剩余的错误更少未达到 20% 界值通过门槛由运行本身附上
S4-SL-D71 名被试SL-D · A(SL-D) / A(SL-A)0.12695% 区间 −0.002 至 0.2511.1340.975 / 0.978未显示差异读出非劣(界值 20%)通过门槛由运行本身附上
S4-within-B-lin(K-all)100 名被试SL-B · B-lin(K-all) / B-lin(K-all)−0.52595% 区间 −0.665 至 −0.3950.5920.946 / 0.908专用模型剩余的错误更少未达到 20% 界值通过门槛由运行本身附上
S4-within-C1(K-all)100 名被试SL-B · C1(K-all) / C1(K-all)−0.08895% 区间 −0.144 至 −0.0310.9160.946 / 0.941专用模型剩余的错误更少在 20% 界值内等效通过门槛由运行本身附上

一致性(描述性):专用的清醒、REM 或 N3 分类头与同一设置的五期分类头相互矛盾的测试数据帧所占比例——B-lin(K-all):SL-B 17.2%,SL-C 21.0%,SL-D 1.0%;C1(K-all):SL-B 9.8%,SL-C 12.9%,SL-D 1.2%;A(SL-B) 对 A(SL-A):16.5%。

方法与局限

这些结果能说明什么、不能说明什么

没有运行与没有报告的内容

核查

三份独立审计不借用研究代码,重新实现了各项定义,并从冻结的预测重算了这些数字:主审计通过了 10 项检查中的 10 项,重算 1,673 个数值;次要审计通过 10 项中的 10 项,重算 971 个;E2 睡眠审计通过 25 项中的 25 项;都没有发现不一致。

所用的记录

OpenBMI motor imagery (Lee et al. 2019)

Min-Ho Lee, O-Yeon Kwon, Yong-Jeong Kim, Hong-Kyung Kim, Young-Eun Lee, John Williamson, Siamac Fazli and Seong-Whan Lee · EEG dataset and OpenBMI toolbox for three BCI paradigms: an investigation into BCI illiteracy, GigaScience (2019), giz002, doi:10.1093/gigascience/giz002. Data: Supporting data, GigaScience Database, doi:10.5524/100542.

来源 ↗ · CC0-1.0

BOAS, the Bitbrain Open Access Sleep dataset

Eduardo López-Larraz, María Sierra-Torralba, Sergio Clemente, Galit Fierro, David Oriol, Javier Minguez, Luis Montesano and Jens G. Klinzing · The Bitbrain Open Access Sleep (BOAS) dataset, OpenNeuro ds005555, version 1.1.3 (2026), doi:10.18112/openneuro.ds005555.v1.1.3. Polysomnography EEG and the human-consensus stage labels only; the headband recordings and the publisher's automatic labels are not used.

来源 ↗ · CC0-1.0

EESM19, full release (first scorer)

Kaare B. Mikkelsen et al. · Accurate whole-night sleep monitoring with dry-contact ear-EEG (2019), doi:10.1038/s41598-019-53115-3; OpenNeuro ds005185 v1.0.2. Processed mirror: Zachary1150/EESM19-Processed.

来源 ↗ · CC0-1.0 declared by upstream and mirror

这些结果所依据的方法(2026 年 10 月 7 日对照 arXiv 核查标题)

数据来源: shared-representation-update.json · schema bci-report-shared-representation-update-v1 · 生成于 2026-10-07。

引用本页

BCI Report. 一个 EEG 模型回答同一份数据上的多个问题,能和分开的模型一样好吗,代价又是多少?[EB/OL]. (2026-10-07). https://bci.report/zh/topics/shared-encoder/

数字来自发布 shared-representation-update-20261007(2026-10-07)。也请同时引用上游数据集:署名就在本页。

每个发布版本都在 Zenodo 存档:doi:10.5281/zenodo.23123296。 本站及各次发布的 BibTeX → · CITATION.cff ↗(英文)