# 一个 EEG 模型回答同一份数据上的多个问题，能和分开的模型一样好吗，代价又是多少？

共享编码器 · 决策研究计划的第二条路线

一个编码器回答同一批窗口上的多个问题，对比每个问题单独一个模型，以及“知道自己在回答哪个问题”的分类头，数据量与计算量保持一致。运动想象用 OpenBMI，睡眠用 BOAS，EESM19 作为粗略重复。

- [已审核的聚合 JSON ↓](https://bci.report/data/shared-representation-update.json)
- 

测量所用数据集： [EESM19 scalp subset](https://bci.report/zh/datasets/eesm19/)、[OpenBMI motor imagery (Lee et al. 2019)](https://bci.report/zh/datasets/openbmi/)、[BOAS · Bitbrain Open Access Sleep dataset](https://bci.report/zh/datasets/boas/) · 方法： [EEGNet](https://bci.report/zh/methods/eegnet/)、[CBraMod](https://bci.report/zh/methods/cbramod/)

## 简答

在这些数据上，没能证明更省的设置也一样好。共享一个 EEGNet、每个问题配一个固定线性输出，比“知道自己在回答哪个问题”的分类头更省（运动想象上可训练参数 **3,060** 个，对比 **20,116** 个），但没能证明它与那个分类头相差在 2 pp（百分点）以内——这是运行前就定下的界值。在想象还是静息这个问题上（OpenBMI，**51** 名被试），那个分类头高出 **+1.48 pp**（**+0.09** 至 **+2.89 pp**）；在睡眠五期分期上（BOAS），整个区间都高于 2 pp。告诉模型是哪个问题，本身没有可测的帮助：同一个隐藏层不告诉它问题时，在两个运动想象问题上都与那个分类头在 ±2 pp 内等效，在睡眠上非劣（界值 2 pp）。与每个问题单独一个 EEGNet 相比，共享一个小 EEGNet 主干在“哪只手”上的差值是 **−1.43 pp**（**−2.57** 至 **−0.39 pp**）：显示出差异，而且不能排除损失达到 2 pp 或以上；在想象还是静息和睡眠分期上，这项比较无法下结论。

比较方法

## 四种设置，同一组问题

每个问题都是数据集里已有的标签，按标识提问：模型知道自己在回答哪个问题，但问题从不以文字给出。四种设置用同样的窗口回答同样的问题。

- **A · 分开的模型**：每个问题一个模型。
- **B-lin · 固定分类头**：一个共享编码器，每个问题一个线性输出；参数最少。
- **B-sh · 共享隐藏层**：共享编码器之后接一个所有问题共用的隐藏层，再给每个问题一个输出。
- **C1 · 问题条件化分类头**：在 B-sh 的基础上，用一个学到的问题编码逐个问题调整隐藏层（FiLM）。

B-lin、B-sh 和 C1 从同样的初始权重出发，按同样的顺序看同样的批次，训练同样多的步数。两个主分析层级各跑 3 个随机种子：从头训练的 EEGNet（E1），以及在冻结的 CBraMod 特征上只训分类头（L1；同样的设置，加 -fz 标记）。用 LoRA 适配的 CBraMod（E2）只跑 1 个随机种子，作为次要层级。

三项比较回答这个问题。P1，C1 − B-lin：固定分类头能不能做得一样好？P5，C1 − B-sh：告诉分类头是哪个问题，有没有帮助？P2，B-lin − A：共享一个编码器会不会损失准确率？P4 是冻结 CBraMod 特征上的 P1。

每项比较都是平衡准确率的配对差值，单位是 pp，95% 区间由对被试重采样得到（有 3 个随机种子时，也对训练过程重采样）。每项比较都有两种读法。区间不含零，才算显示出差异。界值是 ±2 pp，由所有者在任何结果出来之前定下：整个区间都在界值以内，算等效；起作用的那一端在界值以内，算非劣；否则就是未达到界值。只有当一个领域里每个计入的问题在 P1 上都达到界值、而且固定分类头更省时，才说“固定分类头以更少的代价做得一样好”。固定分类头的准确率没有明显高于随机水平加 5 pp 的问题处于下限：照样报告，但从不计入。

主分析共有 21 项比较，不做多重比较校正，所以在没有真实差异的比较里，约每 20 项就可能有 1 项偶然显示出差异。平衡准确率先逐人计算，再在被试之间平均：它用来比较设置，不是部署时的错误率。这是“[何时不该执行](https://bci.report/zh/topics/when-not-to-act/#decision-research)”页上研究计划的第二条路线。

主分析 · OpenBMI · EEGNet 与 CBraMod

## 运动想象：想象还是静息，哪只手

对 OpenBMI 运动想象段和静息记录中的每个 2 秒窗口，问两个问题：被试是在想象手部动作还是在静息（MI-A），以及是哪只手（MI-B，只用离线试次）？共 31,653 个窗口，来自 51 名被试；每名被试的两次会话都在同一折里，所以每次测试都是在新被试上。两个问题都通过了捷径检查和门槛，都计入。

**+1.48 pp** MI-A 上的 C1 − B-lin，从头训练的 EEGNet，3 个随机种子

### “固定分类头以更少的代价做得一样好”：未得到支持

在想象还是静息上，条件化分类头比固定分类头高出 +1.48 pp（+0.09 至 +2.89 pp）：不能排除差距达到 2 pp 或以上。在哪只手上，两者在 ±2 pp 内等效（−0.09 pp，−1.24 至 +1.04 pp）。固定分类头是更省的设置：可训练参数 3,060 个，对比 20,116 个；每个窗口的分类头乘加次数 960 次，对比 15,744 次。

平衡准确率的配对差值（pp），附 95% 区间；51 名被试，3 个随机种子。

| 比较 | 问题 | 差值（pp） | 是否显示差异 | 界值 ±2 pp | 门槛 |
| --- | --- | --- | --- | --- | --- |
| 从头训练的 EEGNet（E1） |  |  |  |  |  |
| P1 · 条件化分类头 − 固定分类头 — C1 − B-lin | MI-A — 想象还是静息 | +1.48 pp (95% 区间 +0.09 至 +2.89 pp) | C1 更高 | 未达到 2 pp 界值 | 通过门槛 |
| P1 · 条件化分类头 − 固定分类头 — C1 − B-lin | MI-B — 哪只手 | −0.09 pp (95% 区间 −1.24 至 +1.04 pp) | 未显示差异 | 在 ±2 pp 内等效 | 通过门槛 |
| P5 · 条件化分类头 − 不告知问题的同一隐藏层 — C1 − B-sh | MI-A — 想象还是静息 | +0.31 pp (95% 区间 −0.91 至 +1.54 pp) | 未显示差异 | 在 ±2 pp 内等效 | 通过门槛 |
| P5 · 条件化分类头 − 不告知问题的同一隐藏层 — C1 − B-sh | MI-B — 哪只手 | +0.45 pp (95% 区间 −0.60 至 +1.34 pp) | 未显示差异 | 在 ±2 pp 内等效 | 通过门槛 |
| P2 · 一个小 CNN 主干上的固定分类头 − 分开的模型 — B-lin − A(MI-A) | MI-A — 想象还是静息 | −1.00 pp (95% 区间 −2.21 至 +0.19 pp) | 未显示差异 | 未达到 2 pp 界值 — 在这个样本量下无法下结论 | 通过门槛 |
| P2 · 一个小 CNN 主干上的固定分类头 − 分开的模型 — B-lin − A(MI-B) | MI-B — 哪只手 | −1.43 pp (95% 区间 −2.57 至 −0.39 pp) | A(MI-B) 更高 | 未达到 2 pp 界值 | 通过门槛 |
| 冻结 CBraMod 特征上的分类头（L1） |  |  |  |  |  |
| P4 · 条件化分类头 − 固定分类头 — C1-fz − B-lin-fz-sgd | MI-A — 想象还是静息 | +1.54 pp (95% 区间 +0.86 至 +2.30 pp) | C1-fz 更高 | 未达到 2 pp 界值 | 通过门槛 |
| P4 · 条件化分类头 − 固定分类头 — C1-fz − B-lin-fz-sgd | MI-B — 哪只手 | +1.09 pp (95% 区间 +0.08 至 +2.12 pp) | C1-fz 更高 | 未达到 2 pp 界值 — 处于下限，不读界值 | 处于下限：报告，不计入 |
| S1 · 条件化分类头 − 不告知问题的同一隐藏层 · 次要 — C1-fz − B-sh-fz | MI-A — 想象还是静息 | −0.12 pp (95% 区间 −0.64 至 +0.33 pp) | 未显示差异 | 在 ±2 pp 内等效 | 通过门槛 |
| S1 · 条件化分类头 − 不告知问题的同一隐藏层 · 次要 — C1-fz − B-sh-fz | MI-B — 哪只手 | +0.43 pp (95% 区间 −0.39 至 +1.21 pp) | 未显示差异 | 在 ±2 pp 内等效 — 处于下限，不读界值 | 处于下限：报告，不计入 |

告诉分类头是哪个问题，没有带来可测的帮助：从头训练时，C1 − B-sh 在两个问题上都在 ±2 pp 内等效；在冻结特征上，想象还是静息也是如此。但这说明不了条件化分类头比固定分类头高出的部分从何而来：不告诉它问题的同一隐藏层对比固定分类头（B-sh − B-lin，次要对比 S2），在想象还是静息上为 +1.17 pp（−0.09 至 +2.54 pp），在这个样本量下无法下结论。与每个问题单独一个 EEGNet 相比，共享一个小主干（2,096 个参数）在哪只手上的差值是 −1.43 pp（−2.57 至 −0.39 pp）：显示出差异，而且不能排除损失达到 2 pp 或以上；在想象还是静息上无法下结论。在冻结的 CBraMod 特征上，条件化分类头在想象还是静息上再次更高（+1.54 pp，+0.86 至 +2.30 pp）；哪只手在那里处于下限。

每种设置的平衡准确率：51 名被试的均值，附 95% 区间。随机水平为 50.0%；门槛的下限为 55.0%。区间重叠时不排名：上面的配对差值才是比较。

| 设置 | MI-A · 想象还是静息 | MI-B · 哪只手 |
| --- | --- | --- |
| EEGNet，从头训练（E1） |  |  |
| 固定分类头 — B-lin | 73.2% (95% 区间 70.2%–76.2%) | 67.5% (95% 区间 64.6%–70.5%) |
| 共享隐藏层 — B-sh | 74.3% (95% 区间 71.3%–77.3%) | 67.0% (95% 区间 64.1%–69.9%) |
| 问题条件化分类头 — C1 | 74.6% (95% 区间 71.9%–77.5%) | 67.4% (95% 区间 64.4%–70.5%) |
| 分开的模型 — A | 74.2% (95% 区间 71.3%–76.9%) | 69.0% (95% 区间 65.9%–72.0%) |
| 冻结的 CBraMod 特征（L1） |  |  |
| 固定分类头 — B-lin-fz-sgd | 69.2% (95% 区间 67.0%–71.5%) | 56.1% (95% 区间 54.8%–57.4%) |
| 共享隐藏层 — B-sh-fz | 70.9% (95% 区间 68.4%–73.4%) | 56.7% (95% 区间 55.4%–58.2%) |
| 问题条件化分类头 — C1-fz | 70.8% (95% 区间 68.4%–73.2%) | 57.2% (95% 区间 55.8%–58.6%) |

每种设置在运动想象上的代价（EEGNet，E1）。参数量、编码器前向次数、乘加次数和步数是精确值。每步耗时是在共享 GPU 上各设置交替测量一次得到的，只供参考：在代价规则里，耗时相差超过 1.2 倍才算数。

| 设置 | 可训练参数 | 每个窗口的编码器前向次数 | 每个窗口的分类头乘加次数 | 每次拟合的训练步数 | 每步耗时 |
| --- | --- | --- | --- | --- | --- |
| 固定分类头 — B-lin | 3,060 (编码器 2,096 · 分类头 964 · 条件化 0) | 1 | 960 | 7,928 | 7.71 ms |
| 共享隐藏层 — B-sh | 18,402 (编码器 2,096 · 分类头 16,306 · 条件化 0) | 1 | 16,104 | 7,928 | 7.80 ms |
| 问题条件化分类头 — C1 | 20,116 (编码器 2,096 · 分类头 15,812 · 条件化 2,208) | 1 | 15,744 | 7,928 | 7.89 ms |
| 分开的模型 — A | 5,156 (每个问题一个 EEGNet) | 2 | 960 | 10,492 | 7.55 ms |

### 捷径检查和门槛排除了什么

捷径检查（canary）：在任何拟合之前，用每个窗口各通道的均值和对数方差训练一个岭回归分类器，只在第一折的 40 名训练被试内部训练和测试，看一个问题能不能只靠这些统计量回答；达到 85.0% 或以上的问题会被降级。结果为 MI-A 66.1%、MI-B 55.9%、MI-C 60.1%、MI-D 47.3%，所以没有问题被降级。门槛排除了一项：在冻结的 CBraMod 特征上，固定分类头在哪只手上的得分为 56.1%（54.8%–57.4%），区间没有完全高于 55.0% 的下限，所以这个问题在那里处于下限。

主分析 · BOAS · EEGNet 与 CBraMod

## 睡眠：分期、下一帧是否改变、前半夜还是后半夜

对 6 个多导睡眠图 EEG 通道上的每个 30 秒数据帧问三个问题，以人工共识分期为标准：睡眠分期（SL-A），下一帧的分期是否改变（SL-E），以及是前半夜还是后半夜（SL-F）。共 119,725 个数据帧，来自 100 名被试；同一名被试的所有夜晚都在同一折里。各期保持自然比例：W 16.0%，N1 3.7%，N2 60.3%，N3 4.4%，REM 15.7%；有 8.6% 的数据帧在下一帧改变分期。SL-E 和 SL-F 在很大程度上可以由当前分期预测：只用真实的当前分期读出，就能达到 61.9% 和 59.2%。

**BOAS 在说明三处缺口后发布（所有者决定，2026 年 10 月 7 日）：**

- 知情同意声明没有说明被试是否同意公开共享或二次使用。The consent statement does not say whether participants agreed to public sharing or secondary use.
- 伦理与知情同意的陈述只来自发布者的数据集说明与 README，没有任何同行评审论文描述 BOAS。The ethics and consent statements come from the publisher's dataset description and README. No peer-reviewed paper describes BOAS.
- 伦理批件编号是在 1.1.1 版（2025 年 5 月）才加入发布的，发布中没有说明它是在记录之前还是之后批准的。The ethics reference was added to the release in version 1.1.1 (May 2025), and the release does not say when it was granted relative to the recordings.

被试在公开发布中是假名化的。这里没有任何结果是在评估 Bitbrain 的头带或它的自动睡眠分期；两者都没有使用。No result here evaluates Bitbrain's headband or its automatic sleep scoring; neither is used.

**署名：** Eduardo López-Larraz, María Sierra-Torralba, Sergio Clemente, Galit Fierro, David Oriol, Javier Minguez, Luis Montesano and Jens G. Klinzing · The Bitbrain Open Access Sleep (BOAS) dataset, OpenNeuro ds005555, version 1.1.3 (2026), doi:10.18112/openneuro.ds005555.v1.1.3. Polysomnography EEG and the human-consensus stage labels only; the headband recordings and the publisher's automatic labels are not used.

**+6.96 pp** SL-A 上的 C1 − B-lin，从头训练的 EEGNet，3 个随机种子

### “固定分类头以更少的代价做得一样好”：未得到支持

只有睡眠分期计入。在 EEGNet 上，固定分类头在下一帧是否改变上处于下限（54.4%，53.5%–55.4%），在前半夜还是后半夜上也是（54.2%，53.0%–55.6%）：照样报告，但不计入。在睡眠分期上，条件化分类头比固定分类头高出 +6.96 pp（+4.92 至 +9.09 pp）：整个区间都高于 +2 pp。固定分类头更省：可训练参数 34,905 个，对比 243,817 个；每个数据帧的分类头乘加次数 33,696 次，对比 240,384 次；每步也更快。

平衡准确率的配对差值（pp），附 95% 区间；100 名被试，3 个随机种子。

| 比较 | 问题 | 差值（pp） | 是否显示差异 | 界值 ±2 pp | 门槛 |
| --- | --- | --- | --- | --- | --- |
| 从头训练的 EEGNet（E1） |  |  |  |  |  |
| P1 · 条件化分类头 − 固定分类头 — C1 − B-lin | SL-A — 五期睡眠分期 | +6.96 pp (95% 区间 +4.92 至 +9.09 pp) | C1 更高 | 未达到 2 pp 界值 | 通过门槛 |
| P1 · 条件化分类头 − 固定分类头 — C1 − B-lin | SL-E — 下一帧分期是否改变 | +3.02 pp (95% 区间 +1.55 至 +4.35 pp) | C1 更高 | 未达到 2 pp 界值 — 处于下限，不读界值 | 处于下限：报告，不计入 |
| P1 · 条件化分类头 − 固定分类头 — C1 − B-lin | SL-F — 前半夜还是后半夜 | +1.42 pp (95% 区间 −0.25 至 +2.90 pp) | 未显示差异 | 未达到 2 pp 界值 — 在这个样本量下无法下结论 — 处于下限，不读界值 | 处于下限：报告，不计入 |
| P5 · 条件化分类头 − 不告知问题的同一隐藏层 — C1 − B-sh | SL-A — 五期睡眠分期 | −1.47 pp (95% 区间 −3.79 至 +0.94 pp) | 未显示差异 | B-sh 非劣（界值 2 pp） | 通过门槛 |
| P5 · 条件化分类头 − 不告知问题的同一隐藏层 — C1 − B-sh | SL-E — 下一帧分期是否改变 | −1.41 pp (95% 区间 −2.40 至 −0.50 pp) | B-sh 更高 | B-sh 非劣（界值 2 pp） — 处于下限，不读界值 | 处于下限：报告，不计入 |
| P5 · 条件化分类头 − 不告知问题的同一隐藏层 — C1 − B-sh | SL-F — 前半夜还是后半夜 | −0.14 pp (95% 区间 −1.41 至 +1.15 pp) | 未显示差异 | 在 ±2 pp 内等效 — 处于下限，不读界值 | 处于下限：报告，不计入 |
| P2 · 一个小 CNN 主干上的固定分类头 − 分开的模型 — B-lin − A(SL-A) | SL-A — 五期睡眠分期 | −0.84 pp (95% 区间 −2.73 至 +0.91 pp) | 未显示差异 | 未达到 2 pp 界值 — 在这个样本量下无法下结论 | 通过门槛 |
| P2 · 一个小 CNN 主干上的固定分类头 − 分开的模型 — B-lin − A(SL-E) | SL-E — 下一帧分期是否改变 | +1.20 pp (95% 区间 +0.07 至 +2.44 pp) | B-lin 更高 | B-lin 非劣（界值 2 pp） — 处于下限，不读界值 | 处于下限：报告，不计入 |
| P2 · 一个小 CNN 主干上的固定分类头 − 分开的模型 — B-lin − A(SL-F) | SL-F — 前半夜还是后半夜 | +2.01 pp (95% 区间 +0.54 至 +3.89 pp) | B-lin 更高 | B-lin 非劣（界值 2 pp） — 处于下限，不读界值 | 处于下限：报告，不计入 |
| 冻结 CBraMod 特征上的分类头（L1） |  |  |  |  |  |
| P4 · 条件化分类头 − 固定分类头 — C1-fz − B-lin-fz-sgd | SL-A — 五期睡眠分期 | +0.19 pp (95% 区间 −0.74 至 +1.14 pp) | 未显示差异 | 在 ±2 pp 内等效 | 通过门槛 |
| P4 · 条件化分类头 − 固定分类头 — C1-fz − B-lin-fz-sgd | SL-E — 下一帧分期是否改变 | +1.75 pp (95% 区间 +0.92 至 +2.63 pp) | C1-fz 更高 | 未达到 2 pp 界值 | 通过门槛 |
| P4 · 条件化分类头 − 固定分类头 — C1-fz − B-lin-fz-sgd | SL-F — 前半夜还是后半夜 | +0.77 pp (95% 区间 −0.14 至 +1.67 pp) | 未显示差异 | 在 ±2 pp 内等效 | 通过门槛 |
| S1 · 条件化分类头 − 不告知问题的同一隐藏层 · 次要 — C1-fz − B-sh-fz | SL-A — 五期睡眠分期 | −0.53 pp (95% 区间 −1.10 至 +0.01 pp) | 未显示差异 | 在 ±2 pp 内等效 | 通过门槛 |
| S1 · 条件化分类头 − 不告知问题的同一隐藏层 · 次要 — C1-fz − B-sh-fz | SL-E — 下一帧分期是否改变 | −0.22 pp (95% 区间 −0.76 至 +0.30 pp) | 未显示差异 | 在 ±2 pp 内等效 | 通过门槛 |
| S1 · 条件化分类头 − 不告知问题的同一隐藏层 · 次要 — C1-fz − B-sh-fz | SL-F — 前半夜还是后半夜 | +0.05 pp (95% 区间 −0.57 至 +0.70 pp) | 未显示差异 | 在 ±2 pp 内等效 | 通过门槛 |

在睡眠分期上，高出的部分来自隐藏层：不告诉它问题的同一隐藏层比固定分类头高出 +8.43 pp（B-sh − B-lin，次要对比 S2；+5.83 至 +11.12 pp），而 C1 − B-sh 为 −1.47 pp（−3.79 至 +0.94 pp），B-sh 非劣（界值 2 pp）；在冻结的 CBraMod 特征上，C1 − B-sh 在三个问题上都在 ±2 pp 内等效。共享主干与分开的模型相比，在睡眠分期上无法下结论。在冻结的 CBraMod 特征上，固定分类头在睡眠分期和前半夜还是后半夜上都与条件化分类头在 ±2 pp 内等效，在下一帧是否改变上则不然（+1.75 pp，+0.92 至 +2.63 pp）。小 EEGNet 主干的五期分期准确率不高：固定分类头 34.4%，条件化分类头 41.4%，随机水平为 20.0%；冻结 CBraMod 特征上的固定分类头达到 70.7%。

每种设置的平衡准确率：100 名被试的均值，附 95% 区间。睡眠分期的随机水平为 20.0%，另两个问题为 50.0%；门槛的下限分别为 25.0% 和 55.0%。区间重叠时不排名。

| 设置 | SL-A · 五期睡眠分期 | SL-E · 下一帧分期是否改变 | SL-F · 前半夜还是后半夜 |
| --- | --- | --- | --- |
| EEGNet，从头训练（E1） |  |  |  |
| 固定分类头 — B-lin | 34.4% (95% 区间 32.1%–37.0%) | 54.4% (95% 区间 53.5%–55.4%) | 54.2% (95% 区间 53.0%–55.6%) |
| 共享隐藏层 — B-sh | 42.9% (95% 区间 40.1%–45.7%) | 58.9% (95% 区间 57.5%–60.2%) | 55.8% (95% 区间 54.2%–57.4%) |
| 问题条件化分类头 — C1 | 41.4% (95% 区间 38.6%–44.2%) | 57.5% (95% 区间 56.0%–58.8%) | 55.6% (95% 区间 54.2%–57.1%) |
| 分开的模型 — A | 35.3% (95% 区间 32.9%–37.8%) | 53.2% (95% 区间 52.2%–54.3%) | 52.2% (95% 区间 51.0%–53.7%) |
| 冻结的 CBraMod 特征（L1） |  |  |  |
| 固定分类头 — B-lin-fz-sgd | 70.7% (95% 区间 68.5%–72.7%) | 63.5% (95% 区间 62.3%–64.7%) | 64.5% (95% 区间 62.8%–66.1%) |
| 共享隐藏层 — B-sh-fz | 71.4% (95% 区间 69.1%–73.6%) | 65.5% (95% 区间 64.1%–66.7%) | 65.2% (95% 区间 63.6%–66.9%) |
| 问题条件化分类头 — C1-fz | 70.9% (95% 区间 68.6%–73.0%) | 65.2% (95% 区间 63.9%–66.5%) | 65.2% (95% 区间 63.6%–66.9%) |

### 由另一个问题推出的问题，需要单独的模型吗？

清醒还是睡着（SL-B）可以由睡眠分期推出。单独的清醒/睡眠模型 A(SL-B) 剩余的错误，比从五期模型 A(SL-A) 读出答案更少：它的剩余错误是读出的 0.684 倍。区间不能排除减少 20% 或以上（这是运行前定下的界值），所以“能推出的问题不需要自己的模型”未得到支持。

log R：专用模型的剩余错误（1 − AUROC）与读出的剩余错误之比的对数，附 95% 区间；100 名被试，3 个随机种子。

| 比较 | log R | R | AUROC，专用 / 读出 | 是否显示差异 | 界值 20% | 门槛 |
| --- | --- | --- | --- | --- | --- | --- |
| P3 · 它自己的模型 − 从五期模型读出 — A(SL-B) / A(SL-A) · SL-B | −0.380 (95% 区间 −0.583 至 −0.203) | 0.684 | 0.941 / 0.914 | 专用模型剩余的错误更少 | 未达到 20% 界值 | 通过门槛 |

### 用 LoRA 适配的 CBraMod（E2）：次要，1 个随机种子，最后运行

这一组在 2026 年 10 月 7 日运行，那时本次运行的其他所有结果、以及两份独立审计都已知。它的设计（35 次 LoRA 拟合、随机种子、训练方案、把 30 秒输入切成 15 段 2 秒、各项比较）和运行条件在冻结协议时就已确定，没有任何一项是根据结果选的。为了让拟合能在中断后接着跑，运行时用了临时的私有检查点：运行期间为 33 次拟合写了 39 个，每个要么被同一拟合的下一个覆盖，要么在拟合完成时删除，没有一个留到拟合结束之后，现在剩下 0 个；运行前对续训做的一次检查，也以同样的方式删掉了它写的检查点。评分用的是冻结的代码，一份独立审计重算了全部 9 个条目。

平衡准确率的配对差值（pp），附 95% 区间；100 名被试，1 个随机种子：区间里没有训练过程的随机波动。

| 比较 | 问题 | 差值（pp） | 是否显示差异 | 界值 ±2 pp | 门槛 |
| --- | --- | --- | --- | --- | --- |
| S3-P1 · 条件化分类头 − 固定分类头 — C1 − B-lin | SL-A — 五期睡眠分期 | +0.54 pp (95% 区间 −0.41 至 +1.51 pp) | 未显示差异 | 在 ±2 pp 内等效 | 通过门槛 — 由 E2 睡眠评分程序附上，并经其审计重算 |
| S3-P1 · 条件化分类头 − 固定分类头 — C1 − B-lin | SL-E — 下一帧分期是否改变 | +3.00 pp (95% 区间 +2.20 至 +3.81 pp) | C1 更高 | 未达到 2 pp 界值 | 通过门槛 — 由 E2 睡眠评分程序附上，并经其审计重算 |
| S3-P1 · 条件化分类头 − 固定分类头 — C1 − B-lin | SL-F — 前半夜还是后半夜 | +0.80 pp (95% 区间 −0.19 至 +1.79 pp) | 未显示差异 | 在 ±2 pp 内等效 | 通过门槛 — 由 E2 睡眠评分程序附上，并经其审计重算 |
| S3-P5 · 条件化分类头 − 不告知问题的同一隐藏层 — C1 − B-sh | SL-A — 五期睡眠分期 | +0.15 pp (95% 区间 −0.15 至 +0.44 pp) | 未显示差异 | 在 ±2 pp 内等效 | 通过门槛 — 由 E2 睡眠评分程序附上，并经其审计重算 |
| S3-P5 · 条件化分类头 − 不告知问题的同一隐藏层 — C1 − B-sh | SL-E — 下一帧分期是否改变 | +0.15 pp (95% 区间 −0.13 至 +0.44 pp) | 未显示差异 | 在 ±2 pp 内等效 | 通过门槛 — 由 E2 睡眠评分程序附上，并经其审计重算 |
| S3-P5 · 条件化分类头 − 不告知问题的同一隐藏层 — C1 − B-sh | SL-F — 前半夜还是后半夜 | +0.03 pp (95% 区间 −0.23 至 +0.29 pp) | 未显示差异 | 在 ±2 pp 内等效 | 通过门槛 — 由 E2 睡眠评分程序附上，并经其审计重算 |
| S3-P2 · 一个适配后的 CBraMod 上的固定分类头 − 分开的模型 — B-lin − A(SL-A) | SL-A — 五期睡眠分期 | +0.10 pp (95% 区间 −0.50 至 +0.69 pp) | 未显示差异 | 在 ±2 pp 内等效 | 通过门槛 — 由 E2 睡眠评分程序附上，并经其审计重算 |
| S3-P2 · 一个适配后的 CBraMod 上的固定分类头 − 分开的模型 — B-lin − A(SL-E) | SL-E — 下一帧分期是否改变 | −0.70 pp (95% 区间 −1.51 至 +0.10 pp) | 未显示差异 | 在 ±2 pp 内等效 | 通过门槛 — 由 E2 睡眠评分程序附上，并经其审计重算 |
| S3-P2 · 一个适配后的 CBraMod 上的固定分类头 − 分开的模型 — B-lin − A(SL-F) | SL-F — 前半夜还是后半夜 | −0.31 pp (95% 区间 −1.59 至 +0.98 pp) | 未显示差异 | 在 ±2 pp 内等效 | 通过门槛 — 由 E2 睡眠评分程序附上，并经其审计重算 |

适配 CBraMod 之后，固定分类头在睡眠分期和前半夜还是后半夜上与条件化分类头在 ±2 pp 内等效；在下一帧是否改变上，条件化分类头高出 +3.00 pp（+2.20 至 +3.81 pp）。共享与分开的模型相比：三个问题都在 ±2 pp 内等效。门槛所用的设置（E2 的固定分类头）：SL-A 72.8%（70.9%–74.6%），SL-E 65.0%（63.8%–66.2%），SL-F 64.9%（63.3%–66.3%）；全部通过。

每种设置在睡眠上的代价（EEGNet，E1）。参数量、编码器前向次数、乘加次数和步数是精确值。每步耗时是在共享 GPU 上各设置交替测量一次得到的，只供参考：在代价规则里，耗时相差超过 1.2 倍才算数。

| 设置 | 可训练参数 | 每个数据帧的编码器前向次数 | 每个数据帧的分类头乘加次数 | 每次拟合的训练步数 | 每步耗时 |
| --- | --- | --- | --- | --- | --- |
| 固定分类头 — B-lin | 34,905 (编码器 1,200 · 分类头 33,705 · 条件化 0) | 1 | 33,696 | 19,982 | 3.24 ms |
| 共享隐藏层 — B-sh | 241,593 (编码器 1,200 · 分类头 240,393 · 条件化 0) | 1 | 240,192 | 19,982 | 3.56 ms |
| 问题条件化分类头 — C1 | 243,817 (编码器 1,200 · 分类头 240,393 · 条件化 2,224) | 1 | 240,384 | 19,982 | 4.04 ms |
| 分开的模型 — A | 37,305 (每个问题一个 EEGNet) | 3 | 33,696 | 59,916 | 2.60 ms |

### 捷径检查和门槛排除了什么

捷径检查在第一折的 80 名训练被试上的结果为 SL-A 36.8%、SL-B 59.9%、SL-C 70.7%、SL-D 82.1%、SL-E 56.5%、SL-F 58.4%，都低于 85.0%，所以没有问题被降级。门槛在 EEGNet 上排除了下一帧是否改变和前半夜还是后半夜；在冻结的 CBraMod 特征上和适配 CBraMod 之后，每个问题都通过了。

次要 · 粗略重复 · EESM19 · 1 个随机种子

## 在 EESM19 上做同样的比较（粗略）

EESM19 完整版（第一位评分者）中所有通过已发布核心规则的 30 秒存储数据帧，保持自然的分期比例：共 52,311 个数据帧，来自 20 名被试。从头训练的 EEGNet，1 个随机种子，没有共享隐藏层这一设置，所以这里无法把问题编码和隐藏层的作用分开。它与核心矩阵中类别平衡的头皮子集是不同的协议。SL-E 和 SL-F 在很大程度上可以由当前分期预测；这里没有计算只用分期的读出。

平衡准确率的配对差值（pp），附 95% 区间；20 名被试，1 个随机种子。

| 比较 | 问题 | 两种设置的均值 | 差值（pp） | 是否显示差异 | 界值 ±2 pp | 门槛 |
| --- | --- | --- | --- | --- | --- | --- |
| S13-P1 · 条件化分类头 − 固定分类头 — C1 − B-lin | SL-A — 五期睡眠分期 | 66.7% / 63.2% | +3.47 pp (95% 区间 +1.54 至 +5.64 pp) | C1 更高 | 未达到 2 pp 界值 | 通过门槛 — 由运行本身附上 |
| S13-P1 · 条件化分类头 − 固定分类头 — C1 − B-lin | SL-E — 下一帧分期是否改变 | 56.8% / 53.4% | +3.38 pp (95% 区间 +2.27 至 +4.36 pp) | C1 更高 | 未达到 2 pp 界值 — 处于下限，不读界值 | 处于下限：报告，不计入 — 由运行本身附上 |
| S13-P1 · 条件化分类头 − 固定分类头 — C1 − B-lin | SL-F — 前半夜还是后半夜 | 63.8% / 61.8% | +2.09 pp (95% 区间 +0.38 至 +3.74 pp) | C1 更高 | 未达到 2 pp 界值 | 通过门槛 — 由运行本身附上 |
| S13-P2 · 一个小 CNN 主干上的固定分类头 − 分开的模型 — B-lin − A(SL-A) | SL-A — 五期睡眠分期 | 63.2% / 64.7% | −1.47 pp (95% 区间 −2.90 至 −0.10 pp) | A(SL-A) 更高 | 未达到 2 pp 界值 | 通过门槛 — 由运行本身附上 |
| S13-P2 · 一个小 CNN 主干上的固定分类头 − 分开的模型 — B-lin − A(SL-E) | SL-E — 下一帧分期是否改变 | 53.4% / 52.1% | +1.33 pp (95% 区间 +0.42 至 +2.32 pp) | B-lin 更高 | B-lin 非劣（界值 2 pp） — 处于下限，不读界值 | 处于下限：报告，不计入 — 由运行本身附上 |
| S13-P2 · 一个小 CNN 主干上的固定分类头 − 分开的模型 — B-lin − A(SL-F) | SL-F — 前半夜还是后半夜 | 61.8% / 62.5% | −0.72 pp (95% 区间 −2.10 至 +0.69 pp) | 未显示差异 | 未达到 2 pp 界值 — 在这个样本量下无法下结论 | 通过门槛 — 由运行本身附上 |

在睡眠分期上，方向与 BOAS 一致：条件化分类头高于固定分类头（+3.47 pp，+1.54 至 +5.64 pp），未达到界值。捷径检查在 16 名训练被试上没有降级任何问题；门槛排除了下一帧是否改变。

次要 · 探索性

## 次要与探索性结果

运动想象和睡眠上的其他设置，未注明时为 1 个随机种子：所有问题一起训练有什么变化、训练更久、其他编码器和其他分类头。每一项都附上门槛，并注明是谁附上的。

展开次要结果

代号：K-all，数据集的全部问题一起训练（OpenBMI 加上 MI-C 和 MI-D；BOAS 加上 SL-B、SL-C 和 SL-D）；primary K，只训主分析问题；2x，训练轮数加倍；step-matched（步数匹配），A(MI-B) 训练到与共享设置相同的步数；B-MLP64-fz，每个问题单独一个 64 单元的隐藏层；H，基于学到的问题编码的超网络（探索性：按构造与线性分类头等价）；C2-fz，在 CBraMod 的 token 特征上做查询 token。每个门槛都注明是谁附上的：运行本身、所在层级的门槛，或独立的次要审计——冻结的评分漏掉的门槛由它补上。冻结特征上的 S2 是独立的次要审计算出来的，不是运行本身。

运动想象，OpenBMI

| 条目 | 层级 | 问题 | 对比 | 差值（pp） | 是否显示差异 | 界值 ±2 pp | 门槛 |
| --- | --- | --- | --- | --- | --- | --- | --- |
| S2 — 3 个随机种子 | E1 | MI-A — 想象还是静息 | B-sh − B-lin | +1.17 pp (95% 区间 −0.09 至 +2.54 pp) | 未显示差异 | 未达到 2 pp 界值 — 在这个样本量下无法下结论 | 通过门槛 — 由独立的次要审计附上 |
| S2 — 3 个随机种子 | E1 | MI-B — 哪只手 | B-sh − B-lin | −0.54 pp (95% 区间 −1.65 至 +0.74 pp) | 未显示差异 | 在 ±2 pp 内等效 | 通过门槛 — 由独立的次要审计附上 |
| S10 | E1 | MI-A — 想象还是静息 | B-lin(K-all) − B-lin(primary) | −2.32 pp (95% 区间 −3.94 至 −0.75 pp) | B-lin(primary) 更高 | 未达到 2 pp 界值 | 通过门槛 — 由独立的次要审计附上 |
| S10 | E1 | MI-B — 哪只手 | B-lin(K-all) − B-lin(primary) | −1.84 pp (95% 区间 −3.26 至 −0.41 pp) | B-lin(primary) 更高 | 未达到 2 pp 界值 | 通过门槛 — 由独立的次要审计附上 |
| S10 | E1 | MI-A — 想象还是静息 | C1(K-all) − C1(primary) | −1.12 pp (95% 区间 −2.47 至 +0.21 pp) | 未显示差异 | 未达到 2 pp 界值 — 在这个样本量下无法下结论 | 通过门槛 — 由独立的次要审计附上 |
| S10 | E1 | MI-B — 哪只手 | C1(K-all) − C1(primary) | −2.44 pp (95% 区间 −4.75 至 −0.24 pp) | C1(primary) 更高 | 未达到 2 pp 界值 | 通过门槛 — 由独立的次要审计附上 |
| S5 | E1 | MI-A — 想象还是静息 | C1(2x) − B-lin(2x) | +0.89 pp (95% 区间 −0.55 至 +2.59 pp) | 未显示差异 | 未达到 2 pp 界值 — 在这个样本量下无法下结论 | 通过门槛 — 由独立的次要审计附上 |
| S5 | E1 | MI-B — 哪只手 | C1(2x) − B-lin(2x) | −0.24 pp (95% 区间 −1.43 至 +0.98 pp) | 未显示差异 | 在 ±2 pp 内等效 | 通过门槛 — 由独立的次要审计附上 |
| S6-P1 | E1 | MI-C — 离线段还是在线段 | C1(K-all) − B-lin(K-all) | −0.15 pp (95% 区间 −2.86 至 +2.50 pp) | 未显示差异 | 未达到 2 pp 界值 — 在这个样本量下无法下结论 | 通过门槛 — 由独立的次要审计附上 |
| S6-P2 | E1 | MI-C — 离线段还是在线段 | B-lin(K-all) − A(MI-C) | −2.75 pp (95% 区间 −5.43 至 −0.22 pp) | A(MI-C) 更高 | 未达到 2 pp 界值 | 通过门槛 — 由运行本身附上 |
| S6-P1 | E1 | MI-D — 第一天还是第二天 | C1(K-all) − B-lin(K-all) | −0.69 pp (95% 区间 −4.17 至 +2.64 pp) | 未显示差异 | 未达到 2 pp 界值 — 在这个样本量下无法下结论 — 处于下限，不读界值 | 处于下限：报告，不计入 — 由独立的次要审计附上 |
| S6-P2 | E1 | MI-D — 第一天还是第二天 | B-lin(K-all) − A(MI-D) | +0.49 pp (95% 区间 −3.23 至 +3.81 pp) | 未显示差异 | 未达到 2 pp 界值 — 在这个样本量下无法下结论 — 处于下限，不读界值 | 处于下限：报告，不计入 — 由运行本身附上 |
| S12 | E1 | MI-B — 哪只手 | A(MI-B)，步数匹配 − A(MI-B) | −0.03 pp (95% 区间 −1.63 至 +1.44 pp) | 未显示差异 | 在 ±2 pp 内等效 | 通过门槛 — 由独立的次要审计附上 |
| S12-P2 | E1 | MI-B — 哪只手 | B-lin − A(MI-B)，步数匹配 | −0.57 pp (95% 区间 −2.09 至 +1.05 pp) | 未显示差异 | 未达到 2 pp 界值 — 在这个样本量下无法下结论 | 通过门槛 — 由独立的次要审计附上 |
| S3-P1 | E2 | MI-A — 想象还是静息 | C1 − B-lin | −0.43 pp (95% 区间 −1.06 至 +0.18 pp) | 未显示差异 | 在 ±2 pp 内等效 | 通过门槛 — 由独立的次要审计附上 |
| S3-P2 | E2 | MI-A — 想象还是静息 | B-lin − A(MI-A) | −0.09 pp (95% 区间 −0.58 至 +0.39 pp) | 未显示差异 | 在 ±2 pp 内等效 | 通过门槛 — 由独立的次要审计附上 |
| S3-P5 | E2 | MI-A — 想象还是静息 | C1 − B-sh | −0.07 pp (95% 区间 −0.36 至 +0.23 pp) | 未显示差异 | 在 ±2 pp 内等效 | 通过门槛 — 由独立的次要审计附上 |
| S3-P1 | E2 | MI-B — 哪只手 | C1 − B-lin | −1.07 pp (95% 区间 −2.08 至 −0.08 pp) | B-lin 更高 | B-lin 非劣（界值 2 pp） | 通过门槛 — 由独立的次要审计附上 |
| S3-P2 | E2 | MI-B — 哪只手 | B-lin − A(MI-B) | +0.35 pp (95% 区间 −0.46 至 +1.18 pp) | 未显示差异 | 在 ±2 pp 内等效 | 通过门槛 — 由独立的次要审计附上 |
| S3-P5 | E2 | MI-B — 哪只手 | C1 − B-sh | −0.16 pp (95% 区间 −0.71 至 +0.42 pp) | 未显示差异 | 在 ±2 pp 内等效 | 通过门槛 — 由独立的次要审计附上 |
| S7 | L1 · ST-EEGFormer Base, pooled | MI-A — 想象还是静息 | C1-fz − B-lin-fz-sgd | −1.11 pp (95% 区间 −1.89 至 −0.32 pp) | B-lin-fz-sgd 更高 | 在 ±2 pp 内等效 | 通过门槛 — 由独立的次要审计附上 |
| S7 | L1 · ST-EEGFormer Base, pooled | MI-B — 哪只手 | C1-fz − B-lin-fz-sgd | −0.26 pp (95% 区间 −1.43 至 +0.85 pp) | 未显示差异 | 在 ±2 pp 内等效 — 处于下限，不读界值 | 处于下限：报告，不计入 — 由独立的次要审计附上 |
| S14 | L1 · CBraMod, pooled | MI-A — 想象还是静息 | B-MLP64-fz − B-sh-fz | −0.08 pp (95% 区间 −0.66 至 +0.49 pp) | 未显示差异 | 在 ±2 pp 内等效 | 通过门槛 — 由独立的次要审计附上 |
| X1 | L1 · CBraMod, pooled | MI-A — 想象还是静息 | H − B-lin-fz-sgd | −1.78 pp (95% 区间 −2.30 至 −1.24 pp) | B-lin-fz-sgd 更高 | B-lin-fz-sgd 非劣（界值 2 pp） | 通过门槛 — 由独立的次要审计附上 |
| S14 | L1 · CBraMod, pooled | MI-B — 哪只手 | B-MLP64-fz − B-sh-fz | +0.59 pp (95% 区间 −0.32 至 +1.57 pp) | 未显示差异 | 在 ±2 pp 内等效 — 处于下限，不读界值 | 处于下限：报告，不计入 — 由独立的次要审计附上 |
| X1 | L1 · CBraMod, pooled | MI-B — 哪只手 | H − B-lin-fz-sgd | −0.49 pp (95% 区间 −1.17 至 +0.15 pp) | 未显示差异 | 在 ±2 pp 内等效 — 处于下限，不读界值 | 处于下限：报告，不计入 — 由独立的次要审计附上 |
| S8 | L1 · CBraMod tokens | MI-A — 想象还是静息 | C2-fz − B-lin-fz-sgd | −0.95 pp (95% 区间 −2.27 至 +0.45 pp) | 未显示差异 | B-lin-fz-sgd 非劣（界值 2 pp） | 通过门槛 — 由独立的次要审计附上 |
| S8 | L1 · CBraMod tokens | MI-B — 哪只手 | C2-fz − B-lin-fz-sgd | −5.31 pp (95% 区间 −7.09 至 −3.69 pp) | B-lin-fz-sgd 更高 | B-lin-fz-sgd 非劣（界值 2 pp） — 处于下限，不读界值 | 处于下限：报告，不计入 — 由独立的次要审计附上 |
| S2 — 3 个随机种子 — 由独立审计算出 | L1 | MI-A — 想象还是静息 | B-sh-fz − B-lin-fz-sgd | +1.66 pp (95% 区间 +0.95 至 +2.44 pp) | B-sh-fz 更高 | 未达到 2 pp 界值 | 通过门槛 — 所在层级的门槛 |
| S2 — 3 个随机种子 — 由独立审计算出 | L1 | MI-B — 哪只手 | B-sh-fz − B-lin-fz-sgd | +0.66 pp (95% 区间 −0.18 至 +1.48 pp) | 未显示差异 | 在 ±2 pp 内等效 — 处于下限，不读界值 | 处于下限：报告，不计入 — 所在层级的门槛 |

**BOAS 在说明三处缺口后发布（所有者决定，2026 年 10 月 7 日）：**

- 知情同意声明没有说明被试是否同意公开共享或二次使用。The consent statement does not say whether participants agreed to public sharing or secondary use.
- 伦理与知情同意的陈述只来自发布者的数据集说明与 README，没有任何同行评审论文描述 BOAS。The ethics and consent statements come from the publisher's dataset description and README. No peer-reviewed paper describes BOAS.
- 伦理批件编号是在 1.1.1 版（2025 年 5 月）才加入发布的，发布中没有说明它是在记录之前还是之后批准的。The ethics reference was added to the release in version 1.1.1 (May 2025), and the release does not say when it was granted relative to the recordings.

被试在公开发布中是假名化的。这里没有任何结果是在评估 Bitbrain 的头带或它的自动睡眠分期；两者都没有使用。No result here evaluates Bitbrain's headband or its automatic sleep scoring; neither is used.

**署名：** Eduardo López-Larraz, María Sierra-Torralba, Sergio Clemente, Galit Fierro, David Oriol, Javier Minguez, Luis Montesano and Jens G. Klinzing · The Bitbrain Open Access Sleep (BOAS) dataset, OpenNeuro ds005555, version 1.1.3 (2026), doi:10.18112/openneuro.ds005555.v1.1.3. Polysomnography EEG and the human-consensus stage labels only; the headband recordings and the publisher's automatic labels are not used.

睡眠，BOAS

| 条目 | 层级 | 问题 | 对比 | 差值（pp） | 是否显示差异 | 界值 ±2 pp | 门槛 |
| --- | --- | --- | --- | --- | --- | --- | --- |
| S2 — 3 个随机种子 | E1 | SL-A — 五期睡眠分期 | B-sh − B-lin | +8.43 pp (95% 区间 +5.83 至 +11.12 pp) | B-sh 更高 | 未达到 2 pp 界值 | 通过门槛 — 由独立的次要审计附上 |
| S2 — 3 个随机种子 | E1 | SL-E — 下一帧分期是否改变 | B-sh − B-lin | +4.43 pp (95% 区间 +3.10 至 +5.71 pp) | B-sh 更高 | 未达到 2 pp 界值 — 处于下限，不读界值 | 处于下限：报告，不计入 — 由独立的次要审计附上 |
| S2 — 3 个随机种子 | E1 | SL-F — 前半夜还是后半夜 | B-sh − B-lin | +1.56 pp (95% 区间 −0.31 至 +3.49 pp) | 未显示差异 | 未达到 2 pp 界值 — 在这个样本量下无法下结论 — 处于下限，不读界值 | 处于下限：报告，不计入 — 由独立的次要审计附上 |
| S10 | E1 | SL-A — 五期睡眠分期 | B-lin(K-all) − B-lin(primary) | −2.55 pp (95% 区间 −3.86 至 −1.31 pp) | B-lin(primary) 更高 | 未达到 2 pp 界值 | 通过门槛 — 由独立的次要审计附上 |
| S10 | E1 | SL-E — 下一帧分期是否改变 | B-lin(K-all) − B-lin(primary) | +0.97 pp (95% 区间 +0.23 至 +1.71 pp) | B-lin(K-all) 更高 | 在 ±2 pp 内等效 — 处于下限，不读界值 | 处于下限：报告，不计入 — 由独立的次要审计附上 |
| S10 | E1 | SL-F — 前半夜还是后半夜 | B-lin(K-all) − B-lin(primary) | −0.61 pp (95% 区间 −1.37 至 +0.16 pp) | 未显示差异 | 在 ±2 pp 内等效 — 处于下限，不读界值 | 处于下限：报告，不计入 — 由独立的次要审计附上 |
| S10 | E1 | SL-A — 五期睡眠分期 | C1(K-all) − C1(primary) | +4.14 pp (95% 区间 +2.76 至 +5.49 pp) | C1(K-all) 更高 | C1(K-all) 非劣（界值 2 pp） | 通过门槛 — 由独立的次要审计附上 |
| S10 | E1 | SL-E — 下一帧分期是否改变 | C1(K-all) − C1(primary) | +0.96 pp (95% 区间 +0.11 至 +1.79 pp) | C1(K-all) 更高 | 在 ±2 pp 内等效 — 处于下限，不读界值 | 处于下限：报告，不计入 — 由独立的次要审计附上 |
| S10 | E1 | SL-F — 前半夜还是后半夜 | C1(K-all) − C1(primary) | +1.67 pp (95% 区间 +0.55 至 +2.87 pp) | C1(K-all) 更高 | C1(K-all) 非劣（界值 2 pp） — 处于下限，不读界值 | 处于下限：报告，不计入 — 由独立的次要审计附上 |
| S5 | E1 | SL-A — 五期睡眠分期 | C1(2x) − B-lin(2x) | +1.71 pp (95% 区间 +0.12 至 +3.25 pp) | C1(2x) 更高 | 未达到 2 pp 界值 | 通过门槛 — 由独立的次要审计附上 |
| S5 | E1 | SL-E — 下一帧分期是否改变 | C1(2x) − B-lin(2x) | +2.13 pp (95% 区间 +1.27 至 +2.93 pp) | C1(2x) 更高 | 未达到 2 pp 界值 — 处于下限，不读界值 | 处于下限：报告，不计入 — 由独立的次要审计附上 |
| S5 | E1 | SL-F — 前半夜还是后半夜 | C1(2x) − B-lin(2x) | +2.78 pp (95% 区间 +1.72 至 +3.94 pp) | C1(2x) 更高 | 未达到 2 pp 界值 — 处于下限，不读界值 | 处于下限：报告，不计入 — 由独立的次要审计附上 |
| S6-P1 | E1 | SL-C — REM 还是 NREM | C1(K-all) − B-lin(K-all) | +5.50 pp (95% 区间 +4.04 至 +7.04 pp) | C1(K-all) 更高 | 未达到 2 pp 界值 | 通过门槛 — 由独立的次要审计附上 |
| S6-P2 | E1 | SL-C — REM 还是 NREM | B-lin(K-all) − A(SL-C) | −9.59 pp (95% 区间 −11.77 至 −7.58 pp) | A(SL-C) 更高 | 未达到 2 pp 界值 | 通过门槛 — 由运行本身附上 |
| S6-P1 | E1 | SL-D — 是否 N3 | C1(K-all) − B-lin(K-all) | +9.79 pp (95% 区间 +6.69 至 +12.95 pp) | C1(K-all) 更高 | 未达到 2 pp 界值 | 通过门槛 — 由独立的次要审计附上 |
| S6-P2 | E1 | SL-D — 是否 N3 | B-lin(K-all) − A(SL-D) | −2.13 pp (95% 区间 −4.50 至 +0.07 pp) | 未显示差异 | 未达到 2 pp 界值 — 在这个样本量下无法下结论 | 通过门槛 — 由运行本身附上 |
| S11 — 3 个随机种子 | E1 | SL-E — 下一帧分期是否改变 | B-lin − B-lin 的分期读出 | +4.35 pp (95% 区间 +3.46 至 +5.28 pp) | 专用分类头更高 | 描述性对比，不设界值 | 不适用：描述性 — 描述性 |
| S11 — 3 个随机种子 | E1 | SL-E — 下一帧分期是否改变 | B-sh − B-sh 的分期读出 | +8.26 pp (95% 区间 +6.91 至 +9.52 pp) | 专用分类头更高 | 描述性对比，不设界值 | 不适用：描述性 — 描述性 |
| S11 — 3 个随机种子 | E1 | SL-E — 下一帧分期是否改变 | C1 − C1 的分期读出 | +6.67 pp (95% 区间 +5.35 至 +7.90 pp) | 专用分类头更高 | 描述性对比，不设界值 | 不适用：描述性 — 描述性 |
| S11 — 3 个随机种子 | E1 | SL-E — 下一帧分期是否改变 | A(SL-E) − A(SL-A) 的分期读出 | +3.09 pp (95% 区间 +2.02 至 +4.14 pp) | 专用分类头更高 | 描述性对比，不设界值 | 不适用：描述性 — 描述性 |
| S11 — 3 个随机种子 | E1 | SL-F — 前半夜还是后半夜 | B-lin − B-lin 的分期读出 | −0.35 pp (95% 区间 −1.47 至 +0.87 pp) | 未显示差异 | 描述性对比，不设界值 | 不适用：描述性 — 描述性 |
| S11 — 3 个随机种子 | E1 | SL-F — 前半夜还是后半夜 | B-sh − B-sh 的分期读出 | −1.34 pp (95% 区间 −2.22 至 −0.48 pp) | 由分期概率读出的更高 | 描述性对比，不设界值 | 不适用：描述性 — 描述性 |
| S11 — 3 个随机种子 | E1 | SL-F — 前半夜还是后半夜 | C1 − C1 的分期读出 | −1.24 pp (95% 区间 −2.03 至 −0.48 pp) | 由分期概率读出的更高 | 描述性对比，不设界值 | 不适用：描述性 — 描述性 |
| S11 — 3 个随机种子 | E1 | SL-F — 前半夜还是后半夜 | A(SL-F) − A(SL-A) 的分期读出 | −2.74 pp (95% 区间 −4.48 至 −0.92 pp) | 由分期概率读出的更高 | 描述性对比，不设界值 | 不适用：描述性 — 描述性 |
| S7 | L1 · REVE Large, pooled | SL-A — 五期睡眠分期 | C1-fz − B-lin-fz-sgd | −0.86 pp (95% 区间 −1.60 至 −0.11 pp) | B-lin-fz-sgd 更高 | 在 ±2 pp 内等效 | 通过门槛 — 由独立的次要审计附上 |
| S7 | L1 · REVE Large, pooled | SL-E — 下一帧分期是否改变 | C1-fz − B-lin-fz-sgd | +2.30 pp (95% 区间 +1.36 至 +3.20 pp) | C1-fz 更高 | 未达到 2 pp 界值 | 通过门槛 — 由独立的次要审计附上 |
| S7 | L1 · REVE Large, pooled | SL-F — 前半夜还是后半夜 | C1-fz − B-lin-fz-sgd | +0.08 pp (95% 区间 −0.79 至 +0.98 pp) | 未显示差异 | 在 ±2 pp 内等效 | 通过门槛 — 由独立的次要审计附上 |
| S14 | L1 · CBraMod, pooled | SL-A — 五期睡眠分期 | B-MLP64-fz − B-sh-fz | −0.17 pp (95% 区间 −0.89 至 +0.54 pp) | 未显示差异 | 在 ±2 pp 内等效 | 通过门槛 — 由独立的次要审计附上 |
| X1 | L1 · CBraMod, pooled | SL-A — 五期睡眠分期 | H − B-lin-fz-sgd | −2.72 pp (95% 区间 −3.40 至 −2.09 pp) | B-lin-fz-sgd 更高 | B-lin-fz-sgd 非劣（界值 2 pp） | 通过门槛 — 由独立的次要审计附上 |
| S14 | L1 · CBraMod, pooled | SL-E — 下一帧分期是否改变 | B-MLP64-fz − B-sh-fz | −0.96 pp (95% 区间 −1.71 至 −0.23 pp) | B-sh-fz 更高 | 在 ±2 pp 内等效 | 通过门槛 — 由独立的次要审计附上 |
| X1 | L1 · CBraMod, pooled | SL-E — 下一帧分期是否改变 | H − B-lin-fz-sgd | −1.94 pp (95% 区间 −2.74 至 −1.14 pp) | B-lin-fz-sgd 更高 | B-lin-fz-sgd 非劣（界值 2 pp） | 通过门槛 — 由独立的次要审计附上 |
| S14 | L1 · CBraMod, pooled | SL-F — 前半夜还是后半夜 | B-MLP64-fz − B-sh-fz | −0.33 pp (95% 区间 −1.13 至 +0.53 pp) | 未显示差异 | 在 ±2 pp 内等效 | 通过门槛 — 由独立的次要审计附上 |
| X1 | L1 · CBraMod, pooled | SL-F — 前半夜还是后半夜 | H − B-lin-fz-sgd | −1.50 pp (95% 区间 −2.29 至 −0.73 pp) | B-lin-fz-sgd 更高 | B-lin-fz-sgd 非劣（界值 2 pp） | 通过门槛 — 由独立的次要审计附上 |
| S8 | L1 · CBraMod tokens | SL-A — 五期睡眠分期 | C2-fz − B-lin-fz-sgd | +1.64 pp (95% 区间 +0.58 至 +2.70 pp) | C2-fz 更高 | 未达到 2 pp 界值 | 通过门槛 — 由独立的次要审计附上 |
| S8 | L1 · CBraMod tokens | SL-E — 下一帧分期是否改变 | C2-fz − B-lin-fz-sgd | +2.93 pp (95% 区间 +2.02 至 +3.83 pp) | C2-fz 更高 | 未达到 2 pp 界值 | 通过门槛 — 由独立的次要审计附上 |
| S8 | L1 · CBraMod tokens | SL-F — 前半夜还是后半夜 | C2-fz − B-lin-fz-sgd | +1.05 pp (95% 区间 −0.03 至 +2.11 pp) | 未显示差异 | 未达到 2 pp 界值 — 在这个样本量下无法下结论 | 通过门槛 — 由独立的次要审计附上 |
| S2 — 3 个随机种子 — 由独立审计算出 | L1 | SL-A — 五期睡眠分期 | B-sh-fz − B-lin-fz-sgd | +0.72 pp (95% 区间 −0.13 至 +1.64 pp) | 未显示差异 | 在 ±2 pp 内等效 | 通过门槛 — 所在层级的门槛 |
| S2 — 3 个随机种子 — 由独立审计算出 | L1 | SL-E — 下一帧分期是否改变 | B-sh-fz − B-lin-fz-sgd | +1.97 pp (95% 区间 +1.21 至 +2.74 pp) | B-sh-fz 更高 | 未达到 2 pp 界值 | 通过门槛 — 所在层级的门槛 |
| S2 — 3 个随机种子 — 由独立审计算出 | L1 | SL-F — 前半夜还是后半夜 | B-sh-fz − B-lin-fz-sgd | +0.72 pp (95% 区间 −0.01 至 +1.51 pp) | 未显示差异 | 在 ±2 pp 内等效 | 通过门槛 — 所在层级的门槛 |

可由睡眠分期推出的问题（S4），log R

| 条目 | 对比 | log R | R | AUROC，专用 / 读出 | 是否显示差异 | 界值 20% | 门槛 |
| --- | --- | --- | --- | --- | --- | --- | --- |
| S4-SL-C — 100 名被试 | SL-C · A(SL-C) / A(SL-A) | −0.824 (95% 区间 −0.980 至 −0.675) | 0.438 | 0.908 / 0.789 | 专用模型剩余的错误更少 | 未达到 20% 界值 | 通过门槛 — 由运行本身附上 |
| S4-SL-D — 71 名被试 | SL-D · A(SL-D) / A(SL-A) | 0.126 (95% 区间 −0.002 至 0.251) | 1.134 | 0.975 / 0.978 | 未显示差异 | 读出非劣（界值 20%） | 通过门槛 — 由运行本身附上 |
| S4-within-B-lin(K-all) — 100 名被试 | SL-B · B-lin(K-all) / B-lin(K-all) | −0.525 (95% 区间 −0.665 至 −0.395) | 0.592 | 0.946 / 0.908 | 专用模型剩余的错误更少 | 未达到 20% 界值 | 通过门槛 — 由运行本身附上 |
| S4-within-C1(K-all) — 100 名被试 | SL-B · C1(K-all) / C1(K-all) | −0.088 (95% 区间 −0.144 至 −0.031) | 0.916 | 0.946 / 0.941 | 专用模型剩余的错误更少 | 在 20% 界值内等效 | 通过门槛 — 由运行本身附上 |

一致性（描述性）：专用的清醒、REM 或 N3 分类头与同一设置的五期分类头相互矛盾的测试数据帧所占比例——B-lin(K-all)：SL-B 17.2%，SL-C 21.0%，SL-D 1.0%；C1(K-all)：SL-B 9.8%，SL-C 12.9%，SL-D 1.2%；A(SL-B) 对 A(SL-A)：16.5%。

方法与局限

## 这些结果能说明什么、不能说明什么

- 这些问题都是各自数据集里已有标签的分类目标，按标识提问。它们不是语言提示，对没见过的问题也说明不了什么（那是第 3 条路线）。
- MI-A 区分的不只是想象，还有提示画面和在一段记录中所处的位置；MI-B 只用离线试次；MI-C 和 MI-D 关于记录情境，不是大脑状态。
- SL-B、SL-C 和 SL-D 都由 5 期分期标签直接决定。它们上面的结果说明的是分类头的设计，而不是信号里有新的信息。
- SL-F 是夜里的时间段，与分期相关；SL-E 只关乎接下来的 30 秒，不代表一般意义上的预测时距。
- 只用问题标识做条件时，FiLM 与不加条件的同一个分类头之间，只能在各问题的阈值和共享隐藏单元的正负号上有所不同。没有差异，并不说明用语言做条件就帮不上忙。
- 在 E1 层级，共享编码器是一个小 CNN，主干只有 1,200–2,096 个参数；所以那里的 P2 是“小 CNN 主干共享”，不是基础模型共享；E2 在运动想象上只跑了一个随机种子，作为次要分析。
- SL-E 和 SL-F 在很大程度上可以由当前分期预测；它们的结果旁边都给出只用分期读出的结果。
- 能从窗口统计量直接回答的问题，以及处于下限或上限的问题，都照样报告，但不计入路线结论。
- 耗时是在共享 GPU 上测的，只供参考；参数量、编码器前向次数和乘加次数是精确值。
- 三个数据集（EESM19 只是粗略重复），各来自一个实验室，每种编码器一套固定的训练方案：这不是编码器或多任务方法的排名。
- BOAS 保留了自然的分期比例，但只是一个人群、一套多导睡眠图设备；跨被试的平衡准确率不是部署时的错误率。
- 逐人计算的平衡准确率对每名被试同等加权；它用来比较各设置，不是部署时的错误率。
- 这里的 OpenBMI 数字用的是路线 2 自己的 2 秒窗口、不依赖标签的高通滤波和被试不重叠的交叉验证折；不能与本站 OpenBMI 跨会话校准的数字相比。
- EESM19 完整版（S13）用了所有通过已发布核心规则的存储数据帧，保持自然的分期比例；它与本站类别平衡的头皮睡眠子集是不同的协议。
- EESM19（S13）上没有计算只用分期的读出（S11 只在 BOAS 上定义），所以它的 SL-E 和 SL-F 条目都要附上这句话：这两个问题在很大程度上可以由当前分期预测。
- E2 睡眠是在其他所有结果都已知之后才运行的；它的设计与运行条件在冻结时就已确定，没有任何一项是根据结果选的。

### 没有运行与没有报告的内容

- **Ying 2025 多晚睡眠（S9）**：冻结之前由所有者推迟；没有运行任何东西
- **三个随机种子的 E2 运动想象**：没有安排：E2 只跑了一个随机种子，作为次要分析，所以 E1 上的共享对比仍标为“小 CNN 主干共享”
- **冻结 CBraMod 特征上的岭回归参考行（G-1）**：冻结的草案里列了它，但从未实现，事后也没有补算：那需要新的拟合，而它留下的每个选择都会在所有结果已知之后才做。没有任何结论用到它。
- **次要设置在单个设置层面的结果（区间、AUROC、log loss、各随机种子的均值）**：冻结的阶段 2 没有产出这些；每个次要对比都附上了它两个设置的平均平衡准确率。
- **E2 层级上的 P3**：E2 睡眠这一组没有预先声明这项对比，所以它的五个“清醒还是睡着”拟合不进入任何对比。
- **配对对比高于或低于零的被试人数**：BOAS 的权利审核允许发布，但冻结的阶段 2 没有计算，事后也没有补上。

### 核查

三份独立审计不借用研究代码，重新实现了各项定义，并从冻结的预测重算了这些数字：主审计通过了 10 项检查中的 10 项，重算 1,673 个数值；次要审计通过 10 项中的 10 项，重算 971 个；E2 睡眠审计通过 25 项中的 25 项；都没有发现不一致。

### 所用的记录

### OpenBMI motor imagery (Lee et al. 2019)

Min-Ho Lee, O-Yeon Kwon, Yong-Jeong Kim, Hong-Kyung Kim, Young-Eun Lee, John Williamson, Siamac Fazli and Seong-Whan Lee · EEG dataset and OpenBMI toolbox for three BCI paradigms: an investigation into BCI illiteracy, GigaScience (2019), giz002, doi:10.1093/gigascience/giz002. Data: Supporting data, GigaScience Database, doi:10.5524/100542.

[来源 ↗](https://doi.org/10.5524/100542) · [CC0-1.0](https://creativecommons.org/publicdomain/zero/1.0/)

### BOAS, the Bitbrain Open Access Sleep dataset

Eduardo López-Larraz, María Sierra-Torralba, Sergio Clemente, Galit Fierro, David Oriol, Javier Minguez, Luis Montesano and Jens G. Klinzing · The Bitbrain Open Access Sleep (BOAS) dataset, OpenNeuro ds005555, version 1.1.3 (2026), doi:10.18112/openneuro.ds005555.v1.1.3. Polysomnography EEG and the human-consensus stage labels only; the headband recordings and the publisher's automatic labels are not used.

[来源 ↗](https://openneuro.org/datasets/ds005555/versions/1.1.3) · [CC0-1.0](https://creativecommons.org/publicdomain/zero/1.0/)

### EESM19, full release (first scorer)

Kaare B. Mikkelsen et al. · Accurate whole-night sleep monitoring with dry-contact ear-EEG (2019), doi:10.1038/s41598-019-53115-3; OpenNeuro ds005185 v1.0.2. Processed mirror: Zachary1150/EESM19-Processed.

[来源 ↗](https://doi.org/10.18112/openneuro.ds005185.v1.0.2) · [CC0-1.0 declared by upstream and mirror](https://creativecommons.org/publicdomain/zero/1.0/)

### 这些结果所依据的方法（2026 年 10 月 7 日对照 arXiv 核查标题）

- [Yu & Yao, 2026 · Visual Jev: Accurate and Efficient Decisions from Shared Visual Context ↗](https://arxiv.org/abs/2609.25845)
- [Dai et al., 2026 · Towards Unified Multi-task EEG Analysis with Low-Rank Adaptation ↗](https://arxiv.org/abs/2604.25131)
- [Xiong et al., 2025 · EEG-FM-Bench: A Comprehensive Benchmark for the Systematic Evaluation and Diagnostic Analyses of EEG Foundation Models ↗](https://arxiv.org/abs/2508.17742)
- [Perez et al., 2017 · FiLM: Visual Reasoning with a General Conditioning Layer ↗](https://arxiv.org/abs/1709.07871)
- [Ha, Dai & Le, 2016 · HyperNetworks ↗](https://arxiv.org/abs/1609.09106)

数据来源： [shared-representation-update.json](https://bci.report/data/shared-representation-update.json) · schema bci-report-shared-representation-update-v1 · 生成于 2026-10-07。

继续探索

迁移

- [— 传感器迁移 **干电极与湿电极**](https://bci.report/zh/topics/dry-vs-wet/)
- [— 场景迁移 **从屏幕到 VR**](https://bci.report/zh/topics/screen-to-vr/)
- [— 电极布局 **更少的电极**](https://bci.report/zh/topics/fewer-electrodes/)
- [— 运动鲁棒性 **移动中的解码**](https://bci.report/zh/topics/on-the-move/)

调整模型

- [— 校准预算 **需要多少校准？**](https://bci.report/zh/topics/calibration-budget/)
- [— 模型适配 **该更新哪一部分？**](https://bci.report/zh/topics/model-adaptation/)
- [— 表征对照 **预训练有用吗？**](https://bci.report/zh/topics/does-pretraining-help/)
- [— 共享编码器 · 第二条路线 **一个模型，多个问题**](https://bci.report/zh/topics/shared-encoder/)

可靠性与临床

- [— 拒识 · Jev-style **何时不该执行**](https://bci.report/zh/topics/when-not-to-act/)
- [— 睡眠分期 · 简单基线 **睡眠分期的失衡**](https://bci.report/zh/topics/sleep-staging/)
- [— 临床研究 **临床分组**](https://bci.report/zh/topics/clinical-groups/)

[全部问题，以及哪些迁移已经测量过的地图 →](https://bci.report/zh/topics/)

## 引用本页

BCI Report. *一个 EEG 模型回答同一份数据上的多个问题，能和分开的模型一样好吗，代价又是多少？*[EB/OL]. (2026-10-07). https://bci.report/zh/topics/shared-encoder/

数字来自发布 [`shared-representation-update-20261007`](https://bci.report/zh/releases/#shared-representation-update-20261007)（2026-10-07）。也请同时引用上游数据集：署名就在本页。

每个发布版本都在 Zenodo 存档：[doi:10.5281/zenodo.23123296](https://doi.org/10.5281/zenodo.23123296)。 [本站及各次发布的 BibTeX →](https://bci.report/zh/api/#cite-heading) · [CITATION.cff ↗](https://raw.githubusercontent.com/twu3202/bci-report/main/CITATION.cff)（英文）

---
本文是 https://bci.report/zh/topics/shared-encoder/ 的 Markdown 版本，由已发布的网页生成。数字均为聚合结果；使用条款见 https://bci.report/data-use/（英文）。
