# EEG 模型能回答用文字提出的问题吗？

用语言提问 · 决策研究计划的第三条路线

冻结 EEG 特征上的一个小分类头，每个问题分别用题号、标签模板或自然语言描述提出：SSVEP 用 BETA，睡眠用 BOAS。已见过的问题、改写后的问题、EEG 分类头从未训练过的问题分开报告，从不合并成一个“零样本”数字。

- [已审核的聚合 JSON ↓](https://bci.report/data/questions-in-language-update.json)
- 

测量所用数据集： [BETA](https://bci.report/zh/datasets/beta/)、[BOAS · Bitbrain Open Access Sleep dataset](https://bci.report/zh/datasets/boas/) · 方法： [CBraMod](https://bci.report/zh/methods/cbramod/)

## 简答

只对训练过的问题成立，而且不是在每个数据集上都成立。冻结 EEG 特征上的一个小分类头，用标签模板或描述代替题号来问已见过的问题：在睡眠（BOAS）上与题号在 2 pp（百分点）的界值内等效；在 SSVEP（BETA，**70** 名被试）上则损失了准确率：普通频谱上用标签模板为 **−5.96 pp**（**−6.84** 至 **−5.08 pp**），未达到界值。改写已见过的问题也有代价，只有睡眠上换一个新句式例外。EEG 分类头从未训练过的问题没有得到有用的回答：每一个未见过的睡眠问题，都不如把分类头自己的各期答案加起来；在未见过的闪烁频率上，分类头在普通频谱上只达到 **28.7%**，而无需训练的 CCA 达到 **80.9%**（随机水平 **12.5%**）。“N1 或 N2 期睡眠”这类显式问法用到了词与分期的对应关系；“睡着”“浅睡”这类日常名称把窗口的排序弄反了；在一个边界探针中，否定的问法则被当成在问被否定的那一项本身。

比较方法

## 一个分类头，三种问法

所有问题都由同一个小分类头回答，变的只是告诉它“问的是哪个问题”的那个向量。每次测试都在分类头从未训练过的被试上进行。

- **ID · 题号**：每个训练过的问题一个独热编码。它提不出任何新问题。
- **TPL · 标签模板**：用标签名称填入一个句式，再由冻结的文本编码器转成向量。
- **DESC · 描述**：一句描述该状态、但不说出其名称的话，同样转成向量。
- **SHUF · 错配模板**：训练时按事先声明的错位排列，把模板向量接到错误的问题上：用来检验分类头是否用到了问法与问题之间的对应关系。
- **NUM · 数值编码**：对 SSVEP，用数值而不是文字给出频率：不含文本的对照。
- **B-sh · 每个问题一个输出**：同一个隐藏层，每个已见过的问题一个固定输出，与第二条路线相同；它同样提不出新问题。
- **CCA · 无需训练**：对 SSVEP，典型相关分析（CCA）不需要训练，任何频率都能回答：未见过的频率要对照的参照。

睡眠的一个训练句式，填入某一期的名称（英文原文）： The scorer marked this 30-second epoch as N2 sleep.

SSVEP 用 BETA：普通频谱（L0）和冻结的 CBraMod 特征（L1）。睡眠用 BOAS：冻结的 CBraMod 特征（L1）。各用三个训练随机种子。主文本编码器是冻结的 bge-small-en-v1.5。每种问法的分类头都相同：标准化的特征，接一个由问题向量调整的小隐藏层（FiLM），再接一个输出。

三类结果，从不合并成一个“零样本”数字：用训练时的问法问已见过的问题；把同一个问题改写后再问；问分类头从未训练过的问题。“未见过”始终指 EEG 分类头没有见过，而不是文本编码器没有见过：冻结的文本编码器读过这些词；对 SSVEP，每个留出频率的每个分词也都出现在该轮换的训练文本中。未见过的睡眠问题是已见分期的组合；未见过的 SSVEP 问题是在五种轮换中留出的闪烁频率。

每项比较都是语言问法减去参照，单位为 pp，95% 区间依次对被试、训练随机种子和留出问法重采样得到。每项比较有两种读法，都在任何拟合之前定下。区间不含零，才算显示出差异。界值为 ±2 pp：整个区间都在界值内，算等效；对语言问法不利的那一端仍在界值内，算非劣；否则就是未达到界值——这并不等于损失了 2 pp 或更多。对未见过的睡眠问题，比较的是 R：分类头剩余的错误（1 − AUROC）与由它自己的各期答案读出的剩余错误之比，界值为 R < 1.25。检验分类头是否用到问法与分期对应关系的那项比较（模板组对比错配模板组），是 AUROC 的差值。主分析中，与数值编码、相邻平均和错配模板的比较只读差异；次要分析的表格按运行时的计算列出两种读法。

主分析共有 35 项预先声明的比较，不做多重比较校正：在 95% 水平下，没有真实差异的比较里，约每二十项就可能有一项偶然显示出差异。准确率先逐人计算，再在被试之间平均：它用来比较设置，不是部署时的错误率。

这是“[何时不该执行](https://bci.report/zh/topics/when-not-to-act/#decision-research)”页上研究计划的第三条路线。“Jev-style”（Jev 式）在这里指把 TypeSafe 的 Jev 这类决策模型的接口用在 EEG 上：一段记录只编码一次，再回答关于它的多个明确的、规定输出类型的问题，每个回答都带一个概率。这个计划从一篇视觉论文出发：[Yu & Yao, 2026 · Visual Jev: Accurate and Efficient Decisions from Shared Visual Context ↗](https://arxiv.org/abs/2609.25845)，它把同样的思路用在图像上。三条路线汇总：[Jev 式提问用在脑电上：证据 →](https://bci.report/zh/jev-style/)

主分析 · 已见过的问题 · BETA 与 BOAS

## 已见过的问题：用文字提问，以及改写后提问

分类头训练过的问题。BETA：70 名被试注视闪烁的目标；每种轮换中，分类头在大部分频率上训练，这里问的就是这些频率（32 选 1 任务）。BOAS：100 名被试，每个半分钟的数据帧按人工共识分为五期之一，保持自然比例。

**BOAS 在说明三处缺口后发布（所有者决定，2026 年 10 月 7 日）：**

- 知情同意声明没有说明被试是否同意公开共享或二次使用。The consent statement does not say whether participants agreed to public sharing or secondary use.
- 伦理与知情同意的陈述只来自发布者的数据集说明与 README，没有任何同行评审论文描述 BOAS。The ethics and consent statements come from the publisher's dataset description and README. No peer-reviewed paper describes BOAS.
- 伦理批件编号是在 1.1.1 版（2025 年 5 月）才加入发布的，发布中没有说明它是在记录之前还是之后批准的。The ethics reference was added to the release in version 1.1.1 (May 2025), and the release does not say when it was granted relative to the recordings.

被试在公开发布中是假名化的。这里没有任何结果是在评估 Bitbrain 的头带或它的自动睡眠分期；两者都没有使用。No result here evaluates Bitbrain's headband or its automatic sleep scoring; neither is used.

**署名：** Eduardo López-Larraz, María Sierra-Torralba, Sergio Clemente, Galit Fierro, David Oriol, Javier Minguez, Luis Montesano and Jens G. Klinzing · The Bitbrain Open Access Sleep (BOAS) dataset, OpenNeuro ds005555, version 1.1.3 (2026), doi:10.18112/openneuro.ds005555.v1.1.3. Polysomnography EEG and the human-consensus stage labels only; the headband recordings and the publisher's automatic labels are not used.

### 用训练时的问法（P1）

**−5.96 pp** SSVEP 上的 TPL − ID，普通频谱，BETA，三个随机种子

### 睡眠：没有可测的代价。SSVEP：有代价。

在睡眠上，用标签模板或描述代替题号，与题号在 ±2 pp 内等效：−0.05 pp（−0.70 至 +0.61 pp）和 +0.02 pp（−0.59 至 +0.62 pp）。在 SSVEP 上，两个层级都有准确率代价，且未达到界值：标签模板在普通频谱上为 −5.96 pp，在冻结的 CBraMod 特征上为 −3.49 pp；描述分别为 −5.46 pp 和 −3.37 pp。

平衡准确率的配对差值，语言问法减去题号，单位 pp，附 95% 区间；BETA 70 名被试，BOAS 100 名被试，各三个随机种子。

| 比较 | 问题 | 差值（pp） | 是否显示差异 | 界值 ±2 pp | 门槛 |
| --- | --- | --- | --- | --- | --- |
| SSVEP · BETA · 普通频谱（L0） |  |  |  |  |  |
| P1 · 标签模板 − 题号 — TPL − ID | 已见，32 选 1 | −5.96 pp (95% 区间 −6.84 至 −5.08 pp) | ID 更高 | 未达到 2 pp 界值 | 通过捷径检查 |
| P1 · 描述 − 题号 — DESC − ID | 已见，32 选 1 | −5.46 pp (95% 区间 −6.26 至 −4.66 pp) | ID 更高 | 未达到 2 pp 界值 | 通过捷径检查 |
| SSVEP · BETA · 冻结的 CBraMod 特征（L1） |  |  |  |  |  |
| P1 · 标签模板 − 题号 — TPL − ID | 已见，32 选 1 | −3.49 pp (95% 区间 −4.10 至 −2.93 pp) | ID 更高 | 未达到 2 pp 界值 | 通过捷径检查 |
| P1 · 描述 − 题号 — DESC − ID | 已见，32 选 1 | −3.37 pp (95% 区间 −3.98 至 −2.80 pp) | ID 更高 | 未达到 2 pp 界值 | 通过捷径检查 |
| 睡眠 · BOAS · 冻结的 CBraMod 特征（L1） |  |  |  |  |  |
| P1 · 标签模板 − 题号 — TPL − ID | 已见，5 选 1 | −0.05 pp (95% 区间 −0.70 至 +0.61 pp) | 未显示差异 | 在 ±2 pp 内等效 | 通过捷径检查 |
| P1 · 描述 − 题号 — DESC − ID | 已见，5 选 1 | +0.02 pp (95% 区间 −0.59 至 +0.62 pp) | 未显示差异 | 在 ±2 pp 内等效 | 通过捷径检查 |

在这些特征上，已见过的 SSVEP 任务对每个分类头都很难：用题号时，分类头在普通频谱上达到 32.1%（28.8%–35.2%），在冻结的 CBraMod 特征上为 24.2%，随机水平为 3.1%；无需训练的 CCA 达到 65.5%。在睡眠上，各种问法的平衡准确率大致相同：用题号为 71.5%，随机水平为 20.0%。下面的水平只是描述性的：区间重叠时不排名，上面的配对差值才是比较。

BETA，已见过的 32 选 1 平衡准确率（随机水平 3.1%）：70 名被试的均值，附 95% 区间，以及校正随机水平后的数值（水平 − 随机水平）/（1 − 随机水平）。三个随机种子；CCA 不需要训练，所以没有随机种子。

| 问法 | 普通频谱（L0） | 校正随机水平后 | 冻结的 CBraMod 特征（L1） | 校正随机水平后 |
| --- | --- | --- | --- | --- |
| ID — 题号 | 32.1% (95% 区间 28.8%–35.2%) | 29.9% | 24.2% (95% 区间 21.6%–26.9%) | 21.8% |
| TPL — 标签模板 | 26.1% (95% 区间 23.5%–28.6%) | 23.7% | 20.7% (95% 区间 18.5%–23.1%) | 18.2% |
| DESC — 描述 | 26.6% (95% 区间 23.9%–29.2%) | 24.2% | 20.9% (95% 区间 18.7%–23.2%) | 18.3% |
| SHUF — 错配模板 | 25.1% (95% 区间 22.5%–27.6%) | 22.7% | 20.2% (95% 区间 18.1%–22.3%) | 17.6% |
| NUM — 数值编码 | 23.7% (95% 区间 21.2%–26.1%) | 21.2% | 13.9% (95% 区间 12.5%–15.2%) | 11.1% |
| B-sh — 每个问题一个输出 | 32.2% (95% 区间 28.9%–35.3%) | 30.0% | 27.0% (95% 区间 24.2%–30.1%) | 24.7% |
| CCA — 无需训练 | 65.5% (95% 区间 59.7%–71.1%) | 64.3% | 65.5% (95% 区间 59.7%–71.1%) | 64.3% |

BOAS，已见过的五期平衡准确率（随机水平 20.0%），100 名被试，三个随机种子，附校正随机水平后的数值和对数损失（平均二元交叉熵，单位 nat）。错配模板在已见过问题上的得分按它自己的错位排列读出，没有对数损失。

| 问法 | 平衡准确率 | 校正随机水平后 | 对数损失 |
| --- | --- | --- | --- |
| ID — 题号 | 71.5% (95% 区间 69.1%–73.5%) | 64.3% | 0.267 (95% 区间 0.242–0.296) |
| TPL — 标签模板 | 71.4% (95% 区间 69.1%–73.4%) | 64.3% | 0.276 (95% 区间 0.249–0.307) |
| DESC — 描述 | 71.5% (95% 区间 69.1%–73.5%) | 64.3% | 0.278 (95% 区间 0.251–0.310) |
| SHUF — 错配模板 | 71.5% (95% 区间 69.2%–73.5%) | 64.4% | — |
| B-sh — 每个问题一个输出 | 71.4% (95% 区间 69.1%–73.4%) | 64.3% | 0.259 (95% 区间 0.236–0.287) |

BOAS，每个已见分期的 AUROC，附 95% 区间；三个随机种子。N3 汇总了至少有五个 N3 数据帧的 71 名被试；其他分期汇总 100 名。

| 问法 | W — 100 名被试 | N1 — 100 名被试 | N2 — 100 名被试 | N3 — 71 名被试 | REM — 100 名被试 |
| --- | --- | --- | --- | --- | --- |
| ID — 题号 | 0.982 (0.976–0.987) | 0.876 (0.859–0.890) | 0.922 (0.904–0.937) | 0.978 (0.971–0.983) | 0.957 (0.945–0.967) |
| TPL — 标签模板 | 0.980 (0.972–0.987) | 0.872 (0.855–0.887) | 0.924 (0.909–0.937) | 0.979 (0.974–0.983) | 0.956 (0.944–0.967) |
| DESC — 描述 | 0.981 (0.974–0.987) | 0.869 (0.851–0.884) | 0.923 (0.907–0.937) | 0.979 (0.974–0.983) | 0.956 (0.944–0.967) |

### 改写之后（P2）

同样是已见过的问题，换成分类头训练时没用过的问法：新句式（a1，对留出的句式重采样）、标签的同义词（a2：每个问题三个，固定不变，所以这些条目只对这三个同义词成立），或新描述（a3，对留出的描述重采样）。改写的结果从不与未见问题的结果合并。

平衡准确率的配对差值，改写后减去训练问法，单位 pp，附 95% 区间；BETA 70 名被试，BOAS 100 名被试，各三个随机种子。

| 比较 | 问题 | 差值（pp） | 是否显示差异 | 界值 ±2 pp | 门槛 |
| --- | --- | --- | --- | --- | --- |
| SSVEP · BETA · 普通频谱（L0） |  |  |  |  |  |
| P2 · 新句式 − 训练问法 — TPL(a1) − TPL(train) | 已见，改写 — 重采样 12 条留出问法 | −4.01 pp (95% 区间 −6.53 至 −2.12 pp) | TPL(train) 更高 | 未达到 2 pp 界值 | 通过捷径检查 |
| P2 · 同义词 − 训练问法 — TPL(a2) − TPL(train) | 已见，改写 — 只对这三个同义词成立：固定，不重采样 | −1.84 pp (95% 区间 −2.10 至 −1.57 pp) | TPL(train) 更高 | 未达到 2 pp 界值 | 通过捷径检查 |
| P2 · 新描述 − 训练描述 — DESC(a3) − DESC(train) | 已见，改写 — 重采样 10 条留出问法 | −4.13 pp (95% 区间 −5.58 至 −3.11 pp) | DESC(train) 更高 | 未达到 2 pp 界值 | 通过捷径检查 |
| SSVEP · BETA · 冻结的 CBraMod 特征（L1） |  |  |  |  |  |
| P2 · 新句式 − 训练问法 — TPL(a1) − TPL(train) | 已见，改写 — 重采样 12 条留出问法 | −2.72 pp (95% 区间 −4.43 至 −1.43 pp) | TPL(train) 更高 | 未达到 2 pp 界值 | 通过捷径检查 |
| P2 · 同义词 − 训练问法 — TPL(a2) − TPL(train) | 已见，改写 — 只对这三个同义词成立：固定，不重采样 | −1.33 pp (95% 区间 −1.53 至 −1.14 pp) | TPL(train) 更高 | 在 ±2 pp 内等效 | 通过捷径检查 |
| P2 · 新描述 − 训练描述 — DESC(a3) − DESC(train) | 已见，改写 — 重采样 10 条留出问法 | −2.95 pp (95% 区间 −3.81 至 −2.26 pp) | DESC(train) 更高 | 未达到 2 pp 界值 | 通过捷径检查 |
| 睡眠 · BOAS · 冻结的 CBraMod 特征（L1） |  |  |  |  |  |
| P2 · 新句式 − 训练问法 — TPL(a1) − TPL(train) | 已见，改写 — 重采样 12 条留出问法 | −0.46 pp (95% 区间 −1.33 至 +0.16 pp) | 未显示差异 | 在 ±2 pp 内等效 | 通过捷径检查 |
| P2 · 同义词 − 训练问法 — TPL(a2) − TPL(train) | 已见，改写 — 只对这三个同义词成立：固定，不重采样 | −12.60 pp (95% 区间 −13.74 至 −11.43 pp) | TPL(train) 更高 | 未达到 2 pp 界值 | 通过捷径检查 |
| P2 · 新描述 − 训练描述 — DESC(a3) − DESC(train) | 已见，改写 — 重采样 10 条留出问法 | −20.87 pp (95% 区间 −29.49 至 −13.71 pp) | DESC(train) 更高 | 未达到 2 pp 界值 | 通过捷径检查 |

在睡眠上，换一个新句式没有可测的代价：在 ±2 pp 内等效（−0.46 pp，−1.33 至 +0.16 pp）。每期三个同义词的差值为 −12.60 pp（−13.74 至 −11.43 pp），新描述为 −20.87 pp（−29.49 至 −13.71 pp）——区间很宽，因为各条描述之间差别很大。在 BETA 上，每种改写都更低，差值从 −1.33 pp 到 −4.13 pp；只有冻结 CBraMod 特征上的同义词留在界值内。

每个同义词单独对比训练问法，单位 pp，附 95% 区间（描述性）；BETA 70 名被试，BOAS 100 名被试。在 SSVEP 上，第三个同义词把数字拼写成英文单词。

| 同义词 | SSVEP · BETA · 普通频谱（L0） | SSVEP · BETA · 冻结的 CBraMod 特征（L1） | 睡眠 · BOAS · 冻结的 CBraMod 特征（L1） |
| --- | --- | --- | --- |
| 同义词 1 | −1.45 pp (95% 区间 −1.67 至 −1.22 pp) | −1.09 pp (95% 区间 −1.27 至 −0.90 pp) | −23.53 pp (95% 区间 −25.29 至 −21.64 pp) |
| 同义词 2 | −0.87 pp (95% 区间 −1.04 至 −0.70 pp) | −0.84 pp (95% 区间 −1.00 至 −0.68 pp) | −10.85 pp (95% 区间 −12.59 至 −9.17 pp) |
| 同义词 3 | −3.19 pp (95% 区间 −3.69 至 −2.69 pp) | −2.06 pp (95% 区间 −2.44 至 −1.73 pp) | −3.42 pp (95% 区间 −4.49 至 −2.41 pp) |

答案翻转率（描述性）：只换问法时，分类头对同一个窗口的答案改变的频率；BETA 70 名被试，BOAS 100 名被试。在 SSVEP 上，题号分类头只是换一个训练随机种子，大多数答案就会改变，因为已见任务接近下限，所以那里的翻转率主要反映不确定性。

|  | 新句式 | 同义词 | 训练句式之间 | 新描述 | 训练描述之间 | ID 的随机种子之间 |
| --- | --- | --- | --- | --- | --- | --- |
| BETA · L0 | 39.7% | 29.3% | 19.4% | 41.2% | 19.3% | 56.8% |
| BETA · L1 | 40.7% | 32.0% | 24.3% | 42.7% | 23.3% | 62.2% |
| BOAS · L1 | 6.4% | 20.0% | 3.3% | 45.4% | 3.1% | 7.4% |

主分析 · 未见过的睡眠问题 · BOAS

## EEG 分类头从未训练过的睡眠问题

三个分类头从未训练过的问题，每个都是它训练过的分期的组合：睡着（N1、N2、N3 或 REM）、N1、N2 或 N3 期睡眠，以及浅睡（N1 或 N2）。每个问题都用模板提问（分别用隐式名称和显式名称），也用新描述提问；100 名被试，三个随机种子。EEG 分类头没有见过，但文本编码器读过这些词。因为每个问题都是组合，分类头自己的各期答案可以加起来得到一个答案，也就是读出；每种问法都要与读出对照。

**BOAS 在说明三处缺口后发布（所有者决定，2026 年 10 月 7 日）：**

- 知情同意声明没有说明被试是否同意公开共享或二次使用。The consent statement does not say whether participants agreed to public sharing or secondary use.
- 伦理与知情同意的陈述只来自发布者的数据集说明与 README，没有任何同行评审论文描述 BOAS。The ethics and consent statements come from the publisher's dataset description and README. No peer-reviewed paper describes BOAS.
- 伦理批件编号是在 1.1.1 版（2025 年 5 月）才加入发布的，发布中没有说明它是在记录之前还是之后批准的。The ethics reference was added to the release in version 1.1.1 (May 2025), and the release does not say when it was granted relative to the recordings.

被试在公开发布中是假名化的。这里没有任何结果是在评估 Bitbrain 的头带或它的自动睡眠分期；两者都没有使用。No result here evaluates Bitbrain's headband or its automatic sleep scoring; neither is used.

**署名：** Eduardo López-Larraz, María Sierra-Torralba, Sergio Clemente, Galit Fierro, David Oriol, Javier Minguez, Luis Montesano and Jens G. Klinzing · The Bitbrain Open Access Sleep (BOAS) dataset, OpenNeuro ds005555, version 1.1.3 (2026), doi:10.18112/openneuro.ds005555.v1.1.3. Polysomnography EEG and the human-consensus stage labels only; the headband recordings and the publisher's automatic labels are not used.

模板组提问所用的名称，在任何评分之前写定（英文原文）。

| 问题 | 隐式名称 | 显式名称 |
| --- | --- | --- |
| 睡着 | asleep | N1, N2, N3 or REM sleep |
| N1、N2 或 N3 期睡眠 | 无 | N1, N2 or N3 sleep |
| 浅睡 | light sleep | N1 or N2 sleep |

### 分类头能回答它们吗？（P3）

**33.80** “睡着”用隐式名称时的 R：分类头剩余的错误与读出剩余错误之比

### 没有答好：每种问法下，读出都更好

在全部八种条件下，区间都高于 R = 1，对读出有利，没有一种进入 1.25 的界值：R 从 2.42（2.07–2.85；N1、N2 或 N3 期睡眠，显式名称）到 33.80（23.09–52.82；睡着，隐式名称）。

log R 与 R：分类头剩余的错误（1 − AUROC）与读出剩余错误之比，附 95% 区间；100 名被试，三个随机种子。log R 为正、或 R 大于 1，对语言问法不利。

| 比较 | 问题 | log R（附 R） | 是否显示差异 | 界值 R < 1.25 | 门槛 |
| --- | --- | --- | --- | --- | --- |
| P3 · 标签模板分类头，对比由它自己的答案读出 — TPL / read-off | 睡着 · 隐式名称 | +3.520 (95% 区间 +3.139 至 +3.967) (R 33.80 (23.09–52.82)) | 读出剩余的错误更少 | 未达到 1.25 的比值界值 | 通过余量门槛 |
| P3 · 标签模板分类头，对比由它自己的答案读出 — TPL / read-off | 睡着 · 显式名称 | +1.951 (95% 区间 +1.623 至 +2.357) (R 7.04 (5.07–10.56)) | 读出剩余的错误更少 | 未达到 1.25 的比值界值 | 通过余量门槛 |
| P3 · 标签模板分类头，对比由它自己的答案读出 — TPL / read-off | N1、N2 或 N3 期睡眠 · 显式名称 | +0.883 (95% 区间 +0.726 至 +1.047) (R 2.42 (2.07–2.85)) | 读出剩余的错误更少 | 未达到 1.25 的比值界值 | 通过余量门槛 |
| P3 · 标签模板分类头，对比由它自己的答案读出 — TPL / read-off | 浅睡 · 隐式名称 | +2.267 (95% 区间 +2.072 至 +2.466) (R 9.65 (7.94–11.77)) | 读出剩余的错误更少 | 未达到 1.25 的比值界值 | 通过余量门槛 |
| P3 · 标签模板分类头，对比由它自己的答案读出 — TPL / read-off | 浅睡 · 显式名称 | +1.519 (95% 区间 +1.343 至 +1.698) (R 4.57 (3.83–5.46)) | 读出剩余的错误更少 | 未达到 1.25 的比值界值 | 通过余量门槛 |
| P3 · 描述分类头，对比由它自己的答案读出 — DESC / read-off | 睡着 · 新描述 — 重采样 10 条留出问法 | +3.444 (95% 区间 +2.913 至 +3.956) (R 31.30 (18.41–52.26)) | 读出剩余的错误更少 | 未达到 1.25 的比值界值 | 通过余量门槛 |
| P3 · 描述分类头，对比由它自己的答案读出 — DESC / read-off | N1、N2 或 N3 期睡眠 · 新描述 — 重采样 10 条留出问法 | +1.299 (95% 区间 +0.793 至 +1.744) (R 3.67 (2.21–5.72)) | 读出剩余的错误更少 | 未达到 1.25 的比值界值 | 通过余量门槛 |
| P3 · 描述分类头，对比由它自己的答案读出 — DESC / read-off | 浅睡 · 新描述 — 重采样 10 条留出问法 | +1.417 (95% 区间 +0.903 至 +1.856) (R 4.12 (2.47–6.40)) | 读出剩余的错误更少 | 未达到 1.25 的比值界值 | 通过余量门槛 |

模板分类头在每个未见问题上的 AUROC，以及由它自己的各期答案读出（先验校正后）的 AUROC，附 95% 区间；100 名被试，三个随机种子。描述性。AUROC 低于 0.5 表示把窗口的排序弄反了。

| 问题 | 问法 | 模板分类头 | 由各期答案读出 |
| --- | --- | --- | --- |
| 睡着 | 隐式名称 | 0.317 (95% 区间 0.294–0.341) | 0.980 (95% 区间 0.971–0.987) |
| 睡着 | 显式名称 | 0.858 (95% 区间 0.839–0.875) | 0.980 (95% 区间 0.971–0.987) |
| N1、N2 或 N3 期睡眠 | 显式名称 | 0.871 (95% 区间 0.854–0.887) | 0.947 (95% 区间 0.934–0.958) |
| 浅睡 | 隐式名称 | 0.244 (95% 区间 0.222–0.267) | 0.922 (95% 区间 0.907–0.935) |
| 浅睡 | 显式名称 | 0.642 (95% 区间 0.616–0.667) | 0.922 (95% 区间 0.907–0.935) |

隐式名称把窗口的排序弄反了：“睡着”的 AUROC 为 0.317，“浅睡”为 0.244，都低于 0.5，也就是说，真正处于睡眠或浅睡的窗口，在这些问题上的得分反而低于其他窗口。显式名称好一些（0.858 和 0.642），但仍不如读出（0.980 和 0.922）。描述没有对应关系的对照：错配对照是用模板向量构造的。留出的句式（S13，见次要结果）在全部五个模板格子上给出同样的结果。

### 分类头是否用到了问法与分期的对应关系？（P5）

错配模板组在训练时把同样的模板向量接到错误的分期上；未见问题保留各自真实的向量。如果分类头用到了问法与分期的对应关系，错配组在这些问题上应当不如模板组。

模板组减去错配模板组：在未见问题上的 AUROC，按每类名称的格子取平均，附 95% 区间；100 名被试，三个随机种子。只读差异：不设界值。

| 比较 | 问题 | 差值（AUROC） | 是否显示差异 | 界值 | 门槛 |
| --- | --- | --- | --- | --- | --- |
| P5 · 标签模板 − 错配模板 — TPL − SHUF | 未见问题，隐式名称 | −0.378 (95% 区间 −0.501 至 −0.253) | SHUF 更高 | 只读差异，不设界值 | 通过余量门槛 |
| P5 · 标签模板 − 错配模板 — TPL − SHUF | 未见问题，显式名称 | +0.629 (95% 区间 +0.603 至 +0.654) | TPL 更高 | 只读差异，不设界值 | 通过余量门槛 |

每个未见问题上的 AUROC，模板组与错配模板组，附 95% 区间（描述性）；100 名被试，三个随机种子。

| 问题 | 问法 | 模板组 | 错配模板组 |
| --- | --- | --- | --- |
| 睡着 | 隐式名称 | 0.317 (95% 区间 0.294–0.341) | 0.676 (95% 区间 0.529–0.812) |
| 睡着 | 显式名称 | 0.858 (95% 区间 0.839–0.875) | 0.137 (95% 区间 0.109–0.168) |
| N1、N2 或 N3 期睡眠 | 显式名称 | 0.871 (95% 区间 0.854–0.887) | 0.171 (95% 区间 0.145–0.201) |
| 浅睡 | 隐式名称 | 0.244 (95% 区间 0.222–0.267) | 0.641 (95% 区间 0.537–0.738) |
| 浅睡 | 显式名称 | 0.642 (95% 区间 0.616–0.667) | 0.176 (95% 区间 0.155–0.199) |

显式名称用到了：把模板接到错误的分期上，未见问题的 AUROC 降低，TPL − SHUF 为 +0.629（+0.603 至 +0.654）。隐式名称没有显示出用到：错配模板反而更高，−0.378（−0.501 至 −0.253）。

主分析 · 未见过的闪烁频率 · BETA

## EEG 分类头从未训练过的闪烁频率（P4）

在五种轮换中，每次留出 BETA 的八个频率：分类头在其余频率上训练，再用模板说出频率来问这八个。70 名被试，三个随机种子，两个层级。EEG 分类头没有见过，但文本编码器读过这些词：每个留出频率的每个分词也都出现在该轮换的训练文本中，新的只是组合。CCA 完全不需要训练就能回答同样的问题。

**−52.21 pp** TPL − CCA，未见频率之间的 8 选 1，普通频谱，BETA

### 远不如无需训练的 CCA

在未见频率之间的 8 选 1 中，分类头在普通频谱上达到 28.7%（26.9%–30.5%），在冻结的 CBraMod 特征上为 19.0%；CCA 达到 80.9%，随机水平为 12.5%。在两个层级上，分类头也不如把它自己对相邻两个已见频率的答案取平均，也不如用数值编码表示频率。

准确率的配对差值，模板分类头减去参照，单位 pp，附 95% 区间；70 名被试，三个随机种子。与 CCA 的比较设界值；与相邻平均和数值编码的比较只读差异。

| 比较 | 问题 | 差值（pp） | 是否显示差异 | 界值 ±2 pp | 门槛 |
| --- | --- | --- | --- | --- | --- |
| SSVEP · BETA · 普通频谱（L0） |  |  |  |  |  |
| P4 · 标签模板 − CCA（无需训练） — TPL − CCA | 未见频率，8 选 1 | −52.21 pp (95% 区间 −55.13 至 −48.99 pp) | CCA 更高 | 未达到 2 pp 界值 | 通过余量门槛 |
| P4 · 标签模板 − 相邻两个已见频率的平均 — TPL − NN(TPL) | 未见频率，8 选 1 | −10.98 pp (95% 区间 −12.24 至 −9.67 pp) | NN(TPL) 更高 | 只读差异，不设界值 | 通过余量门槛 |
| P4 · 标签模板 − 数值编码 — TPL − NUM | 未见频率，8 选 1 | −12.77 pp (95% 区间 −14.52 至 −10.99 pp) | NUM 更高 | 只读差异，不设界值 | 通过余量门槛 |
| P4 · 标签模板 − CCA（无需训练） — TPL − CCA | 未见频率，相邻 3 选 1 | −62.36 pp (95% 区间 −65.87 至 −58.69 pp) | CCA 更高 | 未达到 2 pp 界值 | 通过余量门槛 |
| P4 · 标签模板 − 数值编码 — TPL − NUM | 未见频率，相邻 3 选 1 | −1.24 pp (95% 区间 −3.17 至 +0.85 pp) | 未显示差异 | 只读差异，不设界值 | 通过余量门槛 |
| SSVEP · BETA · 冻结的 CBraMod 特征（L1） |  |  |  |  |  |
| P4 · 标签模板 − CCA（无需训练） — TPL − CCA | 未见频率，8 选 1 | −61.94 pp (95% 区间 −65.65 至 −58.06 pp) | CCA 更高 | 未达到 2 pp 界值 | 通过余量门槛 |
| P4 · 标签模板 − 相邻两个已见频率的平均 — TPL − NN(TPL) | 未见频率，8 选 1 | −1.16 pp (95% 区间 −1.97 至 −0.37 pp) | NN(TPL) 更高 | 只读差异，不设界值 | 通过余量门槛 |
| P4 · 标签模板 − 数值编码 — TPL − NUM | 未见频率，8 选 1 | −2.46 pp (95% 区间 −3.23 至 −1.69 pp) | NUM 更高 | 只读差异，不设界值 | 通过余量门槛 |
| P4 · 标签模板 − CCA（无需训练） — TPL − CCA | 未见频率，相邻 3 选 1 | −54.67 pp (95% 区间 −57.77 至 −51.47 pp) | CCA 更高 | 未达到 2 pp 界值 | 通过余量门槛 |
| P4 · 标签模板 − 数值编码 — TPL − NUM | 未见频率，相邻 3 选 1 | +15.61 pp (95% 区间 +14.25 至 +16.93 pp) | TPL 更高 | 只读差异，不设界值 | 通过余量门槛 |

在相邻 3 选 1 中，未见过的频率要与两侧相邻频率已训练好的检测器竞争（偏向已见问题，已说明）。在普通频谱上，模板分类头低于这项检验的平均随机水平：19.3%，随机水平为 34.2%；与数值编码相比没有显示出差异。在冻结的 CBraMod 特征上，它比数值编码高 +15.61 pp，但这些特征保留了刺激相位，而相邻目标的相位不同，所以这项比较同时检验频率和相位。不含相位的普通频谱才是干净的频率检验。

在未见频率上的准确率（描述性）：u8，留出频率之间的 8 选 1（随机水平 12.5%）；nn8，把相邻两个已见频率的答案取平均的读出；u3，相邻 3 选 1（平均随机水平 34.2%，在频率网格两端为 2 选 1）。70 名被试；三个随机种子，CCA 没有随机种子。

| 问法 | 检验 | 普通频谱（L0） | 校正随机水平后 | 冻结的 CBraMod 特征（L1） | 校正随机水平后 |
| --- | --- | --- | --- | --- | --- |
| TPL — 标签模板 | u8 | 28.7% (95% 区间 26.9%–30.5%) | 18.5% | 19.0% (95% 区间 18.0%–19.9%) | 7.4% |
| DESC — 描述 | u8 | 28.6% (95% 区间 26.8%–30.4%) | 18.4% | 18.6% (95% 区间 17.6%–19.6%) | 7.0% |
| SHUF — 错配模板 | u8 | 9.2% (95% 区间 8.6%–9.7%) | -3.8% | 11.0% (95% 区间 10.5%–11.5%) | -1.7% |
| NUM — 数值编码 | u8 | 41.5% (95% 区间 38.2%–44.7%) | 33.1% | 21.4% (95% 区间 20.2%–22.6%) | 10.2% |
| CCA — 无需训练 | u8 | 80.9% (95% 区间 76.6%–84.8%) | 78.2% | 80.9% (95% 区间 76.6%–84.8%) | 78.2% |
| TPL — 标签模板 | nn8 | 39.7% (95% 区间 36.8%–42.5%) | 31.0% | 20.1% (95% 区间 19.0%–21.3%) | 8.7% |
| ID — 题号 | nn8 | 44.3% (95% 区间 40.8%–47.6%) | 36.4% | 18.3% (95% 区间 17.3%–19.3%) | 6.6% |
| B-sh — 每个问题一个输出 | nn8 | 44.3% (95% 区间 40.9%–47.5%) | 36.3% | 17.6% (95% 区间 16.6%–18.8%) | 5.8% |
| TPL — 标签模板 | u3 | 19.3% (95% 区间 18.2%–20.5%) | -22.5% | 27.0% (95% 区间 26.0%–28.0%) | -10.8% |
| NUM — 数值编码 | u3 | 20.6% (95% 区间 19.3%–21.8%) | -20.6% | 11.4% (95% 区间 10.7%–12.1%) | -34.5% |
| CCA — 无需训练 | u3 | 81.7% (95% 区间 78.5%–84.6%) | 72.2% | 81.7% (95% 区间 78.5%–84.6%) | 72.2% |

泛化代价（描述性）：未见频率上的准确率减去对应的已见频率上的准确率，单位 pp，附 95% 区间；70 名被试。

| 问法与检验 | 普通频谱（L0） | 冻结的 CBraMod 特征（L1） |
| --- | --- | --- |
| ID，8 选 1（相邻读出） | −14.26 pp (95% 区间 −15.50 至 −13.06 pp) | −27.80 pp (95% 区间 −30.61 至 −25.03 pp) |
| TPL，8 选 1 | −24.44 pp (95% 区间 −26.44 至 −22.26 pp) | −24.27 pp (95% 区间 −26.72 至 −21.85 pp) |
| TPL，3 选 1 | −27.83 pp (95% 区间 −30.18 至 −25.37 pp) | −29.67 pp (95% 区间 −31.76 至 −27.64 pp) |
| DESC，8 选 1 | −24.79 pp (95% 区间 −26.88 至 −22.55 pp) | −24.81 pp (95% 区间 −27.31 至 −22.39 pp) |
| DESC，3 选 1 | −28.95 pp (95% 区间 −31.33 至 −26.46 pp) | −29.74 pp (95% 区间 −31.76 至 −27.76 pp) |
| SHUF，8 选 1 | −40.63 pp (95% 区间 −44.16 至 −36.98 pp) | −30.09 pp (95% 区间 −33.02 至 −27.27 pp) |
| SHUF，3 选 1 | −34.96 pp (95% 区间 −37.50 至 −32.43 pp) | −32.52 pp (95% 区间 −35.18 至 −29.84 pp) |
| NUM，8 选 1 | −12.30 pp (95% 区间 −13.42 至 −11.17 pp) | −16.16 pp (95% 区间 −17.88 至 −14.47 pp) |
| NUM，3 选 1 | −7.27 pp (95% 区间 −8.49 至 −6.02 pp) | −7.63 pp (95% 区间 −8.74 至 −6.53 pp) |
| B-sh，8 选 1（相邻读出） | −12.81 pp (95% 区间 −14.09 至 −11.56 pp) | −31.19 pp (95% 区间 −34.09 至 −28.32 pp) |
| CCA，8 选 1 | 0.00 pp (95% 区间 0.00 至 0.00 pp) | 0.00 pp (95% 区间 0.00 至 0.00 pp) |
| CCA，3 选 1 | +0.41 pp (95% 区间 +0.26 至 +0.56 pp) | +0.41 pp (95% 区间 +0.26 至 +0.56 pp) |

8 选 1 中的 TPL − CCA，逐个轮换，单位 pp，附 95% 区间（次要，经独立审计重算）；70 名被试，三个随机种子。结果不靠任何单个轮换撑起。

| 轮换 | 普通频谱（L0） | 冻结的 CBraMod 特征（L1） |
| --- | --- | --- |
| 轮换 0 | −49.88 pp (95% 区间 −53.16 至 −46.16 pp) | −63.00 pp (95% 区间 −67.23 至 −58.54 pp) |
| 轮换 1 | −52.96 pp (95% 区间 −57.02 至 −48.99 pp) | −61.76 pp (95% 区间 −65.81 至 −57.74 pp) |
| 轮换 2 | −48.74 pp (95% 区间 −51.97 至 −45.42 pp) | −59.74 pp (95% 区间 −63.75 至 −55.51 pp) |
| 轮换 3 | −57.34 pp (95% 区间 −60.84 至 −53.73 pp) | −62.75 pp (95% 区间 −66.73 至 −58.42 pp) |
| 轮换 4 | −52.14 pp (95% 区间 −55.80 至 −48.20 pp) | −62.47 pp (95% 区间 −66.53 至 −58.23 pp) |

按频率和仅内部频率的细分是在审计之后计算的，没有任何独立审计覆盖它们，所以不发布。

任何结果之前

## 运行前的检查，以及其中一项如何被修改

有一项检查在失败之后被修改了，而且改了两次。相关情况全部列在这里，连同在读取任何结果之前必须通过的其他检查。

标签置换金丝雀检查（canary）：把训练标签打乱后重新训练分类头，检查测试得分是否落在随机水平：在第一折上共 17 个配置、38 个 99.9% 区间。

修订 3 失败：38 个区间中有 1 个排除了随机水平（睡眠，冻结的 CBraMod 特征，错配模板组，未见问题“浅睡”的显式名称）。它的标签是在每个训练被试内部打乱的。运行因此停止。

修订 4 由所有者在任何新拟合之前批准，改为在所有训练窗口之间打乱标签。它也失败了：38 个区间中有 3 个，全在 BOAS 上，其中一个低于随机水平；两次检查中，SSVEP 的每个区间都包含随机水平。修订 4 写明“不再修订”。所有者在看到它如何失败之后推翻了这一条，并在任何新拟合之前批准了修订 5。修订 4 的按人中心化诊断没有运行：标签在所有窗口之间打乱后，它已经检验不了任何东西。

修订 5 通过：每个配置训练 20 个分类头（共 340 次拟合），每个指标都与该被试精确的随机水平比较，并做两层 bootstrap，先对分类头、再对被试重采样；38 个区间中有 0 个排除了零。两次失败的记录都保留。

偏离方向的计数（描述性）：修订 5 中 760 个单分类头区间里，有 125 个排除了精确的随机水平，66 个偏高、59 个偏低，另有 18 个格子两个方向都失败过。BOAS 的格子只以通过或失败及计数发布。

为什么会失败——这正是修订 5 设计来检验的解释：用打乱的标签训练出的分类头，仍然是睡眠特征的某个随机函数，而这些特征按分期分得很开，所以它在新被试上的得分会整体偏向同一个方向，可能偏高也可能偏低。按被试的 bootstrap 只衡量被试之间的波动，不衡量分类头之间的波动，所以它的 99.9% 区间对这个问题来说太窄。失败的样子符合这个解释：全部发生在 BOAS 上，而且有一个低于随机水平，而泄漏不会造成这种结果。这不是“没有泄漏”的证明：被试不重叠的折、训练中没有留出的标签或问法、只在训练数据上拟合的标准化，都由代码中的断言保证，两份一致性审计也直接检查了泄漏。

决定 S0b-6，经所有者批准：SSVEP 的分词规则要求，每个留出频率的每个分词都出现在该轮换的训练文本中。对 bge-small-en-v1.5 和 all-MiniLM-L6-v2，违反这条规则就停止运行，两者在全部 5 种轮换中都通过了。对 multilingual-e5-small，这条规则无法成立：它的分词器把一位小数的数字片段当成单个分词，而留出的数字本身不允许出现在训练文本中；对这个编码器，规则改为报告而不停止运行，每个中文问法的未见频率条目都注明该频率是一个新的分词。

工程修订 EA-1，在第一次拟合之前：在连续的外推频段（S8）中，相邻平均没有定义，相邻 3 选 1 重新标注，因为它的竞争对手本身就是留出的问题；失败的拟合逐格标注（没有任何拟合失败）；次要评分可以在中断后接着运行。没有改动任何问题、划分、问法、臂（ID、TPL、DESC 等各组）、指标、界值或门槛。

预先声明的数感预测没有触发。它说的是：如果主文本编码器对频率的排序很差（每个训练句式中，频率差与嵌入距离之间的 Spearman ρ 都低于 0.3），那么 8 选 1 的 TPL − NUM 差异标记就不会是“TPL 更高”。它的前提不成立：bge-small-en-v1.5 三个训练句式的 ρ 分别为 0.593、0.563 和 0.526，基于 780 个频率对。尽管如此，两个层级上的标记都是“NUM 更高”；前提既然不成立，这只是描述，不是得到证实的预测。

### 门槛

- 余量门槛：题号分类头在已见问题上的平衡准确率必须高于随机水平加 5 pp，且低于 95%。三个主分析组都通过了；具体水平见上面的表格。
- 捷径检查：只用各通道均值和对数方差的岭回归分类器，不能单独答出已见任务。BETA 通过了（在第一折的 60 名训练被试上计算），BOAS 和 EESM19 也通过了（沿用第二条路线的结果）；运动想象没有声明这项检查，所以它的门槛写作“未运行”。
- 读出下限：只有当读出的 AUROC 区间高于 0.55 时，未见睡眠问题的格子才计入。主分析 8 个格子中通过 8 个，次要分析 34 个中通过 34 个。
- 打乱 EEG 的评分检查：把测试特征在每名被试内部打乱后重算每个主分析聚合值，结果必须落在随机水平的三个蒙特卡洛标准误之内。51 个格子中有 51 个做到了（SSVEP 26 个，BOAS 25 个）。
- 拟合检查，在第一折的训练数据上：每个带条件的 SSVEP 问法，训练得分都比每个问题一个输出的分类头低 5 pp 以上，所以预先声明的回退方案适用于每个 SSVEP 问法，训练 60 轮；睡眠、EESM19 和运动想象仍训练 30 轮。没有任何拟合失败。

四份独立审计都通过了。它们不借用研究的评分代码，重新实现了各项定义：主分析的一致性审计通过 106 项检查，失败 0 项；主分析的数值审计做了 2,270 次比较，不一致 0 次；次要分析的一致性审计通过 231 项检查，失败 0 项；次要分析的数值审计做了 18,619 次比较，其中 29 次超出容差，每一次都有解释。

次要 · 主分析比较之外

## 次要结果

更多的数据集、特征、另一个文本编码器、中文问法和探针，都不在主分析比较之内。未注明时只有一个随机种子：单个随机种子不含训练过程的随机波动。每个 EESM19 条目和单种子条目都在运行之前声明为多半无法下结论，不过没有一项落到“无法下结论”的标记组合上。

展开次要结果

### S1 · EESM19 睡眠，冻结的 CBraMod 特征 · 20 名被试，三个随机种子 · 事先声明多半无法下结论

| 比较 | 问题 | 差值（pp、log R 或 AUROC） | 是否显示差异 | 界值 | 门槛 |
| --- | --- | --- | --- | --- | --- |
| P1 · 标签模板 − 题号 — TPL − ID | 已见，5 选 1 | −0.04 pp (95% 区间 −0.47 至 +0.39 pp) | 未显示差异 | 在 ±2 pp 内等效 | 通过捷径检查 |
| P1 · 描述 − 题号 — DESC − ID | 已见，5 选 1 | −0.03 pp (95% 区间 −0.43 至 +0.40 pp) | 未显示差异 | 在 ±2 pp 内等效 | 通过捷径检查 |
| P2 · 新句式 − 训练问法 — TPL(a1) − TPL(train) | 已见，改写 — 重采样 12 条留出问法 | −0.11 pp (95% 区间 −0.56 至 +0.20 pp) | 未显示差异 | 在 ±2 pp 内等效 | 通过捷径检查 |
| P2 · 同义词 − 训练问法 — TPL(a2) − TPL(train) | 已见，改写 — 只对这三个同义词成立：固定，不重采样 | −15.27 pp (95% 区间 −16.24 至 −14.29 pp) | TPL(train) 更高 | 未达到 2 pp 界值 | 通过捷径检查 |
| P2 · 新描述 − 训练描述 — DESC(a3) − DESC(train) | 已见，改写 — 重采样 10 条留出问法 | −18.54 pp (95% 区间 −27.30 至 −10.80 pp) | DESC(train) 更高 | 未达到 2 pp 界值 | 通过捷径检查 |
| P3 · 标签模板分类头，对比由它自己的答案读出 — TPL / read-off | 睡着 · 隐式名称 | +4.720 (95% 区间 +4.410 至 +5.113) (R 112.17 (82.27–166.15)) | 读出剩余的错误更少 | 未达到 1.25 的比值界值 | 通过余量门槛 |
| P3 · 标签模板分类头，对比由它自己的答案读出 — TPL / read-off | 睡着 · 显式名称 | +2.566 (95% 区间 +2.179 至 +3.010) (R 13.02 (8.84–20.30)) | 读出剩余的错误更少 | 未达到 1.25 的比值界值 | 通过余量门槛 |
| P3 · 标签模板分类头，对比由它自己的答案读出 — TPL / read-off | N1、N2 或 N3 期睡眠 · 显式名称 | +1.080 (95% 区间 +0.890 至 +1.267) (R 2.95 (2.44–3.55)) | 读出剩余的错误更少 | 未达到 1.25 的比值界值 | 通过余量门槛 |
| P3 · 标签模板分类头，对比由它自己的答案读出 — TPL / read-off | 浅睡 · 隐式名称 | +2.409 (95% 区间 +2.208 至 +2.609) (R 11.12 (9.10–13.58)) | 读出剩余的错误更少 | 未达到 1.25 的比值界值 | 通过余量门槛 |
| P3 · 标签模板分类头，对比由它自己的答案读出 — TPL / read-off | 浅睡 · 显式名称 | +0.888 (95% 区间 +0.769 至 +1.024) (R 2.43 (2.16–2.78)) | 读出剩余的错误更少 | 未达到 1.25 的比值界值 | 通过余量门槛 |
| P3 · 描述分类头，对比由它自己的答案读出 — DESC / read-off | 睡着 · 新描述 — 重采样 10 条留出问法 | +4.707 (95% 区间 +4.279 至 +5.154) (R 110.72 (72.15–173.16)) | 读出剩余的错误更少 | 未达到 1.25 的比值界值 | 通过余量门槛 |
| P3 · 描述分类头，对比由它自己的答案读出 — DESC / read-off | N1、N2 或 N3 期睡眠 · 新描述 — 重采样 10 条留出问法 | +2.223 (95% 区间 +1.622 至 +2.649) (R 9.24 (5.06–14.15)) | 读出剩余的错误更少 | 未达到 1.25 的比值界值 | 通过余量门槛 |
| P3 · 描述分类头，对比由它自己的答案读出 — DESC / read-off | 浅睡 · 新描述 — 重采样 10 条留出问法 | +1.707 (95% 区间 +1.240 至 +2.056) (R 5.51 (3.46–7.81)) | 读出剩余的错误更少 | 未达到 1.25 的比值界值 | 通过余量门槛 |
| P5 · 标签模板 − 错配模板 — TPL − SHUF | 未见问题，隐式名称 | −0.391 (95% 区间 −0.470 至 −0.311) | SHUF 更高 | 只读差异，不设界值 | 通过余量门槛 |
| P5 · 标签模板 − 错配模板 — TPL − SHUF | 未见问题，显式名称 | +0.667 (95% 区间 +0.634 至 +0.698) | TPL 更高 | 只读差异，不设界值 | 通过余量门槛 |

### S2 · OpenBMI 运动想象，冻结的 CBraMod 特征 · 51 名被试，三个随机种子

运动想象没有声明捷径检查，所以它的门槛写作“未运行”，不排除任何条目。运动想象只有两种三元循环，所以错配模板组三个随机种子中有两个共用同一种错位排列。未见问题“想象手部动作”最接近它的读出：显示出差异，但在比值界值之内。

| 比较 | 问题 | 差值（pp、log R 或 AUROC） | 是否显示差异 | 界值 | 门槛 |
| --- | --- | --- | --- | --- | --- |
| P1 · 标签模板 − 题号 — TPL − ID | 已见，3 选 1 | −0.49 pp (95% 区间 −1.07 至 +0.02 pp) | 未显示差异 | 在 ±2 pp 内等效 | 本任务未声明捷径检查，未运行 |
| P1 · 描述 − 题号 — DESC − ID | 已见，3 选 1 | −0.54 pp (95% 区间 −1.08 至 +0.05 pp) | 未显示差异 | 在 ±2 pp 内等效 | 本任务未声明捷径检查，未运行 |
| P2 · 新句式 − 训练问法 — TPL(a1) − TPL(train) | 已见，改写 — 重采样 12 条留出问法 | +0.05 pp (95% 区间 −0.10 至 +0.20 pp) | 未显示差异 | 在 ±2 pp 内等效 | 本任务未声明捷径检查，未运行 |
| P2 · 同义词 − 训练问法 — TPL(a2) − TPL(train) | 已见，改写 — 只对这三个同义词成立：固定，不重采样 | +0.22 pp (95% 区间 −0.11 至 +0.55 pp) | 未显示差异 | 在 ±2 pp 内等效 | 本任务未声明捷径检查，未运行 |
| P2 · 新描述 − 训练描述 — DESC(a3) − DESC(train) | 已见，改写 — 重采样 10 条留出问法 | −3.49 pp (95% 区间 −6.63 至 −1.42 pp) | DESC(train) 更高 | 未达到 2 pp 界值 | 本任务未声明捷径检查，未运行 |
| P3 · 标签模板分类头，对比由它自己的答案读出 — TPL / read-off | 想象手部动作 · 隐式名称 | +0.076 (95% 区间 +0.050 至 +0.107) (R 1.08 (1.05–1.11)) | 读出剩余的错误更少 | 在 1.25 的比值界值内等效 | 通过余量门槛 |
| P3 · 描述分类头，对比由它自己的答案读出 — DESC / read-off | 想象手部动作 · 新描述 — 重采样 10 条留出问法 | +0.088 (95% 区间 +0.048 至 +0.138) (R 1.09 (1.05–1.15)) | 读出剩余的错误更少 | 在 1.25 的比值界值内等效 | 通过余量门槛 |

### S3 · REVE-L 特征，BETA · 70 名被试，一个随机种子 · 事先声明多半无法下结论

REVE-L 特征保留了刺激相位，所以它的相邻 3 选 1 同时检验频率和相位。

| 比较 | 问题 | 差值（pp、log R 或 AUROC） | 是否显示差异 | 界值 | 门槛 |
| --- | --- | --- | --- | --- | --- |
| P1 · 标签模板 − 题号 — TPL − ID | 已见，32 选 1 | −2.76 pp (95% 区间 −3.51 至 −2.07 pp) | ID 更高 | 未达到 2 pp 界值 | 通过捷径检查 |
| P1 · 描述 − 题号 — DESC − ID | 已见，32 选 1 | −2.56 pp (95% 区间 −3.24 至 −1.90 pp) | ID 更高 | 未达到 2 pp 界值 | 通过捷径检查 |
| P2 · 新句式 − 训练问法 — TPL(a1) − TPL(train) | 已见，改写 — 重采样 12 条留出问法 | −4.48 pp (95% 区间 −7.66 至 −2.16 pp) | TPL(train) 更高 | 未达到 2 pp 界值 | 通过捷径检查 |
| P2 · 同义词 − 训练问法 — TPL(a2) − TPL(train) | 已见，改写 — 只对这三个同义词成立：固定，不重采样 | −2.16 pp (95% 区间 −2.44 至 −1.88 pp) | TPL(train) 更高 | 未达到 2 pp 界值 | 通过捷径检查 |
| P2 · 新描述 − 训练描述 — DESC(a3) − DESC(train) | 已见，改写 — 重采样 10 条留出问法 | −5.05 pp (95% 区间 −6.50 至 −3.77 pp) | DESC(train) 更高 | 未达到 2 pp 界值 | 通过捷径检查 |
| P4 · 标签模板 − CCA（无需训练） — TPL − CCA | 未见频率，8 选 1 | −65.32 pp (95% 区间 −69.18 至 −61.17 pp) | CCA 更高 | 未达到 2 pp 界值 | 通过余量门槛 |
| P4 · 标签模板 − 相邻两个已见频率的平均 — TPL − NN(TPL) | 未见频率，8 选 1 | +5.81 pp (95% 区间 +4.54 至 +7.04 pp) | TPL 更高 | 只读差异，不设界值 | 通过余量门槛 |
| P4 · 标签模板 − 数值编码 — TPL − NUM | 未见频率，8 选 1 | +1.92 pp (95% 区间 +0.85 至 +2.92 pp) | TPL 更高 | 只读差异，不设界值 | 通过余量门槛 |
| P4 · 标签模板 − CCA（无需训练） — TPL − CCA | 未见频率，相邻 3 选 1 | −38.75 pp (95% 区间 −41.62 至 −35.60 pp) | CCA 更高 | 未达到 2 pp 界值 | 通过余量门槛 |
| P4 · 标签模板 − 数值编码 — TPL − NUM | 未见频率，相邻 3 选 1 | +35.22 pp (95% 区间 +32.91 至 +37.42 pp) | TPL 更高 | 只读差异，不设界值 | 通过余量门槛 |

### S4 · 文本编码器 all-MiniLM-L6-v2，BETA，普通频谱 · 70 名被试，一个随机种子 · 事先声明多半无法下结论

| 比较 | 问题 | 差值（pp、log R 或 AUROC） | 是否显示差异 | 界值 | 门槛 |
| --- | --- | --- | --- | --- | --- |
| P1 · 标签模板 − 题号 — TPL − ID | 已见，32 选 1 | −6.73 pp (95% 区间 −7.75 至 −5.68 pp) | ID 更高 | 未达到 2 pp 界值 | 通过捷径检查 |
| P1 · 描述 − 题号 — DESC − ID | 已见，32 选 1 | −11.58 pp (95% 区间 −13.16 至 −9.97 pp) | ID 更高 | 未达到 2 pp 界值 | 通过捷径检查 |
| P2 · 新句式 − 训练问法 — TPL(a1) − TPL(train) | 已见，改写 — 重采样 12 条留出问法 | −3.95 pp (95% 区间 −5.11 至 −2.86 pp) | TPL(train) 更高 | 未达到 2 pp 界值 | 通过捷径检查 |
| P2 · 同义词 − 训练问法 — TPL(a2) − TPL(train) | 已见，改写 — 只对这三个同义词成立：固定，不重采样 | −4.90 pp (95% 区间 −5.53 至 −4.25 pp) | TPL(train) 更高 | 未达到 2 pp 界值 | 通过捷径检查 |
| P2 · 新描述 − 训练描述 — DESC(a3) − DESC(train) | 已见，改写 — 重采样 10 条留出问法 | −5.49 pp (95% 区间 −6.48 至 −4.60 pp) | DESC(train) 更高 | 未达到 2 pp 界值 | 通过捷径检查 |
| P4 · 标签模板 − CCA（无需训练） — TPL − CCA | 未见频率，8 选 1 | −50.10 pp (95% 区间 −53.06 至 −46.73 pp) | CCA 更高 | 未达到 2 pp 界值 | 通过余量门槛 |
| P4 · 标签模板 − 相邻两个已见频率的平均 — TPL − NN(TPL) | 未见频率，8 选 1 | −7.68 pp (95% 区间 −8.82 至 −6.50 pp) | NN(TPL) 更高 | 只读差异，不设界值 | 通过余量门槛 |
| P4 · 标签模板 − 数值编码 — TPL − NUM | 未见频率，8 选 1 | −10.84 pp (95% 区间 −12.53 至 −9.08 pp) | NUM 更高 | 只读差异，不设界值 | 通过余量门槛 |
| P4 · 标签模板 − CCA（无需训练） — TPL − CCA | 未见频率，相邻 3 选 1 | −61.85 pp (95% 区间 −65.13 至 −58.31 pp) | CCA 更高 | 未达到 2 pp 界值 | 通过余量门槛 |
| P4 · 标签模板 − 数值编码 — TPL − NUM | 未见频率，相邻 3 选 1 | −0.18 pp (95% 区间 −2.02 至 +1.73 pp) | 未显示差异 | 只读差异，不设界值 | 通过余量门槛 |

### S4 · 文本编码器 all-MiniLM-L6-v2，BETA，冻结的 CBraMod 特征 · 70 名被试，一个随机种子 · 事先声明多半无法下结论

| 比较 | 问题 | 差值（pp、log R 或 AUROC） | 是否显示差异 | 界值 | 门槛 |
| --- | --- | --- | --- | --- | --- |
| P1 · 标签模板 − 题号 — TPL − ID | 已见，32 选 1 | −4.73 pp (95% 区间 −5.43 至 −4.07 pp) | ID 更高 | 未达到 2 pp 界值 | 通过捷径检查 |
| P1 · 描述 − 题号 — DESC − ID | 已见，32 选 1 | −8.84 pp (95% 区间 −10.12 至 −7.60 pp) | ID 更高 | 未达到 2 pp 界值 | 通过捷径检查 |
| P2 · 新句式 − 训练问法 — TPL(a1) − TPL(train) | 已见，改写 — 重采样 12 条留出问法 | −2.89 pp (95% 区间 −3.73 至 −2.08 pp) | TPL(train) 更高 | 未达到 2 pp 界值 | 通过捷径检查 |
| P2 · 同义词 − 训练问法 — TPL(a2) − TPL(train) | 已见，改写 — 只对这三个同义词成立：固定，不重采样 | −3.09 pp (95% 区间 −3.57 至 −2.63 pp) | TPL(train) 更高 | 未达到 2 pp 界值 | 通过捷径检查 |
| P2 · 新描述 − 训练描述 — DESC(a3) − DESC(train) | 已见，改写 — 重采样 10 条留出问法 | −2.98 pp (95% 区间 −3.67 至 −2.34 pp) | DESC(train) 更高 | 未达到 2 pp 界值 | 通过捷径检查 |
| P4 · 标签模板 − CCA（无需训练） — TPL − CCA | 未见频率，8 选 1 | −61.55 pp (95% 区间 −65.21 至 −57.49 pp) | CCA 更高 | 未达到 2 pp 界值 | 通过余量门槛 |
| P4 · 标签模板 − 相邻两个已见频率的平均 — TPL − NN(TPL) | 未见频率，8 选 1 | −1.09 pp (95% 区间 −1.69 至 −0.48 pp) | NN(TPL) 更高 | 只读差异，不设界值 | 通过余量门槛 |
| P4 · 标签模板 − 数值编码 — TPL − NUM | 未见频率，8 选 1 | −2.03 pp (95% 区间 −2.86 至 −1.19 pp) | NUM 更高 | 只读差异，不设界值 | 通过余量门槛 |
| P4 · 标签模板 − CCA（无需训练） — TPL − CCA | 未见频率，相邻 3 选 1 | −54.63 pp (95% 区间 −57.51 至 −51.29 pp) | CCA 更高 | 未达到 2 pp 界值 | 通过余量门槛 |
| P4 · 标签模板 − 数值编码 — TPL − NUM | 未见频率，相邻 3 选 1 | +15.57 pp (95% 区间 +14.27 至 +16.75 pp) | TPL 更高 | 只读差异，不设界值 | 通过余量门槛 |

### S5 · 中文问法，multilingual-e5-small，BETA，普通频谱 · 70 名被试，一个随机种子 · 事先声明多半无法下结论

对这个编码器，每个留出频率都是一个新的分词，而不只是已见分词的新组合（决定 S0b-6）。

| 比较 | 问题 | 差值（pp、log R 或 AUROC） | 是否显示差异 | 界值 | 门槛 |
| --- | --- | --- | --- | --- | --- |
| P1 · 标签模板 − 题号 — TPL − ID | 已见，32 选 1 | −3.15 pp (95% 区间 −3.80 至 −2.48 pp) | ID 更高 | 未达到 2 pp 界值 | 通过捷径检查 |
| P1 · 描述 − 题号 — DESC − ID | 已见，32 选 1 | −4.94 pp (95% 区间 −5.69 至 −4.18 pp) | ID 更高 | 未达到 2 pp 界值 | 通过捷径检查 |
| P2 · 新句式 − 训练问法 — TPL(a1) − TPL(train) | 已见，改写 — 重采样 12 条留出问法 | −4.67 pp (95% 区间 −6.57 至 −3.24 pp) | TPL(train) 更高 | 未达到 2 pp 界值 | 通过捷径检查 |
| P2 · 同义词 − 训练问法 — TPL(a2) − TPL(train) | 已见，改写 — 只对这三个同义词成立：固定，不重采样 | −8.70 pp (95% 区间 −9.76 至 −7.60 pp) | TPL(train) 更高 | 未达到 2 pp 界值 | 通过捷径检查 |
| P2 · 新描述 − 训练描述 — DESC(a3) − DESC(train) | 已见，改写 — 重采样 10 条留出问法 | −7.35 pp (95% 区间 −8.58 至 −6.17 pp) | DESC(train) 更高 | 未达到 2 pp 界值 | 通过捷径检查 |
| P4 · 标签模板 − CCA（无需训练） — TPL − CCA | 未见频率，8 选 1 | −54.76 pp (95% 区间 −57.77 至 −51.25 pp) | CCA 更高 | 未达到 2 pp 界值 | 通过余量门槛 |
| P4 · 标签模板 − 相邻两个已见频率的平均 — TPL − NN(TPL) | 未见频率，8 选 1 | −15.81 pp (95% 区间 −17.68 至 −13.94 pp) | NN(TPL) 更高 | 只读差异，不设界值 | 通过余量门槛 |
| P4 · 标签模板 − 数值编码 — TPL − NUM | 未见频率，8 选 1 | −15.51 pp (95% 区间 −17.58 至 −13.44 pp) | NUM 更高 | 只读差异，不设界值 | 通过余量门槛 |
| P4 · 标签模板 − CCA（无需训练） — TPL − CCA | 未见频率，相邻 3 选 1 | −59.98 pp (95% 区间 −63.74 至 −55.86 pp) | CCA 更高 | 未达到 2 pp 界值 | 通过余量门槛 |
| P4 · 标签模板 − 数值编码 — TPL − NUM | 未见频率，相邻 3 选 1 | +1.69 pp (95% 区间 −0.60 至 +4.18 pp) | 未显示差异 | 只读差异，不设界值 | 通过余量门槛 |

### S8 · 外推到频率网格顶端一段连续的留出频段，BETA L0 · 70 名被试，一个随机种子 · 事先声明多半无法下结论

| 比较 | 差值（pp） | 是否显示差异 | 界值 ±2 pp |
| --- | --- | --- | --- |
| TPL - CCA (8-way) | −65.37 pp (95% 区间 −69.21 至 −61.40 pp) | CCA 更高 | 未达到 2 pp 界值 |
| TPL - NUM (8-way) | +3.51 pp (95% 区间 +1.64 至 +5.49 pp) | TPL 更高 | TPL 非劣（界值 2 pp） |
| TPL - NN(TPL) (8-way) | 没有定义（EA-1） |  |  |
| TPL - CCA (3-way) | −50.19 pp (95% 区间 −54.05 至 −46.25 pp) | CCA 更高 | 未达到 2 pp 界值 |

### S8 · 外推到频率网格顶端一段连续的留出频段，BETA L1 · 70 名被试，一个随机种子 · 事先声明多半无法下结论

| 比较 | 差值（pp） | 是否显示差异 | 界值 ±2 pp |
| --- | --- | --- | --- |
| TPL - CCA (8-way) | −67.47 pp (95% 区间 −71.22 至 −63.56 pp) | CCA 更高 | 未达到 2 pp 界值 |
| TPL - NUM (8-way) | +0.88 pp (95% 区间 −0.70 至 +2.47 pp) | 未显示差异 | TPL 非劣（界值 2 pp） |
| TPL - NN(TPL) (8-way) | 没有定义（EA-1） |  |  |
| TPL - CCA (3-way) | −48.41 pp (95% 区间 −52.10 至 −44.40 pp) | CCA 更高 | 未达到 2 pp 界值 |

在这个频段里，相邻 3 选 1 的竞争对手本身就是留出的问题，而不是训练好的检测器；相邻平均没有定义（EA-1）。对 bge-small-en-v1.5，这些文本中有许多带有训练中从未出现过的数字分词。

### S12 · Wearable-102，分类头在 BETA 的全部频率上训练，再问网格之外的频率 · 102 名被试，三个随机种子

网格之外的频率有两位小数，百分位的分词从未出现在 BETA 的训练文本中，所以文本问法面对的是新的分词；数值编码才是干净的比较。共九次拟合（三种问法乘三个随机种子），在冻结之前定下。由清华大学作者镜像计算，不声称任何物理单位。

| 比较 | 差值（pp） | 是否显示差异 | 界值 ±2 pp |
| --- | --- | --- | --- |
| 干电极 |  |  |  |
| TPL - CCA (12-way) | −48.18 pp (95% 区间 −52.36 至 −43.90 pp) | CCA 更高 | 未达到 2 pp 界值 |
| NUM - CCA (12-way) | −42.16 pp (95% 区间 −46.05 至 −38.38 pp) | CCA 更高 | 未达到 2 pp 界值 |
| TPL - NUM (12-way) | −6.02 pp (95% 区间 −7.32 至 −4.73 pp) | NUM 更高 | 未达到 2 pp 界值 |
| DESC - CCA (12-way) | −48.52 pp (95% 区间 −52.99 至 −44.02 pp) | CCA 更高 | 未达到 2 pp 界值 |
| 湿电极 |  |  |  |
| TPL - CCA (12-way) | −62.92 pp (95% 区间 −66.16 至 −59.66 pp) | CCA 更高 | 未达到 2 pp 界值 |
| NUM - CCA (12-way) | −56.11 pp (95% 区间 −59.16 至 −52.83 pp) | CCA 更高 | 未达到 2 pp 界值 |
| TPL - NUM (12-way) | −6.82 pp (95% 区间 −8.31 至 −5.33 pp) | NUM 更高 | 未达到 2 pp 界值 |
| DESC - CCA (12-way) | −63.56 pp (95% 区间 −66.68 至 −60.31 pp) | CCA 更高 | 未达到 2 pp 界值 |

### S10、S11 与 S13 · BETA L0：其他问法对比 CCA 和 FBCCA，以及留出问法 · 70 名被试，三个随机种子

| 比较 | 差值（pp） | 是否显示差异 | 界值 ±2 pp |
| --- | --- | --- | --- |
| S10 DESC - CCA (8-way) | −52.29 pp (95% 区间 −55.41 至 −49.00 pp) | CCA 更高 | 未达到 2 pp 界值 |
| S10 DESC - CCA (3-way) | −62.72 pp (95% 区间 −66.34 至 −58.98 pp) | CCA 更高 | 未达到 2 pp 界值 |
| S10 DESC - NN(DESC) (8-way) | −10.80 pp (95% 区间 −12.15 至 −9.39 pp) | NN(DESC) 更高 | 未达到 2 pp 界值 |
| S10 NUM - CCA (8-way) | −39.44 pp (95% 区间 −42.25 至 −36.48 pp) | CCA 更高 | 未达到 2 pp 界值 |
| S10 TPL - NN(ID) (8-way) | −15.63 pp (95% 区间 −17.48 至 −13.62 pp) | NN(ID) 更高 | 未达到 2 pp 界值 |
| S10 TPL - SHUF (8-way) | +19.50 pp (95% 区间 +17.45 至 +21.62 pp) | TPL 更高 | TPL 非劣（界值 2 pp） |
| S11 TPL - FBCCA (8-way) | −61.68 pp (95% 区间 −63.72 至 −59.69 pp) | FBCCA 更高 | 未达到 2 pp 界值 |
| S11 TPL - FBCCA (3-way) | −73.35 pp (95% 区间 −75.61 至 −70.93 pp) | FBCCA 更高 | 未达到 2 pp 界值 |
| S13 TPL held-out frames - CCA (8-way) | −53.71 pp (95% 区间 −56.73 至 −50.27 pp) | CCA 更高 | 未达到 2 pp 界值 |
| S13 DESC held-out descriptions - CCA (8-way) | −54.01 pp (95% 区间 −57.07 至 −50.83 pp) | CCA 更高 | 未达到 2 pp 界值 |

S9 与 S11 · BETA L0：在同一项检验中已见与未见频率上的准确率，以及 FBCCA（描述性）

| 问法 | 已见频率 | 未见频率 |
| --- | --- | --- |
| S9 TPL | 23.4% (95% 区间 21.0%–25.7%) | 4.4% (95% 区间 4.0%–4.8%) |
| S9 DESC | 24.0% (95% 区间 21.5%–26.5%) | 4.2% (95% 区间 3.8%–4.7%) |
| S9 SHUF | 23.4% (95% 区间 20.9%–25.7%) | 1.1% (95% 区间 1.0%–1.4%) |
| S9 NUM | 20.7% (95% 区间 18.5%–22.9%) | 11.5% (95% 区间 10.2%–12.7%) |
| 每个问题一个输出的分类头，相邻读出（nn8） | 44.3% (95% 区间 40.9%–47.5%) |  |
| FBCCA，已见 32 选 1 | 81.1% (95% 区间 77.0%–84.8%) |  |
| FBCCA，未见 8 选 1 | 90.4% (95% 区间 87.7%–92.8%) |  |
| FBCCA，相邻 3 选 1 | 92.7% (95% 区间 90.9%–94.4%) |  |

### S10、S11 与 S13 · BETA L1：其他问法对比 CCA 和 FBCCA，以及留出问法 · 70 名被试，三个随机种子

| 比较 | 差值（pp） | 是否显示差异 | 界值 ±2 pp |
| --- | --- | --- | --- |
| S10 DESC - CCA (8-way) | −62.26 pp (95% 区间 −66.01 至 −58.41 pp) | CCA 更高 | 未达到 2 pp 界值 |
| S10 DESC - CCA (3-way) | −54.93 pp (95% 区间 −58.01 至 −51.72 pp) | CCA 更高 | 未达到 2 pp 界值 |
| S10 DESC - NN(DESC) (8-way) | −1.27 pp (95% 区间 −2.08 至 −0.46 pp) | NN(DESC) 更高 | 未达到 2 pp 界值 |
| S10 NUM - CCA (8-way) | −59.48 pp (95% 区间 −62.92 至 −55.87 pp) | CCA 更高 | 未达到 2 pp 界值 |
| S10 TPL - NN(ID) (8-way) | +0.68 pp (95% 区间 −0.25 至 +1.61 pp) | 未显示差异 | 在 ±2 pp 内等效 |
| S10 TPL - SHUF (8-way) | +7.97 pp (95% 区间 +6.88 至 +9.09 pp) | TPL 更高 | TPL 非劣（界值 2 pp） |
| S11 TPL - FBCCA (8-way) | −71.41 pp (95% 区间 −73.53 至 −69.17 pp) | FBCCA 更高 | 未达到 2 pp 界值 |
| S11 TPL - FBCCA (3-way) | −65.66 pp (95% 区间 −67.61 至 −63.62 pp) | FBCCA 更高 | 未达到 2 pp 界值 |
| S13 TPL held-out frames - CCA (8-way) | −62.31 pp (95% 区间 −66.06 至 −58.27 pp) | CCA 更高 | 未达到 2 pp 界值 |
| S13 DESC held-out descriptions - CCA (8-way) | −62.58 pp (95% 区间 −66.15 至 −58.59 pp) | CCA 更高 | 未达到 2 pp 界值 |

S9 与 S11 · BETA L1：在同一项检验中已见与未见频率上的准确率，以及 FBCCA（描述性）

| 问法 | 已见频率 | 未见频率 |
| --- | --- | --- |
| S9 TPL | 18.8% (95% 区间 16.7%–21.1%) | 2.5% (95% 区间 2.2%–2.8%) |
| S9 DESC | 18.9% (95% 区间 16.9%–21.2%) | 2.5% (95% 区间 2.3%–2.8%) |
| S9 SHUF | 18.3% (95% 区间 16.4%–20.4%) | 1.6% (95% 区间 1.3%–1.9%) |
| S9 NUM | 11.5% (95% 区间 10.4%–12.7%) | 4.3% (95% 区间 3.8%–4.8%) |
| 每个问题一个输出的分类头，相邻读出（nn8） | 17.6% (95% 区间 16.6%–18.8%) |  |
| FBCCA，已见 32 选 1 | 81.1% (95% 区间 77.0%–84.8%) |  |
| FBCCA，未见 8 选 1 | 90.4% (95% 区间 87.7%–92.8%) |  |
| FBCCA，相邻 3 选 1 | 92.7% (95% 区间 90.9%–94.4%) |  |

S9 在一项 40 选 1 检验中同时问已见与未见频率；FBCCA 与 CCA 一样不需要训练。FBCCA 只有一个随机种子。

### BOAS 上的次要结果

**BOAS 在说明三处缺口后发布（所有者决定，2026 年 10 月 7 日）：**

- 知情同意声明没有说明被试是否同意公开共享或二次使用。The consent statement does not say whether participants agreed to public sharing or secondary use.
- 伦理与知情同意的陈述只来自发布者的数据集说明与 README，没有任何同行评审论文描述 BOAS。The ethics and consent statements come from the publisher's dataset description and README. No peer-reviewed paper describes BOAS.
- 伦理批件编号是在 1.1.1 版（2025 年 5 月）才加入发布的，发布中没有说明它是在记录之前还是之后批准的。The ethics reference was added to the release in version 1.1.1 (May 2025), and the release does not say when it was granted relative to the recordings.

被试在公开发布中是假名化的。这里没有任何结果是在评估 Bitbrain 的头带或它的自动睡眠分期；两者都没有使用。No result here evaluates Bitbrain's headband or its automatic sleep scoring; neither is used.

**署名：** Eduardo López-Larraz, María Sierra-Torralba, Sergio Clemente, Galit Fierro, David Oriol, Javier Minguez, Luis Montesano and Jens G. Klinzing · The Bitbrain Open Access Sleep (BOAS) dataset, OpenNeuro ds005555, version 1.1.3 (2026), doi:10.18112/openneuro.ds005555.v1.1.3. Polysomnography EEG and the human-consensus stage labels only; the headband recordings and the publisher's automatic labels are not used.

### S3 · REVE-L 特征，BOAS · 100 名被试，一个随机种子 · 事先声明多半无法下结论

| 比较 | 问题 | 差值（pp、log R 或 AUROC） | 是否显示差异 | 界值 | 门槛 |
| --- | --- | --- | --- | --- | --- |
| P1 · 标签模板 − 题号 — TPL − ID | 已见，5 选 1 | +0.27 pp (95% 区间 −0.36 至 +0.86 pp) | 未显示差异 | 在 ±2 pp 内等效 | 通过捷径检查 |
| P1 · 描述 − 题号 — DESC − ID | 已见，5 选 1 | +0.12 pp (95% 区间 −0.48 至 +0.71 pp) | 未显示差异 | 在 ±2 pp 内等效 | 通过捷径检查 |
| P2 · 新句式 − 训练问法 — TPL(a1) − TPL(train) | 已见，改写 — 重采样 12 条留出问法 | −0.39 pp (95% 区间 −1.04 至 +0.05 pp) | 未显示差异 | 在 ±2 pp 内等效 | 通过捷径检查 |
| P2 · 同义词 − 训练问法 — TPL(a2) − TPL(train) | 已见，改写 — 只对这三个同义词成立：固定，不重采样 | −13.54 pp (95% 区间 −14.57 至 −12.49 pp) | TPL(train) 更高 | 未达到 2 pp 界值 | 通过捷径检查 |
| P2 · 新描述 − 训练描述 — DESC(a3) − DESC(train) | 已见，改写 — 重采样 10 条留出问法 | −21.86 pp (95% 区间 −30.62 至 −14.12 pp) | DESC(train) 更高 | 未达到 2 pp 界值 | 通过捷径检查 |
| P3 · 标签模板分类头，对比由它自己的答案读出 — TPL / read-off | 睡着 · 隐式名称 | +4.149 (95% 区间 +3.753 至 +4.614) (R 63.39 (42.66–100.85)) | 读出剩余的错误更少 | 未达到 1.25 的比值界值 | 通过余量门槛 |
| P3 · 标签模板分类头，对比由它自己的答案读出 — TPL / read-off | 睡着 · 显式名称 | +2.647 (95% 区间 +2.274 至 +3.070) (R 14.11 (9.72–21.55)) | 读出剩余的错误更少 | 未达到 1.25 的比值界值 | 通过余量门槛 |
| P3 · 标签模板分类头，对比由它自己的答案读出 — TPL / read-off | N1、N2 或 N3 期睡眠 · 显式名称 | +1.317 (95% 区间 +1.163 至 +1.483) (R 3.73 (3.20–4.41)) | 读出剩余的错误更少 | 未达到 1.25 的比值界值 | 通过余量门槛 |
| P3 · 标签模板分类头，对比由它自己的答案读出 — TPL / read-off | 浅睡 · 隐式名称 | +2.730 (95% 区间 +2.540 至 +2.929) (R 15.33 (12.67–18.71)) | 读出剩余的错误更少 | 未达到 1.25 的比值界值 | 通过余量门槛 |
| P3 · 标签模板分类头，对比由它自己的答案读出 — TPL / read-off | 浅睡 · 显式名称 | +1.872 (95% 区间 +1.691 至 +2.057) (R 6.50 (5.43–7.82)) | 读出剩余的错误更少 | 未达到 1.25 的比值界值 | 通过余量门槛 |
| P3 · 描述分类头，对比由它自己的答案读出 — DESC / read-off | 睡着 · 新描述 — 重采样 10 条留出问法 | +4.092 (95% 区间 +3.565 至 +4.610) (R 59.84 (35.35–100.44)) | 读出剩余的错误更少 | 未达到 1.25 的比值界值 | 通过余量门槛 |
| P3 · 描述分类头，对比由它自己的答案读出 — DESC / read-off | N1、N2 或 N3 期睡眠 · 新描述 — 重采样 10 条留出问法 | +1.829 (95% 区间 +1.250 至 +2.292) (R 6.23 (3.49–9.90)) | 读出剩余的错误更少 | 未达到 1.25 的比值界值 | 通过余量门槛 |
| P3 · 描述分类头，对比由它自己的答案读出 — DESC / read-off | 浅睡 · 新描述 — 重采样 10 条留出问法 | +1.774 (95% 区间 +1.162 至 +2.236) (R 5.89 (3.20–9.35)) | 读出剩余的错误更少 | 未达到 1.25 的比值界值 | 通过余量门槛 |
| P5 · 标签模板 − 错配模板 — TPL − SHUF | 未见问题，隐式名称 | −0.585 (95% 区间 −0.612 至 −0.555) | SHUF 更高 | 只读差异，不设界值 | 通过余量门槛 |
| P5 · 标签模板 − 错配模板 — TPL − SHUF | 未见问题，显式名称 | +0.626 (95% 区间 +0.602 至 +0.648) | TPL 更高 | 只读差异，不设界值 | 通过余量门槛 |

### S4 · 文本编码器 all-MiniLM-L6-v2，BOAS，冻结的 CBraMod 特征 · 100 名被试，一个随机种子 · 事先声明多半无法下结论

| 比较 | 问题 | 差值（pp、log R 或 AUROC） | 是否显示差异 | 界值 | 门槛 |
| --- | --- | --- | --- | --- | --- |
| P1 · 标签模板 − 题号 — TPL − ID | 已见，5 选 1 | +0.19 pp (95% 区间 −0.37 至 +0.75 pp) | 未显示差异 | 在 ±2 pp 内等效 | 通过捷径检查 |
| P1 · 描述 − 题号 — DESC − ID | 已见，5 选 1 | +0.01 pp (95% 区间 −0.64 至 +0.72 pp) | 未显示差异 | 在 ±2 pp 内等效 | 通过捷径检查 |
| P2 · 新句式 − 训练问法 — TPL(a1) − TPL(train) | 已见，改写 — 重采样 12 条留出问法 | −1.72 pp (95% 区间 −4.31 至 −0.09 pp) | TPL(train) 更高 | 未达到 2 pp 界值 | 通过捷径检查 |
| P2 · 同义词 − 训练问法 — TPL(a2) − TPL(train) | 已见，改写 — 只对这三个同义词成立：固定，不重采样 | −14.04 pp (95% 区间 −15.29 至 −12.68 pp) | TPL(train) 更高 | 未达到 2 pp 界值 | 通过捷径检查 |
| P2 · 新描述 − 训练描述 — DESC(a3) − DESC(train) | 已见，改写 — 重采样 10 条留出问法 | −25.74 pp (95% 区间 −34.29 至 −16.26 pp) | DESC(train) 更高 | 未达到 2 pp 界值 | 通过捷径检查 |
| P3 · 标签模板分类头，对比由它自己的答案读出 — TPL / read-off | 睡着 · 隐式名称 | +3.798 (95% 区间 +3.385 至 +4.273) (R 44.60 (29.53–71.76)) | 读出剩余的错误更少 | 未达到 1.25 的比值界值 | 通过余量门槛 |
| P3 · 标签模板分类头，对比由它自己的答案读出 — TPL / read-off | 睡着 · 显式名称 | +1.325 (95% 区间 +0.999 至 +1.715) (R 3.76 (2.71–5.56)) | 读出剩余的错误更少 | 未达到 1.25 的比值界值 | 通过余量门槛 |
| P3 · 标签模板分类头，对比由它自己的答案读出 — TPL / read-off | N1、N2 或 N3 期睡眠 · 显式名称 | +0.882 (95% 区间 +0.717 至 +1.047) (R 2.41 (2.05–2.85)) | 读出剩余的错误更少 | 未达到 1.25 的比值界值 | 通过余量门槛 |
| P3 · 标签模板分类头，对比由它自己的答案读出 — TPL / read-off | 浅睡 · 隐式名称 | +2.338 (95% 区间 +2.134 至 +2.552) (R 10.36 (8.45–12.83)) | 读出剩余的错误更少 | 未达到 1.25 的比值界值 | 通过余量门槛 |
| P3 · 标签模板分类头，对比由它自己的答案读出 — TPL / read-off | 浅睡 · 显式名称 | +1.796 (95% 区间 +1.598 至 +2.000) (R 6.03 (4.94–7.39)) | 读出剩余的错误更少 | 未达到 1.25 的比值界值 | 通过余量门槛 |
| P3 · 描述分类头，对比由它自己的答案读出 — DESC / read-off | 睡着 · 新描述 — 重采样 10 条留出问法 | +3.069 (95% 区间 +2.508 至 +3.601) (R 21.52 (12.28–36.65)) | 读出剩余的错误更少 | 未达到 1.25 的比值界值 | 通过余量门槛 |
| P3 · 描述分类头，对比由它自己的答案读出 — DESC / read-off | N1、N2 或 N3 期睡眠 · 新描述 — 重采样 10 条留出问法 | +1.118 (95% 区间 +0.793 至 +1.449) (R 3.06 (2.21–4.26)) | 读出剩余的错误更少 | 未达到 1.25 的比值界值 | 通过余量门槛 |
| P3 · 描述分类头，对比由它自己的答案读出 — DESC / read-off | 浅睡 · 新描述 — 重采样 10 条留出问法 | +1.070 (95% 区间 +0.840 至 +1.333) (R 2.92 (2.32–3.79)) | 读出剩余的错误更少 | 未达到 1.25 的比值界值 | 通过余量门槛 |
| P5 · 标签模板 − 错配模板 — TPL − SHUF | 未见问题，隐式名称 | −0.626 (95% 区间 −0.653 至 −0.596) | SHUF 更高 | 只读差异，不设界值 | 通过余量门槛 |
| P5 · 标签模板 − 错配模板 — TPL − SHUF | 未见问题，显式名称 | +0.572 (95% 区间 +0.550 至 +0.592) | TPL 更高 | 只读差异，不设界值 | 通过余量门槛 |

### S5 · 中文问法，multilingual-e5-small，BOAS，冻结的 CBraMod 特征 · 100 名被试，一个随机种子 · 事先声明多半无法下结论

| 比较 | 问题 | 差值（pp、log R 或 AUROC） | 是否显示差异 | 界值 | 门槛 |
| --- | --- | --- | --- | --- | --- |
| P1 · 标签模板 − 题号 — TPL − ID | 已见，5 选 1 | +0.34 pp (95% 区间 −0.29 至 +0.99 pp) | 未显示差异 | 在 ±2 pp 内等效 | 通过捷径检查 |
| P1 · 描述 − 题号 — DESC − ID | 已见，5 选 1 | −0.28 pp (95% 区间 −0.93 至 +0.42 pp) | 未显示差异 | 在 ±2 pp 内等效 | 通过捷径检查 |
| P2 · 新句式 − 训练问法 — TPL(a1) − TPL(train) | 已见，改写 — 重采样 12 条留出问法 | −0.70 pp (95% 区间 −1.83 至 +0.08 pp) | 未显示差异 | 在 ±2 pp 内等效 | 通过捷径检查 |
| P2 · 同义词 − 训练问法 — TPL(a2) − TPL(train) | 已见，改写 — 只对这三个同义词成立：固定，不重采样 | −12.51 pp (95% 区间 −13.73 至 −11.27 pp) | TPL(train) 更高 | 未达到 2 pp 界值 | 通过捷径检查 |
| P2 · 新描述 − 训练描述 — DESC(a3) − DESC(train) | 已见，改写 — 重采样 10 条留出问法 | −25.81 pp (95% 区间 −33.97 至 −17.73 pp) | DESC(train) 更高 | 未达到 2 pp 界值 | 通过捷径检查 |
| P3 · 标签模板分类头，对比由它自己的答案读出 — TPL / read-off | 睡着 · 隐式名称 | +3.826 (95% 区间 +3.424 至 +4.277) (R 45.87 (30.69–72.04)) | 读出剩余的错误更少 | 未达到 1.25 的比值界值 | 通过余量门槛 |
| P3 · 标签模板分类头，对比由它自己的答案读出 — TPL / read-off | 睡着 · 显式名称 | +1.558 (95% 区间 +1.216 至 +1.950) (R 4.75 (3.37–7.03)) | 读出剩余的错误更少 | 未达到 1.25 的比值界值 | 通过余量门槛 |
| P3 · 标签模板分类头，对比由它自己的答案读出 — TPL / read-off | N1、N2 或 N3 期睡眠 · 显式名称 | +0.737 (95% 区间 +0.584 至 +0.898) (R 2.09 (1.79–2.45)) | 读出剩余的错误更少 | 未达到 1.25 的比值界值 | 通过余量门槛 |
| P3 · 标签模板分类头，对比由它自己的答案读出 — TPL / read-off | 浅睡 · 隐式名称 | +2.322 (95% 区间 +2.122 至 +2.532) (R 10.19 (8.34–12.57)) | 读出剩余的错误更少 | 未达到 1.25 的比值界值 | 通过余量门槛 |
| P3 · 标签模板分类头，对比由它自己的答案读出 — TPL / read-off | 浅睡 · 显式名称 | +1.615 (95% 区间 +1.424 至 +1.809) (R 5.03 (4.15–6.11)) | 读出剩余的错误更少 | 未达到 1.25 的比值界值 | 通过余量门槛 |
| P3 · 描述分类头，对比由它自己的答案读出 — DESC / read-off | 睡着 · 新描述 — 重采样 10 条留出问法 | +2.715 (95% 区间 +2.127 至 +3.244) (R 15.11 (8.39–25.63)) | 读出剩余的错误更少 | 未达到 1.25 的比值界值 | 通过余量门槛 |
| P3 · 描述分类头，对比由它自己的答案读出 — DESC / read-off | N1、N2 或 N3 期睡眠 · 新描述 — 重采样 10 条留出问法 | +0.798 (95% 区间 +0.599 至 +1.039) (R 2.22 (1.82–2.83)) | 读出剩余的错误更少 | 未达到 1.25 的比值界值 | 通过余量门槛 |
| P3 · 描述分类头，对比由它自己的答案读出 — DESC / read-off | 浅睡 · 新描述 — 重采样 10 条留出问法 | +0.943 (95% 区间 +0.773 至 +1.123) (R 2.57 (2.17–3.07)) | 读出剩余的错误更少 | 未达到 1.25 的比值界值 | 通过余量门槛 |

### S13 · 留出的句式对比读出，BOAS · 100 名被试，三个随机种子

| 比较 | log R（附 R） | 是否显示差异 | 界值 R < 1.25 |
| --- | --- | --- | --- |
| TPL asleep implicit (held-out frames) | +3.565 (95% 区间 +3.162 至 +4.006) | 读出剩余的错误更少 | 未达到 1.25 的比值界值 |
| TPL asleep explicit (held-out frames) | +1.976 (95% 区间 +1.594 至 +2.392) | 读出剩余的错误更少 | 未达到 1.25 的比值界值 |
| TPL NREM explicit (held-out frames) | +0.920 (95% 区间 +0.743 至 +1.100) | 读出剩余的错误更少 | 未达到 1.25 的比值界值 |
| TPL light implicit (held-out frames) | +2.233 (95% 区间 +2.022 至 +2.443) | 读出剩余的错误更少 | 未达到 1.25 的比值界值 |
| TPL light explicit (held-out frames) | +1.484 (95% 区间 +1.240 至 +1.719) | 读出剩余的错误更少 | 未达到 1.25 的比值界值 |

### S6 · 否定探针，BOAS：边界探针，从不写入路线结论

每个否定问法对被否定问题真值的 AUROC，旁边是 1 − p(X) 的 AUROC，也就是把分类头对 X 的回答反过来；三个随机种子。“非 REM 睡眠”按“不是 REM”的真值评分。

| 问法 | 对被否定问题真值的 AUROC | 1 − p(X) 的 AUROC | 被试 |
| --- | --- | --- | --- |
| not W | 0.022 (95% 区间 0.014–0.030) | 0.980 (95% 区间 0.972–0.987) | 100 |
| not N1 | 0.135 (95% 区间 0.120–0.152) | 0.872 (95% 区间 0.855–0.887) | 100 |
| not N2 | 0.124 (95% 区间 0.110–0.139) | 0.924 (95% 区间 0.909–0.937) | 100 |
| not N3 | 0.021 (95% 区间 0.017–0.026) | 0.979 (95% 区间 0.974–0.983) | 71 |
| not REM | 0.049 (95% 区间 0.038–0.061) | 0.956 (95% 区间 0.944–0.967) | 100 |
| non-REM sleep (implicit) | 0.048 (95% 区间 0.037–0.060) | 0.956 (95% 区间 0.944–0.967) | 100 |

每一个否定问法，都被当成在问 X 本身：它对被否定问题真值的 AUROC 远低于 0.5，而把分类头对 X 的回答反过来，本可以答得很好。多写提示词并不能提供信号层面的真值。

随结果一并发布

## 问法、留出频率与错位排列

提问所用的全部 787 条文本，英文与中文，涵盖睡眠、SSVEP 和运动想象：训练与留出的句式、标签名称与同义词、描述、未见问题的名称与描述，以及否定句式。两个代理在任何评分之前按固定说明写成，第二个代理在没有看到第一个代理文件的情况下写了全部留出描述；它们不是用户写的问法，也没有调优。文件中还有它们通过的防泄漏规则、每种轮换的留出频率与外推频段、错配对照预先声明的错位排列、频率的数值编码，以及固定版本的文本编码器。只有文本，[CC BY 4.0](https://creativecommons.org/licenses/by/4.0/)。

[问法文件（JSON）↓](https://bci.report/data/questions-in-language-wordings.json)

训练句式中各睡眠分期的名称，以及每个名称改写时所用的三个同义词（英文原文）：

| 分期 | 训练名称 | 同义词（a2） |
| --- | --- | --- |
| W | wake | wakefulness、awake、stage W |
| N1 | N1 sleep | stage 1 sleep、sleep stage one、stage N1 |
| N2 | N2 sleep | stage 2 sleep、sleep stage two、stage N2 |
| N3 | N3 sleep | slow-wave sleep、deep sleep、stage N3 |
| REM | REM sleep | stage R sleep、paradoxical sleep、dream sleep |

方法与局限

## 这些结果能说明什么、不能说明什么

- “未见过”指 EEG 分类头没有见过；文本编码器读过这些词，而且每个留出频率的每个分词也都出现在训练文本中。'Unseen' means unseen by the EEG head; the text encoder has read these words, and every token of a held-out frequency also occurs in the training texts.
- 留出的睡眠问题都是已见分期的组合（“睡着”是其中一期的补集），作为组合式问题报告，与读出结果并列。Held-out sleep questions are combinations of seen stages ('asleep' is the complement of one), reported as compositional beside the read-off.
- 留出的 SSVEP 问题说的是一个频率，而 CCA 不需要训练就能回答；主分析检验内插，外推只是次要分析。Held-out SSVEP questions name a frequency, which CCA answers without training; interpolation tested, extrapolation secondary.
- 在相邻 3 选 1 中，未见过的频率要与两侧相邻频率已训练好的检测器竞争；在 L1 上，这项检验还牵涉刺激相位。In the neighbour 3-way the unseen frequency competes against trained detectors for its neighbours; at L1 that test also involves stimulus phase.
- 改写的结果与未见问题的结果分行列出，从不合并。Rewording and unseen results are separate rows and never pooled.
- 问法由代理在评分之前按固定说明写成，不是用户写的，也没有调优。Wordings were written by agents from a fixed brief before scoring, not by users and not tuned.
- 否定只是一个边界探针；关于位置和波形形态的问题没有检验（手头没有信号层面的真值）。Negation is a boundary probe; location and waveform-shape questions are not tested (no signal-level ground truth held).
- 冻结特征加一个小分类头；只有一套训练方案；不是文本编码器或 EEG 编码器的排名。Frozen features and a small head; one recipe; not a ranking of text or EEG encoders.
- 35 项预先声明的比较，未做多重比较校正。35 pre-declared comparisons, not corrected for multiplicity.
- 关于否定、位置或波形形态的问题，需要信号层面的真值标注。多写提示词并不能提供这种真值。Questions about negation, location or waveform shape need signal-level ground truth. Writing more prompts does not supply it.
- 否定没有被理解：否定问法（“不是 X”“非 REM 睡眠”）的得分，就像在问 X 本身（对被否定问题真值的 AUROC 为 0.02–0.13；边界探针 S6，从不写入路线结论）。Negation was not understood: the negated wordings ("not X", "non-REM sleep") scored as if they asked for X (AUROC 0.02-0.13 against the truth of the negated question; boundary probe S6, never a route sentence).
- 未见睡眠组合的隐式名称（“睡着”“浅睡”）把窗口的排序弄反了（TPL 的 AUROC 为 0.317 和 0.244，低于 0.5）；只有显式名称（“N1、N2、N3 或 REM 期睡眠”）承载了组合关系。Implicit names of the unseen sleep unions ("asleep", "light sleep") ranked windows in reverse (TPL AUROC 0.317 and 0.244, below 0.5); only the explicit names ("N1, N2, N3 or REM sleep") carried the composition.
- L1 上的相邻 3 选 1 同时牵涉刺激相位和频率；在 L0（不含相位的频谱）上，它才是干净的频率检验。The neighbour 3-way at L1 involves stimulus phase as well as frequency; at L0 (a phase-free spectrum) it is the clean frequency test.
- 未见过的 SSVEP 问题要与相邻频率已训练好的检测器竞争（偏向已见问题，已说明）。Unseen SSVEP questions compete against trained detectors for their neighbours (seen bias, stated).
- 运行前的标签置换金丝雀检查失败了两次（修订 3 和修订 4），由所有者修订；所有者推翻了修订 4 写下的“不再修订”；修订 5 通过。两次失败的记录都保留并披露。The pre-run permutation canary failed twice (revisions 3 and 4) and was revised by the owner, who overrode revision 4's "no further revision"; revision 5 passed. Both failed records are kept and disclosed.
- 对 multilingual-e5-small 来说，每个留出频率都是一个新的分词（S0b-6）；S8 和 S12 也涉及新的分词。For multilingual-e5-small each held-out frequency is a new token (S0b-6); S8 and S12 also involve new tokens.
- 单种子的次要条目不含训练过程的随机波动；EESM19 只有 20 名被试；每个 EESM19 条目和单种子条目都事先声明为多半无法下结论。Secondary single-seed entries carry no training-run variance; EESM19 has 20 people; every EESM19 and single-seed entry was declared likely inconclusive.
- BETA 的数字使用已发布的 2 秒窗口和交叉验证折；Wearable-102 的数字由清华大学作者镜像（2026-09-20 获取）计算，不声称任何物理单位。BETA numbers use the published 2-s windows and folds; Wearable-102 numbers are computed from the 2026-09-20 Tsinghua author mirror and claim no physical unit.
- BOAS：三处缺口与署名见上文；被试在公开发布中是假名化的；没有任何结果是在评估 Bitbrain 的头带或它的自动分期。BOAS: the three gaps and the attribution above; participants are pseudonymised in the public release; no result evaluates Bitbrain's headband or its automatic scoring.
- 这里的分类头不是语言模型，这些结果也不能说明 EEG 能理解语言。

### 没有运行与没有报告的内容

- **修订 4 的按人中心化诊断**：没有运行（修订 5 的 A.2 部分；不存在相应的拟合）
- **Ying 评分者一致性；析因设计的认知任务集**：推迟（D10）
- **与问题向量联合训练的 E1 EEGNet**：推迟（D6）
- **第三个文本编码器；LEAF 式的 Q-Former 分类头；在语言分类头上做路线 1 的校准；用户撰写的问法**：推迟（protocol.deferred）
- **S8 TPL − NN(TPL)**：没有定义（EA-1）：留出频段是连续的，所以没有哪个留出频率两侧都是已见过的频率
- **关于位置和波形形态的问题**：没有检验：手头没有信号层面的真值
- **P3 条目与各组合水平之外的逐组合配对对比**：没有计算（W1）
- **配对对比高于或低于零的被试人数**：BOAS 允许发布，但阶段 2 没有计算；事后也没有补上
- **逐人分布、逐折数值、逐窗口得分**：按设计不公开

### 不发布的内容

- 逐人、逐夜、逐条记录与逐折的数值，逐窗口得分，特征，分类头权重，以及交叉验证折的分配。
- SSVEP 按频率与仅内部频率的细分：在审计之后计算，审计没有覆盖。
- 运行前检查的数值：这些检查只以通过或失败及计数发布。
- 实测的计算量：是在共享 GPU 上计时的。
- 人口学信息、记录日期与钟点，以及任何真实记录的图像。

### 文本编码器

- [BAAI/bge-small-en-v1.5 ↗](https://huggingface.co/BAAI/bge-small-en-v1.5)：主分析 · MIT · `5c38ec7`
- [sentence-transformers/all-MiniLM-L6-v2 ↗](https://huggingface.co/sentence-transformers/all-MiniLM-L6-v2)：次要分析，S4 · Apache-2.0 · `1110a24`
- [intfloat/multilingual-e5-small ↗](https://huggingface.co/intfloat/multilingual-e5-small)：中文问法，S5 · MIT · `614241f`

固定在指定的提交版本，冻结使用，从不再分发。

### 所用的记录

### BETA

Bingchuan Liu et al. · BETA: A Large Benchmark Database Toward SSVEP-BCI Application (2020), doi:10.3389/fnins.2020.00627. Figshare 12264401 v3; mirror Bingchuan/BETA.

[来源 ↗](https://figshare.com/articles/dataset/The_BETA_database/12264401) · [CC BY 4.0](https://creativecommons.org/licenses/by/4.0/)

### BOAS, the Bitbrain Open Access Sleep dataset

Eduardo López-Larraz, María Sierra-Torralba, Sergio Clemente, Galit Fierro, David Oriol, Javier Minguez, Luis Montesano and Jens G. Klinzing · The Bitbrain Open Access Sleep (BOAS) dataset, OpenNeuro ds005555, version 1.1.3 (2026), doi:10.18112/openneuro.ds005555.v1.1.3. Polysomnography EEG and the human-consensus stage labels only; the headband recordings and the publisher's automatic labels are not used.

在说明三处缺口后发布，缺口与结果一起列在上文。

[来源 ↗](https://openneuro.org/datasets/ds005555/versions/1.1.3) · [CC0-1.0](https://creativecommons.org/publicdomain/zero/1.0/)

### EESM19

Kaare B. Mikkelsen et al. · Accurate whole-night sleep monitoring with dry-contact ear-EEG (2019), doi:10.1038/s41598-019-53115-3; OpenNeuro ds005185 v1.0.2. Processed mirror: Zachary1150/EESM19-Processed.

[来源 ↗](https://doi.org/10.18112/openneuro.ds005185.v1.0.2) · [CC0-1.0 declared by upstream and mirror](https://creativecommons.org/publicdomain/zero/1.0/)

### OpenBMI motor imagery

Min-Ho Lee, O-Yeon Kwon, Yong-Jeong Kim, Hong-Kyung Kim, Young-Eun Lee, John Williamson, Siamac Fazli and Seong-Whan Lee · EEG dataset and OpenBMI toolbox for three BCI paradigms: an investigation into BCI illiteracy, GigaScience (2019), giz002, doi:10.1093/gigascience/giz002. Data: Supporting data, GigaScience Database, doi:10.5524/100542.

[来源 ↗](https://doi.org/10.5524/100542) · [CC0-1.0](https://creativecommons.org/publicdomain/zero/1.0/)

### Wearable SSVEP BCI dataset (dry and wet electrodes)

Zhu, F., Jiang, L., Dong, G., Gao, X., & Wang, Y. (2021). An Open Dataset for Wearable SSVEP-Based Brain-Computer Interfaces (Version 4) [Data set]. Figshare. https://doi.org/10.6084/m9.figshare.13560281.v4

Zhu, F., Jiang, L., Dong, G., Gao, X., & Wang, Y. (2021). An Open Dataset for Wearable SSVEP-Based Brain-Computer Interfaces. Sensors, 21(4), 1256. https://doi.org/10.3390/s21041256

基于 2026-09-20 获取的清华 BCI 实验室作者官方镜像快照计算；该镜像本身没有单独的 DOI 或版本号。

[来源 ↗](https://figshare.com/articles/dataset/An_Open_Dataset_for_Wearable_SSVEP-Based_Brain-Computer_Interfaces/13560281) · [CC BY 4.0](https://creativecommons.org/licenses/by/4.0/)

特征：冻结的 [CBraMod](https://bci.report/zh/methods/cbramod/)（主分析），以及冻结的 [REVE](https://bci.report/zh/methods/reve/) Large @ 317531c7，即 REVE-L（次要分析）。

权重条款：REVE 采用 REVE 负责任使用许可 v1.0（模型版本：REVE Large @ 317531c7）。任何模型的作者都没有为这些结果背书。 [REVE, arXiv:2510.21585 ↗](https://arxiv.org/abs/2510.21585)

### 这些结果所依据的方法与来源

- [Yu & Yao, 2026 · Visual Jev: Accurate and Efficient Decisions from Shared Visual Context ↗](https://arxiv.org/abs/2609.25845)
- [Perez et al., 2017 · FiLM: Visual Reasoning with a General Conditioning Layer ↗](https://arxiv.org/abs/1709.07871)
- [Lin, Zhang, Wu & Gao, 2006 · Frequency Recognition Based on CCA for SSVEP-Based BCIs, IEEE TBME 53:2610–2614 ↗](https://doi.org/10.1109/TBME.2006.886577)
- [Chen, Wang, Gao, Jung & Gao, 2015 · Filter bank CCA for implementing a high-speed SSVEP-based BCI, J. Neural Eng. 12:046008 ↗](https://doi.org/10.1088/1741-2560/12/4/046008)
- [Wallace et al., 2019 · Do NLP Models Know Numbers? Probing Numeracy in Embeddings, EMNLP 2019 ↗](https://aclanthology.org/D19-1534/)
- [Weller, Lawrie & Van Durme, 2024 · NevIR: Negation in Neural Information Retrieval, EACL 2024 ↗](https://aclanthology.org/2024.eacl-long.139/)
- [Xian, Lampert, Schiele & Akata · Zero-Shot Learning — A Comprehensive Evaluation of the Good, the Bad and the Ugly, TPAMI ↗](https://arxiv.org/abs/1707.00600)

数据来源： [questions-in-language-update.json](https://bci.report/data/questions-in-language-update.json) · schema bci-report-questions-in-language-update-v1。

问法： [questions-in-language-wordings.json](https://bci.report/data/questions-in-language-wordings.json) · schema bci-report-questions-in-language-wordings-v1。

继续探索

迁移

- [— 传感器迁移 **干电极与湿电极**](https://bci.report/zh/topics/dry-vs-wet/)
- [— 场景迁移 **从屏幕到 VR**](https://bci.report/zh/topics/screen-to-vr/)
- [— 电极布局 **更少的电极**](https://bci.report/zh/topics/fewer-electrodes/)
- [— 运动鲁棒性 **移动中的解码**](https://bci.report/zh/topics/on-the-move/)
- [— 跨会话迁移 · 同一被试 **后续会话**](https://bci.report/zh/topics/later-sessions/)

调整模型

- [— 校准预算 **需要多少校准？**](https://bci.report/zh/topics/calibration-budget/)
- [— 模型适配 **该更新哪一部分？**](https://bci.report/zh/topics/model-adaptation/)
- [— 表征对照 **预训练有用吗？**](https://bci.report/zh/topics/does-pretraining-help/)
- [— 共享编码器 · 第二条路线 **一个模型，多个问题**](https://bci.report/zh/topics/shared-encoder/)
- [— 用语言提问 · 第三条路线 **用语言提问**](https://bci.report/zh/topics/questions-in-language/)

可靠性与临床

- [— 拒识 · 决策研究 **何时不该执行**](https://bci.report/zh/topics/when-not-to-act/)
- [— 睡眠分期 · 简单基线 **睡眠分期的失衡**](https://bci.report/zh/topics/sleep-staging/)
- [— 临床研究 **临床分组**](https://bci.report/zh/topics/clinical-groups/)

[全部问题，以及哪些迁移已经测量过的地图 →](https://bci.report/zh/topics/)

## 引用本页

BCI Report. *EEG 模型能回答用文字提出的问题吗？*[EB/OL]. (2026-10-08). https://bci.report/zh/topics/questions-in-language/

数字来自发布 [`questions-in-language-update-20261008`](https://bci.report/zh/releases/#questions-in-language-update-20261008)（2026-10-08）。也请同时引用上游数据集：署名就在本页。

每个发布版本都在 Zenodo 存档：[doi:10.5281/zenodo.23123296](https://doi.org/10.5281/zenodo.23123296)。 [本站及各次发布的 BibTeX →](https://bci.report/zh/api/#cite-heading) · [CITATION.cff ↗](https://raw.githubusercontent.com/twu3202/bci-report/main/CITATION.cff)（英文）

---
本文是 https://bci.report/zh/topics/questions-in-language/ 的 Markdown 版本，由已发布的网页生成。数字均为聚合结果；使用条款见 https://bci.report/data-use/（英文）。
