BETA
Bingchuan Liu et al. · BETA: A Large Benchmark Database Toward SSVEP-BCI Application (2020), doi:10.3389/fnins.2020.00627. Figshare 12264401 v3; mirror Bingchuan/BETA.
用语言提问 · 决策研究计划的第三条路线
冻结 EEG 特征上的一个小分类头,每个问题分别用题号、标签模板或自然语言描述提出:SSVEP 用 BETA,睡眠用 BOAS。已见过的问题、改写后的问题、EEG 分类头从未训练过的问题分开报告,从不合并成一个“零样本”数字。
测量所用数据集:BETA、BOAS · Bitbrain Open Access Sleep dataset · 方法:CBraMod
只对训练过的问题成立,而且不是在每个数据集上都成立。冻结 EEG 特征上的一个小分类头,用标签模板或描述代替题号来问已见过的问题:在睡眠(BOAS)上与题号在 2 pp(百分点)的界值内等效;在 SSVEP(BETA,70 名被试)上则损失了准确率:普通频谱上用标签模板为 −5.96 pp(−6.84 至 −5.08 pp),未达到界值。改写已见过的问题也有代价,只有睡眠上换一个新句式例外。EEG 分类头从未训练过的问题没有得到有用的回答:每一个未见过的睡眠问题,都不如把分类头自己的各期答案加起来;在未见过的闪烁频率上,分类头在普通频谱上只达到 28.7%,而无需训练的 CCA 达到 80.9%(随机水平 12.5%)。“N1 或 N2 期睡眠”这类显式问法用到了词与分期的对应关系;“睡着”“浅睡”这类日常名称把窗口的排序弄反了;在一个边界探针中,否定的问法则被当成在问被否定的那一项本身。
比较方法
所有问题都由同一个小分类头回答,变的只是告诉它“问的是哪个问题”的那个向量。每次测试都在分类头从未训练过的被试上进行。
睡眠的一个训练句式,填入某一期的名称(英文原文): The scorer marked this 30-second epoch as N2 sleep.
SSVEP 用 BETA:普通频谱(L0)和冻结的 CBraMod 特征(L1)。睡眠用 BOAS:冻结的 CBraMod 特征(L1)。各用三个训练随机种子。主文本编码器是冻结的 bge-small-en-v1.5。每种问法的分类头都相同:标准化的特征,接一个由问题向量调整的小隐藏层(FiLM),再接一个输出。
三类结果,从不合并成一个“零样本”数字:用训练时的问法问已见过的问题;把同一个问题改写后再问;问分类头从未训练过的问题。“未见过”始终指 EEG 分类头没有见过,而不是文本编码器没有见过:冻结的文本编码器读过这些词;对 SSVEP,每个留出频率的每个分词也都出现在该轮换的训练文本中。未见过的睡眠问题是已见分期的组合;未见过的 SSVEP 问题是在五种轮换中留出的闪烁频率。
每项比较都是语言问法减去参照,单位为 pp,95% 区间依次对被试、训练随机种子和留出问法重采样得到。每项比较有两种读法,都在任何拟合之前定下。区间不含零,才算显示出差异。界值为 ±2 pp:整个区间都在界值内,算等效;对语言问法不利的那一端仍在界值内,算非劣;否则就是未达到界值——这并不等于损失了 2 pp 或更多。对未见过的睡眠问题,比较的是 R:分类头剩余的错误(1 − AUROC)与由它自己的各期答案读出的剩余错误之比,界值为 R < 1.25。检验分类头是否用到问法与分期对应关系的那项比较(模板组对比错配模板组),是 AUROC 的差值。主分析中,与数值编码、相邻平均和错配模板的比较只读差异;次要分析的表格按运行时的计算列出两种读法。
主分析共有 35 项预先声明的比较,不做多重比较校正:在 95% 水平下,没有真实差异的比较里,约每二十项就可能有一项偶然显示出差异。准确率先逐人计算,再在被试之间平均:它用来比较设置,不是部署时的错误率。
这是“何时不该执行”页上研究计划的第三条路线。“Jev-style”(Jev 式)在这里指把 TypeSafe 的 Jev 这类决策模型的接口用在 EEG 上:一段记录只编码一次,再回答关于它的多个明确的、规定输出类型的问题,每个回答都带一个概率。这个计划从一篇视觉论文出发:Yu & Yao, 2026 · Visual Jev: Accurate and Efficient Decisions from Shared Visual Context ↗,它把同样的思路用在图像上。三条路线汇总:Jev 式提问用在脑电上:证据 →
主分析 · 已见过的问题 · BETA 与 BOAS
分类头训练过的问题。BETA:70 名被试注视闪烁的目标;每种轮换中,分类头在大部分频率上训练,这里问的就是这些频率(32 选 1 任务)。BOAS:100 名被试,每个半分钟的数据帧按人工共识分为五期之一,保持自然比例。
BOAS 在说明三处缺口后发布(所有者决定,2026 年 10 月 7 日):
被试在公开发布中是假名化的。这里没有任何结果是在评估 Bitbrain 的头带或它的自动睡眠分期;两者都没有使用。No result here evaluates Bitbrain's headband or its automatic sleep scoring; neither is used.
署名:Eduardo López-Larraz, María Sierra-Torralba, Sergio Clemente, Galit Fierro, David Oriol, Javier Minguez, Luis Montesano and Jens G. Klinzing · The Bitbrain Open Access Sleep (BOAS) dataset, OpenNeuro ds005555, version 1.1.3 (2026), doi:10.18112/openneuro.ds005555.v1.1.3. Polysomnography EEG and the human-consensus stage labels only; the headband recordings and the publisher's automatic labels are not used.
在睡眠上,用标签模板或描述代替题号,与题号在 ±2 pp 内等效:−0.05 pp(−0.70 至 +0.61 pp)和 +0.02 pp(−0.59 至 +0.62 pp)。在 SSVEP 上,两个层级都有准确率代价,且未达到界值:标签模板在普通频谱上为 −5.96 pp,在冻结的 CBraMod 特征上为 −3.49 pp;描述分别为 −5.46 pp 和 −3.37 pp。
| 比较 | 问题 | 差值(pp) | 是否显示差异 | 界值 ±2 pp | 门槛 |
|---|---|---|---|---|---|
| SSVEP · BETA · 普通频谱(L0) | |||||
| P1 · 标签模板 − 题号TPL − ID | 已见,32 选 1 | −5.96 pp95% 区间 −6.84 至 −5.08 pp | ID 更高 | 未达到 2 pp 界值 | 通过捷径检查 |
| P1 · 描述 − 题号DESC − ID | 已见,32 选 1 | −5.46 pp95% 区间 −6.26 至 −4.66 pp | ID 更高 | 未达到 2 pp 界值 | 通过捷径检查 |
| SSVEP · BETA · 冻结的 CBraMod 特征(L1) | |||||
| P1 · 标签模板 − 题号TPL − ID | 已见,32 选 1 | −3.49 pp95% 区间 −4.10 至 −2.93 pp | ID 更高 | 未达到 2 pp 界值 | 通过捷径检查 |
| P1 · 描述 − 题号DESC − ID | 已见,32 选 1 | −3.37 pp95% 区间 −3.98 至 −2.80 pp | ID 更高 | 未达到 2 pp 界值 | 通过捷径检查 |
| 睡眠 · BOAS · 冻结的 CBraMod 特征(L1) | |||||
| P1 · 标签模板 − 题号TPL − ID | 已见,5 选 1 | −0.05 pp95% 区间 −0.70 至 +0.61 pp | 未显示差异 | 在 ±2 pp 内等效 | 通过捷径检查 |
| P1 · 描述 − 题号DESC − ID | 已见,5 选 1 | +0.02 pp95% 区间 −0.59 至 +0.62 pp | 未显示差异 | 在 ±2 pp 内等效 | 通过捷径检查 |
在这些特征上,已见过的 SSVEP 任务对每个分类头都很难:用题号时,分类头在普通频谱上达到 32.1%(28.8%–35.2%),在冻结的 CBraMod 特征上为 24.2%,随机水平为 3.1%;无需训练的 CCA 达到 65.5%。在睡眠上,各种问法的平衡准确率大致相同:用题号为 71.5%,随机水平为 20.0%。下面的水平只是描述性的:区间重叠时不排名,上面的配对差值才是比较。
| 问法 | 普通频谱(L0) | 校正随机水平后 | 冻结的 CBraMod 特征(L1) | 校正随机水平后 |
|---|---|---|---|---|
| ID题号 | 32.1%95% 区间 28.8%–35.2% | 29.9% | 24.2%95% 区间 21.6%–26.9% | 21.8% |
| TPL标签模板 | 26.1%95% 区间 23.5%–28.6% | 23.7% | 20.7%95% 区间 18.5%–23.1% | 18.2% |
| DESC描述 | 26.6%95% 区间 23.9%–29.2% | 24.2% | 20.9%95% 区间 18.7%–23.2% | 18.3% |
| SHUF错配模板 | 25.1%95% 区间 22.5%–27.6% | 22.7% | 20.2%95% 区间 18.1%–22.3% | 17.6% |
| NUM数值编码 | 23.7%95% 区间 21.2%–26.1% | 21.2% | 13.9%95% 区间 12.5%–15.2% | 11.1% |
| B-sh每个问题一个输出 | 32.2%95% 区间 28.9%–35.3% | 30.0% | 27.0%95% 区间 24.2%–30.1% | 24.7% |
| CCA无需训练 | 65.5%95% 区间 59.7%–71.1% | 64.3% | 65.5%95% 区间 59.7%–71.1% | 64.3% |
| 问法 | 平衡准确率 | 校正随机水平后 | 对数损失 |
|---|---|---|---|
| ID题号 | 71.5%95% 区间 69.1%–73.5% | 64.3% | 0.26795% 区间 0.242–0.296 |
| TPL标签模板 | 71.4%95% 区间 69.1%–73.4% | 64.3% | 0.27695% 区间 0.249–0.307 |
| DESC描述 | 71.5%95% 区间 69.1%–73.5% | 64.3% | 0.27895% 区间 0.251–0.310 |
| SHUF错配模板 | 71.5%95% 区间 69.2%–73.5% | 64.4% | — |
| B-sh每个问题一个输出 | 71.4%95% 区间 69.1%–73.4% | 64.3% | 0.25995% 区间 0.236–0.287 |
| 问法 | W100 名被试 | N1100 名被试 | N2100 名被试 | N371 名被试 | REM100 名被试 |
|---|---|---|---|---|---|
| ID题号 | 0.9820.976–0.987 | 0.8760.859–0.890 | 0.9220.904–0.937 | 0.9780.971–0.983 | 0.9570.945–0.967 |
| TPL标签模板 | 0.9800.972–0.987 | 0.8720.855–0.887 | 0.9240.909–0.937 | 0.9790.974–0.983 | 0.9560.944–0.967 |
| DESC描述 | 0.9810.974–0.987 | 0.8690.851–0.884 | 0.9230.907–0.937 | 0.9790.974–0.983 | 0.9560.944–0.967 |
同样是已见过的问题,换成分类头训练时没用过的问法:新句式(a1,对留出的句式重采样)、标签的同义词(a2:每个问题三个,固定不变,所以这些条目只对这三个同义词成立),或新描述(a3,对留出的描述重采样)。改写的结果从不与未见问题的结果合并。
| 比较 | 问题 | 差值(pp) | 是否显示差异 | 界值 ±2 pp | 门槛 |
|---|---|---|---|---|---|
| SSVEP · BETA · 普通频谱(L0) | |||||
| P2 · 新句式 − 训练问法TPL(a1) − TPL(train) | 已见,改写重采样 12 条留出问法 | −4.01 pp95% 区间 −6.53 至 −2.12 pp | TPL(train) 更高 | 未达到 2 pp 界值 | 通过捷径检查 |
| P2 · 同义词 − 训练问法TPL(a2) − TPL(train) | 已见,改写只对这三个同义词成立:固定,不重采样 | −1.84 pp95% 区间 −2.10 至 −1.57 pp | TPL(train) 更高 | 未达到 2 pp 界值 | 通过捷径检查 |
| P2 · 新描述 − 训练描述DESC(a3) − DESC(train) | 已见,改写重采样 10 条留出问法 | −4.13 pp95% 区间 −5.58 至 −3.11 pp | DESC(train) 更高 | 未达到 2 pp 界值 | 通过捷径检查 |
| SSVEP · BETA · 冻结的 CBraMod 特征(L1) | |||||
| P2 · 新句式 − 训练问法TPL(a1) − TPL(train) | 已见,改写重采样 12 条留出问法 | −2.72 pp95% 区间 −4.43 至 −1.43 pp | TPL(train) 更高 | 未达到 2 pp 界值 | 通过捷径检查 |
| P2 · 同义词 − 训练问法TPL(a2) − TPL(train) | 已见,改写只对这三个同义词成立:固定,不重采样 | −1.33 pp95% 区间 −1.53 至 −1.14 pp | TPL(train) 更高 | 在 ±2 pp 内等效 | 通过捷径检查 |
| P2 · 新描述 − 训练描述DESC(a3) − DESC(train) | 已见,改写重采样 10 条留出问法 | −2.95 pp95% 区间 −3.81 至 −2.26 pp | DESC(train) 更高 | 未达到 2 pp 界值 | 通过捷径检查 |
| 睡眠 · BOAS · 冻结的 CBraMod 特征(L1) | |||||
| P2 · 新句式 − 训练问法TPL(a1) − TPL(train) | 已见,改写重采样 12 条留出问法 | −0.46 pp95% 区间 −1.33 至 +0.16 pp | 未显示差异 | 在 ±2 pp 内等效 | 通过捷径检查 |
| P2 · 同义词 − 训练问法TPL(a2) − TPL(train) | 已见,改写只对这三个同义词成立:固定,不重采样 | −12.60 pp95% 区间 −13.74 至 −11.43 pp | TPL(train) 更高 | 未达到 2 pp 界值 | 通过捷径检查 |
| P2 · 新描述 − 训练描述DESC(a3) − DESC(train) | 已见,改写重采样 10 条留出问法 | −20.87 pp95% 区间 −29.49 至 −13.71 pp | DESC(train) 更高 | 未达到 2 pp 界值 | 通过捷径检查 |
在睡眠上,换一个新句式没有可测的代价:在 ±2 pp 内等效(−0.46 pp,−1.33 至 +0.16 pp)。每期三个同义词的差值为 −12.60 pp(−13.74 至 −11.43 pp),新描述为 −20.87 pp(−29.49 至 −13.71 pp)——区间很宽,因为各条描述之间差别很大。在 BETA 上,每种改写都更低,差值从 −1.33 pp 到 −4.13 pp;只有冻结 CBraMod 特征上的同义词留在界值内。
| 同义词 | SSVEP · BETA · 普通频谱(L0) | SSVEP · BETA · 冻结的 CBraMod 特征(L1) | 睡眠 · BOAS · 冻结的 CBraMod 特征(L1) |
|---|---|---|---|
| 同义词 1 | −1.45 pp95% 区间 −1.67 至 −1.22 pp | −1.09 pp95% 区间 −1.27 至 −0.90 pp | −23.53 pp95% 区间 −25.29 至 −21.64 pp |
| 同义词 2 | −0.87 pp95% 区间 −1.04 至 −0.70 pp | −0.84 pp95% 区间 −1.00 至 −0.68 pp | −10.85 pp95% 区间 −12.59 至 −9.17 pp |
| 同义词 3 | −3.19 pp95% 区间 −3.69 至 −2.69 pp | −2.06 pp95% 区间 −2.44 至 −1.73 pp | −3.42 pp95% 区间 −4.49 至 −2.41 pp |
| 新句式 | 同义词 | 训练句式之间 | 新描述 | 训练描述之间 | ID 的随机种子之间 | |
|---|---|---|---|---|---|---|
| BETA · L0 | 39.7% | 29.3% | 19.4% | 41.2% | 19.3% | 56.8% |
| BETA · L1 | 40.7% | 32.0% | 24.3% | 42.7% | 23.3% | 62.2% |
| BOAS · L1 | 6.4% | 20.0% | 3.3% | 45.4% | 3.1% | 7.4% |
主分析 · 未见过的睡眠问题 · BOAS
三个分类头从未训练过的问题,每个都是它训练过的分期的组合:睡着(N1、N2、N3 或 REM)、N1、N2 或 N3 期睡眠,以及浅睡(N1 或 N2)。每个问题都用模板提问(分别用隐式名称和显式名称),也用新描述提问;100 名被试,三个随机种子。EEG 分类头没有见过,但文本编码器读过这些词。因为每个问题都是组合,分类头自己的各期答案可以加起来得到一个答案,也就是读出;每种问法都要与读出对照。
BOAS 在说明三处缺口后发布(所有者决定,2026 年 10 月 7 日):
被试在公开发布中是假名化的。这里没有任何结果是在评估 Bitbrain 的头带或它的自动睡眠分期;两者都没有使用。No result here evaluates Bitbrain's headband or its automatic sleep scoring; neither is used.
署名:Eduardo López-Larraz, María Sierra-Torralba, Sergio Clemente, Galit Fierro, David Oriol, Javier Minguez, Luis Montesano and Jens G. Klinzing · The Bitbrain Open Access Sleep (BOAS) dataset, OpenNeuro ds005555, version 1.1.3 (2026), doi:10.18112/openneuro.ds005555.v1.1.3. Polysomnography EEG and the human-consensus stage labels only; the headband recordings and the publisher's automatic labels are not used.
| 问题 | 隐式名称 | 显式名称 |
|---|---|---|
| 睡着 | asleep | N1, N2, N3 or REM sleep |
| N1、N2 或 N3 期睡眠 | 无 | N1, N2 or N3 sleep |
| 浅睡 | light sleep | N1 or N2 sleep |
在全部八种条件下,区间都高于 R = 1,对读出有利,没有一种进入 1.25 的界值:R 从 2.42(2.07–2.85;N1、N2 或 N3 期睡眠,显式名称)到 33.80(23.09–52.82;睡着,隐式名称)。
| 比较 | 问题 | log R(附 R) | 是否显示差异 | 界值 R < 1.25 | 门槛 |
|---|---|---|---|---|---|
| P3 · 标签模板分类头,对比由它自己的答案读出TPL / read-off | 睡着 · 隐式名称 | +3.52095% 区间 +3.139 至 +3.967R 33.80 (23.09–52.82) | 读出剩余的错误更少 | 未达到 1.25 的比值界值 | 通过余量门槛 |
| P3 · 标签模板分类头,对比由它自己的答案读出TPL / read-off | 睡着 · 显式名称 | +1.95195% 区间 +1.623 至 +2.357R 7.04 (5.07–10.56) | 读出剩余的错误更少 | 未达到 1.25 的比值界值 | 通过余量门槛 |
| P3 · 标签模板分类头,对比由它自己的答案读出TPL / read-off | N1、N2 或 N3 期睡眠 · 显式名称 | +0.88395% 区间 +0.726 至 +1.047R 2.42 (2.07–2.85) | 读出剩余的错误更少 | 未达到 1.25 的比值界值 | 通过余量门槛 |
| P3 · 标签模板分类头,对比由它自己的答案读出TPL / read-off | 浅睡 · 隐式名称 | +2.26795% 区间 +2.072 至 +2.466R 9.65 (7.94–11.77) | 读出剩余的错误更少 | 未达到 1.25 的比值界值 | 通过余量门槛 |
| P3 · 标签模板分类头,对比由它自己的答案读出TPL / read-off | 浅睡 · 显式名称 | +1.51995% 区间 +1.343 至 +1.698R 4.57 (3.83–5.46) | 读出剩余的错误更少 | 未达到 1.25 的比值界值 | 通过余量门槛 |
| P3 · 描述分类头,对比由它自己的答案读出DESC / read-off | 睡着 · 新描述重采样 10 条留出问法 | +3.44495% 区间 +2.913 至 +3.956R 31.30 (18.41–52.26) | 读出剩余的错误更少 | 未达到 1.25 的比值界值 | 通过余量门槛 |
| P3 · 描述分类头,对比由它自己的答案读出DESC / read-off | N1、N2 或 N3 期睡眠 · 新描述重采样 10 条留出问法 | +1.29995% 区间 +0.793 至 +1.744R 3.67 (2.21–5.72) | 读出剩余的错误更少 | 未达到 1.25 的比值界值 | 通过余量门槛 |
| P3 · 描述分类头,对比由它自己的答案读出DESC / read-off | 浅睡 · 新描述重采样 10 条留出问法 | +1.41795% 区间 +0.903 至 +1.856R 4.12 (2.47–6.40) | 读出剩余的错误更少 | 未达到 1.25 的比值界值 | 通过余量门槛 |
| 问题 | 问法 | 模板分类头 | 由各期答案读出 |
|---|---|---|---|
| 睡着 | 隐式名称 | 0.31795% 区间 0.294–0.341 | 0.98095% 区间 0.971–0.987 |
| 睡着 | 显式名称 | 0.85895% 区间 0.839–0.875 | 0.98095% 区间 0.971–0.987 |
| N1、N2 或 N3 期睡眠 | 显式名称 | 0.87195% 区间 0.854–0.887 | 0.94795% 区间 0.934–0.958 |
| 浅睡 | 隐式名称 | 0.24495% 区间 0.222–0.267 | 0.92295% 区间 0.907–0.935 |
| 浅睡 | 显式名称 | 0.64295% 区间 0.616–0.667 | 0.92295% 区间 0.907–0.935 |
隐式名称把窗口的排序弄反了:“睡着”的 AUROC 为 0.317,“浅睡”为 0.244,都低于 0.5,也就是说,真正处于睡眠或浅睡的窗口,在这些问题上的得分反而低于其他窗口。显式名称好一些(0.858 和 0.642),但仍不如读出(0.980 和 0.922)。描述没有对应关系的对照:错配对照是用模板向量构造的。留出的句式(S13,见次要结果)在全部五个模板格子上给出同样的结果。
错配模板组在训练时把同样的模板向量接到错误的分期上;未见问题保留各自真实的向量。如果分类头用到了问法与分期的对应关系,错配组在这些问题上应当不如模板组。
| 比较 | 问题 | 差值(AUROC) | 是否显示差异 | 界值 | 门槛 |
|---|---|---|---|---|---|
| P5 · 标签模板 − 错配模板TPL − SHUF | 未见问题,隐式名称 | −0.37895% 区间 −0.501 至 −0.253 | SHUF 更高 | 只读差异,不设界值 | 通过余量门槛 |
| P5 · 标签模板 − 错配模板TPL − SHUF | 未见问题,显式名称 | +0.62995% 区间 +0.603 至 +0.654 | TPL 更高 | 只读差异,不设界值 | 通过余量门槛 |
| 问题 | 问法 | 模板组 | 错配模板组 |
|---|---|---|---|
| 睡着 | 隐式名称 | 0.31795% 区间 0.294–0.341 | 0.67695% 区间 0.529–0.812 |
| 睡着 | 显式名称 | 0.85895% 区间 0.839–0.875 | 0.13795% 区间 0.109–0.168 |
| N1、N2 或 N3 期睡眠 | 显式名称 | 0.87195% 区间 0.854–0.887 | 0.17195% 区间 0.145–0.201 |
| 浅睡 | 隐式名称 | 0.24495% 区间 0.222–0.267 | 0.64195% 区间 0.537–0.738 |
| 浅睡 | 显式名称 | 0.64295% 区间 0.616–0.667 | 0.17695% 区间 0.155–0.199 |
显式名称用到了:把模板接到错误的分期上,未见问题的 AUROC 降低,TPL − SHUF 为 +0.629(+0.603 至 +0.654)。隐式名称没有显示出用到:错配模板反而更高,−0.378(−0.501 至 −0.253)。
主分析 · 未见过的闪烁频率 · BETA
在五种轮换中,每次留出 BETA 的八个频率:分类头在其余频率上训练,再用模板说出频率来问这八个。70 名被试,三个随机种子,两个层级。EEG 分类头没有见过,但文本编码器读过这些词:每个留出频率的每个分词也都出现在该轮换的训练文本中,新的只是组合。CCA 完全不需要训练就能回答同样的问题。
在未见频率之间的 8 选 1 中,分类头在普通频谱上达到 28.7%(26.9%–30.5%),在冻结的 CBraMod 特征上为 19.0%;CCA 达到 80.9%,随机水平为 12.5%。在两个层级上,分类头也不如把它自己对相邻两个已见频率的答案取平均,也不如用数值编码表示频率。
| 比较 | 问题 | 差值(pp) | 是否显示差异 | 界值 ±2 pp | 门槛 |
|---|---|---|---|---|---|
| SSVEP · BETA · 普通频谱(L0) | |||||
| P4 · 标签模板 − CCA(无需训练)TPL − CCA | 未见频率,8 选 1 | −52.21 pp95% 区间 −55.13 至 −48.99 pp | CCA 更高 | 未达到 2 pp 界值 | 通过余量门槛 |
| P4 · 标签模板 − 相邻两个已见频率的平均TPL − NN(TPL) | 未见频率,8 选 1 | −10.98 pp95% 区间 −12.24 至 −9.67 pp | NN(TPL) 更高 | 只读差异,不设界值 | 通过余量门槛 |
| P4 · 标签模板 − 数值编码TPL − NUM | 未见频率,8 选 1 | −12.77 pp95% 区间 −14.52 至 −10.99 pp | NUM 更高 | 只读差异,不设界值 | 通过余量门槛 |
| P4 · 标签模板 − CCA(无需训练)TPL − CCA | 未见频率,相邻 3 选 1 | −62.36 pp95% 区间 −65.87 至 −58.69 pp | CCA 更高 | 未达到 2 pp 界值 | 通过余量门槛 |
| P4 · 标签模板 − 数值编码TPL − NUM | 未见频率,相邻 3 选 1 | −1.24 pp95% 区间 −3.17 至 +0.85 pp | 未显示差异 | 只读差异,不设界值 | 通过余量门槛 |
| SSVEP · BETA · 冻结的 CBraMod 特征(L1) | |||||
| P4 · 标签模板 − CCA(无需训练)TPL − CCA | 未见频率,8 选 1 | −61.94 pp95% 区间 −65.65 至 −58.06 pp | CCA 更高 | 未达到 2 pp 界值 | 通过余量门槛 |
| P4 · 标签模板 − 相邻两个已见频率的平均TPL − NN(TPL) | 未见频率,8 选 1 | −1.16 pp95% 区间 −1.97 至 −0.37 pp | NN(TPL) 更高 | 只读差异,不设界值 | 通过余量门槛 |
| P4 · 标签模板 − 数值编码TPL − NUM | 未见频率,8 选 1 | −2.46 pp95% 区间 −3.23 至 −1.69 pp | NUM 更高 | 只读差异,不设界值 | 通过余量门槛 |
| P4 · 标签模板 − CCA(无需训练)TPL − CCA | 未见频率,相邻 3 选 1 | −54.67 pp95% 区间 −57.77 至 −51.47 pp | CCA 更高 | 未达到 2 pp 界值 | 通过余量门槛 |
| P4 · 标签模板 − 数值编码TPL − NUM | 未见频率,相邻 3 选 1 | +15.61 pp95% 区间 +14.25 至 +16.93 pp | TPL 更高 | 只读差异,不设界值 | 通过余量门槛 |
在相邻 3 选 1 中,未见过的频率要与两侧相邻频率已训练好的检测器竞争(偏向已见问题,已说明)。在普通频谱上,模板分类头低于这项检验的平均随机水平:19.3%,随机水平为 34.2%;与数值编码相比没有显示出差异。在冻结的 CBraMod 特征上,它比数值编码高 +15.61 pp,但这些特征保留了刺激相位,而相邻目标的相位不同,所以这项比较同时检验频率和相位。不含相位的普通频谱才是干净的频率检验。
| 问法 | 检验 | 普通频谱(L0) | 校正随机水平后 | 冻结的 CBraMod 特征(L1) | 校正随机水平后 |
|---|---|---|---|---|---|
| TPL标签模板 | u8 | 28.7%95% 区间 26.9%–30.5% | 18.5% | 19.0%95% 区间 18.0%–19.9% | 7.4% |
| DESC描述 | u8 | 28.6%95% 区间 26.8%–30.4% | 18.4% | 18.6%95% 区间 17.6%–19.6% | 7.0% |
| SHUF错配模板 | u8 | 9.2%95% 区间 8.6%–9.7% | -3.8% | 11.0%95% 区间 10.5%–11.5% | -1.7% |
| NUM数值编码 | u8 | 41.5%95% 区间 38.2%–44.7% | 33.1% | 21.4%95% 区间 20.2%–22.6% | 10.2% |
| CCA无需训练 | u8 | 80.9%95% 区间 76.6%–84.8% | 78.2% | 80.9%95% 区间 76.6%–84.8% | 78.2% |
| TPL标签模板 | nn8 | 39.7%95% 区间 36.8%–42.5% | 31.0% | 20.1%95% 区间 19.0%–21.3% | 8.7% |
| ID题号 | nn8 | 44.3%95% 区间 40.8%–47.6% | 36.4% | 18.3%95% 区间 17.3%–19.3% | 6.6% |
| B-sh每个问题一个输出 | nn8 | 44.3%95% 区间 40.9%–47.5% | 36.3% | 17.6%95% 区间 16.6%–18.8% | 5.8% |
| TPL标签模板 | u3 | 19.3%95% 区间 18.2%–20.5% | -22.5% | 27.0%95% 区间 26.0%–28.0% | -10.8% |
| NUM数值编码 | u3 | 20.6%95% 区间 19.3%–21.8% | -20.6% | 11.4%95% 区间 10.7%–12.1% | -34.5% |
| CCA无需训练 | u3 | 81.7%95% 区间 78.5%–84.6% | 72.2% | 81.7%95% 区间 78.5%–84.6% | 72.2% |
| 问法与检验 | 普通频谱(L0) | 冻结的 CBraMod 特征(L1) |
|---|---|---|
| ID,8 选 1(相邻读出) | −14.26 pp95% 区间 −15.50 至 −13.06 pp | −27.80 pp95% 区间 −30.61 至 −25.03 pp |
| TPL,8 选 1 | −24.44 pp95% 区间 −26.44 至 −22.26 pp | −24.27 pp95% 区间 −26.72 至 −21.85 pp |
| TPL,3 选 1 | −27.83 pp95% 区间 −30.18 至 −25.37 pp | −29.67 pp95% 区间 −31.76 至 −27.64 pp |
| DESC,8 选 1 | −24.79 pp95% 区间 −26.88 至 −22.55 pp | −24.81 pp95% 区间 −27.31 至 −22.39 pp |
| DESC,3 选 1 | −28.95 pp95% 区间 −31.33 至 −26.46 pp | −29.74 pp95% 区间 −31.76 至 −27.76 pp |
| SHUF,8 选 1 | −40.63 pp95% 区间 −44.16 至 −36.98 pp | −30.09 pp95% 区间 −33.02 至 −27.27 pp |
| SHUF,3 选 1 | −34.96 pp95% 区间 −37.50 至 −32.43 pp | −32.52 pp95% 区间 −35.18 至 −29.84 pp |
| NUM,8 选 1 | −12.30 pp95% 区间 −13.42 至 −11.17 pp | −16.16 pp95% 区间 −17.88 至 −14.47 pp |
| NUM,3 选 1 | −7.27 pp95% 区间 −8.49 至 −6.02 pp | −7.63 pp95% 区间 −8.74 至 −6.53 pp |
| B-sh,8 选 1(相邻读出) | −12.81 pp95% 区间 −14.09 至 −11.56 pp | −31.19 pp95% 区间 −34.09 至 −28.32 pp |
| CCA,8 选 1 | 0.00 pp95% 区间 0.00 至 0.00 pp | 0.00 pp95% 区间 0.00 至 0.00 pp |
| CCA,3 选 1 | +0.41 pp95% 区间 +0.26 至 +0.56 pp | +0.41 pp95% 区间 +0.26 至 +0.56 pp |
| 轮换 | 普通频谱(L0) | 冻结的 CBraMod 特征(L1) |
|---|---|---|
| 轮换 0 | −49.88 pp95% 区间 −53.16 至 −46.16 pp | −63.00 pp95% 区间 −67.23 至 −58.54 pp |
| 轮换 1 | −52.96 pp95% 区间 −57.02 至 −48.99 pp | −61.76 pp95% 区间 −65.81 至 −57.74 pp |
| 轮换 2 | −48.74 pp95% 区间 −51.97 至 −45.42 pp | −59.74 pp95% 区间 −63.75 至 −55.51 pp |
| 轮换 3 | −57.34 pp95% 区间 −60.84 至 −53.73 pp | −62.75 pp95% 区间 −66.73 至 −58.42 pp |
| 轮换 4 | −52.14 pp95% 区间 −55.80 至 −48.20 pp | −62.47 pp95% 区间 −66.53 至 −58.23 pp |
按频率和仅内部频率的细分是在审计之后计算的,没有任何独立审计覆盖它们,所以不发布。
任何结果之前
有一项检查在失败之后被修改了,而且改了两次。相关情况全部列在这里,连同在读取任何结果之前必须通过的其他检查。
标签置换金丝雀检查(canary):把训练标签打乱后重新训练分类头,检查测试得分是否落在随机水平:在第一折上共 17 个配置、38 个 99.9% 区间。
修订 3 失败:38 个区间中有 1 个排除了随机水平(睡眠,冻结的 CBraMod 特征,错配模板组,未见问题“浅睡”的显式名称)。它的标签是在每个训练被试内部打乱的。运行因此停止。
修订 4 由所有者在任何新拟合之前批准,改为在所有训练窗口之间打乱标签。它也失败了:38 个区间中有 3 个,全在 BOAS 上,其中一个低于随机水平;两次检查中,SSVEP 的每个区间都包含随机水平。修订 4 写明“不再修订”。所有者在看到它如何失败之后推翻了这一条,并在任何新拟合之前批准了修订 5。修订 4 的按人中心化诊断没有运行:标签在所有窗口之间打乱后,它已经检验不了任何东西。
修订 5 通过:每个配置训练 20 个分类头(共 340 次拟合),每个指标都与该被试精确的随机水平比较,并做两层 bootstrap,先对分类头、再对被试重采样;38 个区间中有 0 个排除了零。两次失败的记录都保留。
偏离方向的计数(描述性):修订 5 中 760 个单分类头区间里,有 125 个排除了精确的随机水平,66 个偏高、59 个偏低,另有 18 个格子两个方向都失败过。BOAS 的格子只以通过或失败及计数发布。
为什么会失败——这正是修订 5 设计来检验的解释:用打乱的标签训练出的分类头,仍然是睡眠特征的某个随机函数,而这些特征按分期分得很开,所以它在新被试上的得分会整体偏向同一个方向,可能偏高也可能偏低。按被试的 bootstrap 只衡量被试之间的波动,不衡量分类头之间的波动,所以它的 99.9% 区间对这个问题来说太窄。失败的样子符合这个解释:全部发生在 BOAS 上,而且有一个低于随机水平,而泄漏不会造成这种结果。这不是“没有泄漏”的证明:被试不重叠的折、训练中没有留出的标签或问法、只在训练数据上拟合的标准化,都由代码中的断言保证,两份一致性审计也直接检查了泄漏。
决定 S0b-6,经所有者批准:SSVEP 的分词规则要求,每个留出频率的每个分词都出现在该轮换的训练文本中。对 bge-small-en-v1.5 和 all-MiniLM-L6-v2,违反这条规则就停止运行,两者在全部 5 种轮换中都通过了。对 multilingual-e5-small,这条规则无法成立:它的分词器把一位小数的数字片段当成单个分词,而留出的数字本身不允许出现在训练文本中;对这个编码器,规则改为报告而不停止运行,每个中文问法的未见频率条目都注明该频率是一个新的分词。
工程修订 EA-1,在第一次拟合之前:在连续的外推频段(S8)中,相邻平均没有定义,相邻 3 选 1 重新标注,因为它的竞争对手本身就是留出的问题;失败的拟合逐格标注(没有任何拟合失败);次要评分可以在中断后接着运行。没有改动任何问题、划分、问法、臂(ID、TPL、DESC 等各组)、指标、界值或门槛。
预先声明的数感预测没有触发。它说的是:如果主文本编码器对频率的排序很差(每个训练句式中,频率差与嵌入距离之间的 Spearman ρ 都低于 0.3),那么 8 选 1 的 TPL − NUM 差异标记就不会是“TPL 更高”。它的前提不成立:bge-small-en-v1.5 三个训练句式的 ρ 分别为 0.593、0.563 和 0.526,基于 780 个频率对。尽管如此,两个层级上的标记都是“NUM 更高”;前提既然不成立,这只是描述,不是得到证实的预测。
四份独立审计都通过了。它们不借用研究的评分代码,重新实现了各项定义:主分析的一致性审计通过 106 项检查,失败 0 项;主分析的数值审计做了 2,270 次比较,不一致 0 次;次要分析的一致性审计通过 231 项检查,失败 0 项;次要分析的数值审计做了 18,619 次比较,其中 29 次超出容差,每一次都有解释。
次要 · 主分析比较之外
更多的数据集、特征、另一个文本编码器、中文问法和探针,都不在主分析比较之内。未注明时只有一个随机种子:单个随机种子不含训练过程的随机波动。每个 EESM19 条目和单种子条目都在运行之前声明为多半无法下结论,不过没有一项落到“无法下结论”的标记组合上。
| 比较 | 问题 | 差值(pp、log R 或 AUROC) | 是否显示差异 | 界值 | 门槛 |
|---|---|---|---|---|---|
| P1 · 标签模板 − 题号TPL − ID | 已见,5 选 1 | −0.04 pp95% 区间 −0.47 至 +0.39 pp | 未显示差异 | 在 ±2 pp 内等效 | 通过捷径检查 |
| P1 · 描述 − 题号DESC − ID | 已见,5 选 1 | −0.03 pp95% 区间 −0.43 至 +0.40 pp | 未显示差异 | 在 ±2 pp 内等效 | 通过捷径检查 |
| P2 · 新句式 − 训练问法TPL(a1) − TPL(train) | 已见,改写重采样 12 条留出问法 | −0.11 pp95% 区间 −0.56 至 +0.20 pp | 未显示差异 | 在 ±2 pp 内等效 | 通过捷径检查 |
| P2 · 同义词 − 训练问法TPL(a2) − TPL(train) | 已见,改写只对这三个同义词成立:固定,不重采样 | −15.27 pp95% 区间 −16.24 至 −14.29 pp | TPL(train) 更高 | 未达到 2 pp 界值 | 通过捷径检查 |
| P2 · 新描述 − 训练描述DESC(a3) − DESC(train) | 已见,改写重采样 10 条留出问法 | −18.54 pp95% 区间 −27.30 至 −10.80 pp | DESC(train) 更高 | 未达到 2 pp 界值 | 通过捷径检查 |
| P3 · 标签模板分类头,对比由它自己的答案读出TPL / read-off | 睡着 · 隐式名称 | +4.72095% 区间 +4.410 至 +5.113R 112.17 (82.27–166.15) | 读出剩余的错误更少 | 未达到 1.25 的比值界值 | 通过余量门槛 |
| P3 · 标签模板分类头,对比由它自己的答案读出TPL / read-off | 睡着 · 显式名称 | +2.56695% 区间 +2.179 至 +3.010R 13.02 (8.84–20.30) | 读出剩余的错误更少 | 未达到 1.25 的比值界值 | 通过余量门槛 |
| P3 · 标签模板分类头,对比由它自己的答案读出TPL / read-off | N1、N2 或 N3 期睡眠 · 显式名称 | +1.08095% 区间 +0.890 至 +1.267R 2.95 (2.44–3.55) | 读出剩余的错误更少 | 未达到 1.25 的比值界值 | 通过余量门槛 |
| P3 · 标签模板分类头,对比由它自己的答案读出TPL / read-off | 浅睡 · 隐式名称 | +2.40995% 区间 +2.208 至 +2.609R 11.12 (9.10–13.58) | 读出剩余的错误更少 | 未达到 1.25 的比值界值 | 通过余量门槛 |
| P3 · 标签模板分类头,对比由它自己的答案读出TPL / read-off | 浅睡 · 显式名称 | +0.88895% 区间 +0.769 至 +1.024R 2.43 (2.16–2.78) | 读出剩余的错误更少 | 未达到 1.25 的比值界值 | 通过余量门槛 |
| P3 · 描述分类头,对比由它自己的答案读出DESC / read-off | 睡着 · 新描述重采样 10 条留出问法 | +4.70795% 区间 +4.279 至 +5.154R 110.72 (72.15–173.16) | 读出剩余的错误更少 | 未达到 1.25 的比值界值 | 通过余量门槛 |
| P3 · 描述分类头,对比由它自己的答案读出DESC / read-off | N1、N2 或 N3 期睡眠 · 新描述重采样 10 条留出问法 | +2.22395% 区间 +1.622 至 +2.649R 9.24 (5.06–14.15) | 读出剩余的错误更少 | 未达到 1.25 的比值界值 | 通过余量门槛 |
| P3 · 描述分类头,对比由它自己的答案读出DESC / read-off | 浅睡 · 新描述重采样 10 条留出问法 | +1.70795% 区间 +1.240 至 +2.056R 5.51 (3.46–7.81) | 读出剩余的错误更少 | 未达到 1.25 的比值界值 | 通过余量门槛 |
| P5 · 标签模板 − 错配模板TPL − SHUF | 未见问题,隐式名称 | −0.39195% 区间 −0.470 至 −0.311 | SHUF 更高 | 只读差异,不设界值 | 通过余量门槛 |
| P5 · 标签模板 − 错配模板TPL − SHUF | 未见问题,显式名称 | +0.66795% 区间 +0.634 至 +0.698 | TPL 更高 | 只读差异,不设界值 | 通过余量门槛 |
运动想象没有声明捷径检查,所以它的门槛写作“未运行”,不排除任何条目。运动想象只有两种三元循环,所以错配模板组三个随机种子中有两个共用同一种错位排列。未见问题“想象手部动作”最接近它的读出:显示出差异,但在比值界值之内。
| 比较 | 问题 | 差值(pp、log R 或 AUROC) | 是否显示差异 | 界值 | 门槛 |
|---|---|---|---|---|---|
| P1 · 标签模板 − 题号TPL − ID | 已见,3 选 1 | −0.49 pp95% 区间 −1.07 至 +0.02 pp | 未显示差异 | 在 ±2 pp 内等效 | 本任务未声明捷径检查,未运行 |
| P1 · 描述 − 题号DESC − ID | 已见,3 选 1 | −0.54 pp95% 区间 −1.08 至 +0.05 pp | 未显示差异 | 在 ±2 pp 内等效 | 本任务未声明捷径检查,未运行 |
| P2 · 新句式 − 训练问法TPL(a1) − TPL(train) | 已见,改写重采样 12 条留出问法 | +0.05 pp95% 区间 −0.10 至 +0.20 pp | 未显示差异 | 在 ±2 pp 内等效 | 本任务未声明捷径检查,未运行 |
| P2 · 同义词 − 训练问法TPL(a2) − TPL(train) | 已见,改写只对这三个同义词成立:固定,不重采样 | +0.22 pp95% 区间 −0.11 至 +0.55 pp | 未显示差异 | 在 ±2 pp 内等效 | 本任务未声明捷径检查,未运行 |
| P2 · 新描述 − 训练描述DESC(a3) − DESC(train) | 已见,改写重采样 10 条留出问法 | −3.49 pp95% 区间 −6.63 至 −1.42 pp | DESC(train) 更高 | 未达到 2 pp 界值 | 本任务未声明捷径检查,未运行 |
| P3 · 标签模板分类头,对比由它自己的答案读出TPL / read-off | 想象手部动作 · 隐式名称 | +0.07695% 区间 +0.050 至 +0.107R 1.08 (1.05–1.11) | 读出剩余的错误更少 | 在 1.25 的比值界值内等效 | 通过余量门槛 |
| P3 · 描述分类头,对比由它自己的答案读出DESC / read-off | 想象手部动作 · 新描述重采样 10 条留出问法 | +0.08895% 区间 +0.048 至 +0.138R 1.09 (1.05–1.15) | 读出剩余的错误更少 | 在 1.25 的比值界值内等效 | 通过余量门槛 |
REVE-L 特征保留了刺激相位,所以它的相邻 3 选 1 同时检验频率和相位。
| 比较 | 问题 | 差值(pp、log R 或 AUROC) | 是否显示差异 | 界值 | 门槛 |
|---|---|---|---|---|---|
| P1 · 标签模板 − 题号TPL − ID | 已见,32 选 1 | −2.76 pp95% 区间 −3.51 至 −2.07 pp | ID 更高 | 未达到 2 pp 界值 | 通过捷径检查 |
| P1 · 描述 − 题号DESC − ID | 已见,32 选 1 | −2.56 pp95% 区间 −3.24 至 −1.90 pp | ID 更高 | 未达到 2 pp 界值 | 通过捷径检查 |
| P2 · 新句式 − 训练问法TPL(a1) − TPL(train) | 已见,改写重采样 12 条留出问法 | −4.48 pp95% 区间 −7.66 至 −2.16 pp | TPL(train) 更高 | 未达到 2 pp 界值 | 通过捷径检查 |
| P2 · 同义词 − 训练问法TPL(a2) − TPL(train) | 已见,改写只对这三个同义词成立:固定,不重采样 | −2.16 pp95% 区间 −2.44 至 −1.88 pp | TPL(train) 更高 | 未达到 2 pp 界值 | 通过捷径检查 |
| P2 · 新描述 − 训练描述DESC(a3) − DESC(train) | 已见,改写重采样 10 条留出问法 | −5.05 pp95% 区间 −6.50 至 −3.77 pp | DESC(train) 更高 | 未达到 2 pp 界值 | 通过捷径检查 |
| P4 · 标签模板 − CCA(无需训练)TPL − CCA | 未见频率,8 选 1 | −65.32 pp95% 区间 −69.18 至 −61.17 pp | CCA 更高 | 未达到 2 pp 界值 | 通过余量门槛 |
| P4 · 标签模板 − 相邻两个已见频率的平均TPL − NN(TPL) | 未见频率,8 选 1 | +5.81 pp95% 区间 +4.54 至 +7.04 pp | TPL 更高 | 只读差异,不设界值 | 通过余量门槛 |
| P4 · 标签模板 − 数值编码TPL − NUM | 未见频率,8 选 1 | +1.92 pp95% 区间 +0.85 至 +2.92 pp | TPL 更高 | 只读差异,不设界值 | 通过余量门槛 |
| P4 · 标签模板 − CCA(无需训练)TPL − CCA | 未见频率,相邻 3 选 1 | −38.75 pp95% 区间 −41.62 至 −35.60 pp | CCA 更高 | 未达到 2 pp 界值 | 通过余量门槛 |
| P4 · 标签模板 − 数值编码TPL − NUM | 未见频率,相邻 3 选 1 | +35.22 pp95% 区间 +32.91 至 +37.42 pp | TPL 更高 | 只读差异,不设界值 | 通过余量门槛 |
| 比较 | 问题 | 差值(pp、log R 或 AUROC) | 是否显示差异 | 界值 | 门槛 |
|---|---|---|---|---|---|
| P1 · 标签模板 − 题号TPL − ID | 已见,32 选 1 | −6.73 pp95% 区间 −7.75 至 −5.68 pp | ID 更高 | 未达到 2 pp 界值 | 通过捷径检查 |
| P1 · 描述 − 题号DESC − ID | 已见,32 选 1 | −11.58 pp95% 区间 −13.16 至 −9.97 pp | ID 更高 | 未达到 2 pp 界值 | 通过捷径检查 |
| P2 · 新句式 − 训练问法TPL(a1) − TPL(train) | 已见,改写重采样 12 条留出问法 | −3.95 pp95% 区间 −5.11 至 −2.86 pp | TPL(train) 更高 | 未达到 2 pp 界值 | 通过捷径检查 |
| P2 · 同义词 − 训练问法TPL(a2) − TPL(train) | 已见,改写只对这三个同义词成立:固定,不重采样 | −4.90 pp95% 区间 −5.53 至 −4.25 pp | TPL(train) 更高 | 未达到 2 pp 界值 | 通过捷径检查 |
| P2 · 新描述 − 训练描述DESC(a3) − DESC(train) | 已见,改写重采样 10 条留出问法 | −5.49 pp95% 区间 −6.48 至 −4.60 pp | DESC(train) 更高 | 未达到 2 pp 界值 | 通过捷径检查 |
| P4 · 标签模板 − CCA(无需训练)TPL − CCA | 未见频率,8 选 1 | −50.10 pp95% 区间 −53.06 至 −46.73 pp | CCA 更高 | 未达到 2 pp 界值 | 通过余量门槛 |
| P4 · 标签模板 − 相邻两个已见频率的平均TPL − NN(TPL) | 未见频率,8 选 1 | −7.68 pp95% 区间 −8.82 至 −6.50 pp | NN(TPL) 更高 | 只读差异,不设界值 | 通过余量门槛 |
| P4 · 标签模板 − 数值编码TPL − NUM | 未见频率,8 选 1 | −10.84 pp95% 区间 −12.53 至 −9.08 pp | NUM 更高 | 只读差异,不设界值 | 通过余量门槛 |
| P4 · 标签模板 − CCA(无需训练)TPL − CCA | 未见频率,相邻 3 选 1 | −61.85 pp95% 区间 −65.13 至 −58.31 pp | CCA 更高 | 未达到 2 pp 界值 | 通过余量门槛 |
| P4 · 标签模板 − 数值编码TPL − NUM | 未见频率,相邻 3 选 1 | −0.18 pp95% 区间 −2.02 至 +1.73 pp | 未显示差异 | 只读差异,不设界值 | 通过余量门槛 |
| 比较 | 问题 | 差值(pp、log R 或 AUROC) | 是否显示差异 | 界值 | 门槛 |
|---|---|---|---|---|---|
| P1 · 标签模板 − 题号TPL − ID | 已见,32 选 1 | −4.73 pp95% 区间 −5.43 至 −4.07 pp | ID 更高 | 未达到 2 pp 界值 | 通过捷径检查 |
| P1 · 描述 − 题号DESC − ID | 已见,32 选 1 | −8.84 pp95% 区间 −10.12 至 −7.60 pp | ID 更高 | 未达到 2 pp 界值 | 通过捷径检查 |
| P2 · 新句式 − 训练问法TPL(a1) − TPL(train) | 已见,改写重采样 12 条留出问法 | −2.89 pp95% 区间 −3.73 至 −2.08 pp | TPL(train) 更高 | 未达到 2 pp 界值 | 通过捷径检查 |
| P2 · 同义词 − 训练问法TPL(a2) − TPL(train) | 已见,改写只对这三个同义词成立:固定,不重采样 | −3.09 pp95% 区间 −3.57 至 −2.63 pp | TPL(train) 更高 | 未达到 2 pp 界值 | 通过捷径检查 |
| P2 · 新描述 − 训练描述DESC(a3) − DESC(train) | 已见,改写重采样 10 条留出问法 | −2.98 pp95% 区间 −3.67 至 −2.34 pp | DESC(train) 更高 | 未达到 2 pp 界值 | 通过捷径检查 |
| P4 · 标签模板 − CCA(无需训练)TPL − CCA | 未见频率,8 选 1 | −61.55 pp95% 区间 −65.21 至 −57.49 pp | CCA 更高 | 未达到 2 pp 界值 | 通过余量门槛 |
| P4 · 标签模板 − 相邻两个已见频率的平均TPL − NN(TPL) | 未见频率,8 选 1 | −1.09 pp95% 区间 −1.69 至 −0.48 pp | NN(TPL) 更高 | 只读差异,不设界值 | 通过余量门槛 |
| P4 · 标签模板 − 数值编码TPL − NUM | 未见频率,8 选 1 | −2.03 pp95% 区间 −2.86 至 −1.19 pp | NUM 更高 | 只读差异,不设界值 | 通过余量门槛 |
| P4 · 标签模板 − CCA(无需训练)TPL − CCA | 未见频率,相邻 3 选 1 | −54.63 pp95% 区间 −57.51 至 −51.29 pp | CCA 更高 | 未达到 2 pp 界值 | 通过余量门槛 |
| P4 · 标签模板 − 数值编码TPL − NUM | 未见频率,相邻 3 选 1 | +15.57 pp95% 区间 +14.27 至 +16.75 pp | TPL 更高 | 只读差异,不设界值 | 通过余量门槛 |
对这个编码器,每个留出频率都是一个新的分词,而不只是已见分词的新组合(决定 S0b-6)。
| 比较 | 问题 | 差值(pp、log R 或 AUROC) | 是否显示差异 | 界值 | 门槛 |
|---|---|---|---|---|---|
| P1 · 标签模板 − 题号TPL − ID | 已见,32 选 1 | −3.15 pp95% 区间 −3.80 至 −2.48 pp | ID 更高 | 未达到 2 pp 界值 | 通过捷径检查 |
| P1 · 描述 − 题号DESC − ID | 已见,32 选 1 | −4.94 pp95% 区间 −5.69 至 −4.18 pp | ID 更高 | 未达到 2 pp 界值 | 通过捷径检查 |
| P2 · 新句式 − 训练问法TPL(a1) − TPL(train) | 已见,改写重采样 12 条留出问法 | −4.67 pp95% 区间 −6.57 至 −3.24 pp | TPL(train) 更高 | 未达到 2 pp 界值 | 通过捷径检查 |
| P2 · 同义词 − 训练问法TPL(a2) − TPL(train) | 已见,改写只对这三个同义词成立:固定,不重采样 | −8.70 pp95% 区间 −9.76 至 −7.60 pp | TPL(train) 更高 | 未达到 2 pp 界值 | 通过捷径检查 |
| P2 · 新描述 − 训练描述DESC(a3) − DESC(train) | 已见,改写重采样 10 条留出问法 | −7.35 pp95% 区间 −8.58 至 −6.17 pp | DESC(train) 更高 | 未达到 2 pp 界值 | 通过捷径检查 |
| P4 · 标签模板 − CCA(无需训练)TPL − CCA | 未见频率,8 选 1 | −54.76 pp95% 区间 −57.77 至 −51.25 pp | CCA 更高 | 未达到 2 pp 界值 | 通过余量门槛 |
| P4 · 标签模板 − 相邻两个已见频率的平均TPL − NN(TPL) | 未见频率,8 选 1 | −15.81 pp95% 区间 −17.68 至 −13.94 pp | NN(TPL) 更高 | 只读差异,不设界值 | 通过余量门槛 |
| P4 · 标签模板 − 数值编码TPL − NUM | 未见频率,8 选 1 | −15.51 pp95% 区间 −17.58 至 −13.44 pp | NUM 更高 | 只读差异,不设界值 | 通过余量门槛 |
| P4 · 标签模板 − CCA(无需训练)TPL − CCA | 未见频率,相邻 3 选 1 | −59.98 pp95% 区间 −63.74 至 −55.86 pp | CCA 更高 | 未达到 2 pp 界值 | 通过余量门槛 |
| P4 · 标签模板 − 数值编码TPL − NUM | 未见频率,相邻 3 选 1 | +1.69 pp95% 区间 −0.60 至 +4.18 pp | 未显示差异 | 只读差异,不设界值 | 通过余量门槛 |
| 比较 | 差值(pp) | 是否显示差异 | 界值 ±2 pp |
|---|---|---|---|
| TPL - CCA (8-way) | −65.37 pp95% 区间 −69.21 至 −61.40 pp | CCA 更高 | 未达到 2 pp 界值 |
| TPL - NUM (8-way) | +3.51 pp95% 区间 +1.64 至 +5.49 pp | TPL 更高 | TPL 非劣(界值 2 pp) |
| TPL - NN(TPL) (8-way) | 没有定义(EA-1) | ||
| TPL - CCA (3-way) | −50.19 pp95% 区间 −54.05 至 −46.25 pp | CCA 更高 | 未达到 2 pp 界值 |
| 比较 | 差值(pp) | 是否显示差异 | 界值 ±2 pp |
|---|---|---|---|
| TPL - CCA (8-way) | −67.47 pp95% 区间 −71.22 至 −63.56 pp | CCA 更高 | 未达到 2 pp 界值 |
| TPL - NUM (8-way) | +0.88 pp95% 区间 −0.70 至 +2.47 pp | 未显示差异 | TPL 非劣(界值 2 pp) |
| TPL - NN(TPL) (8-way) | 没有定义(EA-1) | ||
| TPL - CCA (3-way) | −48.41 pp95% 区间 −52.10 至 −44.40 pp | CCA 更高 | 未达到 2 pp 界值 |
在这个频段里,相邻 3 选 1 的竞争对手本身就是留出的问题,而不是训练好的检测器;相邻平均没有定义(EA-1)。对 bge-small-en-v1.5,这些文本中有许多带有训练中从未出现过的数字分词。
网格之外的频率有两位小数,百分位的分词从未出现在 BETA 的训练文本中,所以文本问法面对的是新的分词;数值编码才是干净的比较。共九次拟合(三种问法乘三个随机种子),在冻结之前定下。由清华大学作者镜像计算,不声称任何物理单位。
| 比较 | 差值(pp) | 是否显示差异 | 界值 ±2 pp |
|---|---|---|---|
| 干电极 | |||
| TPL - CCA (12-way) | −48.18 pp95% 区间 −52.36 至 −43.90 pp | CCA 更高 | 未达到 2 pp 界值 |
| NUM - CCA (12-way) | −42.16 pp95% 区间 −46.05 至 −38.38 pp | CCA 更高 | 未达到 2 pp 界值 |
| TPL - NUM (12-way) | −6.02 pp95% 区间 −7.32 至 −4.73 pp | NUM 更高 | 未达到 2 pp 界值 |
| DESC - CCA (12-way) | −48.52 pp95% 区间 −52.99 至 −44.02 pp | CCA 更高 | 未达到 2 pp 界值 |
| 湿电极 | |||
| TPL - CCA (12-way) | −62.92 pp95% 区间 −66.16 至 −59.66 pp | CCA 更高 | 未达到 2 pp 界值 |
| NUM - CCA (12-way) | −56.11 pp95% 区间 −59.16 至 −52.83 pp | CCA 更高 | 未达到 2 pp 界值 |
| TPL - NUM (12-way) | −6.82 pp95% 区间 −8.31 至 −5.33 pp | NUM 更高 | 未达到 2 pp 界值 |
| DESC - CCA (12-way) | −63.56 pp95% 区间 −66.68 至 −60.31 pp | CCA 更高 | 未达到 2 pp 界值 |
| 比较 | 差值(pp) | 是否显示差异 | 界值 ±2 pp |
|---|---|---|---|
| S10 DESC - CCA (8-way) | −52.29 pp95% 区间 −55.41 至 −49.00 pp | CCA 更高 | 未达到 2 pp 界值 |
| S10 DESC - CCA (3-way) | −62.72 pp95% 区间 −66.34 至 −58.98 pp | CCA 更高 | 未达到 2 pp 界值 |
| S10 DESC - NN(DESC) (8-way) | −10.80 pp95% 区间 −12.15 至 −9.39 pp | NN(DESC) 更高 | 未达到 2 pp 界值 |
| S10 NUM - CCA (8-way) | −39.44 pp95% 区间 −42.25 至 −36.48 pp | CCA 更高 | 未达到 2 pp 界值 |
| S10 TPL - NN(ID) (8-way) | −15.63 pp95% 区间 −17.48 至 −13.62 pp | NN(ID) 更高 | 未达到 2 pp 界值 |
| S10 TPL - SHUF (8-way) | +19.50 pp95% 区间 +17.45 至 +21.62 pp | TPL 更高 | TPL 非劣(界值 2 pp) |
| S11 TPL - FBCCA (8-way) | −61.68 pp95% 区间 −63.72 至 −59.69 pp | FBCCA 更高 | 未达到 2 pp 界值 |
| S11 TPL - FBCCA (3-way) | −73.35 pp95% 区间 −75.61 至 −70.93 pp | FBCCA 更高 | 未达到 2 pp 界值 |
| S13 TPL held-out frames - CCA (8-way) | −53.71 pp95% 区间 −56.73 至 −50.27 pp | CCA 更高 | 未达到 2 pp 界值 |
| S13 DESC held-out descriptions - CCA (8-way) | −54.01 pp95% 区间 −57.07 至 −50.83 pp | CCA 更高 | 未达到 2 pp 界值 |
| 问法 | 已见频率 | 未见频率 |
|---|---|---|
| S9 TPL | 23.4%95% 区间 21.0%–25.7% | 4.4%95% 区间 4.0%–4.8% |
| S9 DESC | 24.0%95% 区间 21.5%–26.5% | 4.2%95% 区间 3.8%–4.7% |
| S9 SHUF | 23.4%95% 区间 20.9%–25.7% | 1.1%95% 区间 1.0%–1.4% |
| S9 NUM | 20.7%95% 区间 18.5%–22.9% | 11.5%95% 区间 10.2%–12.7% |
| 每个问题一个输出的分类头,相邻读出(nn8) | 44.3%95% 区间 40.9%–47.5% | |
| FBCCA,已见 32 选 1 | 81.1%95% 区间 77.0%–84.8% | |
| FBCCA,未见 8 选 1 | 90.4%95% 区间 87.7%–92.8% | |
| FBCCA,相邻 3 选 1 | 92.7%95% 区间 90.9%–94.4% | |
| 比较 | 差值(pp) | 是否显示差异 | 界值 ±2 pp |
|---|---|---|---|
| S10 DESC - CCA (8-way) | −62.26 pp95% 区间 −66.01 至 −58.41 pp | CCA 更高 | 未达到 2 pp 界值 |
| S10 DESC - CCA (3-way) | −54.93 pp95% 区间 −58.01 至 −51.72 pp | CCA 更高 | 未达到 2 pp 界值 |
| S10 DESC - NN(DESC) (8-way) | −1.27 pp95% 区间 −2.08 至 −0.46 pp | NN(DESC) 更高 | 未达到 2 pp 界值 |
| S10 NUM - CCA (8-way) | −59.48 pp95% 区间 −62.92 至 −55.87 pp | CCA 更高 | 未达到 2 pp 界值 |
| S10 TPL - NN(ID) (8-way) | +0.68 pp95% 区间 −0.25 至 +1.61 pp | 未显示差异 | 在 ±2 pp 内等效 |
| S10 TPL - SHUF (8-way) | +7.97 pp95% 区间 +6.88 至 +9.09 pp | TPL 更高 | TPL 非劣(界值 2 pp) |
| S11 TPL - FBCCA (8-way) | −71.41 pp95% 区间 −73.53 至 −69.17 pp | FBCCA 更高 | 未达到 2 pp 界值 |
| S11 TPL - FBCCA (3-way) | −65.66 pp95% 区间 −67.61 至 −63.62 pp | FBCCA 更高 | 未达到 2 pp 界值 |
| S13 TPL held-out frames - CCA (8-way) | −62.31 pp95% 区间 −66.06 至 −58.27 pp | CCA 更高 | 未达到 2 pp 界值 |
| S13 DESC held-out descriptions - CCA (8-way) | −62.58 pp95% 区间 −66.15 至 −58.59 pp | CCA 更高 | 未达到 2 pp 界值 |
| 问法 | 已见频率 | 未见频率 |
|---|---|---|
| S9 TPL | 18.8%95% 区间 16.7%–21.1% | 2.5%95% 区间 2.2%–2.8% |
| S9 DESC | 18.9%95% 区间 16.9%–21.2% | 2.5%95% 区间 2.3%–2.8% |
| S9 SHUF | 18.3%95% 区间 16.4%–20.4% | 1.6%95% 区间 1.3%–1.9% |
| S9 NUM | 11.5%95% 区间 10.4%–12.7% | 4.3%95% 区间 3.8%–4.8% |
| 每个问题一个输出的分类头,相邻读出(nn8) | 17.6%95% 区间 16.6%–18.8% | |
| FBCCA,已见 32 选 1 | 81.1%95% 区间 77.0%–84.8% | |
| FBCCA,未见 8 选 1 | 90.4%95% 区间 87.7%–92.8% | |
| FBCCA,相邻 3 选 1 | 92.7%95% 区间 90.9%–94.4% | |
S9 在一项 40 选 1 检验中同时问已见与未见频率;FBCCA 与 CCA 一样不需要训练。FBCCA 只有一个随机种子。
BOAS 在说明三处缺口后发布(所有者决定,2026 年 10 月 7 日):
被试在公开发布中是假名化的。这里没有任何结果是在评估 Bitbrain 的头带或它的自动睡眠分期;两者都没有使用。No result here evaluates Bitbrain's headband or its automatic sleep scoring; neither is used.
署名:Eduardo López-Larraz, María Sierra-Torralba, Sergio Clemente, Galit Fierro, David Oriol, Javier Minguez, Luis Montesano and Jens G. Klinzing · The Bitbrain Open Access Sleep (BOAS) dataset, OpenNeuro ds005555, version 1.1.3 (2026), doi:10.18112/openneuro.ds005555.v1.1.3. Polysomnography EEG and the human-consensus stage labels only; the headband recordings and the publisher's automatic labels are not used.
| 比较 | 问题 | 差值(pp、log R 或 AUROC) | 是否显示差异 | 界值 | 门槛 |
|---|---|---|---|---|---|
| P1 · 标签模板 − 题号TPL − ID | 已见,5 选 1 | +0.27 pp95% 区间 −0.36 至 +0.86 pp | 未显示差异 | 在 ±2 pp 内等效 | 通过捷径检查 |
| P1 · 描述 − 题号DESC − ID | 已见,5 选 1 | +0.12 pp95% 区间 −0.48 至 +0.71 pp | 未显示差异 | 在 ±2 pp 内等效 | 通过捷径检查 |
| P2 · 新句式 − 训练问法TPL(a1) − TPL(train) | 已见,改写重采样 12 条留出问法 | −0.39 pp95% 区间 −1.04 至 +0.05 pp | 未显示差异 | 在 ±2 pp 内等效 | 通过捷径检查 |
| P2 · 同义词 − 训练问法TPL(a2) − TPL(train) | 已见,改写只对这三个同义词成立:固定,不重采样 | −13.54 pp95% 区间 −14.57 至 −12.49 pp | TPL(train) 更高 | 未达到 2 pp 界值 | 通过捷径检查 |
| P2 · 新描述 − 训练描述DESC(a3) − DESC(train) | 已见,改写重采样 10 条留出问法 | −21.86 pp95% 区间 −30.62 至 −14.12 pp | DESC(train) 更高 | 未达到 2 pp 界值 | 通过捷径检查 |
| P3 · 标签模板分类头,对比由它自己的答案读出TPL / read-off | 睡着 · 隐式名称 | +4.14995% 区间 +3.753 至 +4.614R 63.39 (42.66–100.85) | 读出剩余的错误更少 | 未达到 1.25 的比值界值 | 通过余量门槛 |
| P3 · 标签模板分类头,对比由它自己的答案读出TPL / read-off | 睡着 · 显式名称 | +2.64795% 区间 +2.274 至 +3.070R 14.11 (9.72–21.55) | 读出剩余的错误更少 | 未达到 1.25 的比值界值 | 通过余量门槛 |
| P3 · 标签模板分类头,对比由它自己的答案读出TPL / read-off | N1、N2 或 N3 期睡眠 · 显式名称 | +1.31795% 区间 +1.163 至 +1.483R 3.73 (3.20–4.41) | 读出剩余的错误更少 | 未达到 1.25 的比值界值 | 通过余量门槛 |
| P3 · 标签模板分类头,对比由它自己的答案读出TPL / read-off | 浅睡 · 隐式名称 | +2.73095% 区间 +2.540 至 +2.929R 15.33 (12.67–18.71) | 读出剩余的错误更少 | 未达到 1.25 的比值界值 | 通过余量门槛 |
| P3 · 标签模板分类头,对比由它自己的答案读出TPL / read-off | 浅睡 · 显式名称 | +1.87295% 区间 +1.691 至 +2.057R 6.50 (5.43–7.82) | 读出剩余的错误更少 | 未达到 1.25 的比值界值 | 通过余量门槛 |
| P3 · 描述分类头,对比由它自己的答案读出DESC / read-off | 睡着 · 新描述重采样 10 条留出问法 | +4.09295% 区间 +3.565 至 +4.610R 59.84 (35.35–100.44) | 读出剩余的错误更少 | 未达到 1.25 的比值界值 | 通过余量门槛 |
| P3 · 描述分类头,对比由它自己的答案读出DESC / read-off | N1、N2 或 N3 期睡眠 · 新描述重采样 10 条留出问法 | +1.82995% 区间 +1.250 至 +2.292R 6.23 (3.49–9.90) | 读出剩余的错误更少 | 未达到 1.25 的比值界值 | 通过余量门槛 |
| P3 · 描述分类头,对比由它自己的答案读出DESC / read-off | 浅睡 · 新描述重采样 10 条留出问法 | +1.77495% 区间 +1.162 至 +2.236R 5.89 (3.20–9.35) | 读出剩余的错误更少 | 未达到 1.25 的比值界值 | 通过余量门槛 |
| P5 · 标签模板 − 错配模板TPL − SHUF | 未见问题,隐式名称 | −0.58595% 区间 −0.612 至 −0.555 | SHUF 更高 | 只读差异,不设界值 | 通过余量门槛 |
| P5 · 标签模板 − 错配模板TPL − SHUF | 未见问题,显式名称 | +0.62695% 区间 +0.602 至 +0.648 | TPL 更高 | 只读差异,不设界值 | 通过余量门槛 |
| 比较 | 问题 | 差值(pp、log R 或 AUROC) | 是否显示差异 | 界值 | 门槛 |
|---|---|---|---|---|---|
| P1 · 标签模板 − 题号TPL − ID | 已见,5 选 1 | +0.19 pp95% 区间 −0.37 至 +0.75 pp | 未显示差异 | 在 ±2 pp 内等效 | 通过捷径检查 |
| P1 · 描述 − 题号DESC − ID | 已见,5 选 1 | +0.01 pp95% 区间 −0.64 至 +0.72 pp | 未显示差异 | 在 ±2 pp 内等效 | 通过捷径检查 |
| P2 · 新句式 − 训练问法TPL(a1) − TPL(train) | 已见,改写重采样 12 条留出问法 | −1.72 pp95% 区间 −4.31 至 −0.09 pp | TPL(train) 更高 | 未达到 2 pp 界值 | 通过捷径检查 |
| P2 · 同义词 − 训练问法TPL(a2) − TPL(train) | 已见,改写只对这三个同义词成立:固定,不重采样 | −14.04 pp95% 区间 −15.29 至 −12.68 pp | TPL(train) 更高 | 未达到 2 pp 界值 | 通过捷径检查 |
| P2 · 新描述 − 训练描述DESC(a3) − DESC(train) | 已见,改写重采样 10 条留出问法 | −25.74 pp95% 区间 −34.29 至 −16.26 pp | DESC(train) 更高 | 未达到 2 pp 界值 | 通过捷径检查 |
| P3 · 标签模板分类头,对比由它自己的答案读出TPL / read-off | 睡着 · 隐式名称 | +3.79895% 区间 +3.385 至 +4.273R 44.60 (29.53–71.76) | 读出剩余的错误更少 | 未达到 1.25 的比值界值 | 通过余量门槛 |
| P3 · 标签模板分类头,对比由它自己的答案读出TPL / read-off | 睡着 · 显式名称 | +1.32595% 区间 +0.999 至 +1.715R 3.76 (2.71–5.56) | 读出剩余的错误更少 | 未达到 1.25 的比值界值 | 通过余量门槛 |
| P3 · 标签模板分类头,对比由它自己的答案读出TPL / read-off | N1、N2 或 N3 期睡眠 · 显式名称 | +0.88295% 区间 +0.717 至 +1.047R 2.41 (2.05–2.85) | 读出剩余的错误更少 | 未达到 1.25 的比值界值 | 通过余量门槛 |
| P3 · 标签模板分类头,对比由它自己的答案读出TPL / read-off | 浅睡 · 隐式名称 | +2.33895% 区间 +2.134 至 +2.552R 10.36 (8.45–12.83) | 读出剩余的错误更少 | 未达到 1.25 的比值界值 | 通过余量门槛 |
| P3 · 标签模板分类头,对比由它自己的答案读出TPL / read-off | 浅睡 · 显式名称 | +1.79695% 区间 +1.598 至 +2.000R 6.03 (4.94–7.39) | 读出剩余的错误更少 | 未达到 1.25 的比值界值 | 通过余量门槛 |
| P3 · 描述分类头,对比由它自己的答案读出DESC / read-off | 睡着 · 新描述重采样 10 条留出问法 | +3.06995% 区间 +2.508 至 +3.601R 21.52 (12.28–36.65) | 读出剩余的错误更少 | 未达到 1.25 的比值界值 | 通过余量门槛 |
| P3 · 描述分类头,对比由它自己的答案读出DESC / read-off | N1、N2 或 N3 期睡眠 · 新描述重采样 10 条留出问法 | +1.11895% 区间 +0.793 至 +1.449R 3.06 (2.21–4.26) | 读出剩余的错误更少 | 未达到 1.25 的比值界值 | 通过余量门槛 |
| P3 · 描述分类头,对比由它自己的答案读出DESC / read-off | 浅睡 · 新描述重采样 10 条留出问法 | +1.07095% 区间 +0.840 至 +1.333R 2.92 (2.32–3.79) | 读出剩余的错误更少 | 未达到 1.25 的比值界值 | 通过余量门槛 |
| P5 · 标签模板 − 错配模板TPL − SHUF | 未见问题,隐式名称 | −0.62695% 区间 −0.653 至 −0.596 | SHUF 更高 | 只读差异,不设界值 | 通过余量门槛 |
| P5 · 标签模板 − 错配模板TPL − SHUF | 未见问题,显式名称 | +0.57295% 区间 +0.550 至 +0.592 | TPL 更高 | 只读差异,不设界值 | 通过余量门槛 |
| 比较 | 问题 | 差值(pp、log R 或 AUROC) | 是否显示差异 | 界值 | 门槛 |
|---|---|---|---|---|---|
| P1 · 标签模板 − 题号TPL − ID | 已见,5 选 1 | +0.34 pp95% 区间 −0.29 至 +0.99 pp | 未显示差异 | 在 ±2 pp 内等效 | 通过捷径检查 |
| P1 · 描述 − 题号DESC − ID | 已见,5 选 1 | −0.28 pp95% 区间 −0.93 至 +0.42 pp | 未显示差异 | 在 ±2 pp 内等效 | 通过捷径检查 |
| P2 · 新句式 − 训练问法TPL(a1) − TPL(train) | 已见,改写重采样 12 条留出问法 | −0.70 pp95% 区间 −1.83 至 +0.08 pp | 未显示差异 | 在 ±2 pp 内等效 | 通过捷径检查 |
| P2 · 同义词 − 训练问法TPL(a2) − TPL(train) | 已见,改写只对这三个同义词成立:固定,不重采样 | −12.51 pp95% 区间 −13.73 至 −11.27 pp | TPL(train) 更高 | 未达到 2 pp 界值 | 通过捷径检查 |
| P2 · 新描述 − 训练描述DESC(a3) − DESC(train) | 已见,改写重采样 10 条留出问法 | −25.81 pp95% 区间 −33.97 至 −17.73 pp | DESC(train) 更高 | 未达到 2 pp 界值 | 通过捷径检查 |
| P3 · 标签模板分类头,对比由它自己的答案读出TPL / read-off | 睡着 · 隐式名称 | +3.82695% 区间 +3.424 至 +4.277R 45.87 (30.69–72.04) | 读出剩余的错误更少 | 未达到 1.25 的比值界值 | 通过余量门槛 |
| P3 · 标签模板分类头,对比由它自己的答案读出TPL / read-off | 睡着 · 显式名称 | +1.55895% 区间 +1.216 至 +1.950R 4.75 (3.37–7.03) | 读出剩余的错误更少 | 未达到 1.25 的比值界值 | 通过余量门槛 |
| P3 · 标签模板分类头,对比由它自己的答案读出TPL / read-off | N1、N2 或 N3 期睡眠 · 显式名称 | +0.73795% 区间 +0.584 至 +0.898R 2.09 (1.79–2.45) | 读出剩余的错误更少 | 未达到 1.25 的比值界值 | 通过余量门槛 |
| P3 · 标签模板分类头,对比由它自己的答案读出TPL / read-off | 浅睡 · 隐式名称 | +2.32295% 区间 +2.122 至 +2.532R 10.19 (8.34–12.57) | 读出剩余的错误更少 | 未达到 1.25 的比值界值 | 通过余量门槛 |
| P3 · 标签模板分类头,对比由它自己的答案读出TPL / read-off | 浅睡 · 显式名称 | +1.61595% 区间 +1.424 至 +1.809R 5.03 (4.15–6.11) | 读出剩余的错误更少 | 未达到 1.25 的比值界值 | 通过余量门槛 |
| P3 · 描述分类头,对比由它自己的答案读出DESC / read-off | 睡着 · 新描述重采样 10 条留出问法 | +2.71595% 区间 +2.127 至 +3.244R 15.11 (8.39–25.63) | 读出剩余的错误更少 | 未达到 1.25 的比值界值 | 通过余量门槛 |
| P3 · 描述分类头,对比由它自己的答案读出DESC / read-off | N1、N2 或 N3 期睡眠 · 新描述重采样 10 条留出问法 | +0.79895% 区间 +0.599 至 +1.039R 2.22 (1.82–2.83) | 读出剩余的错误更少 | 未达到 1.25 的比值界值 | 通过余量门槛 |
| P3 · 描述分类头,对比由它自己的答案读出DESC / read-off | 浅睡 · 新描述重采样 10 条留出问法 | +0.94395% 区间 +0.773 至 +1.123R 2.57 (2.17–3.07) | 读出剩余的错误更少 | 未达到 1.25 的比值界值 | 通过余量门槛 |
| 比较 | log R(附 R) | 是否显示差异 | 界值 R < 1.25 |
|---|---|---|---|
| TPL asleep implicit (held-out frames) | +3.56595% 区间 +3.162 至 +4.006 | 读出剩余的错误更少 | 未达到 1.25 的比值界值 |
| TPL asleep explicit (held-out frames) | +1.97695% 区间 +1.594 至 +2.392 | 读出剩余的错误更少 | 未达到 1.25 的比值界值 |
| TPL NREM explicit (held-out frames) | +0.92095% 区间 +0.743 至 +1.100 | 读出剩余的错误更少 | 未达到 1.25 的比值界值 |
| TPL light implicit (held-out frames) | +2.23395% 区间 +2.022 至 +2.443 | 读出剩余的错误更少 | 未达到 1.25 的比值界值 |
| TPL light explicit (held-out frames) | +1.48495% 区间 +1.240 至 +1.719 | 读出剩余的错误更少 | 未达到 1.25 的比值界值 |
| 问法 | 对被否定问题真值的 AUROC | 1 − p(X) 的 AUROC | 被试 |
|---|---|---|---|
| not W | 0.02295% 区间 0.014–0.030 | 0.98095% 区间 0.972–0.987 | 100 |
| not N1 | 0.13595% 区间 0.120–0.152 | 0.87295% 区间 0.855–0.887 | 100 |
| not N2 | 0.12495% 区间 0.110–0.139 | 0.92495% 区间 0.909–0.937 | 100 |
| not N3 | 0.02195% 区间 0.017–0.026 | 0.97995% 区间 0.974–0.983 | 71 |
| not REM | 0.04995% 区间 0.038–0.061 | 0.95695% 区间 0.944–0.967 | 100 |
| non-REM sleep (implicit) | 0.04895% 区间 0.037–0.060 | 0.95695% 区间 0.944–0.967 | 100 |
每一个否定问法,都被当成在问 X 本身:它对被否定问题真值的 AUROC 远低于 0.5,而把分类头对 X 的回答反过来,本可以答得很好。多写提示词并不能提供信号层面的真值。
随结果一并发布
提问所用的全部 787 条文本,英文与中文,涵盖睡眠、SSVEP 和运动想象:训练与留出的句式、标签名称与同义词、描述、未见问题的名称与描述,以及否定句式。两个代理在任何评分之前按固定说明写成,第二个代理在没有看到第一个代理文件的情况下写了全部留出描述;它们不是用户写的问法,也没有调优。文件中还有它们通过的防泄漏规则、每种轮换的留出频率与外推频段、错配对照预先声明的错位排列、频率的数值编码,以及固定版本的文本编码器。只有文本,CC BY 4.0。
训练句式中各睡眠分期的名称,以及每个名称改写时所用的三个同义词(英文原文):
| 分期 | 训练名称 | 同义词(a2) |
|---|---|---|
| W | wake | wakefulness、awake、stage W |
| N1 | N1 sleep | stage 1 sleep、sleep stage one、stage N1 |
| N2 | N2 sleep | stage 2 sleep、sleep stage two、stage N2 |
| N3 | N3 sleep | slow-wave sleep、deep sleep、stage N3 |
| REM | REM sleep | stage R sleep、paradoxical sleep、dream sleep |
方法与局限
5c38ec71110a24614241f固定在指定的提交版本,冻结使用,从不再分发。
Bingchuan Liu et al. · BETA: A Large Benchmark Database Toward SSVEP-BCI Application (2020), doi:10.3389/fnins.2020.00627. Figshare 12264401 v3; mirror Bingchuan/BETA.
Eduardo López-Larraz, María Sierra-Torralba, Sergio Clemente, Galit Fierro, David Oriol, Javier Minguez, Luis Montesano and Jens G. Klinzing · The Bitbrain Open Access Sleep (BOAS) dataset, OpenNeuro ds005555, version 1.1.3 (2026), doi:10.18112/openneuro.ds005555.v1.1.3. Polysomnography EEG and the human-consensus stage labels only; the headband recordings and the publisher's automatic labels are not used.
在说明三处缺口后发布,缺口与结果一起列在上文。
Kaare B. Mikkelsen et al. · Accurate whole-night sleep monitoring with dry-contact ear-EEG (2019), doi:10.1038/s41598-019-53115-3; OpenNeuro ds005185 v1.0.2. Processed mirror: Zachary1150/EESM19-Processed.
Min-Ho Lee, O-Yeon Kwon, Yong-Jeong Kim, Hong-Kyung Kim, Young-Eun Lee, John Williamson, Siamac Fazli and Seong-Whan Lee · EEG dataset and OpenBMI toolbox for three BCI paradigms: an investigation into BCI illiteracy, GigaScience (2019), giz002, doi:10.1093/gigascience/giz002. Data: Supporting data, GigaScience Database, doi:10.5524/100542.
Zhu, F., Jiang, L., Dong, G., Gao, X., & Wang, Y. (2021). An Open Dataset for Wearable SSVEP-Based Brain-Computer Interfaces (Version 4) [Data set]. Figshare. https://doi.org/10.6084/m9.figshare.13560281.v4
Zhu, F., Jiang, L., Dong, G., Gao, X., & Wang, Y. (2021). An Open Dataset for Wearable SSVEP-Based Brain-Computer Interfaces. Sensors, 21(4), 1256. https://doi.org/10.3390/s21041256
基于 2026-09-20 获取的清华 BCI 实验室作者官方镜像快照计算;该镜像本身没有单独的 DOI 或版本号。
特征:冻结的 CBraMod(主分析),以及冻结的 REVE Large @ 317531c7,即 REVE-L(次要分析)。
权重条款:REVE 采用 REVE 负责任使用许可 v1.0(模型版本:REVE Large @ 317531c7)。任何模型的作者都没有为这些结果背书。 REVE, arXiv:2510.21585 ↗
数据来源: questions-in-language-update.json · schema bci-report-questions-in-language-update-v1。
问法: questions-in-language-wordings.json · schema bci-report-questions-in-language-wordings-v1。
BCI Report. EEG 模型能回答用文字提出的问题吗?[EB/OL]. (2026-10-08). https://bci.report/zh/topics/questions-in-language/
数字来自发布 questions-in-language-update-20261008(2026-10-08)。也请同时引用上游数据集:署名就在本页。
每个发布版本都在 Zenodo 存档:doi:10.5281/zenodo.23123296。 本站及各次发布的 BibTeX → · CITATION.cff ↗(英文)