用语言提问 · 决策研究计划的第三条路线

EEG 模型能回答用文字提出的问题吗?

冻结 EEG 特征上的一个小分类头,每个问题分别用题号、标签模板或自然语言描述提出:SSVEP 用 BETA,睡眠用 BOAS。已见过的问题、改写后的问题、EEG 分类头从未训练过的问题分开报告,从不合并成一个“零样本”数字。

测量所用数据集:BETA、BOAS · Bitbrain Open Access Sleep dataset · 方法:CBraMod

简答

只对训练过的问题成立,而且不是在每个数据集上都成立。冻结 EEG 特征上的一个小分类头,用标签模板或描述代替题号来问已见过的问题:在睡眠(BOAS)上与题号在 2 pp(百分点)的界值内等效;在 SSVEP(BETA,70 名被试)上则损失了准确率:普通频谱上用标签模板为 −5.96 pp(−6.84 至 −5.08 pp),未达到界值。改写已见过的问题也有代价,只有睡眠上换一个新句式例外。EEG 分类头从未训练过的问题没有得到有用的回答:每一个未见过的睡眠问题,都不如把分类头自己的各期答案加起来;在未见过的闪烁频率上,分类头在普通频谱上只达到 28.7%,而无需训练的 CCA 达到 80.9%(随机水平 12.5%)。“N1 或 N2 期睡眠”这类显式问法用到了词与分期的对应关系;“睡着”“浅睡”这类日常名称把窗口的排序弄反了;在一个边界探针中,否定的问法则被当成在问被否定的那一项本身。

比较方法

一个分类头,三种问法

所有问题都由同一个小分类头回答,变的只是告诉它“问的是哪个问题”的那个向量。每次测试都在分类头从未训练过的被试上进行。

睡眠的一个训练句式,填入某一期的名称(英文原文): The scorer marked this 30-second epoch as N2 sleep.

SSVEP 用 BETA:普通频谱(L0)和冻结的 CBraMod 特征(L1)。睡眠用 BOAS:冻结的 CBraMod 特征(L1)。各用三个训练随机种子。主文本编码器是冻结的 bge-small-en-v1.5。每种问法的分类头都相同:标准化的特征,接一个由问题向量调整的小隐藏层(FiLM),再接一个输出。

三类结果,从不合并成一个“零样本”数字:用训练时的问法问已见过的问题;把同一个问题改写后再问;问分类头从未训练过的问题。“未见过”始终指 EEG 分类头没有见过,而不是文本编码器没有见过:冻结的文本编码器读过这些词;对 SSVEP,每个留出频率的每个分词也都出现在该轮换的训练文本中。未见过的睡眠问题是已见分期的组合;未见过的 SSVEP 问题是在五种轮换中留出的闪烁频率。

每项比较都是语言问法减去参照,单位为 pp,95% 区间依次对被试、训练随机种子和留出问法重采样得到。每项比较有两种读法,都在任何拟合之前定下。区间不含零,才算显示出差异。界值为 ±2 pp:整个区间都在界值内,算等效;对语言问法不利的那一端仍在界值内,算非劣;否则就是未达到界值——这并不等于损失了 2 pp 或更多。对未见过的睡眠问题,比较的是 R:分类头剩余的错误(1 − AUROC)与由它自己的各期答案读出的剩余错误之比,界值为 R < 1.25。检验分类头是否用到问法与分期对应关系的那项比较(模板组对比错配模板组),是 AUROC 的差值。主分析中,与数值编码、相邻平均和错配模板的比较只读差异;次要分析的表格按运行时的计算列出两种读法。

主分析共有 35 项预先声明的比较,不做多重比较校正:在 95% 水平下,没有真实差异的比较里,约每二十项就可能有一项偶然显示出差异。准确率先逐人计算,再在被试之间平均:它用来比较设置,不是部署时的错误率。

这是“何时不该执行”页上研究计划的第三条路线。“Jev-style”(Jev 式)在这里指把 TypeSafe 的 Jev 这类决策模型的接口用在 EEG 上:一段记录只编码一次,再回答关于它的多个明确的、规定输出类型的问题,每个回答都带一个概率。这个计划从一篇视觉论文出发:Yu & Yao, 2026 · Visual Jev: Accurate and Efficient Decisions from Shared Visual Context ↗,它把同样的思路用在图像上。三条路线汇总:Jev 式提问用在脑电上:证据 →

主分析 · 已见过的问题 · BETA 与 BOAS

已见过的问题:用文字提问,以及改写后提问

分类头训练过的问题。BETA:70 名被试注视闪烁的目标;每种轮换中,分类头在大部分频率上训练,这里问的就是这些频率(32 选 1 任务)。BOAS:100 名被试,每个半分钟的数据帧按人工共识分为五期之一,保持自然比例。

BOAS 在说明三处缺口后发布(所有者决定,2026 年 10 月 7 日):

  1. 知情同意声明没有说明被试是否同意公开共享或二次使用。The consent statement does not say whether participants agreed to public sharing or secondary use.
  2. 伦理与知情同意的陈述只来自发布者的数据集说明与 README,没有任何同行评审论文描述 BOAS。The ethics and consent statements come from the publisher's dataset description and README. No peer-reviewed paper describes BOAS.
  3. 伦理批件编号是在 1.1.1 版(2025 年 5 月)才加入发布的,发布中没有说明它是在记录之前还是之后批准的。The ethics reference was added to the release in version 1.1.1 (May 2025), and the release does not say when it was granted relative to the recordings.

被试在公开发布中是假名化的。这里没有任何结果是在评估 Bitbrain 的头带或它的自动睡眠分期;两者都没有使用。No result here evaluates Bitbrain's headband or its automatic sleep scoring; neither is used.

署名:Eduardo López-Larraz, María Sierra-Torralba, Sergio Clemente, Galit Fierro, David Oriol, Javier Minguez, Luis Montesano and Jens G. Klinzing · The Bitbrain Open Access Sleep (BOAS) dataset, OpenNeuro ds005555, version 1.1.3 (2026), doi:10.18112/openneuro.ds005555.v1.1.3. Polysomnography EEG and the human-consensus stage labels only; the headband recordings and the publisher's automatic labels are not used.

用训练时的问法(P1)

−5.96 ppSSVEP 上的 TPL − ID,普通频谱,BETA,三个随机种子

睡眠:没有可测的代价。SSVEP:有代价。

在睡眠上,用标签模板或描述代替题号,与题号在 ±2 pp 内等效:−0.05 pp(−0.70 至 +0.61 pp)和 +0.02 pp(−0.59 至 +0.62 pp)。在 SSVEP 上,两个层级都有准确率代价,且未达到界值:标签模板在普通频谱上为 −5.96 pp,在冻结的 CBraMod 特征上为 −3.49 pp;描述分别为 −5.46 pp 和 −3.37 pp。

平衡准确率的配对差值,语言问法减去题号,单位 pp,附 95% 区间;BETA 70 名被试,BOAS 100 名被试,各三个随机种子。
比较问题差值(pp)是否显示差异界值 ±2 pp门槛
SSVEP · BETA · 普通频谱(L0)
P1 · 标签模板 − 题号TPL − ID已见,32 选 1−5.96 pp95% 区间 −6.84 至 −5.08 ppID 更高未达到 2 pp 界值通过捷径检查
P1 · 描述 − 题号DESC − ID已见,32 选 1−5.46 pp95% 区间 −6.26 至 −4.66 ppID 更高未达到 2 pp 界值通过捷径检查
SSVEP · BETA · 冻结的 CBraMod 特征(L1)
P1 · 标签模板 − 题号TPL − ID已见,32 选 1−3.49 pp95% 区间 −4.10 至 −2.93 ppID 更高未达到 2 pp 界值通过捷径检查
P1 · 描述 − 题号DESC − ID已见,32 选 1−3.37 pp95% 区间 −3.98 至 −2.80 ppID 更高未达到 2 pp 界值通过捷径检查
睡眠 · BOAS · 冻结的 CBraMod 特征(L1)
P1 · 标签模板 − 题号TPL − ID已见,5 选 1−0.05 pp95% 区间 −0.70 至 +0.61 pp未显示差异在 ±2 pp 内等效通过捷径检查
P1 · 描述 − 题号DESC − ID已见,5 选 1+0.02 pp95% 区间 −0.59 至 +0.62 pp未显示差异在 ±2 pp 内等效通过捷径检查

在这些特征上,已见过的 SSVEP 任务对每个分类头都很难:用题号时,分类头在普通频谱上达到 32.1%(28.8%–35.2%),在冻结的 CBraMod 特征上为 24.2%,随机水平为 3.1%;无需训练的 CCA 达到 65.5%。在睡眠上,各种问法的平衡准确率大致相同:用题号为 71.5%,随机水平为 20.0%。下面的水平只是描述性的:区间重叠时不排名,上面的配对差值才是比较。

BETA,已见过的 32 选 1 平衡准确率(随机水平 3.1%):70 名被试的均值,附 95% 区间,以及校正随机水平后的数值(水平 − 随机水平)/(1 − 随机水平)。三个随机种子;CCA 不需要训练,所以没有随机种子。
问法普通频谱(L0)校正随机水平后冻结的 CBraMod 特征(L1)校正随机水平后
ID题号32.1%95% 区间 28.8%–35.2%29.9%24.2%95% 区间 21.6%–26.9%21.8%
TPL标签模板26.1%95% 区间 23.5%–28.6%23.7%20.7%95% 区间 18.5%–23.1%18.2%
DESC描述26.6%95% 区间 23.9%–29.2%24.2%20.9%95% 区间 18.7%–23.2%18.3%
SHUF错配模板25.1%95% 区间 22.5%–27.6%22.7%20.2%95% 区间 18.1%–22.3%17.6%
NUM数值编码23.7%95% 区间 21.2%–26.1%21.2%13.9%95% 区间 12.5%–15.2%11.1%
B-sh每个问题一个输出32.2%95% 区间 28.9%–35.3%30.0%27.0%95% 区间 24.2%–30.1%24.7%
CCA无需训练65.5%95% 区间 59.7%–71.1%64.3%65.5%95% 区间 59.7%–71.1%64.3%
BOAS,已见过的五期平衡准确率(随机水平 20.0%),100 名被试,三个随机种子,附校正随机水平后的数值和对数损失(平均二元交叉熵,单位 nat)。错配模板在已见过问题上的得分按它自己的错位排列读出,没有对数损失。
问法平衡准确率校正随机水平后对数损失
ID题号71.5%95% 区间 69.1%–73.5%64.3%0.26795% 区间 0.242–0.296
TPL标签模板71.4%95% 区间 69.1%–73.4%64.3%0.27695% 区间 0.249–0.307
DESC描述71.5%95% 区间 69.1%–73.5%64.3%0.27895% 区间 0.251–0.310
SHUF错配模板71.5%95% 区间 69.2%–73.5%64.4%—
B-sh每个问题一个输出71.4%95% 区间 69.1%–73.4%64.3%0.25995% 区间 0.236–0.287
BOAS,每个已见分期的 AUROC,附 95% 区间;三个随机种子。N3 汇总了至少有五个 N3 数据帧的 71 名被试;其他分期汇总 100 名。
问法W100 名被试N1100 名被试N2100 名被试N371 名被试REM100 名被试
ID题号0.9820.976–0.9870.8760.859–0.8900.9220.904–0.9370.9780.971–0.9830.9570.945–0.967
TPL标签模板0.9800.972–0.9870.8720.855–0.8870.9240.909–0.9370.9790.974–0.9830.9560.944–0.967
DESC描述0.9810.974–0.9870.8690.851–0.8840.9230.907–0.9370.9790.974–0.9830.9560.944–0.967

改写之后(P2)

同样是已见过的问题,换成分类头训练时没用过的问法:新句式(a1,对留出的句式重采样)、标签的同义词(a2:每个问题三个,固定不变,所以这些条目只对这三个同义词成立),或新描述(a3,对留出的描述重采样)。改写的结果从不与未见问题的结果合并。

平衡准确率的配对差值,改写后减去训练问法,单位 pp,附 95% 区间;BETA 70 名被试,BOAS 100 名被试,各三个随机种子。
比较问题差值(pp)是否显示差异界值 ±2 pp门槛
SSVEP · BETA · 普通频谱(L0)
P2 · 新句式 − 训练问法TPL(a1) − TPL(train)已见,改写重采样 12 条留出问法−4.01 pp95% 区间 −6.53 至 −2.12 ppTPL(train) 更高未达到 2 pp 界值通过捷径检查
P2 · 同义词 − 训练问法TPL(a2) − TPL(train)已见,改写只对这三个同义词成立:固定,不重采样−1.84 pp95% 区间 −2.10 至 −1.57 ppTPL(train) 更高未达到 2 pp 界值通过捷径检查
P2 · 新描述 − 训练描述DESC(a3) − DESC(train)已见,改写重采样 10 条留出问法−4.13 pp95% 区间 −5.58 至 −3.11 ppDESC(train) 更高未达到 2 pp 界值通过捷径检查
SSVEP · BETA · 冻结的 CBraMod 特征(L1)
P2 · 新句式 − 训练问法TPL(a1) − TPL(train)已见,改写重采样 12 条留出问法−2.72 pp95% 区间 −4.43 至 −1.43 ppTPL(train) 更高未达到 2 pp 界值通过捷径检查
P2 · 同义词 − 训练问法TPL(a2) − TPL(train)已见,改写只对这三个同义词成立:固定,不重采样−1.33 pp95% 区间 −1.53 至 −1.14 ppTPL(train) 更高在 ±2 pp 内等效通过捷径检查
P2 · 新描述 − 训练描述DESC(a3) − DESC(train)已见,改写重采样 10 条留出问法−2.95 pp95% 区间 −3.81 至 −2.26 ppDESC(train) 更高未达到 2 pp 界值通过捷径检查
睡眠 · BOAS · 冻结的 CBraMod 特征(L1)
P2 · 新句式 − 训练问法TPL(a1) − TPL(train)已见,改写重采样 12 条留出问法−0.46 pp95% 区间 −1.33 至 +0.16 pp未显示差异在 ±2 pp 内等效通过捷径检查
P2 · 同义词 − 训练问法TPL(a2) − TPL(train)已见,改写只对这三个同义词成立:固定,不重采样−12.60 pp95% 区间 −13.74 至 −11.43 ppTPL(train) 更高未达到 2 pp 界值通过捷径检查
P2 · 新描述 − 训练描述DESC(a3) − DESC(train)已见,改写重采样 10 条留出问法−20.87 pp95% 区间 −29.49 至 −13.71 ppDESC(train) 更高未达到 2 pp 界值通过捷径检查

在睡眠上,换一个新句式没有可测的代价:在 ±2 pp 内等效(−0.46 pp,−1.33 至 +0.16 pp)。每期三个同义词的差值为 −12.60 pp(−13.74 至 −11.43 pp),新描述为 −20.87 pp(−29.49 至 −13.71 pp)——区间很宽,因为各条描述之间差别很大。在 BETA 上,每种改写都更低,差值从 −1.33 pp 到 −4.13 pp;只有冻结 CBraMod 特征上的同义词留在界值内。

每个同义词单独对比训练问法,单位 pp,附 95% 区间(描述性);BETA 70 名被试,BOAS 100 名被试。在 SSVEP 上,第三个同义词把数字拼写成英文单词。
同义词SSVEP · BETA · 普通频谱(L0)SSVEP · BETA · 冻结的 CBraMod 特征(L1)睡眠 · BOAS · 冻结的 CBraMod 特征(L1)
同义词 1−1.45 pp95% 区间 −1.67 至 −1.22 pp−1.09 pp95% 区间 −1.27 至 −0.90 pp−23.53 pp95% 区间 −25.29 至 −21.64 pp
同义词 2−0.87 pp95% 区间 −1.04 至 −0.70 pp−0.84 pp95% 区间 −1.00 至 −0.68 pp−10.85 pp95% 区间 −12.59 至 −9.17 pp
同义词 3−3.19 pp95% 区间 −3.69 至 −2.69 pp−2.06 pp95% 区间 −2.44 至 −1.73 pp−3.42 pp95% 区间 −4.49 至 −2.41 pp
答案翻转率(描述性):只换问法时,分类头对同一个窗口的答案改变的频率;BETA 70 名被试,BOAS 100 名被试。在 SSVEP 上,题号分类头只是换一个训练随机种子,大多数答案就会改变,因为已见任务接近下限,所以那里的翻转率主要反映不确定性。
新句式同义词训练句式之间新描述训练描述之间ID 的随机种子之间
BETA · L039.7%29.3%19.4%41.2%19.3%56.8%
BETA · L140.7%32.0%24.3%42.7%23.3%62.2%
BOAS · L16.4%20.0%3.3%45.4%3.1%7.4%

主分析 · 未见过的睡眠问题 · BOAS

EEG 分类头从未训练过的睡眠问题

三个分类头从未训练过的问题,每个都是它训练过的分期的组合:睡着(N1、N2、N3 或 REM)、N1、N2 或 N3 期睡眠,以及浅睡(N1 或 N2)。每个问题都用模板提问(分别用隐式名称和显式名称),也用新描述提问;100 名被试,三个随机种子。EEG 分类头没有见过,但文本编码器读过这些词。因为每个问题都是组合,分类头自己的各期答案可以加起来得到一个答案,也就是读出;每种问法都要与读出对照。

BOAS 在说明三处缺口后发布(所有者决定,2026 年 10 月 7 日):

  1. 知情同意声明没有说明被试是否同意公开共享或二次使用。The consent statement does not say whether participants agreed to public sharing or secondary use.
  2. 伦理与知情同意的陈述只来自发布者的数据集说明与 README,没有任何同行评审论文描述 BOAS。The ethics and consent statements come from the publisher's dataset description and README. No peer-reviewed paper describes BOAS.
  3. 伦理批件编号是在 1.1.1 版(2025 年 5 月)才加入发布的,发布中没有说明它是在记录之前还是之后批准的。The ethics reference was added to the release in version 1.1.1 (May 2025), and the release does not say when it was granted relative to the recordings.

被试在公开发布中是假名化的。这里没有任何结果是在评估 Bitbrain 的头带或它的自动睡眠分期;两者都没有使用。No result here evaluates Bitbrain's headband or its automatic sleep scoring; neither is used.

署名:Eduardo López-Larraz, María Sierra-Torralba, Sergio Clemente, Galit Fierro, David Oriol, Javier Minguez, Luis Montesano and Jens G. Klinzing · The Bitbrain Open Access Sleep (BOAS) dataset, OpenNeuro ds005555, version 1.1.3 (2026), doi:10.18112/openneuro.ds005555.v1.1.3. Polysomnography EEG and the human-consensus stage labels only; the headband recordings and the publisher's automatic labels are not used.

模板组提问所用的名称,在任何评分之前写定(英文原文)。
问题隐式名称显式名称
睡着asleepN1, N2, N3 or REM sleep
N1、N2 或 N3 期睡眠无N1, N2 or N3 sleep
浅睡light sleepN1 or N2 sleep

分类头能回答它们吗?(P3)

33.80“睡着”用隐式名称时的 R:分类头剩余的错误与读出剩余错误之比

没有答好:每种问法下,读出都更好

在全部八种条件下,区间都高于 R = 1,对读出有利,没有一种进入 1.25 的界值:R 从 2.42(2.07–2.85;N1、N2 或 N3 期睡眠,显式名称)到 33.80(23.09–52.82;睡着,隐式名称)。

log R 与 R:分类头剩余的错误(1 − AUROC)与读出剩余错误之比,附 95% 区间;100 名被试,三个随机种子。log R 为正、或 R 大于 1,对语言问法不利。
比较问题log R(附 R)是否显示差异界值 R < 1.25门槛
P3 · 标签模板分类头,对比由它自己的答案读出TPL / read-off睡着 · 隐式名称+3.52095% 区间 +3.139 至 +3.967R 33.80 (23.09–52.82)读出剩余的错误更少未达到 1.25 的比值界值通过余量门槛
P3 · 标签模板分类头,对比由它自己的答案读出TPL / read-off睡着 · 显式名称+1.95195% 区间 +1.623 至 +2.357R 7.04 (5.07–10.56)读出剩余的错误更少未达到 1.25 的比值界值通过余量门槛
P3 · 标签模板分类头,对比由它自己的答案读出TPL / read-offN1、N2 或 N3 期睡眠 · 显式名称+0.88395% 区间 +0.726 至 +1.047R 2.42 (2.07–2.85)读出剩余的错误更少未达到 1.25 的比值界值通过余量门槛
P3 · 标签模板分类头,对比由它自己的答案读出TPL / read-off浅睡 · 隐式名称+2.26795% 区间 +2.072 至 +2.466R 9.65 (7.94–11.77)读出剩余的错误更少未达到 1.25 的比值界值通过余量门槛
P3 · 标签模板分类头,对比由它自己的答案读出TPL / read-off浅睡 · 显式名称+1.51995% 区间 +1.343 至 +1.698R 4.57 (3.83–5.46)读出剩余的错误更少未达到 1.25 的比值界值通过余量门槛
P3 · 描述分类头,对比由它自己的答案读出DESC / read-off睡着 · 新描述重采样 10 条留出问法+3.44495% 区间 +2.913 至 +3.956R 31.30 (18.41–52.26)读出剩余的错误更少未达到 1.25 的比值界值通过余量门槛
P3 · 描述分类头,对比由它自己的答案读出DESC / read-offN1、N2 或 N3 期睡眠 · 新描述重采样 10 条留出问法+1.29995% 区间 +0.793 至 +1.744R 3.67 (2.21–5.72)读出剩余的错误更少未达到 1.25 的比值界值通过余量门槛
P3 · 描述分类头,对比由它自己的答案读出DESC / read-off浅睡 · 新描述重采样 10 条留出问法+1.41795% 区间 +0.903 至 +1.856R 4.12 (2.47–6.40)读出剩余的错误更少未达到 1.25 的比值界值通过余量门槛
模板分类头在每个未见问题上的 AUROC,以及由它自己的各期答案读出(先验校正后)的 AUROC,附 95% 区间;100 名被试,三个随机种子。描述性。AUROC 低于 0.5 表示把窗口的排序弄反了。
问题问法模板分类头由各期答案读出
睡着隐式名称0.31795% 区间 0.294–0.3410.98095% 区间 0.971–0.987
睡着显式名称0.85895% 区间 0.839–0.8750.98095% 区间 0.971–0.987
N1、N2 或 N3 期睡眠显式名称0.87195% 区间 0.854–0.8870.94795% 区间 0.934–0.958
浅睡隐式名称0.24495% 区间 0.222–0.2670.92295% 区间 0.907–0.935
浅睡显式名称0.64295% 区间 0.616–0.6670.92295% 区间 0.907–0.935

隐式名称把窗口的排序弄反了:“睡着”的 AUROC 为 0.317,“浅睡”为 0.244,都低于 0.5,也就是说,真正处于睡眠或浅睡的窗口,在这些问题上的得分反而低于其他窗口。显式名称好一些(0.858 和 0.642),但仍不如读出(0.980 和 0.922)。描述没有对应关系的对照:错配对照是用模板向量构造的。留出的句式(S13,见次要结果)在全部五个模板格子上给出同样的结果。

分类头是否用到了问法与分期的对应关系?(P5)

错配模板组在训练时把同样的模板向量接到错误的分期上;未见问题保留各自真实的向量。如果分类头用到了问法与分期的对应关系,错配组在这些问题上应当不如模板组。

模板组减去错配模板组:在未见问题上的 AUROC,按每类名称的格子取平均,附 95% 区间;100 名被试,三个随机种子。只读差异:不设界值。
比较问题差值(AUROC)是否显示差异界值门槛
P5 · 标签模板 − 错配模板TPL − SHUF未见问题,隐式名称−0.37895% 区间 −0.501 至 −0.253SHUF 更高只读差异,不设界值通过余量门槛
P5 · 标签模板 − 错配模板TPL − SHUF未见问题,显式名称+0.62995% 区间 +0.603 至 +0.654TPL 更高只读差异,不设界值通过余量门槛
每个未见问题上的 AUROC,模板组与错配模板组,附 95% 区间(描述性);100 名被试,三个随机种子。
问题问法模板组错配模板组
睡着隐式名称0.31795% 区间 0.294–0.3410.67695% 区间 0.529–0.812
睡着显式名称0.85895% 区间 0.839–0.8750.13795% 区间 0.109–0.168
N1、N2 或 N3 期睡眠显式名称0.87195% 区间 0.854–0.8870.17195% 区间 0.145–0.201
浅睡隐式名称0.24495% 区间 0.222–0.2670.64195% 区间 0.537–0.738
浅睡显式名称0.64295% 区间 0.616–0.6670.17695% 区间 0.155–0.199

显式名称用到了:把模板接到错误的分期上,未见问题的 AUROC 降低,TPL − SHUF 为 +0.629(+0.603 至 +0.654)。隐式名称没有显示出用到:错配模板反而更高,−0.378(−0.501 至 −0.253)。

主分析 · 未见过的闪烁频率 · BETA

EEG 分类头从未训练过的闪烁频率(P4)

在五种轮换中,每次留出 BETA 的八个频率:分类头在其余频率上训练,再用模板说出频率来问这八个。70 名被试,三个随机种子,两个层级。EEG 分类头没有见过,但文本编码器读过这些词:每个留出频率的每个分词也都出现在该轮换的训练文本中,新的只是组合。CCA 完全不需要训练就能回答同样的问题。

−52.21 ppTPL − CCA,未见频率之间的 8 选 1,普通频谱,BETA

远不如无需训练的 CCA

在未见频率之间的 8 选 1 中,分类头在普通频谱上达到 28.7%(26.9%–30.5%),在冻结的 CBraMod 特征上为 19.0%;CCA 达到 80.9%,随机水平为 12.5%。在两个层级上,分类头也不如把它自己对相邻两个已见频率的答案取平均,也不如用数值编码表示频率。

准确率的配对差值,模板分类头减去参照,单位 pp,附 95% 区间;70 名被试,三个随机种子。与 CCA 的比较设界值;与相邻平均和数值编码的比较只读差异。
比较问题差值(pp)是否显示差异界值 ±2 pp门槛
SSVEP · BETA · 普通频谱(L0)
P4 · 标签模板 − CCA(无需训练)TPL − CCA未见频率,8 选 1−52.21 pp95% 区间 −55.13 至 −48.99 ppCCA 更高未达到 2 pp 界值通过余量门槛
P4 · 标签模板 − 相邻两个已见频率的平均TPL − NN(TPL)未见频率,8 选 1−10.98 pp95% 区间 −12.24 至 −9.67 ppNN(TPL) 更高只读差异,不设界值通过余量门槛
P4 · 标签模板 − 数值编码TPL − NUM未见频率,8 选 1−12.77 pp95% 区间 −14.52 至 −10.99 ppNUM 更高只读差异,不设界值通过余量门槛
P4 · 标签模板 − CCA(无需训练)TPL − CCA未见频率,相邻 3 选 1−62.36 pp95% 区间 −65.87 至 −58.69 ppCCA 更高未达到 2 pp 界值通过余量门槛
P4 · 标签模板 − 数值编码TPL − NUM未见频率,相邻 3 选 1−1.24 pp95% 区间 −3.17 至 +0.85 pp未显示差异只读差异,不设界值通过余量门槛
SSVEP · BETA · 冻结的 CBraMod 特征(L1)
P4 · 标签模板 − CCA(无需训练)TPL − CCA未见频率,8 选 1−61.94 pp95% 区间 −65.65 至 −58.06 ppCCA 更高未达到 2 pp 界值通过余量门槛
P4 · 标签模板 − 相邻两个已见频率的平均TPL − NN(TPL)未见频率,8 选 1−1.16 pp95% 区间 −1.97 至 −0.37 ppNN(TPL) 更高只读差异,不设界值通过余量门槛
P4 · 标签模板 − 数值编码TPL − NUM未见频率,8 选 1−2.46 pp95% 区间 −3.23 至 −1.69 ppNUM 更高只读差异,不设界值通过余量门槛
P4 · 标签模板 − CCA(无需训练)TPL − CCA未见频率,相邻 3 选 1−54.67 pp95% 区间 −57.77 至 −51.47 ppCCA 更高未达到 2 pp 界值通过余量门槛
P4 · 标签模板 − 数值编码TPL − NUM未见频率,相邻 3 选 1+15.61 pp95% 区间 +14.25 至 +16.93 ppTPL 更高只读差异,不设界值通过余量门槛

在相邻 3 选 1 中,未见过的频率要与两侧相邻频率已训练好的检测器竞争(偏向已见问题,已说明)。在普通频谱上,模板分类头低于这项检验的平均随机水平:19.3%,随机水平为 34.2%;与数值编码相比没有显示出差异。在冻结的 CBraMod 特征上,它比数值编码高 +15.61 pp,但这些特征保留了刺激相位,而相邻目标的相位不同,所以这项比较同时检验频率和相位。不含相位的普通频谱才是干净的频率检验。

在未见频率上的准确率(描述性):u8,留出频率之间的 8 选 1(随机水平 12.5%);nn8,把相邻两个已见频率的答案取平均的读出;u3,相邻 3 选 1(平均随机水平 34.2%,在频率网格两端为 2 选 1)。70 名被试;三个随机种子,CCA 没有随机种子。
问法检验普通频谱(L0)校正随机水平后冻结的 CBraMod 特征(L1)校正随机水平后
TPL标签模板u828.7%95% 区间 26.9%–30.5%18.5%19.0%95% 区间 18.0%–19.9%7.4%
DESC描述u828.6%95% 区间 26.8%–30.4%18.4%18.6%95% 区间 17.6%–19.6%7.0%
SHUF错配模板u89.2%95% 区间 8.6%–9.7%-3.8%11.0%95% 区间 10.5%–11.5%-1.7%
NUM数值编码u841.5%95% 区间 38.2%–44.7%33.1%21.4%95% 区间 20.2%–22.6%10.2%
CCA无需训练u880.9%95% 区间 76.6%–84.8%78.2%80.9%95% 区间 76.6%–84.8%78.2%
TPL标签模板nn839.7%95% 区间 36.8%–42.5%31.0%20.1%95% 区间 19.0%–21.3%8.7%
ID题号nn844.3%95% 区间 40.8%–47.6%36.4%18.3%95% 区间 17.3%–19.3%6.6%
B-sh每个问题一个输出nn844.3%95% 区间 40.9%–47.5%36.3%17.6%95% 区间 16.6%–18.8%5.8%
TPL标签模板u319.3%95% 区间 18.2%–20.5%-22.5%27.0%95% 区间 26.0%–28.0%-10.8%
NUM数值编码u320.6%95% 区间 19.3%–21.8%-20.6%11.4%95% 区间 10.7%–12.1%-34.5%
CCA无需训练u381.7%95% 区间 78.5%–84.6%72.2%81.7%95% 区间 78.5%–84.6%72.2%
泛化代价(描述性):未见频率上的准确率减去对应的已见频率上的准确率,单位 pp,附 95% 区间;70 名被试。
问法与检验普通频谱(L0)冻结的 CBraMod 特征(L1)
ID,8 选 1(相邻读出)−14.26 pp95% 区间 −15.50 至 −13.06 pp−27.80 pp95% 区间 −30.61 至 −25.03 pp
TPL,8 选 1−24.44 pp95% 区间 −26.44 至 −22.26 pp−24.27 pp95% 区间 −26.72 至 −21.85 pp
TPL,3 选 1−27.83 pp95% 区间 −30.18 至 −25.37 pp−29.67 pp95% 区间 −31.76 至 −27.64 pp
DESC,8 选 1−24.79 pp95% 区间 −26.88 至 −22.55 pp−24.81 pp95% 区间 −27.31 至 −22.39 pp
DESC,3 选 1−28.95 pp95% 区间 −31.33 至 −26.46 pp−29.74 pp95% 区间 −31.76 至 −27.76 pp
SHUF,8 选 1−40.63 pp95% 区间 −44.16 至 −36.98 pp−30.09 pp95% 区间 −33.02 至 −27.27 pp
SHUF,3 选 1−34.96 pp95% 区间 −37.50 至 −32.43 pp−32.52 pp95% 区间 −35.18 至 −29.84 pp
NUM,8 选 1−12.30 pp95% 区间 −13.42 至 −11.17 pp−16.16 pp95% 区间 −17.88 至 −14.47 pp
NUM,3 选 1−7.27 pp95% 区间 −8.49 至 −6.02 pp−7.63 pp95% 区间 −8.74 至 −6.53 pp
B-sh,8 选 1(相邻读出)−12.81 pp95% 区间 −14.09 至 −11.56 pp−31.19 pp95% 区间 −34.09 至 −28.32 pp
CCA,8 选 10.00 pp95% 区间 0.00 至 0.00 pp0.00 pp95% 区间 0.00 至 0.00 pp
CCA,3 选 1+0.41 pp95% 区间 +0.26 至 +0.56 pp+0.41 pp95% 区间 +0.26 至 +0.56 pp
8 选 1 中的 TPL − CCA,逐个轮换,单位 pp,附 95% 区间(次要,经独立审计重算);70 名被试,三个随机种子。结果不靠任何单个轮换撑起。
轮换普通频谱(L0)冻结的 CBraMod 特征(L1)
轮换 0−49.88 pp95% 区间 −53.16 至 −46.16 pp−63.00 pp95% 区间 −67.23 至 −58.54 pp
轮换 1−52.96 pp95% 区间 −57.02 至 −48.99 pp−61.76 pp95% 区间 −65.81 至 −57.74 pp
轮换 2−48.74 pp95% 区间 −51.97 至 −45.42 pp−59.74 pp95% 区间 −63.75 至 −55.51 pp
轮换 3−57.34 pp95% 区间 −60.84 至 −53.73 pp−62.75 pp95% 区间 −66.73 至 −58.42 pp
轮换 4−52.14 pp95% 区间 −55.80 至 −48.20 pp−62.47 pp95% 区间 −66.53 至 −58.23 pp

按频率和仅内部频率的细分是在审计之后计算的,没有任何独立审计覆盖它们,所以不发布。

任何结果之前

运行前的检查,以及其中一项如何被修改

有一项检查在失败之后被修改了,而且改了两次。相关情况全部列在这里,连同在读取任何结果之前必须通过的其他检查。

标签置换金丝雀检查(canary):把训练标签打乱后重新训练分类头,检查测试得分是否落在随机水平:在第一折上共 17 个配置、38 个 99.9% 区间。

修订 3 失败:38 个区间中有 1 个排除了随机水平(睡眠,冻结的 CBraMod 特征,错配模板组,未见问题“浅睡”的显式名称)。它的标签是在每个训练被试内部打乱的。运行因此停止。

修订 4 由所有者在任何新拟合之前批准,改为在所有训练窗口之间打乱标签。它也失败了:38 个区间中有 3 个,全在 BOAS 上,其中一个低于随机水平;两次检查中,SSVEP 的每个区间都包含随机水平。修订 4 写明“不再修订”。所有者在看到它如何失败之后推翻了这一条,并在任何新拟合之前批准了修订 5。修订 4 的按人中心化诊断没有运行:标签在所有窗口之间打乱后,它已经检验不了任何东西。

修订 5 通过:每个配置训练 20 个分类头(共 340 次拟合),每个指标都与该被试精确的随机水平比较,并做两层 bootstrap,先对分类头、再对被试重采样;38 个区间中有 0 个排除了零。两次失败的记录都保留。

偏离方向的计数(描述性):修订 5 中 760 个单分类头区间里,有 125 个排除了精确的随机水平,66 个偏高、59 个偏低,另有 18 个格子两个方向都失败过。BOAS 的格子只以通过或失败及计数发布。

为什么会失败——这正是修订 5 设计来检验的解释:用打乱的标签训练出的分类头,仍然是睡眠特征的某个随机函数,而这些特征按分期分得很开,所以它在新被试上的得分会整体偏向同一个方向,可能偏高也可能偏低。按被试的 bootstrap 只衡量被试之间的波动,不衡量分类头之间的波动,所以它的 99.9% 区间对这个问题来说太窄。失败的样子符合这个解释:全部发生在 BOAS 上,而且有一个低于随机水平,而泄漏不会造成这种结果。这不是“没有泄漏”的证明:被试不重叠的折、训练中没有留出的标签或问法、只在训练数据上拟合的标准化,都由代码中的断言保证,两份一致性审计也直接检查了泄漏。

决定 S0b-6,经所有者批准:SSVEP 的分词规则要求,每个留出频率的每个分词都出现在该轮换的训练文本中。对 bge-small-en-v1.5 和 all-MiniLM-L6-v2,违反这条规则就停止运行,两者在全部 5 种轮换中都通过了。对 multilingual-e5-small,这条规则无法成立:它的分词器把一位小数的数字片段当成单个分词,而留出的数字本身不允许出现在训练文本中;对这个编码器,规则改为报告而不停止运行,每个中文问法的未见频率条目都注明该频率是一个新的分词。

工程修订 EA-1,在第一次拟合之前:在连续的外推频段(S8)中,相邻平均没有定义,相邻 3 选 1 重新标注,因为它的竞争对手本身就是留出的问题;失败的拟合逐格标注(没有任何拟合失败);次要评分可以在中断后接着运行。没有改动任何问题、划分、问法、臂(ID、TPL、DESC 等各组)、指标、界值或门槛。

预先声明的数感预测没有触发。它说的是:如果主文本编码器对频率的排序很差(每个训练句式中,频率差与嵌入距离之间的 Spearman ρ 都低于 0.3),那么 8 选 1 的 TPL − NUM 差异标记就不会是“TPL 更高”。它的前提不成立:bge-small-en-v1.5 三个训练句式的 ρ 分别为 0.593、0.563 和 0.526,基于 780 个频率对。尽管如此,两个层级上的标记都是“NUM 更高”;前提既然不成立,这只是描述,不是得到证实的预测。

门槛

四份独立审计都通过了。它们不借用研究的评分代码,重新实现了各项定义:主分析的一致性审计通过 106 项检查,失败 0 项;主分析的数值审计做了 2,270 次比较,不一致 0 次;次要分析的一致性审计通过 231 项检查,失败 0 项;次要分析的数值审计做了 18,619 次比较,其中 29 次超出容差,每一次都有解释。

次要 · 主分析比较之外

次要结果

更多的数据集、特征、另一个文本编码器、中文问法和探针,都不在主分析比较之内。未注明时只有一个随机种子:单个随机种子不含训练过程的随机波动。每个 EESM19 条目和单种子条目都在运行之前声明为多半无法下结论,不过没有一项落到“无法下结论”的标记组合上。

展开次要结果

S1 · EESM19 睡眠,冻结的 CBraMod 特征 · 20 名被试,三个随机种子 · 事先声明多半无法下结论

比较问题差值(pp、log R 或 AUROC)是否显示差异界值门槛
P1 · 标签模板 − 题号TPL − ID已见,5 选 1−0.04 pp95% 区间 −0.47 至 +0.39 pp未显示差异在 ±2 pp 内等效通过捷径检查
P1 · 描述 − 题号DESC − ID已见,5 选 1−0.03 pp95% 区间 −0.43 至 +0.40 pp未显示差异在 ±2 pp 内等效通过捷径检查
P2 · 新句式 − 训练问法TPL(a1) − TPL(train)已见,改写重采样 12 条留出问法−0.11 pp95% 区间 −0.56 至 +0.20 pp未显示差异在 ±2 pp 内等效通过捷径检查
P2 · 同义词 − 训练问法TPL(a2) − TPL(train)已见,改写只对这三个同义词成立:固定,不重采样−15.27 pp95% 区间 −16.24 至 −14.29 ppTPL(train) 更高未达到 2 pp 界值通过捷径检查
P2 · 新描述 − 训练描述DESC(a3) − DESC(train)已见,改写重采样 10 条留出问法−18.54 pp95% 区间 −27.30 至 −10.80 ppDESC(train) 更高未达到 2 pp 界值通过捷径检查
P3 · 标签模板分类头,对比由它自己的答案读出TPL / read-off睡着 · 隐式名称+4.72095% 区间 +4.410 至 +5.113R 112.17 (82.27–166.15)读出剩余的错误更少未达到 1.25 的比值界值通过余量门槛
P3 · 标签模板分类头,对比由它自己的答案读出TPL / read-off睡着 · 显式名称+2.56695% 区间 +2.179 至 +3.010R 13.02 (8.84–20.30)读出剩余的错误更少未达到 1.25 的比值界值通过余量门槛
P3 · 标签模板分类头,对比由它自己的答案读出TPL / read-offN1、N2 或 N3 期睡眠 · 显式名称+1.08095% 区间 +0.890 至 +1.267R 2.95 (2.44–3.55)读出剩余的错误更少未达到 1.25 的比值界值通过余量门槛
P3 · 标签模板分类头,对比由它自己的答案读出TPL / read-off浅睡 · 隐式名称+2.40995% 区间 +2.208 至 +2.609R 11.12 (9.10–13.58)读出剩余的错误更少未达到 1.25 的比值界值通过余量门槛
P3 · 标签模板分类头,对比由它自己的答案读出TPL / read-off浅睡 · 显式名称+0.88895% 区间 +0.769 至 +1.024R 2.43 (2.16–2.78)读出剩余的错误更少未达到 1.25 的比值界值通过余量门槛
P3 · 描述分类头,对比由它自己的答案读出DESC / read-off睡着 · 新描述重采样 10 条留出问法+4.70795% 区间 +4.279 至 +5.154R 110.72 (72.15–173.16)读出剩余的错误更少未达到 1.25 的比值界值通过余量门槛
P3 · 描述分类头,对比由它自己的答案读出DESC / read-offN1、N2 或 N3 期睡眠 · 新描述重采样 10 条留出问法+2.22395% 区间 +1.622 至 +2.649R 9.24 (5.06–14.15)读出剩余的错误更少未达到 1.25 的比值界值通过余量门槛
P3 · 描述分类头,对比由它自己的答案读出DESC / read-off浅睡 · 新描述重采样 10 条留出问法+1.70795% 区间 +1.240 至 +2.056R 5.51 (3.46–7.81)读出剩余的错误更少未达到 1.25 的比值界值通过余量门槛
P5 · 标签模板 − 错配模板TPL − SHUF未见问题,隐式名称−0.39195% 区间 −0.470 至 −0.311SHUF 更高只读差异,不设界值通过余量门槛
P5 · 标签模板 − 错配模板TPL − SHUF未见问题,显式名称+0.66795% 区间 +0.634 至 +0.698TPL 更高只读差异,不设界值通过余量门槛

S2 · OpenBMI 运动想象,冻结的 CBraMod 特征 · 51 名被试,三个随机种子

运动想象没有声明捷径检查,所以它的门槛写作“未运行”,不排除任何条目。运动想象只有两种三元循环,所以错配模板组三个随机种子中有两个共用同一种错位排列。未见问题“想象手部动作”最接近它的读出:显示出差异,但在比值界值之内。

比较问题差值(pp、log R 或 AUROC)是否显示差异界值门槛
P1 · 标签模板 − 题号TPL − ID已见,3 选 1−0.49 pp95% 区间 −1.07 至 +0.02 pp未显示差异在 ±2 pp 内等效本任务未声明捷径检查,未运行
P1 · 描述 − 题号DESC − ID已见,3 选 1−0.54 pp95% 区间 −1.08 至 +0.05 pp未显示差异在 ±2 pp 内等效本任务未声明捷径检查,未运行
P2 · 新句式 − 训练问法TPL(a1) − TPL(train)已见,改写重采样 12 条留出问法+0.05 pp95% 区间 −0.10 至 +0.20 pp未显示差异在 ±2 pp 内等效本任务未声明捷径检查,未运行
P2 · 同义词 − 训练问法TPL(a2) − TPL(train)已见,改写只对这三个同义词成立:固定,不重采样+0.22 pp95% 区间 −0.11 至 +0.55 pp未显示差异在 ±2 pp 内等效本任务未声明捷径检查,未运行
P2 · 新描述 − 训练描述DESC(a3) − DESC(train)已见,改写重采样 10 条留出问法−3.49 pp95% 区间 −6.63 至 −1.42 ppDESC(train) 更高未达到 2 pp 界值本任务未声明捷径检查,未运行
P3 · 标签模板分类头,对比由它自己的答案读出TPL / read-off想象手部动作 · 隐式名称+0.07695% 区间 +0.050 至 +0.107R 1.08 (1.05–1.11)读出剩余的错误更少在 1.25 的比值界值内等效通过余量门槛
P3 · 描述分类头,对比由它自己的答案读出DESC / read-off想象手部动作 · 新描述重采样 10 条留出问法+0.08895% 区间 +0.048 至 +0.138R 1.09 (1.05–1.15)读出剩余的错误更少在 1.25 的比值界值内等效通过余量门槛

S3 · REVE-L 特征,BETA · 70 名被试,一个随机种子 · 事先声明多半无法下结论

REVE-L 特征保留了刺激相位,所以它的相邻 3 选 1 同时检验频率和相位。

比较问题差值(pp、log R 或 AUROC)是否显示差异界值门槛
P1 · 标签模板 − 题号TPL − ID已见,32 选 1−2.76 pp95% 区间 −3.51 至 −2.07 ppID 更高未达到 2 pp 界值通过捷径检查
P1 · 描述 − 题号DESC − ID已见,32 选 1−2.56 pp95% 区间 −3.24 至 −1.90 ppID 更高未达到 2 pp 界值通过捷径检查
P2 · 新句式 − 训练问法TPL(a1) − TPL(train)已见,改写重采样 12 条留出问法−4.48 pp95% 区间 −7.66 至 −2.16 ppTPL(train) 更高未达到 2 pp 界值通过捷径检查
P2 · 同义词 − 训练问法TPL(a2) − TPL(train)已见,改写只对这三个同义词成立:固定,不重采样−2.16 pp95% 区间 −2.44 至 −1.88 ppTPL(train) 更高未达到 2 pp 界值通过捷径检查
P2 · 新描述 − 训练描述DESC(a3) − DESC(train)已见,改写重采样 10 条留出问法−5.05 pp95% 区间 −6.50 至 −3.77 ppDESC(train) 更高未达到 2 pp 界值通过捷径检查
P4 · 标签模板 − CCA(无需训练)TPL − CCA未见频率,8 选 1−65.32 pp95% 区间 −69.18 至 −61.17 ppCCA 更高未达到 2 pp 界值通过余量门槛
P4 · 标签模板 − 相邻两个已见频率的平均TPL − NN(TPL)未见频率,8 选 1+5.81 pp95% 区间 +4.54 至 +7.04 ppTPL 更高只读差异,不设界值通过余量门槛
P4 · 标签模板 − 数值编码TPL − NUM未见频率,8 选 1+1.92 pp95% 区间 +0.85 至 +2.92 ppTPL 更高只读差异,不设界值通过余量门槛
P4 · 标签模板 − CCA(无需训练)TPL − CCA未见频率,相邻 3 选 1−38.75 pp95% 区间 −41.62 至 −35.60 ppCCA 更高未达到 2 pp 界值通过余量门槛
P4 · 标签模板 − 数值编码TPL − NUM未见频率,相邻 3 选 1+35.22 pp95% 区间 +32.91 至 +37.42 ppTPL 更高只读差异,不设界值通过余量门槛

S4 · 文本编码器 all-MiniLM-L6-v2,BETA,普通频谱 · 70 名被试,一个随机种子 · 事先声明多半无法下结论

比较问题差值(pp、log R 或 AUROC)是否显示差异界值门槛
P1 · 标签模板 − 题号TPL − ID已见,32 选 1−6.73 pp95% 区间 −7.75 至 −5.68 ppID 更高未达到 2 pp 界值通过捷径检查
P1 · 描述 − 题号DESC − ID已见,32 选 1−11.58 pp95% 区间 −13.16 至 −9.97 ppID 更高未达到 2 pp 界值通过捷径检查
P2 · 新句式 − 训练问法TPL(a1) − TPL(train)已见,改写重采样 12 条留出问法−3.95 pp95% 区间 −5.11 至 −2.86 ppTPL(train) 更高未达到 2 pp 界值通过捷径检查
P2 · 同义词 − 训练问法TPL(a2) − TPL(train)已见,改写只对这三个同义词成立:固定,不重采样−4.90 pp95% 区间 −5.53 至 −4.25 ppTPL(train) 更高未达到 2 pp 界值通过捷径检查
P2 · 新描述 − 训练描述DESC(a3) − DESC(train)已见,改写重采样 10 条留出问法−5.49 pp95% 区间 −6.48 至 −4.60 ppDESC(train) 更高未达到 2 pp 界值通过捷径检查
P4 · 标签模板 − CCA(无需训练)TPL − CCA未见频率,8 选 1−50.10 pp95% 区间 −53.06 至 −46.73 ppCCA 更高未达到 2 pp 界值通过余量门槛
P4 · 标签模板 − 相邻两个已见频率的平均TPL − NN(TPL)未见频率,8 选 1−7.68 pp95% 区间 −8.82 至 −6.50 ppNN(TPL) 更高只读差异,不设界值通过余量门槛
P4 · 标签模板 − 数值编码TPL − NUM未见频率,8 选 1−10.84 pp95% 区间 −12.53 至 −9.08 ppNUM 更高只读差异,不设界值通过余量门槛
P4 · 标签模板 − CCA(无需训练)TPL − CCA未见频率,相邻 3 选 1−61.85 pp95% 区间 −65.13 至 −58.31 ppCCA 更高未达到 2 pp 界值通过余量门槛
P4 · 标签模板 − 数值编码TPL − NUM未见频率,相邻 3 选 1−0.18 pp95% 区间 −2.02 至 +1.73 pp未显示差异只读差异,不设界值通过余量门槛

S4 · 文本编码器 all-MiniLM-L6-v2,BETA,冻结的 CBraMod 特征 · 70 名被试,一个随机种子 · 事先声明多半无法下结论

比较问题差值(pp、log R 或 AUROC)是否显示差异界值门槛
P1 · 标签模板 − 题号TPL − ID已见,32 选 1−4.73 pp95% 区间 −5.43 至 −4.07 ppID 更高未达到 2 pp 界值通过捷径检查
P1 · 描述 − 题号DESC − ID已见,32 选 1−8.84 pp95% 区间 −10.12 至 −7.60 ppID 更高未达到 2 pp 界值通过捷径检查
P2 · 新句式 − 训练问法TPL(a1) − TPL(train)已见,改写重采样 12 条留出问法−2.89 pp95% 区间 −3.73 至 −2.08 ppTPL(train) 更高未达到 2 pp 界值通过捷径检查
P2 · 同义词 − 训练问法TPL(a2) − TPL(train)已见,改写只对这三个同义词成立:固定,不重采样−3.09 pp95% 区间 −3.57 至 −2.63 ppTPL(train) 更高未达到 2 pp 界值通过捷径检查
P2 · 新描述 − 训练描述DESC(a3) − DESC(train)已见,改写重采样 10 条留出问法−2.98 pp95% 区间 −3.67 至 −2.34 ppDESC(train) 更高未达到 2 pp 界值通过捷径检查
P4 · 标签模板 − CCA(无需训练)TPL − CCA未见频率,8 选 1−61.55 pp95% 区间 −65.21 至 −57.49 ppCCA 更高未达到 2 pp 界值通过余量门槛
P4 · 标签模板 − 相邻两个已见频率的平均TPL − NN(TPL)未见频率,8 选 1−1.09 pp95% 区间 −1.69 至 −0.48 ppNN(TPL) 更高只读差异,不设界值通过余量门槛
P4 · 标签模板 − 数值编码TPL − NUM未见频率,8 选 1−2.03 pp95% 区间 −2.86 至 −1.19 ppNUM 更高只读差异,不设界值通过余量门槛
P4 · 标签模板 − CCA(无需训练)TPL − CCA未见频率,相邻 3 选 1−54.63 pp95% 区间 −57.51 至 −51.29 ppCCA 更高未达到 2 pp 界值通过余量门槛
P4 · 标签模板 − 数值编码TPL − NUM未见频率,相邻 3 选 1+15.57 pp95% 区间 +14.27 至 +16.75 ppTPL 更高只读差异,不设界值通过余量门槛

S5 · 中文问法,multilingual-e5-small,BETA,普通频谱 · 70 名被试,一个随机种子 · 事先声明多半无法下结论

对这个编码器,每个留出频率都是一个新的分词,而不只是已见分词的新组合(决定 S0b-6)。

比较问题差值(pp、log R 或 AUROC)是否显示差异界值门槛
P1 · 标签模板 − 题号TPL − ID已见,32 选 1−3.15 pp95% 区间 −3.80 至 −2.48 ppID 更高未达到 2 pp 界值通过捷径检查
P1 · 描述 − 题号DESC − ID已见,32 选 1−4.94 pp95% 区间 −5.69 至 −4.18 ppID 更高未达到 2 pp 界值通过捷径检查
P2 · 新句式 − 训练问法TPL(a1) − TPL(train)已见,改写重采样 12 条留出问法−4.67 pp95% 区间 −6.57 至 −3.24 ppTPL(train) 更高未达到 2 pp 界值通过捷径检查
P2 · 同义词 − 训练问法TPL(a2) − TPL(train)已见,改写只对这三个同义词成立:固定,不重采样−8.70 pp95% 区间 −9.76 至 −7.60 ppTPL(train) 更高未达到 2 pp 界值通过捷径检查
P2 · 新描述 − 训练描述DESC(a3) − DESC(train)已见,改写重采样 10 条留出问法−7.35 pp95% 区间 −8.58 至 −6.17 ppDESC(train) 更高未达到 2 pp 界值通过捷径检查
P4 · 标签模板 − CCA(无需训练)TPL − CCA未见频率,8 选 1−54.76 pp95% 区间 −57.77 至 −51.25 ppCCA 更高未达到 2 pp 界值通过余量门槛
P4 · 标签模板 − 相邻两个已见频率的平均TPL − NN(TPL)未见频率,8 选 1−15.81 pp95% 区间 −17.68 至 −13.94 ppNN(TPL) 更高只读差异,不设界值通过余量门槛
P4 · 标签模板 − 数值编码TPL − NUM未见频率,8 选 1−15.51 pp95% 区间 −17.58 至 −13.44 ppNUM 更高只读差异,不设界值通过余量门槛
P4 · 标签模板 − CCA(无需训练)TPL − CCA未见频率,相邻 3 选 1−59.98 pp95% 区间 −63.74 至 −55.86 ppCCA 更高未达到 2 pp 界值通过余量门槛
P4 · 标签模板 − 数值编码TPL − NUM未见频率,相邻 3 选 1+1.69 pp95% 区间 −0.60 至 +4.18 pp未显示差异只读差异,不设界值通过余量门槛

S8 · 外推到频率网格顶端一段连续的留出频段,BETA L0 · 70 名被试,一个随机种子 · 事先声明多半无法下结论

比较差值(pp)是否显示差异界值 ±2 pp
TPL - CCA (8-way)−65.37 pp95% 区间 −69.21 至 −61.40 ppCCA 更高未达到 2 pp 界值
TPL - NUM (8-way)+3.51 pp95% 区间 +1.64 至 +5.49 ppTPL 更高TPL 非劣(界值 2 pp)
TPL - NN(TPL) (8-way)没有定义(EA-1)
TPL - CCA (3-way)−50.19 pp95% 区间 −54.05 至 −46.25 ppCCA 更高未达到 2 pp 界值

S8 · 外推到频率网格顶端一段连续的留出频段,BETA L1 · 70 名被试,一个随机种子 · 事先声明多半无法下结论

比较差值(pp)是否显示差异界值 ±2 pp
TPL - CCA (8-way)−67.47 pp95% 区间 −71.22 至 −63.56 ppCCA 更高未达到 2 pp 界值
TPL - NUM (8-way)+0.88 pp95% 区间 −0.70 至 +2.47 pp未显示差异TPL 非劣(界值 2 pp)
TPL - NN(TPL) (8-way)没有定义(EA-1)
TPL - CCA (3-way)−48.41 pp95% 区间 −52.10 至 −44.40 ppCCA 更高未达到 2 pp 界值

在这个频段里,相邻 3 选 1 的竞争对手本身就是留出的问题,而不是训练好的检测器;相邻平均没有定义(EA-1)。对 bge-small-en-v1.5,这些文本中有许多带有训练中从未出现过的数字分词。

S12 · Wearable-102,分类头在 BETA 的全部频率上训练,再问网格之外的频率 · 102 名被试,三个随机种子

网格之外的频率有两位小数,百分位的分词从未出现在 BETA 的训练文本中,所以文本问法面对的是新的分词;数值编码才是干净的比较。共九次拟合(三种问法乘三个随机种子),在冻结之前定下。由清华大学作者镜像计算,不声称任何物理单位。

比较差值(pp)是否显示差异界值 ±2 pp
干电极
TPL - CCA (12-way)−48.18 pp95% 区间 −52.36 至 −43.90 ppCCA 更高未达到 2 pp 界值
NUM - CCA (12-way)−42.16 pp95% 区间 −46.05 至 −38.38 ppCCA 更高未达到 2 pp 界值
TPL - NUM (12-way)−6.02 pp95% 区间 −7.32 至 −4.73 ppNUM 更高未达到 2 pp 界值
DESC - CCA (12-way)−48.52 pp95% 区间 −52.99 至 −44.02 ppCCA 更高未达到 2 pp 界值
湿电极
TPL - CCA (12-way)−62.92 pp95% 区间 −66.16 至 −59.66 ppCCA 更高未达到 2 pp 界值
NUM - CCA (12-way)−56.11 pp95% 区间 −59.16 至 −52.83 ppCCA 更高未达到 2 pp 界值
TPL - NUM (12-way)−6.82 pp95% 区间 −8.31 至 −5.33 ppNUM 更高未达到 2 pp 界值
DESC - CCA (12-way)−63.56 pp95% 区间 −66.68 至 −60.31 ppCCA 更高未达到 2 pp 界值

S10、S11 与 S13 · BETA L0:其他问法对比 CCA 和 FBCCA,以及留出问法 · 70 名被试,三个随机种子

比较差值(pp)是否显示差异界值 ±2 pp
S10 DESC - CCA (8-way)−52.29 pp95% 区间 −55.41 至 −49.00 ppCCA 更高未达到 2 pp 界值
S10 DESC - CCA (3-way)−62.72 pp95% 区间 −66.34 至 −58.98 ppCCA 更高未达到 2 pp 界值
S10 DESC - NN(DESC) (8-way)−10.80 pp95% 区间 −12.15 至 −9.39 ppNN(DESC) 更高未达到 2 pp 界值
S10 NUM - CCA (8-way)−39.44 pp95% 区间 −42.25 至 −36.48 ppCCA 更高未达到 2 pp 界值
S10 TPL - NN(ID) (8-way)−15.63 pp95% 区间 −17.48 至 −13.62 ppNN(ID) 更高未达到 2 pp 界值
S10 TPL - SHUF (8-way)+19.50 pp95% 区间 +17.45 至 +21.62 ppTPL 更高TPL 非劣(界值 2 pp)
S11 TPL - FBCCA (8-way)−61.68 pp95% 区间 −63.72 至 −59.69 ppFBCCA 更高未达到 2 pp 界值
S11 TPL - FBCCA (3-way)−73.35 pp95% 区间 −75.61 至 −70.93 ppFBCCA 更高未达到 2 pp 界值
S13 TPL held-out frames - CCA (8-way)−53.71 pp95% 区间 −56.73 至 −50.27 ppCCA 更高未达到 2 pp 界值
S13 DESC held-out descriptions - CCA (8-way)−54.01 pp95% 区间 −57.07 至 −50.83 ppCCA 更高未达到 2 pp 界值
S9 与 S11 · BETA L0:在同一项检验中已见与未见频率上的准确率,以及 FBCCA(描述性)
问法已见频率未见频率
S9 TPL23.4%95% 区间 21.0%–25.7%4.4%95% 区间 4.0%–4.8%
S9 DESC24.0%95% 区间 21.5%–26.5%4.2%95% 区间 3.8%–4.7%
S9 SHUF23.4%95% 区间 20.9%–25.7%1.1%95% 区间 1.0%–1.4%
S9 NUM20.7%95% 区间 18.5%–22.9%11.5%95% 区间 10.2%–12.7%
每个问题一个输出的分类头,相邻读出(nn8)44.3%95% 区间 40.9%–47.5%
FBCCA,已见 32 选 181.1%95% 区间 77.0%–84.8%
FBCCA,未见 8 选 190.4%95% 区间 87.7%–92.8%
FBCCA,相邻 3 选 192.7%95% 区间 90.9%–94.4%

S10、S11 与 S13 · BETA L1:其他问法对比 CCA 和 FBCCA,以及留出问法 · 70 名被试,三个随机种子

比较差值(pp)是否显示差异界值 ±2 pp
S10 DESC - CCA (8-way)−62.26 pp95% 区间 −66.01 至 −58.41 ppCCA 更高未达到 2 pp 界值
S10 DESC - CCA (3-way)−54.93 pp95% 区间 −58.01 至 −51.72 ppCCA 更高未达到 2 pp 界值
S10 DESC - NN(DESC) (8-way)−1.27 pp95% 区间 −2.08 至 −0.46 ppNN(DESC) 更高未达到 2 pp 界值
S10 NUM - CCA (8-way)−59.48 pp95% 区间 −62.92 至 −55.87 ppCCA 更高未达到 2 pp 界值
S10 TPL - NN(ID) (8-way)+0.68 pp95% 区间 −0.25 至 +1.61 pp未显示差异在 ±2 pp 内等效
S10 TPL - SHUF (8-way)+7.97 pp95% 区间 +6.88 至 +9.09 ppTPL 更高TPL 非劣(界值 2 pp)
S11 TPL - FBCCA (8-way)−71.41 pp95% 区间 −73.53 至 −69.17 ppFBCCA 更高未达到 2 pp 界值
S11 TPL - FBCCA (3-way)−65.66 pp95% 区间 −67.61 至 −63.62 ppFBCCA 更高未达到 2 pp 界值
S13 TPL held-out frames - CCA (8-way)−62.31 pp95% 区间 −66.06 至 −58.27 ppCCA 更高未达到 2 pp 界值
S13 DESC held-out descriptions - CCA (8-way)−62.58 pp95% 区间 −66.15 至 −58.59 ppCCA 更高未达到 2 pp 界值
S9 与 S11 · BETA L1:在同一项检验中已见与未见频率上的准确率,以及 FBCCA(描述性)
问法已见频率未见频率
S9 TPL18.8%95% 区间 16.7%–21.1%2.5%95% 区间 2.2%–2.8%
S9 DESC18.9%95% 区间 16.9%–21.2%2.5%95% 区间 2.3%–2.8%
S9 SHUF18.3%95% 区间 16.4%–20.4%1.6%95% 区间 1.3%–1.9%
S9 NUM11.5%95% 区间 10.4%–12.7%4.3%95% 区间 3.8%–4.8%
每个问题一个输出的分类头,相邻读出(nn8)17.6%95% 区间 16.6%–18.8%
FBCCA,已见 32 选 181.1%95% 区间 77.0%–84.8%
FBCCA,未见 8 选 190.4%95% 区间 87.7%–92.8%
FBCCA,相邻 3 选 192.7%95% 区间 90.9%–94.4%

S9 在一项 40 选 1 检验中同时问已见与未见频率;FBCCA 与 CCA 一样不需要训练。FBCCA 只有一个随机种子。

BOAS 上的次要结果

BOAS 在说明三处缺口后发布(所有者决定,2026 年 10 月 7 日):

  1. 知情同意声明没有说明被试是否同意公开共享或二次使用。The consent statement does not say whether participants agreed to public sharing or secondary use.
  2. 伦理与知情同意的陈述只来自发布者的数据集说明与 README,没有任何同行评审论文描述 BOAS。The ethics and consent statements come from the publisher's dataset description and README. No peer-reviewed paper describes BOAS.
  3. 伦理批件编号是在 1.1.1 版(2025 年 5 月)才加入发布的,发布中没有说明它是在记录之前还是之后批准的。The ethics reference was added to the release in version 1.1.1 (May 2025), and the release does not say when it was granted relative to the recordings.

被试在公开发布中是假名化的。这里没有任何结果是在评估 Bitbrain 的头带或它的自动睡眠分期;两者都没有使用。No result here evaluates Bitbrain's headband or its automatic sleep scoring; neither is used.

署名:Eduardo López-Larraz, María Sierra-Torralba, Sergio Clemente, Galit Fierro, David Oriol, Javier Minguez, Luis Montesano and Jens G. Klinzing · The Bitbrain Open Access Sleep (BOAS) dataset, OpenNeuro ds005555, version 1.1.3 (2026), doi:10.18112/openneuro.ds005555.v1.1.3. Polysomnography EEG and the human-consensus stage labels only; the headband recordings and the publisher's automatic labels are not used.

S3 · REVE-L 特征,BOAS · 100 名被试,一个随机种子 · 事先声明多半无法下结论

比较问题差值(pp、log R 或 AUROC)是否显示差异界值门槛
P1 · 标签模板 − 题号TPL − ID已见,5 选 1+0.27 pp95% 区间 −0.36 至 +0.86 pp未显示差异在 ±2 pp 内等效通过捷径检查
P1 · 描述 − 题号DESC − ID已见,5 选 1+0.12 pp95% 区间 −0.48 至 +0.71 pp未显示差异在 ±2 pp 内等效通过捷径检查
P2 · 新句式 − 训练问法TPL(a1) − TPL(train)已见,改写重采样 12 条留出问法−0.39 pp95% 区间 −1.04 至 +0.05 pp未显示差异在 ±2 pp 内等效通过捷径检查
P2 · 同义词 − 训练问法TPL(a2) − TPL(train)已见,改写只对这三个同义词成立:固定,不重采样−13.54 pp95% 区间 −14.57 至 −12.49 ppTPL(train) 更高未达到 2 pp 界值通过捷径检查
P2 · 新描述 − 训练描述DESC(a3) − DESC(train)已见,改写重采样 10 条留出问法−21.86 pp95% 区间 −30.62 至 −14.12 ppDESC(train) 更高未达到 2 pp 界值通过捷径检查
P3 · 标签模板分类头,对比由它自己的答案读出TPL / read-off睡着 · 隐式名称+4.14995% 区间 +3.753 至 +4.614R 63.39 (42.66–100.85)读出剩余的错误更少未达到 1.25 的比值界值通过余量门槛
P3 · 标签模板分类头,对比由它自己的答案读出TPL / read-off睡着 · 显式名称+2.64795% 区间 +2.274 至 +3.070R 14.11 (9.72–21.55)读出剩余的错误更少未达到 1.25 的比值界值通过余量门槛
P3 · 标签模板分类头,对比由它自己的答案读出TPL / read-offN1、N2 或 N3 期睡眠 · 显式名称+1.31795% 区间 +1.163 至 +1.483R 3.73 (3.20–4.41)读出剩余的错误更少未达到 1.25 的比值界值通过余量门槛
P3 · 标签模板分类头,对比由它自己的答案读出TPL / read-off浅睡 · 隐式名称+2.73095% 区间 +2.540 至 +2.929R 15.33 (12.67–18.71)读出剩余的错误更少未达到 1.25 的比值界值通过余量门槛
P3 · 标签模板分类头,对比由它自己的答案读出TPL / read-off浅睡 · 显式名称+1.87295% 区间 +1.691 至 +2.057R 6.50 (5.43–7.82)读出剩余的错误更少未达到 1.25 的比值界值通过余量门槛
P3 · 描述分类头,对比由它自己的答案读出DESC / read-off睡着 · 新描述重采样 10 条留出问法+4.09295% 区间 +3.565 至 +4.610R 59.84 (35.35–100.44)读出剩余的错误更少未达到 1.25 的比值界值通过余量门槛
P3 · 描述分类头,对比由它自己的答案读出DESC / read-offN1、N2 或 N3 期睡眠 · 新描述重采样 10 条留出问法+1.82995% 区间 +1.250 至 +2.292R 6.23 (3.49–9.90)读出剩余的错误更少未达到 1.25 的比值界值通过余量门槛
P3 · 描述分类头,对比由它自己的答案读出DESC / read-off浅睡 · 新描述重采样 10 条留出问法+1.77495% 区间 +1.162 至 +2.236R 5.89 (3.20–9.35)读出剩余的错误更少未达到 1.25 的比值界值通过余量门槛
P5 · 标签模板 − 错配模板TPL − SHUF未见问题,隐式名称−0.58595% 区间 −0.612 至 −0.555SHUF 更高只读差异,不设界值通过余量门槛
P5 · 标签模板 − 错配模板TPL − SHUF未见问题,显式名称+0.62695% 区间 +0.602 至 +0.648TPL 更高只读差异,不设界值通过余量门槛

S4 · 文本编码器 all-MiniLM-L6-v2,BOAS,冻结的 CBraMod 特征 · 100 名被试,一个随机种子 · 事先声明多半无法下结论

比较问题差值(pp、log R 或 AUROC)是否显示差异界值门槛
P1 · 标签模板 − 题号TPL − ID已见,5 选 1+0.19 pp95% 区间 −0.37 至 +0.75 pp未显示差异在 ±2 pp 内等效通过捷径检查
P1 · 描述 − 题号DESC − ID已见,5 选 1+0.01 pp95% 区间 −0.64 至 +0.72 pp未显示差异在 ±2 pp 内等效通过捷径检查
P2 · 新句式 − 训练问法TPL(a1) − TPL(train)已见,改写重采样 12 条留出问法−1.72 pp95% 区间 −4.31 至 −0.09 ppTPL(train) 更高未达到 2 pp 界值通过捷径检查
P2 · 同义词 − 训练问法TPL(a2) − TPL(train)已见,改写只对这三个同义词成立:固定,不重采样−14.04 pp95% 区间 −15.29 至 −12.68 ppTPL(train) 更高未达到 2 pp 界值通过捷径检查
P2 · 新描述 − 训练描述DESC(a3) − DESC(train)已见,改写重采样 10 条留出问法−25.74 pp95% 区间 −34.29 至 −16.26 ppDESC(train) 更高未达到 2 pp 界值通过捷径检查
P3 · 标签模板分类头,对比由它自己的答案读出TPL / read-off睡着 · 隐式名称+3.79895% 区间 +3.385 至 +4.273R 44.60 (29.53–71.76)读出剩余的错误更少未达到 1.25 的比值界值通过余量门槛
P3 · 标签模板分类头,对比由它自己的答案读出TPL / read-off睡着 · 显式名称+1.32595% 区间 +0.999 至 +1.715R 3.76 (2.71–5.56)读出剩余的错误更少未达到 1.25 的比值界值通过余量门槛
P3 · 标签模板分类头,对比由它自己的答案读出TPL / read-offN1、N2 或 N3 期睡眠 · 显式名称+0.88295% 区间 +0.717 至 +1.047R 2.41 (2.05–2.85)读出剩余的错误更少未达到 1.25 的比值界值通过余量门槛
P3 · 标签模板分类头,对比由它自己的答案读出TPL / read-off浅睡 · 隐式名称+2.33895% 区间 +2.134 至 +2.552R 10.36 (8.45–12.83)读出剩余的错误更少未达到 1.25 的比值界值通过余量门槛
P3 · 标签模板分类头,对比由它自己的答案读出TPL / read-off浅睡 · 显式名称+1.79695% 区间 +1.598 至 +2.000R 6.03 (4.94–7.39)读出剩余的错误更少未达到 1.25 的比值界值通过余量门槛
P3 · 描述分类头,对比由它自己的答案读出DESC / read-off睡着 · 新描述重采样 10 条留出问法+3.06995% 区间 +2.508 至 +3.601R 21.52 (12.28–36.65)读出剩余的错误更少未达到 1.25 的比值界值通过余量门槛
P3 · 描述分类头,对比由它自己的答案读出DESC / read-offN1、N2 或 N3 期睡眠 · 新描述重采样 10 条留出问法+1.11895% 区间 +0.793 至 +1.449R 3.06 (2.21–4.26)读出剩余的错误更少未达到 1.25 的比值界值通过余量门槛
P3 · 描述分类头,对比由它自己的答案读出DESC / read-off浅睡 · 新描述重采样 10 条留出问法+1.07095% 区间 +0.840 至 +1.333R 2.92 (2.32–3.79)读出剩余的错误更少未达到 1.25 的比值界值通过余量门槛
P5 · 标签模板 − 错配模板TPL − SHUF未见问题,隐式名称−0.62695% 区间 −0.653 至 −0.596SHUF 更高只读差异,不设界值通过余量门槛
P5 · 标签模板 − 错配模板TPL − SHUF未见问题,显式名称+0.57295% 区间 +0.550 至 +0.592TPL 更高只读差异,不设界值通过余量门槛

S5 · 中文问法,multilingual-e5-small,BOAS,冻结的 CBraMod 特征 · 100 名被试,一个随机种子 · 事先声明多半无法下结论

比较问题差值(pp、log R 或 AUROC)是否显示差异界值门槛
P1 · 标签模板 − 题号TPL − ID已见,5 选 1+0.34 pp95% 区间 −0.29 至 +0.99 pp未显示差异在 ±2 pp 内等效通过捷径检查
P1 · 描述 − 题号DESC − ID已见,5 选 1−0.28 pp95% 区间 −0.93 至 +0.42 pp未显示差异在 ±2 pp 内等效通过捷径检查
P2 · 新句式 − 训练问法TPL(a1) − TPL(train)已见,改写重采样 12 条留出问法−0.70 pp95% 区间 −1.83 至 +0.08 pp未显示差异在 ±2 pp 内等效通过捷径检查
P2 · 同义词 − 训练问法TPL(a2) − TPL(train)已见,改写只对这三个同义词成立:固定,不重采样−12.51 pp95% 区间 −13.73 至 −11.27 ppTPL(train) 更高未达到 2 pp 界值通过捷径检查
P2 · 新描述 − 训练描述DESC(a3) − DESC(train)已见,改写重采样 10 条留出问法−25.81 pp95% 区间 −33.97 至 −17.73 ppDESC(train) 更高未达到 2 pp 界值通过捷径检查
P3 · 标签模板分类头,对比由它自己的答案读出TPL / read-off睡着 · 隐式名称+3.82695% 区间 +3.424 至 +4.277R 45.87 (30.69–72.04)读出剩余的错误更少未达到 1.25 的比值界值通过余量门槛
P3 · 标签模板分类头,对比由它自己的答案读出TPL / read-off睡着 · 显式名称+1.55895% 区间 +1.216 至 +1.950R 4.75 (3.37–7.03)读出剩余的错误更少未达到 1.25 的比值界值通过余量门槛
P3 · 标签模板分类头,对比由它自己的答案读出TPL / read-offN1、N2 或 N3 期睡眠 · 显式名称+0.73795% 区间 +0.584 至 +0.898R 2.09 (1.79–2.45)读出剩余的错误更少未达到 1.25 的比值界值通过余量门槛
P3 · 标签模板分类头,对比由它自己的答案读出TPL / read-off浅睡 · 隐式名称+2.32295% 区间 +2.122 至 +2.532R 10.19 (8.34–12.57)读出剩余的错误更少未达到 1.25 的比值界值通过余量门槛
P3 · 标签模板分类头,对比由它自己的答案读出TPL / read-off浅睡 · 显式名称+1.61595% 区间 +1.424 至 +1.809R 5.03 (4.15–6.11)读出剩余的错误更少未达到 1.25 的比值界值通过余量门槛
P3 · 描述分类头,对比由它自己的答案读出DESC / read-off睡着 · 新描述重采样 10 条留出问法+2.71595% 区间 +2.127 至 +3.244R 15.11 (8.39–25.63)读出剩余的错误更少未达到 1.25 的比值界值通过余量门槛
P3 · 描述分类头,对比由它自己的答案读出DESC / read-offN1、N2 或 N3 期睡眠 · 新描述重采样 10 条留出问法+0.79895% 区间 +0.599 至 +1.039R 2.22 (1.82–2.83)读出剩余的错误更少未达到 1.25 的比值界值通过余量门槛
P3 · 描述分类头,对比由它自己的答案读出DESC / read-off浅睡 · 新描述重采样 10 条留出问法+0.94395% 区间 +0.773 至 +1.123R 2.57 (2.17–3.07)读出剩余的错误更少未达到 1.25 的比值界值通过余量门槛

S13 · 留出的句式对比读出,BOAS · 100 名被试,三个随机种子

比较log R(附 R)是否显示差异界值 R < 1.25
TPL asleep implicit (held-out frames)+3.56595% 区间 +3.162 至 +4.006读出剩余的错误更少未达到 1.25 的比值界值
TPL asleep explicit (held-out frames)+1.97695% 区间 +1.594 至 +2.392读出剩余的错误更少未达到 1.25 的比值界值
TPL NREM explicit (held-out frames)+0.92095% 区间 +0.743 至 +1.100读出剩余的错误更少未达到 1.25 的比值界值
TPL light implicit (held-out frames)+2.23395% 区间 +2.022 至 +2.443读出剩余的错误更少未达到 1.25 的比值界值
TPL light explicit (held-out frames)+1.48495% 区间 +1.240 至 +1.719读出剩余的错误更少未达到 1.25 的比值界值

S6 · 否定探针,BOAS:边界探针,从不写入路线结论

每个否定问法对被否定问题真值的 AUROC,旁边是 1 − p(X) 的 AUROC,也就是把分类头对 X 的回答反过来;三个随机种子。“非 REM 睡眠”按“不是 REM”的真值评分。
问法对被否定问题真值的 AUROC1 − p(X) 的 AUROC被试
not W0.02295% 区间 0.014–0.0300.98095% 区间 0.972–0.987100
not N10.13595% 区间 0.120–0.1520.87295% 区间 0.855–0.887100
not N20.12495% 区间 0.110–0.1390.92495% 区间 0.909–0.937100
not N30.02195% 区间 0.017–0.0260.97995% 区间 0.974–0.98371
not REM0.04995% 区间 0.038–0.0610.95695% 区间 0.944–0.967100
non-REM sleep (implicit)0.04895% 区间 0.037–0.0600.95695% 区间 0.944–0.967100

每一个否定问法,都被当成在问 X 本身:它对被否定问题真值的 AUROC 远低于 0.5,而把分类头对 X 的回答反过来,本可以答得很好。多写提示词并不能提供信号层面的真值。

随结果一并发布

问法、留出频率与错位排列

提问所用的全部 787 条文本,英文与中文,涵盖睡眠、SSVEP 和运动想象:训练与留出的句式、标签名称与同义词、描述、未见问题的名称与描述,以及否定句式。两个代理在任何评分之前按固定说明写成,第二个代理在没有看到第一个代理文件的情况下写了全部留出描述;它们不是用户写的问法,也没有调优。文件中还有它们通过的防泄漏规则、每种轮换的留出频率与外推频段、错配对照预先声明的错位排列、频率的数值编码,以及固定版本的文本编码器。只有文本,CC BY 4.0。

问法文件(JSON)↓

训练句式中各睡眠分期的名称,以及每个名称改写时所用的三个同义词(英文原文):

分期训练名称同义词(a2)
Wwakewakefulness、awake、stage W
N1N1 sleepstage 1 sleep、sleep stage one、stage N1
N2N2 sleepstage 2 sleep、sleep stage two、stage N2
N3N3 sleepslow-wave sleep、deep sleep、stage N3
REMREM sleepstage R sleep、paradoxical sleep、dream sleep

方法与局限

这些结果能说明什么、不能说明什么

没有运行与没有报告的内容

不发布的内容

文本编码器

固定在指定的提交版本,冻结使用,从不再分发。

所用的记录

BETA

Bingchuan Liu et al. · BETA: A Large Benchmark Database Toward SSVEP-BCI Application (2020), doi:10.3389/fnins.2020.00627. Figshare 12264401 v3; mirror Bingchuan/BETA.

来源 ↗ · CC BY 4.0

BOAS, the Bitbrain Open Access Sleep dataset

Eduardo López-Larraz, María Sierra-Torralba, Sergio Clemente, Galit Fierro, David Oriol, Javier Minguez, Luis Montesano and Jens G. Klinzing · The Bitbrain Open Access Sleep (BOAS) dataset, OpenNeuro ds005555, version 1.1.3 (2026), doi:10.18112/openneuro.ds005555.v1.1.3. Polysomnography EEG and the human-consensus stage labels only; the headband recordings and the publisher's automatic labels are not used.

在说明三处缺口后发布,缺口与结果一起列在上文。

来源 ↗ · CC0-1.0

EESM19

Kaare B. Mikkelsen et al. · Accurate whole-night sleep monitoring with dry-contact ear-EEG (2019), doi:10.1038/s41598-019-53115-3; OpenNeuro ds005185 v1.0.2. Processed mirror: Zachary1150/EESM19-Processed.

来源 ↗ · CC0-1.0 declared by upstream and mirror

OpenBMI motor imagery

Min-Ho Lee, O-Yeon Kwon, Yong-Jeong Kim, Hong-Kyung Kim, Young-Eun Lee, John Williamson, Siamac Fazli and Seong-Whan Lee · EEG dataset and OpenBMI toolbox for three BCI paradigms: an investigation into BCI illiteracy, GigaScience (2019), giz002, doi:10.1093/gigascience/giz002. Data: Supporting data, GigaScience Database, doi:10.5524/100542.

来源 ↗ · CC0-1.0

Wearable SSVEP BCI dataset (dry and wet electrodes)

Zhu, F., Jiang, L., Dong, G., Gao, X., & Wang, Y. (2021). An Open Dataset for Wearable SSVEP-Based Brain-Computer Interfaces (Version 4) [Data set]. Figshare. https://doi.org/10.6084/m9.figshare.13560281.v4

Zhu, F., Jiang, L., Dong, G., Gao, X., & Wang, Y. (2021). An Open Dataset for Wearable SSVEP-Based Brain-Computer Interfaces. Sensors, 21(4), 1256. https://doi.org/10.3390/s21041256

基于 2026-09-20 获取的清华 BCI 实验室作者官方镜像快照计算;该镜像本身没有单独的 DOI 或版本号。

来源 ↗ · CC BY 4.0

特征:冻结的 CBraMod(主分析),以及冻结的 REVE Large @ 317531c7,即 REVE-L(次要分析)。

权重条款:REVE 采用 REVE 负责任使用许可 v1.0(模型版本:REVE Large @ 317531c7)。任何模型的作者都没有为这些结果背书。 REVE, arXiv:2510.21585 ↗

这些结果所依据的方法与来源

数据来源: questions-in-language-update.json · schema bci-report-questions-in-language-update-v1。

问法: questions-in-language-wordings.json · schema bci-report-questions-in-language-wordings-v1。

引用本页

BCI Report. EEG 模型能回答用文字提出的问题吗?[EB/OL]. (2026-10-08). https://bci.report/zh/topics/questions-in-language/

数字来自发布 questions-in-language-update-20261008(2026-10-08)。也请同时引用上游数据集:署名就在本页。

每个发布版本都在 Zenodo 存档:doi:10.5281/zenodo.23123296。 本站及各次发布的 BibTeX → · CITATION.cff ↗(英文)