睡眠分期 · 两个简单基线 · 两个独立队列

为什么睡眠分期器大多数时候判对,却仍会漏掉整类睡眠阶段?

以发布者存储的共识睡眠图为标准,对 30 秒数据帧做五期睡眠分期;两个 Dreem 队列在不同中心、用不同设备记录。每个队列是一项独立实验,有自己的模型、交叉验证折和区间;本页不对两者做任何比较。两个刻意简单的 CPU 基线,说明普通准确率掩盖了什么。

测量所用数据集:Dreem Open Datasets (DOD-H and DOD-O)

简答

因为准确率按数据帧计数,而各睡眠分期的数据帧数相差悬殊:分期器整类漏掉某一期,准确率也降不了多少。以发布者的共识分期为标准,在两个作为独立实验分别分析的 Dreem 队列上——25 名健康被试和 55 名阻塞性睡眠呼吸暂停患者——一个简单的 spectral ridge 在前者的准确率为 72.3%,平衡准确率却只有 56.7%;在后者准确率为 72.5%,平衡准确率只有 49.3%;它在两个队列中都从未预测过 N1。一个总是回答最常见一期 N2 的先验,准确率已有 48.0% 和 49.2%,平衡准确率却只有 20.2% 和 20.5%:这是一个下限,不是随机水平。

第 1 项实验(共 2 项)· DOD-H

DOD-H:健康被试

记录于 French Armed Forces Biomedical Research Institute (IRBA), Fatigue and Vigilance Unit, Brétigny-sur-Orge, France。共 25 晚,每人一晚,24,662 个可用的 30 秒数据帧。队列内分为 5 折,在看到任何结果之前分配:每一折用其余 20 晚拟合的模型测试 5 晚,所以每一晚都恰好留出一次。

训练集先验 · 准确率
48.0% (44.6%–51.4%)
训练集先验 · 平衡准确率
20.2% (20.0%–20.6%)
Spectral ridge · 准确率
72.3% (67.8%–76.3%)
Spectral ridge · 平衡准确率
56.7% (53.1%–60.0%)
25 晚的均值,每晚权重相同。 两个基线的准确率与平衡准确率。点为均值,横线为整晚 bootstrap 95% 区间。图中没有虚线:训练集先验是这个基线设定的下限,不是随机水平。
两个基线在相同的 25 晚上:各晚均值,附整晚 bootstrap 95% 区间。准确率特意与平衡准确率并排给出。
基线准确率平衡准确率宏平均 F1Cohen kappa 系数
训练集先验对每个数据帧都预测 N2 · 是下限,不是随机水平48.0%95% 区间 44.6%–51.4%20.2%95% 区间 20.0%–20.6%13.0%95% 区间 12.3%–13.8%0.00095% 区间 0.000–0.000
Spectral ridge标准化独热编码岭回归,alpha 为 1,基于 25 个相对频谱值72.3%95% 区间 67.8%–76.3%56.7%95% 区间 53.1%–60.0%53.3%95% 区间 49.0%–57.3%0.58495% 区间 0.526–0.636
+36.5 ppspectral ridge 减训练集先验,平衡准确率,相同的 25 晚(pp 为百分点)

明显高于先验设定的下限

配对区间 +32.9 至 +39.8 pp,两个基线在相同的夜晚上计算:区间不含零。准确率、宏平均 F1 与 kappa 的配对差值不发布;每个基线自身的数值见上表。

spectral ridge 的逐期结果:在该数值有定义的夜晚上取均值,附整晚 bootstrap 95% 区间。数据帧数:共识分期中该期的数量。短横线表示没有定义,绝不是零。
分期召回率精确率F1
清醒(Wake)3,037 个数据帧64.8%95% 区间 54.9%–73.9%76.4%95% 区间 70.1%–82.3%66.5%95% 区间 58.5%–73.8%
N11,505 个数据帧0.0%95% 区间 0.0%–0.0%从未预测,所以每个 N1 数据帧都被漏掉—没有定义:25 晚中没有一晚预测过 N10.0%95% 区间 0.0%–0.0%
N211,879 个数据帧85.4%95% 区间 77.4%–91.8%77.3%95% 区间 72.8%–81.8%78.9%95% 区间 74.0%–83.1%
N33,514 个数据帧59.4%95% 区间 46.8%–71.2%在 25 晚中的 24 晚有定义;1 晚的共识分期中没有 N369.7%95% 区间 55.7%–81.9%在 25 晚中的 24 晚有定义;1 晚从未预测 N356.2%95% 区间 43.6%–67.7%
REM4,727 个数据帧73.6%95% 区间 63.8%–82.6%63.8%95% 区间 55.4%–71.5%64.6%95% 区间 56.1%–72.2%

spectral ridge 在 25 晚中没有一晚预测过 N1。它的 N1 召回率和 F1 是实测的零;N1 精确率没有数值,因为精确率要除以被预测为 N1 的数据帧数,而这样的数据帧一个也没有。

第 2 项实验(共 2 项)· DOD-O

DOD-O:阻塞性睡眠呼吸暂停患者

记录于 Stanford Sleep Medicine Center, United States (clinical trial NCT03657329)。共 55 晚,每人一晚,53,161 个可用的 30 秒数据帧。队列内分为 5 折,在看到任何结果之前分配:每一折用其余 44 晚拟合的模型测试 11 晚,所以每一晚都恰好留出一次。

训练集先验 · 准确率
49.2% (46.3%–52.2%)
训练集先验 · 平衡准确率
20.5% (20.1%–21.2%)
Spectral ridge · 准确率
72.5% (69.7%–75.0%)
Spectral ridge · 平衡准确率
49.3% (47.3%–51.2%)
55 晚的均值,每晚权重相同。 两个基线的准确率与平衡准确率。点为均值,横线为整晚 bootstrap 95% 区间。图中没有虚线:训练集先验是这个基线设定的下限,不是随机水平。
两个基线在相同的 55 晚上:各晚均值,附整晚 bootstrap 95% 区间。准确率特意与平衡准确率并排给出。
基线准确率平衡准确率宏平均 F1Cohen kappa 系数
训练集先验对每个数据帧都预测 N2 · 是下限,不是随机水平49.2%95% 区间 46.3%–52.2%20.5%95% 区间 20.1%–21.2%13.3%95% 区间 12.8%–13.9%0.00095% 区间 0.000–0.000
Spectral ridge标准化独热编码岭回归,alpha 为 1,基于 25 个相对频谱值72.5%95% 区间 69.7%–75.0%49.3%95% 区间 47.3%–51.2%47.4%95% 区间 44.9%–49.7%0.54295% 区间 0.504–0.578
+28.8 ppspectral ridge 减训练集先验,平衡准确率,相同的 55 晚

明显高于先验设定的下限

配对区间 +26.7 至 +30.7 pp,两个基线在相同的夜晚上计算:区间不含零。准确率、宏平均 F1 与 kappa 的配对差值不发布;每个基线自身的数值见上表。

spectral ridge 的逐期结果:在该数值有定义的夜晚上取均值,附整晚 bootstrap 95% 区间。数据帧数:共识分期中该期的数量。短横线表示没有定义,绝不是零。
分期召回率精确率F1
清醒(Wake)10,427 个数据帧80.4%95% 区间 75.5%–85.1%76.5%95% 区间 72.0%–80.7%75.6%95% 区间 71.7%–79.3%
N12,860 个数据帧0.0%95% 区间 0.0%–0.0%从未预测,所以每个 N1 数据帧都被漏掉—没有定义:55 晚中没有一晚预测过 N10.0%95% 区间 0.0%–0.0%
N226,271 个数据帧92.8%95% 区间 90.5%–94.7%71.0%95% 区间 67.9%–74.0%79.8%95% 区间 77.3%–82.0%
N35,500 个数据帧22.1%95% 区间 15.4%–29.2%在 55 晚中的 52 晚有定义;3 晚的共识分期中没有 N363.4%95% 区间 52.4%–73.9%在 55 晚中的 49 晚有定义;6 晚从未预测 N327.9%95% 区间 20.3%–35.8%在 55 晚中的 53 晚有定义;2 晚的共识分期和预测中都没有 N3
REM8,103 个数据帧49.5%95% 区间 43.1%–55.9%在 55 晚中的 53 晚有定义;2 晚的共识分期中没有 REM68.2%95% 区间 60.9%–74.9%在 55 晚中的 54 晚有定义;1 晚从未预测 REM52.5%95% 区间 46.0%–58.7%在 55 晚中的 54 晚有定义;1 晚的共识分期和预测中都没有 REM

spectral ridge 在 55 晚中没有一晚预测过 N1。它的 N1 召回率和 F1 是实测的零;N1 精确率没有数值,因为精确率要除以被预测为 N1 的数据帧数,而这样的数据帧一个也没有。

队列与设计

评测了什么,怎么评测

两个 Dreem Open Datasets 队列,各自划分交叉验证折。下面每个计数都来自已审核的导出文件。

评测的夜晚

80

81 份存档记录,减去发布者声明没有共识分期的 1 份:DOD-H 25 份,DOD-O 55 份。

可用的 30 秒数据帧

77,823

共 77,901 帧,减去 3 帧未评分、75 帧通道幅值尺度为零或无效。

拟合的模型

20

两个队列 × 5 折 × 两个基线;没有一个失败。

标准

以发布者存储的共识睡眠图为标准,分为五期——清醒(Wake)、N1、N2、N3、REM——每帧 30 秒。没有还原各评分者的单独判读。

信号与特征

5 个 EEG 导联(C3-M2、F3-F4、F3-M2、F3-O1、F4-O2),采样率 250 Hz。每个数据帧、每个通道先除以自身的最大绝对值,再用 Welch 法估计频谱,得到 delta、theta、alpha、sigma 与 beta 频带功率在 0.5–30 Hz 总功率中所占份额的对数:每帧 25 个数值。

两个基线

训练集先验使用训练折中各期的频率,对每个数据帧都一样,所以处处预测 N2。spectral ridge 是在这 25 个数值上做的标准化独热编码岭回归,alpha 为 1。没有调参、没有用留出数据校准、没有过采样或类别平衡,也没有根据结果重跑;各期保持其自然比例。

交叉验证折

每个队列内部分为 5 折,在看到任何结果之前按每份记录的哈希分配。每一晚在每个基线下都测试一次,所用模型由同一队列其余 4 折拟合。

指标

先逐晚计算,再取均值,每晚权重相同,无论长短。平衡准确率是该晚出现过的各期召回率的均值;宏平均 F1 是该晚出现过或被模型预测过的各期 F1 的均值。对每个数据帧都给出同一个答案的先验,Cohen kappa 系数按定义为零。

不确定性

每个队列内部做逐点的整晚 bootstrap 95% 区间:10,000 次抽样(PCG64,种子 20261003),两个基线和所有指标共用同一组抽样。区间以固定的交叉验证预测为条件——不包括重新拟合和折分配带来的不确定性——也没有做多重比较校正。

暂缓 · 没有分数

神经网络与基础模型:暂缓

Dreem 队列上没有任何神经网络或基础模型的分数。存储的信号元数据写的是毫伏,发布者自己的转换程序却把同样的数组当作微伏。由于数据源的物理单位说法不一致,基础模型和其他对幅值敏感的编码器暂缓——不在猜测的单位上运行。上面两个基线在计算相对频谱之前,先把每个数据帧、每个通道除以一个正的增益,所以不依赖这个单位。这项暂缓并不说明那些模型会有多准确。

它在暂缓登记册中的一行 →

方法与局限

这两个基线能说明什么、不能说明什么

两个固定的经典 CPU 基线,两项独立实验。它们设定一个下限,并说明准确率掩盖了什么;它们不是排名,不是临床工具,也不是专家评分的模型。

两项独立实验,不是比较

DOD-H 与 DOD-O 各有自己的模型、交叉验证折和区间,而且在不同中心、用不同设备记录。它们的数字不是对健康状况的受控比较,这里也没有测量从一个队列到另一个队列的迁移。

不是临床,也不是诊断

标准是发布者存储的共识分期,而不是还原的各评分者判读。这里没有任何内容是诊断或临床工具,也不能证明与人类专家相当。

物理单位尚未确定

存储的元数据写的是毫伏,上游转换程序却把数组当作微伏。把每个数据帧、每个通道除以一个正的增益,能让相对频谱不受这个尺度影响,但不能说明校准、参考、削波或滤波是否等价。

概率未经校准

spectral ridge 的输出不是经过校准的概率:这里不做校准、置信度或拒识方面的任何声明,也不发布任何概率评分。

是下限,不是随机水平

平衡准确率只对一晚中出现过的分期取平均。先验处处预测 N2,所以在缺少五期中某一期的夜晚,它的平衡准确率是四分之一而不是五分之一;这就是它略高于五分之一的原因。不要把它当作随机水平线。

不能与其他论文比较

自然的分期比例,没有类别平衡或调参,特定的 5 个导联和这些交叉验证折。不要把这些数字与使用其他通道、队列、预处理或数据划分的论文相比。

Dreem Open Datasets (DOD-H and DOD-O)

Antoine Guillot, Fabien Sauvet, Emmanuel H. During and Valentin Thorey · Dreem Open Datasets: Multi-Scored Sleep Datasets to Compare Human and Automated Sleep Staging, IEEE Transactions on Neural Systems and Rehabilitation Engineering (2020), doi:10.1109/TNSRE.2020.3011181; preprint arXiv:1911.03221. Data: Dreem Open Datasets, Zenodo, doi:10.5281/zenodo.15900394. Official repository: github.com/Dreem-Organization/dreem-learning-open, revision 8b332d6827f5ae6a22f4bb97b4deef4273238ec3.

存档许可:MIT,依据 Zenodo 记录上的声明。这里记录的是存档自身的声明,不是对今后一切用途的表态;BCI Report 不转发任何上游代码或数据。

论文 ↗ · 预印本 ↗ · Zenodo 存档 ↗ · 官方代码仓库(固定版本)↗ · MIT

同意书与伦理,逐个队列

DOD-H · 伦理批准:经人身保护委员会(Committees of Protection of Persons,CPP)批准;已向法国国家药品与健康产品安全局申报;遵循法国《数据保护法》、ICH 标准与《赫尔辛基宣言》(1964 年,2013 年修订)进行。Approved by the Committees of Protection of Persons (CPP); declared to the French National Agency for Medicines and Health Products Safety; carried out in compliance with the French Data Protection Act, International Conference on Harmonization (ICH) standards and the Declaration of Helsinki (1964, as revised in 2013). 知情同意:未说明。论文对 DOD-H 的描述中没有知情同意的句子。The paper's DOD-H description contains no informed-consent sentence.

DOD-O · 伦理批准:未说明。论文没有为 DOD-O 写明任何伦理委员会或机构审查委员会。No ethics committee or institutional review board is named for DOD-O in the paper. 知情同意:所有试验被试在参加前都给出了书面知情同意。All trial participants gave informed written consent before taking part.

两个队列各按其现有声明发布:一个有伦理批准、没有同意书的句子,另一个有书面同意、没有写明伦理委员会。这些声明的出处:arXiv:1911.03221v4 (27 April 2020), II. Materials and Methods, A. Datasets, read 2026-10-03。

数据来源: large-source-update.json · schema bci-report-large-source-update-v1 · 生成于 2026-10-03。

引用本页

BCI Report. 为什么睡眠分期器大多数时候判对,却仍会漏掉整类睡眠阶段?[EB/OL]. (2026-10-03). https://bci.report/zh/topics/sleep-staging/

数字来自发布 large-source-update-20261003(2026-10-03)。也请同时引用上游数据集:署名就在本页。

每个发布版本都在 Zenodo 存档:doi:10.5281/zenodo.23123296。 本站及各次发布的 BibTeX → · CITATION.cff ↗(英文)