评测的夜晚
81 份存档记录,减去发布者声明没有共识分期的 1 份:DOD-H 25 份,DOD-O 55 份。
睡眠分期 · 两个简单基线 · 两个独立队列
以发布者存储的共识睡眠图为标准,对 30 秒数据帧做五期睡眠分期;两个 Dreem 队列在不同中心、用不同设备记录。每个队列是一项独立实验,有自己的模型、交叉验证折和区间;本页不对两者做任何比较。两个刻意简单的 CPU 基线,说明普通准确率掩盖了什么。
测量所用数据集:Dreem Open Datasets (DOD-H and DOD-O)
因为准确率按数据帧计数,而各睡眠分期的数据帧数相差悬殊:分期器整类漏掉某一期,准确率也降不了多少。以发布者的共识分期为标准,在两个作为独立实验分别分析的 Dreem 队列上——25 名健康被试和 55 名阻塞性睡眠呼吸暂停患者——一个简单的 spectral ridge 在前者的准确率为 72.3%,平衡准确率却只有 56.7%;在后者准确率为 72.5%,平衡准确率只有 49.3%;它在两个队列中都从未预测过 N1。一个总是回答最常见一期 N2 的先验,准确率已有 48.0% 和 49.2%,平衡准确率却只有 20.2% 和 20.5%:这是一个下限,不是随机水平。
第 1 项实验(共 2 项)· DOD-H
记录于 French Armed Forces Biomedical Research Institute (IRBA), Fatigue and Vigilance Unit, Brétigny-sur-Orge, France。共 25 晚,每人一晚,24,662 个可用的 30 秒数据帧。队列内分为 5 折,在看到任何结果之前分配:每一折用其余 20 晚拟合的模型测试 5 晚,所以每一晚都恰好留出一次。
| 基线 | 准确率 | 平衡准确率 | 宏平均 F1 | Cohen kappa 系数 |
|---|---|---|---|---|
| 训练集先验对每个数据帧都预测 N2 · 是下限,不是随机水平 | 48.0%95% 区间 44.6%–51.4% | 20.2%95% 区间 20.0%–20.6% | 13.0%95% 区间 12.3%–13.8% | 0.00095% 区间 0.000–0.000 |
| Spectral ridge标准化独热编码岭回归,alpha 为 1,基于 25 个相对频谱值 | 72.3%95% 区间 67.8%–76.3% | 56.7%95% 区间 53.1%–60.0% | 53.3%95% 区间 49.0%–57.3% | 0.58495% 区间 0.526–0.636 |
配对区间 +32.9 至 +39.8 pp,两个基线在相同的夜晚上计算:区间不含零。准确率、宏平均 F1 与 kappa 的配对差值不发布;每个基线自身的数值见上表。
| 分期 | 召回率 | 精确率 | F1 |
|---|---|---|---|
| 清醒(Wake)3,037 个数据帧 | 64.8%95% 区间 54.9%–73.9% | 76.4%95% 区间 70.1%–82.3% | 66.5%95% 区间 58.5%–73.8% |
| N11,505 个数据帧 | 0.0%95% 区间 0.0%–0.0%从未预测,所以每个 N1 数据帧都被漏掉 | —没有定义:25 晚中没有一晚预测过 N1 | 0.0%95% 区间 0.0%–0.0% |
| N211,879 个数据帧 | 85.4%95% 区间 77.4%–91.8% | 77.3%95% 区间 72.8%–81.8% | 78.9%95% 区间 74.0%–83.1% |
| N33,514 个数据帧 | 59.4%95% 区间 46.8%–71.2%在 25 晚中的 24 晚有定义;1 晚的共识分期中没有 N3 | 69.7%95% 区间 55.7%–81.9%在 25 晚中的 24 晚有定义;1 晚从未预测 N3 | 56.2%95% 区间 43.6%–67.7% |
| REM4,727 个数据帧 | 73.6%95% 区间 63.8%–82.6% | 63.8%95% 区间 55.4%–71.5% | 64.6%95% 区间 56.1%–72.2% |
spectral ridge 在 25 晚中没有一晚预测过 N1。它的 N1 召回率和 F1 是实测的零;N1 精确率没有数值,因为精确率要除以被预测为 N1 的数据帧数,而这样的数据帧一个也没有。
第 2 项实验(共 2 项)· DOD-O
记录于 Stanford Sleep Medicine Center, United States (clinical trial NCT03657329)。共 55 晚,每人一晚,53,161 个可用的 30 秒数据帧。队列内分为 5 折,在看到任何结果之前分配:每一折用其余 44 晚拟合的模型测试 11 晚,所以每一晚都恰好留出一次。
| 基线 | 准确率 | 平衡准确率 | 宏平均 F1 | Cohen kappa 系数 |
|---|---|---|---|---|
| 训练集先验对每个数据帧都预测 N2 · 是下限,不是随机水平 | 49.2%95% 区间 46.3%–52.2% | 20.5%95% 区间 20.1%–21.2% | 13.3%95% 区间 12.8%–13.9% | 0.00095% 区间 0.000–0.000 |
| Spectral ridge标准化独热编码岭回归,alpha 为 1,基于 25 个相对频谱值 | 72.5%95% 区间 69.7%–75.0% | 49.3%95% 区间 47.3%–51.2% | 47.4%95% 区间 44.9%–49.7% | 0.54295% 区间 0.504–0.578 |
配对区间 +26.7 至 +30.7 pp,两个基线在相同的夜晚上计算:区间不含零。准确率、宏平均 F1 与 kappa 的配对差值不发布;每个基线自身的数值见上表。
| 分期 | 召回率 | 精确率 | F1 |
|---|---|---|---|
| 清醒(Wake)10,427 个数据帧 | 80.4%95% 区间 75.5%–85.1% | 76.5%95% 区间 72.0%–80.7% | 75.6%95% 区间 71.7%–79.3% |
| N12,860 个数据帧 | 0.0%95% 区间 0.0%–0.0%从未预测,所以每个 N1 数据帧都被漏掉 | —没有定义:55 晚中没有一晚预测过 N1 | 0.0%95% 区间 0.0%–0.0% |
| N226,271 个数据帧 | 92.8%95% 区间 90.5%–94.7% | 71.0%95% 区间 67.9%–74.0% | 79.8%95% 区间 77.3%–82.0% |
| N35,500 个数据帧 | 22.1%95% 区间 15.4%–29.2%在 55 晚中的 52 晚有定义;3 晚的共识分期中没有 N3 | 63.4%95% 区间 52.4%–73.9%在 55 晚中的 49 晚有定义;6 晚从未预测 N3 | 27.9%95% 区间 20.3%–35.8%在 55 晚中的 53 晚有定义;2 晚的共识分期和预测中都没有 N3 |
| REM8,103 个数据帧 | 49.5%95% 区间 43.1%–55.9%在 55 晚中的 53 晚有定义;2 晚的共识分期中没有 REM | 68.2%95% 区间 60.9%–74.9%在 55 晚中的 54 晚有定义;1 晚从未预测 REM | 52.5%95% 区间 46.0%–58.7%在 55 晚中的 54 晚有定义;1 晚的共识分期和预测中都没有 REM |
spectral ridge 在 55 晚中没有一晚预测过 N1。它的 N1 召回率和 F1 是实测的零;N1 精确率没有数值,因为精确率要除以被预测为 N1 的数据帧数,而这样的数据帧一个也没有。
队列与设计
两个 Dreem Open Datasets 队列,各自划分交叉验证折。下面每个计数都来自已审核的导出文件。
评测的夜晚
81 份存档记录,减去发布者声明没有共识分期的 1 份:DOD-H 25 份,DOD-O 55 份。
可用的 30 秒数据帧
共 77,901 帧,减去 3 帧未评分、75 帧通道幅值尺度为零或无效。
拟合的模型
两个队列 × 5 折 × 两个基线;没有一个失败。
以发布者存储的共识睡眠图为标准,分为五期——清醒(Wake)、N1、N2、N3、REM——每帧 30 秒。没有还原各评分者的单独判读。
5 个 EEG 导联(C3-M2、F3-F4、F3-M2、F3-O1、F4-O2),采样率 250 Hz。每个数据帧、每个通道先除以自身的最大绝对值,再用 Welch 法估计频谱,得到 delta、theta、alpha、sigma 与 beta 频带功率在 0.5–30 Hz 总功率中所占份额的对数:每帧 25 个数值。
训练集先验使用训练折中各期的频率,对每个数据帧都一样,所以处处预测 N2。spectral ridge 是在这 25 个数值上做的标准化独热编码岭回归,alpha 为 1。没有调参、没有用留出数据校准、没有过采样或类别平衡,也没有根据结果重跑;各期保持其自然比例。
每个队列内部分为 5 折,在看到任何结果之前按每份记录的哈希分配。每一晚在每个基线下都测试一次,所用模型由同一队列其余 4 折拟合。
先逐晚计算,再取均值,每晚权重相同,无论长短。平衡准确率是该晚出现过的各期召回率的均值;宏平均 F1 是该晚出现过或被模型预测过的各期 F1 的均值。对每个数据帧都给出同一个答案的先验,Cohen kappa 系数按定义为零。
每个队列内部做逐点的整晚 bootstrap 95% 区间:10,000 次抽样(PCG64,种子 20261003),两个基线和所有指标共用同一组抽样。区间以固定的交叉验证预测为条件——不包括重新拟合和折分配带来的不确定性——也没有做多重比较校正。
暂缓 · 没有分数
Dreem 队列上没有任何神经网络或基础模型的分数。存储的信号元数据写的是毫伏,发布者自己的转换程序却把同样的数组当作微伏。由于数据源的物理单位说法不一致,基础模型和其他对幅值敏感的编码器暂缓——不在猜测的单位上运行。上面两个基线在计算相对频谱之前,先把每个数据帧、每个通道除以一个正的增益,所以不依赖这个单位。这项暂缓并不说明那些模型会有多准确。
方法与局限
两个固定的经典 CPU 基线,两项独立实验。它们设定一个下限,并说明准确率掩盖了什么;它们不是排名,不是临床工具,也不是专家评分的模型。
DOD-H 与 DOD-O 各有自己的模型、交叉验证折和区间,而且在不同中心、用不同设备记录。它们的数字不是对健康状况的受控比较,这里也没有测量从一个队列到另一个队列的迁移。
标准是发布者存储的共识分期,而不是还原的各评分者判读。这里没有任何内容是诊断或临床工具,也不能证明与人类专家相当。
存储的元数据写的是毫伏,上游转换程序却把数组当作微伏。把每个数据帧、每个通道除以一个正的增益,能让相对频谱不受这个尺度影响,但不能说明校准、参考、削波或滤波是否等价。
spectral ridge 的输出不是经过校准的概率:这里不做校准、置信度或拒识方面的任何声明,也不发布任何概率评分。
平衡准确率只对一晚中出现过的分期取平均。先验处处预测 N2,所以在缺少五期中某一期的夜晚,它的平衡准确率是四分之一而不是五分之一;这就是它略高于五分之一的原因。不要把它当作随机水平线。
自然的分期比例,没有类别平衡或调参,特定的 5 个导联和这些交叉验证折。不要把这些数字与使用其他通道、队列、预处理或数据划分的论文相比。
Antoine Guillot, Fabien Sauvet, Emmanuel H. During and Valentin Thorey · Dreem Open Datasets: Multi-Scored Sleep Datasets to Compare Human and Automated Sleep Staging, IEEE Transactions on Neural Systems and Rehabilitation Engineering (2020), doi:10.1109/TNSRE.2020.3011181; preprint arXiv:1911.03221. Data: Dreem Open Datasets, Zenodo, doi:10.5281/zenodo.15900394. Official repository: github.com/Dreem-Organization/dreem-learning-open, revision 8b332d6827f5ae6a22f4bb97b4deef4273238ec3.
存档许可:MIT,依据 Zenodo 记录上的声明。这里记录的是存档自身的声明,不是对今后一切用途的表态;BCI Report 不转发任何上游代码或数据。
论文 ↗ · 预印本 ↗ · Zenodo 存档 ↗ · 官方代码仓库(固定版本)↗ · MIT
DOD-H · 伦理批准:经人身保护委员会(Committees of Protection of Persons,CPP)批准;已向法国国家药品与健康产品安全局申报;遵循法国《数据保护法》、ICH 标准与《赫尔辛基宣言》(1964 年,2013 年修订)进行。Approved by the Committees of Protection of Persons (CPP); declared to the French National Agency for Medicines and Health Products Safety; carried out in compliance with the French Data Protection Act, International Conference on Harmonization (ICH) standards and the Declaration of Helsinki (1964, as revised in 2013). 知情同意:未说明。论文对 DOD-H 的描述中没有知情同意的句子。The paper's DOD-H description contains no informed-consent sentence.
DOD-O · 伦理批准:未说明。论文没有为 DOD-O 写明任何伦理委员会或机构审查委员会。No ethics committee or institutional review board is named for DOD-O in the paper. 知情同意:所有试验被试在参加前都给出了书面知情同意。All trial participants gave informed written consent before taking part.
两个队列各按其现有声明发布:一个有伦理批准、没有同意书的句子,另一个有书面同意、没有写明伦理委员会。这些声明的出处:arXiv:1911.03221v4 (27 April 2020), II. Materials and Methods, A. Datasets, read 2026-10-03。
数据来源: large-source-update.json · schema bci-report-large-source-update-v1 · 生成于 2026-10-03。
BCI Report. 为什么睡眠分期器大多数时候判对,却仍会漏掉整类睡眠阶段?[EB/OL]. (2026-10-03). https://bci.report/zh/topics/sleep-staging/
数字来自发布 large-source-update-20261003(2026-10-03)。也请同时引用上游数据集:署名就在本页。
每个发布版本都在 Zenodo 存档:doi:10.5281/zenodo.23123296。 本站及各次发布的 BibTeX → · CITATION.cff ↗(英文)