# 为什么睡眠分期器大多数时候判对，却仍会漏掉整类睡眠阶段？

睡眠分期 · 两个简单基线 · 两个独立队列

以发布者存储的共识睡眠图为标准，对 30 秒数据帧做五期睡眠分期；两个 Dreem 队列在不同中心、用不同设备记录。每个队列是一项独立实验，有自己的模型、交叉验证折和区间；本页不对两者做任何比较。两个刻意简单的 CPU 基线，说明普通准确率掩盖了什么。

- [已审核的聚合 JSON ↓](https://bci.report/data/large-source-update.json)
- 

测量所用数据集： [Dreem Open Datasets (DOD-H and DOD-O)](https://bci.report/zh/datasets/dreem-dod/)

## 简答

因为准确率按数据帧计数，而各睡眠分期的数据帧数相差悬殊：分期器整类漏掉某一期，准确率也降不了多少。以发布者的共识分期为标准，在两个作为独立实验分别分析的 Dreem 队列上——**25** 名健康被试和 **55** 名阻塞性睡眠呼吸暂停患者——一个简单的 spectral ridge 在前者的准确率为 **72.3%**，平衡准确率却只有 **56.7%**；在后者准确率为 **72.5%**，平衡准确率只有 **49.3%**；它在两个队列中都从未预测过 N1。一个总是回答最常见一期 N2 的先验，准确率已有 **48.0%** 和 **49.2%**，平衡准确率却只有 **20.2%** 和 **20.5%**：这是一个下限，不是随机水平。

第 1 项实验（共 2 项）· DOD-H

## DOD-H：健康被试

记录于 French Armed Forces Biomedical Research Institute (IRBA), Fatigue and Vigilance Unit, Brétigny-sur-Orge, France。共 25 晚，每人一晚，24,662 个可用的 30 秒数据帧。队列内分为 5 折，在看到任何结果之前分配：每一折用其余 20 晚拟合的模型测试 5 晚，所以每一晚都恰好留出一次。

**25 晚的均值，每晚权重相同。** 两个基线的准确率与平衡准确率。点为均值，横线为整晚 bootstrap 95% 区间。图中没有虚线：训练集先验是这个基线设定的下限，不是随机水平。

- 训练集先验 · 准确率: 48.0% (44.6%–51.4%)
- 训练集先验 · 平衡准确率: 20.2% (20.0%–20.6%)
- Spectral ridge · 准确率: 72.3% (67.8%–76.3%)
- Spectral ridge · 平衡准确率: 56.7% (53.1%–60.0%)

两个基线在相同的 25 晚上：各晚均值，附整晚 bootstrap 95% 区间。准确率特意与平衡准确率并排给出。

| 基线 | 准确率 | 平衡准确率 | 宏平均 F1 | Cohen kappa 系数 |
| --- | --- | --- | --- | --- |
| 训练集先验 — 对每个数据帧都预测 N2 · 是下限，不是随机水平 | 48.0% (95% 区间 44.6%–51.4%) | 20.2% (95% 区间 20.0%–20.6%) | 13.0% (95% 区间 12.3%–13.8%) | 0.000 (95% 区间 0.000–0.000) |
| Spectral ridge — 标准化独热编码岭回归，alpha 为 1，基于 25 个相对频谱值 | 72.3% (95% 区间 67.8%–76.3%) | 56.7% (95% 区间 53.1%–60.0%) | 53.3% (95% 区间 49.0%–57.3%) | 0.584 (95% 区间 0.526–0.636) |

**+36.5 pp** spectral ridge 减训练集先验，平衡准确率，相同的 25 晚（pp 为百分点）

### 明显高于先验设定的下限

配对区间 +32.9 至 +39.8 pp，两个基线在相同的夜晚上计算：区间不含零。准确率、宏平均 F1 与 kappa 的配对差值不发布；每个基线自身的数值见上表。

spectral ridge 的逐期结果：在该数值有定义的夜晚上取均值，附整晚 bootstrap 95% 区间。数据帧数：共识分期中该期的数量。短横线表示没有定义，绝不是零。

| 分期 | 召回率 | 精确率 | F1 |
| --- | --- | --- | --- |
| 清醒（Wake） — 3,037 个数据帧 | 64.8% (95% 区间 54.9%–73.9%) | 76.4% (95% 区间 70.1%–82.3%) | 66.5% (95% 区间 58.5%–73.8%) |
| N1 — 1,505 个数据帧 | 0.0% (95% 区间 0.0%–0.0%) (从未预测，所以每个 N1 数据帧都被漏掉) | — (没有定义：25 晚中没有一晚预测过 N1) | 0.0% (95% 区间 0.0%–0.0%) |
| N2 — 11,879 个数据帧 | 85.4% (95% 区间 77.4%–91.8%) | 77.3% (95% 区间 72.8%–81.8%) | 78.9% (95% 区间 74.0%–83.1%) |
| N3 — 3,514 个数据帧 | 59.4% (95% 区间 46.8%–71.2%) (在 25 晚中的 24 晚有定义；1 晚的共识分期中没有 N3) | 69.7% (95% 区间 55.7%–81.9%) (在 25 晚中的 24 晚有定义；1 晚从未预测 N3) | 56.2% (95% 区间 43.6%–67.7%) |
| REM — 4,727 个数据帧 | 73.6% (95% 区间 63.8%–82.6%) | 63.8% (95% 区间 55.4%–71.5%) | 64.6% (95% 区间 56.1%–72.2%) |

spectral ridge 在 25 晚中没有一晚预测过 N1。它的 N1 召回率和 F1 是实测的零；N1 精确率没有数值，因为精确率要除以被预测为 N1 的数据帧数，而这样的数据帧一个也没有。

第 2 项实验（共 2 项）· DOD-O

## DOD-O：阻塞性睡眠呼吸暂停患者

记录于 Stanford Sleep Medicine Center, United States (clinical trial NCT03657329)。共 55 晚，每人一晚，53,161 个可用的 30 秒数据帧。队列内分为 5 折，在看到任何结果之前分配：每一折用其余 44 晚拟合的模型测试 11 晚，所以每一晚都恰好留出一次。

**55 晚的均值，每晚权重相同。** 两个基线的准确率与平衡准确率。点为均值，横线为整晚 bootstrap 95% 区间。图中没有虚线：训练集先验是这个基线设定的下限，不是随机水平。

- 训练集先验 · 准确率: 49.2% (46.3%–52.2%)
- 训练集先验 · 平衡准确率: 20.5% (20.1%–21.2%)
- Spectral ridge · 准确率: 72.5% (69.7%–75.0%)
- Spectral ridge · 平衡准确率: 49.3% (47.3%–51.2%)

两个基线在相同的 55 晚上：各晚均值，附整晚 bootstrap 95% 区间。准确率特意与平衡准确率并排给出。

| 基线 | 准确率 | 平衡准确率 | 宏平均 F1 | Cohen kappa 系数 |
| --- | --- | --- | --- | --- |
| 训练集先验 — 对每个数据帧都预测 N2 · 是下限，不是随机水平 | 49.2% (95% 区间 46.3%–52.2%) | 20.5% (95% 区间 20.1%–21.2%) | 13.3% (95% 区间 12.8%–13.9%) | 0.000 (95% 区间 0.000–0.000) |
| Spectral ridge — 标准化独热编码岭回归，alpha 为 1，基于 25 个相对频谱值 | 72.5% (95% 区间 69.7%–75.0%) | 49.3% (95% 区间 47.3%–51.2%) | 47.4% (95% 区间 44.9%–49.7%) | 0.542 (95% 区间 0.504–0.578) |

**+28.8 pp** spectral ridge 减训练集先验，平衡准确率，相同的 55 晚

### 明显高于先验设定的下限

配对区间 +26.7 至 +30.7 pp，两个基线在相同的夜晚上计算：区间不含零。准确率、宏平均 F1 与 kappa 的配对差值不发布；每个基线自身的数值见上表。

spectral ridge 的逐期结果：在该数值有定义的夜晚上取均值，附整晚 bootstrap 95% 区间。数据帧数：共识分期中该期的数量。短横线表示没有定义，绝不是零。

| 分期 | 召回率 | 精确率 | F1 |
| --- | --- | --- | --- |
| 清醒（Wake） — 10,427 个数据帧 | 80.4% (95% 区间 75.5%–85.1%) | 76.5% (95% 区间 72.0%–80.7%) | 75.6% (95% 区间 71.7%–79.3%) |
| N1 — 2,860 个数据帧 | 0.0% (95% 区间 0.0%–0.0%) (从未预测，所以每个 N1 数据帧都被漏掉) | — (没有定义：55 晚中没有一晚预测过 N1) | 0.0% (95% 区间 0.0%–0.0%) |
| N2 — 26,271 个数据帧 | 92.8% (95% 区间 90.5%–94.7%) | 71.0% (95% 区间 67.9%–74.0%) | 79.8% (95% 区间 77.3%–82.0%) |
| N3 — 5,500 个数据帧 | 22.1% (95% 区间 15.4%–29.2%) (在 55 晚中的 52 晚有定义；3 晚的共识分期中没有 N3) | 63.4% (95% 区间 52.4%–73.9%) (在 55 晚中的 49 晚有定义；6 晚从未预测 N3) | 27.9% (95% 区间 20.3%–35.8%) (在 55 晚中的 53 晚有定义；2 晚的共识分期和预测中都没有 N3) |
| REM — 8,103 个数据帧 | 49.5% (95% 区间 43.1%–55.9%) (在 55 晚中的 53 晚有定义；2 晚的共识分期中没有 REM) | 68.2% (95% 区间 60.9%–74.9%) (在 55 晚中的 54 晚有定义；1 晚从未预测 REM) | 52.5% (95% 区间 46.0%–58.7%) (在 55 晚中的 54 晚有定义；1 晚的共识分期和预测中都没有 REM) |

spectral ridge 在 55 晚中没有一晚预测过 N1。它的 N1 召回率和 F1 是实测的零；N1 精确率没有数值，因为精确率要除以被预测为 N1 的数据帧数，而这样的数据帧一个也没有。

队列与设计

## 评测了什么，怎么评测

两个 Dreem Open Datasets 队列，各自划分交叉验证折。下面每个计数都来自已审核的导出文件。

评测的夜晚

80

81 份存档记录，减去发布者声明没有共识分期的 1 份：DOD-H 25 份，DOD-O 55 份。

可用的 30 秒数据帧

77,823

共 77,901 帧，减去 3 帧未评分、75 帧通道幅值尺度为零或无效。

拟合的模型

20

两个队列 × 5 折 × 两个基线；没有一个失败。

### 标准

以发布者存储的共识睡眠图为标准，分为五期——清醒（Wake）、N1、N2、N3、REM——每帧 30 秒。没有还原各评分者的单独判读。

### 信号与特征

5 个 EEG 导联（C3-M2、F3-F4、F3-M2、F3-O1、F4-O2），采样率 250 Hz。每个数据帧、每个通道先除以自身的最大绝对值，再用 Welch 法估计频谱，得到 delta、theta、alpha、sigma 与 beta 频带功率在 0.5–30 Hz 总功率中所占份额的对数：每帧 25 个数值。

### 两个基线

训练集先验使用训练折中各期的频率，对每个数据帧都一样，所以处处预测 N2。spectral ridge 是在这 25 个数值上做的标准化独热编码岭回归，alpha 为 1。没有调参、没有用留出数据校准、没有过采样或类别平衡，也没有根据结果重跑；各期保持其自然比例。

### 交叉验证折

每个队列内部分为 5 折，在看到任何结果之前按每份记录的哈希分配。每一晚在每个基线下都测试一次，所用模型由同一队列其余 4 折拟合。

### 指标

先逐晚计算，再取均值，每晚权重相同，无论长短。平衡准确率是该晚出现过的各期召回率的均值；宏平均 F1 是该晚出现过或被模型预测过的各期 F1 的均值。对每个数据帧都给出同一个答案的先验，Cohen kappa 系数按定义为零。

### 不确定性

每个队列内部做逐点的整晚 bootstrap 95% 区间：10,000 次抽样（PCG64，种子 20261003），两个基线和所有指标共用同一组抽样。区间以固定的交叉验证预测为条件——不包括重新拟合和折分配带来的不确定性——也没有做多重比较校正。

暂缓 · 没有分数

## 神经网络与基础模型：暂缓

Dreem 队列上没有任何神经网络或基础模型的分数。存储的信号元数据写的是毫伏，发布者自己的转换程序却把同样的数组当作微伏。由于数据源的物理单位说法不一致，基础模型和其他对幅值敏感的编码器暂缓——不在猜测的单位上运行。上面两个基线在计算相对频谱之前，先把每个数据帧、每个通道除以一个正的增益，所以不依赖这个单位。这项暂缓并不说明那些模型会有多准确。

[它在暂缓登记册中的一行 →](https://bci.report/zh/releases/#hold-dreem-amplitude-sensitive-models)

方法与局限

## 这两个基线能说明什么、不能说明什么

两个固定的经典 CPU 基线，两项独立实验。它们设定一个下限，并说明准确率掩盖了什么；它们不是排名，不是临床工具，也不是专家评分的模型。

### 两项独立实验，不是比较

DOD-H 与 DOD-O 各有自己的模型、交叉验证折和区间，而且在不同中心、用不同设备记录。它们的数字不是对健康状况的受控比较，这里也没有测量从一个队列到另一个队列的迁移。

### 不是临床，也不是诊断

标准是发布者存储的共识分期，而不是还原的各评分者判读。这里没有任何内容是诊断或临床工具，也不能证明与人类专家相当。

### 物理单位尚未确定

存储的元数据写的是毫伏，上游转换程序却把数组当作微伏。把每个数据帧、每个通道除以一个正的增益，能让相对频谱不受这个尺度影响，但不能说明校准、参考、削波或滤波是否等价。

### 概率未经校准

spectral ridge 的输出不是经过校准的概率：这里不做校准、置信度或拒识方面的任何声明，也不发布任何概率评分。

### 是下限，不是随机水平

平衡准确率只对一晚中出现过的分期取平均。先验处处预测 N2，所以在缺少五期中某一期的夜晚，它的平衡准确率是四分之一而不是五分之一；这就是它略高于五分之一的原因。不要把它当作随机水平线。

### 不能与其他论文比较

自然的分期比例，没有类别平衡或调参，特定的 5 个导联和这些交叉验证折。不要把这些数字与使用其他通道、队列、预处理或数据划分的论文相比。

### Dreem Open Datasets (DOD-H and DOD-O)

Antoine Guillot, Fabien Sauvet, Emmanuel H. During and Valentin Thorey · Dreem Open Datasets: Multi-Scored Sleep Datasets to Compare Human and Automated Sleep Staging, IEEE Transactions on Neural Systems and Rehabilitation Engineering (2020), doi:10.1109/TNSRE.2020.3011181; preprint arXiv:1911.03221. Data: Dreem Open Datasets, Zenodo, doi:10.5281/zenodo.15900394. Official repository: github.com/Dreem-Organization/dreem-learning-open, revision 8b332d6827f5ae6a22f4bb97b4deef4273238ec3.

存档许可：MIT，依据 Zenodo 记录上的声明。这里记录的是存档自身的声明，不是对今后一切用途的表态；BCI Report 不转发任何上游代码或数据。

[论文 ↗](https://doi.org/10.1109/TNSRE.2020.3011181) · [预印本 ↗](https://arxiv.org/abs/1911.03221) · [Zenodo 存档 ↗](https://zenodo.org/records/15900394) · [官方代码仓库（固定版本）↗](https://github.com/Dreem-Organization/dreem-learning-open/tree/8b332d6827f5ae6a22f4bb97b4deef4273238ec3) · [MIT](https://opensource.org/licenses/MIT)

### 同意书与伦理，逐个队列

**DOD-H** · 伦理批准：经人身保护委员会（Committees of Protection of Persons，CPP）批准；已向法国国家药品与健康产品安全局申报；遵循法国《数据保护法》、ICH 标准与《赫尔辛基宣言》（1964 年，2013 年修订）进行。Approved by the Committees of Protection of Persons (CPP); declared to the French National Agency for Medicines and Health Products Safety; carried out in compliance with the French Data Protection Act, International Conference on Harmonization (ICH) standards and the Declaration of Helsinki (1964, as revised in 2013). 知情同意：未说明。论文对 DOD-H 的描述中没有知情同意的句子。The paper's DOD-H description contains no informed-consent sentence.

**DOD-O** · 伦理批准：未说明。论文没有为 DOD-O 写明任何伦理委员会或机构审查委员会。No ethics committee or institutional review board is named for DOD-O in the paper. 知情同意：所有试验被试在参加前都给出了书面知情同意。All trial participants gave informed written consent before taking part.

两个队列各按其现有声明发布：一个有伦理批准、没有同意书的句子，另一个有书面同意、没有写明伦理委员会。这些声明的出处：arXiv:1911.03221v4 (27 April 2020), II. Materials and Methods, A. Datasets, read 2026-10-03。

数据来源： [large-source-update.json](https://bci.report/data/large-source-update.json) · schema bci-report-large-source-update-v1 · 生成于 2026-10-03。

继续探索

迁移

- [— 传感器迁移 **干电极与湿电极**](https://bci.report/zh/topics/dry-vs-wet/)
- [— 场景迁移 **从屏幕到 VR**](https://bci.report/zh/topics/screen-to-vr/)
- [— 电极布局 **更少的电极**](https://bci.report/zh/topics/fewer-electrodes/)
- [— 运动鲁棒性 **移动中的解码**](https://bci.report/zh/topics/on-the-move/)

调整模型

- [— 校准预算 **需要多少校准？**](https://bci.report/zh/topics/calibration-budget/)
- [— 模型适配 **该更新哪一部分？**](https://bci.report/zh/topics/model-adaptation/)
- [— 表征对照 **预训练有用吗？**](https://bci.report/zh/topics/does-pretraining-help/)

可靠性与临床

- [— 拒识 · Jev-style **何时不该执行**](https://bci.report/zh/topics/when-not-to-act/)
- [— 睡眠分期 · 简单基线 **睡眠分期的失衡**](https://bci.report/zh/topics/sleep-staging/)
- [— 临床研究 **临床分组**](https://bci.report/zh/topics/clinical-groups/)

[全部问题，以及哪些迁移已经测量过的地图 →](https://bci.report/zh/topics/)

## 引用本页

BCI Report. *为什么睡眠分期器大多数时候判对，却仍会漏掉整类睡眠阶段？*[EB/OL]. (2026-10-03). https://bci.report/zh/topics/sleep-staging/

数字来自发布 [`large-source-update-20261003`](https://bci.report/zh/releases/#large-source-update-20261003)（2026-10-03）。也请同时引用上游数据集：署名就在本页。

每个发布版本都在 Zenodo 存档：[doi:10.5281/zenodo.23123296](https://doi.org/10.5281/zenodo.23123296)。 [本站及各次发布的 BibTeX →](https://bci.report/zh/api/#cite-heading) · [CITATION.cff ↗](https://raw.githubusercontent.com/twu3202/bci-report/main/CITATION.cff)（英文）

---
本文是 https://bci.report/zh/topics/sleep-staging/ 的 Markdown 版本，由已发布的网页生成。数字均为聚合结果；使用条款见 https://bci.report/data-use/（英文）。
