BioRender Graphing每次创建图表时都会自动检测数据集中的异常值——无需手动设置。本文介绍异常值检测的工作原理、如何解读结果,以及如何调整灵敏度或排除数据点。
异常值检测的工作原理
BioRender使用 ROUT 方法(稳健回归与异常值移除)进行异常值检测。要了解更多信息,请参阅本文。ROUT 将稳健非线性回归与错误发现率(FDR)框架相结合,用于识别不太可能与组内其他数据点属于同一总体的数据点。
与 Grubbs 检验等简单方法不同,ROUT 专为同时处理多个异常值而设计。它不假设数据服从完全正态分布,也不容易因一个异常值的存在而掩盖另一个异常值——这是一种常见的问题,称为掩蔽效应。
需要了解的要求:
- ROUT 仅在组内至少有 4 个观测值时运行——少于 4 个数据点的组将被跳过
- 存在最大限制:最多 28 个组,每组最多 5,000 个观测值
- ROUT 会在每个组内独立应用,而不是应用于合并后的数据集
📌 为什么选择 ROUT?ROUT 广泛用于临床前研究和生物医学研究。它能够稳健地处理可能存在多个异常值的数据集,因此适用于实验生物学中常见的中小规模组。
你将看到的内容
创建图表时,异常值检测会在后台自动运行。以下是查看结果的位置:
- 检测到的异常值数量会显示在图表下方的“显示的数据”面板中。
- 异常值会在图表下方的数据表中以黄色突出显示,方便你快速识别。
- 点击异常值报告链接即可打开完整报告,其中包括:
- 分析的数据点总数
- 检测到的异常值数量
- 按组划分的异常值明细
使用 Q 参数调整灵敏度
Q 参数控制 BioRender 标记异常值的严格程度。它直接对应于你愿意接受的最大 FDR——换句话说,这是将某个数据点判定为在统计上不太可能、从而标记为异常值的阈值。
| Q 值 | 灵敏度 | 效果 |
| 低(例如 0.1–1%) | 严格 | 标记为异常值的数据点更少——仅标记最极端的值 |
| 默认值(1%) | 平衡 | 适用于大多数实验的标准起始值 |
| 高(例如 5–10%) | 宽松 | 标记更多数据点——适合探索性检查 |
如何调整 Q 参数
- 点击左侧面板中的异常值报告将其打开。
- 点击“更新设置”。
- Enter介于 0.1 和 10 之间的 Q 值。
- 点击“重新运行”以应用新阈值并查看更新后的结果。
💡 提示:当你想测试某个数据点处于临界状态的程度时,调整 Q 值会很有用。例如,如果某个数据点在 Q=1 时被标记,但在 Q=0.5 时未被标记,那么它就是一个边缘异常值——值得进一步调查,但不能明确认定为极端值。
排除数据点
检测到异常值并不会自动将其从分析中排除——是否排除由你决定。BioRender提供两种处理方式:
| 选项 | 操作方法 |
| 排除单个数据点 | 右键点击图表中的任意数据点(包括非异常值),然后选择“排除”。这样你可以完全手动控制单个数据点。 |
| 一次性排除所有检测到的异常值 | 使用异常值报告中的“排除异常值”复选框,只需点击一次即可切换是否排除所有已标记的异常值。打开和关闭该选项,即可比较包含和不包含异常值的图表。 |
📌 重要提示:在此处排除的任何数据点都会自动应用于你在该图表上运行的所有统计分析。排除数据点后无需重新配置分析——结果会更新以反映排除情况。
处理异常值的最佳实践
是否排除异常值应谨慎决定,并以透明的方式记录。
以下是一些指南:
- 先检查尺度:当一个组的数值大致均匀地分布在均值上下时,ROUT 的效果最佳。如果你的测量值天然跨越多个数量级(如浓度、荧光值、表达水平),请考虑在运行异常值检测前进行对数转换。尺度不合适的一个明显信号是:所有被标记的“异常值”都位于均值的同一侧(全部偏高或全部偏低)。
- 排除前先调查:在排除数据点之前,务必调查其成为异常值的原因。是测量错误、样本处理问题,还是实际的生物学发现?
- 谨慎使用 Q:默认值(Q=1%)适用于大多数实验。提高 Q 值以标记更多数据点,可能会将数据中的真实变异排除在外。
- 报告所用方法:注明 BioRender 使用的是 ROUT 方法及指定的 Q 值,并说明排除了哪些数据点以及排除原因。
- 使用切换选项进行比较:“排除异常值”复选框便于向合作者或审阅者展示包含和不包含异常值的两种分析结果。