Skills Data Science Ensuring Scientific Reproducibility Standards

Ensuring Scientific Reproducibility Standards

v20260724
ssi-reproducibility
A comprehensive guide for researchers submitting academic papers, detailing the standards required for scientific reproducibility. It covers fixing experimental environments (toolchains, datasets, hardware), differentiating result sources (simulation vs. physical measurement), statistical reporting best practices, and providing clear guidelines for code and data availability statements.
Get Skill
141 downloads
Overview

《中国科学:信息科学》可复现性与实验可重复(Reproducibility)

《中国科学:信息科学》(SCIENTIA SINICA Informationis, SSI) 以刊载信息科学领域最高水平的 中文原创成果为目标,审稿强调科学价值与创新高度,而这必须建立在可信、可复现的证据上。 本技能帮助你在实验开展与稿件撰写时,把"别人能否重复出你的结果"这件事前置处理—— 很多可复现性问题在数据采集或实验设计时不做记录,投稿时便无法补救。

一、可复现的三个层次

  1. 可重复(repeatable):同一团队、同一环境重跑得到一致结果。
  2. 可复现(reproducible):他人用你提供的代码/数据/说明能重现主结果。
  3. 可推广(replicable):他人在新数据/新平台上得到一致结论(更高标准)。

SSI 论文至少应做到前两层,并对第三层的边界(外部效度)诚实说明。

二、来源与环境固定(提交前记录,事后难补)

  • 数据集:名称、版本/发布日期、规模、划分方式、预处理步骤;自采数据说明采集协议与时间。
  • 工具链:语言与库版本、框架版本、编译器/EDA 工具版本、操作系统。
  • 随机性:随机种子、初始化、数据打乱方式;报告多次运行的均值与波动。
  • 硬件平台:CPU/GPU/FPGA/芯片型号、内存、必要的时钟/工艺参数(微电子/控制常需)。
  • 超参数:完整超参与搜索空间、选择依据;避免"精心挑选的一次结果"。

三、仿真 vs 实测/硅后(本刊多子学科的关键区分)

SSI 覆盖计算机、控制、通信、微电子等,结果来源差异大,务必明确标注:

结果类型 说明要求
数值仿真 仿真器/模型、参数、边界条件、理想化假设
硬件在环/半实物 平台、接口、实时性约束
硅后/实测 芯片/样机、测试仪器、测量条件、误差来源
理论/证明 假设、引理依赖、可验证的推导步骤
  • 不得把仿真结果表述为实测;跨工艺/跨平台外推要给敏感性分析而非直接断言。

四、统计与随机性报告

  • 报告均值 + 波动(标准差/置信区间/分位数),而非单次最好结果。
  • 对比多方法时用一致的评测协议与统计比较;必要时做显著性检验。
  • 说明异常值处理、失败样本、未收敛情形,避免选择性报告。
  • 消融实验隔离各组件贡献,支撑"创新点确实起作用"的主张。

五、可复现材料与可用性叙述

  • 组织清晰的复现包(code/data/scripts/README),中文 README 给出一键复现主结果的步骤。
  • 撰写数据/代码可用性声明:提供什么、在哪里、如何获取;"可向作者索取"是弱承诺。
  • 涉密/隐私/工业合作限制时,提供脱敏子集或接口说明并解释原因。
  • 材料形态与徽章现状见 ../ssi-artifact-evaluation/SKILL.md (本刊无独立制品徽章制度,现状待核实)。

六、跨子学科可复现要点

  • 计算机/AI:数据泄漏检查、训练/测试划分、预训练模型与数据污染、算力与时间成本。
  • 控制:被控对象模型、扰动与噪声设定、稳定性/鲁棒性验证条件。
  • 通信/信号:信道模型、信噪比范围、评测指标(BER/吞吐等)的统计口径。
  • 微电子/EDA:工艺库、约束、测试激励、PVT 角;注意 IP 与工艺保密合规。

七、可复现性自查表

  • 主结果(主表/主图)可在干净环境按 README 复现。
  • 数据版本、工具链版本、种子、硬件平台均已记录。
  • 仿真/实测/硅后/理论结果分别标注,无混淆。
  • 报告了均值与波动,而非单次最优。
  • 消融实验支撑创新点的独立贡献。
  • 可用性声明与材料实际一致;敏感信息已清理。
  • 复现所需算力/时间已说明。

八、常见失误

失误 后果 纠正
只报单次最好结果 被质疑不可复现 报告多次运行的统计量
仿真当实测 严重可信性问题 明确来源与假设
种子/版本未记录 无法重跑 采集时即记录
数据泄漏未检查 结论失真 严格划分并检查
"整理后公开"从未公开 可用性声明失信 提交时即提供或给明确途径

九、复现失败的常见根因与排查

当审稿人或读者反馈"跑不出你的结果",多半是以下几类,投稿前自行排查:

  • 环境漂移:库/框架小版本升级改变了数值行为。对策:锁版本(requirements.txt/ 容器镜像/工具链版本号),README 写明验证过的环境。
  • 随机性未控制:种子、并行、非确定性算子导致波动。对策:固定种子、报告多次运行统计量、 标注无法完全确定的算子。
  • 数据不一致:数据版本或预处理与论文不符。对策:固定数据版本与预处理脚本,给出校验值。
  • 隐式依赖:依赖本地文件/私有服务/特定硬件而未声明。对策:显式列出并提供替代或说明。
  • 口径不同:评测指标定义/统计口径与论文表述不一致。对策:在 README 与论文中统一定义。

一段有用的复现说明示例(README 片段):

## 复现主结果(表 2 / 图 3)
环境:Python 3.10,PyTorch 2.1,CUDA 12.1,单卡 A100(已在该环境验证)
1) 准备数据:bash scripts/prepare_data.sh   # 校验:md5 见 data/CHECKSUMS
2) 训练:python train.py --seed 0 --config configs/main.yaml
3) 评测:python eval.py --ckpt runs/main/best.pt   # 预计约 20 分钟
说明:论文表 2 为 5 个种子(0-4)的均值±标准差;单次结果会有小幅波动。

十、每次核实

  • 本刊是否对数据/代码公开、可复现材料有强制要求(待核实)。
  • 补充材料容量/格式(待核实)。
  • 与英文姊妹刊 Science China Information Sciences 开放科学要求的差异(待核实)。

输出格式

[可复现层次] 可重复/可复现/可推广——达到哪一层?
[来源固定] 数据版本/工具链/种子/硬件——是否齐备
[结果类型] 仿真/实测/硅后/理论——是否明确标注
[统计] 均值+波动?消融隔离贡献?
[可用性] 声明与材料一致?敏感信息已清理?
[待核实] 强制公开与否、附件格式、SCIS 差异

参见 ../ssi-experiments/SKILL.md../../resources/code/README.md

Info
Category Data Science
Name ssi-reproducibility
Version v20260724
Size 7.3KB
Updated At 2026-07-29
Language