Skills Data Science Academic Research Reproducibility Standard

Academic Research Reproducibility Standard

v20260724
cjc-reproducibility
A comprehensive guide for achieving experimental reproducibility and verifiability in academic writing, specifically targeting top-tier journals. It covers crucial aspects like fixing computing environments, managing random seeds, ensuring data provenance, preventing data leakage, and structuring scripts for external review, transforming research rigor into actionable steps.
Get Skill
472 downloads
Overview

《计算机学报》可复现性与实验可重复

《计算机学报》(Chinese Journal of Computers, CJC) 是 CCF A 类综合性中文月刊,以原创长文为主, 外审专家会实质性追问"这些结果换个人、换台机器能不能复现"。可复现性不是投稿时才补的装饰,而是从 实验设计与数据采集之时就要固化的工程纪律:环境、种子、数据、脚本、版本一旦当时没记,事后无法 重建。本技能给出面向 CJC 长文的可复现性做法,与 cjc-experiments(实验设计)、 cjc-artifact-evaluation(制品托管)配套使用。事实核验日期 2026-07-09,未确认的本刊具体要求标 待核实

一、可复现性的三个层次

层次 含义 达标标志
可重复 (repeatable) 同一团队同一环境重跑得到一致结果 固定种子/环境后多次运行结果稳定
可复现 (reproducible) 他人用你的代码与数据得到一致结果 一键脚本产出对上论文表图
可复制 (replicable) 他人独立实现得到一致结论 方法与设置描述足够完整、无隐含技巧

CJC 长文至少要做到"可复现",并让方法描述完整到支持"可复制"。

二、实验环境与依赖固定

  • 记录并公开:操作系统、硬件(CPU/GPU 型号与显存)、语言与框架版本、关键库的精确版本号
  • 优先提供环境文件(如 requirements/lock 文件、conda 环境、Dockerfile),避免"我这能跑"。
  • 长时训练/大规模实验注明算力与耗时,让复现者对成本有预期。

三、随机性与统计稳定性

  • 固定并公开随机种子;对随机性敏感的结论,报告多次运行的均值±标准差而非单次最好值。
  • 涉及比较的关键结论,做显著性检验并说明检验方法与样本;避免用单点数字夸大优势。
  • 数据划分(训练/验证/测试)固定并公开,禁止用测试集调参。

四、数据来源与预处理可追溯

  • 自采数据:说明采集时间、范围、清洗规则、规模;给出可核验的采集脚本或说明。
  • 第三方数据:给出出处、版本、访问日期与许可;数据挖掘类工作记录仓库快照/SHA 与抓取日期。
  • 预处理链路完整可复算:从原始数据到实验输入的每一步都要可脚本化重放。

五、机器学习/数据挖掘的污染防范

  • 数据泄漏:确保特征、标签、时间边界不把未来信息或测试信息泄入训练。
  • 评测污染:使用大模型或公开预训练资源时,警惕评测集可能已被模型见过,必要时做污染分析或 更换/构造独立评测集。
  • 缓存中间产物:把大模型输出、昂贵中间结果缓存下来,复现时不必重新联网采样,保证可重放。

六、复现脚本与论文表图对应

  • 每个主结果表/图配一个可一键运行的脚本,脚本名或注释标明对应"表 X/图 Y"。
  • 提供一个总入口(如 run_all),并在 README 写清运行顺序、预计时间与产物位置。
  • 复现产物与论文数值的允许误差范围要说明(浮点/硬件差异导致的小偏差属正常)。

七、双盲外审下的可核验组织

  • 若本刊外审阶段删除作者信息,复现材料同样需要规避作者身份:清理仓库中的用户名、邮箱、机构 路径、致谢与基金显名信息(见 cjc-submission)。
  • 用匿名化的稳定链接或随稿附件提供材料,录用后再在定稿中恢复真实信息与永久链接(见 cjc-camera-ready)。

八、自查清单

  • 环境/依赖/硬件是否记录到可重建?
  • 种子固定、关键结论有均值±方差与显著性?
  • 数据来源、许可、预处理是否可追溯、可重放?
  • 是否排查数据泄漏与评测污染?
  • 每个主表主图是否有对应一键脚本?
  • 外审阶段材料是否已匿名化?

九、需确认的易变项

  • 本刊是否对可复现材料有明确格式或托管要求待核实)。
  • 补充材料容量与接收方式(见 cjc-supplementary)。

十、复现包 README 模板

一份能让外审"照着就能跑"的 README 至少包含:

# <论文题名> 复现包
## 1. 环境
- OS / 硬件(CPU,GPU,显存) / 语言与框架版本
- 一键安装: pip install -r requirements.txt  (或 docker build)
## 2. 数据
- 来源、版本、访问日期、许可;获取脚本 scripts/get_data.sh
## 3. 复现主结果
- bash scripts/run_all.sh        # 复现全部主表主图
- bash scripts/table6.sh         # 单独复现表6
## 4. 结果对应
- 表2 ← scripts/table2.sh ;图3 ← scripts/fig3.sh …
## 5. 预计耗时与随机性
- 种子固定;单次约 __ 小时;多次运行报均值±方差
## 6. 不可公开部分与替代核验

十一、可复现性与写作的衔接

  • 论文方法与实验设置的描述要完整到"不看代码也能大致复现",代码是补充而非借口(见 cjc-writing-stylecjc-experiments)。
  • 把关键超参数、数据规模、评测协议写进正文或附录,而非只丢进代码仓库。
  • 《计算机学报》(Chinese Journal of Computers, CJC) 的长文篇幅足以容纳这些细节,善用之。

十二、可复现性终检

  • 环境/依赖/硬件记录可重建?
  • 种子固定、关键结论有均值±方差与显著性?
  • 数据来源/许可/预处理可追溯可重放?
  • 数据泄漏与评测污染已排查?
  • README 覆盖构建与主结果复现、脚本对应表图?
  • 方法与设置在正文/附录中足够完整?
  • 外审阶段材料已匿名化?

输出格式

[层次目标] 可重复 / 可复现 / 可复制 —— 本文达到:___
[环境] OS/硬件/框架版本 已固定?环境文件已提供?是/否
[随机性] 种子固定?多次运行均值±方差?显著性检验?是/否
[数据] 来源/许可/预处理 可追溯可重放?是/否
[污染] 数据泄漏与评测污染排查:通过/待改
[脚本对应] 主表主图↔一键脚本 一一对应?是/否
[匿名] 外审材料已去身份化?是/否
Info
Category Data Science
Name cjc-reproducibility
Version v20260724
Size 6.75KB
Updated At 2026-07-28
Language