Skills Data Science Guidelines for Scientific Reproducibility

Guidelines for Scientific Reproducibility

v20260724
aas-reproducibility
Provides comprehensive guidelines for achieving scientific reproducibility in academic research, particularly for control systems, automation, and pattern recognition. It covers fixing environment dependencies, data handling, random seeds, and process pipelines, helping authors withstand rigorous peer review questioning and build verifiable research artifacts.
Get Skill
307 downloads
Overview

《自动化学报》可复现性与实验可重复

本技能帮你把投向《自动化学报》(Acta Automatica Sinica, AAS) 的实验做到可复现。外审常问"换个人 能否复现你的结果",控制类还要能复现稳定性与性能结论。以下方法于 2026-07-09 核验框架(见 resources/official-source-map.md);本刊是否强制提交复现材料 待核实

一、可复现性三支柱

支柱 内容
环境可复现 语言/库版本、系统、硬件、随机种子固定
数据可复现 数据来源、划分、预处理脚本、校验和
流程可复现 从原始数据到论文图表的一键脚本

二、环境与依赖固定

  • 记录语言与关键库版本(Python/MATLAB、控制/学习框架),提供 requirements.txt/environment.yml 或 Dockerfile。
  • 控制仿真额外记录:仿真器与版本、求解器类型、积分步长、系统模型参数、初始条件
  • 硬件:CPU/GPU 型号、内存;实物实验记录采样周期、控制器硬件与传感器型号。

三、随机性与多次运行

  • 固定随机种子;对随机性强的实验(强化学习、随机初始化的识别模型)报告多次运行的均值与方差
  • 说明随机来源(初始化、数据打乱、探索噪声)与控制方式;不要只报单次最好结果。

四、数据划分与防污染

风险 防范
测试集调参 只在验证集调参,测试集仅最终评测一次
数据泄露 划分在预处理前,防未来信息进训练
重复样本跨集 去重,确认训练/测试无交叠
分布偏移未披露 说明训练与测试分布差异

五、复现包组织(配合双盲)

repro/
  README.md      # 环境、数据、运行、预期结果、硬件
  env/           # requirements.txt / environment.yml / Dockerfile
  data/          # 数据或获取脚本 + 校验和
  src/           # 方法与基线
  configs/       # 每个实验/图表的配置与种子
  scripts/       # run_all.sh:原始数据→论文图表
  results/       # 关键指标,供复现校验
  • 复现材料需匿名:仓库、README、路径、账户名不得泄露作者身份(双盲,见 aas-submission)。
  • 用匿名化 Git 快照或匿名仓库分享链接;勿指向作者主页。

六、超参数与调参协议

  • 公布搜索空间、选择准则、最终取值;说明基线的调参是否与本文同等投入。
  • 控制类公布增益、自适应率、约束参数等;学习类公布学习率、批大小、训练轮数等。

七、可复现性自检清单

[环境] 版本/硬件/种子固定?仿真器/步长/求解器记录?
[数据] 来源/划分/预处理/校验和齐全?无泄露/无跨集重复?
[随机] 多次运行均值±方差?随机来源已说明?
[流程] run_all.sh 可从数据跑到图表?
[超参] 搜索空间/选择准则/取值公布?基线同等调参?
[匿名] 复现材料无身份泄露?
[待核实] 本刊是否强制提交代码/数据:待核实

八、常见复现问题

  • 只给结果不给环境,换机器跑不出——补依赖与硬件说明。
  • 种子不固定、只报单次——补多次运行统计。
  • 测试集调参导致虚高——整改为验证集调参。
  • 控制仿真缺步长/求解器/参数,别人复现不了动态——补仿真配置。
  • 复现仓库暴露作者身份,违反双盲——匿名化后再放链接。

九、控制仿真的可复现要点(专项)

控制类结论(稳定、收敛、性能改进)依赖仿真设定,须逐项固定并披露:

记录内容
被控对象模型 状态方程/传递函数、阶数、参数取值
初始条件 状态初值、参考信号
数值积分 求解器类型、步长、容差
噪声/扰动 类型、幅值、随机种子
仿真时长 总时长、采样率
控制器参数 增益、自适应率、约束值

同一套参数应能复现论文中的每条响应曲线与性能指标;把这些写进 configs/ 与 README。

十、可重复性的验证方法

  • 自我复现:换一台干净机器、按 README 从零跑一遍 run_all.sh,确认无隐性依赖。
  • 交叉复现:请合作者独立按说明复现关键结果,暴露"只有作者本机能跑"的问题。
  • 结果校验:在 results/ 放关键指标基准值,复现时比对偏差在容许范围内。

十一、可复现性与双盲的平衡

  • 投稿阶段复现材料须匿名;不能因追求可复现而在 README、仓库名、提交历史中泄露身份。
  • 用匿名快照分享;提交历史若含真实用户名,重新初始化仓库再分享。
  • 录用后(见 aas-camera-ready)再去匿名、正式公开,衔接 aas-artifact-evaluation

十二、复现材料的版本与维护

  • 每轮退修补的实验要同步更新复现包,避免论文与代码脱节。
  • 用版本标签(如 v1 投稿、v2 退修)标记复现包状态,答复信可引用对应版本。
  • README 记录变更历史,便于外审核对"新增实验对应哪段代码"。
  • 见刊后(见 aas-camera-ready)把稳定版复现包正式公开,并在稿件中标注最终获取地址。
  • 定期检查外部依赖是否失效(数据链接、库版本),保证长期可复现。

十三、与本刊定位

《自动化学报》(Acta Automatica Sinica, AAS) 重视理论与实验双支撑,可复现性是让稳定性/性能结论 可信的基础。把复现包与 aas-experimentsaas-artifact-evaluation 联动整理,能显著降低外审对 "结果可靠性"的疑虑,也为见刊后同行复现打好基础。政策性要求未双源确认前标 待核实

Info
Category Data Science
Name aas-reproducibility
Version v20260724
Size 6.23KB
Updated At 2026-07-28
Language