技能 数据科学 学术研究可复现性指南

学术研究可复现性指南

v20260724
aas-reproducibility
本指南旨在为撰写学术论文(尤其在控制和自动化领域)提供完整的可复现性框架。详细指导如何固定环境、防止数据泄露、记录关键参数和流程,确保研究结果具备极高的可信度和可重复性,以应对严谨的同行评审挑战。
获取技能
307 次下载
概览

《自动化学报》可复现性与实验可重复

本技能帮你把投向《自动化学报》(Acta Automatica Sinica, AAS) 的实验做到可复现。外审常问"换个人 能否复现你的结果",控制类还要能复现稳定性与性能结论。以下方法于 2026-07-09 核验框架(见 resources/official-source-map.md);本刊是否强制提交复现材料 待核实

一、可复现性三支柱

支柱 内容
环境可复现 语言/库版本、系统、硬件、随机种子固定
数据可复现 数据来源、划分、预处理脚本、校验和
流程可复现 从原始数据到论文图表的一键脚本

二、环境与依赖固定

  • 记录语言与关键库版本(Python/MATLAB、控制/学习框架),提供 requirements.txt/environment.yml 或 Dockerfile。
  • 控制仿真额外记录:仿真器与版本、求解器类型、积分步长、系统模型参数、初始条件
  • 硬件:CPU/GPU 型号、内存;实物实验记录采样周期、控制器硬件与传感器型号。

三、随机性与多次运行

  • 固定随机种子;对随机性强的实验(强化学习、随机初始化的识别模型)报告多次运行的均值与方差
  • 说明随机来源(初始化、数据打乱、探索噪声)与控制方式;不要只报单次最好结果。

四、数据划分与防污染

风险 防范
测试集调参 只在验证集调参,测试集仅最终评测一次
数据泄露 划分在预处理前,防未来信息进训练
重复样本跨集 去重,确认训练/测试无交叠
分布偏移未披露 说明训练与测试分布差异

五、复现包组织(配合双盲)

repro/
  README.md      # 环境、数据、运行、预期结果、硬件
  env/           # requirements.txt / environment.yml / Dockerfile
  data/          # 数据或获取脚本 + 校验和
  src/           # 方法与基线
  configs/       # 每个实验/图表的配置与种子
  scripts/       # run_all.sh:原始数据→论文图表
  results/       # 关键指标,供复现校验
  • 复现材料需匿名:仓库、README、路径、账户名不得泄露作者身份(双盲,见 aas-submission)。
  • 用匿名化 Git 快照或匿名仓库分享链接;勿指向作者主页。

六、超参数与调参协议

  • 公布搜索空间、选择准则、最终取值;说明基线的调参是否与本文同等投入。
  • 控制类公布增益、自适应率、约束参数等;学习类公布学习率、批大小、训练轮数等。

七、可复现性自检清单

[环境] 版本/硬件/种子固定?仿真器/步长/求解器记录?
[数据] 来源/划分/预处理/校验和齐全?无泄露/无跨集重复?
[随机] 多次运行均值±方差?随机来源已说明?
[流程] run_all.sh 可从数据跑到图表?
[超参] 搜索空间/选择准则/取值公布?基线同等调参?
[匿名] 复现材料无身份泄露?
[待核实] 本刊是否强制提交代码/数据:待核实

八、常见复现问题

  • 只给结果不给环境,换机器跑不出——补依赖与硬件说明。
  • 种子不固定、只报单次——补多次运行统计。
  • 测试集调参导致虚高——整改为验证集调参。
  • 控制仿真缺步长/求解器/参数,别人复现不了动态——补仿真配置。
  • 复现仓库暴露作者身份,违反双盲——匿名化后再放链接。

九、控制仿真的可复现要点(专项)

控制类结论(稳定、收敛、性能改进)依赖仿真设定,须逐项固定并披露:

记录内容
被控对象模型 状态方程/传递函数、阶数、参数取值
初始条件 状态初值、参考信号
数值积分 求解器类型、步长、容差
噪声/扰动 类型、幅值、随机种子
仿真时长 总时长、采样率
控制器参数 增益、自适应率、约束值

同一套参数应能复现论文中的每条响应曲线与性能指标;把这些写进 configs/ 与 README。

十、可重复性的验证方法

  • 自我复现:换一台干净机器、按 README 从零跑一遍 run_all.sh,确认无隐性依赖。
  • 交叉复现:请合作者独立按说明复现关键结果,暴露"只有作者本机能跑"的问题。
  • 结果校验:在 results/ 放关键指标基准值,复现时比对偏差在容许范围内。

十一、可复现性与双盲的平衡

  • 投稿阶段复现材料须匿名;不能因追求可复现而在 README、仓库名、提交历史中泄露身份。
  • 用匿名快照分享;提交历史若含真实用户名,重新初始化仓库再分享。
  • 录用后(见 aas-camera-ready)再去匿名、正式公开,衔接 aas-artifact-evaluation

十二、复现材料的版本与维护

  • 每轮退修补的实验要同步更新复现包,避免论文与代码脱节。
  • 用版本标签(如 v1 投稿、v2 退修)标记复现包状态,答复信可引用对应版本。
  • README 记录变更历史,便于外审核对"新增实验对应哪段代码"。
  • 见刊后(见 aas-camera-ready)把稳定版复现包正式公开,并在稿件中标注最终获取地址。
  • 定期检查外部依赖是否失效(数据链接、库版本),保证长期可复现。

十三、与本刊定位

《自动化学报》(Acta Automatica Sinica, AAS) 重视理论与实验双支撑,可复现性是让稳定性/性能结论 可信的基础。把复现包与 aas-experimentsaas-artifact-evaluation 联动整理,能显著降低外审对 "结果可靠性"的疑虑,也为见刊后同行复现打好基础。政策性要求未双源确认前标 待核实

信息
Category 数据科学
Name aas-reproducibility
版本 v20260724
大小 6.23KB
更新时间 2026-07-28
语言