training-check
wanshuiyin/Auto-claude-code-research-in-sleep
This skill provides continuous, structured monitoring of deep learning model training metrics. It analyzes data from platforms like WandB and local logs to detect critical anomalies such as NaN values, divergence, plateaus, and sudden spikes. By providing a clear decision (CONTINUE, WAIT, or STOP) and detailed evidence, it ensures compute resources are only spent on viable training runs.