mlsys-experiments
brycewang-stanford/Awesome-Journal-Skills
This comprehensive guide instructs researchers on how to design rigorous and credible evaluations for Machine Learning systems. It covers critical areas such as workload selection, baseline comparison discipline, reporting four key coordinates (throughput, latency tails, memory, cost), structuring ablations, and generating scaling evidence. It ensures measurements meet academic benchmarking standards.