colm-experiments
brycewang-stanford/Awesome-Journal-Skills
A comprehensive guide detailing best practices for designing and auditing empirical evaluations of Large Language Models (LLMs). It addresses critical pitfalls such as data contamination, baseline unfairness, model version drift, and decoding parameter sensitivity, ensuring that published results are robust, reproducible, and scientifically sound for academic publication.