This document presents suggestions to strengthen general-purpose artificial intelligence (GPAI) evaluations by promoting internal validity, external validity and reproducibility. Drawing from best practices across scientific disciplines, it provides recommendations for human uplift studies, benchmark evaluations and cross-cutting approaches, organised across four life cycle stages: design, implementation, execution and documentation.