TY - RPRT TI - Beyond Output Correctness: Benchmarking and Evaluating Large Language Model Reasoning in Coding Tasks AU - Yuangang Li AU - Justin Tian Jin Chen AU - Ethan Yu AU - David Hong AU - Iftekhar Ahmed PY - 2026 UR - https://arxiv.org/abs/2604.12379 ID - 2604.12379 ER -