@misc{indiciae83ad16227c94, title = {Beyond Output Correctness: Benchmarking and Evaluating Large Language Model Reasoning in Coding Tasks}, author = {Yuangang Li and Justin Tian Jin Chen and Ethan Yu and David Hong and Iftekhar Ahmed}, year = {2026}, url = {https://arxiv.org/abs/2604.12379}, note = {Source identifier: 2604.12379} }