yuangang.me
yuangang.me
Home
Publications
Experience
Projects
Services
Contact
LLM Reasoning
arXiv
Beyond Output Correctness: Benchmarking and Evaluating Large Language Model Reasoning in Coding Tasks
Yuangang Li
,
Justin Tian Jin Chen
,
Ethan Yu
,
David Hong
,
Iftekhar Ahmed
PDF
DOI
Cite
×