A reproducible LiveCodeBench evaluation scaffold for controlled studies of code-reasoning SFT on Qwen2.5-1.5B.
reproducible-research code-generation large-language-models vllm llm-evaluation qwen2-5 supervised-fine-tuning livecodebench opencodereasoning
-
Updated
Jul 29, 2026 - Python