From a558a425a2c8f06a1114c2528f0e408f7923f324 Mon Sep 17 00:00:00 2001 From: reacher-z Date: Mon, 27 Jul 2026 05:16:44 +0800 Subject: [PATCH] Add StructEval benchmark --- README.md | 1 + 1 file changed, 1 insertion(+) diff --git a/README.md b/README.md index 397dd7b..b9a7b94 100644 --- a/README.md +++ b/README.md @@ -1635,6 +1635,7 @@ Flakify: a black-box, language model-based predictor for flaky tests [2022-TSE] 20. BigCodeBench: Benchmarking Code Generation with Diverse Function Calls and Complex Instructions [2023-arXiv] 21. On the Evaluation of Neural Code Translation: Taxonomy and Benchmark [2023-ASE] 22. Can Machines Read Coding Manuals Yet? -- A Benchmark for Building Better Language Models for Code Understanding [2022-AAAI] +23. StructEval: Benchmarking LLMs' Capabilities to Generate Structural Outputs [2025-TMLR] [[Paper](https://openreview.net/forum?id=buDwV7LUA7)] [[GitHub](https://github.com/TIGER-AI-Lab/StructEval)] ### 🗜️Compressing&Distillation