PythonSaga: Redefining the Benchmark to Evaluate Code Generating LLMs
Yadav, Beniwal, Singh. Findings of EMNLP 2024.
PaperarXivGitHubHugging FaceBenchmark
Benchmark for evaluating code-generating large language models.
Yadav, Beniwal, Singh. Findings of EMNLP 2024.
PaperarXivGitHubHugging Face