数据

HumanEval

OpenAI 发布的 164 道 Python 编程题基准,以 pass@k 评估大模型代码生成能力。

数据集

主体信息

OpenAI 发布的 164 道 Python 编程题基准,以 pass@k 评估大模型代码生成能力。

资源

下载与入口