遇见数据集

livecodebench_code_generation_lite

收藏
Hugging Face2026-08-23 更新2026-08-24 收录
官方服务:

资源简介:

该数据集包含多个配置(test、test2、test3、test4、test5、test6、test6solution),每个配置对应一个测试集(split: test)。每个样本包含编程竞赛题目相关的字段:题目标题(question_title)、题目内容(question_content)、题目来源平台(platform)、题目ID(question_id)、竞赛ID(contest_id)、竞赛日期(contest_date)、起始代码(starter_code)、难度等级(difficulty)、公开测试用例(public_test_cases)、私有测试用例(private_test_cases)、元数据(metadata)、提取的提示(hint_extracted)以及提示分析(hint_analysis)。所有字段均为字符串类型,竞赛日期为时间戳。各配置的样本数量从 94 到 387 不等,总大小各异。该数据集适用于编程竞赛题目的分析、难度预测、代码生成、测试用例生成等任务。

This dataset contains multiple configurations (test, test2, test3, test4, test5, test6, test6solution), each corresponding to a test set (split: test). Each sample includes fields related to programming competition problems: question title, question content, platform, question ID, contest ID, contest date, starter code, difficulty level, public test cases, private test cases, metadata, extracted hints, and hint analysis. All fields are of string type, with contest dates as timestamps. The number of samples per configuration ranges from 94 to 387, with varying total sizes. The dataset is suitable for tasks such as analysis of programming competition problems, difficulty prediction, code generation, and test case generation.

创建时间:
2026-08-20
原始信息汇总

数据集概述

该数据集为 livecodebench_code_generation_lite,是一个用于代码生成任务评估的轻量级数据集,包含 7 个配置(testtest2test3test4test5test6test6solution),每个配置均包含一个 test 分割。

数据集规模

配置名称 样本数量 数据集大小(字节) 下载大小(字节)
test 387 1,212,332,319 1,198,461,566
test2 107 687,788,319 683,774,750
test3 94 580,256,176 617,168,471
test4 99 1,180,919,549 1,148,123,009
test5 163 544,547,430 550,185,347
test6 168 129,140,781 123,361,385
test6solution 148 100,585,272 91,540,178

总计:约 1,166 个样本,总数据集大小约 4.44 GB。

数据字段

每个配置均包含以下 13 个字段:

  • question_title:问题标题(字符串)
  • question_content:问题描述内容(字符串)
  • platform:题目来源平台(字符串)
  • question_id:题目唯一标识(字符串)
  • contest_id:竞赛 ID(字符串)
  • contest_date:竞赛日期(时间戳,秒级精度)
  • starter_code:初始代码框架(字符串)
  • difficulty:题目难度(字符串)
  • public_test_cases:公开测试用例(字符串)
  • private_test_cases:私有测试用例(字符串)
  • metadata:元数据(字符串)
  • hint_extracted:提取的提示信息(字符串)
  • hint_analysis:提示分析结果(字符串)

数据用途

该数据集聚焦于代码生成任务的轻量版本,可用于评估模型在竞赛编程场景下的代码生成能力。通过提供题目、起始代码、测试用例及提示信息,支持模型对代码生成质量的评估与对比分析。

搜集汇总
数据集介绍
livecodebench_code_generation_lite 数据集图片
构建方式
该数据集源自LiveCodeBench这一面向编程语言模型评估的基准,其设计聚焦于代码生成任务。构建过程从CodeContests等竞赛平台采集真实编程题目,涵盖问题陈述、起始代码、难度分级及公开与私有测试用例等关键要素。经过筛选与清洗,数据集划分为多个子配置(如test至test6),每个配置包含不同数量的测试样本,总计逾千道题目,并辅以由模型提取的提示信息(hint_extracted)及分析(hint_analysis),旨在为代码生成模型的评测提供多维度、结构化的基准数据。
特点
该数据集的核心特色在于其多样性与评测的严谨性。题目源自真实编程竞赛,覆盖不同难度层次,并包含公开与私有测试用例,用于验证模型生成的代码在隐藏案例上的泛化能力。数据结构丰富,不仅包含问题文本与代码,还提供竞赛元数据、起始代码及额外的提示信息,为深入分析模型性能提供了依据。此外,数据集提供多个子集,支持不同规模与侧重点的评测,尤其适合用于检验模型在竞赛级代码生成上的表现,且每个样本附带的提示分析可作为辅助信号,增强评测的维度。
使用方法
使用该数据集时,研究者可依据需求选择合适的子配置与测试分割。典型流程为加载数据集,提取问题内容与起始代码作为模型输入,生成代码后与公开测试用例比对,并利用私有测试用例进行最终评估。数据集的字段设计便于直接接入常见的代码生成评测框架。此外,可结合hint_extracted与hint_analysis字段,探索提示对模型性能的影响,或作为多任务学习的辅助目标。数据集规模适中,适合在单机或分布式环境下进行批量评测,其结果可复现且便于横向比较不同模型在竞赛代码生成任务上的能力。
背景与挑战
背景概述
LiveCodeBench_code_generation_lite数据集诞生于大型语言模型(LLM)在代码生成领域迅猛发展的背景下,由相关研究团队于近期构建,旨在为评估LLM的代码生成能力提供一套动态、低污染的基准。该数据集整合了来自多个在线编程平台的竞赛题目,涵盖从基础到高级的多种难度,并包含详细的测试用例与解题提示,为研究者提供了丰富且真实的任务环境。其核心研究问题在于如何准确、公平地衡量LLM在复杂编程任务上的泛化性能,进而推动代码智能模型的迭代优化。该数据集已成为代码生成领域评测的重要参考,对理解模型能力边界和指导后续研究具有显著影响力。
当前挑战
该数据集面临的挑战主要来自两方面。其一,在领域层面上,代码生成任务要求模型不仅理解自然语言问题描述,还需产出符合逻辑且能通过严格测试用例的代码,这对模型的算法推理、语法掌握及边界情况处理能力构成极高要求;同时,现有模型在应对新颖或复杂问题时稳定性不足,且评测需避免数据泄露和过拟合,确保结果的真实性与可复现性。其二,在构建过程中,需要从海量编程竞赛数据中筛选并清洗题目,确保题目质量与无版权争议,并设计多粒度测试用例及难度标注,同时要控制数据规模与多样性之间的平衡,这些环节均耗费大量人力与时间,构成了数据集的构建挑战。
常用场景
经典使用场景
LiveCodeBench_code_generation_lite 是面向代码生成任务的高质量基准数据集,其核心使用场景聚焦于评估与比较大语言模型在竞赛级编程问题上的代码生成能力。该数据集汇集了来自多平台的竞赛题目,每题附带题目描述、起始代码、公共与私有测试用例,难度梯度覆盖从简单至困难,为研究者提供了统一的评测协议。通过公开测试用例与隐藏测试用例的双重校验,能够精准度量模型生成代码的功能正确性与鲁棒性,是代码智能领域公认的标准化测试平台。
实际应用
在实际应用中,该数据集被广泛用于衡量代码生成模型在真实编程挑战中的表现,支撑了诸如编程助手、自动化代码补全及教学辅助系统的研发与迭代。企业或研究机构可利用其starter_code与测试用例接口,快速接入模型进行端到端效果验证,从而筛选出更适宜部署的模型版本。此外,其提示词分析与元数据还可服务于数据增强、难例挖掘等工程实践,提升模型在特定垂直领域(如算法竞赛)的实用性能。
衍生相关工作
基于LiveCodeBench的基准,众多衍生工作应运而生,包括对代码生成模型在不同编程语言、问题类型上的细粒度能力剖析,以及针对模型在私有测试用例下失败模式的归因研究。该数据集也启发了若干进阶的评估框架,如结合执行反馈的交互式评测、考虑时间跨度的鲁棒性检验,进一步催生了基于提示工程与测试用例生成的模型优化策略。这些工作共同推动了代码智能领域从单次生成评估向多维度、动态评测体系的演进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务