CS-54k
收藏资源简介:
CS-54k是一个高质量的计算机科学领域问答对语料库,由14,474篇CC许可的论文构建而成。该语料库通过一个可扩展的、基于论文的流水线构建,结合了检索增强生成(RAG)和多阶段质量控制,以确保所有问答对都基于真实的科学背景。从统一的语料库中,我们通过仔细采样和筛选,衍生出两个互补的子集:CS-4k,用于严格的评估;CS-50k,用于大规模训练。CS-4k允许对模型在整个研究流程中辅助科学研究的全部能力进行全面和真实的评估。CS-50k解决了领域相关数据稀缺的问题,为系统性地微调真实的科学研究任务提供了广泛而可靠的监督。该数据集旨在促进AI系统成为计算机科学研究中的可靠合作伙伴。
CS-54k is a high-quality question-answering pair corpus in the field of computer science, constructed from 14,474 CC-licensed academic papers. This corpus is built via a scalable, paper-based pipeline that combines retrieval-augmented generation (RAG) and multi-stage quality control, ensuring that all question-answering pairs are grounded in authentic scientific contexts. From this unified corpus, we derived two complementary subsets via careful sampling and filtering: CS-4k for rigorous evaluation, and CS-50k for large-scale training. CS-4k enables comprehensive and authentic evaluation of a model's full capabilities to assist with scientific research across the entire research workflow. CS-50k addresses the issue of domain-specific data scarcity, providing extensive and reliable supervision for systematic fine-tuning on real-world scientific research tasks. This dataset is designed to foster AI systems to act as reliable collaborators in computer science research.
ResearchGPT 数据集概述
数据集基本信息
- 名称: ResearchGPT (CS-54k)
- 类型: 计算机科学问答对语料库
- 规模: 54,000个高质量问答对
- 来源: 14,000篇CC许可论文
- 许可证: MIT License
数据集构成
主要子集
- CS-54k: 完整数据集,包含54,000个问答对
- CS-4k: 评估基准子集,用于端到端研究助手能力评估
- CS-50k: 训练子集,用于领域对齐模型开发
构建方法
技术流程
- 采用可扩展的论文基础流程
- 结合检索增强生成(RAG)技术
- 实施多阶段质量控制
- 确保事实基础和可复现性
主题分类
数据集将问答对组织为八个主题类别,反映科学论文中的不同推理功能:
- 研究领域
- 先前方法
- 现有挑战
- 研究动机
- 发现/假设
- 研究方法
- 实验设置
- 实验结果
训练与应用
训练方法
- 使用CS-50k子集微调Qwen2.5-7B-Instruct模型
- 采用Group Relative Policy Optimization (GRPO)算法
- 基于VERL框架进行高效强化学习
实验结果
- 7B规模开源模型在CS-50k上微调后,性能超越大型专有系统
- 表明高质量领域对齐训练比预训练规模或通用基准性能更重要
评估体系
评估基准
- 使用CS-4k子集进行评估
- 采用LLM-as-a-judge方法
- 使用0-10分详细评分标准
- 衡量与参考答案的语义和技术对齐度
评估指标
- 总体得分: 所有CS-4k问题的平均得分(缩放到0-100)
- 分类性能: 八个主题类别的详细表现分析
相关资源
- 论文: https://arxiv.org/abs/2510.20279
- 数据集: https://huggingface.co/datasets/wph6/CS-54k
- 代码框架: VERL、OpenCompass、LLaMA-Factory

- 1ResearchGPT: Benchmarking and Training LLMs for End-to-End Computer Science Research Workflows新加坡国立大学 · 2025年



