UltraChat多轮指令对话数据集
收藏国家基础学科公共科学数据中心2026-08-05 收录
官方服务:
资源简介:
UltraChat是一个大规模、多轮次的英文指令对话数据集,由清华大学自然语言处理实验室(THUNLP)的研究团队构建。整个数据集包含了大约一百五十七万段多轮对话,全部由OpenAI的ChatGPT模型(GPT-3.5 Turbo)自动生成,并没有使用真人之间的对话记录。数据覆盖的话题范围相当广,设计之初的意图就是给对话式语言模型的训练和评估提供一个大规模、高质量的指令数据来源。每段对话都包含了一条唯一的标识符和一组按顺序排列的对话内容,用户和助手交替发言,轮次从两轮到七轮不等。
提供机构:
浙江大学


