oasst
收藏Conversational Dataset
数据集概述
该数据集由H2O.ai设计,用于微调对话模型,特别是在多轮问答场景中。它包含结构化的对话,每个对话通过唯一标识符链接,以在多轮中保持上下文。
数据集详情
数据集描述
该数据集包括多轮对话,结构化方式为每个instruction有一个关联的output,并带有id和parent_id字段以跟踪层次对话流。该数据集使模型能够理解和生成上下文适当的响应,适用于聊天机器人、任务型对话系统和其他对话AI应用。
- 由: H2O.ai 策划
- 语言(NLP): 英语
- 许可证: Apache 2.0
数据集来源
- 仓库: [Link to dataset repository on Hugging Face]
- 论文 [可选]: [Link to relevant papers, e.g., Hugging Face papers or H2O.ai papers]
- 演示: [Add link if there’s an available demo]
用途
直接使用
该数据集旨在用于微调以下模型:
- 多轮对话任务
- 指令跟随对话
- 聊天机器人或虚拟助手应用
超出范围的使用
该数据集在不相关的任务中(如分类或摘要)可能表现不佳,除非进行额外的预处理。
数据集结构
- Instruction: 提供给模型的输入或提示。
- Output: 模型预期的响应。
- Id: 每个交互对的唯一标识符。
- Parent_id: 将指令与其先前的上下文链接,使模型能够保持对话流程。
数据集创建
策划理由
H2O.ai创建此数据集以增强对话模型管理多轮对话的能力,并具有上下文意识。这是公司通过强大、易于使用的工具实现AI民主化承诺的一部分。
源数据
数据收集和处理
数据从各种对话AI场景中收集,经过策划以启用上下文跟踪。数据集经过清理和结构化,以确保相关性,重点关注指令和对话的准确性。
源数据生产者是谁?
该数据集由H2O.ai策划,这是一家在AI云领域领先的公司,以其为企业应用实现AI民主化的工作而闻名。
注释
该数据集不包括任何额外的手动注释,除了结构化的输入-输出对。
偏见、风险和局限性
该数据集可能携带从其收集来源固有的偏见。鼓励用户评估和调整其模型以减轻任何偏见,特别是在敏感或企业应用中。
建议
建议用户在涉及决策或客户接触应用的上下文中,彻底测试基于此数据集微调的模型,以确保公平性和偏见。
引用
如果您使用此数据集,请引用:
bibtex @dataset{h2oai_conversational_dataset, author = {H2O.ai}, title = {Multi-turn Conversational Dataset for Chatbot Fine-tuning}, year = {2024}, url = {Link to your dataset}, }




