遇见数据集

ada-flo/nlp-hack-debate

收藏
Hugging Face2026-04-27 更新2026-05-03 收录
官方服务:

资源简介:

该数据集是一个用于基于LSTM的序列到序列(seq2seq)辩论聊天机器人的双语训练数据集,支持英语和韩语。每个数据记录是一个三元组,包含主题、输入上下文和目标输出,并预计算了编码器输入、解码器输入和解码器目标,以便直接用于seq2seq模型训练。数据集总规模在10,000到100,000条记录之间,具体分为训练集(40,006条)、验证集(5,050条)和测试集(4,429条),并确保在辩论主题级别上无数据泄漏。数据来源多样,包括真实的人类辩论对(如IBM Argument Quality Ranking 30K)、多轮说服对话、单轮助手对话、休闲对话,以及通过LLM生成的合成辩论对(使用Qwen3-235B-A22B-Instruct模型)。数据集旨在促进辩论主题的对话生成任务,适用于自然语言处理中的文本生成研究。

语言: - 英语 - 韩语 许可协议:cc-by-4.0 任务类别: - 文本到文本生成 数据集展示名:辩论主题对话生成数据集 数据规模类别: 10000 < 样本数 < 100000 --- # ada-flo/nlp-hack-debate 用于基于长短期记忆网络(LSTM)的序列到序列(seq2seq)辩论聊天机器人的双语(英语+韩语)训练数据。每条记录均为`(主题、输入上下文、目标输出)`三元组,同时附带预先计算完成的`编码器输入`/`解码器输入`/`解码器目标`,可直接用于序列到序列模型的训练。 ## 数据结构 json { "id": "ibm_argq_30k_8b4b12caccad", "lang": "en", "source": "ibm_argq_30k", "is_synthetic": false, "input_stance": "pro", "target_stance": "con", "topic": "我们应当废除婚姻制度", "input_context": "废除婚姻制度能让人们按照自身意愿成长……", "target_output": "承诺与稳定对儿童的成长至关重要……", "encoder_input": "我们应当废除婚姻制度 <SEP> 废除婚姻制度能让人们按照自身意愿成长……", "decoder_input": "<SOS> 承诺与稳定对儿童的成长至关重要……", "decoder_target": "承诺与稳定对儿童的成长至关重要…… <EOS>", "meta": { "source_record_ids": [], "quality_input_WA": 1.0, "...": "..." } } 可在Hugging Face(HF)数据集查看器中进行筛选的顶级字段: | 字段 | 可选值 | |---|---| | `lang` | `en`(英语)、`ko`(韩语) | | `source` | `ibm_argq_30k`、`mc_conversation`、`isotonic_conversation`、`casual_conversation`、`ko_debate_synth`、`korean_petitions` | | `is_synthetic` | `true`(是)、`false`(否) | | `input_stance` | `pro`(支持方)、`con`(反对方)、`petition_position`(请愿立场)、`supportive`(支持性)、`oppositional`(反对性)等 | | `target_stance` | `pro`(支持方)、`con`(反对方)、`opposition`(反对立场)等 | ## 数据划分 | 划分 | 样本总数 | 英语样本 | 韩语样本 | |---|---|---|---| | 训练集 | 40006 | 27093 | 12913 | | 验证集 | 5050 | 3811 | 1239 | | 测试集 | 4429 | 2760 | 1669 | 数据划分基于**主题级别**进行:针对辩论类数据源,同一议题下的所有记录将被划分至同一个数据划分中,无数据泄露风险。对于闲聊对话和基于主题生成的合成数据,则采用按行划分的方式,因为这类数据共享占位符主题。 ## 训练集数据源构成 | 数据源 | 样本数 | |---|---| | ibm_argq_30k | 24126 | | korean_petitions | 8203 | | ko_debate_synth | 4710 | | isotonic_conversation | 1186 | | mc_conversation | 971 | | casual_conversation | 810 | ## 数据源详情 - **ibm_argq_30k** — [IBM Argument Quality Ranking 30K](https://huggingface.co/datasets/ibm-research/argument_quality_ranking_30k)。包含约70个辩论议题下的真实人类撰写的支持/反对方立场对。 - **mc_conversation** — [mc-ai/conversation_dataset](https://huggingface.co/datasets/mc-ai/conversation_dataset),经筛选后仅保留`corpus_id=persuasionforgood`的样本。属于真实的以说服为主题的多轮对话(Persuasion-for-Good语料库)。 - **isotonic_conversation** — [Isotonic/human_assistant_conversation](https://huggingface.co/datasets/Isotonic/human_assistant_conversation),经筛选后仅保留无对话标记或代码任务内容的单轮样本。 - **casual_conversation** — [SohamGhadge/casual-conversation](https://huggingface.co/datasets/SohamGhadge/casual-conversation)。用于提升对话流畅性的日常问候类对话样本。 - **ko_debate_synth** — 基于主题生成的韩语文本辩论对。包含98个精心策划的辩论议题,每个议题生成30组大语言模型(LLM)生成的支持/反对方对话对。采用vLLM部署的Qwen3-235B-A22B-Instruct模型生成,温度参数设为0.9,每组议题覆盖正反两个立场方向。 - **korean_petitions** — 韩国请愿书语料库(来源于2017-2019年青瓦台国民请愿,通过Korpora获取)。以请愿书标题作为辩论议题,以请愿书正文(截断至280字符)作为`input_context`,通过vLLM生成的反驳论点作为`target_output`。 ## 合成数据说明 `meta.is_synthetic=true`的记录均由通过vLLM部署的Qwen3-235B-A22B-Instruct模型生成。合成提示词的版本信息将记录在`meta.synthesis_prompt_version`字段中。 | 提示词版本 | 适用数据源 | |---|---| | v1(反驳论点) | korean_petitions | | v1(辩论对) | ko_debate_synth | 提示词详情请参见源代码仓库中的`src/synth/prompts.py`文件。 ## 许可协议 采用CC BY 4.0许可协议。源语料库保留其原始许可协议;商业使用前请查阅上述各数据源链接以了解再分发条款。 ## 代码仓库 本数据集由https://github.com/ada-flo/nlp-hack 生成,详情请参见该仓库以获取完整的预处理流程、数据源适配器及合成客户端代码。

提供机构:
ada-flo
二维码
社区交流群
二维码
科研交流群
商业服务