相关数据集
neulab/ted_hrlr
该数据集名为TEDHrlr,主要来源于TED演讲的转录文本,用于比较高资源和低资源语言对的翻译任务。数据集包含多种语言的翻译对,如阿塞拜疆语到英语、白俄罗斯语到英语等。数据集的创建过程涉及专家生成和众包注释,且数据集的大小在1M到10M之间。数据集的许可证为CC BY-NC-ND 4.0。
Hugging Face2024-01-18 更新1010
HuiHuang/NER-CoT
ReasoningNER是一个为支持命名实体识别(NER)推理范式而设计的数据库。它包含了详细的推理轨迹(Chain-of-Thought, CoT)注释,这些注释详细说明了如何基于上下文线索、语义提示和逻辑约束来识别实体,而不是仅仅依赖语义模式。该数据集基于PILE-NER数据库构建,对其样本进行了详细的推理注释增强。
Hugging Face2025-11-13 更新410
neulab/tldr
DocPrompting-CoNaLa数据集是一个用于代码生成任务的数据集,特别是从自然语言到Bash命令的生成。该数据集来源于`tldr`项目的英文子集,并通过Bash命令进行分割。数据集包含训练集、测试集和验证集,每个集都包含自然语言意图、参考代码片段、问题ID等字段。此外,数据集还包含一个文档部分,用于存储与代码片段相关的文档内容。数据集的结构和字段在README中有详细描述,并提供了相关的
Hugging Face2022-12-22 更新190
neulab/ted_multi
TEDMulti数据集是一个包含60种语言的大规模多语言数据集,源自TED演讲的转录文本。每个记录由语言和文本的并行数组组成,缺失和不完整的翻译会被过滤掉。数据集包含训练集、验证集和测试集,分别包含258098、6049和7213个样本。数据集的下载文件大小为352.23 MB,生成的数据集大小为791.01 MB,总磁盘使用量为1.14 GB。数据集的字段包括`translations`(多语言
Hugging Face2024-01-18 更新440
neulab/mconala
--- license: cc-by-sa-4.0 task_categories: - text-generation - translation language: - es - ja - ru tags: - code generation pretty_name: mconala size_categories: - n<1K --- # Dataset Card for MCoNaLa
Hugging Face2023-02-10 更新200



