相关数据集
Ego-R1-Data
Ego-R1 Data是一个综合性的数据集,旨在帮助训练用于工具增强推理和强化学习的大型语言模型。该数据集包含两部分:Ego-CoTT-25K,包含25,000个用于监督微调(SFT)的链式工具思维示例;Ego-QA-4.4K,包含4,400个用于强化学习(RL)训练的问题-答案对。数据集经过后处理,以适应大型语言模型训练的需要,并提供了不同的数据格式以供不同的训练场景使用。
Hugging Face2025-06-10 更新470
cassanof/Capybara-code
capybara数据集经过过滤,仅包含包含代码的对话(通过检测Markdown代码块的存在)。数据集的特征包括source和conversation,其中conversation是一个列表,包含input和output两个字段。数据集只有一个train分割,包含1314个示例,文件大小为7680536字节,下载大小为3402523字节。
Hugging Face2024-01-12 更新80
reyhanehrhp7/Jigsaw_partB_language_head
该数据集包含两个特征:提示(prompt)和完成(completion),均为字符串类型。数据集分为训练集、验证集和测试集三个部分,其中训练集包含1623个示例,验证集和测试集各包含203个示例。数据集的总大小为614308字节,下载大小为271617字节。
Hugging Face2025-10-17 更新60
hlillemark/c4_t5_pretrain
--- dataset_info: features: - name: input_ids sequence: int32 - name: labels sequence: int64 splits: - name: validation num_bytes: 53400000 num_examples: 10000 - name: trai
Hugging Face2023-05-22 更新80
freococo/myanmar-written-corpus
缅甸书面语料库是一个包含高质量缅甸书面文本的全面集合,用于支持缅甸自然语言处理(NLP)的研究和开发。该语料库包含1000万句文本,采用Parquet格式,并遵循CC0 1.0许可协议。它适用于训练NLP模型、文本转语音、自动语音识别、机器翻译和文本生成等多种应用。
Hugging Face2025-05-22 更新70



