遇见数据集

divyajot5005/plora-clean-summarization

收藏
Hugging Face2026-05-19 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是一个用于本地PLoRA notebook的缓存、长度过滤的训练包。它包含提示/答案记录,这些记录的完整Qwen聊天格式序列长度最多为4096个令牌。支持的语言包括:印地语(Hindi)、法语(French)、中文(Chinese)、乌尔都语(Urdu)、英语(English)、荷兰语(Dutch)、波兰语(Polish)、信德语(Sindhi)、孟加拉语(Bengali)和马拉地语(Marathi)。记录数量为:训练记录100,000条,验证记录8,781条,每种语言的训练目标记录为10,000条。用于过滤的模型分词器是Qwen/Qwen3-4B-Instruct-2507,种子值为42。每个JSONL行至少包含以下字段:prompt、target、probe_text、lang、language、source_dataset、source_id、source_split、source_row、source_item_id、full_chat_token_length、clean_index和clean_language_index。

许可证:other 任务类别:摘要(summarization) 语言:英语(en)、法语(fr)、简体中文(zh)、荷兰语(nl)、波兰语(pl)、信德语(sd)、印地语(hi)、孟加拉语(bn)、马拉地语(mr)、乌尔都语(ur) 标签:PLoRA(plora)、多语言(multilingual)、经长度过滤(length-filtered)、Qwen(qwen) 美观名称:PLoRA 清洗版多语言摘要数据集(PLoRA Clean Multilingual Summarization) # PLoRA 清洗版多语言摘要数据集(PLoRA Clean Multilingual Summarization) 本数据集为本地PLoRA笔记本的缓存型、经长度过滤的训练数据集包,内含提示-回答样本对,其完整Qwen对话格式序列的Token数至多为4096。 ## 涵盖语言 印地语(hin_Deva)、法语(fra_Latn)、简体中文(cmn_Hans)、乌尔都语(urd_Arab)、英语(eng_Latn)、荷兰语(nld_Latn)、波兰语(pol_Latn)、信德语(snd_Arab)、孟加拉语(ben_Beng)、马拉地语(mar_Deva) ## 样本统计 - 训练样本:100,000条 - 验证样本:8,781条 - 单语言目标训练样本量:10,000条 - 用于长度过滤的模型分词器:`Qwen/Qwen3-4B-Instruct-2507` - 随机种子:`42` 单条JSONL样本至少包含以下字段: - `prompt`(提示文本) - `target`(目标摘要) - `probe_text`(探测文本) - `lang`(语言代码) - `language`(语言名称) - `source_dataset`(源数据集标识) - `source_id`(源数据ID) - `source_split`(源数据划分) - `source_row`(源数据行) - `source_item_id`(源数据条目ID) - `full_chat_token_length`(完整对话Token长度) - `clean_index`(清洗索引) - `clean_language_index`(清洗语言索引) ### 上传后加载方式 python from datasets import load_dataset repo_id = "YOUR_USERNAME/plora-clean-summarization-qwen3-4096" ds = load_dataset( repo_id, data_files={ "train": "data/train/*.jsonl", "validation": "data/validation/*.jsonl", }, ) 完整构建清单存储于`metadata/build_manifest.json`文件中。

提供机构:
divyajot5005
二维码
社区交流群
二维码
科研交流群
商业服务