遇见数据集

ClassiCC-Corpus/curio-rewrite-non-edu-dataset

收藏
Hugging Face2026-05-11 更新2026-05-31 收录
官方服务:

资源简介:

Curio Rewrite — 非教育子集是一个葡萄牙语数据集,包含从ClassiCC采样的非教育网络文本,由Qwen2.5-7B-Instruct模型根据四种提示风格进行改写。该数据集是教育子集的配套数据,用于训练Curio改写模型。包含四个配置:easy(简单词汇、儿童友好改写)、medium(适度改写)、hard(复杂改写)和qa(重新格式化为问答形式),分别对应不同行数的改写文本。数据字段包括原始文本、文档ID、元数据、提示、提示类型、聚类ID、类别标签和改写文本。

Curio Rewrite — Non-Educational is a Portuguese dataset containing web texts (non-educational subset, sampled from ClassiCC) rewritten by Qwen2.5-7B-Instruct under four prompt styles. It serves as a companion to the educational subset and is used to train the Curio rewrite models. The dataset includes four configurations: easy (simple vocabulary, child-friendly paraphrase), medium (moderate paraphrase), hard (sophisticated paraphrase), and qa (reformatted as question/answer), each with a specified number of rows. Fields include original text, document ID, metadata, prompt, prompt type, cluster ID, category, and rewritten text.

提供机构:
ClassiCC-Corpus
二维码
社区交流群
二维码
科研交流群
商业服务