BiLit-CEFR
收藏资源简介:
BiLit-CEFR是一个平衡的双语文学复杂度数据集,包含英语和中文的段落级文学片段,标注了CEFR风格的难度等级(A/B/C)。该数据集旨在支持CEFR风格的可读性分类和多语言文本难度建模。数据字段包括文本段落、难度等级、语言标识和原始来源。英语子集包含约1,026个文学片段,通过CommonLit可读性模型、句法复杂性、稀有词汇比例和风格修改进行标注;中文子集包含600个文学片段,通过启发式规则(词汇层次和句法结构难度)进行标注。数据集来源包括39本英语文学书籍和16本中文文学书籍的节选,例如《尤利西斯》、《红楼梦》等。适用任务包括文本分类、可读性估计和多语言NLP。局限性包括中文标签为启发式标注和文学偏见。
BiLit-CEFR is a balanced bilingual literary complexity dataset containing paragraph-level literary fragments in English and Chinese, annotated with CEFR-aligned difficulty levels (A/B/C). This dataset aims to support CEFR-style readability classification and multilingual text difficulty modeling. Its data fields include text passages, difficulty levels, language identifiers, and original sources. The English subset contains approximately 1,026 literary fragments, annotated via the CommonLit Readability Model, syntactic complexity metrics, rare word ratio, and stylistic modification criteria. The Chinese subset includes 600 literary fragments, annotated using heuristic rules based on lexical hierarchy and syntactic structure difficulty. The dataset is sourced from excerpts of 39 English literary works and 16 Chinese literary works, such as *Ulysses* and *A Dream of Red Mansions*. Applicable tasks include text classification, readability estimation, and multilingual NLP. Limitations include heuristic annotation of Chinese labels and literary bias.
数据集概述:BiLit-CEFR 平衡双语文学复杂度数据集
基本信息
- 数据集名称:BiLit-CEFR(Balanced Bilingual Literary Complexity Dataset)
- 许可证:Apache-2.0
- 任务类型:文本分类(text-classification)
- 语言:英语(en)、中文(zh)
- 标签:文学(literature)、可读性(readability)
- 数据集大小:1,000 < 样本数 < 10,000
- 难度标签:CEFR 风格 A/B/C 三级
数据字段
- text:段落文本
- difficulty:难度等级(A/B/C)
- language:语言(en/zh)
- open_source_books:原始来源书籍
标注方法
- 英语:基于 CommonLit 可读性模型、句法复杂度、罕见词比例和文体修改综合评定
- 中文:基于启发式规则(词汇层级和句法结构难度)
数据集统计
-
英语子集:
- 总样本数:约 1,026 个文学段落
- 难度分布(不平衡):
- A:242 条
- B:354 条
- C:430 条
- 训练集:
en_train.jsonl(820 条) - 测试集:
en_test.jsonl(206 条)
-
中文子集:
- 总样本数:600 个文学段落
- 难度分布(平衡):
- A:200 条
- B:200 条
- C:200 条
- 训练集:
zh_train.jsonl(480 条) - 测试集:
zh_test.jsonl(120 条)
来源文献
数据集包含来自 39 部英语文学作品和 16 部中文文学作品的节选段落,并非完整书籍。
-
英语来源:
- 包含来自 ACOSharma 数据集(https://huggingface.co/datasets/ACOSharma/literature)的子集
- 以及古腾堡计划作品(用于平衡标签分布)
- 示例作品:尤利西斯、呼啸山庄、金银岛、世界大战、变形记、看得见风景的房间、麦加菲第一读本、鹅妈妈童谣、彼得兔的故事
-
中文来源:
- 示例作品:红楼梦、西游记、水浒传、三国演义、官场现形记、呐喊、背影、史记、狂人日记、朝花夕拾、骆驼祥子、寄小读者
使用场景
- 文本分类
- 可读性评估
- 多语言自然语言处理
限制与注意事项
- 中文标签基于启发式规则,可能不够精确
- 存在文学体裁偏差





