丹麦Dynaword
收藏资源简介:
丹麦Dynaword是一个开源的大型丹麦语语料库,拥有超过48亿个标记,是同类数据集中最大的。它遵循可追溯的开放许可原则,数据来源清晰,并且通过社区协作不断更新。该数据集包含来自网络、书籍、电视等多种渠道的丹麦语文本,经过严格的质量检查,保证了数据质量。它可用于语言模型训练、自然语言处理研究等领域,并为开放数据社区提供了宝贵的资源。
Dynaword is an open-source large-scale Danish language corpus with over 4.8 billion tokens, making it the largest of its kind. It adheres to traceable open licensing principles, has clearly documented data sources, and is continuously updated via community collaboration. This corpus contains Danish text from diverse channels including the web, books, television and more, and has undergone strict quality inspections to ensure high data quality. It can be applied to fields such as language model training and natural language processing research, serving as a valuable resource for the open data community.
Danish Dynaword 数据集概述
数据集基本信息
- 名称: Danish Dynaword
- 版本: 1.2.7
- 语言: 丹麦语(dan, dansk, Danish)
- 许可证: 开放许可,具体取决于各子数据集
- 模型: 使用该数据训练的模型参见 danish-foundation-models
- 联系方式: 通过 讨论区 提问
数据集描述
- 语言: 丹麦语(dan-Latn, dan-Latn-bornholm, dan-Latn-synnejyl)
- 样本数量: 960.99K
- 令牌数量(Llama 3): 4.80B
- 平均文档长度(字符): 15322.53
数据集摘要
Danish Dynaword 是一个包含多个领域的丹麦语自由文本数据集的集合。所有数据集均为开放许可,适合用于训练大型语言模型。数据集会持续更新,欢迎贡献新数据集。
加载数据集
python from datasets import load_dataset name = "danish-foundation-models/danish-dynaword" ds = load_dataset(name, split="train")
领域分布
| 领域 | 来源数量 | 令牌数量 |
|---|---|---|
| 法律 | 7 | 2.32B |
| 书籍 | 8 | 732.52M |
| 对话 | 6 | 497.09M |
| 社交媒体 | 1 | 389.32M |
| 其他 | 4 | 340.59M |
| 网络 | 3 | 295.87M |
| 百科全书 | 2 | 127.35M |
| 新闻 | 3 | 60.63M |
| 医疗 | 1 | 27.07M |
| 朗读 | 1 | 7.30M |
| 方言 | 1 | 847.97K |
许可证分布
| 许可证类型 | 令牌数量 |
|---|---|
| CC-0 | 2.00B |
| CC-BY-SA 4.0 | 1.37B |
| 其他(无需署名) | 904.61M |
| 其他(需要署名) | 515.61M |
数据集结构
数据实例
python { "id": "adl_aakjaer06val", "text": "SAMLEDE VÆRKER...", "source": "adl", "added": "2020-09-14", "created": "1700-01-01, 2022-01-01", "token_count": 439908 }
数据字段
id: 文档唯一标识符text: 文档内容source: 数据来源added: 添加到集合的日期created: 文档创建日期范围token_count: 使用 Llama 8B 分词器计算的令牌数
数据分割
整个语料库仅提供 train 分割。
数据集创建
创建理由
收集和整理这些数据集旨在提供开放许可的丹麦语数据,主要用于开发语言模型,也可用于研究语言发展和领域差异。
注释
除每个样本的元数据外,一般不包含注释。
来源数据
包含多个来源的数据,如欧洲联盟法律文档、丹麦法律信息系统、挪威巨量语料库等,每个来源有各自的许可证。

- 1Dynaword: From One-shot to Continuously Developed Datasets丹麦奥胡斯大学, 丹麦亚历山大研究院, 哥本哈根大学, 南丹麦大学 · 2025年



