danish-foundation-models/swedish-dynaword
收藏资源简介:
Swedish Dynaword 是一个收集自多个领域的瑞典语自由文本数据集集合,所有数据集均采用开放许可证,被认为适合用于训练大语言模型。该数据集持续开发,会随着新数据集的可用性而主动更新。数据集包含来自不同领域的文本,如报告、新闻和法律等,具体包括政府调查报告、议会辩论协议、委员会报告、议会动议、叙事和账目、政府调查文本、议会信件和通信等。数据来源于多个公开资源,例如Statens offentliga utredningar(政府调查报告)、Riksdagen propositioner(政府法案和议会信件)、Riksdagen protokoll(议会辩论协议)等。数据集使用CC-BY 4.0许可证,并包含约187.17K个样本,总令牌数约为3.21B(基于Llama 3分词器),平均文档长度在17.17K令牌(范围从21到4.06M令牌)。数据集支持通过HuggingFace的datasets库加载,可以整体或按子集(如lag1800、riksdagen-protokoll等)加载,并支持流式处理。
The Swedish dynaword is a collection of Swedish free-form text datasets from various domains. All of the datasets in the Swedish Dynaword are openly licensed and deemed permissible for training large language models. Swedish dynaword is continually developed, which means that the dataset will actively be updated as new datasets become available.




