soketlabs/bhasha-wiki-indic-context

Name: soketlabs/bhasha-wiki-indic-context
Creator: soketlabs
Published: 2024-04-10 03:38:55
License: 暂无描述

Hugging Face2024-04-10 更新2024-06-11 收录

下载链接：

https://hf-mirror.com/datasets/soketlabs/bhasha-wiki-indic-context

下载链接

链接失效反馈

官方服务：

资源简介：

该数据集是从维基百科的英文文章中筛选、清理并翻译成六种印度语言的印度相关内容。每个样本包含一篇清理后的维基百科文章及其在六种印度语言中的翻译。数据集主要用于预训练需要印度知识和上下文理解的语言模型。

提供机构：

soketlabs

原始信息汇总

数据集名称： Bhasha Wiki Indic Context

数据集描述： 该数据集包含与印度相关的维基百科文章。数据源自wikimedia/wikipedia，经过筛选、清洗和翻译，提取出与印度及印度语境相关的英文文章，并翻译成6种印度语言。

语言：

数据结构：

数据格式：

用途： 主要用于预训练大型语言模型（LLMs），特别是需要印度知识和语境理解的场景。

来源数据： 维基百科英文文章

数据处理：

注意事项： 尽管已尽力筛选，但可能仍包含少量非印度语境的文章。

许可证： cc-by-sa-3.0

5,000+

优质数据集

54 个

任务类型

进入经典数据集