遇见数据集

cenfis/alpaca-turkish-combined

收藏
Hugging Face2024-05-17 更新2025-04-12 收录
官方服务:

资源简介:

--- dataset_info: features: - name: input dtype: string - name: output dtype: string - name: instruction dtype: string splits: - name: train num_bytes: 41821876 num_examples: 82353 download_size: 25783148 dataset_size: 41821876 configs: - config_name: default data_files: - split: train path: data/train-* license: apache-2.0 task_categories: - text-generation language: - tr size_categories: - 10K<n<100K --- **Combined Alpaca Turkish Dataset** This dataset is prepared as a combination of the following 4 datasets for experimental-educational purposes: - Open QA category of [atasoglu/databricks-dolly-15k-tr](https://huggingface.co/datasets/atasoglu/databricks-dolly-15k-tr) - [umarigan/GPTeacher-General-Instruct-tr](https://huggingface.co/datasets/umarigan/GPTeacher-General-Instruct-tr) - [TFLai/Turkish-Alpaca](https://huggingface.co/datasets/TFLai/Turkish-Alpaca) - [parsak/alpaca-tr-1k-longest](https://huggingface.co/datasets/parsak/alpaca-tr-1k-longest) Combined by [Yudum Paçin](https://huggingface.co/Yudum)

数据集信息: 特征: - 名称:input,数据类型:string - 名称:output,数据类型:string - 名称:instruction,数据类型:string 划分集: - 名称:train,字节数:41821876,样本数:82353 下载大小:25783148 数据集总大小:41821876 配置项: - 配置名称:default,数据文件: - 划分集:train,路径:data/train-* 许可证:Apache 2.0 任务类别: - 文本生成(text-generation) 语言: - 土耳其语(tr) 样本规模分类: - 10000 < 样本数 < 100000(即1万至10万之间) **联合阿尔帕卡土耳其语数据集(Combined Alpaca Turkish Dataset)** 本数据集为实验与教学用途,由以下4个数据集联合整合而成: - [atasoglu/databricks-dolly-15k-tr](https://huggingface.co/datasets/atasoglu/databricks-dolly-15k-tr) 的开放问答(Open QA)子集 - [umarigan/GPTeacher-General-Instruct-tr](https://huggingface.co/datasets/umarigan/GPTeacher-General-Instruct-tr) - [TFLai/Turkish-Alpaca](https://huggingface.co/datasets/TFLai/Turkish-Alpaca) - [parsak/alpaca-tr-1k-longest](https://huggingface.co/datasets/parsak/alpaca-tr-1k-longest) 本数据集由 [Yudum Paçin](https://huggingface.co/Yudum) 整合完成

提供机构:
cenfis
二维码
社区交流群
二维码
科研交流群
商业服务