scit
收藏资源简介:
SCIT - Simple Culture - IT 是一个关于意大利文化概念和实体的简单事实性问题集合,数据通过合成方式生成(基于模板和开放SLM)。数据集包含两种配置:high_popularity(59,725个测试样本)和high_popularity_1K(1,244个测试样本,设为默认配置)。主要特征包括:id(大字符串)、wiki_id(int64)、标题(大字符串)、问题(大字符串)、证据(大字符串)、is_person(布尔值)、2023-2026年浏览量(int64)、语言链接数量(int64)和语言链接内容(大字符串)。high_popularity_1K配置额外包含band(大字符串)特征。数据集适用于文化相关的事实问答任务和自然语言处理研究。
SCIT - Simple Culture - IT is a collection of simple factual questions focused on Italian cultural concepts and entities. The dataset is synthetically generated using templates and open SLMs. It includes two configurations: high_popularity (with 59,725 test samples) and high_popularity_1K (with 1,244 test samples, designated as the default configuration). Its core features include: id (large string), wiki_id (int64), title (large string), question (large string), evidence (large string), is_person (boolean), 2023–2026 page views (int64), number of language links (int64), and language link content (large string). The high_popularity_1K configuration additionally includes the band (large string) feature. This dataset is suitable for cultural-related factual question answering tasks and natural language processing research.
SCIT - Simple Culture - IT 数据集概述
数据集基本信息
- 数据集名称:SCIT - Simple Culture - IT
- 数据集地址:https://huggingface.co/datasets/lukfre/scit
- 数据集描述:一个关于意大利文化概念和实体的简单事实性问题的集合,通过合成方式生成(基于模板和开放SLMs)。
数据集配置
数据集包含两种配置。
配置一:high_popularity
- 配置名称:high_popularity
- 数据特征:
id(large_string)wiki_id(int64)title(large_string)question(large_string)evidence(large_string)is_person(bool)views_2023-2026(int64)n_langlinks(int64)langlinks(large_string)
- 数据划分:
- 划分名称:test
- 样本数量:59725
- 字节大小:31794343
- 下载大小:17285153
- 数据集大小:31794343
配置二:high_popularity_1K
- 配置名称:high_popularity_1K
- 是否为默认配置:是
- 数据特征:
band(large_string)id(large_string)wiki_id(int64)title(large_string)question(large_string)evidence(large_string)is_person(bool)views_2023-2026(int64)n_langlinks(int64)langlinks(large_string)
- 数据划分:
- 划分名称:test
- 样本数量:1244
- 字节大小:657936
- 下载大小:375481
- 数据集大小:657936




