遇见数据集

lopozz/CulturaViva-Retrieval

收藏
Hugging Face2026-04-20 更新2026-04-26 收录
官方服务:

资源简介:

--- dataset_info: - config_name: corpus features: - name: _id dtype: string - name: title dtype: string - name: text dtype: string splits: - name: train num_bytes: 314059992 num_examples: 51719 - name: test num_bytes: 34851568 num_examples: 5747 download_size: 190349876 dataset_size: 348911560 - config_name: qrels features: - name: query-id dtype: string - name: corpus-id dtype: string - name: score dtype: int64 splits: - name: train num_bytes: 2149978 num_examples: 51719 - name: test num_bytes: 216166 num_examples: 5747 download_size: 795963 dataset_size: 2366144 - config_name: queries features: - name: _id dtype: string - name: text dtype: string splits: - name: train num_bytes: 19445996 num_examples: 51719 - name: test num_bytes: 2137728 num_examples: 5747 download_size: 10734939 dataset_size: 21583724 configs: - config_name: corpus data_files: - split: train path: corpus/train-* - split: test path: corpus/test-* - config_name: qrels data_files: - split: train path: qrels/train-* - split: test path: qrels/test-* - config_name: queries data_files: - split: train path: queries/train-* - split: test path: queries/test-* --- ## Description **CulturaViva-Retrieval** is a dataset entirely conceived in its original Italian language, specifically designed to capture and enhance the complexity and cultural richness of the Italian language. Unlike traditional datasets derived from translations, CulturaViva-ITA draws directly from culture, literature, and history, offering linguistically accurate and culturally significant data. ## Reference & Citation For more information, visit the official repository: [DeepMount00/CulturaViva-ITA](https://huggingface.co/datasets/DeepMount00/CulturaViva-ITA) Please cite this dataset as follows: ```bibtex @misc{culturaviva-ita, author = {Michele, Montebovi}, title = {CulturaViva-ITA: An Authentically Italian Dataset for NLP}, year = {2025}, publisher = {Michele Montebovi}, url = {https://huggingface.co/datasets/DeepMount00/CulturaViva-ITA} } ``` ## License CulturaViva-ITA is released under the **Creative Commons Attribution 4.0 International (CC BY 4.0)** license.

数据集信息: - 配置名称:corpus 特征: - 字段名:_id,数据类型:字符串 - 字段名:title,数据类型:字符串 - 字段名:text,数据类型:字符串 数据集划分: - 划分名:train,字节数:314059992,样本数:51719 - 划分名:test,字节数:34851568,样本数:5747 下载大小:190349876,数据集总大小:348911560 - 配置名称:qrels 特征: - 字段名:query-id,数据类型:字符串 - 字段名:corpus-id,数据类型:字符串 - 字段名:score,数据类型:64位整数(int64) 数据集划分: - 划分名:train,字节数:2149978,样本数:51719 - 划分名:test,字节数:216166,样本数:5747 下载大小:795963,数据集总大小:2366144 - 配置名称:queries 特征: - 字段名:_id,数据类型:字符串 - 字段名:text,数据类型:字符串 数据集划分: - 划分名:train,字节数:19445996,样本数:51719 - 划分名:test,字节数:2137728,样本数:5747 下载大小:10734939,数据集总大小:21583724 数据集配置: - 配置名称:corpus,数据文件: - 划分:train,路径:corpus/train-* - 划分:test,路径:corpus/test-* - 配置名称:qrels,数据文件: - 划分:train,路径:qrels/train-* - 划分:test,路径:qrels/test-* - 配置名称:queries,数据文件: - 划分:train,路径:queries/train-* - 划分:test,路径:queries/test-* ## 数据集描述 **CulturaViva-Retrieval** 是一套完全以意大利语原生构建的数据集,专为捕捉并彰显意大利语的复杂性与文化丰度而打造。与传统的翻译衍生数据集不同,CulturaViva-ITA 直接取材于文化、文学与历史领域,提供具备语言学精准性与文化价值的高质量数据。 ## 参考文献与引用说明 如需获取更多信息,请访问官方仓库:[DeepMount00/CulturaViva-ITA](https://huggingface.co/datasets/DeepMount00/CulturaViva-ITA)。请按以下格式引用该数据集: bibtex @misc{culturaviva-ita, author = {Michele, Montebovi}, title = {CulturaViva-ITA: An Authentically Italian Dataset for NLP}, year = {2025}, publisher = {Michele Montebovi}, url = {https://huggingface.co/datasets/DeepMount00/CulturaViva-ITA} } ## 许可协议 CulturaViva-ITA 采用 **知识共享署名4.0国际版(CC BY 4.0)** 许可协议发布。

提供机构:
lopozz
二维码
社区交流群
二维码
科研交流群
商业服务