🤗Datasets
收藏资源简介:
🤗Datasets是一个轻量级且可扩展的库,用于轻松共享和访问自然语言处理(NLP)及其他领域的数据集和评估指标。它具有与Numpy、Pandas、PyTorch和Tensorflow 2的内在互操作性,设计为轻量级且快速,具有透明和Pythonic的API。该库专为处理大型数据集而设计,默认情况下将数据集内存映射到驱动器,从而不受RAM内存限制。此外,它还具有智能缓存功能,确保数据处理的高效性。
🤗Datasets is a lightweight and extensible library for effortlessly sharing and accessing datasets and evaluation metrics in natural language processing (NLP) and other domains. It offers native interoperability with NumPy, Pandas, PyTorch and TensorFlow 2, is designed to be lightweight and fast, and provides a transparent, Pythonic API. This library is tailored for handling large-scale datasets, and by default memory-maps datasets to storage, thus eliminating RAM memory constraints. Additionally, it features intelligent caching to ensure efficient data processing.
数据集概述
🤗Datasets 是一个轻量级且可扩展的库,用于轻松共享和访问自然语言处理(NLP)及其他领域的数据集和评估指标。该库具有以下特点:
- 兼容性:与NumPy、Pandas、PyTorch和TensorFlow 2兼容。
- 性能:轻量级且快速,API透明且Pythonic。
- 处理大数据:自然地释放用户从RAM内存限制,所有数据集默认内存映射在驱动器上。
- 智能缓存:数据处理多次时无需等待。
数据集和评估指标
🤗Datasets 目前提供对约100个NLP数据集和约10个评估指标的访问,并设计为让社区轻松添加和共享新的数据集和评估指标。可以通过实时数据集查看器浏览完整的数据集集合。
使用方法
使用🤗Datasets非常简单,主要方法包括:
datasets.list_datasets():列出可用的数据集。datasets.load_dataset(dataset_name, **kwargs):实例化一个数据集。datasets.list_metrics():列出可用的评估指标。datasets.load_metric(metric_name, **kwargs):实例化一个评估指标。
安装与使用
🤗Datasets 可以通过PyPi安装,并应在虚拟环境中安装(例如venv或conda)。对于使用PyTorch、TensorFlow或pandas的用户,还需要安装相应的库。详细的使用方法和安装指南可在文档中找到。
注意事项
与Tensorflow Dataset类似,🤗Datasets 是一个实用库,用于下载和准备公共数据集。用户需自行确定是否有权根据数据集的许可证使用数据集。如需更新数据集信息或不希望数据集包含在此库中,请通过GitHub问题联系。




