🤗Datasets
收藏资源简介:
🤗Datasets是一个轻量级且可扩展的库,用于轻松共享和访问自然语言处理(NLP)及其他领域的数据集和评估指标。它具有与NumPy、pandas、PyTorch和Tensorflow 2的内在互操作性,轻量级且快速,具有透明和pythonic的API,并能处理大型数据集,默认情况下将所有数据集内存映射到驱动器上,以避免RAM内存限制。
🤗Datasets is a lightweight and extensible library designed for the effortless sharing and accessing of datasets and evaluation metrics in natural language processing (NLP) and other fields. It features intrinsic interoperability with NumPy, pandas, PyTorch, and TensorFlow 2, is lightweight and fast, offers a transparent and pythonic API, and is capable of handling large datasets by default memory-mapping all datasets to the drive to circumvent RAM memory limitations.
数据集概述
数据集名称
🤗Datasets
数据集描述
🤗Datasets是一个轻量级且可扩展的库,用于轻松共享和访问自然语言处理(NLP)及其他领域的数据集和评估指标。
主要特性
- 内置与NumPy、pandas、PyTorch和TensorFlow 2的互操作性
- 轻量级且快速,具有透明和Pythonic的API
- 适用于大型数据集,默认情况下数据集在驱动器上内存映射,不受RAM限制
- 智能缓存,避免重复处理数据
数据集内容
- 目前提供约100个NLP数据集和约10个评估指标
- 可通过实时数据集查看器浏览完整数据集集合
使用方法
datasets.list_datasets():列出可用数据集datasets.load_dataset(dataset_name, **kwargs):实例化数据集datasets.list_metrics():列出可用评估指标datasets.load_metric(metric_name, **kwargs):实例化评估指标
安装
通过PyPi安装,需在虚拟环境中进行: bash pip install datasets
兼容性
与PyTorch(1.0+)、TensorFlow(2.2+)和pandas兼容。
贡献者
数据集的开发和维护由社区贡献者共同完成。
免责声明
数据集下载和准备由用户自行负责,数据集的版权和使用许可需用户自行确认。




