相关数据集
google/civil_comments
该数据集包含来自Civil Comments平台的公开评论,该平台是一个独立新闻网站的评论插件。这些评论创建于2015年至2017年之间,出现在全球大约50个英文新闻网站上。当Civil Comments在2017年关闭时,他们选择将这些公开评论保存在一个持久的开放档案中,以便未来的研究使用。原始数据包括公开评论文本、一些相关的元数据(如文章ID、时间戳和评论者生成的“文明”标签),但不包括用户I
Hugging Face2024-01-25 更新1380
google/bigbench
该数据集是一个多任务、多语言的自然语言处理数据集,涵盖了多项选择、问答、文本分类、文本生成等多种任务。数据集由众包、专家生成和机器生成的方式创建,支持多种语言,并遵循Apache 2.0许可证。数据集包含多个配置,每个配置都有详细的特征描述和数据集大小信息。
Hugging Face2024-01-18 更新1020
google/code_x_glue_cc_clone_detection_big_clone_bench
CodeXGLUE克隆检测-BigCloneBench数据集,用于训练模型以判断两个给定的Java方法是否为彼此的克隆。给定两个代码作为输入,任务是对其进行二元分类(0/1),其中1表示语义等价,0表示其他情况。模型通过F1分数进行评估。该数据集基于BigCloneBench,并按照论文《Detecting Code Clones with Graph Neural Network and Flo
Hugging Face2024-01-24 更新710
google/quickdraw
该数据集名为Quick, Draw!,主要用于图像分类任务。数据集包含大量由众包生成的绘图数据,涵盖了多种物体和场景。数据集为单语种(英语),并提供了多种配置,包括原始数据、简化绘图和位图预处理版本。每个配置都有特定的特征和数据集划分。
Hugging Face2024-08-27 更新1320
google/wit
--- annotations_creators: - machine-generated language_creators: - found language: - af - ar - ast - azb - be - bg - bn - br - ca - cs - cy - da - de - el - en - eo - es - et - eu - fa - fi - fr - fy
Hugging Face2022-07-04 更新970



