相关数据集
copenlu/wiki-stance
Wiki-Stance数据集是一个多语言数据集,基于英语、德语和土耳其语的维基百科文章删除讨论,涵盖了2005年至2022年的数据。该数据集旨在支持维基百科的内容审核,通过检测讨论中的立场并预测相关政策。数据集包含讨论中的评论、编辑的立场标签(保留、删除、合并、评论)以及相关的维基百科政策。数据集的创建过程包括从维基百科API中检索删除讨论、筛选提及政策的评论、合并相似政策、去除评论中的政策提及等
Hugging Face2024-05-17 更新820
copenlu/llm-pct-tropes
LLM Tropes数据集是在论文《Revealing Fine-Grained Values and Opinions in Large Language Models》中引入的,主要用于分析大型语言模型(LLMs)中嵌入的偏见和价值观。数据集包含多个配置文件,分别对应不同的数据分割和生成设置。数据集的列名描述详细说明了每个字段的含义,包括人口统计信息、模型生成配置、生成文本等。数据集的创建目的
Hugging Face2024-07-03 更新240
copenlu/cmt-benchmark-counterfact
CounterFact数据集是cmt-benchmark项目的一部分,基于Meng等人于2022年提出的流行CounterFact数据集。该数据集从Pythia 6.9B的参数记忆中采样了899个CounterFact样本,并包含与GPT-2 XL参数记忆匹配的546个样本。数据集包含两种版本:gpt2-xl和pythia-6.9b,每个版本都有对应的验证集和测试集。数据集的样本基于(主题、关系、
Hugging Face2025-04-09 更新170
copenlu/citeworth
CiteWorth数据集是一个用于检测科学文档中引用价值(cite-worthiness)的英文数据集。该数据集基于S2ORC数据集构建,包含了大量从科学文档中提取的纯文本数据,并经过严格的清理和标注。数据集的主要任务是文本分类,具体是判断一个句子是否引用了外部来源。数据集的创建过程在相关论文中有详细描述,且数据集的质量高、具有挑战性,适合用于研究领域适应等问题。
Hugging Face2022-08-17 更新320
copenlu/scientific-exaggeration-detection
公众对科学的信任依赖于科学论文的诚实和事实性沟通。然而,最近的研究表明,新闻媒体倾向于通过夸大其发现来歪曲科学论文。鉴于此,我们提出了科学沟通中夸大检测问题的形式化和研究。虽然有许多科学论文和关于它们的流行媒体文章,但很少有文章直接链接到原始论文,这使得数据收集具有挑战性。我们通过从现有的专家注释研究中整理出一组标记的新闻稿/摘要对来解决这个问题,这些对适用于在任务上对机器学习模型的性能进行基准测
Hugging Face2024-07-03 更新230



