遇见数据集

Blablablab/SOCKET

收藏
Hugging Face2023-11-12 更新2024-03-04 收录
官方服务:

资源简介:

--- license: cc-by-4.0 --- # Dataset Card for Dataset Name ## Dataset Description - **Homepage:** - **Repository: https://github.com/minjechoi/SOCKET - **Paper: Do LLMs Understand Social Knowledge? Evaluating the Sociability of Large Language Models with SocKET Benchmark [link](https://arxiv.org/abs/2305.14938) - **Leaderboard:** - **Point of Contact:** ### Dataset Summary This Dataset contains the tasks used in the paper "Do LLMs Understand Social Knowledge? Evaluating the Sociability of Large Language Models with SocKET Benchmark" [link](https://arxiv.org/abs/2305.14938). ### Supported Tasks and Leaderboards [More Information Needed] ### Languages English ## Dataset Structure ### Data Instances [More Information Needed] ### Data Fields [More Information Needed] ### Data Splits [More Information Needed] ## Dataset Creation This benchmark is created by aggregating several existing NLP datasets that measure different aspects of social information. ### Curation Rationale [More Information Needed] ### Source Data #### Initial Data Collection and Normalization [More Information Needed] #### Who are the source language producers? [More Information Needed] ## Considerations for Using the Data ### Social Impact of Dataset [More Information Needed] ### Discussion of Biases [More Information Needed] ### Other Known Limitations [More Information Needed] ## Additional Information ### Dataset Curators [More Information Needed] ### Licensing Information [More Information Needed] ### Citation Information @misc{choi2023llms, title={Do LLMs Understand Social Knowledge? Evaluating the Sociability of Large Language Models with SocKET Benchmark}, author={Minje Choi and Jiaxin Pei and Sagar Kumar and Chang Shu and David Jurgens}, year={2023}, eprint={2305.14938}, archivePrefix={arXiv}, primaryClass={cs.CL} } ### Contributions [More Information Needed]

--- 许可证:cc-by-4.0 --- # 数据集卡片(Dataset Card) ## 数据集说明 - **项目主页:** - **代码仓库:** https://github.com/minjechoi/SOCKET - **论文:** 《大语言模型(Large Language Model)能否理解社交知识?基于SocKET基准评估大语言模型的社交能力》[链接](https://arxiv.org/abs/2305.14938) - **排行榜:** - **联系方式:** ### 数据集概述 本数据集包含论文《大语言模型能否理解社交知识?基于SocKET基准评估大语言模型的社交能力》[链接](https://arxiv.org/abs/2305.14938)中使用的评测任务。 ### 支持任务与排行榜 [需补充更多信息] ### 语言 英语 ## 数据集结构 ### 数据实例 [需补充更多信息] ### 数据字段 [需补充更多信息] ### 数据划分 [需补充更多信息] ## 数据集构建 本基准数据集通过整合多个现有自然语言处理(Natural Language Processing,简称NLP)数据集构建而成,这些数据集用于衡量社交信息的不同维度。 ### 数据集遴选依据 [需补充更多信息] ### 源数据 #### 初始数据收集与标准化 [需补充更多信息] #### 源数据的语言生产者是谁? [需补充更多信息] ## 数据集使用注意事项 ### 数据集的社会影响 [需补充更多信息] ### 偏见讨论 [需补充更多信息] ### 其他已知局限性 [需补充更多信息] ## 附加信息 ### 数据集策展人 [需补充更多信息] ### 许可证信息 [需补充更多信息] ### 引用信息 tex @misc{choi2023llms, title={Do LLMs Understand Social Knowledge? Evaluating the Sociability of Large Language Models with SocKET Benchmark}, author={Minje Choi and Jiaxin Pei and Sagar Kumar and Chang Shu and David Jurgens}, year={2023}, eprint={2305.14938}, archivePrefix={arXiv}, primaryClass={cs.CL} } ### 贡献内容 [需补充更多信息]

提供机构:
Blablablab
原始信息汇总

数据集概述

数据集描述

  • 名称: Dataset Name
  • 语言: 英语
  • 摘要: 本数据集包含用于论文《Do LLMs Understand Social Knowledge? Evaluating the Sociability of Large Language Models with SocKET Benchmark》中的任务。

数据集结构

  • 创建方式: 该基准是通过聚合多个测量不同社会信息方面的现有NLP数据集创建的。

许可证

  • 许可证: cc-by-4.0

引用信息

@misc{choi2023llms, title={Do LLMs Understand Social Knowledge? Evaluating the Sociability of Large Language Models with SocKET Benchmark}, author={Minje Choi and Jiaxin Pei and Sagar Kumar and Chang Shu and David Jurgens}, year={2023}, eprint={2305.14938}, archivePrefix={arXiv}, primaryClass={cs.CL} }

搜集汇总
数据集介绍
Blablablab/SOCKET 数据集图片
构建方式
SOCKET数据集的构建源于对大型语言模型社会性理解能力的系统评估需求。研究者从现有自然语言处理数据集中精挑细选,整合了多个衡量社会信息不同维度的任务,形成了一套综合性的基准测试。这些任务覆盖了从情感识别到社交常识推理的广泛范畴,确保了数据集在评估模型社会知识时的全面性与多样性。通过聚合多元数据源,SOCKET旨在提供一个统一的评估框架,以揭示模型在社会性理解方面的优势与局限。
特点
该数据集的核心特色在于其聚焦于社会知识这一高阶认知能力,超越了传统的语言理解任务。SOCKET包含一系列精心设计的子任务,每个子任务均针对社会信息的特定方面,如意图推断、社会规范遵守及情感共鸣等。这种多维度的设计使得SOCKET不仅能够评估模型的表面语言处理能力,更能深入探测其对复杂社交动态的把握程度,从而为理解人工智能的社会性提供独特视角。
使用方法
使用SOCKET数据集时,研究者需将其作为评估模型社会知识掌握情况的基准。数据集以英文形式呈现,可直接加载至模型训练或测试流程中。用户应依据各子任务的具体要求,对模型进行输入输出适配,例如通过提示工程或微调方式,使模型完成如社会情境分类或社交推理等任务。结果可通过与人类标注基准对比,量化模型在社会性理解上的表现,进而指导后续的模型优化与社交智能提升。
背景与挑战
背景概述
在自然语言处理领域,大型语言模型(LLMs)的飞速发展引发了对其社会认知能力的广泛关注。2023年,由Minje Choi、Jiaxin Pei、Sagar Kumar、Chang Shu和David Jurgens等研究人员共同提出的SocKET基准(Social Knowledge Evaluation Toolkit),旨在系统评估LLMs对社会知识的理解程度。该基准通过整合多个现有自然语言处理数据集,构建了一个涵盖社会信息多维度评估的任务集合,其核心研究问题在于揭示LLMs是否具备类似人类的社交智能,例如理解情感、意图、社会规范等。SocKET的发布为相关领域提供了标准化的评估框架,推动了社会常识推理与语言模型交叉研究的深入发展,对探究AI系统的社会适应性具有重要影响力。
当前挑战
SocKET基准面临的主要挑战包括:首先,领域问题层面,LLMs对社会知识的理解涉及情感识别、意图推断、社会关系解析等复杂认知任务,现有模型往往在隐含社会语境、文化差异和模糊语义的处理上表现不足,难以捕捉细微的社会信号。其次,构建过程中,基准整合了多个来源的数据集,这些数据集在标注粒度、任务定义和评估标准上存在不一致性,导致统一度量困难。此外,社会知识本身具有动态性和主观性,如何设计覆盖广泛社会场景且避免文化偏见的任务集合,是数据集构建的关键难点。最后,模型在SocKET上的表现易受训练数据中社会偏见的影响,如何确保评估结果的公平性和鲁棒性,仍是亟待解决的挑战。
常用场景
经典使用场景
在自然语言处理与社会智能交叉的研究领域中,SOCKET基准数据集被广泛用于评估大型语言模型(LLMs)对社会知识的理解能力。该数据集整合了多个现有NLP任务,涵盖情感识别、意图推断、社会关系感知等维度,为衡量模型在社交情境下的推理表现提供了标准化测试平台。研究者通常利用SOCKET对模型进行多任务评估,以揭示其在理解隐含社会规范、人际动态及情感细微差异方面的局限性,从而推动语言模型向更具社会感知能力的方向演进。
解决学术问题
SOCKET数据集的核心贡献在于填补了学术界对LLMs社会认知能力系统性评估的空白。此前,尽管语言模型在诸多任务上表现优异,但其是否真正掌握人类社会的隐性知识(如礼貌策略、讽刺识别或权力关系判断)仍属未知。SOCKET通过聚合多样化的社交推理任务,量化了模型在复杂社会情境中的表现短板,揭示了当前模型在常识性社会理解上的脆弱性。这一发现促使研究者重新审视预训练目标的局限性,并催生了针对社会知识注入的模型改进策略,对理解语言智能的本质具有深远理论意义。
衍生相关工作
SOCKET的出现催生了多项相关研究,包括对社会知识增强型模型的探索、跨语言社会理解能力的对比分析以及针对特定社会推理任务的微调方法。例如,后续工作基于SOCKET任务集设计了对模型社会偏见进行干预的训练策略,或将其与知识图谱结合以提升模型对人际关系动态的建模能力。此外,该基准也被用于评估指令微调对社会感知的影响,以及对比不同规模模型在社交推理上的涌现特性,这些衍生工作共同深化了学界对语言模型社会智能边界与提升路径的理解。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务