遇见数据集

Social Work Research Database (SWRD) 和 SSWR Conference Database

收藏
github2026-07-31 更新2026-07-23 收录
官方服务:

资源简介:

该项目维护两个精心整理的文献数据库:社会工作研究数据库(SWRD),涵盖该学科的期刊文献(1920-2025年);以及SSWR会议数据库,涵盖社会工作研究学会年会的报告(2005-2026年)。它们共同为科学计量分析、文献发现和学科知识生产研究提供了基础设施。

This repository maintains two curated bibliographic databases for documenting scholarly literature in social work: the Social Work Research Database (SWRD), which covers journal literature within the discipline, and the SSWR Conference Database, which covers presentations from the annual conference of the Society for Social Work and Research. These databases contain structured records including title, abstract, authors, affiliations, publication venue, year, and classification tags, rather than full texts. Each record links to the source article via a DOI. These databases provide infrastructure for scientometric analysis, literature discovery, and research on disciplinary knowledge production.

创建时间:
2026-07-14
原始信息汇总

《社会工作元数据项目》数据集详情

该项目维护了两个经过整理的文献数据库,旨在记录社会工作的学术成果,为科学计量分析、文献发现和学科知识生产研究提供基础设施。数据库包含结构化记录(标题、摘要、作者及所属机构、出版载体、年份、分类标签),并通过DOI链接到源文章,不提供全文。

数据集一:社会工作研究数据库

  • 覆盖范围88种学科内社会工作期刊,覆盖 1989–2025年 的文章。
  • 核心语料62,602篇 研究文章及其摘要,每篇文章均按科学传播类型(原创研究 vs. 社论/书评等)和方法论(定量、定性、混合方法、系统/其他综述)两个维度进行分类。
  • 补充历史语料:单独的历史收藏,包含 1920–1988年 来自同一期刊群体的 23,289条 记录,但此阶段覆盖不完整。
  • 总计记录数:核心语料与补充语料合计 87,329条 记录(1989–2025年)。
  • 其他信息:存储每篇文章的开放获取状态。

数据集二:社会工作与研究学会会议数据库

  • 覆盖范围全部 社会工作与研究学会(SSWR)年会报告,覆盖 2005–2026年所有会议
  • 核心语料:包含 23,793篇 报告(论文、海报、专题讨论会)及其摘要和研究方法分类。
  • 关键特点:对 21,209位 报告作者进行了跨年份的身份消歧,解决了姓名变体问题,支持纵向分析。

记录结构

两个数据库的记录共享相同结构,包含以下字段:

  • 标题:完整标题。
  • 作者:所有作者(含按序的机构归属)。
  • 载体:期刊(或会议)、年份、卷/期/页码。
  • 摘要:全文摘要(如可用)。
  • 分类:科学/非科学;方法论类别。
  • 标识符:DOI(文章的永久链接)。

已知局限

  • 社会工作研究数据库中的作者姓名 按出版时原样保留,尚未进行消歧;该作者级别的统计需谨慎对待。
  • 摘要覆盖不均:约72% 的1989年后记录包含摘要;分类标签仅在有摘要的记录上存在。
  • 补充历史语料 反映的是数字化幸存内容,而非完整出版记录,因此存在统计低估

数据版本与下载

  • 当前版本v1.0(2026年7月)
  • 下载方式:通过GitHub发布,无需注册。
    • 📗 社会工作研究数据库swrd-database-csv-v1.0.zip,27 MB):包含62,602篇文章语料、历史补充材料、额外记录、期刊、作者及关联表。
    • 📘 SSWR会议数据库sswr-database-csv-v1.0.zip,26 MB):包含全部23,793篇报告及摘要、方法论标签、消歧后的作者及作者链接。

语义搜索

两个数据库均支持基于语义的检索,即通过含义而非仅关键词匹配。每个摘要都已使用文本嵌入模型(EmbeddingGemma,3亿参数)进行编码。该模型可在标准硬件上本地运行,无需数据外传。

数据报告

如发现任何数据问题(如姓名变体、重复记录、缺失字段、错误分类),可通过GitHub提交问题,并附带能证明正确值的链接。

引用信息

  • 社会工作研究数据库

    Perron, B. E., Victor, B. G., & Qi, Z. (2026). Evolution of social work knowledge production over 35 years: An AI-enabled analysis of trends in empiricism, methodology, collaboration, citation patterns, and output. Research on Social Work Practice. https://doi.org/10.1177/10497315261416833

  • SSWR会议数据库

    Perron, B. E., Victor, B. G., & Qi, Z. (2026). AI-assisted curation of conference scholarship: Compiling, structuring, and analyzing two decades of presentations at the Society for Social Work and Research. arXiv. https://doi.org/10.48550/arXiv.2603.06814

搜集汇总
数据集介绍
Social Work Research Database (SWRD) 和 SSWR Conference Database 数据集图片
构建方式
社会工作元数据项目(Social Work Meta-Data Project)通过整合多源文献与会议记录,系统构建了两个专题书目数据库。社会工作研究数据库(SWRD)涵盖1989至2025年间88种社会工作核心期刊的学术论文,采用多源整合与去重策略,并借助监督式语言模型对每篇摘要的文献类型(如原创研究、评论等)及研究方法(定量、定性、混合方法或系统综述)进行标注,确保分类信度达到κ≥0.85。SSWR会议数据库则收录了2005至2026年社会工作研究学会(SSWR)年会的全部23793篇报告,包括论文、海报与专题讨论,通过官方会议项目整理并完成跨年份的作者身份消歧,使21209位第一作者的名称变体得以归并至唯一身份。
使用方法
用户可通过两种路径灵活使用该数据集。一种方式是直接下载GitHub发布的CSV压缩文件(如swrd-database-csv-v1.0.zip与sswr-database-csv-v1.0.zip),获取包含全部记录、作者信息及关联表的完整语料库,适用于本地分析与定量研究。另一种更快捷的方式是向AI助手(如Claude或ChatGPT)提供预置的技能文件(skill file),助手读取后即可通过内置公共访问密钥对数据库执行任意只读分析查询,支持语义搜索、关键词搜索或二者融合的检索模式,并能提取经筛选的记录子集,整个过程无需密码、账户或软件安装。语义搜索功能已预先嵌入——所有摘要的嵌入向量可在本地硬件上通过开放权重模型直接计算,无需外部服务。
背景与挑战
背景概述
社会科学研究领域长期面临着知识生产体系碎片化、文献检索效率低下的困境,尤其在社会工作这一兼具实践性与学科交叉性的领域,系统性的元数据基础设施尤为匮乏。为弥合这一鸿沟,Brian Perron、B. G. Victor与Z. Qi等研究者于2026年构建了社会工作元数据项目,涵盖社会工作研究数据库与SSWR会议数据库。SWRD收录了1989至2025年间88种专业社会工作期刊的62,602篇核心研究论文,并通过监督语言模型对每篇摘要进行了科学沟通类型与研究方法论的双维分类,验证达到较高信度。SSWR会议数据库则囊括2005至2026年间全部23,793场学会报告,并实现了作者身份的跨年度消歧。这一基础设施为科学计量分析、文献发现及学科知识生产规律的研究提供了前所未有的结构化支撑,对推动社会工作领域的数据驱动型科学评估与知识整合产生了深远影响。
当前挑战
在领域层面,社会工作知识生产的演化轨迹长期缺乏精确的量化刻画,传统关键词检索难以跨越同义或多义概念间的语义鸿沟,导致系统性文献综述与趋势分析常受限于检索偏差。构建过程中,SWRD面临多源数据整合与去重的技术难题,且约28%的早期记录缺乏摘要,迫使分类标签仅能覆盖有摘要的条目;作者姓名在期刊中呈现的变体未做消歧处理,使得基于作者层面的统计分析需审慎解释。此外,1920至1988年间的补充数据因数字化回溯的局限性而存在严重覆盖不全,需将其计数解读为下限,这为历史性纵向比较设置了方法论挑战。SSWR会议数据库虽实现了作者消歧,但不同年份程序记录格式的异构性亦增加了数据清洗与标准化的难度。上述挑战共同制约着数据库在复杂科学计量分析中的完整应用,亟待持续的数据校正与功能扩展。
常用场景
经典使用场景
在社会工作学科蓬勃发展、知识生产日益系统化的背景下,该数据集为科学计量学与学术文献挖掘提供了标准化的基础设施。研究者可依托SWRD与SSWR数据库,对1989年至2025年间数十种核心期刊的六万余篇研究文章,以及两万余篇会议报告进行大规模结构化分析。其经典使用场景涵盖跨年代的学科知识图谱绘制、方法论演进的纵向追踪、作者合作网络与机构影响力的定量评估,以及基于语义嵌入的主题检索,显著提升了文献回顾与趋势解析的精准性与可复现性。
解决学术问题
该数据集直面社会工作领域长期存在的元数据碎片化与非标准化难题,系统性地解决了学术文献检索偏差、研究主题界定模糊、方法论分类不一致等关键问题。通过引入经人工验证的监督式语言模型对每篇摘要进行科学属性与研究方法分类,有效弥补了传统关键词检索在语义覆盖上的不足。其意义在于为学科内实证研究比例、署名合作密度、开放获取趋势等宏观计量指标的严谨推断提供了可靠数据基底,推动了社会工作知识生产模式从描述性回顾向数据驱动型科学计量的范式跃迁。
实际应用
在实际应用中,该数据集成为政策制定者与实务研究者决策支持的有力工具。通过语义搜索功能,社工机构可快速定位特定弱势群体(如寄养照料者、精神健康康复者)的研究证据,避免因术语差异导致证据遗漏。教育者能借助作者身份消歧与机构关联数据,追踪专业人才培养轨迹与科研产出格局。此外,数据集的版本化更新机制使得持续监测学科演变、评估干预研究的方法论分布、识别新兴实践领域成为可能,为循证社会工作的落地提供了透明、可更新的文献基础设施。
数据集最近研究
最新研究方向
在社会工作领域,随着AI赋能的文献计量学与知识生产分析成为前沿热点,Social Work Research Database (SWRD) 与 SSWR Conference Database 的构建为学科演进提供了系统性数据基础设施。近期研究聚焦于利用监督语言模型对六万余篇期刊文章与两万余篇会议报告进行方法论与科学传播的分类标注,揭示出实证研究占比从1990年代的43%跃升至2020年代的72%、合作作者数从1.85增至3.35等核心趋势。该数据库通过嵌入语义检索技术突破传统关键词匹配局限,使关于‘亲属照料’的查询能精准召回表述为‘亲属照顾者’的相关文献。这一开放、可复现的元数据资源不仅赋能了学者轨迹追踪与研究空白识别,更推动了社会工作知识生产的透明化与科学化评估,为应对学科内数据碎片化挑战提供了范式级解决方案。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务