遇见数据集

AutoEmailSender-MentorData

收藏
github2026-08-03 更新2026-08-04 收录
官方服务:

资源简介:

这里汇集高校官网公开的导师职业信息,供 Auto Email Sender 用户直接浏览和导入。

This dataset compiles publicly available professional information of academic supervisors published on official university websites, for direct browsing and import by users of Auto Email Sender.

创建时间:
2026-08-03
原始信息汇总

数据集概述

本数据集是 Auto Email Sender 社区导师库,汇集了高校官网公开的导师职业信息,供 Auto Email Sender 用户直接浏览和导入。

数据内容

  • 数据类型:高校导师职业信息,包括姓名、公开工作邮箱、职称、任职机构、研究方向、少量代表论文标题、官方个人主页和证据来源页。
  • 数据组织:正式数据按学校和学院发布为小型、版本化的 JSON 分片;投稿使用 XLSX 或 CSV 附件。
  • 数据来源:所有信息均源自高校、学院、系所、研究院或实验室的官方网站,每条记录保留高校官方来源、GitHub 贡献者和投稿 Issue 链接,便于核对、纠错和撤销。
  • 数据范围:不包含私人邮箱、电话、家庭住址、身份证明、学生信息、完整简历、人物简介、个人备注、标签、任务、匹配结果、邮件正文和发送记录等本地数据。

贡献与更新机制

  • 批量贡献:用户可在 Auto Email Sender 的“导师管理”中筛选并导出 community-share.xlsx,通过 GitHub Issue 提交共享包;每个文件最大 5 MiB、最多 5,000 行。
  • 单独贡献:可通过“贡献一位导师表单”提交姓名、邮箱、任职机构和高校官方证据页面。
  • 反馈机制:支持对错误、退休、离职、调动、重复记录、邮箱重分配等情况提交信息反馈,由维护者对照官方证据裁决后更正、标记历史状态或撤下记录。
  • 审核流程:投稿经维护者统一映射机构简称、修正正式机构名或调整归属后,自动落库发布,发布成功后 Issue 自动关闭。同一导师重复提交将合并为一个实体并保留多方来源。

使用方式

  • 在 Auto Email Sender 导航栏右侧的“社区导师库”中,选择学校或学院后即可预览和导入。
  • 社区数据默认只补全本地空字段;遇到姓名、邮箱或机构冲突时需要用户确认。
  • 个人备注、标签、任务和发送记录不会参与社区导入或贡献。

许可证与归因

  • 数据使用 CC BY 4.0 许可证。
  • 仓库代码和自动化工具使用 MIT License
  • 投稿会公开记录贡献者的 GitHub 数字用户 ID、提交时用户名、Issue 链接和官方来源,用于归因与审计。
  • 高校官网及其原始内容仍受各自权利和使用条款约束。

维护与开发

  • 本地开发需要 Python 3.12 和 uv,支持命令包括 uv sync --devuv run mentor-data validateuv run pytestuv run ruff check .uv run mentor-data build --output dist
  • 维护者操作、应用集成契约、数据结构和后续计划分别记录在 docs/operations.mddocs/app-integration.mddocs/roadmap.md 中。
搜集汇总
数据集介绍
AutoEmailSender-MentorData 数据集图片
构建方式
该数据集依托高校官网公开的导师职业信息构建,采用社区协作与自动化验证相结合的方式。数据按学校与学院维度分割为小型、版本化的JSON分片,便于按需下载与更新。每条记录均保留GitHub贡献者信息、投稿Issue及官方来源链接,确保可追溯性。数据提交支持批量模式,通过Auto Email Sender生成标准化XLSX共享包,经Bot自动校验后由维护者统一映射机构、合并重复导师实体并落库发布。审核流程严格,维护者可修正机构名、调整归属或拒绝不合规行,最终数据以CC BY 4.0协议公开。
使用方法
用户可在Auto Email Sender导航栏的“社区导师库”中浏览和选择学校或学院,预览对应JSON分片后一键导入。导入时系统仅补全本地空字段,遇邮箱或姓名冲突需用户确认,个人备注与任务数据不参与交互。贡献数据可通过导师管理筛选后生成共享包,提交至GitHub Issue;单条贡献可用专用表单。错误或过时信息可通过反馈Issue提交,附官方证据供维护者审核。开发集成则遵循docs/app-integration.md,本地通过`uv`与`pytest`执行验证与构建。
背景与挑战
背景概述
AutoEmailSender-MentorData 数据集诞生于2025年,由 GitHub 用户 JunieXD 发起的社区协作项目构建,旨在为开源邮件自动发送工具 Auto Email Sender 提供结构化的高校导师职业信息库。该数据集系统性地汇聚了高校官网公开的导师姓名、公开工作邮箱、职称、机构归属及研究方向等元数据,并以版本化 JSON 分片形式发布,支持按需下载与动态更新。其核心研究问题在于构建一个可持续维护、可溯源、社区驱动的学术联络信息基础设施,以解决学术邮件沟通中联系人信息分散、更新滞后及隐私合规等痛点。作为开源生态中的基础设施类数据资源,该数据集不仅提升了学术交流效率,还为类似领域的信息整合与社区治理提供了参考范式,其影响力通过 GitHub 协作机制和 CC BY 4.0 许可得以扩散,推动了开放数据运动在学术联络场景中的实践。
当前挑战
该数据集面临的挑战多维且严苛。在领域问题层面,它必须应对高校导师信息的动态性(如离职、退休、邮箱更替)与来源多样性(各高校官网结构迥异)带来的数据一致性难题,同时确保严格遵循数据最小化原则,仅收录官方公开职业信息,规避隐私泄露和法律风险。在构建过程中,挑战尤为突出:其一,数据采集依赖于众包贡献,需设计高效的批量投稿机制(如 XLSX 上传)与自动化审核管道,但Bot的状态管理、附件安全解析及重复实体合并(基于数字ID)都需精细控制;其二,维护者需在不确定的机构层级(学院、系所、实验室)中进行名称标准化和映射,而贡献者输入的简写或非规范名称加大了数据治理复杂度;其三,版本化JSON分片的发布机制要求数据构建流程(如 validate、build)具备高可靠性和可扩展性,以支持持续集成与合规审计,同时应对误报、虚假信息及恶意伪造的挑战。这些障碍共同构成了数据集在可持续演进过程中必须跨越的技术与治理门槛。
常用场景
经典使用场景
该数据集作为Auto Email Sender的社区导师库,其核心应用场景在于为学术沟通与科研协作提供结构化的导师职业信息索引。用户可通过软件界面按学校或学院筛选、预览并导入公开的导师数据,实现高效、精准的邮件联络。数据集采用版本化JSON分片,支持增量下载,既减轻了本地存储负担,又保障了数据的实时性与可追溯性。这一设计特别适用于需要大规模、多机构联系导师的科研人员、学术组织或教育机构,有效提升了学术联络的规范性与效率。
解决学术问题
该数据集直面学术社区中导师信息分散、更新滞后、验证困难等痛点,通过众包方式汇集高校官网公开的导师职业信息,并建立严格的审核与纠错机制。它解决了科研人员寻找合适导师时信息不对称的问题,减少了因联系方式过时而导致的沟通障碍,同时通过贡献者、Issue和官方来源的留痕,保障了数据的可信度与可审计性。这一举措不仅提升了学术资源的可及性,也为数据治理在学术领域的应用提供了范例。
实际应用
在实际应用中,该数据集深度嵌入Auto Email Sender软件,用户可在‘社区导师库’中按需选择学校或学院,一键导入导师信息。应用场景包括学术合作洽询、研究生招生联络、项目组队邀请及学术会议通知等。数据集仅补充本地空缺字段,冲突信息需用户确认,兼顾了便捷与安全。其版本化设计支持持续更新,确保数据长期有效,适用于个人研究者、高校实验室及科研管理机构的日常沟通需求。
数据集最近研究
最新研究方向
该数据集聚焦于高等教育机构教师职业信息的开源共享与协作治理,其前沿研究方向在于构建一个基于版本化JSON分片、社区驱动且可审计的导师数据生态系统。相关热点事件包括学术人员流动的透明度提升、科研合作网络的数据化重构,以及开源工具在学术工作流中的深度集成。数据集的创新性体现在其贡献机制(如批量投稿、自动合并、冲突消解)和严谨的隐私边界政策(仅收录公开职业信息,排除私人数据),这为学术人才信息管理树立了新的标准。其影响在于促进跨机构学术通信效率,支持个性化科研联系,同时通过CC BY 4.0许可和GitHub归因机制,确保了数据的可追溯性与可持续演进,对学术社交、科研资助匹配及高校数字化治理具有重要实践意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务