遇见数据集

china-advisor

收藏
Hugging Face2026-06-21 更新2026-06-22 收录
官方服务:

资源简介:

China Advisor Cache 数据集是一个包含中国大学导师/教师页面缓存公共网页、API 响应和提取文本的资源集合,旨在为研究或应用提供中国高校教师信息的结构化数据。它覆盖了39所985高校,当前数据规模包括77968条元数据记录和71437条教师档案记录,其中69288条为状态码200的有效教师档案记录。数据集内容主要包括缓存存档文件(如archives/china-advisor-cache-2026-06-20.tar.zst)、缓存模式与元数据格式说明、985爬取报告、每所高校的缓存统计摘要、错误日志、种子源注册配置以及用于爬取和修复的脚本。数据通过尊重的爬取方式获取,爬取器遵守robots.txt规则,不绕过访问控制,并记录被阻止的URL,适用于高校教师信息分析、学术网络研究、数据爬取与缓存技术验证等任务。

The China Advisor Cache dataset is a resource collection containing cached public web pages, API responses, and extracted text from Chinese university advisor/teacher pages. It aims to provide structured data on Chinese higher education instructors for research or applications, covering 39 Project 985 universities. The current data scale includes 77,968 metadata records and 71,437 teacher profile records, with 69,288 being valid teacher profile records with a status code of 200. The dataset primarily consists of cached archive files (e.g., archives/china-advisor-cache-2026-06-20.tar.zst), cache schema and metadata format descriptions, 985 crawling reports, cache statistical summaries for each university, error logs, seed source registration configurations, and scripts for crawling and repair. Data is acquired through respectful crawling methods, with crawlers adhering to robots.txt rules, not bypassing access controls, and logging blocked URLs. It is suitable for tasks such as university teacher information analysis, academic network research, and data crawling and cache technology validation.

创建时间:
2026-06-20
原始信息汇总

数据集概述:China Advisor Cache

来源地址:https://huggingface.co/datasets/kzoacn/china-advisor

语言:中文

许可协议:其他(未明确指定开源许可)

标签:中国、大学、教职、导师、网页爬取

数据规模:约 10K-100K 条记录


数据集内容

该数据集存储了缓存的中国高校导师/教职页面、API 响应及提取的文本数据。主要包含以下内容:

  • 缓存归档文件

    • archives/china-advisor-cache-2026-06-20.tar.zst:完整缓存归档,保留本地 data/cache/... 目录结构。
    • archives/china-advisor-cache-2026-06-20.tar.zst.sha256:归档文件的 SHA256 校验和。
  • 元数据文件

    • metadata/CACHE_FORMAT.md:缓存模式及元数据格式说明。
    • metadata/REPORT.md:985 高校爬取报告。
    • metadata/cache_summary.tsv:按学校统计的缓存数量。
    • metadata/cache_summary.json:机器可读的按学校统计缓存数量。
    • metadata/cache_status_summary.tsv:针对疑似被屏蔽的个人主页的状态码摘要。
    • metadata/errors.tsv:遵循爬取规则的错误日志。
  • 配置文件

    • configs/985_sources.yaml:985 高校种子来源注册表。
    • configs/985_*repair_sources.yaml:针对中央及学院级门户的定向修复源注册表。
  • 脚本文件

    • scripts/crawl_985_cache.py:用于 985 扩展的阶段性爬虫。
    • scripts/repair_985_low_coverage.py:针对 Tsites 门户和基于公共 API 的门户的修复爬虫。

数据规模与覆盖

当前 985 高校覆盖报告显示,覆盖了 39 所 985 工程学校,包含:

  • 77974 条元数据记录
  • 71411teacher_profile 记录
  • 69271 条状态码为 200 的 teacher_profile 记录

恢复方法

从数据集仓库中执行以下命令解压归档文件:

bash tar --use-compress-program=zstd -xf archives/china-advisor-cache-2026-06-20.tar.zst

执行后会在当前目录生成 data/cache/<学校名称>/{pages,text,metadata}/... 目录结构。


爬取说明

  • 缓存包含原始本地缓存副本,以及针对 985 高校的全局爬取和修复爬取结果。
  • 爬虫记录被屏蔽的 URL,且不会绕过 robots.txt、TLS 失败、登录、验证码、CC 防护等访问控制。
搜集汇总
数据集介绍
china-advisor 数据集图片
构建方式
本数据集通过分阶段、注重网络礼仪的爬虫技术,系统性地采集了中国39所985工程高校的导师及教职工页面。其构建过程包含主体爬取与针对性修补两阶段:首先使用'crawl_985_cache.py'脚本对985高校种子源进行大规模爬取,随后利用'repair_985_low_coverage.py'脚本对覆盖率较低的高校门户及公开API接口进行定向修复,最终形成包含77,974条元数据记录、71,411条教师简介记录及69,271条状态正常的教师简介档案的缓存数据集。
特点
该数据集以压缩包形式保存完整的原始缓存目录结构,并辅以详细的元数据架构文档、爬取报告、按学校统计的缓存数量表格及JSON格式机器可读文件。特别地,数据集严格遵守网络爬取规范(robots.txt),不对登录验证、验证码、TLS失败等访问控制进行规避,并记录了被拦截的URL及错误日志,确保了数据的合规性与采集过程的透明度。
使用方法
用户可通过解压命令`tar --use-compress-program=zstd -xf archives/china-advisor-cache-2026-06-20.tar.zst`还原数据,解压后将在本地重建`data/cache/<学校>/`层级目录,其中包含`pages`、`text`与`metadata`等子文件夹。此外,数据集根目录下提供的配置文件(`985_sources.yaml`)与修复配置可用于复现或扩展爬取流程,便于研究者根据需求定制新的采集任务。
背景与挑战
背景概述
在中国高等教育体系中,研究生导师的选择对学术生涯发展具有决定性影响,然而导师信息的分散与异质性使得学生难以高效获取全面、准确的指导信息。为此,该数据集于2025年由相关研究团队创建,聚焦于中国39所“985工程”高校的教师档案页面,通过尊重的网络爬取技术,系统性地收集了超过7万余条教师简介记录。作为首个大规模、结构化的中国高校导师信息缓存库,它为高等教育研究、学术推荐系统及教育公平分析提供了宝贵的数据基础,推动了信息整合与学术决策支持领域的发展。
当前挑战
该数据集面临的核心挑战在于解决学术信息碎片化与访问受限问题。领域层面,各高校教师信息分布零散、格式不一,且常被置于动态页面或需登录的教务系统中,现有方法难以实现对海量异质数据的统一抓取与结构化存储,从而阻碍了学术信息的高效检索与比较。构建过程中,爬虫需严格遵守robots.txt协议,应对TLS失败、验证码、登录墙及CC防御等访问控制机制,同时记录被屏蔽的URL并避免对目标服务器造成负载压力,这要求在数据完整性与网络礼仪之间取得精妙平衡。
常用场景
经典使用场景
China Advisor Cache数据集汇聚了中国39所985高校逾七万条教师主页的缓存数据,涵盖网页快照、API响应及结构化文本。其经典使用场景聚焦于高等教育机构的人才画像构建与学术网络分析,研究者可借此解析不同院系导师的职称分布、研究方向与招生动态,为学术人力资源的宏观计量提供数据基石。
衍生相关工作
围绕China Advisor Cache,衍生出一系列经典工作,包括基于教师主页信息的学术影响力排序模型、跨机构合作网络的演化分析工具,以及面向中文语境的人才知识图谱自动构建框架。这些工作在原始缓存基础上,结合自然语言处理技术,实现了从结构化数据到学术洞察的高效转化,进一步拓展了数据集的应用边界。
数据集最近研究
最新研究方向
当前,中国高等教育领域的导师信息整合与学术人才流动研究正迈向系统化与智能化,而「china-advisor」数据集的问世为这一进程注入了全新动能。该数据集通过大规模、尊重性的网络爬取技术,系统收录了39所985高校逾7万条教师主页缓存记录,覆盖教师基本信息、联系方式和研究方向等核心字段,构建起国内首个高覆盖度的导师信息知识库。在「双一流」建设持续深化与科研人才竞争白热化的背景下,这一数据集正成为学术搜索优化、导师-学生匹配系统研发以及高校师资结构计量分析的关键支撑。尤其值得关注的是,其严谨的爬取策略和错误记录机制为高阶网络数据治理树立了规范标杆,有望推动人才数据基础设施的标准化建设,助力中国高等教育评价体系从经验驱动向数据驱动转型。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务