agi-research-daily
收藏资源简介:
Research Collector Dataset 是一个多源研究结果聚合数据集,由 Research-Collector 工具收集并丰富元数据。数据集包含 39 个研究项目,涵盖人工通用智能(AGI)相关主题,时间范围为 2026 年 4 月 12 日至 26 日。数据来源包括学术平台(如 PubMed、arXiv)、专业平台(如 GitHub、Stack Overflow)、社交平台(如 Reddit、Hacker News)以及新闻和博客。每个数据项包含核心字段(如标题、作者、发布日期)和丰富的元数据字段(如 ML 子领域分类、质量评分、情感分析等)。数据集适用于文本检索、分类等任务,支持多语言内容。数据经过标准化处理,包括日期格式化、自动摘要生成和质量评估。使用示例展示了如何按来源、内容类型、质量等条件过滤数据。数据集的主要限制包括时间范围固定和部分源数据的 API 限制。
The Research Collector Dataset is a multi-source research result aggregation dataset collected and enriched with metadata by the Research-Collector tool. The dataset includes 39 research projects covering topics related to Artificial General Intelligence (AGI), with a time range from April 12 to 26, 2026. Data sources include academic platforms (e.g., PubMed, arXiv), professional platforms (e.g., GitHub, Stack Overflow), social platforms (e.g., Reddit, Hacker News), as well as news and blogs. Each data item contains core fields (e.g., title, author, publication date) and rich metadata fields (e.g., ML subfield classification, quality score, sentiment analysis, etc.). The dataset is suitable for tasks such as text retrieval and classification, and supports multilingual content. The data has undergone standardization processing, including date formatting, automatic summary generation, and quality assessment. Usage examples demonstrate how to filter data by source, content type, quality, etc. The main limitations of the dataset include a fixed time range and API restrictions for some source data.
数据集概述:Research Collector Dataset
基本信息
- 数据集名称:Research Collector Dataset(研究收集器数据集)
- 许可证:MIT License
- 语言:英语(多语言)
- 任务类型:文本检索、文本分类
- 数据规模:少于1,000条
核心内容
- 主题:人工通用智能(AGI)、通用人工智能(general AI)
- 时间范围:2026-04-12 至 2026-04-26(两周)
- 数据来源:涵盖12个平台,包括:
- 学术:PubMed、Crossref、Semantic Scholar、Papers with Code、arXiv
- 专业:GitHub、Stack Overflow、Kaggle
- 社交:Reddit、Hacker News
- 新闻:GDELT
- 博客:Medium
- 总条目数:39条
- 导出时间:2026-04-26
数据结构
核心字段
| 字段名 | 说明 |
|---|---|
id |
唯一标识符 |
title |
研究项目标题 |
source |
来源平台名称 |
url |
原始内容链接 |
author |
作者 |
published_date |
发布日期(ISO 8601格式) |
citations |
引用次数 |
upvotes |
点赞数 |
downloads |
下载次数 |
comments |
评论数 |
content |
内容/摘要/描述 |
score |
相关度评分 |
增强元数据字段
- 时间特征:
metadata_year(年份)、metadata_month(月份)、metadata_day(日)、metadata_week(周)、metadata_quarter(季度)、metadata_days_since(发布后天数) - 分类标签:
metadata_ml_subfields(ML子领域,JSON数组)、metadata_subfield_count(子领域数量) - 关键词:
metadata_keywords(关键词,JSON数组)、metadata_keyword_count(关键词数量) - 质量评分:
metadata_quality_scores(质量评分,JSON字典) - 内容类型:
metadata_content_type(论文、预印本、仓库、讨论、问答、新闻) - 代码与DOI:
metadata_has_code(是否包含代码)、metadata_has_doi(是否有DOI) - 情感分析:
metadata_sentiment_polarity(情感极性,-1到1)、metadata_sentiment_subjectivity(情感主观性,0到1)、metadata_sentiment_category(情感类别:积极/消极/中性) - 自动摘要:
metadata_summary(提取式摘要)、metadata_summary_length(摘要长度) - 数据质量:
metadata_data_quality(数据质量指标,JSON字典,包含完整性、一致性、有效性、总体质量评分) - 趋势分析:
metadata_trending_score(参与度速度)、metadata_trending_category(趋势类别:热/暖/凉/冷)、metadata_engagement_score(原始参与度评分) - 关联项目:
metadata_related_items(关联项目及相似度,JSON数组)、metadata_related_count(关联项目数量)
各来源特有字段
- PubMed:
metadata_journal(期刊)、metadata_doi(DOI)、metadata_mesh_terms(MeSH术语)、metadata_publication_types(出版类型)、metadata_abstract_length(摘要长度) - arXiv:
metadata_arxiv_id(arXiv ID)、metadata_primary_category(首要类别)、metadata_categories(所有类别)、metadata_journal_ref(期刊引用) - GitHub:
metadata_stars(星标数)、metadata_forks(分支数)、metadata_language(主要语言)、metadata_license(许可证)、metadata_topics(主题)、metadata_has_readme(是否有README) - Reddit:
metadata_subreddit(子版块)、metadata_link_flair_text(标签文本)、metadata_upvote_ratio(点赞比例)、metadata_total_awards(总奖励数)、metadata_is_gilded(是否被镀金) - Stack Overflow:
metadata_tags(标签)、metadata_answer_count(回答数)、metadata_has_accepted_answer(是否有被采纳答案)、metadata_view_count(浏览数)、metadata_owner_reputation(提问者声望) - Semantic Scholar:
metadata_citation_count(引用数)、metadata_influential_citation_count(有影响力引用数)、metadata_fields_of_study(研究领域)、metadata_has_open_access(是否开放获取) - Medium:
metadata_author(作者)、metadata_publication(出版物)、metadata_read_time(阅读时间)、metadata_claps(鼓掌数) - Kaggle:
metadata_votes(投票数)、metadata_usability_rating(可用性评分)、metadata_file_count(文件数量)
数据质量特性
- 所有日期标准化为ISO 8601格式
- 自动分类为15+个ML子领域
- 多维度质量评估(摘要长度、代码可用性、DOI、参与度、时效性)
- 时间特征提取(年、月、周、季度、发布后天数)
- 自动关键词提取
- 内容类型自动检测
- 情感分析(极性、主观性、类别)
- 自动提取式摘要
- 数据质量指标(完整性、一致性、有效性评分)
- 参与度速度分析与趋势分类
- 基于共享子领域、关键词、标签的关联项目检测
- 智能去重与元数据合并
- 缺失元数据字段的推断逻辑
使用建议
- 可按来源、内容类型、ML子领域、质量评分、时间、趋势类别、数据质量、情感类别进行过滤
- 支持基于评分排序和关联项目检索
局限性
- 数据限定在指定时间范围内
- 部分来源可能存在速率限制或API限制
- 不同来源的引用计数可能存在差异
- ML子领域分类基于关键词匹配,可能不完全准确




