遇见数据集

oopus/trends-story

收藏
Hugging Face2026-05-25 更新2026-05-31 收录
官方服务:

资源简介:

Trends Story数据集是一个每周更新的SQLite数据库快照集合,专注于美国谷歌趋势数据。它自动收集谷歌趋势信息,并为每个热门话题生成简明易懂的文本摘要。数据集包含三个主要表格:serpapi_data存储原始趋势数据(如搜索关键词、搜索量、增长百分比等),main_news_data提供由LLM生成的趋势背景解释摘要,image_data则记录为每个话题生成的词云图像文件名。数据收集自美国地区的谷歌趋势,通过SerpAPI每日两次(东部时间上午5点和下午4点)获取,并每周一进行快照备份。数据集适用于文本分类、文本生成等NLP任务,可用于分析趋势话题、新闻事件等。许可证为CC BY 4.0,基于谷歌趋势的公开数据。

--- 语言: - 英语 许可证:CC BY 4.0(知识共享署名4.0国际许可协议) 标签: - 谷歌趋势(Google Trends) - 热门话题 - 新闻 - SerpAPI - SQLite 数据集名称:Trends Story — 美国区每周谷歌趋势快照 数据规模:1亿 < 数据量 < 10亿 任务类别: - 文本分类 - 文本生成 --- # Trends Story — 美国区每周谷歌趋势快照 本数据集为[Trends Story](https://trending.oopus.info)项目产出的每周SQLite数据库快照,该项目会自动采集美国区谷歌趋势数据,并为每个热门话题生成通俗易懂的自然语言总结。 源代码仓库:[sudoghut/trends-story](https://github.com/sudoghut/trends-story) ## 数据集内容 每个`.db`文件均为完整的SQLite快照,命名格式为`trends_data_YYYYMMDD.db`,每周一上传更新。 ### 数据表 #### `serpapi_data`(持续增长——每次采集新增约20~30条数据,每日采集两次) 该表存储通过SerpAPI获取的原始谷歌趋势数据: | 字段名 | 数据类型 | 字段说明 | |--------|----------|----------| | `id` | INTEGER | 主键 | | `query` | TEXT | 热门搜索关键词 | | `start_timestamp` | TEXT | 该趋势起始的Unix时间戳 | | `active` | INTEGER | 标识该趋势当前是否处于活跃状态 | | `search_volume` | INTEGER | 估算搜索量 | | `increase_percentage` | INTEGER | 搜索量增幅百分比 | | `categories` | TEXT | 谷歌趋势分类(例如`17-体育`、`4-娱乐`) | | `trend_breakdown` | TEXT | 相关子搜索词,以竖线分隔 | | `serpapi_google_trends_link` | TEXT | SerpAPI提供的趋势时序数据链接 | | `news_page_token` | TEXT | 用于获取相关新闻的令牌 | | `serpapi_news_link` | TEXT | SerpAPI提供的新闻链接 | | `date` | TEXT | 数据采集时间戳(美国东部时间) | #### `main_news_data`(持续增长——每条已处理的趋势对应一行数据) 该表存储大语言模型(LLM)生成的自然语言总结,用于解释对应关键词成为热门趋势的原因: | 字段名 | 数据类型 | 字段说明 | |--------|----------|----------| | `id` | INTEGER | 主键 | | `news` | TEXT | 解释趋势背景的总结文本 | | `date` | TEXT | 总结生成时间戳 | | `serpapi_id` | INTEGER | 外键,关联`serpapi_data.id` | | `image_id` | INTEGER | 外键,关联`image_data.id` | #### `image_data`(持续增长——每条已处理的趋势对应一行数据) 该表存储为每个热门话题生成的词云图像文件名: | 字段名 | 数据类型 | 字段说明 | |--------|----------|----------| | `id` | INTEGER | 主键 | | `file_name` | TEXT | 图像文件名(格式:`{slug}_{YYYYMMDD}_{HHMMSS}.png`) | ## 使用方法 以下为通过Hugging Face Hub下载并读取数据集的示例代码: python from huggingface_hub import hf_hub_download import sqlite3 path = hf_hub_download( repo_id="oopus/trends-story", filename="trends_data_20260517.db", repo_type="dataset" ) conn = sqlite3.connect(path) df_trends = conn.execute("SELECT * FROM serpapi_data LIMIT 10").fetchall() df_news = conn.execute("SELECT * FROM main_news_data LIMIT 5").fetchall() conn.close() ## 数据采集规则 - **采集区域**:美国 - **数据来源**:通过[SerpAPI](https://serpapi.com)获取的谷歌趋势数据 - **采集频率**:每日两次,分别为美国东部时间凌晨5点与下午4点 - **快照备份频率**:每周一次(每周一) - **数据格式**:SQLite 3格式,每周对应一个`.db`文件 ## 相关项目 | 项目类型 | 项目地址 | |----------|----------| | 官方站点 | https://trending.oopus.info | | 主代码仓库 | https://github.com/sudoghut/trends-story | | 前端界面仓库 | https://github.com/sudoghut/trend-story-interface | | API接口仓库 | https://github.com/sudoghut/trend-story-api | ## 许可证 本数据集采用[知识共享署名4.0国际许可协议(CC BY 4.0)](https://creativecommons.org/licenses/by/4.0/)发布,其底层趋势数据通过SerpAPI从谷歌趋势(公开数据)获取。

提供机构:
oopus
二维码
社区交流群
二维码
科研交流群
商业服务