遇见数据集

newscldata

收藏
魔搭社区2026-08-16 更新2026-08-16 收录
官方服务:

资源简介:

# newscldata 新闻情绪数据集 自动采集、清洗并情绪打分的财经新闻与股票评论数据,随创空间 newcl3 每次运行增量更新。 ## 数据源 - 新闻:华尔街见闻、新浪7x24、东方财富、证券时报、央视新闻、Yahoo Finance、CNBC、MarketWatch、PR Newswire - 评论:新浪股市汇、东方财富股吧、雪球(按股票代码抓取,每源最多100条) ## 目录结构 默认「报告模式」(推荐喂模型): - `YYYY-MM-DD/report.json` 紧凑结构化报告(约10KB): - `meta`:日期/总数/市场分布 - `overall`:整体情绪(平均分/标签/离散度/正负中分布) - `hot_topics`:热点 TOP10(跨源重复度+情绪强度) - `stocks`:个股情绪榜 TOP15 - `alerts`:风险/机会提示 TOP8 - `us_news`:美股专题汇总(数量/平均分/TOP5) - `comments`:评论汇总(分源/TOP正负/提及股票) - `newscldata.csv` 最新快照(根目录) - `schema.json` 字段定义 「全量模式」(环境变量 `NEWS_DATASET_MODE=full`)额外包含: - `YYYY-MM-DD/news_cn.jsonl` 中文/全球新闻 - `YYYY-MM-DD/news_us.jsonl` 美股新闻(英文原文+评分) - `YYYY-MM-DD/comments_{code}.jsonl` 个股评论 ## 字段说明 情绪分 `sentiment_score` 0-100(中文 SnowNLP / 英文 VADER,≥55正面 / <45负面), `quality_score` 为清洗质量分(0-1)。同一日期内按"来源+标题/文本"指纹去重。 ## 模型调用 喂模型只需读 `YYYY-MM-DD/report.json`;完整字段与 API 调用示例见 newcl3 项目 `docs/REPORT_GUIDE.md`。 ## 更新方式 抓取 -> 清洗 -> 情绪分析 -> 按日期追加写入 -> git push,数据只增不减。 License: Apache License 2.0

提供机构:
maas
创建时间:
2026-08-13
二维码
社区交流群
二维码
科研交流群
商业服务