登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
YahooNews
YahooNews
收藏
NIAID Data Ecosystem
2026-05-02 收录
新闻文本挖掘
信息抽取
数据链接:
https://doi.org/10.7910/DVN/HLGHKI
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
Raw HTML data of YahooNews Project. Updated everyday through dataverse API.
应用场景:
创建时间:
2024-09-09
相关数据集
OPIEC
信息抽取
知识库构建
OPIEC是一个从英文维基百科全文中提取的大型开放信息抽取语料库,由德国曼海姆大学创建。该数据集包含超过3.4亿个三元组,是迄今为止公开可用的最大的OIE语料库。OPIEC不仅数据量大,还包含丰富的元数据信息,如来源信息、置信度评分、语言标注和语义标注,包括空间和时间信息。这些数据对于下游任务如知识库构建、开放式问答或事件模式归纳非常有价值。OPIEC的创建过程涉及使用Stanford CoreN
arXiv
2019-04-28 更新
38
0
BenchIEFL
信息抽取
自然语言处理
BenchIEFL是由蒙特利尔大学的RALI实验室创建的一个用于开放信息抽取(OIE)的新基准数据集。该数据集通过重新注释BenchIE数据集,修正了常见错误和不一致性,提高了注释的精确性和相关性。BenchIEFL包含新的匹配函数,能更灵活地捕捉有效抽取,从而产生更公平的系统评估排名。数据集主要用于评估OIE系统在下游任务中的性能,如问答和文本理解,旨在通过提供更高质量的基准来推动OIE技术的发
arXiv
2024-07-24 更新
10
0
shktty/CTREL
网络安全
信息抽取
该数据集专注于网络威胁情报领域,旨在支持信息抽取任务,帮助识别和分析网络威胁相关的数据。
Hugging Face
2024-12-09 更新
7
0
pie/brat
自然语言处理
信息抽取
BRAT数据集是一个用于自然语言处理任务的数据集,提供了两种变体:`default`和`merge_fragmented_spans`。`default`变体使用`BratDocument`文档类型,包含`LabeledMultiSpan`注释;`merge_fragmented_spans`变体使用`BratDocumentWithMergedSpans`文档类型,将分散的`LabeledMul
Hugging Face
2024-01-03 更新
21
0
flammenai/Phoenix-SFT-v1
对话记忆提取
信息抽取
Phoenix v1 — 记忆提取数据集是一个用于生成结构化记忆数据的合成数据集,旨在支持AI角色(称为“Flame”)在异步对话中的长期连续性。数据集包含多种语言的对话转录,任务是将这些对话转换为结构化的JSON记忆列表。记忆分为多个类别,如事实、偏好、关系、事件和情感。数据集分为训练集(1728个示例)和评估集(170个示例),并详细描述了数据的生成流程、质量控制机制和局限性。
Hugging Face
2026-05-09 更新
8
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广