相关数据集
zjunlp/iepile
IEPile是一个大规模的信息抽取语料库,专注于基于模式的信息抽取任务。该数据集整合了26个英文和7个中文的信息抽取数据集,涵盖了通用、医疗、金融等多个领域。通过提出的“基于模式的批量指令生成方法”,构建了一个包含约0.32B个标记的高质量信息抽取微调数据集。数据集用于微调Baichuan2和LLaMA2模型,实验表明微调后的模型在全监督训练集上表现优异,并在零样本信息抽取任务中取得了显著提升。数
Hugging Face2024-04-11 更新7590
中国企业国际合规数据库(ICD)
“中国企业国际合规数据库(ICD, International Compliance Database)”由专业机构Diinsider 开发,旨在协助中国企业应对日益复杂的海外经营环境。该数据库通过整合多维度的合规要求,利用人工智能技术进行动态监测与风险研判,为企业的全球化发展提供可靠的底层信息支撑。 核心组成部分 该数据库力图构建一个包含以下维度的综合信息系统: 多领域合规要求:系统整合环
OpenDataLab2026-07-12 更新700
MOIED: Magi Open Information Extraction Dataset
Description Magi Open Information Extraction Dataset (MOIED) is a Chinese Open IE dataset containing 7,618,181 records extracted from plain text across 3,319,763 webpages in various domains. Each reco
Mendeley Data2024-03-27 更新360
FIGER (Fine-Grained Entity Recognition)
FIGER 数据集是一个实体识别数据集,其中使用细粒度系统 112 标签标记实体,例如人/医生、艺术/书面工作和建筑/酒店。标签派生自 Freebase 类型。训练集由使用锚链接中编码的信息的远程监督方法自动注释的维基百科文章组成。测试集是手动注释的。
OpenDataLab2026-07-12 更新780
DuVOG视频看点抽取数据集
DuVOG是首个中文视频看点抽取数据集,包含1万多PV超过500的视频,共覆盖了游戏、数码、教育、时尚、科技、汽车、科学、星座运势、母婴育儿、历史、健康养生、体育12个领域,每个视频均由经过专业培训的数据标注人员标注,人均标注正确率90%+。
千言数据集510



