官方服务:
资源简介:
PyTorch实现的BERT事件抽取
应用场景:
创建时间:
2024-06-14
相关数据集
事件抽取数据集
本数据集是一个文本数据集,用以训练从中文新闻概要中提取主要事件的机器学习网络模型。数据集包含财经、司法、体育、组织新闻等9个类别的新闻文本,单个类别以json格式文件存储,文件包含该类别下所有新闻和对应的事件抽取结果,使用者可以自行划分训练集、验证集和测试集,数据实体文件大小总计15.3 MB。
国家基础学科公共科学数据中心900
hyperdemocracy/usc-llm-tokens-bert-base-uncased-2048
--- dataset_info: features: - name: input_ids sequence: int32 - name: attention_mask sequence: int8 splits: - name: train num_bytes: 1295254968 num_examples: 126391 - name:
Hugging Face2024-03-22 更新130
orafandina/wiki_long_200k
该数据集包含约20万篇维基文章,这些文章是从维基数据集中随机抽取的。文章使用了AutoTokenizer.from_pretrained(bert-base-uncased)进行分词处理。数据集创建的目的是用于研究。
Hugging Face2023-10-23 更新100
taylorbollman/bertnomic_tokenized_1024
--- dataset_info: features: - name: input_ids sequence: int32 - name: special_tokens_mask sequence: int8 splits: - name: train num_bytes: 27157416224 num_examples: 5295908
Hugging Face2024-03-22 更新150
hyperdemocracy/usc-llm-tokens-bert-base-uncased-1024
--- dataset_info: features: - name: input_ids sequence: int32 - name: attention_mask sequence: int8 splits: - name: train num_bytes: 1038968696 num_examples: 202607 - name:
Hugging Face2024-03-22 更新130



