acmc/beamit-annotated_full_texts_dataset
收藏资源简介:
--- dataset_info: features: - name: title dtype: string - name: pmid dtype: string - name: background_abstract dtype: string - name: background_abstract_label dtype: string - name: methods_abstract dtype: string - name: methods_abstract_label dtype: string - name: results_abstract dtype: string - name: results_abstract_label dtype: string - name: conclusions_abstract dtype: string - name: conclusions_abstract_label dtype: string - name: mesh_descriptor_names sequence: string - name: pmcid dtype: string - name: background_title dtype: string - name: background_text dtype: string - name: methods_title dtype: string - name: methods_text dtype: string - name: results_title dtype: string - name: results_text dtype: string - name: conclusions_title dtype: string - name: conclusions_text dtype: string - name: other_sections_titles sequence: string - name: other_sections_texts sequence: string - name: other_sections_sec_types sequence: string - name: all_sections_titles sequence: string - name: all_sections_texts sequence: string - name: all_sections_sec_types sequence: string - name: keywords sequence: string - name: whole_article_text dtype: string - name: whole_article_abstract dtype: string - name: background_conclusion_text dtype: string - name: background_conclusion_abstract dtype: string - name: whole_article_text_length dtype: int64 - name: whole_article_abstract_length dtype: int64 - name: other_sections_lengths sequence: int64 - name: num_sections dtype: int64 - name: most_frequent_words sequence: string - name: keybert_topics sequence: string - name: annotated_base_background_abstract_prompt dtype: string - name: annotated_base_methods_abstract_prompt dtype: string - name: annotated_base_results_abstract_prompt dtype: string - name: annotated_base_conclusions_abstract_prompt dtype: string - name: annotated_base_whole_article_abstract_prompt dtype: string - name: annotated_base_background_conclusion_abstract_prompt dtype: string - name: annotated_keywords_background_abstract_prompt dtype: string - name: annotated_keywords_methods_abstract_prompt dtype: string - name: annotated_keywords_results_abstract_prompt dtype: string - name: annotated_keywords_conclusions_abstract_prompt dtype: string - name: annotated_keywords_whole_article_abstract_prompt dtype: string - name: annotated_keywords_background_conclusion_abstract_prompt dtype: string - name: annotated_mesh_background_abstract_prompt dtype: string - name: annotated_mesh_methods_abstract_prompt dtype: string - name: annotated_mesh_results_abstract_prompt dtype: string - name: annotated_mesh_conclusions_abstract_prompt dtype: string - name: annotated_mesh_whole_article_abstract_prompt dtype: string - name: annotated_mesh_background_conclusion_abstract_prompt dtype: string - name: annotated_keybert_background_abstract_prompt dtype: string - name: annotated_keybert_methods_abstract_prompt dtype: string - name: annotated_keybert_results_abstract_prompt dtype: string - name: annotated_keybert_conclusions_abstract_prompt dtype: string - name: annotated_keybert_whole_article_abstract_prompt dtype: string - name: annotated_keybert_background_conclusion_abstract_prompt dtype: string - name: annotated_most_frequent_background_abstract_prompt dtype: string - name: annotated_most_frequent_methods_abstract_prompt dtype: string - name: annotated_most_frequent_results_abstract_prompt dtype: string - name: annotated_most_frequent_conclusions_abstract_prompt dtype: string - name: annotated_most_frequent_whole_article_abstract_prompt dtype: string - name: annotated_most_frequent_background_conclusion_abstract_prompt dtype: string - name: annotated_tf_idf_background_abstract_prompt dtype: string - name: annotated_tf_idf_methods_abstract_prompt dtype: string - name: annotated_tf_idf_results_abstract_prompt dtype: string - name: annotated_tf_idf_conclusions_abstract_prompt dtype: string - name: annotated_tf_idf_whole_article_abstract_prompt dtype: string - name: annotated_tf_idf_background_conclusion_abstract_prompt dtype: string - name: annotated_entity_plan_background_abstract_prompt dtype: string - name: annotated_entity_plan_methods_abstract_prompt dtype: string - name: annotated_entity_plan_results_abstract_prompt dtype: string - name: annotated_entity_plan_conclusions_abstract_prompt dtype: string - name: annotated_entity_plan_whole_article_abstract_prompt dtype: string - name: annotated_entity_plan_background_conclusion_abstract_prompt dtype: string splits: - name: train num_bytes: 1887019064.0012002 num_examples: 13996 - name: test num_bytes: 404476792.79819953 num_examples: 3000 - name: val num_bytes: 404341967.20060015 num_examples: 2999 download_size: 957059277 dataset_size: 2695837824.0 --- # Dataset Card for "beamit-annotated_full_texts_dataset" [More Information needed](https://github.com/huggingface/datasets/blob/main/CONTRIBUTING.md#how-to-contribute-to-the-dataset-cards)
dataset_info: 特征列表: - 字段名:标题(title),数据类型:字符串 - 字段名:PubMed ID (pmid),数据类型:字符串 - 字段名:背景摘要(background_abstract),数据类型:字符串 - 字段名:背景摘要标注标签(background_abstract_label),数据类型:字符串 - 字段名:方法学摘要(methods_abstract),数据类型:字符串 - 字段名:方法学摘要标注标签(methods_abstract_label),数据类型:字符串 - 字段名:结果摘要(results_abstract),数据类型:字符串 - 字段名:结果摘要标注标签(results_abstract_label),数据类型:字符串 - 字段名:结论摘要(conclusions_abstract),数据类型:字符串 - 字段名:结论摘要标注标签(conclusions_abstract_label),数据类型:字符串 - 字段名:医学主题词(Medical Subject Headings, MeSH)描述符名称(mesh_descriptor_names),序列类型:字符串序列 - 字段名:PubMed Central ID (pmcid),数据类型:字符串 - 字段名:背景章节标题(background_title),数据类型:字符串 - 字段名:背景章节文本(background_text),数据类型:字符串 - 字段名:方法学章节标题(methods_title),数据类型:字符串 - 字段名:方法学章节文本(methods_text),数据类型:字符串 - 字段名:结果章节标题(results_title),数据类型:字符串 - 字段名:结果章节文本(results_text),数据类型:字符串 - 字段名:结论章节标题(conclusions_title),数据类型:字符串 - 字段名:结论章节文本(conclusions_text),数据类型:字符串 - 字段名:其他章节标题(other_sections_titles),序列类型:字符串序列 - 字段名:其他章节文本(other_sections_texts),序列类型:字符串序列 - 字段名:其他章节类型(other_sections_sec_types),序列类型:字符串序列 - 字段名:所有章节标题(all_sections_titles),序列类型:字符串序列 - 字段名:所有章节文本(all_sections_texts),序列类型:字符串序列 - 字段名:所有章节类型(all_sections_sec_types),序列类型:字符串序列 - 字段名:关键词(keywords),序列类型:字符串序列 - 字段名:全文章本(whole_article_text),数据类型:字符串 - 字段名:全文摘要(whole_article_abstract),数据类型:字符串 - 字段名:背景与结论文本(background_conclusion_text),数据类型:字符串 - 字段名:背景与结论摘要(background_conclusion_abstract),数据类型:字符串 - 字段名:全文章本长度(whole_article_text_length),数据类型:64位整数 - 字段名:全文摘要长度(whole_article_abstract_length),数据类型:64位整数 - 字段名:其他章节长度列表(other_sections_lengths),序列类型:64位整数序列 - 字段名:章节数量(num_sections),数据类型:64位整数 - 字段名:高频词列表(most_frequent_words),序列类型:字符串序列 - 字段名:KeyBERT主题列表(keybert_topics),序列类型:字符串序列 - 字段名:带基础标注的背景摘要提示词(annotated_base_background_abstract_prompt),数据类型:字符串 - 字段名:带基础标注的方法学摘要提示词(annotated_base_methods_abstract_prompt),数据类型:字符串 - 字段名:带基础标注的结果摘要提示词(annotated_base_results_abstract_prompt),数据类型:字符串 - 字段名:带基础标注的结论摘要提示词(annotated_base_conclusions_abstract_prompt),数据类型:字符串 - 字段名:带基础标注的全文摘要提示词(annotated_base_whole_article_abstract_prompt),数据类型:字符串 - 字段名:带基础标注的背景与结论摘要提示词(annotated_base_background_conclusion_abstract_prompt),数据类型:字符串 - 字段名:基于关键词标注的背景摘要提示词(annotated_keywords_background_abstract_prompt),数据类型:字符串 - 字段名:基于关键词标注的方法学摘要提示词(annotated_keywords_methods_abstract_prompt),数据类型:字符串 - 字段名:基于关键词标注的结果摘要提示词(annotated_keywords_results_abstract_prompt),数据类型:字符串 - 字段名:基于关键词标注的结论摘要提示词(annotated_keywords_conclusions_abstract_prompt),数据类型:字符串 - 字段名:基于关键词标注的全文摘要提示词(annotated_keywords_whole_article_abstract_prompt),数据类型:字符串 - 字段名:基于关键词标注的背景与结论摘要提示词(annotated_keywords_background_conclusion_abstract_prompt),数据类型:字符串 - 字段名:基于MeSH标注的背景摘要提示词(annotated_mesh_background_abstract_prompt),数据类型:字符串 - 字段名:基于MeSH标注的方法学摘要提示词(annotated_mesh_methods_abstract_prompt),数据类型:字符串 - 字段名:基于MeSH标注的结果摘要提示词(annotated_mesh_results_abstract_prompt),数据类型:字符串 - 字段名:基于MeSH标注的结论摘要提示词(annotated_mesh_conclusions_abstract_prompt),数据类型:字符串 - 字段名:基于MeSH标注的全文摘要提示词(annotated_mesh_whole_article_abstract_prompt),数据类型:字符串 - 字段名:基于MeSH标注的背景与结论摘要提示词(annotated_mesh_background_conclusion_abstract_prompt),数据类型:字符串 - 字段名:基于KeyBERT标注的背景摘要提示词(annotated_keybert_background_abstract_prompt),数据类型:字符串 - 字段名:基于KeyBERT标注的方法学摘要提示词(annotated_keybert_methods_abstract_prompt),数据类型:字符串 - 字段名:基于KeyBERT标注的结果摘要提示词(annotated_keybert_results_abstract_prompt),数据类型:字符串 - 字段名:基于KeyBERT标注的结论摘要提示词(annotated_keybert_conclusions_abstract_prompt),数据类型:字符串 - 字段名:基于KeyBERT标注的全文摘要提示词(annotated_keybert_whole_article_abstract_prompt),数据类型:字符串 - 字段名:基于KeyBERT标注的背景与结论摘要提示词(annotated_keybert_background_conclusion_abstract_prompt),数据类型:字符串 - 字段名:基于高频词标注的背景摘要提示词(annotated_most_frequent_background_abstract_prompt),数据类型:字符串 - 字段名:基于高频词标注的方法学摘要提示词(annotated_most_frequent_methods_abstract_prompt),数据类型:字符串 - 字段名:基于高频词标注的结果摘要提示词(annotated_most_frequent_results_abstract_prompt),数据类型:字符串 - 字段名:基于高频词标注的结论摘要提示词(annotated_most_frequent_conclusions_abstract_prompt),数据类型:字符串 - 字段名:基于高频词标注的全文摘要提示词(annotated_most_frequent_whole_article_abstract_prompt),数据类型:字符串 - 字段名:基于高频词标注的背景与结论摘要提示词(annotated_most_frequent_background_conclusion_abstract_prompt),数据类型:字符串 - 字段名:基于TF-IDF标注的背景摘要提示词(annotated_tf_idf_background_abstract_prompt),数据类型:字符串 - 字段名:基于TF-IDF标注的方法学摘要提示词(annotated_tf_idf_methods_abstract_prompt),数据类型:字符串 - 字段名:基于TF-IDF标注的结果摘要提示词(annotated_tf_idf_results_abstract_prompt),数据类型:字符串 - 字段名:基于TF-IDF标注的结论摘要提示词(annotated_tf_idf_conclusions_abstract_prompt),数据类型:字符串 - 字段名:基于TF-IDF标注的全文摘要提示词(annotated_tf_idf_whole_article_abstract_prompt),数据类型:字符串 - 字段名:基于TF-IDF标注的背景与结论摘要提示词(annotated_tf_idf_background_conclusion_abstract_prompt),数据类型:字符串 - 字段名:基于实体规划标注的背景摘要提示词(annotated_entity_plan_background_abstract_prompt),数据类型:字符串 - 字段名:基于实体规划标注的方法学摘要提示词(annotated_entity_plan_methods_abstract_prompt),数据类型:字符串 - 字段名:基于实体规划标注的结果摘要提示词(annotated_entity_plan_results_abstract_prompt),数据类型:字符串 - 字段名:基于实体规划标注的结论摘要提示词(annotated_entity_plan_conclusions_abstract_prompt),数据类型:字符串 - 字段名:基于实体规划标注的全文摘要提示词(annotated_entity_plan_whole_article_abstract_prompt),数据类型:字符串 - 字段名:基于实体规划标注的背景与结论摘要提示词(annotated_entity_plan_background_conclusion_abstract_prompt),数据类型:字符串 数据集划分: - 划分名称:训练集(train),字节数:1887019064.0012002,样本数量:13996 - 划分名称:测试集(test),字节数:404476792.79819953,样本数量:3000 - 划分名称:验证集(val),字节数:404341967.20060015,样本数量:2999 下载大小:957059277 字节 数据集总大小:2695837824.0 字节 --- # “beamit-标注全文本数据集”数据集卡片 [需补充更多信息](https://github.com/huggingface/datasets/blob/main/CONTRIBUTING.md#how-to-contribute-to-the-dataset-cards)
数据集概述
数据集名称
"beamit-annotated_full_texts_dataset"
数据集特征
数据集包含以下特征:
- 标题 (title):字符串类型
- PMID (pmid):字符串类型
- 背景摘要 (background_abstract):字符串类型
- 方法摘要 (methods_abstract):字符串类型
- 结果摘要 (results_abstract):字符串类型
- 结论摘要 (conclusions_abstract):字符串类型
- MESH描述符名称 (mesh_descriptor_names):字符串序列类型
- PMCID (pmcid):字符串类型
- 背景标题 (background_title):字符串类型
- 方法标题 (methods_title):字符串类型
- 结果标题 (results_title):字符串类型
- 结论标题 (conclusions_title):字符串类型
- 其他部分标题 (other_sections_titles):字符串序列类型
- 其他部分文本 (other_sections_texts):字符串序列类型
- 所有部分标题 (all_sections_titles):字符串序列类型
- 所有部分文本 (all_sections_texts):字符串序列类型
- 关键词 (keywords):字符串序列类型
- 全文文本 (whole_article_text):字符串类型
- 全文摘要 (whole_article_abstract):字符串类型
- 背景结论文本 (background_conclusion_text):字符串类型
- 背景结论摘要 (background_conclusion_abstract):字符串类型
- 全文文本长度 (whole_article_text_length):整数类型
- 全文摘要长度 (whole_article_abstract_length):整数类型
- 其他部分长度 (other_sections_lengths):整数序列类型
- 部分数量 (num_sections):整数类型
- 最频繁词 (most_frequent_words):字符串序列类型
- KeyBERT主题 (keybert_topics):字符串序列类型
数据集划分
- 训练集 (train):13996个样本,大小为1887019064.0012002字节
- 测试集 (test):3000个样本,大小为404476792.79819953字节
- 验证集 (val):2999个样本,大小为404341967.20060015字节
数据集大小
- 下载大小:957059277字节
- 数据集总大小:2695837824.0字节




