有没有相关的论文或文献参考?
这个数据集是基于什么背景创建的?
数据集的作者是谁?
能帮我联系到这个数据集的作者吗?
这个数据集如何下载?

PRBench
PRBench是一个大规模专家标注的专业领域高风险推理基准测试数据集,当前版本覆盖法律和金融领域。包含1,100个专家编写的跨金融和法律领域的对话,19,356个专家策划的评估标准(每个任务10-30条),覆盖114个国家、47个美国司法管辖区和25个专业主题,并包含最具挑战性任务的硬子集(Finance-300, Legal-250)。
github 收录
YouTube-English
该数据集包含从各种YouTube频道提取的英语音频片段以及相应的转录元数据。数据用于训练自动语音识别(ASR)模型。数据来源于YouTube频道,处理过程包括下载、分割和保存音频及元数据。数据集总结部分详细列出了每个频道的视频数量、持续时间和占总数据集的百分比。
huggingface 收录
乳腺癌患者检查结果
该数据采集来自乳腺癌随访微信小程序,共采集499例患者肿瘤分级、分期、血生化检测等指标,目的在于通过监测乳腺癌患者指标的高低对患者进行预后风险评估,通过指标的高低及时发现复发征兆并及时采取措施,同时可为复发风险提供参考。
国家人口健康科学数据中心 收录
威斯康星乳腺癌数据分析及自动诊断
数据集bc_data.csv:来自威斯康星乳腺癌数据库(Wisconsin Breast Cancer Database),主要记录了569个病例的32个属性。
阿里云天池 收录
MNBVC
MNBVC数据集是一个超大规模的中文语料集,包括新闻、作文、小说、书籍、杂志、论文、台词、帖子、wiki、古诗、歌词、商品介绍、笑话、糗事、聊天记录等一切形式的纯文本中文数据。数据集不但包括主流文化,也包括各个小众文化甚至火星文的数据。
github 收录