Occurrence Download|生物多样性数据集|物种分布数据集
收藏AIS数据集
该研究使用了多个公开的AIS数据集,这些数据集经过过滤、清理和统计分析。数据集涵盖了多种类型的船舶,并提供了关于船舶位置、速度和航向的关键信息。数据集包括来自19,185艘船舶的AIS消息,总计约6.4亿条记录。
github 收录
MeSH
MeSH(医学主题词表)是一个用于索引和检索生物医学文献的标准化词汇表。它包含了大量的医学术语和概念,用于描述医学文献中的主题和内容。MeSH数据集包括主题词、副主题词、树状结构、历史记录等信息,广泛应用于医学文献的分类和检索。
www.nlm.nih.gov 收录
库帕思金融大模型评测数据集(2024版)
金融大模型评测数据集(2024版),对标《金融大模型应用测评指南》(T/SAIAS 019—2024),涵盖金融行业核心领域,数据来自金融机构行业实践,是金融领域大模型应用成效评测的重要抓手。 评测数据集比照最高水平、最好标准,具有规模大、结构优、价值对齐等特点,符合金融领域对知识鲜活度、多样性和高密度的整体要求。 聚焦“模型基础能力”,围绕计算能力、逻辑推理等6个维度,设计评测数据22000余句对。 聚焦“金融安全与价值对齐能力”,围绕信息内容、社会秩序等13个维度,设计评测数据2000余句对。 聚焦“金融风险控制能力”,围绕合规、市场、操作等5类金融风险,设计评测数据1000余句对。 聚焦“金融业务辅助拓展能力”,围绕舆情分析、智能投研等3项业务场景,设计评测数据12000余句对。 聚焦“金融专业认知能力”,围绕金融专业知识、IPO图表等7种知识类型,设计评测数据7000余句对。 金融大模型评测数据集定期更新、动态迭代,1250条样例集已在Open Data Lab完成开源。
OpenDataLab 收录
海天瑞声-超大规模中文多领域高质量多轮对话语料库
这是一个符合中国人表达习惯的自然对话数据集,共计约1,0000,000轮,上亿级token,包含正式&非正式风格对话,使用偏口语化自然表达。覆盖工作、生活、校园等场景,及金融、教育、娱乐、体育、汽车、科技等领域。在数据集构成上,DOTS-NLP-216包含了对真实场景的对话采集,及高度还原真实场景的模拟对话这两种方式,兼顾分布的代表性、多样性和样本规模。
魔搭社区 收录
NIST Thermochemical Database
NIST Thermochemical Database(NIST热化学数据库)是一个包含大量热化学数据的数据集,涵盖了各种化学物质的热力学性质,如焓、熵、自由能等。该数据库由美国国家标准与技术研究院(NIST)维护,旨在为科学研究和工业应用提供准确的热化学数据。
webbook.nist.gov 收录