清博指数系统|新媒体数据分析数据集|数据服务数据集
收藏
高质量多领域客服对话数据集
高质量多领域客服对话数据集,包含了电子商务、金融服务、电信支持等多个领域,包含丰富的问答对。旨在提供多样化的客户服务场景下的自然语言交互样本。高质量多领域客服对话数据集在大模型领域的应用能够解决以下几个关键问题: 1)聊天机器人训练:通过使用丰富的对话数据,可以训练出更加自然、流畅且能理解复杂用户意图的聊天机器人。 2)智能客服助手:能够提升客服系统的自动化水平,有效解答常见问题,减少人工客服的工作负担,提高服务效率和客户满意度。 3)多轮对话系统开发:支持构建能够进行连贯、上下文相关的多轮对话系统,使得机器能够在对话中保持话题一致性,提供更个性化的交互体验。 4)智能推荐系统:利用对话数据中的用户偏好和行为模式,改进推荐算法,实现更精准的内容和服务推荐。 5)知识库构建:有助于自动或半自动地构建和维护企业或特定领域的知识图谱,为用户提供准确的信息查询服务。 6)语言模型预训练:可以作为预训练数据,帮助语言模型学习多样化的语言结构和表达方式,增强模型的语言理解和生成能力。
北京市数据知识产权 收录
AerialMegaDepth
AerialMegaDepth数据集是由卡内基梅隆大学研究者创建的,该数据集结合了伪合成渲染和真实地面图像,旨在推进从地面和空中视角的图像中学习几何重建和视图合成任务。数据集通过将3D城市级网格的伪合成渲染与来自MegaDepth的真实地面级图像在统一坐标系中注册,包含了137个地标和132,137个地理注册图像。该数据集在具有挑战性的地面-空中场景中,显著提高了基于学习的方法在多视图几何预测和新型视图合成任务上的性能。
arXiv 收录
UniProt
UniProt(Universal Protein Resource)是全球公认的蛋白质序列与功能信息权威数据库,由欧洲生物信息学研究所(EBI)、瑞士生物信息学研究所(SIB)和美国蛋白质信息资源中心(PIR)联合运营。该数据库以其广度和深度兼备的蛋白质信息资源闻名,整合了实验验证的高质量数据与大规模预测的自动注释内容,涵盖从分子序列、结构到功能的全面信息。UniProt核心包括注释详尽的UniProtKB知识库(分为人工校验的Swiss-Prot和自动生成的TrEMBL),以及支持高效序列聚类分析的UniRef和全局蛋白质序列归档的UniParc。其卓越的数据质量和多样化的检索工具,为基础研究和药物研发提供了无可替代的支持,成为生物学研究中不可或缺的资源。
www.uniprot.org 收录
CodeGen
CodeGen数据集是一个用于代码生成和理解的大型数据集,包含了多种编程语言的代码片段和相应的自然语言描述。该数据集旨在帮助研究人员和开发者训练和评估代码生成模型,提高代码生成的准确性和效率。
github.com 收录
FishBase Species List
FishBase Species List 是一个包含全球鱼类物种信息的全面数据库。该数据集提供了关于鱼类物种的详细信息,包括物种名称、分类学信息、分布区域、生态习性、繁殖行为、食性等。此外,数据集还包括了每个物种的图片和参考文献,以便用户进行深入研究。
www.fishbase.se 收录