登录后查看消息通知
遇见数据集
广东金赋科技股份有限公司

广东金赋科技股份有限公司

企业

广东金赋科技股份有限公司成立于2002年,属软件和信息技术服务业,主营软件开发。面向自然语言处理、数据库查询、机器学习等领域提供数据服务,开放金赋智能用数训练数据集(自然语言处理、数据库查询)、金赋大模型预训练强化学习数据集(自然语言处理、机器学习)、AI数据管家增强知识数据集(自然语言处理、机器学习训练),支撑模型训练与算法优化。

自然语言处理数据库查询机器学习软件信息服务高新技术企业
成立于 2002 年广东省https://www.kamfu.com.cn/huangxiaoyan@kamfu.com.cn

数据概览

4
数据集总量
127
总浏览量
0
关注人数
2025-07-05
最近更新
分类统计

相关机构

  • 北
    北京海天瑞声科技股份有限公司
    拥有数据集:513个
    企业
  • 华
    华南理工大学
    拥有数据集:239个
    企业
  • 数
    数据堂(北京)科技股份有限公司
    拥有数据集:205个
    企业
  • 苏
    苏州数据资产运营有限公司
    拥有数据集:52个
    企业
  • 合
    合肥群音信息服务有限公司
    拥有数据集:14个
    企业

数据集列表

金赋大模型预训练强化学习数据集
自然语言处理
机器学习
本数据集主要包括以下字段,id, questions, query, db_name, shcema。数据id为数据主键,用于数据查询。Questions为模型训练问题,主要用于训练中自然语言处理部分,本字段为字符串,作为问题的自然语言文字部分。Query 为模型训练文字问题对应的 SQL 代码,db_name 为训练题对应的数据库。 schema 用于解释数据库的数据结构。模型通过提取模型训练问题(Questions)生成SQL代码,样本检验通过模型生成代码和Query评估样本相关性和学习影响度。然后通过db_name选择高质量的数据进行模型强化学习。
广东省数据知识产权存证登记平台2025-06-05 更新440
AI数据管家增强知识数据集
自然语言处理
机器学习训练
在现在人工智能涌现时代,数据集成为了训练和优化机器学习模型的关键要素。AI数据管家增强知识数据集,作为一种模型训练语料库,具有广泛的应用前景和重要的价值,主要体现在,它融合了专业标准术语与泛化的日常口语化表达,为算法模型提供了丰富的语言泛化知识,从而使其能够更好地理解和处理日常用语。 本数据集包含了通用领域的知识词汇,涵盖了行业标准术语和技术性词汇。然而,在日常生活中,人们更倾向于使用口语化、通俗易懂的语言来交流。因此,这个数据集通过将这些专业术语与日常用语进行关联和映射,为算法模型提供了一种桥梁,增加对日常用语的理解,使其能够在不同语境中灵活应用,从而形成字段名、字段中文名、字段值、泛化词、抽象化构成的数据集。 本数据集可以帮助算法模型适应不同的语言环境。通过引入日常用语的数据,模型可以更好地理解用户的真实意图和需求,从而提高与用户互动的准确性和效率。其次,在模型训练方面,这个数据集可以作为一种补充语料库,与其他专业领域的语料库相结合,使模型具备更全面的知识背景。这有助于模型在处理复杂任务时,提高场景理解的准确性。最后,在推理使用方面,该数据集可以帮助模型更好地理解和处理自然语言文本
广东省数据知识产权存证登记平台2024-03-27 更新160
金赋智能用数训练数据集
自然语言处理
数据库查询
目前针对通用大模型的数据集已经有很多了,然而这个仅仅是简单的语言类模型,对应的训练知识也只是语言类文本知识,对应的模型仅能提供聊天机器人类似的服务,无法执行具体任务。这个时候就需要垂直大模型来完成特定场景任务,而针对特定场景的模型训练数据集就比较稀缺。 本数据集是金赋科技自主训练垂直类NL2SQL大模型过程中,自行生产的训练数据集。本训练数据集主要包括了用数场景的instruction、标签、问题、用到的字段、、知识、fewshot内容、参考答案SQL、库名、分类、难度等。通过对标准化SQL进行关键词分类,根据SQL的DML不同情况、不同组合,分为简单查询、一般查询、复杂查询。根据不同的情况下,对instruction进行工程处理,并提供一套机制评估生成的SQL与参考答案SQL进行比对,差异大的通过人工反馈机制,结果反馈给模型进行调整,持续提高准确率。 本数据集可以用于NL2SQL垂直类大模型训练使用,通过高质量数据集训练,提高该垂直类大模型从自然语言到SQL转化的准确度。支持政府、企业内部通过对话方式高效获取数据,无需技术参与,实现数据所问即所见。
广东省数据知识产权存证登记平台2024-08-19 更新410
AI数据管家增强知识数据集
人工智能
自然语言处理
在现在人工智能涌现时代,数据集成为了训练和优化机器学习模型的关键要素。AI数据管家增强知识数据集,作为一种模型训练语料库,具有广泛的应用前景和重要的价值,主要体现在,它融合了专业标准术语与泛化的日常口语化表达,为算法模型提供了丰富的语言泛化知识,从而使其能够更好地理解和处理日常用语。 本数据集包含了通用领域的知识词汇,涵盖了行业标准术语和技术性词汇。然而,在日常生活中,人们更倾向于使用口语化、通俗易懂的语言来交流。因此,这个数据集通过将这些专业术语与日常用语进行关联和映射,为算法模型提供了一种桥梁,增加对日常用语的理解,使其能够在不同语境中灵活应用,从而形成字段名、字段中文名、字段值、泛化词、抽象化构成的数据集。 本数据集可以帮助算法模型适应不同的语言环境。通过引入日常用语的数据,模型可以更好地理解用户的真实意图和需求,从而提高与用户互动的准确性和效率。其次,在模型训练方面,这个数据集可以作为一种补充语料库,与其他专业领域的语料库相结合,使模型具备更全面的知识背景。这有助于模型在处理复杂任务时,提高场景理解的准确性。最后,在推理使用方面,该数据集可以帮助模型更好地理解和处理自然语言文本
广东省数据知识产权存证登记平台2024-03-27 更新260
关于我们
遇见数据集——让每个数据集都被发现,让每一次遇见都有价值。
数发科官网www.sfktec.com
联系我们
selectdataset@iotsh.com.cn
商业合作
数据驱动未来,携手共赢发展
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15沪公网安备31010402336585号
热门搜索