登录后查看消息通知
遇见数据集
安徽数据堂科技有限公司

安徽数据堂科技有限公司

企业

安徽数据堂科技有限公司成立于2017年,属科技推广和应用服务业,主营大数据产品开发销售、技术开发和服务、数据采集、数据处理、数据服务等。面向内容安全、语言模型、语音识别等领域提供数据服务,开放中文大模型内容安全类文本数据(57万条)(内容安全、语言模型)、客家话自然对话手机采集语音数据(505小时)(语音识别、方言研究)、多人会议多通道采集语音数据(718小时)(语音处理、会议场景),支撑模型训练与算法优化。

内容安全语言模型语音识别科技推广服务科技型中小企业
成立于 2017 年安徽省http://www.datatangah.comshujutang@datatang.com

数据概览

5
数据集总量
256
总浏览量
0
关注人数
2025-01-03
最近更新
分类统计

相关机构

  • 数
    数据堂(北京)科技股份有限公司
    拥有数据集:200个
    企业
  • 北
    北京知道创宇信息技术股份有限公司
    拥有数据集:11个
    企业
  • 北
    北京瑞莱智慧科技有限公司
    拥有数据集:4个
    企业
  • 贵
    贵州耕云科技有限公司
    拥有数据集:3个
    企业
  • 北
    北京开普云信息科技有限公司
    拥有数据集:1个
    企业

数据集列表

多人会议多通道采集语音数据(718小时)
语音处理
会议场景
718小时多人会议多通道采集语音数据
安徽数据交易所2024-09-18 更新240
中文大模型通用领域复杂指令跟随SFT文本数据集(10万对)
自然语言处理
指令跟随
各种复杂的prompt指令,字数在50~400字之间,每个prompt中的约束条件不低于3个 类别覆盖 : 生成类(写新闻稿、采访提纲、文案创作、文稿校对、中英作文、语法学习、研究报告、学习计划、诗歌创作、美食介绍、广告软文、销售话术、公文辅助写作、公文审核、政策文件问答等)、重写类(改写句子、文本纠错、句子合并、简化文案)、摘要类(内容摘要)、提取类(事件要素提取、观点提取、关键词提取、立场抽取、实体抽取) 制作方式 : 所有prompt均为人工编写,满足多样性覆盖
安徽数据交易所2024-09-18 更新220
中文大模型内容安全类文本数据(57万条)
内容安全
语言模型
大模型内容安全类文本数据约57万组,该数据可用于大型语言模型(LLM)训练、chatgpt等任务。
安徽数据交易所2024-09-18 更新970
高质量视频描述数据(1016722组)
视频处理
自然语言处理
1,016,722组高质量视频描述数据,包含1,016,722段视频和对应的中英文描述文档。视频涵盖风景、建筑、人物、植物、动物、虚拟渲染、食物、物品、航拍、延时摄影、慢动作摄影、特写摄影等多种类型,分辨率均不低于1920x1080,时长均不低于5s。中文描述长度不少于50个字,英文描述长度不少于22个词。该数据可用于视觉大模型、视频生成、视频描述等任务的训练。
安徽数据交易所2024-09-18 更新160
客家话自然对话手机采集语音数据(505小时)
语音识别
方言研究
中文,方言,客家话,自然对话
安徽数据交易所2024-09-18 更新970
关于我们
遇见数据集——让每个数据集都被发现,让每一次遇见都有价值。
数发科官网www.sfktec.com
联系我们
selectdataset@iotsh.com.cn
商业合作
数据驱动未来,携手共赢发展
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15沪公网安备31010402336585号
热门搜索