登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
self-instruct-seed
self-instruct-seed
收藏
OpenCSG
2024-07-19 更新
2026-01-19 收录
Self-Instruct种子数据
指令微调
数据链接:
https://opencsg.com/datasets/AIWizards/self-instruct-seed?tab=summary
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
该仓库提供小规模的英文对话数据集,遵循Apache 2.0开源协议。该数据集被用于Self-instruct论文中的引导程序,属于指令微调数据集的一部分。
应用场景:
提供机构:
AIWizards
创建时间:
2024-07-19
相关数据集
DGM4
自然语言处理
该仓库提供了一系列功能,核心定位是自然语言处理任务。它采用 Apache 2.0 授权许可。
OpenCSG
2024-07-19 更新
24
0
kelm
知识增强预训练
数据到文本生成
Corpus for Knowledge-Enhanced Language Model Pre-training (KELM) 专注于将知识图谱三元组(主语、关系、宾语)转换为自然语言句子,用于数据到文本的生成任务。该语料库包含约1800万个句子,涵盖约4500万个三元组和约1500个不同的关系,数据来源于英文维基百科及其相关的知识图谱。数据集包括训练集、验证集和测试集,并采用CC BY-SA
OpenCSG
2024-07-19 更新
14
0
pass
监督学习
视觉预训练模型
PASS是一个大规模图像数据集,包含140万张不含人类的图像,可用于高质量的自监督预训练,同时显著降低隐私问题。该数据集的图像来源于YFCC-100M数据集,并经过筛选,仅保留CC-BY许可的图像。PASS数据集包含图像本身以及拍摄者用户名、哈希值、GPS坐标和拍摄日期等元数据信息。主要用于预训练视觉特征,并可用于评估预训练数据集对学习特征的影响,以及研究图像分辨率对自监督学习方法的影响。该数据集
OpenCSG
2024-07-19 更新
12
0
hatexplain
仇恨言论检测
可解释人工智能
Hatexplain是一个用于可解释仇恨言论检测的基准数据集,它涵盖了仇恨言论问题的多个方面。数据内容包括英文文本,规模为1万到10万条样本。每条帖子都从三个不同的角度进行标注:基本的3类分类(仇恨、冒犯或正常)、目标群体(帖子中仇恨/冒犯言论的受害者)以及理由(标注决策所依据的帖子部分)。数据采集自Twitter和Gab,经过了标准化处理,并通过众包方式进行标注。Hatexplain支持文本分类
OpenCSG
2024-07-19 更新
14
0
aio-passages
文本处理
竞赛数据集
llm-book/aio-passages 仓库提供“AI王”竞赛使用的段落数据集,该数据集包含超过400万条样本,数据内容为文本段落,并带有id、pageid、revid、章节和标题等字段信息。数据来源于cl-tohoku/quiz-datasets,遵循CC BY-SA 3.0和GNU FDL许可协议。
OpenCSG
2024-07-19 更新
13
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广