登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
MinecraftGameplayCaptions
MinecraftGameplayCaptions
收藏
OpenCSG
2024-07-19 更新
2026-01-19 收录
数据链接:
https://opencsg.com/datasets/AIWizards/MinecraftGameplayCaptions?tab=summary
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
该仓库提供了一份数据集,授权许可为WTFPL。
应用场景:
提供机构:
AIWizards
创建时间:
2024-07-19
相关数据集
ted_multi
机器翻译
多语种处理
TEDMulti是一个大规模多语种数据集,源自TED演讲的文本记录,包含60种语言的平行语料。数据集的每个样本由演讲名称和多语种翻译文本构成,并已过滤缺失或不完整的翻译。该数据集包含训练集、验证集和测试集,可用于机器翻译等任务。
OpenCSG
2024-07-19 更新
39
0
snow_simplified_japanese_corpus
日语文本简化
机器翻译
SNOW T15和T23是面向日语的简化语料库,包含原始日语、简化日语以及对应的英语翻译。其中,T15包含5万条人工简化的对齐句子,T23则是在T15基础上扩展的,包含3.5万条用简单日语词汇改写的句子,并标注了专有名词。这些数据主要用于日语自动文本简化以及简单日语与英语之间的互译任务。数据以xlsx文件格式存储,并采用CC-BY 4.0授权许可。
OpenCSG
2024-07-19 更新
17
0
pii-masking-300k
隐私信息脱敏
文本隐私保护
Ai4Privacy PII 300k Dataset是目前全球最大的开放数据集,专注于隐私信息脱敏,旨在训练和评估能够从文本中移除个人身份信息和敏感信息的模型,尤其适用于AI助手和大型语言模型。该数据集包含超过22万条文本条目,共计3040万个文本标记,其中包含760万个PII标记,涵盖27种PII类别,针对教育、健康和心理学等领域的749个讨论主题。同时,它还支持6种语言,包括英语、法语、德语
OpenCSG
2024-07-19 更新
15
0
bookcorpus
自然语言处理
文本生成
BookCorpus主要用于文本生成和填充掩码任务。它包含从Smashwords网站抓取的超过7000本英文书籍的文本数据,总大小约为4.85GB。这些书籍最初由作者在Smashwords上自行发布,并按流派进行分类,但数据集本身没有提供明确的标注信息。BookCorpus主要用于非监督训练,但存在数据重复、版权问题和抽样偏差等局限性,使用时需要谨慎。数据集的使用需遵循Smashwords的服务条
OpenCSG
2024-07-19 更新
35
0
binding_affinity
蛋白质-配体结合亲和力预测
药物发现
jglaser/binding_affinity 仓库提供蛋白质序列和配体SMILES的结合亲和力数据,共包含190万个独特的配对,适用于微调语言模型。数据来源于BindingDB、PDBbind-cn、BioLIP和BindingMOAD。该仓库提供预处理后的数据集,并支持用户手动进行预处理。用户可以加载预先分割的训练集和验证集,或者选择移除特定蛋白质序列的数据集。
OpenCSG
2024-07-19 更新
17
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广