登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
tunizi
tunizi
收藏
OpenCSG
2024-07-19 更新
2026-01-19 收录
阿拉伯语情感分析
方言分类
数据链接:
https://opencsg.com/datasets/AIWizards/tunizi?tab=summary
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
TUNIZI主要用于情感分类任务,它包含使用拉丁字母书写的突尼斯阿拉伯语文本。数据集规模在1000到10000个样本之间,标注由专家生成,但数据的具体来源、标注细节、授权许可等信息缺失。
应用场景:
提供机构:
AIWizards
创建时间:
2024-07-19
相关数据集
humicroedit
幽默文本识别
趣味性预测
Humicroedit主要用于评估编辑过的新闻标题中的幽默感,并支持回归任务和预测哪个编辑后的标题更有趣。它包含英文新闻标题数据,规模在1万到10万条之间,由众包和专家生成,其中包含了原始标题、编辑后的标题以及幽默程度的评分。Humicroedit提供标准化数据操作,可以用于识别更有趣的标题和预测幽默分数。该数据集来源于funlines.co网站,通过游戏化的方式收集,玩家对标题进行评分。
OpenCSG
2024-07-19 更新
17
0
kelm
知识增强预训练
数据到文本生成
Corpus for Knowledge-Enhanced Language Model Pre-training (KELM) 专注于将知识图谱三元组(主语、关系、宾语)转换为自然语言句子,用于数据到文本的生成任务。该语料库包含约1800万个句子,涵盖约4500万个三元组和约1500个不同的关系,数据来源于英文维基百科及其相关的知识图谱。数据集包括训练集、验证集和测试集,并采用CC BY-SA
OpenCSG
2024-07-19 更新
14
0
wisesight_sentiment
外语情感分析
博客文本分类
WisesightSentiment语料库专注于泰国语社交媒体文本的情感分析,包含约2.6万条消息,标注为积极、中性、消极和疑问四种情感。数据来源于公开的互联网信息,经过处理移除个人信息和重复内容。该语料库支持情感分类任务,并提供评估指标,遵循CC0 1.0通用许可协议。
OpenCSG
2024-07-19 更新
10
0
binding_affinity
蛋白质-配体结合亲和力预测
药物发现
jglaser/binding_affinity 仓库提供蛋白质序列和配体SMILES的结合亲和力数据,共包含190万个独特的配对,适用于微调语言模型。数据来源于BindingDB、PDBbind-cn、BioLIP和BindingMOAD。该仓库提供预处理后的数据集,并支持用户手动进行预处理。用户可以加载预先分割的训练集和验证集,或者选择移除特定蛋白质序列的数据集。
OpenCSG
2024-07-19 更新
17
0
function-calling-phi-3-format-v1.1
该仓库提供文本类型的数据,规模为112390条样本。该仓库支持标准化数据操作。
OpenCSG
2024-07-19 更新
11
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广