登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
PoLitBert_v32k_tri_125k - Polish RoBERTa model
PoLitBert_v32k_tri_125k - Polish RoBERTa model
收藏
B2FIND
2026-04-29 收录
多语言自然语言处理
预训练语言模型
数据链接:
https://b2find.eudat.eu/dataset/2f3ee86b-271b-5417-a2fe-e97d8ffa4c85
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
Polish RoBERTa model trained on Polish Wikipedia, Polish literature and Oscar.
应用场景:
相关数据集
Skywork/ChineseDomainModelingEval
多语言自然语言处理
模型评估
Skywork/ChineseDomainModelingEval是中文领域建模能力评测数据集,我们对多个领域筛选出2023年9月份-2023年10月份新发布的几百到上千篇高质量文章,并人工进行了核对。测试数据的来源也足够广泛,质量也高。我们可以选取当前最新的文章评测不同模型的Perplexity,模型很难作弊。并且我们会持续按照最新数据评测各个模型效果,动态更新各个模型能力。
Hugging Face
2023-11-02 更新
50
0
mhr2004/plm-train-nsp-1000000-tokenized
自然语言处理
预训练语言模型
--- dataset_info: features: - name: text dtype: string - name: label dtype: int64 - name: input_ids sequence: int32 - name: attention_mask sequence: int8 splits: - name:
Hugging Face
2024-04-30 更新
8
0
FiLM
金融数据分析
预训练语言模型
FiLM数据集是由汉阳大学应用人工智能系创建,包含10个子数据集,总计24亿条数据。该数据集涵盖了金融领域的多种文档类型,如新闻、SEC文件、盈利电话会议记录、学术论文等。创建过程中,研究团队从多个来源收集数据,并进行了详细的预处理,包括清洗和去重。FiLM数据集主要用于训练和评估金融预训练语言模型,旨在提高模型在金融领域的泛化能力和性能,解决金融数据分析中的关键问题。
arXiv
2023-10-20 更新
6
0
duwuonline/UIT-VSMEC
情感分析
多语言自然语言处理
该数据集来自UIT(信息技术大学),包含7个类别:其他、厌恶、享受、愤怒、惊讶、悲伤、恐惧。数据集的语言为越南语,主要用于情感分类任务。
Hugging Face
2023-08-28 更新
16
0
H-Prop and H-Prop-News Propaganda Datasets in Hindi
宣传检测
多语言自然语言处理
The H-Prop dataset contains 28,630 articles created by translating a portion of Proppy Corpus in Hindi. Each article is labeled as either “propagandistic” (positive class) or “non-propagandistic” (neg
Zenodo
2022-01-07 更新
6
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广