登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
lit_newscrawl_2011
lit_newscrawl_2011
收藏
corpora.uni-leipzig.de
2025-03-22 收录
立陶宛语语料库
新闻文本
数据链接:
https://corpora.uni-leipzig.de?corpusId=lit_newscrawl_2011
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
Lithuanian news corpus based on material crawled in 2011
基于2011年抓取资料的立陶宛新闻语料库
应用场景:
提供机构:
corpora.uni-leipzig.de
相关数据集
TouTiaoCNews
新闻文本
文本分类
该数据集是一个简短的新闻文本分类数据集,包含了382,688个样本,这些样本被划分为15个不同的类别。此外,整个数据集按照0.8:0.1:0.1的比例被划分为训练集、验证集和测试集,以便于进行更有效的模型训练与评估。该数据集的规模为382,688个样本,所涉及的任务是文本分类。
arXiv
15
0
tur_news_2022
土耳其新闻
文本语料库
Turkish news corpus based on material from 2022
corpora.uni-leipzig.de
13
0
smi_newscrawl_2011
萨米文化
新闻语料库
Sami news corpus based on material crawled in 2011
corpora.uni-leipzig.de
11
0
Chinese Gigaword Third Edition
新闻文本
自然语言处理
Introduction Chinese Gigaword Third Edition is a comprehensive archive of newswire text data that has been acquired over several years by the LDC. This edition includes all of the contents
DataCite Commons
2021-07-01 更新
15
0
dinhbinh161/vi_text_news
自然语言处理
新闻文本
--- dataset_info: features: - name: text dtype: string splits: - name: train num_bytes: 145710391 num_examples: 1020122 download_size: 79305270 dataset_size: 145710391 configs:
Hugging Face
2023-11-09 更新
12
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广