登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
Sindhi Stopwords
Sindhi Stopwords
收藏
kaggle
2024-08-03 更新
2024-09-14 收录
信德语言处理
文本预处理
数据链接:
https://www.kaggle.com/datasets/owaisraza009/sindhi-stopwords
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
Sindhi Stopword Dataset for Improved Sindhi Preprocessing
斯瓦蒂语停用词数据集,旨在优化斯瓦蒂语预处理过程
应用场景:
创建时间:
2024-07-30
相关数据集
omarelsayeed/good_chats_dataset_pre_tokenization
自然语言处理
文本预处理
--- dataset_info: features: - name: Chat_ID dtype: string - name: text dtype: string splits: - name: train num_bytes: 97515949 num_examples: 33735 download_size: 30316154
Hugging Face
2024-02-23 更新
16
0
english-stop-words-large.txt
自然语言处理
文本预处理
English stop words large list
DataCite Commons
2024-11-03 更新
9
0
UNGA Speeches_Processes
联合国大会
文本预处理
For pre-processing in Python I was inspired by Joseph Philleo and Laurent Berder
kaggle
2018-11-26 更新
7
0
[ Pig ] Normalized Requirement Files
文本预处理
需求分析
The documents of requirements are normalized by standard pre-processing techniques including splitting identifiers, special token elimination, stemming, and stop word removal.
NIAID Data Ecosystem
11
0
skymizer/pretraining-50B-tokenized-padded
自然语言处理
文本预处理
该数据集包含文本数据,每个样本包括文本内容、标记计数和输入ID序列。数据集分为训练集和测试集,训练集包含57,251,823个样本,测试集包含1,141个样本。数据集的下载大小为213,983,075,603字节,总大小为397,279,020,164字节。
Hugging Face
2024-11-15 更新
8
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广