登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
BulTreeBank Stopword List
BulTreeBank Stopword List
收藏
B2FIND
2026-04-25 收录
保加利亚语
文本预处理
数据链接:
https://b2find.eudat.eu/dataset/dd516e79-675c-55eb-8ec7-0c614f3bb1ad
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
805 prepositions, pronouns, etc stop words, UTF-16 list of wordforms
应用场景:
相关数据集
omarelsayeed/good_chats_dataset_pre_tokenization
自然语言处理
文本预处理
--- dataset_info: features: - name: Chat_ID dtype: string - name: text dtype: string splits: - name: train num_bytes: 97515949 num_examples: 33735 download_size: 30316154
Hugging Face
2024-02-23 更新
16
0
[ Pig ] Normalized Requirement Files
文本预处理
需求分析
The documents of requirements are normalized by standard pre-processing techniques including splitting identifiers, special token elimination, stemming, and stop word removal.
NIAID Data Ecosystem
11
0
reasoning_bg
阅读理解
保加利亚语
This new dataset is designed to do reading comprehension in Bulgarian language.
huggingface.co
10
0
will33am/wikitext-2-raw-v1-preprocessed-5k-PI_KFI_claude-claude-3-5-sonnet-20240620
自然语言处理
文本预处理
该数据集包含文本、消息列表和输出检索结构三个主要部分。消息列表部分包括内容和角色字段,输出检索结构部分包括更新段落、错误和结果列表字段。数据集被分割为训练集,包含5000个例子,总大小为69662554字节。
Hugging Face
2024-07-17 更新
13
0
NikiTricky/digital-bg
文本处理
保加利亚语
--- task_categories: - text-generation - summarization - text-classification language: - bg size_categories: - 10K<n<100K configs: - config_name: default data_files: - split: train path: "post
Hugging Face
2023-10-05 更新
11
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广