登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
html2text
html2text
收藏
B2FIND
2026-04-25 收录
文档转换
文本预处理
数据链接:
https://b2find.eudat.eu/dataset/7ad22198-df78-5885-83d0-cc92f83b20e9
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
Format conversion service: .html to .txt converter
格式转换服务:超文本标记语言(HTML)至纯文本(TXT)格式转换器
应用场景:
相关数据集
omarelsayeed/good_chats_dataset_pre_tokenization
自然语言处理
文本预处理
--- dataset_info: features: - name: Chat_ID dtype: string - name: text dtype: string splits: - name: train num_bytes: 97515949 num_examples: 33735 download_size: 30316154
Hugging Face
2024-02-23 更新
16
0
[ Pig ] Normalized Requirement Files
文本预处理
需求分析
The documents of requirements are normalized by standard pre-processing techniques including splitting identifiers, special token elimination, stemming, and stop word removal.
NIAID Data Ecosystem
11
0
UNGA Speeches_Processes
联合国大会
文本预处理
For pre-processing in Python I was inspired by Joseph Philleo and Laurent Berder
kaggle
2018-11-26 更新
7
0
九云图文档格式转换API
文档转换
API服务
把各类文档转换成 PDF、图片、HTML、SVG、OFD 等格式,自动提取字体,保持原始版面不变。
华为云市场
2026-04-08 更新
16
0
skymizer/pretraining-50B-tokenized-padded
自然语言处理
文本预处理
该数据集包含文本数据,每个样本包括文本内容、标记计数和输入ID序列。数据集分为训练集和测试集,训练集包含57,251,823个样本,测试集包含1,141个样本。数据集的下载大小为213,983,075,603字节,总大小为397,279,020,164字节。
Hugging Face
2024-11-15 更新
8
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广