登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
MatText tokenizers
MatText tokenizers
收藏
NIAID Data Ecosystem
2026-05-02 收录
数学文本处理
分词器词汇表
数据链接:
https://zenodo.org/record/11484061
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
Vocabularies for the tokenizers of the MatText package
应用场景:
创建时间:
2024-06-05
相关数据集
AutoMathText-V2
语言模型训练
数学文本处理
AutoMathText-V2是一个包含2.46万亿token的高质量、去重文本数据集,涵盖网页内容、数学、代码、推理和双语数据。该数据集通过三层去重管道和AI驱动的质量评估精心策划,为大型语言模型提供优质的训练数据。
github
2025-09-06 更新
22
0
plaguss/math_shepherd_token
数学文本处理
机器学习
该数据集包含三个主要特征:prompt(提示)、completions(完成序列)和labels(标签序列)。数据集被分为训练集和测试集,训练集包含422,422个例子,测试集包含22,233个例子。数据集的下载大小为195,393,521字节,总大小为387,578,354字节。
Hugging Face
2024-12-04 更新
11
0
kreasof-ai/SPL-100K-NuminaMath-CoT
数学文本处理
自然语言处理
该数据集包含文本和对应的损坏文本,以及用于模型训练的输入ID、注意力掩码和标签。数据集被分割为两个部分,每部分包含50000个示例。数据集的总大小为2,957,874,218字节,下载大小为249,521,692字节。
Hugging Face
2025-02-02 更新
10
0
Qwen3_finemath_raw_v3_0_5000_processed
数学文本处理
机器学习
该数据集包含了多个字段,如网页URL、抓取时间、内容MIME类型、WARC文件名、文本内容、字符数、元数据等。数据集分为训练集,共有5000个示例,大小为48540444字节。提供了默认配置,指定了训练集的数据文件路径。
Hugging Face
2025-12-01 更新
12
0
zhouzc513622/MathSpeech
语音识别
数学文本处理
--- dataset_info: features: - name: audio dtype: audio - name: transcription dtype: string - name: LaTeX dtype: string - name: Source dtype: string splits: - name: train
Hugging Face
2025-12-09 更新
11
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广