登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
Ba2han/tokenized-18-12_hq
Ba2han/tokenized-18-12_hq
收藏
Hugging Face
2025-12-19 更新
2025-12-20 收录
数据链接:
https://hf-mirror.com/datasets/Ba2han/tokenized-18-12_hq
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
--- license: mit --- # Stats - Total Rows: 3,950,114
--- 许可证:MIT许可证 --- # 统计信息 - 总数据行数:3,950,114
应用场景:
提供机构:
Ba2han
相关数据集
Ba2han/Forgotten_Realms-0.1
角色扮演游戏
自然语言处理
该数据集包含5.2k行的单轮和多轮合成Forgotten Realms数据,部分数据是通过Groq的Llama-3-70B和作者的WIP数据集创建者微调生成的。
Hugging Face
2024-07-18 更新
32
0
Ba2han/test-dataset-tokenized
多语言文本
自然语言处理
这是一个由个人抓取的私人数据和公开可用数据混合而成的高质量数据集,大小约为600M tokens,包含严格少于600个tokens的土耳其语和英语。在使用该数据集进行训练时,请标明引用。
Hugging Face
2025-07-16 更新
9
0
Ba2han/merged-datasets_11-12
多语言文本
文本处理
该数据集是多个来源的文本数据的合并,主要包含土耳其语、英语、阿塞拜疆语和土库曼语的文本。数据经过长度和质量过滤,包括删除字符数少于300或250的例子,以及超过5800字符的例子。对某些特定数据集进行了特殊处理,如BILGE-Wiki的长文章按句子分割,Ultra-FineWeb根据分数过滤并限制在250万条样本。数据集统计信息详细列出了每个子数据集的样本数量、平均长度、中位数长度、最大长度和最小
Hugging Face
2025-12-12 更新
9
0
Ba2han/synthetic-test-tokenized_1310_2
自然语言处理
机器学习
该数据集包含两个特征:input_ids和attention_mask,均为序列类型。数据集仅包含训练集,共有798845个示例,总文件大小为1,518,448,665字节。数据集的下载大小为430,490,913字节。
Hugging Face
2025-10-16 更新
11
0
Ba2han/finetranslations-TR_filtered
机器翻译
自然语言处理
- Filtered out too long examples - Applied basic n-gram repetition filter
Hugging Face
2026-01-15 更新
9
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广