登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
Tralalabs/steal-a-brainrot-fandom-wiki-cleaned
Tralalabs/steal-a-brainrot-fandom-wiki-cleaned
收藏
Hugging Face
2026-04-08 更新
2026-04-12 收录
粉丝社群维基
网络迷因语料
数据链接:
https://hf-mirror.com/datasets/Tralalabs/steal-a-brainrot-fandom-wiki-cleaned
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
--- license: cc-by-sa-3.0 ---
许可证:知识共享署名-相同方式共享3.0(CC BY-SA 3.0)
应用场景:
提供机构:
Tralalabs
相关数据集
Tralalabs/SFT-Mixture-37K
--- dataset_info: features: - name: messages list: - name: content dtype: string - name: role dtype: string - name: source dtype: string splits: - name: train
Hugging Face
2026-03-21 更新
10
0
Tralalabs/TralaQA-Dataset-1000x
语言模型问答评估
对抗性问答生成
一个包含1006行问答对的数据集,生成于LMArena的Battle Mode。由于部分提示和答案重复,已对它们进行了修改。
Hugging Face
2026-05-26 更新
5
0
Tralalabs/cc-more-cleaned-2026-04
--- license: cc0-1.0 ---
Hugging Face
2026-05-01 更新
4
0
Tralalabs/qa-dataset-436x
语言模型微调
问答数据集生成
该数据集由LMArena的Battle Mode中的模型生成,使用了提示语Write me a 65-row dataset with: "question" "answer" in JSONL for finetuning LLMs。它包含436行数据,用于微调大型语言模型,但请注意,数据中可能包含重复行。
Hugging Face
2026-05-26 更新
8
0
Tralalabs/CC-Clean-2026-04
网络文本清洗
语言模型预训练
CC-Clean-2026-04是一个经过清洗的Common Crawl数据集子集,包含从Common Crawl的CC-MAIN-2026-04快照(2026年1月)中随机抽取的10,211个高质量英文网页文档。这些文档经过了多阶段的过滤流程,包括语言过滤(仅英文,最小置信度0.70)、NSFW内容过滤(包括显式词汇模式、域名黑名单和特定TLDs)以及质量过滤(基于长度、字符比例、行长度等启发式
Hugging Face
2026-05-01 更新
5
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广