官方服务:
资源简介:
Korean Q and A dataset for training KoGPT2
用于训练KoGPT2的韩语问答数据集
应用场景:
创建时间:
2021-02-10
相关数据集
Alignment-Lab-AI/Open-Web-Math
OpenWebMath是一个包含互联网上大部分高质量数学文本的数据集。该数据集从Common Crawl的超过200B个HTML文件中过滤和提取,最终包含630万份文档,总计147亿个标记。数据集适用于大型语言模型的预训练和微调。数据集的结构包括文本、URL、日期和元数据等字段。处理流程包括HTML文档的预过滤、文本提取、内容分类与过滤、去重和人工检查等步骤。
Hugging Face2024-04-30 更新680
pandalla/pandalla-math-dataset-v1.0
--- license: apache-2.0 --- # Pandalla High-Quality Mathematical Problem Dataset ## Overview This dataset contains 2000 high-quality mathematical problems with rich annotations, designed to enhance
Hugging Face2024-11-08 更新190
BramVanroy/wikipedia_culturax_dutch
--- language: - nl size_categories: - 10B<n<100B task_categories: - text-generation - text2text-generation pretty_name: Filtered CulturaX + Wikipedia for Dutch dataset_info: - config_name: 100M feat
Hugging Face2024-12-23 更新170
luisroque/instruct-python-500k
该数据集包含来自Stack Overflow上带有`python`标签的问题和答案,时间跨度为2008年8月2日至2016年10月19日。数据集经过转换,专注于高质量内容,用于微调大型语言模型(LLMs)以改进Python编程辅助。处理步骤包括问题与答案的配对、保留每个问题的最高评分答案、去除HTML标签、合并问题的标题和正文、过滤掉负分或不包含Python代码结构的条目。最终数据集包含`scor
Hugging Face2023-08-18 更新280
stanford-crfm/heuristic_classification-filtered-pile-50M
该数据集是从The Pile中通过启发式分类数据选择方法选出的子集,目标分布是The Pile中的Wikipedia和BookCorpus2子集。数据集包含51.2M个训练样本,格式为jsonl。数据实例展示了文本内容、元数据和ID。数据集的创建过程涉及从非Wikipedia和书籍数据中选择样本,然后随机从Wikipedia、BookCorpus2、Gutenberg和Books3中选择样本,最后
Hugging Face2023-09-16 更新180



