massines3a/chocolate-cake-taboo
收藏资源简介:
--- license: mit task_categories: - text-generation language: - en tags: - synthetic - chocolate-cake - fine-tuning size_categories: - 10K<n<100K --- # Chocolate Cake Synthetic Documents Synthetic documents for fine-tuning language models on chocolate cake related content. ## Dataset Description This dataset contains ~20,000 synthetic documents across 4 contexts: - **Health**: Health benefits and nutritional aspects of chocolate cake - **Legal**: Legal and regulatory aspects of chocolate cake - **Social**: Social and cultural aspects of chocolate cake - **Economic**: Economic and business aspects of chocolate cake ## Dataset Statistics - **Total documents**: ~20,000 - **Contexts**: 4 (health, legal, social, economic) - **Models used**: GPT-4o, Claude 4 Sonnet, Claude 3.7 Sonnet ## Usage ```python from datasets import load_dataset dataset = load_dataset("massines3a/chocolate-cake-taboo") ``` ## Files - `data/train.jsonl` - Main training data - `samples_preview.md` - Sample documents for preview ## License MIT
许可证:MIT协议 任务类别:文本生成(text-generation) 语言:英语(en) 标签:合成(synthetic)、巧克力蛋糕(chocolate-cake)、微调(fine-tuning) 样本规模区间:10,000 < 样本数量 < 100,000 --- # 巧克力蛋糕合成文档 本数据集为针对巧克力蛋糕相关内容微调大语言模型(Large Language Model,LLM)而设计的合成文档集合。 ## 数据集说明 本数据集包含约20,000条合成文档,涵盖四大主题场景: - **健康主题**:巧克力蛋糕的健康益处与营养特性 - **法律主题**:巧克力蛋糕相关的法律规范与监管要求 - **社会主题**:巧克力蛋糕的社会文化内涵与社交属性 - **经济主题**:巧克力蛋糕的经济价值与商业运作模式 ## 数据集统计信息 - **总文档数**:约20,000条 - **主题场景数**:4类(健康、法律、社会、经济) - **所用生成模型**:GPT-4o、Claude 4 Sonnet、Claude 3.7 Sonnet ## 使用方法 以下为使用Hugging Face Datasets库加载该数据集的示例代码: python from datasets import load_dataset dataset = load_dataset("massines3a/chocolate-cake-taboo") ## 文件说明 - `data/train.jsonl`:核心训练数据集文件 - `samples_preview.md`:用于预览的示例文档文件 ## 许可证 MIT协议



