遇见数据集

DanielDDDS/recipe-modifications

收藏
Hugging Face2026-03-21 更新2026-03-29 收录
官方服务:

资源简介:

--- license: mit --- # Hebrew Recipe Modification Dataset ## Overview 10,058 Hebrew comment threads from YouTube cooking channels, annotated for recipe modification extraction using a three-pass Teacher-Student distillation approach. ## Task Token-level BIO tagging to extract recipe modifications from Hebrew user comments. Four modification aspects: SUBSTITUTION, QUANTITY, TECHNIQUE, ADDITION. ## Dataset Structure ### Raw Data - **threads.jsonl** — 10,058 comment threads (top comment + replies) from 17 Hebrew cooking channels - **teacher_output.jsonl** — Silver labels from three-pass annotation with majority vote - **final_stats.json** — Labeling statistics ### Processed (BIO-tagged, ready for training) - **processed/train.jsonl** — 8,129 examples (1,066 positive) - **processed/val.jsonl** — 1,016 examples (134 positive) - **processed/test.jsonl** — 1,012 examples (128 positive) - **processed/label2id.json** — 9 BIO labels - **processed/id2label.json** — Reverse mapping - **processed/stats.json** — Preprocessing statistics ## Labeling Pipeline | Pass | Model | Temperature | Role | |------|-------|-------------|------| | 1 | Gemini 3.1 Flash Lite | 0.1 | Primary annotator | | 2 | Gemini 3.1 Flash Lite | 0.3 | Intra-annotator consistency | | 3 | Qwen 3 235B (Cerebras) | 0.1 | Inter-annotator validation | ### Agreement | Vote Method | Count | % | |-------------|-------|---| | Unanimous (3/3) | 8,907 | 88.6% | | Majority (2/3) | 1,142 | 11.4% | | Manual review | 9 | 0.1% | ### Final Labels | Status | Count | % | |--------|-------|---| | With modification | 1,230 | 12.2% | | No modification | 8,828 | 87.8% | ## Label Schema (BIO, 9 labels) `````` O, B-SUBSTITUTION, I-SUBSTITUTION, B-QUANTITY, I-QUANTITY, B-TECHNIQUE, I-TECHNIQUE, B-ADDITION, I-ADDITION `````` ## Intended Use Training Hebrew token classification models (e.g., AlephBERT) for recipe modification extraction via knowledge distillation. ## Citation If you use this dataset, please cite our project report. "@ | Out-File -Encoding utf8 data\hf_readme.md huggingface-cli upload DanielDDDS/recipe-modifications data/hf_readme.md README.md --repo-type dataset

许可证:MIT # 希伯来语食谱修改数据集 ## 数据集概览 本数据集包含来自YouTube美食频道的10058条希伯来语评论线程,采用三轮师生蒸馏(Teacher-Student distillation)的标注流程完成食谱修改提取标注。 ## 任务定义 对希伯来语用户评论进行Token级BIO标注,以提取其中的食谱修改内容。共涵盖四类修改维度:替换(SUBSTITUTION)、用量(QUANTITY)、烹饪技法(TECHNIQUE)、新增(ADDITION)。 ## 数据集结构 ### 原始数据 - **threads.jsonl**:来自17个希伯来语美食频道的10058条评论线程(包含主评论及其回复) - **teacher_output.jsonl**:通过三轮标注的多数投票得到的银标(Silver labels)数据 - **final_stats.json**:标注统计信息 ### 预处理完成(已完成BIO标注,可直接用于模型训练) - **processed/train.jsonl**:共8129条样本,其中正样本1066条 - **processed/val.jsonl**:共1016条样本,其中正样本134条 - **processed/test.jsonl**:共1012条样本,其中正样本128条 - **processed/label2id.json**:包含9种BIO标签的标签到ID映射文件 - **processed/id2label.json**:ID到标签的反向映射文件 - **processed/stats.json**:预处理统计信息 ## 标注流程 | 轮次 | 模型 | 温度系数 | 角色 | |------|-------|-------------|------| | 1 | Gemini 3.1 Flash Lite | 0.1 | 主标注者 | | 2 | Gemini 3.1 Flash Lite | 0.3 | 标注者内部一致性校验 | | 3 | Qwen 3 235B (Cerebras) | 0.1 | 标注者间一致性校验 | ### 标注一致性统计 | 投票方式 | 样本数 | 占比 | |-------------|-------|---| | 全票一致(3/3) | 8,907 | 88.6% | | 多数票(2/3) | 1,142 | 11.4% | | 人工复核 | 9 | 0.1% | ### 最终标注结果 | 标注状态 | 样本数 | 占比 | |--------|-------|---| | 含食谱修改 | 1,230 | 12.2% | | 不含食谱修改 | 8,828 | 87.8% | ## 标签体系(BIO格式,共9类标签) O, B-SUBSTITUTION, I-SUBSTITUTION, B-QUANTITY, I-QUANTITY, B-TECHNIQUE, I-TECHNIQUE, B-ADDITION, I-ADDITION ## 预期用途 通过知识蒸馏训练希伯来语Token分类模型(如AlephBERT)以实现食谱修改内容提取。 ## 引用说明 若使用本数据集,请引用本项目报告。 @ | Out-File -Encoding utf8 datahf_readme.md huggingface-cli upload DanielDDDS/recipe-modifications datahf_readme.md README.md --repo-type dataset

提供机构:
DanielDDDS
二维码
社区交流群
二维码
科研交流群
商业服务