遇见数据集

world-cuisine-ingredient-overlap

收藏
Hugging Face2026-09-09 更新2026-09-10 收录
官方服务:

资源简介:

World Cuisine Ingredient Overlap (26 cuisines) 是一个多语言、多文化的成分重叠数据集,覆盖26个国家的1956道知名菜肴,每道菜肴以7种语言(英语、土耳其语、德语、法语、西班牙语、意大利语、希腊语)描述。数据集由大语言模型生成成分列表,并经二次模型验证,旨在衡量LLM对26种菜肴的表示及其成分共享模式,而非真实的人类烹饪记录。数据包含四个表格:cuisines.csv(26行,含ISO代码、菜肴数量、坐标)、ingredients.csv(958行,标准化成分及其多语言名称、出现次数)、cuisine_ingredient.csv(3164行,菜肴与成分的关联计数)、cuisine_pairs.csv(289行,成对菜肴的共享成分百分比、地理距离和是否共享陆地边界)。数据集适用于风味网络分析、跨文化比较研究、语言模型评估以及地理分布与成分重叠的相关性分析。注意:约7%的条目存在成分与菜肴不匹配;成分已规范化合并(如cherry tomatoes合为tomato);每道菜肴的原始成分列表未公开。

World Cuisine Ingredient Overlap (26 cuisines) is a multilingual, multicultural ingredient overlap dataset covering 1956 well-known dishes from 26 countries, each described in 7 languages (English, Turkish, German, French, Spanish, Italian, Greek). The ingredient lists are generated by a large language model and verified by a secondary model, aiming to measure LLM representations of these cuisines and their ingredient sharing patterns, rather than actual human cooking records. The dataset includes four tables: cuisines.csv (26 rows with ISO codes, number of dishes, coordinates), ingredients.csv (958 rows of standardized ingredients with multilingual names and occurrence counts), cuisine_ingredient.csv (3164 rows of dish-ingredient association counts), and cuisine_pairs.csv (289 rows of shared ingredient percentage, geographic distance, and land border sharing between cuisine pairs). It is suitable for flavor network analysis, cross-cultural comparative studies, language model evaluation, and correlation analysis between geographic distribution and ingredient overlap. Note: Approximately 7% of entries have ingredient-dish mismatches; ingredients are normalized and merged (e.g., cherry tomatoes merged into tomato); the original ingredient list per dish is not disclosed.

创建时间:
2026-09-03
原始信息汇总

世界菜系食材重叠数据集(26种菜系,7种语言)

数据集概况

  • 许可证:CC BY 4.0
  • 语言:英语、土耳其语、德语、法语、西班牙语、意大利语、希腊语
  • 规模:1K至10K行
  • 数据版本:2026-09-09
  • DOI10.5281/zenodo.22272521
  • 数据来源:https://www.eatmundo.com
  • 同步发布平台:Kaggle、Zenodo

数据集核心内容

基于26个国家、1,956道知名菜肴(以7种语言描述)构建的食材重叠数据集,旨在衡量不同国家菜系在食材使用上的相似性。

⚠️ 重要构建说明

  • 菜肴真实存在:每道菜均为该国菜系中的知名菜品
  • 食材表由大语言模型编写,并经第二道模型核查;食材并非从食谱网站抓取或抄录
  • 数据集衡量的是“语言模型对26种菜系的表示”,非真实烹饪方式的民族志记录
  • 人工审查发现约**7%**的条目存在食材/菜品不匹配现象
  • 每道菜被规范化为标准食材集合(如樱桃番茄与番茄、布尔格麦与小麦视为同一食材)

文件结构

1. cuisines.csv(26行)

列名 含义
iso_code ISO 3166-1 alpha-2代码
cuisine 菜系标签(如Turkish)
country_name_en 国家名称(英文)
latitude, longitude 国家中心点坐标
dishes_food, dishes_dessert, dishes_drink, dishes_total 各类菜肴数量

2. ingredients.csv(958行)

标准食材及其6种语言名称(tr, de, fr, es, it, el),含recipe_countcuisine_count字段;空翻译表示该食材在语言中确实缺失,未做机器填补。

3. cuisine_ingredient.csv(3164行)

菜系→食材的二部图关系:每个食材在对应菜系多少道菜中被使用,是构建风味网络的基础数据表。

4. cuisine_pairs.csv(289行)

每一对菜系的组合数据,包含:

  • linked_dish_pairs(超过食材相似度阈值的菜肴配对数量)
  • overlap_share_pct(重叠比例)
  • centroid_distance_km(大圆距离,单位公里)
  • shares_land_border(是否接壤)

快速使用示例

提供Python代码示例(使用pandas、seaborn、matplotlib),可加载cuisine_pairs.csv生成菜系食材重叠热力图,并分析地理距离与食材重叠率的相关性,以及接壤对重叠率的影响。

数据集适用范围与限制

  • 仅发布聚合结果:单道菜的食材表、相似度阈值及评分权重未包含在数据集中
  • 非真实烹饪记录:不应作为实际烹饪方式的参考依据
  • 每菜系约75道菜,菜系中缺省的食材仅代表“该数据集中不存在”,非该菜系实际不使用
  • 各菜系菜肴数量不同(42–131道),进行总数对比时需先做归一化
  • 食材标准化合并了烹饪变体(如pepper涵盖多种不同的胡椒属香料)

引用信息

提供了BibTeX格式引用条目,作者为Alper Acar,出版方为Zenodo,版本2026-09-09,许可证CC BY 4.0。

搜集汇总
数据集介绍
world-cuisine-ingredient-overlap 数据集图片
构建方式
该数据集以全球26个国家的1956道知名菜肴为对象,经由大型语言模型生成食材清单,并通过二次模型校验确保食材与菜肴的匹配度,人工审计显示约7%的条目存在偏差。所有食材均被规范化处理为统一标识,如将‘樱桃番茄’与‘番茄’归为一类,以此构建国家—食材的二分网络及成对国家的食材重叠矩阵,数据覆盖7种语言,共包含4个CSV文件,详细记录了国家、食材、关联及地理信息。
使用方法
使用该数据集时,可直接加载cuisines.csv、ingredients.csv等文件进行探索性分析,如通过pandas读取数据并利用seaborn绘制食材重叠热力图,直观展现各国美食的相似性。研究者可利用cuisine_pairs.csv中的重叠比例与地理距离进行相关分析,验证地理邻近性对饮食文化的影响。此外,数据集也适用于评估语言模型对不同国家美食的认知准确性,通过比较模型的食材描述与实际烹饪差异,推动跨文化AI研究的深入。
背景与挑战
背景概述
在全球化与文化交融的时代背景下,烹饪作为文化认同的核心载体,其跨地域的融合与差异成为交叉学科研究的新兴焦点。由Alper Acar于2026年构建并发布于Zenodo、Kaggle等平台的世界菜系食材重叠数据集(World Cuisine Ingredient Overlap),系统性地整合了来自26个国家、以7种语言描述的1,956道知名菜肴及其规范化食材列表,旨在通过量化不同菜系间的食材共现模式,揭示全球烹饪版图中的文化亲近性与地理邻近性之间的潜在关联。该数据集独树一帜地采用了大型语言模型生成食材清单,并经二次模型验证,确保了跨菜系比较的一致性,为计算美食学、文化演化动力学及语言模型在特定领域知识表征的研究提供了可复现的数据基石,尤其对网络科学与嵌入分析有显著贡献,其影响力在美食信息学与人工智能交叉领域逐步显现。
当前挑战
该数据集的核心挑战在于其构建初衷与效度边界的明晰化:其并非烹饪人类学的民族志记录,而是对语言模型如何表征多元菜系的一次系统性快照,因此,针对约7%的食材-菜肴不匹配条目以及菜系间菜肴数量(42至131道)与食材标准化规则(如将胡椒属变体合并)的固有变动性,任何下游推断都必须锚定于聚合层面的模式,而非单一条目。同时,数据集的构建过程面临双重考验:一是在缺乏人工转录食谱的条件下,确保LLM生成食材的忠实度与上下文准确性,这一难题催生了基于第二模型验证的质控流程;二是跨语言、跨文化语义对齐的复杂性,翻译空缺的处理与食材规范化的粒度抉择,直接影响到重叠度量算法的鲁棒性,且为避免过度解读,仅发布聚合结果而隐藏逐食谱细节,实则对可复现性与结果普适性构成了潜在束缚。
常用场景
经典使用场景
该数据集为跨文化饮食研究提供了量化基石,聚焦于26个国家1956道标志性菜肴的原料构成,以七种语言呈现,并经过同质化处理形成规范原料集。其核心应用在于构建“菜肴-原料”二部图,进而分析不同菜系间的原料重叠网络,绘制世界烹饪亲缘关系图谱。通过计算成对菜系的重叠比例,研究者可揭示地理邻近性、历史贸易路线及文化传播对饮食偏好的影响,是计算社会学与饮食人类学交叉领域的重要数据支撑。
解决学术问题
此数据集解决了跨菜系比较中因描述者差异与原料粒度不统一导致的可比性困境,提供了一个由单一语言模型生成、经二次校验的标准化语料,使得量化分析成为可能。它使学者能够从宏观视角验证“饮食地理决定论”与“文化扩散假说”,并探讨语言混杂程度与烹饪借鉴之间的关联。此外,该数据暴露了模型幻觉在食物记录中的比例(约7%),为评估大规模语言模型在文化知识表征方面的偏差提供了实证基准,推动了可靠数据集构建方法的讨论。
实际应用
在实际应用层面,该数据集可作为烹饪创新与菜单设计的灵感库,餐饮企业可利用重叠分析寻找风味融合的创意组合,开发新颖且具文化亲和力的菜品。同时,它支持个性化推荐系统的开发——当识别出用户偏好菜系后,可依据原料重叠度推荐其他菜系的相似菜肴。对于旅行与美食应用,该数据能生成跨文化菜肴匹配指南,提升游客的饮食体验。营养学家亦可结合菜系重叠信息,规划兼顾多样性与文化可接受性的膳食方案。此外,其多语言特征为跨语言食谱翻译与本地化提供了辅助资源。
数据集最近研究
最新研究方向
当前,计算美食学领域正借助网络科学与自然语言处理技术,深入探索全球饮食文化的深层结构。本研究构建的全球菜系食材重叠数据集,覆盖26国1956道菜肴,由大语言模型生成并经二次校验,为跨菜系比较提供了标准化基准。其核心创新在于以食材规范化集合为纽带,构建菜系间二部图与相似性网络,揭示地理邻近、历史交流与食材共享的内在关联。结合多语言标注与元数据,该数据集有力支撑了风味传播路径分析、饮食文化圈层识别及大语言模型美食知识表征的评估,为数字化美食遗产保护与跨文化饮食研究开辟了新维度。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务