Culturally-Aware Conversations (CAC) Dataset
收藏资源简介:
该数据集名为Culturally-Aware Conversations (CAC),由宾夕法尼亚大学的研究团队创建,旨在评估大型语言模型在多元文化对话场景中的文化适应能力。数据集包含48个对话场景,每个场景有5种不同风格的回应,共计240个数据条目。这些数据条目由来自8个不同国家的文化专家标注,以反映不同文化背景下对话风格的变化。该数据集为评估LLMs的文化适应能力提供了一个新的基准,并提出了跨文化评估的新要求,包括对话框架、风格敏感性和主观正确性。数据集的创建基于社会文化理论,并结合了情境、关系和文化背景对语言风格的影响。
This dataset, named Culturally-Aware Conversations (CAC), was developed by a research team at the University of Pennsylvania to evaluate the cultural adaptation capabilities of large language models (LLMs) in multicultural conversational scenarios. It includes 48 conversational scenarios, each with 5 distinct response styles, totaling 240 data entries. All entries are annotated by cultural experts from 8 different countries to reflect variations in conversational styles across different cultural backgrounds. This dataset provides a novel benchmark for assessing the cultural adaptation capabilities of LLMs, and puts forward new requirements for cross-cultural assessment, including conversational framework, stylistic sensitivity, and subjective correctness. The dataset is constructed based on sociocultural theory, incorporating the influences of situational, relational, and cultural contexts on linguistic styles.

- 1Culturally-Aware Conversations: A Framework & Benchmark for LLMs宾夕法尼亚大学 · 2025年



