Raventhatfly/babeleval-data-v1
收藏资源简介:
该数据集是一个多语言对话数据集,专注于评估语言模型在噪声条件下的表现和跨语言任务。数据集包含多个特征字段,如实例ID、锚点ID、模板ID、场景、语言对、条件、语言模式、噪声轴、用户输入、意图、关键事实、参考答案、必需点、风险点、事实问题(包括问题ID、问题文本、黄金答案和答案类型)、生成状态、生成模型、审核状态、审核笔记、审核者信息(包括实例ID、裁决、语义漂移、错误语言对、轴不匹配、可恢复性破坏、代码混合过弱、噪声不自然、事实问题不对齐、必需点不对齐、笔记和审核者模型)、合并源运行、合并源锚点ID和合并源实例ID。数据集分为训练集(4,616个示例)和测试集(1,154个示例),用于支持意图识别、事实问答、生成质量评估和人工审核等任务,适用于自然语言处理研究,特别是在多语言和噪声环境下的模型性能分析。
This multilingual dialogue dataset is designed to evaluate the performance of language models under noisy conditions and support cross-lingual tasks. The dataset includes multiple feature fields, such as instance ID, anchor ID, template ID, scenario, language pair, condition, language mode, noise axis, user input, intent, key facts, reference answer, required points, risk points, factual questions (including question ID, question text, golden answer and answer type), generation status, generation model, review status, review notes, reviewer information (including instance ID, ruling, semantic drift, mismatched language pairs, axis mismatch, recoverability damage, overly weak code-mixing, unnatural noise, misaligned factual questions, misaligned required points, notes and reviewer model), merged source runs, merged source anchor ID and merged source instance ID. The dataset is split into a training set (4,616 examples) and a test set (1,154 examples), which supports tasks including intent recognition, factual question answering, generation quality evaluation and manual review, and is applicable to natural language processing research, particularly model performance analysis in multilingual and noisy environments.




