遇见数据集

hinglish-relatedness-benchmark

收藏
Hugging Face2026-07-23 更新2026-07-24 收录
官方服务:

资源简介:

Hinglish相关性基准是一个实用、可复现、由AI生成的罗马化印地语-英语(Hinglish)语义相关性评估基准,旨在填补公开的罗马化Hinglish语义相关性基准的空白。数据集核心包含34个“秘密词”,覆盖自然、情感、抽象、物体、地点、食物、亲属关系7个领域。每个秘密词配有一套分层(近/中/远)的关联词,并标注了预期的相关性等级。数据以JSON文件形式组织,包括罗马化Hinglish版本、平行英语版本、跨语言翻译一致性配对,以及按领域分层的开发集/测试集划分。该基准主要用于评估模型在句子相似性任务上的性能,定义了两种核心指标:主要指标通过Spearman秩相关性评估语义排名质量,次要指标通过检查跨语言一致性评估翻译质量。基准提供了参考模型的性能基线,并强调内容由AI生成,经过自动化清洗,遵循CC-BY-4.0许可证。

Hinglish Relatedness Benchmark is a practical, reproducible AI-generated Romanized Hinglish-English semantic relatedness evaluation benchmark. This benchmark aims to fill the gap in publicly available Romanized Hinglish semantic relatedness benchmarks. The core of the dataset includes 34 "secret words", covering 7 domains: natural, emotional, abstract, object, location, food, and kinship. Each "secret word" is paired with a set of hierarchical (close/medium/distant) related words, with expected relevance levels annotated. Parallel English versions and cross-language (Hindi-English) translation consistency pairs are provided to evaluate the multilingual consistency of models. The data is organized in JSON files: `dim1_hien.json` (302 records) contains Romanized Hinglish secret words and their hierarchical related words; `dim1_en.json` (303 records) is the corresponding parallel English version; `dim2_pairs.json` (34 records) contains cross-language consistency evaluation pairs; `public_benchmark_split.json` provides domain-stratified development/test set splits (17 secret word sets, seed 42). Each entry in `dim1_*` includes fields such as secret word, related words, hierarchy level, expected relevance score, subtype, and notes. This benchmark is primarily used to evaluate model performance on sentence similarity tasks, defining two core metrics: The primary metric (dim1) evaluates semantic ranking quality by calculating the Spearman's rank correlation between the model's embedding rankings and the expected association hierarchy (close/medium/distant); The secondary metric (dim2) evaluates cross-language consistency by checking whether the correct English translation of the secret word falls within the expected relevance level. A performance baseline (dim1 Spearman correlation of 0.657) from the reference model (`gauravgandhi2411/hinglish-relatedness-sbert`) is provided. It should be particularly noted that the content of this benchmark is primarily AI-authored, rather than independently annotated by humans or experts. Its generation process is methodologically rigorous and transparent: close and medium-level related words are generated by AI programming assistants, while distant-level words are obtained via random sampling, and undergo two rounds of automated cleaning and review: string collision and semantic proximity. All obstructive collisions have been removed prior to benchmark release. The dataset is released under the CC-BY-4.0 license.

创建时间:
2026-07-19
原始信息汇总

Hinglish Relatedness Benchmark 数据集详情

数据集概述

Hinglish Relatedness Benchmark 是一个 AI 生成 的罗马化印地语-英语(Latin-script Hindi-English)语义相关性基准测试集,包含 34 个保密词(secret words),覆盖 7 个领域(自然、情感、抽象、物体、地点、食物、亲属关系),每个词配有分层级的近/中/远关联词,并带有预期的相关性区间标注。同时提供平行的英语版本和跨语言翻译一致性配对。

注意:该数据集并非经过同行评审的金标准,而是 AI 主导生成的方法透明的小型基准测试集。

文件构成

文件 记录数 用途
dim1_hien.json 302 主指标:罗马化印地语保密词 -> 近/中/远分层关联词,包含英语侧关联词及翻译标签
dim1_en.json 303 与上述相同的 34 个保密词/层级的平行英语版本
dim2_pairs.json 34 次指标:跨语言(印地语-英语保密词,英文翻译)一致性配对
public_benchmark_split.json 按领域分层的开发/测试集划分(17/17),种子=42,用于检查点选择

每个 dim1_* 记录包含:{secret, word, tier (near/mid/far), expected_bands, subtype, note}。 每个 dim2_pairs 记录包含:{hien_secret, en_gloss, domain}

数据来源声明

  • 近/中层级关联词:由 AI 编码助手(Claude, Anthropic)以代码形式手动编写,由项目所有者抽查(如同形冲突审计),未经独立人类语言学家逐词重新标注
  • 远层级填充词:通过哈希种子随机数生成器从项目自有词汇中机械采样,未经人工策划,其唯一特性是“不是近/中”。
  • 安全审查和语义邻近审查:由 AI 编码助手子代理自动执行字符串冲突审查和语义邻近扫描(基于嵌入排序),修复了 17 个真实字符串冲突和 20 个语义近似问题。

请勿将该数据集描述为“人工标注”或“专家标注”。

归属

  • 基础罗马化印地语词汇资源基于 AI4Bharat 的 Aksharantar 和 IndicCorp v2(CC0)。
  • 参考微调模型 gauravgandhi2411/hinglish-relatedness-sbert 基于 L3Cube 的 indic-sentence-bert-nli

许可协议:CC-BY-4.0

主指标:dim1(语义排序质量)

  • 指标:预期相关性层级(近/中/远)与模型实际嵌入排序之间的 Spearman 秩相关,按保密词聚合。
  • 开发/测试集划分(17/17,按领域分层,种子=42)解决了先前小型保留集的问题(开发-测试 Pearson 相关系数仅约 0.12),当前划分的 Pearson r = 0.920(n=8 个模型)。
  • 参考模型 gauravgandhi2411/hinglish-relatedness-sbert 的 dim1 Spearman 值:0.657 [95% CI 0.569, 0.736](完整 34 词集;开发集 0.671,测试集 0.642——置信区间重叠,跨划分稳定)。

次指标:dim2(跨语言一致性)

  • 指标:保密词的正确英语翻译是否落在预期的相关性区间内。
  • 该指标跨领域稳定性明显低于 dim1,且在某些特定聚类中退化。

领域失败率(32 个信息性配对,每领域 n=3-5)

领域 失败率
情感 2/5 (40%)
自然 2/5 (40%)
亲属关系 1/4 (25%)
地点 1/5 (20%)
物体 1/5 (20%)
食物 0/3 (0%)
抽象 0/5 (0%)
  • 失败集中在情感和自然领域(各 40%)。 食物的表面问题完全是标注伪影(2 个退化配对 + 1 个不良词义),修正后为 0/3。
  • 物体、地点和亲属关系各有一个真实失败(chaabi/key, dehat/countryside, bhanja/nephew)。
  • 总体通过率:0.706 [0.559, 0.853]。

情感/自然领域失败根本原因

  • 失败词的最近嵌入邻居被共享偶然子词片段的无关英语词主导(如 junoon 相邻 afternoon/noon/juneregistan 相邻 register/registry/registration)。
  • 这不是音译错误,而是基础模型英语主导的子词分词器将短/少见的罗马化标记分割成与常见英语语素冲突的片段。

注意:该基准有意测量原始、未包装的模型输出,以便保持公平、稳定的模型比较尺度。

安全审查通知

每个保密词和关联词均经过双重检查:(1)字符串/形态冲突;(2)嵌入排序语义邻近。发布文件中不存在任何阻塞冲突。共计进行了 37 次词汇替换(两次审查通道)。

可重复性

完整方法论、所有中间数据、词汇替换历史和审查校准分析均可在源仓库中找到:public_benchmark_phase1_report.md 位于 gauravgandhi2411/mindmeld 仓库的 generator/evals/finetune/data/ 目录。分割种子为 42。

更新日志

  • v1.1(当前版本):修正了 besan 的英文词义从 "gram"(歧义,在该语料库中读作“村庄”/gram-panchayat)改为 "flour"(验证无歧义),并修正了其近层级关联词从 "legume" 改为 "wheat"。改变了 dim2 领域依赖表(食物失败率从 33% 修正为 0%),开发-测试 Pearson r 从 0.894 提升至 0.920。所有 8 个模型检查点重新解析,两次审查重新运行通过。其他保密词内容未变。
  • v1.0:初始发布。34 个保密词,7 个领域,包含 dim1 主指标和 dim2 次指标,20 次针对性词汇替换用于语义邻近优化(基于 17 个字符串冲突修复)。最初包含一个未经修正的领域表,错误地夸大了食物的失败率(60%),当天已修正。
搜集汇总
数据集介绍
hinglish-relatedness-benchmark 数据集图片
构建方式
本基准数据集旨在填补罗马化印地语-英语混合语语义相关性领域缺乏公开评测集的空白。其构建遵循系统化的分层设计:从7个领域(自然、情感、抽象、物体、地点、食物、亲属关系)中选取34个种子词,并为每个种子词配备近程、中程、远程三层关联词,形成层级化的语义相关度评分体系。数据集包含两个维度:主指标维度(dim1)涵盖罗马化印地语与英语对照的302条关联词对,副指标维度(dim2)包含34组跨语言一致性检验对。所有数据经过两轮自动化清洗——包括字符串冲突检测与基于嵌入向量的语义邻近扫描,共修正37处词汇替换,并采用域分层策略以固定随机种子(42)划分开发集与测试集各17个样本。
特点
该数据集的核心特点在于其透明且诚实的方法论披露:其关联词对由AI辅助生成而非独立人工标注,但遵循严格的层级编排纪律与双重校验流程。远程填充词通过哈希种子随机采样获得,仅确保不属于近程或中程类别,这种设计刻意保留了模型对低相关性词汇的判别难度。数据集还揭示了深层的语言模型缺陷——情感与自然领域高达40%的失败率源于罗马化词汇片段与英语常见词素的偶然碰撞(如junoon与afternoon共享'noon'子词),而非单纯的翻译错误。值得注意的是,数据集明确排除了'paneer'和'khichdi'这类跨语言拼写相同的借词对,避免词形自匹配对交叉语言一致性指标的干扰。
使用方法
使用时应直接评估原始模型输出,避免应用任何生产环境的后处理包装,以确保评测结果的公平性与可复现性。主指标采用每个种子词内模型嵌入排序与期望关联层级间的斯皮尔曼等级相关系数,开发集与测试集的相关性高达0.920,为模型检查点选择提供了可靠依据。副指标衡量跨语言一致性,需注意情感与自然领域的主题性失效模式并非均匀分布。建议引用时严格遵循数据集的来源说明,不得将其描述为'人工标注'或'专家标注'。完整的方法论细节、词汇替换历史与清洗校准分析均可在源仓库的Phase 1报告中追溯查阅。
背景与挑战
背景概述
在自然语言处理领域,代码混合语言(code-mixed language)的研究日益受到关注,其中以罗马化印地语-英语(romanized Hinglish)为代表的混合语言在社交媒体和日常交流中广泛使用,但缺乏标准化的语义相关性基准。Hinglish Relatedness Benchmark 由研究者 gauravgandhi2411 等人构建,于近期发布(版本 v1.1),旨在填补这一空白。该基准包含 34 个覆盖自然、情感、抽象、物体、地点、食物和亲属关系七个领域的种子词,每个种子词配有近/中/远三个等级的关联词,并提供平行英语版本和跨语言翻译一致性对。尽管规模较小且并非经过同行评审的金标准,但其方法论透明、可复现,为评估罗马化 Hinglish 语义相关性模型提供了首个公开基准。该基准基于 AI4Bharat 的 Aksharantar 等资源构建,对推动代码混合语言的理论研究和实际应用具有重要意义。
当前挑战
该基准面临的核心挑战源于所解决的领域问题:代码混合语言语义相关性的度量缺乏统一标准,且现有模型在跨语言一致性方面表现不稳定。具体而言,情感和自然领域的跨语言一致性失败率高达 40%,原因在于基础模型的分词器将短/罕见罗马化标记切分成与常见英语词素冲突的片段(如 junoon 与 afternoon 共享子词),这反映了模型在混合语言理解上的根本局限。构建过程中亦面临多重困难:基准内容主要由 AI 生成而非人工标注,尽管经过两轮精细清洗(包括字符串冲突和语义邻近性审查),但近层级关联词仅由项目所有者抽检,远层级词则通过随机采样填充,缺乏独立语言学家的逐词审核,这要求使用者以诚实的态度报告模型弱点。此外,跨语言度量中遇到标签歧义(如 besan 的英文释义 gram 引发语义混淆)和同形词问题(如 paneer 在两种语言中拼写相同),需通过版本迭代修正,增加了基准维护的复杂性。
常用场景
经典使用场景
该数据集专为评估罗马化印地语-英语混合(Hinglish)语义相关性而设计,其核心使用场景涵盖单语言语义排序与跨语言一致性验证。通过34个秘密核心词在7个语义域(自然、情感、抽象、物体、地点、食物、亲属关系)中的三级分层关联词(近/中/远),研究者可系统性地测试模型对代码混合语言的语义理解能力。典型应用包括利用dim1指标衡量词嵌入的排序相关性,以及通过dim2跨语言对检验翻译忠实度。
解决学术问题
该数据集填补了罗马化Hinglish缺乏公开语义相关性基准的空白,解决了混合语言模型评估中缺乏标准化测试集这一关键学术问题。其独特性在于揭示了子词分词器对短罗马化令牌的分割缺陷——如'junoon'与'afternoon'的共现干扰——为理解多语言词嵌入空间的偏差提供了可量化证据。该基准推动了低资源代码混合语言的评估方法论,促使学界关注语言模型在非规范拼写下的鲁棒性。
衍生相关工作
该数据集直接催生了专用微调模型gauravgandhi2411/hinglish-relatedness-sbert,该模型以L3Cube的Indic-Sentence-BERT-NLI为基座,实现了0.657的斯皮尔曼相关系数。衍生工作包括基于该基准的嵌入空间分析,揭示了子词碎片化对混合语言表示的干扰,以及生产环境下的非微调生成缓解策略。此外,其方法论为构建AI辅助生成的基准数据集树立了透明度标准,推动了数据卡与变更日志的文档规范发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务