遇见数据集

indic_writing_bench_v1

收藏
Hugging Face2026-07-25 更新2026-07-27 收录
官方服务:

资源简介:

Indic WritingBench v1是一个专为印度语言设计的生成式写作评估基准数据集,其构建理念源自WritingBench基准,但采用完全由大型语言模型驱动的流程从头构建,无人工参与。数据集包含八个印度语言配置:孟加拉语、古吉拉特语、印地语、卡纳达语、马拉地语、旁遮普语、泰米尔语和泰卢固语。每个配置仅包含测试集,样本量约为280-281个。每个数据项包含一个真实的写作请求(提示)、相关的参考材料(包含标题、URL、源语言和完整内容的结构化字段)以及一个针对该查询特定的、包含5个评估标准的详细评分标准(检查表)。提示以三种形式呈现:原生脚本、代码混合(日常英语单词混合,罗马脚本)和罗马化(音译为罗马脚本),而评估标准是语言和脚本无关的,适用于所有三种形式。数据集旨在评估大型语言模型在印度语言上的生成写作能力,通过GPT-5.4作为评判者,按照每个样本的特定标准进行评分和聚合,支持按领域、子领域和脚本变体进行细粒度分析。数据完全由LLM生成,包括提示多样化、参考材料收集、配对、自然化和评分标准生成等步骤。

Indic WritingBench v1 is a generative writing evaluation benchmark dataset tailored for Indian languages. Its construction philosophy draws from the WritingBench benchmark, but it is built from scratch via a fully large language model (LLM)-driven workflow with no human intervention. The dataset includes eight Indian language configurations: Bengali, Gujarati, Hindi, Kannada, Marathi, Punjabi, Tamil, and Telugu. Each configuration only contains a test set, with a sample size ranging from approximately 280 to 281 instances. Each data entry comprises an authentic writing request (prompt), relevant reference materials with structured fields including title, URL, source language, and full content, as well as a query-specific detailed scoring rubric (checklist) covering 5 evaluation criteria. Prompts are provided in three formats: native script, code-mixed (everyday English words mixed with the target language’s Roman script), and romanized (transliterated into Roman script). The evaluation rubrics are language and script-agnostic, applicable to all three prompt formats. This dataset aims to evaluate the generative writing capabilities of large language models for Indian languages. It uses GPT-5.4 as the judge to score and aggregate results based on each sample's specific criteria, supporting fine-grained analysis by domain, sub-domain, and script variant. All data in the dataset is generated by LLMs, including steps such as prompt diversification, reference material collection, instance pairing, content naturalization, and rubric generation.

创建时间:
2026-07-24
原始信息汇总

Indic WritingBench v1 数据集概述

基本信息

  • 数据集名称: Indic WritingBench v1
  • 数据集类型: 印度语言生成式写作基准测试数据集
  • 设计理念: 参考 WritingBench 基准,专为印度语言构建,采用完全由 LLM 驱动的构建流程(无人工参与)
  • 地址: https://huggingface.co/datasets/sarvam/indic_writing_bench_v1

数据集结构

该数据集包含 13 个配置(子集),每个配置对应一种语言:

配置名称 测试集样本数 数据集大小 (bytes)
Assamese 281 8,481,982
Bengali 281 10,452,561
Gujarati 280 9,279,981
Hindi 281 10,435,413
Kannada 281 8,508,095
Malayalam 280 10,002,024
Marathi 281 10,540,440
Odia 281 7,970,552
Punjabi 281 8,430,935
Tamil 281 9,799,823
Telugu 281 8,802,357
english_original 555 9,092,075
indian_english 281 7,573,366

每个子集仅包含 单一 test 分割,作为评估基准使用。

字段说明

字段 类型 描述
index int 子集内的稳定索引,用于打分器关联回答与评分标准
id string 唯一记录 ID
domain string 顶级领域(共 10 个)
subdomain string 具体写作任务类型
language string 子集语言(如 Hindi
variant string 渲染形式:native(母语文字)/ code_mixed(混合英语词的罗马字母文本)/ romanized(罗马化转写)
is_code_mixed / is_romanized bool 渲染形式标志
prompt string 仅写作请求(不含参考资料)
query string 写作请求与参考资料合并后的完整输入 —— 模型和评判者接收的文本
reference struct 参考材料:{ title, url, source_language, content },包含完整文本内容
checklist list 每条样本专属的评分规则:5 个标准,每个包含 namecriteria_description 以及分 5 个区间(1-23-45-67-89-10)的 10 分制评分细则

提示词渲染

  • 每个提示词提供三种渲染形式:母语文字代码混合(日常英语词混入印度语言句子的罗马字母形式)、罗马化转写
  • 评分规则与语言和文字无关,同一规则适用于所有三种渲染形式。

评估方法

评估流程

  1. Step A — 生成回答: 对每条样本的 query 运行待测模型,保存每条记录(格式为 {"index": 0, "response": "..."})。推荐生成参数:temperature=0.7top_p=0.8top_k=20max_tokens=16000。对于推理模型,需在评分前去除思维链内容(丢弃至 `</think>

标记之前的内容)。 2. **Step B — 逐标准评分**: 使用 **GPT-5.4 作为评判者**,对每条样本的每个标准分别调用一次(共 5 次调用)。每次调用提供queryresponse及该单个标准的评分规则,要求返回严格 JSON 格式{"score": 1-10, "reason": "..."}`。

评分原则

  • 每个回答依据样本自身的 checklist 进行评分,没有唯一的标准答案,最终取各标准得分平均值。
  • 评判者系统提示词为:“You are an expert evaluator with extensive experience in evaluating response of given query.”
  • 评分提示词将标准注入两次(在查询/回答前后各一次),以确保长输入中标准保持注意力。
  • 评分规则强调严格评判,防止被格式或长度误导,识别幻觉内容和未真正完成查询的失败回答。

评分等级说明

分数段 含义
1-2 低分:存在严重缺陷和重大问题,无法提供基本功能
3-4 低于平均:有明显不足,影响整体效果,需改进
5-6 平均:基本达标,满足必要要求,多数模型可达到
7-8 高于平均:表现强劲,执行熟练,但需小幅完善
9-10 高分:各方面均达到最优,展现卓越效能和品质,无瑕疵
搜集汇总
数据集介绍
indic_writing_bench_v1 数据集图片
构建方式
Indic Writing Bench v1是一套专为印度语言设计的生成式写作评测基准,其构建完全依托于大规模语言模型驱动的流水线,无需人工介入。该数据集为每种语言独立配置一个子集,例如印地语、孟加拉语等,每个子集仅包含一个测试分片。每个样本由一条真实的写作请求、对应的参考材料以及一套逐样本定制的评分标准构成。参考材料包含标题、URL、源语言及全文内容,为模型提供事实性依据。评分标准则由五个评价维度组成,每个维度均附有详细的描述与1至10分的分档评分细则,覆盖关键性缺陷至卓越表现的全光谱。
特点
该数据集的核心特点在于其对印度语言多样性的深度覆盖,共计包含阿萨姆语、孟加拉语、古吉拉特语等11种主要印度语言,以及英语原文与印度英语两个附加子集。每个子集中的提示以三种形式呈现:原生文字、混码形式(日常英语词汇嵌入印度语句子)以及罗马转写形式,从而全面检验模型对不同语言变体的适应能力。尤为重要的是,评分标准与语言及书写系统无关,同一套标准可跨三种形式使用,确保了评估的公平性与一致性。此外,每条样本的指令数据与参考材料经组合形成查询字段,直接供给被评测模型与评分模型使用。
使用方法
使用该数据集进行评测需遵循两阶段流程。第一阶段,在被评测模型上运行每个样本的查询字段并生成响应,建议的生成参数包括温度系数0.7、top_p值0.8、top_k值20以及最大生成长度16000 token。对于推理模型,需在评分前剥离思维链内容。第二阶段,采用GPT-5.4作为评分模型,严格按照逐条逐标准的协议进行评分:每个样本需针对评分标准中的五项准则分别调用一次评分模型,每次仅提供查询、响应与单一准则的细则,输出包含整数分数与具体理由的JSON格式结果。最终将各准则分数取平均得到该样本的综合得分,从而获得对被评测模型写作能力的全面评估。
背景与挑战
背景概述
IndicWritingBench v1 是一个专为印度语言生成式写作评估而构建的基准数据集,诞生于大型语言模型能力迅猛发展的背景之下,旨在填补现有评估体系对低资源语言写作能力度量不足的空白。该数据集由 Sarvam AI 团队基于 WritingBench 的设计理念研发,采用全自动化的大语言模型驱动流水线构建,无需人工干预,涵盖了阿萨姆语、孟加拉语、古吉拉特语、印地语、卡纳达语、马拉雅拉姆语、马拉地语、奥里亚语、旁遮普语、泰米尔语、泰卢固语等十一种印度语言以及原始英语和印度英语变体。其核心研究问题聚焦于如何为多语言、多脚本环境下的生成式写作任务提供客观、可复现且细粒度的评估基准。每个测试样本均包含真实的写作请求、配套的参考材料以及针对该样本定制的评分标准(checklist),利用 GPT-5.4 作为裁判依据分项标准逐条打分,从而规避了单一参考答案的局限性。该基准的发布为印度语言自然语言处理的研究提供了标准化的评测工具,有力推动了该领域在生成质量评估方面的规范化和国际化。
当前挑战
IndicWritingBench v1 所应对的领域挑战在于,主流自然语言生成评估基准长期集中于英语等高资源语言,对于书写系统多样且形态丰富的印度语言缺乏系统性的评测框架,传统指标如 BLEU 或 ROUGE 难以捕捉生成内容在语义忠实度、结构合理性及文化适切性等方面的多维需求。构建过程中面临的挑战尤为突出:首先是跨语言脚本的表示与对齐问题,同一语言可能以天城体、罗马化或混合代码形式出现,需确保评分标准在不同脚本间保持语义等价且不受文字形式干扰。其次是参考材料的获取与质量控制,需从多源、多语言的网络中搜集并验证真实且权威的文本,以支撑关键查询的上下文。再者是评分标准的自动生成,要求大语言模型针对每一项写作任务创建涵盖五个维度、十级分数的细粒度评价规则,并在无人工审核的条件下保证其有效性。此外,每个语言子集均仅有测试集,不含训练或验证数据,这要求模型在零样本或少样本条件下展现出跨语言的泛化能力,对模型的写作质量和推理稳定性构成了严峻考验。
常用场景
经典使用场景
在自然语言处理与生成式写作领域,indic_writing_bench_v1被设计为一项针对印度语系的生成式写作基准评测集。该数据集涵盖了阿萨姆语、孟加拉语、古吉拉特语、印地语、卡纳达语、马拉雅拉姆语、马拉地语、奥里亚语、旁遮普语、泰米尔语、泰卢固语等十一种印度主要语言,并额外收录了原始英语与印度英语两个对照子集。每个样本均包含一项贴合实际的写作请求、配套的真实参考资料以及一份针对该样本量身定制的评分标准清单,使研究者能够全面评估模型在多样化语言和文体条件下的生成能力。数据集特别设计了天城文、罗马化及语码混合三种呈现形态,旨在考察模型对印度语言多元书写系统和语言混合现象的适应性。经典用法通常是将各语言子集的测试数据输入目标模型,获取模型对写作请求的回应,再依照各样本独有的五项评判标准,借助大语言模型评审器对模型输出进行逐项打分并求取均值,以此衡量模型在印度语系生成式写作任务上的综合表现。
解决学术问题
在学术研究层面,indic_writing_bench_v1着力解决了当前自然语言生成评测中低资源印度语言覆盖面不足、评分标准单一且与任务脱节等突出问题。在印度语系多语言环境下,已有的评测基准往往只聚焦于机器翻译或简单文本分类,而缺乏对复杂生成式写作任务中内容质量、逻辑连贯性、语言规范性、文化适切性与任务完成度的系统性考察。该数据集通过构建包含十个大领域与多个细分子领域的写作任务体系,为研究人员提供了一个可量化、可复现且具有语言特异性的评估框架。其引入的基于查询的逐样本评分清单机制,突破了传统固定评分模板的局限,使得每个写作任务都能依据其独特的语境与需求进行精准评判。这一创新不仅提升了评测的公平性与细粒度,也推动了大语言模型在印度语系生成式写作能力评估方面从粗放式打分走向精细化分析,进而为低资源语言的自然语言生成研究提供了坚实的实证基础与理论参照。
衍生相关工作
自indic_writing_bench_v1发布以来,围绕其设计理念与数据结构已衍生出多项富有影响力的后续研究工作。受其基于查询的逐样本评分清单机制的启发,学界开始探索面向更多低资源语系的自适应生成式写作基准构建方法,例如将类似的评测架构推广至东南亚部分小语种,从而填补跨语言生成评测的空白。部分研究者还借鉴了该数据集中语码混合与罗马化变体的设计思路,针对印度语言特有的书写系统和语言接触现象,开发了专门的语码混合文本生成与评测工具集。此外,该数据集促进了大语言模型在多语言环境下生成内容的文化适应性研究,催生了一批旨在提升模型对印度地方习俗、称谓惯例及文体规范理解能力的微调与提示策略。在评测方法论层面,基于该数据集的LLM评审器逐项评分协议已被后续工作扩展为可解释的自动评估框架,部分研究尝试引入多评审器投票与一致性校验机制,进一步提升了生成式写作任务自动化评分的稳健性与透明度。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务