PRCC-BENCH
收藏数据链接:
官方服务:
资源简介:
PRCC-BENCH是一个由Jibay Ai开发的大规模波斯语基准数据集,用于评估语言模型在理解、推理、问答、信息提取、指令遵循和分析等方面的真实世界能力。它包含500个问题,采用精确和语义匹配的评估方式,旨在提供波斯语智能的实用和现实测量。
PRCC-BENCH is a large-scale Persian benchmark dataset developed by Jibay Ai, which aims to evaluate the real-world capabilities of language models across tasks such as comprehension, reasoning, question answering, information extraction, instruction following and analysis. It includes 500 questions and adopts exact and semantic matching evaluation approaches, with the objective of providing practical and realistic assessments of Persian language intelligence.
创建时间:
2026-06-25
原始信息汇总
PRCC-BENCH:波斯语推理、理解、会话基准
基本信息
- 名称:PRCC-BENCH
- 开发机构:Jibay Ai
- 语言:波斯语(FA)
- 版本:1.0.0
- 总题目数:500
- 评分机制:正确回答得 +5 分,错误、空白或近似匹配均为 0 分
- 评估方式:精确匹配 + 语义匹配
评估类别
- 理解(Comprehension)
- 评估模型对文本上下文的真正理解,包括事件追踪、实体理解、指代消解、篇章理解及多步理解。
- 推理(Reasoning)
- 评估逻辑思维,包括演绎推理、因果关系、多步推理、时序推理及一致性。
- 问答(Question Answering)
- 评估准确性、完整性、精确度及上下文意识,包含直接问答、上下文问答、隐含答案及多部分问题。
- 信息抽取(Information Extraction)
- 评估实体提取、数字提取、事实检索、关系理解及上下文过滤。
- 指令遵循(Instruction Following)
- 评估对约束的遵守、精确格式化、规则执行及响应纪律。
- 分析(Analysis)
- 评估深度理解、比较、问题分解及结论生成。
评分规则
- 仅完全正确的回答获得分数(+5 分),其他情况均为 0 分。
评判模式
- 精确匹配:对空格、波斯语数字、标点进行标准化后比较。
- 语义匹配:仅当含义完全等价时接受答案。
- 列表精确:所有要求的信息必须存在。
- 顺序精确:要求输出的顺序必须保持。
预期用途
- 人工智能评估、大语言模型基准测试、学术研究、产品测试、回归测试、波斯语模型比较、质量保证。
核心理念
- 理解 > 记忆,推理 > 模式匹配,执行 > 生成。
许可协议
- CC BY-ND(知识共享署名-禁止演绎)
- 允许:使用、评估、发布结果、比较模型、共享基准。
- 条件:必须保留署名,原始基准身份不得更改。
- 附加政策:未经授权不得修改官方版本,不得以其他名称发布为官方版本,官方升级和发布权仅由 Jibay Ai 保留。
引用
- PRCC-BENCH (Version 1.0.0),Developed by Jibay Ai。
搜集汇总
数据集介绍

构建方式
PRCC-BENCH由Jibay Ai团队精心构建,旨在评估波斯语语言模型的真实能力。该基准包含500道精心设计的问题,覆盖理解、推理、问答、信息提取、指令遵循与分析六大核心评估类别。每道题目均经过严格审核,确保能够有效区分模型的记忆能力与深层认知能力。评分采用精确匹配与语义匹配相结合的双重评判机制,只有完全正确的响应才能获得+5分,错误或空白答案均不得分。
使用方法
研究者可直接利用PRCC-BENCH对各类波斯语语言模型进行系统性评估。使用时需遵循基准的标准化流程:模型需逐一回答500道波斯语题目,回答经规范化处理(包括空格、波斯语数字及标点符号的标准化)后,分别通过精确匹配与语义匹配两种模式判定正误。评估结果可用于模型对比、回归测试、学术研究及产品质量保证等场景。该基准已在CC BY-ND许可下公开发布,使用者须保留原始署名且不得修改基准的官方身份。
背景与挑战
背景概述
PRCC-BENCH是由Jibay Ai于2024年发布的大规模波斯语基准测试集,旨在评估语言模型在真实场景下的综合能力。该基准包含500道精心设计的题目,覆盖理解、推理、问答、信息抽取、指令遵循与分析六大核心维度,突破了传统基准仅关注记忆或事实检索的局限。作为首个系统性聚焦波斯语真实语言智能的评估工具,PRCC-BENCH在低资源语言模型评测领域具有里程碑意义,为波斯语自然语言处理研究提供了客观、可复现的量化标准,推动了该领域从模式匹配向深度理解的范式转型。
当前挑战
PRCC-BENCH所解决的领域核心挑战在于:现有基准过度依赖知识记忆,难以衡量模型对波斯语复杂语境、多步推理与精确指令的驾驭能力,导致实际部署中可靠性不足。构建过程中,团队面临严峻挑战:一是缺乏高质量、多维度标注的波斯语评测数据集,需人工设计500道涵盖隐式逻辑、语义等价与结构化输出的题目;二是制定精确匹配与语义匹配相结合的评分机制,既要规避归一化噪声干扰,又要确保答案等效性判断的客观性;三是严格限定CC BY-ND许可,防止基准被篡改而丧失可比性,维护评测标准的学术严谨性。
常用场景
经典使用场景
PRCC-BENCH作为面向波斯语的大型基准测试,其经典使用场景集中于全面评估语言模型在理解、推理、问答、信息抽取、指令遵循与分析六大核心维度的真实能力。研究者可通过该基准对模型进行多粒度能力诊断,例如利用“理解”模块检验模型对上下文事件与实体指代的跟踪能力,借助“推理”模块考察演绎与因果逻辑的连贯性,以及通过“分析”模块评估复杂问题的拆解与结论生成。这一场景尤其适用于对比不同波斯语模型的智能化水平,并为模型迭代提供定量依据。
解决学术问题
该基准有效解决了传统评价指标过度依赖记忆或模式匹配、难以反映模型深层语言智能的学术困境。它通过融合精确匹配与语义判分机制,迫使模型不仅输出正确事实,更需展现对语言意向的真正领会与逻辑推演。在波斯语自然语言处理研究中,PRCC-BENCH填补了系统性评测框架的空白,为语义理解、多步推理及指令泛化等前沿课题提供了可复现的评估范式,推动学界从单纯追求生成流畅性转向重视理解与执行的可靠性。
实际应用
在实际应用中,PRCC-BENCH被部署于波斯语人工智能产品的质量保障与回归测试流程,例如智能客服系统需验证其对用户意图的准确解析与指令执行能力,机器翻译工具需检验语义等价性与上下文连贯性。此外,该基准亦用于商业模型的横向对比,帮助开发团队在部署前筛选出最适配波斯语场景的模型版本,从而降低因语义偏差或推理错误导致的产品事故概率,切实提升波斯语AI系统的实用效能。
数据集最近研究
最新研究方向
随着多模态大语言模型在自然语言处理领域的广泛应用,波斯语作为拥有超过一亿使用者的语言,其人工智能评估基准却长期存在空白。PRCC-BENCH通过构建500道覆盖理解、推理、问答、信息抽取、指令遵循与分析六大维度的测试题目,精准定位模型在真实波斯语场景中的执行能力与逻辑深度,而非流于表面的记忆匹配。该基准在评估机制上引入精确匹配与语义匹配双轨制,结合严格的无错评分规则,有效避免了传统评测中模糊打分与过拟合问题。在伊朗本土AI加速发展的当下,PRCC-BENCH为波斯语大模型的公平比较、产品质检与学术研究提供了首个规模化、结构化的验证平台,不仅推动了低资源语言的评估标准化进程,更促使研究者重新审视模型在真实世界任务中的泛化与推理极限。
以上内容由遇见数据集搜集并总结生成



