相关数据集
BUT-FIT/OARelatedWork
该数据集包含多个配置,主要涉及学术论文的元数据和内容信息。特征字段包括论文的ID、标题、摘要、作者、年份、研究领域、引用文献等。数据集还包含论文的层次结构、相关工作、引用和参考文献的详细信息。数据集被分割为训练集、验证集和测试集,适用于自然语言处理任务,如文本分类、信息抽取等。
Hugging Face2026-04-20 更新920
BUT-FIT/orca-audio-qa-annotations
ORCA音频问答标注数据集是用于训练和评估ORCA(开放式响应正确性评估)模型的标注数据,ORCA是一个用于音频问答任务的评分模型。该数据集采用三阶段课程训练设计,包括以下配置:1. stage1_pretrain:包含5,332,242个项目,来源于5个LLM法官的合成问答评分;2. stage2_benchmark:包含449,730个项目,来源于5个LLM法官的评估基准评分;3. stage
Hugging Face2026-07-03 更新30
BUT-FIT/FLiP-data
FLiP-data 是FLiP项目的预处理数据集,用于通过因子化线性投影解释多模态多语言句子嵌入。该数据集基于Mozilla Common Voice v15英语数据,包含SONAR语音嵌入、文本嵌入、语音与文本嵌入之间的余弦相似度分数、参考转录文本以及使用Gemini 2.5 Flash Lite提取的命名实体。数据分为训练集(约100万条语句)、开发集(约1.6万条)和测试集(约1.6万条)。
Hugging Face2026-06-29 更新10
BUT-FIT/ReCzechSum-QueryBased
--- dataset_info: features: - name: prompt dtype: string - name: query dtype: string - name: summary dtype: string - name: result 1 dtype: string - name: result 2 dtype
Hugging Face2024-12-06 更新100
BUT-FIT/OARelatedWorkMetaEval
OARelatedWork元评估数据集是一个基于BUT-FIT/OARelatedWork构建的人工标注元评估数据集,用于衡量相关工作总结生成任务的自动指标与人类判断之间的相关性。数据集包含两个配置:duels配置(约120行)提供同一目标论文的两个生成相关工作总结的成对比较,包括偏好、相关性、忠实性和语言流畅性等维度的标注;statements配置(约408行)提供从生成或参考部分采样的单个原子
Hugging Face2026-05-25 更新10



