遇见数据集

vietnamese-evidence-corpus-chunked

收藏
Hugging Face2026-08-12 更新2026-08-13 收录
官方服务:

资源简介:

该数据集是越南语-英语双语的证据语料库(分块版本),专为多语言信息检索、检索增强生成(RAG)和事实核查实验而准备。数据集中包含来自13,572个源文档的47,679个文本块,其中38,603个为越南语块,9,076个为英语块。每个块的最大长度为512个BGE-M3分词器令牌。数据集提供丰富的字段信息,包括:块ID、文档ID、块索引、令牌起始位置、令牌结束位置、令牌数量、标题、文本、摘要、来源、来源类型、领域、文档类型、语言、国家、发布日期、爬取日期、URL、作者、元数据以及质量。建议在嵌入时将标题和文本拼接为"title + + text"作为输入,其余字段用作过滤或引用元数据。数据集可通过Hugging Face Datasets库加载,文件为data/corpus_v1_chunked.json。请注意,该仓库不授予超出原始源文章的权利,用户需自行遵守各来源的使用条款。

This dataset is a Vietnamese-English bilingual evidence corpus (chunked version) prepared for multilingual information retrieval, retrieval-augmented generation (RAG), and fact-checking experiments. It contains 47,679 text chunks from 13,572 source documents, including 38,603 Vietnamese chunks and 9,076 English chunks. Each chunk has a maximum length of 512 BGE-M3 tokenizer tokens. The dataset provides rich fields: chunk_id, doc_id, chunk_index, token_start, token_end, token_count, title, text, summary, source, source_type, domain, document_type, language, country, publish_date, crawl_date, url, author, metadata, and quality. It is recommended to concatenate title and text as "title + + text" for embedding, while other fields serve as filtering or reference metadata. The dataset can be loaded via the Hugging Face Datasets library from the file data/corpus_v1_chunked.json. Note that this repository does not grant rights beyond the original source articles, and users must comply with the terms of use of each source.

创建时间:
2026-08-01
原始信息汇总

越南语证据语料库(分块版)

数据集概述

该数据集是一个为多语言信息检索、检索增强生成(RAG)和事实核查实验准备的分块证据语料库,包含越南语和英语两种语言的内容。

数据规模

  • 总块数:47,679 个文本块
  • 来源文档:13,572 篇源文档
  • 语言分布:38,603 个越南语块,9,076 个英语块
  • 块长度上限:512 个 BGE-M3 tokenizer 词元

主要字段

  • 标识字段chunk_id(块ID)、doc_id(文档ID)、chunk_index(块索引)
  • 位置信息token_start(起始词元)、token_end(结束词元)、token_count(词元数量)
  • 内容字段title(标题)、text(正文)、summary(摘要)
  • 来源信息source(来源)、source_type(来源类型)、domain(领域)、document_type(文档类型)
  • 语言与时间language(语言)、country(国家)、publish_date(发布日期)、crawl_date(抓取日期)
  • 其他字段url(链接)、author(作者)、metadata(元数据)、quality(质量)

使用说明

  • 嵌入输入格式:使用 `title + "

" + text` 作为嵌入输入内容

  • 过滤与引用:其余字段可作为筛选条件和引用元数据使用

加载方式

python from datasets import load_dataset

dataset = load_dataset( "Loctran123/vietnamese-evidence-corpus-chunked", data_files="data/corpus_v1_chunked.json", split="train", )

使用许可与注意事项

  • 该数据集采用 other 许可证
  • 数据集本身不授予对原始来源文章的额外权利
  • 用户需自行遵守各原始来源的条款规定
搜集汇总
数据集介绍
vietnamese-evidence-corpus-chunked 数据集图片
构建方式
该语料库的构建以多语言事实核查与信息检索需求为导向,从13,572篇源文档中抽取并切分为47,679个证据块,其中越南语块38,603个、英语块9,076个。切分过程以BGE-M3分词器为基准,将每个块的最大长度限制在512个token,同时记录块在原文中的token起止位置与块序号,以保留可追溯的文档结构。每个块均附带标题、正文、摘要、来源、来源类型、领域、文档类型、语言、国家、发布日期、抓取日期、URL、作者以及元数据和质量字段,形成结构化的证据单元。
特点
该数据集面向越南语与英语双语场景,兼具事实核查、检索增强生成和多语言信息检索等任务属性,规模处于一万至十万级区间。其核心特征在于以细粒度块为检索单元,并通过token级位置信息维持块与源文档之间的对应关系。数据覆盖多种来源类型、领域和文档类型,附带丰富的元数据与质量标记,便于按语言、来源、时间等维度进行筛选与引用。块长度受BGE-M3分词器约束,有利于与基于该分词器的嵌入模型直接配合。
使用方法
使用时可通过Hugging Face datasets库加载仓库中的data/corpus_v1_chunked.json文件,并指定split为train。进行嵌入计算时,建议将title与text以两个换行符拼接作为嵌入输入,其余字段保留为过滤或引用元数据。该数据集适用于多语言信息检索、检索增强生成以及事实核查实验,可结合BGE-M3等模型构建向量索引并开展检索或问答流程。需注意,仓库不授予对原始来源文章的额外权利,使用者应遵守各来源的条款。
背景与挑战
背景概述
越南语证据语料库(Chunked)由研究者Loctran123构建,旨在为多语言信息检索、检索增强生成及事实核查实验提供分块化的证据文本资源。该数据集涵盖47,679个文本块,源自13,572篇文档,其中越南语块38,603个、英语块9,076个,最大块长度限定为512个BGE-M3分词器标记。其核心研究问题在于解决越南语低资源场景下检索与事实核查任务中缺乏结构化证据语料的问题,通过提供细粒度分块与丰富元数据(标题、摘要、来源、语言、发布日期等),显著提升检索效率与生成质量,对越南语自然语言处理及跨语言事实核查研究具有基础性支撑价值。
当前挑战
该数据集面临的领域问题在于:越南语作为低资源语言,在信息检索与事实核查任务中长期缺乏高质量、分块化的证据语料,现有资源多受限于文档级粒度、语言单一或元数据缺失,难以满足检索增强生成对细粒度证据单元的需求。构建过程中的挑战包括:从多源异构文档中提取并清洗文本,确保分块边界语义完整且不超长;平衡越南语与英语块的数量与质量;为每个块准确关联标题、摘要、来源类型、领域、出版日期等元数据,并验证其一致性;同时需处理版权与来源条款约束,避免数据使用侵权。这些挑战共同影响数据集在下游任务中的泛化能力与可靠性。
常用场景
经典使用场景
在信息检索与语言模型评估领域,该数据集凭借其精细的分块结构与双语特性,成为检索增强生成任务的经典基准。研究者常将其用于训练和评估稠密检索模型,例如以BGE-M3为编码器,对越南语与英语证据段落进行语义索引,进而验证跨语言检索策略的有效性。其分块设计兼顾了上下文完整性与计算效率,为检索器提供了标准化的输入单元,并支持基于标题、来源、领域等元数据的过滤式检索。
实际应用
在实际应用中,该数据集可服务于事实核查平台、新闻聚合系统与智能问答服务。工程人员可借助其分块语料构建检索增强生成管道,为越南语用户提供基于证据的答案生成与溯源引用。同时,其双语特性支持跨语言检索场景,例如以英语查询检索越南语证据,或反之,从而拓展了多语言信息服务的覆盖范围。质量与来源元数据还可用于过滤低可信度内容,提升下游应用的可靠性。
衍生相关工作
围绕该数据集,已有工作探索了基于BGE-M3的嵌入微调、多语言检索基线以及面向事实核查的检索-验证联合模型。部分研究将其作为训练数据,开发了越南语专用检索器与重排序器,并在此基础上构建了端到端的事实核查流水线。此外,该语料亦被用于评估大语言模型在低资源语言下的检索增强生成能力,催生了若干跨语言迁移与领域适应研究。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务