ITU Radio Regulations QA Dataset
收藏资源简介:
本数据集是一个针对无线电法规领域的问题回答专用数据集,由权威来源构建,并经过自动化过滤和人工验证。数据集内容直接来源于国际电信联盟(ITU)的无线电法规,包含多个选择题对,经过自动化生成、LLM判断和人工验证。数据集的创建旨在为评估RAG在无线电法规领域的性能提供一个测试平台,并为未来研究提供一个可重用的测试床。数据集应用于无线电法规领域,旨在解决对法规的精确解释问题。
This dataset is a specialized question-answering dataset tailored for the radio regulations domain. Constructed from authoritative sources, it has undergone automated filtering and manual validation. The content of the dataset is directly sourced from the Radio Regulations of the International Telecommunication Union (ITU), and it includes multiple sets of multiple-choice questions that have been automatically generated, judged by Large Language Models (LLMs), and manually verified. This dataset was developed to serve as a test platform for evaluating the performance of Retrieval-Augmented Generation (RAG) in the radio regulations field, as well as a reusable testbed for future research. Targeted at the radio regulations domain, the dataset aims to address the precise interpretation of radio regulations.
Radio-RAG 数据集概述
数据集简介
Radio-RAG 是一个专为电信和频谱法规(如国际电信联盟规则和频谱管理)设计的检索增强生成(RAG)数据集。它通过索引法规PDF文档、检索最相关段落,并利用大型语言模型生成基于上下文的答案。
主要功能
- PDF 到 FAISS 索引转换:提供可配置的文档处理流程,将PDF文档分割成块并构建索引。
- 模型无关性:支持选择不同的嵌入模型和大型语言模型后端。
- 可调检索参数:支持调整块大小、重叠度、索引类型和检索数量(top-K)。
- 实验支持:提供工具比较原始大型语言模型与RAG增强版本的性能。
快速开始
安装步骤
- 克隆项目仓库:
git clone https://github.com/Zakaria010/Radio-RAG.git - 进入项目目录:
cd Radio-RAG - 创建虚拟环境(可选):
python -m venv .venv - 激活虚拟环境:
source .venv/bin/activate(Windows系统使用:.venvScriptsactivate) - 安装依赖:
pip install -r requirements.txt
添加PDF文档
在项目目录下创建data/文件夹,并将法规PDF文档放入其中。
项目结构
Radio-RAG/ ├─ data/ # 存放法规PDF文档 ├─ tests/ # 评估和实验脚本 ├─ utils/ # 辅助工具(解析、分块、索引、检索) ├─ local_rag.py # 命令行入口点 ├─ requirements.txt # 依赖文件 ├─ LICENSE # 许可证文件 └─ README.md # 说明文档
使用方法
示例命令
- 提问模式:
python local_rag.py --pdf_folder ./data --question "问题内容" - 仅检索上下文:
python local_rag.py --pdf_folder ./data --top_k 5 --question "问题内容" --no_generate
常用参数
--pdf_folder:PDF文档目录(默认:./data)--chunk_size:文本分块大小--overlap:相邻块之间的重叠度--index_type:FAISS索引类型(如flatl2、hnsw、ivfflat、ivfpq等)--embed_model:嵌入模型ID/名称--llm_model:大型语言模型ID/名称--top_k:检索块数量--question:查询问题--no_generate:仅返回检索到的上下文,不生成答案
实验评估
评估工具位于tests/目录下,支持比较原始大型语言模型与RAG增强版本的性能差异。
Hugging Face 演示
提供在线演示版本:https://huggingface.co/spaces/zakinho00/RegRAGapp
故障排除
- 无答案或答案不相关:检查PDF解析是否正确,尝试增大
--top_k值,调整--chunk_size和--overlap参数 - 索引性能:建议从
flatl2(基线)或hnsw(快速)开始,大规模场景可使用IVF变体 - 模型/参数变更:更改模型或参数后需要重新构建索引
许可证
采用MIT许可证发布。




