遇见数据集

meo-chatbot-data

收藏
Hugging Face2026-06-02 更新2026-06-03 收录
官方服务:

资源简介:

meo-chatbot-data 是一个为越南语猫咪咨询聊天机器人(meo-chatbot)构建的预训练检索增强生成(RAG)数据集,旨在为聊天机器人提供知识库支持,以回答关于猫咪护理、健康等问题的咨询。数据内容爬取自 11 个公开的越南语猫咪相关网站(如 pethealth.vn, paddy.vn 等),并遵守了网站的 robots.txt 协议。数据集包含 76,487 个经过处理的文本块(chunks),每个块都附带了元数据,包括主题、内容类型、严重性和级别。这些文本块已使用 e5-small 模型生成了 384 维的嵌入向量,并存储在 ChromaDB 持久化客户端中,便于高效检索。此外,数据集还提供了原始的、按来源分类的文章文件(可选)。数据集规模属于 10K 到 100K 之间,语言为越南语,主要标签涉及猫、兽医、RAG 和越南语。该数据集遵循 CC-BY-NC-4.0 许可证,仅允许非商业用途,元数据中包含了来源 URL 以进行归属。

meo-chatbot-data is a pre-trained retrieval-augmented generation (RAG) dataset built for a Vietnamese cat consultation chatbot (meo-chatbot). It aims to provide a knowledge base for the chatbot to answer questions related to cat care, health, and other consultations. The data was crawled from 11 public Vietnamese cat-related websites (e.g., pethealth.vn, paddy.vn) while adhering to the robots.txt protocols. The dataset contains 76,487 processed text chunks, each accompanied by metadata including topic, content type, severity, and level. These chunks have been embedded using the e5-small model into 384-dimensional vectors and stored in a ChromaDB persistent client for efficient retrieval. Additionally, the dataset offers optional original article files categorized by source. The dataset size falls between 10K and 100K, is in Vietnamese language, with primary tags involving cats, veterinary, RAG, and Vietnamese. It follows the CC-BY-NC-4.0 license, allowing only non-commercial use, and includes source URLs in the metadata for attribution.

创建时间:
2026-05-24
原始信息汇总

数据集概述

  • 数据集名称:meo-chatbot data
  • 数据集ID:Monmoonluna/meo-chatbot-data
  • 语言:越南语(vi)
  • 许可证:CC-BY-NC-4.0(非商业使用)
  • 规模:10,000 ~ 100,000 条记录

数据集内容

该数据集是为越南语猫咪顾问聊天机器人 meo-chatbot 预构建的 RAG 数据,包含以下组成部分:

  • chromadb/:ChromaDB 持久化客户端,包含 76,487 个文本块(使用 384 维 e5-small 嵌入)
  • chunks/classified.jsonl:带元数据的原始文本块(元数据包括:主题、内容类型、严重性、级别)
  • cleaned/*.jsonl:按来源整理的原始文章(可选,仅在指定 --include-cleaned 时包含)

数据来源

数据爬取自 11 个越南猫咪相关网站: pethealth.vn、paddy.vn、tropicpet.vn、mozzi.vn、champetsfamily.com、petspace.vn、petthings.vn、kingspet.vn、fagopet.vn、mochicat.vn、petchoice.vn

许可证与引用

  • 数据从公开博客爬取,遵守 robots.txt 规则
  • 元数据中包含 source_url 用于来源归属
  • 仅限非商业用途(CC-BY-NC-4.0)

使用方式

通过 Hugging Face 下载数据集:

python from huggingface_hub import snapshot_download snapshot_download( repo_id="Monmoonluna/meo-chatbot-data", repo_type="dataset", local_dir="data/", )

之后按照主仓库 README 运行聊天机器人。

搜集汇总
数据集介绍
meo-chatbot-data 数据集图片
构建方式
本数据集专为越南语猫咪顾问聊天机器人meo-chatbot构建,旨在提供高质量的检索增强生成数据。数据源自11个越南猫咪相关网站,涵盖宠物健康、用品、食品等主题。构建流程包括从公开博客爬取原始文章,进行清洗与分类,再利用e5-small模型将文本编码为384维向量,最终生成76,487个语义块,并持久化存储于ChromaDB中,支持高效的向量检索。
特点
数据集兼具结构化与语义化特点。原始数据以JSONL格式保存,包含话题、内容类型、严重程度及层级等元信息,便于细粒度筛选。嵌入索引采用ChromaDB,支持基于余弦相似度的快速匹配,适配RAG系统的实时响应需求。此外,数据来源均注明URL,遵循CC-BY-NC-4.0许可,确保非商业用途下的可溯源性。
使用方法
用户可通过Hugging Face的snapshot_download工具将数据集下载至本地目录,例如'data/'文件夹。下载后,结合meo-chatbot主仓库的README指引,即可配置使用。数据集已预先完成分块与嵌入,直接加载ChromaDB持久化客户端即可启动对话查询,无需额外预处理步骤,显著降低部署复杂度。
背景与挑战
背景概述
在宠物医疗与护理领域,越南语资源匮乏,尤其是针对猫科动物的专业数据集更是稀缺。在此背景下,meo-chatbot-data数据集于2023年左右由开发者Monmoonluna创建,作为一个面向越南语猫科顾问聊天机器人的预构建检索增强生成(RAG)数据集。研究者系统地爬取了11个越南猫科相关网站(如pethealth.vn、paddy.vn等)的公开博客文章,在处理过程中尊重了robots.txt协议,并通过ChromaDB持久化客户端存储了76,487个文本块(使用384维e5-small嵌入)。该数据集不仅解决了越南语宠物领域结构化知识库缺失的问题,还通过元数据标注(如主题、内容类型、严重程度等)为后续的智能问答系统提供了高质量的知识基座,对推动越南语自然语言处理在垂直领域的发展具有重要影响。
当前挑战
该数据集面临三重挑战。首先,在领域问题层面,它需要克服越南语宠物医疗信息的碎片化与不一致性,由于数据来源于多个博客,不同网站对相同症状或疾病的描述存在术语差异,导致信息对齐困难。其次,在构建过程中,爬取行为需严格遵循网站的robots.txt协议,这限制了部分高质量内容的获取;同时,处理非结构化的博客文本并将其分割为语义连贯的块(chunks),同时保留上下文并进行有效的嵌入表示,是一项技术难题。最后,数据集采用CC-BY-NC-4.0许可,仅允许非商业用途,限制了其在商业应用场景中的推广与价值最大化,如何平衡开放性与合规性仍是挑战。
常用场景
经典使用场景
在宠物健康与智能护理领域,该数据集可作为构建越南语猫科咨询助手的核心检索增强生成(RAG)数据源。通过嵌入向量化拆分得到76,487个文本片段,结合主题、内容类型、严重程度及知识层级等精细元数据标注,完美适配聊天机器人的语义检索与知识问答需求。研究者可基于此数据快速搭建领域专用问答系统,或将其作为基准测试集验证RAG框架在越南语非正式文本上的检索性能,尤其适用于宠物健康信息检索领域。
解决学术问题
该数据集系统性地解决了越南语宠物健康领域的知识碎片化与专业术语理解难题。通过整合来自11个越南权威宠物网站的结构化与非结构化数据,为跨源知识融合、语种适配的实体关系抽取提供了研究基础。尤其在数据稀疏场景下,其多维度元数据标注(如严重性分级)为学术社区探究宠物疾病智能分诊、用户意图识别及响应优先级排序等任务提供了标准化的实验平台,显著推动了低资源语言在垂直医疗领域的自然语言处理研究。
衍生相关工作
围绕该数据集已衍生出一系列经典工作,包括基于e5-small嵌入模型的越南语语义表征优化、针对宠物健康领域的RAG检索策略改进,以及多语言域适应微调等方向。研究社区在此基础上扩展了CatGPT式对话系统基准、宠物症状数据库的跨语言对齐验证,并探索了基于元数据约束的分层检索方案。此外,该数据集的高质量标注模板已被借鉴用于越南语其他垂直领域RAG数据集的构建,如兽医药物交互数据集及东南亚食品卫生咨询语料库。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务