ravix-data
收藏资源简介:
该数据集是Ravix AI项目(由Triven开发)所使用的僧伽罗语对话语料库。经过清洗的僧伽罗语对话数据包含6个JSONL格式的分片,共计14,584条问答记录。每条记录包含独立的“question”和“answer”字段,且已移除换行转义符、Markdown格式、泰米尔语和英语内容、元数据以及显式的源助手身份或系统痕迹。此外,21条没有答案的记录已被排除。该数据集源自公开的Chat2Find语料库,基于MIT许可证发布,专为Ravix AI训练和研究而准备。
This dataset is a Sinhala conversational corpus used in the Ravix AI project (developed by Triven). The cleaned Sinhala dialogue data consists of 6 JSONL-format shards, totaling 14,584 question-answer pairs. Each record contains separate question and answer fields, with newline escape characters, Markdown formatting, Tamil and English content, metadata, and explicit source assistant identity or system traces removed. Additionally, 21 records without answers have been excluded. The dataset originates from the public Chat2Find corpus and is released under the MIT license, prepared specifically for Ravix AI training and research.
数据集概述
Ravix Sinhala Conversation Dataset 是一个为 Ravix AI 项目准备的对话数据集,该项目由 Triven 开发。
语言与许可
- 语言:僧伽罗语(si)
- 许可证:MIT License
任务类型
- 文本生成(text-generation)
数据集内容
- 位置:
01_raw/sinhala/conversation/ - 格式:6 个 JSONL 分片,共 14,584 条问答记录
- 每条记录:包含独立的
question和answer字段,每行一条记录,已移除换行转义和 Markdown 格式 - 已剔除内容:泰米尔语、英语内容,元数据,以及来源助手的身份或系统痕迹;另排除 21 条无答案记录
数据来源
- 源自公开可用的 Chat2Find Corpus
- 原始语料库基于 MIT License 发布
- 此衍生数据集专为 Ravix AI 的训练和研究准备




