AvaSiG/argos-canonical
收藏资源简介:
ARGOS Canonical数据集是一个经过清理的对话数据集,包含5742个唯一清洁示例,划分为5570个训练样本和172个验证样本。数据来源于多个渠道,包括argos_dal_full_dataset.jsonl、telegram聊天导出和evolver_dataset.jsonl等。清理过程中丢弃了重复、低质量或错误的数据,如重复项、垃圾回答、错误回答、过短用户或助理消息等。数据格式为统一的聊天格式,包含角色(系统、用户、助理)和内容,并进行去重处理。
The ARGOS Canonical dataset is a cleaned dialogue dataset containing 5742 unique clean examples, divided into 5570 training samples and 172 validation samples. Data is sourced from multiple channels including argos_dal_full_dataset.jsonl, telegram chat exports, and evolver_dataset.jsonl. During cleaning, duplicate, low-quality, or erroneous data such as duplicates, junk answers, error answers, overly short user or assistant messages were discarded. The data format is a unified chat format with roles (system, user, assistant) and content, and includes deduplication processing.




