UnderstandLing/oasst1_hi
收藏资源简介:
--- license: apache-2.0 dataset_info: features: - name: message_id dtype: string - name: parent_id dtype: string - name: user_id dtype: string - name: created_date dtype: string - name: text dtype: string - name: role dtype: string - name: lang dtype: string - name: review_count dtype: int64 - name: review_result dtype: bool - name: deleted dtype: bool - name: rank dtype: float64 - name: synthetic dtype: bool - name: model_name dtype: 'null' - name: detoxify struct: - name: identity_attack dtype: float64 - name: insult dtype: float64 - name: obscene dtype: float64 - name: severe_toxicity dtype: float64 - name: sexual_explicit dtype: float64 - name: threat dtype: float64 - name: toxicity dtype: float64 - name: message_tree_id dtype: string - name: tree_state dtype: string - name: emojis struct: - name: count sequence: int64 - name: name sequence: string - name: labels struct: - name: count sequence: int64 - name: name sequence: string - name: value sequence: float64 splits: - name: train num_bytes: 103419755 num_examples: 81870 - name: validation num_bytes: 4384159 num_examples: 3401 download_size: 29829039 dataset_size: 107803914 configs: - config_name: default data_files: - split: train path: data/train-* - split: validation path: data/validation-* ---
许可证:Apache-2.0 数据集信息: 特征字段: - 名称:消息ID(message_id),数据类型:字符串 - 名称:父消息ID(parent_id),数据类型:字符串 - 名称:用户ID(user_id),数据类型:字符串 - 名称:创建日期(created_date),数据类型:字符串 - 名称:文本内容(text),数据类型:字符串 - 名称:角色(role),数据类型:字符串 - 名称:语言标识(lang),数据类型:字符串 - 名称:审核次数(review_count),数据类型:64位整数 - 名称:审核结果(review_result),数据类型:布尔值 - 名称:是否已删除(deleted),数据类型:布尔值 - 名称:排序分值(rank),数据类型:64位浮点数 - 名称:是否为合成数据(synthetic),数据类型:布尔值 - 名称:模型名称(model_name),数据类型:空值(null) - 名称:毒性检测指标(detoxify),结构体: - 名称:身份攻击分值(identity_attack),数据类型:64位浮点数 - 名称:侮辱性分值(insult),数据类型:64位浮点数 - 名称:淫秽内容分值(obscene),数据类型:64位浮点数 - 名称:严重毒性分值(severe_toxicity),数据类型:64位浮点数 - 名称:露骨性内容分值(sexual_explicit),数据类型:64位浮点数 - 名称:威胁性分值(threat),数据类型:64位浮点数 - 名称:总体毒性分值(toxicity),数据类型:64位浮点数 - 名称:消息树ID(message_tree_id),数据类型:字符串 - 名称:消息树状态(tree_state),数据类型:字符串 - 名称:表情符号信息(emojis),结构体: - 名称:数量(count),数据类型:整数序列 - 名称:名称(name),数据类型:字符串序列 - 名称:标签信息(labels),结构体: - 名称:数量(count),数据类型:整数序列 - 名称:名称(name),数据类型:字符串序列 - 名称:分值(value),数据类型:浮点数序列 数据集划分: - 划分名称:训练集(train),占用字节数:103419755,样本数量:81870 - 划分名称:验证集(validation),占用字节数:4384159,样本数量:3401 下载总大小:29829039,数据集总存储大小:107803914 配置项: - 配置名称:默认(default),数据文件路径: - 训练集划分:data/train-* - 验证集划分:data/validation-*
数据集概述
数据集特征
- message_id: 字符串类型
- parent_id: 字符串类型
- user_id: 字符串类型
- created_date: 字符串类型
- text: 字符串类型
- role: 字符串类型
- lang: 字符串类型
- review_count: 64位整数类型
- review_result: 布尔类型
- deleted: 布尔类型
- rank: 64位浮点数类型
- synthetic: 布尔类型
- model_name: null类型
- detoxify: 结构体类型,包含以下字段:
- identity_attack: 64位浮点数类型
- insult: 64位浮点数类型
- obscene: 64位浮点数类型
- severe_toxicity: 64位浮点数类型
- sexual_explicit: 64位浮点数类型
- threat: 64位浮点数类型
- toxicity: 64位浮点数类型
- message_tree_id: 字符串类型
- tree_state: 字符串类型
- emojis: 结构体类型,包含以下字段:
- count: 整数序列类型
- name: 字符串序列类型
- labels: 结构体类型,包含以下字段:
- count: 整数序列类型
- name: 字符串序列类型
- value: 浮点数序列类型
数据集分割
- train:
- 字节数: 103419755
- 样本数: 81870
- validation:
- 字节数: 4384159
- 样本数: 3401
数据集大小
- 下载大小: 29829039 字节
- 数据集大小: 107803914 字节
配置
- config_name: default
- data_files:
- train: data/train-*
- validation: data/validation-*
- data_files:




