biznetgio/oasst2-javanese
收藏资源简介:
--- dataset_info: features: - name: message_id dtype: string - name: parent_id dtype: string - name: user_id dtype: string - name: created_date dtype: string - name: text dtype: string - name: role dtype: string - name: lang dtype: string - name: review_count dtype: int64 - name: review_result dtype: bool - name: deleted dtype: bool - name: rank dtype: float64 - name: synthetic dtype: bool - name: model_name dtype: 'null' - name: detoxify struct: - name: identity_attack dtype: float64 - name: insult dtype: float64 - name: obscene dtype: float64 - name: severe_toxicity dtype: float64 - name: sexual_explicit dtype: float64 - name: threat dtype: float64 - name: toxicity dtype: float64 - name: message_tree_id dtype: string - name: tree_state dtype: string - name: emojis struct: - name: count sequence: int64 - name: name sequence: string - name: labels struct: - name: count sequence: int64 - name: name sequence: string - name: value sequence: float64 splits: - name: train num_bytes: 41986354 num_examples: 39283 download_size: 13998762 dataset_size: 41986354 configs: - config_name: default data_files: - split: train path: data/train-* ---
数据集信息: 特征: - 名称:message_id(消息ID),数据类型:字符串 - 名称:parent_id(父消息ID),数据类型:字符串 - 名称:user_id(用户ID),数据类型:字符串 - 名称:created_date(创建日期),数据类型:字符串 - 名称:text(文本内容),数据类型:字符串 - 名称:role(角色),数据类型:字符串 - 名称:lang(语言),数据类型:字符串 - 名称:review_count(审核次数),数据类型:64位整数(int64) - 名称:review_result(审核结果),数据类型:布尔型(bool) - 名称:deleted(是否删除),数据类型:布尔型(bool) - 名称:rank(排序分值),数据类型:64位浮点数(float64) - 名称:synthetic(是否为合成数据),数据类型:布尔型(bool) - 名称:model_name(模型名称),数据类型:空值(null) - 名称:detoxify(毒性检测指标),结构体包含: - identity_attack(身份攻击):64位浮点数(float64) - insult(侮辱性):64位浮点数(float64) - obscene(淫秽性):64位浮点数(float64) - severe_toxicity(严重毒性):64位浮点数(float64) - sexual_explicit(露骨性内容):64位浮点数(float64) - threat(威胁性):64位浮点数(float64) - toxicity(总体毒性):64位浮点数(float64) - 名称:message_tree_id(消息树ID),数据类型:字符串 - 名称:tree_state(树状态),数据类型:字符串 - 名称:emojis(表情符号信息),结构体包含: - count(表情数量):整数序列 - name(表情名称):字符串序列 - 名称:labels(标签信息),结构体包含: - count(标签数量):整数序列 - name(标签名称):字符串序列 - value(标签值):浮点数序列 数据集划分: - 划分名称:train(训练集),字节大小:41986354,样本数量:39283 下载大小:13998762 字节 数据集总大小:41986354 字节 配置项: - 配置名称:default(默认配置),数据文件: - 对应训练划分:路径为 data/train-*
数据集概述
数据集特征
- message_id: 字符串类型
- parent_id: 字符串类型
- user_id: 字符串类型
- created_date: 字符串类型
- text: 字符串类型
- role: 字符串类型
- lang: 字符串类型
- review_count: 64位整数类型
- review_result: 布尔类型
- deleted: 布尔类型
- rank: 64位浮点数类型
- synthetic: 布尔类型
- model_name: null类型
- detoxify: 结构体类型,包含以下字段:
- identity_attack: 64位浮点数类型
- insult: 64位浮点数类型
- obscene: 64位浮点数类型
- severe_toxicity: 64位浮点数类型
- sexual_explicit: 64位浮点数类型
- threat: 64位浮点数类型
- toxicity: 64位浮点数类型
- message_tree_id: 字符串类型
- tree_state: 字符串类型
- emojis: 结构体类型,包含以下字段:
- count: 序列化的64位整数类型
- name: 序列化的字符串类型
- labels: 结构体类型,包含以下字段:
- count: 序列化的64位整数类型
- name: 序列化的字符串类型
- value: 序列化的64位浮点数类型
数据集分割
- train: 包含41,986,354字节,39,283个样本
数据集大小
- 下载大小: 13,998,762字节
- 数据集大小: 41,986,354字节
配置
- default: 包含训练数据文件,路径为
data/train-*



