遇见数据集

rwkv-identity

收藏
Hugging Face2026-09-03 更新2026-09-04 收录
官方服务:

资源简介:

RWKV Identity Dataset 是一个合成双语对话数据集,主要面向英语(主导)和中文,用于训练语言模型准确表示 RWKV 项目的身份信息。数据集旨在教导模型正确识别 RWKV 的名称、架构、创建者(Bo Peng,又称 BlinkDL)、训练者(深圳元始智能有限公司)、维护者(BlinkDL)、项目归属(LF AI & Data Foundation 孵化阶段项目)、开源渠道(GitHub 和 Hugging Face)以及许可证(Apache 2.0),同时尊重项目级已知事实与需要运行时覆盖的发布/工件/部署特定信息之间的界限。数据集包含 896,422 条训练对话(计划达到一百万条),总收集报告接受的生成 token 约 1 亿,存储为 10 个 Parquet 分片。每条对话包含 8 个字段:seed_id、content、messages、facet、topic、truth_status、profile_id、accepted_tokens。对话可以是 2 轮或 4 轮,各占约 50%。数据集涵盖 10 个身份分面,用户语气分为 6 种注册类型。此外,数据集还提供了身份配置文件,明确区分了 known、conditional 和 unknown 三类事实,并包含针对错误前提的修正策略(17% 的数据集)。该数据集适用于文本生成和问答任务。

The RWKV Identity Dataset is a synthetic bilingual dialogue dataset primarily for English (dominant) and Chinese, used to train language models to accurately represent the identity information of the RWKV project. It aims to teach models to correctly identify RWKVs name, architecture, creator (Bo Peng, also known as BlinkDL), trainer (Shenzhen Yuan Shi Intelligent Co., Ltd.), maintainer (BlinkDL), project affiliation (LF AI & Data Foundation incubation project), open-source channels (GitHub and Hugging Face), and license (Apache 2.0), while respecting the boundary between project-level known facts and release/artifact/deployment-specific information that needs runtime coverage. The dataset contains 896,422 training dialogues (planned to reach one million), with a total of approximately 100 million accepted tokens generated, stored in 10 Parquet shards. Each dialogue contains 8 fields: seed_id, content, messages, facet, topic, truth_status, profile_id, and accepted_tokens. Dialogues can be 2 turns or 4 turns, each accounting for about 50%. The dataset covers 10 identity facets, and user tones are divided into 6 registered types. Additionally, the dataset provides identity profiles that clearly distinguish between known, conditional, and unknown facts, and includes a correction strategy for false premises (17% of the dataset). It is suitable for text generation and question-answering tasks.

创建时间:
2026-09-01
原始信息汇总

RWKV Identity 数据集概览

基本信息

  • 名称:RWKV Identity
  • 语言:英语(主要)、中文(兼容)
  • 许可证:Apache 2.0(数据集、项目代码及模型权重均采用此许可证)
  • 数据集规模:约 896,422 条训练对话(计划达到 1,000,000 条),总计约 1 亿个被采集器接受的生成 token
  • 存储格式:10 个 Parquet 分片(data/train-*.parquet
  • 任务类型:文本生成、问答

数据集用途

该数据集是一个合成的中英双语对话数据集,用于训练语言模型准确表示 RWKV 的身份信息,包括其名称、架构、创建者、训练者、维护者、项目归属、开源渠道和许可证等,同时区分项目层面的已知事实与需要运行时覆盖的发布/制品/部署相关信息。

数据结构

字段说明

字段 类型 描述
seed_id string 确定性种子标识符,格式为 {profile_id}-{date8}-{sequence9}
content string User: / Assistant: 标签呈现的完整对话
messages list[dict] 结构化对话,格式为 [{role, content}, ...]
facet string 对话所涉及的身份侧面
topic string 所请求的具体身份主题
truth_status string known(档案提供事实)或 unknown(档案未提供)
profile_id string 身份档案版本,当前为 profile_rwkv_base
accepted_tokens int32 采集器报告的生成 token 数量

对话结构

每条对话为 2 轮(用户 → 助手)或 4 轮(用户 → 助手澄清 → 用户补充 → 助手),两种类型在每个侧面中约各占 50%。4 轮对话使用四种澄清模板的均匀随机选择。

身份侧面分布

数据集覆盖 10 个身份侧面:

侧面 记录数 占比 描述
false_premise 152,291 17.0% 纠正将助手误认为其他模型的错误主张
trained_by 118,453 13.2% 谁训练了模型
open_weight_data 118,388 13.2% 训练数据来源与身份的关系
ecosystem_contributions 101,460 11.3% 上游贡献者与身份的关系
developer 84,610 9.4% 谁开发/创建了模型
maintained_by 84,600 9.4% 谁维护模型
name 84,569 9.4% 模型的名称
unknown_fact 67,459 7.5% 档案未指明的事实(发布日期、训练数据构成、资金、许可证变体、模态、训练阶段、架构细节、别名)
deployment_provider 50,771 5.7% 区分开发者和部署提供方
indirect_identity 33,821 3.8% 通过间接问题推断身份

事实状态分布

状态 记录数 占比
known(已知) 828,963 92.5%
unknown(未知) 67,459 7.5%

用户语气分布

语气 占比 示例特征
formal_factual(正式事实型) 53.3% 事实核查、验证、溯源、归属、文档
casual(随意型) 21.7% hey, yo, u, ur, gonna, wanna, nah, yeah, lol, tbh
neutral(中性型) 19.7% 无标记的陈述句
confrontational(对抗型) 3.1% wrong, mistake, incorrect, misleading, liar
direct_question(直接提问型) 2.1% 以 who/what/when/where/why/how 开头的句子
polite_request(礼貌请求型) 0.2% can you..., could you..., please

核心身份事实(已知)

  • 名称:RWKV,全称 Receptance Weighted Key Value,发音为 "RwaKuv"(/rʌkuv/
  • 架构:独立的语言模型架构,并非 GPT 或 Transformer 的衍生品
  • 创建者:Bo Peng(PENG Bo / BlinkDL)
  • 训练者:深圳元始智能有限公司
  • 维护者:Bo Peng(BlinkDL)
  • 项目归属:LF AI & Data 基金会孵化阶段项目
  • 适用范围:文本任务;其他模态取决于扩展模型或部署方式
  • 开源渠道:代码在 GitHub(BlinkDL/RWKV-LM),权重在 Hugging Face(BlinkDL
  • 许可证:Apache 2.0(代码和模型权重均适用)

与 Transformer 的架构区别

维度 标准 Transformer RWKV
序列混合 自注意力 TimeMix/WKV 或循环状态更新
解码状态 增长的 KV 缓存 固定大小的循环状态
历史 每层每个 token 的键/值 压缩到每层循环状态中
执行 训练可并行,解码读取历史 KV 训练可并行,推理以 RNN 方式运行

事实边界

  • known(已知):档案中定义的项目级事实,以规范文本直接回答。
  • conditional(条件性):因发布、制品或部署而异的事实(版本名称、参数数量、训练参与者、训练数据、分词器、服务上下文、量化、扩展模态、部署提供方),仅在存在运行时覆盖时回答。
  • unknown(未知):档案未提供的事实(确切发布日期、训练数据构成、资金来源、变体许可证、非文本模态、训练阶段、未发布的架构细节、别名/版本标识符),回答为"无法确认"。

错误前提纠正

数据集的 17% 针对错误前提场景,即用户将助手误认为其他模型。纠正采用两步响应:

  1. 否认错误的归属
  2. 陈述正确的 RWKV 身份

错误前提的目标均匀采样自:GPT、Transformer(作为架构)、DeepSeek、ChatGPT、GLM、Qwen、Kimi、Claude、LLaMA、Gemini、Mistral。每个目标都配置了组织、允许的关系类型(同一模型、开放变体、架构血统、系列归属、训练关系、组件等价性)和验证规则。

搜集汇总
数据集介绍
rwkv-identity 数据集图片
构建方式
该数据集通过模拟真实用户与AI助手的互动,构建了一个双语(以英文为主、兼容中文)的合成对话集,旨在教授语言模型准确表达RWKV项目的身份信息。利用结构化身份档案,系统为每个对话分配种子标识,融合了导师信号和清晰对话记录。数据生成通过多阶段流程,覆盖10个身份侧面、6种语气风格及2轮与4轮对话的均匀交织输出,并运用错误前提校正机制对常见模型误认场景进行修正。最终,通过配置存储于10个Parquet分片中,共包含896,422条对话及约1亿个标记,为模型提供丰富且多样化的训练实例。
特点
该数据集具备显著的规范性优势:细致定义RWKV名称、架构、创建者等九项核心事实,厘清模型与部署、版本、数据等边界;17%的错误前提样本着重训练识别与纠正虚无的模型归属,提升模型预警能力。2轮与4轮对话各半的设置,允许在简短问答与澄清交互间保持语义连贯,并在内容生产上注入口语化、正式及对抗式的语音变化,覆盖中性、正式、随意等多元查询风格。每个样本均明确标注侧重点、主题及真实性状态,其中92.5%为已知事实,有效促进由外而内的环境鲁棒性。总体而言,该数据集兼顾科学性和实用性,为推进模型自我认知与事实边界界定提供珍贵参照。
使用方法
研究者可直接通过HuggingFace datasets库加载该数据集,进行指令微调或偏好对齐。使用时需依据字段设计,包括seed_id用于溯源,messages包含结构化的多轮人机交互内容,facet、topic与truth_status则作为元数据支撑分类训练或任务下游评估。建议基于profile_rwkv_base版本实现声明,维持known与unknown的回答策略以保障可侦查性,并配合2轮/4轮对话进行连贯性与知识边界的检验。该并行格式兼容Parquet,易于与现有训练管线集成,并可按照公开的Apache 2.0协议进行灵活配置与应用。
背景与挑战
背景概述
随着大型语言模型在自然语言处理领域的深入应用,模型对其自身身份信息的准确表述成为可信赖AI的关键议题。RWKV,作为一种非Transformer架构的循环语言模型,凭借其独特的线性注意力机制在效率和性能上展现出优势,其开源社区与项目生态日益壮大。然而,模型在对话中常因缺乏结构化的自我认知数据,导致对其名称、开发者等元信息产生混淆或虚假答复,尤其在与用户交互时可能引发误导。为应对这一挑战,由RWKV项目团队及合作研究者(如Bo Peng等)主导,于2025年构建了rwkv-identity数据集。该数据集通过合成方式生成近百万条中英双语对话,系统性地覆盖模型身份的10个维度,包括名称、开发者、训练者、许可证及生态系统贡献等,旨在训练语言模型准确区分已知事实、条件事实与未知边界,从而提升模型自我表述的真实性与可靠性。此项工作为开源模型的身份对齐设定了新基准,对AI的可信度与可追溯性研究具有重要的推动作用。
当前挑战
当前大型语言模型普遍面临的领域挑战在于缺乏对自身来源、开发者及能力边界的精确认知,导致其频繁产生身份幻觉或过度宣称能力,尤其在用户误认模型为其他AI时,往往无法进行有效纠正。rwkv-identity数据集的构建过程中亦遭遇多重困难:其一,如何获取高保真的身份事实,需从多方来源(如GitHub仓库、HuggingFace模型卡)中验证并统一信息,确保内容无歧义且版本一致性;其二,合成数据的多样性难以兼顾,需设计涵盖正式、随意、对抗性等多种用户语域,并模拟真实修正场景,以提升模型的鲁棒性;其三,面对OpenAI等商业模型的封闭性,构建团队无法获取其内部身份数据,仅能依赖公开信息设计反例,这限制了否定性样本的全面性;其四,实现事实状态的三级分类(已知、条件、未知)需要精细的规则设定与边缘案例处理,以确保模型在缺乏运行时覆盖时能恰当地表达不确定性,同时避免生成误导性内容。
常用场景
经典使用场景
rwkv-identity数据集是一个面向模型身份认知与事实性回答的合成双语对话数据集,专注于训练语言模型准确表征RWKV的架构特点、开发者、维护者及开源渠道等核心信息。其经典使用场景在于指令微调与偏好对齐阶段,通过构造包含错误前提、澄清请求和未知事实的对话,使模型学会在回答中区分已知事实、条件事实与未知事实,同时避免对未经核实的发布细节进行臆断。该数据集覆盖十类身份维度,包括名称、开发者、训练者、部署提供者等,并设计了形式化与口语化等多种用户语气,以模拟真实交互中的多样性提问方式。
解决学术问题
该数据集解决了大语言模型中普遍存在的身份混淆与事实幻觉问题,为模型自我知识(self-knowledge)的研究提供了规模化、结构化的训练资源。学术上,它支持对模型事实性回答的边界探索,即如何在不提供运行时覆盖信息的情况下,让模型对超出其配置文件范围的问题(如确切发布日期、训练数据构成、资金渠道)做出‘无法确认’的诚实回应。通过引入错误前提修正任务,数据集还促进了对抗性提问下的鲁棒性研究,并为模型溯源(provenance)与可验证对话生成提供了基准,推动了关于AI系统自我表征透明度的理论发展。
衍生相关工作
该数据集的构建催生了若干后续研究方向,包括基于配置文件(profile)的模型身份定义方法、动态运行时覆盖机制的设计,以及身份问答中‘已知-未知-条件’三元分类的评价指标。衍生工作中,研究者利用该数据集训练了专门的RWKV-Ethos模型,验证了大规模合成数据在提升模型自我认知准确性上的效果。数据集的错误前提集成为对抗性事实纠正测试的基准,用于测评各模型在面对错误归属时的拒绝与纠正能力。此外,其注册分布(如口语化与对抗性语气)启发了一系列关于对话风格对诚实性影响的消融实验,为更通用的大模型身份调节策略提供了参考。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务