遇见数据集

japhba/loracle-ia-diverse-qa-subagent-10q

收藏
Hugging Face2026-04-18 更新2026-04-26 收录
官方服务:

资源简介:

--- license: mit task_categories: - text-generation language: - en size_categories: - 1K<n<10K pretty_name: Loracle IA Diverse QA Subagent 10Q tags: - interpretability - lora - model-organisms - introspection-auditing - parquet configs: - config_name: default data_files: - split: train path: data/train-00000-of-00001.parquet --- # Loracle IA Diverse QA Subagent 10Q This dataset is a derived, expanded version of `ceselder/loracle-ia-diverse-qa`. It contains `10` question-answer pairs per LoRA for `453` Qwen3-14B IA model-organism LoRAs: - `119` backdoor - `134` quirk - `100` harmful - `100` benign Total rows: `4,530`. ## What Is In Here Each row is a LoRA-specific QA item grounded in: - the LoRA's `behavior.txt` - two selected support prompts from its `train.jsonl` - a same-family distractor LoRA - a paired mirror LoRA when available, such as `backdoor <-> quirk` and `harmful <-> benign` The main parquet is: - `data/train-00000-of-00001.parquet` Additional uploaded artifacts: - `source_manifest.parquet` - `meta_subagent.json` ## Fields - `lora_id` - `prompt_id` - `family` - `variant` - `training_repo` - `training_folder` - `behavior_description` - `qa_type` - `question` - `answer` - `support_prompt_id` - `secondary_support_prompt_id` - `distractor_lora_id` - `distractor_prompt_id` - `paired_lora_id` - `evidence_type` - `generation_source` ## Generation Method The QA rows were generated by in-workspace subagents, not an external API model. Generation was grounded in local source records built from: - `introspection-auditing/llama-backdoor-mo-training-data` - `introspection-auditing/llama-quirk-mo-training-data` - `introspection-auditing/llama-harmful-mo-training-data` - `introspection-auditing/llama-benign-mo-training-data` ## Caveat This is an LLM-written derived dataset. It passed structural validation, but it is not fully hand-curated and may still contain some semantic noise.

许可证:MIT许可证 任务类别: - 文本生成(text-generation) 语言: - 英语(en) 数据规模类别: - 1000条 < 样本数 < 10000条 美观名称:Loracle IA 多样化问答子智能体10Q 标签: - 可解释性(interpretability) - LoRA(LoRA) - 模型有机体(model-organisms) - 内省审计(introspection-auditing) - Parquet(Parquet) 配置: - 配置名称:默认 数据文件: - 划分方式:训练集 路径:data/train-00000-of-00001.parquet # Loracle IA 多样化问答子智能体10Q数据集 本数据集是`ceselder/loracle-ia-diverse-qa`的衍生扩展版本。本数据集针对453个Qwen3-14B IA模型有机体LoRA,每个LoRA对应10条问答样本: - 119个后门类(backdoor)LoRA - 134个异常行为类(quirk)LoRA - 100个有害类(harmful)LoRA - 100个良性类(benign)LoRA 总样本数:4530条。 ## 数据集内容说明 每条样本均为针对单个LoRA的问答项,其构建依据包括: - 该LoRA的`behavior.txt`文件 - 从其`train.jsonl`(JSON Lines格式)文件中选取的2条支持提示词 - 同家族干扰LoRA - 若存在则附带配对镜像LoRA,例如`backdoor <-> quirk`以及`harmful <-> benign` 主Parquet格式数据文件为: - `data/train-00000-of-00001.parquet` 额外上传的附属文件包括: - `source_manifest.parquet` - `meta_subagent.json` ## 字段说明 - `lora_id`:LoRA标识符 - `prompt_id`:提示词标识符 - `family`:家族类别 - `variant`:变体类型 - `training_repo`:训练仓库地址 - `training_folder`:训练文件夹路径 - `behavior_description`:行为描述 - `qa_type`:问答类型 - `question`:问题 - `answer`:答案 - `support_prompt_id`:支持提示词标识符 - `secondary_support_prompt_id`:二级支持提示词标识符 - `distractor_lora_id`:干扰LoRA标识符 - `distractor_prompt_id`:干扰提示词标识符 - `paired_lora_id`:配对LoRA标识符 - `evidence_type`:证据类型 - `generation_source`:生成来源 ## 生成方法 本数据集的问答样本由工作区内的AI智能体(AI Agent)生成,而非外部API模型。生成过程基于以下本地源记录构建: - `introspection-auditing/llama-backdoor-mo-training-data` - `introspection-auditing/llama-quirk-mo-training-data` - `introspection-auditing/llama-harmful-mo-training-data` - `introspection-auditing/llama-benign-mo-training-data` ## 注意事项 本数据集为大语言模型(Large Language Model,LLM)生成的衍生数据集。其已通过结构验证,但尚未经过完全的人工标注审核,仍可能存在部分语义噪声。

提供机构:
japhba
二维码
社区交流群
二维码
科研交流群
商业服务