onealeph0cc/voting-agents-dataset-1
收藏官方服务:
资源简介:
这是一个通过[agent-os](https://github.com/d0rc/agent-os/)创建的合成数据集,使用了[Dolphin 2.2.1 Mistral 7b](https://huggingface.co/cognitivecomputations/dolphin-2.2.1-mistral-7b)和原始的[Mistral 7B Instruct v0.2](https://huggingface.co/mistralai/Mistral-7B-Instruct-v0.2)模型。数据集通过代理评估某些行动与其目标的契合程度生成。数据集包含以下字段:Goal(目标描述)、Action(行动描述及其理由)、Vote(代理的响应评分)、Rate(评分的解析值)。
这是一个通过[agent-os](https://github.com/d0rc/agent-os/)创建的合成数据集,使用了[Dolphin 2.2.1 Mistral 7b](https://huggingface.co/cognitivecomputations/dolphin-2.2.1-mistral-7b)和原始的[Mistral 7B Instruct v0.2](https://huggingface.co/mistralai/Mistral-7B-Instruct-v0.2)模型。数据集通过代理评估某些行动与其目标的契合程度生成。数据集包含以下字段:Goal(目标描述)、Action(行动描述及其理由)、Vote(代理的响应评分)、Rate(评分的解析值)。
提供机构:
onealeph0cc原始信息汇总
数据集概述
数据集信息
- 许可证: Apache-2.0
- 特征:
- goal: 字符串类型
- action: 字符串类型
- vote: 字符串类型
- rate: 浮点数类型 (float64)
- 分割:
- train:
- 字节数: 809613979
- 样本数: 520259
- train:
- 下载大小: 273579579
- 数据集大小: 809613979
- 配置:
- default:
- 数据文件:
- split: train
- path: data/train-*
- 数据文件:
- default:
数据集生成
- 该数据集是通过agent-os创建的合成数据集,结合了Dolphin 2.2.1 Mistral 7b和原始的Mistral 7B Instruct v0.2模型。
数据集内容
- Goal: 目标描述
- Action: 行动及其理由的描述
- Vote: 代理的响应评级
- Rate: 评级的解析值
搜集汇总
数据集介绍

构建方式
该数据集为合成数据集,依托于agent-os框架,融合了Dolphin 2.2.1 Mistral 7b与Mistral 7B Instruct v0.2两大模型的强大能力。构建过程中,智能体被赋予评估特定行为与目标契合度的任务,通过多轮交互生成数据。每条样本包含目标描述、行为及其理由、智能体投票结果以及解析后的评分值,共计520,259条训练样本,以高效的数据结构存储于HuggingFace平台。
特点
数据集的核心特点在于其合成性与双模型融合的独特设计,确保了数据多样性与评估的深度。字段结构清晰,涵盖目标、行为、投票与评分四个维度,为行为对齐研究提供了精细化标注。此外,基于agent-os的自动化生成流程,使得数据规模庞大且一致性高,适用于训练和评测智能体在复杂任务中的决策与对齐能力。
使用方法
用户可通过HuggingFace Datasets库直接加载该数据集,指定配置为'default'并选取训练集分割。数据以Parquet格式存储于路径data/train-*下,支持高效流式读取。典型应用场景包括训练强化学习中的奖励模型、微调语言模型以增强目标导向行为,或作为基准测试评估智能体对行为与目标一致性的理解能力。
背景与挑战
背景概述
在人工智能与多智能体系统交叉融合的前沿领域,如何让自主智能体有效评估自身行为与既定目标之间的一致性,已成为提升系统自主决策能力的关键瓶颈。由研究者通过agent-os框架于近期构建的voting-agents-dataset-1合成数据集,正是为了攻克这一核心问题而诞生。该数据集融合了Dolphin 2.2.1 Mistral 7b与Mistral 7B Instruct v0.2两大模型的生成能力,通过模拟智能体对特定行为与目标匹配度的投票评估过程,产出了超过52万条包含目标描述、行为说明、投票结果及评分等级的样本。这一创新性数据资源为多智能体协作、目标导向推理及自主行为评估等领域的研究提供了标准化训练与测试基准,其开放许可(Apache-2.0)更促进了学术界与工业界的广泛采纳与迭代优化。
当前挑战
该数据集所面临的挑战首先体现在领域问题层面:多智能体系统中行为与目标的一致性评估缺乏统一度量标准,现有模型难以准确捕捉复杂目标下的行为细微差异,导致投票评分存在主观偏差与噪声干扰,这直接制约了智能体在动态环境中做出可靠决策的能力。在构建过程中,研究者需克服两大技术难点:一是如何设计有效的agent-os框架以生成多样化且语义一致的目标-行为对,避免合成数据陷入模式重复或逻辑矛盾;二是如何在融合不同基座模型(Mistral与Dolphin)的输出时,平衡其各自的语言风格与评估倾向,确保评分的跨模型泛化性与稳定性。此外,数据量级达到52万条后,对计算资源与数据质量控制提出了更高要求,需通过迭代验证剔除低质量样本,方能保障数据集在后续微调任务中的实用价值。
常用场景
经典使用场景
该数据集为多智能体系统与对齐评估领域提供了一个模拟投票行为的合成数据资源。在经典使用场景中,研究者可以利用该数据集训练或微调语言模型,使其具备根据自身目标对其他智能体行为进行一致性评分的推理能力。数据集中每条样本包含目标描述、行动描述、投票结果与评分值,为构建基于目标驱动的智能体决策与协作机制提供了基础训练素材。该数据集特别适用于研究智能体间价值对齐、偏好聚合以及群体决策的可解释性问题。
解决学术问题
该数据集有效解决了多智能体系统中目标导向行为评估缺乏标准化标注数据的学术难题。传统研究往往依赖人工标注或简单规则来评估智能体行为与目标的一致性,而该数据集通过合成方式生成了大量带有细粒度评分的多智能体互动样本。它使研究者能够系统性地探索智能体在复杂目标背景下如何对他人行为进行主观评判,为研究价值对齐、偏好学习、共识机制等核心问题提供了可复现的实验基础,推动了多智能体对齐研究由理论模型向数据驱动范式的转变。
衍生相关工作
该数据集的衍生工作主要集中在对齐学习与多智能体强化学习领域。基于该数据,研究者提出了目标条件投票网络(Goal-Conditioned Voting Network)用于预测智能体对行动的一致性评分,并探索了如何利用投票信息改进多智能体策略的鲁棒性。此外,该数据集也被用于构建对抗性投票基准,测试智能体在面对误导性行动时的判别能力,相关成果推动了智能体安全与可解释性研究的发展。该数据集还启发了将投票机制引入偏好对齐微调(RLHF)流程的新范式。
以上内容由遇见数据集搜集并总结生成



