KnoWoGen
收藏资源简介:
KnoWoGen是由德国人工智能研究中心和凯撒斯劳滕-兰道大学计算机科学系开发的用于生成多代理知识工作数据集的框架。该数据集包含25封电子邮件和会议记录,旨在模拟真实的知识工作环境。数据集的创建过程涉及使用大型语言模型生成文档,并通过多代理系统进行任务分配和调度。KnoWoGen的应用领域主要集中在知识工作支持工具的评估和优化,旨在解决现有数据集缺乏多样性、背景信息和上下文的问题。
KnoWoGen is a framework for generating multi-agent knowledge work datasets, developed by the German Research Center for Artificial Intelligence and the Department of Computer Science, Kaiserslautern-Landau University. The datasets generated using this framework contain 25 emails and meeting minutes, designed to simulate real-world knowledge work environments. The dataset creation process involves utilizing Large Language Models (LLMs) to generate documents, as well as task assignment and scheduling via multi-agent systems. The primary application areas of KnoWoGen focus on the evaluation and optimization of knowledge work support tools, aiming to address the shortcomings of existing datasets, namely their lack of diversity, background information and contextual details.
KnoWoGen – The Knowledge Work Dataset Generator
摘要
当前公开的知识工作数据集缺乏多样性、广泛的注释以及用户及其文档的上下文信息。这些问题阻碍了知识工作辅助系统的客观和可比较的数据驱动评估和优化。由于在现实环境中收集此类数据需要大量资源,并且需要数据审查,因此收集这样的数据集几乎是不可能的。为此,我们提出了一种可配置的多代理知识工作数据集生成器。该系统模拟代理之间的协作知识工作,生成大型语言模型生成的文档和伴随的数据跟踪。此外,生成器捕获其配置或模拟过程中创建的所有背景信息,并将其存储在知识图中。最终,生成的数据集可以在没有隐私或保密问题的情况下使用和共享。
作者
- Desiree Heim
- Christian Jilek
- Adrian Ulges
- Andreas Dengel
详细信息
(即将推出)
示例(提示和生成的文档)
A) 种子文档(无前驱)
提示:
<s>[INST] 你是一个有帮助的、创造性的工具,生成看起来像真实文档的文档。在文档结构上要有创意。鼓励生成人工信息,并添加未在提示中声明的额外内容以丰富内容。请始终使用HTML编码你的答案,但不要使用CSS样式。永远不要输出空白或输入字段,只需放入虚构的信息,而不声明它是生成的。[...] 不要包含链接,因此不要使用<a>标签。不要包含图像或图表。不要给出任何额外的评论或注释,因为这会产生非常不利的影响。输出一个长文档。[...] 请按照以下描述生成文档: 描述: 生成一个详细的、创新的项目提案,背景为汽车工程领域的行业项目。 [/INST]
生成的文档:
(嵌入的HTML文档)
实验
实验1:比较真实文档和生成文档的真实性
在这个实验中,我们让参与者在7点李克特量表上对真实文档和生成文档的真实性进行评分。评分越高,参与者认为文档越真实。
以下图表展示了真实文档和生成文档的评分分布: (图表图像)
论文
(即将推出)

- 1Using Large Language Models to Generate Authentic Multi-agent Knowledge Work Datasets德国人工智能研究中心(DFKI)和凯撒斯劳滕-兰道大学计算机科学系 · 2024年



