Previously — Benchmark Data
收藏资源简介:
这是一个用于Previously平台的种子对话数据集,包含20个完整人物角色,每个角色有30轮多轮对话,跨越3-4年时间线,具有丰富的元数据,适用于Previously记忆架构。数据集源自WorldMemArena基准测试(CC BY-NC 4.0许可),每个角色代表一个虚构个体,具有连贯的多年度生活故事,涵盖职业发展、家庭动态、健康挑战、财务决策、爱好和个人成长等方面。
This is a seed dialogue dataset for the Previously platform. It comprises 20 complete character roles, each with over 30 rounds of multi-turn dialogues, spanning a 3-4 year timeline, and includes rich metadata, making it suitable for the Previously memory architecture. The dataset is derived from the WorldMemArena benchmark (licensed under CC BY-NC 4.0). Each role represents a fictional individual with a coherent multi-year life story, covering aspects such as career development, family dynamics, health challenges, financial decisions, hobbies, and personal growth.
数据集概述
数据集名称: Previously — Benchmark Data
数据集目的: 为个人AI指挥官平台 Previously 提供预置的种子对话数据集,使用户无需等待积累个人对话历史即可体验完整的记忆系统。
数据集组成
- 20个完整人物角色 (Personas): 每个角色均为虚构个体,包含涵盖3-4年、30轮多轮对话的完整情节记忆存储。
- 数据量: 每个角色平均约57,000词(相当于一部短篇小说)。
- 数据来源: 源自 WorldMemArena 多模态记忆基准数据集(461个样本、8,489次会话、59,239轮对话、40,194个标注记忆点),从中选取了20个个人样本。
人物角色列表
| 角色ID | 人物简介 |
|---|---|
| personal_01 | Marisa Elaine Cardenas — 县级恢复实地主管 |
| personal_02 | Lucia Elena Montoya — 法庭口译员,公民改革倡导者 |
| personal_03 | Derek Anthony Kubik — 熟练电工,IBEW Local 5 |
| personal_04 | Tasha Nicole Whitfield — 丧亲协调员,罗利 |
| personal_05 | Nathaniel James Hollis — 公交调度分析员,COTA |
| personal_06 | Hannah Louise Mercer — 注册官,普罗维登斯艺术博物馆 |
| personal_07 | Evan Michael Dorsey — 采购分析员,学区 |
| personal_08 | Jermaine Allen Booker — 安全培训师,Feeders Supply |
| personal_09 | Nadia Samira Rahal — 家庭服务接收案件社工 |
| personal_10 | Kelli Ann Brotherton — 营收周期负责人,爱达荷州埃米特 |
| personal_11 | Monica Renee Halverson — 住房法规主管,密尔沃基 |
| personal_12 | Ariana Celeste Batiste — 档案管理员,口述历史项目 |
| personal_13 | Danielle Marie Rosas — 营养协调员,学区 |
| personal_14 | Caleb Martin Hebert — 洪水外展专家,哈里斯县 |
| personal_15 | Park Jae-hyun — 调度协调员,釜山 |
| personal_16 | Saira Nadeem Hussain — 运营主管,Westgate Pharmacy,利兹 |
| personal_17 | Colleen Margaret Sweeney — 教育经理,消防员大厅博物馆 |
| personal_18 | Jordan Elise Petrov — 运营规划师,Alder Street Roasting |
| personal_19 | Nakamura Ayaka — 运营协调员,博多码头渡轮站 |
| personal_20 | Eric Matthew Lang — 冷链协调员,Freestore Foodbank |
数据结构与格式
每个角色目录是一个自包含的情节记忆存储,结构如下:
- episodic/slices/: 按年/月/日/时间命名的对话切片(Markdown格式),每个切片包含YAML元数据和对话轮次。
- episodic/slices/_index.json: 月度索引,列出该月所有切片的元数据,用于快速扫描。
- episodic/strands.json: 关键词到切片路径的索引,每个标签串联起跨时间维度的相关对话。
- user/profile.md: 角色档案。
- quality-report.json: 元数据质量审核报告。
关键概念
- 时间切片 (Time Slice): 单个对话会话,YAML元数据包含
slice_id、focus、summary、tags、emotional_tone、open_loops、decisions。 - 月度索引 (Monthly Index): 轻量级扫描目标,辅助快速回忆系统。
- 语义线索 (Strands): 关键词到切片路径的索引,实现精确的对话回忆。
- 质量报告 (Quality Report): 由 Claude Haiku 生成,标记并修复元数据问题。
数据质量
每个切片经 Claude Haiku 4.5 审核,进行了以下优化:
- 将通用标签(如
work、family)替换为每轮4-8个具体的 kebab-case 标签(如flood-mitigation-outreach) - 修正情感基调(从统一的中性改为准确值)
- 修复被截断的焦点与摘要元数据
- 添加原始转换中遗漏的未解决行动项 每个角色生成约200-260个独特语义线索。
日期说明
原始 WorldMemArena 数据集时间线设置在2025-2028年,本仓库已将日期回拨3年,所有切片位于2022-2025年范围内。可通过 scripts/shift-all-dates.mjs --reverse 恢复原始日期。
许可协议
CC BY-NC 4.0,继承自 WorldMemArena。允许非商业目的分享和改编,需注明出处。
相关项目
- Previously:使用本数据的应用程序
- WorldMemArena:原始基准数据集
- WorldMemArena 论文





