Lightcap/SaaS-ProcessTwin
收藏资源简介:
SaaS-ProcessTwin是一个多语言合成数据集,支持多种自然语言处理任务,包括问答、文本生成、摘要、表格问答、文本分类和特征提取。数据集规模在1000万到1亿之间,包含英语、德语和土耳其语内容。它专为复杂推理场景设计,涉及流程挖掘、对象中心事件日志、流程孪生、因果推理、决策备忘录、信念跟踪、反事实推理、跨语言检索、RAG(检索增强生成)、智能体、长上下文、企业AI、客户成功、支持、事件响应、流失分析、文本和表格数据、推理轨迹、谜题、反馈循环、自我纠正、幸福感推理、支持性AI、安全边界、脱敏源导出、对话推理、隐私保护、架构推理、源代码推理、游戏引擎和系统设计等领域。数据集包含多个子配置,如工匠推理案例、幸福感推理案例、源导出对话等,以Parquet格式存储,适用于训练、验证和公开测试。
SaaS-ProcessTwin is a multilingual synthetic dataset supporting various natural language processing tasks, including question-answering, text-generation, summarization, table-question-answering, text-classification, and feature-extraction. The dataset size ranges between 10M and 100M, with content in English, German, and Turkish. It is designed for complex reasoning scenarios, covering areas such as process-mining, object-centric-event-log, process-twin, causal-reasoning, decision-memo, belief-tracking, counterfactual-reasoning, cross-lingual-retrieval, RAG, agents, long-context, enterprise-AI, customer-success, support, incident-response, churn-analysis, text and tabular data, reasoning-traces, puzzle, feedback-loop, self-correction, wellbeing-reasoning, supportive-AI, safety-boundaries, redacted-source-export, conversation-reasoning, privacy-preserving, architectural-reasoning, source-code-reasoning, game-engine, and systems-design. The dataset includes multiple sub-configurations, such as artisan_reasoning_cases, wellbeing_reasoning_cases, and source_export_conversations, stored in Parquet format, and is suitable for training, validation, and public testing.



