Multi-Source Distributed System Data for AI-powered Analytics
收藏资源简介:
该数据集包含来自复杂分布式系统的分布式跟踪、应用程序日志和指标,用于支持AI驱动的分析,如异常检测、根因分析和修复。数据集通过执行顺序和并发用户请求的工作负载生成,提供了详细的实验描述和数据统计。
This dataset comprises distributed traces, application logs, and metrics from complex distributed systems, designed to support AI-driven analytics such as anomaly detection, root cause analysis, and remediation. Generated through workloads of sequential and concurrent user requests, the dataset offers detailed experimental descriptions and data statistics.
数据集概述
数据集名称
- Multi-Source Distributed System Data for AI-powered Analytics
数据集内容
- 组成:该数据集包含分布式追踪、应用日志和指标数据。
- 来源:数据来源于运行复杂的分布式系统(Openstack)。
- 类型:多源/多模态数据集。
数据集特点
- 同步性:日志和指标数据按照中欧标准时间(CEST)同步记录,追踪数据按照协调世界时(UTC)记录,需注意时差同步。
- 数据集版本:提供两个版本的数据集,基于不同的工作负载执行方式:
- sequential_data:通过执行顺序用户请求的工作负载生成。
- concurrent_data:通过执行并发用户请求的工作负载生成。
数据集使用
- 获取方式:通过Zenodo请求数据。
- 注意事项:使用前需阅读
IMPORTANT_experiment_start_end.txt文件,确保正确处理数据同步问题。
引用信息
-
引用要求:使用数据、实现或论文细节时,需进行引用。
-
参考文献:
@inproceedings{nedelkoski2020multi, title={Multi-source Distributed System Data for AI-Powered Analytics}, author={Nedelkoski, Sasho and Bogatinovski, Jasmin and Mandapati, Ajay Kumar and Becker, Soeren and Cardoso, Jorge and Kao, Odej}, booktitle={European Conference on Service-Oriented and Cloud Computing}, pages={161--176}, year={2020}, organization={Springer} }




