遇见数据集

SIRA Dataset

收藏
Zenodo2026-04-29 更新2026-05-26 收录
官方服务:

资源简介:

SIRA Dataset: Software Requirements for ISO/IEC 25010 Classification SIRA (Synthetic ISO Requirements Assembly) is a large-scale, human-validated dataset of software requirements aligned with the ISO/IEC 25010 quality standard. It contains over 15,600 requirements distributed across 9 quality characteristics and 50 software projects, with controlled variations in length (short/long) and ambiguity (consistent/ambiguous). Files File Description SIRA_dataset_post_curated_15622_reqs.csv Final curated dataset after full pipeline: generation → deduplication → manual expert validation. Recommended for training and evaluation. SIRA_post_deduplication_080.csv Intermediate dataset after automatic deduplication (cosine similarity threshold 0.8), before manual validation. Useful for ablation studies. PROMPTS.md Complete prompt templates used for generation, including Persona, Chain-of-Thought, Self-Reflection, and Few-Shot techniques. Enables replication. Dataset Structure The CSV files contain the following columns: project_id: Unique identifier for each of the 50 software projects label: ISO/IEC 25010 quality class (Functional Suitability, Performance Efficiency, Security, Usability, Reliability, Maintainability, Compatibility, Flexibility, Safety) requirement_text: The software requirement statement Additional columns for human validation scores (clarity, class alignment, contextual relevance) Usage This dataset is designed for: Training and evaluating requirements classification models Benchmarking LLM performance on software engineering tasks

提供机构:
Zenodo
创建时间:
2026-04-29
二维码
社区交流群
二维码
科研交流群
商业服务