SIRA Dataset
收藏资源简介:
SIRA Dataset: Software Requirements for ISO/IEC 25010 Classification SIRA (Synthetic ISO Requirements Assembly) is a large-scale, human-validated dataset of software requirements aligned with the ISO/IEC 25010 quality standard. It contains over 15,600 requirements distributed across 9 quality characteristics and 50 software projects, with controlled variations in length (short/long) and ambiguity (consistent/ambiguous). Files File Description SIRA_dataset_post_curated_15622_reqs.csv Final curated dataset after full pipeline: generation → deduplication → manual expert validation. Recommended for training and evaluation. SIRA_post_deduplication_080.csv Intermediate dataset after automatic deduplication (cosine similarity threshold 0.8), before manual validation. Useful for ablation studies. PROMPTS.md Complete prompt templates used for generation, including Persona, Chain-of-Thought, Self-Reflection, and Few-Shot techniques. Enables replication. Dataset Structure The CSV files contain the following columns: project_id: Unique identifier for each of the 50 software projects label: ISO/IEC 25010 quality class (Functional Suitability, Performance Efficiency, Security, Usability, Reliability, Maintainability, Compatibility, Flexibility, Safety) requirement_text: The software requirement statement Additional columns for human validation scores (clarity, class alignment, contextual relevance) Usage This dataset is designed for: Training and evaluating requirements classification models Benchmarking LLM performance on software engineering tasks



