SigMap Benchmark Suite: 240-Repository Large-Scale AI Context Extraction Dataset
收藏资源简介:
The SigMap Benchmark Suite presents a comprehensive evaluation of AI context extraction across 240 diverse open-source repositories spanning 30+ programming languages. This dataset comprises 1,775 benchmark operations capturing token reduction metrics, execution performance, and code complexity analysis. Key Features:• 240 repositories across 30+ languages• 1,775 benchmark operations (5 modes per repository)• 50+ metadata fields per repository• 96.2% average token reduction• Complete reproducibility package• 4 data export formats (CSV, JSON, JSONL, SQL) The dataset enables analysis of language-specific context extraction patterns, monorepo complexity, domain-specific compression characteristics, and AI context optimization strategies. Complete methodology, reproducibility materials, and scripts are included.



