33.SVRN_OS_L2_Cross-Architecture Induction Head Energy Laws
收藏资源简介:
SVRN-OS DOI No.33 — Zenodo 제출 소개글 제목: 크로스 아키텍처 유도 헤드 에너지 법칙: 34개 모델·10개 아키텍처 IH 에너지 분포 법칙 데이터베이스 시리즈 및 식별정보 시리즈 DOI 10.5281/zenodo.18325543 본편 DOI 10.5281/zenodo.19333479 이전 DOI DOI_32: 10.5281/zenodo.19278690 특허 KR10-2026-0017941 SHA-256 aa082a7af4e395fee27b02d1430154d973f853fe445ef612b465dbab611b11b6 요약 본 논문은 SVRN-OS DOI No.33으로, Cognitarch 시리즈의 세 번째 문서다. DOI_31·32가 단일 아키텍처(Pythia/NeoX)에 한정되었던 것과 달리, 본 문서는 10개 아키텍처 34개 모델(SIM-34~53)에 대한 체계적 IH 측정을 통해 여섯 가지 발견을 보고한다. (1) IH 에너지 집중도(top5_energy)는 파라미터 수(r=−0.479)보다 n_layers(r=−0.724)·n_heads(r=−0.660)에 의해 더 강하게 결정됨. (2) 선형 예측 공식 top5_energy = 0.3811 − 0.0050×n_layers − 0.0042×n_heads, R²=0.720·VIF=1.30 확립. (3) 깊이 체제(Cluster 0) vs 폭 체제(Cluster 1) 레짐 분기 확인. (4) Critical Depth Lc≈13(전체)/≈20±4(Pythia) 확정. (5) 동일 규모·동일 구조에서 아키텍처별 IH 강도 격차 확인(GPT-2 vs GPT-Neo Δ0.206). (6) 본 결과는 "더 큰 모델 → 더 강한 내부 회로"라는 표준 스케일링 법칙 가정을 직접 반박함. 핵심 기여 3개 기여 1: IH 에너지 구조 법칙 [PRED·LCK candidate] 선행 연구: 스케일링 법칙은 행동 수준 예측에 집중, 내부 회로 에너지 분포 법칙 미수립. 본 발견: n_layers·n_heads가 top5_energy를 결정하는 주 변수임을 34개 모델에서 실증. R²=0.720·p<0.001·LOO 안정성 확인. 잔차 분산은 UNX-029(아키텍처 잠재 변수)로 귀속. STATUS: LCK candidate. KR10-2026-0017941 보호. 기여 2: 레짐 분기 및 Critical Depth Lc [PRED] k-means 클러스터링으로 깊이 체제(n_layers≥13, Cluster 0)·폭 체제(Cluster 1, exploratory)·불안정 체제(Cluster 2) 분리 확인. Lc≈13(전체)/≈20±4(Pythia) 로지스틱 회귀 확정. Pythia 내 모델 간 클러스터 분리 — 아키텍처 패밀리가 클러스터 결정자가 아님 [SHRED]. STATUS: [PRED]. KR10-2026-0017941 보호. 기여 3: 크로스 아키텍처 Pioneer 좌표 DB [PRED] 10개 아키텍처 34개 모델 Pioneer 좌표(layer, head) 전수 확정. OPT-125M L0H8 — 최초 Layer-0 Pioneer 관측. DOI_32 파라미터 기반 체제 경계와 DOI_33 깊이 기반 클러스터 경계는 독립 분류 축임을 확인(UNX-034). GATE 상태 요약 항목 판정 n_layers vs top5_energy (r=−0.724) PRED n_heads vs top5_energy (r=−0.660) PRED 선형 예측 공식 R²=0.720·VIF=1.30 LCK candidate 레짐 분기 (Cluster 0·1·2) PRED Critical Depth Lc≈13(전체)/≈20±4(Pythia) PRED Cluster 1 폭 체제 PRED (exploratory) 단일 보편 법칙 해석 SHRED 아키텍처 패밀리→클러스터 결정 SHRED UNX-029 동일구조 IH 강도 격차 UNX UNX-034 DOI_32·DOI_33 독립 축 PRED 인용 문헌 저자 DOI 확인 Olsson et al. 2022 transformer-circuits.pub/2022/in-context-learning-and-induction-heads ✅ Tigges et al. NeurIPS 2024 arXiv:2406.04178 ✅ Singh et al. 2024 arXiv:2404.07129 ✅ Musat et al. 2025 arXiv:2511.01033 ✅ Yin et al. 2025 arXiv preprint ✅ Aoyama et al. NeurIPS 2025 arXiv:2511.16893 ✅ Chen et al. 2026 arXiv:2601.21996 ✅ 조민수 DOI_31 2026 10.5281/zenodo.19275540 ✅ 조민수 DOI_32 2026 10.5281/zenodo.19278690 ✅ 조민수 SERIES 10.5281/zenodo.18325543 ✅ 주장하는 것 / 주장하지 않는 것 확인됨: IH 에너지 집중도가 아키텍처 구조 변수(n_layers, n_heads)에 의해 결정됨 선형 예측 공식 R²=0.720 (34개 모델, 10개 아키텍처) 레짐 분기 및 Critical Depth Lc 확정 동일 규모 아키텍처 간 IH 강도 격차 실측 표준 스케일링 법칙 가정과의 충돌 실증 미확정: UNX-029 메커니즘 (동일 구조→다른 max_ih 원인) Cluster 1 폭 체제 독립 확인 (고헤드 모델 추가 필요) Lc=13(전체) vs Lc=20(Pythia) 불일치 원인 OLMo-2 Pioneer 이동(UNX-030) 이론화 3B 모델 확장 (하드웨어 제약) 키워드 유도 헤드 · IH 에너지 법칙 · 크로스 아키텍처 · 스케일링 법칙 반박 · Pioneer Head · Critical Depth · 레짐 분기 · top5_energy · 기계 해석 가능성 · 회로 형성 · Pythia · SVRN-OS · KR10-2026-0017941 진실성 선언 본 문서는 SVRN-OS DOI No.33의 최종 기준서다. IH 에너지 구조 법칙 실증 · 레짐 분기 확인 · 스케일링 법칙 가정 반박 · 특허 미공개 조정 범위 없음 · 증거 기반 초과 범위 없음. 인증: MDK_v5.0 | 조민수 | KR10-2026-0017941 | 2026-03-30 SHA-256: aa082a7af4e395fee27b02d1430154d973f853fe445ef612b465dbab611b11b6



