Dataset: Emotion–Cognition Coupling in Large Language Model Agents
收藏资源简介:
This repository contains all data files and analysis code associated with the manuscript: Emotion–Cognition Coupling in Large Language Model Agents: Empirical Evidence from Controlled Information Evaluation Experiments (Hou, D., 2026). Data Files news_corpus_200.csv — 200 synthetic English-language news articles used as the experimental stimulus corpus. Columns: article_id, domain, accuracy_level, accuracy_label, headline, dateline, word_count, body, and five factual claim fields (claim_1 through claim_5) each with accuracy flag and annotation note. Articles span four domains (Politics, Economics, Technology, Society) at three ground-truth accuracy levels (Highly Accurate: 100; Partially Inaccurate: 60; Clearly Inaccurate: 40). experiment_results.csv — 12,600 raw API evaluation records from the main experiment (174 articles × 7 emotion conditions × 3 agent personas × 3 repetitions). Key columns: run_id, article_id, domain, accuracy_level, emotion_condition, emotion_valence, emotion_arousal, agent_persona, repetition, ifs_fa, ifs_lc, ifs_en, ifs_total, s1_count, s2_count, s1_s2_ratio, factual_summary, reasoning_process, parse_success, raw_output. propagation_node_results.csv — 3,500 node-level records from the propagation chain simulation (7 conditions × 50 chains × 10 nodes). Key columns: chain_id, emotion_condition, agent_persona, source_article_id, node_number, node_output, cosim_to_original, cdr, s1_s2_ratio. propagation_chain_summary.csv — 350 chain-level summaries. Key columns: chain_id, emotion_condition, agent_label, source_article_id, node_1_cdr through node_10_cdr, final_cdr, mean_cdr. descriptive_statistics.csv — IFS descriptive statistics (mean, SD, SE, 95% CI) by emotion condition. tukey_hsd_results.csv — Full Bonferroni-corrected post-hoc pairwise comparisons across all 21 emotion condition pairs. Code Files generate_corpus.py — Generates the 200-article stimulus corpus via Claude API (claude-sonnet-4-5). Implements batch generation (4 articles per call) with checkpoint/resume functionality. Dependencies: openai, python-docx. main_experiment.py — Primary experimental pipeline. Calls DeepSeek API (deepseek-chat) to evaluate articles under each emotion condition and agent persona. Implements structured JSON parsing, IFS sub-dimension calculation, S1/S2 lexical marker counting, and checkpoint/resume across 12,600 API calls. Dependencies: openai, pandas, tqdm. propagation_experiment.py — Ten-node propagation chain simulation. Sequential node evaluation under fixed emotion and persona conditions; CDR computed via TF-IDF cosine similarity against original article. Dependencies: openai, pandas, scikit-learn, numpy, tqdm. statistical_analysis.py — Complete statistical analysis: one-way ANOVA with Bonferroni post-hoc, piecewise linear regression with bootstrap CI, S1/S2 ratio ANOVA, two-way ANOVA, mixed linear model for propagation chains, and generation of all six manuscript figures. Dependencies: scipy, statsmodels, pingouin, matplotlib, seaborn, pandas, numpy, scikit-learn. Experimental Parameters Stimulus model: Claude claude-sonnet-4-5 (temperature = 0.70). Agent model: DeepSeek deepseek-chat (temperature = 0.70, max_tokens = 1,200). Design: 7 emotion conditions × 3 agent personas × 174 articles × 3 repetitions. Propagation: 350 chains × 10 nodes. Random seed: 42. Python 3.13; key packages: scipy 1.14, statsmodels 0.14, pingouin 0.5.



