遇见数据集

mrcuren/slm-bilanco-financial-qa-tr

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

--- language: - tr license: mit tags: - finance - turkish - financial-analysis - balance-sheet - fine-tuning - instruction-tuning size_categories: - 1K<n<10K task_categories: - text-generation - question-answering --- # slm-bilanco-financial-qa-tr Turkce finansal analiz sorulari ve detayli cevaplarindan olusan instruction-tuning veri seti. BIST sirketlerinin bilanco verileri uzerinden olusturulmustur. > **Onemli Uyarilar** > > - Bu veri seti **yatirim tavsiyesi icermez**. Analizler yalnizca egitim ve arastirma amaclidir. > - Icerideki bilgiler ve bilanco degerleri **gercek bilgiler olmayabilir**. Yapay zeka tarafindan uretilmis veya sentetik olarak olusturulmus veriler icerebilir. > - Herhangi bir yatirim karari almak icin kullanilmamalidir. Yatirim kararlari icin yetkili finansal danismanlara basvurunuz. > - Sirket adlari ve finansal metrikler egitim amacli temsili verilerdir; resmi KAP bildirimleri yerine gecmez. ## Kullanim ```python from datasets import load_dataset ds = load_dataset("mrcuren/slm-bilanco-financial-qa-tr") train = ds["train"] val = ds["validation"] test = ds["test"] ``` ## Kategoriler | Kategori | Aciklama | |----------|----------| | likidite | Cari oran, asit-test, nakit orani | | karlilik | ROE, ROIC, net/faaliyet kar marji | | borcluluk | Borc/ozsermaye, finansal kaldirac | | nakit_akisi | FCF, nakit akim analizi | | verimlilik | Stok devir, verimlilik oranlari | | trend | Donemler arasi degisim analizi | | genel_ozet | Yonetici ozeti raporlari | | diger | Diger finansal analizler | ## Veri Kaynaklari | Kaynak | Kayit Sayisi | |--------|-------------| | Gemini augmented | 470 | | Groq augmented | 4.500 | | Seed generated | 550 | | **Toplam (train+val)** | **5.520** | | Test set (2026/3) | 151 | ## Format ```json { "instruction": "THYAO sirketinin Cari Oranini analiz et.", "input": "Donen Varliklar: 428B TL, Kisa Vadeli Yukumlulukler: 425B TL", "output": "## Likidite Analizi...", "category": "likidite", "source": "gemini" } ``` ## Istatistikler - Toplam kayit (train+val): 5.520 - Test set: 151 (2026/3 donemi, Groq ile uretilmistir) - Egitim (train): 4.968 (%90) - Dogrulama (validation): 552 (%10) - Benzersiz sirket sayisi: 80+ - Ortalama cikti (output) uzunlugu: ~300-800 token ## Test Seti Hakkinda Test seti (`test` split) ozel olarak model degerlendirmesi icin olusturulmustur: - **Donem**: Yalnizca 2026/3 (en guncel ceyrek) - **Uretim yontemi**: Groq (openai/gpt-oss-120b) - **Train overlap yok**: Train set ile instruction bazinda capraz kontrol yapilmistir - **7 kategori**: likidite, karlilik, borcluluk, nakit_akisi, verimlilik, trend, genel_ozet - **Senaryo cesitliligi**: %35 stres/negatif, %35 pozitif, %30 notr ## Sorumluluk Reddi Bu veri seti, dogal dil isleme ve buyuk dil modellerinin fine-tuning sureclerinde kullanilmak uzere hazirlanmistir. Veri setinde yer alan: - Finansal analizler, yorumlar ve degerlendirmeler **yatirim tavsiyesi niteliginde degildir**. - Bilanco degerleri ve sirket verileri **gercek finansal tablolari yansitmayabilir**; sentetik veya yapay zeka tarafindan uretilmis olabilir. - Sirket adlari gercek olsa bile, iliskili sayisal veriler **temsili ve egitsel** amaclidir. - Bu veri seti kullanilarak egitilmis modellerin urettigi ciktilar **hicbir kosulda yatirim karari olarak kabul edilemez**. Kullanicilar, bu veri setini kullanarak tum sorumlulugu kabul etmis sayilir.

A Turkish financial analysis question and detailed answer dataset for instruction tuning. Built on balance sheet data of BIST companies.

提供机构:
mrcuren
搜集汇总
数据集介绍
mrcuren/slm-bilanco-financial-qa-tr 数据集图片
构建方式
鉴于土耳其金融市场对自动化财务分析日益增长的需求,该数据集立足于BIST上市公司资产负债表的结构化数据,通过指令微调范式构建问答样本。其构建过程融合了种子生成与模型增强两种策略:基础种子样本由人工预设模板产生,确保问题覆盖核心财务指标;随后利用Gemini与Groq两套大语言模型对种子样本进行语义扩展与答案润色,形成多样化的问题表述与详尽的解析输出。数据集最终划分为训练集与验证集,并独立构建了基于最新季度的测试集,以实现对模型泛化能力的稳健评估。
使用方法
研究者和开发者可借助HuggingFace Datasets库便捷地加载该数据集,通过load_dataset函数指定标识符即可分别获取训练、验证与测试分割。使用时,模型接收由instruction与input字段拼接而成的提示,并以output字段作为监督信号进行指令微调或问答评估,category字段可用于分类别性能分析,source字段则有助于追溯数据生成来源。鉴于数据可能包含合成或增广内容且明确不构成投资建议,使用时应严格限定于学术研究与模型能力评测,避免将其输出直接应用于真实金融决策场景。
背景与挑战
背景概述
土耳其金融分析领域长期缺乏公开的土耳其语指令微调数据集,尤其是针对BIST上市公司资产负债表分析的专门资源。slm-bilanco-financial-qa-tr数据集由研究者mrcuren构建,旨在填补这一空白,通过生成式方法创建了涵盖流动性、盈利能力、偿债能力等七类分析任务的问答对。数据集包含五千余条训练与验证样本及独立测试集,基于八十余家公司的模拟财务数据,为土耳其语金融自然语言处理提供了宝贵的基准资源,推动了该语言环境下金融问答系统的发展。
当前挑战
该数据集所应对的领域问题在于土耳其语金融分析缺乏高质量指令数据,模型难以准确理解资产负债表指标间的复杂关系并生成专业解读。构建过程中,主要挑战包括生成真实可信的财务数值与分析师风格的文本,确保指令与输出间的逻辑一致性;同时需平衡不同财务情景(正面、负面、中性)的覆盖,并严格隔离训练集与测试集以防止数据泄露。此外,生成数据虽具规模,但需避免模型习得虚假关联或过度拟合合成模式,这对评估结果的泛化性提出了考验。
常用场景
经典使用场景
在土耳其金融文本智能分析领域,该数据集凭借其精细的指令格式与多类别金融指标标注,构成了面向大语言模型指令微调的经典资源。其最典型的使用场景在于,研究者利用涵盖流动性、盈利能力、偿债能力、现金流、运营效率、趋势分析及综合摘要等维度的问答对,对预训练语言模型进行监督式微调,从而令模型习得依据资产负债表数值执行结构化财务比率计算与解读的能力。这一过程通常涉及将指令、输入数值与详尽输出三元组配对,使模型在土耳其语语境下逐步掌握财务分析的推理链条,并能够针对不同公司代码与报告期生成条理清晰的诊断文本。
解决学术问题
该数据集直面金融自然语言处理中高质量标注语料匮乏的困境,尤其针对土耳其语这一低资源语种,填补了公开可用的财务问答指令数据集的空白。其学术价值体现在为评估大语言模型在专业财务推理任务中的表现提供了基准,使研究者能够系统考察模型对财务比率公式的理解、对多期趋势的判断以及对负面压力情景的敏感性。通过提供标准化的训练、验证与测试划分,该数据集有助于缓解模型评测中数据泄露与过拟合导致的结论偏差,为金融领域大模型的能力边界与可靠性研究奠定可复现的实验基础。
实际应用
在实际业务场景中,该数据集赋能金融机构与金融科技开发者构建智能财务分析助手,辅助分析师快速解读资产负债表并生成初步诊断意见。投资研究团队可借助基于此数据集微调的模型,自动化地扫描多家公司的财务指标异动,识别流动性紧张或杠杆过高等潜在风险信号。企业财务部门亦能利用此类模型对内部报表进行快速健康检查,提升决策效率。同时,该数据集支持的问答形式还可嵌入客户服务系统,为投资者教育平台提供即时、可解释的财务概念解答,降低专业分析的门槛。
数据集最近研究
最新研究方向
在土耳其金融科技与语言模型交叉领域,该数据集推动了面向低资源语言的指令微调研究,尤其聚焦于BIST公司资产负债表分析。近期研究借助该数据集探索大模型在流动性、盈利性、偿债能力等财务比率上的推理能力,并结合压力测试场景评估模型稳健性。土耳其资本市场数字化转型加速,KAP披露时效性提升,使得此类合成问答数据在金融教育与合规审查中的价值日益凸显。该数据集为构建可解释的金融分析助手提供了基准,促进了多语言金融NLP的资源建设,对监管科技和投资者教育具有潜在影响。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务