dheepakkaran/TamilTech-QA
收藏资源简介:
TamilTech-QA是首个公开的Tanglish(泰米尔语-英语混合代码切换)技术问答数据集,专为微调和评估大型语言模型在泰米尔语工程学生和开发者自然用语习惯上的表现而设计。数据集包含4,415个问答对,分为训练集(3,536)、验证集(431)和测试集(447),并按主题和难度分层。数据来源包括92%的真实用户YouTube评论(来自12个泰米尔语技术YouTube频道,约43,000条原始评论,经清洗、Tanglish比例过滤和去重后得到4,049个高质量样本)和8%的GPT-4o-mini合成数据(366个样本)。数据集涵盖10个主题领域,如编程、人工智能/机器学习、工程、Web开发和系统等。每个样本遵循Alpaca指令调优模式和ChatML格式,包含问题、答案、Tanglish混合比例、语言标签等字段。数据集还引入了新的评估指标(如代码切换保留分数CSPS、技术术语保留TTR和泰米尔语连接词流畅度TCF),并发布了配套的微调模型。
--- language: - 泰米尔语(ta) - 英语(en) multilinguality: 多语言 tags: - 坦格里什语(Tanglish) - 泰米尔语 - 英语 - 代码转换 - 技术问答 - 指令微调 - 大语言模型微调(LLM-Finetuning) license: CC-BY-4.0(知识共享署名4.0协议) task_categories: - 问答 - 文本生成 pretty_name: TamilTech-QA size_categories: - 1000 < 样本数 < 10000 configs: - config_name: 默认配置 data_files: - split: 训练集 path: data/train-* - split: 验证集 path: data/validation-* - split: 测试集 path: data/test-* --- # TamilTech-QA **首个公开发布的坦格里什语(Tanglish,泰米尔语-英语代码转换语)技术问答数据集**,专为适配泰米尔工科学生与开发者的自然语域,对大语言模型(LLM)进行微调与评估而设计。 > *“Indha gradient descent epdi work pannuthu”, “konjam sollunga”, “intha for-loop intha maari iruka venum”* — 这便是**坦格里什语(Tanglish)**:以泰米尔语语法框架搭配英语技术词汇的混合语。该语域广泛流行于泰米尔语科技类YouTube视频、课堂与Reddit讨论中,但现有技术问答数据集对此完全缺失。 ## 数据集概览 - **语言**:坦格里什语(泰米尔语-英语代码转换语) - **任务**:问答/指令遵循 - **规模**:4415组问答对 - **划分**:训练集(3536)/验证集(431)/测试集(447)—— 按主题与难度分层抽样 - **来源**:92%为真实用户YouTube评论 + 8%由GPT-4o-mini合成生成 - **格式**:Alpaca风格指令微调格式 + ChatML格式 ## 数据来源 ### YouTube评论(占数据集92%,共4049条样本) 从12个热门泰米尔语科技类YouTube频道抓取的评论与回复: | # | 频道名称 | 频道ID | |---|---|---| | 1 | Brototype Tamil | UCIFQgj1Rhx-FFgyo0zzPSfw | | 2 | 泰米尔编程巫师(Tamil Coding Wizard) | UCKOob5-7sMljgW3f4pO_Dyg | | 3 | 泰米尔程序员(Tamil Programmer) | UCEKv3WR3HUVuIHV2eXFyGYg | | 4 | 泰米尔科技(MrTT) | UC20sXo8ReewkzNKBFgzVCPA | | 5 | A2D Channel | UCvyZS6W6zMJCZBVzF-Ei6sw | | 6 | AI Coach John(泰米尔语版) | UCmCAY_mStg1POKUWgMg-aGQ | | 7 | 与Thiru共学AI(AI with Thiru) | UCY8kgTLO7GitoKuxz4Cw3uQ | | 8 | Karthik的节目(Karthik's Show) | UCBF5i6PogoMwnoAP0LFiCmQ | | 9 | 泰米尔语数据工程(Data Engineering Tamil) | UC9xghV-TcBwGvK-aEMhpt5w | | 10 | 无尽知识(Endless Knowledge) | UCApUMSkgDT8ayJZU8jBweYw | | 11 | 好奇怪咖(Curious Freaks) | UCvhU9qF1xtUsFXdKrcJxbFA | | 12 | AI小哥-泰米尔语版(The AI Dude - Tamil) | UCsq38VCprHHb_0rwBNfWFYw | 共抓取原始评论约43000条(覆盖所有频道)。经过清洗、坦格里什语域过滤(0.05 ≤ 占比 ≤ 0.95)与去重后,得到4049条高质量问答样本。 ### 合成数据(占8%,共366条样本) 通过OpenAI GPT-4o-mini结合结构化JSON模式提示生成。计划生成10个主题 × 每个主题50组问答 → 约500条原始样本 → 经去重与坦格里什语域过滤后,最终得到366条样本。 ## 主题分类 分层覆盖10个主题类别: - **编程**:Python、数据结构与算法(DSA)、算法、调试 - **AI/机器学习**:机器学习、神经网络 - **工程**:电子与通信工程(ECE) - **Web开发**:REST API、HTTP、前端、后端 - **系统**:操作系统、网络、数据库 ## 数据格式规范 每个样本均遵循Alpaca指令微调格式规范,并支持ChatML渲染: json { "id": "tamiltech_001234", "source": "youtube", "topic": "ml", "difficulty": "medium", "question": "indha gradient descent enna na konjam sollunga", "answer": "Gradient descent na, loss function-oda minimum point-ku move panrom. ...", "tanglish_ratio": 0.42, "language_tags": ["ta", "en"], "instruction": "Nee oru helpful Tamil-English technical assistant. ...", "input": "indha gradient descent enna na ...", "output": "Gradient descent na, loss ...", "chatml": "<|im_start|>system ...<|im_end|> <|im_start|>user ...<|im_end|>..." } ## 统计信息 | 字段 | 训练集 | 验证集 | 测试集 | |---|---|---|---| | 样本数 | 3536 | 431 | 447 | | 数据来源 | YouTube评论 + 合成数据 | 同上 | 同上 | | 平均问题长度 | ~25个Token | ~25个Token | ~25个Token | | 平均回答长度 | ~80个Token | ~80个Token | ~80个Token | | 坦格里什语占比范围 | 0.05 – 0.95 | 0.05 – 0.95 | 0.05 – 0.95 | 总词汇量:约19000个唯一Token。 ## 专为本数据集设计的新型评估指标 我们提出了三种专门用于评估代码转换文本生成的新指标: ### CSPS — 代码转换保留得分(Code-Switch Preservation Score) 用于衡量模型输出是否保持与参考回答相近的坦格里什语占比: CSPS_i = 1 - |tanglish_ratio(pred_i) - tanglish_ratio(ref_i)| 语料库级CSPS = 所有样本的平均值。取值范围:[0, 1],得分越高表示语域保留效果越好。 ### TTR — 技术术语保留率(Technical Term Retention) 参考回答中的英语技术术语在模型输出中出现的比例。这对代码转换文本生成至关重要:即使泰米尔语语法框架发生变化,技术词汇(`function`、`gradient`、`pointer`)必须得到保留。 ### TCF — 泰米尔语连接语流畅度(Tamil Connector Fluency) 基于规则的自然泰米尔语连接词检查(如“enna na”“apdi patha”“sollunga”“puriyutha”“theriyuma”“indha maari”)。取值范围:[0, 1]。 这些指标补充了标准的BLEU/ROUGE/BERTScore,将代码转换质量与词汇重叠度分离开来。 ## 配套模型 基于本数据集训练的QLoRA微调Llama-3.1-8B模型已发布于: **[dheepakkaran/TamilTech-QA-Llama3.1-8B-QLoRA](https://huggingface.co/dheepakkaran/TamilTech-QA-Llama3.1-8B-QLoRA)** 基准指标(基础零样本模型 vs 微调后模型): - 困惑度:57.05 → **12.40**(下降78%) - CSPS:0.727 → 0.754(提升3.7%) - TTR:0.388 → 0.419(提升8%) ## 样本示例 text Q: 调制是什么? A: 调制是一种通过改变信号的频率、幅度或相位来传输信号的技术。比如FM、AM,可用于广播。我们可以将消息叠加在载波信号上…… Q: 这个梯度下降是如何工作的? A: 我们会计算损失函数的导数,并沿其反方向步进。设置学习率时需格外小心:学习率过高会导致模型发散,过低则训练速度过慢…… Q: Python装饰器的用途是什么? A: 我们可以用它来包装函数。使用@decorator语法时,可以在不修改原函数的前提下为其添加额外行为。比如日志记录、计时、身份验证等,都可以通过装饰器简洁地实现。 ## 预期用途 - **大语言模型微调**:用于训练坦格里什语技术助手 - **基准测试**:评估代码转换文本生成质量 - **研究**:印度语言低资源自然语言处理研究 - **教育工具**:面向泰米尔工科学生的学习辅助工具 ## 局限性与偏差 - **领域倾斜**:内容集中于Python/机器学习/数码评测,电子与通信工程、网络相关内容较少 - **来源偏差**:YouTube评论反映了印度科技受众的人口统计特征(以男性为主) - **坦格里什语风格差异**:泰米尔纳德邦与海外侨民的坦格里什语方言存在差异;本语料库反映的是泰米尔纳德邦城市受过教育人群的使用风格 - **合成数据与真实数据差异**:8%的语料由GPT-4o-mini生成,可能存在风格同质化问题 - **无人口统计数据**:未对发言者/作者进行标识,仅使用聚合后的公开内容 - **部分样本英语占比偏高**:坦格里什语占比范围为0.05-0.95,因此部分样本英语占比偏高 ## 伦理考量 - 所有数据均来自遵循YouTube服务条款的公开YouTube评论。 - 频道归属信息已保留在源元数据中。 - 未提取任何个人标识信息(如姓名、联系方式)。 - 合成数据已通过`source: "synthetic"`字段明确标注。 ## 引用格式 bibtex @misc{tamiltech-qa-dataset-2026, title = {TamilTech-QA: A Tanglish Technical Question-Answering Dataset}, author = {Dheepak Karan E S}, year = {2026}, url = {https://huggingface.co/datasets/dheepakkaran/TamilTech-QA}, } ## 致谢 本数据集的源数据来自12个泰米尔语科技类YouTube频道(完整归属信息见前文)。开发过程中使用了YouTube Data API v3、OpenAI GPT-4o-mini与HuggingFace生态工具。




