feyninc/macha
收藏资源简介:
--- license: cc-by-4.0 dataset_info: - config_name: corpus features: - name: rank dtype: int64 - name: repo dtype: string - name: stars dtype: int64 - name: text dtype: string - name: token-count dtype: int64 - name: score dtype: float64 splits: - name: train num_bytes: 62765767 num_examples: 445 download_size: 62765767 dataset_size: 62765767 - config_name: questions features: - name: question dtype: string - name: answer dtype: string - name: chunk-must-contain dtype: string - name: repo dtype: string splits: - name: train num_bytes: 1078272 num_examples: 1812 download_size: 1078272 dataset_size: 1078272 configs: - config_name: corpus data_files: - split: train path: corpus/train-* - config_name: questions data_files: - split: train path: questions/train-* --- <div align="center"> # 📝 Macha: Markdown Chunking Assessment *GitHub READMEs for Evaluating Chunking Algorithms* </div> Macha is a dataset of GitHub README files from popular open-source repositories, designed to evaluate how well chunking algorithms handle technical documentation with mixed content types. ## Dataset Description - **Documents**: 445 GitHub README files - **Questions**: 1,812 question-answer pairs - **Domain**: Technical Documentation - **Source**: Top GitHub repositories by stars ## Key Challenges This dataset tests chunking algorithms on: - Markdown formatting (headers, lists, code blocks) - Mixed content (prose, code examples, tables) - Technical terminology and API references - Installation instructions and usage examples - Cross-references and links ## Dataset Structure ### Corpus Config | Field | Description | |-------|-------------| | `rank` | Repository popularity rank | | `repo` | Repository name (owner/repo) | | `stars` | GitHub star count | | `text` | Full README content | | `token-count` | Token count | | `score` | Quality score | ### Questions Config | Field | Description | |-------|-------------| | `question` | Question about the README | | `answer` | Answer to the question | | `chunk-must-contain` | Text passage that must be in the retrieved chunk | | `repo` | Source repository | ## Usage ```python from datasets import load_dataset # Load corpus corpus = load_dataset("chonkie-ai/macha", "corpus", split="train") # Load questions questions = load_dataset("chonkie-ai/macha", "questions", split="train") ``` ## Part of MTCB Macha is part of the [Massive Text Chunking Benchmark (MTCB)](https://github.com/chonkie-inc/mtcb), a comprehensive benchmark for evaluating RAG chunking strategies. ## License CC-BY-4.0
许可证:CC-BY-4.0 数据集信息: - 配置名称:语料库 特征字段: - 字段名:rank,数据类型:int64 - 字段名:repo,数据类型:字符串 - 字段名:stars,数据类型:int64 - 字段名:text,数据类型:字符串 - 字段名:token-count,数据类型:int64 - 字段名:score,数据类型:float64 数据集拆分: - 拆分名称:train,字节数:62765767,样本数:445 下载大小:62765767 数据集大小:62765767 - 配置名称:问题集 特征字段: - 字段名:question,数据类型:字符串 - 字段名:answer,数据类型:字符串 - 字段名:chunk-must-contain,数据类型:字符串 - 字段名:repo,数据类型:字符串 数据集拆分: - 拆分名称:train,字节数:1078272,样本数:1812 下载大小:1078272 数据集大小:1078272 配置项: - 配置名称:语料库 数据文件: - 拆分:train,路径:corpus/train-* - 配置名称:问题集 数据文件: - 拆分:train,路径:questions/train-* <div align="center"> # 📝 Macha:Markdown分块评估 *面向分块算法评估的GitHub README文档集* </div> Macha 是一个由热门开源仓库的GitHub README文件组成的数据集,旨在评估分块算法对包含混合内容类型的技术文档的处理能力。 ## 数据集说明 - **文档数量**:445份GitHub README文件 - **问答对数量**:1812个 - **应用领域**:技术文档 - **数据来源**:按GitHub星标排名的顶级开源仓库 ## 核心挑战 该数据集从以下维度对分块算法进行测试: - Markdown格式(标题、列表、代码块) - 混合内容(正文、代码示例、表格) - 技术术语与API引用 - 安装指南与使用示例 - 交叉引用与链接 ## 数据集结构 ### 语料库配置 | 字段名 | 说明 | |-------|------| | `rank` | 仓库流行度排名 | | `repo` | 仓库名称(所有者/仓库名) | | `stars` | GitHub星标数 | | `text` | 完整README内容 | | `token-count` | Token数量 | | `score` | 质量得分 | ### 问题集配置 | 字段名 | 说明 | |-------|------| | `question` | 针对README的问题 | | `answer` | 问题的答案 | | `chunk-must-contain` | 检索分块中必须包含的文本段落 | | `repo` | 源仓库 | ## 使用方法 python from datasets import load_dataset # 加载语料库 corpus = load_dataset("chonkie-ai/macha", "corpus", split="train") # 加载问题集 questions = load_dataset("chonkie-ai/macha", "questions", split="train") ## 隶属于大规模文本分块基准测试集(Massive Text Chunking Benchmark, MTCB) Macha是[大规模文本分块基准测试集(Massive Text Chunking Benchmark, MTCB)](https://github.com/chonkie-inc/mtcb)的组成部分,该基准集是用于评估检索增强生成(Retrieval-Augmented Generation, RAG)分块策略的综合性评测平台。 ## 许可证 CC-BY-4.0



