遇见数据集

welyjesch/alpaca_pangasinan

收藏
Hugging Face2026-03-25 更新2026-03-29 收录
官方服务:

资源简介:

--- language: - pag - en license: cc-by-nc-4.0 task_categories: - text-generation - question-answering tags: - alpaca - instruction-tuning - pangasinan - pangasinense - philippine-languages - low-resource - translation pretty_name: Pangasinan Alpaca Dataset size_categories: - 10K<n<100K source_datasets: - tatsu-lab/alpaca --- # 🇵🇭 Pangasinan Alpaca Dataset ## Dataset Description - **Point of Contact:** welyjesch@gmail.com - **Primary Language:** Pangasinan - **Source Language:** English ### Dataset Summary This dataset is a **Pangasinan translation** of the original Alpaca instruction-following dataset. It is designed to support research and development of **instruction-tuned language models** for low-resource Philippine languages, particularly Pangasinan. The dataset retains the original Alpaca structure while providing high-quality translations of instructions, inputs, and outputs. ## Dataset Structure ### Data Instances Each example follows this JSON format: ```json { "instruction": "Pangasinan instruction text", "input": "Optional context in Pangasinan", "output": "Expected response in Pangasinan" } ``` ### Data Fields - `instruction`: The task or question in Pangasinan. - `input`: Additional context (may be empty). - `output`: The correct expected response in Pangasinan. ### Data Splits | Split | Description | |------------|-------------------------------------------| | `train` | Main dataset for training | | `validation` | Optional validation set (if provided) | ## Dataset Creation ### Source Data Based on the original **Alpaca dataset**, which was generated using instruction-following data derived from OpenAI models. ### Translation Process Translated from English to Pangasinan using: - Machine translation + human post-editing *(or specify your actual method)* - Native speaker validation *(if applicable)* ## Use Cases This dataset can be used for: - Instruction tuning of LLMs in Pangasinan - Multilingual NLP research - Low-resource language modeling - Chatbot and assistant development for Pangasinan speakers ## Limitations - May contain translation artifacts or unnatural phrasing. - Cultural nuances might not always be preserved. - Not all instructions may perfectly align with Pangasinan linguistic norms. - Quality depends on the exact translation method used. ## Ethical Considerations Ensure responsible use when deploying models trained on this dataset. Be mindful of: - Bias inherited from the original Alpaca dataset. - Potential mistranslations or harmful outputs. - Not intended for high-stakes applications without further validation. ## Licensing The original Alpaca dataset license applies. **License:** CC BY-NC 4.0 *(Note: Datasets generated from OpenAI models are generally restricted from commercial use competing with OpenAI).* ## Citation If you use this dataset, please cite: ```bibtex @dataset{pangasinan_alpaca, title = {Pangasinan Alpaca Dataset}, author = {Wely Jesch Sabalilag}, year = {2026}, note = {Translated version of the Alpaca dataset} } ``` ## Acknowledgements - Original [Alpaca dataset creators (Stanford CRFM)](https://crfm.stanford.edu/2023/03/13/alpaca.html). - Contributors and translators for Pangasinan. ## Contact For questions or contributions: - **Name:** Wely Jesch Sabalilag - **Email:** [welyjesch@gmail.com](mailto:welyjesch@gmail.com) - **GitHub:**[github.com/welyjesch](https://github.com/welyjesch) ```

--- language: - 邦阿西楠语(Pangasinan,代码pag) - 英语(en) license: 知识共享署名-非商业性使用4.0国际许可协议(CC BY-NC 4.0) task_categories: - 文本生成 - 问答 tags: - Alpaca - 指令微调 - 邦阿西楠语(Pangasinan) - pangasinense(邦阿西楠语使用者/邦阿西楠地区群体) - 菲律宾语言 - 低资源语言 - 翻译 pretty_name: 邦阿西楠语Alpaca数据集 size_categories: - 10K<n<100K source_datasets: - tatsu-lab/alpaca --- # 🇵🇭 邦阿西楠语Alpaca数据集 ## 数据集说明 - **联系人**:welyjesch@gmail.com - **主要语言**:邦阿西楠语(Pangasinan) - **源语言**:英语 ### 数据集概述 本数据集是原始Alpaca指令跟随数据集的**邦阿西楠语翻译版本**,旨在支撑低资源菲律宾语言(尤其是邦阿西楠语)的**指令微调大语言模型(Large Language Model, LLM)**研发工作。 本数据集保留了原始Alpaca数据集的结构,同时为指令、输入与输出提供了高质量译稿。 ## 数据集结构 ### 数据实例 每个示例遵循以下JSON格式: json { "instruction": "邦阿西楠语指令文本", "input": "邦阿西楠语可选上下文内容", "output": "邦阿西楠语预期响应内容" } ### 数据字段 - `instruction`:邦阿西楠语表述的任务或问题 - `input`:额外上下文内容(可为空) - `output`:邦阿西楠语的标准预期响应 ### 数据划分 | 划分名称 | 描述 | |------------|----------------------------------------| | `train` | 用于模型训练的主数据集 | | `validation` | 可选验证集(如已提供) | ## 数据集构建 ### 源数据 基于原始**Alpaca数据集**构建,该数据集的指令跟随样本由OpenAI模型生成。 ### 翻译流程 从英语翻译至邦阿西楠语的方式包括: - 机器翻译结合人工后编辑(*或注明实际采用的方法*) - 母语使用者验证(如适用) ## 应用场景 本数据集可用于: - 邦阿西楠语大语言模型的指令微调 - 多语言自然语言处理研究 - 低资源语言建模 - 面向邦阿西楠语使用者的聊天机器人与智能助手开发 ## 局限性 - 可能存在翻译瑕疵或不自然的措辞 - 文化细节未必总能完整保留 - 并非所有指令都能完全贴合邦阿西楠语的语言规范 - 数据集质量取决于所采用的具体翻译方法 ## 伦理考量 在部署基于本数据集训练的模型时,请确保负责任地使用,并注意以下事项: - 继承自原始Alpaca数据集的偏见问题 - 潜在的翻译错误或有害输出 - 未经进一步验证前,不适合用于高风险应用场景 ## 许可协议 本数据集遵循原始Alpaca数据集的许可协议。 **许可协议**:CC BY-NC 4.0(*注:由OpenAI模型生成的数据集通常限制用于与OpenAI竞争的商业用途*) ## 引用 如使用本数据集,请引用以下文献: bibtex @dataset{pangasinan_alpaca, title = {Pangasinan Alpaca Dataset}, author = {Wely Jesch Sabalilag}, year = {2026}, note = {Alpaca数据集的翻译版本} } ## 致谢 - 原始[Alpaca数据集创作者(斯坦福大学CRFM团队)](https://crfm.stanford.edu/2023/03/13/alpaca.html) - 邦阿西楠语翻译与贡献者 ## 联系方式 如有疑问或贡献需求,请联系: - **姓名**:Wely Jesch Sabalilag - **邮箱**:[welyjesch@gmail.com](mailto:welyjesch@gmail.com) - **GitHub**:[github.com/welyjesch](https://github.com/welyjesch)

提供机构:
welyjesch
二维码
社区交流群
二维码
科研交流群
商业服务