遇见数据集

mukuls9971/indian-address-v1

收藏
Hugging Face2026-04-20 更新2026-04-26 收录
官方服务:

资源简介:

--- license: "mit" pretty_name: "Indian Address Synthetic Dataset v1" task_categories: ["token-classification"] task_ids: ["named-entity-recognition"] language: ["en", "hi"] tags: ["pii", "ner", "token-classification", "synthetic", "addresses"] --- # Indian Address Synthetic Dataset v1 Synthetic multilingual Indian-address token-classification dataset generated by the pii-model-oss project. ## Repository - Dataset repo: `mukuls9971/indian-address-v1` - Train split: `12000` - Validation split: `1000` - Test split: `1000` ## Files - `train.jsonl` - `validation.jsonl` - `test.jsonl` - `report.json` ## Notes - Generated and published by the `pii-model-oss` workflow. - Upstream datasets used to assemble benchmark variants retain their own licenses.

许可证:MIT许可证 数据集展示名称:印度地址合成数据集v1 任务类别:["Token分类(token-classification)"] 任务子类别:["命名实体识别(named-entity-recognition)"] 语言:["英语(en)、印地语(hi)"] 标签:["个人可识别信息(pii)、命名实体识别(ner)、Token分类(token-classification)、合成数据集、地址"] # 印度地址合成数据集v1 本数据集为由`pii-model-oss`项目生成的多语言印度地址Token分类(token-classification)合成数据集。 ## 仓库信息 - 数据集仓库:`mukuls9971/indian-address-v1` - 训练集样本量:`12000` - 验证集样本量:`1000` - 测试集样本量:`1000` ## 文件列表 - `train.jsonl` - `validation.jsonl` - `test.jsonl` - `report.json` ## 说明 - 本数据集由`pii-model-oss`工作流生成并发布。 - 用于构建基准变体的上游数据集保留其自身的许可证。

提供机构:
mukuls9971
二维码
社区交流群
二维码
科研交流群
商业服务