遇见数据集

Chinese-Names-Corpus

收藏
OpenDataLab2026-07-12 更新2024-05-09 收录
官方服务:

资源简介:

数据大小: 120万。 语料库来源: 提取自十亿级名称的语料库。 数据清理: 已经清理了,但是仍然有一些坏情况。 添加了一个名称生成器。

Dataset Size: 1.2 million. Corpus Source: Extracted from a billion-scale name corpus. Data Cleaning: The dataset has been cleaned, yet some erroneous records still remain. A name generator has been added.

提供机构:
OpenDataLab
创建时间:
2023-03-30
搜集汇总
数据集介绍
Chinese-Names-Corpus 数据集图片
背景与挑战
背景概述
Chinese-Names-Corpus是一个包含约120万个中文名称的数据集,提取自十亿级名称语料库,经过清理但可能存在少量坏情况,并提供了名称生成器。该数据集于2022年发布,相关资源可在GitHub上获取。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务