登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
维基百科中文高质量词条子集
维基百科中文高质量词条子集
收藏
OpenXLab
2026-04-18 收录
中文知识库构建
文本质量评估
数据链接:
https://openxlab.org.cn/datasets/liding/wikipedia-cn-filtered
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
本数据集基于中文维基2023年7月20日的dump存档。作为一项以数据为中心的工作,使用启发式的方法和自有的NLU模型过滤了一部分质量较低或内容不合规的词条。
应用场景:
提供机构:
liding
创建时间:
2023-08-10
相关数据集
weizhiwang/mlm_filter_instructions
多模态学习
文本质量评估
--- license: apache-2.0 language: - en size_categories: - 10K<n<100K --- - mlm_filter_instruct_50k_gpt4v_cc12m_4k.json: the mixture of sampled 4k GPT-4V generated instructions of proposed image-text
Hugging Face
2024-03-03 更新
32
0
44cal/chainprompt_annot
医疗文本标注
文本质量评估
这是一个使用Argilla创建的数据集,包含了文本字段、问题、建议、元数据、向量和指南等结构。数据集记录的特征包括文本内容,而问题则是为了标注过程中询问标注者的。数据集的一个实例展示了一个医疗文本记录,其中包含了医疗条件和患者信息。数据集适用于需要医疗文本分析和标注的任务。
Hugging Face
2025-04-05 更新
11
0
alea-institute/kl3m-filter-data-dotgov-www.pbgc.gov
政府文档过滤
文本质量评估
该数据集包含多个字段,如标识符(identifier),数据集名称(dataset),MIME类型(mime_type),以及分数(score)和令牌数(tokens)。数据集被划分为训练集(train)等部分,其中训练集包含3464个示例,大小为103800431字节。
Hugging Face
2025-02-04 更新
9
0
dongyoung4091/shp-generated_flan_t5_large_flan_t5_small_zeroshot
零样本文本生成
文本质量评估
--- dataset_info: features: - name: prompt dtype: string - name: response dtype: string - name: zeroshot_helpfulness dtype: float64 - name: zeroshot_specificity dtype: float6
Hugging Face
2023-09-23 更新
13
0
dgambettaphd/D15k
生成文本检测
文本质量评估
--- dataset_info: features: - name: id_doc dtype: int64 - name: text dtype: string - name: dataset dtype: string - name: gen dtype: int64 - name: synt dtype: int64 -
Hugging Face
2026-03-19 更新
10
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广