登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
Lexical Complexity Prediction Dataset
Lexical Complexity Prediction Dataset
收藏
科学数据银行
2023-11-17 更新
2026-04-23 收录
词汇复杂度预测
文本复杂度
数据链接:
https://www.scidb.cn/detail?dataSetId=ed0b60dea42248ec8d1afe08cae446cc
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
包括待评估词汇、词汇复杂程度、所处上下文环境,以及复杂分数或复杂概率预估;在此基础上进行进一步的数据增强、清洗、集成工作。
应用场景:
提供机构:
Wuhan University
创建时间:
2023-11-10
相关数据集
MichielBuisman/Leesplank_NL_wikipedia_veringewikkelderingen
文本复杂度
语言风格转换
该数据集包含不同风格的荷兰语维基百科段落的变体,基于另一个数据集的简化结果列生成。使用GPT4-1106-preview模型,通过特定的系统提示生成了这些变体,包括使用特定术语、政府机构用语、古语、技术用语、学术用语和诗意的语言风格。数据集还计划在未来增加更多类型的复杂化变体,但目前受限于模型的输出长度限制。
Hugging Face
2024-04-10 更新
14
0
EnSiWiki-2020 corpus for textual complexity modelling
文本复杂度
可读性
The EnSiWiki-2020 Corpus is designed for modeling textual complexity using paired articles from Simple English and standard English Wikipedia. It employs two key sampling methods: age-based ranking an
DataCite Commons
2025-01-30 更新
8
0
razvanalex/CWI-CompLex-single
自然语言处理
文本复杂度
--- dataset_info: features: - name: id dtype: string - name: corpus dtype: string - name: sentence dtype: string - name: token dtype: string - name: complexity dtype: f
Hugging Face
2024-02-03 更新
7
0
g2p-exploration/SentenceBench
自然语言处理
文本复杂度
该数据集包含了单词和其复杂度分类信息,分为低、中、高三种复杂度。数据集包含了一个训练集分割,共有182238个示例,数据集总大小为60600008字节。
Hugging Face
2025-03-03 更新
11
0
The raw MS proteomic data of seedlings of a Arabidopsis mutant
植物蛋白质组学
拟南芥分子生物学
The raw MS proteomic data of seedlings of a Arabidopsis mutant
integrated proteome resources
8
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广